본문으로 건너뛰기

OneAdvanced의 영국 데이터 주권 AI 구축

OneAdvanced가 Llama 모델과 50개 이상 에이전트를 영국 AWS 리전에 자체 구축했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

OneAdvanced는 규제 산업 고객의 데이터가 영국 밖으로 나가지 않도록 Llama 4 Maverick과 Llama Guard 4를 Amazon SageMaker AI의 London 리전에서 자체 호스팅했습니다. vLLM과 p5.48xlarge 인스턴스로 모델을 서빙하고, Llama Guard 4가 주 모델 추론 전에 입력을 검사하며, Amazon ECS의 Strands Agents SDK 기반 에이전트 50개 이상이 도구와 문서 검색을 조율합니다. Amazon S3 문서는 Markdown 변환과 2,048토큰 청크 분할을 거쳐 intfloat/multilingual-e5-large-instruct로 embedding된 뒤 pgvector에서 검색됩니다. 이 구조는 개인·조직 문서 격리, 질의·응답 미보관, 영국 내 데이터 처리와 ISO 42001 인증을 지원했으며, 50개 이상의 에이전트를 3주 만에 구축해 2025년 7월부터 운영됐습니다.

섹션별 상세

규제 산업 고객의 환자 기록과 법률 문서처럼 민감한 데이터를 처리하는 OneAdvanced는 AI 서비스가 영국 밖으로 데이터를 전송하지 않아야 한다는 요구를 받았습니다. 초기에는 Amazon Bedrock으로 2주 만에 채팅 완성, 영국 법령 검색, Snowflake 연동, 차트 생성을 검증했지만 필요한 Llama 4 Maverick과 Llama Guard 4가 당시 영국 리전의 관리형 서비스로 제공되지 않았습니다. 이에 자체 AWS 계정과 인프라에서 모델을 배포·서빙·확장하는 방식으로 전환해 데이터 위치와 모델 운영을 직접 통제했습니다.
근거
  • OneAdvanced는 모든 사용자 데이터를 영국에 유지하기 위해 Llama 4 Maverick과 Llama Guard 4를 자체 UK AWS 계정에서 호스팅했습니다. 본문의 데이터 주권 및 모델 호스팅 절과 Solution overview 절
OneAdvanced는 Amazon SageMaker AI의 London 리전에서 vLLM으로 Llama 4 Maverick과 Llama Guard 4를 서빙하고 p5.48xlarge 인스턴스를 사용했습니다. 긴 문서 분석과 다중 턴 대화를 위해 120K–128K 토큰 컨텍스트 길이를 목표로 삼았으며, p4d.24xlarge에서 시작한 뒤 운영 환경에서는 p5.48xlarge로 이동했습니다. Llama Guard 4는 주 모델보다 먼저 입력을 검사하고, 통과한 요청만 Amazon ECS의 적절한 Strands 에이전트로 전달하는 직렬 흐름을 형성했습니다.
OneAdvanced의 UK-sovereign AI 솔루션을 사용자 애플리케이션, 에이전트 오케스트레이션, 모델 서빙, RAG 파이프라인, 콘텐츠 조정 계층으로 나눈 고수준 아키텍처입니다.
Diagram사용자 요청은 Amazon ECS의 에이전트 오케스트레이션 계층으로 들어가고, 요청 전 콘텐츠 조정을 거쳐 Amazon SageMaker AI의 Llama 4 Maverick으로 전달됩니다. 문서는 Amazon S3에서 처리된 뒤 Aurora PostgreSQL과 pgvector에 저장되며, embedding과 retrieval 경로가 모델 및 에이전트 계층과 연결돼 영국 London 리전 안에서 전체 흐름이 구성됩니다.
에이전트 계층은 Amazon ECS에서 실행되는 50개 이상의 전문 에이전트로 구성됐으며, 각 에이전트는 system prompt와 도구 설정, 선택적 구조화 입력 양식을 가집니다. 설정은 Amazon DynamoDB에 저장되고, 비개발자는 no-code builder에서 드래그 앤 드롭 방식으로 입력 양식을 만들고 @ 구문으로 양식 값을 prompt에 주입할 수 있습니다. 첫 에이전트에서 50개 이상으로 늘어나는 데 3주가 걸렸고 대부분의 에이전트는 하루 이내에 구축돼 의료·법률·인사·마케팅 등 여러 업무를 지원했습니다.
근거
  • Llama 4 Maverick과 Llama Guard 4는 vLLM을 통해 Amazon SageMaker AI의 London 리전 p5.48xlarge 인스턴스에서 실행됐습니다. Model deployment on Amazon SageMaker AI 절
  • Llama Guard 4는 주 모델 추론 전에 사용자 입력의 유해성을 검사하며, 이전 Llama Guard 3의 높은 오거부율 이후 도입됐습니다. Model deployment on Amazon SageMaker AI 절의 Guard 모델 설명
문서 검색은 Amazon S3의 개인 문서 공간과 조직 공유 공간을 분리해 저장하는 RAG 파이프라인으로 처리됩니다. 업로드 문서는 Markdown으로 변환되고 2,048토큰 청크로 나뉜 뒤 intfloat/multilingual-e5-large-instruct로 embedding돼 pgvector에 저장되며, 긴 문서는 재귀적 요약을 거칩니다. 자체 구축한 검색 시스템 Llamadex는 관련 청크와 출처를 반환해 사용자가 어떤 문서가 답변에 사용됐는지 확인하도록 했습니다.
근거
  • OneAdvanced는 첫 에이전트에서 50개 이상의 에이전트로 확장하는 데 3주가 걸렸고 대부분을 하루 이내에 구축했습니다. Building over 50 agents with Strands Agents SDK 절
보안 설계는 London AWS 리전 고정, 사용자 데이터의 영국 외부 전송 금지, 질의·응답의 보관 및 모델 학습 사용 금지, 문서 공간 격리로 구성됩니다. Amazon GuardDuty는 S3 문서 저장 계층의 위협을 탐지하고 Llama Guard 4는 추론 전 유해 입력을 차단하며 조직 단위 privacy control도 적용됩니다. 이 구성은 ISO 42001 AI 거버넌스 인증과 규제 산업 고객의 데이터 주권 요구를 함께 충족하는 운영 기반이 됐습니다.
근거
  • 문서는 2,048토큰 청크로 변환된 뒤 embedding돼 pgvector에서 검색됐습니다. RAG pipeline 절의 문서 처리 및 embedding 설명
AWS 자문 과정에서 OneAdvanced는 런던 리전의 P5 인스턴스에서 Llama 4 Maverick을 운영 환경에 배포하고 50개 이상의 Strands 에이전트를 3주 만에 출시했습니다. 솔루션은 2025년 7월부터 운영됐고 목표 성능 지표를 충족했으며, OneAdvanced는 이를 사용자 데이터를 보관·학습·로깅하지 않는 영국 최초의 민간 주권 AI로 공개 출시했습니다. 다음 단계로 LLM-as-a-judge와 감정 분석을 결합한 지속 평가, prompt 개선 지원, 모델 버전 전환 중 병렬 LLM 실행을 추진하고 있습니다.
근거
  • 솔루션은 2025년 7월부터 운영됐고 목표 성능 지표를 충족했으며 사용자 데이터를 보관·학습·로깅하지 않는 서비스로 공개 출시됐습니다. Results 절의 운영 현황과 공개 출시 설명

용어 해설

데이터 주권(Data Sovereignty)
데이터 주권은 데이터가 저장·처리되는 위치와 접근 주체를 조직이 통제하는 원칙입니다. 이 사례에서는 모든 사용자 데이터와 모델 처리를 영국 AWS 리전에 한정해 영국의 법률·규제 체계 안에 두는 방식으로 구현했습니다. 규제 산업의 개인정보 보호와 감사 요건을 충족하는 핵심 조건입니다.
검색 증강 생성(Retrieval Augmented Generation)
Retrieval Augmented Generation은 질문과 관련된 외부 문서를 먼저 검색한 뒤 그 내용을 언어 모델의 입력 문맥에 넣어 답변을 생성하는 방식입니다. 이 아키텍처에서는 S3 문서를 Markdown으로 변환하고 2,048토큰 단위로 나눈 뒤 pgvector에서 유사도 검색을 수행합니다. 답변에 사용한 원문 문서와 출처를 함께 제시해 기업 문서 기반 응답의 추적성을 높입니다.
벡터 유사도 검색(Vector Similarity Search)
벡터 유사도 검색은 문서와 질문을 embedding 벡터로 바꾼 뒤 벡터 간 거리를 비교해 의미적으로 가까운 문서 조각을 찾는 방법입니다. OneAdvanced는 intfloat/multilingual-e5-large-instruct로 문서를 벡터화하고 PostgreSQL의 pgvector에 저장합니다. 키워드가 정확히 일치하지 않아도 관련 문맥을 검색할 수 있어 RAG의 문서 회수 단계에 사용됩니다.
콘텐츠 조정(Content Moderation)
콘텐츠 조정은 모델 추론 전에 사용자 입력이 유해하거나 정책에 어긋나는지 판별하는 안전 처리 단계입니다. 이 시스템은 Llama Guard 4를 주 모델인 Llama 4 Maverick보다 먼저 직렬로 실행해 입력을 검사합니다. 이전 Llama Guard 3에서 높은 오거부율을 관찰한 뒤 Guard 모델을 교체했다는 점이 운영 품질과 직접 연결됩니다.
LLM 평가자(LLM-as-a-judge)
LLM-as-a-judge는 별도의 언어 모델이 생성 결과를 평가하도록 구성하는 자동 평가 방식입니다. OneAdvanced는 감정 분석과 결합한 평가 프레임워크를 최근 구축해 지속적인 품질 개선에 활용하고 있습니다. 실제 사용자 응답의 품질을 반복적으로 점검하는 운영 체계의 일부로 도입됐습니다.

기술

  • Amazon SageMaker AI
  • vLLM
  • Llama 4 Maverick
  • Llama Guard 4
  • Amazon ECS
  • Strands Agents SDK
  • Amazon DynamoDB
  • Amazon S3
  • Amazon Aurora PostgreSQL-Compatible Edition
  • pgvector
  • intfloat/multilingual-e5-large-instruct
  • Amazon GuardDuty
  • Amazon Bedrock
  • Snowflake

활용 사례

  • 의료 사고 대응 보조
  • 임상 안전 공지 생성
  • 교육용 수업 계획 생성
  • 운영 시나리오 시뮬레이션
  • 인사 성과 검토 보조
  • 문서 비교
  • AWS 아키텍처 지원
  • 영국 법령 검색
  • 조직 및 개인 문서 검색
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 12.수집 2026. 08. 12.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.