TL;DR
OneAdvanced는 규제 산업 고객의 데이터가 영국 밖으로 나가지 않도록 Llama 4 Maverick과 Llama Guard 4를 Amazon SageMaker AI의 London 리전에서 자체 호스팅했습니다. vLLM과 p5.48xlarge 인스턴스로 모델을 서빙하고, Llama Guard 4가 주 모델 추론 전에 입력을 검사하며, Amazon ECS의 Strands Agents SDK 기반 에이전트 50개 이상이 도구와 문서 검색을 조율합니다. Amazon S3 문서는 Markdown 변환과 2,048토큰 청크 분할을 거쳐 intfloat/multilingual-e5-large-instruct로 embedding된 뒤 pgvector에서 검색됩니다. 이 구조는 개인·조직 문서 격리, 질의·응답 미보관, 영국 내 데이터 처리와 ISO 42001 인증을 지원했으며, 50개 이상의 에이전트를 3주 만에 구축해 2025년 7월부터 운영됐습니다.
섹션별 상세
- OneAdvanced는 모든 사용자 데이터를 영국에 유지하기 위해 Llama 4 Maverick과 Llama Guard 4를 자체 UK AWS 계정에서 호스팅했습니다. — 본문의 데이터 주권 및 모델 호스팅 절과 Solution overview 절

- Llama 4 Maverick과 Llama Guard 4는 vLLM을 통해 Amazon SageMaker AI의 London 리전 p5.48xlarge 인스턴스에서 실행됐습니다. — Model deployment on Amazon SageMaker AI 절
- Llama Guard 4는 주 모델 추론 전에 사용자 입력의 유해성을 검사하며, 이전 Llama Guard 3의 높은 오거부율 이후 도입됐습니다. — Model deployment on Amazon SageMaker AI 절의 Guard 모델 설명
- OneAdvanced는 첫 에이전트에서 50개 이상의 에이전트로 확장하는 데 3주가 걸렸고 대부분을 하루 이내에 구축했습니다. — Building over 50 agents with Strands Agents SDK 절
- 문서는 2,048토큰 청크로 변환된 뒤 embedding돼 pgvector에서 검색됐습니다. — RAG pipeline 절의 문서 처리 및 embedding 설명
- 솔루션은 2025년 7월부터 운영됐고 목표 성능 지표를 충족했으며 사용자 데이터를 보관·학습·로깅하지 않는 서비스로 공개 출시됐습니다. — Results 절의 운영 현황과 공개 출시 설명
용어 해설
- 데이터 주권(Data Sovereignty)
- — 데이터 주권은 데이터가 저장·처리되는 위치와 접근 주체를 조직이 통제하는 원칙입니다. 이 사례에서는 모든 사용자 데이터와 모델 처리를 영국 AWS 리전에 한정해 영국의 법률·규제 체계 안에 두는 방식으로 구현했습니다. 규제 산업의 개인정보 보호와 감사 요건을 충족하는 핵심 조건입니다.
- 검색 증강 생성(Retrieval Augmented Generation)
- — Retrieval Augmented Generation은 질문과 관련된 외부 문서를 먼저 검색한 뒤 그 내용을 언어 모델의 입력 문맥에 넣어 답변을 생성하는 방식입니다. 이 아키텍처에서는 S3 문서를 Markdown으로 변환하고 2,048토큰 단위로 나눈 뒤 pgvector에서 유사도 검색을 수행합니다. 답변에 사용한 원문 문서와 출처를 함께 제시해 기업 문서 기반 응답의 추적성을 높입니다.
- 벡터 유사도 검색(Vector Similarity Search)
- — 벡터 유사도 검색은 문서와 질문을 embedding 벡터로 바꾼 뒤 벡터 간 거리를 비교해 의미적으로 가까운 문서 조각을 찾는 방법입니다. OneAdvanced는 intfloat/multilingual-e5-large-instruct로 문서를 벡터화하고 PostgreSQL의 pgvector에 저장합니다. 키워드가 정확히 일치하지 않아도 관련 문맥을 검색할 수 있어 RAG의 문서 회수 단계에 사용됩니다.
- 콘텐츠 조정(Content Moderation)
- — 콘텐츠 조정은 모델 추론 전에 사용자 입력이 유해하거나 정책에 어긋나는지 판별하는 안전 처리 단계입니다. 이 시스템은 Llama Guard 4를 주 모델인 Llama 4 Maverick보다 먼저 직렬로 실행해 입력을 검사합니다. 이전 Llama Guard 3에서 높은 오거부율을 관찰한 뒤 Guard 모델을 교체했다는 점이 운영 품질과 직접 연결됩니다.
- LLM 평가자(LLM-as-a-judge)
- — LLM-as-a-judge는 별도의 언어 모델이 생성 결과를 평가하도록 구성하는 자동 평가 방식입니다. OneAdvanced는 감정 분석과 결합한 평가 프레임워크를 최근 구축해 지속적인 품질 개선에 활용하고 있습니다. 실제 사용자 응답의 품질을 반복적으로 점검하는 운영 체계의 일부로 도입됐습니다.
기술
- Amazon SageMaker AI
- vLLM
- Llama 4 Maverick
- Llama Guard 4
- Amazon ECS
- Strands Agents SDK
- Amazon DynamoDB
- Amazon S3
- Amazon Aurora PostgreSQL-Compatible Edition
- pgvector
- intfloat/multilingual-e5-large-instruct
- Amazon GuardDuty
- Amazon Bedrock
- Snowflake
활용 사례
- 의료 사고 대응 보조
- 임상 안전 공지 생성
- 교육용 수업 계획 생성
- 운영 시나리오 시뮬레이션
- 인사 성과 검토 보조
- 문서 비교
- AWS 아키텍처 지원
- 영국 법령 검색
- 조직 및 개인 문서 검색
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.