섹션별 상세
초기 에이전트 시도는 모델의 지능 부족과 짧은 컨텍스트 윈도우, 표준화된 도구 호출 방식의 부재로 인해 실패를 반복했다. Notion은 이를 극복하기 위해 XML 기반에서 마크다운 및 SQL-like 추상화로 데이터 표현 방식을 변경하며 모델 친화적인 환경을 구축했다. 5번의 재구축 과정을 통해 현재는 안정적인 커스텀 에이전트 아키텍처를 완성했다. 이는 모델의 한계에 맞서기보다 모델이 잘할 수 있는 방식으로 시스템을 설계한 결과이다.
에이전트의 성능을 유지하면서 기능을 확장하기 위해 '점진적 도구 공개(Progressive Disclosure)' 방식을 도입했다. 수백 개의 도구를 한꺼번에 모델에 노출하면 토큰 낭비와 품질 저하가 발생하기 때문에, 필요한 시점에 적절한 도구만 검색하여 제공하는 구조를 갖췄다. 이를 통해 모델이 불필요한 도구를 호출하는 오류를 줄이고 추론 비용을 최적화했다. 결과적으로 개발자가 새로운 도구를 추가해도 전체 시스템의 안정성이 저해되지 않는 확장성을 확보했다.
Notion은 에이전트 평가를 단순한 테스트가 아닌 '에이전트 개발 속도'를 높이는 플랫폼으로 정의한다. 80-90% 통과를 목표로 하는 회귀 테스트와 함께, 모델의 한계를 파악하기 위해 의도적으로 30%만 통과하도록 설계된 '프런티어 평가'를 병행한다. 이를 전담하는 '모델 행동 엔지니어(Model Behavior Engineer)' 직군을 신설하여 모델의 실패 패턴을 분석하고 개선한다. 이러한 체계적인 평가 루프는 에이전트가 실제 프로덕션 환경에서 신뢰할 수 있는 수준의 성능을 내도록 보장한다.
미래 비전으로 제시된 '소프트웨어 팩토리'는 에이전트들이 명세 작성, 코딩, 테스트, 리뷰를 자율적으로 수행하는 시스템이다. 인간 엔지니어의 역할은 직접 코드를 타이핑하는 것에서 에이전트들이 흐르는 외부 시스템을 감독하고 검증하는 방향으로 이동한다. Notion 내부에서는 이미 에이전트가 스스로 버그를 수정하고 PR을 생성하는 워크플로우를 실험 중이다. 이는 소프트웨어 개발의 추상화 계층을 한 단계 높여 생산성을 극대화하는 시도이다.
MCP(Model Context Protocol)와 CLI(Command Line Interface)의 장단점을 분석하며 하이브리드 접근 방식을 취한다. CLI는 에이전트가 스스로 환경을 디버깅하고 도구를 직접 생성할 수 있는 강력한 자율성을 제공하는 반면, MCP는 엄격한 권한 관리와 가벼운 통합에 유리하다. Notion은 핵심 기능에는 고성능 네이티브 통합을 사용하고, 롱테일 도구에는 MCP를 지원하여 생태계 확장성을 확보한다. 이를 통해 보안과 유연성 사이의 균형을 맞춘 에이전트 환경을 제공한다.
text
Sarah Sachs: We have the equivalent of unit test. Regression test. Those live in ci, those have to pass a certain percent... then we have what we call frontier or headroom evals, where we actively wanna be at 30% pass rate.Notion의 에이전트 평가 체계(회귀 테스트 및 프런티어 평가)에 대한 설명
용어 해설
- 모델 컨텍스트 프로토콜(Model Context Protocol)
- — Anthropic이 제안한 개방형 표준으로, AI 모델이 로컬 데이터나 외부 도구에 안전하고 일관되게 접근할 수 있도록 돕는 인터페이스 규격이다. 에이전트가 복잡한 설정 없이도 다양한 데이터 소스와 상호작용할 수 있게 하여 생태계 통합을 가속화한다.
- 소프트웨어 팩토리(Software Factory)
- — 소프트웨어 개발의 전 과정(명세, 코딩, 테스트, 디버깅, 리뷰)을 AI 에이전트들이 협업하여 자동화하는 시스템 아키텍처이다. 인간의 개입을 최소화하면서도 일관된 품질과 높은 생산성을 유지하는 미래형 개발 공정을 의미한다.
- 점진적 정보 공개(Progressive Disclosure)
- — 사용자나 AI 모델에게 처음부터 모든 도구와 정보를 노출하지 않고, 현재 맥락에 필요한 것만 단계적으로 보여주는 설계 방식이다. 모델의 컨텍스트 윈도우 낭비를 줄이고 불필요한 도구 호출로 인한 성능 저하를 방지하는 데 중요하다.
- 평가 하네스(Eval Harness)
- — AI 모델의 성능과 안전성을 체계적으로 측정하기 위한 자동화된 테스트 환경이다. Notion은 이를 에이전트 개발 속도를 높이는 핵심 플랫폼으로 활용하며, 모델이 특정 작업을 얼마나 정확하게 수행하는지 정량적으로 평가한다.
기술
- Notion AI
- Claude 3.5 Sonnet
- GPT-4
- MCP
- SQL Light
- Markdown
활용 사례
- 이메일 트리이징 및 데이터 자동 입력
- 버그 리포트 자동 분류 및 할당
- 회의록 기반 작업 자동 생성
- 자율 코딩 에이전트 워크플로우
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 15.수집 2026. 04. 15.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
