본문으로 건너뛰기

NVIDIA NemoClaw로 기억하는 Chief of Staff 만들기

NemoClaw의 Self Model이 장기 업무 맥락과 사용자 수정 이력을 저장해 에이전트의 사실 추적과 우선순위 판단을 개선한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

NVIDIA NemoClaw로 만든 memory-driven Chief of Staff는 대화 기록과 검색 결과만 임시로 사용하는 대신, 사람·프로젝트·우선순위·업무 패턴을 Markdown 기반 Self Model에 누적한다. SQLite ledger에는 의무, 순위, 사용자 수정, 감사 사건을 따로 기록해 파생 지식과 판단을 분리하고, Intent Gate와 결정적 코드로 사용자 우선순위에 맞는 처리 순서를 집행한다. Agent Memory Benchmark에서 Self Model은 전체 정확도를 82.8%에서 90.9%로, 시간에 따라 바뀐 사실의 추적률을 60.0%에서 100.0%로 높였다. NVIDIA OpenShell은 에이전트를 샌드박스에서 실행하며 파일 시스템·프로세스·네트워크 접근을 통제하지만, 현재 공개 레시피는 실제 메시지 전송이나 원천 시스템 변경 없이 메모리 설계와 검증에 초점을 둔다.

빠른 이해

새로운 점

대화 검색만 반복하는 대신 Markdown Self Model과 SQLite ledger를 분리해 장기 맥락, 판단, 사용자 수정, 실행 권한을 각각 관리하는 메모리 설계다.

핵심 메커니즘

새 업무 활동에서 제한된 증거를 검색하고, 이를 바탕으로 사람·프로젝트·우선순위·업무 패턴을 Markdown Self Model에 갱신한다. 의무·순위·수정·감사 사건은 SQLite ledger에 기록하며, Intent Gate가 사용자 우선순위와 연결된 항목을 선별하고 결정적 코드가 단계 크기와 순위 순서를 집행한다. 사용자 수정은 추가 전용 감사 추적을 거쳐 읽고 편집할 수 있는 선호 정책으로 누적되고, NVIDIA OpenShell은 최종 에이전트 실행을 샌드박스 경계 안에서 통제한다.

핵심 수치

  • 전체 정확도: Agentic RAG 82.8% → Self Model 90.9% (+8.1 pp)- 186개 질문
  • 어려운 질문: 67.7% → 87.1% (+19.4 pp)- 31개 질문
  • 변경된 사실 추적: 60.0% → 100.0% (+40.0 pp)- 5개 질문
  • 시점별 추론: 33.3% → 66.7% (+33.3 pp)- 6개 질문
  • 엔터티 구분: 66.7% → 86.7% (+20.0 pp)- 15개 질문
  • 다중 출처 종합: 87.7% → 94.5% (+6.8 pp)- 73개 질문

섹션별 상세

01

업무 맥락을 유지하는 Self Model

기업 업무는 메시지, 결정, 프로젝트, 의무가 시간에 따라 바뀌므로 대화 기록만으로는 이전 결정과 후속 수정, 미해결 의무를 함께 연결하기 어렵다. NemoClaw 기반 Chief of Staff는 사람·프로젝트·우선순위·목표·개념·반복 업무 패턴을 구조화된 Markdown 페이지에 저장하고, 색인·상호 참조·출처·성장 한도를 스키마로 관리한다. 이 계층은 원천 증거를 덮어쓰지 않고 파생된 해석만 보관하므로 잘못된 답변이 증거 수집, 메모리 유지, 검색, 최종 판단 중 어디에서 발생했는지 구분할 수 있다. 예약 작업은 새 활동을 주기적으로 검토해 의무와 사용자 결정을 장기 맥락에 반영한다.
02

증거와 지식, 실행 권한 분리

에이전트가 기억한 선호를 곧바로 행동 권한으로 취급하면 지식 오류가 외부 작업으로 이어질 수 있어 증거·지식·통제된 실행을 분리했다. 작업마다 제한된 관련 맥락을 검색한 뒤 Markdown 메모리에는 사람·프로젝트·업무 패턴 같은 지식을, SQLite ledger에는 의무·순위·수정·감사 사건 같은 판단을 기록한다. 예를 들어 협업자가 Slack을 선호한다는 지식은 Slack 추천에 쓰이지만 실제 메시지 전송은 자격 증명, 도구 권한, 실행 정책, 사용자 승인을 모두 거쳐야 한다. 따라서 맥락은 행동을 보조하지만 실행을 승인하지 않으며, 원문에 읽음 표시나 폴더를 기록하지 않고 에이전트의 판단만 별도로 보존한다.
03

긴급성보다 사용자 의도를 우선하는 순위

수신 요청이 스스로 긴급하다고 표현해도 사용자의 장기 우선순위와 일치한다는 보장은 없으므로 Intent Gate가 의무의 배치 기준을 분리한다. 이 구조는 사용자가 명시한 우선순위와 연결된 의무를 최고 단계에 예약하고, 우선순위와 무관한 긴급 요청은 처리 목록에 남기되 더 낮은 순위로 보낸다. 공개 레시피의 예에서는 긴급한 비용 정책 확인이 조용하지만 명시된 우선순위에 연결된 요청보다 아래에 놓인다. NemoClaw가 관계를 해석하는 동안 결정적 코드는 단계별 항목 수, 초과 항목 처리, 최종 순위 순서를 고정해 모델 판단의 변동을 제한한다.
04

사용자 수정과 감사 가능한 선호

장기 메모리는 올바른 판단뿐 아니라 잘못된 판단도 반복 보존할 수 있으므로 사용자가 의무의 단계를 바꾸거나 무시한 결정을 다음 실행에 남길 수 있게 했다. 각 변경은 한 번씩 추가 전용 감사 추적에 기록되고, 이후 실행은 이 기록을 읽어 같은 판단을 반복하지 않도록 한다. 여러 수정에서 공통 패턴이 나타나면 에이전트 판단, 사용자 수정, 감사 사건, 선호 정책 갱신의 흐름을 거쳐 작고 읽기 쉬운 정책으로 정리한다. 사용자는 이 정책을 직접 확인·편집·삭제할 수 있어 선호가 모델 내부 상태에 숨지 않는다.
05

Self Model의 정량 평가

저자들은 Agent Memory Benchmark와 예제 저장소의 평가 사례로 여러 에이전트 작업에서 agentic RAG 기준선과 Self Model을 비교했다. 186개 질문의 전체 정확도는 82.8%에서 90.9%로 8.1%p 높아졌고, 시간에 따라 바뀐 사실의 추적률은 60.0%에서 100.0%로 40.0%p 상승했다. 어려운 질문은 67.7%에서 87.1%로, 시점별 추론은 33.3%에서 66.7%로, 엔터티 구분은 66.7%에서 86.7%로 개선됐으며 다중 출처 종합은 87.7%에서 94.5%로 올랐다. 반면 말뭉치에 충실한 답변은 100.0%에서 92.3%로, 단일 단계 조회는 86.7%에서 83.3%로 낮아져 모든 작업에서 일관된 우위가 나타난 것은 아니다.
06

NVIDIA OpenShell로 실행 경계 통제

NemoClaw는 NVIDIA OpenShell과 통합돼 에이전트 생명주기를 관리하고, OpenShell은 파일 시스템·프로세스·네트워크 접근을 정책으로 통제하는 샌드박스 실행 환경을 제공한다. 관리형 추론과 MCP 연결에 필요한 자격 증명은 샌드박스 외부에 두며, 메모리와 검색 결과는 모델 입력일 뿐 신뢰할 수 있는 보안 정책으로 간주하지 않는다. 에이전트가 맥락을 잘못 해석하거나 악성 지시를 따르더라도 운영자가 정한 런타임 경계가 접근 범위와 실패 영향을 제한한다. 공개 레시피는 구조화된 메모리 스키마, 영속 의무 ledger, 제한된 순위 로직, 수정·감사 경로, 예약 유지보수, 오프라인 walkthrough, 단위 테스트를 제공하지만 실제 메시지 전송과 원천 시스템 변경은 수행하지 않는다.

용어 해설

Self Model
에이전트가 사람·프로젝트·우선순위·업무 패턴을 구조화해 저장하는 장기 메모리 계층이다. 원문 증거를 대체하지 않고 파생된 지식과 관계를 보관해 시간에 따른 맥락 연결과 판단에 활용한다.
에이전틱 RAG(Agentic RAG)
에이전트가 여러 차례 검색을 수행해 외부 자료를 가져오고, 검색 결과를 바탕으로 답변이나 작업을 이어가는 구조다. 이 글에서는 Self Model과 비교하는 기준선으로 사용됐다.
의도 게이트(Intent Gate)
들어온 요청의 긴급성만 따르지 않고 사용자가 명시한 우선순위와 연결된 의무를 먼저 배치하는 판단 계층이다. 최고 우선순위의 대상을 결정한 뒤 정해진 코드가 순위와 초과 처리를 집행한다.
추가 전용 감사 추적(Append-Only Audit Trail)
기존 기록을 덮어쓰지 않고 에이전트 판단의 변경을 사건으로 계속 추가하는 기록 방식이다. 사용자의 수정 이력을 보존하며 반복되는 수정 패턴을 읽고 편집할 수 있는 선호 정책으로 반영한다.
샌드박스(Sandbox)
에이전트의 파일 시스템·프로세스·네트워크 접근을 운영자가 정한 범위 안에 가두는 실행 환경이다. 메모리와 검색 결과를 보안 정책으로 신뢰하지 않고, 자격 증명을 샌드박스 외부에 둬 오용의 영향을 제한한다.

기술

  • NVIDIA NemoClaw
  • NVIDIA OpenShell
  • NVIDIA Nemotron
  • SQLite
  • Markdown
  • MCP
  • Retrieval-Augmented Generation (RAG)
  • Agent Memory Benchmark

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 09. 05.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.