AtomicBot-ai/atomic-agent
TypeScript0 / 0
Atomic Agent는 로컬에서 제어 루프와 상태를 유지하며 소형 quantized 모델로 반복적 도구 호출을 효율화해 GAIA L1에서 69.8% 정확도를 기록했다.
TL;DR
Atomic Agent는 제어 루프와 상태를 로컬에 유지하면서 퀀트된 소형 모델로 긴 멀티스텝 워크플로를 처리하려는 목적의 로컬-퍼스트 에이전트이다. 핵심은 모델이 한 번의 추론으로 JSON 도구 호출을 반환하도록 하고 결과는 요약해 외부 상태로 관리하며 TurboQuant 기반 KV-cache 양자화와 추정적 디코딩으로 처리량을 높이는 아키텍처에 있다. 공개 GAIA L1 벤치마크에서 동일 모델·예산 조건으로 69.8% 정확도와 평균 처리시간 단축을 제시했으며 승인 게이트·추적·로컬 저장으로 보안·감시성을 확보했다. 다만 개발 프리뷰 상태라 API·명령·설정은 변할 수 있고 외부 모델이나 브라우저 실행 권한 등 런타임 전제 조건을 충족해야 한다.
핵심 포인트
- 로컬-퍼스트 설계로 모든 제어 루프와 상태가 로컬에 남아 사용자의 데이터가 기본적으로 외부로 유출되지 않도록 하며, 이는 에이전트의 프라이버시 경계와 감사 가능성을 보장한다. 구성과 상태는 디스크의 <stateDir>에 저장되어 사용자가 직접 검증하고 편집할 수 있다. 클라우드 종속성이 없는 운영 모드가 가능한 점이 경쟁 솔루션과 구별된다.
- TurboQuant 계열의 KV-cache 및 가중치 양자화와 커스텀 speculative decoding을 결합해 소형 로컬 모델에서 처리량을 30~50% 이상 향상시켰으며, 이는 동일 하드웨어에서 더 긴 맥락과 더 많은 도구 단계를 소화하게 한다. 이 기술 스택은 KV-cache 압축과 모델 재사용에 초점을 맞추어 메모리와 레이턴시를 동시에 최적화한다. 선별된 GGUF 퀀트 모델을 함께 관리해 VRAM 제약을 현실적으로 맞춘 점이 특징이다.
- 명확한 승인 게이트와 부록 가능한 추적(append-only NDJSON traces)을 통해 위험 작업과 실패를 분류·중단·회복할 수 있는 운영 안전 장치를 제공한다. 셸 쓰기, 아카이브 추출, 프로세스 킬 등 민감한 작업은 정책에 따라 인터랙티브 승인 흐름을 통해서만 실행된다. 트레이스 재생과 프롬프트 드리프트 비교 기능은 디버깅과 규정 준수를 지원한다.
- 브라우저 자동화를 통해 페이지를 탐색하고 ARIA 기반의 간결한 접근성 스냅샷을 읽어 클릭·타이핑·탭 관리 등 상호작용을 수행한다. 이 기능은 Playwright 기반으로 동작해 Chromium 계열 브라우저와 호환되며, 위험한 조작은 승인을 요구하도록 설계되어 있다. 병렬 읽기 호출을 지원해 단일 추론으로 여러 독립적인 읽기 작업을 처리할 수 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| GAIA Level 1 | Accuracy | 37/53 = 69.8% | vs Hermes: 31/53 = 58.5% |
| GAIA Level 1 | Avg wall / task | ~217 s | vs Hermes: ~351 s |
| GAIA Level 1 | Head-to-head wins | +15 atomic-only / +9 Hermes-only | — |
| Model scaling (atomic-only) | Accuracy (qwen-3.5-9b) | 28/53 = 52.8% | vs qwen-3.6-35b-a3b: 69.8% |
| Model scaling (atomic-only) | Accuracy (gemma-4-12b) | 24/53 = 45.3% | vs qwen-3.6-35b-a3b: 69.8% |
이미지 분석


1.6k
Stars
186
Forks
+208
Trending
0
조회수
1.6k watchers13 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.