itayinbarr/little-coder
TypeScript0 / 0
pi 기반 TUI로 소형 로컬 모델을 위한 스캐폴딩과 도구 제어를 결합해 노트북 환경에서 일관된 코딩 에이전트 실행을 가능하게 한다.
TL;DR
이 레포는 pi 위에서 동작하는 TUI 기반 코딩 에이전트로, 작은 로컬 모델의 한계를 스캐폴딩(프롬프트·스킬·도구)으로 보완해 노트북급 하드웨어에서 실무적 코드 생성과 편집을 가능하게 했다. 런처는 --no-extensions로 pi를 실행한 뒤 번들된 확장만 명시적으로 로드해 콜드 스타트 컨텍스트를 약 7k 토큰 수준으로 유지하고, Read-before-edit·권한 게이트·증거 보존 같은 런타임 안전 장치를 통해 파일 무결성과 운영 일관성을 확보한다. 여러 릴리스에서 Aider Polyglot 45.56 %, v0.0.5의 78.67 %, Terminal-Bench 2.0의 24.6 % 등 재현 가능한 벤치마크 결과를 제시해 스캐폴드 설계의 효과를 실증했고 컨텍스트 압축·증거 주입·퍼미션 게이팅이라는 트레이드오프를 통해 소형 모델의 실무 적용 가능성을 확장했다.
핵심 포인트
- 소형 모델에 맞춘 스캐폴드 우선 설계는 단순히 모델 크기를 줄이는 대신 도구·프롬프트·스킬을 함께 조정해 성능을 끌어올린다. 런처는 고정된 확장 세트를 명시적으로 로드해 콜드 스타트 컨텍스트를 약 7k 토큰 수준으로 유지하며 예측 가능한 동작을 만든다. 이 방식은 확장 충돌이나 로컬 설정에 따른 비결정성을 줄여 소형 모델에서의 재현성을 높인다.
- 파일 안전성과 셸 게이팅을 결합해 에이전트가 실수로 파일을 덮어쓰거나 위험한 셸 체인을 실행하는 것을 방지한다. 모든 파이프 체인의 각 명령에 대해 검사를 수행하고 리디렉트 기반 쓰기를 거부함으로써 편집 작업의 무결성을 확보한다. 이 보수적 접근은 벤치마크와 실무 둘 다에서 결과의 일관성을 높이는 데 기여한다.
- 벤치마크와 실측 중심의 개발 흐름을 유지해 논문·릴리스 태그별로 재현 가능한 수치를 제공한다. README는 여러 릴리스의 Aider Polyglot·Terminal-Bench·GAIA 결과를 명시하고 동일한 노트북 하드웨어에서의 비교를 가능하게 한다. 이로 인해 개선 사항의 원인이 스캐폴드 변화인지 모델 변화인지 분리해 검증하기 쉽다.
- pi의 확장 모델을 활용해 모든 기능을 독립적인 확장으로 나누었고 런처가 --no-extensions로 실행되므로 사용자가 필요 없는 기능을 디렉토리 삭제만으로 비활성화할 수 있다. 이 설계는 사용자 맞춤형 경량 에이전트를 구성하기 쉽게 만들며 로컬 설치와 글로벌 pi 설치 간의 상호작용 문제를 기술적으로 격리한다. 확장 단위의 독립성은 개발자가 특정 기능만 수정하거나 교체할 때 종속성 폭발을 방지한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Aider Polyglot | mean | 45.56 % | matched-model vanilla Aider baseline 19.11 % |
| Aider Polyglot (v0.0.5) | mean | 78.67 % | — |
| Terminal-Bench 2.0 (qwen3.6-35b-a3b) | accuracy | 24.6 % ± 3.2 | rank 120 on leaderboard |
| Terminal-Bench 2.0 (qwen3.5-9b) | accuracy | 9.2 % ± 2.4 | rank 142 on leaderboard |
2.3k
Stars
151
Forks
+204
Trending
0
조회수
2.3k watchers17 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.