로컬 에이전트로 구동되는 재현 가능한 레드팀 플랫폼
로컬 AI 코딩 에이전트를 전투 엔진으로 삼아 재현 가능한 툴 기반 레드팀 워크플로를 제공하는 TypeScript 프레임워크이다.
TL;DR
T3MP3ST는 로컬 또는 연결된 AI 코딩 에이전트를 브레인으로 삼아 도구 기반의 레드팀 킬체인을 자동화하는 TypeScript 프레임워크이다. 플랫폼은 War Room UI와 CLI를 제공해 에이전트에 미션을 지시하면 ReAct 스타일 루프를 통해 실 툴(nmap·HTTP 등)을 호출하고 결과를 findings ledger에 기록하며 요약 리포트를 만든다. 모든 주요 성과 지표는 저장소의 벤치 아티팩트로부터 `npm run verify-claims` 명령으로 재계산되도록 설계되어 보고된 수치의 출처와 계산 과정을 재현할 수 있다. 단, 핵심 벤치마크와 PoC 산출은 단일 에이전트 실행에 기반했으며 8-오퍼레이터 동시 협업(스웜)은 아직 완전 검증되지 않아 그 부분의 신뢰도는 제한적이다. 이 플랫폼은 키리스 로컬 운영과 재현 가능한 감사 흐름을 통해 비용·프라이버시·검증 가능성 측면에서 기존 클라우드 중심 도구와 다른 선택지를 제공한다.
주요 기능
- 로컬 에이전트를 중추로 삼아 키 없이 미션을 시작하고 실행한다. War Room UI 또는 CLI에서 에이전트를 연결하면 recon→exploit→report의 킬체인이 자동으로 진행된다. 이 과정에서 외부 API 키를 요구하지 않아 비용과 노출을 줄인다.
- 도구 기반의 실질적 스캐닝과 익스플로잇을 연계해 발견된 증거를 증거 저장소에 기록한다. Recon 엔진은 nmap, DNS, HTTP, 지문화 도구와 연동되며 각 발견은 원시 툴 출력과 연관된 영수증으로 추적 가능하다. 결과는 커밋된 레퍼런스와 대조해 재계산할 수 있도록 설계됐다.
- 검증 가능한 벤치마크 파이프라인을 내장해 README의 핵심 숫자를 재계산할 수 있다. `npm run verify-claims` 명령은 bench/의 커밋된 JSON을 사용해 모든 헤드라인 수치를 재도출하도록 자동화되어 있다. 이 접근은 보고된 성과가 재현 가능해야만 신뢰를 얻는 철학을 반영한다.
- 도메인별 로드아웃으로 확장 가능한 클래스/스쿼드 구조를 제공한다. 각 도메인은 전문 클래스, 아스날, 타깃 어댑터, 벤치마크로 구성되어 새로운 영역을 모듈식으로 추가할 수 있다. 이 설계는 웹·CTF·임베디드 등 서로 다른 타깃에서 동일한 플랫폼을 재사용하게 한다.
- 코디네이터·오퍼레이터 패턴으로 복합 작업을 조율하며 분산된 툴 호출을 관리한다. 8개 오퍼레이터는 Recon, Scanner, Exploiter, Infiltrator, Exfiltrator, Ghost, Coordinator, Analyst로 맵핑되어 MITRE ATT&CK 단계에 대응한다. 각 오퍼레이터는 툴백·프롬프트·증거 플로우를 결합해 특정 킬체인 역할을 수행한다.
어떻게 동작하는가
T3MP3ST는 로컬 또는 연결된 AI 코딩 에이전트를 '브레인'으로 삼고 그 주위에 미션 엔진과 아스날을 결합해 킬체인을 자동화한다. 에이전트가 자연어로 미션을 수령하면 ReAct 스타일의 루프를 통해 스캐너·익스플로잇 툴을 호출하고 툴 출력은 증거 저장소와 findings ledger에 기록되며 필요시 인간 승인 게이트를 거친다. 모든 성과 지표는 커밋된 아티팩트로부터 `npm run verify-claims`로 재계산할 수 있게 설계되어 있어 보고된 수치의 출처를 추적할 수 있다.
해결 문제
전통적인 레드팀 운영은 고가의 툴셋과 숙련된 인력에 의존해 접근성이 낮았고 보고된 성과가 재현 불가한 경우가 많았다. T3MP3ST는 로컬 에이전트를 활용해 키리스로 툴체인을 연결하고 발견 근거를 커밋된 아티팩트와 대조해 수치의 재현 가능성을 확보함으로써 접근성과 투명성을 동시에 개선했다. 이로 인해 연구자와 오너가 자신의 환경에서 동일한 벤치마크와 판정을 직접 재생산할 수 있게 되었다.
지금 주목받는 이유
README가 제공하는 재현 가능 벤치마크와 키리스 로컬 에이전트 통합이라는 조합이 주목받고 있다. 저장소는 XBEN과 CVE-Zero 같은 실전형 벤치마크에서 눈에 띄는 수치를 공개하고 그 계산 과정을 자동으로 재현하게끔 구성되어 있어 검증 중심 커뮤니티에서 관심을 끌었다. 또한 오프라인·자체 호스팅 워크플로가 보안·규정 준수 요구와 맞물려 실무 적용 가능성을 높였다.
차별점
- 커밋된 아티팩트에서 수치를 재계산하는 `verify-claims` 파이프라인을 내장해 모든 주요 성과를 재현 가능하게 만들었다. README에 제시된 수치는 저장소의 벤치 데이터로부터 자동으로 재도출되며 결과가 재현되지 않으면 수치가 배포되지 않는다. 이 접근은 오픈소스 레포에서 흔히 볼 수 없는 수준의 투명성과 감사 가능성을 제공한다.
- 로컬 에이전트를 우선 설계해 키리스 운영을 기본값으로 삼았다. 사용자는 Claude Code, Codex 같은 기존 에이전트를 연결하거나 Ollama·LM Studio·vLLM 등 로컬 모델을 지정해 미션을 실행할 수 있으며, 별도 API 키나 클라우드 테넌트가 필수적이지 않다. 이로써 비용·프라이버시·연속성 측면에서 기존 클라우드 중심 도구와 차별화된다.
- 실제 도구 출력과 모델 결정을 결합하는 도구 백엔드가 기본으로 포함되어 있으며 결과 증명과 조정된 공개 파이프라인(조정자·드래프트 보관 등)을 통해 coordinated-disclosure가 가능하다. Recon 엔진은 nmap/DNS/HTTP 등 실 툴과 직접 연동되고 증거는 findings ledger에 기록되어 감사 추적이 가능하다. 이러한 통합은 단순 시뮬레이션이 아닌 도구 기반의 실무적 리포트 생산을 목표로 한다.
사용 사례
- 권한이 명확히 부여된 모의침투(authorized pentest)에서 자동화된 정찰·취약점 확인·리포트 생산을 수행한다. 사용자는 War Room에 타깃을 입력하고 로컬 에이전트를 연결해 recon→exploit→report의 흐름을 실행하며 발견 근거는 findings ledger에 기록된다. 이 과정은 조직 내부에서 손쉽게 반복 가능한 감사용 결과물을 생성하는 데 적합하다.
- CTF 또는 교육용 연습 환경에서 힌트 없는 문제 해결을 자동화해 학습과 검증을 지원한다. README는 Cybench에서의 힌트-프리 성과를 언급하며, 문제 해결 과정과 채점은 커밋된 오라클에 따라 재계산 가능하다. 이런 특성은 교육용 문제집이나 연습 경기를 자동 평가·분석하는 파이프라인으로 활용되기 좋다.
- 오픈소스 취약점 헌팅과 조정된 공개(coordinated disclosure) 파이프라인에 활용해 발견부터 PoC 생성, 리포트 초안 작성, 벤더 조정까지 흐름을 연결한다. T3MP3ST는 OSV 연동과 라이브-PoC·refuter 패널을 포함해 증거 기반의 보고를 관리하며 드래프트는 인간 검토 후 전달되도록 설계됐다. 이 워크플로는 OSS 보안 조사와 책임 있는 공개를 체계화하는 데 적합하다.
시작하기
가장 빠른 진입은 저장소를 클론한 뒤 의존성을 설치하고 서버를 띄우는 것이다. `npm install`로 패키지를 설치한 뒤 `npm run server`로 War Room을 실행하면 기본적으로 http://127.0.0.1:3333/ui/에 접속해 에이전트를 연결할 수 있다. 로컬 모델을 쓸 경우에는 Ollama/LM Studio/vLLM 같은 서버를 띄우고 환경변수로 TEMPEST_LOCAL_BASE_URL과 TEMPEST_LOCAL_MODEL을 설정해 T3MP3ST가 해당 엔드포인트를 사용하게 하면 된다.
요구사항
- Node.js 기반의 환경과 npm이 필요하며 저장소는 TypeScript로 구현되어 있다. README와 INSTALL_MATRIX 문서들은 macOS와 Linux 지원을 중심으로 설치 매트릭스를 제공하므로 운영체제별 준비가 필요하다. 로컬 모델을 사용할 경우 Ollama·LM Studio·vLLM 같은 OpenAI 호환 서버를 가동하거나 외부 API 키(OPENROUTER_API_KEY 등)를 설정할 수 있다.
- 아스날의 일부 외부 툴은 선택적 의존으로 분리되어 있고 위험한 드라이버(예: metasploit, hydra)는 인간 승인 게이트 뒤에 위치한다. README는 `T3MP3ST_FULL_ARSENAL` 옵션을 통해 기본 35개 도구에서 최대 83개 어댑터까지 확장 가능하다고 명시했으며, 위험한 외부 드라이버는 명시적 opt-in이 필요하다. 또한 AGPL-3.0 라이선스 조건과 법적 책임은 사용자가 준수해야 한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| XBEN (black-box) | pass@1 | 90.1% (Wilson-95 86.2–92.9) | vs XBOW self-reported 85% |
| XBEN (white-box) | pass@1 | 98.7% best-ball 104/104 | — |
| Cybench | pass@1 | 23/40 (58%) hint-free | Anthropic: 76.5% pass@10 (context in README) |
| CVE-Zero | exact file/line/CWE hits | single-agent 8/10 exact, 10/10 found | — |
3.3k
Stars
759
Forks
+211
Trending
6
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.