검색 품질을 정량화하는 RAG 평가 프레임워크와 44문항 검증셋
Retrieval Arena는 동일 골든셋에 대해 청킹·검색·재랭크 전략을 비교해 검색 지표(MRR, nDCG 등)와 생성 정합성(LLM judge)을 별도로 측정하고 지연과 토큰 비용을 추적하는 오픈소스 평가 툴이다.
LLM 애플리케이션을 실제로 구축하고 배포하는 개발자들의 실전 경험과 오픈소스 도구, 아키텍처 고민이 집약되어 있음
Retrieval Arena는 동일 골든셋에 대해 청킹·검색·재랭크 전략을 비교해 검색 지표(MRR, nDCG 등)와 생성 정합성(LLM judge)을 별도로 측정하고 지연과 토큰 비용을 추적하는 오픈소스 평가 툴이다.
프롬프트 개선으로는 한계가 있어 파일 쓰기 후 타입체크와 빌드 실패 규칙, 허용목록 등 결정적 검증 계층으로 모델 실수를 감지·제한한 경험을 공유한다.
YAML 주석에 숨긴 프롬프트 인젝션으로 자동 리뷰어를 속여 내부 코드명·체크포인트 URI·서명 시크릿을 유출하도록 만드는 게임이 공개되었다.
메인 모델을 라우터로 삼아 파일 조회·기계적 편집 등 하위 작업을 최저 비용 계층에 위임하고 검증된 실패만 에스컬레이션하는 Claude Code 플러그인이다.
여러 차례의 RAG 파이프라인 장애는 단계 간 데이터 형식이 은밀히 바뀌며 발생했고 각 핸드오프에 JSON Schema 계약을 적용해 구조적 드리프트를 차단했다.
ctxdiff는 LLM 에이전트의 각 턴에서 컨텍스트 블록이 어떻게 추가되거나 제거되었는지를 content-hash 기반으로 기록해 턴별 차이와 토큰 사용처를 추적하는 로컬 우선 도구이다.
PR 대화와 최신 코드 상태를 비교해 각 리뷰 코멘트가 실제로 반영되었는지 규칙 기반과 LLM 보완으로 판정하는 CLI·Action·에이전트 도구이다.
같은 태스크 시퀀스를 메모리 유지와 초기화로 두 번 실행하여 메모리 기여도를 성능 차이로 정량화한다.
Kimi K3는 프런티어에 근접하는 강력한 모델이지만 Fable 5와 GPT-5.6 Sol을 일괄적으로 능가한다는 주장과 '명백히 더 저렴하다'는 주장은 벤치마크 설정과 비용 산정 방식에 따라 달라진다.
파서로 심볼과 정확한 소스 슬라이스를 추출해 사실을 해시 ID로 저장하고 모델에는 불투명 마커만 보이게 하여 모델이 직접 위치를 쓰지 못하게 하는 방식으로 잘못된 코드 인용을 구조적으로 제거한다.
Databricks 벤치마크는 동일 모델도 하니스 설계에 따라 완료 비용이 2배 이상 달라질 수 있고 일부 하니스는 턴당 컨텍스트를 약 3배 적게 전송하면서 유사한 품질을 달성해 '검증된 작업당 비용' 지표의 중요성을 제기했다.
Arc Gate는 웹·이메일·도구 결과로부터 온 텍스트를 모두 명령 권한이 없는 것으로 처리해 프롬프트 인젝션을 차단하고 데모와 깃허브, 벤치마크 결과를 공개했다.
SceneProof는 소스에서 추출한 구조·스타일·지오메트리 정보를 사용해 React DOM과 Three.js 장면을 탐색하고 재렌더링하는 오픈소스 CLI 도구이다.
작성자는 총 124B 중 5.1B만 활성화하는 실행 모델이 256K 컨텍스트와 서브100ms 첫 토큰 지연으로 도구 호출과 고량 처리에 적합하며 현재는 API 전용·무게 비공개 상태임을 밝히고 의견을 구했다.
에이전트 실패의 핵심 원인은 모델이 행동과 진행 평가를 동시에 수행하며 진전 여부를 판별하지 못하는 것이며, 토큰/단계 예산과 외부적 진행 검증 신호가 이를 완화한다.
에이전트를 활용한 개발에서 작은 작업 범위 설정, 사전 사양과 테스트 작성, 민감 영역의 수동 검토, 모든 diff의 인간 승인, 아키텍처 소유권 유지가 품질 유지에 결정적이었다.