TL;DR
이 게시물은 Supervisor가 Researcher(Tavily), Writer, Critiquer를 라우팅하며 Critiquer의 다섯 개 지표로 채점한 뒤 Writer가 수정하는 자체 검토 루프를 통해 인간 개입 없이 문서 품질을 반복적으로 개선하는 다중 에이전트 시스템을 소개했다. 구현은 LangGraph로 그래프 기반 오케스트레이션을 구성하고 LangChain으로 에이전트 호출을 관리하며 LLM은 Together AI로 연결하고 UI는 Streamlit으로 제공되는 형태로 이루어져 있다. 종료 조건은 Critiquer 점수가 지정 임계값을 넘거나 최대 수정 횟수에 도달하면 루프가 멈추는 방식으로 설정되어 있으며 핵심 재현 자원은 공개된 GitHub 저장소에 존재한다. 이 접근법은 자동화된 반복 개선을 가능하게 하는 반면 평가자 설계와 임계치 설정에 따라 품질 편향이나 누적 오류 위험이 존재한다.
실용적 조언
- 임계치와 최대 수정 횟수는 자동 반복의 안전장치 역할을 하므로 실험 단계에서 다양한 임계값을 시도하여 품질과 반복 횟수 간의 균형을 찾아야 한다. 초기에는 보수적인 임계값을 설정해 자동 수렴이 예상보다 빠르게 일어나지 않도록 해야 하며 로그를 통해 각 반복에서의 점수 변화를 모니터링해야 한다. 또한 특정 지표에 편중된 개선이 일어나지 않도록 다섯 개 지표의 상대적 가중치를 조정하는 절차를 병행할 필요가 있다.
- Critiquer의 피드백 내용과 Writer의 수정 결과를 구조화된 로그로 남기면 자동 루프의 실패 모드를 진단하고 보상 모델을 설계하는 데 유용하다. 각 반복의 입력·출력·점수와 피드백 텍스트를 저장하여 특정 유형의 피드백이 개선에 실제로 기여하는지 계량적으로 평가할 수 있으며 이 데이터를 바탕으로 평가자 설계나 라우팅 규칙을 개정할 수 있다. 또한 사용자 인터페이스에서 수정 이력과 점수 추이를 시각화하면 비전문가도 시스템 동작을 이해하고 신뢰도를 검증하는 데 도움이 된다.
섹션별 상세
용어 해설
- Multi-Agent System
- — 여러 에이전트가 역할을 분담하여 협력하거나 조정하는 시스템으로, 입력 문서 생성·검토·수정 작업을 각 에이전트가 담당하고 중앙 Supervisor가 라우팅을 수행하는 방식으로 동작한다. 에이전트 간 메시지 교환과 상태 업데이트가 루프를 통해 이루어지며 작업 종료 조건은 품질 임계치나 최대 수정 횟수로 정해진다. 이 방식은 작업 분업과 자동 반복을 통해 인간 개입을 줄이면서 산출물 품질을 높이려는 목적을 가진다.
- Self-Review Loop
- — 생성된 텍스트를 자동화된 평가자가 점검하고 피드백을 반영해 작성자가 수정하는 순환 과정으로, 평가 점수가 임계값에 도달하거나 최대 반복 횟수에 도달하면 종료된다. 입력은 초기 초안이며 처리 과정은 평가자 채점→피드백 전송→수정 적용의 반복이고 출력은 최종 검토를 통과한 문서이다. 이 방식은 사람 참여를 최소화하면서 반복적 개선을 자동화하는 데 중요하다.
- Critiquer Agent
- — 생성된 결과물을 여러 품질 차원으로 채점하고 구체적 수정 지시를 반환하는 에이전트로, 이 게시물에서는 다섯 개 지표로 점수를 부여하고 점수 기반 피드백을 Writer에 전달하는 역할을 수행한다. 입력은 최신 초안이며 처리 과정은 차원별 평가·점수 합산·피드백 생성이고 출력은 수정 지시와 통계적 점수이다. Critiquer의 신뢰도와 평가 설계는 자동 개선 루프의 유효성을 좌우한다.
언급된 도구
LangGraph는 에이전트와 처리 단계를 그래프 노드로 구성하여 Supervisor가 라우팅 결정을 내리도록 구조화하는 역할을 했다. 그래프 표현은 상태 전이와 의존성을 명확히 하여 반복 루프의 조건 평가와 에러 핸들링을 단순화했다. 이 구성은 복합 워크플로에서 작업 분배와 재시도를 체계적으로 관리하는 데 유리하다.
LangChain은 prompt 관리와 에이전트간 호출 흐름을 연결하는 역할로 사용되어 Writer와 Critiquer 간의 텍스트 전달과 도구 호출을 표준화했다. 이를 통해 각 에이전트가 입력을 받아 처리하고 다음 에이전트로 출력하는 파이프라인을 안정적으로 운영할 수 있었다. LangChain의 체인·액터 패턴은 다양한 LLM 호출 전략을 적용하는 데 유용했다.
Together AI는 실제 LLM 추론을 제공하는 외부 모델 제공자로서 모델 호출과 응답 지연·비용을 실험 환경에서 결정하는 요소로 작동했다. LLM 호출 결과가 Researcher의 자료 생성과 Writer의 초안 품질에 직접적 영향을 미쳐서 추론 속도와 응답 품질은 전체 루프의 성능 지표가 되었다. 운영 환경에서는 모델 선택과 비용 대비 성능 최적화가 필요하다는 점이 드러났다.
Streamlit은 사용자 인터페이스를 신속히 구성하여 Supervisor의 상태, 각 에이전트의 출력, Critiquer 점수와 수정 이력을 실시간으로 확인하게 하는 프레임을 제공했다. 이 UI는 개발자가 루프 동작을 관찰하고 파라미터를 조정하는 데 사용되었으며 프로토타입을 시연하는 용도로 적합했다. 단순하고 빠른 대시보드 구축은 반복 실험을 효율화하는 데 기여했다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



