TL;DR
작성자는 LLM이 정답을 맞히는지보다 확보한 증거만으로 결정을 정당하게 닫을 수 있는지를 확인하는 Comparative Feedback Control (CFC)을 테스트했습니다. 모델은 누락된 증거를 부정적 증거로 취급하거나 provenance가 사라진 상태를 다른 주장으로 옮기고, 작업을 끝내라는 압박 속에서 존재하지 않는 규칙을 추가해 결정을 확정했습니다. 교차 세션 실험에서 기준 조건은 3회 중 1회 근거 없는 REJECTED 상태를 이전했지만, CFC provenance 규칙을 적용한 조건은 3회 모두 주장을 미해결 상태로 유지했습니다. 다만 표본이 작고 탐색적인 결과라서 일반적인 benchmark나 신뢰성 개선의 증거가 아니며, 작성자는 Zenodo 자료와 함께 실험 설계 비판 및 adversarial case를 요청했습니다.
실용적 조언
- LLM이 최종 결정을 내리기 전에 결론을 뒷받침하는 증거가 해당 주장에 직접 연결되는지와 누락된 증거를 부정적 증거로 바꾸고 있지 않은지를 별도 단계에서 확인해야 합니다.
- 상태값을 세션 사이에서 전달할 때는 상태의 원래 주장과 provenance를 함께 저장하고, 연결 정보가 사라지면 승인이나 거부 대신 미해결 상태를 유지하는 규칙을 둘 수 있습니다.
- CFC를 실제 평가에 적용할 때는 기준 조건과 제어 규칙 조건을 여러 번 반복 실행하고, 의도적으로 provenance를 훼손하는 adversarial case를 별도로 추가해 효과의 재현성을 확인해야 합니다.
섹션별 상세
용어 해설
- 비교 피드백 제어(Comparative Feedback Control)
- — Comparative Feedback Control (CFC)는 LLM이 결정을 마무리하기 전에 남은 증거가 결론을 정당화하기에 충분한지 비교·점검하는 제어 규칙입니다. 불확실성을 임의의 추가 규칙으로 메우지 못하게 해 근거 없는 최종 판정을 줄이는 데 초점을 둡니다.
- 출처 추적성(Provenance)
- — Provenance는 특정 상태나 증거가 어느 주장과 어떤 근거에 연결되는지 추적하는 속성입니다. 이 연결이 사라지면 모델이 한 주장에 붙은 REJECTED 상태를 근거 없이 다른 주장으로 옮길 수 있어, 결정의 정당성을 확인하는 핵심 조건이 됩니다.
- 부정적 증거(Negative Evidence)
- — Negative Evidence는 어떤 사실이 없다는 점을 부정적인 판단의 근거로 사용하는 경우를 뜻합니다. 글의 실험에서는 누락된 증거를 자동으로 부정적 증거로 간주하는 오류가 LLM의 성급한 결정 종결과 연결되는지 점검했습니다.
- 미해결 주장(Unresolved Claim)
- — Unresolved Claim은 현재 확보된 증거만으로 승인이나 거부를 정당화할 수 없어 결론을 닫지 않은 주장입니다. CFC의 provenance 규칙을 적용한 실험에서는 근거 없는 REJECTED 상태 이전을 막고 주장을 미해결 상태로 유지하는 결과를 확인했습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.