TL;DR
이 게시물은 GPT, Claude, Gemini, Kimi를 포함한 11개 대형 언어모델을 교차 벤더 방식으로 31,430회 실행한 결과를 보고한다. 분석에서는 11,658건의 성공 실행에서 UTF-8 출력 바이트가 정확히 0인 사례들이 집계되었고, 엄격히 매칭된 4,290개 의미적 쌍 비교에서 널 조건에서만 2,505건의 Voids가 나오며 출력 허가 대조군에서는 0건이었다. 해당 현상은 거부·안전 차단·레이트 제한·전송 실패와는 별개로 처리되었고, 원시 기록·이벤트 해시·검증 코드·전체 분석 자료가 공개되어 독립 검증이 가능하다.
주요 논점
대규모 교차 벤더 실험에서 동일한 입력에 대해 출력이 완전히 비어 있는 사례가 반복적으로 나타났다는 점은 LLM 응답의 신뢰성 문제를 시사한다.
공개된 원시 기록과 검증 도구가 제시되어 독립적인 재현 가능성은 확보되었으나, 외부 검증 결과가 추가로 필요하다.
널 조건에서만 대량의 Voids가 발생하고 출력 허가 대조군에서 0건인 점은 권한·거부 정책이 원인이 아님을 강하게 암시한다.
섹션별 상세
용어 해설
- 빈 출력(Voids)(Void)
- — 출력 결과의 가시적 UTF-8 바이트가 0인 실행을 가리킨다. 연구는 로그와 원시 기록을 기준으로 출력 바이트 유무를 판정했고, 거부·안전 차단·전송 실패와는 별도로 이 상태를 분리하여 집계했다. 검증을 위해 이벤트 해시와 검증 코드가 함께 공개되었다.
- 엄격 의미적 쌍(Strict matched semantic pairs)
- — 의미적으로 동일한 입력 쌍을 만들어 널 조건과 출력 허용 조건을 엄격히 대응시켜 비교하는 실험 설계이다. 이 방식은 입력 의미와 컨텍스트를 고정한 상태에서 출력 차이를 분리해 원인 규명을 돕는다. 게시물에서는 4,290개의 엄격 대응 쌍을 사용해 결과 차이를 평가했다.
- 출력 허가 대조군(Output-licensed controls)
- — 모델에게 출력 생성이 허용된 조건으로 설정한 대조군을 뜻한다. 연구에서는 이 대조군에서 Voids가 한 건도 관측되지 않아 널 조건에서 발생한 빈 출력이 단순한 권한 문제나 정책 거부와 무관함을 뒷받침한다. 대조군 결과는 동일 입력에 대한 비교의 핵심 근거로 제시되었다.
- 이벤트 해시(Event hashes)
- — 실험 로그 항목의 무결성을 확보하기 위해 각 이벤트에서 생성한 해시 값이다. 해시를 통해 기록 위조 가능성을 낮추고 공개된 원시 기록의 일관성을 검증할 수 있다. 게시물은 원시 기록과 이벤트 해시, 검증 코드를 함께 공개하여 독립 재현을 지원한다고 밝힌다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.