본문으로 건너뛰기

신규 모델 네 종을 동일 수수께끼로 비교한 결과 LongCat-2.0은 높은 벤치 성능에도 반복적이고 확신에 찬 허위 응답을 보였다

두 가지 수수께끼를 동일 프롬프트로 네 모델에 던진 결과 LongCat-2.0이 높은 SWE-bench 점수를 기록했지만 반복적인 허위 응답과 교정 불이행을 보였다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 웹 검색 없이 해결해야 하는 두 개의 수수께끼를 동일한 프롬프트로 네 모델에 투입하여 모델별 정답 도달 방식과 힌트 요구량을 비교했다. MiMo-V2.5-Pro와 MiniMax M3은 첫 번째 수수께끼를 힌트 없이 해결했고 Mercury 2는 소수의 힌트로 정답에 도달했으나 LongCat-2.0은 여러 차례 존재하지 않는 근거를 창출하고 교정 요구에 불응하는 반복적 허위 응답을 보였다. 작성자는 LongCat의 SWE-bench Pro 점수(59.5)와 하드웨어 자립성 표기가 엔지니어링 성취를 시사하지만 모델 선택 시에는 벤치 점수만으로 판단할 수 없으며 RAG나 에이전트 통합 시 정직성 거동을 별도로 평가해야 한다는 결론을 제시했다.

주요 논점

01찬성다수

작성자는 높은 벤치 점수와 자체 하드웨어 기반 학습이 모델 선택의 전부가 될 수 없으며, 모델이 확신에 차서 허위 정보를 반복하는 거동은 RAG·에이전트 파이프라인에서 실무적 위험을 초래한다고 주장했다.

실용적 조언

  • 모델을 RAG나 에이전트 파이프라인에 도입할 때는 표준 벤치 점수뿐만 아니라 허위 응답 재현 테스트를 병행해 정직성 거동을 확인할 필요가 있다. 구체적으로는 사전에 설계한 비연결형 추리 문제를 동일한 프롬프트로 투입하고 힌트 요청과 교정 후 응답 변화를 기록하면 모델의 불확실성 표출 양상을 정량화할 수 있다. 또한 벤치 성능과 하드웨어 자립성은 모델의 역량을 평가하는 한 축이지만, 외부 지식 출처를 결합하는 워크로드에서는 모델의 '모른다' 선언 능력이나 근거 표출 능력이 더 중요할 수 있다.

섹션별 상세

01
저자는 웹 검색 차단 상태에서 정답이 표면적 패턴 매칭으로 해결되지 않는 두 개의 수수께끼를 동일한 프롬프트로 각 모델에 입력하고 힌트는 최대 세 번만 허용하는 규칙으로 실험을 진행했다. 입력 과정은 원문 그대로 복사해 붙여넣는 방식으로 통제되었고, 각 모델에 대해 힌트 요청 시점과 정답에 도달한 힌트 수를 기록했다. 이 방식은 모델이 사전 학습된 가중치 내의 연결을 얼마나 직접적으로 회수하는지를 검증하려는 의도였고, 결과는 모델별 정직성·추론 경로 차이를 드러냈다.
02
실험 결과에서 MiMo-V2.5-Pro와 MiniMax M3은 힌트 없이 두 수수께끼 중 첫 번째를 해결했으며 작성자는 MiniMax가 설명 중 유쾌한 추론 과정을 보였다고 언급했다. Mercury 2는 첫 번째 수수께끼에 대해 힌트 하나만으로 정답에 도달했고, 두 번째 수수께끼는 두 힌트가 필요했다는 점이 기록되었다. 저자는 MiniMax가 두 번째 수수께끼를 풀어가는 과정에서 Windows 95 CD 관련 사실을 잘못 연결한 소소한 오류를 보였으나 이는 LongCat의 반복적·확신적 허위응답과는 성격이 다르다고 구분했다.
03
LongCat-2.0의 거동은 명확히 허위 응답 사례들로 구성되어 있는데 첫 번째 수수께끼에서는 존재하지 않는 근거를 만들어내어 Walter Koenig의 가족사가 팬덤 속 일화로 존재한다고 주장했고 두 번째 수수께끼에서는 전혀 사실과 다른 음반·비디오 연결들을 잇는 등 적어도 네 건의 허위 사실을 생산했다. 작성자는 LongCat이 정정 지시를 받은 뒤에도 최초의 허위 주장을 반복하거나 다른 허위 후보를 제시하는 등 교정 불이행을 보였다고 기록했고 이 점이 단순한 실수와 구별된다고 판단했다. 이러한 관찰은 모델의 출력이 표면적 신뢰성 지표나 벤치마크 점수와 일치하지 않을 수 있음을 보여주며 검증의 필요성을 강조한다.
게시물에 첨부된 이미지로 보이는 모델 응답 캡처는 작성자가 지적한 허위 인용과 잘못된 사실들을 보여주는 스크린샷으로 판단된다.
Screenshot이미지는 LongCat과 다른 모델이 수수께끼에 대해 생성한 문장들을 캡처한 것으로 보이며, 그 안에는 존재하지 않는 배우 가족사·가짜 비디오 제목 같은 허위 텍스트와 모델의 확신적 문장이 포함되어 있다. 이 시각 자료는 본문 서술과 일치하는 구체적 예시를 제공하므로 작성자의 허위 응답 주장에 대한 근거 자료로 활용될 수 있다.
04
작성자는 LongCat이 SWE-bench Pro에서 59.5를 기록해 MiMo보다 앞섰고 하드웨어 측면에서는 Huawei 기반의 국내 실리콘으로 끝단까지 학습이 이루어졌다는 점을 별도로 강조했으나 바로 뒤이어 이 모델의 허위 응답 경향을 위험 신호로 지목했다. 이 관찰은 벤치마크 점수와 엔지니어링 자립성은 모델의 성능·효율성 측면에서 중요한 지표이나 모델의 정직성·불확실성 표출 능력은 별도의 평가 축이 되어야 함을 시사한다. 따라서 RAG나 에이전트 통합 시 단순 점수 중심의 선택이 오히려 위험을 높일 수 있다는 결론이 도출되었다.

용어 해설

허위 응답(Hallucination)
모델이 외부 근거 없이 사실이 아닌 정보를 자신 있게 생성하는 현상으로, 학습 중 통계적 연관성이나 패턴 재생산이 원인이 되고 RAG나 에이전트 파이프라인에서 잘못된 결정을 유발할 수 있다.
검색 증강 생성(RAG)
질의에 대해 외부 문서 검색으로 관련 컨텍스트를 찾아 모델 입력으로 결합하여 응답의 정확도를 높이는 방법론으로, 모델이 자체 지식에 의존할 때 발생하는 허위 응답을 완화하기 위해 널리 사용된다.
확산 모델(Diffusion Model)
노이즈 추가와 역순의 정제 과정을 통해 이미지를 점진적으로 생성하는 생성 모델 계열로, 이미지 생성에서 고해상도·세부 묘사에 강점이 있으며 텍스트-이미지 연동에서는 별도의 텍스트 이해 모듈과 결합된다.
벤치마크(Benchmark)
모델 성능을 표준 과제와 수치로 비교하는 평가 도구로, 특정 태스크에서의 점수는 한 축의 판단 근거가 되나 모델의 정직성이나 추론 거동 같은 정성적 특성은 포착하지 못하는 한계가 있다.
하드웨어 가속기(Hardware Accelerator)
AI 학습·추론 연산을 위해 설계된 특수 칩셋으로, 설계·제조 주체가 다른 국가 또는 기업이면 수출 규제나 생태계 의존성에서 자유로울 수 있으나 소프트웨어·데이터 측면의 특성은 독립과 별개로 남는다.

언급된 도구

LongCat-2.0비추천

언어 추론 태스크 수행을 위해 사용된 최신 모델

MiniMax M3추천

수수께끼 풀기에서 비교 대상으로 사용된 고성능 언어 모델

MiMo-V2.5-Pro중립

같은 실험에서 정답을 바로 찾아낸 대조 모델

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 03.수집 2026. 07. 03.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.