본문으로 건너뛰기
HF Daily Papers조회 4

하이브리드 사고 MLLM의 응답 패턴 정렬

PatternEval으로 네 가지 응답 오류를 측정하고 PatternRL로 non-thinking Trigger를 낮췄다.

용어 해설

하이브리드 사고(Hybrid-Thinking)
하나의 MLLM이 추가 추론을 수행하는 thinking 모드와 짧은 직접 응답을 생성하는 non-thinking 모드를 모두 제공하는 추론 방식이다. 두 모드는 계산량과 지연시간이 다르지만 최종 응답의 정확성뿐 아니라 일관성과 가독성도 같은 기준을 충족해야 한다.
응답 패턴 정렬(Response-Pattern Alignment)
추론 모드가 thinking에서 non-thinking으로 바뀌어도 사용자에게 전달되는 최종 응답의 형식과 의미가 허용 범위 안에 유지되는지를 평가하는 개념이다. 정확한 답을 내더라도 사고 과정 노출, 반복, 모순이 발생하면 정렬이 깨진 것으로 본다.
사고 과정 노출(Chain-of-Thought Leakage)
내부 추론의 흔적, 초안, 자기 수정, 명시적인 thinking 표지가 사용자에게 보이는 최종 답변에 포함되는 오류다. 간결하고 다듬어진 근거 설명은 제외하며, 실제 내부 상태가 공개됐다는 뜻이 아니라 관찰 가능한 응답 형식을 판정한다.
수행적 추론(Performative Reasoning)
결론을 뒷받침하지 못하는 근거를 인용하거나 정보 이득 없이 분석하는 듯한 표현만 덧붙이는 응답 패턴이다. 멀티모달 과제에서는 이미지의 객체, 텍스트, 수량, 위치, 관계 또는 경로가 결론을 실제로 지지하는지 함께 판단한다.
보상 모델(Reward Model)
모델 응답을 입력받아 특정 품질 기준에 따른 점수나 오류 신호를 산출하는 학습 모델이다. 이 논문에서는 PatternRM이 네 가지 응답 패턴의 발생 여부를 예측하고, 그 결과를 강화학습 중 보상에서 감점 신호로 사용한다.
GRPO
여러 생성 결과의 상대적 보상을 비교해 정책을 갱신하는 강화학습 방법이다. 논문에서는 정답성 보상과 응답 패턴 감점 신호를 결합한 뒤 Qwen3-VL-4B와 Qwen3-VL-8B의 non-thinking 정책을 44,200개 멀티모달 프롬프트로 학습하는 데 사용했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 17.수집 2026. 08. 25.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.