용어 해설
- 하이브리드 사고(Hybrid-Thinking)
- — 하나의 MLLM이 추가 추론을 수행하는 thinking 모드와 짧은 직접 응답을 생성하는 non-thinking 모드를 모두 제공하는 추론 방식이다. 두 모드는 계산량과 지연시간이 다르지만 최종 응답의 정확성뿐 아니라 일관성과 가독성도 같은 기준을 충족해야 한다.
- 응답 패턴 정렬(Response-Pattern Alignment)
- — 추론 모드가 thinking에서 non-thinking으로 바뀌어도 사용자에게 전달되는 최종 응답의 형식과 의미가 허용 범위 안에 유지되는지를 평가하는 개념이다. 정확한 답을 내더라도 사고 과정 노출, 반복, 모순이 발생하면 정렬이 깨진 것으로 본다.
- 사고 과정 노출(Chain-of-Thought Leakage)
- — 내부 추론의 흔적, 초안, 자기 수정, 명시적인 thinking 표지가 사용자에게 보이는 최종 답변에 포함되는 오류다. 간결하고 다듬어진 근거 설명은 제외하며, 실제 내부 상태가 공개됐다는 뜻이 아니라 관찰 가능한 응답 형식을 판정한다.
- 수행적 추론(Performative Reasoning)
- — 결론을 뒷받침하지 못하는 근거를 인용하거나 정보 이득 없이 분석하는 듯한 표현만 덧붙이는 응답 패턴이다. 멀티모달 과제에서는 이미지의 객체, 텍스트, 수량, 위치, 관계 또는 경로가 결론을 실제로 지지하는지 함께 판단한다.
- 보상 모델(Reward Model)
- — 모델 응답을 입력받아 특정 품질 기준에 따른 점수나 오류 신호를 산출하는 학습 모델이다. 이 논문에서는 PatternRM이 네 가지 응답 패턴의 발생 여부를 예측하고, 그 결과를 강화학습 중 보상에서 감점 신호로 사용한다.
- GRPO
- — 여러 생성 결과의 상대적 보상을 비교해 정책을 갱신하는 강화학습 방법이다. 논문에서는 정답성 보상과 응답 패턴 감점 신호를 결합한 뒤 Qwen3-VL-4B와 Qwen3-VL-8B의 non-thinking 정책을 44,200개 멀티모달 프롬프트로 학습하는 데 사용했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

