왜 중요한가
비디오 이해 모델이 최종 답변을 내놓기 전 수행하는 내부 추론 과정인 '사고 스트림(Thought Streams)'의 실질적 효용성을 분석했습니다. 모델이 더 많이 생각할수록 성능이 무한히 좋아지는 것이 아니라 특정 지점에서 정체된다는 사실과, 사고 예산이 부족할 때 발생하는 '압축 단계 환각' 현상을 규명하여 효율적인 모델 배포 전략을 제시합니다.
핵심 기여
사고 스트림 평가 프레임워크 구축
사고 스트림의 유용성을 측정하는 Contentfulness, 최종 출력과의 일치도를 보는 Thought–Final Coverage, 모델의 주목 대상을 분석하는 Dominant Entity Analysis 등 세 가지 핵심 지표를 제안했다.
사고 토큰량에 따른 성능 임계점 발견
Gemini 2.5 모델군에서 사고 토큰이 증가함에 따라 품질이 향상되지만, 약 700토큰 지점부터는 이득이 급격히 줄어드는 Diminishing Returns 현상을 확인했다.
압축 단계 환각 현상 정의
추론 예산이 극도로 제한될 때(예: 128토큰), 모델이 사고 스트림에는 없던 내용을 최종 출력에 임의로 추가하는 'Compression-step Hallucination'이 발생함을 입증했다.
Flash와 Flash Lite의 추론 유사성 입증
서로 다른 체급의 모델임에도 불구하고 사고 스트림의 내용적 유사도가 0.88~0.90에 달하며, Lite 모델이 추론 과정 설명보다 장면 묘사에 집중해 더 높은 토큰 효율성을 보임을 밝혔다.
핵심 아이디어 이해하기
기존의 비전-언어 모델(VLM)은 비디오를 입력받아 즉시 결과를 출력하는 블랙박스 형태로 평가되어 왔다. 하지만 최근 Gemini 2.5와 같은 모델은 최종 답변 전 내부적인 Chain-of-Thought(사고 스트림)를 생성할 수 있게 되었다. 이 논문은 이 사고 스트림이 단순히 겉치레인지, 아니면 실제 최종 출력의 품질을 결정하는 핵심 요소인지를 딥러닝의 추론 예산(Inference Budget) 개념과 연결하여 분석한다.
모델이 비디오의 각 프레임을 Embedding으로 변환하고 Attention Mechanism을 통해 시공간적 관계를 파악할 때, 사고 스트림은 이 복잡한 정보를 텍스트 형태로 구조화하는 중간 저장소 역할을 한다. 연구진은 이 과정에서 '생각의 양'이 늘어날수록 모델이 더 구체적인 개체(Entity)를 식별하고 모호한 표현을 줄인다는 점에 주목했다.
결과적으로 사고 스트림은 모델이 비디오 내의 수많은 시각적 신호 중 무엇에 우선순위를 두는지 보여주는 관측 가능한 흔적(Trace)이다. 이를 통해 모델이 단순히 통계적 확률로 단어를 생성하는 것이 아니라, 내부적인 논리 전개 과정을 거쳐 최종 JSON 데이터를 구성한다는 메커니즘을 확인했다.
관련 Figure

사고 토큰이 약 700개에 도달할 때까지 F1 스코어가 급격히 상승하다가 이후 평탄해지는(Plateau) 지점을 명확히 보여준다. 또한 예산이 적을 때 Thought Coverage와 Output Grounding 사이의 간극이 커지며 환각이 발생함을 시각화했다.
사고 예산 증가에 따른 Contentfulness 및 F1 스코어의 변화 그래프
방법론
VideoDB를 사용하여 100시간 분량의 비디오를 시각적/의미적 경계에 따라 장면(Scene) 단위로 분할했다. 각 장면에서 초당 1프레임(1 FPS)으로 최대 10개의 프레임을 추출하여 Gemini 2.5 Flash 및 Flash Lite 모델에 입력값으로 제공했다.
모델의 사고 예산(Thinking Budget)을 128, 512, 1024, Unlimited(Dynamic)로 설정하여 독립적인 실험을 수행했다. 입력 프레임 수에 따른 Input Token은 일정하게 유지하되, 모델이 최종 JSON 출력을 내놓기 전 생성할 수 있는 Thought Token의 양만 변수로 조절하여 성능 변화를 관측했다.
평가 지표 중 Contentfulness는 사고 스트림에서 '분석을 시작하겠다'와 같은 메타 발언을 정규표현식으로 제거한 뒤, NLTK를 이용해 명사구와 동사구의 비중을 계산한다. [전체 단어 수 → 메타 발언 필터링 → POS 태깅 → 내용어 수 / 전체 단어 수] 과정을 거쳐 0에서 1 사이의 점수를 산출하며, 이는 사고의 밀도를 의미한다.
Thought–Final Coverage는 GPT-5를 판정관으로 활용하여 사고 스트림과 최종 출력 간의 사실 일치도를 측정한다. 사고 스트림의 개별 사실 항목들을 추출하고 이를 최종 JSON의 값들과 Fuzzy Matching(정확도 75% 기준)을 통해 비교하여, 모델이 생각한 내용이 얼마나 충실하게 결과에 반영되었는지(Thought Coverage)와 결과에 포함된 내용이 사고 과정에 근거하는지(Output Grounding)를 계산한다.
주요 결과
실험 결과, Flash Lite 1024 모델이 F1 스코어 0.959를 기록하며 가장 우수한 성능을 보였다. 이는 무제한 예산을 사용한 Flash Dynamic(F1 0.957)보다 근소하게 높으면서도 전체 토큰 사용량은 약 30% 적어 최적의 효율성을 입증했다.
사고 예산이 128토큰으로 제한된 Flash 128의 경우, Output Grounding 점수가 0.767로 급격히 떨어졌다. 이는 최종 출력 항목 4개 중 1개는 사고 과정에서 언급되지 않은 '환각'임을 의미하며, 충분한 추론 시간이 주어지지 않을 때 모델이 논리적 근거 없이 결론을 도출하는 경향이 있음을 보여준다.
Dominant Entity Analysis에서는 예산이 늘어날수록 모델이 '사람(person)'과 같은 일반적인 명칭 대신 '요리사(chef)', '스트리머(streamer)'와 같은 구체적인 명칭을 사용하는 비율이 증가했다. Flash 128은 약 15%의 장면에서 일반 명칭을 사용했으나, Flash Dynamic에서는 이 수치가 8%로 감소하여 사고의 깊이가 구체성으로 직결됨이 확인됐다.
관련 Figure

입력 토큰(이미지+텍스트)은 일정하지만 사고 토큰(Thought Tokens)이 전체 비용의 핵심 변수임을 보여준다. Flash Lite 모델이 Flash 모델보다 적은 사고 토큰을 사용하면서도 효율적인 성능을 낼 수 있는 구조적 근거를 제시한다.
Gemini 2.5 모델 변체별 평균 토큰 사용량 분포 차트
기술 상세
본 연구는 Gemini 2.5의 내부 추론 과정을 '관측 가능한 흔적'으로 취급하여 분석했다. Flash 모델은 사고 과정에서 자신의 추론 단계를 서술하는 스타일을 보인 반면, Lite 모델은 장면의 시각적 요소를 직접 묘사하는 데 집중하는 경향을 보였다. 이러한 스타일 차이로 인해 Lite 모델은 더 적은 토큰으로도 높은 Contentfulness를 달성할 수 있었다.
수학적으로 F1 스코어는 Thought Coverage(TC)와 Output Grounding(OG)의 조화 평균으로 계산된다. [2 * TC * OG / (TC + OG)] 연산을 통해 두 지표 간의 균형을 평가하며, 이는 모델의 내부 일관성을 나타내는 핵심 척도가 된다.
실험에 사용된 데이터셋은 37개의 시각적 스타일과 38개의 도메인을 포함하는 100시간 분량의 비디오로 구성되었으며, 93,000개 이상의 장면 레벨 결과를 생성하여 통계적 유의성을 확보했다. 특히 동일 비디오에 대해 반복 실행 시 사고 스트림의 유사도가 0.893으로 나타나, 모델의 추론 패턴이 비교적 결정론적(Deterministic)임을 확인했다.
관련 Figure

두 모델군 모두 예산이 증가함에 따라 모든 지표가 개선되지만, Flash Lite 1024가 Flash Dynamic과 대등하거나 오히려 앞서는 성능을 보임을 입증한다. 이는 모델의 체급보다 적절한 추론 예산 설정이 중요함을 시사한다.
Gemini 2.5 Flash와 Flash Lite의 주요 성능 지표 비교 바 차트
한계점
본 연구의 지표는 사고 과정과 출력 간의 '일관성'을 측정할 뿐, 실제 정답(Ground Truth)과의 '정확성'을 직접 평가하지는 않는다. 또한 1 FPS의 장면 단위 분석에 국한되어 있어, 장기적인 시간적 추론이나 복잡한 서사 구조 이해에 대한 평가는 포함되지 않았다.
실무 활용
비디오 메타데이터 추출 시스템 구축 시, 고비용의 대형 모델 대신 적절한 사고 예산을 설정한 경량 모델(Flash Lite)만으로도 충분한 품질을 확보할 수 있음을 시사한다.
- 대규모 비디오 아카이브의 자동 태깅 및 구조화된 메타데이터 추출
- 실시간 영상 분석 시스템에서 추론 비용과 정확도 간의 최적 균형점 설정
- VLM의 추론 과정을 모니터링하여 최종 결과의 신뢰성을 검증하는 가드레일 구축
코드 공개 여부: 공개
코드 저장소 보기키워드
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
