본문으로 건너뛰기

Interhuman AI, 행동 과학 기반의 비언어적 신호 분석 모델 Inter-1 공개

Interhuman AI가 텍스트 요약을 넘어 시선, 자세, 음성 운율 등 100개 이상의 비언어적 신호를 분석하는 행동 분석 특화 모델 Inter-1을 출시했다.

실용적 조언

  • 인터뷰나 교육 영상 분석 시 텍스트 요약뿐만 아니라 화자의 시선과 음성 톤 변화를 함께 모니터링하여 신뢰도를 평가할 것
  • AI의 분석 결과를 맹신하기보다 모델이 제공하는 판단 근거(Rationale)를 실제 영상과 대조하여 최종 결정을 내릴 것

섹션별 상세

01
기존 GPT나 Gemini 같은 멀티모달 모델은 비디오 분석 시 주로 화자의 발화 내용을 요약하는 데 그친다는 한계가 있다. Inter-1은 비디오와 오디오를 시간적으로 정렬하여 처리함으로써 답변 직전의 시선 회피나 문장 중간의 2초간 멈춤 같은 미세한 행동 패턴을 포착한다. 이러한 방식은 인터뷰나 영업 통화처럼 '무엇'을 말하는지보다 '어떻게' 말하는지가 중요한 상황에서 실질적인 통찰을 제공한다.
02
모델은 단순한 감정 분류 대신 행동 과학 연구에 기반한 12가지 사회적 신호 체계를 사용한다. 얼굴 표정, 시선, 자세, 음성 운율, 발화 리듬 등 100개 이상의 구체적인 행동 단서를 분석하여 확률 점수와 함께 판단 근거를 출력한다. 예를 들어 단순히 '불안함'이라고 출력하는 대신 '언어적 헤지 사용과 시선 회피가 관찰됨'과 같은 구체적인 이유를 제시하여 사용자가 모델의 추론 과정을 검증할 수 있게 했다.
03
Inter-1은 15개 이상의 모델과 비교 벤치마크를 수행한 결과, 특히 회의론이나 스트레스 같은 복잡한 신호 탐지에서 우수한 성능을 보였다. 난이도가 높은 신호 탐지 영역에서 기존 최첨단 폐쇄형 모델들보다 평균 10%p 이상의 정확도 우위를 기록했다. 행동 과학 전문가들을 대상으로 진행한 블라인드 테스트에서도 Inter-1의 분석 결과가 기존 모델보다 83%의 선호도를 얻으며 실효성을 입증했다.
04
기존 감성 컴퓨팅 데이터셋의 한계를 극복하기 위해 행동 과학자와 숙련된 작업자들이 협업하여 대규모 전용 데이터셋을 직접 구축했다. 실제 상황의 비디오 데이터와 합성 데이터를 결합하고 모든 샘플에 대해 전문가와 일반 작업자의 병렬 주석 작업을 거쳐 데이터의 신뢰도를 높였다. 현재는 1인 분석에 최적화되어 있으며 향후 다수 인원 간의 상호작용 분석 및 실시간 스트리밍 추론 기능을 추가할 계획이다.

용어 해설

음성 운율(Vocal Prosody)
말소리의 고저, 강단, 속도, 리듬 등 언어적 의미 외에 감정이나 태도를 전달하는 음성적 특징이다. Inter-1 모델은 이를 분석하여 화자의 확신이나 스트레스 상태를 파악하는 핵심 지표로 활용한다.
비언어적 신호(Nonverbal Cues)
시선 처리, 자세 변화, 얼굴 표정 등 언어를 통하지 않고 전달되는 의사소통 신호이다. 기존 LLM이 놓치기 쉬운 화자의 심리적 변화나 사회적 신호를 포착하는 데 필수적인 데이터이다.
감성 컴퓨팅(Affective Computing)
인간의 감정을 인식, 해석, 처리할 수 있는 시스템을 연구하는 분야이다. Inter-1은 단순 감정 분류를 넘어 행동 과학에 기반한 12가지 사회적 신호를 분석하여 이 분야의 기술적 한계를 확장했다.
시간적 정렬(Temporal Alignment)
비디오의 시각적 프레임과 오디오 신호를 동일한 시간축에서 일치시켜 분석하는 기법이다. 특정 단어를 말할 때의 미세한 시선 회피나 멈춤을 정확히 연결하여 행동 패턴을 이해하는 데 중요하다.

언급된 도구

Inter-1추천

비언어적 행동 및 사회적 신호 분석용 멀티모달 모델

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 16.수집 2026. 04. 17.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.