관련 기사 바로가기
UrbanGround: 복잡한 도시 환경에서 MLLM 에이전트의 공간 추론과 내비게이션을 평가하는 샌드박스.AutoGaze: 비디오 이해 모델을 위한 시공간적 중복성 제거 및 가속화Remember‑R1으로 시각적 어텐션 지속화KeyFrame-Compass: 키프레임 조건화 비디오 생성의 포괄적 벤치마크와 자동화 평가 프레임워크시각화가 추론의 첫 단계일 때: 시각적 사고의 사슬(Visual CoT)을 위한 벤치마크 MIRAJoyAI-Image: 지시어 기반 이미지 편집을 위한 24B 규모 멀티모달 모델 공개실시간 음성에서 감정, 의도 및 생체 정보를 추출하는 하이브리드 접근 방식FORGE: 제조 시나리오를 위한 세밀한 멀티모달 평가 벤치마크Agentic-MME: 멀티모달 지능에서 에이전트 능력이 실제로 가져오는 변화는 무엇인가?HippoCamp: 개인용 컴퓨터에서의 컨텍스트 기반 에이전트 벤치마킹ECG-Reasoning-Benchmark: 심전도 해석의 임상적 추론 능력 평가를 위한 벤치마크MM-CondChain: 시각적 근거 기반 심층 조합 추론을 위한 프로그래밍 검증 벤치마크
← 피드로 돌아가기
MLLM
약 12개 아티클
관심 태그 추가
관련 태그:Gemini-3-ProASRAutoGazeCoTECG-Reasoning-BenchmarkFORGEGPT‑4oHippoCampJoyAI-ImageKeyFrame-Compass
TIMEHEADLINE