본문으로 건너뛰기

관련 기사 바로가기

비디오 VLM 평가에서 파이프라인 설정이 모델 교체보다 성능을 더 크게 좌우한 결과CV 인턴십 준비를 위한 단계별 체크리스트와 전문 트랙 모음Physical AI 시스템 설계: 로봇 AI의 미래와 시스템적 접근사후 기여도 분석의 안정성 측정: Feature Attribution Stability Suite 논문 공개AI GAMESTORE: 인간용 게임을 활용한 기계 일반 지능의 확장 가능한 개방형 평가크로스 디픽션 조립 지침 정렬을 위한 시각-언어 모델의 벤치마킹 및 메커니즘 분석Civilization VI를 위한 제어 가능한 컴퓨터 사용 VLM 하네스 'civStation' 공개CMU 연구진, 텍스트로 물리 법칙을 따르는 시뮬레이션용 3D 장면 생성 프레임워크 'PAT3D' 개발Gemini 3 Pro를 활용하여 레거시 문서에서 구조화된 Markdown 추출하기MIT 연구진, 생성형 AI와 고전적 알고리즘을 결합한 로봇 계획 수립 시스템 개발모든 이미지에서 구조화된 JSON 데이터 추출하기Kognic vs Labelbox: 자율주행을 위한 최적의 데이터 어노테이션 플랫폼 선택 가이드비전-언어 모델(VLM)을 활용한 물리적 AI 시스템의 데이터 어노테이션 확장 사례데이터에서 속도로: Capsight를 통한 Caper의 에지 및 클라우드 데이터 플라이휠 구축초 단위로 뇌 MRI를 판독하고 응급 상황을 알리는 AI 시스템 개발MIT 건축학과 학생들이 개발한 AI 주방 보조 기기 'Kitchen Cosmo'생각하고, 행동하고, 구축하라: 제로샷 3D 비주얼 그라운딩을 위한 비전 언어 모델 기반 에이전트 프레임워크스트리밍 비디오 이해를 위한 단순한 베이스라인: SimpleStreamHunyuanOCR: 10억 파라미터 규모의 고성능 엔드투엔드 OCR VLM 공개ESPIRE: 시각-언어 모델의 체화된 공간 추론을 위한 진단 벤치마크
← 피드로 돌아가기

VLM

Vision Models (비전 모델)

39개 아티클

관심 태그 추가
TIMEHEADLINE