본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
CV 인턴십 준비를 위한 단계별 체크리스트와 전문 트랙 모음
Physical AI 시스템 설계: 로봇 AI의 미래와 시스템적 접근
사후 기여도 분석의 안정성 측정: Feature Attribution Stability Suite 논문 공개
AI GAMESTORE: 인간용 게임을 활용한 기계 일반 지능의 확장 가능한 개방형 평가
크로스 디픽션 조립 지침 정렬을 위한 시각-언어 모델의 벤치마킹 및 메커니즘 분석
HunyuanOCR: 10억 파라미터 규모의 고성능 엔드투엔드 OCR VLM 공개
Civilization VI를 위한 제어 가능한 컴퓨터 사용 VLM 하네스 'civStation' 공개
CMU 연구진, 텍스트로 물리 법칙을 따르는 시뮬레이션용 3D 장면 생성 프레임워크 'PAT3D' 개발
Gemini 3 Pro를 활용하여 레거시 문서에서 구조화된 Markdown 추출하기
MIT 연구진, 생성형 AI와 고전적 알고리즘을 결합한 로봇 계획 수립 시스템 개발
모든 이미지에서 구조화된 JSON 데이터 추출하기
Kognic vs Labelbox: 자율주행을 위한 최적의 데이터 어노테이션 플랫폼 선택 가이드
비전-언어 모델(VLM)을 활용한 물리적 AI 시스템의 데이터 어노테이션 확장 사례
데이터에서 속도로: Capsight를 통한 Caper의 에지 및 클라우드 데이터 플라이휠 구축
초 단위로 뇌 MRI를 판독하고 응급 상황을 알리는 AI 시스템 개발
MIT 건축학과 학생들이 개발한 AI 주방 보조 기기 'Kitchen Cosmo'
생각하고, 행동하고, 구축하라: 제로샷 3D 비주얼 그라운딩을 위한 비전 언어 모델 기반 에이전트 프레임워크
스트리밍 비디오 이해를 위한 단순한 베이스라인: SimpleStream
ESPIRE: 시각-언어 모델의 체화된 공간 추론을 위한 진단 벤치마크
Vision AI를 활용한 창고 랙 점유율 실시간 모니터링 및 용량 계획
← 피드로 돌아가기
VLM
Vision Models (비전 모델)
약 42개 아티클
관련 태그:
Roboflow
MIT
civStation
Kognic
ViT
GPT-5.2
Best Practice
Claude Opus 4.5
Gemini 2.5 Pro
YOLO