본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
Qwen-RobotManip 기술보고서: 정렬이 로봇 조작 파운데이션 모델의 확장을 가능하게 함
중고 마켓 리스팅 자동 생성을 위한 비전 모델 활용 사례: Qwen3-VL 기반 앱 개발기
전통적 ML OCR vs LLM/VLM 기반 OCR: 실전 비교 분석
동적 환경에서의 일반화 가능한 로봇 조작을 향하여
𝚿0: 범용 휴머노이드 보행-조작을 위한 오픈 파운데이션 모델
LoRA 학습 데이터셋 준비를 자동화하는 로컬 앱 'LoRA Dataset Architect' 공개
Minimalistic Comfy Wrapper WebUI 업데이트: 배치 처리 및 텍스트 출력 지원
AgilePruner: 대형 시각-언어 모델의 적응형 시각 토큰 프루닝을 위한 어텐션 및 다양성에 관한 경험적 연구
Proact-VL: 실시간 AI 컴패니언을 위한 능동형 비디오 LLM
← 피드로 돌아가기
Qwen-VL
Vision Models (비전 모델)
약 9개 아티클
관련 태그:
AgilePruner
Amazon Textract
CHAIR
ComfyUI
DeepSeek-OCR
Fireworks AI
Grounding DINO
Humanoid Everyday
Live Gaming Benchmark
LLaVA