요약은 생성됐지만 현재 화면 버전과 데이터 형식이 맞지 않아 렌더링할 수 없습니다.
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
요약은 생성됐지만 현재 화면 버전과 데이터 형식이 맞지 않아 렌더링할 수 없습니다.
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
아직 관련 토론이 없습니다.
댓글을 작성하려면 로그인이 필요합니다.
클라우드 기반 AI 서비스 대신 개인 컴퓨터에서 LLM을 직접 구동하여 데이터 프라이버시를 확보하고 오프라인 환경에서 AI를 활용하는 방법을 다룬다.
이번 포스트는 Wan3.0의 일반 공개와 여러 서비스로의 확산을 중심으로, Kimi-K3의 2.8T 파라미터·100만 토큰 문맥, 언어별 LLM reasoning 격차, 대규모 MoE 학습과 harness 평가 비용을 줄이는 방법을 함께 다뤘다. Wan3.0은 텍스트·이미지·오디오·비디오·웹페이지·문서를 입력으로 받아 최대 30초 영상을 한 번에 생성하고, Qwen Cloud에서는 480p 초당 0.05달러부터 가격이 책정됐다. 연구 포스트에서는 영어 reasoning 전환에 따른 성능 회복, 작은 proxy model을 이용한 learning rate 전이, 불일치가 큰 task 중심의 검증 샘플링이 핵심으로 나타났다. OpenMHC는 wearable data와 clinical data를 잇는 공개 연구 기반으로, Grok은 ESP32-S에서 DOOM 전체를 높은 frame rate로 실행한 사례로 언급됐다.
이번 기간에는 770B MoE인 Hy4-preview가 1M context와 vLLM·NVIDIA Blackwell 실행 경로를 함께 내놓으며 오픈 모델의 실제 배포 조건을 넓혔습니다. Wan3.0은 30초 영상과 동기화 오디오, 참조 입력, 장면 확장·재스타일링을 묶어 여러 제작 서비스로 확산했습니다. Qwen3.8-Flash는 OpenCode Go와 GMI Cloud에 들어가 125B 전체·6B 활성 구성과 멀티모달·긴 context를 내세웠습니다. 연구 쪽에서는 Co-Scientist의 자율 실험, RTX 5090 기반 Puro-2B 학습, LeVJEPA의 사전학습 비용 절감, Uber의 agent harness 운영 수치가 함께 부각됐습니다.
VRAM과 컨텍스트, 작업 유형을 맞춰 로컬 LLM의 실행 가능 모델과 속도를 계산하는 방법을 정리합니다.