관련 기사 바로가기
Qwen 3.5 0.8B 모델의 IQ2_XXS 양자화 버전 테스트 및 오작동 사례iGPU vs NPU: 긴 컨텍스트 환경에서의 llama.cpp와 lemonade 성능 비교Continue 및 PyCharm용 최적의 로컬 AI 모델 추천 및 YAML 설정 공유MoE 모델 추론 속도를 2.3배 향상시킨 추론 엔진 개발 및 피드백 요청하드웨어에 맞춰 llama.cpp를 자동 설정하는 OpenJet 개발anemll-flash-mlx: Apple Silicon에서 MLX를 활용한 Flash-MoE 실험 가속화 툴킷프런티어 모델만큼 빠르게 느껴지는 로컬 AI: 텍스트 풀 듀플렉스(Full Duplex) 상호작용ZINC — Zig로 작성된 LLM 추론 엔진, 550달러 AMD GPU에서 35B 모델 실행하드웨어에 모델을 직접 각인하여 초당 15,000 토큰을 생성하는 Taalas 기술긴 컨텍스트 LLM을 위한 분할 정복 기법의 효과 분석로컬 LLM 구동을 위한 CPU의 재발견: Zen 4와 DDR5의 놀라운 성능11세 소년이 1달러로 직접 학습시킨 커스텀 MoE LLM 'Wind Arc 1.6' 공개Claude 모델의 성능 비결: 아키텍처인가, 데이터와 학습 방법론인가?대형 언어 모델의 시간 추론을 제어하는 핵심 요소: 토큰화인가, 시간의 표현인가?MHPO: 안정적인 강화학습을 위한 변조된 위험 인식 정책 최적화임베딩 공간 프로빙을 통한 효율적인 학습 불필요 멀티 토큰 예측합성 태스크 스케일링을 통한 AI 과학자 구현VideoAtlas: 로그 단위 연산량으로 장편 비디오를 탐색하는 기법행동 전 관찰: 시각-언어-행동 모델을 위한 시각 파운데이션 표현 강화Apple의 LLM in a Flash 기법을 활용한 Qwen 397B 모델의 로컬 실행 연구