X (Twitter)
Qwen3.8-27B 경량 실행, GPU 메모리 병목, 에이전트 지침 누적, AGI 아키텍처 전환
이번 포스트에서는 Qwen3.8-27B의 빠른 다운로드 증가와 17GB RAM에서의 4-bit GGUF 실행 사례가 함께 확산됐습니다. GPU 성능 논의에서는 HBM에서 가중치를 가져오는 데이터 이동과 산술 연산의 비율이 단일 Token 생성 속도를 결정하며, 32개 요청을 묶는 Batching이나 긴 Prompt가 가중치 재사용을 늘려 병목을 연산 쪽으로 옮기는 구조가 제시됐습니다. 에이전트 개발에서는 CLAUDE.md 같은 지침 파일이 Commit마다 커지고 삭제되지 않는 문제가 247,000개 이상의 지침과 1,867개 Repository를 대상으로 측정됐으며, 규칙 옆에 존재 이유를 적는 방식이 과잉 증가와 지침 준수를 개선했습니다. AGI 논쟁에서는 단순한 Next-token Prediction과 Transformer Scaling만으로는 지속적 Memory, World Model, 장기 Goal, Multi-agent 협력이 부족하다는 관점이 부상했습니다.