본문으로 건너뛰기

GLM 5.3이 바꾸는 모델 확장 공식

LLM 성능 경쟁이 매개변수 수에서 후처리 학습과 실행 환경 최적화로 이동하고 있습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 Latent Space AINews는 LLM 경쟁의 기준이 매개변수 수에서 데이터 품질, 추론 계산량, 후처리 학습과 실행 환경으로 이동하는 흐름을 묶었습니다. GLM-5.3은 장기 작업 환경과 합성 검증기를 활용한 강화학습으로 같은 기반 모델에서 성능을 높였고, Ornith-1.5와 Qwen3.8-27B Dynamic V3는 오픈 모델과 압축 실행의 선택지를 넓혔습니다. DeepSeek Harness와 TrueForge 사례는 도구·메모리·세션을 관리하는 harness가 비용과 성능을 좌우하는 계층으로 부상했음을 보여줍니다. 검색 인덱스와 상태 관리 같은 비LLM 구성요소도 실제 에이전트 지연과 비용의 큰 부분을 차지해 운영 최적화의 중요성이 커졌습니다.

섹션별 상세

01
모델 크기를 비교할 때 매개변수 수만 묻는 관행이 한계에 이르렀고, 데이터 규모와 계산을 투입할 위치, 실행 주체와 조건까지 함께 봐야 한다는 관점이 제기됐습니다. Chinchilla 계열의 고정된 데이터·매개변수 비율은 추론 비용이 중요해진 환경에서 모든 작업에 맞지 않으며, 원문은 작업에 따라 필요한 토큰 수가 매개변수당 200~900개까지 달라질 수 있다고 전합니다. 기억과 암기에는 더 많은 매개변수가 유리하지만, 추론에는 후처리 학습 데이터와 유효 깊이가 더 큰 영향을 줄 수 있다는 구분이 핵심입니다.
02
GLM-5.3의 성능 향상은 GLM-5.2와 같은 핵심 기반 모델과 아키텍처를 유지한 채 약 한 달간 추가한 강화학습에서 비롯됐다고 전해집니다. 학습 환경은 코드베이스, 내부 문서, 저장 시스템, 컴퓨트 클러스터와 실험 결과를 제공하고, 모델은 병목 진단부터 최적화 구현과 실험, 정확성 보존까지 이어지는 작업을 수행합니다. 연구 에이전트가 실제 업무 패턴을 실행 가능한 장기 환경으로 바꾸고, 판정 에이전트와 합성 검증기가 보상 신호를 점검하면서 사용자의 세부 지시 없이 업무를 끝까지 맡는 능력을 키우는 구조입니다.
03
새로운 오픈 모델과 압축 기법은 모델 규모보다 실제 실행 비용과 작업 성능을 함께 겨냥합니다. Ornith-1.5는 9B dense, 35B MoE, 397B MoE 변형을 MIT 라이선스로 공개했고, Terminal-Bench 2.1에서 86.1, SWE-Bench Verified에서 86, DeepSWE에서 56, HLE에서 44.6, Tool Decathlon에서 71.2를 기록했다고 보고됐습니다. Unsloth의 Qwen3.8-27B Dynamic V3 GGUF는 같은 크기에서 약 10% 높은 정확도를 내세우며 1-bit 형식으로 약 8GB RAM에서 실행되고, BF16 정확도의 약 77%를 유지한다고 전해집니다.
04
에이전트의 경쟁력은 모델 자체뿐 아니라 도구, 메모리, 세션, 승인 절차를 묶는 harness 계층으로 이동하고 있습니다. DeepSeek Harness는 Cordis 플러그인 구조 위에 에이전트 루프까지 플러그인으로 둔 얇은 런타임을 지향하며, 초기 베타에서 일주일 안에 100개 이상의 플러그인과 400건의 이슈가 나왔습니다. TrueForge는 도구 오케스트레이션, 컨텍스트 관리, 하위 에이전트, 코드 샌드박스, 사람 승인과 추적 기능을 제공하고, 14개 기업 과제 벤치마크에서 Claude Managed Agents와 맞먹는 정확도를 약 30% 적은 토큰으로 냈으며 GLM-5.2 라우팅으로 비용을 약 75% 낮췄다고 보고됐습니다.
05
후처리 학습을 실제 시스템에 연결하는 인프라도 발전하고 있습니다. Microsoft의 Agent Lightning은 endpoint proxy를 통해 임의의 harness를 강화학습과 연결하고, 재토큰화와 샘플 병합, advantage 계산, 정규화, 스케줄러와 백엔드 조정을 처리합니다. 약 6,000개의 학습 예제와 제한적인 컴퓨트로 Qwen3.5-9B의 SWE-Bench Verified 점수를 41.8%에서 56.4%로 높였다는 수치가 제시됐으며, TRL의 on-policy distillation은 generation buffer와 배치 teacher 호출로 40배 빨라졌다고 전해집니다.
06
운영 환경에서는 검색 인덱스와 비언어모델 구성요소가 전체 지연과 비용을 크게 좌우합니다. Qdrant의 filterable HNSW는 필터 조건을 질의 시점에만 적용하지 않고 같은 payload 값을 가진 벡터 사이에 연결을 추가해 필터링된 하위 그래프의 연결성을 유지하며, 100만 벡터에서 1% 필터 기준 1.0ms에 99.8% recall을 기록해 ACORN의 4.7ms·67.7%와 비교됐습니다. 열 개 에이전트 앱을 측정한 결과에서는 비LLM 구성요소가 절반의 앱에서 지연을 주도했고, 작업 인식 서빙은 지연을 29~40%, 상태 오프로딩은 메모리를 4.6배, 도구 결과 캐시는 중복 검색 호출을 35.2% 줄였다고 보고됐습니다.

용어 해설

후처리 학습 스케일링 법칙(Post-training Scaling Law)
모델 성능이 사전 학습의 매개변수 수만으로 결정되지 않고, 후처리 학습 데이터와 추론 시 계산량, 작업 환경의 복잡도에 따라 달라진다는 관점입니다. 장기 추론과 전문 작업의 성능을 키우는 데 중요합니다.
Mixture of Experts
하나의 거대한 모델 안에 여러 전문가 네트워크를 두고, 입력마다 일부 전문가만 활성화하는 구조입니다. 전체 매개변수 수를 늘리면서도 실제 계산량을 줄일 수 있어 모델 확장과 추론 비용 사이의 균형에 쓰입니다.
장기 작업 환경(Long-horizon Environment)
여러 단계와 숨은 상태를 포함해 모델이 긴 시간 동안 문제를 해결하도록 구성한 실행 환경입니다. 코드베이스, 컴퓨트 클러스터, 문서와 실험 결과를 연결해 실제 엔지니어링 업무에 가까운 강화학습 신호를 만듭니다.
사후 학습 양자화(Post-training Quantization)
학습이 끝난 모델의 가중치나 관련 값을 더 적은 비트로 변환해 메모리 사용량과 실행 비용을 낮추는 방법입니다. Qwen3.8-27B Dynamic V3는 1-bit 형식에서도 BF16 정확도의 약 77%를 유지한다고 보고됐습니다.
Late-interaction Retrieval
문서 전체를 하나의 벡터로 압축하지 않고 토큰별 벡터를 유지한 뒤, 질의 토큰과 문서 토큰의 대응 점수를 계산해 검색 순위를 정하는 방식입니다. 단일 벡터 검색보다 세밀한 일치 정보를 보존할 수 있습니다.

기술

  • GLM-5.3
  • GLM-5.2
  • Ornith-1.5
  • Qwen3.8-27B
  • Dynamic V3
  • GGUF
  • vLLM
  • Ollama
  • DeepSeek Harness
  • Cordis
  • TrueForge
  • Claude Managed Agents
  • Agent Lightning
  • TRL
  • Qdrant
  • HNSW
  • ACORN
  • Sentence Transformers v6.0
  • Gemini 3.7 Flash
  • GPT-5.6 Luna
  • Private Safety Processing

활용 사례

  • 장기 소프트웨어 엔지니어링 작업
  • ML 인프라 병목 진단과 최적화
  • 코딩 에이전트의 도구·메모리·승인 관리
  • 소비자 GPU에서 대형 오픈 모델 실행
  • 필터 조건을 포함한 벡터 검색
  • 스프레드시트와 문서 기반 정량 분석
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 20.수집 2026. 08. 20.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.