챕터별 상세
GLM-4.7 모델 소개 및 성능
GLM-4.7은 Zhipu AI에서 출시한 오픈 웨이트 하이브리드 추론 모델이다. GLM-4.5 아키텍처를 기반으로 가중치를 업그레이드하여 코딩, 에이전트 도구 사용, 다회차 추론 능력이 대폭 향상되었다. Cerebras 하드웨어에서 구동 시 초당 평균 1,000개, 최대 1,700개의 토큰을 생성하며 이는 기존 상용 모델 대비 약 20배 빠른 속도이다.
GLM-4.7은 Mixture-of-Experts(MoE) 구조를 사용하여 효율적인 연산을 수행한다.
Predicted Outputs 기술의 원리와 활용
Predicted Outputs는 출력 내용의 일부를 미리 알고 있을 때 생성 속도를 높이는 추론 최적화 기법이다. 모델이 처음부터 모든 토큰을 생성하는 대신, 사용자가 제공한 예측값과 실제 모델의 출력을 비교하여 일치하는 부분은 즉시 통과시킨다. 코드 리팩터링이나 문서 수정처럼 기존 텍스트의 상당 부분이 유지되는 작업에서 생성 시간을 최대 2배까지 단축한다.
이 기술은 Speculative Decoding과 유사한 원리를 사용하지만 사용자가 직접 예측 데이터를 제공한다는 점이 다르다.
python
import os
from cerebras.cloud.sdk import Cerebras
client = Cerebras(api_key=os.environ.get("CEREBRAS_API_KEY"))
# 기존 코드 블록 (예측값으로 사용)
code_block = """
def add(a, b):
return a + b
"""
response = client.chat.completions.create(
model="zal-glm-4.7",
messages=[
{"role": "user", "content": "Add type hints to this code."},
{"role": "user", "content": code_block}
],
# Predicted Outputs 설정
prediction={"type": "content", "content": code_block}
)
print(response.choices[0].message.content)Cerebras SDK를 사용하여 Predicted Outputs 기능을 적용하고 코드 리팩터링 속도를 높이는 예시
Cerebras WSE-3 하드웨어 가속
Cerebras의 Wafer-Scale Engine-3(WSE-3)는 단일 칩 기반의 거대 프로세서이다. NVIDIA GPU와 달리 모델 전체를 칩 내부에 배치할 수 있어 데이터 전송 병목 현상을 제거했다. 이를 통해 대규모 언어 모델 추론 시 GPU 클러스터 대비 15배 이상의 압도적인 처리 성능을 구현했다.
웨이퍼 스케일 설계는 메모리와 연산 유닛 간의 거리를 최소화하여 지연 시간을 획기적으로 줄인다.
용어 해설
- 초당 토큰 수(TPS)
- — 언어 모델이 1초 동안 생성할 수 있는 토큰의 양을 나타내는 지표이다. TPS가 높을수록 텍스트 생성 속도가 빨라지며, 실시간 대화형 서비스나 복잡한 에이전트 작업의 반응성을 결정하는 핵심 수치이다.
- 오픈 웨이트(Open-weight)
- — 모델의 학습된 가중치(Weights)를 공개하여 누구나 자신의 인프라에 내려받아 실행할 수 있는 형태이다. 소스 코드까지 완전히 공개된 오픈 소스와는 차이가 있지만, 상용 API에 의존하지 않고 독립적인 배포가 가능하다는 장점이 있다.
- 웨이퍼 스케일 엔진(Wafer-Scale Engine)
- — 단일 실리콘 웨이퍼 전체를 하나의 거대한 칩으로 만드는 Cerebras의 독자적인 프로세서 설계 방식이다. 수천 개의 작은 칩으로 나누는 대신 하나의 거대 칩을 사용하여 데이터 전송 병목을 제거하고 연산 효율을 극대화한다.
- 에이전트적 행동(Agentic Behavior)
- — LLM이 단순한 텍스트 생성을 넘어 외부 도구를 사용하거나 스스로 계획을 세워 복잡한 목표를 달성하는 특성이다. 모델의 추론 능력과 도구 호출(Tool-use)의 정확도가 높을수록 에이전트로서의 성능이 우수하다고 평가한다.
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 01. 21.수집 2026. 02. 21.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
