TL;DR
LLM 0.32은 모델의 내부 추론 흔적을 표준 오류로 노출하고, 여러 공급자의 서버사이드 도구 호출과 OpenAI Responses 호환성을 추가했으며, 메시지 중복 로그를 줄이기 위해 내용 주소형 메시지 저장소를 도입했습니다. 파이썬 API는 model.prompt(messages=[])와 스트리밍 이벤트를 통해 reasoning·text·tool call 같은 혼합 출력에 대응하도록 바뀌었고, 이로 인해 플러그인은 새로운 이벤트 스트림 모델에 맞춰 업데이트가 필요합니다. 결과적으로 개발자는 모델의 사고 과정을 더 쉽게 확인하고 서버사이드 도구를 단일 요청 흐름 안에서 안전하게 활용할 수 있게 됩니다.
섹션별 상세

- LLM이 추론 흔적(reasoning traces)을 표준 오류(stderr)에 출력해 내부 사고 과정을 확인할 수 있게 되었다. — 본문의 'Running LLM against reasoning models now displays their reasoning traces to standard error' 문장과 '-R/--hide-reasoning' 옵션 언급.
uvx --with llm-tools-quickjs \
llm openai endpoint http://localhost:1234/v1 -m google/gemma-4-12b \
-T QuickJS 'Use QuickJS to multiply 3434 * 2434' --td이 셸 커맨드는 로컬 LM 스튜디오(API) 엔드포인트에 대해 llm openai endpoint를 사용해 단행성(prompt) 요청을 실행하면서 QuickJS 도구 플러그인으로 자바스크립트를 서버사이드에서 실행하는 예시입니다. 입력으로 곱셈 JavaScript 코드를 전달하면 도구가 실행되어 결과를 반환하고, 클라이언트는 표준 출력에서 계산 결과를 확인합니다. 로컬 또는 호환 가능한 OpenAI 엔드포인트에 대해 일회성 요청을 신속히 시험할 때 유용합니다.

- LLM 0.32은 여러 공급자의 서버사이드 도구 호출을 통합해서 단일 요청에서 도구 실행을 가능하게 한다. — 본문의 OpenAI CodeInterpreter, WebSearch 및 llm-anthropic 플러그인의 WebSearch·WebFetch·CodeExecution·AnthropicMCP 예시와 llm --tool 사용 예.
import llm
from llm import user, assistant, system
model = llm.get_model("gpt-5.6-luna")
response = model.prompt(messages=[
system("You are a helpful pirate."),
user("What is the capital of France?"),
assistant("Paris, matey."),
user("And Germany?"),
])
print(response.text())이 파이썬 예제는 model.prompt(messages=[]) API를 통해 이전 메시지 히스토리를 한 번에 전달하는 새로운 호출 방식을 보여줍니다. 입력으로 시스템·유저·어시스턴트 메시지 배열을 주면 모델이 그 전체 문맥을 바탕으로 응답을 생성합니다. 이런 방식은 대화 상태를 외부에서 구성해 보다 유연한 흐름 제어와 재현 가능한 요청을 가능하게 합니다.
for event in model.prompt("Explain cats").stream_events():
if event.type == "reasoning":
print(f"[thinking] {event.chunk}", end="", flush=True)
elif event.type == "text":
print(event.chunk, end="", flush=True)
else:
print(f"Other event: {event}")이 스니펫은 모델이 반환하는 스트리밍 이벤트를 처리하는 방법을 보여줍니다. event.type에 따라 reasoning, text 등 서로 다른 이벤트를 구분해 적절히 출력하거나 추가 처리를 수행하도록 설계되어 있으며, 도구 호출이나 이미지 첨부 같은 혼합 출력 형태에도 대응할 수 있습니다. 스트리밍 이벤트 처리로 클라이언트는 중간 출력과 도구 콜을 실시간으로 받아 반응을 제어할 수 있습니다.
- 중복되는 대화 로그 문제를 해결하기 위해 내용 주소형(content-addressable) 메시지 저장소를 도입했으며, 로그 명령들이 이를 역변환해 읽기 쉬운 형식으로 만든다. — 본문의 'content-addressable message store, modeled after Git' 및 llm logs/llm logs --json 업그레이드 관련 문장.
용어 해설
- 추론 흔적(Visible reasoning traces)
- — 모델이 내부적으로 생성하는 사고 과정 텍스트를 표준 출력과 분리해 표준 오류(stderr)에 노출하는 방식으로, 디버깅과 개발자가 모델의 중간 생각을 확인하는 용도로 사용됩니다.
- 서버사이드 도구(Server-side tools)
- — 모델 요청 처리 중 외부 서비스에서 코드를 실행하거나 웹검색·파일 처리 같은 작업을 수행하도록 모델이 호출하는 원격 도구 인터페이스로, LLM은 다양한 공급자의 도구를 하나의 요청 흐름에서 호출할 수 있게 지원합니다.
- 내용 주소형 메시지 저장소(Content-addressable message store)
- — Git과 유사한 방식으로 메시지 본문을 해시해 중복을 제거하고 참조로 관리하는 로그 구조로, 매 턴 전체 JSON을 반복 저장하지 않고도 대화 기록을 재구성할 수 있게 설계됩니다.
- 스트리밍 이벤트(Streaming events)
- — 모델 응답을 단일 문자열이 아닌 여러 유형의 이벤트(reasoning, text, tool call 등)로 분할해 순차적으로 전달하는 출력 형식으로, 클라이언트가 이벤트별로 다르게 처리할 수 있게 합니다.
- OpenAI 채팅 완성 호환성(OpenAI chat completions compatibility)
- — 기존 OpenAI chat completions API의 메시지-앱엔드포인트 패턴을 모방해 외부 도구와의 호환성을 유지하면서 LLM을 서버로 노출하는 패턴이며, llm-chat-completions-server 플러그인이 이를 제공하는 예시입니다.
기술
- GPT-5.6 Luna
- QuickJS
- OpenAI Responses API
- uvx
- google/gemma-4-12b
- SQLite
- Datasette
- llm-chat-completions-server
활용 사례
- 모델 추론 과정을 실시간으로 관찰해 도구 호출과 판단 근거를 디버깅하는 작업.
- 서버사이드 도구를 활용해 코드 실행·웹크롤링·데이터베이스 쿼리를 모델 응답 흐름에 통합하는 자동화.
- 로컬 또는 호환 엔드포인트에 대해 일회성 실험을 빠르게 실행하고 결과만을 파이프라인으로 전달하는 워크플로우.
- 에이전트형 시스템에서 도구 체인을 구성하고 인간 승인 지점을 두어 작업을 안전하게 중단·재개하는 운영.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.