본문으로 건너뛰기

GPT‑5.6 Sol 효율화, EPD 재현 실험, Hermes 음성 스트리밍, OBI 커널 관찰 도구

Sol의 사용량 조정과 EPD의 지식 증류 실험 모두 더 적은 자원으로 같은 성능을 얻으려는 시도라는 공통점을 보였다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 기간 토론은 GPT-5.6 Sol의 실사용 효율 문제와 개선, 에이전트 경험을 학생 모델로 이전하는 Experience Distillation(EPD) 재현, 에이전트 음성 상호작용의 실시간화, 그리고 운영·관찰 툴의 등장으로 요약된다. Sol은 도구 호출 증가와 병렬화로 일부 파워유저에서 토큰 소모가 급증했고(대응으로 코드 모드·검색 대기 처리 효율화와 다수 사용자의 평균 효율 개선을 통해 전형적 사용에서 약 18% 더 오래 사용할 것으로 예상) 제품 측면에서 사용 한도 복원 조치가 이뤄졌다. EPD 재현 실험은 경험-조건화 교사로부터 증류한 결과가 문맥 학습 이득의 44.1%를 포착했고, 단순 SFT는 동등한 이득을 재현하지 못해 경험 기반 증류의 실효성이 확인됐다. Hermes Agent의 스트리밍 TTS는 음성 응답 지연을 줄여 실시간 상호작용에 유리하고, OBI 같은 커널·이벤트 레벨 관찰 도구는 LLM 호출·벡터 검색·툴 인자·스트리밍 이벤트를 캡처해 1분 내 원인 규명이라는 운영 효율 개선을 가능하게 한다.

𝕏 실시간 트렌드 토픽

🔥 GPT‑5.6 Sol 사용량 이슈와 코드 모드 효율화포스트 2

GPT‑5.6 Sol은 더 길게·더 많은 도구 호출을 수행하도록 설계되어 일부 복잡한 작업에서 예상보다 토큰 사용량이 급증했고, 이에 따라 사용 한도와 효율을 조정해 평균적 사용에서 약 18% 길어진 사용 지속 시간을 기대하고 다섯 시간 제한을 원복했다.

  • Sol은 이전 모델보다 도구 호출·서브에이전트 조정·병렬 작업을 더 적극적으로 수행해 동일한 추론 작업에서 더 많은 응답과 캐시된 입력 토큰을 생성했다.
  • 문제 원인으로는 도구 호출 대기 처리와 웹 검색 처리 비효율이 지목되었고, 해당 두 분야의 처리 로직을 최적화해 전형적 사용자의 토큰 효율을 개선했다.
  • 중앙값 사용자에게는 효율이 양호했으나, 복잡한 워크플로를 쓰는 소수 파워유저에서 장기 사용량 소모가 컸고 이를 반영해 사용 한도를 조정했다.
찬성다수

Sol의 향상된 도구 호출·병렬 처리 능력은 복잡한 문제 해결 능력을 높여 일부 사용 사례에서 더 큰 생산성을 제공하고, 중앙값 사용자 기준 효율 개선(약 18%)을 달성했다.

반대소수

도구 호출로 인한 장기적 사용량 급증과 일부 파워유저에 대한 영향은 사전 예측과 소통에서 미흡함을 드러냈다.

원문 트윗 2개 보기

Tibo

@thsottiaux

Hello people of Sol! I've reset usage limits for all ChatGPT Work and Codex users. Together with that, a quick update on GPT-5.6 Sol usage limits. Over the past few weeks, many of you have told us that Sol was using your Codex limits faster than expected. To be clear, we have not reduced usage on any subscription plans. We’ve been digging into what was happening and have landed several improvements. As a result, we expect your usage to last around 18% longer during typical use of Sol. Some of you should already see significantly larger improvements from today. Tomorrow, we’ll also restore the five-hour limit that we temporarily paused while investigating. Here’s what we found: - GPT-5.6 Sol is much more willing to work for longer, make additional tool calls, and coordinate complex workflows across tools and subagents. That makes it better at solving hard problems, but some tasks were using far more than we intended. - Sol also works harder at the same reasoning effort than previous models. High on Sol can use more tokens than High did on GPT-5.5. - Programmatic tool calling, also referred to as code mode, gives Sol much more flexibility to run tool calls in parallel or continue working while waiting. But it also led to more responses per turn, more cached input tokens, and higher usage than expected. - This was particularly noticeable when Sol was waiting for tool calls to finish or running many web searches. We’ve improved how we handle both cases and are continuing to make code mode more efficient. - The impact was also very uneven. The median user actually found Sol quite token efficient, while some power users working on harder tasks saw their usage drain much faster. We were very focused on average and median usage before launch and missed some cases where the long tail could use significantly more usage. Sol is a significant step forward in what Codex can do, but capability and efficiency do not always improve at the same pace, and some issues only become clear once people are using the model at real-world scale. We should have recognized this sooner and been more upfront about it. You keep pushing the frontier and we’ll keep improving efficiency and sharing updates as we go.

💬 174 135 725👁 15548

Tibo

@thsottiaux

One day we created the reset button and the rest is history.

💬 98 18 324👁 9557

📈 Experience Distillation(EPD) 재현과 에이전트 학습 영향포스트 2

연구진은 경험-조건화 교사로부터 학생 모델로 정책을 증류하는 EPD를 소규모 재현 실험으로 검증했고, 증류본이 문맥 학습 이득의 44.1%를 포착한 반면 일반적인 SFT는 동일 이득을 재현하지 못했다.

  • 실험은 GPT‑5.6 Sol과 Fable 5 연구 에이전트를 교사로 사용해 Qwen3.5-9B를 포스트트레인했으며, EPD가 문맥 기반 학습 이득의 상당 부분을 영속화하는 결과를 보였다.
  • 추가 대조 실험에서 최종 성공 시점만을 사용한 SFT와 복수 교사 시퀀스 샘플링이 예기치 않은 성능 저하를 보이는 등 아블레이션이 일부 역효과를 드러냈다.
  • 연구 결과와 코드·실험 레포는 공개 저장소로 연결되어 재현성과 후속 실험을 가능하게 했다.
찬성다수

경험 증류(EPD)는 에이전트의 롤아웃 경험을 학생 모델로 옮겨 문맥 학습 이득의 상당 부분(44.1%)을 재현해 실무적 가치가 확인됐다.

중립소수

일부 아블레이션에서 기대치 못한 성능 저하가 관찰되어, 증류 설계와 샘플링 전략의 민감도를 추가로 검증할 필요가 있다.

원문 트윗 2개 보기

alphaXiv

@askalphaxiv

Hindsight is 20/20 and it turns out you can train your agents with it. We used an ensemble of GPT-5.6-Sol and Fable 5 research agents to run a small-scale replication of “Sample-Efficient Learning from Agent Experience.” The agents post-trained Qwen3.5-9B with Tinker on SWE-smith tasks using the Experience to Policy Distillation (EPD) technique introduced in the paper. EPD distills an experience-conditioned teacher (opposed to a solution-conditioned one) into a student model We found that EPD captures 44.1% of the in-context learning gains, corroborating the paper’s headline claim. Vanilla SFT captured 0%. Two additional ablations surprised us: - SFT on only each task’s final, successful trial scored lower than ordinary SFT on all trials - Using four sampled teacher sequences per trial instead of one underperformed both with matched optimization steps and with proportionally more training

alphaXiv

"Sample-Efficient Learning from Agent Experience" Agents can learn from trial and error in context, but forget once the context is gone. This paper propose something called Experience Distillation. So you let an experience-conditioned teacher look at old agent rollouts, ask it

💬 1 0 2👁 422

alphaXiv

@askalphaxiv

Repo of our replication and additional experiments: https:// github.com/alphaXiv/exper ience-distillation … All code and experiments were written and run with the OpenResearch CLI: https:// github.com/alphaXiv/openr esearch-cli … Link to the original paper: https:// alphaxiv.org/abs/2607.21051

💬 0 0 0👁 75

Hermes Agent의 음성 채팅 스트리밍과 오픈 모델 보안 논의포스트 2

Hermes Agent는 대부분의 TTS 백엔드가 음성 스트리밍을 제공함에 따라 음성 채팅의 실시간성이 크게 개선되었고, 오픈 모델의 투명성이 자율 에이전트 관련 공격·방어 사례에서 방어자 학습에 기여한다는 논의가 병행되었다.

  • TTS 스트리밍은 음성 응답을 청크 단위로 순차 전송해 초기 음성 재생을 앞당기므로 대화형 에이전트의 체감 지연을 줄인다.
  • 오픈 모델을 활용한 침해·포렌식 공개 사례가 방어 측면에서 학습 자료로 활용될 수 있다는 주장이 제기되었고, 이는 투명성 기반 방어 전략과 연결된다.
  • 스트리밍과 도구 호출이 결합된 에이전트 워크플로에서 응답 수·토큰 관리가 다시 중요해진다.
찬성다수

스트리밍 TTS는 음성 대화의 지연을 실질적으로 낮춰 실시간 상호작용 품질을 개선한다.

찬성다수

오픈 모델 기반의 사건 공개는 방어자에게 재현 가능한 학습 자료를 제공해 보안 대응 역량을 높인다.

원문 트윗 2개 보기

알리바바 클라우드 OBI: 커널 레벨 AI 실행 경로 관찰포스트 1

알리바바 클라우드의 OBI는 커널 레벨에서 LLM 호출·벡터 검색·MCP 툴 실행·SSE 이벤트를 자동으로 캡처해 AI 실행 경로를 재구성하며, 이를 통해 코드 변경 없이 1분 이내에 잘못된 응답의 근본 원인을 규명할 수 있다고 제시했다.

  • OBI는 모델 호출 시의 토큰·모델명·툴 호출 파라미터와 벡터 검색의 Top‑K·네임스페이스·유사도 점수 등 세부 정보를 수집한다.
  • 툴 실행 상태와 인자, SSE 레벨 이벤트 추적을 결합해 TTFT(Time To First Token) 등 정밀 메트릭을 산출할 수 있다.
  • 코드 변경 없이 운영 중인 파이프라인에서 문제 원인을 빠르게 찾는 관찰·디버깅 워크플로를 목표로 설계되었다.
찬성다수

커널·이벤트 레벨의 실행 경로 캡처는 원인 규명 시간을 크게 단축해 운영 신뢰성과 문제 대응 속도를 높인다.

원문 트윗 1개 보기

용어 해설

툴 호출(코드 모드)(Tool Calling)
모델이 외부 API나 도구를 호출해 정보를 조회하거나 작업을 수행하는 방식으로, 요청별로 도구 호출을 병렬 실행하거나 대기 상태에서 작업을 지속해 응답을 구성한다. 도구 호출이 늘어나면 토큰 사용량과 응답 건수가 급증할 수 있어 비용·지연 측면에서 최적화가 필요하다.
문맥 내 학습(In-Context Learning)
모델이 별도 파인튜닝 없이 입력된 프롬프트(예: 예제·롤아웃)를 바탕으로 즉시 성능을 개선하는 현상으로, 에이전트 생성·시뮬레이션에서 경험을 프롬프트로 제공해 성능을 높이는 용도로 활용된다. 장기 보존이 어려워 외부화·증류 기법이 연구된다.
경험 증류(Experience Distillation (EPD))
에이전트의 실행 롤아웃(경험)을 교사 모델이 해석한 뒤, 그 경험-조건화 교사로부터 학생 모델로 정책을 증류하는 기법으로, 문맥 기반 학습 이득 일부를 영속화해 학생 모델이 과거 시행착오를 일반화하도록 만든다. 에이전트 학습 효율 개선 목적에서 사용된다.
스트리밍 TTS(Streaming TTS)
텍스트 음성 변환(TTS) 응답을 실시간으로 청크 단위로 전송해 음성 출력 지연을 줄이는 방식으로, 사용자 상호작용에서 대화형 응답 속도를 개선한다. API 백엔드가 스트리밍을 지원하면 초기 음성 부분을 빠르게 재생해 실시간성이 향상된다.
실행 경로 추적(관찰)(Execution Tracing)
모델 호출·벡터 검색·툴 실행 등 AI 파이프라인의 각 단계에서 이벤트·파라미터·결과를 수집해 흐름을 재구성하는 기술로, 문제 발생 시 원인 지점을 신속히 식별하고 성능·비용 분석을 가능하게 한다. 커널 레벨 캡처나 이벤트 스트리밍을 통해 정밀 추적이 이뤄진다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 29.수집 2026. 07. 29.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.