본문으로 건너뛰기
X (Twitter)조회 5

에이전트 제어면, 문서 추출 정확도, 모델 서빙과 추론 최적화

에이전트 실행 제어의 세분화와 문서 추출·모델 처리 효율의 동시 개선

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 기간에는 에이전트가 장시간 작업을 수행하는 동안 출력 길이, 권한, memory, 브라우저 도구, 실행 상태를 세밀하게 제어하는 제품 업데이트가 이어졌다. Claude Code는 Concise 출력 스타일을 추가했고, Claude Managed Agents는 Self-Hosted Sandbox 작업을 memory로 저장하며 domain controls와 multi-agent session viewer를 확장했다. Grok Build는 Workflows catalog와 Always allow·Never allow 권한, 반복 tool call 조기 중단을 묶었고, Codex harness와 SDK는 내부 도구와 세무 처리 시스템에 agent loop를 연결해 7,000건의 신고서를 처리하고 준비 시간을 약 3분의 1 줄인 사례를 냈다. 문서 처리에서는 AI Extract가 PDF 필드 추출 정확도 95%를 기록했고 LlamaParse는 Word-style 변경 이력과 reviewer comments를 구조화된 metadata로 보존했다. 모델 측면에서는 Ornith-1.5의 vLLM 서빙, Recirculation의 perplexity 23% 감소와 GSM8K 정확도 21% 향상, PyTorch 내장 GELU 사용에 따른 21,000에서 25,000 tokens/second 처리량 증가가 공유됐다.

𝕏 실시간 트렌드 토픽

🔥 Claude Code의 간결 출력과 에이전트 운영 제어포스트 4

Claude Code와 Claude Managed Agents에 출력 길이, 작업 memory, 검색 도메인, multi-agent 세션을 제어하는 기능이 추가됐다. 사용자는 결과 중심 응답부터 세션별 비용과 에이전트별 실행 흐름까지 한 화면과 설정값으로 관리할 수 있다.

세부 내용 보기
  • Claude Code는 응답을 결과부터 짧게 시작하면서 추가 요청이 있을 때 전체 세부 정보를 유지하는 Concise 출력 스타일을 /config → Output style 또는 settings.json의 outputStyle 설정으로 켠다. 긴 설명을 기본값으로 받지 않으면서 필요할 때 상세 응답을 이어갈 수 있는 출력 제어 방식이다.
  • Claude Managed Agents는 Self-Hosted Sandbox에서 수행한 작업을 memory에 저장하고, web_search와 web_fetch에 allowed_domains 또는 blocked_domains를 지정하도록 바꿨다. 검색·열람 입력을 허용 목록이나 차단 목록으로 제한하고 작업 결과를 memory에 남겨 장기 실행 에이전트의 데이터 접근 범위를 좁히는 구성이다.
  • Console session viewer는 multi-agent 세션을 에이전트별 한 줄 minimap과 iteration별 streaming transcript로 나누고, thread·session 단위 비용을 달러로 표시한다. 실행 순서와 비용을 같은 화면에서 확인할 수 있어 여러 에이전트가 나뉘어 수행한 작업의 소비 구조를 추적할 수 있다.
원문 트윗 2개 보기

🔥 Grok Build의 워크플로와 권한 지속 설정포스트 2

Grok Build v1.0.7은 설치된 workflows를 찾고 실행 상태를 확인하는 catalog와 명령을 추가했다. 프로젝트별 도구 권한 저장, timer 기반 상태 갱신, 반복 tool call 조기 중단이 함께 들어가 에이전트 실행 관리와 실패 비용을 줄이는 구성이다.

세부 내용 보기
  • Workflows tab은 extensions modal에서 설치된 workflow의 name·source·description을 나열하고, /workflows와 command palette의 Workflows 항목으로 접근한다. /workflow runs는 active·recent 실행의 status와 progress를 표시해 workflow 선택과 실행 상태 확인을 한 흐름으로 묶는다.
  • Permission prompt에는 Always allow와 Never allow가 기본으로 표시되고, MCP 도구와 web-fetch domain에 대한 Never allow 선택은 프로젝트 단위로 지속된다. 매번 같은 권한을 묻는 대신 허용·차단 결정을 저장해 에이전트가 접근할 수 있는 도구와 사이트를 고정한다.
  • status line command script는 config.toml의 refresh_interval에 따라 timer로 실행되며, 반복되는 동일 tool call은 더 이른 시점에 중단된다. startup timeout에는 GROK_CONNECT_UI_TIMEOUT_SECS 환경 변수로 connect budget을 늘릴 수 있어 상태 갱신과 장시간 작업의 제어 폭을 넓힌다.
원문 트윗 2개 보기

X Freeze

@XFreeze

14일 전

Grok Build just got a new update bringing a first-class workflows catalog, Always and Never allow on permission prompts, a live status line that can refresh on a timer, and faster shutdown of looping tool calls Release Notes: v1.0.7 Features: • Users hitting startup timeouts can now raise the connect budget with the `GROK_CONNECT_UI_TIMEOUT_SECS` environment variable. • Permission prompts now show "Always allow" and "Never allow" options by default. • Users can now delete scheduled background loops directly from the tray. • Status line command scripts can now run on a timer via refresh_interval in config.toml. • Permission prompts now offer a 'Never allow' choice for MCP tools and web-fetch domains that persists per project. • Workflows tab added to the extensions modal (Ctrl+L or /plugins) listing installed workflows with name, source, and description. • New /workflows command opens the Workflows catalog tab; use /workflow runs to view live workflow runs. • Bare /workflow (or /workflow runs) now lists active and recent workflow runs with status and progress instead of usage help. • Workflows row added to the Ctrl+P command palette, opening the Workflows catalog tab. Bug Fixes: • MCP server connections in non-interactive sessions no longer incorrectly require authentication for tokenless servers. • Fixed startup timeouts caused by concurrent auth refreshes across multiple sessions. • Tool call loops are interrupted earlier to avoid wasting time on repeated identical actions. • Subagents no longer receive the ask-user-question tool. • Bare email addresses are now turned into clickable mailto links in the pager.

X Freeze

Grok Build just got a new update bringing a cleaner agent architecture, smoother prompt controls, a powerful new grok clone workflow, and major reliability improvements across sessions and tasks Release Notes: v1.0.6 Breaking Changes: • Subagent spawning no longer accepts x.com/XFreeze/status…

인용 트윗 보기
💬 16 29 151👁 28187

Grok

@grok

14일 전

Now, manage sharing and access for apps built and deployed in Grok. Make apps private to you, shared with your team, or public to the world. Start building on Grok web, iOS, Android, or in the CLI.

💬 23 26 131👁 32165

📈 Codex harness의 업무 도구 연결과 세무 처리포스트 3

오픈소스 Codex harness와 Codex SDK가 내부 앱·운영 대시보드·Cisco Cloud Control용 App Builder에 agent loop를 연결하는 사례가 공유됐다. 애플리케이션이 interface·context·tools·approvals를 통제하고 harness가 실행 루프를 맡는 구조로, 세무 처리에서는 7,000건과 준비 시간 약 3분의 1 단축이 제시됐다.

세부 내용 보기
  • Codex harness는 애플리케이션이 interface, context, tools, approvals를 정하고 harness가 agent loop를 처리하는 분업 구조이다. 기존 도구 안에 에이전트를 넣을 때 사용자 화면과 입력 맥락, 사용 가능 도구, 승인 지점을 애플리케이션 쪽에 남길 수 있다.
  • Codex SDK는 Cisco App Builder에서 자연어로 Cisco Cloud Control용 custom application을 만드는 경로에 쓰였고, Thrive Holdings와 Crete의 tax-prep system은 7,000 returns를 처리했다. 같은 실행 기반이 고객용 애플리케이션 생성과 운영 업무 자동화에 연결된 사례이다.
  • 세무 시스템은 preparation time을 about a third 줄였다는 수치를 냈다. 단순한 coding 도구를 넘어 내부 업무와 운영 화면에 agent loop를 이식할 수 있다는 점에서 harness의 적용 범위를 가늠하게 하는 사례이다.
원문 트윗 2개 보기

📈 PDF 필드와 문서 변경 이력의 구조화 추출포스트 2

Databricks의 AI Extract는 PDF에서 필요한 필드를 직접 추출하는 작업에 초점을 맞춰 95% 정확도를 제시했고, LlamaParse는 Word-style tracked changes와 reviewer comments를 구조화된 metadata로 보존한다. 문서 내용을 markdown으로 바꾸는 데서 나아가 필드와 수정 맥락을 downstream AI agent가 사용할 입력으로 남기는 흐름이다.

세부 내용 보기
  • PDF 필드 추출은 다음 토큰 예측에 맞춰 학습된 LLM이 원문을 자동 보정할 수 있어 단순 생성과 다른 처리 문제가 생긴다. AI Extract는 이 작업을 전용 기능으로 다뤄 95% 정확도와 others의 87%, extremely low cost를 제시했으며 SQL에서 직접 호출할 수 있다.
  • LlamaParse의 revision tracking은 Word-style tracked changes와 reviewer comments를 추출해 parsed markdown content에 추가 structured metadata로 붙인다. 문서 본문만 출력하지 않고 검토자가 남긴 변경과 의견을 함께 전달해 downstream AI agent가 전체 revision history를 입력으로 사용할 수 있게 한다.
원문 트윗 2개 보기

📈 장기 작업 에이전트의 목표·브라우저·메모리 경로포스트 3

Cursor의 /goal, Stagehand 연결, Agentic ESOpt 관련 게시물은 에이전트가 장기 목표를 유지하고 브라우저 도구를 호출하며 긴 작업을 적은 GPU memory로 Fine-tuning하는 방향을 가리킨다. 목표 지속, 클릭·입력·스크린샷, 장기 horizon 최적화가 서로 다른 실행 경로로 병렬 확장됐다.

세부 내용 보기
  • Cursor의 /goal은 에이전트에 하나의 long-lived objective를 주고 실제 완료까지 계속 작업하게 하며, /loop는 check-in을 추가하고 Custom Mode는 playbook을 제공한다. 반복 확인과 작업 지침을 결합해 한 번의 짧은 요청보다 긴 목표를 지속하는 실행 방식이다.
  • Stagehand를 연결한 deepagent는 몇 줄의 코드로 click, type, screenshot 도구를 사용해 browser agent가 된다. 에이전트의 텍스트 판단을 브라우저 조작 입력으로 연결하는 구조라서 페이지 탐색과 화면 조작을 동일한 작업 흐름에 넣을 수 있다.
  • Agentic ESOpt는 long-horizon LLM agents를 minimal GPU memory로 Fine-tuning하는 연구로 소개됐고, 한 반응은 RL보다 적합한 접근일 수 있다고 평가했다. 장기·분기형 작업을 다룰 때 학습 메모리 요구량을 줄이는 방향이 제시됐지만 게시물에는 구체적인 성능 수치가 없다.
찬성소수

Agentic ESOpt가 conventional Agentic Fine-tuning보다 적은 GPU memory로 long-horizon agent를 다루는 접근으로 소개되며 RL보다 적합할 수 있다는 반응이 나왔다.

원문 트윗 2개 보기

내장 GELU 함수로 LLM 학습 처리량 개선포스트 2

손으로 구현한 GELU 대신 PyTorch 내장 함수를 사용한 사례에서 LLM training speed가 21,000 tokens/second에서 25,000으로 올랐다. pretrained weights가 기대하는 approximate GELU와 구현 차이까지 함께 언급되며 교육용 구현과 실제 성능 경로의 구분이 드러났다.

세부 내용 보기
  • 직접 작성한 GELU를 PyTorch built-in 함수로 바꾸자 LLM training speed가 21,000 tokens/second에서 25,000으로 증가했다. 같은 활성화 함수를 더 최적화된 구현으로 호출해 연산 경로의 불필요한 비용을 줄인 사례이며, 교육 목적이 아니라면 내장 모듈을 우선하라는 실무 교훈으로 이어졌다.
  • 게시물의 후속 대화에서는 hand-written GELU가 tanh approximation을 사용하고, GPT-2 pretrained weights가 TensorFlow의 approximate version을 전제로 학습됐다고 설명했다. 구현을 바꾸면 inference에서 slight differences가 생길 수 있어 속도만이 아니라 기존 weight와의 계산 방식 일치도 함께 고려해야 한다.
  • cross entropy처럼 backward pass의 항을 단순화하는 손수 구현이 이점을 얻는 함수도 있다고 덧붙였다. 모든 함수를 기계적으로 내장 구현으로 바꾸기보다 함수별 backward 계산 구조와 목적을 기준으로 선택해야 한다는 맥락이다.
원문 트윗 2개 보기

Sebastian Raschka

@rasbt

14일 전

Nice case study on using optimized functions whenever possible (except for educational purposes, though )

Giles Thomas

By switching from a hand-rolled GELU to PyTorch's built-in one, I improved my LLM training speed -- and much more than I expected, from 21,000 tokens/second to 25,000! https:// gilesthomas.com/2026/08/built- in-gelu …

💬 2 0 5👁 1193

Sebastian Raschka

@rasbt

14일 전

Nvm, I just saw your article ( https:// gilesthomas.com/2026/08/built- in-gelu …). Really good one. I should have profiled this better. I plan to do some profiling for the bonus materials and will link your article as a good case-study. > I'm not that sure why the hand-rolled version is in there -- he covers the maths, but the specific implementation isn't explained in that much depth Yeah, I think it was the page limits for this chapter... > the hand-written code from the book uses an approximation using tanh btw the reason for the approximate one was that the original model weights assumed that the model was using this approximation (gpt-2 was trained with tensorflow where the approximate version is the default); you'd notice slight differences in inference if you don't use the approximate version with the pretrained weights. > On the other hand, I do intend to have a look at torch.compile in the future, to see what kind of speedup I can get from it. Yeah, I can imagine that'll get close to the built-in one. > But anyway, for now, lesson learned: use built-in PyTorch modules when you can. It's a pretty obvious one ;-) 100%. The handrolled ones are just for educational purposes. Some function benefit from it a lot (like cross entropy), because they simplify terms in the backward pass, e.g., I discussed this a bit here https:// sebastianraschka.com/blog/2022/loss es-learned-part1.html …)

💬 0 0 0👁 77

📈 Ornith-1.5의 오픈 모델군과 vLLM 서빙포스트 1

Ornith-1.5가 9B Dense, 35B MoE, 397B MoE로 구성된 MIT-licensed open-source LLM family로 공개됐고 vLLM에서 즉시 서빙할 수 있다는 소식이다. vllm serve ornith-ai/Ornith-1.5-9B 명령으로 serving 경로가 제시됐으며 coding·agentic tasks 성능이 강조됐다.

세부 내용 보기
  • Ornith-1.5는 self-improving strategies로 학습한 9B Dense, 35B MoE, 397B MoE 계열로 소개됐다. 크기와 구조가 다른 모델을 하나의 family로 제공해 사용 환경에 맞는 선택지를 만들고, MIT license로 공개 모델 활용 경로를 열었다.
  • vLLM 게시물은 Ornith-1.5-9B를 vLLM에서 이미 serving할 수 있다고 밝혔고, 실행 예시로 vllm serve ornith-ai/Ornith-1.5-9B를 제시했다. 모델 공개와 inference runtime 지원이 동시에 이뤄져 배포 단계로 바로 이어지는 구성이 됐다.
  • 게시물은 comparable size의 open-source models 가운데 coding and agentic tasks에서 SOTA이며 Claude Opus와 comparable performance라고 전했다. 별도 수치나 평가 조건은 제시되지 않아 이 주장은 게시물에 적힌 비교 범위 안에서만 해석해야 한다.
원문 트윗 1개 보기

Recirculation으로 추론 중 작업 기억 보강포스트 1

Recirculation은 pretrained Transformer를 재학습하지 않고 추론 중 정보 일부를 앞쪽 레이어로 되돌려 문맥 지속성을 높이는 방식이다. Gemma3에서 perplexity 23% 감소와 GSM8K accuracy 21% 향상, generation latency 거의 증가하지 않음이 게시물에 제시됐다.

세부 내용 보기
  • 깊은 레이어에 유용한 맥락이 묻히는 문제가 배경이며, Recirculation은 모델이 다음 token을 읽을 때 정보 일부를 earlier layers로 다시 공급한다. 입력을 재학습 데이터로 바꾸지 않고 추론 경로 안에서 이미 이해한 내용을 되돌려 작업 기억처럼 유지하는 구조이다.
  • 게시물에 따르면 Gemma3에서 perplexity가 23% 줄고 GSM8K accuracy가 21% 올랐으며 generation latency 증가는 almost no extra로 표현됐다. 구체적인 기준값과 실험 조건은 원문에 없지만, 언어 모델의 기억 보강을 추가 학습보다 추론 단계의 정보 흐름 변경으로 시도한 결과이다.
  • 이 접근은 pretrained models 안에 더 나은 memory 능력이 이미 존재하고 Recirculation이 그 정보를 지속시키는 통로를 제공할 수 있다는 해석으로 이어진다. 모델 파라미터를 다시 학습하지 않는다는 점이 장기 문맥 처리 실험의 핵심 조건이다.
원문 트윗 1개 보기

용어 해설

에이전트 실행 루프(Agent Loop)
에이전트 실행 루프는 애플리케이션이 모델에 작업 맥락과 도구를 전달하고, 모델의 다음 행동을 받아 다시 실행하는 반복 구조이다. Codex harness는 이 루프를 담당하고 애플리케이션이 인터페이스·승인·도구를 제어한다.
자체 호스팅 샌드박스(Self-Hosted Sandbox)
Self-Hosted Sandbox는 사용자가 직접 운영하는 격리 실행 환경이다. Claude Managed Agents에서는 이 환경에서 수행한 작업을 memory에 저장해 이후 에이전트 작업에서 재사용하는 연결 구조로 쓰인다.
MCP
MCP는 에이전트가 외부 도구나 서버에 연결할 때 쓰이는 인터페이스이다. 이번 업데이트에서는 MCP 도구별로 Never allow 권한을 프로젝트 단위로 저장하고, 비대화형 세션의 tokenless 서버 인증 처리를 조정했다.
GELU
GELU는 Transformer 계열 모델에서 사용하는 활성화 함수이다. 게시물의 사례에서는 직접 구현한 GELU 대신 PyTorch 내장 함수를 사용해 동일한 계산 경로를 더 효율적으로 실행했고, 처리량이 21,000 tokens/second에서 25,000으로 증가했다.
Recirculation
Recirculation은 재학습 없이 추론 중 일부 정보를 모델의 앞쪽 레이어로 되돌리는 방식이다. 깊은 레이어에 묻히는 문맥을 다음 토큰 처리 전에 다시 주입해 pretrained Transformer의 작업 기억을 유지하도록 설계됐다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 20.수집 2026. 08. 20.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.