본문으로 건너뛰기
X (Twitter)조회 4

TrueForge의 에이전트 실행 기반과 비용 비교

에이전트 실패 원인을 모델보다 실행 기반에서 찾은 TrueForge

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

AI 에이전트 데모가 실제 사용자 환경에서 오래 작동하지 못하는 이유로 문맥 유지, 도구 순서 제어, 하위 에이전트 위임, 사람 승인, 샌드박스 실행, 오류 추적을 묶는 실행 인프라의 부족이 거론됐다. TrueForge는 이 기능을 오픈소스 MIT 라이선스와 vendor-neutral 구조로 제공해 작업별로 서로 다른 모델을 연결하도록 구성됐다. 14개 작업으로 이뤄진 enterprise-agent benchmark에서 같은 Opus 모델을 쓸 때 Claude Managed Agents와 맞먹는 결과를 내면서 비용은 약 30% 낮았고, GLM-5.2로 라우팅할 때는 최대 약 75% 낮았다는 수치가 함께 제시됐다. 핵심 쟁점은 모델 자체보다 운영 기반을 먼저 갖추는 접근이다.

𝕏 실시간 트렌드 토픽

🔥 TrueForge의 Agent Harness와 비용 비교포스트 2

실제 사용자 환경에서 에이전트가 오래 작동하려면 모델 호출 외에 문맥·도구·승인·추적을 묶는 실행 기반이 필요하다는 흐름이다.

  • 에이전트 데모의 약 80%가 실제 사용자 손에 들어간 뒤 하루도 지속되지 않았다는 경험을 바탕으로, 장시간 문맥 관리와 도구 순서 제어를 포함한 운영 구조가 문제로 떠올랐다. Agent Harness는 입력된 작업을 문맥에 맞춰 유지하고 도구·하위 에이전트를 조정한 뒤 사람 승인, 샌드박스 실행, 오류 추적을 거쳐 결과를 내보내는 방식이며, 원문은 이 기반을 직접 구현하기 어렵다고 설명했다. 99%의 사용자는 직접 재구축하기보다 검증된 기반에서 시작해야 한다는 실무적 판단으로 이어진다.
  • TrueForge는 MIT 라이선스의 오픈소스로 자체 인프라에 호스팅할 수 있고, 작업별로 적합한 모델을 선택하는 vendor-neutral 라우팅을 지원한다. 14개 작업의 enterprise-agent benchmark에서 Claude Managed Agents의 Opus 4.8과 맞먹었으며, 같은 Opus 모델 기준 비용은 약 30% 낮고 GLM-5.2로 라우팅하면 최대 약 75% 낮았다는 수치가 근거로 제시됐다. 모델 선택보다 도구 조정과 승인 지점을 포함한 실행 계층이 운영 비용과 재현성에 직접 연결된다는 의미이다.
원문 트윗 1개 보기

Santiago

@svpino

Most agents don't work. Period. I make a living testing AI applications, and around 80% of the demos I've seen don't last a single day in the hands of a real user. Creating a production-ready agent is way more complex than people think. Your agent needs to do all of this: • Manage context across long-running tasks • Call tools in the right order • Delegate work to subagents • Stop for human approval before doing something consequential • Execute code in a sandbox • Leave a trace you can inspect when things go wrong That infrastructure is what we call the "agent harness", and implementing a good one is hard. 99% of people should start off with a good foundation harness instead of reinventing the wheel. Check out TrueForge, an open-source, vendor-neutral agent harness you can start using right now. The @truefoundry team that's behind this project is partnering with me on this post. You can use models from different providers and route each task to the model that makes sense. For context, in a 14-task enterprise-agent benchmark, TrueForge matched Claude Managed Agents running Opus 4.8 while costing ~30% less on the same Opus model, and up to ~75% less when TrueForge routed the work to GLM-5.2. Here is what you get when you use TrueForge: 1. Open-source (MIT license), so you can just host it on your own infrastructure. 2. Vendor-neutral, so you can use any model that fits each task. 3. The ability to orchestrate tools, manage context, run subagents, and have human-in-the-loop checkpoints. See the GitHub Repository below.

💬 1 0 0👁 719

📈 Claude Code에서 Codex로 옮긴 뒤의 제품 고착성포스트 1

한 사용자가 Claude Code에서 Codex로 이동한 뒤 작업 방식의 변화가 작았다고 평가하며 Anthropic 제품의 낮은 전환 장벽을 지적했다.

  • 작성자는 Claude Code에서 Codex로 옮긴 지 몇 주가 지났지만 빠뜨린 기능이 없었고, 변화에 익숙해지는 데 하루가 걸렸다고 말했다. 기존에 하던 작업을 같은 방식으로 이어간 경험이 핵심 근거이며, 특정 제품의 기능보다 사용자가 수행하는 작업 흐름의 연속성이 전환 비용을 좌우한다는 맥락이다.
  • 게시물은 Fable을 고려하지 않으며 Opus가 Sol보다 낫다는 판단도 믿지 않는다고 밝혔다. 이어 Anthropic 제품은 고착성이 없어서 누구나 한 시간 안에 옮길 수 있다고 평가했다. 다만 이 수치는 작성자의 경험과 판단으로 제시된 것이며, 별도의 비교 benchmark 수치는 포함되지 않았다.
  • Claude Code와 Codex 사이에서 작업 결과를 유지한 사례는 코딩 도구의 교체가 모델 이름이나 제품 충성도보다 실제 사용 흐름의 호환성에 좌우될 수 있음을 시사한다.
반대소수

Anthropic 제품은 사용자가 특정 기능이나 흐름에 묶이지 않아 다른 코딩 도구로 빠르게 이동할 수 있다는 평가이다.

원문 트윗 1개 보기

AI 문체 판별보다 내용의 깊이포스트 2

AI 작성 여부를 맞히려는 태도보다 문장이 반복해서 읽을 가치가 있는지, 표현과 내용 사이에 간극이 있는지를 판단 기준으로 삼자는 관점이다.

  • 한 작성자는 자신의 글이 AI로 작성됐다는 의심을 받았지만 문체를 바꾸지 않겠다고 밝혔다. AI 문체 자체가 읽기 불편한 이유가 아니라, 강한 표현과 얕은 내용 사이의 단절이 문제라는 설명이며, 문체의 표면적 특징만으로 작성 주체를 판단하는 방식에 의문을 던진다.
  • AI 생성물의 범람으로 독자가 읽는 모든 글을 끊임없이 의심하게 됐다는 맥락에서, 작성자는 AI 여부에 대한 걱정을 멈추고 글을 두 번째로 읽어 처음보다 깊이가 드러나는지 또는 공허하게 느껴지는지를 확인하자고 말했다. 판별기의 점수보다 반복 독해를 통한 내용 검증을 우선하는 처리 방식이다.
  • 두 게시물은 같은 취지의 글로, AI 같은 문체를 칭찬으로 받아들일 수 있지만 표현의 날카로움과 실질적 내용이 분리된 글은 경계해야 한다는 기준을 공유한다.
반대소수

AI 작성 여부를 추측하는 것보다 글을 다시 읽으며 내용의 깊이와 표현의 실질적 근거를 판단해야 한다는 입장이다.

원문 트윗 1개 보기

📈 Dynamic Short Convolutions로 Transformer 학습 시간 절감포스트 1

Dynamic short convolutions를 활용해 AI 모델의 GPU 학습 시간을 줄이는 연구·발표가 공유됐다.

  • Transformer 계열 모델의 학습 비용을 줄이려는 맥락에서 dynamic short convolutions가 소개됐다. 이 방식은 짧은 convolution 연산을 동적으로 활용해 모델 처리 구조에 변화를 주고, 그 결과 학습 과정에 필요한 GPU 시간을 줄이는 접근이다.
  • 원문은 해당 접근이 GPU training hours를 21% 줄인다고 밝혔다. 게시물에는 세부 입력·출력 구조나 benchmark 조건은 없으며, 발표 영상에서 관련 내용을 확인할 수 있다는 정보만 포함됐다.
  • 학습 시간 감소 수치는 모델 구조를 바꾸는 방식이 GPU 자원 사용량에 직접 영향을 줄 수 있음을 보여주는 근거이다.
원문 트윗 1개 보기

📈 Wan3.0 Creator Live Session포스트 1

Alibaba Cloud가 Wan3.0의 모델 업그레이드와 실제 제작 workflows를 다루는 Creator Live Session을 예고했다.

  • Wan3.0을 둘러싼 제작자 대상 행사는 단순한 모델 소개보다 최신 업그레이드, 실제 creator workflows, 즉시 활용을 위한 팁을 한 자리에서 공유하는 구성이다. 사용자는 간단한 입력에서 창작 결과로 이어지는 흐름을 행사 내용으로 접하게 된다.
  • 원문은 Wan 팀과 leading creators가 참여하는 Creator Live Session을 통해 최신 모델 업그레이드와 실제 작업 흐름을 확인할 수 있다고 밝혔다. 구체적인 성능 수치, 지원 기능, 공개 일정은 게시물에 포함되지 않았다.
  • 모델 업데이트를 실제 제작 과정과 함께 전달하려는 방식이 핵심이며, Wan3.0의 활용 장면을 창작자 관점에서 연결하는 행사라는 의미이다.
원문 트윗 1개 보기

📈 Miora의 3D Camera Stage 기반 영상 제어포스트 1

Tencent AI가 Miora에 3D camera stage를 적용해 편집기에서 그린 카메라 경로와 캐릭터 움직임을 AI 실행 결과에 연결했다.

  • 기존에는 AI에게 wide shot에서 close-up으로 카메라를 밀어달라고 문장으로 지시하고 결과를 기다리는 방식이 문제였다. Miora의 3D camera stage는 편집기에서 지면 위에 경로를 그리면 캐릭터가 그 경로를 따라 걷고 타이밍이 동기화되는 흐름으로, 공간 지시를 직접 조작 가능한 경로로 바꾼다.
  • 입력은 편집기 안에서 그린 ground path이고, 시스템은 해당 경로와 카메라 무대 정보를 AI 실행에 반영한 뒤 캐릭터 이동과 timing-sync 결과를 출력한다. 게시물에는 정량 성능이나 지원 장면의 범위는 포함되지 않았다.
  • 문장 해석에 의존하던 카메라 제어를 편집기상의 3D 경로 조작으로 바꾸면, 사용자가 의도한 움직임과 AI 결과 사이의 연결을 시각적으로 확인할 수 있다는 의미이다.
원문 트윗 1개 보기

📈 Cohere의 언어적 추론 연구포스트 1

Cohere Labs가 linguistic reasoning의 최신 연구 결과를 다룬 논문을 공개했다.

  • 언어적 추론의 현재 수준을 다루는 새 연구가 Eduardo Sánchez, Rita Berrada, DanMirea4, Sara Rajaee 등 연구진 주도로 공개됐다. 게시물은 연구 주제와 논문 링크를 알렸지만, 사용한 데이터셋·모델 구성·실험 수치는 포함하지 않았다.
  • 논문은 언어적 추론의 state of the art를 대상으로 하며, 원문에서 확인 가능한 결과는 연구 논문이 공개됐다는 사실과 저자 목록이다. 따라서 세부 방법이나 성능 비교는 링크된 원문 확인이 필요한 상태이다.
  • 언어 모델의 추론 능력을 별도 연구 대상으로 정리한 자료가 공유되면서, 이번 기간에는 제품 발표뿐 아니라 언어적 추론 자체를 측정하려는 연구 흐름도 함께 나타났다.
원문 트윗 1개 보기

Hollow-Core Fiber의 데이터 전송 속도포스트 1

Relativity Networks가 기존 광섬유보다 데이터 전송을 30% 빠르게 하는 hollow-core fiber 기술을 취급한다는 내용이 공유됐다.

  • 데이터 전송 인프라에서는 기존 광섬유의 전달 속도를 높이는 방식이 관심사이며, hollow-core fiber는 아직 드물게 배치된 기술로 소개됐다. 광섬유 내부 구조를 바꾸는 접근을 통해 데이터가 기존 방식보다 빠르게 전달되도록 한다.
  • 원문은 hollow-core fiber가 conventional fiber보다 데이터를 30% 빠르게 전송한다고 밝혔다. 적용 환경, 지연시간 측정 조건, 실제 배치 규모는 게시물에 포함되지 않았다.
  • 전송 속도 수치는 모델 학습·추론 장비 자체가 아니라 데이터 이동 경로도 AI 인프라 성능에 영향을 줄 수 있다는 관점을 제공하지만, 해당 게시물은 AI 적용 사례를 직접 제시하지 않았다.
원문 트윗 1개 보기

용어 해설

에이전트 실행 기반(Agent Harness)
장시간 작업에서 문맥을 유지하고 도구 호출 순서, 하위 에이전트 위임, 사람 승인, 코드 샌드박스 실행, 오류 추적을 관리하는 실행 인프라이다.
사람 개입형 검토(Human-in-the-Loop)
에이전트가 중요한 작업을 실행하기 전에 사람의 승인을 거치도록 구성하는 방식이다. 결과의 실행 권한을 자동화 흐름 안에 남겨두는 역할을 한다.
샌드박스(Sandbox)
에이전트가 코드를 실행할 때 작업 공간과 영향을 제한하는 격리 환경이다. 원문에서는 에이전트 인프라가 갖춰야 할 기능 중 하나로 제시됐다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 19.수집 2026. 08. 19.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.