TL;DR
이번 기간에는 Fable이 Astra보다 다중 에이전트 오케스트레이션에 적합하다는 실사용 경험과, Astra를 Hermes에서 계속 다듬으려는 흐름이 이어졌습니다. 로봇 분야에서는 Motus2가 정책·시뮬레이터·가치 모델을 하나로 묶어 행동을 상상하고 평가하는 월드 모델 구조로 5개 정교 조작 작업에서 평균 84% 성공률을 기록했습니다. 실시간 추론에서는 로컬 모델의 3Hz 수준 추적과 200ms 이하 지연 목표가 GPT-6 Astra Ultra의 높은 토큰·처리 시간 비용과 대비됐고, vLLM은 MiniCPM5-2B에 131K native context와 Tool Calling을 지원했습니다. Codex의 모바일 기반 연구 실험 실행, Qdrant의 벡터 검색 기술 행사, Hugging Face와 NVIDIA의 협력 의향도 개발 인프라와 오픈 모델 생태계의 변화로 묶였습니다.
𝕏 실시간 트렌드 토픽
🔥 Fable 중심의 다중 에이전트 오케스트레이션포스트 3
Fable이 서브에이전트 조율과 실행 궤적 검토를 맡고 Astra가 구현을 수행하는 구성이 실제 리팩터링 세션에서 더 안정적으로 작동했다는 경험이 모였습니다.
세부 내용 보기
- Astra가 여러 방식의 서브에이전트 오케스트레이션에 실패한 뒤 리팩터링 세션을 보고 Fable을 오케스트레이터로 쓰라고 권했고, Fable은 19시간 동안 1,390개 서브에이전트를 한 세션에서 문제없이 운용했다는 사례가 나왔습니다. Fable은 각 trajectory를 검토하고 harness 개선점을 제안하며 시스템 전체를 조율하는 반면 Astra는 구현 서브에이전트 역할을 맡는 구조여서, 역할을 분리할수록 대규모 작업의 실행 안정성을 확보하는 방식입니다.
- Hermes에서 Astra를 최소 일주일간 주력으로 사용하며 품질을 끌어올리겠다는 계획도 함께 제시됐고, 이는 오케스트레이터와 구현 에이전트의 역할을 고정하기보다 실제 세션 결과에 따라 조정하는 운용 흐름으로 이어졌습니다.
원문 트윗 2개 보기

Teknium 🪽
Whoever said to use Fable as an orchestrator and Astra as the subagents for implementation was right - even Astra after failing all kinds of orchestration of subagents just looked at my refactor session run and said - Use Fable to orchestrate - lol
It's not, fable does it fine, fable reviewed all of its trajectories, there are some improvements to the harness it's suggesting, but fable handles the system like a champ - literally ran 1390 subagents over 19hrs in one session just a few days ago without issues..
📈 Motus2의 폐루프 로봇 월드 모델포스트 1
Motus2가 하나의 공유 모델로 정책·시뮬레이터·가치 모델을 수행하며 행동 예측과 정책 개선을 연결한 로봇 학습 구조가 소개됐습니다.
세부 내용 보기
- 기존 로봇 월드 모델이 예측·평가·정책 개선을 하나의 폐루프로 잇지 못한 문제에 대해, Motus2는 행동을 제안하고 시각적 결과를 상상한 뒤 점수를 매겨 정책을 개선하는 Model-Based Reinforcement Learning 구조를 사용합니다. 130K시간의 egocentric pretraining과 로봇 영역 적응을 거친 뒤 다섯 가지 정교 조작 작업에서 평균 84% 성공률을 기록했고, MBRL과 test-time planning이 성능을 더 높였습니다. 예측 결과가 곧 행동 선택과 정책 갱신으로 이어지므로 실제 로봇의 시행착오를 줄이는 데 의미가 있습니다.
📈 로컬 실시간 추론과 Astra Ultra의 비용 격차포스트 1
로컬 모델의 추적·지능 처리 속도가 3Hz 수준에 도달한 가운데, GPT-6 Astra Ultra의 정밀한 영상 작업은 처리 시간과 토큰 비용을 크게 요구한다는 대비가 나왔습니다.
세부 내용 보기
- 테니스공 추적 사례에서 GPT-6 Astra Ultra는 3개 병렬 에이전트로 공을 주석 처리하는 데 8분 35초와 17,611토큰을 사용했고, 전체 workflow에는 11분 49초와 30,481토큰이 들었습니다. 반면 로컬 모델은 현재 추적과 지능 처리를 약 3Hz로 수행하며, Astra 수준의 지능을 10~30Hz와 200ms 미만 지연으로 실행하는 시점이 1년 이내일 수 있다는 전망이 제시됐습니다. 같은 시각 작업에서 중앙 처리형 고성능 모델의 품질과 로컬 모델의 반복 처리 속도·비용이 핵심 비교축이 됐습니다.
GPT-6 Astra Ultra는 복잡한 추적 workflow에서 높은 처리 비용을 보였고, 로컬 모델은 낮은 지연과 반복 실행에 초점을 둔 속도 개선 경로를 보였습니다.
➖ 모바일에서 원격 GPU 실험을 실행하는 Codex포스트 1
Codex를 휴대전화에서 호출해 SSH로 연결된 GPU Slurm 클러스터의 연구 실험을 구현하고 테스트하는 작업 방식이 공유됐습니다.
세부 내용 보기
- 연구 아이디어가 생기면 휴대전화에서 Codex에 구현과 테스트를 지시하고, 원격 GPU Slurm 클러스터에서 실험을 실행하는 흐름이 사용됐습니다. ChatGPT Desktop의 SSH 연결과 Codex를 결합해 노트북 앞에 머무는 시간을 줄이면서도 코드 작성과 실험 검증을 이어가는 방식이며, 연구 작업의 입력 장치와 실행 환경을 분리한 사례입니다.
📈 vLLM의 MiniCPM5-2B 초기 지원포스트 1
stable vLLM이 MiniCPM5-2B를 출시 당일부터 지원하며 긴 문맥과 동일 체크포인트의 Think·No-Think 모드, Tool Calling을 연결했습니다.
세부 내용 보기
- MiniCPM5-2B는 2.6B dense model로 131K native context와 같은 체크포인트에서 Think·No-Think 모드를 제공하며, stable vLLM은 minicpm5 parser를 통해 Tool Calling을 지원합니다. 모델을 LlamaForCausalLM 형식으로 유지한 채 vLLM의 실행 경로에 연결했기 때문에 긴 문맥 처리와 도구 호출을 별도 서빙 계층에서 활용할 수 있는 구성이 됐습니다.
➖ Qdrant의 벡터 검색 기술 행사포스트 1
Qdrant가 벡터 압축·임베딩 기하·hybrid search·대규모 벡터 평가를 중심으로 한 기술 행사를 예고했습니다.
세부 내용 보기
- 9월 16~17일 행사에서 Qdrant 팀과의 오피스 아워, 벡터·임베딩·에이전트 구축물을 공유하는 데모 세션, 4시간 이상의 Vector Space Stream이 이어집니다. 기술 세션은 vector compression, Qdrant Edge, embedding geometries, hybrid search, extreme-scale vector evaluation을 입력 주제로 삼고 연구·실험·구축 사례를 공유하는 구성이라, 벡터 검색 시스템의 저장 효율과 검색 품질을 함께 다루는 자리입니다.
📈 Hugging Face와 NVIDIA의 오픈 모델 협력 의향포스트 1
Hugging Face와 NVIDIA의 협력 의향에 대해 주요 기술 인사와 커뮤니티가 오픈 모델·오픈소스 생태계 확대라는 방향으로 긍정적 반응을 보였습니다.
세부 내용 보기
- Hugging Face 측 게시물에는 Satya Nadella, Sundar Pichai, Mira Murati, Ali Godsi 등 여러 인사가 오픈 모델 생태계와 접근성 강화를 지지하는 발언을 남겼고, 게시자는 향후 수개월과 수년 동안 행동으로 성과를 입증하겠다고 밝혔습니다. 발언의 공통점은 open models, open weights AI, open-source 도구에 대한 접근성을 넓히는 데 있으며, NVIDIA의 지원이 Hugging Face와 오픈소스 커뮤니티의 확장 기반으로 해석됐습니다.
공개된 반응은 Hugging Face와 NVIDIA의 협력이 오픈 모델과 오픈소스 도구의 접근성을 넓히는 방향이라는 데 모였습니다.
➖ GitHub 이슈 라벨 관리 기능포스트 1
GitHub가 긴 이슈 라벨 목록에서 필요한 라벨을 빠르게 찾도록 Suggested Labels를 제공하고, 사용하지 않는 라벨을 Archive Labels로 정리하는 기능을 일반 공개했습니다.
세부 내용 보기
- 라벨이 계속 늘어나는 저장소에서는 목록 탐색과 정리가 관리 부담이 되는데, GitHub의 새 기능은 추천 라벨로 선택 과정을 줄이고 보관 라벨로 기존 목록을 정돈하는 입력·분류 흐름을 제공합니다. 이슈 라벨을 삭제하지 않고 보관할 수 있어 장기간 운영되는 저장소에서 목록을 유지하면서 검색 속도를 높이는 방식입니다.
용어 해설
- 모델 기반 강화학습(Model-Based Reinforcement Learning)
- — 환경을 직접 반복해서 실행하는 대신 월드 모델이 행동의 결과를 예측하고, 그 예측을 평가해 정책을 개선하는 학습 방식입니다. Motus2는 하나의 모델을 정책·시뮬레이터·가치 모델로 함께 사용합니다.
- 월드 모델(World Model)
- — 행동이 환경에 미칠 결과를 내부적으로 예측하는 모델입니다. 로봇 입력과 시각적 결과를 연결해 실제 동작 전에 후보 행동을 평가하는 데 쓰입니다.
- 네이티브 컨텍스트(Native Context)
- — 모델이 별도 확장 절차 없이 기본적으로 처리할 수 있는 입력 문맥 길이입니다. MiniCPM5-2B는 131K native context를 지원한다고 발표됐습니다.
- 도구 호출(Tool Calling)
- — 언어 모델이 외부 함수나 도구에 전달할 인자와 호출 시점을 생성하는 기능입니다. vLLM은 MiniCPM5-2B를 위해 minicpm5 parser를 통한 Tool Calling을 지원합니다.
- 벡터 검색(Vector Search)
- — 텍스트나 이미지에서 변환한 벡터 사이의 거리를 계산해 의미적으로 가까운 항목을 찾는 검색 방식입니다. Qdrant 관련 행사에서는 압축, 임베딩 기하, hybrid search, 대규모 평가를 다룹니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.