본문으로 건너뛰기
X (Twitter)조회 1

코딩 에이전트의 세션 확장, 생성 모델의 영상 제어, 로컬 추론과 운영·평가 계층

코딩 에이전트의 세션 확장과 영상 생성 제어, Qwen 로컬 추론, AI 운영·평가 계층

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 기간에는 코딩 에이전트가 단일 세션을 넘어 세션 간 메시지 교환과 subagent orchestration을 지원하는 방향으로 확장됐습니다. Gemini Omni 1.1 Flash와 Grok Imagine은 장면 확장, 프레임 보간, 객체 교체, 영상·음성 생성 기능을 앞세웠습니다. Qwen 계열 로컬 실행 사례는 125B MoE 모델을 4090과 75GB RAM 조합에서 구동하고, 4B 모델을 Ryzen 5 CPU에서 11.4 tok/s로 실행하는 경로를 제시했습니다. 동시에 AI Gateway의 사용자별 예산, Markdown 기반 design system, LoopArena의 장기 에이전트 평가처럼 운영·검증 계층을 구체화하는 흐름이 이어졌습니다.

𝕏 실시간 트렌드 토픽

📈 Muse Code의 베타 종료와 세션 간 협업 구조포스트 4

muse code가 베타를 종료하고 SDK developer preview와 월간 구독을 시작했습니다. 여러 세션이 서로 메시지를 주고받고 subagent workflow를 조율하는 구조가 코딩 에이전트의 기본 단위를 단일 세션에서 협업 세션으로 넓혔습니다.

세부 내용 보기
  • muse code는 터미널 기반 coding agent를 더 복잡한 engineering task에 맞추면서, 서로 영향을 주는 작업을 맡은 세션끼리 상태를 직접 공유하는 기능을 추가했습니다. 개발자는 한 세션의 결과를 복사해 다른 세션에 붙이는 대신 세션 간 메시지 교환과 subagent 팀 orchestration을 활용하는 흐름을 갖게 됐습니다.
  • 출시와 함께 SDK가 developer preview로 제공되고 월간 구독 플랜이 시작됐으며, 별도 포스트에는 월 $5부터 시작하는 계획이 적혔습니다. 이 구조는 완성된 에이전트를 사용하는 단계를 넘어 개발자가 자체 agent를 구축하고 여러 작업 흐름을 연결하는 사용 경로를 만들었습니다.
원문 트윗 2개 보기

Gemini Omni 1.1 Flash와 Grok Imagine의 영상 제어포스트 4

Gemini Omni 1.1 Flash가 장면 확장, 첫·마지막 프레임 보간, 4K 업스케일링을 내놓았고 Grok Imagine은 영상·음성 생성을 앞세운 장면 제작 공모를 열었습니다. 자연어로 영상 객체와 캐릭터를 교체하면서 장면 일관성을 유지하는 작업 흐름이 핵심입니다.

세부 내용 보기
  • Gemini Omni 1.1 Flash는 생성 영상에서 장면을 연장하고 첫 프레임과 마지막 프레임 사이를 보간하며 4K 업스케일링을 수행합니다. Google은 더 세밀한 creative control과 빠른 prototyping을 제공한다고 밝혔고, 다른 포스트에서는 자연어 요청으로 영상 속 객체나 캐릭터를 교체해도 장면의 일관성을 유지한다고 설명했습니다.
  • Grok Imagine은 Homer의 The Odyssey 장면을 영상과 음성 기능으로 제작하는 공모를 진행하고 상위 세 작품에 $100K, $50K, $25K를 지급한다고 안내했습니다. 두 흐름 모두 텍스트 지시를 단순한 영상 생성에 그치지 않고 장면 편집과 표현 제어로 연결하는 사용 사례를 앞세웠습니다.
원문 트윗 2개 보기

📈 장기 작업을 위한 Context 관리와 Persistent Agent 기능포스트 4

Tencent 연구는 에이전트가 작업 Context를 직접 관리하고 개별 Context 편집 단위에 credit을 배분하는 학습 방식을 다뤘습니다. Hermes Agent v0.21.0과 LangChain의 MCP 지원은 세션 지속성, 서버 연결, 에이전트 간 통신을 제품 기능으로 확장했습니다.

세부 내용 보기
  • 긴 작업에서는 여러 턴에 흩어진 정보를 검색하고 통합하며 유지해야 하므로, Tencent의 접근은 모델이 자신의 working context를 편집하고 각 편집의 기여도를 따로 계산하도록 구성됐습니다. Context를 고정된 대화 기록으로 두지 않고 작업 중 관리되는 상태로 취급하는 방식이 장기 작업의 정보 누락 문제를 겨냥합니다.
  • Hermes Agent v0.21.0은 Bots Mode, Agent 2 Agent Comms, Persistent Multi-Gateway Connections, Subagent Steering, Expanded Connectors Access를 추가했습니다. LangChain 쪽에서는 여러 MCP 서버 연결, OAuth, elicitation과 interrupts를 결합하는 API 지원을 준비하면서 외부 도구와 지속형 에이전트를 연결하는 실행 계층을 넓혔습니다.
원문 트윗 2개 보기

📈 Qwen과 DeepSeek의 로컬 추론 하드웨어 경계 확장포스트 3

Qwen3.8-Flash-Next의 125B MoE를 4090과 시스템 RAM 조합에서 실행하고 Qwen3.5-4B를 Ryzen 5 CPU에서 11.4 tok/s로 구동한 사례가 공유됐습니다. 전문가와 KV를 VRAM에 모두 넣지 않는 메모리 배치가 로컬 실행의 핵심 경로로 제시됐습니다.

세부 내용 보기
  • Qwen3.8-Flash-Next는 125B MoE 모델에서 4090에 attention을 유지하고 512개 전문가를 DDR4에 두는 구성을 사용했습니다. 포스트에 따르면 4090에서 21 t/s, 250k context, 364 t/s prefill을 기록했으며, Unsloth GGUF와 llama.cpp PR 27742가 실행 경로에 포함됐습니다.
  • Qwen3.5-4B는 CUDA나 offload 없이 6코어 Ryzen 5 노트북 CPU와 RAM만으로 11.4 tok/s를 기록했고, thread·KV·batch 조정이 적용됐습니다. DeepSeek V4 Flash Vision Exp도 2x NVIDIA DGX Sparks에서 1M context와 native vision을 로컬 실행하는 사례로 언급돼, cloud round-trip 없이 모델을 구동하는 선택지가 넓어지고 있습니다.
원문 트윗 2개 보기

Token 비용 통제와 Markdown 기반 Design System포스트 3

AI Gateway는 API key와 team·project 단위에 이어 사용자별 budget을 추가했고, DESIGN.md와 design.md는 에이전트가 브랜드 규칙을 읽고 평가·피드백 루프를 거치도록 구성됐습니다. 무제한 인프라 키와 일관성 없는 생성 결과를 각각 비용 거버넌스와 문서화된 규칙으로 제어하는 흐름입니다.

세부 내용 보기
  • AI Gateway는 사용자가 임의의 AWS 규모를 선택하듯 token 사용량을 소비하는 문제를 인프라 비용 관리와 같은 방식으로 다룹니다. per-key와 team·project budget에 per-user limit과 monthly refresh period를 추가해 사용자별 소비 상한을 설정하고 사용량을 관찰할 수 있게 했습니다.
  • DESIGN.md는 한 파일에 디자인 결정과 guidance를 기록하고, agent의 결과를 eval harness로 조정한 뒤 production feedback을 다음 실행에 되돌립니다. Markdown 문서가 생성 모델의 입력 규칙과 평가·개선 순서를 함께 담으면서 대규모 조직에서 design taste를 확장하는 운영 단위로 쓰였습니다.
원문 트윗 2개 보기

전문 데이터 Fine-tuning과 시간계열·양방향 멀티모달 모델포스트 3

TimesFM 3.0은 330M parameters의 open foundation model로 복잡한 multivariate time series를 zero-shot forecasting하고, Inkling은 25~100시간의 전문 오디오 Fine-tuning으로 음성의 미세한 세부 정보 복원을 강화했습니다. BIT 연구는 text-to-image와 image-to-text를 하나의 bidirectional diffusion process로 연결하는 방향을 다뤘습니다.

세부 내용 보기
  • TimesFM 3.0은 Hugging Face에 공개된 330m parameters 모델로, 복잡한 multivariate scenario에서 zero-shot time series forecasting을 수행하도록 설계됐습니다. 별도 학습 없이 여러 변수의 시계열 입력을 예측하는 open foundation model이라는 점이 새 use case의 기반으로 제시됐습니다.
  • Inkling은 작은 크기와 robustness를 기반으로 domain-specific Fine-tuning에 맞춰졌고, 25~100시간의 specialized audio를 추가 학습해 speech에서 미묘한 세부 정보를 복원하는 능력을 높였습니다. BIT는 텍스트와 이미지를 분리된 text-to-image·image-to-text 문제로 두지 않고 양방향 diffusion으로 연결하는 연구 방향을 내놓았습니다.
원문 트윗 2개 보기

📈 LoopArena로 측정하는 장기 코딩 에이전트의 외부 제어포스트 1

LoopArena는 코딩 에이전트 자체가 아니라 여러 실행 라운드를 조정하는 outer loop를 평가합니다. Controller가 매 라운드의 구조화된 요약을 읽고 고정된 Worker의 다음 행동·검증·종료 여부를 결정해 장기 작업에서 guidance와 실행 능력을 분리합니다.

세부 내용 보기
  • 긴 agent session에서는 오래된 진행 기록을 믿거나 필요한 검증을 건너뛰고, 예산을 잘못된 방향에 쓰거나 안전한 제출 전에 멈추는 실패가 발생합니다. LoopArena는 Worker를 고정해 결과가 Worker의 실행력 때문인지 Controller의 guidance 때문인지 구분할 수 있도록 설계됐습니다.
  • Controller는 각 라운드 뒤 structured summary를 입력으로 받아 별도의 fixed Worker에게 다음에 수행하거나 확인할 작업을 지시하고, 필요하면 중단을 결정합니다. 새 benchmark에서 full task 기준 최고 결과가 약 25%였다는 수치가 함께 언급돼, loop engineering의 효과를 측정할 별도 평가 계층이 필요하다는 점을 드러냈습니다.
원문 트윗 1개 보기

용어 해설

MCP
Model Context Protocol의 약어로, 에이전트가 외부 서버와 도구를 연결하는 규격입니다. 이 기간 포스트에서는 LangChain 에이전트가 여러 MCP 서버에 연결하고 OAuth와 사용자 입력 수집 흐름을 처리하는 기반으로 쓰였습니다.
전문가 혼합 구조(Mixture of Experts)
하나의 대형 모델을 여러 전문가 네트워크로 나누고 입력마다 일부 전문가만 활성화하는 구조입니다. Qwen3.8-Flash-Next 사례에서는 전문가를 VRAM이 아닌 시스템 RAM에 두어 대형 모델의 로컬 실행을 가능하게 했습니다.
KV 캐시(KV Cache)
Transformer가 이전 토큰의 Key와 Value를 저장해 다음 토큰 생성 때 같은 계산을 반복하지 않도록 하는 메모리 구조입니다. 로컬 추론 포스트에서는 KV 및 배치 조정이 CPU 환경의 토큰 처리 속도 향상에 사용됐습니다.
루프 엔지니어링(Loop Engineering)
코딩 에이전트의 한 번의 실행보다 여러 라운드에 걸친 점검·수정·재실행 흐름을 설계하는 방식입니다. LoopArena는 Controller가 매 라운드 요약을 읽고 Worker의 다음 행동이나 종료 여부를 결정하는 구조로 이를 평가했습니다.
Fine-tuning
기존 모델에 특정 분야의 데이터를 추가 학습시켜 해당 작업의 성능을 조정하는 방법입니다. Inkling 사례에서는 25~100시간의 전문 오디오를 사용해 음성의 미세한 세부 정보를 복원하는 능력을 높였습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 01.수집 2026. 09. 01.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.