본문으로 건너뛰기
X (Twitter)조회 1

DeepSeek V4 출시와 에이전트 실행층, 로컬 생성·업무형 평가의 확장

DeepSeek V4의 에이전트 기능 강화와 실행 인프라 공개, 영상·문서·접근성 모델의 실사용 확장

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 기간에는 DeepSeek-V4-Pro와 V4-Flash의 Agent 기능, 가변 reasoning effort, OpenAI Responses API 지원, off-peak API 요금이 함께 공개되며 모델 출시와 운영 비용 조정이 한 흐름으로 이어졌다. DeepSeek Harness는 Cordis 메타 프레임워크를 기반으로 한 Agent Harness 코드베이스를 MIT 라이선스로 공개했고, NVIDIA skills의 Cursor 연동과 Snowflake Cloud Agents·Adaptive Compute도 도구 실행을 제품 환경에 붙이는 방식이다. Runway Dev에서는 주말 동안 만든 영상 애플리케이션과 Scene Fixer가 등장했으며, 입력 영상의 의상·소품·조명·시선 불일치를 찾아 해당 부분만 수정하는 처리 흐름이 제시됐다. Test-Time Training과 ARC-AGI, SL2T의 수어-텍스트 변환, ExtractBench의 기업 문서 추출처럼 모델의 일반화·접근성·업무 정확도를 구체적 과제로 측정하려는 흐름도 함께 나타났다.

𝕏 실시간 트렌드 토픽

🔥 DeepSeek-V4-Pro 출시와 추론 비용·로컬 실행 조정포스트 5

DeepSeek가 V4-Pro와 V4-Flash의 Agent 기능, 작업 난도별 reasoning effort, OpenAI Responses API 지원을 공개하고 API에 peak·off-peak 요금을 적용했다. V4-Flash의 로컬 실행과 생성 사례도 함께 확산됐다.

  • DeepSeek는 V4-Pro를 출시하면서 단순 작업에는 낮은 reasoning effort, 일상적인 Agent workflow에는 높은 수준, 복잡한 작업에는 최대 수준을 선택하는 구조를 넣었다. V4-Pro는 app·web의 Expert Mode와 API에서 사용할 수 있고, API 모델명은 바뀌지 않았으며 OpenAI Responses API와 Codex용 원클릭 설정을 지원한다.
  • V4 라인업 출시와 함께 API 요금은 peak·off-peak 구간으로 나뉘고 off-peak 요금이 peak보다 50% 낮아졌다. 변경된 가격은 2026년 8월 16일 16:00 UTC부터 적용돼, workload를 시간대별로 배치하는 운영 방식과 직접 연결된다.
  • UnslothAI는 DeepSeek-V4-Pro quants의 로컬 실행 가능성을 기대했고, 다른 게시물에서는 DeepSeek-V4-Flash를 4× RTX PRO 6000에서 실행하며 공식 weights, 500만 토큰 context, 초당 400 tokens, 원클릭 배포를 내세웠다. 별도 사례에서는 V4-Flash가 Gustave Doré 스타일 판화를 절차적으로 생성한 뒤 자체 vision 검토와 반복 수정을 거쳤다는 작업 흐름이 제시됐다.
원문 트윗 2개 보기

📈 오픈소스 에이전트 하네스와 실행 환경 통합포스트 4

DeepSeek Harness의 Developer Preview와 MIT 공개, NVIDIA skills의 Cursor 연결, Grokbot 기반 multi-agent 구성, Snowflake의 Cloud Agents·CoCo·Adaptive Compute가 에이전트 실행 환경의 확장을 가리킨다.

  • DeepSeek Harness는 Developer Preview로 공개됐고, 전 세계 Agent Harness 개발자를 대상으로 코드베이스를 MIT 라이선스로 열었다. Cordis 메타 프레임워크를 기반으로 한 프로젝트라는 점에서 모델 출시와 별도로 Agent 애플리케이션을 구성하는 실행층에 초점이 맞춰졌다.
  • NVIDIA skills는 Cursor에서 NVIDIA plugin을 추가하는 방식으로 연결되며, CUDA·NeMo·RAG를 포함한 30개 이상 제품의 300개 이상 skill을 Agent가 활용한다. 사용자가 구축 대상을 입력하면 관련 skill을 고르고 그 절차를 따르는 입력·선택·실행 흐름이다.
  • 한 사례에서는 Grokbot을 여러 subscription의 모델을 specialist Agent로 나누고 ACP를 통해 서로 통신하며 다른 CLI·harness와 도구를 제어하는 multi-agent 구조로 바꿨다. Snowflake는 CoCo Desktop을 governed Snowflake 환경 안의 IDE로 제공해 data model과 access policy를 바로 참조하게 했고, Cloud Agents는 브라우저에서 prompt를 남긴 뒤 Snowflake 관리 인프라에서 작업을 계속 수행한다.
  • Snowflake는 CoCo Desktop의 복잡한 작업 처리 속도가 최대 2배 빠르고 third-party assistant 대비 tokens가 51% 적다고 밝혔다. Adaptive Compute는 AI workload의 성능과 규모를 자동 조정하고, iOS용 Mobile·Artifacts·Sharing·Deep Research 기능도 GA 단계에 들어갔다.
원문 트윗 2개 보기

📈 Runway Dev 기반 영상 애플리케이션과 부분 수정포스트 3

Runway API Hackathon에서 주말 제작 영상 도구 세 가지가 공개됐고, Scene Fixer는 영상 전체를 다시 생성하지 않고 불일치한 시각 요소만 찾아 수정하는 방식을 내세웠다.

  • Runway Dev API Hackathon의 세 수상작은 주말 동안 제작됐으며, 1위 Quigo는 수동 영상을 interactive story로 바꾸고 2위 ClinicalSim은 virtual patient와 어려운 대화를 연습하게 한다. 두 사례는 영상 생성 API를 단순 출력이 아니라 상호작용과 시뮬레이션의 입력·응답 구조에 연결한다.
  • 3위 Scene Fixer는 영상 sequence를 입력받아 vision AI가 wardrobe, props, lighting, eyeline의 불일치를 찾고 사용자가 수정 지점을 확인하면 Aleph가 해당 부분만 고친다. 나머지 frame은 동일하게 유지하고 audio도 보존해 전체 장면을 reroll하지 않는 처리 방식이다.
  • Runway는 세 프로젝트가 Runway Dev의 media API platform 위에서 만들어졌다고 밝혔다. 플랫폼에 Runway의 creative expertise와 다른 frontier lab 모델을 활용할 수 있는 환경이 결합돼, 짧은 제작 기간 안에 영상용 서비스의 입력·검출·부분 수정·출력 단계를 구성하는 기반이 된다.
원문 트윗 2개 보기

수어·망막 영상으로 넓어지는 의료·접근성 AI포스트 2

SL2T는 수어를 텍스트로 바꾸는 기능을 Android 환경에 연결했고, 다른 게시물은 망막 영상에서 의사가 직접 얻기 어려운 정보를 AI가 예측하는 의료 활용 방향을 짚었다.

  • SL2T는 Deaf community와 협력해 만든 sign-language-to-text model로, American Sign Language를 English로 변환하는 기능부터 Pixel 11에서 시작한다. 사용자는 타이핑 대신 Gboard와 Live Transcribe에 직접 수어를 입력하고, 입력된 동작을 텍스트로 바꾸는 경로를 사용한다.
  • 망막 영상 관련 게시물은 AI가 의사가 스스로 얻지 못한 정보를 retinal image에서 예측할 수 있다고 적었다. 제시된 핵심은 의료진을 대체하는 흐름이 아니라, 하나의 영상 modality에서 사람이 직접 처리하기 어려운 신호를 추출해 다른 의료 modality로 확장할 가능성이다.
찬성소수

SL2T와 망막 영상 사례는 AI를 의료진 대체보다 인간이 직접 얻기 어려운 정보와 입력 방식을 확장하는 도구로 쓰는 방향에 무게를 둔다.

원문 트윗 2개 보기

📈 복잡한 기업 문서 추출의 벤치마크 경쟁포스트 1

LlamaExtract Agentic Plus가 복잡한 기업 문서를 정제된 구조화 출력으로 바꾸는 모델·하네스 엔진으로 출시됐고, ExtractBench가 문서 길이·지각·표 구조·업무 영역별 비교 기준으로 함께 공개됐다.

  • LlamaExtract Agentic Plus는 다양한 길이와 schema의 복잡한 문서를 입력받아 clean하고 grounded한 structured output으로 변환하는 document extraction model+harness engine이다. ExtractBench에서는 short·medium·long 문서, long-list·needle in a haystack·dense docs 과제, rotated·scanned·handwriting 인식, merged headers와 cross-page tables 같은 표 구조를 나눠 측정한다.
  • 출시 게시물은 coding agent harness를 활용한 document extraction 솔루션들과 비교했으며, LlamaExtract Agentic Plus의 가격이 Claude Code와 Codex의 25~50% 수준이라고 밝혔다. 정확도만이 아니라 실제 기업 문서의 길이·형식·업무 영역과 가격을 함께 평가하는 구조가 핵심이다.
원문 트윗 1개 보기

ARC-AGI에서 재점화된 Test-Time Training포스트 1

ARC 관련 데이터셋에서 Test-Time Training이 강한 성능을 낸다는 관찰을 바탕으로, 테스트 시점 gradient update가 효율적 일반화와 모델 메모리의 새로운 경로가 될 수 있다는 해석이 이어졌다.

  • 게시물은 ARC 문제의 실제 정답으로 모델을 학습하지 않았는데도 작동했다는 점을 일반화 범위의 단서로 삼았다. ARC-AGI benchmark는 효율적 일반화를 이해하기 위한 초대장으로 제시됐고, Test-Time Training은 추론 중 gradient update를 적용하는 방식으로 연결된다.
  • 인용된 설명에 따르면 2024 ARC Prize 경쟁 이후 Test-Time Training이 널리 알려졌으며, 당시까지 ARC 1·2가 TTT가 강하게 앞선 유일한 데이터셋으로 언급됐다. 이를 통해 더 작으면서도 능력과 실제 memory를 갖춘 모델로 이어질 가능성이 논점이 됐다.
찬성소수

ARC-AGI에서의 성능 우위와 학습에 없던 정답에 대한 작동 사례가 테스트 시점 업데이트의 일반화 가능성을 뒷받침한다는 입장이다.

원문 트윗 1개 보기

📈 6GB VRAM을 겨냥한 로컬 영상 생성 스튜디오포스트 1

한 오픈소스 도구가 WAN 2.2, LTX-2, Hunyuan Video, Flux를 묶어 6GB VRAM의 consumer GPU에서 브라우저 기반 영상 생성을 실행하는 구성을 내세웠다.

  • 게시물의 도구는 WAN 2.2, LTX-2, Hunyuan Video, Flux를 내장하고 one-click install script로 로컬에 설치한 뒤 browser에서 영상을 생성한다. 입력과 생성 과정을 외부 업로드 없이 로컬 GPU에서 처리하는 구성이며, subscription과 watermark가 없다는 조건도 함께 제시됐다.
  • 실행 목표가 6GB VRAM의 consumer GPU로 명시돼 대형 서버 환경이 아닌 개인 장비에서 여러 video model을 한 스튜디오 안에 묶는 방식이다. 다만 게시물에는 생성 속도나 품질 benchmark 수치가 없어 성능 우열까지는 판단할 근거가 없다.
원문 트윗 1개 보기

W&B가 내세운 반복형 모델 개발 루프포스트 1

W&B는 모델 개발을 배포 후 production 관찰, 학습, 재훈련, 재배포로 이어지는 반복 루프로 규정하고, 10억 회의 run에서 얻은 경험을 이 운영 구조의 기반으로 연결했다.

  • W&B의 게시물은 개발 흐름을 ship한 뒤 production을 watch하고, 결과에서 learn한 뒤 retrain하고 다시 ship하는 순환으로 묶는다. 개별 실험 하나의 성공보다 운영 데이터가 다음 학습과 배포로 돌아오는 반복 구조를 중심에 둔 설명이다.
  • W&B는 10억 회의 run이 이 loop에 필요한 요소를 파악하는 데 기여했다고 밝혔다. 게시물에는 실패한 run의 수나 구체적인 제품별 성능 수치가 없어, 이번 기간에는 반복형 MLOps 원칙과 회사의 운영 경험까지로 범위를 한정한다.
원문 트윗 1개 보기

용어 해설

에이전트 하네스(Agent Harness)
에이전트가 여러 도구와 작업 흐름을 실행하도록 조정하는 실행 계층이다. DeepSeek Harness처럼 모델 자체가 아니라 도구 호출, 상태 관리, 작업 순서와 같은 운영 구조를 묶어 에이전트 애플리케이션의 뼈대를 제공한다.
OpenAI Responses API
모델이 대화 응답과 도구 사용을 처리하도록 설계된 API 인터페이스다. DeepSeek-V4-Pro는 이 인터페이스를 기본 지원하고 Codex와의 설정 흐름에도 맞춰져, 기존 API 형식과의 연결 부담을 줄인다.
Cordis 메타 프레임워크(Cordis Meta-Framework)
DeepSeek Harness의 기반으로 언급된 메타 프레임워크다. 에이전트 하네스를 구성하는 공통 실행 구조와 확장 지점을 제공하며, 해당 프로젝트는 이를 활용해 개발자용 하네스 코드를 공개한다.
테스트 시점 학습(Test-Time Training)
모델이 추론 시점에 입력과 관련된 gradient update를 수행해 작업에 맞게 내부 상태를 조정하는 방식이다. ARC-AGI 사례에서는 학습 데이터에 실제 정답이 포함되지 않아도 일반화와 메모리 확장 가능성을 살피는 축으로 다뤄진다.
ARC-AGI
새로운 문제에 대한 효율적 일반화를 측정하는 벤치마크 계열이다. 원문에서는 Test-Time Training이 ARC 관련 데이터셋에서 강한 성능을 냈다는 관찰과 함께, 시험 시점 업데이트의 효과를 가늠하는 기준으로 언급된다.
ExtractBench
복잡한 기업 문서에서 정보 추출 성능을 측정하는 벤치마크다. 문서 길이, 검색 대상 위치, 스캔·필기 인식, 복잡한 표 구조와 업무 영역을 나눠 LlamaExtract Agentic Plus의 성능을 비교하는 데 쓰인다.
Adaptive Compute
AI workload의 성능과 규모를 자동으로 조정하는 Snowflake 기능이다. workload 수요를 미리 예측해 warehouse 크기를 수동으로 정하는 대신, 실행 조건에 맞춰 성능과 확장 수준을 조율한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 13.수집 2026. 08. 13.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.