본문으로 건너뛰기

DeepSeek 비전 weights 공개, Hy4·로컬 에이전트 성능, Agent 중심 개발과 AI 인프라 투자

비전 모델 weights 공개와 로컬 Agent 성능 검증, 코드 생성형 소프트웨어 구조, 공공 조달·전력 인프라 확장

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 기간에는 DeepSeek-V4-Flash-Vision-Exp의 weights 공개와 API 출시가 맞물리며 native vision과 multimodal agent 활용 범위가 넓어졌다. 모델 측면에서는 Hy4의 770B total·49B active·1M context 구성과 DeepSeek-V4-Flash EXL3-REAP의 128GB 로컬 실행 수치가 실제 사용 환경을 겨냥한 비교 기준으로 떠올랐다. 동시에 Agent가 작업마다 코드를 생성·실행·폐기하는 구조와 on-policy distillation 같은 post-training 기법이 모델 중심 개발 방식의 변화를 뒷받침했다. £100M 규모의 영국 공공 AI 조달과 250MW·$5B+ 인프라 계약은 에이전트 도입과 open source compute의 운영 조건을 바꾸는 사례로 나타났다.

𝕏 실시간 트렌드 토픽

🔥 DeepSeek-V4-Flash-Vision-Exp weights 공개와 native vision 확장포스트 2

DeepSeek가 DeepSeek-V4-Flash-Vision-Exp를 API Platform에 출시하고 Hugging Face에 weights를 공개하면서 text 능력을 유지한 실험적 multimodal model이 개발자 지원 단계로 들어갔다.

세부 내용 보기
  • DeepSeek-V4-Flash-Vision-Exp는 API Platform에 live 상태로 공개됐고, DeepSeek-V4-Flash와 agents·reasoning·world knowledge를 포함한 text capabilities가 같다고 제시됐다. SGLang Project는 Hugging Face weights를 바탕으로 support와 cookbook 업데이트를 준비한다고 밝혀, 이번 공개가 단순 발표보다 실행 환경 편입으로 이어지는 흐름임을 드러냈다.
  • 게시물에 인용된 DeepSeek 설명은 multimodal agent benchmarks에서의 성과를 언급했지만 구체적인 점수는 본문에 끝까지 제시되지 않았다. 따라서 확인 가능한 변화는 experimental multimodal model의 API 제공과 weights 공개이며, 성능 우위의 정량 비교는 제한된 상태다.
원문 트윗 2개 보기

📈 Hy4와 DeepSeek-V4-Flash의 실행 환경별 Agent 성능포스트 3

Tencent의 Hy4 preview와 DeepSeek-V4-Flash EXL3-REAP가 각각 engineering blind test와 128GB 로컬 환경 수치로 공유되며, 모델 비교의 기준이 leaderboard에서 실제 실행 조건으로 이동했다.

세부 내용 보기
  • Hy4는 770B total, 49B active per token, 1M context를 갖고 Codex picker에서 제공된다고 게시됐다. Tencent의 blind evaluation에서는 163명의 전문가가 203개 engineering task를 평가했고, Hy4가 GLM 5.3과 Kimi K3보다 앞섰으며 공개 SWE-Bench Pro 수치는 65.7로 제시됐다.
  • DeepSeek-V4-Flash EXL3-REAP는 3bpw로 양자화해 128GB 안에서 실행됐고 Terminal-Bench 2.1의 89개 작업에서 75.28%를 기록했다. 게시물은 점수 7포인트를 잃는 대신 Spark-class box에서 실행 가능한 점을 핵심으로 삼아, 실제 하드웨어에 맞는 모델 크기와 비용을 성능 판단에 결합했다.
원문 트윗 2개 보기

Agent가 코드 대신 runtime reasoning loop를 중심에 두는 소프트웨어 구조포스트 1

한 게시물은 Agent가 사전에 decision logic을 코드에 고정하는 대신 LLM reasoning loop에서 작업별 코드를 생성·실행·폐기하는 구조로 이동한다고 해석하며, 소프트웨어 엔지니어링의 핵심을 reasoning constraint boundary 설계로 옮긴다.

세부 내용 보기
  • 전통적인 소프트웨어는 if-else statements, state machines, algorithms에 사람의 판단을 미리 인코딩하지만, Agent 시스템에서는 LLM이 작업별 코드를 runtime에 만들고 실행한 뒤 버리는 흐름을 취한다고 설명됐다. 이 입력→추론→임시 코드 실행→폐기 과정에서는 코드가 시스템의 영구 중심이 아니라 보조 수단으로 바뀐다.
  • 게시물은 이런 변화를 단순한 productivity tool 개선이 아니라 software production paradigm의 구조적 대체로 규정했다. 다만 해당 관점은 게시자가 소개한 논문의 해석이며, 구체적인 benchmark나 구현 수치는 본문에 제시되지 않아 신뢰 가능한 reasoning boundary 설계가 후속 과제로 남는다.
찬성소수

Agent의 runtime reasoning loop가 고정된 decision logic을 대체하면 소프트웨어의 중심이 유지보수 가능한 코드에서 신뢰 가능한 reasoning constraint boundary로 이동한다는 관점이다.

원문 트윗 1개 보기

Md Ismail Šojal

@0x0SojalSec

3일 전

This paper makes you feel that discussions about AI will replace programmers might be heading in completely the wrong direction. The emergence of AI Agents isn't about making software engineers more efficient at their jobs, but about rendering the very act of permanently encoding decision logic into software increasingly unnecessary. What the author is describing is a more fundamental paradigm shift: The essence of traditional software engineering is humans hardcoding judgment logic into code if-else statements, state machines, algorithms these are all ways of pre-baking human decisions. But in Agent systems with LLMs as the core reasoning engine, code becomes a temporarily generated, use-and-discard tool. For each task, the Agent dynamically generates the needed code, executes it, and then discards it. Decisions are no longer pre-encoded but dynamically produced through LLM reasoning loops at runtime. This isn't incremental improvement it's a structural replacement of the software production paradigm. think the most noteworthy detail in this perspective is: This isn't just an upgrade to productivity tools; it's a transformation in the role of software as a concept itself. In the past, code was the center of the system, with Agent frameworks as the shell. Now, the LLM reasoning loop is the center, and code has become a temporary auxiliary inside that shell. If this trend continues, the core competency of software engineering might no longer be writing good code, but designing reliable reasoning constraint boundaries. In the past, focused on writing maintainable code; in the future, might need to focus more on designing reliable reasoning boundaries. Paper - http:// arxiv.org/html/2606.0560 8v1 …

💬 0 1 0👁 199

On-Policy Distillation과 post-training의 Agent 성능 개선포스트 1

모델 자체 rollout과 denser supervision을 결합하는 On-Policy Distillation이 일반적인 post-training 이후 frontier lab이 성능을 더 끌어올리는 방법으로 공유됐다.

세부 내용 보기
  • On-Policy Distillation은 모델이 직접 만든 rollout을 학습에 다시 넣고 denser supervision으로 보정하는 방식이다. 게시물은 On-policy와 off-policy, Forward KL·Reverse KL·JSD, RL·OPD·SFT·DPO의 선택, self-distillation의 privileged information을 30분 시각 자료의 구성으로 묶었다.
  • 이 방식은 LLM training의 final stages에서 유용한 technique로 평가됐지만, 해당 게시물에는 특정 모델의 개선 폭이나 benchmark 점수가 제시되지 않았다. 따라서 이번 기간에 확인된 근거는 방법의 처리 절차와 비교 축이며, 실효성의 정량 검증은 별도로 필요하다.
원문 트윗 1개 보기

📈 £100M 영국 공공 AI 조달과 start-up 진입 조건포스트 1

UK Sovereign AI가 영국 AI 기업을 대상으로 £100M 계약을 배정하는 rapid procurement scheme을 출범시키며, NHS·Defence·public compute·safe AI agent adoption을 공공 적용 영역으로 묶었다.

세부 내용 보기
  • 기존 영국 정부 조달이 innovative British start-up에 불리했다는 문제를 배경으로, 새 scheme은 turnover minimums를 없애고 첫날부터 departmental champions를 배치하며 upfront payments와 streamlined applications를 제공한다. 기업은 IP를 보유한 채 eligibility를 확인하고 네 가지 초기 영역에 입찰하는 구조다.
  • 초기 scheme은 더 생산적인 NHS용 AI, Defence 환경 전반의 AI 통합, public compute 효율화, AI agents의 안전한 도입으로 구성됐다. 게시물에 따르면 계약 규모는 £100M이며, 이 방식은 제품 성능 수치보다 공공기관의 구매 절차와 start-up의 현금흐름·IP 조건을 바꾸는 산업 인프라 사례다.
원문 트윗 1개 보기

📈 전력·데이터센터 규모가 결정하는 open source AI 확장포스트 1

Together Compute가 HUMAIN과 사우디아라비아에 250MW 데이터센터를 구축하는 $5B+ 연간 매출 계약을 발표하며, open source AI 확장의 병목으로 전력과 대규모 compute 확보를 부각했다.

세부 내용 보기
  • 계약은 250MW 데이터센터와 $5B+ annualized revenue를 포함하고 HUMAIN과 함께 사우디아라비아에 구축된다. Together Compute는 Power가 현재 AI의 실제 bottleneck이며, 대부분의 기업이 자체 balance sheet만으로 접근하기 어려운 규모의 문제를 이 거래가 해결한다고 설명했다.
  • 게시물은 closed models가 수년간 hyperscalers의 compute 자금 지원을 받았고 open source가 이제 따라잡기 시작했다고 연결했다. 같은 작성자의 연속 포스트를 하나의 흐름으로 묶으면, 모델 공개만으로는 충분하지 않고 전력·데이터센터·운영 자본이 open source 확장의 입력 조건이라는 산업 구조 변화다.
원문 트윗 1개 보기

TurboVec의 저메모리 로컬 검색과 Agent 관측성 도구포스트 2

TurboVec는 Google의 TurboQuant를 사용해 AI 앱 검색 데이터를 저장하는 메모리를 31GB에서 4GB로 줄였고, W&B ARIA는 Agent 대화 안에 실제 실험 run 차트를 삽입하는 기능을 추가했다.

세부 내용 보기
  • TurboVec는 느린 setup step을 건너뛰는 TurboQuant 기반으로 16배 적은 memory를 사용하고, FAISS보다 빠른 search와 Mac·standard server 실행을 지원한다고 게시됐다. Python에서 offline으로 동작하며 LangChain·LlamaIndex에 연결되므로, 데이터가 기기 밖으로 나가지 않는 검색 애플리케이션 구현 경로를 제공한다.
  • W&B ARIA는 Agent의 분석 결과 아래에 실제 run data의 line plot과 bar chart를 live W&B panel로 렌더링하고, 차트 hover를 Workspace와 동기화한다. 두 사례 모두 Agent를 연결하는 데 그치지 않고 검색 메모리와 실험 검증 결과를 로컬 실행·대화형 시각화로 처리해 개발 workflow의 관측 가능성을 높이는 도구 층을 형성한다.
원문 트윗 2개 보기

Qwen Image 3.0 Pro와 Wan 3.0의 이미지-영상 제작 흐름포스트 1

Alibaba Wan의 게시물은 Qwen Image 3.0 Pro로 이미지를 만들고 Wan 3.0으로 cinematic video로 확장하는 image-to-motion workflow를 MotionMux 사례와 함께 공유했다.

세부 내용 보기
  • 작업 흐름은 Qwen Image 3.0 Pro가 시작 이미지를 만들고 Wan 3.0이 이를 움직이는 영상으로 변환하며, MotionMux와 GRACEncxl이 제작 과정에 포함되는 순서다. 인용된 사례는 이미지와 영상의 담당 모델을 분리해 하나의 creative workflow로 연결하는 방식이다.
  • 게시물은 이 과정을 The Inheritance라는 작품으로 제시하고, human creation·nature·memory를 다루는 창작 의도를 덧붙였다. 구체적인 생성 시간이나 품질 benchmark는 없으므로, 이번 사례에서 확인되는 근거는 모델별 입력·처리·출력의 연결 구조와 cinematic video 제작 적용이다.
원문 트윗 1개 보기

용어 해설

온폴리시 증류(On-Policy Distillation)
모델이 직접 생성한 rollout을 학습 자료로 사용하고 더 촘촘한 supervision을 결합하는 post-training 기법이다. RL·SFT·DPO와 선택 기준을 비교하며 최종 학습 단계의 성능 개선에 활용된다.
Terminal-Bench 2.1
터미널 기반 작업 수행 능력을 측정하는 benchmark다. DeepSeek-V4-Flash EXL3-REAP는 89개 작업을 독립적으로 평가해 75.28%를 기록했고, 128GB 환경에서 실행 가능한 점이 핵심이다.
SWE-Bench Pro
소프트웨어 엔지니어링 작업에서 모델의 문제 해결 성능을 측정하는 benchmark다. Hy4의 공개 수치로 65.7이 제시됐으며, Tencent의 자체 blind test와 함께 비교 근거로 쓰였다.
검색 증강 생성(retrieval-augmented generation (RAG))
AI 애플리케이션이 외부 데이터를 검색한 뒤 그 결과를 LLM의 입력 문맥으로 주입하는 구조다. 게시물에서는 vector database, memory, function calling, tool integration과 함께 애플리케이션 구성 요소로 제시됐다.
Model Context Protocol(MCP)
AI 애플리케이션과 외부 도구·데이터를 연결하는 통합 방식으로 언급됐다. 게시물에서는 Python 기반 Generative AI와 Agentic AI workflow, multi-agent systems를 구성하는 요소 중 하나로 포함됐다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 31.수집 2026. 08. 31.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.