본문으로 건너뛰기
X (Twitter)조회 1

Hy4·Wan3.0·Qwen3.8-Flash 확산과 저비용 AI 연구·코딩 에이전트 운영

긴 context 모델의 배포, 30초 멀티모달 영상 제작, 저비용 학습과 agent harness 운영

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 기간에는 770B MoE인 Hy4-preview가 1M context와 vLLM·NVIDIA Blackwell 실행 경로를 함께 내놓으며 오픈 모델의 실제 배포 조건을 넓혔습니다. Wan3.0은 30초 영상과 동기화 오디오, 참조 입력, 장면 확장·재스타일링을 묶어 여러 제작 서비스로 확산했습니다. Qwen3.8-Flash는 OpenCode Go와 GMI Cloud에 들어가 125B 전체·6B 활성 구성과 멀티모달·긴 context를 내세웠습니다. 연구 쪽에서는 Co-Scientist의 자율 실험, RTX 5090 기반 Puro-2B 학습, LeVJEPA의 사전학습 비용 절감, Uber의 agent harness 운영 수치가 함께 부각됐습니다.

𝕏 실시간 트렌드 토픽

🔥 Hy4-preview의 770B MoE와 vLLM 실행 경로포스트 7

Tencent Hunyuan이 770B 전체·49B 활성 파라미터의 Hy4-preview를 공개했고, vLLM은 출시 시점부터 실행을 지원했습니다. 1M context를 유지하면서 질의당 2048개 토큰만 처리하는 희소 구조와 NVIDIA Blackwell 경로가 함께 제시됐습니다.

세부 내용 보기
  • Hy4-preview는 코드·문서·분석·과학 연구용 open weights 모델로 공개됐으며, 770B 전체 파라미터 중 49B만 활성화하는 MoE 구조와 256개 routed expert·하나의 shared expert를 사용합니다. WorkBuddy에서는 2주 동안 무료로 제공된다는 배포 방식도 함께 언급됐습니다.
  • 1M context를 그대로 모든 계산에 넣지 않고 각 질의가 2048개 토큰에만 주목하게 하며, 78개 레이어 중 21개만 자체 sparse index를 계산하고 나머지 57개는 이를 재사용합니다. 체크포인트에는 10B MTP 레이어가 포함되고 그중 0.7B가 활성화되며 draft depth는 3입니다.
  • vLLM은 Hy4-preview를 출시 첫날부터 지원하고 NVIDIA Blackwell에서 검증했으며, Tencent의 HPC-Ops attention·MoE kernel을 Blackwell 경로로 가져왔습니다. `VLLM_ENABLE_HPC_OPS=1 vllm serve tencent/Hy4-preview-FP8 -tp 8` 명령으로 해당 체크포인트를 실행하는 경로가 제시돼 모델 규모와 실제 추론 인프라의 연결이 핵심으로 부상했습니다.
원문 트윗 2개 보기

🔥 Wan3.0의 30초 영상·오디오 제작 워크플로포스트 10

Wan3.0이 30초 영상 생성과 동기화 오디오, 멀티모달 참조를 묶어 A2E·Medeo·DeepInfra·PowerDirectorJP·PixelDojoAI·Picsart 등으로 확산했습니다. 생성 뒤 타임라인 편집, 장면 확장, 재스타일링을 이어가면서 캐릭터 일관성을 유지하는 흐름이 핵심입니다.

세부 내용 보기
  • Wan3.0은 텍스트나 이미지에서 30초 영상을 만들고, 생성된 결과를 타임라인에서 편집하거나 장면을 확장하고 샷의 스타일을 바꾸는 입력 흐름을 제공합니다. A2E 관련 포스트는 이러한 후속 편집에서도 캐릭터를 유지한다고 밝혔습니다.
  • Medeo와 DeepInfra에서는 영상과 오디오를 한 모델에서 처리해 동기화된 음향을 붙이며, DeepInfra 경로는 1080P 30초 클립과 이미지·파일·웹페이지를 포함한 omni-modal reference를 내세웠습니다. 캐릭터와 스타일 일관성이 여러 서비스의 공통 기능으로 반복됐습니다.
  • Wan3.0은 단순 생성 버튼을 넘어 프롬프트 구조화, 오디오 레이어링, Omni-Reference를 실제 제작 흐름에 넣는 방식으로 소개됐고, Pixmax의 제작 사례와 A2E·PowerDirectorJP·Medeo·DeepInfra·PixelDojoAI의 출시 소식이 이어졌습니다. 모델 기능이 개별 데모보다 편집 도구와 창작 서비스의 연속 작업으로 이동한 양상입니다.
원문 트윗 2개 보기

📈 Qwen3.8-Flash의 OpenCode Go·클라우드 배포포스트 3

Qwen3.8-Flash가 OpenCode Go와 GMI Cloud에 추가됐습니다. OpenCode Go에서는 125B/6B와 1M context·멀티모달 구성이, GMI Cloud에서는 125B 전체·6B 활성과 262K context·Qwen 3.8 Max 대비 12배 저렴한 조건이 제시됐습니다.

세부 내용 보기
  • OpenCode와 Alibaba_Qwen 포스트는 Qwen3.8-Flash를 OpenCode Go에서 125B/6B, 1M context, 멀티모달 구성으로 제공한다고 밝혔습니다. 같은 모델이 코딩 서비스 안에서 긴 문맥과 이미지·텍스트 입력을 함께 처리하는 배포 사례입니다.
  • GMI Cloud 관련 포스트는 125B total parameters와 token당 6B active parameters, 262K context를 제시하며 Qwen 3.8 Max보다 12배 저렴하다고 밝혔습니다. OpenCode Go 포스트의 1M context와 수치가 다르므로 제공 플랫폼별 조건이 구분됩니다.
  • Alibaba Cloud는 Qwen3.8-Flash를 멀티모달 MoE이자 Qwen4 architecture의 early preview로 표현했습니다. 모델 자체의 새 기능뿐 아니라 OpenCode Go와 GMI Cloud라는 서로 다른 실행 채널이 동시에 늘어난 점이 이번 확산의 핵심입니다.
원문 트윗 2개 보기

📈 Midjourney V8.2 Edit 모델의 참조·인페인팅 기능포스트 1

Midjourney가 V8.2 Edit 모델의 첫 테스트를 시작하며 지시문 기반 편집, 최대 4개 이미지 참조, 브러시 인페인팅과 아웃페인팅을 예고했습니다. Personalization·moodboards·srefs도 함께 지원됩니다.

세부 내용 보기
  • V8.2 Edit 모델은 기존 이미지에 지시문을 적용하거나 다른 이미지에서 결과를 생성하는 입력 방식을 지원하며, 최대 4개의 reference image를 받을 수 있습니다. 브러시 기반 inpainting과 outpainting이 편집 범위를 넓히는 처리 단계로 포함됐습니다.
  • 생성 과정에는 Personalization, moodboards, srefs가 함께 작동합니다. 원문은 첫 테스트가 당일 시작된다고 밝혔지만 성능 수치나 공개 범위는 제시하지 않았습니다.
  • 이미지 생성 모델의 사용 단위가 단일 프롬프트 생성에서 다중 참조와 부분 수정, 캔버스 확장으로 넓어졌다는 기능 구성이 확인됐습니다.
원문 트윗 1개 보기

Co-Scientist의 도메인별 자율 과학 연구포스트 1

GDM은 Co-Scientist를 재료과학·생물학·컴퓨터과학의 실제 조건에 적용했습니다. 실험 장비 제어, 희소 영상 데이터 예측, 추론 시점 확장 구조 탐색을 각 분야의 검증 요건에 맞춰 수행했습니다.

세부 내용 보기
  • 재료과학에서는 반자동 CVD 장비와 연결해 Ti3C2T𝑥 MXene 성장을 겨냥한 비유해 전구체 경로를 설계했고, 사람이 최종 최적화한 상위 recipe를 물리적으로 실행해 유사한 2D layered structure를 얻었습니다.
  • 생물학에서는 희소 imaging data와 inducer인 IPTG 농도 gradient를 입력으로 받아 engineered E. coli의 emergent swarming phenotype을 예측했으며, 예측값을 미공개 wet-lab 형태 측정과 정량 비교했습니다.
  • 컴퓨터과학에서는 Co-Scientist가 완전 자율로 inference-time scaling architecture를 찾았고, HealthBench Hard와 Professional에서 6개 frontier model보다 높은 성능을 냈습니다. blinded physician 평가에서는 잠재적 임상 위해가 유의미하지만 modest하게 감소해 도메인별 협업 수준과 검증 절차를 조절하는 구조가 드러났습니다.
원문 트윗 1개 보기

RTX 5090 기반 Puro-2B 저비용 학습포스트 1

Puro-2B는 RTX 5090에서 Qwen2-1.5B를 학습한 사례로, 데이터·하드웨어·소프트웨어·학습 전략을 하나의 파이프라인으로 묶었습니다. 1.4T scheduled tokens와 22,514 active-training GPU-hours가 약 $6.9K compute cost와 17.6일의 경과 시간으로 집계됐습니다.

세부 내용 보기
  • Puro-2B는 단일 RTX 5090 기반의 학습 사례로 제시됐으며, 원문 제목은 비용을 $5090으로 표현했습니다. 학습 파이프라인은 data recipe, hardware infrastructure, supporting software, training strategy를 모두 포함합니다.
  • 전체 단계에서 1.4T scheduled tokens를 처리하고 22,514 active-training GPU-hours를 사용했으며, 계산 비용은 약 $6.9K, 경과 시간은 17.6일이었습니다. 입력 자원과 시간·비용이 함께 공개돼 재현 조건을 가늠할 수 있습니다.
  • 원문 인용에 따르면 최선의 checkpoint는 Qwen2-1.5B를 overall 기준으로 능가하고 Qwen2.5-1.5B에 근접했습니다. 작은 모델 학습에서도 데이터 구성과 인프라, 학습 전략의 결합이 결과 비교의 기준으로 작동했습니다.
원문 트윗 1개 보기

LeVJEPA의 저비용 영상 사전학습포스트 1

LeVJEPA는 collapse-free objective로 학습한 영상 encoder로 제시됐습니다. 동일 데이터·epoch 조건에서는 V-JEPA 2 수준을 5.6~20.8배 적은 사전학습 계산량으로 맞추고, 동일 FLOPs 조건에서는 ImageNet-1K에서 최강 영상 baseline보다 7.6포인트 높았습니다.

세부 내용 보기
  • LeVJEPA는 LeJEPA의 collapse-free objective 아래에서 학습한 영상 encoder이며, ViT-S/B/L 규모를 같은 데이터와 epoch 조건에서 V-JEPA 2와 비교했습니다. 이 비교에서 사전학습 계산량은 5.6~20.8배 적었습니다.
  • 총 FLOPs를 맞춘 조건에서는 ImageNet-1K에서 가장 강한 video baseline보다 7.6 points 높은 성능을 냈고, motion-centric benchmark에서도 경쟁력을 유지했습니다. 동일 영상의 frame으로 학습한 compute-matched DINOv2와 비교할 때 appearance 중심 평가는 image-pretrained encoder에 근접했습니다.
  • LeVJEPA는 motion-centric accuracy를 거의 두 배로 높이면서 appearance 평가도 유지했습니다. 계산량을 줄인 영상 표현 학습이 움직임 정보와 외형 정보를 동시에 다루는지를 수치로 비교한 결과입니다.
원문 트윗 1개 보기

📈 Uber의 agent harness 운영 규모포스트 1

Uber에서는 pull request의 70% 이상이 local 또는 cloud agent에서 비롯됐다는 수치가 공유됐습니다. 3,600개 이상의 skill과 하루 30K건 이상의 실행을 context management·tool loading·orchestration으로 운영하며 세션 비용을 낮추는 구조입니다.

세부 내용 보기
  • Uber의 agentic coding은 모델 자체보다 agent harness의 운영 구조를 경쟁 요소로 삼는 사례로 제시됐습니다. pull request의 70% 이상이 local 또는 cloud agent에 귀속됐다는 수치가 그 사용 범위를 나타냅니다.
  • 운영 계층에는 3,600+ skills와 하루 30K+ executions가 있으며, context management와 tool loading, orchestration을 통해 각 세션의 비용을 크게 낮췄습니다. 에이전트가 코드를 작성하는 능력보다 어떤 도구와 문맥을 언제 연결하는지가 비용 구조를 좌우합니다.
  • 이 사례에서 처리량과 경제성을 만드는 입력·처리·출력의 연결은 모델 호출 자체가 아니라 skill 선택, 도구 로딩, 문맥 관리, 실행 조율입니다. 따라서 agentic coding의 확장 조건이 모델 성능만이 아니라 전체 harness 설계로 이동했다는 실무 관점이 제시됐습니다.
원문 트윗 1개 보기

용어 해설

전문가 혼합 구조(MoE)
여러 전문가 네트워크 중 일부만 활성화해 토큰을 처리하는 모델 구조입니다. Hy4-preview는 770B 전체 파라미터와 49B 활성 파라미터를 사용하며, 256개 routed expert와 하나의 shared expert를 둡니다.
희소 인덱스(sparse index)
전체 토큰을 모두 계산하지 않고 필요한 일부 위치를 가리키는 인덱스입니다. Hy4-preview는 각 질의가 1M context 전체가 아니라 2048개 토큰만 주목하도록 처리량을 줄입니다.
Omni-Reference
Wan3.0 프롬프트 작업에서 여러 참조 입력을 활용하는 기능입니다. 영상 생성 과정에 오디오를 겹치고 참조 정보를 함께 넣어 실제 제작 흐름에 맞추는 방식으로 쓰입니다.
추론 시점 확장(inference-time scaling)
모델 학습을 다시 하지 않고 추론 단계의 계산이나 구조를 늘려 성능을 높이는 방식입니다. Co-Scientist가 발견한 구조는 HealthBench 평가에서 6개 frontier 모델보다 높은 성능을 냈습니다.
행동으로 드러난 선호(revealed preferences)
말로 밝힌 선호보다 실제 선택과 행동에서 드러난 선호를 가리키는 개념입니다. 원문은 다른 주체의 의도를 파악할 때 stated preferences보다 revealed preferences를 우선해야 한다고 말합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 28.수집 2026. 08. 28.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.