본문으로 건너뛰기
X (Twitter)조회 1

Qwen3.8-Flash-Next 공개, Ox Alpha의 GLM 확인, 긴 문맥 추론 최적화와 에이전트 메모리 확장

6B 활성 파라미터 모델 공개부터 GLM 계열 익명 모델 확인까지 오픈 웨이트 경쟁의 새 국면

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 기간에는 Qwen3.8-Flash-Next가 125B 전체 파라미터 중 6B만 토큰마다 활성화하는 multimodal MoE 구조와 Qwen4로 이어지는 새 Attention 설계로 가장 큰 반응을 얻었습니다. Ox Alpha는 Zhipu의 GLM 계열 변형으로 확인됐고, 오픈 웨이트 공개가 예고됐습니다. 긴 문맥 추론에서는 Speculative Decoding과 LMCache처럼 초안 검증과 KV cache 오프로드로 반복 계산을 줄이는 방식이 공유됐습니다. 에이전트 메모리의 세션 간 이전, 생성 콘텐츠 출처 추적, Wan3.0의 전문 영상 제작 서비스 배포도 함께 나타났습니다.

𝕏 실시간 트렌드 토픽

🔥 Qwen3.8-Flash-Next의 125B·6B 구조와 Qwen4 전조포스트 8

Alibaba_Qwen이 Qwen3.8-Flash를 open-weight로 공개하고, Qwen4에 사용할 구조의 초기 미리보기인 Qwen3.8-Flash-Next 가중치도 함께 열었습니다. 125B 파라미터 가운데 6B만 토큰마다 활성화하며 긴 문맥과 낮은 추론 비용을 함께 겨냥한 구성이 핵심입니다.

세부 내용 보기
  • Qwen3.8-Flash-Next는 125B 파라미터의 multimodal MoE와 별도 51B N-gram embedding table을 결합하고, 각 토큰에서 6B만 활성화합니다. N-gram table은 deterministic lookup으로 작동해 토큰별 행렬 곱셈 비용을 추가하지 않으며, 이 희소 계산 구조가 큰 모델 용량과 낮은 실행 비용을 함께 유지하는 기반입니다.
  • 새 구조에는 GDN + QSA hybrid attention, Gated Residual, N-gram Embedding, Muon optimizer가 포함됐습니다. 기본 문맥 길이는 262K이고 YaRN으로 1M까지 확장되며, 게시된 수치는 DeepSWE 1.1 58.7, SWE-bench Pro 62.5, CoWorkBench 73.9, AndroidWorld 84.5, MathVision 95.7입니다.
  • 1M-token 문맥에서 QSA attention kernel은 prefill 최대 7.6배, decode 최대 4.9배 빨라졌고, prefix-cache hit rate 90% 조건에서는 Qwen3.7-Plus 대비 prefill throughput 8.6배가 기록됐습니다. QwenCloud API 가격은 input 1M tokens당 $0.16, output 1M tokens당 $0.47로 제시됐으며 SGLang과 vLLM이 출시 당일부터 배포를 지원했습니다.
찬성다수

Qwen3.8-Flash-Next는 6B 활성 파라미터, 51B N-gram table, 긴 문맥 최적화로 높은 계산 효율을 확보했다는 평가입니다.

찬성다수

초기 벤치마크와 SGLang·vLLM의 day-0 지원이 공개 가중치의 실제 사용 가능성을 뒷받침한다는 반응입니다.

원문 트윗 2개 보기

Qwen

@Alibaba_Qwen

1일 전

Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight! The production version Qwen3.8-Flash will be available soon via QwenCloud API at just $ 0.16/1M input tokens and $ 0.47/1M output tokens. 125B parameters + 51B N-gram embeddings, with just 6B activated per token. Unmatched cost-efficiency. What's new: - Next architecture: GDN + QSA hybrid attention, Gated Residual, N-gram Embedding & Muon optimizer, serving as a precursor to the architecture used in Qwen4. - Dramatically lower training and inference costs: trained at just 1/9 the cost of Qwen3.7-Plus, while outperforming it across the board with especially strong gains in coding and office tasks. - Strong performance: scoring 58.7 on DeepSWE 1.1, 62.5 on SWE-bench Pro, 73.9 on CoWorkBench, 84.5 on AndroidWorld, and 95.7 on MathVision (with CI). - 262K native context, extensible to 1M with YaRN. We’re also releasing the weights for Qwen3.8-Flash-Next, giving the community an early look at the new architecture we’re exploring for Qwen4. We can't wait to see what you build with Qwen3.8-Flash! - Blog: https:// qwen.ai/blog?id=qwen3. 8-flash-next … - Technical Report: https:// github.com/QwenLM/Qwen3.8 -Flash-Next/blob/main/tech_report.pdf … - Hugging Face: https:// huggingface.co/Qwen/Qwen3.8-F lash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next … - ModelScope: https:// modelscope.cn/models/Qwen/Qw en3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921XAP2dV&file=Qwen3.8-Flash-Next …

💬 12 52 157👁 4465

vLLM

@vllm_project

1일 전

Qwen3.8-Flash-Next from @Alibaba_Qwen has day-0 support in vLLM, verified on NVIDIA and AMD GPUs. Ultra-sparse multimodal MoE: 125B params, 6B active, 262K native, 1M via YaRN. On top of those sits a separate 51B N-gram table you can offload. Most of it will look familiar. The Gated DeltaNet layers reuse the KV path vLLM has had since Qwen3-Next: only a quarter of the layers hold a growing KV cache. Keep the 51B table in host RAM instead of HBM with VLLM_PLE_CPU_OFFLOAD=1. Qwen Sparse Attention is where the new engine work went. For now the model runs from vllm/vllm-openai:qwen38-flash-next. Thanks to @Alibaba_Qwen for the weights, and for opening them this early! http:// recipes.vllm.ai/Qwen/Qwen3.8-F lash-Next …

Qwen

Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight! The production version Qwen3.8-Flash will be available soon via QwenCloud API at just $ 0.16/1M input tokens and $ 0.47/1M output tokens. 125B parameters + 51B N-gram

인용 트윗 보기
💬 0 0 2👁 239

🔥 Ox Alpha의 GLM 계열 확인과 오픈 웨이트 예고포스트 4

Zhipu가 OpenRouter 사용량 차트 상위에 오른 익명 모델 Ox Alpha를 GLM 계열의 새 변형으로 확인했습니다. 해당 모델의 가중치 공개가 예고되면서 성능 비교와 정체 추적이 오픈 모델 경쟁의 새 관심사가 됐습니다.

세부 내용 보기
  • Ox Alpha는 처음에는 출처가 공개되지 않은 모델로 퍼졌지만, Zhipu가 GLM series의 새 iteration이라고 확인했습니다. @MiaAI_lab은 Ox Alpha가 Zai의 GLM Flash이며 당일 밤 출시된다고 전했고, tldrnewsletter는 Zhipu가 가중치를 공개할 예정이라고 정리했습니다.
  • 한 게시물은 Ox Alpha가 frontend 실험에서 GPT-5.6 Sol을 앞섰고, 단일 프롬프트로 자동차 게임의 물리와 주행 제어, UI를 생성했다고 주장했습니다. 다만 이 수치는 해당 게시물의 실험 주장으로 제시됐으며, 공식 벤치마크 세부 결과는 함께 공개되지 않았습니다.
  • Bloomberg 인용 게시물은 Ox Alpha가 무료 사용 환경에서 높은 성능으로 온라인 사용량 차트 정상에 올랐고 DeepSeek 사용량을 두 배 이상 웃돌았다고 전했습니다. GLM 계열 확인과 가중치 공개 예고가 이어지면서 익명 모델의 실체보다 공개 후 재현성과 검증이 다음 기준이 됐습니다.
찬성다수

Ox Alpha의 성능과 사용량이 기존 주요 모델을 앞섰다는 게시물들이 확산되며 새 GLM 변형에 대한 관심이 커졌습니다.

중립다수

현재 확인된 핵심 사실은 Zhipu의 GLM 계열 확인과 가중치 공개 예고이며, 개별 성능 주장은 추가 검증이 필요합니다.

원문 트윗 2개 보기

📈 Speculative Decoding과 LMCache의 반복 계산 절감포스트 3

긴 문맥 추론 비용을 낮추는 두 가지 실무 기법이 함께 공유됐습니다. Speculative Decoding은 초안 생성과 대형 모델 검증을 겹치고, LMCache는 반복 입력의 KV cache를 GPU 밖에 보관해 prefill 재계산을 피합니다.

세부 내용 보기
  • 추론 속도가 병목인 환경에서는 매 토큰을 큰 모델이 순차 생성하는 대신 초안 모델이 후보를 만들고 큰 모델이 묶음 단위로 검증하는 Speculative Decoding이 사용됩니다. 게시물은 draft-and-verify, Medusa, EAGLE·EAGLE-2·EAGLE-3, DFlash·DSpark를 같은 흐름의 주요 기법으로 묶고 품질 저하 없이 2~6배 속도 향상을 언급했습니다.
  • 24K 토큰을 매 요청마다 다시 prefill하는 로컬 환경에서는 LMCache가 paged KV cache를 system memory 또는 NVMe에 저장하고 다음 요청에서 복원합니다. GPU가 동일한 prefix를 다시 처리하지 않도록 만들어 긴 문맥 로컬 추론의 대기 시간을 줄이는 입력 재사용 구조입니다.
  • Speculative Decoding 게시물은 알고리즘별 차이를 도식과 수식으로 정리한 학습 자료를 연결했고, LMCache 게시물은 시스템 RAM·NVMe 오프로드를 실제 설정 항목과 함께 제시했습니다. 두 접근 모두 모델 자체를 바꾸기보다 추론 과정의 중복 계산과 메모리 이동을 줄이는 데 초점을 둡니다.
찬성다수

초안-검증과 KV cache 재사용은 품질을 유지하면서 긴 문맥 및 로컬 추론의 처리 시간을 줄이는 실용적 최적화로 평가됩니다.

원문 트윗 2개 보기

📈 에이전트 세션과 작업 기억의 도구 간 이전포스트 2

에이전트가 긴 세션에서 맥락을 잃는 문제를 줄이고, IDE나 에이전트를 바꿔도 세션과 Skills를 이어가는 메모리 구조가 공유됐습니다. 중간 맥락 압축과 프로젝트 기억의 외부화를 통해 cold start를 warm start로 바꾸는 방향입니다.

세부 내용 보기
  • Tencent AI는 에이전트가 장시간 세션에서 맥락을 잃는 문제를 해결하기 위해 agent memory system을 구축하고 open-source로 공개했다고 전했습니다. 오래된 맥락을 세션 중간에 압축하고 구조화된 task map을 제공하는 입력 처리로 token usage를 61% 줄였다는 수치가 제시됐습니다.
  • 다른 게시물은 Claude Code, DeepSeek Harness, WorkBuddy 사이에서 Sessions와 Skills가 함께 이동하도록 설계된 메모리를 설명했습니다. 기억을 특정 IDE에 묶지 않고 다음 에이전트 턴에서 불러오며, 설치 이전의 history에도 소급 적용해 프로젝트의 cold start를 warm start로 바꾸는 방식입니다.
  • 두 게시물은 에이전트 메모리를 단순한 대화 기록 저장이 아니라 오래된 맥락 압축, task map 구조화, 도구 간 세션 공유로 나눠 처리합니다. 이 구조는 장기 작업에서 토큰 사용량과 재설정 비용을 줄이고 동일 프로젝트의 연속성을 유지하는 데 의미가 있습니다.
찬성다수

맥락 압축과 도구 간 기억 이전이 장기 에이전트 작업의 토큰 비용과 재시작 부담을 줄이는 방향으로 제시됐습니다.

원문 트윗 2개 보기

Claude 생성 콘텐츠의 워터마크와 출처 추적포스트 1

Anthropic이 향후 Claude 모델에 보이지 않는 워터마크를 넣고, 텍스트와 이미지에 서로 다른 출처 추적 방식을 적용한다는 내용이 공유됐습니다. EU AI Act 같은 규제 대응과 오탐 및 출력 품질 영향이 핵심 쟁점입니다.

세부 내용 보기
  • 게시물은 합성 콘텐츠 출처 추적이 규제 요건으로 자리 잡는 흐름 속에서 Anthropic이 향후 Claude 모델과 일부 이전 모델에 보이지 않는 워터마크를 적용한다고 전했습니다. 텍스트에는 Google의 SynthID 방식처럼 seed generator가 단어 선택을 미세하게 유도해 통계적 패턴을 만드는 처리가 사용됩니다.
  • 생성된 텍스트는 scoring API가 통계 패턴을 탐지하고, 이미지는 C2PA metadata를 삽입하는 이중 경로로 처리됩니다. Anthropic은 출력에 의미 있는 영향을 주지 않는다고 밝혔지만, 사용자는 false positive와 품질 저하 가능성을 우려하는 것으로 전해졌습니다.
  • 이 구현은 콘텐츠 생성 단계에서 표시를 덧붙이는 방식이 아니라 토큰 선택 확률과 이미지 메타데이터에 출처 신호를 심는 방식입니다. 따라서 탐지 정확도, 변환·재가공 이후의 보존성, 규제 준수와 출력 품질 사이의 균형이 실제 적용의 기준이 됩니다.
찬성소수

합성 콘텐츠의 출처를 추적하려면 텍스트 워터마크와 이미지 메타데이터가 필요하다는 규제 대응 관점입니다.

반대소수

사용자 측에서는 false positive와 생성 품질 저하가 발생할 수 있다는 우려가 제기됐습니다.

원문 트윗 1개 보기

Wan3.0의 전문 영상 제작 서비스 배포포스트 2

Wan3.0이 KoyalAI의 Film Arena와 Media.io에 연이어 연결되며 AI 영상 생성의 서비스 배포 범위를 넓혔습니다. 일관된 캐릭터와 연결된 장면, 영화적 움직임을 한 아이디어나 스크립트에서 생성하는 사용 흐름이 강조됐습니다.

세부 내용 보기
  • Alibaba Cloud 게시물은 KoyalAI의 전문 영상 제작 벤치마크 Film Arena에서 Wan3.0이 측정 대상인 6개 애니메이션 카테고리 모두 1위를 기록했고 사실적인 영상에서도 높은 평가를 받았다고 전했습니다. 전문 영화 제작자의 관점으로 모델을 시험했다는 점이 성능 수치의 사용 맥락입니다.
  • Media.io에서는 Wan3.0이 하나의 아이디어나 스크립트를 입력으로 받아 일관된 캐릭터, 연결된 장면, 영화적 움직임을 갖춘 AI story로 변환합니다. KoyalAI에서는 에이전트를 통해 모델을 사용할 수 있고, Alibaba Cloud Model Studio와 Qwen Cloud에서도 API 접근 경로가 제공됩니다.
  • 같은 모델이 벤치마크인 Film Arena와 일반 창작 서비스 Media.io에 동시에 배포되면서 평가와 제작 도구 사이의 연결이 짧아졌습니다. 성능을 전문 제작 환경에서 측정하고 결과물을 소비자용 서비스로 전달하는 배포 구조입니다.
찬성다수

Wan3.0의 전문 영상 평가와 Media.io·KoyalAI 배포가 모델 사용 경로를 넓혔다는 흐름입니다.

원문 트윗 2개 보기

Semantic view materialization의 쿼리 가속포스트 1

Snowflake는 semantic view에 미리 계산한 rollup을 연결해 기본 테이블 대신 사전 집계 결과를 읽도록 query planner를 바꾸는 방식을 공유했습니다. TPC-DS에서 59~91배 속도 향상과 데이터 스캔량 359GB에서 120MB로의 감소가 함께 제시됐습니다.

세부 내용 보기
  • 기본 테이블을 매번 읽는 쿼리 처리에서 반복 집계가 병목이 될 때, semantic view materialization은 미리 계산한 rollup을 저장합니다. `ALTER SEMANTIC VIEW ... ADD MATERIALIZATION`을 실행하면 query planner가 원본 테이블 스캔 대신 해당 rollup을 선택하는 흐름입니다.
  • 게시물의 TPC-DS 결과에서는 하나의 materialization이 네 개 쿼리에 사용됐고, 데이터 스캔량이 359GB에서 120MB로 줄었습니다. 속도 향상 범위는 59~91배로 제시됐으며, 동일한 의미 계층을 공유하는 쿼리의 반복 계산을 줄이는 사례입니다.
  • 이 방식은 모델 추론이 아니라 데이터 계층에서 사전 계산 결과를 재사용해 처리량을 높입니다. semantic view의 의미 구조와 query planner를 연결하기 때문에 반복 분석 쿼리의 스캔 비용과 실행 시간을 동시에 줄이는 접근입니다.
찬성소수

semantic view materialization이 사전 집계 rollup 재사용으로 쿼리 스캔량과 실행 시간을 크게 줄였다는 사례입니다.

원문 트윗 1개 보기

용어 해설

Mixture of Experts
전체 파라미터를 매번 모두 계산하지 않고 여러 전문가 모듈 가운데 일부만 토큰별로 활성화하는 구조입니다. Qwen3.8-Flash-Next는 125B 파라미터 중 6B만 토큰마다 작동시켜 계산량과 추론 비용을 낮춥니다.
N-gram 임베딩(N-gram Embedding)
연속된 토큰 묶음인 N-gram을 별도 테이블에서 결정적으로 조회하는 방식입니다. Qwen3.8-Flash-Next는 51B 파라미터 테이블을 사용하며, 게시물은 토큰별 행렬 곱셈 비용을 추가하지 않는다고 설명합니다.
Qwen Sparse Attention
긴 문맥에서 모든 토큰 쌍을 동일하게 처리하지 않고 필요한 부분을 희소하게 선택하는 Attention 방식입니다. 1M 토큰 문맥에서 prefill과 decode 커널의 처리 속도를 높이는 Qwen3.8-Flash-Next의 핵심 엔진 요소입니다.
YaRN
모델이 학습한 기본 문맥 길이보다 더 긴 입력을 처리하도록 위치 정보를 확장하는 기법입니다. Qwen3.8-Flash-Next는 262K native context를 YaRN으로 1M까지 늘릴 수 있다고 발표됐습니다.
Speculative Decoding
작은 초안 모델이 다음 토큰 후보를 먼저 생성하고, 큰 모델이 후보를 한 번에 검증하는 추론 기법입니다. 게시물은 품질 저하 없이 2~6배 속도를 높일 수 있다고 소개하며 draft-and-verify, Medusa, EAGLE 계열을 함께 다룹니다.
LMCache
반복 입력의 paged KV cache를 GPU 밖의 시스템 메모리나 NVMe에 저장해 다시 불러오는 기술입니다. 긴 문맥을 매번 재계산하는 prefill 단계를 건너뛰어 로컬 추론에서 반복 요청의 대기 시간을 줄이는 방식입니다.
C2PA 메타데이터(C2PA)
생성 콘텐츠의 출처와 처리 이력을 기록하는 메타데이터 표준입니다. 게시물은 향후 Claude 이미지 출력에 C2PA 메타데이터를 삽입하고, 텍스트에는 통계적 워터마크를 적용한다고 전합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 26.수집 2026. 08. 26.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.