TL;DR
이번 기간에는 Qwen3.8-Flash의 API 출시와 긴 컨텍스트·낮은 토큰 가격, LLM 추론 비용을 줄이는 양자화와 Prefix Sliding이 기술 흐름의 중심에 놓였습니다. Qwen3.8-Flash는 QwenCloud와 OpenRouter에서 제공되며 262K 네이티브 컨텍스트, 최대 1M 확장, 입력 토큰 100만 개당 0.15달러의 가격을 내세웠습니다. 별도 학습 없이 reasoning token을 줄이는 Prefix Sliding은 기존 모델의 처리 속도를 3배 높였고, 다섯 가지 양자화 방식은 outlier를 반올림 전후·추론 중·학습 중 언제 처리하느냐에 따라 갈립니다. Nvidia의 Hugging Face 인수 보도와 WorkBuddy의 전 세계 Human-AI 공동 집필 출시도 모델과 도구의 배포 경로를 바꾸는 사례로 함께 나타났습니다.
𝕏 실시간 트렌드 토픽
🔥 Qwen3.8-Flash의 262K 컨텍스트 API와 토큰 가격포스트 4
Qwen3.8-Flash가 QwenCloud와 OpenRouter에 출시되며 긴 입력 처리와 낮은 API 가격을 내세웠습니다.
세부 내용 보기
- Qwen3.8-Flash 관련 포스트 네 건은 같은 API 출시를 다루며, QwenCloud에서는 262K 네이티브 컨텍스트를 기본 제공하고 최대 1M까지 확장하는 구조입니다. 입력은 100만 토큰당 0.15달러, 출력은 0.47달러, 캐시 적중은 0.016달러로 책정됐고, OpenRouter에서는 coding assistants·agentic workflows·long-video understanding을 한 번의 API 호출로 연결하는 용도로 제공됩니다. 긴 문서·영상과 반복 요청을 한 모델 API 안에서 처리하면서 입력 길이와 캐시 재사용에 따라 비용을 나누는 출시입니다.
원문 트윗 2개 보기

Qwen
Qwen3.8-Flash on @qwen_cloud : $0.15/1M input tokens, $0.47/1M output tokens, and just $0.016/1M on cache hits. Come give it a try!
Qwen3.8-Flash API is live on QwenCloud. 262K native context, extensible to 1M, and priced to scale. About Price Input: $0.15 / 1M tokens Output: $0.47 / 1M tokens Cache hit: $0.016 / 1M tokens Get your API key and start building: https:// qwencloud.com/models/qwen3.8 -flash?utm_content=g_20000002831 … #QwenCloud #Qwen
Qwen
Qwen3.8-Flash is now live on @OpenRouter ! Coding assistants, agentic workflows, long-video understanding, all one API call away.
Qwen3.8 Flash from @Alibaba_Qwen is now live on OpenRouter. A multimodal reasoning model for coding assistants, agentic workflows, visual understanding, codebase and document analysis, desktop interaction, charts, and long video. https:// openrouter.ai/qwen/qwen3.8-f lash …
➖ LLM 양자화에서 outlier를 처리하는 다섯 가지 위치포스트 1
70B 모델의 가중치를 FP16 140GB에서 4-bit 35GB로 줄이는 과정에서, RTN·GPTQ·AWQ·LLM.int8()·QAT가 outlier를 서로 다른 단계에서 처리합니다.
세부 내용 보기
- 70B 모델은 FP16에서 가중치만 140GB를 차지하지만 4-bit로 낮추면 35GB가 되어 한 장의 카드에 들어갑니다. 다만 hidden dimension의 약 0.1%가 다른 값보다 최대 20배 커 양자화 격자를 망가뜨리므로, RTN은 이를 무시하고 단순 반올림하며 GPTQ는 층의 열을 순서대로 양자화한 뒤 남은 가중치로 오차를 보정합니다. AWQ는 중요한 약 1%의 weight channel을 먼저 키운 뒤 모두 INT4로 만들고, LLM.int8()은 이상치 차원만 FP16으로 남겨 나머지 99.9%의 INT8 결과와 합치며, QAT는 모든 forward pass에 반올림을 넣어 학습 중 모델이 오차에 적응하게 합니다. 다섯 방식은 모두 학습 정밀도보다 작은 모델을 만들지만 outlier를 다루는 시점이 달라 메모리와 품질 절충의 선택지가 됩니다.
➖ Prefix Sliding의 reasoning token 삭제와 3배 추론 속도포스트 1
Prefix Sliding은 중요도가 낮아진 중간 reasoning token을 버리고 prefix와 최근 window만 유지해 긴 추론의 토큰 비용을 줄입니다.
세부 내용 보기
- 긴 reasoning trace에서는 모델이 계속 추론할수록 많은 중간 token의 중요도가 낮아진다는 관찰이 출발점입니다. Prefix Sliding은 입력의 prefix와 최근 수천 개 token으로 window를 구성하고 그 밖의 중간 reasoning token을 버려 이후 계산에 남기는 문맥을 줄입니다. 원문이 인용한 결과에 따르면 추가 학습 없이 기존 모델을 3배 빠르게 하면서 성능을 유지했고, reinforcement learning으로 Prefix Sliding을 학습하면 10만 token을 넘는 reasoning trace로 확장할 때 더 나은 성능을 얻을 수 있습니다.
➖ RLVR post-training의 sparse reward 한계와 probability mass 재배치포스트 1
RLVR 학습에서 보상 밀도와 prompt set이 모델이 원하는 행동을 학습하는 범위를 좌우한다는 관점을 담은 자료가 공유됐습니다.
세부 내용 보기
- 공유된 RLVR 자료는 post-training을 사전학습 분포 안에서 probability mass를 재배치하는 과정으로 보고, 학습 중 원하는 행동의 확률과 출력 분포의 entropy를 추적하는 측정 틀을 둡니다. sparse RL은 모델이 한 번도 샘플링하지 않은 행동을 찾아낼 수 없고, dense reward는 그 상한을 높이며, spurious reward는 prompt set의 구성과 연결된다는 세 가지 결과를 제시합니다. 따라서 보상값만 보는 대신 어떤 행동의 확률이 늘었는지와 분포의 entropy가 어떻게 변했는지를 함께 기록해야 post-training의 작동 범위를 파악할 수 있습니다.
➖ Nvidia의 129억 달러 Hugging Face 인수 보도포스트 1
Nvidia가 오픈소스 AI 허브 Hugging Face를 129억 달러에 인수하기로 합의했다는 보도가 나왔습니다.
세부 내용 보기
- TechCrunch 포스트는 Nvidia가 인기 있는 오픈소스 AI 허브 Hugging Face를 129억 달러에 인수하기로 합의했다고 전합니다. 보도에 따르면 이 거래는 Nvidia가 칩 사업을 보호하는 동시에 클라우드 사업에 다시 진입하는 경로가 될 수 있습니다. 한 번의 인수 보도 안에서 모델·데이터·개발 자원이 모인 허브와 칩·클라우드 사업의 결합 가능성이 함께 거론됐다는 점이 핵심입니다.
➖ WorkBuddy의 전 세계 Human-AI 공동 집필 출시포스트 1
WorkBuddy가 같은 문서에서 사람과 AI가 동시에 편집하고 선택한 부분만 수정하는 기능을 전 세계에 출시했습니다.
세부 내용 보기
- WorkBuddy는 AI가 문서 전체를 대신 쓰는 대신 사람 옆에서 같은 시간에 편집하도록 설계됐으며, 사용자가 문장·셀 범위·슬라이드 중 대상을 선택하면 해당 부분만 수정합니다. Word·Excel·PPT·Markdown 파일을 그대로 열어 사람과 AI의 변경 사항을 동시에 확인하고, AI가 바꾼 내용에도 Ctrl+Z를 적용해 수정 권한을 사용자가 유지합니다. 무료 Hy3 model과 신규 사용자용 무료 크레딧도 함께 제공돼 문서 작업에 제한적 수정과 되돌리기를 결합한 방식입니다.
용어 해설
- 네이티브 컨텍스트(Native Context)
- — 모델이 별도 확장 없이 한 번에 처리하도록 설계된 입력 토큰 범위입니다. Qwen3.8-Flash API는 262K 토큰을 기본으로 처리하고, 확장하면 최대 1M 토큰까지 다룰 수 있어 긴 문서와 긴 영상 입력에 쓰입니다.
- 캐시 적중(Cache Hit)
- — 이전에 계산한 동일한 입력 prefix를 다시 활용하는 경우입니다. QwenCloud는 캐시 적중 토큰에 입력·출력 토큰보다 낮은 별도 요금을 적용해 반복 요청에서 비용 구조를 달리합니다.
- LLM 양자화(LLM Quantization)
- — 모델 가중치의 수치 정밀도를 낮춰 메모리 사용량을 줄이는 처리입니다. 원문에서는 70B 모델의 FP16 가중치 140GB를 4-bit에서 35GB로 줄이는 사례와 함께, outlier를 처리하는 다섯 가지 방식을 비교합니다.
- 이상치 차원(Outlier Dimensions)
- — 텐서 안에서 다른 값보다 훨씬 큰 값을 갖는 소수의 hidden dimension입니다. 원문에서는 약 0.1%의 차원이 최대 20배 큰 값을 가져 양자화 격자를 왜곡한다고 설명하며, 각 기법이 이 문제를 처리하는 시점이 다릅니다.
- Prefix Sliding
- — 추론이 길어질수록 중요도가 낮아지는 중간 reasoning token을 버리고, prefix와 최근 수천 개 token으로 구성된 window를 유지하는 방식입니다. 원문에서는 추가 학습 없이 기존 모델을 3배 빠르게 만들면서 성능을 유지했다고 전합니다.
- RLVR
- — 검증 가능한 보상으로 언어 모델을 post-training하는 강화학습 방식입니다. 원문은 sparse reward가 모델이 생성하지 않는 행동을 찾지 못하게 하는 한계와 dense reward가 그 상한을 높이는 과정을 단순화된 설정에서 다룹니다.
- Human-AI 공동 집필(Human-AI Co-writing)
- — 사람과 AI가 같은 문서에서 동시에 편집하는 작업 방식입니다. WorkBuddy는 문장·셀 범위·슬라이드처럼 선택한 부분만 수정하고, Word·Excel·PPT·Markdown 파일에서 AI 변경 사항에도 Ctrl+Z를 적용하도록 구성됩니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.