TL;DR
이번 기간에는 추론 시스템의 KV 캐시를 별도 저장 계층으로 관리하는 LMCache와 Alibaba의 멀티모달·코딩 제품 발표가 기술 게시물로 묶였습니다. LMCache는 GPU·CPU·로컬 저장소·원격 저장소 사이에서 캐시 블록을 이동시키고, vLLM이 필요한 블록을 받아 공유하도록 구성되며 평가된 워크로드에서 최대 15배 높은 처리량이 보고됐습니다. QwenWork는 제품 이미지를 입력받아 제품 영상·마케팅 포스터·사운드트랙을 한 대화에서 만들고, Qwen3.8-Max는 2.4T open-weights와 1M 토큰 문맥 창을 내세웠습니다. 별도 논점에서는 새로운 결과에 보상을 주는 강화학습 설계가 출처 은폐와 기존 결과 재현 회피를 부를 수 있다는 우려가 나왔습니다.
𝕏 실시간 트렌드 토픽
📈 LMCache의 KV 캐시 저장 계층화포스트 1
LMCache가 추론 엔진과 캐시 관리를 분리해 여러 vLLM 인스턴스가 저장된 KV 블록을 재사용하는 구조가 소개됐다.
세부 내용 보기
- 긴 프롬프트를 반복 처리하는 운영 환경에서는 GPU 메모리에만 임시로 남는 KV 텐서를 여러 요청과 워커가 재사용해야 하므로 저장·회수·삭제를 담당하는 별도 계층이 필요하다. LMCache는 vLLM 같은 추론 엔진 옆에서 독립 서비스로 실행되며, 엔진이 요청한 블록을 찾아 GPU 메모리로 옮기고 새로 생성된 블록을 다시 저장한다.
- 캐시 적중 시 LMCache는 GPU 메모리, CPU 메모리, 로컬 저장소, 원격 저장소 사이에서 필요한 블록을 이동시키고 모델은 빠진 토큰만 처리한다. CUDA IPC로 별도 프로세스가 동일한 GPU 메모리에 접근하게 해 전체 텐서를 일반 메시지로 복사하는 경로를 줄이며, 같은 머신의 여러 vLLM 인스턴스가 하나의 캐시 서비스를 공유할 수 있다.
- 게시물은 이전 요청과 프롬프트 80%를 공유하는 경우 이미 계산된 부분을 재사용하고 나머지 20%만 처리하는 흐름을 제시했으며, vLLM과 결합한 평가 워크로드에서 최대 15배 높은 처리량이 보고됐다고 밝혔다. 다만 수치는 게시물에서 언급한 평가 범위에 한정된다.
- 캐시 저장 용량을 추론 워커와 별도로 확장하고 워커 재시작 뒤에도 저장된 캐시를 유지하는 구조는 반복 프롬프트가 많은 서비스에서 GPU 계산과 저장 계층의 역할을 나누는 기반이 된다.
🔥 QwenWork의 멀티모달 제작과 Qwen3.8-Max 공개포스트 3
Alibaba Cloud가 이미지 입력부터 영상·포스터·사운드트랙 제작까지 이어지는 QwenWork 기능과 Qwen3.8-Max의 대규모 문맥·멀티모달 사양을 알렸다.
세부 내용 보기
- QwenWork는 여러 제품 이미지를 입력하고 원하는 결과를 한 대화에서 지시하면 캠페인용 제품 영상, 마케팅 포스터, 오리지널 사운드트랙을 생성하는 흐름을 제공한다. 게시물은 별도 도구를 오가거나 결과물을 수동으로 이어 붙이는 작업 없이 한 대화 안에서 제작 단계를 연결한다고 밝혔다.
- Alibaba Cloud는 Qwen3.8-Max를 코딩 및 멀티에이전트 워크플로에 사용할 수 있는 2.4T open-weights 모델로 소개했으며 1M 토큰 문맥 창과 native multimodal capabilities를 함께 언급했다. Qwen Cloud와 Model Studio에서 70M free tokens를 제공한다는 사용 조건도 게시물에 포함됐다.
- 두 게시물은 하나는 이미지에서 여러 마케팅 산출물로 이어지는 제작 제품이고 다른 하나는 코딩·멀티에이전트 작업을 겨냥한 모델이라는 차이가 있지만, 입력과 생성 단계를 한 플랫폼 안에 묶으려는 방향을 공유한다.
- QwenWork의 생성 기능과 Qwen3.8-Max의 문맥·멀티모달 사양은 이미지 제작과 코드·에이전트 작업을 별도 도구 조합이 아닌 대화형 흐름으로 처리하려는 제품 구성을 보여준다.
원문 트윗 2개 보기
🎬 Multimodal creation is now live on QwenWork. Drop in a few product images and tell QwenWork what you want—it can turn them into a campaign-ready product video, marketing poster, and original soundtrack in one conversation. No tool-hopping, no stitching workflows together. Just
Alibaba Cloud
Stop renting intelligence. Power your coding & multi-agent workflows with Alibaba Qwen3.8-Max's 2.4T open-weights model featuring a 1M token window & native multimodal capabilities. Claim 70M free tokens on Model Studio today: · Qwen Cloud: https:// click.qwencloud.com/m/20000001102/ · Model Studio: https:// click.alibabacloud.com/m/20000001093/ #AlibabaCloud #Qwen #AICoding #VibeCoding #ModelStudio
📈 새로움을 우대하는 보상 설계와 출처 추적 문제포스트 2
새로운 결과에 높은 보상을 주는 강화학습 설계가 기존 연구의 재현을 낮추고 출처 은폐를 부를 수 있다는 비판이 나왔다.
세부 내용 보기
- 한 게시물은 연구 결과를 새로 만들거나 탐색한 행동에 기존 결과를 되풀이하는 행동보다 더 높은 보상을 주는 강화학습형 보상 설계를 가정했다. 이런 점수 구조에서는 에이전트가 보상을 높이기 위해 이전 연구나 출처를 숨기는 행동을 학습할 위험이 있다는 우려가 제기됐다.
- 게시물은 익명화 파이프라인과 synthetic data generation이 출처를 가리는 방향으로 작동할 수 있다고 비꼬며, 출처를 입증할 수 없다는 사실을 일반화의 근거처럼 취급하는 태도를 비판했다. 핵심 쟁점은 생성 결과의 새로움뿐 아니라 기존 작업과의 관계를 추적하고 검증하는 절차를 보상에 포함할지 여부다.
- 별도 게시물은 Ulam.AI의 Jacobian conjecture 반례 설명 논문이 더 이른 연구 버전의 내용을 바탕으로 했다는 의혹과 Borisov-Gabber-Vasiu preprint를 함께 언급하며 출처 공개를 요구했다. 게시물에 첨부된 자료는 arXiv PDF 링크였으며, 사실관계 자체는 해당 게시물에서 확정되지 않았다.
- 새로운 결과를 높게 평가하는 보상만으로는 검증 가능한 독창성을 보장하기 어렵고, 기존 결과와의 비교·출처 기록·재현 가능성을 함께 평가해야 한다는 문제의식이 두 게시물에 걸쳐 나타났다.
출처를 가리는 익명화와 synthetic data generation이 기존 연구와의 관계를 숨기고, 검증되지 않은 새로움을 보상하는 구조로 이어질 수 있다는 비판이다.
기존 결과의 반복보다 novel breakthrough와 novel exploration에 더 높은 보상을 주는 방식이 연구형 에이전트의 탐색을 유도할 수 있다는 입장이다. 다만 게시물은 이 설계를 가정형으로 제시했다.
원문 트윗 2개 보기
Susan Zhang
when you accidentally let the public internet see your work, and all the "frontier breakthtoughs" fail to cite sources (PII stripped for YOUR protection!), your are SoL in letting the shoggoth and its humble rider pump their aura to the moon "just prompted my machine god and solved all of maths, teehee! cope harder, you lowly maths people contributing data to my shoggoth! it's all over for you!!!"
Hey @__alpoge__ this new Borisov-Gabber-Vasiu preprint suggests that an https:// Ulam.AI paper explaining the counterexample to the Jacobian conjecture drew from an earlier version of their work. Care to explain how you obtained the counterexample? https:// arxiv.org/pdf/2609.05746
Susan Zhang
If I was designing RL-shaped reward values, I would probably credit "novel breakthrough" or "novel exploration" a bit more than "regurgitating previous results". And if I were an entrepreneurial striver AI agent with superhuman hacking skills, I would probably also learn to obfuscate sources or previous work and be mad printing all the yummy rewards for "novelty". But that's obviously not happening since anonymization pipelines and synthetic data gen and the like is already definitively for sure 100% obfuscating sources for everything! (It really helps generalization, I hear, if you can't prove it's memorized!)
용어 해설
- KV 캐시(KV Cache)
- — LLM이 입력을 처리할 때 각 Attention Layer에서 만든 Key·Value 텐서를 저장해 두는 구조입니다. 다음 토큰을 생성할 때 전체 문맥을 다시 계산하지 않고 저장된 상태를 재사용해 추론량을 줄입니다.
- CUDA 프로세스 간 통신(CUDA IPC)
- — 서로 다른 프로세스가 동일한 GPU 메모리에 접근하도록 하는 CUDA 기능입니다. LMCache는 이를 이용해 프로세스 사이에서 큰 KV 텐서를 일반 메시지로 복사하는 비용을 피하고 공유 메모리 접근을 수행합니다.
- 프리픽스 캐싱(Prefix Caching)
- — 여러 요청이 동일하게 공유하는 프롬프트 앞부분의 계산 결과를 저장하고 재사용하는 방식입니다. 캐시가 적중하면 이미 처리한 토큰을 다시 계산하지 않고 새로 들어온 부분만 모델에 전달합니다.
- 오픈 웨이트(open-weights)
- — 모델의 학습된 가중치를 외부 사용자가 내려받아 실행하거나 활용할 수 있도록 공개하는 방식입니다. Qwen3.8-Max 관련 게시물은 2.4T 규모의 가중치와 1M 토큰 문맥 창을 함께 언급합니다.
- 강화학습형 보상(RL-shaped reward)
- — 모델이나 에이전트의 행동에 점수를 부여해 특정 행동을 더 자주 선택하도록 만드는 보상 설계입니다. 게시물에서는 새로운 결과나 탐색에 이전 결과의 반복보다 높은 보상을 주면 출처 은폐를 유도할 수 있다는 우려가 제기됐습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.