본문으로 건너뛰기

Wan3.0 플랫폼 확장, 작업 단위 모델 고정, 오프라인 로봇 검색

Wan3.0의 유통 확대와 Prompt Cache를 보존하는 Model Affinity

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 포스트에서는 반복 문맥의 캐시를 보존하기 위해 호출마다 모델을 바꾸기보다 작업 단위로 모델을 고정하는 라우팅 방식이 부상했습니다. Plano는 OpenAI 호환 endpoint와 YAML 설정으로 이 구조를 구현하며, 고정은 기본 10분 동안 유지되고 여러 replica 환경에서는 Redis를 사용할 수 있습니다. 별도 연구에서는 한 모델의 KV cache를 다른 모델 형식으로 바꿔 재처리보다 2.7x-25x 빠르게 전송하는 방법이 다뤄졌지만, 현재는 같은 계열 모델 사이의 실험에 머뭅니다. 한편 Wan3.0은 ComfyUI·OpenRouter·Runway·TopviewAI 등으로 제공 범위를 넓혔고, Qdrant Edge와 MobileCLIP2는 네트워크 없이 창고 로봇의 상품 시각 검색을 처리합니다.

𝕏 실시간 트렌드 토픽

📈 작업 단위 Model Affinity와 Prompt Cache 보존포스트 4

세션 중 모델을 계속 바꾸면 새 모델에서 전체 Prompt Cache를 다시 계산하고 입력 토큰 비용도 다시 부담해야 합니다. Model Affinity는 첫 호출에서 고른 모델을 작업 식별자에 묶어 후속 호출에 재사용하며, KV cache 변환 연구는 향후 중간 전환 비용을 줄일 가능성을 남겼습니다.

세부 내용 보기
  • 호출마다 의도를 판별하는 기존 라우터는 하나의 작업 중에도 모델을 바꿀 수 있어 새 모델이 문맥을 cold 상태에서 다시 구축하게 됩니다. 첫 LLM 호출에서 쉬운 작업은 저렴한 모델, 어려운 작업은 비싼 모델로 보내고 이후 호출을 같은 모델에 고정하면 라우팅 기능을 유지하면서 반복 prefill과 입력 토큰 재지불을 피하는 구조입니다.
  • Plano는 OpenAI 호환 endpoint 뒤에서 이 방식을 구현하며, 작업마다 UUID 형식의 affinity_id를 생성해 루프의 모든 호출에 X-Model-Affinity 헤더로 전달합니다. 고정 기간은 기본 10분이고 작업이 바뀌면 새 ID를 발급하며, replica가 여러 개이면 Redis를 연결할 수 있습니다.
  • NVIDIA가 발표한 방법은 한 모델의 KV cache를 다른 모델이 기대하는 형식으로 변환해 대상 모델의 prefill을 생략하며, 변환 속도는 문맥 재처리보다 약 2.7x-25x 빠릅니다. 이 방식은 closed-form·training-free이지만 시험한 조합이 Qwen to Qwen과 Llama to Llama 같은 동일 계열에 한정되고 cross-family 전송은 향후 과제로 남아 있습니다.
원문 트윗 2개 보기

Avi Chawla

@_avichawla

11일 전

How to think about model routing in production: Traditional routers classify by intent, and inside one task the intent keeps changing. Each call gets scored on its own, usually with no context that it's the middle of something. So if the routing layer switches the model midway, the new model has to build the whole cache again, at cold rates. Routing per call is the problem, not routing itself, so one common solution is to route once per task, not once per call. First LLM call routes normally, and that model gets pinned to a session ID. Every subsequent call goes to the same model. When the task changes, the pin resets, and the router picks again. This still gives you routing, but it's just that it happens at the point where switching is actually (or mostly) free. Easy tasks get routed to the cheap model and hard ones to the expensive model, and the model stays pinned during the same task. The idea is called model affinity, and the visual below explains this. To use this in practice, Plano (open-source) already implements it behind an OpenAI-compatible endpoint. You can integrate it by just changing the base URL in the actual code while the whole model routing config is defined in a YAML file. Basically, you generate one ID per task and pass it as a header on every call in the loop: ``` affinity_id = str(uuid.uuid4()) response = client(.)chat(.)completions(.)create( ..., extra_headers={"X-Model-Affinity": affinity_id}, ) ``` The pin lasts 10 minutes by default, and you can back it with Redis if you run more than one replica. When the task changes, you can swap in a new ID, and it routes again. Here's the repo: http:// github.com/katanemo/plano Btw, there's also early research trying to remove the KV transfer constraint. NVIDIA published a method recently that converts one model's KV cache into the format another model expects, so the target skips prefill entirely, and the conversion runs about 2.7x-25x faster than reprocessing the context. It's closed-form and training-free, which is new. But every pair they tested is within one family, Qwen to Qwen and Llama to Llama, and cross-family is listed as future work. So it's not production-ready yet. But if cross-family transfer gets solved, you could switch models mid-task without repaying for the cache. NVIDIA paper: https:// arxiv.org/abs/2608.03893

Teknium

Just FYI. If you are switching models in a session all the time - you are doing it wrong. Every time you switch, your entire prompt cache is invalidated on the new model you switch to, and you have to repay the full input tokens price for all of it. Stop doing this unless those

트윗에 첨부된 이미지
💬 0 2 3👁 265

Teknium

@Teknium

11일 전

Just FYI. If you are switching models in a session all the time - you are doing it wrong. Every time you switch, your entire prompt cache is invalidated on the new model you switch to, and you have to repay the full input tokens price for all of it. Stop doing this unless those models are free. This is not a hermes thing - this is a fundamentals of inference thing.

💬 5 4 38👁 824

Qdrant Edge와 MobileCLIP2의 오프라인 상품 검색포스트 2

창고 로봇이 네트워크 없이 상품을 식별하도록 Qdrant Edge의 벡터 인덱스와 MobileCLIP2를 로봇 내부에서 실행하는 구성이 제시됐습니다. Multivectors와 MAX_SIM은 상품의 시점 변화, 구김, 부분 가림을 고려해 시각 검색을 수행합니다.

세부 내용 보기
  • 창고 환경에서는 네트워크에 의존하지 않고 로봇이 상품 카탈로그와 현장 영상을 직접 대조해야 합니다. Qdrant Edge의 벡터 인덱스와 MobileCLIP2 vision model을 로봇에 배치하면 이미지 입력을 장치 내부 벡터 검색 흐름으로 연결할 수 있습니다.
  • 상품을 한 장의 고정된 특징으로 표현하지 않고 여러 시점의 벡터를 함께 저장한 뒤 MAX_SIM으로 입력 영상과 가장 잘 맞는 조합을 찾습니다. 그 결과 상품이 다른 각도에서 보이거나 구겨졌거나 일부만 노출된 경우에도 검색 대상과의 대응을 계산할 수 있습니다.
  • 게시물은 이 구성을 warehouse robotics의 offline visual search 사례로 연결하며 관련 구현 글을 함께 가리킵니다. 네트워크가 끊긴 현장에서도 인식 모델과 검색 인덱스가 같은 로봇 안에서 작동한다는 점이 핵심입니다.
원문 트윗 2개 보기

🔥 Wan3.0, 30초 생성의 서비스·창작 생태계 확장포스트 13

Wan3.0이 ComfyUI·OpenRouter·Runway·TopviewAI 등 여러 서비스에 연결되며 2-30초 영상과 최대 1080p 출력을 제공하는 흐름이 이어졌습니다. 게시물들은 단일 생성 장면, 캐릭터 일관성, 참조 입력, 변형 VFX와 광고·단편·패션 영상 사례를 함께 다뤘습니다.

세부 내용 보기
  • Wan3.0은 OpenRouter에서 텍스트·이미지·reference를 입력받아 2-30초 영상을 480p·720p·1080p로 생성하고, Runway에서는 여러 image·video·audio reference를 함께 사용합니다. ComfyUI에서도 한 번에 30초 장면을 만들며 480p는 반복 작업, 1080p는 제작 품질 용도로 배치됐습니다.
  • VivaReel 사례에서는 인간에서 용으로 이어지는 변형, 에너지 형성, 캐릭터 이동, 공중 카메라 움직임을 한 장면에 연결하고, 다른 작품에서는 폐허 세계의 외계인과 LED 얼굴 로봇, 말없는 우정, 감정적인 하트 수선 이야기를 구성했습니다. 게시물은 여러 장면에서 캐릭터 세부와 조명·제품 외형을 유지하는 용도도 함께 제시했습니다.
  • Wan3.0은 Qwen Cloud와 Alibaba Cloud Model Studio뿐 아니라 ComfyUI·OpenRouter·Runway·TopviewAI에서 접근할 수 있게 됐고, OpenRouter의 출시 가격은 해상도별 초당 $0.05/$0.10/$0.20이며 한시적으로 15% 할인이 적용됩니다. SousakuAI와 Pollo AI는 각각 30초 창작 공모전과 15s 이상 패션 영상 챌린지를 열어 모델 사용처를 넓혔습니다.
원문 트윗 2개 보기

용어 해설

프롬프트 캐시(Prompt Cache)
이전 요청에서 계산한 입력 문맥의 중간 결과를 저장해 반복 입력의 처리 비용과 지연을 줄이는 방식입니다. 모델을 바꾸면 기존 캐시를 재사용하지 못해 전체 문맥을 다시 처리해야 합니다.
모델 어피니티(Model Affinity)
하나의 작업에 선택한 모델을 고정하고 후속 호출도 같은 모델로 보내는 라우팅 방식입니다. 작업이 바뀌면 고정 식별자를 새로 발급해 라우팅을 다시 수행합니다.
KV 캐시 전송(KV Cache Transfer)
한 모델이 만든 KV 캐시를 다른 모델이 읽을 수 있는 형식으로 변환하는 처리입니다. 성공하면 대상 모델이 문맥을 처음부터 채우는 prefill 단계를 건너뛸 수 있습니다.
멀티벡터(Multivectors)
하나의 상품이나 이미지에 여러 벡터를 연결해 서로 다른 시점과 부분 정보에서 유사도를 계산하는 표현 방식입니다. 구겨지거나 일부만 보이는 상품 검색에 쓰입니다.
MAX_SIM
여러 벡터 사이의 유사도를 비교할 때 가장 잘 맞는 조합을 기준으로 검색 결과를 산출하는 방식입니다. 상품의 다양한 시점 표현을 하나의 검색 대상과 대조하는 데 사용됩니다.
오프라인 시각 검색(Offline Visual Search)
네트워크 연결 없이 장치 내부의 이미지 인식 모델과 벡터 인덱스로 대상을 찾는 검색 방식입니다. 창고 로봇이 상품 카탈로그와 입력 영상을 현장에서 직접 대조합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 25.수집 2026. 08. 25.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.