본문으로 건너뛰기

단일 GPU 추론 통합, 에이전트 탐색 폭 확장, 초저비트 양자화

추론 서버 통합과 탐색 폭 확장, 초장문맥 온디바이스 모델과 초저비트 양자화

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 기간에는 모델 자체의 크기와 기능뿐 아니라 추론에 투입하는 탐색량, 여러 모델을 배치하는 서버 구조, 요청을 묶는 방식이 함께 부각됐습니다. SIE는 임베더·재순위화 모델·개체 추출기·LLM을 한 프로세스에서 교체 로드해 단일 GPU의 유휴 메모리 비용을 줄이고, vLLM은 DeepSeek-V4-Flash-Vision-Exp와 Spark-X2.5 계열을 바로 서빙하는 경로를 마련했습니다. 한편 Test-time Scaling은 시간축의 깊이와 에이전트 수에 따른 폭을 모두 확장해야 한다는 관점을 내놓았고, Fast Weight Attention과 Sherry 양자화는 메모리 갱신 방식과 가중치 저장량을 줄이는 방향을 각각 다뤘습니다.

𝕏 실시간 트렌드 토픽

📈 SIE의 단일 GPU 다중 모델 추론포스트 1

Superlinked Inference Engine이 검색·재순위화·개체 추출·생성에 쓰이는 여러 모델을 하나의 API와 프로세스로 묶는 구조를 공개했습니다.

세부 내용 보기
  • 기존 에이전트 파이프라인은 임베더, 재순위화 모델, 개체 추출기, LLM마다 별도 서버를 두어 요청이 없어도 각 서버가 GPU 메모리를 점유하는 구조였습니다. SIE는 트래픽이 발생한 모델만 한 프로세스에서 불러오고 가장 오래 사용하지 않은 모델부터 퇴출해, 호출 비용보다 서버 유지 비용이 큰 환경의 병목을 줄이는 방식입니다.
  • SIE는 encode()로 벡터를 반환하고 score()로 관련도 점수를 계산하며 extract()로 개체 구간을 추출하고 generate()로 소형 오픈 LLM을 실행하는 네 가지 호출을 제공합니다. Apache 2.0 서버 하나가 85개 이상 모델을 단일 API 뒤에서 실행하고, 노트북부터 Kubernetes 클러스터까지 배포되도록 구성됐습니다.
  • 게시물은 기존 구조에서 vLLM, TEI, 사용자 정의 FastAPI 래퍼가 모델별로 나뉘었다고 설명하며, SIE 전환으로 셀프 호스팅 비용이 약 4배 낮아진다고 밝혔습니다. Qdrant, Weaviate, Chroma, LanceDB, LangChain, LlamaIndex와 연결되고, 단일 GPU에서 소형 언어 모델·OCR·NER·재순위화 모델·객체 검출기 다섯 개를 운영하는 사례도 제시됐습니다.
원문 트윗 1개 보기

Avi Chawla

@_avichawla

3일 전

Massive breakthrough here! Researchers built a new AI inference engine that: - reduces self-hosting costs by ~4x - runs a full agentic pipeline on one GPU - serves 20+ architectures, not just LLMs And it's fully open-source. Here's the core problem with engines like vLLM that it solves: Most agent pipelines today run 4-5 small models under the hood: - an embedder for retrieval - a reranker for precision - an extractor for entities - and an LLM for generation The standard way to serve them is one server per model. vLLM serves the LLM, TEI serves the embedder, and everything else gets a custom FastAPI wrapper. Each server reserves its own slice of GPU memory and holds it whether traffic arrives or not. GPUs are billed by the hour, so idle time costs the same as busy time. This is why switching to small models rarely reduces the bill. The cost is never in the calls but rather in maintaining the servers. The structural fix is serving every model from one process that loads and evicts models based on traffic. Superlinked open-sourced a new inference engine that does exactly that. SIE (Superlinked Inference Engine) is an Apache 2.0 server that runs 85+ models behind one API. Four calls cover the whole pipeline: - encode() returns vectors - score() returns relevance scores - extract() returns entity spans - and generate() runs small open LLMs. Models load on first request and are evicted least-recently-used, so one GPU serves a rotating set of models instead of sitting siloed behind one. It runs anywhere from a laptop to a Kubernetes cluster, and it plugs into Qdrant, Weaviate, Chroma, LanceDB, LangChain, and LlamaIndex. GitHub repo: https:// github.com/superlinked/sie (don't forget to star ) To dive deeper, my co-founder also wrote a hands-on guide to using SIE. It walks through a real-world example where you can learn to deploy and manage five models on a single GPU, including a small language model, an OCR model, an NER model, a reranker, and an object detector. Read it below.

💬 2 1 6👁 316

Test-time Scaling의 탐색 폭 확장포스트 1

Test-time Scaling을 더 오래 실행하는 깊이와 더 많은 에이전트를 투입하는 폭이라는 두 축으로 나누는 관점이 제기됐습니다.

세부 내용 보기
  • 어려운 문제를 추론 시점에 풀 때는 한 에이전트의 실행 시간을 늘리는 방식만으로 탐색 공간을 넓히기 어렵다는 맥락입니다. 여러 에이전트를 동시에 실행하면 서로 다른 해답 후보를 폭넓게 검색할 수 있어, 시간축의 깊이와 병렬 탐색의 폭을 함께 조절하는 구조가 됩니다.
  • 게시물은 첫 번째 축을 장시간 에이전트 실행으로, 두 번째 축을 더 많은 에이전트 실행으로 구분했습니다. 전자는 한 경로를 더 오래 확장하고 후자는 여러 경로를 병렬로 탐색하므로, 입력 문제의 난도와 필요한 검색 범위에 따라 계산 자원을 배분하는 기준이 됩니다.
  • 작성자는 긴 실행 시간에 따른 확장은 널리 알려졌지만 에이전트 수를 늘리는 확장도 똑같이 중요하다고 밝혔습니다. 이 관점은 단일 추론 경로의 개선뿐 아니라 후보 생성과 비교를 위한 병렬 실행량까지 Test-time Scaling의 설계 범위에 포함시킵니다.
원문 트윗 1개 보기

DeepSeek-V4 비전 모델과 vLLM 서빙포스트 1

DeepSeek-V4-Flash-Vision-Exp가 V4 계열의 첫 멀티모달 모델로 공개됐고, vLLM이 출시 시점부터 서빙을 지원했습니다.

세부 내용 보기
  • DeepSeek-V4-Flash-Vision-Exp는 V4-Flash MoE 백본에 비전 인코더와 정렬기를 결합해 이미지와 텍스트를 함께 처리하는 구조입니다. 285B/13B 백본을 기반으로 하면서 텍스트 에이전트 점수는 유지하도록 설계됐다는 설명입니다.
  • DeepSeek API Platform에서 실험 모델로 제공되며, 텍스트 능력은 에이전트·추론·세계 지식 영역에서 DeepSeek-V4-Flash와 같다고 밝혔습니다. 멀티모달 에이전트 벤치마크에서도 성능을 측정하는 경로가 함께 제시됐습니다.
  • vLLM은 별도 레시피를 통해 DeepSeek-V4-Flash-Vision-Exp를 바로 서빙합니다. 모델 출시와 추론 엔진 지원이 맞물리면서 멀티모달 에이전트 파이프라인에서 비전 입력을 포함한 모델을 기존 서빙 계층에 연결하는 흐름이 형성됐습니다.
원문 트윗 1개 보기

Spark-X2.5의 100만 토큰 온디바이스 에이전트포스트 1

Spark-X2.5-4B와 1.7B가 공개됐으며, 두 모델 모두 100만 토큰 네이티브 문맥과 200개 이상 언어를 지원하는 온디바이스 에이전트 모델로 소개됐습니다.

세부 내용 보기
  • Spark-X2.5-4B와 Spark-X2.5-1.7B는 에이전트, 코드, 수학, 지시 이행에 맞춰 조정된 소형 모델입니다. Hybrid-attention architecture를 사용해 긴 문맥을 처리하며, 게시물은 두 모델 모두 최대 1,000,000토큰의 네이티브 문맥을 지원한다고 밝혔습니다.
  • 두 모델은 200개 이상 언어를 처리하고, Spark의 out-of-tree general plugin을 통해 출시 당일부터 vLLM에서 실행됩니다. 따라서 모델 가중치 공개와 별개로 실제 추론 서버에 연결하는 경로가 동시에 마련됐습니다.
  • 소형 모델 크기와 온디바이스 실행을 전제로 하면서도 100만 토큰 문맥을 유지하는 조합은 긴 대화나 에이전트 작업 기록을 외부 요약으로 줄이지 않고 처리하는 선택지를 넓힙니다. 다만 게시물에는 구체적인 성능 수치나 하드웨어 조건이 제시되지 않았습니다.
원문 트윗 1개 보기

LLM 추론의 Static·Dynamic·Continuous Batching포스트 1

LLM 서빙에서 Static, Dynamic, Continuous Batching을 비교하는 실무 자료가 공유됐습니다.

세부 내용 보기
  • LLM 추론은 각 요청의 출력 길이와 종료 시점이 달라 전통적인 ML 추론처럼 고정된 입력 묶음만 처리하기 어렵다는 맥락입니다. 요청을 어떤 시점에 묶고 언제 새 요청을 넣는지가 GPU 활용률과 대기 시간에 직접 영향을 줍니다.
  • Static Batching은 정해진 요청 묶음을 한 번에 처리하고, Dynamic Batching은 도착한 요청을 일정 조건에 따라 묶으며, Continuous Batching은 생성 중인 요청 사이에 새 요청을 계속 편입하는 방식입니다. 세 전략은 입력 도착과 출력 종료의 비동기성을 다르게 처리합니다.
  • 게시물은 세 전략이 어떻게 작동하고 LLM 서빙이 전통적 ML 추론과 왜 다른지 설명하는 상세 글을 인용했습니다. 구체적인 처리량이나 지연 시간 수치는 제공되지 않았으므로, 이 기간에는 방식 비교와 선택 기준이 중심으로 남았습니다.
원문 트윗 1개 보기

Hy4 preview의 1.25비트 Sherry 양자화포스트 1

TencentAI_News가 Sherry 양자화로 Hy4 preview의 가중치를 1.5TB에서 214GB로 줄이고 여러 장비의 GPU를 연결하는 실행 방식을 제시했습니다.

세부 내용 보기
  • Hy4 preview처럼 큰 모델은 가중치 저장량이 단일 장비의 메모리 한계를 넘을 수 있어, 모델 호출보다 가중치를 보관하는 인프라가 먼저 병목이 됩니다. Sherry는 가중치를 개당 1.25비트로 패킹해 저장 공간을 줄이는 방식입니다.
  • 게시물에 따르면 1.5TB였던 모델이 214GB로 축소돼 약 7분의 1 크기가 됐습니다. 양자화된 가중치를 여러 머신에 있는 GPU에 나눠 연결하면 이미 보유한 장비를 조합해 모델을 실행할 수 있다는 경로도 함께 제시됐습니다.
  • TencentAI_News는 이 방식을 Hy4 preview의 핵심 기술로 설명했지만, 정확도 변화나 실제 추론 속도 수치는 공개하지 않았습니다. 따라서 이번 포스트에서 확인되는 효과는 저장 용량 감소와 분산 GPU 실행 가능성에 한정됩니다.
원문 트윗 1개 보기

Fast Weight Attention의 온라인 메모리 갱신포스트 1

Fast Weight Attention 연구가 어텐션 비용을 낮추기 위해 고정 크기 메모리를 계속 다시 쓰는 모델의 갱신 신호를 다뤘습니다.

세부 내용 보기
  • Fast-weight 모델은 어텐션이 참조하는 메모리를 무한히 늘리는 대신 작은 고정 크기 메모리를 반복해서 갱신합니다. 이 구조는 메모리 크기를 제한하면서 최근 입력을 반영하려는 방식이지만, 무엇을 기준으로 메모리를 다시 쓸지가 핵심 문제가 됩니다.
  • 게시물은 모델이 방금 예측한 내용에서 실제로 예측해야 했던 내용으로 학습 신호를 옮기는 온라인 학습형 갱신이 필요하다고 설명합니다. 입력을 메모리에 단순 복사하는 대신 예측 결과와 실제 목표의 차이를 이용해 고정 메모리를 수정하는 흐름입니다.
  • 공유된 논문 제목은 “Fast Weight Attention for Continual Learning”이며, 게시물에는 벤치마크 수치나 구체적인 메모리 절감량이 없습니다. 확인 가능한 기여는 지속 학습 상황에서 메모리 재작성 규칙을 예측 오차 중심으로 바꾸는 문제 설정입니다.
원문 트윗 1개 보기

용어 해설

추론 시점 확장(Test-time Scaling)
모델 학습이 끝난 뒤 문제를 풀 때 더 많은 계산을 투입하는 방식입니다. 여러 단계의 에이전트 실행으로 탐색 깊이를 늘리거나, 여러 에이전트를 병렬로 실행해 탐색 폭을 넓히며, 어려운 문제에서 해답 후보를 더 폭넓게 찾는 데 쓰입니다.
혼합 전문가 모델(MoE)
하나의 거대한 신경망을 여러 전문가 모듈로 나누고 입력마다 필요한 모듈을 선택하는 구조입니다. DeepSeek-V4-Flash-Vision-Exp는 285B/13B V4-Flash MoE 백본에 비전 인코더와 정렬기를 결합해 멀티모달 입력을 처리합니다.
추론 엔진(Inference Engine)
학습된 모델에 요청을 전달하고 결과를 반환하는 실행 계층입니다. SIE는 여러 모델을 하나의 프로세스에서 트래픽에 따라 로드·퇴출해 임베딩, 재순위화, 개체 추출, 생성을 단일 API로 처리합니다.
연속 배칭(Continuous Batching)
추론 요청이 끝날 때까지 고정된 묶음으로 기다리지 않고, 실행 중인 배치에 새 요청을 동적으로 합류시키는 방식입니다. 요청별 생성 길이가 다른 LLM 서빙에서 GPU 유휴 시간을 줄이는 핵심 전략으로 제시됐습니다.
고속 가중치 어텐션(Fast Weight Attention)
어텐션이 참조하는 작은 고정 크기 메모리를 계속 다시 쓰는 구조입니다. Fast Weight Attention 연구는 모델이 직전에 예측한 내용보다 실제 정답에 가까운 신호를 온라인 학습처럼 메모리 갱신에 반영해야 한다고 다룹니다.
Sherry 양자화(Sherry)
가중치를 1.25비트씩 저장하도록 압축하는 Tencent의 양자화 방식입니다. Hy4 preview의 크기를 1.5TB에서 214GB로 줄이고, 여러 장비에 있는 GPU를 연결해 실행하는 경로를 여는 방식으로 소개됐습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 01.수집 2026. 09. 01.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.