TL;DR
이번 기간에는 LLM 생성 설정을 토큰 샘플링, 반복 억제, 종료 제어로 나눠 이해하는 글과, GPU 성능보다 요청 경로와 추론 배치가 첫 토큰 지연을 좌우한다는 사례가 함께 나왔다. 벡터 검색에서는 ACORN이 검색 시점에 필터 단절을 우회하는 반면 Filterable HNSW는 인덱스에 조건별 연결을 추가하며, 1% 필터·100만 벡터 조건에서 각각 67.7%와 99.8% recall이 기록됐다. Alibaba Cloud의 ANOLISA는 운영체제 프록시에서 도구 출력을 정리하고 JSON을 표 형식으로 압축해 Agent의 문맥 효율을 높이는 구조를 공개했다. Kimi Work의 금융 분석 workflow와 Hyra의 수학 난제 결과는 LLM·Agent 활용 범위가 업무 자동화와 연구 계산으로 넓어지는 흐름을 담았다.
𝕏 실시간 트렌드 토픽
➖ LLM 생성 파라미터를 세 가지 작업으로 분리포스트 1
한 토큰씩 확률분포에서 선택하는 LLM 생성 과정의 설정 7개를 분포 조정, 반복 억제, 종료 제어로 나눴다.
세부 내용 보기
- 프롬프트가 모델이 말할 내용을 정한다면 max tokens, Temperature, top_p, top_k, frequency penalty, presence penalty, stop sequences는 각 토큰을 고르고 생성을 멈추는 방식을 정한다. 이 구분이 필요한 이유는 답변의 내용과 생성 제어를 같은 문제로 다루면 설정 변경의 효과를 분리하기 어렵기 때문이다.
- Temperature는 점수를 스케일링한 뒤 확률분포를 넓히거나 좁히고, top_p는 누적 확률 p를 채우는 최소 토큰 집합만 남기며, top_k는 확률 순위 상위 k개를 고정해 남긴다. frequency penalty는 등장 횟수에 비례해 점수를 낮추고 presence penalty는 한 번이라도 나온 토큰의 점수를 낮추며, max tokens와 stop sequences는 생성 길이와 종료 시점을 결정한다.
- Temperature와 top_p는 같은 후보 풀을 넓히는 효과가 겹치므로 두 값을 동시에 바꾸면 어느 설정이 결과를 바꿨는지 판별하기 어렵다. 한 값을 조정할 때 다른 값은 고정하는 방식이 원인과 결과를 분리하는 데 적합하다.
📈 첫 토큰 지연을 GPU가 아닌 배치 위치로 해결포스트 1
LLM 챗봇의 12초 지연에서 prefill은 약 1.5초에 그치므로 GPU를 3배 빠르게 바꿔도 전체 응답 시간이 거의 줄지 않는다는 구조적 사례이다.
세부 내용 보기
- 12초의 첫 토큰 지연에서 prefill이 약 1.5초라면 이 단계를 절반으로 줄여도 750ms, 전체의 7% 미만만 절약된다. 나머지는 사용자와 실행 리전 사이의 네트워크 왕복, 요청 처리기, serverless cold start, 인증·rate limiting·프롬프트 조립, retrieval, 응답 스트리밍에 분산돼 GPU 교체만으로 바뀌지 않는다.
- LLM 앱은 사용자 가까이에 둬야 하는 짧고 급격한 요청 경로와, 장시간 GPU를 점유하는 추론 작업으로 나뉜다. 전용 GPU는 cold start를 없애지만 상시 비용과 단일 위치의 왕복 지연이 있고, container 기반 serverless는 scale-to-zero 대신 cold start를 지불하며, Edge runtime은 WebAssembly 모듈을 1ms 미만에 시작하지만 모델을 보유하지 못한다.
- 해법은 두 작업을 분리해 요청 경로를 사용자 가까운 Edge에 두고 추론을 전용 GPU에 배치하는 방식이다. 참고 구현은 Linode Kubernetes Engine의 RTX 4000 Ada GPU에서 Qwen2.5-7B-Instruct를 vllm-on-lke로 제공하고, akamai-functions-llm-chatbot에서 WebAssembly API가 KV cache를 확인한 뒤 cache miss에만 GPU 인스턴스를 호출한다.
📈 필터 검색의 병목을 인덱스 연결성으로 이동포스트 1
Qdrant 포스트는 ACORN의 검색 시점 우회와 Filterable HNSW의 인덱스 연결 추가를 비교하며 필터 적용으로 인한 HNSW 단절 문제를 다뤘다.
세부 내용 보기
- 필터 조건이 HNSW 그래프를 연결되지 않은 섬으로 나누면 검색이 후보를 따라가지 못해 recall이 낮아진다. ACORN은 query time에 필터에서 제외된 이웃을 거쳐가며 단절을 우회하고, Filterable HNSW는 같은 indexed payload 값을 가진 점 사이에 간선을 추가해 필터가 적용된 그래프 자체의 연결성을 유지한다.
- 1M 벡터에 1% 필터를 적용한 benchmark에서 Filterable HNSW는 1.0ms에 99.8% recall을 기록했고, ACORN은 4.7ms에 67.7% recall을 기록했다. 수치는 필터 조건에 맞춘 그래프를 미리 구축하는 방식이 해당 조건에서 검색 품질과 지연시간 모두에서 앞섰음을 나타낸다.
- ACORN은 broad values와 AND filters 같은 간격에서 여전히 쓰임새가 있지만, 필터를 위한 그래프가 아래에 함께 있을 때 효과가 커진다. 따라서 모든 필터 문제를 query-time 우회 하나로 처리하기보다 인덱스 구조와 검색 기법을 조건별로 조합해야 한다.
1% 필터·100만 벡터 조건에서는 payload 기반 연결을 인덱스에 추가하는 Filterable HNSW가 ACORN보다 높은 recall과 짧은 지연시간을 기록했다.
ACORN은 broad values와 AND filters 같은 조건에서 여전히 역할이 있으므로 Filterable HNSW가 모든 검색 조건을 대체한다고 볼 수 없다.
📈 ANOLISA의 Tokenless 계층으로 도구 출력 압축포스트 1
Alibaba Cloud Linux 4 Agentic Edition의 Tokenless는 Agent framework를 바꾸지 않고 운영체제 수준에서 도구 출력의 중복과 잡음을 줄이는 계층이다.
세부 내용 보기
- AI Agent가 도구를 호출할 때 null 필드, 디버그 잡음, 과도하게 큰 출력이 그대로 모델에 들어가면 문맥 토큰을 소모한다. ANOLISA는 OS-level proxy에서 이 내용을 제거한 뒤 모델이 처리할 입력만 남겨 기존 workflow의 호출 구조를 유지한다.
- 처리 순서는 도구 출력 수집, 불필요한 필드 제거, verbose JSON의 tabular notation 변환, 필요할 때 marker를 통한 원문 회수이다. 삭제된 내용은 reversible marker로 다시 가져올 수 있고, Claude Code로 같은 workflow를 테스트했다.
- Tokenless는 모델이나 framework를 교체하는 대신 모델에 도달하기 전 출력 표현을 바꾸는 접근이다. 따라서 Agent가 반복적으로 받는 구조화된 도구 결과에서 입력 토큰을 줄이는 운영체제 계층으로 작동한다.
➖ Kimi Work의 금융 분석 workflow포스트 1
Kimi Work 포스트는 금융 분석가의 반복 업무를 live investor dashboard, spreadsheet 금융 모델, batch 보고서 처리로 나눴다.
세부 내용 보기
- 금융 분석 업무에서 실시간 투자자 대시보드 구축, spreadsheet 금융 모델 업데이트, 보고서 일괄 처리와 생성이 반복 작업으로 제시됐다. Kimi Work는 이 세 작업을 별도 workflow로 묶어 금융 분석가가 사용하는 업무 흐름에 적용하는 제품으로 소개됐다.
- 튜토리얼은 세 가지 작업을 순서대로 다루며, 대시보드에서는 live 정보 흐름을 구성하고 spreadsheet에서는 금융 모델을 갱신하며 보고서 workflow에서는 여러 문서를 batch로 처리하고 생성한다. 포스트는 각 작업의 내부 구현 수치나 benchmark는 제공하지 않았다.
- 업무별 workflow를 분리하면 대시보드, 모델 파일, 보고서 묶음처럼 입력과 출력 형식이 다른 금융 작업을 하나의 범용 요청으로 처리하지 않고 목적별 절차로 구성할 수 있다.
➖ Hyra의 공개 모델이 수학 난제 계산을 확장포스트 1
Tencent Hunyuan은 Hyra가 3D Blaschke–Lebesgue, Beurling–Ahlfors, Partial Hadamard matrices, operator commutators에서 네 가지 수학 결과를 추가했다고 밝혔다.
세부 내용 보기
- Hyra의 최근 수학 업데이트는 constant-width body의 universal lower bound를 0.380799w³에서 0.411040w³로 올려 conjectured Meissner optimum의 97.9%에 도달했고, Beurling–Ahlfors의 최선 uniform L^p coefficient를 1.575에서 1.523958로 낮췄다.
- Partial Hadamard matrices에서는 점근적 개수 세기의 범위를 cubic scale에서 near-quadratic regime로 확장했고, operator commutators에서는 identity 근사 비용을 Tao의 O(log⁵(1/ε))에서 O(log³)으로 개선했다. 각 결과는 열린 문제의 경계나 근사 비용을 더 유리한 방향으로 이동시킨 수치로 제시됐다.
- 포스트는 오픈소스 모델이 open problems를 푸는 능력을 높이고 있다고 연결하지만, 네 결과의 증명 과정이나 모델 학습 방법은 밝히지 않았다. 따라서 이번 포스트에서 확인되는 범위는 수학 결과의 수치 변화와 Hyra의 공개 모델 활용 사례이다.
용어 해설
- 프리필·디코드(Prefill·Decode)
- — LLM 추론은 입력 프롬프트를 한꺼번에 처리하는 prefill과 생성 토큰을 순차적으로 계산하는 decode로 나뉜다. 두 단계의 처리 특성이 달라 첫 토큰 지연과 스트리밍 지연을 따로 측정해야 병목 위치를 파악할 수 있다.
- KV 캐시(KV Cache)
- — KV Cache는 Attention 계산에 필요한 이전 토큰의 Key·Value를 저장해 반복 계산을 줄이는 메모리 구조이다. 긴 대화나 여러 생성 단계에서 이미 처리한 문맥을 재사용해 decode 과정의 계산량을 낮추는 데 쓰인다.
- Temperature
- — Temperature는 토큰 점수를 확률로 바꾸기 전 스케일링하는 생성 설정이다. 1보다 낮으면 높은 확률의 토큰에 선택이 집중되고, 1보다 높으면 낮은 확률의 토큰도 선택될 여지가 커지며, 0에서는 출력이 사실상 결정적으로 변한다.
- 필터 대응 HNSW(Filterable HNSW)
- — Filterable HNSW는 payload 값을 공유하는 벡터 사이에 추가 연결을 만들어 필터 적용 뒤에도 검색 그래프의 연결성을 유지하는 방식이다. 필터로 그래프가 여러 섬처럼 분리되어 recall이 떨어지는 문제를 인덱스 구축 단계에서 줄인다.
- ACORN
- — ACORN은 필터 조건에 맞지 않는 이웃도 검색 시점에 통과해 필터링된 HNSW 그래프의 단절을 우회하는 기법이다. Qdrant의 비교에서는 1% 필터와 100만 벡터 조건에서 Filterable HNSW와 recall·지연시간 차이가 측정됐다.
- Agent 중심 운영체제(Agentic Operating System)
- — Agentic Operating System은 AI Agent의 도구 호출과 실행 흐름을 운영체제 수준에서 지원하는 구조이다. ANOLISA는 Tokenless 계층을 통해 도구 출력의 null 필드와 디버그 잡음을 제거하고 JSON을 더 짧은 표 형식으로 바꿔 모델 입력 토큰을 줄인다.
코드 예제
curl -fsSL https:// hermes-agent.nousresearch.com/install.sh | bashHermes Agents 설치 스크립트를 내려받아 bash로 실행하는 명령이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.