본문으로 건너뛰기

Hermes Agent 라우팅, Qwen3 추론 구현, 로컬 분산 추론과 실시간 정보 대시보드

모델별 Provider 설정부터 KV 캐싱·분산 추론까지 실행 환경을 세분화하는 도구와 기법

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 기간에는 Hermes Agent가 OpenRouter Provider를 모델별로 지정하는 설정과 여러 Hermes 환경을 한 모바일 앱에서 전환하는 기능이 함께 부각됐다. 구현 학습 측면에서는 Qwen3의 텍스트 생성 과정을 처음부터 재현하며 KV caching과 torch.compile을 결합해 속도 차이를 측정하는 흐름이 공유됐다. Tail-Likelihood Reinforcement Learning은 평균 보상 대신 각 보상 임계값을 넘을 확률을 최적화해 희귀한 고보상 출력을 다루려는 접근으로 제시됐다. 이와 함께 단일 DGX Spark의 Qwen3.8 Flash Next 성능, 브라우저 기반 실시간 정보 대시보드, 로컬 네트워크 PC를 활용한 NVIDIA’s PAIR 분산 추론이 언급됐다.

𝕏 실시간 트렌드 토픽

📈 Hermes Agent의 모델별 Provider 라우팅과 다중 환경 모바일 접속포스트 2

Hermes Agent 사용자는 이제 OpenRouter Provider를 전체가 아닌 모델별로 고정하거나 선택 목록으로 지정할 수 있다. 별도의 Hermes Bots 앱에서는 한 휴대폰에서 홈 서버·VPS·Cloud·로컬 등 여러 환경을 전환한다.

세부 내용 보기
  • 기존에는 Provider를 전역에서 잠그는 방식이라 모델을 바꿀 때 같은 Provider 제약을 유지하기 어려웠지만, Hermes Agent 설정에 모델별 재정의 항목을 두어 요청마다 다른 Provider 경로를 선택하는 구조로 바뀌었다. 모델 전환과 Provider 제약을 함께 관리해야 하는 사용자의 설정 부담을 줄이는 기능이다.
  • 비공식 Hermes Bots 모바일 앱은 한 기기에서 여러 Hermes 설정에 연결하고, 연결 대상을 전환한 뒤 각 환경에서 실행 중인 Bot에 접근하는 흐름을 지원한다. 홈 서버·VPS·Cloud·서로 다른 VPN·로컬 환경을 매번 재설정하지 않고 오갈 수 있다는 점이 핵심이다.
원문 트윗 2개 보기

Qwen3 텍스트 생성의 처음부터 구현과 KV 캐싱 측정포스트 1

Reasoning from scratch 강의는 Qwen3를 불러 텍스트 생성 과정을 직접 구현하고, KV caching과 torch.compile을 결합해 추론 속도를 비교하는 순서를 따른다. 토큰화·Logits·Greedy decoding·CPU와 GPU 성능 비교가 한 흐름에 포함됐다.

세부 내용 보기
  • LLM 입력은 토큰화 뒤 Input tensor와 Batch dimension으로 변환되고, pretrained Qwen3가 선택한 장치에서 Logits와 다음 토큰 확률을 계산한다. 이후 argmax 기반 Greedy decoding과 Streaming text generator가 종료 토큰을 처리하며 문장을 출력하는 구조다.
  • KV caching은 이전 단계에서 계산한 상태를 저장해 다음 토큰 생성 때 반복 계산을 줄이는 방식으로 적용됐다. 포스트의 강의 구성은 KV 캐싱을 넣기 전후의 속도 향상을 측정한 뒤 torch.compile을 결합하고 CPU와 GPU 결과를 비교하는 실험 순서다.
원문 트윗 1개 보기

희귀 고보상 출력을 겨냥한 Tail-Likelihood Reinforcement Learning포스트 1

Tail-Likelihood Reinforcement Learning은 평균 보상 최적화가 드물지만 탁월한 출력을 억누르고 Best-of-k 스케일링을 약화할 수 있다는 문제에서 출발한다. 모든 보상 임계값을 넘을 확률을 최적화해 보상 분포의 꼬리 부분에 더 큰 비중을 둔다.

세부 내용 보기
  • 표준 RL은 평균 reward를 높이는 과정에서 대부분의 결과에 유리한 방향으로 학습되므로, 드물게 나타나는 높은 reward 결과의 확률이 충분히 커지지 않을 수 있다. 이 특성이 여러 후보 중 최고 결과를 고르는 Best-of-k 평가와 충돌한다는 문제의식이다.
  • 제안된 방식은 하나의 평균값만 키우는 대신 각 reward threshold를 초과할 probability를 기준으로 학습 신호를 구성한다. 입력된 출력 후보의 보상 분포에서 높은 임계값을 넘는 희귀 결과에 더 많은 가중치를 주는 구현 방향이다.
원문 트윗 1개 보기

단일 DGX Spark에서의 Qwen3.8 Flash Next 로컬 추론 수치포스트 1

Qwen3.8 Flash Next는 단일 DGX Spark에서 prose 기준 단일 스트림 46 tok/s, 4개 동시 스트림 108 tok/s를 기록했다. Prefill은 문맥 길이 전반에서 2,000–2,200 tok/s로 제시됐고 KV cache 크기는 1M으로 언급됐다.

세부 내용 보기
  • 측정은 prose 생성과 Prefill을 분리해 진행됐다. 단일 스트림과 4개 동시 스트림의 생성 속도를 따로 제시하고, 모든 context size에서 Prefill 처리량을 함께 비교해 로컬 장치의 대화형 생성과 긴 입력 처리를 구분했다.
  • 포스트는 KV cache가 1M으로 바뀌었다고 전하며, 이를 근거로 집에서 실행하는 모델이 Claude Opus (Max) 수준에 가까워졌다고 평가한다. 같은 글에는 SWE-Bench Verified 79.6%와 단일 DGX Spark 구성이 함께 언급됐다.
원문 트윗 1개 보기

브라우저에서 실시간 신호를 추적하는 오픈소스 World Monitor포스트 1

World Monitor는 전쟁·군사 활동·인프라·시위·시장 신호를 실시간으로 추적하는 무료 글로벌 정보 대시보드로 제시됐다. 브라우저에서 실행되고 MIT 라이선스를 사용한다.

세부 내용 보기
  • 사용자는 별도 데스크톱 프로그램 대신 브라우저에서 대시보드를 열고 여러 신호를 한 화면에서 확인한다. 추적 대상은 분쟁뿐 아니라 군사 활동, 인프라, 시위, 시장 신호까지 포함돼 사건별 데이터를 한 흐름으로 묶는다.
  • 서비스는 무료로 제공되며 소스가 공개되고 MIT 라이선스가 적용됐다. 포스트에 적힌 worldmonitor.app 주소를 통해 브라우저 실행 환경에 바로 접근하는 구조다.
원문 트윗 1개 보기

NVIDIA’s PAIR의 로컬 네트워크 분산 추론포스트 1

NVIDIA’s PAIR는 로컬 네트워크에서 호환 PC를 찾고 여러 장치에 AI 추론을 분산하는 도구로 언급됐다. Ollama와 LM Studio 같은 로컬 실행 도구를 지원해 단일 PC 밖으로 추론 자원을 확장한다.

세부 내용 보기
  • 구성의 첫 단계는 같은 로컬 네트워크에 연결된 호환 PC를 탐색하는 일이다. 이후 발견한 장치들의 연산 자원을 추론 작업에 배분해, 한 컴퓨터의 자원만 사용하는 대신 네트워크 안의 여러 PC를 함께 활용한다.
  • 지원 대상으로 Ollama와 LM Studio가 명시됐다. 모델 실행 도구와 PC 탐색·분산 계층을 연결하면 별도 중앙 서버를 추가하지 않고도 로컬 환경에서 AI 추론을 나눠 처리하는 구조가 된다.
원문 트윗 1개 보기

용어 해설

Provider 라우팅(Provider Routing)
하나의 모델 요청을 여러 Provider 중 원하는 곳으로 보내는 방식이다. Hermes Agent에서는 전체 설정이 아니라 모델별로 Provider를 고정하거나 선택 목록을 지정해 모델마다 다른 경로를 유지한다.
KV 캐싱(KV Caching)
LLM이 이전 토큰의 Key·Value 상태를 저장해 다음 토큰 생성 때 같은 계산을 반복하지 않는 방식이다. 저장된 캐시를 재사용하면 긴 문맥의 추론 속도를 높일 수 있다.
Best-of-k 스케일링(Best-of-k Scaling)
여러 출력 후보를 생성한 뒤 가장 높은 보상 결과를 선택하는 평가 방식이다. 희귀한 고보상 결과가 얼마나 잘 나타나는지가 평균 보상과 별도로 중요해진다.
추론(Inference)
학습이 끝난 모델에 입력을 넣고 다음 토큰이나 결과를 계산하는 과정이다. 이번 포스트에서는 KV 캐시와 여러 PC의 자원을 활용해 이 계산의 속도와 처리 범위를 넓히는 방식이 다뤄졌다.
분산 추론(Distributed Inference)
여러 컴퓨터의 연산 자원을 네트워크로 묶어 하나의 AI 추론 작업에 나누어 쓰는 방식이다. NVIDIA’s PAIR는 로컬 네트워크에서 호환 PC를 찾고 Ollama와 LM Studio 같은 도구의 추론을 분산한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 06.수집 2026. 09. 06.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.