35ms Fast Path과 80% 성공률 개선을 목표로 한 LHIC 하이브리드 에이전트
LHIC는 로컬 Fast Path과 LLM 기반 Slow Path를 결합해 평균 35ms 응답과 레이아웃 변경에 대한 80% 향상된 요소 탐지 성공률을 달성하는 오픈소스 브라우저 에이전트이다.
Hacker News의 LLM 관련 최신 게시물 피드입니다.
LHIC는 로컬 Fast Path과 LLM 기반 Slow Path를 결합해 평균 35ms 응답과 레이아웃 변경에 대한 80% 향상된 요소 탐지 성공률을 달성하는 오픈소스 브라우저 에이전트이다.
모델 구조와 런타임 최적화를 함께 설계하여 메모리·대역폭 병목을 줄이고 추론 효율을 개선하는 접근법을 제시한다.
Tilth가 ripgrep과 tree-sitter의 연계를 통해 코드 리딩을 개선하고 v0.4.5에서 TOKEN_THRESHOLD를 3500에서 6000으로 늘려 중간 크기 파일의 전체 내용을 반환하도록 변경해 Sonnet이 52/52로 100% 정확도를 달성했다.
27B급 온디바이스 LLM은 ternary 양자화로 메모리에 적재할 수 있어도 LPDDR 대역폭이 병목이며 CaSA는 상용 DRAM 내부 전하 공유로 메모리 버스 없이 추론을 수행한다고 주장한다.
이 시스템은 3d10 주사위로 생성한 벨 커브 분포를 바탕으로 LLM이 주사위 결과를 서사로 구현하고 분류기가 상황별 수정치를 계산해 서사와 게임 상태를 동기화한다.
WorldBuild Bench는 동일한 30줄 내외 게임 프롬프트로 9개 모델이 생성한 브라우저용 3D 게임 27개를 블라인드 비교해 공간·시간·인과 일관성과 비용을 함께 평가했다.
저자는 ESP32에서 호스트로부터 필요한 가중치만 WiFi로 스트리밍해 LLM 추론을 구현했고 속도는 매우 느렸으나 슬라이딩 윈도우로 무한 생성이 가능하다고 설명했다.
DWS Report는 RSS를 15분마다 수집해 LLM으로 기사 중요도를 평가하고 임베딩 DB로 중복을 제거한 뒤 시간에 따라 점수를 감쇠시키는 자체 호스팅 뉴스 집계 시스템이다.
JAX 기반 LLM 학습에서 고대역폭 메모리(HBM) 병목을 호스트 오프로딩으로 완화하는 방안을 제시하는 NVIDIA 개발자 블로그 글이다.
머신을 프로파일링해 실행 가능한 모델을 선택하고 로컬 서버와 Cloudflare Quick Tunnel을 자동으로 구성해 Cursor에서 'Local Motion'을 모델로 선택해 바로 사용하는 플러그인이다.
.NET 기반 네이티브 인퍼런스 엔진으로 GGUF 모델을 로컬에서 실행하며 CLI, 브라우저 채팅 서버와 OpenAI 및 Ollama 호환 API를 제공한다.
작성자는 코딩에 qwen3-coder-next를, TTS에 Fish Audio S2 Pro와 STT에 Whisper를, 이미지 생성·분석에 Flux와 Gemma를 사용하며 Apple M5 Max 탑재 16형 MacBook Pro에서 128GB 통합 메모리로 운영한다.
Debategle은 FastAPI 백엔드와 Clerk 인증, Elo 스타일 랭킹을 통해 실시간 1대1 토론을 매칭하고 LLM에게 논증 구조와 반박을 중심으로 승패를 판단하게 하는 플랫폼이다.
Bash4LLM은 Bash·curl·jq만으로 LLM API 요청과 스트리밍 출력, 파일 단위 처리, 세션 메타데이터 저장을 수행하는 단일 파일 유틸리티이다.
Qwen3:4B를 베이스로 Unsloth로 메모리 효율을 확보하여 RTX 5070에서 Fine-tuning하고 Open-CoT-Reasoning-Mini로 Chain-of-Thought 능력을 강화한 구현 사례이다.
Hacker News에 공유된 Telnyx의 GitHub 저장소 링크로 Python 기반 AI 콘텐츠 번역용 코드 예제를 가리킨다.
소규모 초기 제품 팀을 겨냥한 셀프 호스팅 LLM 게이트웨이를 공개했으며 'mantis deploy' 명령으로 AWS에 간단히 배포할 수 있다.
ModelFit은 대상 리포지토리에서 생성한 프로브와 블라인드 루브릭 채점을 통해 모델의 정답률을 우선으로 비교하고 비용과 지연을 부차적으로 보고하는 오픈소스 벤치마킹 도구이다.
소수의 '슈퍼 웨이트'와 대응하는 '슈퍼 액티베이션'이 LLM의 생성 품질을 결정하며 이를 보존하면 단순 양자화로도 높은 압축 품질을 유지할 수 있다.
탐색과 추론을 분리한 이중 에이전트 구조가 실행 오차를 줄이고 이해 기반의 실수를 감소시키며, 토폴로지 설계가 모델 크기보다 성능에 더 큰 영향을 준다는 것을 실험으로 보여준다.
도메인 객체에 AI를 내장해 자연어 지시를 직접 실행하고, RAG 근거로 의사결정을 내리며 스키마 검증된 출력으로 바로 API와 UI에 연결한다.
Cachet은 OpenAI/Anthropic 호환 API 앞에 두는 100% 로컬 세맨틱 캐시로 중복 프롬프트의 비용과 지연을 실시간으로 절감한다.
대화의 임베딩 공간 궤도를 분석해 다중 턴 대화에서의 공격 가능성을 조기에 예측하고 온라인 모니터링을 가능하게 하는 프레임워크를 제안한다.
대형 모델의 텍스트 출력에 Big Five 성격 특성과 정신건강 지표를 반영하도록 파라미터 효율적 어댑터를 활용하는 구현 방법이다.