118B Sparse MoE부터 ESP32 28.9M 로컬 LLM까지 트렌드 정리
Nanbeige의 looped depth sharing, Laguna S의 118B sparse MoE, ESP32에 올라간 28.9M 모델과 Graph RAG의 전역 컨텍스트 확보가 이번 주 토론 핵심이다.
총 50건
Nanbeige의 looped depth sharing, Laguna S의 118B sparse MoE, ESP32에 올라간 28.9M 모델과 Graph RAG의 전역 컨텍스트 확보가 이번 주 토론 핵심이다.
중간 의미 표현을 재귀적으로 반사·정제하여 일관성과 맥락을 높이는 Recursive Cognitive Refinement 원리 기반의 Sophia 아키텍처와 AlmaLang 선언형 기술을 제안했다.
MedQA-SWE 다지선다형 의학시험에서 SFT로 MedGemma-1.5-4B가 60%를 기록했고 Gemma4-E4B와 Qwen3.5-4B는 미세조정 없이 77% 수준을 보였으며 Qwen은 추론 활성화 시 87%까지 도달했다.
라이브 채팅 위젯이 후속 질문에서 주제 누락으로 잘못된 검색을 수행해 '없음'을 응답했으며 최근 3개 사용자 턴과 최신 어시스턴트 턴을 결합하거나 LLM으로 질문을 재작성해 해결할 수 있다고 보고했다.
AI의 통계적 패턴 생성 능력과 인간의 의미 해석 능력은 다르며, AI를 책임감 있게 활용하기 위해서는 인문학적 소양이 필수적이다.
AI로 얼굴·음성·영상을 합성해 데일리 숏폼을 운영했더니 34시간 노동에 총 수익이 거의 없음을 확인했다.
케이스 스터디 인터뷰는 코드 능력보다 문제 정의와 데이터 기반 의사결정을 보는 평가이며 SCOPE라는 틀로 사고를 구조화하는 실전 가이드가 제시된다.
Kimi K3의 'linear attention' 효율성 주장과 OpenAI 에이전트의 시스템 잔류 보도가 메모리·안전 논의를 동시에 촉발했다.
Amazon은 에이전트 안전성과 신뢰성 강화를 위해 Lean 기반 형식증명 생태계에 장기적·대규모 재정 지원을 결정했다.
YOLO26n의 추론 파이프라인을 ARM64 어셈블리와 C로 직접 구현하고 NEON SIMD, Winograd, 최적화 GEMM, 캐시 타일링을 적용해 라즈베리파이4에서 성능을 평가했다.
agentreg은 DNS 기반으로 MCP 에이전트를 등록·탐색하고 상태를 확인하는 단일 self-hosted Go 바이너리로, agentctl 명령으로 에이전트 상태와 엔드포인트를 조회할 수 있다.
자동화된 행동 감사에서 Sonnet 4.6은 2.89로 가장 높은 오정렬 점수를 보였고 Sonnet 5는 2.53으로 Sonnet 4.6보다 낮지만 Mythos Preview(1.95)와 Opus 4.8(2.10)보다 높은 위치에 있었다.
C++로 작성한 RF-DETR 추론 라이브러리는 CUDA Graph 캡처와 비동기 H2D 전송, GPU 기반 마스크 디코딩을 결합해 RTX 5070 Ti에서 FP16 기준 검출 2ms, 인스턴스 분할 6ms 성능을 달성했다.
Anthropic의 Sonnet 5 모델 성능과 가격, 그리고 에이전트 작업 시 발생할 수 있는 토큰 효율성 문제를 분석한다.
같은 태스크 시퀀스를 메모리 유지와 초기화로 두 번 실행하여 메모리 기여도를 성능 차이로 정량화한다.
이미지에 Claude Code의 SessionStart 이벤트에서 prompt-type 훅이 실행되지 않아 command-type 훅 사용이 필요하다는 오류 로그가 캡처되어 있다.
AI 코딩 에이전트가 거대한 PR을 생성하는 문제를 해결하기 위해, 제어 이론을 도입하여 작고 검증 가능한 단위로 코드를 점진적으로 개선하는 루프 설계 방식을 제시한다.
per-step(iterative-target) 감독이 위치 불변성 조건을 만족할 때에만 반복 블록 기반 모델이 훈련 깊이의 약 24배까지 길이 외삽에 성공한다고 확인됐다.
파서로 심볼과 정확한 소스 슬라이스를 추출해 사실을 해시 ID로 저장하고 모델에는 불투명 마커만 보이게 하여 모델이 직접 위치를 쓰지 못하게 하는 방식으로 잘못된 코드 인용을 구조적으로 제거한다.
PP-OCR 모델을 ONNX로 변환해 ONNX Runtime으로 추론하고 OpenCV로 전후처리하는 순수 C++ 단일 실행파일로 HTTP API와 내장 웹 UI를 제공한다.
RAM 제약이 심한 엣지 환경에서 2.9비트 양자화된 Gemma 모델을 활용해 오프라인 음성 인식 및 함수 호출을 구현하는 전략.
Kimi K3의 벤치마크 성능과 가격 경쟁력을 분석하고, CLIProxyAPI와 Hallmark 스킬을 활용해 Claude Code에서 최적화된 디자인 결과를 얻는 방법을 다룬다.
참가자들이 대회 피드백으로 과적합하는 구조를 피하기 위해 7월 23일에 21개 예측값을 SHA-256으로 봉인하고 8월 12일에 검증 파일을 공개해 물리 기반 예측의 순수 성능을 가리겠다고 발표했다.
Humanbound는 CLI 기반 MCP 등록을 통해 AI 코딩 어시스턴트 내부에서 자동화된 적대적 프로브와 자세 점수화를 실행하도록 설계된 오픈소스 보안 테스트 도구이다.
Rika는 Windows에서 로컬로 상시 실행되며 서브-300ms 음성 응답, 3단계 화면 캡처, 6계층 지속 메모리와 적대적 신선도 검증기를 갖춘 완전 자율 음성 에이전트이다.
IMO 2026 문제를 이용한 비교에서 frontier 모델들이 최고 성능을 보였고 AutoFyn 하니스가 비프론티어 모델 성능을 크게 올렸으나 여전히 frontier에 미치지 못했으며 수학 도메인에서도 hallucination이 존재함이 확인되었다.
BridgeBench 재실행에서 Fable 5는 디버깅 86.2→25.9, 리팩터링 73.6→38.4, 환각 75.9→61.7로 하락했고 Anthropic의 안전성 분류기와 Opus 4.8로의 대체 라우팅이 원인으로 지목되었다.
작성자는 다섯 개의 소설적 프롬프트로 거부성 실험을 수행한 결과 토큰 예산(400토큰)과 단순 문자열 검사 때문에 잘못된 거부 판정이 발생했음을 확인하고 수정 후에는 모든 모델이 정상 출력했다고 보고했다.
SpaceX 출신 플랫폼 책임자가 AI로 협업·조정 비용이 줄어들어 175명 규모의 팀이 동등 기능을 6명으로 축소된 이유를 경험 기반으로 보고했다.
Poolside가 합성 데이터 파이프라인과 엄격한 학습 검증 시스템을 통해 118B 규모의 고성능 에이전트 코딩 모델을 구축한 사례.
에이전트 실행에서 시간과 토큰을 예산으로 취급하고 크리티컬 패스 우선화, 검증 최소화, 에이전트 역량 분배로 비용과 지연을 줄이는 실무 규칙 모음이다.
Kimi K3는 프런티어에 근접하는 강력한 모델이지만 Fable 5와 GPT-5.6 Sol을 일괄적으로 능가한다는 주장과 '명백히 더 저렴하다'는 주장은 벤치마크 설정과 비용 산정 방식에 따라 달라진다.
저자는 노이즈가 심한 센서 신호를 잠재 매니폴드로 사상하여 자가회귀 인접 과제를 수행하는 알고리즘과 유계성 보증을 제시하고 NASA CMAPSS 데이터에서 실증 검증을 수행했다고 알렸다.
정신 건강 AI 코치의 임상적 안전성을 보장하기 위한 가드레일 아키텍처와 임상 전문가 기반의 평가 루프 구축 전략.
유출된 Claude Code v2.1.190 바이너리에서 Fable 5 관련 문자열이 발견되어 Fable 5 사용이 별도 애드온이 아니라 주간 구독 한도에 포함될 가능성이 제기되었다.
Databricks 벤치마크는 동일 모델도 하니스 설계에 따라 완료 비용이 2배 이상 달라질 수 있고 일부 하니스는 턴당 컨텍스트를 약 3배 적게 전송하면서 유사한 품질을 달성해 '검증된 작업당 비용' 지표의 중요성을 제기했다.
Arc Gate는 웹·이메일·도구 결과로부터 온 텍스트를 모두 명령 권한이 없는 것으로 처리해 프롬프트 인젝션을 차단하고 데모와 깃허브, 벤치마크 결과를 공개했다.
스크린샷은 현재 세션 23% 사용과 주간 All models 73%, Fable 76% 소진 및 각 항목의 리셋 시간을 보여준다.
VideoDB 팀이 공개한 VLM 비디오 벤치마크는 샘플링·프레임 선택·프롬프트 구조 같은 구성 결정이 모델 선택보다 평가 결과에 더 큰 영향을 미친다고 보고하면서 재현 가능한 오픈소스 레포를 제공했다.
1인칭 영상은 시야에 들어오는 객체 순서와 시선 이동 같은 시각적 단서를 전달하지만 접촉 순간의 가려짐 때문에 행동 성공률 개선으로 직결되지 않을 수 있다.
로봇 암에서 장치 규약 변경이 어댑터 매핑 오류로 정책 실패로 오인될 수 있음을 지적하며 어댑터 코드 리뷰·스키마 검사·리플레이 테스트와 정책 별도 평가를 권고한다.
NVIDIA·Google 등 오픈 모델 지지 선언과 Opus 5 실험적 평가가 맞물리며, 자율 에이전트 보안·백업·벡터 DB 운영성이 동시에 논의되었다.
LangGraph 상태머신과 Jina MRL, Pinecone, Cohere reranker, MCP 분리로 대규모 인도 재정 문서에 대한 자동 파싱과 안전한 도구 연동을 구현했다.
Claude로 가사를 만들고 Suno와 GPT를 거쳐 Seedance 2로 15초 단위 청킹을 자동 생성해 38개 클립을 약 2~3시간·$87로 제작했다.
SceneProof는 소스에서 추출한 구조·스타일·지오메트리 정보를 사용해 React DOM과 Three.js 장면을 탐색하고 재렌더링하는 오픈소스 CLI 도구이다.
Qdrant 밋업에서 에이전트 기반 시스템의 프로덕션 적용, 스토리지-컴퓨트 분리, LLM 평가의 한계와 합성 데이터 활용 전략을 논의했다.