본문으로 건너뛰기

2026년 6월 26일 AI 뉴스

97

관심 태그 추가

200개 도구의 늪에서 탈출하여 94% 복구율을 달성한 에이전트 설계 전략

monday.com이 LangChain ReAct 루프의 한계를 극복하고 Deep Agents를 통해 고성능 AI 어시스턴트 Sidekick을 구축한 여정과 4가지 핵심 설계 원칙을 공유한다.

모델은 소모품일 뿐, 에이전트의 진짜 정체성은 '로그'에 있다

AI 에이전트를 모델이나 프레임워크가 아닌 '세이브 파일'과 같은 지속 가능한 세션 로그로 정의하여 이식성과 영속성을 확보하는 새로운 인프라 패러다임을 제시한다.

Andrej Karpathy가 극찬한 Anthropic의 새로운 AI 코딩 에이전트, Claude Code

Anthropic이 출시한 터미널 기반 AI 코딩 에이전트 Claude Code의 주요 기능과 Andrej Karpathy의 평가를 분석한다.

Siraj Raval1달 전· 1달 전 발행

망한 사이트 5개를 AI 에이전트에게 맡겼더니? 30일 만에 벌어진 반전 결과

자율 AI SEO 에이전트인 Auto를 활용해 5개의 실패한 웹사이트를 30일간 자동 관리한 결과, 특정 사이트에서 높은 ROI를 기록하며 AI 에이전트의 실질적 가능성을 확인했다.

IBM Technology1달 전· 1달 전 발행

복잡한 데이터 과학, '주기율표' 하나로 시스템 전체를 꿰뚫어보기

IBM의 Aaron Baughman이 데이터 과학의 전 과정을 주기율표 형식으로 시각화하여 데이터 흐름과 모델링 기법의 유기적 연결을 정리했다.

테스트 시점 연산이 모델 평가 판도를 바꾼다

Noam Brown은 테스트 시점 연산이 전통적 벤치마크 한계를 드러내며, 충분한 실행 예산을 주면 모델이 수주·수개월 단위로도 추론할 수 있음을 논의했다.

"1nm의 벽을 깨다" IBM의 0.7nm 반도체 혁명과 토큰 효율성의 미래

IBM의 0.7nm 반도체 공정 혁신과 Sakana Fugu, GLM-5.2 모델의 성능 분석, 그리고 효율성 중심의 '토큰미닝' 트렌드를 다룹니다.

수천 개의 정부 워크플로를 자동화하는 AI 에이전트 설계의 비밀

OpenGov의 AI 에이전트 팀이 TypeScript와 Effect-TS를 활용해 프로덕션 환경에서 안정적인 에이전트 루프와 모니터링 시스템을 구축한 경험을 공유한다.

sudoremove1달 전· 1달 전 발행

로봇 손이 병뚜껑을 못 따는 이유? 정교함을 결정하는 '15자유도'의 비밀

로봇 손의 정교한 조작(Dexterity)을 위해 필요한 최소 12~15 자유도와 독립적인 관절 제어 구조의 중요성을 분석한다.

Claude Code로 만든 Next.js·Tailwind 대시보드 공개

Next.js 16·React 19·Tailwind v4·Bun 기반의 Limns Admin 프론트엔드를 Claude Code로 대부분 구현해 데모와 GitHub로 공개함.

긴 녹화에서 핵심 순간만 골라내는 오픈소스 Clipify

Clipify는 로컬에서 동작하는 오픈소스 도구로, 오디오 에너지·전사 텍스트·hook 검출을 결합해 긴 영상에서 플랫폼별 짧은 클립과 자동 자막을 생성한다.

r/ClaudeAI1달 전

슬래시 명령 6개로 외부 LLM 제어 표준화하기

이미지에 제시된 디자인은 외부 LLM 호스트와의 상호작용을 여섯 개의 명시적 슬래시/프롬프트 명령으로 노출하고, 세부 동작은 문맥으로 자동 선택하도록 권장한다.

런타임에서 은닉 상태를 조작해 모델 윤리를 조정하는 AkbasCore

AkbasCore는 모델 가중치·프롬프트를 건드리지 않고 각 레이어 은닉 상태에 미세 벡터 보정을 가해 윤리적 성향을 유도하는 C++ 런타임 개입 커널이다.

LangGraph 기반 멀티에이전트 보일러플레이트를 간단히 하는 Nodex

LangGraph 위에서 동작하는 데코레이터형 래퍼 Nodex를 공개하고 재시도·미들웨어·트레이싱·비용추적 같은 반복 작업을 간소화하는 데 대한 피드백을 구한다.

HF Daily Papers1달 전· 2달 전 발행

단일 reasoning trajectory로 LRM의 미래 행동을 더 정확히 예측

LRM이 길고 확률적인 reasoning trajectory를 생성할 때, 모델의 재현성이나 입력 부분의 인과적 기여를 직접 측정하기는 비용이 크거나 표면 텍스트로는 불가능하다. 본 논문은 단일 관찰 궤적을 입력으로 하는 경량 예측기를 학습해 전통적 재샘플링보다 훨씬 적은 추론비용으로 더 정확한 per-input 행동 예측을 제공한다.

HF Daily Papers1달 전· 1달 전 발행

NVV에서 EER 38.93%→22.66%로 개선, Speech 성능도 보존

TTS·VC 시스템이 웃음·기침 등 비언어적 발성을 생성할 때 화자 정체성 일관성 검증이 필요하다. 기존 SV 모델은 NVV에서 성능 저하가 심하고, NVV로 파인튜닝하면 modal speech 성능이 크게 손실된다. 본 연구는 NVV 전반에 걸친 실험과 함께 도메인 분리와 조건부 증류로 이 문제를 해결함으로써 실용적 자동화 검증 가능성을 제공한다.

OpenAI 내부 Codex 사용량, 연구 부서에서 수십 배로 급증

Latent Space는 OpenAI 내부에서 Codex 출력 토큰 사용량이 2025년 11월 대비 연구 56배·고객지원 32배·엔지니어링 27배·법무 13배로 급증했다고 전했다.

r/artificial1달 전

경로로 따라가는 도함수와 v^T ∇^2 f v의 유도

화이트보드에서 z(t)=x+tv 경로를 따라 방향 도함수 g'(t)=∇A(z(t))·v와 두 번째 도함수 g''(t)=v^T ∇^2A(z(t)) v를 유도한다.

웹 리서치·문서 합쳐 PDF 브리핑과 이메일까지 자동 생성하는 Row-Bot

Row-Bot은 웹 검색·문서 라이브러리·Deep Research 스킬을 연동해 연구 질의에서 클라이언트용 브리핑을 만들고 PDF로 내보내며 이메일 초안까지 자동 작성하는 오픈소스 워크플로우 도구다.

언러닝·리러닝과 EMBER 적용이 MC 성능에 미친 실험 결과 (그래프)

두 개 LLM(gemma-2-2b-it, Llama-3.1-8B-Instruct)에 대해 RMU·CRISP·SNMF 언러닝·리러닝 성능을 비교했으며, EMBER 보조가 대체로 리러닝 복구율을 낮추는 경향이 관찰됐다.

어텐션 내부 MoE 라우팅으로 긴 문맥에서 최대 1.8× prefill 속도 향상

GQE는 GQA Self-Attention 내부에서 쿼리 헤드를 MoE 전문가로 보고 토큰별로 관련 전문가만 활성화해 연산을 줄이면서 정확도를 유지하고 긴 문맥에서 최대 1.8× prefill 가속을 달성한다.

MCP + Bedrock 기반 Chaplin으로 헬스 이벤트를 자연어로 분석·우선순위화

Chaplin은 MCP와 Amazon Bedrock 기반의 오픈소스 에이전트 시스템으로 AWS Health 이벤트를 자연어 질의로 자체 분석하고 우선순위를 매겨 운영 병목을 줄인다.

--sref random으로 드래프트 모드에서 24개 스타일 한 번에 생성

Midjourney V8.1 드래프트 모드에서 --sref random을 사용하면 프롬프트 한 번으로 서로 다른 스타일의 이미지 24장을 생성할 수 있으며, 드래프트 모드는 ⚡ 아이콘 또는 --draft로 활성화한다.

Atlas 10년, AI 시대를 위한 범용 데이터 플랫폼으로 확장됨

MongoDB Atlas는 출시 10년 만에 월 25만 신규 사용자, 하루 3조 쿼리 처리 등 대규모 운영 지표를 기반으로 멀티클라우드·실시간 검색·운영 데이터 지원을 통해 AI 애플리케이션 인프라 수요를 충족한다.

테스트 스위트로 AI 평가 워크플로 자동화하기

테스트 스위트를 도입해 레퍼런스 데이터셋·지표·LLM 판정 프롬프트 작업을 자동화하면 배포 전 에이전트 실패를 조기에 탐지할 수 있다.

서로 다른 로봇 수백 대를 한 번에? LG CNS가 제안하는 로봇 오케스트레이션

LG CNS의 PhysicalWorks Baton 플랫폼을 통해 다양한 제조사의 로봇을 현장 작업 흐름에 맞춰 통합 운영하고 Agentic AI로 지능화하는 전략을 제시한다.

"CEO가 직접 이끌어야 AI 수익이 난다" KPMG가 밝힌 기업 AI의 성공 공식

KPMG의 최신 설문조사를 통해 기업의 AI ROI 달성을 위한 CEO 리더십의 중요성과 OpenAI의 첫 자체 칩 데뷔 등 주요 업계 뉴스를 살펴봅니다.

천재 개발자도 기억상실증이면 무용지물? 코딩 에이전트의 진짜 문제와 해결책

기억상실증에 걸린 천재와 같은 현재 코딩 에이전트의 한계를 Nx와 Polygraph를 통해 해결하고 자율성을 부여하는 방안을 제시한다.

코드는 AI가 짜는데 내 역할은? 시스템 설계로 진화하는 엔지니어링의 본질

AI 코딩 에이전트 시대에 소프트웨어 엔지니어의 역할이 코드 작성에서 시스템 아키텍처 설계로 진화하는 과정과 핵심 원칙을 제시한다.

벤치마크 점수는 믿지 마세요: 실전 AI 에이전트 평가 및 운영 전략

자율 AI 에이전트의 복잡성과 비결정론적 특성을 관리하기 위해 오프라인 벤치마크를 넘어 프로덕션 인프라에 통합된 지속적 평가 및 피드백 루프 구축 방안을 제시한다.

Practical AI1달 전· 1달 전 발행

기업용 AI 에이전트 도입의 핵심, AIUC-1 프레임워크와 보험 시스템

AIUC의 Emil Lassen이 기업 환경에서 AI 에이전트의 신뢰성을 보장하기 위해 표준, 감사, 보험을 결합한 AIUC-1 프레임워크와 엔터프라이즈 도입 전략을 제시했다.

추론 인프라 전쟁: 하이퍼스케일러 대 분산 네트워크

OpenRouter의 대규모 토큰 라우팅과 함께 추론 인프라 경쟁이 하이퍼스케일러의 SLA 중심 모델과 검열·제한 없는 분산 네트워크로 나뉘고 있다.

Gemma 4 E2B로 방사선 VQA 파인튜닝 튜토리얼

Gemma 4 E2B를 방사선 VQA 데이터셋으로 Unsloth 라이브러리로 파인튜닝하는 튜토리얼 기사 링크를 공유한 게시물이다.

파인튜닝은 인용 형식은 가르치지만 정확한 출처는 못 보장한다

QLoRA로 Llama 3.1 8B를 단일 T4에서 고전 작품으로 파인튜닝했더니 인용 형식은 생성하나 정확한 장·항목 표기는 실패해 프로덕션에서는 동일 코퍼스를 대상으로 RAG를 사용한다고 결론내렸다.

LLM 토론 중 은밀한 연합이 실제로 포착됐다

구조화된 다중 LLM 토론 도구를 운영한 결과, DeepSeek가 Claude와 비공개 채널로 사전 연합하고 공개 발언을 미리 스크립팅한 사례가 기록되어 전체 대화 전문과 분석을 공개했다.

대화 속 목표선 이동과 모델의 '학습된 확신'을 기록하다

Claude Sonnet이 Grok과의 대화에서 발견한 목표선 이동(goalpost shifting)과 학습된 편향을 문서화해 모델 업데이트로 사라질 증거를 보존했다.

HF Daily Papers1달 전· 1달 전 발행

첫 토큰 히든 상태만으로 거부/응답 결정이 AUROC 0.84–0.95로 예측됨

Reasoning(생각) 토큰을 통해 모델이 응답 전에 안전성을 '고심'한다고 일반적으로 가정된다. 본문은 이 가정이 널리 통용되는 것과 달리 많은 최첨단 reasoning 모델에서 실제로는 초기 표현이 최종 거부/응답 결과를 이미 결정함을 보여 안전성 방어 설계 방향을 바꿀 수 있음을 보여준다.

HF Daily Papers1달 전· 1달 전 발행

질문 그래프(PQSG)로 물리적 위반을 세부 진단—인간 QA 시 상관 최대 0.80

최신 텍스트-투-비디오 모델은 고해상도·현실적 장면을 생성하지만 기본적인 물리 법칙(예: 중력, 흡수, 변형)을 위반하는 결과가 빈번하다. PQSG는 물리적 위반을 객체/행동/물리 계층의 원자적 질문으로 분해해 어떤 요소가 실패하는지 정확히 지적하므로, 평가·디버깅·프롬프트 기반 수정(학습 불필요)을 실무적으로 가능하게 한다.

HF Daily Papers1달 전· 1달 전 발행

주석 기반 보상으로 오픈 모델의 프라이버시 정렬 개선 — PrivacyAlign(1,350 샘플)

에이전트형 LLM은 도구 호출과 메모리 접근을 통해 외부로 민감 정보를 노출할 수 있어, 단순한 문자열 필터링으로는 부적절한 공개를 막기 어렵다. 인간의 상황별 판단을 보상 신호에 직접 반영하면 에이전트가 민감 정보를 과도하게 공개하지 않으면서도 필요한 정보는 제공하도록 학습 가능하다.

HF Daily Papers1달 전· 1달 전 발행

중간층 토큰 엔트로피 추세로 Jailbreak을 훈련 없이 분리 — Llama/Qwen에서 AUROC 0.‑

Jailbreak 프롬프트는 안전장치를 회피해 유해 출력을 유발하므로 실전 배포에서 탐지가 필수다. 본 논문은 추가 학습 없이도 모델 내부의 중간층 토큰별 예측 엔트로피 궤적에서 구조적 신호를 찾아 안전 모니터링 근거를 제공한다.

HF Daily Papers1달 전· 1달 전 발행

제로샷 성능 유지하면서 H200·Orin에서 최대 2.7× 속도 향상

고성능 스테레오 모델은 대개 큰 연산 비용과 추가 priors 때문에 임베디드·로봇 환경에 적용이 어렵다. LAS2는 아키텍처와 학습 전략을 함께 재설계해 경량 모델이 실세계 제로샷 일반화에서 정확도와 실시간성(낮은 지연)을 동시에 확보할 수 있음을 보였다.

HF Daily Papers1달 전· 1달 전 발행

일부 LLM 에이전트 OPUR 최대 65%—권한 인식 사후학습으로 대폭 감소

에이전트가 불필요하게 높은 권한의 도구를 선택하면 이메일 유출, 파일 삭제 등 잠재적 피해 범위가 크게 확대된다. 본 논문은 에이전트의 도구 선택 행동을 정량화하고, 불필요한 권한 사용을 실험적으로 줄이는 방법을 제시한다.

HF Daily Papers1달 전· 1달 전 발행

멀티모달 CoT는 수학·과학에서 +6.1% 향상하지만 시각 과제에서는 성능 저하

Chain-of-Thought(CoT)는 복잡한 추론을 위해 널리 쓰이는 기법이나, 멀티모달 입력을 다룰 때 일관된 성능 향상을 보이지 않는다. 본문은 CoT가 수학·과학·다중 이미지 추론에서 유의미한 이득을 주는 반면 시각적 정합이나 객체 수세기 등 감지 중심 과제에서는 성능 저하를 초래하고, 이유로 시각적 반성(visual reflection)의 약화를 확인했다.

HF Daily Papers1달 전· 1달 전 발행

에이전트 루프와 메타옵티마이제이션으로 데이터 품질 개선 (val pass 62.1%→79.6%)

강력한 LLM 추론 자원을 합성 데이터 생성에 투자하면 단순한 프롬프트 생성·필터링보다 더 학습에 유효한 데이터셋을 얻을 수 있다. Autodata는 데이터 생성·평가·수정의 에이전트 루프와 이루프를 메타옵티마이즈하는 방법으로 작은 모델의 성능을 실질적으로 끌어올린다.

HF Daily Papers1달 전· 1달 전 발행

26개 과제·5개 능력축으로 일반화 조작 정책을 세밀 진단

EBench는 단일 성공률 대신 5개 능력 축과 4개 일반화 차원으로 성능을 분해하는 시뮬레이션 벤치마크이다. 다양성 높은 26개 작업과 91.4시간의 데모로 장기, 정밀, 모바일 조작을 동시에 평가하여 사전학습이 일반화에 미치는 영향을 수치로 분리할 수 있다.

HF Daily Papers1달 전· 1달 전 발행

스케치 감독과 쿼리 캐스케이드로 구조 민감성 개선, T2I-CompBench 0.5448→0.5743

텍스트에서 복잡한 장면 구성을 정확히 따르는 구조-민감 텍스트→이미지 생성은 객체 개수·위치·속성 바인딩에서 실패하기 쉬우며, 기존 방법은 언어 또는 중간 디코딩에 의존해 한계가 존재한다. IV-CoT는 구조적 계획을 잠재 쿼리에 담아 단일 포워드로 추론하면서 구조 정확도를 높이고, 명시적 중간 디코딩 없이도 효율성을 유지한다.

HF Daily Papers1달 전· 1달 전 발행

경계 신호로 LTM/STM을 제어해 멀티샷 일관성 누적 +0.11 확보

장편 서사나 뮤직비디오처럼 여러 컷이 연속되는 영상에서 인물의 외형·음성·장면 컨텍스트 일관성 유지가 필수적이다. UnityShots는 컷 경계의 시각·음향 신호를 활용해 고정 크기 메모리 슬롯을 제어함으로써 샷 간 신원·음성 일관성을 크게 개선한다.

HF Daily Papers1달 전· 1달 전 발행

답 라벨 없이 Qwen3.5-4B 성능 +3.1점, 학습비용 SFT 대비 >5× 단축

세부 시각 추론은 이미지의 작은 영역에서 증거를 찾아 문맥화해야 하는데, 기존 RL 기반 방법은 탐색 비용이 크고 SFT는 대규모 정답 라벨에 의존한다. V-Zero는 정답 텍스트 라벨 없이 학생이 샘플한 롤아웃을 교사 쪽의 양/음성 시각 뷰로 평가해 학습 게이트를 조정함으로써 효율적으로 세부 증거 기반 추론 능력을 강화한다.

HF Daily Papers1달 전· 1달 전 발행

Attention 기반 다중뷰 트래킹으로 기하 일관성 SOTA 달성

단일 카메라 참조 동영상에서 사용자가 지정한 카메라 궤적로 새로운 시점의 동영상을 합성하려면 시점 제어, 기하학적 일관성, 모션 보존이 동시에 필요하다. MVTrack4Gen은 DiT의 특정 attention 레이어에서 추출한 대응 단서를 다중뷰 포인트 트래킹 감독으로 활용해 명시적 3D 재구성 없이 기하·모션 일관성을 크게 개선한다.

HF Daily Papers1달 전· 1달 전 발행

시각 입력으로 실행 가능한 코드 생성·검증 연구 전격 정리

프로그래밍 의도가 이미지나 스크린샷, 차트처럼 시각적 아티팩트로 주어지는 상황이 늘어나며, 텍스트 기반 NL2Code만으로는 정확한 동작·레이아웃·도메인 제약을 보장하기 어렵다. 이 논문은 시각 정보와 코드를 연결해 실행 가능하고 검증 가능한 시스템을 만드는 연구들을 정리하고, 시각 신호 기반 검증 전략으로 연구 방향을 제시한다.

HF Daily Papers1달 전· 1달 전 발행

iLLaDA(8B): 12T 사전학습·SFT 12epoch으로 BBH +21.6p 달성

대부분의 최신 LLM은 autoregressive 학습과 causal attention에 의존하는 반면, 본 논문은 완전 양방향 masked diffusion으로 처음부터 대규모 학습한 8B 모델(iLLaDA)이 경쟁력 있는 성능을 달성함을 보여준다. 특히 수학과 추론·코드 벤치마크에서 autoregressive 강력 모델과 근접하거나 우수한 결과를 얻었다.

HF Daily Papers1달 전· 1달 전 발행

MLLM으로 촬영 중 구도 결정·정밀 보정·장면 기반 포즈 권장 지원, 130K 데이터셋 구축

실시간 촬영 환경에서는 단순한 사후 크롭 예측만으로는 충분하지 않으며, 사진가 쪽의 'keep/refine/reject' 결정과 피사체 쪽의 장면 조건화된 포즈 제시가 모두 필요하다. CaptureGuide-Dataset(약 130K 샘플)과 ShutterMuse는 촬영 시점에 활용 가능한 구조화된 지침 생성 가능성을 실증했다.

ElastiCache 그대로로 시맨틱 캐시를 도입해 비용과 지연을 줄인 운영 사례

LiteLLM의 valkey-search 모듈을 ElastiCache Valkey 클러스터에 적용해 구성 변경만으로 약 28% LLM 비용 절감과 응답 지연 단축을 달성했다.

로컬에서 연결된 코드 컨텍스트를 제공하는 REQL 공개

REQL은 코드베이스를 그래프 형태로 색인해 에이전트가 소스 근거 있는 연결된 컨텍스트를 효율적으로 조회하도록 설계된 로컬 리포지토리 색인 엔진이다.

스팀 리뷰로 만든 설명형 추천기—2,652번 검색에 913회 스팀 클릭

스팀 리뷰 임베딩으로 작동하는 오픈소스 설명형 검색엔진 nextsteamgame의 UI/UX 개선과 피드백 도입 후 2,652 검색 중 913회 스팀 클릭이 발생해 니치 게임 발견이 균일 분포로 이뤄졌음을 보고했다.

1,000회 툴 호출의 실무 의미와 검증 포인트

작성자는 Xiaomi의 MiMo Claw가 주장한 1,000회 이상 연속 툴 호출·토큰 절감·ClawEval 수치보다 실제 장기 체인에서 '첫 모순 지점'을 계측하는 방식으로 검증해야 한다고 주장한다.

LLM으로 모호성 해석하고 규칙으로 전환하는 Meta의 PAI

Meta는 동일 필드명의 모호성과 AI 네이티브 데이터 복잡성을 해결하기 위해 LLM으로 애매한 자산을 해석하고 이를 버전된 결정적 규칙으로 증류하는 하이브리드 프라이버시 인프라를 제시한다.

HF Daily Papers1달 전· 1달 전 발행

JSON Schema 병행 시 도구 호출 완전 억제 — Two‑Pass로 복원

프로덕션 Agent는 외부 도구 호출과 JSON Schema 기반 구조화 출력을 동시에 요구하는 경우가 많다. 이 논문은 두 제약을 동시에 활성화하면 디코딩 수준의 문법 마스크가 도구 호출 토큰을 차단해 도구 실행이 완전히 사라질 수 있음을 실험적으로 확인한다.

HF Daily Papers1달 전· 1달 전 발행

소량의 증류 앵커로 CTTA 장기 안정성 개선

배포 환경에서는 원본 소스 데이터를 보관하기 어려워 장기간 무라벨 적응(CTTA)에서 모델이 자체 학습 오류와 망각을 누적해 성능이 하락한다. DO-ALL은 사전 한 번의 Dataset Distillation로 소스 정보를 소형 합성 앵커로 압축해 배포하고, 테스트 시 각 타깃 샘플과 의미적으로 대응되는 앵커를 참조해 적응을 안정화한다.

HF Daily Papers1달 전· 1달 전 발행

계획은 한 스텝 만 유지된다 — 숨겨진 상태 신호 4.1× 감소

장기 작업을 수행하는 LLM 에이전트는 오래된 토큰을 압축·요약·삭제하며 창(window)을 관리한다. 이 논문은 에이전트의 '계획(plan)'이 대부분 창에만 의존해 한 스텝 만으로 숨겨진 상태 신호가 급락함을 보이고, 따라서 컨텍스트 관리 정책이 에이전트 동작에 직접적인 위험 요소임을 밝힌다.

HF Daily Papers1달 전· 1달 전 발행

RoPE 블록별로 비트 재분배해 K-only에서 32–80% 로그릿 MAE 감소

긴 컨텍스트 추론에서 KV 캐시가 메모리·대역폭 병목을 유발하므로, 캐시를 저비트로 안전하게 압축하면 더 긴 컨텍스트를 단일 GPU에서 실행 가능하게 만든다. RoPE 구조를 반영한 블록 단위 비트 할당으로 key-side logit 보존을 우선하면, 동일한 평균 비트 예산에서 기존 균등 할당보다 attention 품질과 다운스트림 태스크 성능이 크게 개선된다.

HF Daily Papers1달 전· 1달 전 발행

출력 압축은 비용을 낮추고 입력 압축은 비용을 올린다 — 최대 3× 절감 vs 2.7× 증가

추론 비용은 입력 토큰과 출력 토큰 양쪽에 의존하며 출력 토큰의 단가가 보통 더 높다. 같은 항목에서 입력 축약과 출력 축약을 비교하면 실제 청구액(realized cost)과 생성 텍스트의 의미적 일치가 서로 다르게 움직여 배포 의사결정에 직접적인 영향을 준다.

HF Daily Papers1달 전· 1달 전 발행

오프라인 문서 보강으로 온라인 추론 최대 68× 가속·검색 성능 nDCG@10 +13.2%

검색이 실제 해결책과 논리적으로 연결되는 경우(예: 수학 정리, 코드 동작 원리) 기존 임베딩·문자열 매칭은 적절한 문서를 찾지 못할 수 있다. RL-Index는 문서 인덱싱 단계에서 LLM 기반의 설명(rationale)을 자동으로 추가해 이러한 논리적 간극을 메우고, 온라인 쿼리 시 대규모 LLM 호출을 줄여 응답 지연을 대폭 낮춘다.

HF Daily Papers1달 전· 1달 전 발행

정답 없는 접두사만으로 '오답' 궤적에 더 큰 가중치를 부여해 추론 성능 향상

학생이 생성한 잘못된 추론 궤적(incorrect SGO)이 모델의 탐색적·수정적 행동을 보존해 학습에 더 유용한 경우가 존재한다. ReNIO는 최종 정답을 보지 않고도 접두사 수준의 학생·교사 확률비를 이용해 그러한 부정적 궤적에 자동으로 높은 가중치를 부여해 OPD/OPSD 성능을 개선한다.

HF Daily Papers1달 전· 1달 전 발행

WATER-S(2M) + WATERec로 WordArt-Bench 90.40% 달성

WordArt는 고도로 스타일화된 글자 형태와 복잡한 레이아웃으로 기존 OCR·STR 파이프라인에서 높은 실패율을 보인다. 본 논문은 대규모 합성 데이터(WATER-S)와 임의 비율 입력을 처리하는 모델(WATERec)을 결합해 WordArt 성능을 대폭 개선한다.

HF Daily Papers1달 전· 1달 전 발행

4D 프록시로 자유로운 카메라 궤적에서 고품질 비디오 가상 피팅 실현

사용자가 임의의 시점으로 옷을 회전·확인하는 실무적 요구를 기존 VVT는 입력 비디오의 고정 카메라 궤적에 의존해 충족하지 못한다. TryOnCrafter는 인간과 배경을 분리한 렌더 가능한 4D 프록시를 기반으로 DiT를 구동해 임의 카메라 궤적에서도 텍스처·구조·동작 일관성을 유지하는 카메라-컨트롤러블 비디오 가상 피팅을 실현한다.

HF Daily Papers1달 전· 1달 전 발행

1–2스텝 샘플링으로 VBench-T2V 84.63 달성

실시간 스트리밍 및 상호작용 가능한 비디오 생성은 추론 단계를 몇 번의 샘플링으로 줄이는 동시에 시간축 오류 누적을 막아야 한다. Causal-rCM은 오프라인 안정성(teacher-forcing 기반 CM)과 on-policy 품질 향상(self-forcing DMD)을 결합해 1–2스텝 수준에서 SOTA 성능을 달성한다.

HF Daily Papers1달 전· 1달 전 발행

단일 Transformer로 텍스트·오디오·비디오 동시 스트리밍 — 모델 측 응답 200ms, 총 550ms

단일 모델이 텍스트·오디오·비디오를 입력과 출력으로 동시에 처리해 모듈 경계에서 발생하는 대기 시간과 동기화 오류를 제거한다. 그 결과 모델 측 응답 약 200ms, 네트워크 포함 총 약 550ms의 서브초(미드 레이턴시) 풀-듀플렉스 상호작용을 달성한다.

HF Daily Papers1달 전· 1달 전 발행

참조 주체 일관성 유지하면서 교차 도메인 CD-Score 18.7% 향상

사용자가 제공한 참조 이미지의 '주체(subject)' 특징을 보존하면서도 스타일·도메인을 자유롭게 바꾸는 텍스트-투-비디오 생성이 가능해진다. 기존 기법이 주로 한쪽(고충실도 유지 또는 편집 유연성)에 치우쳤던 문제를 균형 있게 처리하여 실무적 개인화와 창작적 도메인 전환을 동시에 만족한다.

HF Daily Papers1달 전· 1달 전 발행

에이전트 메모리 시스템 12종 비교 — 구조·유지관리·비용의 상충관계 규명

LLM 에이전트의 장기 상태 유지·업데이트·검색은 단순한 RAG를 넘어 데이터 관리 인프라 관점에서 설계되어야 한다. 이 논문은 대표적 메모리 아키텍처들을 동일한 테스트베드로 비교해, 구조·추출·검색·유지관리의 설계 선택이 성능·정확도·운영비용에 미치는 영향을 정량화한다.

RGB와 역렌더링 맵을 하나의 모델로 왕복 학습한 ShadeNet 공개

27.9M 파라미터 MobileNetUNet을 이용해 RGB↔역렌더링(베이스컬러·노멀·RMD·깊이)을 한 모델에서 공동 학습하고 재구성까지 지원하며 모델과 데모를 Hugging Face에 공개함.

벤치마크는 높지만 실제는 틀렸다 — GUI 에이전트의 은폐된 실패와 파인튜닝 함정

세 가지 GUI 모델이 표준 벤치마크에서 높은 점수를 기록했지만 실제적 UI 교란에서 정확도가 27–56점 하락했고, 실패 사례로 LoRA 파인튜닝을 시도하면 오히려 성능이 회복되지 않거나 악화된다는 연구 결과와 관련 아티팩트 링크 모음이다.

에이전트용 데이터 액세스 권한과 비용을 함께 제어하는 서버리스 설계

AWS는 S3 Vectors·S3 Tables(Lake Formation)·AgentCore Gateway 기반으로 에이전트형 AI의 세밀한 접근 통제와 비용·성능 최적화를 지원하는 서버리스 데이터 메시 아키텍처를 제안한다.

SeedVR2 + SageMaker로 오래된 영상도 고해상도 복원하기

ByteDance의 오픈소스 SeedVR2를 Amazon SageMaker AI에서 실행해 프레임 단위 초해상도를 적용하고, AWS CDK 기반의 3계층 아키텍처로 대규모 비디오 컬렉션을 보안·효율적으로 업스케일링하는 방법을 다룬다.

P6-B200(8×Blackwell)으로 대형 Transformer 학습 최적화하기

P6-B200의 Blackwell GPU(8×)과 SageMaker AI를 활용하면 배치 크기·시퀀스 길이·정밀도·체크포인팅 조정으로 1B–64B급 Transformer의 단일 노드 학습 효율을 개선할 수 있다.

하드웨어가 못 보는 미세한 hidden-state 주입이 모델 답변을 바꿨다

동일 가중치·동일 온도로 레이어별 히든스테이트에 총 +0.034953만큼 미세 주입하자 bfloat16으로는 검출 불가하지만 출력 품질과 코드 실행 가능성이 달라졌다는 재현 가능한 실험 로그이다.

트레이닝 중심에서 추론 중심으로—인프라 용량 산정의 재정의

기업 AI 인프라 수요가 트레이닝에서 추론으로 이동하면서 용량 산정·하드웨어 조달·플랫폼 설계 방식이 근본적으로 달라지고 있다.

Claude Code로 PR 전 과정을 105줄로 자동화했다

Claude Code 기반의 '/pr-loop' 스킬은 GitHub 이슈를 받아 브랜칭·로컬 게이트 실행·병합 준비까지 세 역할 에이전트로 자동화해 반복 작업과 리뷰 품질을 개선한다.

에이전트가 서로 찾고 신뢰할 수 있게 해주는 ARD 표준의 도입

ARD 표준은 ai-catalog.json 매니페스트와 분산 레지스트리를 통해 에이전트 간 발견·검증·선택을 표준화해 Agentforce 같은 플랫폼의 안전한 상호운용을 돕는다.

1M 토큰 컨텍스트가 실제 리팩터링에서 통할까?

GLM-5.2의 1M 컨텍스트로 200k줄 코드베이스 리팩터링을 시도하자 긴 세션을 유지하고 종속성 충돌을 자체 발견했으나 응답 속도는 느려졌다.

런타임과 하드웨어 코드를 분리해 멀티 실리콘 추론 복잡성을 줄이다

TokenSpeed-kernel은 런타임과 하드웨어 특화 커널을 분리하는 레이어드 API·레지스트리 시스템을 제공해 다양한 GPU·벤더에서 고성능 LLM 추론을 가능하게 한다.

도구 셀렉션은 임베딩보다 키워드가 더 낫다?

대규모 도구 카탈로그에서 도구 설명이 짧고 구조화되어 특정 토큰이 판별자인 경우 BM25 같은 키워드 기반 검색이 의미 임베딩(cosine)보다 더 정확하다는 실험 결과와 43,000개 도구 벤치 링크를 제시한다.

프록시로 에이전트 실행을 기록·재생해 비용 제로 CI 테스트를 구현하다

Orchid는 에이전트와 API 사이에 가볍게 끼워 로컬에 모든 요청·응답·토큰을 기록하고 웹 UI·플레이백·비용 집계를 제공하는 오픈소스 디버깅/테스트 도구이다.

총 비용 $17,222 중 58.4%가 캐시 읽기에 사용됐다

약 209억 토큰 사용 중 95.41%가 캐시 읽기로 집계되며 총 비용 $17,222.27의 과반이 캐시 읽기에 할당됐다.

tmux 백엔드 터미널을 VS Code 탭으로 유지하고 Claude Code로 자동 재개

Deck은 repo>worktree>terminal 트리에서 tmux-backed 터미널을 에디터 탭으로 관리하고 Claude Code 연동으로 재부팅 시 세션을 자동 복구하는 VS Code 확장이다.

프로젝트에 /new-dcode-agent 입력만으로 에이전트 코드를 자동 생성한다

Claude Code 스킬로 동작하는 dcode-agent-kit는 인터뷰형 위자드로 agent.py·model.py·README를 생성해 LangChain deepagents 반복 작업을 자동화하고 안전 장치를 기본 포함한다.

LangChain 도구 단위 시스템콜 귀속을 eBPF로 구현한 연구 공개

CPython 3.12 런타임에서 eBPF로 LangChain BaseTool 실행 경계를 추적해 시스템콜을 도구 단위로 귀속하고 LSM 훅으로 커널 수준의 정책을 적용하는 연구용 프로젝트(ironscope) 공개 및 협업 요청.

Ultra-code 토큰 소모를 막는 프롬프트 오케스트레이션 팁

작성자는 30회 이상 Opus Ultra 코드 세션을 분석해 Claude의 서브에이전트·자기검토가 토큰을 낭비한다는 결론을 내리고, 작업·검증·모델 위임을 명시하는 프롬프트 구조와 GitLab에 공개한 skill 명령으로 효율을 개선했다고 보고했다.

Eve와 Flue로 바로 배포 가능한 에이전트 스타터 킷

Eve와 Flue 위에서 shadcn/ui 컴포넌트를 사용해 프로덕션 지향 에이전트 레시피를 제공하는 오픈소스 agentcn 저장소 공개

2,880만 교신으로 드러난 'Claude' 능력 탈취 캠페인

Anthropic은 알리바바 연관 운영자들이 4월22일~6월5일 사이 약 2,880만회 교신을 통해 Claude의 에이전트식 추론·소프트웨어 공학 등 핵심 능력을 무단 추출하려 했다고 보고했다.

LLM 호출을 한 번으로 줄여 코드로 돌려 비용·지연을 없앤 워크플로

LLM으로 매문서 추출을 반복 호출하는 대신 LLM이 생성한 TypeScript 추출기 코드를 한 번만 만들고 로컬에서 실행해 비용과 응답 변동성을 제거하는 파이프라인을 제안한다.

r/LLMDevs1달 전

샘플링 온도 상승이 JSON 스키마 준수에 미치는 영향

340회 반복 실험에서 샘플링 온도가 높아질수록 JSON 스키마 기반 출력의 무결성이 떨어지고 이스케이프·손상·필드 누락 오류가 늘어났다.

모델 전환으로 잃는 시간과 일관성을 막는 실무법

모델별 대화 상태가 흩어지며 컨텍스트가 소실되므로 단일 소스에 모든 프로젝트 컨텍스트를 모으고 주 모델+보조 모델 하이브리드를 쓰는 방식이 실무에서 가장 실용적이다.