본문으로 건너뛰기

2026년 6월 23일 AI 뉴스

97

관심 태그 추가

AI 에이전트가 약물 디자인의 정확도와 속도를 동시에 끌어올린다

물리 기반 시뮬레이션과 AI 에이전트가 엔드투엔드로 협업하는 새로운 워크플로우를 통해 정확도와 규모의 한계를 넘고 연구 속도와 의사결정의 신뢰성을 대폭 향상시킨다.

특화 에이전트 구축의 모듈형 토대가 된다, NVIDIA Agent Toolkit

기업용 전문 에이전트를 위한 모듈형 구성으로 안전하고 확장 가능한 워크플로를 제공하는 NVIDIA Agent Toolkit의 핵심 아이디어를 제시한다.

역할 분리로 본 에이전트 평가의 핵심 교훈

탐색과 추론을 분리한 이중 에이전트 구조가 실행 오차를 줄이고 이해 기반의 실수를 감소시키며, 토폴로지 설계가 모델 크기보다 성능에 더 큰 영향을 준다는 것을 실험으로 보여준다.

객체에 내장된 AI로 프레임워크의 경계를 허문다

도메인 객체에 AI를 내장해 자연어 지시를 직접 실행하고, RAG 근거로 의사결정을 내리며 스키마 검증된 출력으로 바로 API와 UI에 연결한다.

경량 하네스로 에이전트형 앱을 빠르게 구축하는 CUGA의 실전 예제

CUGA는 프롬프트와 도구 목록만으로 에이전트형 앱을 빠르게 구성하고, 생산 환경에서 거버넌스와 확장을 가능한 한 줄의 코드로 제공합니다.

Ben's Bites1달 전

Codex Record & Replay, Daybreak로 보안까지 한눈에 보는 주간 AI 업데이트

다양한 AI 도구의 최신 업데이트를 한 자리에 모아 실무 적용 포인트를 제시한다.

KDNugget1달 전

데이터 품질을 지키는 5가지 강력한 이상치 탐지 기법

다섯 가지 이상치 탐지 기법의 원리와 파이썬 예제를 비교해 데이터 품질과 분석 신뢰성을 높이는 방법을 제시한다.

개발동생1달 전

AI가 짜는 코드 절반으로 줄이는 '게으른 시니어 개발자' Ponytail

Ponytail은 AI 에이전트에게 YAGNI, KISS, DRY 원칙을 강제하여 불필요한 코드 생성을 억제하고 개발 효율을 높이는 스킬이다.

IBM Technology1달 전

현대 AI 에이전트의 동작 원리: 꼭 알아야 할 5가지 핵심 개념

현대 AI 에이전트 시스템의 동작 원리를 정의하는 5가지 핵심 아키텍처 패턴과 프로토콜을 설명한다.

코딩 없이 전화 응대와 예약 자동화하는 AI 에이전트 만들기

Telnyx 플랫폼을 사용하여 전화 통화와 웹 위젯이 통합된 AI 음성 에이전트를 구축하고 배포하는 과정을 다룬다.

ISC에서 본 NVIDIA의 AI HPC 주도력과 글로벌 확장

ISC 발표를 통해 81%의 TOP500 점유, Green500 선두, Grace/Grace Hopper/Vera의 풀스택 확장으로 NVIDIA가 AI HPC 생태계를 주도하고 전 세계의 연구 인프라를 확장하고 있음을 확인했다.

30초 단일 샷 생성, 바이트댄스의 'Seedance 2.5'가 비디오 AI 판도를 바꾼다

바이트댄스가 30초 단일 샷 생성과 물리 세계 이해 능력을 갖춘 차세대 비디오 생성 모델 'Seedance 2.5'를 공개했다.

풀리지 않는 AI 문제, '차원'을 높여 해결하라

저차원에서 해결 불가능한 문제를 고차원으로 투영하여 패턴을 가시화하는 Expressivity의 원리와 LLM, CNN 등에서의 적용 사례를 다룬다.

NAVER D21달 전

GPU 부족 해결: AI 모델 서빙 비용과 성능을 잡는 Automatic Sharding 전략

수천 개의 AI 콘텐츠를 한정된 GPU 자원에서 효율적으로 서빙하기 위해 NP-Hard 문제를 해결하는 Automatic Sharding 시스템을 구축하고 성능을 개선했다.

HF Daily Papers1달 전· 1달 전 발행

표 형 데이터에서 학습-적응적 discretization으로 표현 학습 강화

의료 표 데이터의 구조화된 특성은 일반적으로 라벨링 비용이 큰 문제를 낳는다. Self-supervised learning은 라벨 없이도 표현 학습을 가능하게 하지만, 기존의 discretization은 전역적으로 고정된 bin 수를 사용하고 특성 간 차이를 고려하지 못한다. Adaptive Binning은 각 특성마다 학습에 맞춰 discretization을 점진적으로 세밀하게 조정하고, 값 공간의 분포와 표현 공간의 일관성을 함께 개선한다. 이를 통해 linear probing과 fine-tuning에서 일관된 성능 향상을 달성하고, 의료 표 데이터에 특화된 벤치마크를 제시한다.

HF Daily Papers1달 전· 1달 전 발행

토큰 사용 99% 절감 및 해석가능성 강화하는 지식 추출 기반 ICL

실세계 B2B 대화 분석은 다자 이해관계자와 변화하는 맥락을 다루며, 기존의 few-shot ICL은 예시를 많이 사용할수록 토큰 비용이 증가하고 일반화가 저하되는 한계를 보인다. 본 연구는 라벨링된 소수 예시를 통해 일반화 가능한 지식을 추출하고 이를 분류 기준 및 태스크 설명으로 압축하여 프롬프트를 구성함으로써 토큰 비용을 대폭 줄이고 해석 가능성을 높인다.

6mW 칩으로 소형 로봇의 실시간 3D 매핑 가능성 확장

초저전력 6mW 시스템온칩(Gleanmer)이 Gaussians 기반의 3D 맵 생성과 하드웨어 가속으로 소형 로봇의 실시간 매핑을 가능하게 하고, 메모리와 전력 소모를 대폭 줄였다.

The AI Grid1달 전

모델을 자율적으로 조율하는 멀티 에이전트 시스템, Sakana Fugu의 성능은?

Sakana AI가 공개한 Fugu는 단일 API로 여러 모델을 동적으로 오케스트레이션하여 복잡한 작업을 자율적으로 해결하는 시스템이다.

프롬프트 튜닝 자동화로 수일의 작업을 한 시간으로 단축하는 GEPA의 프롬프트 진화

GEPA의 Reflective Prompt Mutation과 DSPy 기반 자동 최적화는 프롬프트 후보를 자동으로 진화시키고 Pareto Front로 다축 최적화를 수행하여 LLM 프롬프트 튜닝의 비용과 시간을 크게 줄이고 정책 준수와 품질을 동시에 개선한다.

TechCrunch AI1달 전

AI로 성장과 해고를 동시에? 대기업의 해고 물결을 파헤치다

대형 기술 기업들이 매출 성장에도 불구하고 AI 도입을 이유로 대규모 인력 감축을 단행했고, 이는 AI 투자와 고용의 균형에 대한 재고를 촉발한다.

AI가 개발 과정을 '블랙박스'로 만들지 않으려면? 개발자가 지켜야 할 본질

AI가 개발 루프를 가속화하는 시대에, 개발자가 AI의 단순 승인자가 아닌 주체적인 제작자로 남기 위한 인터페이스 철학을 다룬다.

Claude Code로 브라우저에서 Moebius 0.2B 이미지 인페인팅 실행

Moebius 0.2B를 ONNX로 내보내고 WebGPU 기반 ONNX Runtime Web에서 브라우저에서 직접 구동하도록 Claude Code로 포팅하는 실험을 정리한다.

LLM으로 트랜스크립트를 특징화하고 클러스터링해 모델 의도와 한계를 드러낸 연구

LLM으로 transcripts를 자동 특징화하고 임베딩-클러스터링-레이블링 파이프라인을 통해 모델 행동의 숨은 패턴과 한계를 정량화한다.

그레이 스완의 자동화된 레드팀으로 AI 보안의 한계를 넘다

대형 언어 모델의 보안 취약점을 자동으로 식별하고 방어하는 Shade와 Cygnal의 조합이 엔터프라이즈 보안과 규제/compliance 체계에 중요한 역할을 한다.

NSA 보안 침해 논란부터 DeepMind 인재 유출까지, AI 업계의 긴박한 상황

Fable 5와 Mythos 보안 논란, DeepMind 인재 유출, 그리고 차세대 모델 출시 루머를 통해 본 AI 업계의 긴박한 경쟁 상황을 분석합니다.

TechCrunch AI1달 전

Claude Code의 루프가 코드 자동 작성을 이끄는가?

에이전트 간 루프가 코드 자동 작성의 가능성을 제시하고, 코드 아키텍처 개선과 비용 관리의 균형이 핵심 과제로 떠올랐다.

메타의 AI 재편, 내부 보안 이슈와 프라이버시 논란의 전말

메타의 AI 재편이 직원 데이터 수집과 모니터링 이슈를 불러오며, 보안과 프라이버시에 대한 논쟁으로 번졌고 내부 거버넌스 문제까지 드러났다.

Langflow1달 전

Langflow 1.10의 Memory Bases로 에이전트에게 장기 기억력을 부여하는 방법

Langflow 1.10의 Memory Bases 기능을 활용해 에이전트가 세션 간 대화 이력을 벡터 데이터베이스에 저장하고 장기적인 문맥을 유지하는 방법을 알아본다.

무단 AI 에이전트 관리—가시성 확보와 거버넌스 편입을 위한 실전 가이드

섀도우 에이전트가 거버넌스 밖에서 작동할 때 발생하는 리스크를 식별하고, 가시성 확보와 체계적 거버넌스를 통해 안전하게 실험과 운영의 균형을 맞추는 방법을 제시한다.

Cursor가 공개한 3가지 혁신: 모바일 코딩, 에이전트 전용 Git, 그리고 차세대 모델

Cursor가 에이전트 중심 개발 환경을 위해 모바일 앱, 에이전트 전용 Git 플랫폼 Origin, 그리고 1.5T 파라미터 규모의 신규 모델을 발표했다.

AI 에이전트로 자동 매매 전략 구축부터 백테스팅까지 실전 가이드

Codex 에이전트를 사용하여 Hyperliquid 플랫폼에서 매매 전략을 설계, 백테스팅, 최적화하고 섀도우 러닝 모드로 배포하는 전체 워크플로를 다룬다.

RF-DETR과 Gemini로 매장 선반의 플래노그램 준수를 자동화하다

RF-DETR으로 빈 선반 영역을 탐지하고 Gemini로 브랜드 혼합 및 위치 이슈를 확인하는 Roboflow의 플래노그램 준수 자동화 워크플로우를 구축하는 방법을 설명한다.

AI를 활용한 로봇 용접 품질 자동화 워크플로우

RF-DETR로 용접 이미지에서 Good Weld와 Bad Weld를 로컬라이즈하고, Gemini 2.5 Pro로 자동 인스펙션 요약을 생성하는 엔드-투-엔드 파이프라인을 Roboflow로 구축한다.

ComfyUI와 SageMaker로 콘텐츠 생산 파이프라인을 자동화하는 실전 가이드

ComfyUI 워크플로우를 SageMaker AI 처리로 배치 실행해 대규모 이미지·오디오·비디오 생성을 자동화하고, GPU 기반 인프라와 CDK 구성을 통해 속도와 비용 효율을 동시에 개선한다.

로컬 AI가 바꾸는 개발 환경: Microsoft Build 참관기

Microsoft Build에서 확인한 로컬 AI 모델의 효율성과 하드웨어 SDK의 변화를 다룬 참관기.

GPU를 늘려도 느린 에이전트 추론, DualPath로 해결하는 법

DualPath는 유휴 디코드 머신을 활용해 KV 캐시 처리 대역폭 병목을 해결하고 GPU 활용률을 2배 높이는 추론 최적화 기법이다.

온프렘 환경에서 비용과 지연을 줄이는 llm-d의 다중 벤더 GPU 활용

온프렘 환경에서 llm-d가 다중 벤더 GPU를 효율적으로 배치해 처리량을 높이고 비용을 절감하며, 프리필-디코딩 분리로 각 단계의 최적화를 가능하게 한다.

로컬 캐시로 LLM 호출 비용을 크게 낮추는 Cachet의 비밀

Cachet은 OpenAI/Anthropic 호환 API 앞에 두는 100% 로컬 세맨틱 캐시로 중복 프롬프트의 비용과 지연을 실시간으로 절감한다.

다중 턴 대화의 기하학적 지표로 LLM 공격을 조기에 탐지하는 PsychoPass

대화의 임베딩 공간 궤도를 분석해 다중 턴 대화에서의 공격 가능성을 조기에 예측하고 온라인 모니터링을 가능하게 하는 프레임워크를 제안한다.

자율 네트워크의 실전 로드맵: AI 에이전트로 네트워크를 스스로 움직인다

AI 에이전트와 시뮬레이션 기반 검증으로 텔레콤 네트워크를 자율 운영하는 실전 로드맵을 제시한다.

HF Daily Papers1달 전· 1달 전 발행

대규모 프리트레이닝 데이터의 서사 구조를 정량화

서사는 인간 커뮤니케이션의 기본적 형식으로, 프리트레이닝 데이터의 서사적 다양성은 모델의 서사 추론 능력에 직접적인 영향을 미친다. 본 연구는 DOLMA 기반의 웹 스케일 데이터에서 11개 내러티브 차원을 측정하고, 이들 차원이 소스/주제에 따라 어떻게 다르게 분포하는지 대규모로 밝힌다. 이는 데이터 큐레이션이 서사 다양성을 반영하도록 설계되도록 하며, 이후 서사 추론 태스크의 성능-데이터 구성 간 관계를 탐구하는 발판을 마련한다.

HF Daily Papers1달 전· 1달 전 발행

패션·연령·체형 등 소수의 시각 신호가 MLLMs의 편향을 좌우한다

멀티모달 대형언어모델(MLLMs)의 판단은 외관 신호에 크게 좌우될 수 있다. StylisticBias 벤치마크는 정체성을 고정한 채 한 가지 시각 속성만 변형하는 설정으로 속성 수준의 편향 원인을 분리한다. 이를 통해 어떤 시각 속성이 편향에 가장 큰 기여를 하는지, 모델 간 편향 구조의 차이는 무엇인지 정량적으로 평가할 수 있다. 벤치마크의 공개는 편향 auditing과 지속 가능한 mitigation 연구에 기여한다.

HF Daily Papers1달 전· 1달 전 발행

단일/다중 뷰 소스로 실시간 4D 헤드 아바타를 구현하는 SpatialAvatar-0

고품질 4D 헤드 아바타를 얻기 위해 선행 연구는 일반화 가능한 feed-forward와 개별 아이덴티티를 보장하는 per-subject refinement를 분리해 왔다. SpatialAvatar-0은 두 가지 모드의 Gaussian 표현을 공유된 FLAME- mesh-bound 공간에서 통합하고, monocular-temporal → multi-view-spatial 두 단계 학습 및 10Kiter의 레이아웃 보존형 per-subject refinement를 통해 identity-prior collapse를 억제한다. VFHQ/HDTF에서 cross-domain zero-shot 성능이 향상되고, SplattingAvatar 벤치마크에서 단일 프레임 입력으로도 고주파 디테일이 유지되며, per-subject 재구성은 약 2분 내로 완료된다. 이를 통해 피처 재구성의 일반화와 주제별 재현성을 하나의 파이프라인으로 연결한다.

HF Daily Papers1달 전· 1달 전 발행

기하 지식 기반 재구성과 거버넌스형 메모리로 로봇 계획의 신뢰성 극대화

로봇이 언어 지시와 RGB-D 관측에서 3D 엔드 effector 경로를 계획할 때, monocular SAM3D 재구성이 포즈 불확실성과 비가시 영역으로 인해 왜곡될 수 있다. 또한 과거 경험의 재사용이 무작정 추가되는 append-only 메모리로는 현재 장면과 기하적 적용 가능성의 불일치를 해결하기 어렵다. GeoFuse-MV3D는 다중 뷰 기하 priors의 신뢰성 확인 및 축별 보정을 통해 고정된 입력 뷰에서만 기하 정보를 강화하고, KnowledgeBank는 품질·신뢰도·수명주기·충돌 정보를 갖춘 거버넌스 메모리로 재사용 품질을 제어한다. 이 둘의 결합은 재구성 정확도와 장기 계획의 신뢰성을 동시에 개선한다.

HF Daily Papers1달 전· 1달 전 발행

WorldLines로 장기 상태 유지 능력을 평가하는 휴먼-로봇 가정용 벤치마크

본 연구는 embodied 에이전트가 다일 기간에 걸친 상호작용에서 세계의 상태를 지속적으로 추적하고 이를 바탕으로 Memory QA와 Embodied Task Planning을 수행해야 한다는 문제를 다룬다. 기존 벤치마크는 주로 대화 중심 메모리나 단기 작업에 집중했으며, 긴 기간의 상태 변화와 실행 제약을 연결하지 못했다. WorldLines는 이 문제를 해결하기 위해 장기-프로젝트 기반의 추적 데이터를 생성하고, 관찰-기반 메모리(ObsMem) 아키텍처를 제안한다. 실험은 관찰 가능성의 한계와 overwritten 상태 때문에 발생하는 도전 과제들을 구체적으로 제시하며, ObsMem가 Memory QA와 Embodied Planning에서 강력한 기준 아키텍처임을 보인다.

HF Daily Papers1달 전· 1달 전 발행

Frozen MAE 엔코더로 임상 정보를 보존하는 3D Brain MRI 토크나이저와 DiT 기반 제어 가능

3D brain MRI의 생성-재구성 파이프라인에서 인코더-디코더 토크나이저는 임상 정보를 잃지 않으면서도 고해상도 재구성을 달성해야 한다. 본 논문은 frozen MAE encoder를 통해 임상 정보를 보존하는 이중 목적 토크나이저를 제시하고, 이 임베딩 공간을 통해 6가지 조건으로의 제어 가능한 생성과 환자별 종단 예측을 가능하게 한다.

HF Daily Papers1달 전· 1달 전 발행

토픽 메타데이터로 coarse chunks의 검색 정확도와 효율성을 함께 끌어올리다

RAG 시스템은 문서를 작은 청크로 나눠 검색하는데, 청크의 크기가 작아질수록 정확도는 개선되나 탐색 비용이 커진다. 큰 청크는 후보 수를 줄이지만 여러 토픽이 섞여서 표현이 노이즈가 생긴다. MCompassRAG는 청크에 토픽 메타데이터를 주입하여 큰 청크를 더 잘 검색 가능하게 만들고, 추론 시 LLM 호출 없이도 주석된 토픽 정보를 활용해 효율을 높인다. 여섯 개 벤치마크에서 Information Efficiency(IE)를 평균 8.24% 향상시키고 strongest non-LLM baselines 대비 latency를 5배 이상 감소시켰다.

HF Daily Papers1달 전· 1달 전 발행

LLM 호출 없이 긴 문서에서 다층 증거를 검색하는 SproutRAG

긴 문서의 증거를 효과적으로 모으려면 문맥의 다층 구성을 보존해야 한다. SproutRAG는 sentence-level chunk를 계층적으로 묶는 attention-가이드 트리를 학습해 다중 granul 합성 임베딩으로 검색을 수행하고, LLM 호출 없이도 다층 증거를 확보한다. 이를 통해 정보 효율 IE를 강화하고, 대규모 문서에서도 정확한 증거를 신속하게 찾아낸다.

HF Daily Papers1달 전· 1달 전 발행

Mask Diffusion Models에서 다중 턴 추론을 가능하게 하는 Reflective Masking

AR 기반 모델의 다-turn 추론은 초기 결정의 오류가 누적되며 전체 시퀀스를 재생성해야 한다. Reflective Masking(RM)은 출력의 일부를 선택적으로 재마스킹하고 수정하는 방식으로, 출력의 일부를 현 시점에서만 수정하고 재생성 비용을 줄인다. History Reference(HR)는 denoising 궤적의 과거 상태를 참조해 일관성과 수정 안정성을 높이며, 이는 이미지 편집, 구조적 추론(Sudoku) 및 자유 생성 텍스트 과제에서 일관된 성능 향상을 뒷받침한다.

HF Daily Papers1달 전· 1달 전 발행

다주체 공유 메모리에서 거버넌스와 기억 관리의 한계 평가

LLM 에이전트가 지속적 보조 기능으로 확장되면서 메모리는 개인 대화에서 벗어나 기관·가정 등 다수의 주체 간에 공유된다. 본 연구는 이러한 다주체 공유 환경에서 메모리의 유용성(Utility)과 함께 접근 제어(Access Control), 삭제 요청 후의 비복구성(Active Forgetting)까지 함께 평가하는 벤치마크를 제시한다. 전통적 메모리 벤치마크가 주로 단일 주체의 기억 회상에 집중하는 반면, GATEMEM은 도메인별 시나리오와 긴 호의 에피소드에서 거버넌스 측면의 취약점을 드러낸다. 실험 결과, 어떤 방법도 세 축을 동시에 충족하지 못했고, 긴 컨텍스트를 활용한 프롬팅이 거버넌성에 가장 강한 교차-트레이드를 보여주나 토큰 비용이 증가한다. Retrieval 기반 및 외부 메모리 방식은 비용을 줄이지만 여전히 무단 누출이나 삭제 이후의 회수를 방지하지 못한다.

HF Daily Papers1달 전· 1달 전 발행

다턴 로컬 수정으로 개인화 프리젠테이션을 구현

개인화된 프리젠테이션 생성을 위해서는 장기적 선호와 세션별 제약을 분리해 관리해야 한다. MemSlides는 long-term memory와 working memory를 구분하고, user profile memory와 tool memory를 더해 지속적 개인화와 재사용 가능한 실행 경험을 유지한다. 이를 통해 라운드 단위 수정 시 전체 덱 재생성을 줄이고, 다턴 대화에서의 일관성과 신뢰성을 높인다.

HF Daily Papers1달 전· 1달 전 발행

다중 영역을 병렬로 인지하는 확산 기반 모델로 추론 속도 대폭 향상

다중 영역 인지가 필요한 시나리오에서 AR 기반 디코딩은 영역 수에 비례해 지연이 증가한다. PerceptionDLM은 diffusion 언어 모델의 비 autoregressive 특성을 활용해 여러 영역의 캡션을 함께 생성할 수 있도록 설계되었으며, ParaDLC-Bench를 통해 캡션 품질과 추론 효율성을 함께 평가한다. 결과적으로 다중 영역 인지 작업에서 평균 처리량이 크게 증가하고, AR 대비 속도 상승이 가능해진다.

HF Daily Papers1달 전· 2달 전 발행

재귀적 분해로 복잡한 실세계 정규식 합성을 학습 기반으로 가능하게 한다

실세계 regex는 깊은 중첩과 다수의 Union 연산으로 구성되어 전통적 프로그래밍-에-예제(PBE) 접근법의 일반화가 어렵다. ReSyn은 Regex Canonicalization으로 데이터 품질을 높이고, Set2Regex(10M 파라미터)와 학습 가능한 Router/Partitioner/Segmenter를 통해 재귀적으로 문제를 분해해 복잡한 패턴을 합성한다. RegExLib와 같은 벤치마크에서 SOTA 수준의 성능을 보여주고, 대형 언어모델(GPT-5) 대비 파라미터 효율성에서도 우수한 성능 차이를 보인다.

HF Daily Papers1달 전· 1달 전 발행

데이터 매니폴드 기하를 정밀 측정하는 벤치마크 프레임워크

딥러닝의 일반화와 근사 오차에 대한 이론적 경계가 본질적으로 데이터의 기하에 의존하는데, 실험적으로 확인하기 어렵다. 본 논문은 제어된 변환 축으로 샘플링된 저차원 매니폴드를 구성하고, finite-difference estimators로 curvature, reach, volume을 ground-truth에 가깝게 추정하여 이론적 가설과 실험적 관찰을 연결한다.

HF Daily Papers1달 전· 1달 전 발행

No-resource 언어에서 코드 생성 성능을 비용 효율적으로 향상시키는 방법

대규모 training 데이터가 부족한 no-resource 언어는 상용 LLM이 코드 생성을 제대로 수행하기 어렵다. 본 연구는 Gleam과 MoonBit라는 두 no-resource 언어를 대상으로 벤치마크를 만들고, prompt-based 기술, pre-training, fine-tuning, 그리고 instruction-following 능력 이전(instruction transferring)까지 다양한 접근법을 비교한다. 결과는 특히 no-resource 언어에서의 파인튜닝이 성능을 크게 끌어올리며, instruction transferring이 비용 대비 효과적으로 작동하는 방식을 보여준다.

HF Daily Papers1달 전· 1달 전 발행

Agentic RAG로 임상 정보 추출의 정확도 96.5% 달성

임상 데이터의 메타데이터 부재와 불일치로 인한 검색·추출의 신뢰도 저하가 발생한다. ACIE는 온프레미스에서 전체 환자 맥락을 대상으로 추론하고, 모든 값은 출처 구절로 grounding되어 의사 검토를 거친 뒤 문서화된다. lymphoma 레지스트리 연구의 7,326 판단에서 96.5%의 수용률이 확인되며, 필드 유형에 따라 성능 차이가 나타난다.

HF Daily Papers1달 전· 1달 전 발행

Godot 기반 프로젝트‑수준 코드 벤치마크로 모델의 코드 생성 능력을 평가

게임 엔진 프로젝트 규모의 코드 엔지니어링은 데이터 부족과 결정적 평가의 부재로 연구가 드뭅니다. JamSet은 8,133개 프로젝트의 자동 검증 파이프라인을 통해 대규모 데이터셋을 구성하고, JamBench는 테마 기반 생성과 다중 수준 코드 완성을 평가합니다. 이 프레임워크는 모델의 프로젝트‑수준 설계와 런타임 동작을 함께 평가해 코드 품질과 엔진 설계의 간극을 분석합니다.

HF Daily Papers1달 전· 5달 전 발행

ASR 서빙의 대기시간을 줄이는 duration-based 스케줄링 기법

대규모 ASR 서비스에서 요청 간 길이 차이가 크면 FCFS가 머물름으로 인한 헤드-오브-라인 블로킹이 발생한다. 오디오 길이는 처리를 좌우하는 핵심 요인으로 작용하므로, duration 기반으로 길이 추정치를 만들고 이를 SJF/HRRN 같은 고전 스케줄링 알고리즘에 적용하면 평균 지연과 Tail 지연을 개선할 수 있다. 본 연구는 vLLM 엔진에 두 가지 알고리즘을 도입하고 실제 워크로드에서 성능을 분석한다.

HF Daily Papers1달 전· 1달 전 발행

법률 AI의 방향성까지 진단하는 Typed Hallucination 감사 프레임워크

합계 집계 지표가 유형별 실패 양상과 방향성을 가려 deployment 시 위험을 정확히 파악하기 어렵다. Typed hallucination profiles와 RDI를 통해 어떤 클라우에서 어떤 방향으로 잘못되었는지 구분하고, Calibrated multi-agent debate로 특정 유형의 오류를 효과적으로 감소시킨다.

HF Daily Papers1달 전· 1달 전 발행

지향 3D 프리미티브로 복잡한 다중 객체 영상의 시간적 상호작용을 직관적으로 제어한다

현대의 비디오 디퓨전 모델은 시퀀스 내 다중 객체의 spatio-temporal 동작을 정확히 제어하기 어렵다. 2D 박스나 흐름 기반 제어는 동일한 장면에서 깊이/occlusion 관계를 일관되게 유지하기 어렵고, 3D 정보의 직접적인 활용은 학습 부담을 증대한다. LCV는 oriented 3D boxes를 3D 공간 차원의 제어 프록시로 사용하고, DNOCS 인코딩으로 깊이-오클루전 정보를 2D 컨디셔닝으로 변환하여 Wan 2.2 DiT 기반 비디오 생성 모델의 제어를 향상시킨다. 실험적으로 nuScenes, HO-3D, BEHAVE에서 2D 기반 baselines 대비 Trajectory Error를 1.2-3x, Occlusion Accuracy를 1.5-2x 개선했다.

HF Daily Papers1달 전· 1달 전 발행

Uniform grid 기반 FP4 훈련으로 Shrinkage Bias를 제거하고 RHT를 모든 GEMM에扩

FP4 훈련은 메모리와 계산비를 크게 절감하지만, E2M1 비균일 격자와 RHT의 조합은 Shrinkage Bias를 유발하고 층을 따라 신호가 체인처럼 감소하는 문제를 초래한다. E1M2/INT4 같은 uniform grid를 사용하면 RHT의 코드북 활용을 퀀타이제이션 품질로 더 잘 전환할 수 있으며, Dense 1.5B, MoE 7.9B, MoE 124B에서 BF16-relative 손실 감소를 일관되게 달성한다. 향후 가속기는 FP4 훈련 프린티브로 uniform grid를 첫-class로 지원해야 한다.

HF Daily Papers1달 전· 1달 전 발행

Boundary 기반 선별 정합으로 VOCL의 정확도와 메모리 효율을 동시 향상

슬롯 기반 VOCL은 Encoder의 경계와 Decoder의 내부가 서로 다른 편향을 가지며, Dense Alignment는 계산 복잡도와 노이즈 전파를 초래한다. SSync는 엔코더의 경계 정보를 활용하고 디코더의 내부 정보를 이용해 한정된 영역에서만 교차 지도학습을 수행함으로써 오류 전파를 억제하고 선형 복잡도에서 메모리 사용을 대폭 감소시킨다.

HF Daily Papers1달 전· 1달 전 발행

Taylor-Calibrate로 zero-shot 초기화를 개선하고 토큰 소모를 대폭 감소

하이브드 선형 어텐션(GDN)은 long-context 추론에서 KV-cache 비용을 줄이지만, 새로 도입된 recurrent dynamics의 초기화가 성능에 큰 영향을 미친다. 교사 모델의 투영만 복사하는 기존 전이는 교환된 동적 파라미터의 decay, write 게이트, output 게이트를 제대로 설정하지 못하면 초기 제로샷 품질이 저하되고 추가 distillation 토큰이 필요하다. Taylor-Calibrate은 교사 attention 통계를 활용해 decay, write 게이트, value scale, output 게이트를 초기화하고, 레이어 단위 정렬으로 빠른 보정을 수행함으로써 초기 성능을 향상시키고 downstream recovery를 가속한다.

HF Daily Papers1달 전· 1달 전 발행

해상도에 구애받지 않는 3D 자산 기계 특성 고해상도 예측

3D 자산의 물리 시뮬레이션에 필요한 Volumetric E(Young’s modulus), ν(Poisson’s ratio), ρ(density)가 대부분의 자산에서 누락되거나 불완전하다. AdaVoMP는 입력 형상에서 이들 물성 필드를 공간적으로 변화시키는 SAV( Sparse Adaptive Voxels) 구조와 Transformer 기반의 생성기를 도입해 64^3 대비 1024^3 해상도까지의 고해상도 예측을 가능하게 하며, 메모리 효율도 유지한다. 다 representation across multiple 3D formats에서의 보편적 적용 가능성을 제시한다.

HF Daily Papers1달 전· 1달 전 발행

LOCUS로 미국 현지 조례를 위한 대규모 머신리더블 코퍼스 구축

현지 조례는 연방·주 법과 다층적으로 얽혀 있어 접근성과 연구 가용성이 제한된다. LOCUS-v1은 미국 내 9,239개 도시/카운티의 로컬 코드 원시 코퍼스와 카운티-하모나이즈드 접근layer를 제공하여 지역 법률 연구의 재현성과 대규모 분석 가능성을 크게 높인다.

HF Daily Papers1달 전· 1달 전 발행

훈련 시드와 생성 시드의 가변성이 FID에 미치는 영향

FID는 이미지 생성 평가의 표준 지표이지만, 시드 차이에 따라 값이 크게 달라질 수 있다. 본 논문은 training seeds와 generation seeds의 두 축으로 FID를 확률 변수로 모델링하고, 재현성 문제의 원인과 신뢰 가능한 평가 프로토콜을 제시한다.

HF Daily Papers1달 전· 1달 전 발행

단일 이미지에서 카메라·객체·날씨를 모두 제어하는 영상 월드 모델

영상 세계 모델에서 카메라/객체 제어와 환경 상태를 하나의 인터페이스로 다루는 일은 데이터와 모델 정렬의 난제로 남아 있다. 본 논문은 HoloStateData로 unified 제어 신호를 수집하고, UniSA와 Scene-Weather Decomposed CFG를 통해 세계 보존과 날씨 전이 잔차를 분리 학습·샘플링함으로써 소스 세계의 구조를 유지하면서 다양한 날씨 상태로의 전이가 가능해진다. 이로써 비디오-투-비디오 편집 기반의 날씨 편집 대비 단일 프레임에서의 1-shot 학습으로도 높은 품질의 날씨 변환과 카메라/객체 제어 일관성을 달성한다.

HF Daily Papers1달 전· 1달 전 발행

Egocentric 비디오로 사전학습 시 action-loss 24% 감소

데이터 확장성의 한계로 실로봇 데이터의 수집 비용과 다양성 제약이 크다. 본 연구는 5,000시간 규모에서 egocentric 데이터가 real-robot 데이터와 동등한 조건에서 더 나은 일반화를 이끌 수 있음을 실험적으로 보여준다. 특히 unseen-task에서의 일반화 이점이 두드러지며, open-world prior가 post-training 단계에서 embodiment-alignment를 적은 비용으로 보완한다.

HF Daily Papers1달 전· 1달 전 발행

도메인 정책 준수를 보장하는 상태 ledger와 게이트로 도구 호출의 안전성과 일관성 향상

도메인 정책이 환경 변경 행위를 제어하는 상황에서, 전통적 프롬프트 기반 에이전트는 대화 기록에 의존해 상태를 재구성한다. 이로써 관련 사실이 누락되거나 오래된 정보로 근거가 흔들릴 수 있다. LedgerAgent는 관찰된 상태를 schema-anchored ledger에 보존하고 실행 전 정책 게이트로 차단/수정하여 상태-grounding 문제를 해결하고 다중 시도 간 일관성(pass^k)을 향상시킨다.

HF Daily Papers1달 전· 1달 전 발행

Counting과 공간 추론에서 시각적 근거를 연결해 추론을 강화하는 Visually Groundeding

비전-언어 모델은 중간 사고의 언어 표현은 제시하되 이미지 증거와의 연결이 불완전한 경우가 많다. Visually grounded thinking은 중간 사고를 텍스트와 시각적 근거(객체의 위치나 경계)에 동시에 연결해 검증 가능성과 superviseability를 높이고, Counting 및 공간 추론 벤치에서 성능 향상을 보인다.

HF Daily Papers1달 전· 1달 전 발행

Retriever별 최적 쿼리 전략을 강화학습으로 학습

다양한 retriever가 서로 다른 쿼리 형식을 필요로 한다는 점을 실증한다. RL로 retriever별 최적 쿼리 정책을 학습하고, 브랜칭 롤아웃으로 다중-턴 검색의 학습 안정성을 확보한다. 구조적 Drift를 정량화하는 RE-MMD를 제시해, 동일 정보 필요성임에도 형식이 다른 문제에서의 전이 한계를 설명한다.

HF Daily Papers1달 전· 1달 전 발행

장기 추론과 멀티모달 이해를 맥락 증거로 견고하게 만드는 ContextRL

대형 언어 모델은 긴 맥락에서 결정적인 증거를 간과하는 경향이 있다. ContextRL은 질문-답 쌍과 함께 두 개의 매우 비슷한 맥락을 제시하고, 쿼리-답을 뒷받침하는 컨텍스트를 선택하도록 모델에 보상한다. 이 보조 목적어를 GRPO에 결합하여 긴 호라이즌 추론과 시각적 추론에서의 정당한 맥락 grounding을 개선하며, 5개 장기 맥락 벤치마크와 12개 이미지 기반 벤치마크에서 성능이 향상된다. 데이터 증가 baselines와 비교 시, 개선은 데이터 자체가 아니라 학습 목적의 차이로 설명된다.

HF Daily Papers1달 전· 1달 전 발행

프롬프트 우선 최적화로 파이프라인 성능 평균 +14.1pp 개선

다중 단계 LLM 파이프라인은 Retrieval, Reasoning, Formatting 간의 상호작용으로 프롬프트 단독 최적화만으로는 병목을 해결하기 어렵다. FAPO는 실패를 단계별로 attribution하고 프롬프트 에디트에서 시작해 필요 시 파이프라인 구조를 바꿔가며 반복적으로 최적화를 수행한다.

HF Daily Papers1달 전· 1달 전 발행

카메라 시점 간섭 하에서 월드 엔드포인트의 지속성을 진단하는 최초의 종합 벤치마크

월드 모델이 진정으로 환경의 상태를 시간에 걸쳐 연속적으로 유지하는지 여부가 AGI 도달의 핵심이다.现행 벤치마크는 화질, 모션, 카메라 제어 등 표면 특성에 의존해 왔으며, 시야에서 벗어난 상태에서 월드가 여전히 진화하는지 여부를 평가하지 않는다. WRBench는 카메라 움직임을 관찰 가능성에 대한 개입으로 간주하고, 카메라가 보이지 않는 구간에서 월드 상태가 엔드포인트까지 일관되게 유지되는지를 검사한다.

HF Daily Papers1달 전· 1달 전 발행

Video 대신 Image Editing으로 로봇 WAM의 추론 비용을 대폭 절감

World Action Models(WAMs)은 일반적으로 비디오 생성 기반으로 정책 학습에 필요한 시각 정보를 얻는다. 다수의 미래 프레임 토큰 예측은 계산 비용을 증가시키고, action-irrelevant한 세부 정보까지 처리하게 만든다. ImageWAM은 이미지 편집 모델의 중간 표현을 이용해 언어 지시 conditioned 비주얼 변환에 집중하는 방식으로 이러한 한계를 해결한다.

HF Daily Papers1달 전· 1달 전 발행

방해물 제거된 신규 시점 합성을 위한 대규모 DF3DV-1K 벤치마크

본 논문은 distractor-free radiance field 연구를 위한 대규모real-world 데이터셋과 체계적 벤치마크의 부재를 해소한다. 1,048개 장면과 89,924장의 이미지로 구성되며 128 distractor 타입과 161 시나리오 테마를 포괄한다. 이를 통해 9개 최신 distractor-free 방법과 3D Gaussian Splatting을 포함한 벤치마크를 제공하고, 시나리오별 차이와 모델 간 강건성 차이를 체계적으로 비교할 수 있다. 또한 다수의 샘플로 확장 가능한 2D 기반 엔하서 DI2FIX를 제시해, distractor-free 렌더링 품질을 평균 약 0.96 dB PSNR, LPIPS 약 0.057 감소로 향상시킨다.

HF Daily Papers1달 전· 1달 전 발행

FlowBender로 조건부 샘플링의 충실도와 타당성 동시 향상

조건부 샘플링에서 조건 신호(y)와 데이터 분포 간의 불일치를 줄이는 것이 어렵다. FlowBender는 alignment error를 입력으로 받아 샘플링 경로를 학습하는 폐쇄 루프 방식으로, 기존의 Open-loop 학습과 추론-时의 가이드 방식이 갖는 한계를 극복한다. gradient-based 및 non-differentiable 환경에서 모두 작동하는 보정 정책을 학습하고, prior-step shortcut으로 추론 비용을 거의 증가시키지 않는다. image-to-image translation, restoration, 3D mesh texturing에서 Fidelity와 Plausibility를 동시 향상시키는 것이 가능하다.

HF Daily Papers1달 전· 1달 전 발행

제로샷으로 두 시점에서 다른 의미를 드러내는 3D 환상 메쉬를 5분 내에 생성

다중 시점에서 서로 다른 의미를 갖는 3D 객체를 한 메쉬로 표현하는 기술은 기존 SDS 기반 방법의 느림, 과포화된 색상, 불연속 접합 문제로 제약이 크다. JanusMesh는 훈련 없이 두 가지 시맨틱을 갖는 고품질 3D 환상을 빠르게 생성하며, 지오메트리 무결성과 텍스처 품질을 모두 향상시킨다.

HF Daily Papers1달 전· 1달 전 발행

커뮤니티 LoRA로 스타일-콘텐츠 이중참조 생성의 대규모 데이터 파이프라인 구현

스타일 참조와 콘텐츠 참조를 동시에 활용한 생성은 콘텐츠 구조 보존과 스타일 매칭의 균형을 필요로 한다. 대규모 트리플 데이터의 부재와 콘텐츠 누출 문제를 해결하기 위해 커뮤니티 LoRA를 조합 가능한 앵커로 활용하고, 두 단계 학습과 새로운 평가 지표를 도입한다.

HF Daily Papers1달 전· 1달 전 발행

리더보드의 한계를 넘어 예측 타당성으로 배포-실무 평가를 재정의

대부분의 리더보드가 단일 점수에 의존하는 반면, 배포 환경은 다차원적 요구를 가진다. 이 논문은 12단계의 평가 체계와 예측 타당성에 기반한 랭킹 구조를 통해 배포-시나리오에서의 일반화와 안정성을 더 잘 예측하는 지표를 제시한다. 또한 AssetOpsBench 및 14개의 확장 연구를 종합해 다축 평가의 필요성과 구현적 취약점을 드러낸다.

HF Daily Papers1달 전· 1달 전 발행

놀이 기반 학습으로 로봇의 재사용 가능 코드 스킬을 얻다

로봇 학습은 대개 특정 과제 해결에 집중하고 재사용 가능한 고수준 스킬 축적이 미미하다. RATs는 self-directed play를 통해 코드를 실행하고 피드백을 받아 성공 실행을 코드 스킬로 distill하며, 이 스킬 라이브러리를 다운스트림 작업에 재사용한다. LIBERO-PRO와 MolmoSpaces에서 다운스트림 태스크의 평균 성공이 크게 향상되고, 학습된 스킬의 cross-environment 전이 및 sim-to-real 가능성도 확인된다.

HF Daily Papers1달 전· 2달 전 발행

물리적 접촉으로 관절형 물체를 정교하게 다루는 강건한 손-물체 상호작용 프레임워크

관절형 물체를 다루는 dexterous manipulation은 손가락 다중 접촉 패턴을 통해 가능하지만, 대상 부품은 직접적으로 작동하지 않으며 접촉을 통해서만 동작이 유도된다. 기존 방법은 고정된 dynamics에 의존해 일반화에 취약했고, PICA 기반 DragMesh-2는 접촉 로봇학의 실제 환경에서의 강건성과 성공률을 개선한다.

HF Daily Papers1달 전· 1달 전 발행

0.22B 파라미터로 10B급 품질, 15× 인퍼런스 속도 향상

대규모 10B급 일반ist와 소형 전문 네트워크 간의 성능 격차를 줄이려는 시도다. Moebius는 Local-λλ Mix Interaction(LλMI) 블록과 어댑티브 멀티-그레이네르(distillation)을 결합해 극단적 축소에도 고해상도 텍스처와 시맨틱 지식을 유지한다. 0.22B 파라미터로 10B급 품질에 근접하거나 이를 능가하며, 단일 스텝 추론에서 FLUX.1-Fill-Dev 대비 >15× 총 추론 시간 가속을 달성한다.

패치 더 플래닛으로 오픈소스 보안 부담을 AI가 덜다

오픈AI의 Patch the Planet은 Trail of Bits와 협력해 오픈 소스 보안 이슈를 유지보수자에게 도달하기 전에 선제적으로 탐지·패치를 돕는 협업 모델을 제시한다.

Big Five와 정신건강을 반영하는 LLM 어댑터의 구현

대형 모델의 텍스트 출력에 Big Five 성격 특성과 정신건강 지표를 반영하도록 파라미터 효율적 어댑터를 활용하는 구현 방법이다.

NVIDIA의 물 재순환 냉각으로 데이터센터 물 사용이 달라진다

NVIDIA의 45°C 냉각 루프는 데이터센터 내부 물 사용을 크게 줄일 수 있지만, 전체 물 발자국은 전력 생산과 제조에서 발생하는 물 사용으로 여전히 크게 남아 있다.

제로 코드 변경으로 LLM 비용을 40–70%까지 절감하는 방법

애플리케이션과 AI 공급자 사이에 시맨틱 캐싱 레이어를 두어 반복 질의의 API 호출을 줄이고 코드 수정 없이 비용을 대폭 낮춘다.

다수 모델을 한 곳에서 관리하는 AI 워크스페이스, ChatLLM 리뷰

ChatLLM은 여러 모델을 하나의 인터페이스에서 제공하고 문서 분석, 코딩 도구, 이미지 생성, 자동화까지 포괄하는 올인원 AI 워크스페이스이다.

SpaceX 칩으로 여는 오픈소스 AI의 새로운 경쟁 구도

Reflection AI가 SpaceX와 대규모 컴퓨트 계약을 체결해 Nvidia GB300 칩에 대한 즉시 접근과 Colossus 2 데이터센터 활용권을 확보하고, 오픈-웨이트 AI 생태계 확장을 가속한다.

로컬에서 LLM을 안정적으로 실행하는 실전 가이드: llama.cpp부터 vLLM까지

로컬에서 LLM을 안정적으로 실행하는 방법과 주요 최적화 기법을 llama.cpp 기반으로 체계적으로 정리한다.

Revenant로 펌웨어 역공학 자동화의 새 지평을 열다

Revenant는 LLM 기반 도구로 radare2/ghidra를 중심으로 펌웨어를 자동 분석하고 1:1 재현까지 가능하게 하여 노후 하드웨어의 생명을 현대 도구로 불어넣는 프로젝트다.

AWS ML Blog1달 전

수십 억 픽셀의 항공 이미지를 자연어로 검색하는 실전 파이프라인

다중 뷰 항공 영상의 임베딩·캡션링·벡터 검색을 모듈형 아키텍처로 구현하고, Nova 멀티모달 임베딩과 캡션의 결합이 검색 품질에 가장 큰 영향을 준다는 점을 실험으로 확인했다.

Anthropic의 위험 경고가 규제 논쟁을 촉발하다

FT 분석에 따르면 Anthropic가 올해 위험 경고를 OpenAI보다 자주 제기했고, 미국의 Mythos와 Fable 금지로 규제 논쟁이 격화되었다.

지연 시간 기반 라우팅으로 LLM 공급자 간 트래픽을 자동 최적화하는 경량 사이드카

sturnus는 OpenAI 호환 API를 제공하는 경량 사이드카로, 가장 빠른 공급자에 트래픽을 집중시켜 LLM 응답 속도와 가용성을 높인다.

가격 감시로 안전하게 예산 관리, 8주 간의 LLM 가격 스냅샷 공개

8주간의 자동 가격 스크래핑으로 주요 공급자의 가격 유지 현황과 600배에 달하는 가격 스프레드를 확인하고, Together AI의 가격 변경 주도 사례를 통해 가격 모니터링의 필요성과 TokenPrices의 실무적 도구화를 제시한다.

촬영 없이 AI만으로 유튜브 영상 제작하는 워크플로

Claude Code를 활용해 스크립트, 음성, 애니메이션, 아바타를 포함한 유튜브 영상 제작 전 과정을 자동화하는 방법.