본문으로 건너뛰기

2026년 6월 19일 AI 뉴스

100

관심 태그 추가
AWS ML Blog1달 전

Amazon Quick과 MCP로 Adobe 마케팅 인사이트를 실시간으로 얻는 방법

MCP를 통한 Adobe Marketing Agent의 Amazon Quick 통합으로 거버넌스 하에 마케팅 인사이트를 채팅형 대화에서 실시간으로 도출하는 구현 가이드이다.

Bedrock AgentCore 웹 검색으로 에이전트의 최신 정보가 AWS에서 바로 확보된다

에이전트가 최신 정보를 얻도록 Web Search Tool을 통해 AWS 내에서 웹 검색을 연결하고, 지식 그래프와 의미 스니펫 추출로 정확도와 신뢰성을 높인다.

AI 에이전트 간 '뇌'를 연결해 성능은 높이고 비용은 75% 줄이는 법

RecursiveMAS는 에이전트 간 잠재 상태를 직접 전송하는 재귀적 협업 구조로, 토큰 사용량을 75% 절감하고 수학 문제 해결 정확도를 크게 높였다.

KDNugget1달 전

노브 시리즈: 손실 함수로 모델이 틀렸을 때 어떻게 배우는가

손실 함수의 아이디어와 대표 함수(MSE/MAE/Cross-Entropy)의 차이, 그리고 학습 루프에서의 피드백 메커니즘을 초보자도 이해하도록 설명한다.

ROA 패턴으로 고위험 AI 시스템의 실행 거버넌스 강화

고위험 에이전트 시스템의 실행 거버넌스를 강화하기 위해 책임 계약, 임무 고정, 의심의 분리, 기억의 유지, 의사결정 추적, 그리고 HOTL로의 전환을 제시한다.

모든 LLM 공급자를 하나의 API로 관리하는 솔루션

Wyolet Relay는 하나의 API 엔드포인트로 OpenAI·Anthropic 등 다수 공급자를 연결하고, 키 관리와 비용 추적을 자체 인프라에서 가능하게 한다.

대규모 데이터 라벨링 운영의 플랫폼 선택 포인트를 공개

대규모 멀티프로젝트 데이터 라벨링 운영에서 플랫폼 간 차이와 Kili의 경쟁력을 비교 분석한다.

오픈 소스 AI를 규제하면 왜 교육과 혁신이 손실될까

오픈 소스는 교육, 혁신, 경쟁의 토대이며 이를 규제하는 것은 AI 생태계의 성장과 안전성까지 저해할 수 있다.

AI 인프라 시장의 새 바람, Allbirds의 Smartbird 여정

Allbirds가 AI 인프라로 전환하며 Smartbird를 통해 데이터 주권과 단일-테넌트 운영으로 AI compute를 공급하려 한다.

AI 인격권, 필요할까? 법적 책임의 미래를 묻다

AI 인격권에 대한 역사적 맥락과 현대적 위험, 책임 분배의 함의를 분석하여 현 정책 방향의 필요성과 한계를 제시한다.

All About AI1달 전

Polymarket에서 수수료와 슬리피지를 피하는 에이전트 AI 트레이딩 전략

방대한 시장 데이터를 분석해 적정 가격을 산출하고, 수수료와 슬리피지를 최소화하는 에이전트 AI 트레이딩 전략을 구현한다.

HF Daily Papers1달 전· 2달 전 발행

개인화 데이터를 활용하는 iOS 에이전트의 역량을 평가하는 벤치마크

현대 스마트폰은 여러 앱에 걸친 개인 데이터를 보유한다. 이러한 데이터를 활용해 사용자 의도와 과거 행동을 파악하는 에이전트의 능력이 핵심적이다. 기존 벤치마크는 cross-app 맥락과 개인화 요소를 충분히 반영하지 못한다. iOSWorld는 26개 네이티브 앱에 걸친 지속적 사용자 아이덴티티를 기반으로 133개의 태스크를 제시하고, 단일 앱에서 다중 앱으로 이어지는 맥락 추론과 기억 능력을 정량적으로 평가한다.

HF Daily Papers1달 전· 1달 전 발행

프롬프트 템플릿과 샘플-단위 점수 도입으로 물리 이해 평가 신뢰도 향상

비디오 생성 모델의 물리 현상 이해를 측정하는 벤치마크의 신뢰도 문제를 해결하기 위해, 프롬프트 품질, 아티팩트 제거, 샘플 단위 점수 도입을 제안한다. 이를 통해 물리적 규칙에 대한 모델의 실제 추론 능력을 더 정확하게 반영하고, 벤치마크 결과의 해석 가능성과 재현성을 높인다.

HF Daily Papers1달 전· 1달 전 발행

손실 없이 토큰화하고 임베딩까지 제공하는 Morpheus

Turkish는 agglutinative 언어로, 의미는 형태소 단위에 담겨 있으며, 기존의 subword 토크나이저는 형태소 정보를 보존하지 못하고 역추적 손실이 발생한다. Morpheus는 morphology-aware 토크나이저와 임베더를 하나의 모델로 결합해, training과 inference에서 동일한 형태소 분할을 학습하고, decode(encode(w))=w를 보장한다. 이로써 어휘 수준의 검색/매칭과 토큰-기반 생성을 모두 효과적으로 지원하는 단일 파이프라인을 제시한다.

HF Daily Papers1달 전· 2달 전 발행

ViT-Up으로 ViT 피처를 고해상도에서 충실하게 업샘플

Vision Transformer(ViT)의 패치 토큰 격자는 self-attention의 O(N^2) 복잡도 때문에 보통 해상도가 낮다. 이로 인해 Dense prediction과 정밀한 공간 추론이 어려워진다. 기존 이미지 가이드 기반 업샘플링은 피처 누수(leakage)와 분해를 유발하는 경우가 많고, 백본의 표현 공간에 잘 맞지 않는 고해상도 신호를 필요로 한다. ViT-Up은 Backbone의 중간 계층에서 얻은 히든 스테이트를 층별로 조합해 좌표 조건의 임펄스형 디코더를 구축하고, 외부 이미지 가이드 없이도 임의의 연속 좌표에서 백본 피처를 추정한다. 이로써 피처 업샘플링의 질을 높이고, 악영향인 leakage/fragmentation를 줄인다.

HF Daily Papers1달 전· 1달 전 발행

훈련 없이 차원 부호 패턴으로 Transformer의 작동 원리를 읽다

Transformer의 hidden state를 읽고 해석하기 위한 학습 기반 도구의 비용을 낮출 수 있음을 보여준다. 표준 basis만으로도 의미를 읽을 수 있으며, 언어/비전/오디오 등 다양한 모달리티에서 공통의 읽기 패턴이 관찰된다. 이는 해석 가능성 연구의 새로운 방향을 제시하고, 시스템적 안전성 모니터링에 실용적인 영향을 준다.

HF Daily Papers1달 전· 2달 전 발행

스프레드시트용 다음 액션 예측을 위한 온라인 평가 프레임워크를 제시

스프레드시트는 다양한 셀 조작과 포맷팅으로 구성된 고도 복잡한 UI를 가지며, 자동완성의 도입이 코드 에디터 수준의 보조로 확장될 가능성이 있다. 본 연구는 이러한 자동화 보조를 실제 업무 환경에서 평가하기 위한 벤치마크와 온라인 평가 프레임워크를 제시함으로써, 모델-시스템 간 비교 가능성과 사용자 유틸리티를 함께 측정할 수 있는 체계를 제공한다. 이를 통해 차세대 스프레드시트 보조 시스템의 개발 방향성(정교한 abstention, 트리거 설계, 컨텍스트 활용의 효율성 등)을 구체적으로 도출할 수 있다.

HF Daily Papers1달 전· 1달 전 발행

단일 GPU에서 47.5 FPS의 실시간 오디오-비주얼 생성

소셜 플랫폼의 영상 콘텐츠가 일상적으로 소비되며 인터랙티브한 상황이 늘어나고 있다. 기존의 세계 모델은 물리적 환경 시뮬레이션이나 게임 내 탐사에 초점을 맞추고 있어 사람 중심의 소셜 다이내믹스를 실시간으로 반영하기 어렵다. MaineCoon은 22B 파라미터의 실시간 스트리밍 가능 오디오-비주얼 autoregressive 모델로, 실시간 상호작용과 멀티모달 동기화를 목표로 설계되었으며, 소셜 인터랙티브 애플리케이션의 가능성을 제시한다. 또한 에이전트적 스트리밍 추론, self-resampling, cross-modal representation alignment, domain-aware preference optimization 등을 도입해 학습 및 추론 효율성을 높인다.

HF Daily Papers1달 전· 2달 전 발행

실제 인간 대화로 본 LLM 개인화의 한계와 개선 가능성

본 연구는 합성 데이터와 실제 인간 데이터의 차이가 LLM 개인화 성능에 어떻게 반영되는지 분석한다. 세 단계(속성 추출, 관련성 매칭, 맞춤 생성)를 통해 인간 데이터의 한계를 드러내고, 경량 검증기와 학습 기반 정렬 방법의 효과를 제시하며, 인간 중심 평가의 필요성을 강조한다.

HF Daily Papers1달 전· 1달 전 발행

7B UDLM으로 지식·추론·코딩 벤치마크에서 AR 대비 경쟁력 확보

Uniform diffusion은 모든 토큰을 어느 시점에든 업데이트할 수 있어 생성 유연성을 높인다. Sumi는 1.5T 토큰으로 scratch에서 pretrained된 7B UDLM의 첫 공개 사례로, UDLM의 확장성, 생성 역학, 제어성 및 기존 AR/MDLM과의 트레이드오프를 연구하는 기준점을 제공한다. 모델 가중치와 학습 레시피의 공개는 재현성과 비교 연구를 촉진한다.

HF Daily Papers1달 전· 2달 전 발행

7개 카테고리에서 98.43% 정확도: LLM 기반 NWDAF 인터페이스

NWDAF의 사용자 인터페이스를 자연어로 확장하여 비전문가도 네트워크 분석 및 구독 관리를 수행할 수 있게 한다. Retrieval-Augmented Generation(RAG) 기반 의도 분류와 실시간 Prometheus 쿼리를 결합해 분석과 구독 제어를 모두 실시간으로 처리한다. 이러한 접근은 6G의 AI-native 네트워크 관리로의 전환에 필요한 인간-기계 협업 기반을 제공한다.

HF Daily Papers1달 전· 1달 전 발행

SAE 기반 안전 개입이 억제를 넘어서 회복될 수 있음을 보여주는 진단 프레임워크

Sparse autoencoders(SAEs)가 Residual-stream 표현을 해석가능한 특징으로 분해해 안전 제어에 활용되는 사례가 늘고 있다. 하지만 본 연구는 특정 SAE 특징을 차단해도 억제된 행동이 여전히 재현될 수 있음을 보여준다. 포스트 인터벤션 회복 프레임워크를 통해 개입이 '완전한 차단'이 아닌지 검증할 수 있으며, 이를 통해 안전 평가의 한계와 보강 방향을 제시한다.

HF Daily Papers1달 전· 2달 전 발행

HiLo-Token로 DiT의 토큰 수를 대폭 줄이고 편집 품질을 유지하는 방법

대화형 이미지 편집에서 DiT의 토큰 수가 많아 인퍼런스 지연의 주요 원인이다. HiLo-Token은 editing 마스크 내부의 로컬 정보를 보존하고 외부 영역은 고주파/저주파를 구분해 토큰을 선택적으로 배치함으로써 평균 DiT 속도를 크게 높이고, 전체 파이프라인의 비용을 감소시킨다.

장기 의사결정 평가를 위한 스타트업 시뮬레이션 벤치마크

언어 모델 기반 에이전트는 짧은 목적 수행에 집중한 평가가 많으나, 현실 세계의 중요한 성과는 불확실성과 지연된 피드백 하에서의 다단계 의사결정이다. CEO-BENCH는 500일간의 시뮬레이션에서 가격, 마케팅, 제품, 인프라, enterprise 영업 등 다수의 영역을 아우르는 정책들을 한꺼번에 조정하고, 노이즈가 섞인 신호에서 숨겨진 구조를 추론하며, 시간에 따라 변화하는 환경에 적응하는 능력을 평가한다.

HF Daily Papers1달 전· 2달 전 발행

다중 이미지 속성 추출의 완전성 격차와 한계를 실증

산업용 부품의 규격은 표, 명판, 도면 등 다양한 이미지에 분산되어 있으며 이를 하나의 레코드로 완성하려면 텍스트 인식, 시각 추론, 도메인 지식 해석, 다이미지 간의 증거 통합이 필요하다. 기존 벤치마크는 이 네 가지를 동시에 평가하지 못하며, 실제 산업 현장의 완전한 속성 추출은 미해결 문제로 남아 있다. IndustryBench-MIPU는 이러한 문제를 체계적으로 평가하고 cross-image 증거 통합이 핵심 bottleneck임을 밝힌다.

HF Daily Papers1달 전· 2달 전 발행

Missing 카메라 상황에서도 재훈련 없이 강건한 다중 모달 학습을 구현

로봇 시스템은 시각 카메라+언어 지시 등 여러 모달리티를 사용해 의사결정을 하지만, 센서 드롭아웃으로 모달리티가 사라질 때 기존 imitation learning 방법은 재현성이 떨어진다. RL4IL은 frozen encoder를 유지한 채 BFS-확장 후보 셋에서 가장 관련성 높은 시연을 RL로 선택하고, soft cross-attention으로 다수의 후보를 융합해 missing modality 상황에서도 재훈련 없이 robust한 예측을 달성한다. LIBERO 벤치마크에서 카메라 드롭아웃 조건 하의 성능이 크게 향상된다.

HF Daily Papers1달 전· 1달 전 발행

경로 수준 감독으로 단일 라벨에서 오프라인 RL의 샘플 효율성 확보

오프라인 RL에서 프로세스 수준의 보상이 제공되지 않는 데이터가 흔하다. 이 논문은 경로 수준의 결과를 이용해도 정책 최적화가 가능하다는 이론적·알고리즘적 근거를 제시하고, 샘플 복원력과 하한을 분석한다. OPAC 알고리즘은 latent per-step rewards를 학습하고 offline 분포 이동에 대한 페니즘을 적용하여 성능 보장을 제공한다. 또한 선호 피드백과 일반화된 목표에 대한 확장도 제시한다.

HF Daily Papers1달 전· 2달 전 발행

다문화 에이전트 시스템의 가치 다양성을 시스템 차원에서 평가한다

대규모 언어모델 기반 에이전트의 다문화 구성이 점차 확산되면서, 전체 시스템이 인간 사회의 가치 다원성을 얼마나 보존하는가가 중요해졌다. 이 논문은 단일 에이전트의 가치 정렬성만으로는 시스템 수준의 가치 다양성을 파악하기 어렵다고 지적하고, 시스템 차원의 가치 다양성(value diversity)이라는 새로운 평가 축을 제안한다. 또한 다양성은 개별 에이전트 간 정렬성과 거의 무관하게 작동할 수 있어, 다원성 유지에 필요한 설계 고려사항을 제시한다. 연구는 WVS를 기반으로 19개 문화와 18개 백본 모델의 다양한 구성에서 가치 다양성을 측정하고, 인간의 다양성과의 차이를 실증적으로 보여준다. 이로써 다문화 에이전트 시스템 설계에서 다양성 보존의 중요성과 한계를 드러낸다.

HF Daily Papers1달 전· 1달 전 발행

보상-주도 경계 탐지로 다중 턴 도구 사용 RL의 데이터 효율을 20× 개선

다중 턴 도구 사용 에이전트의 학습은 정보가 풍부한 샘플의 부족으로 제약된다. RP 기반의 경계 탐지는 학습에 가장 큰 기여를 하는 샘플 영역을 식별하고, 이 영역에서 구조적으로 일치하는 샘플을 합성하는 RODS를 통해 데이터 효율과 학습 안정성을 동시에 달성한다.

HF Daily Papers1달 전· 2달 전 발행

Masked Region Diffusion로 텍스트-레이어 생성과 레이어 편집을 한 번에

레이어별로 재사용·편집 가능한 디자인 자산은 고급 디자인 시스템의 핵심이다. MRT는 3가지 상호 보완 작업(T2L, I2L, L2L)을 하나의 공유 프레임워크로 처리하고, boundary를 넘어 확장 가능한 overflow-layer를 도입해 전체 레이어의 재사용성과 편집 가능성을 대폭 확장한다. 더불어 diffusion distillation으로 실시간 멀티-레이어 생성을 가능하게 하여 대규모 디자인 파이프라인의 효율성을 크게 높인다.

HF Daily Papers1달 전· 2달 전 발행

Activation sparsity로 DiT 추론을 실질적으로 가속, 평균 1.88× Sparse GEMM,

Diffusion Transformer(DiT) 계열 모델의 추론 비용은 높은 편이다. 가중치 중심의 sparsification은 성능 저하를 야기하는 반면, Activation sparsity는 본질적으로 더 희소한 패턴을 만들고 품질 손실을 크게 줄인다. RT-Lynx는 Activation sparsity를 online으로 적용하고 Norm Compensation 및 LoRA 보정으로 품질 저하를 억제하며, CUDA 기반의 엔드투엔드 파이프라인으로 실사용 속도 향상을 달성한다.

HF Daily Papers1달 전· 3달 전 발행

분 단위 애니메이션에서 품질과 아이덴티티를 동시에 유지

긴 호라이즌 애니메이션은 프레임 간 drift으로 인해 배경의 텍스처 손상과 인물 아이덴티티 불일치를 초래한다. 기존의 이미지-공간 carry-over와 attention sink은 시간이 지남에 따라 누적 오차를 축적하고 품질 저하를 일으킨다. EverAnimate은 cross-chunk 의미를 잠재 공간에서 전달하고, 샘플링 시 intrinsic restoration을 통해 drift를 보정하므로 분 단위의 긴 애니메이션에서도 시각적 일관성 및 인물 동일성 보존이 가능해진다.

HF Daily Papers1달 전· 2달 전 발행

약한 모델의 오류 프리픽스로부터 회복하는 학습 전략

대형 언어 모델의 추론 능력은 종종 강력한 교사나 정교한 데이터 설계에 의존한다. DenoiseRL은 weak-model의 오류를 구조화된 노이즈로 활용해 회복형 RL 학습 신호를 만들고, 외부 감독 없이도 학습 데이터를 확장하며 탐색 효율을 높인다. 결과적으로 수학적·일반 추론 벤치마크에서 강한 온-정책 RL 기반보다 일관되게 향상된 성능과 더 강한 자기 수정 능력을 보인다.

HF Daily Papers1달 전· 2달 전 발행

Forward-Backward 탐색으로 샘플 품질과 탐색 효율을 동시에 개선

BES는 forward 후보의 진화와 backward 목표 분해를 결합해 expansion-only의 한계를 벗어나 더 적은 샘플로 더 나은 해를 찾고, post-training과 inference에서 성능을 향상시킨다.

HF Daily Papers1달 전· 2달 전 발행

encoder-free 네이티브 원-비전 모델로 멀티모달 범용성 확장

이 연구는 encoder-free native VLM의 가능성을 제시하고, 이미지-단일 프레임에서 다중 이미지와 비디오까지 연동하는 통합 모델을 제시한다. 단일 백본에서 픽셀-단위 상호작용과 시공간 관계를 학습함으로써 1) 단일-이미지에서 다중 이미지, 비디오까지 범위를 확장하고 2) 공간 지능과 긴 맥락 이해에서 경쟁력을 갖춘다.

HF Daily Papers1달 전· 2달 전 발행

4인 멀티에이전트 월드모델의 실시간 롤아웃을 가능하게 하는 Simplex Rotary Encoding

다중 에이전트 환경에서의 월드 모델링은 각 에이전트의 독립 제어성과 시계열 및 관점 간 일관성을 보장해야 한다. 기존 방법은 모든 토큰 간의 어텐션 비용이 증가하고, 학습 시 슬롯 고정으로 인해 permutation 유연성이 제한된다. Gamma-World는 permutation-symmetric한 Simplex Rotary Agent Encoding으로 에이전트 정체성을 고정된 슬롯 없이 표현하고, Sparse Hub Attention으로 교차에이전트 소통을 허브를 통해 제한해 계산 복잡도를 선형으로 감소시킨다. 또 Bidirectional teacher와 causal student 간의 distillation 및 KV caching으로 24 FPS의 실시간 스트리밍 롤아웃을 달성한다. 이로써 두 플레이어에서 네 플레이어로의 일반화가 추가 학습 없이 가능해지며, 멀티에이전트 시뮬레이션의 확장성과 실시간성이 크게 향상된다.

HF Daily Papers1달 전· 2달 전 발행

다층 평가로 LLM 에이전트의 실패를 자동으로 진단

에이전트형 시스템의 자율성이 증가함에 따라 행동을 감독하고 평가하는 도구의 필요성이 커졌다. 기존 도구는 제한적이고 정적 분류에 의존하는 경향이 있어 새로운 도메인에 신속히 적응하기 어렵다. Agentic CLEAR는 트레이스 단위까지 텍스트 기반의 진단을 자동으로 생성하고, 시스템-노드-트레이스 차원의 인사이트를 제공한다.

HF Daily Papers1달 전· 2달 전 발행

ZeroUnlearn: Few-shot로 민감 지식 제거를 한 번의 편집으로 달성

대형 언어 모델은 방대한 웹 코퍼스로부터 민감한 정보를 흡수해 안전성과 프라이버시 문제를 야기한다. 기존 언학(larging-scale unlearning) 방법은 재훈련이나 과도한 파인튜닝에 의존해 비용이 크고, 관련 지식까지 파괴할 위험이 있다. ZeroUnlearn은 민감 지식을 특정 입력에 대해 안전한 상태로 재매핑하고 원래 표현을 직교적으로 제거하는 프레임워크로, few-shot 설정에서 빠르고 정밀한 unlearning을 가능하게 한다.

HF Daily Papers1달 전· 2달 전 발행

NSF Awards에서 2.8M 주장과 조사 제안 추출 데이터셋 구축

대규모 과학 주장 데이터셋은 주장 검증, 발견 추적, 메타과학 연구를 가능하게 한다. Grant abstracts를 새로운 소스로 활용해 기존의 작은 데이터셋 중심 연구의 한계를 넘어선다.

HF Daily Papers1달 전· 2달 전 발행

상태에 맞춰 기억을 꺼내 쓰는 외부 메모리로 긴 추론을 효율화

긴호라이즌 에이전트의 의사결정은 과거의 정보가 시점에 따라 다르게 필요해진다. SAM은 메모리 큐를 통해 현재 상태에서 필요한 과거 정보를 선택적으로 회상하고, 원시 trajectory 페이지를 외부에 보관함으로써 백본 모델의 재학습 없이도 긴 히스토리를 재구성한다. 이로써 정보의 재현성과 적시성 사이의 균형을 달성하고, 추론 정확도와 효율성을 높인다.

HF Daily Papers1달 전· 2달 전 발행

환경 노이즈를 커리큘럼으로 다루어 에이전트의 견고성을 실전 수준으로 끌어올림

실세계 환경은 불확실하고 동적이다. 기존 학습은 이상적인 설정에 의존하는 경향이 있어 배치된 노이즈에 취약하다. 본 연구는 노이즈를 의도적으로 도입하는 학습 프레임워크(NoisyAgent)를 통해 사용자 노이즈와 도구 노이즈에 강인한 의사결정과 일반화 능력을 향상시킨다.

HF Daily Papers1달 전· 2달 전 발행

장편 시네마틱 리메이크에서 캐릭터 일관성과 내러티브를 지키는 다중 에이전트 프레임워크

장편 영상은 수백에서 수천 샷에 걸친 긴 시퀀스로, 샷 간 아이덴티티 drift와 배경 변화로 인한 일관성 손실이 누적되기 쉽다. Soap2Soap은 Dual-Bridge Consistency로 언어-시각 간 상호작용을 안정화하고, grid-based keyframe 생성 및 검증 루프를 통해 수백 샷 규모의 리메이크에서도 캐릭터 식별과 내러티브를 유지한다.

HF Daily Papers1달 전· 2달 전 발행

텍스트/이미지/오디오/비디오를 하나의 벡터로 매핑하는 네이티브 멀티모달 임베딩

Gemini Embedding 2는 텍스트, 이미지, 비디오, 오디오를 하나의 연합 표현 공간에 매핑한다. 멀티태스크 다단계 학습과 네이티브 멀티모달 이해를 통해 unimodal, cross-modal, multimodal 벤치마크에서 SOTA를 달성하며, RAG, 검색/추천 등 엔터프라이즈 애플리케이션에 직접 적용 가능성을 제시한다. 또한 네이티브 오디오 입력이 ASR 기반 파이프라인보다 검색 성능을 향상시키는 것을 실험적으로 입증한다.

HF Daily Papers1달 전· 2달 전 발행

대화량을 줄여도 정확도 상승—DarkForest의 제어된 다에이전트 협력

다중 에이전트 LLM 시스템은 에이전트 간의 상호 작용을 통해 추론 품질을 높일 수 있지만, 과도한 정보 교환은 오류 전파와 토큰 비용 증가를 야기한다. DarkForest는 정보 교환을 정책적으로 제한하고, 독립적으로 생성된 후보를 보정된 신념 상태로 합산해 최종 의사결정을 수행하는 구조를 제안한다. 이를 통해 정확도는 높이고 토큰 소비는 크게 감소시킨다.

HF Daily Papers1달 전· 2달 전 발행

Latent 공간에서의 Clean-Latent 예측으로 FID-50K 2.50 달성

고정된 FLUX.2 VAE 잠재 표현에서 타깃 예측의 기하학적 차이가 학습 난이도와 생성 품질에 직접 영향을 준다. x, ϵ, v 간의 선형적 관계가 존재하나 finite-capacity 모델은 타깃의 기하학에 따라 회귀 문제의 난이도와 샘플링 효율이 다르게 나타난다. 이 연구는 latent diffusion에서도 타깃 지향이 단순한 algebraic 재표현이 아님을 보이며, 동일 표현 공간에서의 예측 타깃 설계가 성능에 큰 차이를 만든다는 점을 제시한다.

HF Daily Papers1달 전· 2달 전 발행

다중 모달 사회 추론에서 발화 grounding 자동 검증 프레임워크 QUACK 공개

현대 LLM/VLM 에이전트의 대화는 관측 정보와 행동에 근거해야 한다. 기존 연구는 주로 최종 게임 결과에 의존하거나 텍스트 기반 평가에 머물며 발화의 grounding을 자동으로 점검하지 못한다. QUACK은 엔진 로그로 재구성된 ground-truth 트래젝토리리를 바탕으로 발화의 주장들을 검증하고, 공간적 환각, 근거 없는 고발, 속임수 붕괴, 언어-행동 불일치 같은 grounding 실패를 자동으로 측정한다.

HF Daily Papers1달 전· 2달 전 발행

궤적 단계 환각 진단으로 산업 에이전트 신뢰성 강화

대형 언어 모델이 자율적 에이전트로 작동하는 환경에서, 최종 산출물만 평가하는 기존 벤치마크는 중간 단계에서 발생하는 환각을 놓친다. Trajel은 Thought-Action-Observation 트레이스를 기반으로 다섯 가지 환각 유형을 정의하는 체계를 제시하고, 225개 궤적의 expert-annotated 데이터와 LLM-판정자 및 인간 평가자 간의 일치도를 통해 궤적-수준 평가의 필요성을 입증한다. 또한 실행-품질 신호(예: 명확성/정당화)가 단일 분류기보다 환각 예측에 더 강력하다는 실증을 제공한다.

HF Daily Papers1달 전· 2달 전 발행

약 10B 활성화 파라미터로 프런티어 시스템과의 성능에 근접

대형 언어 모델의 긴 컨텍스트와 실환경 task에 대한 효율성과 확장성 문제를 해결하기 위해, 미니 활성화 원칙을 채택한 MoE 기반 M2 시리즈를 제안한다. 에이전트-주도 데이터 파이프라인과 Forge RL 시스템, 그리고 자율 디버깅에 이르는 self-evolution으로 10억 단위의 활성화 파라미터에도 불구하고 에이전트 코딩, 협업 작업, 추론 및 지식 벤치마크에서 프런티어에 근접한 성능을 달성한다.

HF Daily Papers1달 전· 2달 전 발행

Scale vectors의 미세 파라미터가 LLM pre-training에 큰 영향을 준다

Normalization 레이어는 학습의 안정성을 제공하지만 scale vectors의 역할은 불분명했다. 본 연구는 scale vectors가 expressivity를 늘리기보다 Pre-Norm 아키텍처에서 self-amplifying preconditioning으로 학습을 가속한다는 이론적·실험적 근거를 제시한다. 또한 Input-Norm과 Output-Norm 간의 weight decay 차이를 보이고, heterogeneity, placement, reparameterization의 세 가지 경량 개선으로 다양한 설정에서 터미널 손실을 낮추고 확장성을 향상시킨다.

HF Daily Papers1달 전· 2달 전 발행

브랜치 간 정보 공유로 중복 탐색을 줄이고 정확도-지연 파레토를 개선

병렬로 다수의 추론 브랜치를 실행하는 Test-Time Scaling에서 브랜치 간 정보가 공유되지 않으면 중복 탐색이 증가한다. CPT는 진행 중인 브랜치의 정보를 deduplicated pool에 모아 입력 컨텍스트로 broadcast하고, 각 브랜치가 다른 브랜치의 발견 정보를 재사용하도록 한다. 실험에서 CPT는 HMMT24/25, AIME24/25/26에서 강한 accuracy–latency Pareto frontier를 보인다.

HF Daily Papers1달 전· 2달 전 발행

숨겨진 비판 벡터로 오류를 감지해 최종 정답 회복

대형 추론 모델은 CoT의 오류를 수정하는 능력을 보이나, 단순한 backtracking을 넘어서는 은밀한 내부 메커니즘이 존재한다. 이 연구는 arithmetic 오류를 주입한 뒤 모델의 내부 상태를 분석해 hidden critique ability를 확인하고, latent space의 critique vector를 추출하여 모델의 오류 탐지 및 수정 능력을 이해한다. 또한 critique 벡터를 이용한 steerings가 테스트-타임 스케일링과 오류 수정 성능을 무추가 학습 비용으로 향상시킨다는 점을 보인다.

HF Daily Papers1달 전· 2달 전 발행

Reward-Tilted 분포 매칭으로 4-step 이미지 생성 품질을 대폭 향상

소수 단계 diffusion/flow 기반 생성기에서 인간 선호를 반영하기 어렵다. 기존 방법은 교사 분포와 인간 보상의 간극을 효과적으로 맞추지 못했고, 중간 시간단계의 노이즈와 이동 타깃 문제로 학습 신호가 불안정했다. RTDMD는 distribution matching과 reward 최적화를 하나의 프레임워크로 결합해 학습 안정성과 샘플 품질을 동시에 개선한다.

HF Daily Papers1달 전· 2달 전 발행

스키마 기반 NLQ로 공공 교통안전 데이터 접근성 확대

NL 인터페이스와 GIS 기반 운송안전 데이터의 신뢰 가능하고 재현 가능한 상호작용이 필요하다. 제안된 스키마-기반 실행과 규칙 기반 검증 레이어는 해석 단계와 실행 단계 사이의 경계를 명확히 하여 재현성 및 감사추적성을 보장하고 공공부문 AI 거버넌스를 강화한다. 또한 현장의 학교·시의회·주민 단체 등 다양한 이해관계자들이 비전문적으로도 안전 데이터를 활용할 수 있도록 한다.

HF Daily Papers1달 전· 2달 전 발행

LLM이 코딩으로 GUI 환경을 합성해 대규모 벤치마크를 구축

ScaleWoB는 GUI 에이전트 평가와 학습을 위한 백엔드-프리 URL 기반 환경과 자동 보상 검증기를 제공한다. 이를 통해 대규모 태스크와 플랫폼 간 벤치마크를 가능하게 하며, 실험에서 현재 에이전트의 평균 SR은 27.92%로 인간 92.08%와의 큰 차이를 보였다. 이 격차는 장기 상호작용과 정교한 제어 능력의 개선 여지가 큼을 시사한다.

HF Daily Papers1달 전· 2달 전 발행

장기 이벤트 스트림과 다중 서비스·다기기 인터페이스를 아우르는 상시 개인 비서 벤치마크

에이전트의 작동 범위를 장기 히스토리와 다중 백엔드 서비스, 다기기 인터페이스로 확장하면 현실 세계의 노이즈를 포함한 복잡한 디지털 환경에서의 의도 추론과 조치 수행 능력이 평가된다. Claw-Anything는 200개의 평가 태스크와 2,000개의 훈련 환경을 자동 생성하는 파이프라인을 제공하고, 이를 통해 현재 최첨단 모델이 광범위한 맥락에서 얼마나 잘 작동하는지 측정한다. 또한 1,500개의 성공 trajectories로 Qwen3.5-27B를 파인튜닝하면 Pass@1이 약 23.7% 포인트 개선되는 것을 확인했다.

HF Daily Papers1달 전· 2달 전 발행

다국어 시맨틱 브리지를 활용한 Sparse Retrieval의 제로샷 및 파인튜닝 성능 향상

Sparse encoders는 단어의 중요도를 어휘 공간에 고정해 표현하는 특성상 영어 중심 구조임. 타언어에서 토큰이 충분히 존재하지 않으면 표면적 매칭만으로는 의미를 잘 포착하기 어렵다. SemBridge는 multilingual dense embeddings를 브리지로 삼아 source/target 어휘 간 시맨틱 정합을 수행하고, 남은 타깃 토큰을 핵심 동의어들로 구성된 희소 가중합으로 초기화하여, 타격이 큰 노이즈를 제거하고 타깃 언어로의 이전을 안정적으로 수행한다. 이로써 제로샷에서도 성능이 개선되고, 파인튜닝 시 수렴 속도와 효율이 증가한다. 또한 다섯 언어 Arabic, Chinese, Hindi, Korean, Russian에서 4가지 sparse 모델에 대해 일관된 향상을 보였다.

HF Daily Papers1달 전· 2달 전 발행

쓰기가 6× 빨라지고 LongMemEval-S에서 79.8% 정답률을 달성하는 MemForest

대형 언어 모델 에이전트의 장기 컨텍스트 기억은 기존 시스템의 전체 재쓰기와 직렬 의존으로 인해 확장성에 한계가 있다. MemForest는 parallel extraction과 MemTree를 통해 쓰기 경로를 분해하고, Temporal Scope를 MemTree로 계층화하여 지역적 업데이트를 가능하게 한다. 이로써 기억의 유연성/정확도와 시스템의 처리량 사이의 트레이드오프를 개선한다.

HF Daily Papers1달 전· 2달 전 발행

긴 비디오 이해를 위한 병렬 도구 호출 RL 프레임워크

긴 비디오 이해에서 도구 호출은 증거를 빠르게 모으는 핵심 방법이지만, 프리트레인 도구 priors가 RL 초기에 포맷 불안정과 도구 탐색의 급진적 증가를 유발한다. ParaVT는 단일 턴에 여러 창을 병렬로 평가하는 구조로 맥락 손실을 줄이고, 프레이밍 문제를 안정화하며, 도구 사용의 실제 가치가 충분히 보상되도록 설계된다. 이로써 긴 비디오 기반 추론에서의 효율성과 정확성을 함께 높인다.

HF Daily Papers1달 전· 2달 전 발행

3D Cache로 360° 영상의 디지털 트윈 생성을 정밀 제어

완전한 디지털 트윈을 위한 고정확도 시뮬레이션은 3D 기하 일관성과 장기 시간 축의 컨트롤이 필수다. 기존의 perspective 기반 영상 생성은 FoV 제한으로 인해 시공간 간 불일치가 누적되지만, Pantheon360은 360° 입력에서 3D Cache를 활용해 기하를 확고히 제어하고 diffusion은 텍스처 합성에 집중한다. 이로써 전역 기하 일관성과 텍스처 품질을 동시에 달성한다.

HF Daily Papers1달 전· 2달 전 발행

FPS 월드 모델의 0샷 일반화, per-pixel Conditioning으로 범위 분리

FPS 게임은 프레임마다 고주파의 복합 제어 신호를 필요로 한다. 기존 월드 모델은 글로벌 conditioning으로 모든 픽셀에 동일한 액션이 주입되어 in-scope 지역에서의 디테일이 손상되거나 불안정해진다. SCOPE은 각 트랜스포머 블록에 per-pixel conditioning 모듈을 삽입하고, Discrete 이벤트를 in-scope로 국소화하는 cross-attention과 Continuous 제어를 out-of-scope의 안정적 생성을 위한 시퀀스 모델링으로 분리한다. CrossFPS 데이터셋으로 다중 게임에서 zero-shot 일반화를 달성한다.

HF Daily Papers1달 전· 2달 전 발행

다음 가속 스케일 예측으로 극단적 undersampling에서도 선명한 MRI 재구성

MRI 재구성은 데이터가 불충분할 때 ill-posed 문제다. 고가속도 조건에서 픽셀 단위 예측은 고주파 해상 정보를 흐리게 만드는 경향이 있다. 본 연구는 reconstruction을 discrete multi-scale latent space로 옮기고, next-acceleration-scale 예측으로 해결 공간을 제약하여 extremely sparse measurements에서도 선명한 해상 유지가 가능하다고 보인다. Discrete latent formulation은 LLM의 토큰 예측과도 자연스러운 연결고리를 제공한다.

HF Daily Papers1달 전· 2달 전 발행

실시간으로 실행 가능한 UI를 생성하는 Generative UI로 개인 에이전트의 대화를 혁신

Plain-text 대화는 정보 수집, 옵션 비교, 확인 등 복잡한 상호작용에서 인지 부담과 대화 길이를 증가시킨다. Generative UI는 대화 맥락에서 적합한 UI를 실시간으로 합성해 정보를 수집하고 의사결정을 간소화한다. 본 연구는 A2UI 프로토콜을 기반으로 대규모 Generative UI 코퍼스를 구축하고 벤치마크와 학습 파이프라인을 통해 실행 가능한 UI 생성을 학습한다.

HF Daily Papers1달 전· 2달 전 발행

Shannon 법칙으로 LLM의 스케일링 한계를 밝힌다

대형 언어 모델의 성능은 데이터와 모델 간의 신호 대 잡음비(SNR)에 의해 결정된다. 기존의 monotonic scaling 법칙은 카도치한 현상인 손실 베이스와 양자화로 인한 저하를 설명하지 못한다. Shannon Scaling Law는 모델 크기(N)와 학습 토큰 수(D)의 상호작용에서 발생하는 비선형 손실 패턴을 설명하고, SNR가 충분하지 않을 때는 규모 확장이 오히려 성능 저하를 유발할 수 있음을 보인다. 이로써 정보 밀도와 SNR 최적화를 중점에 두는 설계 방향이 필요하다는 시사점을 제공한다.

HF Daily Papers1달 전· 2달 전 발행

Latent를 픽셀 확산으로 디코딩해 4K까지 초고속 고품질 이미지를 실현

Latent-to-pixel 디코딩에서 기존 VAE 디코더는 재구성 중심으로 세부 표현에 한계가 있으며, 해상도가 커질수록 품질 저하가 두드러진다. PiD는 latent conditioning과 pixel diffusion를 결합해 디코딩과 업샘플링을 하나의 모듈로 통합하고, 4× 및 8× 업샘플링에서 낮은 지연과 더 우수한 시각 품질을 달성한다. 또한 semantic latents(DINOv2, SigLIP)에도 적용 가능하고, DMD2를 통한 4스텝 추론으로 효율이 크게 향상된다.

HF Daily Papers1달 전· 2달 전 발행

질문 조건부 이미지 편집으로 Pass@1를 평균 약 4.8포인트 향상

다중모달 대형언어모델은 시각적 추론 능력을 향상시키는 점에서 진전을 보였으나, 텍스트 체인-오브-생각만으로는 미세한 시각 변화나 시점 전이를 필요로 하는 문제를 해결하기 어렵다. ETCHR은 질문에 조건화된 전문 이미지 편집기와 추론 유용성 검증을 결합해 편집의 품질과 추론의 정확도를 함께 향상시키며, 이해 모델의 재학습 없이도 다양한 오픈/클로즈드 소스 MLLMs에 연결 가능하도록 한다. 이를 통해 다섯 가지 문제 계열에서 일관된 성능 향상을 달성한다.

HF Daily Papers1달 전· 2달 전 발행

외부 스킬 문서를 통해 무가중치 업데이트로 에이전트 성능을 지속적으로 개선

현대 프런티어 LLM 에이전트에서 스킬은 파라미터를 조정하는 대신 외부 텍스트 문서로 관리된다. 이러한 스킬은 도메인 적응에 취약하고 실행 해 harness 간 일반화가 어려운 경우가 많다. SkillOpt는 텍스트-공간에서 스킬을 최적화하여 가중치 업데이트 없이도 성능 향상을 가능하게 하며, 모델 규모나 실행 환경에 관계없이 재사용 가능한 best_skill.md를 산출한다.

HF Daily Papers1달 전· 2달 전 발행

RLHF로 ASR/TTS/Realtime를 하나의 모델에서 실현

음성-언어를 하나의 멀티모달 표현 공간으로 매핑하고 운용-regime를 데이터/목표/디코딩 제약으로 분리한다. RLHF 중심의 정렬과 특정 디코딩 기법으로 ASR, TTS, Realtime의 서로 다른 배포 목표를 하나의 백본에서 달성하며, SOTA 성능과 효율성을 동시에 달성한다.

HF Daily Papers1달 전· 2달 전 발행

자기조절 시뮬레이티브 계획으로 에이전트 추론 효율성 극대화

에이전트의 긴 수평 계획은 성능 향상에 필요하지만 비효율적일 수 있다. 본 연구는 삼중 시스템(I/II/III)으로 의사결정의 계획 존재 여부와 깊이를 학습적으로 조절해 불필요한 deliberation을 줄이고 일반화 가능한 시뮬레이티브 계획 구조를 제시한다. SR2AM은 LLM을 월드 모델로 활용해 도메인별 엔지니어링 없이도 다양한 문제에서 효과적으로 작동한다.

HF Daily Papers1달 전· 2달 전 발행

Hard 문제에서 세밀한 크레딧 할당으로 LLM 추론 능력을 향상시키는 SCRL

RLVR의 희박한 보상 문제를 극복하기 위해 hard 문제를 verifiable subproblems로 분해하는 SCRL을 제안한다. 하위 문제는 verifiable한 해답이 있어 학습 신호를 촘촘히 제공하고, 롤아웃 중간 단계의 진행을 크레딧으로 반영한다. 여덟 벤치마크에서 GRPO 대비 일관된 성능 향상을 보여주며, 난이도가 커질수록 얻는 이득이 커진다.

HF Daily Papers1달 전· 2달 전 발행

Vision-Language 모델과 고해상도 기하 표현으로 시뮬레이션-준비 3D 자산을 한 번에 생성

기존의 3D 생성 방법은 물리 속성이나 카테고리 다양성의 포괄에 한계가 있다. PhysX-Omni는 VLM 기반의 글로벌-로컬 추론과 고해상도 기하 표현을 도입하여 시뮬레이션에 바로 투입 가능한 자산을 생성하고 PhysXVerse 데이터셋과 PhysX-Bench를 통해 물리 속성·절대 스케일·운동학 등을 실제 조건에서 평가할 수 있게 한다. 이로써 embodied AI 및 로봇 시뮬레이션 분야의 파이프라인 확장을 가능하게 한다.

HF Daily Papers1달 전· 2달 전 발행

RLVR 업데이트의 토큰 크레딧 할당에 구분 신호를 도입

RLVR은 응답 수준의 보상으로 학습이 이뤄지나 토큰 차원의 확률 변화는 불투명하다. 표준 시퀀스-레벨 RLVR은 양측 중심을 평균으로 만들어 공통 패턴에 의해 구별력이 약해질 수 있다. DelTA는 토큰 그래디언트 방향의 구별 신호를 강화해 희소하지만 주목할 만한 방향을 더 잘 살리는 토큰 가중치를 학습에 반영한다.

HF Daily Papers1달 전· 2달 전 발행

Group Autoregressive Transformer로 온라인·오프라인 기하학 인식의 통합 달성

기하학 인식은 센서 관찰로부터 Dense 3D 구조를 추정하는 문제지만, 온라인/오프라인, 다중 모달, 긴 시퀀스, metric-scale를 각각 다루는 독립적 프레임워크들로 분절되어 왔다. 이 논문은 Group Autoregressive Transformer라는 통합 프레임워크를 제시하고, 그룹 단위의 자동회귀를 통해 서로 다른 뷰 구성과 모달리티를 하나의 일관된 파이프라인으로 결합한다. 또한, anchor-free Relational Modeling과 큐-스타일 KV 캐싱으로 긴 시퀀스의 메모리·연산 비용을 억제하고, Scale-Adaptive Geometry Loss로 metric-scale 일반화를 점진적으로 회복한다. 이로써 7개 대표 태스크에 걸친 10개 벤치마크에서 Unified Geometry Perception를 달성한다.

HF Daily Papers1달 전· 2달 전 발행

노이즈 중간 latent에 대한 가치 모델을 한 번의 스티칭으로 대규모로 전이

diffusion/flow 기반 생성모델은 프롬프트 적합성이나 미적 선호도 같은 보상에 맞춰 조정되기 어렵다. 보상은 일반적으로 깨끗한 이미지에 대해 정의되고, 노이즈가 있는 latent에서의 가치 평가가 필요하다. Tweedie 또는 Monte Carlo 접근은 편향 혹은 비용 이슈를 동반한다. StitchVM은 pixel-space reward models를 노이즈 latent으로 이식해, 고정된 head와 작은 finetuning으로 보상 모델의 강점을 그대로 유지하면서 latent 공간에서의 정렬을 가능하게 한다.

Weight Drift로 촉발된 활성화 sparsity와 스파이크를 실험적으로 규명하는 연구

손실 함수와 활성화 함수의 상호작용으로 가중치 드리프트가 발생하고 이로 인해 활성화가 희소해지며, 트랜스포머 계열에서도 예측 품질과 연산 효율성 간의 트레이드오프를 형성한다. 초기 학습 단계의 dynamics가 모델 성능에 큰 영향을 미치고, non-centering normalization이 이 현상을 어떻게 강화하는지 규명한다.

HF Daily Papers1달 전· 2달 전 발행

Z3 검증과 적대적 강화로 frontier LLM의 논리추론 한계 정밀 진단

대형언어모델의 논리추론은 주어진 전제에서 결론이 반드시 도출되어야 하는 규칙적 추론이다. 기존 벤치마크는 템플릿 의존성이나 불충분한 형식 주석으로 인해 실제 추론 능력을 왜곡할 수 있다. LLMEval-Logic은 현실적 시나리오를 기반으로 forward authoring과 Z3 검증, 전문가 루브릭을 결합하고, 5단계의 adversarial hardening 워크플로우를 통해 frontier 모델의 한계를 보다 명확하게 구분한다.

HF Daily Papers1달 전· 3달 전 발행

무라벨 인터넷 비디오에서 GUI 궤적 합성으로 에이전트 일반화 강화

GUI 에이전트의 일반화 능력은 훈련 데이터의 규모와 다양성에 크게 의존한다. 본 연구는 unlabeled Internet videos에서 GUI 상호작용 궤적을 자동으로 추출하는 Video2GUI 파이프라인을 제안하고, 이를 통해 WildGUI 데이터셋을 구축하여 GUI grounding 및 에이전트 벤치마크에서 일관된 성능 향상을 달성한다. 12.7M GUI 운용 궤적과 124.5M 스크린샷으로 구성된 대규모 데이터는 다양한 애플리케이션과 웹사이트를 포괄한다.

훈련 없이 무한 프레임으로 긴 비디오의 일관성 확보

긴 비디오 생성에서 프레임 간 일관성을 유지하는 것이 핵심 문제다. 제안하는 MIGA는 Two-Stage Training-Inference Alignment(TTA)와 Dual Consistency Enhancement(DCE)을 통해 training과 inference 간 노이즈 스팬 차이를 줄이고, 초기 고노이즈 프레임의 자기 반영과 후반 프레임의 장거리 가이던스로 장기 일관성을 강화한다. VBench와 NarrLV에서 state-of-the-art 성능을 확인했다.

HF Daily Papers1달 전· 2달 전 발행

지각-동작 루프를 닫는 구현형 공간 지능 벤치마크

본 연구는 고정 관찰만으로는 해결하기 어려운 공간 지능 문제를 다루며, 에이전트가 필요에 따라 관찰을 선택하고 몸체를 활용해 정보를 적극적으로 수집하도록 요구한다. 3D grounding의 이점은 깊이-가시성 이슈가 해소될 때 크게 나타나지만, 불완전한 3D 재구성은 오히려 성능을 악화시킨다. 인간과 모델 간의 메타인식 차이를 밝히고, embodied 시스템의 안전성과 신뢰성 진단에 기여한다.

HF Daily Papers1달 전· 3달 전 발행

고차 토폴로지로 학습 없이 MoE 압축의 한계를 돌파한다

Sparse MoE 계층에서 토큰은 소수의 전문가를 통해 처리되며, pairwise 신호만으로는 세 전문가가 함께 merge될 때의 Irreducible Cycle을 포착하기 어렵다. 이 논문은 simplicial Laplacian의 harmonic 커널을 이용해 고차 mergeability 잔류를 식별하고, 학습 없이도 상위 계층 압축성능(frontier)을 개선하는 HodgeCover를 제시한다. Qwen 계열과 OLMoE 같은 공개 체크포인터에서 66% expert reduction 시에도 벤치마크를 능가하며, 66%에서 Qwen 3.5-35B-A3B의 DS-Avg가 STUN+Wanda 대비 +12.6pp 향상을 달성한다. 학습-free 파이프라인과 Stage-2 Wanda의 결합은 두 축의 압축을 직교적으로 활용한다.

HF Daily Papers1달 전· 2달 전 발행

에이전트가 자율로 하이브리드 아키텍처를 탐색·구현

LLM 에이전트가 프런티어 연구를 수행하는 능력을 검증하는 RSI 연구로, predefined 프리미티브의 조합을 넘어서는 자율 아키텍처 탐색과 저수준 설계의 가능성을 제시한다. 1B 규모에서의 성능 우위, 스케일-대-효율성 프런티어의 발견, 그리고 LRA/Autoresearch 벤치에서의 실용적 개선이 보고된다.

HF Daily Papers1달 전· 2달 전 발행

Pruning으로 드래프트를 줄이고 retrieval으로 보완해 속도와 MAT를 동시에 끌어올린다

동적 깊이 prune은 드래프트 비용을 낮추지만 MAT를 떨어뜨려 Pareto frontier를 굳건히 만든다. Graft는 pruning으로 해방된 예산을 retrieval으로 보충해 동일 예산에서 후보 범위를 확장하고, lossless한 검증 경로를 유지하며 짧은 컨텍스트와 긴 컨텍스트 양쪽에서 실용적 속도 향상을 달성한다. 대형 모델에서의 평균 속도 up to 5.41×를 기록하고, Qwen3-235B에서 EAGLE-3 대비 평균 속도 향상을 최대 21.8% 달성했다. 또한 LLaMA3.1-8B의 장-context에서 3.22×의 평균 속도를 달성하고 Qwen3-14B에서 EAGLE3-64K 대비 16.6%를 넘었다. DFlash와의 확장 가능성에 대한 초기 탐색도 제시한다.

HF Daily Papers1달 전· 3달 전 발행

잠재 공간에서 변화 마스크를 샘플링으로 생성해 글로벌 일관성과 불확실성 포착

이 논문은 per-pixel discriminative 접근이 가진 지역적 일관성 결여와Ambiguity의 한계를 지적한다. ChangeFlow는 Change Detection을 latent space에서의 마스크 합성 문제로 재정의하고, 샘플링 기반 다중 예측으로 불확실성을 표현하며 전역적 일관성을 확보한다. SYSU, LEVIR, CLCD, OSCD 등 4개 벤치마크에서 평균 F1 80.4%를 달성해 기존 최강 방법 대비 1.3p 향상을 보이고, 추론 속도도 최근 강력한 기반 모델과 비슷한 수준으로 유지된다.

HF Daily Papers1달 전· 2달 전 발행

실행 가능한 PF로 에이전트의 실패를 즉시 바로잡는 HASP 프레임워크

텍스트로 제시된 스킬은 조언 수준에 머물고 정책 루프에 실제로 개입하는 실행 가능 인스트루먼트로 작동하지 않는다. HASP는 스킬을 Program Functions(PFs)로 변환해 인퍼런스 시점, 이후(post-training), 또는 자기 개선(self-improvement) 시점에 실행 개입을 수행하도록 구성한다. 이를 통해 에이전트의 실패 패턴을 런타임에 수정하고, PF 기반의 피드백을 통해 학습 루프를 강화한다. 웹 검색, 수학 추론, 코딩 등 다양한 도메인에서 기법의 유효성을 보이며, PF-선별과 라이브러리 진화를 통해 지속적 개선이 가능하다.

HF Daily Papers1달 전· 2달 전 발행

SpatialBench가 제시하는 cross-paradigm 벤치마크로 공간 3D 모델의 일반화 한계와 설계

공간 재구성/지오메트리 추정 모델은 다양한 downstream 작업과 viewpoints에서의 일반화 능력이 핵심이다. 기존 평가가 특정 도메인과 짧은 시퀀스에 국한되면서 실제 응용 환경의 도메인 간 편향을 충분히 드러내지 못한다. SpatialBench는 19개 데이터셋과 546씬, 41모델, 6 Paradigms를 포괄하며 deterministic sampling으로 재현 가능한 교차-패러다임 비교를 가능하게 한다. 이를 통해 데이터 품질, 도메인 매칭, 입력 밀도에 따른 성능 차이를 체계적으로 분석하고, DA-Next-5M 데이터와 DA-Next 모델이 embodied/egocentric 도메인에서의 OOD 문제를 어떻게 해소하는지 제시한다.

HF Daily Papers1달 전· 2달 전 발행

Box를 한 번의 패스로 디코딩해 속도 2.5× 향상

비전-언어 모델에서 좌표를 순차적으로 생성하는 기존 방식은 박스 기하 구조의 제약을 포착하기 힘들고 추론 지연이 크다. LocateAnything은 bounding box를 atomic unit으로 간주하는 Parallel Box Decoding(PBD)을 도입해 박스 간 기하적 일관성을 유지하면서 병렬 디코딩의 속도를 대폭 끌어올린다. 또한 LocateAnything-Data를 통해 138M 질의의 대규모 다-domain 학습 데이터를 확보해 고정밀 로컬라이제이션 성능을 크게 강화한다.

HF Daily Papers1달 전· 2달 전 발행

기하학 인지 표현 공간에서의 노이즈 제거로 3D 재구성의 강건性 강화

다중 뷰 3D 재구성은 degraded 입력에서 성능이 크게 떨어진다. 기존 복원은 이미지 공간이나 VAE 기반 잠재 공간에 의존해 cross-view 기하 일관성을 크게 유지하기 어렵다. GARD는 기하학 인지 표현 공간에서 확산 기반 노이즈 제거를 수행해 3D 기하와 색상 이미지를 함께 회복하고, cross-view 일관성을 유지한 채 강건한 재구성을 실현한다.

HF Daily Papers1달 전· 2달 전 발행

Minute-scale 오디오-비주얼 생성의 통합 평가 벤치마크

짧은 클립 중심의 평가에서 벗어나 분 단위의 오디오-비주얼 생성은 지속적인 정체성 유지, 내러티브 흐름, 오디오-비주얼 동기화를 요구한다. LongAV-Compass는 텍스트/이미지/비디오 입력을 아우르는 Unified X2AV 평가 체계를 제시하고, 284개 테스트 케이스로 긴 형식에서의 실패 모드와 한계점을 진단한다. GEMINI 3.1 Pro 기반의 MLLM 평가와 DINO-v2, CLIP, ImageBind 등 다중 모달 지표를 결합하여 다차원적인 진단을 가능하게 한다.

HF Daily Papers1달 전· 2달 전 발행

0.85M 파라미터 이하 경량 모니터로 안전 모니터링의 효율-성능 최적화

Diffusion LLM은 다단계 denoising 경로에서 중간 은닉 상태에 안전 관련 정보를 담고 있어 단일-스텝 모니터링으로 포착하기 어려운 신호가 존재한다. 본 연구는 hesitation 지표를 활용한 bi-level 모니터(D2-Monitor)를 제안하고, 테스트 시점에 계산 자원을 효율적으로 배치하기 위해 hesitation severity가 임계치를 넘을 때만 고복잡도 프로브로 escalation하는 구조를 제시한다. 실험에서 3개 데이터셋, 4개 D-LLM에 대해 파라미터 풋프린터가 ≤0.85M인 경량 모니터가 최적의 효과-효율 트레이드오프를 달성한다.

HF Daily Papers1달 전· 2달 전 발행

VLM 추론으로 sparse 입력에서 물리적 동작까지 보강하는 모션 컨트롤 비디오 생성

본 연구는 입력이 희소하고 부정확한 상황에서도 물리 법칙과 상호작용을 반영한 영상 생성을 가능하게 한다. VLM 기반의 추론으로 입력을 보강하고, 2차 동작과 충돌 등의 의도된 결과를 더 현실적으로 만들어 품질과 신뢰성을 높인다.

HF Daily Papers1달 전· 2달 전 발행

전문가 보정된 파이프라인 기반 평가로 영화급 비디오 품질을 측정

시네마틱 품질 평가는 프롬프트를 얼마나 잘 따르는지보다 않는 요소인 미학·연출·감정의 수준에 좌우된다. 기존 벤치마크는 주로 프롬프트 준수 여부를 측정해 ‘right’를 다루지만, 실전 영상 제작의 핵심인 ‘goodness’에 관한 신호를 놓친다. EvalVerse는 파이프라인 관점의 체계적 분류와 전문가 보정으로 신뢰 가능한 평가 신호를 제공하고, 멀티샷/오디오-비주얼 통합 등 복합 시나리오를 다룰 수 있는 생태계를 구축한다.

HF Daily Papers1달 전· 2달 전 발행

고주파 디테일 보존을 위한 Sobolev 정렬 기반 SR

이미지 초해상화에서 생성 priors는 고주파 디테일의 재현을 해치며, 평면적(ℓ2) 노이즈 가정은 자연 이미지의 주파수적 특성과 불일치를 초래한다. 본 논문은 Sobolev Spectral Rectification으로 노이즈를 컬러링하고, Adversarial Manifold Guidance로 현실적 아티팩트를 대상으로 하는 정보를 학습 신호로 활용하여 faithful한 구조적 디테일과 스펙트럴 일치를 달성하고, Downstream 태스크에서도 성능 향상을 보인다.

HF Daily Papers1달 전· 2달 전 발행

대역폭 제약 속에서도 정책과 통신을 분리하는 SLIM 제안

MARL 시스템은 부분 관찰 환경에서 협력적 성능을 목표로 하지만 실제 네트워크 대역폭 제약은 메시지 규모와 빈도를 제한한다. 기존 접근은 메시지 차원을 줄이면 정책 latent 공간도 함께 축소되어 성능 저하가 발생하는 한계를 가진다. 본 연구는 통신 경로를 정책 입력에서 분리하고 β라는 표준화된 대역폭 예산을 도입하여 대역폭 제약 하에서도 협력을 유지하는 방법을 제시한다. 이로써 높은 대역폭에서도 최첨단 성능을 달성하고, 대역폭이 감소하더라도 로버스트한 성능을 보인다.

HF Daily Papers1달 전· 2달 전 발행

포장 손상 픽셀 수준 정밀 측정—인스턴스 세분화로 가능

포장 손상은 얇고 분지형이며 비선형적인 균열로 구성되어 바운딩 박스만으로는 기하학적 특성을 충분히 포착하기 어렵다. 픽셀 수준 세분화는 균열 면적 추정 및 형태 분석에 필요한 정밀 정보를 제공하며, 현장 도로 이미지에서 다중 손상 클래스를 한 번에 로컬라이즈하고 마스크를 통해 면적을 계산할 수 있다. 본 연구는 네 가지 손상 클래스(longitudinal, transverse, alligator, pothole)에 대해 Polygon 라벨로 주석된 UWGB-STREETCRACK 데이터를 사용해 Mask R-CNN 기반의 엔드투엔드 파이프라인의 실용성을 평가한다.

HF Daily Papers1달 전· 3달 전 발행

Prototype-Guided MIL로 로그 이상 탐지와 인스턴스 로컬라이제이션 강화

대규모 로그 시스템에서 인스턴스 단위 라벨링은 비용이 많이 든다. MIL은 가방 단위 레이블로 학습할 수 있지만, 노이즈·고주파 패턴에 의한 로컬라이제이션 오염과 해석의 불투명성이 남는다. 본 연구는 prototype와 counterfactual perturbation를 도입해 로컬라이제이션의 신뢰성과 해석 가능성을 높여 실무 적용 가능성을 높인다.

HF Daily Papers1달 전· 2달 전 발행

다중 타임스케일 PPO의 시간 라우팅 취약점 진단

다중 타임스케일로 가치 예측을 수행하되 actor 업데이트에 라우팅을 직접 포함시키면 surrogate objective를 악용할 수 있는 경로가 생긴다. differentiable router는 현재 업데이트에 유리한 헤드를 선택하도록 기여할 수 있으며, 헤드 간 스케일 차이로 인해 실제 제어와의 정합성이 손상될 수 있다. LunarLander-v2에서 Surrogate Objective Hacking과 Paradox of Temporal Uncertainty를 확인하고, Target Decoupling으로 구조적 분리를 제시한다. 이로써 다중-헤드 크리틱의 안정성과 해석 가능성을 진단하는 프레임워크를 제공한다.

HF Daily Papers1달 전· 2달 전 발행

블랙박스 교사로부터 온-정책 신호를 활용해 AR 비디오 생성의 물리적 일관성과 모션을 향상

교사가 샘플 전체를 제공하는 경우에도 AR 학생은 자신의 rollout 분포에 맞춰 학습해야 한다. SFT, score-based DMD, 또는 비디오 수준의 대립 학습은 교사의 인터페이스 제약으로 인해 비효율적이다. 제안된 AFD는 completed videos로부터 교사–학생 간 불일치를 추정하고 이를 forward-noising 경로에 전달함으로써 denoising 시간에서 밀도 있는 감독 신호를 제공한다. 두 가지 AR 백본(Self-Forcing, Causal-Forcing)에서 모션 및 물리적 특성 향상을 보이며 일반 영상 품질도 유지한다.

HF Daily Papers1달 전· 2달 전 발행

터미널 피드백을 밀도 있는 학습 신호로 바꿔 GRPO를 대폭 향상

다 Turn 터미널 환경에서 보상은 희소하고 지연되기 쉽다. 그러나 터미널 출력은 agent가 실행한 명령의 결과를 담은 실제 환경 피드백이다. 이 정보를 학습 신호로 직접 활용하면 실패 롤아웃에서도 환경이 어떻게 응답하는지에 대한 지식을 얻을 수 있다. ECHO는 GRPO의 정책-그래디언트 손실에 환경-observation 토큰의 교차 엔트로피 손실을 더해 같은 forward pass를 재활용하고, 추가 롤아웃 없이도 터미널 다이나믹스를 예측하는 보조 학습 신호를 제공한다. 이로써 환경 응답을 dense supervision으로 활용하는 것이 가능해지며, 온-정책 학습의 커리큘럼을 스스로 진화시키게 된다.

HF Daily Papers1달 전· 2달 전 발행

Inference 시 이미지-텍스트 이중 조건으로 시각적 컨셉을 주입

텍스트-투-이미지 확산 모델은 텍스트 프롬프트에 대한 품질은 높지만 시각적 가이던스를 추론 시점에 유연하게 반영하는 방법이 부족하다. 기존 접근은 파인튜닝이 필요하거나 스타일 전이로 인한 의미 불일치를 초래할 수 있다. Visual Concept Fusion(VCF)은 concept-specific 학습 없이 이미지와 텍스트의 이중 조건 제공을 가능하게 하여 레퍼런스 이미지의 스타일, 구성, 색채를 프롬프트의 내용과 함께 반영한다.

HF Daily Papers1달 전· 2달 전 발행

Verifier-grounded 진단으로 환경-정책을 함께 진화시키는 SEAL

에이전트의 능력 경계가 학습 중에 바뀌는 상황에서 학습 환경이 정적이면 실패 원인을 충분히 파악하기 어렵다. SEAL은 verifier-grounded diagnosis를 공유 신호로 삼아 학습 인터페이스를 실패 유형에 맞춰 진화시키고 정책 업데이트를 진단 가치로 가중한다. 이로써 소량의 데이터로도 다-turn 도구 사용에서 샘플 효율과 OOD 전이를 개선한다.