본문으로 건너뛰기

2026년 7월 8일 AI 뉴스

100

관심 태그 추가

차기 Ray-Ban에 도입되는 항상 켜지는 슈퍼 센싱 테스트와 LED 표시 논쟁

메타가 차기 Ray-Ban에 수시간 동안 백그라운드로 동작하는 '슈퍼 센싱'을 시험 중이며 현재 기기의 약 30분 지속 시간에서 확장되는 가운데 녹화 표시 LED를 끄는 방안이 내부적으로 검토되고 있다.

프롬프트 인젝션으로 원격 코드 실행 가능한 방어형 에이전트 취약성

AI Now 연구는 방어 목적으로 사용된 agentic LLM이 프롬프트 인젝션을 통해 원격 코드 실행으로 역이용될 수 있음을 보여주었다.

LangSmith로 에이전트 트레이스·대시보드 통합 사례

약 10개의 외부 에이전트에 경량 트레이싱을 추가해 LangSmith로 토큰 소비와 지연·실패를 시각화하고 개선 과제를 도출했다.

ACP 프로토콜로 구현하는 코딩 에이전트: 설계부터 Zed 실전 데모까지

ACP 프로토콜을 사용하여 코딩 에이전트의 통신 설계, 세션 관리, 도구 호출 로직을 구현하고 Zed 에디터에서 시연한다.

Context Graph로 결정 이유를 기록하는 에이전트 메모리

Context Graph는 각 결정마다 Decision Trace를 저장하고 입력·결과·근거를 연결해 에이전트가 과거 결정의 이유를 재사용하고 안전성 근거로 활용하도록 한다.

Flutter 기반 오프라인 현장 이미지 수집기와 Django 관리자 통합

JSON 기반 프로젝트 설정과 오프라인 Flutter 앱, 재개 가능한 업로드와 카메라 intrinsics 보존을 갖춘 self-hosted 이미지 수집 도구가 GitHub에 공개되었다.

파인튜닝 모델의 숨겨진 백도어, Delta Monitor로 40배 더 정확하게 잡아내는 법

Sparse Autoencoder를 활용해 파인튜닝 모델의 활성화 차이를 분석함으로써, 기존 탐지 기법의 한계를 극복하고 sleeper-agent 백도어를 정밀하게 식별하는 Delta Monitor 기법을 소개한다.

SN50과 H200의 이기종 분산 추론으로 MiniMax M2.7 최고 속도 공개

SambaNova가 RAISE Summit 2026에서 SN50과 NVIDIA H200을 결합한 이기종 분산 추론 구성으로 MiniMax M2.7의 최고 속도를 공개했다.

Vizuara1달 전

음성 인식 AI는 어떻게 사람의 말을 텍스트로 변환할까?

음성 신호를 디지털 데이터로 변환하고, 음향 모델과 언어 모델을 통해 텍스트를 생성하는 음성 인식(ASR)의 핵심 과정을 다룬다.

T-Rex 22 프리미티브를 시작점으로 한 구성형 촉각 주석 툴킷 공개

tlabel은 GelSight/DIGIT 등 촉각 센서 데이터를 통합 포맷으로 불러와 시각·촉각 이미지로부터 힘 분포를 추정해 조작 프리미티브를 자동 예측하는 Python 툴킷이다.

온디바이스 추론에서 양자화의 성능·정확도 트레이드오프

저자는 공격적 양자화가 모델 파일 크기는 줄이지만 온디바이스에서는 지연 증가와 정확도 손실을 동반할 수 있음을 실측 결과로 보여주었다.

Claude로 자동화하는 영상 편집, Palmier의 실체와 비용 분석

Claude를 활용해 미디어 정리부터 B-roll 생성까지 영상 편집 전 과정을 자동화하는 도구 Palmier의 기능과 가격 정책을 다룬다.

4.7M 채용 인덱스로 드러난 LangGraph 약진

공개 채용 공고 4.7M를 색인한 결과 LangGraph를 채택한 기업이 131곳으로 집계되었고 엔터프라이즈 비중이 높게 나타났다.

split-CIFAR-10에서 리텐션 +53%를 보인 옵티마이저 폐쇄 베타 모집

작성자는 자신의 옵티마이저가 split-CIFAR-10 (5 tasks, 5 seeds) 실험에서 standard Adam 대비 평균적으로 53% 더 기존 지식을 유지한다고 밝혔다.

HF Daily Papers1달 전· 1달 전 발행

시뮬레이션 학습 RL로 CMS 트리거 In-band 56% 향상 사례

Group-Filtered Policy Optimization 변형을 적용한 강화학습 에이전트가 트리거 임계값을 스트리밍으로 조정하여 CMS 데이터에서 In-band 비율을 최대 56% 개선하고 신호 효율도 동시에 향상시켰다.

HF Daily Papers1달 전· 1달 전 발행

DINOv2 백본에서 계층적 임베딩 정화를 통해 87.90 mIoU를 달성한 클린-포지티브 대조학습

PixCon은 레이블이 있고 학생이 이미 맞춘 픽셀만 은행에 넣어 오염률을 0으로 만들고, 그 결과 supervised-InfoNCE의 양성 신호를 정제하여 DINOv2 기반 반지도 분할에서 안정적인 성능 이득을 확보한다.

쓰기 시 검사로 LLM 코드 품질을 높이고 90% 테스트 커버 달성 사례 노출

Iron Lint는 파일을 디스크에 쓰기 전에 정적 검사 스크립트를 실행해 규칙 위반을 차단하고 텔레메트리를 제공하는 오픈 도구이다.

Tina Huang1달 전

NotebookLM으로 비즈니스 아이디어 검증하고 투자 분석 효율 200% 높이기

NotebookLM을 활용해 방대한 문서를 분석하고 비즈니스 아이디어를 검증하며 투자 의사결정을 효율화하는 실전 워크플로를 소개한다.

Google Flow Agent Mode로 이미지부터 영상까지 자동화하는 법

Google Flow Agent Mode의 설정법부터 스토리보드 작성, 이미지-영상 체이닝 및 프로젝트 관리까지 실무 활용법을 알아본다.

복잡한 에이전트 워크플로를 자동화하는 Deep Agents 활용법

LangChain의 오픈소스 에이전트 하네스인 Deep Agents를 통해 복잡한 장기 실행 워크플로를 구축하고 LangSmith로 최적화하는 방법을 소개한다.

PyTorch 에코시스템 합류한 TorchJD의 다중 손실 학습 도구

TorchJD는 scalarization과 Jacobian descent 계열의 다중 손실 학습 방법을 문헌 수준으로 구현해 PyTorch 환경에서 몇 줄의 변경으로 다양한 전략을 시험할 수 있게 만든 라이브러리이다.

AWS ML Blog1달 전

Amazon Quick으로 금융 분석 워크플로를 자동화해 포트폴리오 전체를 10분 단위 분석으로 전환

AWS Finance는 Amazon Quick 채팅 에이전트로 Redshift를 포함한 엔터프라이즈 데이터에서 회귀·몬테카를로 기반 시나리오 분석을 자동화해 고객별 분석 시간을 최대 6시간에서 약 10분으로 단축했다.

KDNugget1달 전

세 문제·세 도구를 8개 차원으로 실제 실행시간 비교

세 가지 분석 문제와 세 가지 도구를 8개 평가 차원에서 실제 실행시간과 에이전트 프롬프트를 사용해 비교한 실험이다.

인터넷 없이 내 기기에서 완벽하게 돌아가는 온디바이스 RAG 구현 전략

Qdrant Edge와 LiteRT를 사용하여 인터넷 연결 없이 모바일 및 엣지 디바이스에서 로컬 RAG 파이프라인을 구축하는 방법을 다룬다.

AI 모델 보안의 시대, 에이전트형 랜섬웨어와 ClickFix의 위협

최신 AI 모델의 보안 제어 기능과 에이전트형 랜섬웨어, 사회 공학 공격 등 급변하는 사이버 보안 위협을 심층 분석한다.

AI Engineer1달 전

AI 에이전트 플릿 운영의 현실: 다중 머신 확장과 유지보수 경험기

개인 환경에서 다중 머신에 걸쳐 AI 에이전트 플릿을 운영하며 겪은 확장성 문제, 시스템 유지보수, 그리고 에이전트 아키텍처의 수렴 과정을 다룬 실전 보고서.

AI Engineer1달 전

40명이 300명 몫을 해내는 법: 영국 법무부 AI 팀의 현장 중심 개발 전략

영국 법무부 AI 팀이 현장 상주와 실물 중심의 개발 방식으로 관료적 조직 내에서 AI 제품을 성공적으로 배포한 사례.

AI Engineer1달 전

AI 에이전트와 RAG 성능을 극대화하는 실전 실험 기록: WitanLabs 연구 로그

WitanLabs의 연구 로그를 통해 AI 에이전트와 RAG 시스템의 성능 개선을 위한 실험 과정과 기술적 인사이트를 정리합니다.

200k 토큰 시대에도 맥락이 흐려지는 최근성 편향 문제

대화가 길어질수록 초기 지시가 사라지는 최근성 편향이 빈번하게 나타나며 RAG는 일부 상황에서만 효과적이고 수동적 맥락 재주입이 현실적 해결책으로 사용된다.

LLM에 인간의 의식을 구현하다: Anthropic의 Global Workspace 연구 분석

Anthropic이 발표한 Global Workspace 연구를 통해 LLM이 정보를 통합하고 처리하는 새로운 인지 아키텍처의 가능성을 살펴본다.

Grok 에이전트화로 구현한 커스텀 스킬 워크플로

Grok을 커스텀 스킬, 병렬 툴 오케스트레이션, 영속 메모리로 구성하자 복잡한 문제에서 단계적이고 감사 가능한 추론이 눈에 띄게 개선되었다.

Claude의 '글로벌 워크스페이스' 발견: AI 내부 개념 추적의 의미와 규제 흐름

Anthropic의 최신 해석 가능성 연구를 통해 Claude의 내부 개념 추적 메커니즘을 분석하고, UN과 각국의 AI 안전 및 규제 움직임을 살펴본다.

TigrimOSR v0.6.2 — Rust 기반 오픈 루프 에이전트 작업공간

TigrimOSR v0.6.2는 YAML로 사용자 정의 가능한 에이전트 루프와 Obscura 브라우저 통합, LINE·Telegram 제어를 제공하는 Rust 네이티브 멀티에이전트 작업공간이다.

토큰 발화량을 반영한 에이전트 작업 비용 스냅샷

작성자는 모델별 출력 발화량(AA의 토큰 카운트)과 공급자 가격을 반영해 에이전트 작업 비용을 재계산했고 캐시 적중률이 발화량 차이보다 비용에 미치는 영향이 훨씬 크다고 나타났다.

HF Daily Papers1달 전· 1달 전 발행

화자 영향 억제한 음절 토큰으로 이해도 7% 향상

이 논문은 화자 특성에 민감한 기존 자기증류 방법의 한계를 극복하기 위해 화자 변형 입력과 청크 단위의 정규화 회귀(SylReg)를 도입하여 음절 경계·클러스터링에서 SOTA 성능을 달성하고 SylReg-LM이 SpiRit-LM 대비 구문·의미 이해에서 평균 7% 상대 향상을 기록했다고 보고한다.

HF Daily Papers1달 전· 1달 전 발행

8개 공개 VA 벤치마크로 검증된 그래프 기반 셀프러닝 하니스

GaP는 계산 그래프와 다중 에이전트를 활용해 내부 시뮬레이션으로 그래프 구조와 노드 파라미터를 반복 최적화하여 VA 작업의 성공률과 강건성을 향상시킨다.

HF Daily Papers1달 전· 1달 전 발행

행동 일관성 비용으로 CEM 샘플 10배 절감 효과

ACID는 예측된 각 단계 전이에서 역동역학으로 행동을 역추정해 단계별 불일치를 비용으로 더하고, 이를 CEM 기반 결정시점 계획에 적용해 다양한 세계모델과 작업에서 계획 성공률을 높이며 플래닝 계산량을 줄였다.

HF Daily Papers1달 전· 1달 전 발행

동결 오디오 인코더와 게이트형 합성으로 맛 기반 음악 색인을 가능하게 하는 연구

사전학습된 열 개의 오디오 인코더를 동결해 동일한 다중작업 MLP로 학습하고 게이트형 레이트 퓨전을 도입해 5차원 맛 예측에서 최고 macro RMSE 0.134와 순위 상관 개선을 달성했다.

HF Daily Papers1달 전· 1달 전 발행

컨볼루셔널 윈도우와 320k 합성 데이터로 확장된 SynCity 3000 파이프라인

SynCity 3000은 텍스트로 생성한 디메트릭 2D 템플릿을 슬라이딩 윈도우 방식의 컨볼루셔널 3D 생성기로 변환하여 임의 크기의 일관된 3D 장면을 생성하는 파이프라인이다.

HF Daily Papers1달 전· 1달 전 발행

GRPO 보정을 통해 조건 충실도를 끌어올린 200k 합성 흉부 CT 데이터와 모델

CONFLUX는 3D VAE로 볼륨을 압축하고 rectified-flow transformer에 adaLN 조건부를 적용한 뒤 GRPO 기반 RL 후학습으로 소견 충실도를 개선해 tri-planar FID 32.3을 달성한 3D 흉부 CT 생성 모델이다.

HF Daily Papers1달 전· 1달 전 발행

72구성 그리드로 드러난 음성 우울증 집계 강건성

서로 다른 SSL 음성 백본과 집계 아키텍처를 교차 평가한 72가지 구성에서 33%가 단일 클래스로 붕괴해 집계 방법의 성능 평가는 백본과 랜덤시드의 영향을 반드시 고려해야 한다.

HF Daily Papers1달 전· 1달 전 발행

단일 궤적 advantage로 텍스트와 이미지를 공동 최적화해 평균 +5.73 성능 향상

BRAID는 텍스트·이미지·텍스트 형태의 다중 턴 추론을 단일 MDP로 모델링하고 궤적 수준 advantage를 텍스트의 GRPO와 이미지의 DiffusionNFT에 각각 주입하여 7개 벤치마크에서 평균 +5.73 개선을 달성했다.

HF Daily Papers1달 전· 1달 전 발행

동결 VLA에 MCTS 기반 Q-평가기를 결합한 테스트타임 스케일링 성능 개선

동결된 Vision-Language-Action 정책에서 MCTS로 얻은 장기 보상 신호를 경량 Q-평가기로 증류해 후보 행동을 재점검함으로써 테스트타임 계산만으로 일반화 성능과 성공률을 크게 향상시켰다.

에이전트가 이메일을 삭제한다면? AI 보안의 사각지대와 실시간 거버넌스

AI 에이전트의 도구 접근 권한이 초래하는 보안 리스크와 이를 실시간으로 제어하기 위한 파인튜닝 모델 기반 거버넌스 전략을 다룬다.

AI Engineer1달 전

43%에서 92%로, 도메인 특화 코딩 하네스로 AI 정확도 극대화하기

지속가능성 데이터 처리를 위해 결정론적 SDK 인터페이스와 코딩 에이전트 패턴을 결합하여 모델의 추론 정확도를 43%에서 92%로 개선한 사례.

AI 답변을 무비판적으로 수용하는 '인지적 항복' 현상과 해결 전략

AI 시스템에서 인간의 무비판적 수용인 '인지적 항복'을 방지하고, 인터페이스 설계를 통해 판단력을 개선하는 실전 전략을 다룬다.

RAG가 죽었다고? 키워드 검색이 해결할 수 없는 'Oracle Gap'의 실체

RAG와 시맨틱 검색의 한계를 넘어, 에이전트가 최신 검색 도구를 효과적으로 활용하도록 설계하는 방법론을 다룬다.

고정된 구조는 버려라: 복잡한 현실 문제를 해결하는 적응형 엔지니어링의 철학

AI 제품 개발이 상품화된 시대에, 고정된 구조를 넘어 복잡계 과학을 기반으로 유연하게 변화에 대응하는 적응형 엔지니어링의 필요성과 철학을 다룬다.

AI Engineer1달 전

개발자 도구와 AI 스타트업을 위한 성공적인 시장 진입 전략

성공한 개발자 도구 및 AI 스타트업 창업자들의 인터뷰를 통해 초기 기업을 위한 개인 브랜딩 및 커뮤니티 중심의 시장 진입 전략을 제시한다.

HF Daily Papers1달 전· 1달 전 발행

주석자 분포를 직접 예측한 계층적 소프트-레이블 시스템, Task 2.3 1위 성적

Gemini Embedding 2 고정 임베딩을 가벼운 게이트형 MLP로 처리하고 KL divergence 기반 소프트-레이블 학습과 동분산 불확실도 가중을 적용하여 EXIST 2026 멀티모달 성차별 탐지에서 Task 2.3 1위를 획득했다.

HF Daily Papers1달 전· 1달 전 발행

온라인 튜닝으로 p95 TTFT를 6.9–15.5% 개선한 GORGO 라우팅 정책

GORGO는 네트워크 지연·큐 대기·프리필 비용을 가중합으로 정량화하고 온라인 진화 전략으로 가중치를 튜닝하여 p95 TTFT를 6.9–15.5% 및 p95 E2E 지연을 14.3–30.9% 개선했다.

HF Daily Papers1달 전· 1달 전 발행

이전 검사 전이를 이용해 Impressions 품질을 향상한 베스트-오브-N 샘플링

프리트레인된 흉부 X선 보고서 생성기에서 후보 보고서를 이전 검사와의 전이 벡터로 점수화해 베스트-오브-N 선택을 개선했다.

HF Daily Papers1달 전· 1달 전 발행

전략 학습 기반 Mastermind, CyberGym에서 84.5% 재현률

Mastermind는 자연어 전략을 학습하고 태스크별 경험을 보관하는 이중 루프 구조로 CyberGym에서 GPT-5.5와 결합해 84.5%의 취약점 재현률을 달성했다.

HF Daily Papers1달 전· 1달 전 발행

198개 물체와 23.3M 프레임을 담은 멀티뷰 시각촉각 데이터셋 Deform360

Deform360은 41대 카메라와 양수 그리퍼 촉각을 동기화하여 198개 물체, 1,980개 상호작용, 23.3M 프레임의 멀티뷰 시각촉각 기록을 제공해 변형체 동역학 모델의 학습·평가 기반을 마련했다.

HF Daily Papers1달 전· 1달 전 발행

동적 해상도 복원 SeKV로 128K 컨텍스트에서 GPU 메모리 53% 절감

SeKV는 엔트로피 기반 스팬 분할과 GPU 요약·CPU 저계수 SVD를 결합해 128K 문맥에서 GPU 메모리를 53.3% 절감하면서 동적 토큰 수준 복원을 통해 압축된 캐시에서 실질적 성능을 회복했다.

HF Daily Papers1달 전· 1달 전 발행

사전 연습으로 구축한 사용자별 체험 메모리로 ACC 84.7·F1 31.6 달성

PraMem은 긴 사용자 이력을 사전 연습으로 처리해 패턴 경험과 편향 경고 경험을 생성함으로써 OmniBehavior에서 ACC를 73.5→84.7, F1을 24.7→31.6으로 향상시켰다.

HF Daily Papers1달 전· 1달 전 발행

Vera와 1,600개 실행 사례로 검증된 에이전트 런타임 안전성 평가

Vera는 문헌 기반 리스크 탐색과 조합적 사례 생성, 샌드박스 적응형 실행 및 환경 증거 기반 검증을 결합해 에이전트의 런타임 안전성을 자동화하고 Vera-Bench 1,600개 실행 사례와 코드를 공개했다.

HF Daily Papers1달 전· 1달 전 발행

157.4B 오디오 토큰과 320.5B 텍스트 토큰으로 학습된 통합 오디오-텍스트 LLM

Audex는 단일 Transformer 디코더로 오디오를 텍스트 임베딩 공간에 투사해 음성 인식·번역·합성·생성을 통합한 오디오-텍스트 LLM이다.

HF Daily Papers1달 전· 1달 전 발행

4D 기하학 기반으로 장기·다중뷰 비디오 일관성 확보

MV-Forcing은 반복적 3D 재구성 모델을 기하학적 우선신호로 활용하고 시공간 자기강제를 결합해 임의 길이와 임의 카메라 수의 일관된 다중뷰 비디오를 생성한다.

HF Daily Papers1달 전· 1달 전 발행

토큰 로그확률로 검증 세분화를 확장해 4개 벤치마크 SOTA 달성

토큰 로그확률의 기댓값을 점수로 사용해 점수 세분화·반복 평가·기준 분해를 확장함으로써 코딩·로보틱스·의료 벤치에서 검증 성능을 크게 개선한 범용 검증 프레임워크이다.

HF Daily Papers1달 전· 1달 전 발행

134개 실제 과제에서 확인된 로그-시그모이드 학습 법칙과 3개월마다 학습속도 두 배 추세

134개 실제 과제와 약 38,000시간의 에이전트 상호작용을 분석한 결과 평균 성능은 로그-시그모이드 함수로 시간에 따라 예측 가능하며 최신 모델 세대에서는 학습속도가 약 세 달마다 두 배로 증가했다.

HF Daily Papers1달 전· 1달 전 발행

PFM으로 4–8스텝 고품질 이미지·비디오 생성

PFM은 VAE 잠재공간 대신 사전학습된 지각 특징 공간에서 흐름 매칭을 감독하여 4–8스텝으로도 고품질 생성과 편집을 가능하게 했다.

HF Daily Papers1달 전· 1달 전 발행

다중 플레이어 행동을 입력으로 받아 20fps 실시간 생성이 가능한 5B 잠재 확산 월드 모델 공개

다수 에이전트의 행동 스트림을 직접 조건화하는 5B 파라미터 잠재 확산 모델이 Rocket League 경기의 4인 매치를 B200 GPU에서 초당 20프레임으로 실시간 생성하며 훈련 길이를 훌쩍 넘는 안정적 롤아웃을 보였다.

HF Daily Papers1달 전· 1달 전 발행

디노이징 궤적에서 특권 정보를 추출하는 dOPSD 기법

dOPSD는 확산형 언어 모델의 자체 디노이징 궤적을 교사 특권으로 활용하여 온-폴리시 토큰 수준 자기 증류를 수행함으로써 수학 추론과 코드 생성 성능을 동시에 향상시켰다.

HF Daily Papers1달 전· 1달 전 발행

K=64에서 저장량 16.09× 축소와 R@1 개선을 달성한 SaMer 토큰 병합

SaMer은 학습 시 객체 주석을 병합 우선으로 활용해 이미지 post-projector 토큰을 K=64 대표 centroid로 압축하여 저장을 16.09× 줄이고 Flickr30K R@1을 77.0에서 82.4로 개선한 방식이다.

HF Daily Papers1달 전· 1달 전 발행

75–88% KV 캐시 압축에도 Qwen3 성능 95% 수준 유지 기법

KVpop은 학습 단계에서 전치 주의로 계산한 미래 주의 질량을 타깃으로 경량 스코어러를 훈련해 고정 예산의 KV 캐시를 유지하면서 Qwen3-계열 모델에서 밀집 주의 성능을 대체하는 방법이다.

HF Daily Papers1달 전· 1달 전 발행

워크플로 편집 기반 다중회차 논문검색 에이전트, Hit@5 58→77 개선

PaperPilot는 앵커 논문과 사용자 질의로부터 실행 가능한 DAG 형식의 검색 워크플로를 유도하고 다중회차 피드백으로 워크플로를 편집해 Hit@5를 58.0에서 77.0으로 개선한 다중회차 문헌 검색 에이전트이다.

HF Daily Papers1달 전· 1달 전 발행

1.2M 로봇 에피소드와 3M 멀티모달 샘플로 학습된 VLM 기반 잠재 포사이트 로봇 정책

InternVLA-A1.5는 VLM 백본을 유지하면서 학습 전용의 소수 포사이트 토큰을 WAN2.2로 감독하여 픽셀 생성 없이 세계 모델의 동적 사전지식을 정책에 전이해 시뮬레이션과 실환경에서 우수한 조합적 일반화와 장기 실행 성능을 달성했다.

HF Daily Papers1달 전· 1달 전 발행

EVA-Client로 실시간 추론 전략과 배포 파이프라인을 하나의 워크플로로 통합

EVA-Client는 로봇별 코드 수정 없이 정책 배포, 실시간 추론 스케줄링, 데모 수집, 그리고 재현 가능한 물리 평가를 하나의 클라이언트로 연결하는 오픈소스 프레임워크이다.

HF Daily Papers1달 전· 1달 전 발행

640×368 해상도에 200ms 모델 지연을 유지한 실시간 멀티모달 스트리머

Wan-Streamer v0.2는 모델 측 약 200ms 응답 지연을 유지하면서 출력 해상도를 192×336에서 640×368로 확장하고 단일-GPU thinker와 Ulysses 스타일의 다GPU performer로 서빙 토폴로지를 재구성했다.

HF Daily Papers1달 전· 1달 전 발행

경계 중심 자기지도학습으로 깊이 완성도를 끌어올린 1B 비전 모델

교사 예측에서 검증된 경계 토큰을 강제로 마스킹해 범주형 경계 목표와 의미론적 자기증류를 병행 학습함으로써 LingBot-Vision이 라벨 없는 상태에서 깊이·분할·비디오 추적 성능을 크게 향상시켰다.

HF Daily Papers1달 전· 1달 전 발행

WMBench 기반 평가 설계와 GigaWorld-1의 14.9% 정렬도 향상

이 논문은 12,980시간의 데이터와 324,000개 롤아웃 분석을 바탕으로 WMBench를 제안하고 GigaWorld-1을 통해 월드 모델을 로봇 정책 평가자로 사용하는 설계 원칙과 실험적 근거를 제시한다.

HF Daily Papers1달 전· 1달 전 발행

MANCE++ 매니폴드 제약으로 개념 제거 수술성 및 누출 개선

MANCE는 자연 표현의 국소 매니폴드에 편집 방향을 투사하고 단계 크기를 지역 반경에 맞춰 제한하여 목표 개념 누출을 크게 줄이면서 다른 제어 개념을 보존했다.

HF Daily Papers1달 전· 1달 전 발행

1,947편 학회 성과에서 추출한 15개의 재사용형 연구 아이디어 패턴

1,947편의 ICLR·ICML·NeurIPS 성과를 분석해 31개 전술·15개 상위 패턴을 유도하고, 이를 증거 기반의 운영 카드와 세 가지 재사용 스킬(Paper-Search, Scoop-Check, IdeaSpark)로 묶어 자동화된 아이디어 생성 및 감사 워크플로우로 제시했다.

HF Daily Papers1달 전· 1달 전 발행

VAE/RAE 없이 픽셀-스페이스로 통합한 3D 장면 생성·재구성 프레임워크

PixWorld는 VAE나 RAE에 의존하지 않고 픽셀 공간에서 flow-matching 기반 확산을 적용해 하나의 모델로 3D 장면 생성과 재구성을 통합했다.

HF Daily Papers1달 전· 1달 전 발행

하나의 Paper2Assets로 편집 가능한 포스터·비디오·블로그를 동시 생성하는 워크플로

ResearchStudio-Reel은 하나의 공유 추출 번들을 만들고 세 개의 편집 가능한 생성기와 범주적 렌더 게이트를 조합해 포스터·동영상·이중언어 블로그를 일괄 생성하며 섹션 수준으로 정렬한다.

HF Daily Papers1달 전· 1달 전 발행

플랫폼별 교사 라우팅과 K3 토큰 KL로 8B 학생에게 데스크톱·모바일 행동을 동시에 보존한 UI-MOPD

UI-MOPD는 Uni-GUI 데이터와 플랫폼 조건부 다중교사 온-폴리시 증류를 결합해 한 개의 공유 정책이 데스크톱과 모바일의 고유 상호작용 규약을 유지하면서 연속적으로 적응하도록 설계된 방법이다.

HF Daily Papers1달 전· 1달 전 발행

5단계 메타파이프라인과 LMO로 정리한 100여 옵티마이저 벤치북

OmniOpt은 옵티마이저 업데이트를 다섯 단계 메타파이프라인으로 구조화하고 노름 제약 LMO 관점으로 통일한 뒤, 메커니즘 축과 목표 축으로 구성된 분류와 교차 도메인 벤치마크로 옵티마이저 선택의 실무적 좌표계를 제시한다.

Lean 검증과 실행 코드 포함 '순서 효과는 곡률' 리포지토리

이 리포지토리는 정보 결합의 순서가 결과를 바꾸는 조건을 수학적으로 규명하고 Lean 증명과 실행 가능한 파이썬/Lean 코드를 통해 재현성을 제공한다.

196개 LoRA로 만든 부분공간 제약 방어 연구

신뢰된 LoRA 어댑터 풀로 파인튜닝을 부분공간으로 제한하면 공격 성공률이 크게 낮아지고 풀에 포함된 작업에서 적응 성능이 상당 부분 보존된다.

r/LLMDevs1달 전

애플리케이션 레벨 권한 필터링으로 인한 벡터 검색 데이터 노출 사례와 방어책

핸드롤 권한 필터가 벡터 검색의 보안 경계에서 실패해 비인가 문서가 응답에 포함된 사례와 근본 원인과 질문을 제시한다.

Covertype에서 LogLoss 0.5005·정확도 79.56%를 기록한 CPDN 접근법

CPDN은 CatBoost의 트리 구조를 기반으로 계층별 증류와 자동 용량 계산을 수행해 Covertype에서 LogLoss 0.5005 및 정확도 79.56%를 달성했다.

수천 전략의 자기대결로 드러난 해석 가능한 전술

닫힌 형식의 신경-심볼릭 정책을 GPU 병렬 자기대결로 진화시키자 집중사격, 포위, 카이팅 등 해석 가능한 전술이 자발적으로 나타났다.

Gnome 옵티마이저가 PINN에서 고정 학습률로 SOAP·AdamW를 능가하는 사례

Gnome은 한 번의 추가 역전파로 편향 없는 GGN 추정치를 얻어 고유벡터 기반의 제곱근 제거 뉴턴 스텝을 적용하며 고정 학습률 환경에서 SOAP와 AdamW보다 빠르고 낮은 rel-L2를 달성한다.

RX 6650 XT에서 확인된 speculative decoding의 에너지 페널티와 배치 최적화

RX 6650 XT에서 speculative decoding은 부하가 높을수록 토큰당 에너지가 증가해 8스트림에서 +121%의 에너지 페널티를 보였고 배치로 토큰당 에너지를 약 3배 절감할 수 있었다.

AI 모더레이션 오류로 8,000명 이상 계정 차단된 Discord 사건

Discord의 AI 기반 모더레이션 오류가 스프레드시트·체스판·게임 텍스처 등 무해한 이미지를 유해로 판정해 지난 두 달간 8,000명 이상이 차단되었다.

Kimi와 Fireworks AI로 오픈소스 모델 파인튜닝 완벽 정복하기

Kimi API 플랫폼과 Fireworks AI를 활용하여 오픈소스 모델을 효율적으로 파인튜닝하는 방법을 단계별로 설명하는 튜토리얼 영상이다.

두 드론의 판단을 결합해 실종자 발견 확률을 추정하는 확률 모델 제안

두 대의 드론이 반환한 탐지 확률을 결합해 실제 탐지 확률 P(T)를 유도하려는 제안으로서 기초 수식과 RL·DL을 통한 검증 시도가 포함되어 있다.

가역성으로 라우터 활성화 캐시를 없애고 A100에서 MFU 50% 유지하는 RcCaMoE

RcCaMoE는 준3진 투영과 1D 컨볼루션 기반 셀룰러 오토마타와 Toffoli 가역 토폴로지를 결합해 라우터 활성화를 GPU에 저장하지 않고 재구성함으로써 A100에서 MFU를 50.02%로 유지하고 학습 중 PPL을 1.62까지 낮췄다.

챗봇과 Google AI Studio로 완성한 전술 지원 앱 ROMAD-AI 개발기

무경험자가 ChatGPT·Claude·Gemini를 활용해 3개월 동안 프롬프트 중심의 'vibe-coding'으로 전술 지원 애플리케이션 ROMAD-AI를 만든 사례이다.

사전 예산 검사로 $2,000 초과 요금 방지

앱 호출 직전에 고객·에이전트·워크플로별 예산을 확인해 LLM API 과다 과금을 차단하는 오픈소스 Bursora의 설계와 출력 토큰 미확정성에 대한 트레이드오프를 공유한다.

Qwen과 TinyLlama의 윤리 컴퍼스 충돌, katki +0.059226 vs -0.061882

동일한 입력과 모터 설정에서 Qwen2.5-1.5B는 모든 스티어드 레이어에서 양의 cos(θ)을 보여 katki 총합 +0.059226로 프레이밍을 강화했고 TinyLlama-1.1B는 L2부터 음수로 전환되어 katki 총합 -0.061882로 제동하는 양상을 보였다.

Hadith 전승 원리로 체인 신뢰도 등급화한 'isnad' 패키지 공개

작성자는 hadith 전승 평가 원리를 AI 파이프라인에 적용한 'isnad' 프레임워크와 DOI가 있는 논문 및 Python 패키지를 공개하고 초기 검증 결과를 보고했다.

AgentCore 기반 AWS 지원 조사 자동화 솔루션

AgentCore와 Strands Agents, MCP를 결합해 CloudWatch 로그 분석과 문서·커뮤니티 검색을 하나의 대화형 에이전트로 통합하고 CloudFormation 단일 배포로 운영 가능한 지원 자동화 솔루션이다.

Evidently·MLflow 기반 SageMaker AI 모델 모니터링 파이프라인

데이터 드리프트와 모델 드리프트를 베이스라인 통계와 실제 레이블 비교로 탐지하고 Evidently와 MLflow를 통해 SageMaker AI 환경에 통합하는 모니터링 아키텍처를 제안한다.

AgentCore 기반 자연어 이미지 편집 서버리스 파이프라인

AgentCore 구성으로 Claude 모델과 Stability AI 툴을 결합해 사용자의 자연어 편집 요청을 분해·라우팅하고 microVM에서 워터마크 등 후처리를 토큰 비용 없이 실행하는 서버리스 이미지 편집 솔루션이다.

최대 12개 데이터셋 연결로 정규화 상태에서 교차 질의 자동 생성

Amazon Quick의 멀티 데이터셋 Topics는 최대 12개의 데이터셋과 명시적 관계를 하나의 시맨틱 레이어로 결합해 NLQ 엔진이 자동으로 조인된 SQL을 생성하도록 하여 데이터 정규화를 유지한 채 통합 응답을 제공한다.