본문으로 건너뛰기

2026년 5월 12일 AI 뉴스

100

관심 태그 추가

피그마의 시대는 끝났나? Claude Design과 Google Stitch 전격 비교

Anthropic의 Claude Design과 Google의 Stitch를 기능, 비용, 디자인 품질, 코드 연동성 등 다각도에서 비교 분석하여 최적의 AI 디자인 워크플로우를 제안한다.

Krish Naik3달 전

RAG 시스템의 성능 병목과 비용 문제, 시맨틱 캐싱과 BetterDB로 해결하기

Valkey와 BetterDB를 활용하여 RAG 파이프라인에 시맨틱 캐싱을 적용하고, MCP를 통해 자연어로 시스템을 모니터링하는 프로덕션 수준의 구축 방법을 제시한다.

LLM이 스스로 설계한 언어? 2,000줄의 NES 에뮬레이터까지 단번에 작성

Claude Opus가 설계한 Laze는 LLM의 코드 생성 효율과 정확도를 극대화하기 위해 구두점을 최소화하고 C로 컴파일되는 네이티브 언어입니다.

Dataiku Blog3달 전

AI 주권, 단순히 로컬 서버를 쓰는 것만으로는 부족한 이유

AI 주권은 데이터 거주지를 넘어 벤더 종속성 탈피와 기술 스택 전반에 대한 통제력 및 유연성을 확보하는 비즈니스 독립성 전략이다.

KDNugget3달 전

데이터 처리 속도 10배 향상? Pandas를 Polars로 대체해야 하는 이유

대규모 데이터셋 처리 시 Pandas의 성능 한계를 극복하기 위해 Rust 기반 Polars의 병렬 처리와 지연 평가를 활용한 성능 최적화 사례를 분석한다.

TechCrunch AI3달 전

Figma와는 다르다? 코드 위에서 직접 디자인하는 AI 도구 Dessn

디자인 스타트업 Dessn이 코드베이스를 클라우드에서 직접 실행하고 AI 프롬프트로 UI를 수정할 수 있는 도구를 개발하여 600만 달러의 시드 투자를 유치했다.

아마존의 AI 실적 부풀리기? 직원들이 토큰 사용량을 늘리는 이유

아마존 직원들이 AI 기술 활용도를 높게 평가받기 위해 내부 도구 'MeshClaw'를 활용해 불필요한 작업까지 자동화하며 토큰 사용량을 인위적으로 늘리고 있다.

NVIDIA와 SAP가 손잡고 기업용 AI 에이전트의 보안 장벽을 세운다

NVIDIA와 SAP가 협력하여 오픈소스 런타임 OpenShell을 통해 기업용 자율 AI 에이전트의 보안, 정책 집행 및 거버넌스 제어 기능을 강화한다.

토큰은 싸지는데 왜 AI 청구서는 늘어날까? CFO를 위한 AI 거버넌스 가이드

AI 토큰 단가는 하락하고 있으나, 에이전트 기반의 과도한 소비와 가시성 부족으로 인해 기업의 전체 AI 지출은 오히려 급증하고 있으며 이를 관리하기 위한 워크플로 중심의 거버넌스가 시급하다.

당신의 LLM API가 몰래 망가지고 있다면? Silent-Bench의 암호학적 진단

상용 LLM API 게이트웨이에서 발생하는 무음 실패를 탐지하고 암호학적으로 증명하는 오픈소스 감사 프레임워크 Silent-Bench가 공개됐다.

AI가 스스로 제로데이 취약점을 발견했다? 구글이 포착한 새로운 보안 위협

AI가 생성한 최초의 제로데이 익스플로잇 발견과 OpenAI의 새로운 보안 모델 출시 등 AI 기술의 최신 보안 및 산업 동향을 다룹니다.

KDNugget3달 전

시계열 데이터 분석, 이 5가지 Python 스크립트로 종결하세요

시계열 데이터의 리샘플링, 이상치 탐지, 성분 분해, SARIMA 예측 및 다중 시계열 비교를 자동화하는 5가지 핵심 Python 스크립트를 소개합니다.

아마존 링 고객 상담 100% 책임지는 AI 음성 에이전트 Vapi의 급성장

AI 음성 인프라 스타트업 Vapi가 아마존 링의 전량 도입 성과를 바탕으로 5억 달러 가치를 인정받으며 5,000만 달러 규모의 시리즈 B 투자를 유치했다.

단순 코딩 보조를 넘어선 오픈소스 에이전트 런타임, Hermes Agent

Nous Research가 공개한 Hermes Agent는 스케줄링, 도구 통합, 상태 관리를 지원하는 고급 AI 에이전트 구축용 오픈소스 런타임입니다.

RIKEN AIP3달 전

RIKEN AIP, ICML 2026에서 42편 논문 채택하며 AI 연구 저력 증명

일본 RIKEN AIP 연구소가 세계적 AI 학회인 ICML 2026에서 총 42편의 논문을 채택시키는 성과를 거두었습니다.

AICodeKing3달 전

400개 이상의 도구로 나만의 자율형 AI 에이전트 워크플로 구축하기

OnDemand 플랫폼의 마켓플레이스, 플레이그라운드, 플로우 빌더를 사용하여 비즈니스용 멀티 에이전트 시스템을 구축하고 자동화하는 방법을 제시한다.

DeepSeek V4 Flash, Claude Opus 대비 비용 56배 저렴하지만 성능 차이는 단 2.3점

14개 LLM을 대상으로 코드 분석 성능과 비용을 벤치마크한 결과, DeepSeek V4 Flash가 압도적인 가성비를 보였으며 고가 모델의 비용 효율성은 낮은 것으로 나타났다.

수 주 걸릴 레이아웃 엔진 개발을 단 몇 시간 만에? Claude와 Figma를 활용한 디자인 자동화 팁

Figma 디자인 위에 색상 박스를 그려 Claude에게 좌표를 추출하게 함으로써 복잡한 레이아웃 엔진 코딩 없이 앱 템플릿 시스템을 구축한 사례이다.

Claude가 로컬 모델에게 일을 시킨다? MCP를 활용한 비용 절감 팁

MCP를 통해 Claude와 로컬 Ollama(Qwen 2.5 Coder)를 연결하여 고비용 작업을 로컬 모델에 위임하는 하이브리드 에이전트 시스템 구축 사례이다.

성공했다는 AI 에이전트의 3%는 거짓말? 실무용 검증 패턴 공개

AI 에이전트가 로그상 성공을 보고하더라도 실제 작업이 누락되는 문제를 해결하기 위해 4단계 사후 검증 프로세스를 도입하여 신뢰성을 확보했다.

AI가 범죄를 방조했나? OpenAI를 상대로 한 총기 난사 피해자들의 소송

AI 챗봇 사용자의 폭력적 성향을 감지하지 못한 OpenAI 등 AI 기업들을 대상으로 한 '경고 의무' 위반 소송이 잇따르고 있다.

200ms의 마법, Thinking Machines가 공개한 실시간 음성 AI의 미래

Thinking Machines가 200ms 단위의 마이크로 턴 구조를 통해 실시간 멀티모달 상호작용을 구현한 TML-Interaction-Small 모델을 공개했습니다.

r/LLMDevs3달 전

LLMOps는 단순한 마케팅일까? MLOps와 결정적으로 다른 10가지 요소

전통적인 MLOps가 모델 학습과 예측 품질에 집중했다면, LLMOps는 프롬프트, 검색 파이프라인, 에이전트 조율 등 모델 주변 시스템 최적화에 초점을 맞춘다.

Modal Blog3달 전

Modal이 공개한 GPU 추론 서버 부팅 40배 단축의 비밀

Modal은 클라우드 버퍼, 커스텀 파일시스템, CPU/GPU 체크포인트 기술을 결합하여 GPU 서버리스 추론의 콜드 스타트 지연을 2,000초에서 50초로 단축했습니다.

수술실의 미래, 스스로 판단하고 집도하는 자율 수술 로봇의 진화

UC 샌디에이고의 Michael Yip 교수가 이미지 기반 제어부터 물리 시뮬레이션, 휴머노이드 로봇을 활용한 의료 보조까지 자율 수술 로봇의 핵심 기술과 미래 방향을 제시한다.

Stanford Online3달 전

스탠포드가 알려주는 LLM 추론 속도 10배 높이는 아키텍처와 시스템 기법

LLM 추론의 핵심 병목인 메모리 대역폭 문제를 분석하고, KV 캐시 최적화, 추측 디코딩, 연속 배칭 등 최신 성능 향상 기법을 다룹니다.

AWS와 NVIDIA가 제안하는 3대 스케일링 법칙 대응 인프라 전략

AWS 인프라와 오픈소스 소프트웨어 스택을 활용하여 파운데이션 모델의 사전 학습, 사후 학습, 테스트 시간 컴퓨팅을 최적화하는 4계층 아키텍처 가이드

The Verge AI3달 전

OpenAI의 새로운 보안 병기 Daybreak, GPT-5.5-Cyber로 해킹 막는다

OpenAI가 Codex Security 에이전트와 GPT-5.5-Cyber 모델을 결합하여 조직의 코드 취약점을 자동으로 탐지하고 패치하는 보안 이니셔티브 'Daybreak'를 발표했습니다.

HF Daily Papers3달 전· 3달 전 발행

SpecBlock, EAGLE-3보다 2배 저렴한 비용으로 추론 속도 19% 향상

LLM 추론 속도를 높이는 추측 디코딩 기술에서 기존의 순차적 방식(EAGLE-3)과 병렬 방식(Medusa)의 단점을 동시에 해결했습니다. 한 번의 연산으로 여러 토큰 간의 의존성을 유지하며 예측하는 블록 단위 접근법을 통해 연산 비용은 절반으로 줄이면서도 정확도는 높게 유지합니다.

HF Daily Papers3달 전· 3달 전 발행

추가 학습 데이터 없이 LLM 에이전트 성능 최대 8.8% 향상

LLM 에이전트가 긴 작업을 수행할 때 어떤 행동이 성공에 기여했는지 판단하는 Credit Assignment 문제는 매우 어렵다. 이 논문은 추가적인 보상 모델이나 데이터 라벨링 없이 모델 내부의 엔트로피 신호만으로 학습 효율을 극대화하는 경량화된 해결책을 제시한다.

AWS ML Blog3달 전

AWS Strands와 Exa로 구축하는 실시간 웹 검색 딥 리서치 에이전트

AWS의 Strands Agents SDK와 Exa AI 검색 엔진을 통합하여 실시간 웹 정보를 스스로 검색하고 분석하는 고성능 리서치 에이전트 구축 방법을 소개합니다.

WorldofAI3달 전

구글 Remy 에이전트의 3,500줄 코딩 능력과 OpenAI의 초고속 모드 유출

구글의 새로운 에이전트 모드 Remy와 OpenAI Codex의 울트라패스트 모드 등 구글 I/O를 앞두고 유출된 주요 AI 기술 업데이트를 다룹니다.

데이터 브릭스, 'Catalog Commits' 출시로 멀티 테이블 트랜잭션 한계 극복

Databricks가 Delta Lake와 Unity Catalog를 결합하여 멀티 테이블 트랜잭션과 엔진 간 데이터 일관성을 보장하는 Catalog Commits 기능을 정식 출시했다.

Markdown 대신 HTML? Anthropic 엔지니어가 제안하는 에이전트 소통법

Anthropic의 엔지니어가 AI 에이전트와의 데이터 교환 포맷으로 Markdown보다 HTML이 정보 밀도와 시각화 측면에서 우수하다고 제안하며 업계의 주목을 받았습니다.

가뭄 중에 물 3천만 갤런 '공짜'로 쓴 데이터 센터의 정체

미국 조지아주의 대규모 데이터 센터가 유틸리티 당국의 모니터링 부재를 틈타 약 3,000만 갤런의 물을 무단으로 사용한 사실이 밝혀졌다.

답변 거부 없는 AI가 필요하다면? SuperGemma 26B 로컬 실행 가이드

Ollama와 Hugging Face를 활용하여 검열이 제거된 SuperGemma 26B 모델을 로컬 환경에서 실행하고, 자율 연구 루프를 통해 모델의 제한을 해제하는 방법을 제시한다.

수십 년 된 스캔 문서에서 지하수 데이터를 찾는 AI 파이프라인

Databricks와 MapAid가 멀티모달 AI를 사용하여 수단의 방대한 스캔 지질 문서를 검색 가능한 데이터베이스로 변환하고 지하수 예측 모델을 강화했습니다.

하키 경기 분석의 혁신: RF-DETR과 ByteTrack으로 구현하는 실시간 선수 추적

RF-DETR 모델과 ByteTrack 알고리즘을 결합하여 하키 경기 영상에서 선수들의 고유 식별자를 유지하고 이동 경로를 시각화하는 자동화 시스템 구축 방법을 설명합니다.

LLM 성능 저하와 비용 폭증을 막는 7가지 필수 관측성 도구 가이드

프로덕션 환경에서 LLM 애플리케이션의 성능, 비용, 품질을 모니터링하고 디버깅하기 위한 7가지 주요 관측성(Observability) 도구의 특징과 선택 기준을 제시한다.

금붕어 기억력 AI 에이전트, '운영체제'로 해결한다

AI 에이전트의 신뢰성과 확장성을 확보하기 위해 메모리, 도구, 보안을 관리하는 전용 운영체제(Agent OS) 아키텍처의 필요성을 제시한다.

LLM 대화 기록도 Git처럼 리베이스한다? pi-treebase 공개

Git의 interactive rebase 개념을 LLM 세션에 도입하여 대화 기록을 선택적으로 유지, 요약, 삭제할 수 있는 히스토리 관리 도구이다.

AI의 유머 감각을 측정한다? 실시간 뉴스 기반 밈 생성 벤치마크 memebench

실시간 뉴스 헤드라인을 바탕으로 AI 모델들이 밈을 생성하고 사용자가 블라인드 투표로 우열을 가리는 벤치마크 플랫폼입니다.

자고 있는 동안 Claude 사용 제한이 풀린다면? tmux와 at으로 자동화하기

tmux와 at 명령어를 조합하여 Claude의 사용량 제한이 해제되는 시점에 맞춰 자동으로 작업을 재개하는 쉘 스크립트 팁이다.

2025년에만 14만 건 이상? LLM이 생성한 가짜 인용문이 과학계를 위협한다

LLM 도입 이후 과학 논문 내 존재하지 않는 가짜 인용문이 급증했으며, 이는 지식 생산의 신뢰성과 공정성을 훼손하고 있다.

OpenAI와 Anthropic의 JSON 출력, 왜 똑같은 스키마로 안 될까?

LLM 프로바이더마다 JSON 스키마 해석 방식이 달라 발생하는 구조화된 출력의 이식성 문제와 실무적인 해결 방안을 다룬다.

Claude Code가 막혔을 때 소리로 알려준다? AI 에이전트용 라디오 'Agent FM'

여러 코딩 에이전트의 작업 상태와 오류를 실시간 음성 내레이션으로 중계하여 개발자의 모니터링 부담을 줄여주는 Mac용 오픈소스 도구이다.

단순 코드 복붙은 끝, Claude가 직접 Blender를 조작하고 렌더링을 확인한다

MCP를 통해 Claude Desktop과 Blender를 직접 연결하여 실시간 3D 모델링 및 시각적 피드백 루프를 구축하는 실전 워크플로가 공유되었다.

Claude Code가 내 .env 파일을 수정할 수 있다면? 보안 감사 팁

Claude Code 사용 시 발생할 수 있는 보안 리스크를 방지하기 위해 도구 접근 권한과 파일 시스템 범위를 명시적으로 제한해야 한다.

Claude에 '스킬' 9개를 심었더니 비디오 제작부터 재무 모델링까지 자동화됐다

Claude의 '스킬' 기능을 활용해 비디오 제작, API 문서화, 재무 모델링 등 9가지 전문 작업을 자동화하고 생산성을 높인 실무 경험 공유이다.

인턴 5명 몫을 해내는 AI 에이전트, B2B 영업 자동화 성공 사례

Claude Code 기반의 다중 에이전트 시스템을 구축하여 B2B 영업 리드 수집부터 스코어링, CRM 연동까지 전 과정을 자동화했다.

유휴 GPU를 크레딧으로? P2P 방식의 로컬 LLM 공유 프록시 등장

로컬 또는 사설망의 LLM을 외부 포트 개방 없이 공용 인터넷에 연결하고, 토큰 공유를 통해 크레딧을 적립·사용할 수 있는 P2P 프록시 시스템입니다.

LLM의 계산 한계는 어디까지일까? PSPACE-완전 문제로 검증하는 새로운 벤치마크

정규 표현식의 등가성 결정 및 최소화라는 PSPACE-완전 문제를 활용하여 LLM과 LRM의 공간적 계산 한계와 추론 능력을 측정하는 RegexPSPACE 벤치마크가 제안됐다.

Cloudflare가 에이전트 토큰 비용을 99.9% 절감한 비결: 코드 모드

에이전트가 수많은 도구를 개별 호출하는 대신 코드를 직접 작성해 실행하게 함으로써 토큰 사용량과 추론 횟수를 획기적으로 줄이는 '코드 모드' 패턴이 부상하고 있다.

r/ClaudeAI3달 전

Sonnet 4.5 구독 종료 전 필수! 확장 사고 모드 대화창 미리 확보하는 팁

Claude Sonnet 4.5의 구독 서비스 종료 전 'Extended Thinking'이 활성화된 빈 대화창을 대량 생성하여 사용 기간을 연장하는 우회 방법을 공유했다.

Claude Code를 멀티 운영자 협업 도구로 변신시킨 프로젝트

Claude Code 세션을 다중 운영자가 협업하고 원격 제어할 수 있는 공개 에이전트로 확장하는 레이어를 개발했다.

r/ClaudeAI3달 전

엉망이 된 인터뷰 녹취록, AI로 완벽하게 복원하는 포렌식 프롬프트

오디오 품질 저하로 깨진 전사 텍스트를 화자의 말투와 의도를 유지하며 복원하기 위한 구체적인 시스템 프롬프트와 가이드라인이다.

Claude Code로 만든 6가지 AI 페르소나, 비즈니스 전체를 자동화하다

Claude Code를 활용해 비서, 변호사, 조사관 등 6가지 전문 역할을 수행하고 상호 컨텍스트를 공유하는 자율형 AI 에이전트 시스템 구축 사례이다.

AI 에이전트의 망각 문제 해결, 로컬 기반 그래프 메모리 Graft 공개

Graft는 SQLite와 llama.cpp를 기반으로 AI 에이전트에게 세션 간 유지되는 영구적인 그래프 구조의 메모리를 제공하는 로컬 퍼스트 오픈소스 도구입니다.

U-Net에서 DiT까지 확산 모델 아키텍처의 진화 완벽 정리

확산 모델의 백본 아키텍처가 U-Net에서 Transformer(DiT)로 진화하는 과정과 그 내부 작동 원리 및 최적화 기법을 심도 있게 다룹니다.

Hugging Face 엔지니어가 공개하는 수천 개 GPU 학습의 비밀: 5D 병렬 처리 가이드

Hugging Face의 Nouamane Tazi가 수천 개의 GPU 클러스터에서 대규모 언어 모델을 효율적으로 학습시키기 위한 5D 병렬 처리 기법과 MoE 아키텍처의 확장 전략을 상세히 설명합니다.

LLM 성능의 퀀텀 점프, 사전 학습 데이터의 '순서'와 '추론'에 답이 있다

NVIDIA와 Mistral AI의 연구를 바탕으로 LLM 사전 학습 시 데이터의 순서 최적화, 추론 데이터의 조기 주입, 그리고 강화 학습 기반 목적 함수가 모델 지능에 미치는 영향을 다룹니다.

HF Daily Papers3달 전· 3달 전 발행

교사 모델의 로짓 없이도 루브릭만으로 학습 효율 10배 달성

기존의 AI 모델 학습 방식은 교사 모델의 내부 데이터(로짓)가 꼭 필요해 폐쇄형 모델을 교사로 쓰기 어려웠습니다. 이 논문은 텍스트로 된 평가 기준(루브릭)만으로도 모델을 효과적으로 가르칠 수 있음을 증명하여, GPT-5와 같은 강력한 API 모델을 활용한 효율적인 모델 학습의 길을 열었습니다.

HF Daily Papers3달 전· 3달 전 발행

VLM 보안의 새로운 방패, SAE로 적대적 이미지 공격 90% 이상 차단

시각 언어 모델(VLM)이 실제 서비스에 도입되면서 이미지에 숨겨진 미세한 노이즈로 모델을 속이는 적대적 공격이 심각한 보안 위협으로 부상했다. 이 논문은 추가적인 재학습 없이도 기존 모델에 간단히 끼워 넣어 공격을 실시간으로 감지할 수 있는 가벼운 방화벽 기술을 제시하여 VLM의 실무 안전성을 크게 높였다.

HF Daily Papers3달 전· 3달 전 발행

비디오 생성 없이 DINO 특징만으로 3D 로봇 조작 학습 성공

기존 월드 모델은 고비용의 비디오 생성에 의존하여 연산 부담이 크고 환각 현상에 취약했다. 이 논문은 픽셀 대신 DINO 특징의 잔차를 활용한 RLA 기법을 통해 연산 효율을 극대화하면서도 복잡한 3D 환경에서 정확한 물리적 예측과 정책 학습이 가능함을 입증했다.

HF Daily Papers3달 전· 3달 전 발행

양자 영감 모델로 태양 주기 예측 정확도 13배 향상 및 파라미터 90% 절감

기존 양자 시퀀스 모델은 하드웨어의 잡음과 확장성 문제로 긴 데이터를 처리하기 어려웠다. 이 논문은 단일 큐비트 기반의 QKAN과 게이트 메커니즘을 결합하여, 훨씬 적은 파라미터로도 기존 LSTM보다 정확한 예측 성능을 보여주며 실제 양자 컴퓨터에서도 동작 가능함을 입증했다.

HF Daily Papers3달 전· 3달 전 발행

CGM-JEPA, 연속 혈당 데이터로 당뇨 전조 증상 예측 정확도 6.5% 향상

연속 혈당 측정(CGM) 데이터는 기기나 측정 환경에 따라 데이터 형태가 달라져 범용적인 분석 모델을 만들기 어려웠다. 이 논문은 원시 데이터를 복원하는 대신 추상적인 특징을 예측하는 JEPA 구조를 도입하여, 병원 검사 결과와 가정용 센서 데이터 간의 격차를 줄이고 인슐린 저항성 등 대사 질환의 조기 진단 가능성을 높였다.

HF Daily Papers3달 전· 3달 전 발행

LLM 에이전트의 실패를 실시간으로 감지하는 PrefixGuard 프레임워크

LLM 에이전트가 복잡한 도구 사용 작업을 수행할 때, 작업이 완전히 끝난 뒤에야 실패를 확인하면 이미 돌이킬 수 없는 손실이 발생할 수 있다. 이 논문은 에이전트의 실행 기록(Trace)을 실시간으로 분석하여 실패 가능성을 미리 경고함으로써 조기에 개입할 수 있는 실용적인 모니터링 기술을 제공한다.

HF Daily Papers3달 전· 3달 전 발행

LLM이 강화학습의 관측값과 보상을 직접 설계하여 성능 극대화

강화학습에서 에이전트가 무엇을 보고 어떤 보상을 받을지 설계하는 인터페이스 엔지니어링은 수동 작업이 많이 필요한 병목 구간이다. 이 논문은 LLM을 활용해 관측값 매핑과 보상 함수를 파이썬 코드로 자동 생성하고 진화시켜 사람이 설계한 것보다 효율적인 인터페이스를 찾아낸다.

HF Daily Papers3달 전· 3달 전 발행

AI 에이전트 시대, 인간의 임금 하한선은 GPU 대여료가 결정한다

AI 에이전트가 인간의 지식 노동을 대체함에 따라 임금이 0으로 수렴할 것이라는 막연한 공포를 경제학적 모델로 반박한다. 인간의 임금은 노동 시장이 아니라 GPU 대여료와 같은 연산 자본 시장의 가격에 의해 하한선이 형성됨을 입증하여 향후 AI 정책과 경제적 예측에 새로운 틀을 제공한다.

HF Daily Papers3달 전· 3달 전 발행

4만 개 모델 중 내 데이터에 딱 맞는 모델을 0초 만에 추천

Hugging Face에 수십만 개의 모델이 쏟아지는 상황에서, 내 데이터셋에 어떤 모델이 가장 좋을지 일일이 테스트하는 것은 불가능에 가깝다. 이 논문은 모델을 직접 실행해보지 않고도 공개된 리더보드 기록과 메타데이터만으로 최적의 모델을 순위 매겨주는 통합 프레임워크를 제시하여 모델 선택 비용을 획기적으로 줄여준다.

HF Daily Papers3달 전· 3달 전 발행

LLM 에이전트의 진화 단계: 단순 저장에서 자율적 경험 학습으로

LLM 기반 에이전트가 복잡한 다단계 작업을 수행할 때 발생하는 논리적 일관성 부족과 반복적인 추론 오류를 해결하기 위한 메모리 기술의 발전 방향을 제시한다. 단순한 데이터 기록을 넘어 에이전트가 스스로 경험을 추상화하고 자율적으로 진화할 수 있는 기술적 로드맵을 제공한다는 점에서 중요하다.

HF Daily Papers3달 전· 3달 전 발행

이해 능력을 생성의 촉매제로 활용하여 이미지 생성 품질 대폭 향상

기존의 통합 멀티모달 모델은 이해와 생성 기능이 분리되어 서로의 장점을 충분히 활용하지 못하는 한계가 있었다. 이 논문은 모델의 이해 능력을 생성 과정의 직접적인 감독 신호로 전환하여 복잡한 지시문 준수 능력과 이미지 세부 묘사를 획기적으로 개선했다.

HF Daily Papers3달 전· 3달 전 발행

시각적 단서로 검색을 제어하는 AI 에이전트 벤치마크 공개

기존 AI 에이전트 검색이 이미지를 단순히 최종 답변 확인용으로만 썼다면, 이 논문은 이미지를 다음 검색 방향을 결정하는 핵심 단서로 활용하는 능력을 평가합니다. 실제 웹 환경처럼 텍스트와 이미지가 복잡하게 얽힌 상황에서 AI의 추론 능력을 한 단계 높이는 이정표가 될 것입니다.

HF Daily Papers3달 전· 3달 전 발행

토크나이저 없는 BLT 모델, 디퓨전 기법으로 추론 속도 92% 향상

기존의 바이트 단위 언어 모델은 토크나이저 없이 노이즈에 강하다는 장점이 있지만, 한 바이트씩 생성하는 속도가 매우 느려 실무 적용이 어려웠다. 이 논문은 디퓨전 기법과 자기 추측 디코딩을 도입하여 바이트 모델의 고질적인 속도 문제를 해결하고 메모리 대역폭 비용을 50% 이상 절감했다.

HF Daily Papers3달 전· 3달 전 발행

AI 에이전트 보안 비상, 50개 가상 환경에서 취약점 95% 노출

AI 에이전트가 이메일 관리나 금융 거래 등 실생활에 깊숙이 관여하면서 보안 위험이 급증하고 있지만, 이를 체계적으로 평가할 안전한 시뮬레이션 환경이 부족했습니다. 이 논문은 실제 서비스와 유사한 50개 이상의 환경을 제공하여 에이전트의 보안 취약점을 자동으로 탐지하고 평가할 수 있는 표준 플랫폼을 제시합니다.

HF Daily Papers3달 전· 3달 전 발행

LLM의 의도 파악 능력, 무작위 추측보다 낮은 25% 미만 충격적 결과

현재의 대형 언어 모델들이 텍스트 생성 능력은 뛰어나지만 사용자의 실제 의도를 파악하는 능력은 현저히 떨어진다는 사실을 정량적으로 입증했다. 이를 해결하기 위한 새로운 벤치마크와 학습 방법론을 제시함으로써 더 안전하고 유능한 AI 비서 개발의 토대를 마련했다.

HF Daily Papers3달 전· 3달 전 발행

LLM 에이전트 성능 40% 좌우하는 프롬프트 형식, 컴파일러로 자동 최적화

LLM 에이전트가 사용하는 기술(Skill)은 프롬프트 형식에 따라 성능 차이가 최대 40%까지 발생하지만, 기존에는 각 플랫폼에 맞춰 수동으로 재작성해야 했습니다. SkCC는 이를 해결하기 위해 하나의 소스로 여러 에이전트 프레임워크에 최적화된 형식을 자동 생성하고 보안 취약점까지 사전에 차단하는 컴파일러 기반의 새로운 접근 방식을 제시합니다.

HF Daily Papers3달 전· 3달 전 발행

챗봇 중심 AI 패러다임이 초래하는 사회적·인지적 위험 분석

현재 AI 산업이 대화형 챗봇 인터페이스로 급격히 수렴하면서 발생하는 구조적 부작용을 비판적으로 분석합니다. 챗봇 형태의 AI가 인간의 비판적 사고력을 약화시키고 노동 시장과 환경에 미치는 부정적 영향을 조명하며, 이를 극복하기 위한 다원적 설계 방향을 제시합니다.

HF Daily Papers3달 전· 3달 전 발행

PAE: 기존 대비 13배 빠른 수렴과 SOTA 성능을 달성한 새로운 토크나이저

기존의 토크나이저들은 단순히 이미지를 잘 복원하는 데만 집중하여 확산 모델이 학습하기 어려운 복잡한 잠재 공간을 만들었습니다. 이 논문은 확산 모델이 학습하기 쉬운 공간의 특성을 정의하고 이를 강제하는 PAE를 제안하여 학습 효율과 생성 품질을 동시에 획기적으로 개선했습니다.

HF Daily Papers3달 전· 3달 전 발행

단 4단계의 디노이징으로 SOTA급 이미지를 생성하는 NTM 프레임워크

기존의 소수 단계 이미지 생성 기법들은 속도를 위해 확률적 우도 프레임워크를 포기하여 학습 안정성과 품질에 한계가 있었다. NTM은 각 역과정을 가역적인 Normalizing Flow로 모델링하여 정확한 우도 학습을 유지하면서도 단 4번의 샘플링만으로 고품질 이미지를 생성한다.

HF Daily Papers3달 전· 3달 전 발행

300개 이상의 작업을 잊지 않고 학습하는 지속적 학습 모델 CaRE 공개

기존의 지속적 학습 모델들이 20개 내외의 적은 작업 수에서만 검증되었던 한계를 극복하고, 300개 이상의 방대한 작업 시퀀스에서도 성능 저하 없이 학습할 수 있는 확장성을 증명했다. 이는 실제 환경처럼 끊임없이 새로운 정보가 유입되는 상황에서 AI가 지식을 누적하며 성장할 수 있는 발판을 마련했다.

HF Daily Papers3달 전· 3달 전 발행

강화학습으로 진화한 RAG, 1,000만 토큰에서도 정확한 다단계 검색 달성

기존의 다단계 RAG는 LLM 자체를 파인튜닝해야 하므로 비용이 매우 높고 대형 모델 적용이 어려웠다. 이 논문은 LLM 대신 가벼운 Embedder 모델만 강화학습으로 최적화하여, 훨씬 적은 비용으로도 초장문 컨텍스트에서 복잡한 추론 검색을 수행할 수 있음을 입증했다.

HF Daily Papers3달 전· 3달 전 발행

외부 모델 없이 LLM 스스로 성능을 5.4점 높이는 UniSD 프레임워크

강력한 외부 교사 모델에 의존하지 않고 LLM이 생성한 데이터만으로 모델을 개선하는 Self-Distillation의 한계를 극복했습니다. 데이터의 신뢰성, 표현 정렬, 학습 안정성을 동시에 해결하여 자원 제약 환경에서도 효율적인 모델 고도화가 가능함을 입증했습니다.

HF Daily Papers3달 전· 3달 전 발행

5분 이상의 긴 영상도 끊김 없이 일관되게 생성하는 A2RD 기술 공개

기존 비디오 생성 모델은 영상이 길어질수록 내용이 산으로 가거나 캐릭터의 모습이 변하는 문제가 있었다. 이 논문은 에이전트 구조를 도입해 기억을 관리하고 스스로 오류를 수정함으로써 10분 분량의 긴 영상에서도 일관된 서사를 유지하는 방법을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

복잡한 이미지 생성의 한계 극복, SCOPE로 의도 일치율 39% 향상

기존 텍스트-이미지 모델은 복잡한 프롬프트의 세부 사항을 모두 반영하지 못하는 Conceptual Rift 현상을 겪는다. SCOPE는 이를 해결하기 위해 생성 과정을 구조화된 명세서 기반으로 관리하며, 검색과 추론 기능을 결합해 사용자 의도에 완벽히 부합하는 고품질 이미지를 생성한다.

HF Daily Papers3달 전· 3달 전 발행

음악만으로 고품질 댄스 영상 생성, MACE-Dance로 SOTA 달성

음악에 맞춰 춤추는 영상을 생성할 때 발생하는 동작의 물리적 어색함과 외형의 불일치 문제를 동작 전문가와 외형 전문가를 분리한 MoE 구조로 해결했다. 3D 동작 파라미터를 중간 매개체로 사용하여 기존 2D 기반 방식보다 훨씬 정교하고 역동적인 댄스 비디오 생성이 가능하다.

HF Daily Papers3달 전· 3달 전 발행

VLM의 한계 돌파, 4D 잠재 정신 이미저리로 동적 공간 추론 성능 34% 향상

기존 시각 언어 모델(VLM)은 비디오 속 객체의 움직임과 카메라의 이동이 결합된 복잡한 4D 동적 장면을 이해하는 데 어려움을 겪었다. 이 논문은 외부 기하학적 모듈 없이 모델 내부의 잠재 공간에서 장면의 진화를 시뮬레이션하는 4DThinker 프레임워크를 통해 자율 주행 및 로보틱스 분야에 필수적인 동적 공간 추론 능력을 획기적으로 개선했다.

HF Daily Papers3달 전· 3달 전 발행

단 하나의 체크포인트로 모든 Rank 대응, MatryoshkaLoRA 공개

기존 LoRA는 학습 시 설정한 고정된 Rank(r)에서만 동작하여 최적의 효율을 찾기 위해 반복적인 실험이 필요했다. 이 논문은 하나의 모델 학습만으로 다양한 Rank를 자유롭게 선택해 사용할 수 있게 하여 연산 비용을 획기적으로 줄이고 가변적인 하드웨어 환경에 즉각 대응할 수 있게 한다.

HF Daily Papers3달 전· 3달 전 발행

Mamba 등 Affine 순환 모델의 장기 상태 추적 실패 원인 규명

Mamba나 Linear Attention과 같은 최신 순환 모델들이 이론적인 표현력에도 불구하고 왜 긴 시퀀스에서 상태 추적에 실패하는지 분석했다. 오차 제어 역학이라는 새로운 관점을 통해 모델의 구조적 한계가 장기적인 정확도 저하로 이어지는 과정을 수학적으로 증명했다.

HF Daily Papers3달 전· 3달 전 발행

1000층 깊이의 DiT 학습 성공, 평균 모드 스크리밍 현상 해결

Diffusion Transformer(DiT)를 수백 개 이상의 레이어로 확장할 때 발생하는 갑작스러운 학습 붕괴 현상인 Mean Mode Screaming(MMS)의 원인을 규명했다. 이를 해결하는 MV-Split Residuals 기법을 통해 1000개 레이어의 초거대 모델도 안정적으로 학습할 수 있는 기술적 토대를 마련했다.

HF Daily Papers3달 전· 3달 전 발행

HyperEyes: 검색 횟수는 5.3배 줄이고 정확도는 9.9% 높인 병렬 검색 에이전트

기존 멀티모달 검색 에이전트는 여러 대상을 찾을 때 하나씩 순차적으로 검색하여 시간이 오래 걸리고 불필요한 비용이 발생했다. 이 논문은 여러 대상을 한 번에 병렬로 검색하는 기법과 효율성을 극대화하는 강화학습 프레임워크를 통해 검색 속도와 정확도를 동시에 획기적으로 개선했다.

HF Daily Papers3달 전· 3달 전 발행

LPO: LLM의 추론 능력을 극대화하는 새로운 리스트 기반 강화학습 기법

기존의 LLM 강화학습 방식인 GRPO 등은 보상 신호를 근사적으로만 처리하여 학습의 안정성이 떨어지는 문제가 있었다. 이 논문은 응답들을 하나의 확률 공간(Simplex)으로 정의하고 수학적으로 정확한 타겟에 직접 투영하는 LPO 기법을 통해 학습 효율과 응답의 다양성을 동시에 확보했다.

HF Daily Papers3달 전· 3달 전 발행

UniPrefill, LLM 첫 토큰 생성 속도 최대 2.1배 향상

최신 LLM들이 긴 문맥을 처리하기 위해 다양한 하이브리드 구조를 채택하고 있지만, 기존 가속화 기법들은 특정 구조에만 국한되거나 실제 서비스 환경인 vLLM과의 통합이 어려웠습니다. UniPrefill은 모델 구조에 상관없이 적용 가능한 토큰 삭제 전략을 통해 연산량을 획기적으로 줄이면서도 정확도를 유지하며, 실제 추론 엔진에 즉시 배포 가능한 수준의 통합을 구현했습니다.

HF Daily Papers3달 전· 3달 전 발행

100만 시간의 인간 비디오로 로봇 학습 데이터 부족 문제 해결

물리적 지능(Embodied Intelligence) 발전을 가로막는 가장 큰 병목 현상인 로봇 전용 데이터의 부족 문제를 해결하기 위해 인터넷상의 방대한 인간 활동 비디오를 활용하는 새로운 패러다임을 제시합니다. 1,000시간의 인간 비디오 학습이 100시간의 실제 로봇 데이터 학습 성능을 능가함을 입증하여 로봇 학습의 확장성을 확보했습니다.

HF Daily Papers3달 전· 3달 전 발행

Flow-OPD, Stable Diffusion 3.5의 OCR 정확도를 59%에서 94%로 폭발적 향상

기존 Flow Matching 기반 이미지 생성 모델은 여러 작업을 동시에 학습할 때 성능이 상충하는 시소 효과와 보상 해킹 문제에 시달렸다. Flow-OPD는 거대 언어 모델의 온-폴리시 증류 기법을 이미지 생성에 최초로 도입하여, 텍스트 렌더링과 미적 품질을 동시에 극대화하는 새로운 정렬 패러다임을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

이방성 잔차 정렬로 텍스트 데이터만 사용해 멀티모달 모델 성능 극대화

멀티모달 모델 학습 시 고품질의 쌍(paired) 데이터를 확보하는 비용 문제를 해결하기 위해 단일 모달리티 데이터만으로 학습하는 새로운 패러다임을 제시한다. 모달리티 간의 간극(Modality Gap)을 단순한 위치 차이가 아닌 특정 방향으로 쏠린 기하학적 구조로 정의하여 정밀한 정렬을 가능하게 한다.

HF Daily Papers3달 전· 3달 전 발행

코드 검색 성능 2배 향상시키는 새로운 벤치마크 CoREB 공개

기존 코드 검색 평가 도구들이 단순히 텍스트 유사도만 측정하고 실제 개발 환경의 복잡한 리랭킹 과정을 무시하는 문제를 해결합니다. 데이터 오염을 엄격히 차단한 새로운 벤치마크 CoREB과 전용 리랭커 모델을 통해 AI 코딩 에이전트의 정확도를 실질적으로 높일 수 있는 기반을 마련했습니다.

HF Daily Papers3달 전· 3달 전 발행

AutoTTS: 단 40달러로 LLM 추론 성능을 최적화하는 자동화 프레임워크

LLM 추론 시 연산량을 늘려 성능을 높이는 Test-Time Scaling(TTS) 전략은 그동안 연구자의 직관에 의존해 수동으로 설계되었습니다. AutoTTS는 이러한 전략 설계를 자동화하여 단 39.9달러의 비용과 160분의 탐색만으로 기존 수동 설계 방식보다 뛰어난 정확도-비용 효율을 달성했습니다.

LLM이 뱉는 망가진 JSON, 15가지 전략으로 완벽하게 복구하기

288회의 모델 호출 테스트를 통해 LLM의 JSON 출력 오류 패턴을 분석하고, 이를 자동으로 수정 및 검증하는 파이썬 라이브러리 outputguard를 개발한 사례입니다.

a16z 공동 창업자 벤 호로위츠가 밝히는 AI 시대의 새로운 투자 공식

Andreessen Horowitz의 공동 창업자 벤 호로위츠가 AI 기술이 벤처 캐피털의 투자 전략, 기업의 경쟁 우위(Moat), 그리고 조직 문화에 미치는 근본적인 변화를 공유합니다.