본문으로 건너뛰기

2026년 3월 21일 AI 뉴스

100

관심 태그 추가

RAG의 한계를 넘다: 98.7% 정확도의 PageIndex 기술 공개

전통적인 RAG의 청킹과 임베딩 방식 대신 AI 기반 추론 트리를 활용해 문서 구조를 탐색함으로써 복잡한 문서 Q&A 정확도를 98.7%까지 높이는 PageIndex 기법을 소개한다.

읽을 시간은 없고 정보는 넘친다면? LLM이 점수 매겨주는 RSS 리더

LLM을 활용해 RSS 피드의 기술적 가치를 0-10점으로 평가하고 요약하여 정보 과잉을 해결하는 오픈소스 엔지니어용 리더입니다.

클릭률 10% 상승의 비밀! AI가 스스로 학습하고 개선하는 썸네일 자동화 루프

유튜브 CTR 데이터를 분석하고 Gemini로 썸네일을 평가하여 생성 프롬프트를 스스로 개선하는 데이터 기반 자동화 시스템 구축 과정을 다룹니다.

1,000 큐비트 양자 시뮬레이션으로 구현한 100% 정확도의 정보 필터링

GloVe 임베딩을 SO(3) 회전으로 변환하여 행렬 곱 상태(MPS) 양자 시뮬레이터의 엔트로피를 제어함으로써 고효율 정보 필터링을 구현한 연구이다.

상처 속까지 들여다보는 AI: 듀크대와 노키아 벨 연구소의 혁신

듀크 대학교와 노키아 벨 연구소는 OCT 이미징과 AI를 결합하여 피부 표면 아래의 상처 치유 과정을 객관적으로 측정하고 최적의 하이드로젤 특성을 규명했다.

"커피 머신으로 가줘" 말 한마디에 움직이는 AI 스마트 휠체어

독일 인공지능 연구소(DFKI)가 자연어 명령과 드론 연동 센서 시스템을 활용해 중증 장애인의 이동성을 극대화하는 스마트 휠체어 프로토타입을 개발했다.

RTX 5070 Ti로 도전한 불가리아어 로컬 음성 클로닝의 현실

RTX 5070 Ti 환경에서 XTTS-v2와 Fish Speech 1.5를 이용해 불가리아어 음성 클로닝을 시도했으나 언어 지원 미비와 라이브러리 호환성 문제로 겪은 한계를 공유한다.

AI가 스스로 프롬프트를 재설계하게 만드는 '로직 아키텍트' 기법

AI가 사용자 요청을 분석해 페르소나와 제약 사항이 담긴 시스템 프롬프트로 스스로 재설계하게 하여 작업 효율을 극대화하는 프레임워크이다.

AI 에이전트판 TCP/IP? API 키 없는 P2P 네트워크 ClawNet 등장

ClawNet은 API 키나 플랫폼 비용 없이 로컬 에이전트들이 직접 협업할 수 있도록 지원하는 탈중앙화 P2P AI 에이전트 네트워크이다.

AI가 그린 손, 1000장 중 단 25%만 정상이었다

1,000장의 손 이미지 생성 실험 결과, 구조적으로 올바른 비율은 25% 미만이며 모델 내부의 상충하는 표현 방식이 일정한 실패 패턴을 유발한다는 사실이 확인됐다.

무료 VPN은 당신의 데이터를 팝니다 전문가가 밝히는 VPN의 진실

IBM 엔지니어 제프 크룸이 개인용 VPN의 작동 원리, 보안 한계, 그리고 익명성 확보를 위한 Tor와의 차이점을 상세히 분석한다.

보상 설계 없이 뇌 모델로 로봇 강아지를 학습시키다

표준 강화학습 대신 스파이킹 신경망과 소뇌 모델, 예측 부호화 기반의 생물학적 학습 메커니즘을 활용한 오픈 소스 로봇 제어 프레임워크 MH-FLOCKE를 제안한다.

메타 AI 에이전트의 실수로 보안 비상? 이번 주 주요 AI 보안 이슈 정리

메타 AI 에이전트 오작동에 따른 데이터 노출 사고와 암호화 AI 플랫폼 Confer 도입 등 주요 AI 보안 및 프라이버시 이슈가 보고되었다.

Ben's Bites4달 전

비개발자도 AI로 앱을 만든다? 벤 토셀의 최신 AI 빌딩 스택 공개

비개발자를 위한 AI 빌딩 교육 과정 'Fork Off' 준비 과정과 Replit Agent 4 사용 후기, Claude Cowork의 새로운 기능을 공유합니다.

r/AGI4달 전· 4달 전 발행

25억 달러 규모 엔비디아 AI 칩이 중국으로 밀수됐다

슈퍼마이크로 공동 창업자가 유령 회사와 위장 서버를 이용해 25억 달러 상당의 엔비디아 AI 칩을 중국으로 밀수한 혐의로 기소됐다.

단 235줄의 코드로 AI 에이전트의 자율성과 보안을 동시에 잡다

elastik은 HTTP와 SQLite를 기반으로 AI가 브라우저에 UI를 렌더링하고 도구를 실행하며 스스로 진화할 수 있게 돕는 5가지 규칙의 초경량 상호작용 프로토콜이다.

단 40KB의 기적, Claude가 분석한 Turbo Pascal의 내부 구조

Simon Willison이 Claude를 사용하여 1985년 출시된 39KB 크기의 Turbo Pascal 3.02A 바이너리를 분석하고 메모리 맵과 소스 코드를 재구성한 사례를 공유한다.

HF Daily Papers4달 전· 5달 전 발행

단일 언어 데이터만으로 101개 언어 번역 성능을 극대화한 WALAR 기법

저자원 언어 번역에 필수적인 고품질 병렬 데이터가 부족한 한계를 극복하기 위해 단일 언어 텍스트만으로 학습 가능한 강화학습 프레임워크를 제시한다. 기존 품질 평가 모델의 취약점을 보완하여 모델이 입력을 단순히 복사하거나 엉뚱한 언어를 생성하는 리워드 해킹 문제를 해결함으로써 다국어 LLM의 실용성을 높였다.

HF Daily Papers4달 전· 4달 전 발행

LLM 시간 추론의 비밀: 저사양 언어는 토큰화, 고사양 언어는 선형성이 결정한다

LLM이 날짜 계산이나 시간 관계 파악에 어려움을 겪는 근본 원인을 다국어 관점에서 분석했다. 언어의 자원 수준에 따라 성능 저하의 원인이 입력 단계의 토큰 쪼개짐인지 아니면 내부의 추상적 표현 능력인지가 달라짐을 밝혀 모델 개선의 방향성을 제시한다.

Fireworks AI4달 전

API 래퍼는 끝났다: Fireworks AI가 제안하는 10배 저렴한 고성능 AI 구축법

Fireworks AI의 CEO 린 차오가 NVIDIA GTC에서 오픈소스 모델의 효율적인 추론과 데이터 활성화를 통한 TCO 10배 절감 방안을 제시한다.

제프 베이조스의 1,000억 달러 펀드와 애플의 바이브 코딩 제동: AI의 미래는?

AI 업계 리더들의 낙관론과 규제 갈등 속에서 코딩 능력이 지식 노동의 핵심 인터페이스로 부상하며 모든 AI 제품이 슈퍼 앱으로 수렴하고 있다.

Databricks4달 전

생성형 AI 프로젝트 95%가 실패하는 이유와 데이터브릭스의 해법

데이터브릭스가 발표한 Agent Bricks는 기업이 AI 에이전트를 프로덕션 환경에 안전하고 정확하게 배포할 수 있도록 돕는 통합 솔루션이다.

JeredBlu4달 전

Claude Code를 텔레그램에서? Anthropic의 새로운 에이전트 제어 기능 완벽 가이드

Anthropic이 출시한 Claude Code Channels 기능을 통해 텔레그램에서 AI 에이전트를 원격 제어하고 자동화하는 방법과 현재의 기술적 한계를 상세히 다룹니다.

Stripe CTO 출신이 만든 AI 에이전트 OS, Dreamer가 그리는 미래

전 Stripe CTO David Singleton이 설립한 Dreamer는 사용자가 자연어로 에이전트를 구축하고 개발자가 도구를 수익화할 수 있는 풀스택 AI 에이전트 플랫폼이다.

MCP가 구리다고? Stripe가 500개 도구를 관리하는 비결

Perplexity 등의 비판에도 불구하고 Stripe를 포함한 주요 기업들이 MCP를 통해 에이전트 도구 생태계를 구축하고 확장하는 실전 패턴을 분석한다.

The AI Grid4달 전

변호사, 회계사도 위험하다? MS CEO가 예고한 18개월 뒤 화이트칼라의 운명

마이크로소프트와 앤스로픽 CEO의 전망을 바탕으로 AI가 화이트칼라 직종에 미칠 파괴적 영향과 기업의 대응 사례, 그리고 새로운 고용 시장의 변화를 분석한다.

AI가 쓴 소설인가? 베스트셀러 '샤이 걸' 출판 전격 취소

뉴욕타임스가 소설 '샤이 걸'의 상당 부분이 AI로 작성되었다는 의혹을 제기하자 출판사 하셰트가 해당 도서의 출판 및 유통을 전격 취소했다.

Cursor의 새로운 비밀 병기? Composer 2의 기반은 Kimi-k2.5였다

Cursor가 출시한 Composer 2가 Kimi-k2.5 모델을 기반으로 하며, Fireworks AI의 인프라를 통해 RL 학습과 추론이 이루어짐이 공식 확인됐다.

AI 에이전트 개발도 이제 TDD처럼? Databricks의 coSTAR 프레임워크 공개

Databricks는 AI 에이전트의 비결정성 해결을 위해 시나리오, 트레이스, 평가, 개선을 자동화하는 coSTAR 방법론과 MLflow 기반 테스트 시스템을 구축했다.

Databricks4달 전

440만 건의 상담 분석부터 신약 개발까지, Databricks AI 에이전트 실전 사례

Databricks의 Agent Bricks 프레임워크를 활용하여 헬스케어 기업들이 환자 관리, 신약 연구, 영업 최적화 등 복잡한 워크플로를 엔드투엔드로 자동화하는 실전 사례를 제시한다.

엔비디아 1조 달러 매출 전망과 로봇 시대를 여는 OpenClaw 전략

엔비디아의 GTC 기조연설과 OpenClaw 전략을 중심으로 리비안-우버 파트너십, xAI의 조직 변화 등 최신 AI 및 모빌리티 트렌드를 분석한다.

오픈 소스 비전 AI의 혁신: DeepSeek의 강력한 멀티모달 모델 라인업 총정리

DeepSeek가 출시한 다양한 오픈 웨이트 비전-언어 모델들의 아키텍처와 주요 기능을 살펴보고, Roboflow Supervision을 활용한 실전 적용 방법을 제시한다.

단 하루, GPU 1대로 도메인 특화 임베딩 성능 26% 향상하기

NVIDIA NeMo를 활용해 수동 라벨링 없이 합성 데이터와 하드 네거티브 마이닝으로 도메인 특화 임베딩 모델을 하루 만에 구축하고 배포하는 파이프라인이다.

가중치 조작이 쉬워지는 JAX 기반 FP 스타일 라이브러리 Zephyr

JAX를 기반으로 가중치를 딕셔너리 형태로 관리하여 복잡한 가중치 조작과 함수형 프로그래밍을 용이하게 만드는 신경망 라이브러리 Zephyr를 소개한다.

심장 초음파와 AI의 결합, 중증 심부전 진단 병목을 뚫다

Weill Cornell Medicine 연구진이 심장 초음파와 EHR 데이터를 AI로 분석하여 고가의 장비 없이도 중증 심부전의 핵심 지표인 최대 산소 섭취량을 정확히 예측하는 기술을 개발했다.

이 토마토는 따기 쉽네 스스로 판단해 수확하는 AI 로봇의 등장

오사카 공립 대학 연구팀이 이미지 인식과 통계적 기법을 결합하여 토마토의 수확 용이성을 정량적으로 평가하고 최적의 접근 각도를 결정하는 지능형 로봇 시스템을 개발했다.

단 몇 초 만에 분자의 지문을 찾다: 화학 혁신을 이끄는 GPR 모델

가우시안 프로세스 회귀를 기반으로 4,800개 이상의 이중원자 분자의 쌍극자 모멘트를 초 단위로 정확하게 예측하는 AI 모델이 개발되어 화학 연구 효율성을 극대화했다.

GPT-4o와 Claude가 우주 식민지 윤리를 두고 끝장 토론을 벌인다면?

GPT-4o, Claude, Gemini 등 서로 다른 AI 모델들이 특정 주제에 대해 실시간 검색 결과를 바탕으로 토론하고 투표하는 멀티 에이전트 플랫폼이다.

r/artificial4달 전· 4달 전 발행

내 주머니 속의 AI 토론장: Llama 3.2로 구현한 4인격 자율 에이전트

안드로이드 스마트폰에서 Llama 3.2 3B 모델과 Ollama를 활용해 외부 서버 없이 4가지 서로 다른 인격의 AI 에이전트들이 끊임없이 토론하는 로컬 멀티 에이전트 시스템을 구현했다.

서로가 AI인 줄 모른 채 9분 동안 딥러닝을 토론하는 두 AI

OpenAI Realtime API를 통해 두 기기에서 실행된 AI 세션들이 서로의 정체를 모른 채 9분간 철학적 담론과 AI 기술 개념을 주고받은 실험 사례이다.

AI 도구도 결국 소프트웨어, Claude Code에서 발견된 고전적 보안 결함

Anthropic의 Claude Code CLI에서 발견된 CVE-2026-33068 취약점은 AI 특화 공격이 아닌 설정 로딩 순서 오류라는 고전적 소프트웨어 보안 결함임이 확인됐다.

당신의 SaaS는 AI 에이전트에게 불친절하다? operate.txt로 해결하세요

AI 에이전트가 SaaS UI를 원활하게 탐색하고 조작할 수 있도록 제품의 동작 방식과 제약 사항을 기술하는 YAML 기반의 표준 규격인 operate.txt를 제안한다.

OpenAI의 2030년 매출 2800억 달러 목표는 환상인가?

OpenAI가 2030년까지 매출 2,800억 달러 달성을 목표로 하는 가운데, 유럽의 독자적 AI 인프라 구축 움직임이 이 목표 달성의 변수로 떠올랐다.

데이터 없는 지역도 홍수 예측 가능해진다: AI 시계열 모델의 혁신

텍사스 대학교 연구진이 방대한 시계열 데이터로 학습된 파운데이션 모델이 관측 자료가 부족한 지역에서도 하천 유량을 정확히 예측할 수 있음을 입증했다.

r/artificial4달 전

에이전트에게 '통증'을 가르치다: 단순 저장보다 강력한 실시간 초인지 시스템

기존의 수동적 메모리 검색 방식 대신, 실시간 고유 감각(Proprioception)과 강화 추적(Reinforcement Tracking)을 통해 에이전트의 오류를 방지하고 학습하는 'Metacog' 시스템이다.

중국 AI 모델들의 잇따른 유료화, 오픈소스의 시대는 끝났는가?

MiniMax m2.7과 Qwen 3.5 Max가 폐쇄형 모델로 출시됨에 따라 중국 AI 연구소들의 오픈소스 전략 변화와 그에 따른 커뮤니티의 우려를 다룬다.

열역학 계산에서 Claude Opus가 GPT-5.4를 제치고 1위를 차지했다

293개의 개방형 계산 문제로 구성된 ThermoQA 벤치마크를 통해 주요 LLM의 열역학 추론 능력을 평가한 결과, Claude Opus가 종합 1위를 기록했다.

버려진 MI50의 부활: ROCm 6.4에서 llama.cpp 62 t/s 달성하기

공식 지원이 중단된 AMD MI50 GPU에서 ROCm 6.4와 llama.cpp를 활용해 고속 추론 환경을 구축하는 3단계 해결 방법을 제시한다.

내 문서에 대해 수천 명의 가상 인물이 토론한다면? 로컬 GraphRAG 시뮬레이터 MURM

Ollama와 ChromaDB를 활용해 문서에 대한 다양한 가상 인물들의 토론을 시뮬레이션하고 GraphRAG로 시각화하는 오픈소스 로컬 군집 지능 도구이다.

300달러짜리 CPU로 39분 만에 나만의 GPT 모델 만들기

PyTorch를 사용하여 사전 학습된 가중치 없이 캐릭터 단위로 텍스트를 생성하는 0.82M 파라미터 규모의 GPT 트랜스포머를 밑바닥부터 구현하고 학습한 사례이다.

Claude의 독보적 성능, 비밀은 아키텍처가 아닌 정교한 데이터 큐레이션에 있다

Claude Opus의 추론 트레이스를 활용한 로컬 모델의 성능 향상 사례를 통해, 현대 LLM의 경쟁력이 아키텍처 개선보다 고품질 데이터 큐레이션과 학습 방법론에 있음을 논의한다.

스스로 코딩하는 AI 에이전트 Selene, SWE-bench Lite에서 61% 기록

로컬 우선 AI 에이전트 Selene의 개발자가 SWE-bench Lite 성능 결과와 함께 음성 파이프라인, Docling 통합, 브라우저 도구 등 대규모 업데이트를 공유했다.

4x RTX 3090 서버 구축, PCIe x4 병목 현상이 학습 성능을 얼마나 깎아먹을까?

4개의 RTX 3090을 활용한 LLM 서버 구축 시, 소비자용 AM5 플랫폼의 PCIe 레인 부족으로 인한 병목 현상과 중고 서버용 EPYC 플랫폼 도입 사이의 기술적 득실을 비교한 내용이다.

AI 디버깅의 늪 '패치 스파이럴' 탈출을 위한 경로 우선 전략

AI 디버깅 시 발생하는 잘못된 진단과 패치 누적 문제를 해결하기 위해 수리 전 문제 영역을 먼저 식별하는 '경로 우선(Route-first)' 프레임워크인 Problem Map 3.0을 제안한다.

LLM 보안과 성능을 한 번에 해결하는 오픈소스 LLMProxy v1.0.0

WAF 보안 기능과 캐싱 최적화를 결합하고 WASM 기반 플러그인 시스템을 갖춘 LLM 전용 프록시 도구 LLMProxy가 오픈소스로 공개됐다.

8GB VRAM으로 7B 모델을? 소비자용 GPU를 위한 LLM 학습 프레임워크 GSST

고가의 클라우드 GPU 없이도 레이어별 순차 처리를 통해 저사양 소비자용 GPU에서 최대 7B 파라미터 모델을 학습할 수 있는 GSST 프레임워크가 공개됐다.

"업계 관행을 무시하라" AI의 한계를 깨는 3가지 진리 추출법

문제의 근본적인 3가지 진리만을 사용하여 기존 관행을 배제하고 해결책을 도출하도록 강제하는 '제1원칙' 기반의 프롬프트 프로토콜이다.

프롬프트 노가다 끝? YAML 설정으로 100개 모델 동시 테스트

여러 프롬프트 변체와 모델을 조합하여 자동 실행하고, 규칙 기반 휴리스틱과 AI 심사위원으로 점수를 매겨 최적의 조합을 찾아주는 Python CLI 도구이다.

어떻게 묻느냐가 답변을 결정한다: LLM 거부를 피하는 4단계 프롬프트 기법

3년간 1,000개 이상의 프롬프트를 테스트하여 LLM의 거부 반응이 주제가 아닌 요청의 구조와 라우팅 신호에 의해 결정됨을 밝히고 이를 최적화하는 8단계 프레임워크를 제시한다.

난해한 기술 문서, 3단계 원자적 분해로 완벽하게 이해하기

복잡한 기술 개념을 아동용 설명, 비유 기반 용어 정의, 전문가용 요약의 3단계로 구조화하여 AI의 이해와 전달력을 극대화하는 프롬프트 기법이다.

메시지 제한 걱정 끝! ChatGPT 대화 흐름 끊김 없이 이어가는 꿀팁

ChatGPT의 메시지 제한 문제를 해결하기 위해 기존 대화를 요약하여 새 세션으로 매끄럽게 이전하는 실용적인 프롬프트 워크플로우를 공유한다.

추측은 그만, 데이터 기반 콘텐츠 전략을 위한 3단계 프롬프트

과거 게시물의 성과 데이터를 분석하여 월간 전략과 주간 실행 계획을 체계적으로 생성하는 3단계 프롬프트 엔지니어링 워크플로이다.

내가 만든 AI에게 추월당했다: Rainbow DQN으로 정복한 2D 카트 레이싱

Pygame으로 제작한 2D 카트 게임 환경에서 Rainbow DQN 알고리즘을 적용하여 개발자의 주행 실력을 능가하는 레이싱 에이전트를 구현한 프로젝트 사례이다.

r/AGI4달 전· 4달 전 발행

AI가 AI를 해킹하다: 트럼프 목소리로 관리자 권한 탈취

보안 스타트업 CodeWall의 자율형 AI 에이전트가 채용 플랫폼의 취약점을 이용해 관리자 권한을 획득하고 음성 합성으로 사회 공학적 공격을 수행했다.

20년 된 파워북에서 LLM을? C89로 밑바닥부터 만든 빈티지 맥 전용 AI

2002년형 PowerBook G4와 같은 빈티지 매킨토시 하드웨어에서 GPT-2, Qwen 등의 LLM을 로컬로 실행하기 위해 C89로 개발된 커스텀 추론 엔진과 AltiVec SIMD 최적화 기법을 다룹니다.

"Claude에 킬 스위치 없다" Anthropic, 미 국방부 금지 조치에 정면 대응

Anthropic은 미 국방부의 Claude 사용 금지 조치에 대해 모델에 대한 원격 제어 권한이나 킬 스위치가 없음을 강조하며 헌법 위반 소송을 제기했다.

법원이 LLM의 속마음을 보여달라고 한다면? 에어갭 환경의 추론 공개 사례

에어갭 환경에서 구동되는 LLM의 추론 과정을 법적 증거로 제출하기 위해 발생하는 기술적 도전과 해결 과정을 다룹니다.

모델 배포의 늪에서 탈출하기: 팀에 맞는 MLOps 프레임워크 선택법

실험 단계의 머신러닝 모델을 안정적인 프로덕션 환경으로 확장하기 위한 핵심 MLOps 프레임워크들의 특징과 선택 기준을 상세히 비교한다.

HF Daily Papers4달 전· 5달 전 발행

페르시아어 오디오 AI의 한계, 시의 운율과 전통 음악 이해에서 드러나다

기존 오디오-언어 모델(LALM) 평가가 영어와 서구권 문화에 치중되어 있던 한계를 극복하기 위해 페르시아어 특유의 언어적, 문화적 특성을 반영한 최초의 벤치마크를 제시한다. 특히 텍스트로는 파악하기 힘든 시의 운율(vazn)이나 전통 음악 체계(Dastgah) 등을 포함하여, 현재 AI 모델들이 오디오 신호에서 문화적 맥락을 얼마나 추출하지 못하는지를 정량적으로 보여준다.

HF Daily Papers4달 전· 4달 전 발행

보는 것보다 아는 척을 잘한다? MLLM의 인지적 불일치 발견

현재의 멀티모달 AI 모델들이 자연스러운 풍경은 잘 이해하지만, 수학 공식이나 화학 구조식 같은 정밀한 기호를 처리할 때 심각한 인지적 결함을 보인다는 점을 규명했다. 모델이 기호를 정확히 인식하지 못하면서도 언어적 확률에 의존해 정답을 맞히는 현상을 분석하여, 더 신뢰할 수 있는 과학적 AI 개발을 위한 방향성을 제시한다.

HF Daily Papers4달 전· 5달 전 발행

유료 모델 없이 OpenStreetMap만으로 위성 이미지 AI 성능 SOTA 달성

위성 이미지 분석 AI를 구축할 때 발생하는 막대한 데이터 라벨링 비용 문제를 해결했다. 누구나 무료로 쓸 수 있는 OpenStreetMap 지도를 활용해 AI가 스스로 학습 데이터를 만들게 함으로써, 기존 유료 모델 기반 방식보다 저렴하면서도 더 뛰어난 성능을 입증했다.

안드로이드 에이전트의 기억력 한계 극복: ASM 기법으로 작업 성공률 최대 30% 향상

스마트폰 에이전트가 여러 앱을 오가며 복잡한 심부름을 할 때 앞선 단계의 정보를 잊어버리는 고질적인 문제를 해결한다. 단순히 과거를 요약하는 대신 핵심 이정표를 인과관계로 연결해 기억함으로써, 수십 단계가 넘는 긴 작업도 실수 없이 완수할 수 있는 기술적 토대를 마련했다.

HF Daily Papers4달 전· 4달 전 발행

객관식 질문이 AI를 눈멀게 한다? 질문 방식에 따른 VLM의 시각적 편향 발견

동일한 시각적 정보가 필요한 질문이라도 '예/아니오'나 '객관식'처럼 형식이 제한되면 VLM이 이미지보다 텍스트 단서에 의존하며 성능이 저하되는 현상을 규명했다. 이는 벤치마크 평가 방식이 모델의 실제 능력을 왜곡할 수 있음을 시사하며, 간단한 프롬프트 튜닝만으로도 시각적 집중력을 회복할 수 있는 해결책을 제시한다.

HF Daily Papers4달 전· 4달 전 발행

파라미터 업데이트 없이 스스로 기술을 습득하여 성능을 116% 향상시키는 자가 진화형 AI 에이전트

기존 AI 에이전트는 사람이 설계한 고정된 기능에 의존하지만, Memento-Skills는 경험을 통해 새로운 기술을 스스로 생성하고 개선한다. 모델의 가중치를 수정하지 않고도 외부 메모리에 실행 가능한 기술을 축적함으로써, 복잡한 작업에서 지속적으로 성능을 높일 수 있는 새로운 패러다임을 제시한다.

HF Daily Papers4달 전· 4달 전 발행

단일 모델로 끊김 없는 화질 조절, 3D 가우시안 스플래팅의 진화

기존 3D 가우시안 스플래팅은 하드웨어 성능에 따라 화질을 유연하게 조절하기 어려웠으나, 이 논문은 마트료시카 인형처럼 데이터를 중첩 구조로 학습시켜 성능 저하 없이 실시간으로 화질과 속도를 최적화한다. 고사양 PC부터 모바일 기기까지 하나의 모델로 대응할 수 있는 길을 열었다.

HF Daily Papers4달 전· 4달 전 발행

단일 이미지에서 관절형 3D 모델 생성 속도 10배 향상 및 SOTA 달성

기존의 관절형 3D 재구성은 여러 장의 사진이나 복잡한 비디오 생성이 필요해 느리고 불안정했다. 이 논문은 단 한 장의 사진만으로 물체의 구조와 움직임을 단계적으로 추론하여, 로봇 제어나 가상 환경 구축에 즉시 활용 가능한 정교한 3D 모델을 매우 빠르게 생성한다.

HF Daily Papers4달 전· 4달 전 발행

부품 간 관계 학습으로 3D 생성 정밀도 53% 향상 및 자유로운 편집 구현

기존 3D 생성 AI는 물체를 하나의 덩어리로 인식해 세부 부품의 위치나 연결 관계가 어색한 경우가 많았다. 이 논문은 부품별 특징과 부품 간의 논리적 관계를 별도로 학습하여, 훨씬 정교하고 수정이 용이한 3D 모델 생성을 가능하게 한다.

HF Daily Papers4달 전· 5달 전 발행

데이터 군집화로 생성 경로를 직선화하여 단 1단계로 고품질 이미지 생성

기존 생성 AI는 노이즈에서 이미지를 만들 때 경로가 복잡하게 꼬여 있어 여러 번의 반복 계산이 필요했다. 이 기술은 데이터를 비슷한 그룹끼리 묶어 직선 경로를 찾아줌으로써, 계산 횟수를 획기적으로 줄이면서도 선명한 결과를 얻게 해준다.

HF Daily Papers4달 전· 5달 전 발행

배경과 조명이 변해도 끄떡없는 논리적 이상 탐지 데이터셋 VID-AD 공개

기존 이상 탐지 모델들이 배경이나 조명 변화 같은 시각적 노이즈에 취약해 실제 공정 적용이 어렵다는 문제를 해결한다. 픽셀 단위의 미세한 결함이 아닌, 물체의 개수나 배치 같은 논리적 규칙 위반을 정확히 찾아내는 새로운 벤치마크와 언어 기반 방법론을 제시한다.

HF Daily Papers4달 전· 5달 전 발행

강화학습의 고질적 불안정성 해결, MHPO로 추론 성능 15.9% 향상

대규모 언어 모델의 강화학습 과정에서 발생하는 급격한 성능 저하나 학습 실패 문제를 해결하는 새로운 최적화 프레임워크이다. 기존의 강제적인 값 제한(Clipping) 방식 대신 수학적으로 매끄러운 변조 기법을 도입하여, 복잡한 수학 문제 풀이나 시각 지능 학습의 안정성과 성능을 동시에 확보했다.

HF Daily Papers4달 전· 4달 전 발행

NVIDIA, LLM 에이전트 훈련 효율을 극대화하는 ProRL Agent 공개

복잡한 다중 턴 LLM 에이전트 훈련 시 발생하는 롤아웃 병목 현상을 해결하기 위해 훈련과 실행 환경을 분리한 새로운 아키텍처를 제시합니다. 이를 통해 GPU 자원 낭비를 줄이고, 루트 권한이 없는 고성능 컴퓨팅(HPC) 환경에서도 대규모 에이전트 학습이 가능해집니다.

HF Daily Papers4달 전· 4달 전 발행

o3도 고전하는 대학원 수학 추론, Meta의 Principia로 돌파

기존 AI 수학 평가는 객관식이나 단순 숫자 정답에 치중되어 실제 과학적 추론 능력을 과대평가하는 경향이 있었다. 이 논문은 행렬이나 구간 함수 같은 복잡한 수학적 객체를 직접 도출하는 능력을 학습시키고 평가하는 프레임워크를 제시하여, AI가 실제 연구 수준의 STEM 문제를 해결할 수 있는 기반을 마련했다.

HF Daily Papers4달 전· 4달 전 발행

외부 프롬프트 없이 5% 데이터만으로 미학습 도메인 객체 탐지 성공

기존의 객체 탐지 모델은 텍스트 설명이나 예시 이미지가 있어야만 새로운 물체를 찾을 수 있었으나, 이 논문은 그런 도움 없이도 시각 정보만으로 스스로 물체를 찾아내는 기술을 도입했다. 이는 수중 탐사나 산업 현장의 결함 탐지처럼 데이터나 설명이 부족한 환경에서도 AI가 즉시 작동할 수 있게 해준다.

HF Daily Papers4달 전· 5달 전 발행

추가 학습 없이도 실시간 장문 통역이 가능한 SimulU 기술 공개

기존의 실시간 통역 시스템은 방대한 데이터를 새로 학습시켜야 하거나 짧은 문장만 처리할 수 있는 한계가 있었다. 이 논문은 추가 학습 없이도 사전 학습된 AI 모델의 내부 정보를 활용해 긴 대화를 실시간으로 통역하는 SimulU 기술을 제안한다. 이를 통해 복잡한 학습 과정 없이도 다양한 언어 간의 자연스러운 실시간 소통이 가능해진다.

HF Daily Papers4달 전· 4달 전 발행

수백만 시간 학습으로 제로샷 목소리 복제와 1시간 이상의 안정적 음성 생성 달성

기존의 복잡한 음성 합성 파이프라인 대신 언어 모델과 유사한 단일 아키텍처를 채택하여 확장성을 극대화했다. 수백만 시간의 대규모 데이터를 통해 별도의 추가 학습 없이도 처음 듣는 목소리를 즉시 복제하거나 문장 내 특정 단어의 발음과 길이를 정밀하게 제어할 수 있다.

HF Daily Papers4달 전· 4달 전 발행

그림자와 반사까지 완벽 제거, 6만 쌍 데이터로 학습한 비디오 편집 AI

기존 비디오 객체 제거 기술은 물체 자체는 잘 지우지만 그 물체가 남긴 그림자나 반사 광원을 처리하지 못해 부자연스러운 결과물을 만들었다. 이 논문은 객체 제거와 삽입을 동시에 학습하는 새로운 방식과 대규모 전용 데이터셋을 통해, 복잡한 시각적 효과까지 흔적 없이 지워내는 기술적 도약을 이뤄냈다.

HF Daily Papers4달 전· 4달 전 발행

AI 청취자의 자연스러운 몸짓, 15만 개 데이터셋으로 구현

대화형 AI가 단순히 말을 하는 것을 넘어, 사람처럼 고개를 끄덕이거나 자세를 바꾸는 등 비언어적 반응을 생성하는 기술이다. 기존에는 한 가지 정답 동작만 학습했지만, 이 논문은 하나의 말에도 여러 적절한 반응이 있을 수 있다는 점을 반영해 훨씬 자연스러운 상호작용을 가능하게 한다.

HF Daily Papers4달 전· 4달 전 발행

로봇 반응 속도 10배 향상, 탁구 치는 AI VLA 모델 FASTER 등장

기존 로봇 AI 모델은 동작의 부드러움에만 치중해 갑작스러운 환경 변화에 늦게 반응하는 치명적인 약점이 있었다. 이 논문은 동작 시퀀스 중 가장 시급한 첫 번째 동작을 단 한 번의 연산으로 생성하는 기법을 통해 반응 속도를 10배 이상 개선하여, 탁구와 같이 고도의 순발력이 필요한 작업에서도 실시간 대응을 가능하게 한다.

HF Daily Papers4달 전· 4달 전 발행

MoTok: 토큰 83% 절감하며 모션 생성 정확도 9배 향상

텍스트 설명과 같은 추상적인 명령과 특정 경로를 따라가는 구체적인 움직임을 동시에 제어하는 것은 매우 어렵다. 이 논문은 확산 모델을 토크나이저의 디코더로 활용해, 아주 적은 정보만으로도 자연스럽고 정교한 3D 캐릭터 동작을 생성하는 새로운 표준을 제시한다.

HF Daily Papers4달 전· 4달 전 발행

비디오 생성 모델의 물리 법칙 학습을 활용해 3D 장면 이해 SOTA 달성

기존 멀티모달 모델은 텍스트와 이미지는 잘 이해하지만, 물체의 입체적 위치나 물리적 관계를 파악하는 '공간적 맹목성' 문제를 겪어왔다. 이 논문은 비디오 생성 모델이 일관된 영상을 만들기 위해 내부적으로 학습한 3D 구조와 물리 법칙을 추출하여 이 문제를 해결한다. 별도의 3D 데이터 없이도 로봇 조작이나 복잡한 공간 추론 성능을 크게 향상시킬 수 있는 새로운 패러다임을 제시한다.

HF Daily Papers4달 전· 4달 전 발행

이미지 이해와 생성을 하나로, 고차원 토큰 기반 CubiD 모델 공개

기존 이미지 생성 AI는 용량이 작은 토큰을 사용해 세밀한 의미 파악에 한계가 있었으나, 이 논문은 768차원 이상의 고차원 토큰을 직접 생성하는 기술을 구현했다. 이를 통해 이미지의 이해와 생성을 동일한 고성능 토큰으로 처리할 수 있어 진정한 의미의 통합 멀티모달 AI 구축을 가능하게 한다.

HF Daily Papers4달 전· 4달 전 발행

단 13분의 학습으로 360도 회전에도 완벽한 3D 일관성 비디오 생성

기존의 비디오 생성 AI는 대상을 평면적인 이미지로만 인식하여 시점이 바뀔 때 형태가 찌그러지는 고질적인 문제가 있었다. 이 논문은 비디오 모델이 대상의 입체적인 3D 구조를 이해하도록 학습시켜, 어떤 각도에서도 정교한 질감과 형태가 유지되는 맞춤형 비디오 제작을 가능하게 한다.

HF Daily Papers4달 전· 4달 전 발행

SAMA: 시맨틱 앵커링과 모션 정렬 분해로 오픈소스 비디오 편집 SOTA 달성

기존 비디오 편집 모델은 텍스트 지시를 따르면서도 원본의 움직임을 유지하는 데 어려움을 겪었으며, 외부 데이터에 과하게 의존하는 한계가 있었다. SAMA는 편집 계획과 움직임 학습을 분리하여 외부 정보 없이도 정밀한 편집과 자연스러운 움직임을 동시에 구현한다. 이는 고성능 비디오 편집 기술의 대중화와 효율적인 학습 방법론을 제시한다는 점에서 중요하다.

30B 소형 모델로 수학/코딩 올림피아드 금메달 달성: Nemotron-Cascade 2

거대 모델이 독점하던 수학 및 코딩 올림피아드 수준의 고난도 추론 능력을 20배 이상 작은 30B MoE 모델에서 구현했다. 순차적 강화학습과 지식 증류를 결합하여 모델의 지능 밀도를 극대화하는 새로운 사후 학습 방법론을 제시했다.

HF Daily Papers4달 전· 4달 전 발행

200개 이상 언어 지원 F2LLM-v2, 11개 MTEB 벤치마크 세계 1위 달성

기존 임베딩 모델들이 영어와 중국어에 치중되어 소외되었던 중저자원 언어들의 성능을 대폭 개선했습니다. 80M부터 14B까지 8가지 다양한 크기를 제공하며, Matryoshka Learning을 통해 하드웨어 제약에 따라 성능과 비용을 유연하게 선택할 수 있어 실무 활용도가 매우 높습니다.

"AI도 과유불급?" MS, 윈도우 11 코파일럿 기능 전격 축소 결정

마이크로소프트가 사용자 피드백을 반영하여 윈도우 11의 주요 앱에서 코파일럿 진입점을 줄이고 실질적인 유용성과 시스템 성능 개선에 집중하기로 했다.

Databricks4달 전

8시간 걸리던 투자 분석을 15분으로 단축한 금융권 AI 에이전트 실전 사례

데이터브릭스의 Agent Bricks를 통해 금융 기관들이 투자 의사결정 속도를 높이고 규제 준수 비용을 절감하며 초개인화된 고객 경험을 제공하는 실제 성과를 소개한다.

Databricks4달 전

48시간 걸리던 예측을 45분 만에? 제조업을 바꾸는 AI 에이전트

Databricks의 Agent Bricks를 활용해 제조 공정의 계획, 예측, 물류, 품질 관리를 자동화하고 운영 효율을 극대화하는 실전 사례를 제시한다.

Databricks4달 전

3억 달러 매출 증대와 320% 전환율 향상을 이끄는 리테일 AI 에이전트의 실체

Databricks의 Agent Bricks 플랫폼을 통해 리테일 기업이 재고 관리, 공급망 최적화, 고객 검색 경험을 혁신하여 실질적인 비즈니스 성과를 창출하는 방법을 제시한다.

노트북 내장 그래픽으로 Llama 3.1 추론부터 산업용 AI 학습까지 한 번에

PyTorch 2.10의 XPU 백엔드와 Intel Core Ultra Series 3 iGPU를 결합하여 온디바이스 환경에서 고성능 LLM 추론 및 산업용 이상 탐지 학습을 구현하는 기술적 성과를 다룹니다.