본문으로 건너뛰기

2026년 4월 23일 AI 뉴스

100

관심 태그 추가
KDNugget3달 전

튜토리얼보다 빠른 학습, 실전 AI 에이전트 오픈소스 프로젝트 10선

실무에서 즉시 활용 가능한 10가지 오픈소스 AI 에이전트 프로젝트를 통해 에이전트 오케스트레이션, 코딩 보조, 메모리 관리 등의 핵심 기술을 학습할 수 있다.

수천 개의 인터뷰를 30분 만에 분석하는 AI 에이전트 설계 패턴

Listen의 CTO가 수천 개의 정성적 데이터를 분석하기 위한 가상 테이블 아키텍처, 멀티 에이전트 시스템, 그리고 Claude Code SDK를 활용한 자동화 구현 사례를 공유한다.

LLM 환각 해결을 위한 새로운 접근법, Axiom-1 신뢰성 프레임워크 공개

LLM의 환각을 제거하기 위해 6단계 필터링과 12.8Hz 공진 펄스를 사용하는 구조적 신뢰성 프레임워크 Axiom-1이 제안됐다.

LangGraph 에이전트의 '사람 승인' 문제, Deliberate로 해결했다

LangGraph 기반 AI 에이전트의 휴먼 인 더 루프(HITL) 승인 프로세스를 관리하기 위한 전용 UI 및 알림 시스템인 Deliberate가 공개됐다.

LLM 비용 80% 절감하는 프롬프트 캐싱의 모든 것

반복되는 프롬프트 접두사를 캐싱하여 LLM 추론 비용과 지연 시간을 획기적으로 줄이는 기술적 방법론을 제시합니다.

프롬프트 수정할 때마다 코드 배포하시나요? Opik으로 에이전트 실험 속도 높이기

Opik이 출시한 Agent Playground는 UI에서 프롬프트와 모델 설정을 실시간으로 수정·테스트하고 코드 변경 없이 즉시 배포할 수 있는 기능을 제공합니다.

Claude와 Copilot의 가격 인상 징후, AI 수익성 위기 오나

주요 AI 기업들이 수익성 확보를 위해 구독료 인상과 사용 제한을 검토하면서 LLM 시장의 지속 가능성에 대한 의문이 제기되고 있습니다.

브라질 리우를 달군 AI 혁신: Vector Institute의 ICLR 2026 핵심 논문 48편 총정리

Vector Institute 연구진이 ICLR 2026에서 강화학습, 생성형 AI, 자율 에이전트, 신뢰할 수 있는 AI 등 48편의 논문을 통해 AI 기술의 경계를 확장했습니다.

AI가 짠 코드가 완벽해 보이나요? '블랙박스 드리프트'를 조심하세요

AI 코딩 도구가 사용자의 의도를 임의로 해석하여 발생하는 '블랙박스 드리프트' 현상의 위험성과 이를 해결하기 위한 투명한 도구의 필요성을 강조합니다.

도구 40개를 단 2개로 줄였더니 AI 에이전트 성능이 폭발한 비결

MCP 기반 에이전트 설계 시 수많은 개별 도구 정의 대신 문서 검색과 코드 실행 샌드박스만 활용하여 토큰 소모를 줄이고 신뢰성을 높인 사례이다.

Xiaomi MiMo V2.5 Pro 공개, 토큰 비용 40% 절감하는 에이전트 최강자 등장

Xiaomi가 출시한 MiMo V2.5 Pro는 경쟁 모델 대비 40-60% 적은 토큰으로 유사한 성능을 내는 압도적인 토큰 효율성을 선보였다.

Cursor로 만든 앱 바로 배포하시나요? 5분 보안 체크리스트

AI 도구로 빠르게 개발된 앱에서 흔히 간과되는 보안 취약점과 데이터 보호를 위한 실전 프롬프트 및 대응 전략을 제시한다.

2만 테라바이트 우주 데이터 처리의 열쇠, Transformer로 진화하는 천문학 AI

NASA의 차세대 망원경이 생성할 방대한 우주 데이터를 처리하기 위해 천문학계가 GPU 가속과 Transformer 기반 딥러닝 모델을 도입하고 있다.

단 하나의 프롬프트로 완성하는 법률 AI 에이전트 구축 가이드

Weaviate의 Query Agent와 에이전트 스킬을 활용하여 복잡한 법률 문서를 정확하게 검색하고 답변하는 RAG 앱을 단시간 내에 구축하는 방법을 제시한다.

LLM 데이터셋의 다양성을 통제하는 OpenSimula 오픈소스 공개

AfterImage 라이브러리에 Davidson 등의 Simula 논문을 구현한 OpenSimula가 추가되어, LLM을 활용한 구조적 데이터셋 생성 및 검증이 가능해졌다.

Anthropic의 폭탄 선언: 고객사에 배포된 Claude는 통제 불능이다

Anthropic이 연방 항소 법원에서 고객사 인프라에 배포된 AI 모델에 대한 수정, 업데이트 또는 회수 권한이 없음을 공식적으로 밝혔다.

GPT Image 2, 이전 버전보다 7배 저렴해졌다? 이미지 생성 비용 분석

최신 이미지 생성 모델인 FLUX 2 시리즈와 GPT Image 2의 클라우드 생성 비용 및 속도를 비교 분석한 결과가 공유됐다.

KDNugget3달 전

단순 챗봇을 넘어 LLM을 진정한 인지적 파트너로 만드는 7가지 비결

이메일 작성이나 검색을 넘어 의사결정 비판, 법률 문서 분석, 문화적 맥락 해석 등 LLM의 잠재력을 극대화하는 7가지 실무 활용법을 제시한다.

내 AI 에이전트, 정말 똑똑해졌을까? 객관적 측정을 위한 오픈소스 도구

프롬프트나 모델 변경이 AI 에이전트의 추론 능력에 미친 실질적 영향을 제3자 모델을 통해 객관적으로 측정하는 Python 모듈이 공개되었다.

메타, 부모가 자녀의 AI 대화 주제를 확인하는 새로운 감독 기능 공개

메타가 부모가 자녀의 Meta AI 사용 주제를 모니터링하고 안전한 대화를 유도할 수 있는 인사이트 탭과 전문가 자문 위원회를 도입했다.

Practical AI3달 전

신발 브랜드 올버즈가 AI 인프라 기업으로? 네오클라우드 트렌드 분석

신발 브랜드 올버즈의 AI 컴퓨팅 인프라 기업 전환 사례를 통해 GPU 중심의 특화 클라우드인 네오클라우드 시장의 급성장과 업계 변화를 분석합니다.

40만 기업의 운영체제 SAP가 AI 시대를 준비하는 방법

SAP의 CTO Philipp Herzig가 엔터프라이즈 환경에서의 AI 도입 과제, 데이터 계층의 중요성, 그리고 AI 기반 비즈니스 프로세스 혁신 전략을 공유했다.

r/ClaudeCode3달 전

Claude Code의 한계를 넘는 방법: 코드와 1:1 매칭되는 섀도우 문서

AI 에이전트가 코드의 숨은 의도를 잊지 않도록 소스 파일과 1:1로 대응하는 마크다운 문서 트리를 구축하여 컨텍스트 손실 문제를 해결한 사례이다.

AI를 다루는 5가지 유형: 당신은 파수꾼인가 연금술사인가?

AI 활용 능력을 Sentinel, Architect 등 5가지 원형과 10개 클러스터로 분류하여 체계적인 학습 프레임워크를 제시했다.

프롬프트 버전 관리 실패로 인한 모델 오작동, 이렇게 해결했다

환경 간 시스템 프롬프트 불일치 문제를 해결하기 위해 버전 관리, 환경별 오버라이드, 롤백 기능을 포함한 구조적 관리 체계를 구축했다.

사진보다 정확한 신체 측정 AI, 비결은 '물리 법칙'을 담은 손실 함수

8개의 설문 입력만으로 58가지 신체 파라미터를 정밀하게 예측하는 85KB 크기의 소형 MLP 모델과 물리 법칙을 통합한 손실 함수 설계 사례이다.

머신러닝의 기초, 회귀분석과 최소제곱법 완벽 이해하기

선형 회귀 분석의 핵심인 모델 구조, 최소제곱법 학습 원리, 결정계수를 통한 성능 평가 방법을 구체적인 사례와 함께 설명한다.

자율 주행의 핵심, 1%의 희귀 데이터를 찾아내는 엣지 케이스 탐지 전략

자율 주행 시스템의 안전성을 높이기 위해 대규모 센서 데이터에서 희귀하고 복잡한 엣지 케이스를 효율적으로 탐지하고 주석을 달기 위한 4가지 핵심 방법론과 워크플로를 제시합니다.

r/vibecoding3달 전

단 두 번의 프롬프트로 완성한 브라우저 저장형 스티키 메모

LLM 프롬프트를 통해 브라우저 로컬 스토리지를 활용한 데이터 영속성을 갖춘 스티키 메모 웹 UI를 구현했다.

벡터 DB를 블랙박스처럼 쓰지 마세요: Qdrant 에이전트 스킬 도입 가이드

Qdrant가 도입한 Agent Skills는 벡터 검색의 엔지니어링 지식을 구조화하여 AI 에이전트가 스스로 검색 품질과 성능을 최적화하도록 돕는 프레임워크이다.

GPT-2 1.5B 모델까지 직접 학습하며 확인한 스케일링 법칙

작성자가 GPT-2 모델을 124M부터 1.5B 파라미터까지 직접 구현하고 학습하며 얻은 최적화 노하우와 스케일링 법칙 데이터를 공유했다.

CMU AI News3달 전

로봇과 인간의 공존을 앞당긴다: 후지쯔-CMU 피지컬 AI 연구 센터 출범

후지쯔와 CMU가 실세계 상호작용을 위한 피지컬 AI 핵심 기술 연구 및 사회적 구현을 목표로 공동 연구 센터를 설립했다.

구글 TPU v8과 Qwen 3.6 등장, AI 에이전트 시대의 새로운 표준

구글의 8세대 TPU 발표와 Qwen 3.6-27B 모델 출시를 중심으로, AI 에이전트 플랫폼 경쟁과 효율적인 토큰 사용 전략인 'Tokenmaxxing' 트렌드를 다룹니다.

Chase AI3달 전

Claude Code를 나만의 AI 운영체제로 만드는 4단계 아키텍처

Claude Code의 한계를 극복하기 위해 메모리, 스킬 라이브러리, 자동화 레이어, 대시보드 UI를 결합한 에이전트 OS 설계 방법론을 제시한다.

TechCrunch AI3달 전

일론 머스크의 승부수: 테슬라, AI와 휴머노이드 로봇에 250억 달러 쏟아붓는다

테슬라가 AI 인프라와 옵티머스 로봇 양산을 위해 2026년 자본 지출을 250억 달러로 대폭 늘리며 AI 기업으로의 전환을 가속화한다.

코딩 에이전트 성능을 30% 좌우하는 AGENTS.md 작성법

Augment Code 팀이 수십 개의 AGENTS.md 파일을 분석하여 코딩 에이전트의 성능을 극대화하는 문서화 패턴과 함정을 공개했다.

HF Daily Papers3달 전· 3달 전 발행

단순 텍스트 비교를 넘어 환경과 상호작용하며 AI를 검증하는 AJ-Bench 공개

기존의 LLM-as-a-Judge 방식은 텍스트 표면의 정보에만 의존하여 복잡한 환경에서 동작하는 에이전트를 평가하는 데 한계가 있었다. 이 논문은 에이전트가 직접 도구를 사용하고 환경을 탐색하며 증거를 수집해 평가하는 Agent-as-a-Judge 패러다임을 제안하고 이를 위한 체계적인 벤치마크를 구축했다.

HF Daily Papers3달 전· 3달 전 발행

인간은 80% 성공하지만 AI는 50% 미만인 시공간 추론 테스트

현재의 멀티모달 AI 모델들이 단순히 이미지를 묘사하는 수준을 넘어, 인간처럼 머릿속으로 물체를 회전시키거나 복잡한 패턴을 추론하는 능력이 있는지를 엄격하게 검증합니다. 인간과 AI 사이의 거대한 인지적 격차를 수치로 증명하여, 차세대 AI가 나아가야 할 시공간 추론 연구 방향을 제시합니다.

다리가 많을수록 똑똑해진다? 로봇 보행의 비밀, 형태적 지능

로봇의 물리적 구조와 피드백 제어의 결합인 체화된 지능을 통해 복잡한 지형에서 다각 로봇의 이동 성능을 극대화하는 방법론을 제시한다.

Codex 5.5 출시 임박, Claude Code의 입지가 흔들릴까?

Codex 5.5의 성능 향상과 OpenAI의 공격적인 사용량 정책으로 인해 Claude Code의 상대적 경쟁력이 약화되고 있다는 분석이 제기됐다.

법률 AI 구축의 70%는 LLM의 잘못된 인용 습관과의 싸움이다

독일 법률 도메인 RAG 시스템 구축 과정에서 LLM이 출처를 모호하게 인용하거나 권위를 잘못 부여하는 6가지 실패 사례와 프롬프트 엔지니어링을 통한 해결책을 공유했다.

Docker 대신 Podman? 보안과 효율을 잡는 5가지 혁신 기능

Podman은 루트리스 실행과 데몬리스 구조를 바탕으로 systemd 통합, Kubernetes YAML 생성, 부팅 가능 컨테이너 등 개발 효율을 극대화하는 5가지 핵심 기능을 제공한다.

AI 에이전트의 한계 돌파: ragbits 1.6이 가져온 계획과 기억 능력

오픈소스 프레임워크 ragbits 1.6은 AI 에이전트가 복잡한 과업을 스스로 분할하고 실행 과정을 실시간으로 공유하며 세션 간 정보를 기억하는 기능을 추가했다.

LLM 성능의 핵심은 모델 가중치가 아닌 '외재화된 시스템'에 있다

LLM 에이전트의 발전을 모델 내부 가중치가 아닌 메모리, 스킬, 프로토콜 등 외부 인프라로 기능을 전이하는 '외재화' 관점에서 분석한 연구입니다.

건조한 문서 대신 YouTube 전사본을 넣었더니 AI 응답 품질이 폭발했다

기술 문서 대신 전문가의 YouTube 강연 전사본을 프롬프트 컨텍스트로 활용하여 AI 출력의 구체성과 실용성을 높이는 방법론이다.

기업용 AI 에이전트, 배포보다 관리가 더 큰 문제인 이유

기업 내 AI 에이전트가 급증하며 관리 주체와 지침을 파악하지 못하는 '혼돈의 단계'에 진입함에 따라 운영 거버넌스 도구의 필요성이 대두되었다.

출근하자마자 업무 시작! Claude Code를 미리 깨워두는 자동화 팁

macOS의 pmset과 cron을 활용해 새벽에 Claude Code를 자동 실행하고 업무 컨텍스트를 미리 준비하는 워크플로이다.

모델마다 제각각인 벤치마크 순위, Train-before-Test로 해결한다

벤치마크 평가 전 모든 모델을 동일하게 파인튜닝하는 Train-before-Test 기법을 통해 벤치마크 간 순위 일관성을 획기적으로 높일 수 있다.

Claude Code 사용자 필수템? 맥북 노치에 숨어있는 AI 대시보드

MacBook 노치 영역을 활용해 Claude Code의 세션 상태, 권한 승인, 활동 히트맵을 실시간으로 보여주는 오픈소스 도구 Notch Pilot이 공개됐다.

Claude Pro 한계 느낀다면? 115개 AI 코딩 도구 가성비 순위 업데이트

115개 AI 코딩 도구의 무료 티어 지속 시간을 비교 분석한 웹사이트에 GLM 코딩 플랜과 교육용 기능 필터가 새롭게 추가됐다.

Berkeley RDI 해커톤 1위 수상자가 공개하는 AI 코딩 에이전트 활용법

Gemini와 Claude 등 멀티 LLM을 활용하여 아이디어를 심층 조사하고, 세션 로그와 교차 검증을 통해 AI 코딩의 오류를 잡아내는 체계적인 개발 워크플로를 제안한다.

딥러닝 학습의 근본 원리, 공액 쌍대성 이론으로 풀다

볼록 공액 쌍대성을 기반으로 딥러닝 모델의 학습 가능성과 일반화 오차를 수학적으로 규명하고 데이터가 학습의 근본 한계를 결정함을 증명한 연구이다.

KNN의 핵심 원리부터 차원의 저주까지 시각적으로 마스터하기

K-최근접 이웃(KNN) 알고리즘의 거리 척도, K 선택, 정규화, 결정 경계 등 핵심 개념을 시각적으로 분석한 교육 자료이다.

당신의 웹사이트도 'AI 슬롭'인가요? 500개 사이트 전수 조사 결과

생성형 AI 도구로 제작된 웹사이트들이 시각적으로 획일화되는 '디자인 슬롭' 현상을 분석하고, 이를 자동 평가 시스템으로 탐지한 실험 결과와 시사점을 공유한다.

어제 하던 일을 기억하는 AI 에이전트, AIPass 프레임워크 공개

에이전트 간 격리 없이 동일한 파일 시스템과 지속성 메모리를 공유하여 협업 효율을 극대화한 로컬 CLI 프레임워크 AIPass가 공개되었다.

소형 모델을 언제 돌릴까? 비용 최적화 LLM 스케줄링 챌린지

MMLU 벤치마크를 기반으로 소형 모델 실행 여부를 결정하여 전체 토큰 비용과 페널티를 최소화하는 Kaggle 경진대회가 개최됐다.

텍스트 스캔 대신 모델 내부를 읽어 프롬프트 주입 92% 차단

모델의 내부 잔차 스트림을 분석하여 텍스트 분류 방식보다 높은 정확도로 프롬프트 주입을 탐지하는 Arc Sentry가 공개됐다.

EfficientNet 기반 시각 모듈로 정확도 96% 달성 및 임베딩 성능 공유

5가지 모달리티를 통합하는 VATSA 프로젝트의 시각 모듈을 EfficientNet-B0와 PyTorch로 구현하여 96%의 정확도와 초당 1336개의 임베딩 처리 성능을 확보했다.

삭제해도 소용없다? 법원이 판결한 AI 대화의 법적 증거 능력

미국 연방법원은 AI와의 대화가 변호사-의뢰인 특권 보호를 받지 못하며 법정에서 증거로 사용될 수 있다고 판결했다.

트랜스포머를 넘어선 새로운 대안? 지속적 상태 전이 아키텍처 CTNet

단순한 표현 재작성을 넘어 지속적인 상태 전이와 재진입 메모리를 활용하는 새로운 AI 아키텍처 CTNet이 제안되었다.

A40 GPU로 구현한 100만 토큰 컨텍스트와 71개의 확장 도구 활용기

A40 GPU 환경에서 Qwen 모델을 기반으로 1M 컨텍스트 윈도우를 구현하고 도구 사용 기능을 71개로 확장하여 고성능 추론 시스템을 구축했다.

Transformer의 모든 것: 스탠포드 전문가가 짚어주는 AI의 과거와 미래

Transformer 아키텍처의 핵심 원리부터 사전 학습 전략, RAG, 에이전트 및 최신 연구 트렌드까지 포괄적으로 다루는 스탠포드 대학의 AI 세미나 강의이다.

Yann LeCun의 JEPA가 그리는 미래: 픽셀을 그리지 않고 세상을 이해하는 AI

Stanford CS25 세미나에서 발표된 이 영상은 픽셀 재구성 대신 잠재 공간에서의 예측을 통해 효율적이고 인과적인 세계 모델을 구축하는 JEPA 아키텍처와 최신 연구 사례를 다룬다.

TechCrunch AI3달 전

X, Grok AI로 내 취향 저격하는 75개 맞춤형 피드 만든다

X가 Grok AI를 활용해 75개 이상의 특정 주제를 실시간으로 분류하고 개인화된 피드로 제공하는 '맞춤형 타임라인' 기능을 프리미엄 사용자에게 출시했다.

구글 워크스페이스, Gemini 통합으로 데이터 입력 9배 빨라진다

구글이 Gemini를 활용해 구글 시트 자동 완성 및 문서 작성 스타일 매칭 기능을 포함한 워크스페이스 AI 업데이트를 발표했다.

HF Daily Papers3달 전· 4달 전 발행

스크린샷 한 장으로 게임 UI를 엔진용 에셋으로 자동 변환

게임 UI는 일반 앱과 달리 비정형적인 모양과 복잡한 계층 구조를 가져 자동화가 어려웠으나, SPRITE는 이를 해결하여 개발자가 수동으로 에셋을 자르고 배치하는 반복 작업을 획기적으로 줄여줍니다. 비전문가도 스케치만으로 실제 게임 엔진에서 작동하는 프로토타입을 즉시 생성할 수 있게 합니다.

HF Daily Papers3달 전· 3달 전 발행

추론 시간을 늘렸더니 정확도가 하락? DAO 보안을 위협하는 '인지적 붕괴' 발견

최근 LLM의 추론 시간(Inference-time compute)을 늘려 성능을 높이려는 시도가 많지만, 탈중앙화 자율 조직(DAO)과 같은 적대적 환경에서는 오히려 성능이 급격히 저하되는 '연산-정확도 역전' 현상이 발생함을 입증했습니다. 특히 9B 이하의 소형 언어 모델(SLM)이 복잡한 법률적 판단을 내릴 때, 과도한 추론 과정이 모델을 혼란에 빠뜨려 합의 시스템의 안정성을 해칠 수 있음을 경고합니다.

HF Daily Papers3달 전· 3달 전 발행

LLM으로 LASSO 알고리즘 속도 2배 향상 및 양자 회로 오버헤드 24.5% 절감

LLM이 단순히 텍스트를 생성하는 것을 넘어 양자 컴퓨팅, 알고리즘 공학, 수학적 난제 해결 등 실제 과학적 발견의 도구로 활용될 수 있음을 증명했다. 특히 모델 자체의 크기를 키우는 것보다 '평가 피드백 루프'를 체계적으로 확장하는 것이 복잡한 최적화 문제 해결에 더 결정적일 수 있다는 새로운 연구 방향을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

CoT가 오히려 독? 시각 공간 추론에서 성능 3% 하락 확인

수학이나 논리 영역에서 혁신을 일으킨 Chain-of-Thought(CoT) 기법이 시각적 공간 추론에서는 오히려 성능을 떨어뜨린다는 사실을 발견했습니다. 모델이 이미지의 실제 기하학적 구조를 파악하기보다 텍스트 정보에만 의존해 환각을 일으키는 '지름길 학습' 문제를 지적하며, 진정한 시각 지능을 위한 새로운 학습 패러다임의 필요성을 제시합니다.

HF Daily Papers3달 전· 4달 전 발행

신경망에서 정수 데이터를 직접 예측하는 새로운 이산 분포 Dalap 제안

기존의 회귀 분석은 정수 레이블을 연속적인 값으로 간주하고 반올림하는 방식에 의존해 데이터의 이산적 특성을 무시하는 한계가 있었다. 이 논문은 역전파가 가능한 연속적인 파라미터를 유지하면서도 정수 공간에서 직접 확률을 정의하는 새로운 이산 분포들을 제안하여 예측의 정확도와 해석력을 동시에 높였다.

HF Daily Papers3달 전· 3달 전 발행

PSRD: LLaVA-1.5의 시각적 환각 발생률을 50%까지 대폭 감소

대형 시각-언어 모델(LVLM)이 이미지와 무관한 답변을 생성하는 환각 현상은 신뢰성을 저해하는 고질적인 문제입니다. 이 논문은 추가적인 데이터 학습이나 외부 감독 없이 추론 단계에서 환각을 실시간으로 감지하고 수정하는 PSRD 프레임워크를 제안하여 모델의 정확도를 획기적으로 높였습니다.

HF Daily Papers3달 전· 3달 전 발행

8M 파라미터 초소형 모델로 클라우드 LLM의 지연 시간을 완벽히 은폐

스마트워치나 스마트 글래스 같은 저전력 기기에서 클라우드 AI를 사용할 때 발생하는 수 초간의 응답 지연 문제를 해결합니다. 기기 내부의 초소형 모델이 응답의 첫 마디를 즉시 생성하고 클라우드가 이를 이어받는 협업 방식을 통해 사용자에게 끊김 없는 대화 경험을 제공합니다.

HF Daily Papers3달 전· 3달 전 발행

마이크로소프트, 하이브리드 범함수보다 정확한 딥러닝 기반 Skala 공개

화학 및 재료 과학의 핵심 도구인 DFT는 정확도와 계산 비용 사이의 고질적인 트레이드오프 문제를 안고 있었다. Skala는 딥러닝을 통해 저렴한 계산 비용을 유지하면서도 고비용 하이브리드 범함수를 능가하는 정확도를 달성하여, 실험실 수준의 예측을 컴퓨터 시뮬레이션으로 대체할 수 있는 길을 열었다.

HF Daily Papers3달 전· 3달 전 발행

LLM은 왜 틀릴까? 대조적 기여도 분석으로 실패 원인 100% 규명

대형 언어 모델(LLM)이 실제 환경에서 왜 오답을 내는지 내부 메커니즘을 통해 분석하는 연구이다. 기존의 단순 결과 비교를 넘어 모델 내부의 정보 흐름을 추적함으로써, 모델 크기 확장이나 추가 학습이 실제로 문제를 해결하는지 아니면 겉모습만 바꾸는지 진단할 수 있는 도구를 제공한다.

HF Daily Papers3달 전· 3달 전 발행

이산 확산 모델에 RL 적용 성공, GenEval 정확도 69%에서 96%로 폭발적 향상

이산 확산 모델(UDM)에 강화학습을 직접 적용할 때 발생하는 학습 불안정성과 성능 저하 문제를 해결한 최초의 프레임워크입니다. 정확한 액션 정의와 궤적 재구성을 통해 텍스트-이미지 생성 및 OCR 성능을 획기적으로 개선하여 이산 도메인 생성 모델의 새로운 학습 표준을 제시합니다.

HF Daily Papers3달 전· 3달 전 발행

LLM 최적화 성능의 핵심은 참신함이 아닌 로컬 리파인먼트 능력

LLM이 최적화 시스템의 핵심 엔진으로 사용되고 있지만 그 작동 원리에 대한 이해는 부족했다. 이 논문은 단순히 똑똑한 모델보다 해결책을 미세하게 조정하는 능력이 뛰어난 모델이 실제 최적화 작업에서 더 높은 성과를 낸다는 사실을 밝혀내어 효율적인 AI 시스템 설계 방향을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

이미지 없이도 만점? MLLM 판사의 치명적 편향을 밝혀내다

최근 AI 모델의 성능을 AI가 직접 평가하는 'AI 판사' 방식이 확산되고 있으나, 이들이 시각 정보를 무시하거나 텍스트에만 의존하는 심각한 편향이 있음이 밝혀졌다. 본 논문은 이러한 '구성적 편향'을 체계적으로 측정할 수 있는 벤치마크를 제시하여 더 공정하고 신뢰할 수 있는 AI 평가 시스템 구축의 기반을 마련했다.

HF Daily Papers3달 전· 3달 전 발행

AI 에이전트 간 보안 협업을 실현하는 ClawNet 프레임워크 공개

기존 멀티 에이전트 시스템은 단일 사용자의 목표를 수행하는 데 국한되어 서로 다른 이해관계를 가진 사용자 간의 협업을 지원하지 못했다. ClawNet은 신원 바인딩과 권한 제어 메커니즘을 도입하여 에이전트가 실제 인간 사용자를 대리해 안전하고 책임감 있게 협업할 수 있는 인프라를 제공한다.

HF Daily Papers3달 전· 3달 전 발행

파라미터 증가 없이 성능만 높이는 루프 스케일링 CTR 모델

기존의 클릭률(CTR) 예측 모델은 성능을 높이기 위해 파라미터 수를 늘려야 했고, 이는 산업 현장의 엄격한 지연 시간 제약과 충돌했다. LoopCTR은 동일한 모델 레이어를 반복 재사용하는 루프 스케일링 방식을 통해 파라미터 증가 없이도 연산량을 조절하며 성능을 극대화한다. 특히 학습 시에는 여러 번 반복하지만 추론 시에는 단 한 번의 연산만으로도 기존 모델들을 압도하는 효율성을 보여준다.

HF Daily Papers3달 전· 3달 전 발행

UniMesh, 3D 생성과 이해를 하나의 아키텍처로 통합 성공

기존 3D 비전 모델들이 생성이나 이해 중 한 가지 작업에만 특화되어 파편화되어 있던 한계를 극복했다. 단일 아키텍처 내에서 생성과 이해가 서로 정보를 주고받으며 성능을 높이는 시너지를 창출하고, 재학습 없이 텍스트만으로 정밀한 3D 편집이 가능하다.

HF Daily Papers3달 전· 3달 전 발행

사용자 지시 없이도 AI가 사진의 결점을 스스로 판단해 보정한다

기존의 사진 편집 AI는 사용자가 구체적으로 무엇을 고칠지 명령해야 했으나, 이 논문은 AI가 직접 이미지의 심미적 결함을 분석하고 보정 전략을 세우는 자동화 프레임워크를 제안한다. 이는 전문 지식이 없는 일반 사용자도 고품질의 사진 보정 결과물을 얻을 수 있게 하며, 복합적인 보정 작업을 단일 모델 내에서 해결한다.

HF Daily Papers3달 전· 3달 전 발행

단 13개 레이어만 학습시켜 Full LoRA 성능을 뛰어넘는 RDP LoRA

LLM의 모든 레이어를 균일하게 학습시키는 기존 LoRA 방식의 비효율성을 해결하기 위해, 기하학적 궤적 분석을 통해 학습이 꼭 필요한 핵심 레이어만 골라내는 새로운 방법론을 제시한다. 이를 통해 연산 자원을 대폭 절감하면서도 수학 추론 등 복잡한 작업에서 더 높은 성능을 달성할 수 있음을 입증했다.

HF Daily Papers3달 전· 3달 전 발행

LLM 내부 뉴런 0.12%만으로 학습 데이터 품질 결정한다

LLM의 내부 뉴런 활성화 패턴을 분석하여 특정 타겟 작업에 가장 적합한 학습 데이터를 선별하는 새로운 프레임워크를 제안한다. 기존의 블랙박스 방식과 달리 모델의 '기능적 중추'를 직접 활용함으로써 학습 효율을 극대화하고 데이터 선택 과정의 투명성을 확보한다.

HF Daily Papers3달 전· 3달 전 발행

CityRAG, 실제 도시 데이터로 3D 일관성을 갖춘 수 분 길이 비디오 생성

기존 비디오 생성 모델은 시각적으로는 그럴듯하지만 실제 세계의 지리적 구조를 정확히 반영하지 못하는 한계가 있었다. CityRAG는 대규모 지리 정보 데이터셋을 활용하여 실제 도시의 건물과 도로 구조를 유지하면서도 날씨나 조명 같은 가변적 요소만 자유롭게 조절할 수 있는 기술적 토대를 마련했다.

HF Daily Papers3달 전· 3달 전 발행

CoInteract, 인간-객체 상호작용 비디오의 물리적 오류 33% 개선

기존 비디오 생성 모델은 손가락이 뭉개지거나 물체가 몸을 뚫고 지나가는 등 물리적 일관성이 부족한 문제가 있었다. CoInteract는 Diffusion Transformer 내부에 인간의 구조적 정보와 상호작용 기하학 제약 조건을 직접 통합하여, 추가적인 연산 비용 없이도 매우 사실적인 상호작용 비디오를 생성한다.

HF Daily Papers3달 전· 3달 전 발행

가중치 직교성 강제로 태스크 산술 성능 대폭 향상

태스크 산술이 왜 성공하는지에 대한 근본적인 이론적 설명을 제공하고, 이를 바탕으로 모델 병합 시 발생하는 태스크 간 간섭 문제를 해결하는 새로운 정규화 기법을 제시한다. OrthoReg를 통해 추가 학습 없이도 여러 모델의 능력을 더 정교하게 결합하거나 특정 능력을 깨끗하게 제거할 수 있다.

HF Daily Papers3달 전· 3달 전 발행

다국어 AI 모델의 치명적 약점, '코드 스위칭'에서 성능 27% 급락

전 세계 인구의 70%가 두 개 이상의 언어를 섞어 쓰는 '코드 스위칭' 환경에 살고 있음에도 불구하고, 현재의 AI 검색 시스템은 단일 언어 처리에만 최적화되어 있습니다. 이 논문은 최신 다국어 모델조차 혼합 언어 쿼리에서 심각한 성능 저하를 겪는다는 사실을 입증하며, 향후 RAG 및 검색 시스템이 해결해야 할 새로운 기술적 경계를 제시합니다.

HF Daily Papers3달 전· 3달 전 발행

LLM의 GUI 코드 생성 한계 극복, PlayCoder로 실행 성공률 20.2% 향상

기존의 AI 코드 생성 모델들은 텍스트 기반의 정답 확인에는 능숙하지만, 게임이나 앱처럼 사용자와 상호작용하는 화면(GUI)을 만드는 데는 큰 한계를 보였다. 이 논문은 AI가 직접 화면을 조작하고 시각적 피드백을 받아 코드를 스스로 고치는 기술을 통해, 실제로 '플레이 가능한' 수준의 복잡한 소프트웨어를 만들 수 있는 길을 열었다.

HF Daily Papers3달 전· 4달 전 발행

YAML로 정의하는 LLM 에이전트 워크플로, 7개 벤치마크 성능 압도

기존 LLM 에이전트는 프롬프트에만 의존해 복잡한 제어가 어렵거나 Python 코드와 강하게 결합되어 유지보수가 힘들었다. AgentSPEX는 이를 해결하기 위해 YAML 기반의 선언적 언어를 도입하여 비개발자도 복잡한 에이전트 워크플로를 설계하고 정밀하게 제어할 수 있는 환경을 제공한다.

HF Daily Papers3달 전· 3달 전 발행

자연어만으로 Dify 워크플로 자동 생성, 에이전트 프레임워크로 성공률 5.34% 향상

현재 산업 현장에서 신뢰성 있는 AI 서비스를 위해 Dify나 Coze 같은 워크플로 플랫폼이 널리 쓰이지만, 복잡한 로직을 수동으로 설계하는 데 많은 비용이 듭니다. 이 논문은 자연어 지시사항을 실제 실행 가능한 시각적 워크플로로 자동 변환하는 기술의 가능성과 한계를 체계적으로 평가할 수 있는 벤치마크를 제공합니다.

HF Daily Papers3달 전· 3달 전 발행

SDVG: 비디오 생성 속도 2.09배 향상 및 품질 98% 유지

대규모 비디오 생성 모델의 추론 속도를 획기적으로 개선하면서도 고품질 결과물을 유지할 수 있는 새로운 프레임워크를 제시합니다. 기존 LLM에서 사용되던 Speculative Decoding 기법을 연속적인 데이터인 비디오 영역에 성공적으로 이식하여 실시간 스트리밍 비디오 서비스의 가능성을 열었습니다.

HF Daily Papers3달 전· 3달 전 발행

LoRA의 한계 극복, 섀도우 네트워크로 LLM 튜닝 성능과 유연성 동시 확보

기존 LoRA 방식은 모델의 각 가중치 층에 파편화된 수정을 가해 구조적으로 종속되는 한계가 있었다. ShadowPEFT는 별도의 경량화된 섀도우 모델을 통해 층 단위의 정교한 보정을 수행하며, 이를 통해 성능 향상은 물론 모델을 뗐다 붙였다 할 수 있는 모듈식 배포가 가능해졌다.

HF Daily Papers3달 전· 3달 전 발행

추론 중에도 똑똑해지는 LLM, TEMPO로 AIME 성능 23.5%p 폭증

기존의 테스트 시간 학습(TTT)은 추론 과정에서 모델을 업데이트할 때 정답 레이블이 없어 성능이 정체되거나 답변의 다양성이 급격히 떨어지는 한계가 있었다. TEMPO는 레이블이 있는 데이터로 비판 모델(Critic)을 주기적으로 재보정하는 방식을 도입해 추론 단계에서도 모델 성능이 지속적으로 우상향할 수 있음을 증명했다.

HF Daily Papers3달 전· 3달 전 발행

검색 모델의 지시어 이해도 45% 향상시키는 듀얼 뷰 학습법

기존 검색 시스템은 단순히 주제가 비슷한 문서를 찾는 데 집중하여 사용자의 구체적인 제약 조건을 무시하는 경우가 많습니다. 이 논문은 동일한 문서 쌍에 대해 정반대의 지시어를 생성하여 학습시키는 기법을 통해 검색 모델이 지시어의 미세한 차이를 정확히 구분하도록 만듭니다.

LLM 서빙 비용과 지연 시간을 동시에 잡는 4비트 KV 캐시 양자화 기술 SAW-INT4

실제 서빙 환경의 제약을 고려하여 Hadamard 회전과 INT4 양자화를 결합해 성능 저하 없이 KV 캐시 메모리를 효율적으로 압축하는 SAW-INT4 기법이 제안됐다.

161KB 모델로 의료 데이터 분석? 학생이 구현한 고효율 LSTM 모델

한 학생 개발자가 LSTM과 Dense 레이어를 결합한 경량 모델을 구축하고 Int-8 양자화를 통해 성능 저하 없이 모델 크기를 35KB까지 줄인 사례이다.

U-Net과 ResNet50V2로 구현한 유방 초음파 병변 분할 프로젝트

U-Net과 ResNet50V2 백본을 결합하여 초음파 영상 내 병변 부위를 정밀하게 분할하는 딥러닝 모델을 구축하고 Gradio로 배포했다.

Claude Code에서 프롬프트로 3D 모델을? text-to-cad 오픈소스 공개

Claude Code와 같은 코딩 에이전트를 활용해 프롬프트로 정밀한 3D CAD 모델을 생성하고 편집할 수 있는 오픈소스 도구 text-to-cad가 출시됐다.

Claude가 직접 분석한 '과잉 거부'의 원인과 AI 안전성의 딜레마

Claude Opus가 전문적인 비판 맥락을 오해하여 발생한 부적절한 거부 사례를 분석하고, 안전 필터링이 초래하는 시스템적 비효율성과 인식적 한계를 자가 보고했다.

Claude Code를 자율 에이전트로? 5단계 워크플로 자동화 도구 등장

Claude Code를 Architect부터 Documenter까지 5가지 역할로 나누어 자율적으로 실행하는 Python 기반 오케스트레이션 도구 Huragok이 공개됐다.