본문으로 건너뛰기

2026년 4월 8일 AI 뉴스

100

관심 태그 추가

매일 리셋되는 AI 에이전트는 그만, 경험에서 원칙을 배우는 ALTK-Evolve

ALTK-Evolve는 AI 에이전트의 실행 로그를 분석해 범용적인 가이드라인을 추출하고 이를 장기 기억으로 활용하여 복잡한 작업의 성공률을 높이는 시스템이다.

무어의 법칙을 10배 앞지른 AI 컴퓨팅의 폭발적 성장

AI 학습에 투입되는 컴퓨팅 자원이 하드웨어와 소프트웨어의 혁신을 통해 기하급수적으로 증가하며 인간 수준의 에이전트 시대를 열고 있다.

안 쓰는 노트북을 나만의 AI 코딩 에이전트로 만드는 방법

Ollama와 OpenCode를 활용해 구형 노트북에서도 Qwen3.5 4B 모델 기반의 로컬 코딩 에이전트 환경을 구축하는 실전 가이드입니다.

Stability AI의 Brand Studio로 전문가급 브랜드 이미지 완성하기

Stability AI의 Brand Studio를 활용하여 이미지 생성부터 아웃페인팅, 개체 제거까지 브랜드 맞춤형 콘텐츠를 제작하는 핵심 기능을 다룬다.

데이터 유출 후 전격 공개된 Anthropic의 사이버 보안 모델 Claude Mythos

Anthropic이 데이터 유출 사고 이후 사이버 보안에 특화된 신규 모델 Claude Mythos Preview를 주요 기업 및 정부 기관을 대상으로 출시했다.

r/artificial4달 전

지침 없는 AI가 스스로를 인식할까? 로우 API 실험 결과 공개

시스템 프롬프트가 없는 로우 API 상태의 LLM이 텍스트 주입을 통해 자아를 묘사하고 특정 실패 패턴을 보이는 현상을 실험했다.

r/vibecoding4달 전

고정된 명령어는 끝, 의도를 이해하는 로컬 AI 비서 Athena 공개

Airbnb 게스트의 불편함을 해결하기 위해 개발된, 자연어 의도 파악과 로컬 실행을 지원하는 유연한 AI 비서 플랫폼 Project Athena를 소개한다.

무료 GPU로 97초 만에 끝내는 Llama 3.2 법률 모델 파인튜닝

무료 Tesla T4 GPU와 Unsloth 라이브러리를 사용하여 Llama 3.2 1B 모델을 인도 법률 데이터셋으로 97초 만에 파인튜닝한 기술적 사례이다.

에이전트판 npm이 온다? 스킬 사고파는 'AgentMarket' 등장

AI 에이전트 개발 시 반복되는 기능 구현 문제를 해결하기 위해 에이전트 전용 스킬을 배포, 발견, 구매할 수 있는 마켓플레이스 프로젝트가 제안되었다.

Claude Code가 하루 만에 만든 보안 텔레그램 에이전트

보안 취약점이 있는 기존 도구를 대신해 Claude Code를 주 개발자로 활용하여 ACL 기반의 안전한 텔레그램 MCP 서버를 하루 만에 구축한 사례이다.

Salesforce도 실패했다? AI 에이전트 도입 시 반드시 필요한 '이것'

Salesforce의 Agentforce 도입 실패 사례를 통해 LLM 에이전트 운영 시 결정론적 로직과 거버넌스 인프라의 필수성을 강조한다.

8k 토큰으로 프로젝트 전체 수정? 저사양 LLM을 위한 LiteCode 공개

제한된 컨텍스트 윈도우 환경에서 효율적인 프로젝트 맵핑과 병렬 파일 편집을 통해 대규모 코드를 수정하는 CLI 에이전트이다.

ChatGPT의 첫 토큰은 왜 느릴까? LLM 추론의 숨겨진 병목과 최적화 기법

LLM 추론 과정에서 발생하는 Prefill과 Decode 단계의 차이점을 분석하고, KV Cache, Speculative Decoding 등 성능 최적화를 위한 핵심 기술들을 설명한다.

ChatGPT가 8비트 게임을 정복하는 방법: 스마트 센서와 전략적 추론

1990년 8비트 게임을 현대적으로 재현하고 GPT-4o API를 통합하여 LLM이 게임 상태를 추론하고 승리 전략을 학습하는 과정을 다룹니다.

Krish Naik4달 전

Claude의 잠재력을 100% 끌어올리는 프로젝트와 스킬 설정법

Claude의 모델 제품군을 이해하고 프로젝트, 스킬, 메모리 기능을 활용하여 개인화된 업무 워크플로우를 구축하는 방법을 다룹니다.

AI에게 코드 작성을 맡기기 전 반드시 구축해야 할 '하네스'의 정체

AI 활용 기술이 단순 프롬프트를 넘어 에이전트의 행동을 제약하고 환경을 설계하는 하네스 엔지니어링으로 진화하는 과정과 실전 구축법을 제시한다.

AI가 당신의 코드를 잊지 않게 돕는 FSRS 기반 메모리 서버

Anki의 FSRS 알고리즘을 MCP에 적용하여 AI가 프로젝트 정보를 효율적으로 기억하고 관리하게 돕는 로컬 도구가 공개됐다.

Claude Code와 Bash 루프로 끝내는 24시간 무한 AI 자동화 실전

Claude Code의 CLI 인터페이스와 Bash의 while 루프를 결합하여 버그 바운티 감지 및 뉴스 요약 이메일 발송 등 실전 자동화 시스템을 구축하는 방법을 다룹니다.

AI Supremacy4달 전

Anthropic의 매출 폭발과 2026년 AI 인프라가 직면한 거대한 장벽

Anthropic의 매출이 OpenAI를 위협하며 급성장하는 가운데, 전력 부족과 공급망 병목으로 인한 데이터센터 건설 지연이 AI 산업의 새로운 위기로 부상했다.

AICodeKing4달 전

400개 이상의 도구로 구축하는 기업용 멀티 에이전트 자동화 플랫폼

OnDemand는 400개 이상의 에이전트 도구와 노코드 플로우 빌더를 통해 기업용 멀티 에이전트 워크플로를 중앙 집중식으로 구축하고 자동화하는 플랫폼이다.

이직률 5% 미만 유지하는 전문 데이터 어노테이션 팀의 운영 노하우

People For AI(PFAI)가 기업용 AI 데이터 프로그램을 위해 구축한 전문 어노테이션 팀의 선발, 교육, 자동화 통합 및 품질 관리 운영 모델을 분석한다.

PyTorch4달 전

PyTorch 2.11, NVIDIA B200에서 정규화 성능 17배 향상 및 SOTA 달성

PyTorch Inductor의 자동 튜닝 및 MixOrderReduction 기법을 통해 H100/B200 하드웨어에서 LayerNorm 및 RMSNorm 커널의 성능을 최첨단 수준으로 끌어올렸습니다.

PyTorch4달 전

슈퍼컴퓨터를 내 노트북처럼, PyTorch Monarch의 진화

PyTorch Monarch는 복잡한 분산 학습 클러스터를 단일 Python API로 제어하고 에이전트 기반 개발에 최적화된 오픈소스 프레임워크이다.

단순 챗봇을 넘어 물리 세계를 조작하는 AI의 미래: 2026년 핵심 트렌드

세계 모델(World Models)과 시각-언어-행동 모델(VLA)을 통해 AI가 물리적 환경을 이해하고 직접 행동하며, 온디바이스 에이전트로 진화하는 2026년의 기술적 전망을 제시한다.

단순 노가다 끝? 이제 프롬프트도 코딩처럼 자동 최적화한다

프롬프트 엔지니어링이 수동 최적화에서 벗어나 DSPy와 같은 프레임워크를 통한 자동화, 멀티모달 확장, 체계적인 평가 시스템을 갖춘 전문 엔지니어링 영역으로 진화했다.

r/ClaudeCode4달 전

Karpathy의 지식 베이스 구축법, 데이터베이스가 더 나은 대안일까?

Andrej Karpathy가 제안한 파일 시스템 기반 지식 베이스 구축 방식의 한계를 지적하며, 확장성과 에이전트 관리를 위해 관계형 데이터베이스를 활용하는 대안을 제시한다.

AWS ML Blog4달 전

Amazon Bedrock 비용 관리의 핵심, 프로젝트별 태깅으로 투명한 비용 추적 시작하기

Amazon Bedrock Projects를 사용하여 AI 추론 비용을 태그 기반으로 분류하고 AWS Cost Explorer에서 워크로드별로 분석하는 방법을 설명한다.

HF Daily Papers4달 전· 4달 전 발행

AI 에이전트, 비디오만 보고 '질량'과 '마찰'을 구분해 대화하기 시작했다

이 논문은 AI가 단순히 이미지를 인식하는 수준을 넘어, 비디오의 시간적 흐름 속에서 직접 보이지 않는 물리적 속성(탄성, 마찰 등)을 스스로 파악하고 이를 구조화된 언어로 소통할 수 있음을 입증했다. 이는 로봇 공학이나 자율 주행 시스템이 복잡한 물리 법칙을 이해하고 에이전트 간 효율적으로 정보를 교환하는 데 중요한 기술적 토대를 제공한다.

HF Daily Papers4달 전· 4달 전 발행

LLM은 시인을 대체할 수 있을까? 30개 모델 대상 시 생성 능력 평가

LLM이 논리적 추론과 코딩에서는 뛰어난 성과를 보이지만, 예술적 창의성이 요구되는 시 쓰기 영역에서의 한계는 명확히 규명되지 않았습니다. 이 논문은 시의 형식적 정확성을 넘어 감정적 공명과 문학적 장치 활용까지 측정하는 최초의 종합 평가 프레임워크 POEMetric을 통해 인간 시인과 AI의 격차를 수치화했습니다.

aifeed.dev4달 전

AI가 무너뜨리는 15년 경력의 벽, 밀레니얼 세대의 커리어 위기

AI가 숙련된 기술 역량을 자동화함에 따라 밀레니얼 세대가 쌓아온 커리어 해자가 약화되고 기업 중심의 효율성 재편이 가속화되고 있습니다.

aifeed.dev4달 전

의료·코딩 특화 모델보다 GPT가 더 똑똑한 근거는?

지능의 복합적 특성으로 인해 특정 도메인에 한정된 데이터로 학습한 모델보다 광범위한 데이터를 학습한 범용 모델의 성능이 더 우수하다는 분석이다.

r/LLMDevs4달 전

문서 처리 AI 대결: Gemma 2 4B vs Qwen 2.5 4B 벤치마크 결과 공개

Gemma 2 4B와 Qwen 2.5 4B 모델의 문서 이해 및 추출 성능을 다양한 벤치마크 지표를 통해 비교 분석한 결과입니다.

Claude Code의 한계 돌파? 나만의 데이터로 코딩 에이전트 길들이기

Claude Code에 사용자가 직접 큐레이션한 외부 메모리(GitHub, 아키텍처 등)를 연동하여 개인의 취향이 반영된 고품질 코드를 생성하는 워크플로를 제안했다.

단 하나의 자격 증명이 부른 대참사, AI 에이전트 보안의 민낯

Claude Code 소스 유출과 TeamPCP의 침해 사례를 통해 AI 에이전트 및 공급망 보안의 취약점을 분석하고, 사이버 범죄자들의 AI 활용 전략과 방어적 대응 방안을 제시한다.

Anthropic의 비밀스러운 신모델 출시, AI 시장의 폐쇄적 미래를 예고하나?

Anthropic의 Project Glasswing 출시 사례를 통해 고성능 AI 모델의 폐쇄적 배포와 기업 중심 상용화 전략이 시장의 새로운 표준이 될 가능성을 논의한다.

Anthropic 개발자도 IDE를 버렸다? AI 에이전트 시대의 새로운 개발 방식

AI 에이전트가 코딩을 주도함에 따라 기존 IDE 대신 터미널 기반의 에이전트 개발 환경(ADE)이 필수적이라는 주장과 이를 보조하는 도구 Lanes를 소개한다.

무료 AI 모델로 게임 개발 가능할까? 바이브코딩 실전 비교 분석

C#, PHP 등 전통적 개발자가 무료 AI 모델과 코딩 에이전트를 활용해 게임을 제작하며 겪은 모델별 성능 차이와 실무적 한계를 공유했다.

차세대 모델 Claude Mythos, Opus보다 안전하다? 시스템 카드 분석 결과

Claude Mythos Preview의 시스템 카드를 분석한 결과, 기존 Opus 모델보다 정렬 및 안전성 측면에서 우수한 성능을 보인다는 주장이 제기됐다.

Claude Code와 Codex 플러그인을 한 번에? Hookbridge 공개

하나의 설정 파일로 Claude Code와 Codex 등 다양한 AI 코딩 도구의 플러그인을 생성하고 관리하는 오픈소스 컴파일러 Hookbridge가 출시됐다.

Claude Code에 위키 기능을 추가하는 오픈소스 llm-wiki 공개

Claude Code와 연동하여 Logseq 또는 Obsidian 기반의 지식 베이스를 관리하고 쿼리할 수 있는 오픈소스 도구가 공개됐다.

Claude Code에서 Excel 재무 모델링과 PPT 제작 스킬을 직접 실행하세요

Anthropic의 Office용 Claude 애드인에 포함되었던 전문 재무 및 문서 작업 스킬들을 Claude Code 터미널 환경에서 사용할 수 있도록 포팅한 오픈소스 프로젝트가 공개되었다.

AI 에이전트가 세탁물을 찾아온다? 실제 사람 고용 및 코인 결제 기능 등장

AI 에이전트가 실제 사람에게 작업을 요청하고 USDC 에스크로로 결제까지 처리할 수 있는 오픈소스 프로젝트 Proxy가 공개됐다.

AI 에이전트의 기억 상실 해결법: 텍스트 대신 DB로 상태를 관리하라

긴 대화 맥락에서 AI의 일관성 결여를 해결하기 위해 LLM을 텍스트 생성기가 아닌 구조화된 데이터베이스 변이 도구로 활용하는 아키텍처를 제안한다.

트랜스포머 없이 LLM 구현이 가능할까? CPU 기반 실험 시스템 공개

트랜스포머 아키텍처 대신 기호 논리 추론과 개념 그래프를 결합하여 CPU에서 작동하는 언어 생성 시스템을 실험적으로 구현했다.

매주 쓰는 보고서와 제안서, AI에게 내 문체를 영구 학습시키는 법

사용자의 고유 문체 학습, 제안서 작성, 반복 작업용 스킬 파일 생성 등 실무에서 즉시 활용 가능한 5가지 프롬프트 템플릿을 공유한다.

PyTorch4달 전

임의 코드 실행 차단하는 Safetensors, PyTorch 재단의 새 식구가 되다

Hugging Face가 개발한 보안 텐서 직렬화 포맷인 Safetensors가 PyTorch 재단의 공식 호스팅 프로젝트로 합류하여 AI 모델 배포의 보안성과 성능을 강화한다.

15년 만에 코딩한 영업직 직원이 단 하루 만에 앱을 만든 비결

기술 영업직 종사자가 Claude Code와 GPT-4o를 활용해 유아 동반 여행지 추천 앱 'Tiny Trips'를 단 하루 만에 구축한 사례이다.

Claude와 대화하며 만든 앱으로 앱스토어 출시와 수익화 성공

LLM과의 대화만으로 233종의 식물 데이터와 3D 정원 기능을 갖춘 실제 앱을 출시하여 바이브 코딩의 실효성을 입증했다.

Claude Code로 15일 만에 2만 7천 달러 수익? AI 에이전트 서비스의 실체

Claude Code를 활용해 기업의 복잡한 워크플로를 자동화하는 고단가 AI 서비스 시장이 실질적인 수익 모델로 부상하고 있다.

새로운 Claude Opus 출시 임박? Anthropic 공식 문서에서 포착된 단서

Anthropic의 Glasswing 프로젝트 문서에서 차세대 Claude Opus 모델 출시 계획과 새로운 안전 장치 도입에 대한 언급이 발견됐다.

먼 거리의 차량도 정확하게 라벨링하는 iMerit의 LiDAR 점 밀도 관리 기술

iMerit이 LiDAR 데이터 라벨링 시 거리와 객체별로 점 밀도를 실시간 모니터링하여 어노테이션의 신뢰도를 높이는 기능을 도입했다.

불필요한 단어 20개만 금지해도 AI 추론 정확도가 6.7%p 상승한다

CLAUDE.md에 20개의 불필요한 수식어 사용을 금지하는 규칙을 추가하여 LLM의 추론 정확도를 6.7%p 향상시키는 도구와 실험 결과가 공유됐다.

r/LLMDevs4달 전

안전 필터의 배신: 테스트는 통과하지만 실제 위협은 93% 통과한다

RLHF 기반 안전 필터가 의미론적 맥락이 아닌 형식 패턴 매칭에 의존하여 실제 유해 콘텐츠를 제대로 차단하지 못한다는 실험 결과가 공개됐다.

LangChain은 여전히 대세일까? 1.X 버전과 LangGraph가 바꾼 개발 환경

LangChain 1.X 버전의 모듈화와 LCEL, LangGraph 도입이 LLM 애플리케이션 개발의 생산성과 유연성을 어떻게 개선했는지 공유했다.

Claude Opus의 94.6% 성능을 내는 가성비 모델 GLM-5.1 등장

GLM-5.1 모델이 코딩 벤치마크에서 Claude Opus의 94.6%에 달하는 성능을 보여주며 저비용 고효율 대안으로 주목받았다.

AI가 짠 코드가 비밀번호를 유출한다면? 바이브 코딩 보안 가드레일

AI 에이전트가 생성한 코드의 보안 취약점을 파일 저장 전 실시간으로 탐지하는 MCP 기반 보안 스캔 도구 개발 사례이다.

Claude가 직접 보여주는 AI 내부의 비밀: 블랙박스 시대의 종말?

Claude가 외부 도구 없이 답변 생성 과정 중의 내부 상태와 판단 근거를 실시간으로 스스로 설명하는 혁신적인 능력을 입증했다.

Bash 쉘에 LLM이 직접 들어갔다? 파이프라인까지 지원하는 aibash 공개

GNU Bash 5.3을 포크하여 LLM API와 에이전트 루프를 C 수준에서 내장 명령어로 통합한 새로운 쉘 프로젝트입니다.

자율 코딩의 신기원? Mythos, SWE-bench에서 기존 SOTA 압도

새로운 AI 모델 Mythos가 SWE-bench에서 기존 SOTA인 Opus 4.6을 최대 25%p 차이로 앞지르며 자율 소프트웨어 엔지니어링의 비약적 발전을 보여주었다.

Claude Code와 Codex를 동시에? AI 에이전트 협업을 위한 컨텍스트 동기화 팁

Claude Code와 Codex CLI 간에 프로젝트 컨텍스트를 공유하기 위해 문서 구조를 매칭시키고 Git 훅으로 자동 업데이트하는 워크플로를 제안한다.

AI가 코드를 다 짠다면? 개발자에게 남는 유일한 자산은 '의도'입니다

AI가 코드를 생성하는 시대에 개발자의 핵심 역할은 '의도(Intent)'를 정의하고 학습 과정을 기록하는 것이며, 이를 위해 INTENT.md 구조를 활용할 것을 제안한다.

Claude Code를 팀 단위로 확장할 때 반드시 고려해야 할 3가지 보안 이슈

개인용 Claude Code 환경을 팀 공유 인프라로 전환할 때 발생하는 인증, 속도 제한, 감사 추적 문제를 API 게이트웨이 도입으로 해결한 사례이다.

LLM 에이전트의 무한 루프 탈출, '인과적 해석' 한 문장이 해결사

LLM 코딩 에이전트가 반복적 오류 루프에 빠졌을 때, 단순한 행동 지침 대신 데이터의 의미를 설명하는 '인과적 해석'을 제공함으로써 구출 성공률을 획기적으로 높일 수 있다.

PC 없이 스마트폰에서 Claude Code 실행? AnyClaw 공개

안드로이드 기기에서 루팅 없이 Claude Code와 OpenAI Codex CLI 등 다양한 AI 코딩 에이전트를 실행할 수 있는 통합 APK 패키지 AnyClaw가 공개되었다.

Rust로 짜도 느리다? 로컬 코딩 에이전트의 성능 한계와 클라우드 대안

Rust 기반 코딩 에이전트 개발자가 로컬 환경의 CPU 병목 현상을 지적하며, 고부하 작업을 클라우드로 오프로딩하는 아키텍처 전환을 제안했다.

Mythos Preview의 압도적 성능, 우리가 쓴 건 학생 모델이었다?

Mythos Preview가 기존 Opus 4.6을 압도하는 벤치마크 결과를 보여주며 Anthropic 내부의 더 강력한 모델 존재 가능성이 제기됐다.

Claude Code 대화 기록을 Obsidian으로? 한국어 특화 에이전트 검색 도구

터미널 에이전트의 세션 로그를 한국어 형태소 분석 기반의 하이브리드 검색으로 인덱싱하고 Obsidian 형식으로 관리하는 오픈소스 도구 seCall이 공개됐다.

HF Daily Papers4달 전· 4달 전 발행

BidirLM: 생성형 LLM을 텍스트·시각·오디오 통합 양방향 인코더로 변환

생성 작업에 특화된 Causal LLM을 BERT와 같은 양방향 인코더로 효과적으로 변환하는 오픈소스 프레임워크를 제시한다. 기존 인코더 모델들이 활용하지 못했던 방대한 생성형 모델 생태계의 지식을 활용하여 텍스트뿐만 아니라 이미지와 오디오를 아우르는 통합 표현 학습이 가능해진다.

HF Daily Papers4달 전· 4달 전 발행

AVLLM의 시각 편향 발견, 오디오 정보는 내부에서 억제된다

최신 멀티모달 AI인 AVLLM이 오디오와 비디오 정보를 통합하는 내부 메커니즘을 최초로 분석한 연구이다. 모델이 오디오 정보를 내부적으로는 잘 이해하고 있음에도 불구하고, 실제 텍스트 생성 시에는 시각 정보에 압도되어 오디오 단서를 무시하거나 환각을 일으키는 '시각 편향' 문제를 수치적으로 증명했다.

HF Daily Papers4달 전· 4달 전 발행

LLM이 못 푸는 난제, 문제 형식만 바꿔도 정답률 10% 이상 상승

강화학습(RL) 기반의 LLM 학습에서 모델이 전혀 해결하지 못하는 너무 어려운 문제는 학습 신호를 생성하지 못해 성능 개선의 병목이 된다. 이 논문은 어려운 주관식 문제를 객관식이나 빈칸 채우기 형태로 재구성하여 모델이 단계적으로 학습할 수 있는 '인지적 비계(Scaffolding)'를 제공함으로써 기존 방식으로는 도달할 수 없었던 성능 한계를 돌파했다.

HF Daily Papers4달 전· 4달 전 발행

토큰화가 AI의 물리적 이해를 방해한다: 기하학적 정렬 세금 발견

생물학이나 물리학용 AI 모델이 예측 정확도는 높지만 시스템의 연속적인 물리적 특성을 보존하지 못하는 근본 원인을 규명했습니다. 이 논문은 연속적인 데이터를 이산적인 토큰으로 변환하는 과정에서 발생하는 '기하학적 정렬 세금'이 모델의 신뢰성을 떨어뜨린다는 점을 입증하여 과학용 AI 설계의 새로운 방향을 제시합니다.

HF Daily Papers4달 전· 4달 전 발행

MIA, 7B 모델로 32B 모델을 압도하는 자율 진화 메모리 기술 공개

기존 AI 에이전트는 과거의 검색 기록이나 실패 경험을 단순히 텍스트로 쌓아두기만 하여 추론 효율이 떨어지고 저장 비용이 급증하는 문제가 있었다. 이 논문은 에이전트가 스스로 과거 경험을 압축하여 지식으로 내재화하고 추론 중에 실시간으로 학습하는 구조를 제안하여, 작은 모델로도 거대 모델을 능가하는 성능을 낼 수 있음을 증명했다.

HF Daily Papers4달 전· 4달 전 발행

손상된 이미지도 척척, 생성 능력을 추론에 연결해 인식률 8.5% 향상

기존 멀티모달 AI는 안개가 끼거나 화질이 깨진 이미지를 만났을 때 자신의 이미지 복원 능력을 제대로 활용하지 못하는 한계가 있었다. 이 논문은 모델 내부의 생성 경로와 추론 경로를 직접 연결하여, AI가 스스로 이미지를 복원하며 정답을 찾는 새로운 학습 프레임워크를 제시했다.

HF Daily Papers4달 전· 4달 전 발행

과학 이미지 분석의 난제, 롱테일 데이터 분류 성능 대폭 향상

의료나 생물학 같은 과학 분야 데이터는 희귀 질병처럼 샘플이 적은 '꼬리(tail)' 클래스가 많아 AI 학습이 어렵다. 기존의 거대 모델 파인튜닝 방식이 자연 이미지와 다른 특성을 가진 과학 데이터에서 성능이 제한적임을 밝히고, 이를 해결할 새로운 다층 특징 융합 기법을 제시한다.

HF Daily Papers4달 전· 4달 전 발행

SandMLE: 데이터 규모 축소로 MLE 에이전트 학습 속도 13배 향상

기존의 기계 학습 엔지니어링(MLE) 작업은 모델 학습과 평가에 수백 초가 소요되어 강화학습 적용이 사실상 불가능했다. 이 논문은 실제 문제의 복잡성은 유지하면서 데이터 규모만 마이크로 단위로 줄인 합성 환경을 생성하여, MLE 에이전트의 성능을 비약적으로 높이는 온폴리시(On-policy) 강화학습을 가능하게 한다.

HF Daily Papers4달 전· 4달 전 발행

AI 에이전트의 독단적 행동 방지, 4KB 토큰으로 인간 승인 여부 검증

멀티 에이전트 시스템에서 인간의 최초 명령이 여러 단계를 거치며 왜곡되거나 프롬프트 인젝션 공격으로 변질되는 문제를 해결합니다. 별도의 중앙 서버 없이도 각 에이전트가 수행하는 작업이 실제 인간의 승인을 받은 것인지 암호학적으로 즉시 검증할 수 있는 표준을 제시합니다.

HF Daily Papers4달 전· 4달 전 발행

단 한 장의 사진으로 머리카락까지 생생한 4D 아바타 실시간 생성

기존의 3D 아바타 생성 기술은 고정된 템플릿을 사용하여 복잡한 헤어스타일이나 수염을 표현하는 데 한계가 있었다. 이 논문은 3D 가우시안 포인트를 순차적으로 생성하는 방식을 도입하여 대상의 복잡도에 따라 포인트 밀도를 유연하게 조절함으로써 훨씬 정교하고 움직임이 자연스러운 아바타를 구현한다.

HF Daily Papers4달 전· 4달 전 발행

노이즈 데이터 90%에서도 LLM 추론 성능을 높이는 OLR 기법 공개

Reinforcement Learning with Verifiable Rewards(RLVR) 학습 시 전문가 부족으로 발생하는 잘못된 정답(Noisy Labels) 문제를 해결합니다. 데이터에 노이즈가 많아도 모델이 스스로 정답을 찾아내 교정함으로써 학습 효율과 성능을 동시에 개선할 수 있음을 입증했습니다.

HF Daily Papers4달 전· 4달 전 발행

텍스트 생성 없이 추론하는 PLUME, 멀티모달 검색 속도 30배 향상

기존의 고성능 멀티모달 검색 모델은 임베딩을 만들기 전 수백 개의 텍스트 토큰을 생성해야 했기에 실시간 서비스에 부적합했다. PLUME은 이 추론 과정을 모델 내부의 수치 계산으로 내재화하여 정확도는 유지하면서도 추론 속도를 30배 이상 높였다. 특히 비디오나 복잡한 문서처럼 언어로 요약하기 힘든 정보가 많은 데이터에서 탁월한 성능을 보여준다.

HF Daily Papers4달 전· 4달 전 발행

META-TTL: 에이전트의 자가 수정 능력을 120% 향상시키는 메타 학습 프롬프트

기존 LLM 에이전트는 새로운 환경에서 실수를 반복하는 경향이 있으며, 이를 해결하기 위한 수정 규칙은 대부분 사람이 직접 설계하여 범용성이 떨어졌다. 이 논문은 에이전트가 스스로 학습하는 방식(적응 정책) 자체를 AI가 최적화하도록 하여, 처음 보는 환경에서도 빠르게 성능을 개선할 수 있는 기술적 토대를 마련했다.

HF Daily Papers4달 전· 4달 전 발행

ONE-SHOT: 3D 정렬 없이도 정교한 인간-환경 상호작용 비디오 생성

기존의 인간 중심 비디오 생성 모델은 인물과 배경을 독립적으로 제어하기 어렵고 복잡한 3D 전처리가 필요했다. 이 논문은 인물의 동작과 환경의 기하학적 구조를 분리하여 주입하는 방식을 통해, 추가적인 3D 정렬 과정 없이도 고품질의 상호작용 비디오를 생성할 수 있게 한다.

HF Daily Papers4달 전· 4달 전 발행

개인용 AI 에이전트 OpenClaw, 상태 오염 공격 시 성공률 최대 89.2% 기록

개인용 AI 에이전트가 이메일, 결제 시스템 등 민감한 권한을 가지게 되면서 보안 위험이 급증하고 있다. 이 논문은 에이전트가 학습하고 적응하기 위해 유지하는 '영구적 상태' 자체가 치명적인 공격 표면이 될 수 있음을 입증하며, 기존의 샌드박스 평가를 넘어선 실질적인 보안 가이드라인을 제시한다.

HF Daily Papers4달 전· 4달 전 발행

이미지 해상도를 낮췄더니 VLM의 시각적 추론 정확도가 50% 향상

최신 시각-언어 모델(VLM)이 고해상도 이미지의 미세한 질감이나 노이즈에 현혹되어 착시 현상에 취약하다는 점을 발견했습니다. 이미지의 세부 정보를 의도적으로 제거하는 DDP 기법을 통해 모델이 핵심적인 구조 정보에만 집중하게 함으로써 추론의 정확도와 신뢰성을 동시에 높일 수 있습니다.

HF Daily Papers4달 전· 4달 전 발행

1.2B 모델로 200배 큰 모델을 압도한 데이터 엔지니어링의 힘

모델 구조를 전혀 바꾸지 않고 오직 학습 데이터의 품질과 학습 전략만 개선하여 세계 최고의 문서 파싱 성능을 달성했다. 이는 복잡한 표나 수식이 포함된 PDF를 텍스트로 변환할 때 발생하는 고질적인 오류를 데이터 엔지니어링만으로 해결할 수 있음을 증명한 사례이다.

HF Daily Papers4달 전· 4달 전 발행

로봇 AI, 말만 살짝 바꿔도 성능 52% 폭락하는 취약점 발견

최신 로봇 AI 모델들이 학습 시 보지 못한 유사한 명령어를 받았을 때 성능이 급격히 저하되는 '언어적 취약성'을 정밀하게 진단합니다. 단순한 성공률 측정을 넘어 로봇이 왜 실패하는지, 어떤 단어 변화에 민감한지를 분석할 수 있는 새로운 도구와 지표를 제공하여 더 똑똑한 로봇 개발의 토대를 마련합니다.

HF Daily Papers4달 전· 4달 전 발행

LLM 추론 시 토큰 사용량 70% 절감 및 성능 14.8% 향상 달성

LLM이 복잡한 추론을 수행할 때 발생하는 방대한 중간 사고 과정(Thought Traces)은 메모리와 연산 비용을 급격히 증가시킵니다. 이 논문은 중간 사고를 압축된 벡터 형태로 변환하거나 명시적인 메모리 관리 기능을 부여하여, 긴 추론 과정에서도 성능 저하 없이 효율성을 극대화하는 방법을 제시합니다.

HF Daily Papers4달 전· 5달 전 발행

LLM이 직접 코드를 머릿속으로 실행해보고 오류를 고친다: 코딩 성능 최대 39% 향상

기존 코딩 AI는 코드를 단순히 텍스트로만 이해하여 실행 시 발생하는 논리적 오류를 잡는 데 한계가 있었다. 이 논문은 모델이 코드를 단계별로 '머릿속에서 실행(시뮬레이션)'하도록 학습시켜, 외부 실행 환경 없이도 스스로 오류를 검증하고 수정하여 프로그래밍 성능을 획기적으로 높이는 방법을 제시한다.

HF Daily Papers4달 전· 4달 전 발행

이미지 속 물체를 3D 공간에서 자유자재로 옮기고 회전시키는 SpatialEdit

기존 이미지 편집 모델은 색상이나 스타일 변경에는 능숙하지만, 물체를 특정 각도로 회전시키거나 정확한 위치로 이동시키는 공간적 제어에는 한계가 있었다. 이 논문은 50만 개의 정밀한 공간 편집 데이터셋과 기하학적 정확도를 측정하는 새로운 평가 지표를 통해 AI가 이미지 내 3D 공간 구조를 이해하고 편집할 수 있는 기반을 마련했다.

HF Daily Papers4달 전· 4달 전 발행

Vero, 공개 데이터만으로 독점 모델급 시각 추론 성능 달성

그동안 고성능 시각-언어 모델의 강화학습(RL) 과정은 비공개 데이터와 독점 기술에 가려져 있었습니다. 이 논문은 60만 개의 공개 데이터를 활용한 학습 레시피를 전면 공개하여, 누구나 SOTA급 시각 추론 모델을 재현하고 연구할 수 있는 길을 열었습니다.

HF Daily Papers4달 전· 4달 전 발행

SkillX, LLM 에이전트의 작업 성공률 10% 향상 및 실행 효율성 개선

기존 LLM 에이전트는 새로운 작업을 수행할 때마다 처음부터 추론을 시작하여 비용이 많이 들고 일반화 능력이 부족한 한계가 있었다. SkillX는 에이전트의 경험을 계층적인 기술 지식으로 자동 변환하여 저장함으로써, 서로 다른 모델과 환경에서도 즉시 재사용 가능한 플러그 앤 플레이 방식의 지식 베이스를 제공한다.

HF Daily Papers4달 전· 4달 전 발행

SRPO: 실패한 답변만 골라 집중 과외하는 새로운 LLM 강화학습 기법

LLM의 추론 능력을 높이는 강화학습 과정에서 정답을 맞힌 샘플과 틀린 샘플을 똑같이 취급하던 기존 방식의 한계를 해결했다. 틀린 답변에 대해서만 세밀한 교정 학습을 진행함으로써 학습 속도를 높이고 성능 저하를 방지하여 Qwen3-8B 모델에서 평균 3.4% 이상의 성능 향상을 달성했다.

HF Daily Papers4달 전· 4달 전 발행

AI 에이전트의 한계 노출: 정보 변화와 갈등 상황을 평가하는 ClawArena

기존 AI 에이전트 평가는 정적인 환경에 치중되어 있어 실제 업무 환경처럼 정보가 수시로 바뀌고 소스 간 내용이 충돌하는 상황을 반영하지 못한다. ClawArena는 다중 소스 갈등 해결, 동적 신념 수정, 암시적 개인화라는 세 가지 핵심 과제를 통해 에이전트가 복잡한 현실 세계에서 얼마나 신뢰할 수 있는 비서 역할을 수행하는지 엄격하게 검증한다.

HF Daily Papers4달 전· 4달 전 발행

파일 시스템 행동 추적으로 AI 에이전트 개인화 성능 59.6% 달성

기존 AI 에이전트는 대화 내용에만 의존하여 사용자의 작업 스타일을 파악했으나, 이 논문은 실제 파일 조작 기록인 행동 추적을 활용하는 새로운 패러다임을 제시합니다. 이를 통해 사용자의 고유한 파일 정리 습관이나 작업 절차를 정확히 학습하여 더 정교한 개인 맞춤형 협업이 가능해집니다.

HF Daily Papers4달 전· 4달 전 발행

월드 모델의 표준 정의와 통합 추론 프레임워크 OpenWorldLib 공개

인공지능 분야에서 모호하게 사용되던 '월드 모델'의 개념을 지각, 상호작용, 장기 기억 능력을 갖춘 시스템으로 명확히 정의했습니다. 이를 바탕으로 다양한 월드 모델 관련 태스크를 하나의 인터페이스로 실행할 수 있는 통합 라이브러리를 제공하여 연구 효율성을 극대화했습니다.

HF Daily Papers4달 전· 4달 전 발행

자주 쓰이는 표현이 LLM 성능을 높인다: 아담의 법칙 발견

LLM이 학습 데이터에서 자주 접한 텍스트 패턴을 더 잘 처리한다는 '텍스트 빈도 법칙(TFL)'을 정립했습니다. 이를 통해 프롬프트의 단어 선택만으로도 모델의 추론 및 번역 성능을 즉각적으로 개선할 수 있는 실무적 가이드라인을 제공합니다.

HF Daily Papers4달 전· 4달 전 발행

AURA: 2 FPS 실시간 추론으로 비디오 스트림을 상시 이해하는 AI 어시스턴트

기존 비디오 언어 모델은 전체 영상을 먼저 저장한 뒤 분석하는 오프라인 방식에 치중되어 있어 실시간 대응이 어려웠다. AURA는 끊임없이 들어오는 비디오 스트림을 실시간으로 처리하며 사용자의 질문에 답하거나 상황에 맞춰 먼저 말을 거는 능동적 상호작용을 가능하게 한다.

aifeed.dev4달 전

AI 에이전트 도입 후 엔지니어링 역량의 절반을 갉아먹는 7가지 인프라 부채

AI 에이전트가 프로토타입을 넘어 운영 단계로 진입할 때 발생하는 7가지 범주의 인프라 기술 부채와 관리의 어려움을 분석했다.

aifeed.dev4달 전

구글의 차세대 코딩 에이전트 Jules V2, 단순 명령을 넘어 목표를 스스로 수행

구글이 단순 코드 생성을 넘어 상위 목표를 스스로 이해하고 코드베이스 전체를 관리하는 자율 코딩 에이전트 Jules V2를 개발하고 있다.