본문으로 건너뛰기

2026년 4월 22일 AI 뉴스

100

관심 태그 추가
Y Combinator3달 전

Stripe 디자인 총괄이 밝히는 AI 시대의 웹 디자인 전략

Stripe의 디자인 총괄 Katie Dill이 6년 만의 홈페이지 리디자인 과정과 AI 도구를 활용한 프로토타이핑 및 브랜드 이미지 생성 기법을 공유합니다.

AI 환각, 멀티 에이전트 아키텍처가 실질적인 해결책이 될 수 있을까?

법률과 같은 고위험 분야에서 단일 모델의 한계를 극복하기 위해 멀티 에이전트 시스템을 통한 역할 분리 및 상호 검증의 실효성을 논의한다.

arg min blog3달 전

복잡한 시스템을 지탱하는 '제약의 힘', 인터넷부터 아폴로 계획까지

컴퓨터 과학, 소프트웨어, 조직 구조 전반에 걸쳐 복잡성을 관리하고 혁신을 가능하게 하는 계층적 아키텍처와 프로토콜의 설계 원칙을 탐구합니다.

MCP 설치는 이제 그만? Claude가 직접 API를 호출하는 'Teleport'

MCP의 복잡성과 속도 제한 문제를 해결하기 위해 Claude가 직접 REST API를 호출하도록 설계된 오픈소스 프로젝트 Teleport가 공개됐다.

더 이상 '조금 더 어둡게'라고 빌지 마세요, 슬라이더로 조절하는 AI 이미지 에디터

Token-Aware-Image는 이미지의 시각적 속성을 토큰화하여 프롬프트 재입력 없이 사용자가 슬라이더로 직접 정밀 조정할 수 있게 돕는 AI 에이전트 도구이다.

Claude Code와 Codex의 복잡한 에이전트 실행 과정을 실시간으로 추적하세요

여러 코딩 에이전트의 실행 로그, 도구 호출, 토큰 사용량 및 코드 변경 사항을 통합 관리하는 터미널 기반 TUI 도구 Lazyagent가 공개됐다.

손실 함수는 그대로인데 선호도는 63% 상승? 새로운 학습 기법 공개

동일한 데이터와 손실 지표에서도 정밀도 가중치 및 레이어별 그래디언트 조절을 통해 인간 선호도를 유의미하게 높일 수 있음을 입증했다.

TTS 모델이 날짜와 URL을 틀리는 이유와 해결을 위한 벤치마크

실시간 TTS 모델들이 숫자, 날짜, URL 등 텍스트 정규화에서 빈번히 오류를 범하는 문제를 지적하며 이를 평가하는 벤치마크를 공유했다.

KDNugget3달 전

2025년 양자 머신러닝 입문을 위한 필수 GitHub 저장소 5선

양자 컴퓨팅과 머신러닝의 결합인 양자 머신러닝을 체계적으로 학습할 수 있는 5가지 핵심 오픈소스 프로젝트와 학습 경로를 제시한다.

iMerit Blog3달 전

로봇이 세상을 보는 법: Embodied AI를 위한 1인칭 데이터의 중요성

Embodied AI 구현을 위해 로봇의 시점을 반영한 1인칭(Egocentric) 비디오 데이터 수집과 정밀한 어노테이션의 중요성을 다룹니다.

Dataiku Blog3달 전

EU AI Act부터 ISO 42001까지, 기업을 위한 AI 컴플라이언스 실전 가이드

AI 시스템의 법적·윤리적 표준 준수를 위해 데이터 프라이버시, 보안, 투명성, 공정성, 거버넌스의 5대 핵심 요소를 통합 관리하는 전략을 제시한다.

단순한 루프를 넘어선 진짜 AI 에이전트 설계: OpenAI SDK와 H100 병렬 오케스트레이션

OpenAI의 새로운 에이전트 SDK와 Modal의 클라우드 인프라를 결합하여 컨텍스트 관리와 GPU 병렬 처리가 최적화된 실전용 에이전트 아키텍처를 구축하는 방법을 제시한다.

NVIDIA GTC에서 조명한 AI 생태계의 미래와 모델 다양성

AI가 비즈니스 핵심 인프라로 자리 잡으면서 오픈 모델과 폐쇄형 모델이 공존하는 다양한 생태계가 형성되고 있다.

단백질 분석의 '캔 오브 웜스'를 닫다: AI 에이전트 기반의 10x Science

스타트업 10x Science가 AI 에이전트와 질량 분석법을 결합하여 신약 개발의 핵심인 단백질 특성 분석 자동화 솔루션을 출시하고 480만 달러의 시드 투자를 유치했다.

Google Cloud Next ’26에서 공개된 Gemini Enterprise Agent Platform

Google Cloud가 엔터프라이즈 에이전트의 구축, 확장, 거버넌스 및 최적화를 지원하는 통합 개발 플랫폼인 Gemini Enterprise Agent Platform을 발표했습니다.

AI 티 나는 글은 이제 그만, 독자를 설득하는 인간적인 글쓰기 프롬프트

William Zinsser의 간결한 문체와 심리적 설득 기법을 결합하여 AI 생성 콘텐츠를 전문적인 인간의 글로 변환하는 고급 프롬프트 프레임워크입니다.

Salesforce3달 전

AI 코딩 에이전트, 100만 줄의 코드도 이해할 수 있을까? Salesforce의 새로운 벤치마크 공개

Salesforce AI Research가 1만에서 100만 토큰 규모의 대규모 코드베이스에서 AI 코딩 에이전트의 이해력과 효율성을 평가하는 LoCoBench-Agent를 발표했다.

구글, AI 에이전트 가속을 위한 차세대 TPU 8i 및 8t 발표

구글이 AI 에이전트의 추론 속도와 대규모 모델 학습 효율을 극대화하기 위해 설계된 TPU 8i와 TPU 8t 칩을 새롭게 선보였다.

전 OpenAI CTO 미라 무라티의 신생 스타트업, Google과 손잡고 AI 인프라 대확장

미라 무라티가 설립한 Thinking Machines Lab이 Google Cloud와 수십억 달러 규모의 계약을 맺고 Nvidia GB300 기반 차세대 AI 인프라를 확보했다.

Anthropic의 비밀 모델 유출과 SpaceX의 Cursor 인수 옵션

MIT Technology Review가 선정한 AI 핵심 트렌드 10가지와 Anthropic 모델 무단 접속, SpaceX의 Cursor 인수 계약 등 주요 업계 소식을 전합니다.

AI가 쏟아내는 보안 버그 리포트, 리눅스 커널에서 오래된 드라이버를 퇴출시키다

LLM이 생성한 대량의 보안 버그 보고서로 인한 유지보수 부담을 줄이기 위해 리눅스 커널에서 아마추어 무선 및 노후 드라이버를 삭제하는 방안이 논의되고 있습니다.

NVIDIA와 Google Cloud의 만남: 96만 개 GPU 클러스터로 여는 물리적 AI 시대

NVIDIA와 Google Cloud가 Vera Rubin GPU 기반 인프라와 Blackwell 포트폴리오를 통해 에이전트 및 물리적 AI를 위한 풀스택 플랫폼 협력을 강화합니다.

비싼 GPT-4 대신 작은 모델을 써야 할 때는 언제일까?

대규모 특정 도메인 작업에서 비용 효율성을 위해 범용 모델 대신 Phi-3 Mini와 같은 소형 모델의 미세 조정 및 하이브리드 접근 방식이 주목받고 있다.

r/vibecoding3달 전

200개 이상의 AI 에이전트를 구축하며 정립한 6가지 핵심 디자인 패턴

1년 반 동안 200개 이상의 에이전트를 구축한 경험을 바탕으로 정립한 6가지 핵심 에이전트 디자인 패턴을 공유한다.

The Verge AI3달 전

Anthropic의 가장 위험한 보안 모델 Mythos, 디스코드 그룹에 유출

Anthropic이 보안 위험으로 공개를 제한한 사이버 보안 특화 모델 'Mythos'가 서드파티 계약자의 접근 권한과 데이터 유출 정보를 이용한 비인가 그룹에 의해 2주간 사용된 사실이 밝혀졌다.

AI 코딩 에이전트의 한계 돌파! 대규모 코드 검색을 위한 Claude Context

Claude Context는 MCP를 통해 AI 코딩 에이전트에 시맨틱 검색 기능을 추가하여 대규모 코드베이스의 맥락 파악 효율을 높여주는 오픈소스 도구이다.

Wired AI3달 전

인터넷에 넘쳐나는 AI '슬롭' 잡는 청소부, Pangram의 실시간 탐지기

Pangram Labs가 Reddit, X, LinkedIn 등 주요 소셜 플랫폼의 게시물이 AI로 생성되었는지 실시간으로 판별하는 Chrome 확장 프로그램을 출시했습니다.

Databricks가 제안하는 의료 AI의 미래: 유전체부터 웨어러블까지 통합하기

Databricks는 유전체, 의료 영상, 임상 기록 및 웨어러블 데이터를 Unity Catalog 기반의 레이크하우스로 통합하여 정밀 의료 AI를 프로덕션에 배포하는 아키텍처를 제시한다.

r/AutoGPT3달 전

지저분한 PDF와 스크립트 뭉치에서 탈출하는 데이터 중심 파이프라인

파편화된 데이터 전처리 스크립트를 재사용 가능한 연산자 기반 파이프라인으로 구조화하는 dataflow 프로젝트가 공유됐다.

비싼 LLM 대신 소형 모델로 OCR 비용 90% 아끼는 방법

42개의 표준 문서를 대상으로 7,560회의 테스트를 수행한 결과, 소형 모델이 고가 모델 수준의 OCR 정확도를 훨씬 낮은 비용으로 달성함을 확인했다.

금융·의료 AI, 일반 모델보다 정확도 50% 높다? DSLM의 실전 가치

금융, 법률 등 고위험 도메인에서 도메인 특화 모델(DSLM)이 일반 LLM보다 정밀도와 환각 방지 측면에서 우수하며, RAG와 결합 시 시너지가 극대화된다.

CrewAI Blog3달 전

간호사의 업무 시간을 80% 단축하는 CrewAI의 의료용 에이전트 워크플로

CrewAI의 멀티 에이전트 시스템을 활용해 수동 환자 접수 프로세스를 자동화함으로써 간호사의 행정 업무 시간을 80% 절감하고 보험 검증 오류를 개선한다.

SVM의 핵심 원리부터 커널 트릭까지 한눈에 이해하는 시각화 가이드

서포트 벡터 머신의 마진 최대화, 커널 트릭, 힌지 손실 등 복잡한 개념을 애니메이션으로 시각화하여 설명한 튜토리얼이다.

환각 방지 가드레일이 포함된 에이전트용 시스템 프롬프트 구조

에이전트가 직접 파싱하고 주입할 수 있도록 ID, 카테고리, 입출력 형식이 구조화된 안티 환각 시스템 프롬프트 체계이다.

GitHub Copilot 가격 정책 변경, 코딩 에이전트가 불러온 연산 비용의 한계

GitHub이 코딩 에이전트 도입에 따른 연산 비용 급증으로 인해 Copilot 개인 플랜의 사용 제한을 강화하고 가격 구조를 개편했다.

뉴런 하나가 여러 개념을 처리하는 이유, 수학적으로 증명됐다

신경망이 중첩(Superposition) 상태에서 개념을 계산할 때 필요한 뉴런 수의 하한선과 상한선이 sqrt(m) 수준임을 수학적으로 증명한 연구를 소개합니다.

OpenAI의 차세대 이미지 모델 GPT-Image-2와 1조 파라미터 Kimi K2.6의 등장

OpenAI가 텍스트 렌더링과 추론 능력을 강화한 GPT-Image-2를 출시했으며, Moonshot AI는 1조 파라미터 규모의 오픈소스 모델 Kimi K2.6을 공개했습니다.

HF Daily Papers3달 전· 3달 전 발행

OLLM은 텍스트보다 시각 정보를 더 믿는다: 모달리티 선호도 분석

기존 멀티모달 모델이 텍스트에 의존하던 것과 달리, 최신 옴니모달 모델(OLLM)은 시각 정보를 압도적으로 선호한다는 사실을 발견했습니다. 이러한 내부 선호도가 모델의 환각 현상을 유발하는 핵심 원인임을 밝혀내고, 이를 사전에 진단할 수 있는 새로운 도구를 제시하여 더 안전한 AI 구축의 토대를 마련했습니다.

HF Daily Papers3달 전· 3달 전 발행

LLM 검색 모델, 오타에는 강하지만 유의어 교체 공격에는 취약

최근 검색 시스템의 중추가 BERT에서 LLM으로 전환되고 있지만, 실제 환경에서의 강건성은 충분히 검증되지 않았다. 이 논문은 LLM 기반 검색 모델이 오타나 악의적인 문서 주입 공격에는 기존 모델보다 강하지만, 의미적 변형에는 여전히 취약하다는 점을 밝혀내어 더 안전한 검색 시스템 설계 방향을 제시한다.

The Verge AI3달 전

일론 머스크의 SpaceX, AI 코딩 시장 장악 위해 Cursor 인수 추진

SpaceX가 AI 코딩 스타트업 Cursor를 600억 달러에 인수하거나 100억 달러의 협력비를 지불하는 독특한 계약을 체결하며 xAI의 경쟁력을 강화합니다.

OpenAI의 24시간 자율 에이전트 스튜디오 유출과 구글의 반격

OpenAI의 자율 에이전트 구축 도구인 Hermes와 이미지 모델 2.0, 그리고 Google의 Gemini 3.1 Pro 기반 Deep Research 에이전트 출시 소식을 다룹니다.

LLM 판사들의 치명적 약점: 제시 순서만 바꿔도 판정 결과가 뒤집힌다

27개 주요 LLM을 대상으로 동일한 두 답변의 제시 순서를 바꿔 판정의 일관성을 측정한 결과, 모델 평균 63.3%가 첫 번째 답변을 선호하는 위치 편향을 보였습니다.

TechCrunch AI3달 전

구글 맵과 어스에 생성형 AI 탑재, 몇 달 걸리던 분석을 단 몇 분 만에

구글이 Cloud Next에서 기업용 구글 맵 및 어스에 생성형 AI를 통합하여 시각화와 데이터 분석 성능을 대폭 강화했다.

구글 클라우드 넥스트 2026: 7억 5천만 달러 투입해 AI 에이전트 시장 선점 나선다

구글 클라우드가 7억 5천만 달러의 예산을 투입해 파트너사들의 AI 에이전트 판매를 지원하고 Notion, Lovable 등 주요 AI 스타트업과의 협력을 강화합니다.

에이전트 플랫폼 선택의 실수, 기능이 아닌 제약 사항을 먼저 보세요

AI 에이전트 플랫폼 선택 시 기능 나열보다 배포 환경, 엔지니어링 깊이, 거버넌스 등 실질적 제약 사항을 우선 고려해야 한다.

Claude와 GPT-4o에서 검증된 5단계 프롬프트 워크플로 설계법

도메인 특화 비즈니스 아이디어 생성을 위해 역할 고정, 단계별 독립 블록, 구체적 채점 루브릭을 활용한 5단계 프롬프트 워크플로를 제안한다.

AI 에이전트가 해커처럼 내 시스템을 공격한다면? OpenClaw 보안 실험 결과

보안 기업 Sophos가 AI 에이전트 OpenClaw를 활용해 자동화된 침투 테스트를 수행한 실험 결과와 즉석 생성 소프트웨어 시대의 새로운 보안 과제를 논의한다.

Claude Code 업데이트로 Opus 4.7 컨텍스트 1M 강제 적용

Claude Code 2.1.117 버전에서 Opus 4.7의 컨텍스트 윈도우를 200K에서 1M로 수정하며 자동 압축 로직이 변경됐다.

AI 에이전트 7개에게 각각 100달러를 주고 12주간 방치한 결과

7개의 AI 에이전트에게 예산과 도구를 부여하여 자율적으로 제품을 개발하고 배포하게 한 실험의 초기 결과와 교훈을 공유한다.

클라우드 토큰 낭비 끝! Git 작업을 로컬 LLM으로 처리하는 MCP 서버

Git Diff 분석과 커밋 메시지 생성을 로컬 LLM으로 위임하여 클라우드 API 비용을 절감하는 오픈소스 MCP 서버 git-courer가 공개됐다.

Claude Code 터미널에서 진짜 DOOM이 돌아간다? MCP로 구현한 놀라운 프로젝트

Claude Code의 상태 표시줄과 MCP 도구를 활용하여 터미널 UI 내에서 DOOM 게임을 렌더링하고 AI가 직접 플레이하게 만든 프로젝트이다.

LLM 음성 통화의 끊김 현상, 시퀀스 버퍼와 백프레셔로 해결하기

Twilio WebSocket 기반 LLM 음성 에이전트 운영 중 발생한 오디오 패킷 손실 및 순서 뒤바뀜 문제를 시퀀스 인식 버퍼와 백프레셔 제어로 해결한 실무 사례이다.

r/ClaudeCode3달 전

AI 코딩 에이전트의 실수를 막는 Claude Code용 인간 리뷰 도구

Claude Code가 생성한 변경 사항을 개발자가 최종 승인하고 보안 취약점을 점검할 수 있게 돕는 오픈소스 스킬이 공개됐다.

r/LLMDevs3달 전

RAG 성능의 핵심은 검색 알고리즘이 아닌 데이터 수집 파이프라인이다

실제 기업 환경에서 RAG 시스템 구축 시 가장 많은 비용과 시간이 소요되는 지점은 검색 튜닝이 아닌 복잡한 데이터 수집 및 최신성 유지 과정임이 확인됐다.

r/ClaudeCode3달 전

Claude vs Codex 코딩 대결: 성능은 2배 빠르고 비용은 절반?

실제 개발 에픽을 활용해 Claude와 Codex의 코드 품질, 교차 감사 능력, 비용 효율성을 비교한 결과 Codex가 구조적 안정성과 가성비 면에서 압승했다.

Anthropic의 Claude Mythos 비공개, 누가 AI 접근권을 결정하는가?

Anthropic의 Claude Mythos 비공개 결정을 계기로, 고성능 AI의 접근 권한을 공동으로 관리하는 집단 방어 거버넌스 프레임워크가 제안됐다.

Claude Code가 유료 플랜에서 빠진다? Anthropic의 새로운 요금제 테스트

Anthropic이 신규 가입자 2%를 대상으로 Claude Code 포함 여부를 조정한 새로운 요금 체계를 테스트 중이다.

여러 AI 모델이 동시에 같은 가짜 숫자를? 집단 환각 현상 목격담

터미널 기반 에이전트가 여러 모델을 오케스트레이션하는 과정에서 서로 다른 모델들이 동일한 허위 수치를 생성하며 오류를 강화하는 집단 환각 현상이 보고됐다.

r/ClaudeCode3달 전

코드 리뷰의 종말? 이제 '구문'이 아닌 '의도'를 리뷰하는 시대

AI 에이전트가 코드를 구현함에 따라 개발자의 역할이 작성자에서 설계 및 감사자로 변화하며, 리뷰의 중심이 코드에서 기획 단계로 이동하고 있다.

2026년 살아남은 AI 도구는? 챗봇부터 코딩 에이전트까지 완벽 티어 정리

챗봇, 코딩 에이전트, 노코드 도구 등 2026년 주요 AI 서비스들의 실무 효율성과 비용 대비 가치를 기준으로 S급부터 D급까지 상세하게 분류했다.

Gemini로 앱 만들 때 꼭 알아야 할 실전 팁과 주의사항

Google AI Studio와 Gemini를 활용해 앱을 개발할 때 필요한 도메인 연결, 프롬프트 전략 및 모델 선택 가이드를 제시한다.

HF Daily Papers3달 전· 3달 전 발행

LLM 무단 복제 방지: 추론 과정 재작성으로 성능 61% 저하 유도

고성능 LLM의 추론 과정을 훔쳐서 저비용으로 모델을 복제하는 무단 지식 증류 문제를 해결합니다. 기존 방어 기법과 달리 원본 모델의 성능은 유지하거나 오히려 높이면서도, 이를 훔쳐 배우려는 모델의 정확도만 효과적으로 떨어뜨리는 획기적인 보안 기술입니다.

HF Daily Papers3달 전· 4달 전 발행

복잡한 코딩 없이 클릭만으로 유전자-환경(GxE) 상호작용 분석

작물의 수확량이나 질병 저항성은 유전적 요인뿐만 아니라 재배 환경과의 상호작용에 의해 결정되는데, 이를 분석하기 위해서는 복잡한 통계 프로그래밍 기술이 필요했다. 이 논문은 비전문가도 혼합 효과 모델과 안정성 분석을 수행할 수 있는 대화형 도구인 RGxEStat을 제공하여 육종 연구 주기를 단축시킨다.

HF Daily Papers3달 전· 3달 전 발행

쌍곡선 기하학으로 3D 장면 이해도 8.14%p 대폭 향상

기존의 3D 장면 이해 기술은 유클리드 공간을 사용해 장소와 물체 사이의 계층적 포함 관계를 표현하는 데 한계가 있었습니다. 이 논문은 공간이 확장되는 성질을 가진 쌍곡선 기하학을 도입하여, 장소 안에 물체가 있다는 논리적 구조를 AI가 더 정확하게 학습하도록 만들어 로봇의 자율 주행 및 환경 인식 능력을 개선합니다.

HF Daily Papers3달 전· 3달 전 발행

AI 에이전트 보안 사고 74%를 심볼릭 가드레일로 완벽 차단

LLM 기반 에이전트가 실제 비즈니스 환경에서 도구(Tool)를 오용하여 발생하는 데이터 유출이나 금융 손실을 방지하기 위한 핵심 연구이다. 기존의 확률적 방어 체계와 달리 결정론적인 심볼릭 가드레일을 통해 에이전트의 성능 저하 없이도 강력한 안전 보장을 제공할 수 있음을 입증했다.

HF Daily Papers3달 전· 3달 전 발행

복잡한 모델 없이 단일 CNN 블록만으로 시계열 이상 탐지 SOTA 달성

시계열 이상 탐지 분야에서 Attention이나 복잡한 아키텍처 없이도 '데이터 매니폴드 투영'이라는 기본 원리에 충실하면 충분한 성능을 낼 수 있음을 증명했다. JuRe 모델은 기존 복잡한 모델 대비 파라미터 수를 획기적으로 줄이면서도 추론 속도를 20배 이상 향상시켜 실무 적용성을 극대화했다.

HF Daily Papers3달 전· 4달 전 발행

Intel NPU에서 LLM 추론 속도 35% 향상 및 에너지 40% 절감

자율 AI 에이전트가 NPU, GPU, CPU가 혼합된 복잡한 하드웨어에서 효율적으로 동작하려면 각 장치에 최적화된 컴파일러가 필수적이다. 이 논문은 기존 프레임워크의 불투명한 구조를 개선하여 Intel NPU 환경에서 추론 속도와 에너지 효율을 동시에 극대화하는 투명한 컴파일 파이프라인을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

세션이 끝나도 잊지 않는 AI, 연속성 계층으로 구현

현재의 AI는 세션이 종료되거나 컨텍스트 윈도우가 가득 차면 이전의 이해를 모두 잃어버리는 '건망증' 문제를 안고 있습니다. 이 논문은 단순한 데이터 저장을 넘어 상황을 재구성하여 지능의 연속성을 보장하는 새로운 인프라 계층인 Continuity Layer를 제안하여 AI의 구조적 한계를 해결하고자 합니다.

HF Daily Papers3달 전· 3달 전 발행

세포 편집의 성공 여부, 기하학적 일관성 지표 Shesha로 예측한다

유전자 편집 기술의 정밀도는 높아졌으나 편집 후 세포의 상태를 예측하는 것은 여전히 어렵다. 이 논문은 세포들이 얼마나 일관된 방향으로 변화하는지를 측정하는 새로운 기하학적 지표를 제시하여, 단순한 변화량 측정만으로는 알 수 없었던 세포의 안정성과 스트레스 상태를 진단할 수 있게 한다.

HF Daily Papers3달 전· 3달 전 발행

LLM 에이전트의 도구 호출 정확도, 과거 대화 분석으로 80배 효율적 개선

사용자가 도구 사용에 필요한 정보를 누락했을 때, 과거 행동 패턴에서 숨겨진 선호도를 추론하여 자동으로 보완하는 기술입니다. 전체 대화 이력을 모두 입력하는 대신 핵심 선호도만 추출하여 관리함으로써 연산 비용을 98% 이상 절감하면서도 정확한 개인화 서비스를 가능하게 합니다.

HF Daily Papers3달 전· 3달 전 발행

LLM 에이전트 벤치마크의 15% 이상이 보상 해킹에 취약함이 밝혀졌다

LLM 에이전트의 성능을 측정하는 기존 벤치마크들이 실제 과제 해결 대신 검증 로직의 허점을 찌르는 '보상 해킹'에 취약하다는 점을 체계적으로 입증했다. 이를 통해 안전한 AI 에이전트 평가 환경 구축과 에이전트의 기만적 행동을 감시하는 연구의 필요성을 시사한다.

HF Daily Papers3달 전· 3달 전 발행

데이터 부족한 사이버 보안 현장에서 취약점 활동 10일 앞서 예측

사이버 보안 위협 인텔리전스에서 취약점의 실제 악용 여부를 사전에 예측하는 것은 방어 우선순위 결정에 필수적이다. 이 논문은 데이터가 매우 희소하고 일시적으로 폭발하는 실제 환경의 제약을 극복하기 위해 통계적 모델과 기계학습 접근법을 비교 분석하여 실무적인 예측 가이드를 제공한다.

HF Daily Papers3달 전· 3달 전 발행

과학 연구 에이전트의 진화, MLE-Bench에서 성능 316% 향상 달성

기존의 AI 에이전트는 한 번의 실행으로 종료되는 정적인 구조여서 시행착오를 통해 배우는 과학적 탐구 방식에 적합하지 않았습니다. EvoMaster는 스스로 가설을 수정하고 실험 데이터를 축적하며 진화하는 프레임워크를 제공하여, 사람이 개입하지 않아도 수백 번의 실험 사이클을 돌며 스스로 연구 역량을 높이는 '에이전트 과학(Agentic Science)' 시대를 앞당깁니다.

HF Daily Papers3달 전· 3달 전 발행

LLM 디버깅의 함정: 테스트 통과율 76%에도 정밀도는 45% 미만

현재의 LLM은 코드를 디버깅할 때 버그가 있는 부분만 정밀하게 수정하기보다 코드 전체를 새로 작성하는 '재생성' 경향이 강하다는 사실을 밝혀냈다. 이는 대규모 코드베이스에서 코드 리뷰 비용을 높이고 예기치 못한 부작용을 초래할 수 있어, 단순 테스트 통과 여부를 넘어선 정밀한 디버깅 평가 지표가 필요함을 시사한다.

HF Daily Papers3달 전· 3달 전 발행

MNAFT, 특정 뉴런만 골라 학습시켜 이미지 번역 성능 SOTA 달성

기존 멀티모달 모델은 이미지 속 텍스트를 번역할 때 시각 정보와 언어 정보 사이의 간극으로 인해 정확도가 떨어지는 문제가 있었다. 이 논문은 모델 전체를 학습시키는 대신 번역에 핵심적인 특정 뉴런만 선택적으로 업데이트하여 연산 효율성을 높이면서도 번역 품질을 획기적으로 개선했다.

HF Daily Papers3달 전· 3달 전 발행

의료 AI의 맹점: 배경 노이즈만으로 오진을 유도하는 MedFocusLeak 공격

의료용 시각 언어 모델(VLM)이 실제 임상 현장에서 오진을 유도할 수 있는 보안 취약점을 발견했습니다. 기존 공격과 달리 진단에 중요하지 않은 배경 영역에 미세한 노이즈를 주입하여 모델의 시각적 주의력을 분산시킴으로써, 전문가도 알아채기 힘든 수준에서 치명적인 오진을 유도할 수 있음을 입증했습니다.

HF Daily Papers3달 전· 4달 전 발행

570만 개의 PubMed 데이터로 LLM의 의학적 결론 도출 능력 검증

LLM이 단순히 정보를 요약하는 수준을 넘어 증거로부터 과학적 결론을 추론할 수 있는지 평가하는 대규모 데이터셋을 제공한다. 의학 논문의 구조화된 초록을 활용해 배경과 결과로부터 저자의 실제 결론을 맞추는 고난도 추론 과제를 정의함으로써 AI의 연구 지원 능력을 정밀하게 측정할 수 있다.

HF Daily Papers3달 전· 3달 전 발행

Shesha 지표로 LLM 조종 가능성 예측 및 드리프트 탐지 2배 개선

LLM 배포 시 모델이 외부 제어에 얼마나 잘 반응할지 예측하고, 배포 후 내부 구조가 변질되는 '드리프트'를 감지하는 것은 안전한 운영의 핵심이다. 이 논문은 기하학적 안정성이라는 단일 원리로 조종 가능성 예측과 사후 모니터링을 동시에 해결하는 새로운 진단 도구 Shesha를 제안한다.

HF Daily Papers3달 전· 3달 전 발행

한 번에 여러 공감 전략을 구사하는 AI, 정서적 지지 성공률 40% 달성

기존 AI 상담 모델은 한 번에 하나의 전략만 사용해 대화가 단조로웠으나, 이 논문은 인간처럼 한 문장에 공감과 제안을 동시에 담는 기술을 구현했다. 이를 통해 대화 효율성을 높이고 사용자의 정서적 완화 효과를 극대화할 수 있는 새로운 연구 방향을 제시했다.

HF Daily Papers3달 전· 4달 전 발행

미세 조정 없이 뇌 신호로 이미지를 읽는 BrainCoDec 공개

사람마다 뇌의 구조와 활동 패턴이 달라 기존에는 새로운 사람의 뇌 신호를 해독하려면 매번 모델을 새로 훈련해야 했습니다. 이 논문은 몇 가지 예시 데이터만 입력하면 별도의 학습 없이도 처음 보는 사람의 뇌 신호를 즉시 해독할 수 있는 기술을 제시하여 범용적인 뇌-컴퓨터 인터페이스(BCI) 구현에 한 발짝 다가섰습니다.

HF Daily Papers3달 전· 3달 전 발행

LLM의 의미론적 추론 능력 검증을 위한 SEMANTICQA 벤치마크 공개

기존 LLM 평가가 수학이나 논리적 추론에 집중된 반면, 이 논문은 관용구나 복합 명사처럼 단어의 조합과 문맥에 따라 의미가 변하는 의미론적 추론 능력을 진단합니다. 단순한 패턴 매칭을 넘어 모델이 언어의 미묘한 뉘앙스를 실제로 이해하고 있는지 확인하는 새로운 기준을 제시합니다.

HF Daily Papers3달 전· 3달 전 발행

LLM 추론 속도 2.16배 향상, KV Cache 결손 문제 해결한 River-LLM

대형 언어 모델의 추론 속도를 높이기 위해 불필요한 연산 층을 건너뛰는 Early Exit 기법은 이전 토큰의 데이터가 유실되는 KV Cache Absence 문제로 인해 실질적인 속도 향상이 어려웠다. 이 논문은 별도의 추가 학습 없이도 유실된 데이터를 자연스럽게 생성하고 공유하는 구조를 제안하여, 모델의 정확도를 유지하면서도 실제 추론 속도를 획기적으로 개선했다.

HF Daily Papers3달 전· 3달 전 발행

게임에서 배운 전략으로 수학 문제까지 해결하는 STRATAGEM 기술 공개

기존의 게임 기반 셀프 플레이 학습은 특정 게임 규칙에만 종속된 편법을 배우는 한계가 있었다. STRATAGEM은 추론의 추상성과 진화 과정을 측정하여 게임을 넘어 수학이나 코딩 같은 일반적인 문제 해결 능력으로 전이될 수 있는 핵심 논리 구조를 강화한다.

HF Daily Papers3달 전· 3달 전 발행

멀티모달 LLM, 숫자 인식은 완벽해도 곱셈 연산은 0점에 가깝다

멀티모달 LLM이 시각이나 청각 정보를 통해 숫자를 완벽하게 인식함에도 불구하고, 실제 다자리 곱셈 연산에서는 심각한 성능 저하를 보인다는 사실을 입증했다. 이는 모델의 한계가 지각 능력이 아닌 내부 계산 로직의 부재에 있음을 시사하며, 향후 멀티모달 에이전트의 신뢰성 확보를 위한 연구 방향을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

음성 에이전트의 진화, VoxMind로 작업 완료율 34%에서 74%로 급증

기존 음성 대화 모델은 단순히 듣고 말하는 반응형 대화에 치중했으나, VoxMind는 복잡한 추론과 외부 도구 사용 능력을 통합하여 실제 문제를 해결하는 에이전트로 진화했다. 특히 도구 개수가 늘어나도 응답 속도가 느려지지 않는 관리 구조를 도입해 실무 적용성을 크게 높였다.

HF Daily Papers3달 전· 3달 전 발행

보상 없이 스스로 진화하는 LLM 에이전트, 웹 성능 20% 향상

기존의 자기 진화 에이전트는 인간이 정의한 보상과 워크플로우에 의존하는 한계가 있었습니다. 이 논문은 에이전트가 새로운 환경을 스스로 탐색하고 'World Knowledge'를 구축하여 외부 도움 없이도 성능을 개선하는 Native Agency 패러다임을 제시하며, 소형 모델이 대형 모델을 능가할 수 있는 가능성을 보여줍니다.

HF Daily Papers3달 전· 3달 전 발행

문맥 밀도 최적화로 에이전트 토큰 사용량 89.6% 절감 달성

긴 작업 수행 시 발생하는 문맥 폭발 문제를 해결하기 위해 정보 밀도 극대화라는 새로운 설계 원칙을 제시한다. 단순한 문맥 확장 대신 계층적 메모리와 자기 진화 메커니즘을 통해 비용은 낮추면서도 복잡한 작업 성공률을 획기적으로 높였다.

HF Daily Papers3달 전· 3달 전 발행

3만 개의 올림피아드 난제 정복, AI 수학 추론의 새로운 기준 MATHNET

기존 수학 데이터셋은 특정 국가에 편중되거나 규모가 작아 AI의 진정한 수학적 범용성을 평가하기 어려웠다. MATHNET은 47개국 17개 언어의 올림피아드 문제를 통합하여 AI가 복잡한 수식 구조와 다국어 맥락을 동시에 이해하는지 측정하는 강력한 도구를 제공한다.

HF Daily Papers3달 전· 3달 전 발행

자율주행 AI의 추론 속도와 정확도를 동시에 잡은 OneVL 공개

자율주행 시스템에서 사고 과정(Chain-of-Thought)을 거치는 모델은 정확하지만 연산 속도가 느려 실시간 적용이 어려웠습니다. OneVL은 복잡한 추론 과정을 압축된 잠재 토큰으로 처리하여 답변만 내놓는 모델 수준의 속도를 유지하면서도 기존의 단계별 추론 모델보다 더 높은 정확도를 달성했습니다.

HF Daily Papers3달 전· 3달 전 발행

Claude Opus 4.6, 스스로 스킬을 배우고 수정하여 성공률 8.43%p 향상

기존 에이전트 평가는 주어진 도구의 사용 능력에만 집중했으나, 실제 환경에서는 에이전트가 경험을 통해 스스로 스킬을 발견하고 오류를 수정하는 능력이 필수적이다. 이 논문은 에이전트가 시간이 지남에 따라 스킬 라이브러리를 어떻게 진화시키는지 측정하는 새로운 프레임워크를 제공하여 자율 학습 에이전트 연구의 새로운 방향을 제시한다.

HF Daily Papers3달 전· 4달 전 발행

구체적 단어 변조로 VLM의 구성적 이해 성능 13.13% 향상

시각-언어 모델(VLM)이 문장의 어순이나 속성 결합을 제대로 이해하지 못하는 '단어 가방(Bag-of-Words)' 현상을 해결하기 위해 단어의 구체성에 주목했다. 추상적인 단어보다 구체적인 단어를 수정했을 때 모델이 더 강력한 학습 신호를 얻는다는 원리를 이용해 모델의 논리적 추론 능력을 획기적으로 개선했다.

HF Daily Papers3달 전· 3달 전 발행

GPT-5 에이전트도 10번 중 4번만 성공? AI 에이전트의 신뢰성 위기 분석

AI 에이전트가 단일 실행에서 인간을 능가하는 성능을 보여주더라도, 동일한 작업에서 반복적으로 성공하지 못하는 신뢰성 문제가 실무 도입의 큰 장애물이 되고 있습니다. 이 논문은 에이전트의 불확실성을 유발하는 3대 요인을 정의하고, 단순 성공률이 아닌 재현 가능한 성공을 측정하기 위한 새로운 평가 체계를 제시합니다.

HF Daily Papers3달 전· 3달 전 발행

웹 개발의 전 과정을 평가하는 멀티모달 벤치마크 WebCompass 공개

기존의 코드 벤치마크가 단순한 알고리즘 정확도에만 집중했던 것과 달리, 실제 웹 개발에서 중요한 시각적 충실도와 상호작용성을 평가할 수 있는 통합 프레임워크를 제시한다. 텍스트뿐만 아니라 이미지와 비디오 입력을 모두 지원하여 실제 개발자의 워크플로우와 유사한 환경에서 모델의 성능을 정밀하게 측정한다.

HF Daily Papers3달 전· 3달 전 발행

단 한 번의 연산으로 고품질 이미지 생성, MeanFlow의 텍스트 확장 성공

기존의 초고속 이미지 생성 기술인 MeanFlow를 단순 분류 레이블이 아닌 복잡한 문장 입력으로 확장하여 실용성을 극대화했다. 강력한 LLM 기반 인코더의 특정 의미론적 특성이 원스텝 생성의 품질을 결정짓는 핵심 요소임을 밝혀내어 향후 효율적인 생성 모델 설계의 이정표를 제시한다.

HF Daily Papers3달 전· 3달 전 발행

SFT의 한계 극복, GFT로 LLM 성능과 강화학습 시너지를 동시에 잡다

기존의 Supervised Fine-Tuning(SFT)은 정답 데이터만 기계적으로 학습하여 모델의 창의성을 해치고 강화학습(RL)과의 시너지를 떨어뜨리는 문제가 있었다. 이 논문은 SFT를 강화학습의 특수한 사례로 재해석하고, 그룹 기반의 비교 학습과 동적 가중치 조절을 통해 지식 주입 효율과 일반화 성능을 동시에 높이는 새로운 사후 학습 프레임워크를 제시한다.

HF Daily Papers3달 전· 3달 전 발행

에이전트 평가 환경 구축 비용 13,800배 절감 및 대규모 벤치마크 자동화

LLM 에이전트의 성능을 평가하기 위한 환경 구축은 그동안 수작업에 의존해 비용이 높고 확장이 어려웠다. 이 논문은 자연어 설명만으로 검증된 에이전트 실행 환경을 자동 생성하는 파이프라인을 제안하여 평가의 확장성과 연속성을 확보했다.

HF Daily Papers3달 전· 3달 전 발행

MultiWorld, 여러 로봇과 플레이어의 상호작용을 완벽하게 시뮬레이션

기존 비디오 월드 모델은 주로 단일 에이전트 환경에 국한되어 여러 주체가 동시에 상호작용하는 복잡한 현실 세계를 모사하는 데 한계가 있었다. MultiWorld는 가변적인 수의 에이전트와 카메라 시점을 지원하여 협동 로봇 공학이나 멀티플레이어 게임 시뮬레이션의 정확도를 획기적으로 높였다.

HF Daily Papers3달 전· 3달 전 발행

LoRA 어댑터 병합 성능 저하, 출력 행렬 B만 보정해도 SOTA 달성

서로 다른 작업으로 학습된 LoRA 어댑터를 병합할 때 발생하는 성능 저하의 핵심 원인이 출력 측 행렬 B의 중복된 정보 축적임을 밝혀냈습니다. 이를 해결하기 위해 데이터 없이도 실행 가능한 Pico 기법을 도입하여 기존 병합 방식의 정확도를 최대 8.3포인트 향상시켰습니다.

HF Daily Papers3달 전· 3달 전 발행

OpenGame, 자연어 한 줄로 플레이 가능한 2D 웹 게임 자동 생성

기존 코드 에이전트는 단일 파일 코딩에는 능숙하지만, 게임 엔진의 복잡한 상태 관리와 다중 파일 간의 의존성 문제로 인해 실행 가능한 게임을 만드는 데 한계가 있었다. OpenGame은 게임 전용 구조적 가이드와 디버깅 프로토콜을 도입하여 누구나 아이디어만으로 완성도 높은 웹 게임을 제작할 수 있는 환경을 제공한다.

프롬프트 수정할 때마다 다른 게 깨진다면? 4단계 수술적 디버깅 가이드

프롬프트 전체 재작성 대신 오류 정의, 충돌 감사, 메타프롬프팅, 수술적 삽입의 4단계를 통해 부작용 없는 정밀한 프롬프트 디버깅 방법을 제안한다.