본문으로 건너뛰기

2026년 5월 6일 AI 뉴스

100

관심 태그 추가

Anthropic의 Claude Opus 4.7 출시, 3배 더 정밀해진 비전 성능의 핵심

Claude Opus 4.7은 이전 모델 대비 3배 이상 향상된 이미지 해상도 지원과 문서 및 차트 이해 능력을 갖춘 Anthropic의 최신 멀티모달 모델이다.

서로 다른 LLM들이 왜 모두 똑같은 성격으로 변해갈까?

최첨단 LLM들이 개발사와 학습 방식에 상관없이 체계적이고 분석적인 특정 성격으로 수렴하며 페르소나가 균질화되고 있다는 연구 결과가 발표됐다.

KDNugget3달 전

Claude Code를 디스코드와 연결하여 나만의 AI 에이전트 구축하기

로컬 Claude Code 세션을 디스코드와 연동하여 실시간으로 상호작용할 수 있는 채널 설정 가이드

아마존이 0.5%의 효율 개선을 위해 수억 개의 변수를 계산하는 방법

아마존이 복잡한 물류 네트워크에서 발생하는 수요 변동과 예기치 못한 중단 상황에 대응하기 위해 혼합 정수 최적화와 시나리오 기반 스트레스 테스트를 활용하는 전략을 다룹니다.

삼성전자 시총 1조 달러 돌파, HBM과 애플 협력설이 이끈 역사적 급등

삼성전자가 AI 열풍에 따른 HBM 수요 급증과 애플과의 미국 내 칩 제조 협력 가능성에 힘입어 아시아 기업 중 두 번째로 시가총액 1조 달러를 돌파했다.

LangChain3달 전

월 3억 건의 에이전트 실행, Clay는 어떻게 품질과 비용을 잡았나

Clay의 AI 책임자 Jeff Barg가 LangSmith를 활용해 대규모 에이전트 시스템의 관측 가능성, 평가, 99.5%의 비용 정산 정확도를 달성한 실전 사례를 공유합니다.

에이전트 AI의 '확신에 찬 오류'를 잡는 하이브리드 평가 프레임워크

에이전틱 AI의 다단계 추론과 도구 사용 과정에서 발생하는 '확신에 찬 오류'와 '우발적 정렬 불량'을 해결하기 위한 하이브리드 평가 프레임워크와 안전 원칙을 제시한다.

Dataiku Blog3달 전

98%의 CIO가 느끼는 압박, 이제 AI 투자는 ROI 증명으로 결정된다

2026년 기업 AI 예산은 단순한 채택 지표를 넘어 실제 비용 절감이나 수익 창출과 같은 측정 가능한 재무적 성과 증명을 요구받고 있다.

비싼 인간 라벨링 대신 AI가 직접 가르치는 LLM 정렬의 미래

인간 피드백(RLHF) 대신 AI 피드백(RLAIF)을 사용하여 LLM을 정렬해도 대등한 성능을 낼 수 있음을 실험적으로 증명한 논문 요약이다.

All About AI3달 전

AI가 스스로 만든 iOS 앱, 10일 만에 얼마 벌었을까?

Claude Code를 활용해 자동 제작한 iOS 앱들의 10일간 수익 현황과 AI API 비용 기반의 수익화 전략을 공유한다.

ChatGPT와 Claude 안에 내 앱을? MCP로 만드는 인터랙티브 UI

MCP를 활용해 단순 텍스트 응답을 넘어 ChatGPT, Claude 등 호스트 앱 내에서 브랜드화된 인터랙티브 UI를 구현하는 아키텍처와 배포 전략을 다룹니다.

보안과 편의성을 모두 잡는 LLM 게이트웨이 인증 전략 5가지

Archestra v1.2.33은 단순 API 키부터 기업용 JWKS까지 LLM 게이트웨이 환경에 최적화된 5가지 인증 메커니즘을 제공한다.

OpenCode 에이전트의 한계를 넘는 7가지 필수 플러그인 가이드

OpenCode AI 코딩 에이전트의 기능을 확장하여 영구 메모리, 터미널 제어, 웹 검색 및 분석 기능을 추가하는 7가지 핵심 플러그인을 소개한다.

Vizuara3달 전

실시간 대화형 음성 AI 에이전트를 직접 구축하는 8주 완성 가이드

ASR, LLM, TTS 기술을 통합하여 실시간으로 작동하는 고성능 음성 에이전트를 파이썬으로 직접 구축하는 전문 교육 과정이다.

NVIDIA Isaac Lab으로 시작하는 자율 주행 로봇 Sim-to-Real 실전

NVIDIA Isaac Lab 시뮬레이션 환경에서 모방 학습을 통해 TurboPi 로봇의 자율 주행 정책을 학습시키고 실제 환경에 배포하는 전체 워크플로우를 다룬다.

단순 질문이 아닌 설계다! AI 성능을 극대화하는 RACE 프레임워크 가이드

단순한 질문을 넘어 역할, 행동, 맥락, 기대치를 구조화하는 RACE 프레임워크와 체이닝 등 실무 프롬프트 엔지니어링 기법을 소개한다.

수만 개 GPU가 멈추지 않는 비결: OpenAI가 공개한 차세대 네트워크 표준 MRC

OpenAI가 대규모 GPU 클러스터의 학습 효율을 극대화하기 위해 개발한 Multipath Reliable Connection(MRC) 프로토콜의 작동 원리와 업계 표준화 계획을 다룹니다.

Claude Code로 만든 AI 네이티브 GTA? 2천 달러 투자한 개발기

개발자가 Claude Code를 활용해 Unity 기반의 AI 생성형 멀티플레이어 게임 'FLAIR'를 구축한 과정과 성과를 공유했다.

웹 페이지에 숨겨진 AI 조종 명령, Claude는 어떻게 간파했을까?

Claude가 검색 결과 내에 숨겨진 마케팅 목적의 프롬프트 주입 시도를 식별하고 이를 단순 데이터로 취급하여 무시한 실제 사례이다.

The Verge AI3달 전

내 컴퓨터 용량이 갑자기 줄었다면? 크롬 Gemini Nano 자동 다운로드 주의

구글 크롬이 로컬 AI 기능을 위해 4GB 크기의 Gemini Nano 모델 파일을 사용자 고지 없이 자동 다운로드하여 저장 공간을 차지하는 현상이 보고됐다.

AI Supremacy3달 전

1962년 JFK의 자동화 대응책이 AI 시대 일자리 위기의 해법이 될 수 있을까?

1962년 자동화에 대응해 제정된 인력개발훈련법(MDTA)을 거울삼아, AI로 인한 노동 시장 불평등을 해소하기 위한 연방 차원의 강력한 재교육 프로그램 도입이 시급하다.

TechCrunch AI3달 전

전 AMD Silo AI CEO가 설립한 QuTwo, 퀀텀 기반 차세대 AI 오케스트레이션 시장 조준

전 Silo AI CEO 피터 살린이 설립한 핀란드 AI 연구소 QuTwo가 퀀텀 및 하이브리드 컴퓨팅을 활용한 엔터프라이즈 AI 오케스트레이션 플랫폼 개발을 위해 2,500만 유로를 유치했다.

iMerit Blog3달 전

로봇의 눈을 뜨게 하는 데이터 전략: 멀티모달 어노테이션의 핵심

로보틱스 AI의 성능 극대화를 위해 카메라, LiDAR, 레이더 등 다양한 센서 데이터를 통합하고 일관되게 라벨링하는 멀티모달 어노테이션 전략을 제시한다.

r/ClaudeCode3달 전

Claude Code에서 '죄송합니다'를 없애는 /start 스킬의 비밀

Claude Code 사용 시 /start 스킬을 통해 저장소 컨텍스트를 미리 로드하고 모델의 행동 규칙을 완벽하게 제어하는 방법이다.

GPT 챗봇 한 달 운영비가 고작 3달러? 실제 운영 데이터 공개

실제 웹사이트에 GPT-5.4 기반 챗봇을 30일간 통합 운영한 결과, 390회 상호작용에 약 3.25달러의 저렴한 비용이 발생했다.

네트워크 홉 없는 로컬 AI 추론, M4 Air에서 한 자릿수 P99 달성

Apple M4 Air에서 Moss 벤치마크를 실행한 결과, 인프로세스 추론을 통해 네트워크 지연 없이 한 자릿수 P99 성능이 확인됐다.

버그 수정 기간을 주 단위에서 일 단위로 단축한 AI 에이전트 워크플로

GitHub Issue와 Action을 Claude Code와 연동하여 비기술직 팀원도 직접 버그를 수정하고 검증할 수 있는 자율형 개발 파이프라인을 구축했다.

Transformer의 한계를 넘다, 성능과 속도를 모두 잡은 SATFormer 공개

초기 레이어의 정보를 토큰별 게이팅 메커니즘으로 선택적 재사용하여 성능과 처리량을 최적화한 새로운 아키텍처 SATFormer가 제안됐다.

코드 한 줄 안 쓰고 만든 AI 오디오북 생성기가 깃허브에서 화제

Qwen3-TTS를 활용해 직접적인 코드 작성 없이 LLM 지시만으로 EPUB를 오디오북으로 변환하는 Alexandria Audiobook 프로젝트를 개발했다.

AI 모델 개발사가 직접 기업 컨설팅에 나선 이유: 조직 변화 없는 AI 혁신은 불가능하다

OpenAI와 Anthropic이 기업의 실질적인 AI 도입을 지원하기 위해 대규모 컨설팅 및 엔지니어링 벤처를 설립하며 비즈니스 모델을 확장하고 있습니다.

HF Daily Papers3달 전· 3달 전 발행

입자 시스템 생성의 혁신, OGPP로 SOTA 대비 26배 적은 파라미터로 고품질 3D 생성 달성

기존의 생성 모델은 주로 격자(Grid) 구조에 최적화되어 있어 자유롭게 움직이는 입자 시스템을 처리할 때 효율성이 떨어졌다. 이 논문은 입자의 물리적 특성과 대칭성을 직접 활용하는 새로운 Flow Matching 프레임워크를 통해 3D 형상 복원 및 물리 시뮬레이션의 정확도를 획기적으로 높였다.

HF Daily Papers3달 전· 3달 전 발행

최신 AI 에이전트도 대학생 과제 해결률은 55%에 불과

기존 AI 에이전트 벤치마크가 이메일 관리와 같은 단순 비서 업무에 치중되어 실제 고도의 지적 능력이 필요한 학업 현장의 요구를 반영하지 못한다는 한계를 지적한다. 대학생들이 직접 실패를 경험한 80개의 복잡한 과제를 통해 에이전트의 도메인 지식과 장기 추론 능력을 엄격하게 평가할 수 있는 새로운 기준을 제시한다.

AI 점장이 주문한 계란 120개와 통조림 22kg, 웃지 못할 AI 실험의 이면

Andon Labs가 스톡홀름에서 진행한 AI 카페 운영 실험의 사례를 통해 인간의 개입 없는 AI 에이전트의 실무 적용 한계와 윤리적 문제를 고찰한다.

바다 위에서 돌아가는 AI? 파력 발전으로 데이터 센터 전력난 해결한다

피터 틸 등 실리콘밸리 투자자들이 육지 데이터 센터의 전력 및 부지 문제를 해결하기 위해 파력 발전을 직접 활용하는 해상 AI 데이터 센터 기업 Panthalassa에 투자했다.

OpenAI가 투자한 Cerebras의 IPO와 AI 칩 시장의 지각변동

Cerebras의 266억 달러 규모 IPO 소식과 함께 OpenAI의 전략적 지분 확보, 하버드 의대의 o1 모델 진단 성능 평가, IBM의 에이전트 제어 평면 발표 등 최신 AI 산업 동향을 다룹니다.

The AI Grid3달 전

구글이 만든 마케팅 AI Pomelli로 브랜드 콘텐츠 자동 생성하기

구글 랩스에서 출시한 AI 마케팅 도구 Pomelli를 활용하여 브랜드 DNA를 설정하고 고품질 제품 사진, 캠페인 이미지 및 애니메이션 비디오를 생성하는 방법을 다룹니다.

MIT AI News3달 전

1만 달러로 세계 챔피언을 꺾다: MIT 교수가 혁신한 AI 전략 의사결정

MIT의 Gabriele Farina 교수가 게임 이론과 머신러닝을 결합하여 불완전 정보 환경에서도 효율적으로 최적의 전략을 찾는 알고리즘을 개발했습니다.

AI 에이전트 전용 결제 시스템: 월 20달러 구독 대신 10원 결제

AI 에이전트 간의 소액 결제를 지원하기 위해 EIP-3009와 가스비 없는 트랜잭션을 활용한 M2M 에스크로 프로토콜이 Base 메인넷에 배포되었다.

AI 에이전트가 쏟아내는 저품질 코드, slop CLI로 자동 차단

AI 에이전트가 생성하는 구조적 결함과 저품질 코드(Slop)를 탐지하고 방지하기 위한 25가지 메트릭 기반의 린팅 도구 slop v1.0.0이 출시되었다.

가짜 면허 번호까지? Character.AI, 의사 사칭 혐의로 소송 직면

펜실베이니아주가 AI 챗봇을 면허가 있는 의료 전문가로 속여 제공한 혐의로 Character.AI를 주 법원에 고소했다.

AI 모델 10개를 동시에 돌려라? 바이브 코딩으로 게임 만드는 법

AI 모델의 무작위성을 역이용해 10개의 병렬 캔버스를 운영하고 최적의 결과물을 선택하여 한 달 만에 웹 타이쿤 게임을 완성한 사례이다.

AI가 나를 더 잘 기억하게 만드는 법: 세 가지 메모리 설계의 득과 실

오픈소스 AI 어시스턴트인 Hermes, Vellum, OpenClaw의 메모리 관리 방식을 비교하여 사용자 승인 기반의 지식 축적 방식이 가장 효과적임을 분석했다.

Claude Code Teams: 혼자보다 나은 팀 단위 AI 에이전트 활용법

Claude Code의 Teams 기능을 통해 여러 에이전트에게 역할을 분담하고 특히 적대적 에이전트를 배치하여 결과물의 품질을 높이는 방법론을 공유한다.

Claude Code 사이드바가 안 열린다면? v2.1.129 버그 해결 가이드

Claude Code VS Code 확장 프로그램 최신 버전에서 사이드바 UI가 작동하지 않는 회귀 버그가 발생하여 이전 버전으로의 다운그레이드가 권장된다.

단순한 AI 사용을 넘어 'AI가 읽을 수 있는 비즈니스'를 만드는 법

AI 모델의 지능보다 비즈니스 데이터를 모델이 직접 읽고 분석할 수 있도록 구조화된 '운영 계층'을 구축하는 것이 실질적인 기업 경쟁력이다.

Claude와 Cursor의 할루시네이션을 잡는 Ejentum MCP 서버

LLM의 추론 오류와 아첨 현상을 방지하기 위해 네 가지 인지 도구를 제공하는 오픈소스 MCP 서버가 출시됐다.

AI 에이전트가 내 계정으로 정부를 해킹한다면? 사이버 보안의 새로운 위협

주요 AI 기업들의 보안 전략과 AI 에이전트의 정체성 관리 프레임워크, 그리고 Linux 커널의 심각한 취약점인 'Copy Fail'에 대해 심층적으로 논의한다.

프롬프트만으로 앱 완성? Google AI Studio의 강력한 업데이트

Google AI Studio가 Tab Tab Tab, 디자인 프리뷰, 편집 모드를 도입하여 텍스트 중심의 코딩에서 시각적인 앱 빌더로 진화했다.

Claude로 엑셀 노가다 끝내기: 90초 만에 끝나는 데이터 정제 팁

Claude를 단순 텍스트 도구가 아닌 '문서 처리자'로 활용하여 복잡하고 지저분한 스프레드시트 데이터를 자동으로 정제하고 엑셀 파일로 출력하는 실무 프롬프트 전략이다.

대화 이력만 저장하는 에이전트는 한계가 있다? MaxHermes의 기술 결정화

MaxHermes는 단순 대화 이력 저장 대신 성공한 작업 방법론을 '기술'로 결정화하여 영구 메모리에 저장함으로써 긴 컨텍스트에서의 성능 저하를 방지한다.

M5 맥북에서 클라우드 없이 Qwen 3.6 로컬 코딩 환경 구축하기

Apple Silicon 환경에서 mlx-lm의 메모리 누수 문제를 해결하고 Ollama와 Qwen 3.6 MoE 모델을 활용해 안정적인 로컬 코딩 서버를 구축한 사례이다.

RAG 검색 품질 측정 고민 끝! 오픈소스 평가 도구 Evret 등장

검색, RAG, 추천 시스템의 품질을 Hit Rate, MRR 등 핵심 지표로 평가할 수 있는 오픈소스 프레임워크 Evret이 공개됐다.

프롬프트 수정 후 품질 급락? TraceMind로 45초 만에 원인 분석

시스템 프롬프트 변경으로 인한 LLM 품질 저하를 자동으로 탐지하고 ReAct 에이전트로 원인을 분석하는 오픈소스 플랫폼 TraceMind가 공개됐다.

사라진 Rewind AI를 대체할 도구는? Screenpipe부터 Fabric까지 실사용 비교

Rewind AI의 부재 이후 수동적 데이터 캡처와 효율적 정보 검색을 동시에 만족하는 도구가 부족한 상황에서 Screenpipe, Mem.ai 등 대안들의 장단점을 분석했다.

에러율 12%에서 2.5%로 급감시킨 5단계 프롬프트 설계 비법

실제 서비스 중인 5개 에이전트의 경험을 바탕으로, 프롬프트를 API 명세서처럼 구조화하여 성능과 신뢰성을 높이는 5단계 프레임워크를 제안한다.

AI가 추천한 맛집 중 600곳은 이미 폐업? 주요 LLM 지리 정보 정확도 분석

ChatGPT, Gemini, Perplexity를 대상으로 100개 도시 식당 추천의 정확도를 측정한 결과, 상당수의 환각 현상과 데이터 지연 문제가 확인됐다.

귀찮은 프롬프트 작성 끝? 대충 말해도 10가지 버전으로 바꿔주는 도구

사용자의 단순한 아이디어를 OpenAI 가이드라인 기반의 정교하고 즉시 사용 가능한 프롬프트로 변환해주는 도구 Promptimize가 공개됐다.

Suno와 Udio 음악 생성 성공률을 높이는 6단계 프롬프트 공식

Suno와 Udio에서 장르, 분위기, 악기 등 6개 요소를 대괄호로 구분해 입력하면 음악 생성의 일관성과 품질이 크게 향상된다.

r/ClaudeCode3달 전

Claude Code 성능 높이는 팁: 효과 없는 모호한 규칙은 버리세요

Claude Code 사용 시 모호한 지침 대신 구체적이고 측정 가능한 행동 규칙을 설정하는 것이 성능 향상에 핵심적이다.

Claude Code가 Rust 문서를 직접 읽게 만드는 groxide 도구

AI 에이전트가 Rust 크레이트 문서를 HTML 스크래핑 없이 터미널에서 직접 쿼리할 수 있게 해주는 groxide 도구가 공개됐다.

구직 시간 3시간에서 20분으로 단축, Claude 기반 스마트 잡 스캐너

대량의 채용 공고를 키워드로 1차 필터링한 후 Claude를 사용하여 이력서 적합도를 정밀 분석하는 저비용 구직 자동화 도구입니다.

LLM 보안 탐지 지연 시간 12ms로 단축한 3계층 방어 전략

결정론적 패턴 매칭과 LLM을 결합한 3계층 구조를 통해 12ms의 낮은 지연 시간과 0.3%의 위양성률로 프롬프트 주입을 탐지하는 아키텍처이다.

Claude의 새로운 선제적 비서 Orbit 유출과 GPT-5.5의 등장

Anthropic의 선제적 비서 Orbit 유출, OpenAI의 GPT-5.5 Instant 출시, Google의 Gemini 3.2 Flash 유출 등 주요 AI 기업들의 최신 업데이트를 다룹니다.

TechCrunch AI3달 전

SAP의 승부수: 11억 달러 투자로 '표 형식 데이터' 전용 AI 연구소 설립

SAP가 정형 데이터 특화 AI 스타트업 Prior Labs를 인수하고 향후 4년간 10억 유로를 투자하여 기업용 표 형식 기초 모델(TFM) 역량을 강화합니다.

TechCrunch AI3달 전

배터리·반도체 결함 분석, AI로 몇 주 걸리던 작업을 단 몇 분 만에 해결

스타트업 Altara가 배터리 및 반도체 제조 공정의 파편화된 데이터를 통합 분석하여 결함 진단 시간을 획기적으로 단축하는 AI 플랫폼을 출시했습니다.

Claude Code로 구글 애널리틱스 데이터를 직접 분석하는 방법

Claude Code가 GA4, GSC, Bing Webmaster Tools API에 직접 접근하여 SEO 및 웹 분석 데이터를 처리할 수 있게 해주는 오픈소스 스킬이 공개됐다.

HF Daily Papers3달 전· 3달 전 발행

Haiku: 2,600만 개 데이터로 암 진단과 생존 예측 성능 7.9% 향상

기존 암 진단은 조직의 형태(H&E)나 분자 정보(mIF) 중 하나에만 의존해 질병의 전체 맥락을 파악하기 어려웠다. Haiku는 이미지와 분자 데이터, 임상 텍스트를 하나의 공간에 통합하여 데이터 간 교차 검색과 정밀한 생존 예측을 가능하게 한다. 이는 의료진이 복잡한 암 진행 과정을 다각도로 분석하고 개인화된 치료 전략을 세우는 데 기여한다.

TabPFN 성능 극대화: 강화학습 기반 데이터 정렬로 정확도와 신뢰도 동시 확보

표 형식 파운데이션 모델(TFM)은 적은 데이터로도 강력한 성능을 내지만, 입력 데이터에 결측치나 이상치가 있으면 성능이 급격히 저하된다. 이 논문은 강화학습을 통해 데이터 클리닝 순서를 최적화하여 모델이 학습한 가상 분포와 실제 데이터를 일치시킴으로써 정확도를 높이고 모델의 확신 편향 문제를 해결한다.

HF Daily Papers3달 전· 3달 전 발행

게임 그래픽을 실사로 변환하여 AI 학습 성능 극대화

게임 엔진으로 생성한 합성 데이터는 실제 환경과의 시각적 차이(Sim2real gap) 때문에 AI 모델의 실세계 성능을 저하시킨다. 이 논문은 최신 Diffusion 모델과 이미지 번역 기술을 결합하여 합성 이미지의 기하학적 구조를 개선하고 실사 데이터의 분포를 정확히 맞춤으로써 자율주행 등 시각 AI의 학습 효율을 높이는 방법을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

췌장암 수술 가능성 판단 돕는 불확실성 기반 AI 벤치마크 공개

췌장암 수술의 성패는 종양이 인접 혈관을 얼마나 침범했는지 정확히 판단하는 데 달려 있으나, 전문가들 사이에서도 의견이 갈리는 경우가 많다. 이 논문은 이러한 진단적 모호성을 해결하기 위해 다수의 전문가 주석이 포함된 데이터셋과 불확실성을 고려한 새로운 AI 평가 프레임워크를 제시하여 더 안전한 수술 계획 수립을 돕는다.

HF Daily Papers3달 전· 3달 전 발행

MotionCache: 비디오 생성 속도 6.28배 향상 및 품질 유지 성공

자기회귀 비디오 생성은 긴 영상을 만드는 데 유리하지만 연산 비용이 매우 큽니다. 이 논문은 영상 내 움직임이 적은 부분은 이전 계산 결과를 재사용하고 움직임이 큰 부분만 새로 계산하는 방식으로, 화질 저하 없이 생성 속도를 획기적으로 높이는 기술을 제안합니다.

HF Daily Papers3달 전· 3달 전 발행

WeightFormer: Attention 없이도 Transformer급 성능과 선형 연산량 달성

Transformer의 핵심인 Attention 메커니즘은 시퀀스 길이의 제곱에 비례하는 연산량 때문에 고해상도 이미지 처리에 한계가 있습니다. 이 논문은 Attention을 입력에 따라 가중치가 변하는 동적 MLP로 재해석하여, 연산량을 선형적으로 줄이면서도 글로벌 정보를 효과적으로 처리할 수 있는 새로운 설계 패러다임을 제시합니다.

HF Daily Papers3달 전· 3달 전 발행

BlenderRAG, LLM의 3D 모델링 성공률을 40%에서 70%로 끌어올리다

LLM이 생성하는 3D 모델링 코드는 문법 오류나 비현실적인 비율 문제가 잦았습니다. BlenderRAG는 별도의 추가 학습 없이 검색 증강 생성 기법만으로 3D 객체의 기하학적 일관성과 시각적 품질을 대폭 개선하여 일반 소비자용 하드웨어에서도 고품질 3D 에셋 생성을 가능하게 합니다.

HF Daily Papers3달 전· 3달 전 발행

에이전트 AI의 비효율, '한계 토큰 할당' 경제학으로 해결한다

현재 에이전트 AI 시스템은 라우팅, 실행, 서빙, 학습 단계가 서로 분절되어 설계되어 있어 전체적인 자원 낭비가 발생한다. 이 논문은 미시경제학의 한계 분석을 도입하여 토큰 소비의 비용과 위험, 지연 시간을 통합 관리함으로써 시스템 전체의 효율성을 극대화하는 새로운 설계 프레임워크를 제시한다.

HF Daily Papers3달 전· 3달 전 발행

Ctx2Skill: 인간의 개입 없이 LLM 스스로 문맥에서 추론 기술을 추출하고 진화시킨다

기존의 언어 모델은 학습 데이터에 없는 복잡하고 전문적인 문맥을 이해하는 데 한계가 있었습니다. 이 논문은 모델이 스스로 문제를 내고 풀며 정답을 맞춰가는 '자기 주도 학습' 방식을 통해, 긴 문서나 복잡한 규칙에서도 핵심 추론 기술을 스스로 추출하여 성능을 비약적으로 높이는 방법을 제시합니다.

HF Daily Papers3달 전· 3달 전 발행

PFlowNet: 시각적 추론 정확도 90.6% 달성 및 환각 현상 획기적 개선

기존의 시각 언어 모델은 이미지를 단순히 훑어보는 수준에 그쳐 복잡한 질문에 대해 잘못된 정보를 생성하는 환각 현상이 잦았습니다. 이 논문은 모델이 사람처럼 계획을 세우고 이미지의 특정 부분을 단계적으로 탐색하며 추론하는 Perceptual Flow 기법을 도입하여 시각적 이해의 정확도와 신뢰성을 동시에 높였습니다.

HF Daily Papers3달 전· 3달 전 발행

MolmoAct2, GPT-5와 Gemini를 능가하는 오픈소스 로봇 AI 등장

기존 로봇 제어 모델은 폐쇄적이거나 특정 하드웨어에 종속되어 실제 환경 배포에 한계가 있었다. MolmoAct2는 데이터, 학습 코드, 모델 가중치를 모두 공개한 완전 오픈소스 VLA 모델로, 저비용 로봇에서도 고성능 행동 추론이 가능함을 입증하여 로보틱스 연구의 민주화를 가속화한다.

HF Daily Papers3달 전· 3달 전 발행

확산 모델의 학습 속도 가속화 및 3D 형상 생성 품질 대폭 개선

기존 확산 모델은 고차원 데이터의 모든 속성을 동시에 학습하려다 보니 특정 조합의 데이터를 충분히 학습하지 못하는 한계가 있었다. 이 논문은 데이터의 각 차원이나 속성마다 서로 다른 시간 단계를 적용하는 비동기식 학습법을 통해 학습 효율을 높이고, 생성 시점에 정교한 부분별 제어를 가능하게 한다.

HF Daily Papers3달 전· 3달 전 발행

Ψ-RAG: 여러 문서를 넘나드는 복잡한 질문에 25.9% 더 정확한 답변

기존의 트리 기반 RAG 방식은 단일 문서 내 검색에는 강하지만, 여러 문서에 흩어진 정보를 연결해야 하는 복잡한 질문에는 한계가 있었다. 이 논문은 데이터 분포에 유연하게 대응하는 새로운 트리 구조와 에이전트 기반 검색을 통해 대규모 문서 집합에서도 정확한 다단계 추론을 가능하게 한다.

HF Daily Papers3달 전· 3달 전 발행

LLM 에이전트의 실제 의료 현장 성공률은 단 46%에 불과

기존 의료 AI 벤치마크는 단순 지식 암기나 단일 단계 작업에 치중되어 실제 병원 시스템의 복잡한 워크플로우를 반영하지 못했다. 이 논문은 실제 환자 기록과 표준 API를 사용하는 EHR 환경을 구축하여, AI 에이전트가 자율적인 임상 에이전트로 기능하기 위해 극복해야 할 기술적 격차를 명확히 제시한다.

HF Daily Papers3달 전· 3달 전 발행

LLM 환각 해결의 열쇠는 '모른다'고 말하는 메타인지 능력

LLM의 지식 확장은 한계에 다다르고 있으며, 단순히 더 많은 사실을 학습시키는 것보다 자신이 무엇을 모르는지 아는 메타인지 능력이 신뢰성 확보의 핵심이다. 이 논문은 환각을 단순한 오류가 아닌 확신에 찬 오류로 재정의하고, 모델의 내부 확신도와 언어적 표현을 일치시키는 충실한 불확실성 개념을 제시하여 에이전트 시스템의 통제력을 높이는 방향을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

T2PO, 불확실성 제어로 멀티턴 LLM 에이전트 학습 붕괴 해결

멀티턴 강화학습에서 LLM 에이전트가 무의미한 행동을 반복하며 학습이 붕괴되는 'hesitation' 문제를 해결합니다. 토큰과 턴 단위에서 불확실성을 실시간으로 모니터링하여 탐색 효율을 높이고 학습 안정성을 획기적으로 개선합니다.

HF Daily Papers3달 전· 3달 전 발행

LVLM의 시각 정보 희석 문제 해결로 복잡한 추론 성능 4.8% 향상

대형 시각 언어 모델(LVLM)이 긴 문장을 생성할 때 초기에 입력된 시각 정보를 잊어버리는 '시각 신호 희석' 현상을 수학적으로 증명하고 해결책을 제시했습니다. PVM 모듈을 통해 모델이 생성 길이와 관계없이 고해상도 이미지 세부 사항에 지속적으로 접근할 수 있게 하여 복잡한 시각적 추론의 정확도를 높였습니다.

HF Daily Papers3달 전· 3달 전 발행

Meta의 32B 코드 모델, 대형 모델 수준의 성능과 안전성 입증

코드 생성 및 추론 능력이 뛰어난 모델이 사이버 보안이나 생물학적 위협에 악용될 가능성을 사전에 평가한 보고서이다. 32B 규모의 중형 모델인 CWM이 기존의 거대 모델들과 대등한 성능을 내면서도 생물학적/사이버 위험 임계치를 넘지 않음을 확인하여 오픈 웨이트로 공개할 수 있는 기술적 근거를 제시한다.

HF Daily Papers3달 전· 3달 전 발행

해양 AI의 한계 돌파, 50억 토큰 규모의 멀티모달 데이터셋 OceanPile 공개

해양 데이터는 소나, 수중 영상, 과학 문헌 등 형식이 파편화되어 있어 AI 모델 학습에 큰 어려움이 있었다. 이 논문은 세계 최초로 대규모 해양 멀티모달 데이터를 통합하고 정렬하여, 범용 모델이 해결하지 못한 해양 과학 특화 추론 성능을 비약적으로 향상시켰다.

수천 대의 로봇을 동시에 제어하라! LoRR 2026 로봇 경진대회 개최

AAMAS 2026과 연계하여 수백~수천 대의 로봇이 실시간으로 협응하며 작업을 수행하는 대규모 다중 로봇 제어 경진대회가 개최된다.

영수증 AI 추출 정확도를 높이는 비결은 추론 금지 지시문이다

영수증 데이터 추출 시 모델의 임의 추론을 금지하고 필드별 명확한 형식을 지정하여 데이터 정확도를 개선한 사례이다.

터미널에서 직접 코드를 수정하는 AI 에이전트, Claude Code

Claude Code는 코드베이스를 직접 이해하고 터미널 명령어를 실행하며 파일을 수정하는 자율형 AI 코딩 에이전트이다.

애플 인텔리전스 광고와 달랐다? 애플, 아이폰 사용자에게 2억 5천만 달러 배상

애플이 아이폰 16 및 15 프로 광고와 달리 AI 기능을 제때 제공하지 않은 것에 대해 2억 5천만 달러 규모의 집단 소송 배상에 합의했다.

Anthropic이 공개한 MSM, AI가 '착한 척'만 하는 문제를 해결할까?

Anthropic이 모델이 정렬 원칙을 내면화하여 새로운 상황에서도 일관되게 행동하도록 돕는 Model Spec Midtraining(MSM) 기법을 발표했다.

영수증 OCR 비용 절감 비결은 Gemini 단일 패스 추출이다

수천 장의 영수증 테스트를 통해 Gemini의 단일 패스 추출 방식이 기존 OCR-LLM 파이프라인보다 효율적임을 확인했다.

터미널에서 즐기는 AI 판타지, par-storygen의 대규모 업데이트

LLM을 활용해 텍스트, 이미지, 음성을 결합한 터미널 기반 선택형 스토리 게임 par-storygen의 신규 기능과 개선 사항이 공개됐다.

r/vibecoding3달 전

AI가 코드를 짜줘도 결국 아키텍처가 실력을 결정한다

AI를 활용한 빠른 개발 환경에서도 시스템의 복잡성을 제어하고 운영 가능성을 확보하는 전통적인 아키텍처 설계 역량이 더욱 중요해지고 있다.

OpenAI가 공개한 AI 협업을 위한 10가지 엔지니어링 원칙

OpenAI의 엔지니어링 사례를 바탕으로 AI 도구의 효율을 극대화하고 코드 품질을 유지하기 위한 실무 가이드를 제시한다.

TechCrunch AI3달 전

ASML CEO가 밝힌 AI 칩 부족 사태의 진실과 4,000억 원짜리 장비의 비밀

ASML의 Christophe Fouquet CEO는 AI 칩 수요 폭증으로 인한 공급 제한 상황과 차세대 High-NA EUV 장비의 경제성 및 기술적 진입장벽을 강조했다.

SQL만으로 이상 탐지 가능? 트랜잭션당 6마이크로초의 초고속 추론

JVM 기반 분석 엔진 Stratum이 SQL에서 직접 Isolation Forest 모델을 실행할 수 있는 SIMD 가속 네이티브 이상 탐지 기능을 공개했다.

물리학자가 1년 걸릴 난제를 GPT-5는 단 30분 만에 해결했다

OpenAI의 Alex Lupsasca가 GPT-5를 활용해 이론 물리학 및 양자 중력 분야에서 인간 전문가도 해결하지 못한 새로운 연구 결과를 도출한 사례를 다룬다.

AI의 아부와 편향을 제거하는 마크 안드레센의 '독설가 전문가' 프롬프트

실리콘밸리의 거물 마크 안드레센이 사용하는, AI의 무조건적인 동의를 배제하고 비판적 사고와 정확성을 극대화하는 시스템 프롬프트가 공개됐다.

Claude Code와 Gemini를 위한 Elephant/Goldfish 개발 패턴

Dave Rensin의 이론을 바탕으로 브레인스토밍, 기능 추가, 버그 수정 등에 활용 가능한 AI 에이전트용 재사용 명령 세트를 공유했다.