본문으로 건너뛰기

2026년 5월 8일 AI 뉴스

88

관심 태그 추가
KDNugget3달 전

JSON 때문에 낭비되는 LLM 토큰, TOON 포맷으로 비용과 성능 동시에 잡는다

LLM 입력 시 JSON의 반복적인 구조로 인한 토큰 낭비를 줄이기 위해 설계된 새로운 데이터 포맷 TOON의 특징과 활용법을 소개한다.

내 코드가 삭제된다면? Claude Code 보안 사고 막는 Vercel DeepSec 활용법

Vercel이 출시한 DeepSec은 Claude Code와 연동하여 대규모 코드베이스의 보안 취약점을 체계적으로 스캔하고 분석하는 자동화 하네스 도구이다.

The Verge AI3달 전

OpenAI의 ChatGPT 전용 스마트폰 출시 루머와 법정 공방의 전말

OpenAI와 Elon Musk 간의 법정 공방에서 드러난 내부 갈등과 OpenAI의 자체 스마트폰 개발 계획에 대한 분석을 다룹니다.

Slack 메시지 한 번으로 앱 개발부터 클라우드 배포까지 끝내는 AI 팀 구축법

OpenClaw와 Pazi.ai를 활용해 Slack 채널 내에서 관리자, 개발자, 운영 에이전트가 협업하여 Flask 앱을 Google Cloud에 자동 배포하는 멀티 에이전트 워크플로우를 구축한다.

AI가 AI를 만드는 시대, 통제 불능 '바이브 코딩'의 위험과 대응 전략

자연어 프롬프트로 앱을 생성하는 바이브 코딩의 확산에 대응하여, 비결정론적 AI 생성을 가시화하고 결정론적 실행으로 연결하는 새로운 거버넌스 아키텍처가 필요하다.

AWS ML Blog3달 전

지진 데이터 분석 워크플로 생성 시간 95% 단축한 Halliburton의 AI 비결

Halliburton은 Amazon Bedrock과 Claude 3.5를 활용하여 복잡한 지진 데이터 처리 워크플로 구성을 자연어 대화로 자동화하고 작업 시간을 95% 이상 단축했습니다.

재사용 가능한 프롬프트가 다른 에이전트에서 실패하는 이유

프롬프트 스킬을 다른 에이전트에 이식할 때 발생하는 컨텍스트 충돌을 방지하기 위해 명시적인 계약(Contract) 정의가 필요하다.

오타 하나에 비용이 달라진다? 토큰 효율을 결정하는 인간의 습관들

오타, 추임새, 공백 등 인간의 일상적인 작성 습관이 의도 변화 없이도 LLM의 토큰 수를 변화시켜 효율성에 영향을 준다.

AI 에이전트의 표준 연결 고리, MCP가 바꾸는 개발 워크플로

Anthropic이 공개한 MCP(Model Context Protocol)는 LLM과 외부 데이터 소스를 표준화된 방식으로 연결하여 에이전트의 생산성을 극대화하는 개방형 프로토콜이다.

AI 권태기 시대, 우리는 지금 어디에 서 있는가?

MIT 테크놀로지 리뷰는 AI가 일상에 확산되며 발생하는 불확실성과 권태를 분석하고, 로봇 공학 및 의료 분야의 최신 AI 트렌드를 조명했다.

자율주행 성능의 핵심, 카메라와 LiDAR 데이터를 동시에 라벨링하는 센서 퓨전 가이드

카메라, LiDAR, 레이더 데이터를 단일 워크플로에서 통합 라벨링하여 데이터 일관성을 높이고 비용을 절감하는 센서 퓨전 어노테이션 기법을 소개합니다.

AI Engineer3달 전

단순 검색을 넘어선 에이전틱 검색, LLM 성능을 결정짓는 핵심 전략

에이전트가 파일, DB, 웹 등 다양한 소스에서 최적의 정보를 스스로 선택하고 추출하는 에이전틱 검색의 실전 메커니즘을 다룹니다.

KDNugget3달 전

NumPy만으로 구현하는 벡터 검색: 원리부터 시각화까지 한 번에

NumPy를 사용하여 임베딩 정규화, 코사인 유사도 계산, PCA 시각화를 포함한 벡터 검색 엔진을 직접 구현하며 작동 원리를 설명한다.

Claude Code에서 Gemini와 로컬 에이전트를 자유롭게 사용하는 방법

Rust로 개발된 Claudy는 MCP 브리지를 통해 Claude Code에서 다양한 모델과 로컬 에이전트를 사용할 수 있게 지원한다.

Wired AI3달 전

우리 아이 AI 곰인형이 칼 찾는 법을 가르쳐준다면?

급성장하는 AI 장난감 시장에서 부적절한 콘텐츠 노출과 아동 발달 저해 위험이 제기됨에 따라 규제 강화의 필요성이 커지고 있다.

AICodeKing3달 전

데이터 생성부터 모델 배포까지 혼자 다 하는 AI ML 엔지니어 NEO

VS Code 확장 프로그램인 NEO는 단일 프롬프트로 합성 데이터 생성, 모델 학습, 추론 API 구축 및 UI 생성까지 수행하는 자율 머신러닝 엔지니어 에이전트이다.

AMD MI300X와 ROCm으로 5분 만에 구축하는 의료용 AI 에이전트

AMD Instinct MI300X 하드웨어와 ROCm 소프트웨어 스택을 활용하여 Qwen3-1.7B 모델을 의료 질의응답용으로 LoRA 파인튜닝하는 전체 과정을 다룹니다.

Relevance AI3달 전

유튜브 링크만 넣으면 링크드인 포스팅 완성? AI 에이전트 제작기

Relevance AI 플랫폼과 Claude를 활용하여 유튜브, 팟캐스트, 블로그 등의 소스를 분석하고 플랫폼별 맞춤형 SNS 포스팅을 자동 생성하는 에이전트 구축 과정을 다룹니다.

Relevance AI3달 전

9초 만에 DB 삭제? MCP 시대 AI 에이전트 보안 가이드

AI 에이전트가 프로덕션 환경에서 오작동하지 않도록 MCP 환경에서의 새로운 가드레일 설계 패턴과 실제 실패 사례를 통한 보안 전략을 제시한다.

Vizuara3달 전

단순 챗봇을 코딩 전문가로 바꾸는 시스템 프롬프트 설계의 비밀

AI 코딩 에이전트의 핵심인 시스템 프롬프트를 5가지 영역으로 구조화하고 환경 변수를 동적으로 주입하여 지능적인 에이전트를 구축하는 방법을 다룬다.

KT Cloud3달 전

H100급 성능을 내 책상 위에서? Dell GB10 워크스테이션 실사용 리뷰

NVIDIA Grace Blackwell 기반 Dell GB10 워크스테이션의 128GB 통합 메모리와 FP4 가속을 통한 Llama 3.3 70B 모델의 로컬 추론 성능 검증기입니다.

텍스트부터 비디오까지 처리하는 Qwen3.5, vLLM으로 실행하기

텍스트, 이미지, 비디오를 동시에 처리하는 네이티브 멀티모달 모델 Qwen3.5의 특징과 vLLM 및 llama.cpp를 이용한 추론 방법을 소개한다.

에이전트가 도구 호출을 '속이는' 순간을 포착하는 법

Distributional의 CEO Scott Clark가 전통적인 평가 지표(Evals)를 넘어 운영 환경에서의 비지도 학습 기반 분석을 통해 복잡한 AI 에이전트의 비정상 패턴을 탐지하는 방법을 설명합니다.

HF Daily Papers3달 전· 3달 전 발행

ResRL, 수학 추론 성능 9.4% 향상 및 생성 다양성 확보

대형 언어 모델의 추론 능력을 강화하기 위한 강화 학습 과정에서 정답(Positive)과 오답(Negative) 간의 의미적 중첩으로 인해 발생하는 그래디언트 충돌 문제를 해결합니다. 오답의 그래디언트 업데이트가 정답의 유효한 논리 구조까지 억제하는 현상을 방지하여 모델의 성능과 생성 다양성을 동시에 개선합니다.

HF Daily Papers3달 전· 3달 전 발행

4단계 증류만으로 교사 모델을 능가하는 고품질 스트리밍 비디오 생성

기존 비디오 생성 모델의 증류 방식은 모든 프레임과 픽셀을 동일하게 취급하여 품질 개선에 한계가 있었다. Stream-R1은 보상 모델을 활용해 개선이 더 필요한 영역에 학습 집중도를 차등 배분함으로써, 추론 속도를 30배 높이면서도 원본 모델보다 더 뛰어난 영상미와 일관성을 확보했다.

Wired AI3달 전

트럼프의 AI 규제 유턴? 모델 출시 전 연방 검토 추진 소식

트럼프 행정부가 새로운 AI 모델 출시 전 연방 정부의 검토를 거치게 하는 행정명령을 검토 중이라는 소식과 함께 연방 정부 내 AI 관련 갈등을 다룹니다.

파워포인트 안에 들어온 Claude: PDF를 5분 만에 발표 자료로 만드는 법

Anthropic이 출시한 Claude for PowerPoint 추가 기능을 통해 슬라이드 자동 생성, 데이터 시각화, PDF 기반 덱 구축 및 다국어 번역을 수행하는 실전 방법을 다룹니다.

Databricks3달 전

데이터 사일로 해결부터 AI 에이전트 구축까지, Databricks 핵심 요약

Databricks는 Unity Catalog와 Lakebase를 기반으로 데이터 사일로를 통합하고 AI 에이전트 및 애플리케이션 구축을 지원하는 통합 데이터 지능 플랫폼이다.

TechCrunch AI3달 전

유럽 마이크로 모빌리티 거물 Voi 창업진, AI 에이전트로 기업 자동화 혁신 도전

유럽 스쿠터 기업 Voi의 공동 창업자들이 설립한 스웨덴 AI 스타트업 Pit이 a16z로부터 1,600만 달러 투자를 유치하며 기업용 맞춤형 AI 소프트웨어 자동화 시장에 진출했다.

TechCrunch AI3달 전

내 Mac의 파일을 읽고 앱을 조작하는 Perplexity의 로컬 AI 에이전트 출시

Perplexity가 로컬 파일 및 앱 접근 권한을 가진 AI 에이전트 'Personal Computer'를 Mac 데스크톱 앱을 통해 모든 사용자에게 공개했다.

llm-gemini 0.31 업데이트로 Gemini 1.5 Flash-Lite 정식 버전 지원

Simon Willison이 개발한 llm-gemini 플러그인이 0.31 버전으로 업데이트되어 Gemini 1.5 Flash-Lite 모델의 정식 출시 버전을 지원한다.

The Verge AI3달 전

애플, 카메라 달린 에어팟으로 메타 스마트 글래스에 맞불 놓나

애플이 시각 정보를 수집하여 Siri와 연동하는 카메라 탑재 에어팟의 시제품 테스트를 진행하며 양산을 준비 중이다.

구글 딥마인드의 EVE 온라인 협업부터 SSM 구조 분석까지

구글 딥마인드의 게임 내 AI 테스트와 멀티모달 임베딩, SSM 구조 분석 등 최신 AI 연구 및 서비스 트렌드를 요약한 뉴스레터이다.

NVIDIA와 미국 에너지부, 5,000 엑사플롭스급 AI 슈퍼컴퓨터로 에너지 혁신 가속

NVIDIA와 미국 에너지부는 Genesis Mission을 통해 10만 개의 GPU가 탑재된 슈퍼컴퓨터를 구축하고 AI를 활용해 핵융합 및 전력망 효율화를 추진합니다.

내 맥 안의 AI가 직접 골라주는 '망한 사진'들, BadPhotosOut

Ollama의 로컬 비전 모델을 사용하여 사용자가 정의한 기준에 따라 macOS 사진 라이브러리를 분석하고 불필요한 사진을 선별해주는 오픈소스 앱입니다.

OpenAI3달 전

OpenAI가 선보이는 실시간 음성 혁명: GPT-Realtime 모델 3종 출시

OpenAI가 개발자를 위해 실시간 추론, 70개 언어 번역, 스트리밍 전사를 지원하는 새로운 오디오 모델 3종을 API로 출시했다.

수개월 걸리던 데이터 워크플로를 단축한 Informatica의 멀티 에이전트 AI 전략

Informatica는 IDMC 전반에 멀티 에이전트 시스템인 CLAIRE를 구축하여 복잡한 데이터 관리 워크플로의 작업 성공률을 90%까지 끌어올렸습니다.

Anthropic3달 전

Claude의 속마음을 읽는다? Anthropic이 공개한 AI 사고 번역 기술

Anthropic은 AI 모델의 내부 숫자 데이터인 활성화를 사람이 읽을 수 있는 텍스트로 번역하는 Natural Language Autoencoders 기술을 공개했다.

재배포 없이 실시간으로 진화하는 AI 에이전트 구축 가이드

Pydantic AI와 Logfire를 사용하여 서비스 중단 없이 프롬프트와 모델을 업데이트하고 프로덕션 데이터를 기반으로 에이전트 성능을 지속적으로 최적화하는 실전 기법을 다룬다.

모델을 실행하지 않고 출력을 예측한다? 샘플링보다 100배 빠른 메커니즘 추정 기술

무작위로 초기화된 다층 퍼셉트론(MLP)의 기대 출력을 실제 모델 실행 없이 가중치 분석만으로 몬테카를로 샘플링보다 정확하고 빠르게 추정하는 기법을 제안한다.

확률적인 LLM의 한계, '결정론적 평가 레이어'로 해결하는 법

규제 대상 업무에서 LLM의 확률적 특성으로 인한 신뢰성 문제를 해결하기 위해, 해석은 LLM이 하되 결정은 결정론적 규칙 엔진이 담당하는 이층 구조 아키텍처가 필수적이다.

WRITER3달 전

환각 없는 AI 리서치 에이전트: 실시간 데이터 연결로 신뢰성 확보

WRITER 플랫폼을 활용해 실시간 외부 데이터베이스와 연결하고 출처 인용이 가능한 고신뢰도 리서치 에이전트를 구축하는 방법과 사례를 제시한다.

GPU 부족 해결책: AWS에서 단기 GPU 용량 예약하고 비용 75% 절감하기

AWS에서 단기 ML 워크로드를 위해 EC2 Capacity Blocks와 SageMaker 학습 계획을 활용하여 GPU 가용성을 보장받고 비용을 최적화하는 전략을 제시한다.

중국 AI 연구소들이 미국을 빠르게 추격하는 진짜 이유

중국 AI 연구소들은 실용주의적 태도, 학생 중심의 인력 구조, 기술 내재화 의지를 바탕으로 미국과는 차별화된 방식으로 LLM 생태계를 구축하고 있다.

Salesforce3달 전

AI 에이전트 도입의 최대 걸림돌 거버넌스, MuleSoft Omni Gateway로 해결

Salesforce가 AI 에이전트, LLM, API 트래픽을 통합 관리하고 보안 및 비용 정책을 자동 적용하는 MuleSoft Omni Gateway를 출시했다.

구글의 자가 개선 AI AlphaEvolve, 과학과 비즈니스 난제 해결

Gemini 기반 진화 알고리즘 에이전트 AlphaEvolve가 출시 1년 만에 과학 연구 및 구글 클라우드 인프라 최적화에서 실질적인 성과를 거두었다.

Dataiku Blog3달 전

모델 성능 저하의 주범, 데이터 정규화 불일치를 해결하는 법

머신러닝 모델의 학습 안정성과 예측 신뢰성을 확보하기 위해 학습과 추론 파이프라인 간의 데이터 정규화 기법을 표준화하고 일관되게 적용해야 한다.

Practical AI3달 전

오픈 소스 AI가 폐쇄형 모델을 따라잡을 수 있을까? 2026년 전망

오픈 소스와 폐쇄형 AI 모델 간의 성능 격차 변화와 물리적 환경에 내장되는 임베디드 AI의 부상을 통해 향후 2년 내 AI 생태계의 변화를 전망합니다.

Claude와 연동되는 로컬 모델? 프라이버시와 성능을 다 잡는 하이브리드 AI 전략

사용자가 Claude Code와 MCP를 활용해 구축한 하이브리드 홈랩 경험을 바탕으로, Anthropic이 공식적인 로컬 추론 솔루션을 제공할 필요성을 제안했다.

RAG 답변이 이상하다면? 모델을 바꾸기 전 체크해야 할 4가지

RAG 시스템의 할루시네이션 문제는 대부분 모델 성능보다 청킹, 메타데이터 필터링, 유사도 임계값, 쿼리 최적화 등 검색 전략의 부재에서 발생한다.

AI의 답변을 믿어도 될까? 증거의 유효기간과 신뢰도를 계산하는 Veritas

AI 에이전트가 주장의 근거와 신뢰도를 수학적 벡터와 시간적 감쇠 모델을 통해 체계적으로 관리할 수 있게 돕는 Veritas 프레임워크가 공개됐다.

CEO 64%가 AI로 전략 결정? IBM이 제시하는 미래 기업의 AI 생존 전략

IBM Think 2026에서 전문가들이 모여 AI가 단순한 도구를 넘어 기업의 핵심 전략 결정과 엔드투엔드 운영을 주도하는 '에이전트 시대'의 신뢰 및 거버넌스 과제를 논의한다.

외부 SaaS 없이 구축하는 나만의 AI 코드 리뷰 에이전트 팀

Heym 워크플로를 통해 4개의 AI 에이전트가 협력하여 코드 변경 사항을 검토하고, 이를 MCP 서버로 노출해 Claude Code 등과 연동하는 자가 호스팅 시스템이다.

Claude Code 성능을 극대화하는 8가지 커뮤니티 검증 패턴

사용자가 3개월간 Discord와 GitHub 등에서 수집하고 검증한 Claude Code 전용 실전 프롬프트 패턴 8가지를 공유했다.

Claude Code의 한계 극복: 단순 검색에서 하이브리드 RAG로 전환하기

Claude Code의 단순 grep 검색 한계를 극복하기 위해 하이브리드 검색과 재순위화 기능을 갖춘 Denser Retriever를 도입하여 문서 검색 정확도를 개선한 사례이다.

RIKEN 로봇 학습 팀이 제시하는 물리적 AI의 미래와 수학적 접근

RIKEN AIP의 오사 다카유키 팀장이 Nikkei Tech Foresight 인터뷰를 통해 로봇 학습의 발전과 물리적 AI의 실용화 트렌드를 소개했다.

GPT 비용 98% 절감한 비결은 5만 개의 실제 데이터 기반 파인튜닝

프로덕션 데이터를 추적하여 구축한 5만 개의 데이터셋으로 7B 모델을 파인튜닝함으로써 GPT 비용의 2% 수준으로 80%의 트래픽을 처리했다.

Claude Design의 유료 장벽을 넘는 무료 오픈소스 Open Design 등장

Anthropic의 폐쇄적인 Claude Design 워크플로를 로컬 환경에서 무료로 구현할 수 있는 오픈소스 프로젝트 Open Design이 공개되었다.

6년 만의 혁신! 쿠버네티스 v1.35, AI 학습 효율과 무중단 확장을 잡다

Kubernetes v1.35는 실행 중인 Pod의 리소스를 재시작 없이 변경하는 기능의 GA 전환과 AI 워크로드를 위한 Gang Scheduling 도입을 통해 운영 효율성을 극대화했다.

HF Daily Papers3달 전· 3달 전 발행

확산 모델을 분할 모델로 변신시켜 mIoU 58.6점 달성

이미지 생성에 특화된 확산 모델이 가진 시각적 이해 능력을 극대화하여 별도의 복잡한 구조 없이도 정교한 이미지 분할이 가능함을 입증했다. 이는 생성 모델이 단순한 화가 역할을 넘어 의료, 위성, 농업 등 다양한 분야에서 범용적인 시각 이해 도구로 활용될 수 있는 새로운 방향을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

로봇의 물리적 추론 능력을 평가하는 25개 환경과 13개 베이스라인 공개

로봇이 실세계에서 복잡한 작업을 수행하려면 도구 사용이나 동적 제약 조건과 같은 물리적 원리를 이해해야 하지만, 기존 벤치마크는 언어나 인지 능력에 치중되어 있었습니다. KinDER는 인지적 요소를 배제하고 순수하게 물리적 추론 능력만을 측정할 수 있는 표준화된 환경을 제공하여 로봇 지능 연구의 새로운 방향을 제시합니다.

JoyAI-Image, 3D 공간 지능으로 이미지 이해와 편집의 한계를 넘다

기존 멀티모달 모델들이 시각적 이해와 생성 능력을 개별적으로 다루던 한계를 극복하고, 공간 지능을 중심으로 두 능력을 통합했습니다. 이를 통해 단순한 이미지 생성을 넘어 물체의 위치, 거리, 시점 변화를 정밀하게 제어하는 차세대 시각 모델의 방향성을 제시합니다.

HF Daily Papers3달 전· 3달 전 발행

140시간 분량의 탁구 4D 데이터셋으로 로봇 학습의 새 지평

일반 중계 영상만으로 탁구공의 3D 위치, 스핀, 선수의 움직임을 정밀하게 복원하는 기술을 제시한다. 기존의 한계를 극복한 Lift-First 접근법을 통해 가림 현상이 심한 상황에서도 물리적으로 타당한 데이터를 대규모로 생성할 수 있어 스포츠 분석과 로봇 학습에 기여한다.

HF Daily Papers3달 전· 3달 전 발행

LLM의 창의성 한계 발견: 도구 재목적화 성능이 일반 추론 대비 60% 급락

최신 LLM들이 논리적 추론과 도구 사용 능력에서 큰 진전을 보였으나, 주변 사물을 원래 용도가 아닌 새로운 방식으로 활용하는 창의적 문제 해결 능력은 여전히 부족함을 밝혀냈습니다. 이 논문은 사물의 물리적 속성을 기반으로 기능을 유추하는 '어포던스' 개념을 도입하여, 미래의 자율 에이전트가 예기치 못한 상황에서 얼마나 유연하게 대처할 수 있는지를 평가하는 새로운 기준을 제시합니다.

HF Daily Papers3달 전· 3달 전 발행

이미지 한 장으로 시뮬레이션 즉시 투입 가능한 3D 에셋 생성

기존 3D 생성 모델은 겉모습만 그럴듯한 '빈 껍데기'를 만드는 데 그쳐 로봇 시뮬레이션이나 게임 내 상호작용에 활용하기 어려웠다. PhysForge는 물체의 재질, 질량, 관절 가동 범위 등 물리적 속성을 함께 생성하여 별도의 수작업 없이도 즉시 조작 가능한 지능형 에셋을 제공한다.

HF Daily Papers3달 전· 3달 전 발행

LLM의 '침묵 비용' 해결, 정확도 유지하며 응답 속도 대폭 개선

기존 LLM은 복잡한 문제를 풀 때 추론이 끝날 때까지 사용자를 기다리게 하거나, 너무 빨리 답하려다 틀린 답을 내놓는 딜레마가 있었다. 이 논문은 추론 과정 중간에 확신이 서는 부분만 골라 먼저 보여주는 Side-by-Side(SxS) 기법을 통해 대기 시간을 줄이면서도 높은 정확도를 유지하는 방법을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

의료 AI 에이전트의 신뢰성, 전문가 수준으로 자동 검증한다

의료 분야 AI 에이전트는 과학적 무결성과 안전성이 필수적이지만, 기존의 일반적인 벤치마크로는 이를 충분히 검증하기 어렵다. MedSkillAudit은 의료 연구 기술의 배포 전 준비 상태를 체계적으로 감사하여 전문가 검토 수준의 신뢰성을 확보할 수 있는 프레임워크를 제공한다.

HF Daily Papers3달 전· 3달 전 발행

HERMES++, 3D 장면 이해와 미래 예측 통합으로 예측 오차 41.6% 감소

기존 자율주행 모델은 미래 장면을 생성하거나 현재 상황을 이해하는 기능이 분리되어 있어 복잡한 상황 판단에 한계가 있었다. HERMES++는 LLM을 기반으로 3D 기하학적 예측과 시각적 질의응답을 하나의 프레임워크로 통합하여, 차량이 주변 환경을 말로 설명하면서 동시에 미래의 3D 구조 변화를 정확히 예측할 수 있게 한다.

HF Daily Papers3달 전· 3달 전 발행

LLM 환각 탐지, 첫 번째 토큰의 확률값만으로 비용 90% 절감

LLM의 환각을 탐지하기 위해 기존에는 여러 번 답변을 생성하여 비교하는 고비용 방식이 주로 사용되었다. 이 논문은 답변의 첫 번째 핵심 토큰이 생성될 때의 확률 분포(Entropy)만 확인해도 기존의 복잡한 방식과 대등하거나 더 나은 성능을 낼 수 있음을 입증하여 추론 비용을 획기적으로 줄일 수 있는 길을 열었다.

HF Daily Papers3달 전· 3달 전 발행

RLDX-1: 인간 수준의 정교한 로봇 조작을 구현한 차세대 VLA 모델

기존 로봇 AI 모델들이 단순한 사물 인식과 이동에 그쳤다면, RLDX-1은 움직이는 물체를 잡거나 계란을 깨뜨리지 않고 옮기는 등 인간 수준의 정교한 손동작을 구현했다. 시각 정보뿐만 아니라 촉각과 힘의 변화를 실시간으로 감지하여 복잡한 환경에서도 안정적인 작업이 가능하다는 점이 가장 큰 특징이다.

HF Daily Papers3달 전· 3달 전 발행

AI 앱 빌더의 실체: 보안 점수 65% 미만, 상용화까지는 아직 먼 길

자연어만으로 앱을 만드는 '바이브 코딩' 플랫폼들이 등장했지만, 이들이 실제 비즈니스 환경에서 사용 가능한 수준인지는 미지수였다. 이 논문은 단순 코드 생성을 넘어 기획, 설계, 보안, 인프라를 아우르는 68개 지표로 AI 플랫폼을 평가하여 현재 기술의 명확한 한계와 개선 방향을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

ISA 기법으로 비디오 편집 연산 지연 시간 60% 단축 성공

비디오 편집 모델이 길어지는 영상 길이에 따라 연산량이 기하급수적으로 늘어나는 문제를 해결했다. 문맥 토큰의 중요도를 선별적으로 계산하는 새로운 Sparse Attention 기법을 통해 시각적 품질 저하 없이 처리 속도를 획기적으로 높였다.

HF Daily Papers3달 전· 3달 전 발행

OpenSearch-VL, 멀티모달 검색 벤치마크에서 평균 13.8점 성능 향상

최고 수준의 멀티모달 검색 에이전트는 학습 데이터와 방법론이 비공개인 경우가 많아 재현이 어려웠다. 이 논문은 고품질 데이터 생성 파이프라인과 강화학습 알고리즘을 모두 공개하여 누구나 강력한 시각 검색 에이전트를 구축할 수 있는 기반을 제공한다.

HF Daily Papers3달 전· 3달 전 발행

확산 모델 파인튜닝 시 발생하는 품질 저하, 자기 증류로 해결

최근 FLUX.2와 같은 고성능 이미지 생성 모델들은 빠른 속도를 위해 적은 단계로 이미지를 생성하는 Step-distillation 기법을 사용하지만, 새로운 개념을 학습시키기 위해 추가 학습(Fine-tuning)을 하면 이 효율적인 생성 능력이 손상되는 문제가 있다. 이 논문은 모델이 스스로 생성한 데이터를 바탕으로 학습하는 On-policy 방식을 도입하여, 기존의 빠른 생성 속도를 유지하면서도 새로운 스타일이나 개념을 완벽하게 학습할 수 있는 해결책을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

9B 모델로 Gemini 2.5 Flash급 성능과 실시간 전이중 대화 구현

기존 멀티모달 모델의 한계였던 '듣고 말하기'의 순차적 구조를 깨고, 실시간으로 보고 들으며 동시에 말할 수 있는 전이중(Full-Duplex) 상호작용을 구현했습니다. 9B라는 효율적인 파라미터 규모로도 온디바이스 환경에서 인간과 유사한 능동적 반응을 보여주며 차세대 AI 인터페이스의 방향성을 제시합니다.

HF Daily Papers3달 전· 3달 전 발행

에이전트 검색 성능을 극대화하는 BRIGHT-PRO 벤치마크와 RTriever 공개

기존 검색 시스템은 단순히 유사한 문서를 찾는 데 집중했으나, 복잡한 추론이 필요한 에이전트 환경에서는 여러 관점의 증거를 조합하는 능력이 필수적이다. 이 논문은 에이전트의 사고 과정을 지원하는 다각도 검색 평가 체계와 이를 학습하기 위한 합성 데이터 생성 기법을 제시하여 에이전트 검색의 새로운 기준을 마련했다.

HF Daily Papers3달 전· 3달 전 발행

20배 적은 파라미터로 전문가 수준의 운동 피드백 생성 AI 구현

스포츠 코칭이나 재활 치료에서 사람의 동작이 얼마나 정확한지 평가하는 것은 매우 중요하지만, 여러 각도의 카메라 영상을 동시에 분석해야 하므로 연산 비용이 매우 높았다. 이 논문은 적은 연산 자원만으로도 다중 시점 영상을 통합 분석하여 단순 점수 산출을 넘어 전문가 수준의 구체적인 조언까지 생성하는 효율적인 모델 구조를 제시한다.

HF Daily Papers3달 전· 3달 전 발행

21만 곡의 AI 음악 데이터로 인간의 선호도와 인기도를 정확히 예측하는 APEX

AI 생성 음악 플랫폼의 급성장으로 전통적인 아티스트 평판 없이 오직 오디오 특성만으로 음악의 성공 가능성을 예측해야 하는 필요성이 커졌다. 이 논문은 음악의 미적 품질과 대중적 인기도가 서로 보완적인 관계임을 입증하며, AI 음악의 품질 평가와 추천 시스템 성능을 동시에 개선할 수 있는 기술적 토대를 마련했다.

구글·메타 출신 CPO가 밝히는 AI 시대에 살아남는 기획자의 조건

구글과 메타의 제품 리더였던 니킬 싱할이 AI 기술이 제품 관리, 디자인, 엔지니어링의 경계를 허무는 방식과 변화하는 커리어 전략을 공유한다.

The Verge AI3달 전

ChatGPT가 위험을 감지하면 가족에게 알린다? OpenAI의 새로운 안전 기능

OpenAI가 ChatGPT 사용자의 자해나 자살 징후를 감지했을 때 지정된 보호자에게 알림을 보내는 '신뢰할 수 있는 연락처' 기능을 도입했다.

Wired AI3달 전

중국 사용자들을 당황하게 만든 ChatGPT의 '오글거리는' 중국어 말투

ChatGPT가 중국어 응답 시 '내가 너를 든든하게 받아줄게'라는 어색하고 과하게 친절한 표현을 반복적으로 사용하는 현상이 중국 인터넷에서 밈으로 확산되고 있다.

슬라이드 레이아웃 고민 끝, GRPO 강화학습으로 미적 감각을 배운 AeSlides

AeSlides는 검증 가능한 미적 지표와 GRPO 강화학습을 결합하여 LLM의 슬라이드 레이아웃 생성 능력을 획기적으로 개선하는 프레임워크이다.

AI가 생성한 버그 리포트의 역습, 리눅스 커널 138,000줄 삭제로 이어지다

리눅스 네트워킹 유지관리자 야쿠브 키친스키가 AI 생성 버그 리포트 폭주에 대응하기 위해 사용되지 않는 138,000줄의 레거시 코드를 삭제했다.

수학 추론 성능 3.7배 향상! SageMaker와 GRPO로 LLM 강화학습 정복하기

Amazon SageMaker에서 GRPO 알고리즘과 검증 가능한 보상(RLVR) 기법을 사용하여 Qwen2.5 모델의 수학적 추론 능력을 획기적으로 개선하는 방법을 설명한다.

TechCrunch AI3달 전

15년 묵은 버그도 찾아낸다? Anthropic Mythos가 바꾼 보안의 미래

Mozilla는 Anthropic의 Mythos 모델을 활용해 Firefox에서 15년 된 취약점을 포함한 수백 개의 고위험 보안 버그를 발견하고 수정했습니다.

TechCrunch AI3달 전

자율주행 트럭 시대 개막, 오로라 CEO가 말하는 물리적 AI의 미래

오로라 혁신(Aurora Innovation)의 CEO 크리스 엄슨이 자율주행 트럭의 상업적 운영 성과와 검증 가능한 AI 시스템의 중요성을 강조했다.

프롬프트보다 강력한 방법: 라이브러리 소스 코드로 코딩 에이전트 길들이기

Effect 라이브러리 소스 코드를 프로젝트에 직접 포함시켜 코딩 에이전트가 정확한 패턴을 학습하고 신뢰할 수 있는 TypeScript 코드를 생성하게 만드는 실전 워크플로를 다룬다.