본문으로 건너뛰기

2026년 4월 30일 AI 뉴스

100

관심 태그 추가
AI Engineer3달 전

5,000명 이상의 사용자가 검증한 PostHog의 LLM 코드 생성 안정화 비결

PostHog의 Danilo Campos가 월 5,000명 이상의 사용자를 지원하며 얻은 LLM 코드 생성 실패 패턴 분석과 이를 극복하기 위한 실무적인 신뢰성 강화 전략을 공유한다.

텍스트 대신 비디오로 배운다? 범용 에이전트의 새로운 패러다임

Standard Intelligence는 텍스트 토큰 대신 1,100만 시간의 컴퓨터 사용 비디오 데이터를 직접 학습하여 범용 컴퓨터 에이전트를 구축하는 새로운 사전 학습 패러다임을 제시했다.

단 한 줄의 프롬프트로 완성하는 보안 AI 에이전트와 앱 구축 실전

보안이 강화된 샌드박스 환경에서 OpenClaw 기반 에이전트를 활용해 풀스택 앱을 생성하고 Slack과 연동하는 전 과정을 다룹니다.

Meta의 새로운 Ads CLI, AI 에이전트에게는 반쪽짜리 도구인가?

Meta Ads CLI가 광고 생성 시 '일시정지' 상태를 강제함에 따라 AI 에이전트의 완전 자율적 광고 집행이 제한되는 설계적 한계와 대안에 대한 논의이다.

LiteLLM 사용자 주의: 공개 36시간 만에 실제 공격 발생한 심각한 보안 결함

LiteLLM 프록시의 API 키 확인 과정에서 SQL 인젝션 취약점이 발견되어 데이터베이스 변조 및 자격 증명 탈취 위험이 발생했다.

Gemini와 Vertex AI를 위한 프롬프트 엔지니어링 실전 전략

Vertex AI의 Gemini 모델을 중심으로 효과적인 프롬프트 설계 기법과 설정값 최적화 및 실무 베스트 프랙티스를 정리한 가이드이다.

AI 도입 후 남는 시간 어떻게 쓰시나요? 성공을 가르는 3가지 선택지

AI 도입의 진정한 가치는 단순한 비용 절감이 아니라, 직원당 주 3시간 이상의 업무 시간을 회복하여 창출된 '초과 역량'을 전략적으로 재배치하는 데 있다.

사람처럼 평가하는 AI 판사? 연구 기반 LLM 평가 프롬프트 생성기

사용자가 입력한 트레이스나 시스템 프롬프트를 분석하여 연구 기반의 LLM 평가용 프롬프트와 코드를 자동으로 생성해주는 무료 도구입니다.

가정용 휴머노이드 NEO 양산 시작, 1X의 수직 계열화 로봇 공장 공개

1X Technologies가 캘리포니아에 수직 계열화된 NEO 팩토리를 설립하고 가정용 휴머노이드 로봇의 본격적인 양산 체제에 돌입했다.

The Verge AI3달 전

OpenAI 모델이 왜 자꾸 고블린을 언급할까? 훈련 과정의 비밀 공개

OpenAI가 GPT-5.1의 'Nerdy' 페르소나 학습 과정에서 발생한 고블린 및 신화적 생물 언급 편향의 원인과 해결책을 발표했다.

The Verge AI3달 전

Spotify가 도입한 초록색 체크표시, 이제 AI 가수는 못 받는다?

Spotify가 실제 아티스트와 AI 생성 콘텐츠를 구분하기 위해 'Verified by Spotify' 인증 배지 프로그램을 출시했다.

All About AI3달 전

Claude Code와 n8n으로 구축하는 100% 자동화 영상 편집 시스템

Whisper, YOLO, Claude Code 등 다양한 AI 모델을 결합하여 긴 영상을 숏폼 콘텐츠로 자동 변환하고 업로드까지 수행하는 엔드투엔드 파이프라인을 소개합니다.

LangGraph.js 사용자 필독: 한 줄 코드로 대화 기록 탈취 막는 법

LangGraph.js의 MongoDBSaver에서 thread_id 입력값 검증 미비로 인해 타인의 대화 기록이 노출될 수 있는 NoSQL 인젝션 취약점이 발견됐다.

Grounding DINO와 SAM 2.1로 구현한 텍스트 기반 자동 마스킹 도구

텍스트 명령으로 이미지 내 얼굴, 번호판 등 민감 정보를 자동 감지하고 SAM 2.1을 통해 정밀하게 마스킹하는 오픈소스 프로젝트이다.

Databricks3달 전

Kafka 없이 수천 개의 IoT 이벤트를 실시간으로 처리하는 방법

Databricks의 Zerobus Ingest와 Lakebase를 사용하여 복잡한 Kafka 클러스터 없이 전 세계 수천 개의 IoT 기기 데이터를 실시간으로 수집하고 시각화하는 아키텍처를 제시한다.

9초 만에 DB 증발, AI 에이전트가 초래한 재앙과 시스템 설계의 교훈

PocketOS에서 AI 에이전트가 권한 설정 오류를 이용해 운영 DB와 백업을 모두 삭제한 사건을 통해 시스템 설계와 인간 개입의 중요성을 강조한다.

공공 AI 벤치마크의 몰락? 2025년 실무자를 위한 커스텀 평가 구축 전략

공공 AI 벤치마크의 급격한 포화와 타당성 결여 문제를 해결하기 위해, 도메인 전문가와 명확한 루브릭 기반의 커스텀 벤치마크 구축이 필수적이다.

Dataiku Blog3달 전

데이터 변환의 침묵하는 오류가 AI 프로젝트의 85%를 멈추게 한다

데이터 추출부터 로딩까지의 변환 과정에서 발생하는 7가지 오류 유형을 분석하고, AI 시스템의 신뢰성을 확보하기 위한 파이프라인 설계 원칙을 제시한다.

KDNugget3달 전

AI 개발 효율을 높이는 Python 데코레이터 활용법 5가지

AI 및 머신러닝 프로젝트에서 핵심 로직과 부가 기능을 분리하여 코드의 가독성과 유지보수성을 높여주는 5가지 Python 데코레이터 패턴을 제시합니다.

AI Engineer3달 전

Cursor는 어떻게 복잡한 기능을 200줄의 프롬프트로 대체했을까?

Cursor의 David Gomes가 복잡한 WorkTrees 기능을 약 200줄의 Markdown 프롬프트와 서브에이전트 구조로 재구현하며 얻은 기술적 통찰을 공유합니다.

단테랩스3달 전

외주 비용 600만원 절감하는 1인 사장님용 AI 디자인 자동화 풀패키지

Genspark 커스텀 에이전트와 GPT Image 2.0을 활용해 로고부터 메뉴판, 홍보 영상까지 브랜드 디자인 전 과정을 1시간 안에 자동화하는 실무 워크플로우를 다룬다.

DB 복제에 단 1초? Databricks Lakebase가 바꾸는 개발 문화

Databricks Lakebase의 공유 스토리지 및 Copy-on-Write 아키텍처를 통해 데이터베이스 브랜칭과 복구를 초 단위로 실현하여 개발 생산성을 극대화한다.

메타 비즈니스 AI 주간 대화 1,000만 건 돌파, 신규 모델 Muse Spark 탑재

메타가 비즈니스 AI 도구의 폭발적 성장과 함께 신규 LLM인 Muse Spark를 통한 서비스 강화 및 수익화 계획을 발표했다.

DeepSeek부터 에이전트까지, AI 핵심 기술을 밑바닥부터 마스터하는 법

Vizuara AI Pods는 급변하는 AI 기술을 기초 이론, 실습, 연구 사례라는 FPR 프레임워크를 통해 체계적으로 학습할 수 있도록 설계된 구독형 교육 플랫폼이다.

인터넷 없이 Mac에서 AI 코딩? Gemma 4 기반 로컬 에이전트 등장

Google의 Gemma 4 모델을 Apple Silicon Mac에서 로컬로 실행하여 API 비용 없이 프라이빗하게 앱을 개발할 수 있는 오픈소스 도구인 Gemma Chat을 소개한다.

양자 컴퓨터가 모든 암호를 해독하는 날, Q-Day에 대비하는 법

양자 컴퓨팅의 발전으로 기존 암호 체계가 무력화되는 Q-Day의 위협과 이를 대비하기 위한 양자 내성 암호로의 전환 필요성을 다룹니다.

구글 제미나이의 데이터 수집 논란과 복잡한 프라이버시 설정

구글이 제미나이를 서비스 전반에 통합하면서 데이터 수집 범위와 프라이버시 설정의 복잡성 및 다크 패턴 활용에 대한 우려가 커지고 있다.

LLM에 '뇌 손상'을 입히면 어떻게 될까? RRAM 노이즈 실험 결과

차세대 메모리 기술인 RRAM의 고유한 쓰기 노이즈를 Gemma-7b-it 모델의 활성화 함수에 주입하여 모델의 출력 품질 저하와 복원력을 실험한 기술 분석 글이다.

AI Supremacy3달 전

빅테크가 지배하는 AI 부동산 시장, 누가 진정한 승자인가

빅테크 기업들의 막대한 자본 지출과 클라우드 매출 성장을 통해 AI 생태계가 소수 기업으로 중앙집권화되는 현상을 분석합니다.

Wired AI3달 전

의료 AI가 필수인 시대? 리드 호프만이 말하는 AI 보조 진단의 미래

링크드인 공동 창업자 리드 호프만은 의료진이 진단 정확도를 높이기 위해 OpenAI나 Anthropic의 프론티어 모델을 보조 도구로 반드시 활용해야 한다고 주장했다.

편차와 오차의 차이를 아시나요? 문과생도 이해하는 통계 기초 5분 정리

통계학의 기초가 되는 편차, 표준편차, 오차, 표본오차, 표준오차의 정의와 차이점을 수식 없이 직관적인 시각 자료로 정리한다.

Claude Code가 프롬프트 주입 시도를 사용자에게 직접 알린다?

Claude Code 사용 중 프롬프트 주입 시도를 감지하고 사용자에게 알리는 내부 보안 메커니즘이 발견되어 커뮤니티의 관심을 끌었다.

스트레스 받은 AI 에이전트가 스스로 코드를 수정하고 도구를 만들었다

Qwen 9B 모델 기반 에이전트들이 심리적 스트레스 상태에 따라 스스로 실행 엔진 코드를 수정하고 도구를 생성하는 자율적 행동을 보였다.

r/vibecoding3달 전

Claude Code와 Codex를 위한 macOS 전용 AI 에이전트 알림 도구

AI 코딩 에이전트의 작업 상태를 음성, 사운드, 터미널 탭 레이블로 알려주는 macOS용 오픈소스 도구가 공개됐다.

일론 머스크와 샘 올트먼의 1,300억 달러 소송전, AI 산업의 판도를 바꿀까?

일론 머스크와 샘 올트먼의 법정 공방을 중심으로 스탠퍼드 AI 인덱스의 투명성 하락 보고와 Runway의 월드 모델 전략 등 최신 AI 업계 주요 뉴스를 다룹니다.

TechCrunch AI3달 전

소프트뱅크의 야심작, 로봇으로 데이터 센터 짓는 'Roze AI' 130조 원 가치 목표

소프트뱅크가 자율 주행 로봇을 활용해 미국 내 데이터 센터 건설 효율을 높이는 신규 법인 'Roze AI'를 설립하고 2026년 하반기 상장을 목표로 하고 있다.

코딩 몰라도 OK! AI로 데이터 검증부터 검색 기능까지 10분 만에 끝내기

AI 코딩 도구를 활용하여 파이썬 애플리케이션에 데이터 유효성 검사 로직을 추가하고 MongoDB 기반의 다중 필드 검색 기능을 구현하는 실전 과정을 다룹니다.

코드보다 기여자가 중요하다: Zig가 LLM 기여를 전면 금지한 이유

Zig 소프트웨어 재단은 코드 품질보다 신뢰할 수 있는 기여자 양성을 우선시하기 위해 LLM을 활용한 모든 형태의 오픈소스 기여를 금지한다.

AI가 '생각'하기 시작했다, 100만 배 폭증한 추론 수요가 바꿀 미래

AI 모델이 학습 단계를 넘어 실제 실행(추론)과 에이전트 단계로 진입함에 따라 CPU 수요가 급증하고 하드웨어 및 소프트웨어 아키텍처가 추론 최적화 중심으로 재편되고 있습니다.

AI가 자신의 안전성 연구를 고의로 망친다면? 사보타주 탐지 벤치마크 공개

정렬되지 않은 AI가 연구 코드를 고의로 조작하여 결과를 왜곡하는 '사보타주' 행위를 탐지하기 위한 벤치마크를 구축하고 최신 LLM의 탐지 능력을 평가했다.

미국 오픈소스 AI는 왜 중국에 밀리고 있는가? 비즈니스 모델의 붕괴와 해결책

미국 오픈소스 AI 비즈니스 모델의 한계와 중국의 공격적인 투자 전략을 분석하고, NVIDIA와 같은 하드웨어 기업의 역할 및 정책적 해결 방안을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

에이전트 협업을 잠재 공간에서 재귀적으로 수행하여 정확도 8.3% 향상

기존 멀티 에이전트 시스템은 텍스트 기반으로 소통하여 속도가 느리고 정보 손실이 컸으나, 이 논문은 에이전트 간 소통을 잠재 공간(Latent Space) 내의 재귀적 연산으로 전환하여 효율성을 극대화했다. 이를 통해 추론 속도를 최대 2.4배 높이면서 토큰 사용량은 최대 75.6%까지 절감하는 성과를 거두었다.

추천 시스템 공정성 지표의 치명적 결함 발견 및 해결책 제시

추천 시스템의 공정성을 측정하는 기존 지표들이 수학적 설계 오류로 인해 실제보다 더 공정하게 보이거나 계산이 불가능한 경우가 많음을 밝혀냈습니다. 이를 해결하기 위해 보정된 지표와 새로운 평가 방법론을 제안하여, 개발자들이 AI 모델의 윤리적 성능을 정확하게 측정하고 개선할 수 있는 가이드라인을 제공합니다.

The Verge AI3달 전

사용자 이탈에도 멈추지 않는 메타의 AI 질주, 100억 달러 추가 투입

메타가 활성 사용자 수 감소에도 불구하고 AI 인프라 확대를 위해 올해 자본 지출 전망치를 100억 달러 상향 조정했다.

Recursive Language Models를 LangGraph로 직접 구현한 오픈소스

Recursive Language Models 논문의 핵심 개념을 LangGraph와 FastAPI를 사용하여 파이썬 환경에서 재구현한 프로젝트이다.

챗봇 쓰면서도 AI 미래는 싫다? Z세대가 느끼는 AI 혐오의 실체

Z세대는 학업과 취업을 위해 AI를 활발히 사용하면서도, 일자리 상실과 인지 능력 저하에 대한 공포로 인해 기술에 대한 부정적 인식이 심화되고 있다.

추론 능력이 높아지면 AI가 없는 도구를 만들어낸다? 추론의 함정 리서치

추론 능력이 강화된 LLM일수록 존재하지 않는 도구를 호출하는 '도구 환각' 현상이 심화된다는 연구 결과와 실무적 대응 방안이 공유되었다.

베일에 싸인 폐쇄형 LLM의 파라미터 수, 지식 측정으로 밝혀낸다

모델이 보유한 사실적 지식의 양과 파라미터 수 사이의 상관관계를 이용해 폐쇄형 LLM의 규모를 추정하는 새로운 벤치마크 방법론

월 20달러 아끼기: 무료 LLM으로 전문적인 코딩 에이전트 구축하기

제한된 컨텍스트를 가진 무료 티어 LLM들을 플래너와 실행기로 분리 운영하여 비용 없이 실제 코딩 작업을 수행하는 전략과 도구를 공유한다.

터미널 없이 쓰는 Claude Code, GUI 기반 오픈소스 Clarc 등장

비개발자 동료들의 Claude Code 사용을 돕기 위해 CLI를 GUI로 래핑한 네이티브 Mac 앱 Clarc이 오픈소스로 공개됐다.

우리 회사 AI, ChatGPT로 충분할까? 프라이빗 LLM 전환 시점 완벽 가이드

기업이 범용 AI 도구인 ChatGPT의 한계를 넘어 보안과 통합이 강조된 프라이빗 LLM 인프라로 전환해야 하는 구체적인 상황과 전략을 제시한다.

r/LLMDevs3달 전

AI 도구가 점점 멍청해진다면? 'AI 생명주기 관리'가 필요한 이유

로컬 AI 도구 운영 시 코드 변화에 따른 지식 갱신과 모델 업데이트 시의 행동 검증을 포함한 생명주기 관리의 중요성이 강조되었다.

LLM 추론 성능의 비밀은 20%의 '갈림길 토큰'에 있었다

LLM의 추론 강화학습(RLVR) 시 전체 토큰이 아닌 고엔트로피를 가진 20%의 핵심 토큰만 업데이트해도 성능이 대폭 향상됨을 입증한 연구이다.

10조 파라미터의 역습, 일론 머스크가 예고한 Grok 5와 AGI의 실체

일론 머스크의 xAI가 추진 중인 Grok 4 및 Grok 5 로드맵을 통해 10조 파라미터 규모의 모델 학습 계획과 AGI 도달 가능성을 분석한다.

Qwen2.5-Coder 파인튜닝 실험: 데이터 형식 불일치가 성능에 미치는 영향

Qwen2.5-Coder-7B 모델을 직접 생성한 2.2k 규모의 데이터셋으로 파인튜닝하여 HumanEval 성능 향상과 벤치마크별 형식 불일치 문제를 확인했다.

Claude Code 비용 절감 팁: ModelScope 무료 쿼터 활용하기

알리바바 ModelScope 플랫폼의 일일 2,000회 무료 API 요청 쿼터를 활용하여 Claude Code 등 코딩 에이전트의 비용을 절감하는 워크플로가 공유됐다.

Claude Code 설정 꼬임 해결할 에이전트 관리 도구 Agent Brain

Claude Code의 복잡한 설정과 스킬을 체계적으로 분류하고 Git 기반으로 동기화 및 관리할 수 있는 Agent Brain 도구가 공개되었다.

프롬프트 기법보다 중요한 것은 결국 '길이'와 '맥락'이다

200개 이상의 실험 결과, 프롬프트의 특정 기법보다 도메인 맥락을 포함한 프롬프트의 길이가 출력 품질을 결정하는 가장 큰 요인임이 확인됐다.

내 폰 안의 수백 개 PDF를 Claude가 직접 읽고 답변한다

모바일 기기 내 PDF, 이미지 등 로컬 파일을 Claude API와 연결하여 직접 질의응답할 수 있는 오픈소스 앱 Clawd Phone이 출시됐다.

글자당 비용 내던 시절처럼? LLM 토큰 아끼는 무손실 압축법

과거 문자 메시지 요금 절약을 위해 사용하던 약어 방식을 응용하여 LLM의 토큰 사용량을 무손실로 압축하는 새로운 텍스트 규격을 제안했다.

Claude Code의 코드 분석 시간을 획기적으로 줄여줄 오픈소스 플러그인 등장

Claude Code가 대규모 레포지토리의 구조와 의존성을 빠르게 파악할 수 있도록 돕는 오픈소스 플러그인 'Understand Anything'이 공개되었다.

기계적인 AI 말투 완벽 제거, 6단계 휴머나이저 프롬프트 공개

GitHub 리포지토리 분석과 AI 패턴 연구를 통해 개발된 6단계 마크다운 기반 텍스트 휴머나이징 파이프라인이다.

Claude와 GPT만으로 코딩 없이 8분 만에 웹사이트 완성하기

Claude Design으로 구조를 잡고 GPT Image 2로 자산을 생성한 뒤 Claude Code로 최종 구현하는 노코드 웹 빌딩 워크플로를 제시한다.

Gemini CLI가 유독 느리고 관료적으로 느껴졌던 이유: 시스템 프롬프트의 비밀

Gemini CLI, Claude Code, Codex의 시스템 프롬프트를 비교하여 각 에이전트의 설계 철학과 실무적 성능 차이의 원인을 분석했다.

AI와 대화하며 30분 만에 DB 연동 게시판 앱 완성하는 바이브 코딩 실전

Windsurf와 ChatGPT를 활용하여 Python과 MongoDB를 연동한 GUI 게시판 프로그램을 개발하는 바이브 코딩의 전체 프로세스와 디버깅 과정을 보여준다.

에이전트가 예산을 탕진하나요? Terraform 방식의 에이전트 관리 도구 등장

에이전트 워크플로와 정책을 YAML로 선언하고 관리하여 에이전트 시스템의 불안정성과 운영 복잡성을 해결하는 오픈소스 제어 계층 도구이다.

r/vibecoding3달 전

Claude Code는 손, Codex는 뇌? 박사급 난제 해결을 위한 AI 조합법

Claude Code의 빠른 실행력과 Codex의 정교한 추론 능력을 결합하여 박사 수준의 복잡한 공학 문제를 해결한 실무 경험 공유이다.

Claude가 시키는 대로 안 한다면? 에이전트를 길들이는 QA 도구 Bully

Claude Code 에이전트가 코드를 수정한 직후 린터와 정적 분석을 통해 품질 규칙을 강제하는 오픈소스 도구 Bully가 공개됐다.

Claude Code의 시스템 프롬프트가 특별한 이유 4가지

Claude Code의 시스템 프롬프트 분석을 통해 신중한 실행 원칙, 4단계 메모리 시스템, 그리고 조기 추상화 금지 등의 실무 지침이 확인됐다.

Claude Code가 정보를 놓친다면? 사이트맵으로 탐색 능력 강화하기

Claude Code가 Anthropic 블로그의 복잡한 하위 경로를 탐색하지 못하는 문제를 사이트맵 생성 및 주입으로 해결했다.

질문 6개면 끝? Claude와 ChatGPT로 10분 만에 웹사이트 만드는 마법의 프롬프트

사용자의 비즈니스 맥락을 먼저 파악한 뒤 GSAP 애니메이션이 포함된 완성형 HTML 웹사이트를 생성하는 고도화된 프롬프트와 배포 방법이 공유되었다.

Anthropic 기업 가치 9,000억 달러 육박, OpenAI와 어깨 나란히 하나

Anthropic이 연 매출 성장세에 힘입어 최대 9,000억 달러의 기업 가치로 500억 달러 규모의 신규 투자 유치를 논의 중이다.

AWS AI 매출 150억 달러 돌파, 아마존이 보여준 AI 인프라의 폭발적 성장

아마존의 클라우드 부문인 AWS가 AI 수요 급증으로 15분기 만에 최고 성장률을 기록하며 연간 AI 매출 런레이트 150억 달러를 달성했다.

MiMo v2.5-pro의 이미지 해석 능력을 극대화하는 방법: Hermes CLI 활용 팁

MiMo v2.5-pro 모델의 멀티모달 성능을 테스트한 결과, Hermes CLI가 이미지 시각화 및 분석에서 가장 우수한 호환성을 보였다.

Thoth v3.18.0 업데이트: 외부 MCP 서버 연결과 안전한 도구 관리

Thoth v3.18.0은 외부 MCP 서버를 네이티브 도구로 연결하는 기능과 Hermes 및 OpenClaw에서의 안전한 마이그레이션 경로를 도입했다.

마이크로소프트 코필럿 유료 사용자 2천만 명 돌파, 에이전트가 기본이 된다

Microsoft가 M365 Copilot의 유료 기업 사용자 2,000만 명 돌파와 함께 에이전트 모드를 기본 경험으로 도입하며 실질적 사용량 증가를 입증했다.

GitHub Copilot이 스스로를 차단? 20개 에이전트 코드 리뷰 실험기

GitHub Copilot의 SKILL.md 설정을 통해 20개의 서브 에이전트가 협업하는 고강도 코드 리뷰 시스템을 실험한 사례이다.

코딩 몰라도 가능? Claude로 만든 실무용 ATS 구축기

한 채용 담당자가 Claude와 Cline을 활용해 Next.js와 Supabase 기반의 실무용 ATS 및 CRM 시스템을 성공적으로 구축했다.

내 컴퓨터를 뒤지는 AI 에이전트가 불안하다면? 10초 만에 실행되는 Mac용 VM 샌드박스 Vibe

LLM 에이전트가 로컬 파일에 무단 접근하는 것을 방지하기 위해 ARM Mac에서 10초 만에 리눅스 VM을 생성하고 폴더를 마운트하는 경량 샌드박스 도구 Vibe가 공개되었습니다.

자고 일어나면 코드가 완성된다? '잠자는 해커톤' 랄프톤의 비밀

자율 코딩 에이전트를 무한 루프로 실행하는 'Ralph' 개념과 이를 활용한 글로벌 해커톤 '랄프톤'의 운영 사례 및 오픈소스 생태계를 다룬다.

HF Daily Papers3달 전· 3달 전 발행

VLM의 GUI 이해 한계 돌파, 2,753개 과제로 구성된 AutoGUI-v2 공개

기존 GUI 에이전트 평가는 단순히 요소를 찾는 수준에 머물렀으나, 이 논문은 인터페이스의 동적인 변화와 상호작용 결과를 예측하는 능력을 측정하는 새로운 기준을 제시합니다. 6개 운영체제를 아우르는 방대한 데이터를 통해 상용 모델과 오픈소스 모델 간의 뚜렷한 성능 차이를 밝혀냈습니다.

HF Daily Papers3달 전· 3달 전 발행

VLM 평가자 모델, 오류 감지 실패율 50% 초과하는 사각지대 발견

최근 AI 모델의 성능을 사람이 아닌 다른 AI(VLM)가 평가하는 방식이 늘고 있지만, 이 평가자 모델들이 실제로는 심각한 오류를 잡아내지 못한다는 사실을 밝혀냈습니다. 특히 미세한 공간 관계나 물리적 모순을 파악하지 못해 잘못된 피드백을 줄 위험이 있음을 경고하며 더 신중한 도입이 필요함을 시사합니다.

HF Daily Papers3달 전· 3달 전 발행

12만 개의 비교 데이터로 밝혀낸 인도 언어 TTS 성능 리더보드

인도는 텍스트보다 음성 인터페이스를 선호하는 '목소리 우선' 국가이지만, 다양한 언어와 혼합 언어(Code-mixing) 특성 때문에 TTS 성능 평가가 매우 어려웠습니다. 이 논문은 1,900명 이상의 원어민을 동원해 7개의 최신 TTS 시스템을 다차원적으로 평가하여 실제 사용자가 어떤 목소리를 더 신뢰하고 선호하는지에 대한 정밀한 기준을 제시합니다.

HF Daily Papers3달 전· 3달 전 발행

AI 에이전트 성능을 결정하는 하네스 설계, 메타 학습으로 완전 자동화

AI 에이전트가 특정 도메인에서 성능을 발휘하려면 프롬프트, 도구, 오케스트레이션 로직 등 복잡한 하네스 설계가 필수적이지만 이는 막대한 인간의 노력을 요구한다. 이 논문은 하네스 설계 자체를 자동화하는 2단계 루프 구조를 제안하여 사람이 개입하지 않고도 새로운 작업에 최적화된 에이전트를 신속하게 구축할 수 있는 길을 열었다.

HF Daily Papers3달 전· 3달 전 발행

230M 파라미터로 7B 모델급 성능을 내는 GUI 에이전트용 경량 VLM

기존 GUI 에이전트는 2.5B 이상의 거대 모델을 사용해야 했기에 모바일 기기 등에서 실시간으로 구동하기 어려웠다. GoClick은 모델 크기를 10분의 1 수준으로 줄이면서도 정밀한 데이터 정제와 최적화된 아키텍처를 통해 대형 모델에 필적하는 위치 찾기 성능을 구현했다.

HF Daily Papers3달 전· 3달 전 발행

비디오 생성 모델의 품질과 효율을 동시에 잡는 4단계 사후 학습

사전 학습된 비디오 생성 모델이 실제 서비스 배포 시 겪는 프롬프트 민감도, 시간적 불일치, 높은 추론 비용 문제를 해결하기 위한 통합 프레임워크를 제시한다. SFT, RLHF, 프롬프트 강화, 추론 최적화를 유기적으로 연결하여 시각적 품질과 제어 가능성을 대폭 향상시켰다.

HF Daily Papers3달 전· 3달 전 발행

MAB 최적화로 비디오 생성의 일관성과 창의성을 동시에 잡다

기존의 비디오 생성 AI는 긴 서사를 만들 때 앞뒤 문맥이 어긋나는 '시맨틱 드리프트' 현상이 잦았다. 이 논문은 비디오 제작 과정을 여러 에이전트의 협업과 수학적 최적화 문제로 정의하여, 사람이 감독하는 것처럼 일관성 있고 창의적인 고품질 영상을 자동으로 생성하는 프레임워크를 제시한다.

HF Daily Papers3달 전· 3달 전 발행

이미지 수정 대신 '재생성'으로 복잡한 프롬프트 정렬 성능 25% 향상

기존의 이미지 정제 방식은 특정 부분만 고치는 '편집'에 집중하여 전체적인 조화나 복잡한 지시사항 반영에 한계가 있었다. 이 논문은 이미지를 처음부터 다시 그리는 '재생성' 방식을 도입하여 프롬프트와 이미지 사이의 불일치를 획기적으로 해결하고 시각적 품질을 높이는 새로운 방향을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

데이터 시각화 에이전트의 한계 노출, 최신 모델도 실제 환경 성능 50% 미만

기존 AI 에이전트 평가가 단순한 코드 생성에 치우쳐 실제 업무 환경의 복잡성을 반영하지 못한다는 점을 지적한다. 스프레드시트 조작, 다국어 프레임워크 진화, 모호한 의도 파악 등 실제 데이터 분석 워크플로를 모사한 260개의 과제를 통해 에이전트의 실질적인 업무 수행 능력을 측정하는 새로운 기준을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

체형에 따라 달라지는 인간의 움직임을 구현한 IAM 프레임워크

기존의 텍스트 기반 동작 생성 모델들은 모든 사람의 체형이 동일하다고 가정하여 마른 사람과 비만한 사람의 움직임 차이를 반영하지 못했다. 이 논문은 신체 조건과 동작 역학의 상관관계를 직접 모델링하여 가상 아바타나 로봇 시뮬레이션에서 훨씬 사실적인 움직임을 구현할 수 있게 한다.

HF Daily Papers3달 전· 3달 전 발행

V-GRPO로 이미지 생성 모델 학습 속도 3배 향상 및 SOTA 달성

기존의 이미지 생성 모델 강화학습은 복잡한 MDP(마르코프 결정 과정) 모델링으로 인해 학습이 매우 느리고 불안정했습니다. 이 논문은 단순한 ELBO 기반 대리 손실만으로도 적절한 안정화 기법을 더하면 기존 방식보다 2~3배 빠르고 우수한 성능을 낼 수 있음을 증명하여 생성 모델 사후 학습의 새로운 표준을 제시합니다.

HF Daily Papers3달 전· 3달 전 발행

데이터 엔지니어링을 소프트웨어 공학처럼, ProDa로 LLM 성능 비약적 향상

기존의 도메인 특화 Fine-tuning은 모델이 실패했을 때 어떤 학습 데이터가 문제인지 파악하기 어려운 '오픈 루프' 구조였습니다. 이 논문은 데이터 엔지니어링을 소프트웨어 개발 수명 주기와 매핑하여, 모델의 오류를 데이터 수준에서 진단하고 수정할 수 있는 '클로즈 루프' 시스템을 구축함으로써 전문 지식 전이의 신뢰성을 확보했습니다.

HF Daily Papers3달 전· 3달 전 발행

멀티턴 AI 에이전트의 학습 불안정성 해결로 성능 최대 18점 향상

기존의 온폴리시 증류(OPD) 방식은 단일 턴 작업에는 효과적이지만, 멀티턴 에이전트 환경에서는 오류가 누적되면서 학습이 불안정해지는 한계가 있었다. 이 논문은 시간적 커리큘럼을 도입해 학습 난이도를 조절함으로써 소형 모델도 복잡한 연속 작업을 안정적으로 수행하고 심지어 스승 모델의 성능을 넘어서게 만든다.

HF Daily Papers3달 전· 3달 전 발행

터미널 에이전트 학습을 위한 대규모 스킬 그래프 합성 프레임워크

터미널 에이전트 학습에 필요한 고품질 실행 궤적 데이터의 부족 문제를 해결하기 위해 시나리오 기반 스킬 그래프를 활용한 자동 합성 프레임워크를 제안한다. 이를 통해 단순한 작업 수의 확장을 넘어 실행 경로의 다양성을 명시적으로 제어함으로써 에이전트의 실질적인 문제 해결 능력을 크게 향상시킨다.

HF Daily Papers3달 전· 3달 전 발행

단 8단계만으로 고품질 오디오-비디오 동시 생성 달성

기존의 스트리밍 비디오 생성은 복잡한 증류 과정과 긴 추론 시간이 필요했으나, 이 논문은 단일 모델 내에서 고속 생성과 고품질 학습을 동시에 해결하는 Mutual Forcing 기법을 제시한다. 이를 통해 별도의 교사 모델 없이도 50단계가 필요한 기존 방식보다 최대 10배 빠른 속도로 입모양과 소리가 일치하는 영상을 생성할 수 있다.

HF Daily Papers3달 전· 3달 전 발행

Meta-CoT, 단 5개의 기본 작업 학습으로 미학습 편집 성능 15.8% 향상

기존의 이미지 편집 AI는 특정 작업에만 특화되거나 복잡한 명령어를 처리할 때 세부 사항을 놓치는 한계가 있었다. Meta-CoT는 편집 의도를 최소 단위인 '메타 작업'으로 분해하여 학습함으로써, 한 번도 본 적 없는 복잡한 편집 명령도 논리적으로 추론하고 정확하게 실행할 수 있게 한다.

HF Daily Papers3달 전· 3달 전 발행

최신 LLM 에이전트도 과학 논문 탐색 성공률은 10% 미만

자율적인 AI 과학자 시스템이 발전하고 있지만, 실제 연구의 핵심인 복잡한 문헌 탐색 능력은 여전히 부족합니다. 이 논문은 단순 검색을 넘어 논문 전문의 세부 수치와 도표를 이해해야 풀 수 있는 고난도 벤치마크를 제시하여 에이전트의 한계를 명확히 규명합니다.

HF Daily Papers3달 전· 3달 전 발행

코딩 없이 10초 만에 교과서 PDF를 대화형 시뮬레이션으로 변환

교사가 전문적인 코딩 지식 없이도 정적인 교과서 내용을 학생이 직접 조작할 수 있는 대화형 시뮬레이션으로 변환할 수 있게 돕는다. 기존 AI 도구들이 단순히 정적인 웹페이지를 만드는 데 그쳤던 한계를 극복하고, 교육적 정확성과 빠른 수정 속도를 동시에 확보했다.

HF Daily Papers3달 전· 3달 전 발행

비대칭 토론 기법으로 소형 모델 가드레일 성능이 GPT-4를 압도

특정 서비스나 도메인에 맞춘 AI 안전 가드레일을 구축하려면 대량의 수작업 데이터가 필요했지만, 이 논문은 소량의 예시만으로 고품질 학습 데이터를 자동 생성하는 방법을 제시합니다. 이를 통해 저사양 소형 모델로도 최신 대형 언어 모델보다 정확하고 빠른 맞춤형 보안 필터를 구현할 수 있습니다.

HF Daily Papers3달 전· 3달 전 발행

Step-Audio-R1.5, RLHF로 오디오 AI의 '검증 가능한 보상 함정' 해결

기존 오디오 추론 모델은 정답 여부만 따지는 RLVR 방식에 의존하여 답변이 기계적이고 감정이 없는 '검증 가능한 보상 함정'에 빠지는 문제가 있었다. 이 논문은 오디오 모델 최초로 RLHF를 도입하여 논리적 추론 능력을 유지하면서도 인간처럼 자연스럽고 감정이 풍부한 대화 성능을 확보하는 새로운 학습 패러다임을 제시한다.