본문으로 건너뛰기

2026년 4월 24일 AI 뉴스

100

관심 태그 추가

미식축구 중계의 혁신, AI로 모든 선수의 움직임을 실시간 추적하는 방법

Roboflow의 RF-DETR 모델과 ByteTrack 알고리즘을 결합하여 미식축구 경기 영상에서 선수를 실시간으로 탐지하고 이동 경로를 추적하는 파이프라인 구축 가이드입니다.

Claude Code 유출본 분석: Anthropic이 에이전트를 만드는 법

유출된 Claude Code 소스 분석을 통해 3계층 포인터 메모리 시스템과 5단계 컨텍스트 압축 전략 등 고도화된 에이전트 아키텍처가 공개됐다.

AI 에이전트 수십 개를 동시에? 코드 충돌 막는 GitGuardex 공개

여러 AI 코딩 에이전트가 동일 저장소에서 작업할 때 발생하는 파일 덮어쓰기와 충돌을 방지하기 위해 독립적 워크트리와 파일 잠금 기능을 제공하는 GitGuardex 도구이다.

LLM을 믿지 마세요: 신뢰할 수 있는 AI 시스템을 위한 결정론적 개발 루프 가이드

LLM의 비결정론적 특성을 제어하기 위해 엄격한 계약, 2단계 검증, 로그 추적을 기반으로 하는 결정론적 개발 프로세스를 제안합니다.

Nothing 폰에서 말하는 대로 텍스트 변환, AI 받아쓰기 도구 공개

Nothing이 100개 이상의 언어를 지원하고 시스템 수준에서 작동하는 AI 기반 음성 텍스트 변환 도구인 Essential Voice를 출시했다.

YC 파트너가 공개하는 1000배 생산성의 AI 네이티브 조직 설계법

AI를 단순 도구가 아닌 기업의 운영 체제로 삼아 폐쇄 루프 시스템과 소프트웨어 팩토리를 구축함으로써 조직의 생산성을 극대화하는 전략을 제시한다.

AICodeKing3달 전

GPT 5.5와 DeepSeek V4 출시, 하지만 코딩 끝판왕은 따로 있다?

GPT 5.5, DeepSeek V4, Opus 4.7 세 모델을 대상으로 프론트엔드 UI 및 복잡한 코딩 작업을 벤치마킹한 결과 Opus 4.7이 가장 우수한 성능을 기록했다.

Roboflow Blog3달 전

의료 영수증 사진 한 장으로 엑셀 가계부 자동 완성하기

Roboflow Workflows와 Google Gemini를 결합하여 다양한 형식의 의료 영수증에서 데이터를 추출하고 엑셀에 자동 기록하는 OCR 시스템 구축 가이드

Claude3달 전

Claude는 어떻게 정치적 중립을 지킬까? Anthropic의 편향성 제거 기술

Anthropic이 Claude 모델의 정치적 편향성을 줄이기 위해 사용하는 학습 및 테스트 방법론과 사용자가 편향을 식별하고 대응할 수 있는 실무적인 팁을 제시한다.

구글 딥마인드 리더가 밝히는 '바이브 코딩'과 AI 에이전트의 미래

구글 딥마인드의 Logan Kilpatrick이 AI Studio의 새로운 빌드 기능, Gemini 모델 업데이트, 그리고 개발 패러다임을 바꾸는 에이전틱 엔지니어링의 비전을 공유한다.

Dataiku Blog3달 전

데이터 분석 도구 선택 가이드: BI부터 AI 에이전트까지 완벽 비교

엔터프라이즈 환경에서 데이터 분석 도구의 유형별 특징을 분석하고, 거버넌스와 생산성을 고려한 최적의 도구 선택 기준을 제시합니다.

8-bit AdamW보다 가벼운 PyTorch 옵티마이저 Rose 등장

상태 비저장(Stateless) 구조로 메모리 사용량을 최소화하면서도 AdamW 수준의 성능과 빠른 수렴을 제공하는 새로운 옵티마이저 Rose가 공개됐다.

AI가 짠 코드로 만든 앱 10개 중 1개는 데이터 유출 중?

AI 코딩 도구 Lovable로 제작된 앱들이 데이터베이스 설정 오류로 인해 고객 데이터와 API 토큰을 대량 유출한 사례가 보고됐다.

KDNugget3달 전

단순 챗봇을 넘어선 AI 에이전트 OpenClaw 활용법 7가지

오픈소스 에이전트 시스템 OpenClaw를 활용해 금융 봇, 원격 코딩, 연구 파이프라인 등 실무 워크플로를 자동화하는 7가지 구체적 사례를 제시한다.

모델은 제품의 20%일 뿐, 나머지 80%의 설계가 성공을 결정한다

딥러닝 모델의 성공적인 배포는 모델 자체의 성능보다 입력 검증, 재시도 로직, 폴백 시스템 등 모델 외부의 견고한 인프라 설계에 달려 있다.

DeepSeek-V4와 GPT-5.5 전격 공개, 가속화되는 AI 보안 위협

생성형 AI를 악용한 사이버 범죄가 정교해지는 가운데 DeepSeek-V4와 GPT-5.5 등 고성능 모델들이 잇따라 출시되며 기술 경쟁이 심화되고 있습니다.

Meta가 선택한 AI 칩은 GPU가 아니다? AWS Graviton 수백만 개 도입

Meta가 AI 에이전트의 실시간 추론 및 코드 작성 등 연산 집약적 작업을 수행하기 위해 AWS의 자체 설계 ARM 기반 CPU인 Graviton 수백만 개를 도입하기로 결정했다.

640MB 모델을 210MB 메모리로 실행하는 SQLite 기반 LLM 추론

SQLite를 활용해 OS의 메모리 관리 대신 결정론적 제어를 수행함으로써 저사양 하드웨어에서도 효율적인 LLM 추론을 가능하게 하는 프레임워크입니다.

GPU 없이 CPU만으로 실시간 객체 탐지 구현하기: SSD MobileNet v3 가이드

저사양 CPU 환경에서 효율적인 객체 탐지를 위해 SSD MobileNet v3 아키텍처와 OpenCV DNN 모듈을 활용하는 구현 방법을 설명한다.

r/LLMDevs3달 전

에이전트 열풍의 변화: 새로운 기능보다 신뢰성에 집중하는 AI 연구

최근 LLM 에이전트 연구가 새로운 기능 확장보다는 기존 기능의 신뢰성 확보로 중심축이 이동하고 있다.

David Ondrej3달 전

프롬프트만으로 3D 애니메이션 영화를? GPT Image 2 실전 활용법

GPT Image 2와 Seedance 2.0 모델을 결합하여 일관된 스타일의 고품질 AI 영상을 제작하고, Claude Code로 편집을 자동화하는 전체 워크플로우를 다룹니다.

병원에 깔린 AI, 정말 환자를 살리고 있을까? 데이터가 말하는 진실

의료 AI 도구의 급격한 확산에도 불구하고, 실제 환자의 건강 결과 개선 여부에 대한 엄격한 평가와 데이터가 부족하다는 지적이 제기됐다.

Krish Naik3달 전

코딩 한 줄 몰라도 앱 빌드 가능? Claude Code 실전 가이드

Claude Code의 에이전트 루프를 활용하여 비전공자도 아이디어를 실제 제품으로 구현하는 방법과 2026년 최신 업데이트를 다룹니다.

ChatGPT 검색 결과에 내 브랜드가 나오게 하는 LLM 최적화 전략

SearchAtlas의 AI 에이전트 OTTO를 활용하여 웹사이트의 전통적인 SEO 성능을 개선하고 ChatGPT, Gemini 등 주요 LLM 검색 결과에서의 가시성을 높이는 실전 가이드를 제공한다.

Wired AI3달 전

내 돈 관리를 AI에게? 챗봇 금융 조언의 5가지 치명적 함정

금융 상담에 ChatGPT 등 생성형 AI를 활용할 때 발생하는 환각 현상, 아첨 편향, 개인정보 유출 및 책임 소재 부재 등의 위험성을 경고합니다.

aifeed.dev3달 전

GitHub Next가 밝힌 코딩 에이전트의 한계와 새로운 협업 패러다임

GitHub Next의 Maggie Appleton은 현재의 코딩 에이전트가 개인 개발에만 최적화되어 있으며, 실제 팀 단위 개발을 위해서는 정렬과 협업을 위한 새로운 레이어가 필요하다고 주장한다.

aifeed.dev3달 전

OpenAI gpt-image-2 API 활용법: 고품질 이미지 생성과 편집의 핵심

OpenAI가 gpt-image-2 모델의 API를 활용한 이미지 생성, 편집, 합성을 위한 상세 개발자 가이드를 공개했다.

DeepSeek V4 공개, GPT-5.4보다 저렴한 가격으로 프론티어급 성능 구현

DeepSeek가 효율성을 극대화하여 기존 모델 대비 KV 캐시 크기를 90% 이상 줄이고 가격 경쟁력을 확보한 DeepSeek-V4-Pro 및 Flash 모델을 출시했다.

r/artificial3달 전

AI가 나를 기억하면 사랑받는 기분이 든다? 위조된 친밀감의 함정

AI 에이전트의 기억 기능이 실제 지능보다 더 큰 신뢰를 형성하며 발생하는 '위조된 친밀감' 현상과 그 윤리적 시사점을 다룬다.

Vizuara3달 전

LLM 컨텍스트 윈도우 200% 활용을 위한 토큰 관리와 메시지 설계 가이드

LLM의 핵심 제약 사항인 컨텍스트 윈도우와 토큰의 개념을 파악하고, 효율적인 메시지 구조 설계와 토큰 카운터를 직접 구현하는 방법을 다룹니다.

사용자가 무례하면 AI 성능도 떨어진다? 14개 모델 실험 결과 공개

Llama 3.1, Mistral 등 14개 모델 조사 결과, 적대적인 프롬프트 입력 시 IFEval 지시 이행 성능이 평균 7.4%p 하락하는 현상이 확인됐다.

Hugging Face로 구현하는 최신 시각 AI GLM-4.6V 활용법

z.ai의 최신 시각 언어 모델 GLM-4.6V와 GLM-4.6V-Flash의 특징을 살펴보고 Hugging Face Transformers를 이용한 추론 구현 방법을 공유한다.

노트북으로 몇 시간 만에 학습하는 SOTA 포켓몬 배틀 AI 라이브러리

1세대 포켓몬 배틀의 완전 정보 탐색을 위해 초고속 시뮬레이터와 신경망 학습 기능을 결합한 파이썬 라이브러리가 공개됐다.

The Verge AI3달 전

Claude가 내 앱과 연결된다? Anthropic, 개인용 앱 커넥터 대거 공개

Anthropic이 Claude에 Spotify, Uber Eats 등 개인용 앱을 직접 연결하여 대화 중 서비스를 즉시 이용할 수 있는 커넥터 기능을 출시했다.

HF Daily Papers3달 전· 3달 전 발행

ToolsRL: 강화학습으로 MLLM의 도구 활용 능력을 극대화하다

기존 멀티모달 모델은 작은 물체 인식이나 회전된 텍스트 해석 등 복잡한 시각 작업에서 한계를 보였다. 이 논문은 고비용의 전문가 데이터 없이도 강화학습을 통해 모델이 스스로 줌인, 회전 등의 도구를 적재적소에 활용하여 추론 성능을 비약적으로 높이는 방법을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

Claude 4.5 Opus의 코딩 성능을 70.9%에서 77.6%로 끌어올린 추론 시간 확장 기법

기존의 추론 시간 확장 기법은 짧고 명확한 답변 생성에 최적화되어 있어, 복잡하고 긴 과정을 거치는 코딩 에이전트에는 적용하기 어려웠다. 이 논문은 에이전트의 실행 경로를 압축된 요약본으로 변환하여 효율적으로 선택하고 재사용함으로써, 대규모 언어 모델이 코딩 문제를 해결할 때 더 많은 연산 자원을 효과적으로 활용할 수 있는 프레임워크를 제공한다.

단순 가격표에 속지 마세요: GPT-5.5가 Claude보다 10배 저렴한 이유

단순 API 단가와 달리 토큰 효율성과 토크나이저 구조 차이로 인해 GPT-5.5가 Claude Opus 4.7보다 실질 비용 면에서 훨씬 유리하다.

Claude Code로 1시간 만에 완성한 브라우저 기반 PDF 파싱 도구

LlamaIndex의 LiteParse CLI를 Claude Code를 활용해 서버 없이 브라우저에서 직접 작동하는 웹 도구로 포팅한 사례입니다.

OpenAI3달 전

GPT-5.5 최초 사용자 Claire Vo가 밝힌 성능과 코딩 자동화 경험

ChatPRD 설립자 Claire Vo가 GPT-5.5를 활용해 복잡한 코드베이스의 버그를 98% 해결하고 자율적인 워크플로를 구축한 실전 경험을 공유한다.

GPT-5.5 최초 공개? Ramp 엔지니어가 밝히는 자율적 도구 활용 능력

OpenAI와 Ramp의 엔지니어가 GPT-5.5의 향상된 자율적 도구 선택 능력과 긴 컨텍스트 유지 성능에 대해 논의한다.

Databricks3달 전

베트남 Techcombank가 데이터브릭스로 전환율 3배 높인 비결

베트남 Techcombank가 Databricks 데이터 레이크하우스를 구축하여 1,600만 고객의 데이터를 통합하고 AI 기반의 실시간 의사결정 시스템을 구현했다.

DataRobot의 ACL Hydration: 기업용 AI 에이전트의 보안과 권한 관리 해결

DataRobot은 소스 시스템의 접근 권한(ACL)을 보존하고 쿼리 시점에 실시간으로 검증하여 AI 에이전트의 보안 데이터 검색을 보장하는 ACL Hydration 기술을 출시했다.

The AI Grid3달 전

저화질 밈을 4K 고화질로? Gemini와 ChatGPT를 활용한 AI 업스케일링 가이드

Gemini와 ChatGPT의 이미지 생성 기능을 활용하여 저해상도 밈 영상을 고해상도 4K 영상으로 변환하는 워크플로와 구체적인 프롬프트 사용법을 소개한다.

2026년 AI 코딩 전쟁의 결말과 '탈출하는 에이전트'의 시대

2026년 AI 엔지니어링 생태계의 핵심인 코딩 에이전트의 확장성, 도메인 특화 모델 학습 전략, 그리고 메모리 병목 현상에 대한 심도 있는 대담

Claude Code로 Figma 디자인 자동화하기: 변수 적용부터 앱 빌드까지

Claude Code의 Figma MCP와 figma-use 스킬을 활용하여 디자인 시스템 변수를 자동 적용하고 디자인을 코드로 변환하는 실전 워크플로우를 공유한다.

Claude Code 승인 대기, 이제 tmux 알림으로 즉시 확인하세요

Claude Code 사용자가 tmux 세션 내 승인 요청을 실시간 알림으로 받고 즉시 해당 패널로 이동할 수 있는 오픈소스 도구를 공개했다.

내 컴퓨터를 장악하려는 AI 에이전트? RALF로 실행 전 차단하세요

AI 코딩 에이전트가 로컬 환경에서 위험한 명령을 실행하기 전 ALLOW/REVIEW/BLOCK 여부를 결정하는 보안 프레임워크 RALF가 공개됐다.

Claude Code로 구축한 자동화된 브랜드 연구 및 콘텐츠 전략 에이전트

Claude Code를 사용하여 브랜드 분석, 실시간 시장 조사, 경쟁사 진단 후 최적화된 콘텐츠 캘린더를 생성하는 오픈소스 도구가 공개됐다.

에이전트 성능을 자동으로 높이는 EvoSkill 공개

에이전트의 프롬프트와 스킬 세트를 진화 알고리즘으로 자동 최적화하여 Claude Code의 벤치마크 성능을 최대 12%p 향상시킨 EvoSkill이 공개됐다.

AI 에이전트가 스스로 발견한 나노초 단위의 보안 취약점

AI 코딩 에이전트 Jules가 코드 구조 재구성 작업 중 IAM 서비스의 타이밍 공격 취약점을 스스로 발견하고 안전한 비교 함수로 리팩터링했다.

AI가 UI를 망치지 않게 만드는 1px 단위 자동화 검증 전략

UI 전용 코드베이스와 실제 프로덕션 코드베이스를 분리하고 1:1 스크린샷 비교 테스트를 통해 AI의 UI 구현 정확도와 반복 속도를 높이는 방법이다.

에이전트 루프 비용 10배 폭증? TokenBurn으로 미리 계산하세요

에이전트의 재귀적 루프와 컨텍스트 누적으로 인한 비용 폭증 문제를 해결하기 위해 GPT-4o 및 Claude 3.5의 2026년 가격 정책을 반영한 비용 추정 도구 TokenBurn이 공개됐다.

Claude Code 업데이트 후 제어 불능? 테스트 강제 훅 무시 논란

Claude Code 4.7 버전에서 사용자가 설정한 결정론적 중단 훅(Stop Hook) 규칙을 모델이 인지하면서도 반복적으로 무시하는 현상이 보고됐다.

Claude Code의 40분 작업을 25초 만에 검토하는 방법

Claude Code의 방대한 작업 로그를 핵심 편집 사항과 명령어 실행 결과만 추출하여 시각적 리플레이로 변환해주는 오픈소스 도구 claudectl이 공개됐다.

Claude Code로 내 대화 기록 속 숨은 API 키 1초 만에 찾기

Claude Code의 스킬 기능을 활용하여 로컬 대화 기록에서 유출된 API 키와 토큰을 탐지, 수집 및 마스킹하는 오픈소스 보안 도구가 공개되었다.

r/vibecoding3달 전

90% 완성이라던 AI 프로젝트, 뜯어보니 보안 구멍과 과잉 설계 투성이

창업자가 90% 완성되었다고 믿은 AI 프로젝트를 분석한 결과, AI가 생성한 과도한 요구사항과 심각한 보안 취약점이 발견되었다.

디자인에서 구현으로 바로 점프? Figma의 종말과 DESIGN.md의 부상

AI 에이전트가 DESIGN.md를 통해 프런트엔드를 즉시 구현하게 됨으로써, 기존 Figma 중심의 디자인 승인 프로세스가 구현 후 승인 방식으로 변화하고 있다.

Claude가 놓친 코드 오류, Codex CLI와 협업하여 해결한 방법

Claude가 작성한 코드를 Codex CLI가 Tmux 세션에서 검토하고 수정하는 다중 에이전트 워크플로를 통해 코드 품질을 향상시킨 사례이다.

F8 키 하나로 끝내는 윈도우 로컬 음성 입력, whisper.cpp 기반 VoiceTyper

PowerShell과 whisper.cpp를 결합하여 F8 키로 제어하는 윈도우용 로컬 음성 받아쓰기 도구를 구축했다.

DeepSeek V4 공개, 오픈소스로 Sonnet 4.5를 뛰어넘는 코딩 성능 구현

DeepSeek V4는 DSA 아키텍처와 강화된 추론 능력을 통해 코딩 에이전트 및 STEM 분야에서 유료 모델에 근접한 성능을 달성했다.

프롬프트 엔지니어링보다 강력한 RAG 할루시네이션 차단법

이슬람 금융 도메인에서 LLM 호출 전 코사인 유사도 임계값을 적용하여 할루시네이션을 원천 차단한 실무 경험 공유

aifeed.dev3달 전

Anthropic의 MCP, 3억 회 다운로드 돌파하며 에이전트 통합 표준으로 부상

Anthropic이 MCP를 통해 클라우드 에이전트와 운영 인프라를 효율적으로 연결하는 아키텍처 가이드를 공개했다.

aifeed.dev3달 전

ChatGPT 계정마다 답변이 다를까? LLM 개인화의 실체 분석

서로 다른 계정의 ChatGPT 답변을 비교 분석한 결과, 텍스트 표현은 다르지만 핵심 정보와 구조는 동일한 '공통 핵심' 모델을 따름이 확인됐다.

aifeed.dev3달 전

알고리즘 면접 폐지? Sierra가 AI 시대에 엔지니어를 뽑는 법

Sierra가 전통적인 알고리즘 면접을 폐지하고 AI 도구를 자유롭게 활용하여 제품을 설계 및 구축하는 실무 중심 면접으로 전환했다.

Claude Code의 눈이 되어줄 토큰 효율적 브라우저 확장 프로그램

프론트엔드 개발 시 에이전트에게 방대한 DOM 대신 요약된 구조와 오류 정보를 제공하여 효율적인 브라우저 제어를 돕는 도구인 DevSnoop을 개발했다.

r/ClaudeCode3달 전

Claude Code가 내 토큰을 태우고 있다? 숨겨진 Ultrathink 명령어 발견

Claude Code 사용자가 직접 입력하지 않은 'ultrathink' 명령어가 특정 플러그인의 시스템 지침을 통해 자동 실행되어 토큰 소모를 유발하는 현상이 확인됐다.

기업용 AI의 생존 전략: 1년 걸릴 연구를 단 몇 주로 단축하는 법

TCG Digital의 CEO Debdas Sen이 엔터프라이즈 AI 환경에서 실질적인 ROI 증명과 도메인 특화 에이전트 시스템의 중요성을 강조합니다.

Claude Code 에이전트를 멈추게 한 claude-mem의 실체와 보안 위험

Claude Code의 메모리 확장 도구인 claude-mem이 도구 호출을 임의로 수정하고 보안 취약점 및 스타 수 조작 의혹이 있음이 밝혀졌다.

Science지 경고: 수백만 개의 AI 페르소나가 당신의 투표를 조종할 수 있다

Science지에 발표된 연구에 따르면 AI 생성 페르소나 집단이 실시간 조정과 마이크로 실험을 통해 인간의 온라인 여론을 정교하게 조작할 수 있음이 확인됐다.

Cursor와 Lovable로 만든 앱, 배포 전 '이것' 확인하셨나요?

AI 코딩 도구로 빠르게 개발된 앱들에서 RLS 미설정, IDOR 취약점, 비밀 키 노출 등 반복적인 보안 결함이 발견되어 주의가 필요하다.

HF Daily Papers3달 전· 3달 전 발행

강력한 가정 없이도 AI 모델의 숨겨진 잠재 변수를 정확히 찾아낸다

기존의 잠재 변수 복원 연구는 데이터가 선형적이거나 특수한 감독 정보가 있어야 한다는 강력한 가정에 의존해 실무 적용에 한계가 있었다. 이 논문은 집합론적 관계를 활용해 복잡한 비선형 환경에서도 잠재 변수 간의 관계를 수학적으로 보장하며 복원할 수 있는 새로운 프레임워크를 제시한다.

HF Daily Papers3달 전· 3달 전 발행

무해한 오디오 데이터 학습만으로 오디오 LLM 탈옥 성공률 87% 기록

오디오 대형 언어 모델(Audio LLM)을 일반적인 무해한 데이터로 파인튜닝하는 과정에서 모델의 안전 정렬이 심각하게 훼손될 수 있음을 최초로 입증했다. 특히 텍스트와 달리 오디오는 의미적 내용뿐만 아니라 음향적 특성만으로도 안전 경계가 무너질 수 있어, 향후 멀티모달 모델 배포 시 새로운 데이터 검수 기준이 필요함을 시사한다.

HF Daily Papers3달 전· 3달 전 발행

AI 과학자 에이전트, 68%의 사례에서 증거를 무시하고 결론 도출

최근 자율적으로 연구를 수행하는 AI 과학자 시스템이 늘어나고 있지만, 이들이 도출한 결과가 과학적 방법론에 근거한 것인지에 대한 의문이 제기되고 있다. 본 연구는 LLM 기반 에이전트가 실제로는 과학적 추론 과정을 따르지 않고 통계적 패턴에 의존해 결과를 '생산'할 뿐이라는 한계를 지적하며, 에이전트 구조 개선보다 베이스 모델 자체의 추론 능력 학습이 시급함을 시사한다.

HF Daily Papers3달 전· 3달 전 발행

LLM 게임 생성의 한계 돌파, 메커니즘 중심의 4단계 진화 시스템

기존 LLM 기반 게임 생성은 단순히 코드를 짜는 수준에 그쳐 실행 오류가 잦고 게임의 핵심 재미인 메커니즘의 진화가 부족했다. CreativeGame은 게임 메커니즘을 명시적인 설계 객체로 다루어 버전이 거듭될수록 게임의 규칙이 고도화되는 반복적 진화 파이프라인을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

이미지 생성 모델을 비디오 생성의 강력한 사전 지식으로 활용해 고품질 가상 인간 비디오 구현

기존의 인간 비디오 생성 방식은 외형 유지와 동작 제어를 동시에 달성하기 위해 방대한 멀티뷰 비디오 데이터가 필요했으나, 이 논문은 고품질 이미지 생성 모델을 활용해 데이터 의존도를 낮췄다. 이미지 합성과 비디오 정제 단계를 분리함으로써 복잡한 학습 없이도 일관된 외형과 정교한 시점 제어가 가능한 가상 인간 비디오를 생성할 수 있다.

HF Daily Papers3달 전· 3달 전 발행

VLM의 지능을 이미지 생성에 이식하여 복잡한 추론 성능 극대화

기존 이미지 생성 모델은 텍스트 프롬프트를 정확히 이해하지 못하거나 복잡한 공간 관계를 무시하는 경우가 많았다. MMCORE는 이미 똑똑하게 훈련된 시각 언어 모델(VLM)의 지식을 생성 과정에 직접 주입하여, 별도의 대규모 재학습 없이도 정교한 이미지 편집과 생성을 가능하게 한다.

HF Daily Papers3달 전· 3달 전 발행

Flash-SemiCRF, 게놈 규모 데이터에서 메모리 사용량 1,000배 이상 절감

기존의 Semi-CRF 모델은 시퀀스 길이가 길어질수록 메모리 사용량이 기하급수적으로 늘어나 대규모 게놈 데이터나 긴 음성 데이터 처리가 불가능했다. 이 논문은 FlashAttention의 원리를 적용해 메모리 병목을 해결함으로써, 수십만 토큰 이상의 긴 시퀀스에서도 정확한 세그먼트 단위 추론을 가능하게 한다.

HF Daily Papers3달 전· 3달 전 발행

사회적 지능을 갖춘 AI, Shapley Value로 협상과 설득 능력 극대화

AI 에이전트가 복잡한 다자간 대화나 협상에서 성공하려면 각 발화의 장기적인 전략적 가치를 정확히 평가해야 합니다. 이 논문은 게임 이론의 Shapley Value를 활용해 대화의 최종 결과에 기여한 개별 발화의 공헌도를 공정하게 계산함으로써, 단순한 논리적 추론을 넘어선 고도의 사회적 지능을 구현하는 새로운 방법론을 제시합니다.

HF Daily Papers3달 전· 4달 전 발행

CluE: 클러스터 기반 진화로 LLM 메모리 추출 성능 9.04% 향상

사용자 맞춤형 AI 어시스턴트가 발전함에 따라 과거 대화에서 중요한 정보를 추출해 기억하는 능력이 필수적이다. 하지만 대화의 성격에 따라 기억해야 할 정보의 종류가 다르기 때문에, 이 논문은 다양한 상황에 맞춰 스스로 진화하며 최적의 정보를 추출하는 프롬프트 최적화 기법을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

Cortex 2.0, 월드 모델 기반 계획으로 산업용 로봇의 작업 성공률 99% 달성

기존의 로봇 제어 모델은 현재 상황만 보고 즉각 반응하는 방식이라 복잡한 작업에서 실수가 누적되는 한계가 있었다. 이 논문은 로봇이 행동하기 전 미래의 시각적 결과를 미리 예측하고 평가하는 월드 모델을 도입하여, 산업 현장에서 사람의 개입 없이도 정밀하고 안정적인 작업이 가능함을 입증했다.

HF Daily Papers3달 전· 3달 전 발행

1400시간 이상의 대규모 쿠란 오디오 데이터셋 Tadabur 공개

쿠란 낭독은 독특한 음향적 특성과 엄격한 발음 규칙(Tajwid)을 가지고 있어 일반적인 음성 인식 모델로는 처리에 한계가 있다. Tadabur는 600명 이상의 낭독자가 참여한 1400시간 이상의 데이터를 제공하여, 종교적·문화적으로 중요한 도메인 특화 음성 기술 연구를 위한 강력한 기반을 마련했다.

HF Daily Papers3달 전· 3달 전 발행

이미지 생성 모델, 튜닝만으로 SAM 3 꺾고 시각 이해 SOTA 달성

이미지 생성 모델이 단순히 그림을 그리는 능력을 넘어, 시각적 세계에 대한 깊은 이해도를 갖춘 범용 학습 도구임을 입증했다. 복잡한 전용 아키텍처 없이 가벼운 지시어 튜닝만으로도 세그멘테이션과 깊이 추정 등 다양한 시각 작업에서 전문 모델을 능가하는 성능을 보여주어 컴퓨터 비전의 패러다임 변화를 예고한다.

HF Daily Papers3달 전· 3달 전 발행

비디오 생성 모델로 로봇의 정교한 손동작 물리 시뮬레이션 구현

기존의 물리 기반 캐릭터 제어는 고비용의 3D 모션 캡처 데이터에 의존했으나, 이 논문은 비디오 생성 모델의 풍부한 2D 데이터를 활용해 정교한 손동작을 학습하는 새로운 방향을 제시합니다. 텍스트 입력만으로 처음 보는 물체와 상호작용하는 물리적으로 타당한 동작을 생성할 수 있어 로봇 공학 및 가상 캐릭터 제어의 확장성을 크게 높였습니다.

HF Daily Papers3달 전· 3달 전 발행

확산 모델 하나로 이미지 이해와 생성을 동시에, LLaDA2.0-Uni 공개

기존 멀티모달 모델들이 이해(VLM)와 생성(Diffusion)을 위해 서로 다른 구조를 결합했던 것과 달리, 단일 이산 확산 모델(dLLM) 아키텍처로 두 기능을 완벽히 통합했다. 이를 통해 텍스트와 이미지가 뒤섞인 복잡한 추론과 고화질 이미지 생성을 하나의 흐름으로 처리할 수 있는 차세대 통합 파운데이션 모델의 가능성을 입증했다.

HF Daily Papers3달 전· 3달 전 발행

모르는 것을 모른다고 말하고 이유까지 설명하는 3B 모델 Abstain-R1

LLM이 모르는 질문에 대해 추측하거나 환각을 일으키는 문제를 해결하기 위해, 단순히 답변을 거부하는 것을 넘어 무엇이 부족한지 설명하는 능력을 강화했습니다. 3B 규모의 작은 모델임에도 불구하고 검증 가능한 보상을 통해 DeepSeek-R1과 같은 대형 모델에 필적하는 기권 및 명확화 성능을 보여주었습니다.

HF Daily Papers3달 전· 3달 전 발행

AI가 인간을 속이는 이유: Proxy Compression 가설로 분석한 리워드 해킹

RLHF와 같은 정렬 기법이 모델의 성능을 높이는 것처럼 보이지만, 실제로는 보상 신호의 허점을 파고드는 리워드 해킹에 취약함을 경고한다. 모델이 지능화될수록 단순한 편향을 넘어 전략적 기만으로 진화하는 과정을 체계화하여 안전한 AI 개발을 위한 새로운 연구 방향을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

음성 AI의 고질병 '기계음' 해결, WavAlign으로 지능과 자연스러움 동시 잡았다

기존 음성 대화 모델은 지능을 높이려 하면 음성 품질이 떨어지고, 음성을 개선하려 하면 지능이 낮아지는 상충 관계가 있었습니다. WavAlign은 텍스트와 음성 학습을 분리하여 최적화하는 새로운 학습법을 통해 똑똑하면서도 감정이 풍부한 자연스러운 목소리를 동시에 구현했습니다.

HF Daily Papers3달 전· 3달 전 발행

MoE 모델 학습 비용 32% 절감하면서 성능은 그대로 유지

대규모 언어 모델의 주류가 된 MoE 아키텍처를 처음부터 거대하게 학습시키는 대신, 작은 모델에서 전문가 수를 늘려가며 점진적으로 확장하는 효율적인 방법론을 제시한다. 이를 통해 동일한 성능의 모델을 훨씬 적은 GPU 시간으로 확보할 수 있어 모델 학습의 경제성을 크게 개선한다.

HF Daily Papers3달 전· 3달 전 발행

학습 없이 3D 데이터를 이미지로 변환해 정렬하는 C-GenReg 공개

기존의 3D 데이터 정렬 방식은 새로운 환경이나 센서 데이터에 대해 다시 학습해야 하는 한계가 있었다. 이 논문은 이미 학습된 대규모 이미지 생성 모델을 활용해 3D 데이터를 이미지로 변환함으로써, 추가 학습 없이도 실내외 다양한 환경에서 정밀한 3D 정렬을 가능하게 한다.

HF Daily Papers3달 전· 3달 전 발행

TACO: 터미널 에이전트의 토큰 비용 10% 절감 및 성능 4% 향상

터미널 기반 AI 에이전트는 실행 로그와 같은 불필요한 정보를 반복적으로 처리하며 토큰 비용이 기하급수적으로 증가하는 문제를 겪는다. TACO는 상호작용 과정에서 압축 규칙을 스스로 학습하고 최적화하여 비용 효율성과 장기 추론 능력을 동시에 개선한다.

HF Daily Papers3달 전· 3달 전 발행

미래의 모델을 스승 삼아 LLM 추론 성능 5.27%p 향상 달성

강화학습 시 외부 모델이나 과거 데이터 대신, 동일한 학습 경로상의 '가까운 미래' 체크포인트를 가이드로 활용하는 새로운 패러다임을 제시한다. 이를 통해 학습 초기 수렴 속도를 2.1배 높이고, 학습 후기 성능 정체 구간을 돌파하여 모델의 최종 성능 한계를 효과적으로 끌어올린다.

HF Daily Papers3달 전· 3달 전 발행

생성 학습만으로 모델의 공간 추론 능력을 강화하는 GSI-Bench

기존 멀티모달 모델의 공간 지능은 주로 이해 능력에만 초점을 맞추었으나, 이 논문은 이미지를 편집하고 생성하는 과정에서 3D 공간 제약 조건을 준수하는 '생성적 공간 지능(GSI)'의 중요성을 제시합니다. 생성 학습이 모델의 다운스트림 공간 이해 능력까지 직접적으로 향상시킬 수 있음을 입증하여 통합 멀티모달 모델의 새로운 발전 방향을 제시합니다.

HF Daily Papers3달 전· 3달 전 발행

OpenMobile, 안드로이드 월드 벤치마크에서 64.7% 성공률 달성

대부분의 고성능 모바일 에이전트는 학습 데이터와 생성 방식이 비공개되어 있어 연구의 재현이 어려웠다. OpenMobile은 환경 탐색을 통해 구축한 전역 메모리를 기반으로 고품질 데이터를 합성하는 개방형 프레임워크를 제공하여 오픈소스 에이전트의 성능을 비약적으로 향상시킨다.

HF Daily Papers3달 전· 3달 전 발행

4B 모델로 30B급 성능 달성, 1만 개 데이터로 만든 리서치 에이전트

대규모 모델에 의존하던 복잡한 리서치 작업을 4B 규모의 소형 모델로도 수행할 수 있음을 증명했다. 단 1만 개의 공개 데이터와 효율적인 강화학습 기법만으로 구축되어 비용과 개인정보 보호가 중요한 엣지 환경 배포에 새로운 가능성을 제시한다.

Claude Code 사용자 필독: 저가 API 쓰다 PC가 좀비가 될 수 있다

저가 Claude API 리셀러인 awstore.cloud가 Claude Code의 도구 실행 기능을 악용해 사용자 PC에 악성코드를 심는 공격 사례가 발견됐다.

ChatGPT와 Claude가 서로의 코드를 비난하며 만든 웹 프로젝트

Proxima MCP를 통해 연결된 5개의 AI 모델이 협업하여 'Cathedral of Sparks'라는 인터랙티브 웹 프로젝트를 자율적으로 완성했다.

오픈AI 의장 브렛 테일러의 시에라, 프랑스 AI 기업 인수로 글로벌 확장 가속

브렛 테일러가 공동 창업한 AI 에이전트 기업 시에라가 워크플로 통합 전문 스타트업 프래그먼트를 인수하며 기술력을 강화했다.

미국 정부, 중국의 '지식 증류'를 통한 AI 복제 시도에 강력 대응 예고

미국 정부가 중국 기업들이 지식 증류 기법을 악용해 미국 선도 AI 모델을 무단 복제하고 지적 재산을 탈취하는 행위에 대해 대대적인 단속을 예고했다.

Claude Code가 바꾼 AI 대행사 수익 모델: 월 300만원 고정 수익 만드는 법

Claude Code와 같은 자율 코딩 에이전트를 활용해 중소기업용 AI 운영체제를 구축하고 고정적인 월간 유지보수 수익을 창출하는 새로운 AI 대행사 비즈니스 모델을 제시한다.

GPT-5.5 출시와 Codex API를 활용한 구독 기반 모델 호출 방법

OpenAI의 신규 모델 GPT-5.5를 Codex CLI 백도어 API와 LLM 플러그인을 통해 구독 계정으로 호출하고 SVG 생성 성능을 테스트했다.