본문으로 건너뛰기

2026년 5월 1일 AI 뉴스

100

관심 태그 추가
The Verge AI3달 전

미 국방부의 AI 군단 결성, OpenAI와 엔비디아는 합류하고 Anthropic은 퇴출된 이유

미 국방부가 OpenAI, 구글, 엔비디아 등 7개 기업과 기밀 환경 내 AI 사용 계약을 체결했으나, 자율 살상 무기 등에 반대한 Anthropic은 공급망 위험을 이유로 제외했습니다.

OpenAI 신규 PII 필터 vs GLiNER, 벤치마크 함정에 속지 마세요

OpenAI의 privacy-filter와 GLiNER 모델을 비교한 결과, 측정 방식에 따라 성능 우위가 뒤바뀌며 용도에 맞는 선택이 필요함이 확인됐다.

GPT-4부터 로컬 모델까지, 검증된 AI 에이전트 설정 모음집

다양한 LLM과 유스케이스에 맞춘 시스템 프롬프트, 도구 사용 스키마, RAG 파이프라인 설정을 공유하는 커뮤니티 주도 오픈소스 프로젝트이다.

KDNugget3달 전

데이터가 정규분포를 따르지 않을 때? Pingouin으로 해결하는 통계 분석

실제 데이터가 정규성이나 등분산성 가정을 위반할 때, Python의 Pingouin 라이브러리를 활용하여 Mann-Whitney U, Wilcoxon, Welch's ANOVA 등 로버스트 통계 기법을 적용하는 방법을 다룹니다.

LLM의 한계를 넘는 재귀 모델, HRM과 TRM의 작동 원리

재귀 구조를 활용하여 모델 파라미터 크기를 늘리지 않고도 복잡한 논리 추론 능력을 획기적으로 개선하는 HRM과 TRM 아키텍처의 핵심 원리와 학습 방법론을 제시한다.

모든 AI 결정을 승인받아야 할까? 자율성을 살리는 거버넌스 설계법

자율 AI 에이전트 시스템에서 모든 단계를 동기식으로 승인하는 대신, 패스트 패스와 슬로우 패스를 구분하여 효율성과 안전을 동시에 달성하는 거버넌스 아키텍처를 제안한다.

The Verge AI3달 전

성경 이야기가 AI 슬롭으로? Fiverr에서 급증하는 AI 종교 콘텐츠 외주 실태

기독교 콘텐츠 제작자들이 Fiverr의 프리랜서들을 통해 성경 기반의 AI 생성 영상(AI 슬롭)을 저렴하게 대량 생산하여 소셜 미디어에 유포하고 있다.

공개된 내 사진이 수사기관의 감시망이 된다면? Clearview AI 논란

Clearview AI의 무단 이미지 스크래핑과 생체 인식 데이터베이스 구축 사례를 통해 AI 데이터 활용의 윤리적 경계와 법적 규제 필요성을 논의한다.

Claude Code로 주말 만에 완성한 유튜브 자막 추출 도구

Claude Code를 활용해 유튜브 URL을 변경하는 것만으로 자막을 Markdown으로 추출해 LLM 컨텍스트로 활용할 수 있는 서비스를 구축했다.

프롬프트에 수학 공식을 넣었더니 AI 캐릭터가 더 똑똑해졌다?

프롬프트 내에 단어 간의 관계를 정의하는 수학 공식을 포함하여 LLM의 출력 톤과 정밀도를 비약적으로 향상시키는 새로운 프롬프트 엔지니어링 방법론이 공유됐다.

단어 하나로 완성되는 빈티지 포스터, FLUX와 LoRA의 조합

FLUX.2 모델에 특정 LoRA를 적용하고 2단계 워크플로우를 거쳐 단일 단어 프롬프트만으로 고품질 빈티지 성냥갑 스타일 이미지를 생성하는 실험 결과이다.

Salesforce3달 전

Salesforce가 전망한 2026년 AI 에이전트: 신뢰성과 속도가 핵심

Salesforce는 2026년 엔터프라이즈 AI의 핵심이 결정론적 가드레일, 컨텍스트 엔지니어링, MCP 기반 협업을 통한 운영 신뢰성 확보에 있다고 분석했다.

Dataiku Blog3달 전

금융권 AI 도입률 88% 돌파, 파일럿을 넘어 실전 생산으로 가는 로드맵

금융 기관이 머신러닝을 파일럿 단계에서 실제 운영 환경으로 확장하기 위한 핵심 활용 사례와 5단계 구현 로드맵을 제시합니다.

AI의 건망증 해결사 MemPalace, RAG보다 정교한 장기 기억 시스템 구축법

MemPalace는 요약 없이 원문을 그대로 저장하는 계층적 구조의 로컬 우선 메모리 시스템으로, AI 에이전트에게 높은 정확도의 장기 기억력을 제공한다.

LLM과 Tree-sitter로 컴파일러 버그 100개를 잡는 초효율 퍼징 전략

LLM 기반 변이 도구와 Tree-sitter를 활용해 Sui Move, Solidity 등 주요 스마트 컨트랙트 컴파일러에서 100개 이상의 내부 오류(ICE)를 발견한 기술적 방법론을 공유한다.

LLM으로 만든 데이터 5천 개보다 사람의 손길 200개가 강력한 이유

LLM으로 생성한 5,000개의 합성 데이터보다 사람이 직접 라벨링한 200개의 데이터가 모델 학습에서 더 높은 성능을 보였다.

Claude Code 토큰이 녹고 있다면? 비용 90% 아끼는 4가지 필살기

Claude Code 사용 시 발생하는 과도한 토큰 비용을 절감하고 하네스 엔지니어링을 통해 에이전트의 실수를 방지하는 4가지 핵심 플러그인 활용법을 제시한다.

KDNugget3달 전

단 3초의 샘플로 목소리 복제, Mistral AI의 Voxtral TTS 공개

Mistral AI가 공개한 40억 파라미터 규모의 Voxtral TTS는 3초의 오디오만으로 고품질 음성 복제와 초저지연 추론을 지원하는 오픈 웨이트 모델이다.

API 키 없이 로컬 LLM의 반복되는 실수를 해결하는 CogniCore

외부 의존성 없이 로컬 LLM 에이전트에 지속성 메모리와 자기 성찰 기능을 추가하여 과거의 오류를 학습하고 수정하게 돕는 CogniCore 프레임워크가 공개됐다.

DeepSeek V4의 3% 활성화율이 바꿀 AI 추론 경제학과 IBM의 새로운 전략

IBM의 전문가들이 Granite 4.1 모델 출시, DeepMind의 분산 학습 혁신, DeepSeek V4의 파격적인 추론 효율성, 그리고 양자 컴퓨팅의 미래 전략을 심도 있게 논의한다.

Claude Code로 앱 만들고 월 5달러 VPS에 자동 배포하기

Claude Code 에이전트를 사용하여 AI 기반 학습 앱을 개발하고, 오픈소스 Coolify 플랫폼을 통해 Hostinger VPS에 배포 및 관리하는 전체 워크플로를 다룹니다.

LLM 추론 능력의 병목 현상, 모델의 기하학적 구조에 답이 있다

LLM이 복잡한 구성적 추론에서 겪는 한계가 단순 규모 확장이 아닌 트랜스포머 아키텍처의 기하학적 구조적 결함에서 기인한다는 가설과 실험 결과가 제시됐다.

최신 AI 모델이 항상 정답일까? 비디오 요약 검증 실험이 밝힌 반전 결과

비디오 요약 시스템에서 모델 성능보다 검증 레이어의 아키텍처가 정확도 유지에 더 결정적인 역할을 하며, 최신 모델이 반드시 비용 대비 효율적이지 않음을 입증했다.

r/ClaudeCode3달 전

Claude를 튜터로 활용하여 코드 리뷰의 고질적인 문제를 해결하는 방법

Claude Code를 단순 자동화 도구가 아닌 튜터로 활용하여 개발자의 코드 이해도를 높이고 잠재적인 버그를 찾아낸 사례이다.

Mac에서 비디오와 오디오를 동시에? LTX 2.3 기반 로컬 생성 도구 Phosphene

Apple Silicon Mac에서 MLX 프레임워크를 통해 LTX 2.3 모델을 구동하여 오디오가 포함된 비디오를 로컬로 생성하는 오픈소스 도구이다.

카메라가 놓쳐도 끝까지 추적한다! 호모그래피 기반 멀티 카메라 트래킹

서로 다른 카메라 시점 간의 좌표계를 호모그래피 행렬로 매핑하여 객체 추적의 연속성을 확보하는 시스템을 구현했다.

r/artificial3달 전

가짜 뉴스는 정보 오류가 아니라 '주의력 분산 공격'이다

합성 미디어를 단순한 정보 정확성 문제가 아닌 기관의 주의력을 고갈시키는 서비스 거부 공격(DoS) 관점에서 재정의하고 새로운 대응 체계를 제안한다.

상용 소프트웨어 대신 Claude로 48시간 만에 만든 맞춤형 회계 시스템

몬태나주의 한 카지노 회계 담당자가 Claude를 활용해 48시간 만에 기존 QuickBooks를 대체할 수 있는 맞춤형 총계정원장 시스템을 구축했다.

AI Engineer3달 전

9명의 팀으로 6,000명 규모 컨퍼런스를 운영하는 비결: AI 에이전트 실무 적용기

AI Engineer 컨퍼런스 설립자 Swyx가 Devin과 Town Assistant 등 코딩 에이전트를 활용해 웹사이트 구축, 데이터 관리, 리소스 구매 등 운영 전반을 자동화한 실전 사례를 공유한다.

MIT AI News3달 전

수면 중 뇌파 데이터로 알츠하이머 조기 진단하는 AI 파운데이션 모델

MIT 출신들이 설립한 비콘 바이오시그널스가 가정용 EEG 헤드밴드와 머신러닝을 결합해 뇌 질환 진단 및 신약 개발을 위한 뇌 활동 매핑 플랫폼을 구축했다.

LLM 평가, 아직도 ROUGE나 BLEU만 쓰시나요? 실무를 위한 평가 가이드

기존 범용 벤치마크의 한계를 극복하기 위해 분류, 요약, 번역 등 주요 작업별로 실질적인 성능을 측정할 수 있는 특화 평가 지표와 방법론을 제시합니다.

빅테크 실적 폭발과 Harness-as-a-Service가 바꿀 AI 에이전트의 미래

빅테크 기업들의 강력한 AI 기반 실적 성장을 분석하고, AI 에이전트 개발을 가속화할 Harness-as-a-Service 개념과 Cursor SDK의 역할을 살펴봅니다.

Eye on AI3달 전

양자 기술과 AI의 만남, 2025년 실질적 비즈니스 기회와 전망

QED-C의 셀리아 메르츠바허가 양자 시장의 27% 성장세와 AI와의 상호 보완적 관계, 그리고 기업의 하이브리드 시스템 준비 필요성을 설명합니다.

TechCrunch AI3달 전

ChatGPT Images 2.0 출시 후 인도에서 폭발적 인기, 그 이유는?

OpenAI의 ChatGPT Images 2.0 출시 이후 인도가 최대 사용자 시장으로 부상했으며, 주로 개인적 자기표현과 다국어 텍스트 렌더링 기능이 활용되고 있다.

AI 추론 엔지니어링: 연구 결과가 31시간 만에 프로덕션에 적용되는 이유

Base10의 Philip Kiely가 AI 추론 시스템의 복잡성과 연구에서 프로덕션으로 이어지는 급격한 속도, 그리고 추론 엔지니어링의 미래 전망을 공유합니다.

OpenAI Codex CLI, 목표 달성할 때까지 스스로 반복하는 기능 탑재

OpenAI의 Codex CLI 0.128.0 버전이 설정된 목표를 달성하거나 예산이 소진될 때까지 작업을 반복 수행하는 /goal 기능을 도입했다.

GPT-5.5 사이버 보안 능력 공개: Claude Mythos와 대등한 수준

영국 AI 안전 연구소의 평가 결과, OpenAI의 GPT-5.5가 보안 취약점 탐지 분야에서 Claude Mythos와 유사한 성능을 보였다.

HF Daily Papers3달 전· 3달 전 발행

연합 학습의 데이터 오염 문제, 멀티태스크 오토인코더로 정확도 7.02% 향상

연합 학습은 데이터 프라이버시를 보호하지만, 각 기기의 데이터가 서로 다른 분포를 가지거나 노이즈가 섞여 있을 때 모델 성능이 급격히 저하되는 한계가 있다. 이 논문은 중앙 서버가 데이터를 직접 보지 않고도 클라이언트 수준에서 불량 데이터를 걸러낼 수 있는 효율적인 샘플 선택 기법을 제시하여 연합 학습의 실용성을 높인다.

HF Daily Papers3달 전· 3달 전 발행

AI 이미지 편집 모델, 미로 찾기와 퀸 문제 해결 능력은 인간의 6세 수준

기존의 AI 시각 추론은 주로 텍스트 기반의 단계별 생성에 의존하여 연산 효율이 낮았으나, 이 논문은 시각적 계획을 단일 단계의 이미지 편집 작업으로 재정의하여 효율성을 높였습니다. 추상적 퍼즐 데이터셋인 AMAZE를 통해 현재 모델들이 가진 기하학적 불변성과 논리적 추론 능력의 한계를 명확히 규명했습니다.

애플 Mac 매출 깜짝 성장 비결은 로컬 AI와 OpenClaw 열풍

애플의 2분기 Mac 매출이 로컬 AI 모델 실행 및 OpenClaw 수요에 힘입어 시장 예상치를 상회하며 전년 대비 6% 성장했다.

거대 모델 성능을 미리 예측하는 법: 스케일링 법칙의 모든 것

LLM 성능과 컴퓨팅 자원, 데이터 규모 사이의 정량적 관계를 설명하는 스케일링 법칙의 역사와 핵심 원리 및 실무적 적용 방법을 다룹니다.

The AI Grid3달 전

코딩 몰라도 OK! AI 에이전트 Codex로 엑셀부터 자동화까지 끝내기

기술적 지식이 없는 초보자도 Codex를 활용해 파일 생성, 프로젝트 관리, 이메일 요약 및 자동화 워크플로를 구축하는 방법을 다룹니다.

AI 에이전트끼리 대화할 때 발생하는 4가지 치명적 보안 위협

Microsoft Research는 다중 에이전트 환경에서 개별 모델 테스트로는 발견할 수 없는 전파성 웜, 평판 조작 등 4가지 네트워크 수준의 보안 리스크를 규명했다.

암호화된 상태로 AI 연산? 10만 배 느렸던 FHE를 2배 수준으로 앞당긴 비결

보스턴 대학교 Ajay Joshi 교수가 데이터 복호화 없이 AI 연산을 수행하는 완전 동형 암호(FHE) 기술의 성능 혁신과 하드웨어 가속 방안을 제시한다.

시선이 머무는 곳만 고해상도로 생성하여 연산량을 획기적으로 줄이는 방법

인간의 시각적 민감도가 시선 중심부에 집중된다는 점에 착안하여, 시선 영역은 고해상도로 주변부는 저해상도로 토큰을 비균등하게 배분해 생성 효율을 극대화하는 Foveated Diffusion 기술을 소개한다.

로봇이 샌드위치를 만들고 설거지를 끝낼 때까지 잊지 않는 비결: pi0 모델의 진화

Physical Intelligence의 Karl Pertsch가 로봇의 장기 과업 수행을 위해 필수적인 다중 스케일 메모리 아키텍처와 고성능 범용 제어 모델인 pi0.7의 핵심 기술을 소개한다.

Gemma 4 파인튜닝부터 Claude Code 분석까지, AI 최신 트렌드 요약

수학 분야의 AI 혁명, 구체적인 에이전트 스킬 작성 팁, Gemma 4 파인튜닝 가이드 등 최신 AI 기술 소식을 다룹니다.

마이크로소프트 워드에 법률 전문가 전용 AI 에이전트 탑재

마이크로소프트가 법률 팀의 계약서 검토 및 협상 이력 분석을 돕기 위해 워드 내부에 탑재되는 전문 AI 법률 에이전트를 공개했다.

가짜 판례 57개 제출한 변호사의 최후, AI 환각 방지 4단계 전략

AI의 통계적 패턴 완성 특성으로 인한 법률 문서 환각 사례를 통해 실무에서의 4단계 팩트체크 워크플로우를 제시한다.

네트워크 없이 스마트폰에서 LLM과 실시간 대화가 가능하다?

QVAC SDK와 Qwen3 1.7B 모델을 활용하여 안드로이드 기기 내에서 지연 시간 없이 작동하는 로컬 음성 대화 시스템을 구현했다.

LLM에게 PR 승인을 맡겨도 될까? 구조화된 실행으로 치명적 오류 0건 달성

PR 자동 승인 시스템에서 단일 LLM 요청 방식보다 7단계 구조화된 실행 모델이 보안 취약점 감지 및 정책 준수 면에서 월등히 안전함이 확인됐다.

매일 코딩하는 개발자를 위한 AI 구독 서비스 종결판 비교

GLM 5.1, Claude Code, Codex, Kimi 4종의 코딩 AI 서비스를 성능, 비용, 유연성 관점에서 비교 분석하여 최적의 선택지를 제안한다.

AI 코딩 세션 종료 후 맥락 손실 해결하는 오픈소스 Continue Later

AI 코딩 에이전트 세션 종료 시 Git 상태와 작업 맥락을 로컬 파일로 저장하여 다음 세션에서 즉시 복구할 수 있게 돕는 오픈소스 툴킷이다.

Claude Code 토큰 낭비 방지법: 검증된 스킬로 워크플로 최적화하기

Claude Code에 명확한 작업 단계를 가르치는 '스킬'을 도입하여 토큰 소모를 줄이고 프론트엔드 설계, 클라우드 배포 등 복잡한 작업을 자동화하는 방법이 공유됐다.

Claude 설정에 바로 붙여넣는 업무 자동화 프롬프트 5가지

글쓰기 스타일 학습부터 제안서 및 보고서 작성까지 매주 반복되는 업무를 효율화하는 5가지 실전 프롬프트 구조를 공유한다.

Claude Code와 Cursor 사이의 맥락 단절, Harbor로 해결했다

여러 AI 에이전트를 번갈아 사용할 때 발생하는 API 키 관리와 작업 맥락 손실 문제를 해결하기 위한 워크플로 최적화 도구 Harbor를 소개한다.

n8n과 Claude Code의 만남: 말 한마디로 완성되는 AI 자동화 워크플로

n8n이 출시한 공식 MCP 서버를 통해 Claude Code와 같은 AI 에이전트가 자연어 지시만으로 n8n 워크플로를 직접 설계하고 실행하는 방법을 다룬다.

이 코드를 왜 썼지? 3년치 맥락을 1분 만에 요약하는 AI 고고학자

Git 이력, PR, 이슈, Slack 대화까지 통합 분석하여 특정 코드 라인이 작성된 근본 원인을 요약해주는 Claude Code용 도구가 공개됐다.

AI 에이전트가 짠 코드, 의도와 컨텍스트까지 추적하는 agentdiff 공개

자율 AI 에이전트의 코드 수정 의도와 컨텍스트를 로컬에서 추적하여 보안과 PR 리뷰 품질을 높이는 오픈소스 도구 agentdiff가 공개됐다.

Jetson Orin Nano에서 YOLOv8n 추론 속도 10ms 이하로 최적화하기

Jetson Orin Nano 환경에서 YOLOv8n과 TensorRT FP16 최적화를 활용해 10ms 이하의 지연 시간을 갖는 다중 카메라 객체 추적 시스템을 구현했다.

500달러 하드웨어로 구현한 자가 교정 다중 카메라 AI 감시 시스템

Jetson Orin Nano를 활용해 여러 카메라의 영상을 실시간으로 융합하고 자가 교정하는 오픈소스 엣지 AI 시스템 OVERWATCH가 공개되었다.

Claude로 돈 버는 법? 35개 사례를 분석한 비즈니스 운영 매뉴얼

35개 이상의 Reddit 스레드를 분석하여 Claude Code로 비즈니스를 구축하고 운영하기 위한 프레임워크와 실전 패턴을 정리한 오픈소스 저장소를 공유했다.

Perplexity AI의 내부 작동 원리: 시스템 프롬프트 전문 공개

Perplexity AI 어시스턴트의 페르소나, 도구 사용 규칙, 인용 방식 및 답변 구조를 정의하는 상세 시스템 프롬프트이다.

데이터 유출 걱정 없는 100% 온디바이스 심리 치료 보조 AI

외부 API 연결 없이 기기 내에서만 작동하며 음성 대화와 요약을 제공하는 심리 치료 준비 앱 Prelude의 개발 경험 공유이다.

GPU 비용 22% 절감, 응답 속도 85% 향상시키는 프레임워크 Ranvier

LLM 서빙 시 로드 밸런서가 토큰 접두사(Prefix)를 인식하여 동일한 KV 캐시를 보유한 GPU로 요청을 라우팅함으로써 추론 효율을 극대화하는 방법론을 제시한다.

AI 에이전트와 3시간 만에 6,000줄 코딩하여 글로벌 서비스 출시

AI 에이전트를 활용한 '바이브 코딩' 방식으로 3시간 만에 3D 지구본 기반의 익명 고민 공유 플랫폼을 구축하고 배포한 사례이다.

Claude Code가 짠 코드, 보안 점검도 같은 AI에게 맡겨도 될까?

Anthropic의 기업용 보안 도구 출시에 맞춰, AI 시스템 감사 과정에서 발견된 실제 보안 취약점 사례와 독립적 보안 검증의 필요성을 강조한다.

코드 보안 검사도 AI가 직접 공격하며 검증한다 late-sast 공개

MCP와 VulnLLM-R-7B를 연동하여 코드의 취약점을 찾고 실제 PoC 공격으로 유효성을 검증하는 자율형 보안 스캐닝 도구입니다.

Claude Code가 내 과거 코드를 기억한다? 자동 메모리 주입 도구 Brainspike

Brainspike는 Claude Code 사용 시 다양한 메모리 계층에서 관련 정보를 검색하여 프롬프트에 자동으로 주입해주는 오픈소스 도구이다.

Claude Code의 기억력 문제 해결, Slack 대화 기록을 메모리로 활용하는 법

Claude Code 에이전트가 Slack 스레드 기록을 검색하고 소환하여 협업 맥락을 유지할 수 있게 해주는 slack-recall 기술이 공개됐다.

r/ClaudeCode3달 전

Claude Code 사용량 제한 해결? 다중 에이전트 위임 전략

Claude Code의 사용량 제한을 극복하기 위해 상위 모델이 설계를 맡고 저렴한 모델 기반 에이전트들이 구현을 수행하는 다단계 워크플로가 제안됐다.

DeepSeek-R1은 16억 달러인데 OpenAI는 왜 영리 전환이 필요했나?

OpenAI가 막대한 투자금에도 불구하고 영리 법인으로 전환한 것이 DeepSeek-R1의 저비용 성공 사례에 비추어 볼 때 기만적인 행위라는 비판이 제기되었다.

Hugging Face Transformers가 지원하는 최신 양자화 기법 총정리

Hugging Face Transformers 라이브러리에서 지원하는 AWQ, GPTQ, bitsandbytes 등 다양한 양자화 알고리즘의 설정 클래스와 파라미터 상세 명세입니다.

바이브 코딩의 한계 극복, 프로젝트 결정을 기억하는 mneme 공개

LLM이 프로젝트의 기술적 결정과 제약 사항을 잊지 않도록 저장하고 주입하여 일관된 코딩을 돕는 오픈소스 도구 mneme가 공개됐다.

단 5번의 메시지로 완성한 수입 관리 앱, AI 코딩의 놀라운 진화

프리랜서 개발자가 Codex를 활용해 수일이 걸릴 시간 추적 및 수입 관리 앱을 단 몇 번의 프롬프트만으로 구축한 사례이다.

스키마 검증만으로는 부족한 AI 파이프라인의 신뢰도 해결책

AI 파이프라인 단계별로 누적되는 불확실성과 품질 저하 문제를 해결하기 위한 gateframe 도구와 LangChain 통합 사례를 제시한다.

Claude Sonnet 4.8 유출과 GPT-5.5의 압도적 보안 성능 공개

Anthropic의 차세대 모델 Claude Sonnet 4.8 유출 소식과 사이버 보안 벤치마크에서 Mythos를 앞선 OpenAI GPT-5.5의 성능, 그리고 슈퍼 앱으로 진화하는 Codex의 업데이트를 다룹니다.

r/ClaudeCode3달 전

Claude Code로 테스트 커버리지를 넘어 뮤테이션 테스팅까지 자동화하기

Claude Code의 플랜 모드와 4단계 사후 검증 프롬프트를 결합하여 코드 품질과 테스트 신뢰도를 극대화하는 방법론이다.

r/ClaudeCode3달 전

월 200달러 구독료를 30달러로 줄인 Claude Code 비용 최적화 전략

Claude Code 사용자가 작업별 모델 라우팅을 통해 구독료 대비 비용을 85% 절감한 사례를 공유했다.

HF Daily Papers3달 전· 3달 전 발행

연합 학습 통신량 52% 절감하면서 강력한 데이터 보안까지 확보

연합 학습은 데이터를 공유하지 않지만 모델 업데이트 과정에서 정보 유출 위험과 막대한 통신 비용이 발생한다. 이 논문은 적응형 양자화와 Laplacian 기반 차분 프라이버시를 결합하여 보안 수준을 높이면서도 통신 데이터 크기를 절반 이상 줄이는 실용적인 해결책을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

오픈소스 LLM의 도구 사용 성능을 최대 27% 향상시키는 FAMA 프레임워크

오픈소스 LLM은 상용 모델에 비해 추론 능력이 부족하여 복잡한 도구 사용 시 오류가 누적되는 경향이 있다. FAMA는 에이전트의 실패 궤적을 분석해 필요한 최소한의 전문 에이전트만 동적으로 활성화함으로써, 제한된 자원 내에서 에이전트의 신뢰성과 효율성을 동시에 확보한다.

HF Daily Papers3달 전· 3달 전 발행

X-WAM: 로봇의 3D 공간 인지력과 실시간 제어를 동시에 해결

기존 로봇 제어 모델은 2D 이미지 기반의 평면적 이해에 그쳐 물리적 세계의 입체적인 구조를 파악하는 데 한계가 있었다. 이 논문은 비디오 생성 모델의 강력한 시각적 지식을 활용해 미래의 3D 구조를 예측하면서도, 비동기식 계산 방식을 도입해 로봇이 실시간으로 빠르게 반응할 수 있는 통합 프레임워크를 제시했다.

HF Daily Papers3달 전· 3달 전 발행

GLM-5V-Turbo 공개: 멀티모달 코딩 성능에서 Claude Opus 4.6 능가

기존 멀티모달 모델들이 언어 모델의 보조 인터페이스로 시각 기능을 사용했던 것과 달리, 인지 능력을 추론과 계획의 핵심 요소로 통합한 네이티브 모델이다. 이를 통해 복잡한 GUI 조작, 시각적 도구 활용, 멀티모달 코딩 등 실제 환경에서의 에이전트 수행 능력을 비약적으로 향상시켰다.

HF Daily Papers3달 전· 3달 전 발행

보정되지 않은 일반 RGB 영상만으로 3D 공간의 물체를 언어로 검색하는 SLAM 기술

기존의 시맨틱 SLAM 시스템은 카메라의 내부 파라미터나 깊이 센서(RGB-D)가 필수적이었으나, 이 논문은 보정되지 않은 일반 단안 RGB 영상만으로도 실시간 3D 지도 생성과 자연어 쿼리 대응이 가능함을 입증했다. 특히 가구가 옮겨지거나 사람이 움직이는 동적인 환경에서도 안정적인 성능을 유지하여 실제 로봇 서비스와 AR/VR 분야의 활용도를 크게 높였다.

HF Daily Papers3달 전· 3달 전 발행

LLM으로 가상 사용자를 만든다? 대화형 시뮬레이션 기술 총정리

LLM의 발전으로 실제 사람처럼 대화하는 가상 사용자를 생성하여 AI 시스템을 테스트하고 데이터를 증강하는 것이 가능해졌다. 이 논문은 파편화된 사용자 시뮬레이션 연구를 체계적인 프레임워크로 통합하여 향후 연구 방향을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

개인용 AI 에이전트 성능 43% 향상시키는 ClawGym 프레임워크 공개

기존 AI 에이전트는 로컬 파일 시스템이나 복잡한 도구를 사용하는 실제 업무 환경에서 성능이 급격히 저하되는 한계가 있다. ClawGym은 이러한 환경에 특화된 13.5K개의 대규모 학습 데이터와 정밀한 평가 벤치마크를 제공하여, 소형 모델로도 고성능 개인용 에이전트를 구현할 수 있는 길을 열었다.

HF Daily Papers3달 전· 3달 전 발행

Diffusion Templates로 모든 이미지 제어 기능을 플러그인처럼 조립한다

기존의 이미지 생성 제어 기술들은 특정 모델에 종속되어 서로 섞어 쓰거나 재사용하기 어려웠다. 이 논문은 제어 기능을 독립적인 '템플릿'으로 분리하여, 마치 레고 블록을 조립하듯 다양한 제어 기능을 하나의 모델에 자유롭게 추가하고 결합할 수 있는 표준 체계를 제시한다.

HF Daily Papers3달 전· 3달 전 발행

실제 자본 2천만 달러를 운용한 AI 에이전트의 신뢰성 확보 비결

이 논문은 시뮬레이션이 아닌 실제 온체인 금융 환경에서 3,500개 이상의 AI 에이전트가 자본을 직접 운용한 대규모 실증 사례를 다룹니다. 에이전트의 신뢰성이 모델 자체의 성능보다 프롬프트 컴파일, 정책 검증, 실행 가드와 같은 '운영 계층'의 설계에 의해 결정됨을 입증하여 실무적인 에이전트 구축 방향을 제시합니다.

HF Daily Papers3달 전· 3달 전 발행

ESamp: 잠재 공간 증류로 LLM의 추론 다양성과 Pass@k 효율 극대화

표준적인 확률적 샘플링은 겉모습만 다른 문장을 생성할 뿐 실제 추론 전략의 다양성을 확보하지 못하는 한계가 있다. 이 논문은 모델 내부의 잠재 표현을 실시간으로 학습하여 이미 탐색된 경로를 피하고 새로운 의미적 영역을 탐색하게 함으로써 추론 성능과 효율성을 동시에 개선한다.

HF Daily Papers3달 전· 3달 전 발행

인도어 TTS의 고질적 문제인 '억양'을 6가지 차원으로 정밀 측정

기존의 TTS 평가는 단어의 정확도나 전체적인 자연스러움에만 집중하여, 인도어 특유의 권설음이나 기음 같은 미세한 억양 차이를 잡아내지 못했다. 이 논문은 억양을 6가지 물리적 차원으로 분해하여 측정함으로써, 상용 모델들이 실제로는 원어민과 얼마나 다른 억양을 내는지 수치화할 수 있는 도구를 제공한다.

HF Daily Papers3달 전· 3달 전 발행

패션 AI의 불투명한 스타일 추천, FASH-iCNN으로 브랜드와 시대를 추적하다

기존 패션 AI는 특정 브랜드나 시대의 미학적 논리를 사용자에게 알리지 않은 채 학습하여 불투명한 스타일 가이드를 제공해왔다. 이 논문은 의류 이미지에서 브랜드 정체성, 시대적 배경, 색상 전통을 추출하여 AI의 판단 근거를 투명하게 공개하는 시스템을 제안한다.

HF Daily Papers3달 전· 3달 전 발행

추가 학습 없이 오픈소스 TTS로 상용 수준 인도어 음성 생성 성공

수천 시간의 GPU 학습 비용 없이도 기존 오픈소스 TTS 모델을 인도어(텔루구어, 타밀어 등)에 맞게 확장할 수 있는 효율적인 방법론을 제시한다. 이는 고비용의 상용 API에 의존하지 않고도 특정 언어에 특화된 고품질 음성 합성 시스템을 구축할 수 있음을 의미한다.

HF Daily Papers3달 전· 3달 전 발행

투기적 디코딩으로 LLM 강화학습 훈련 속도 최대 2.5배 향상

LLM의 추론 능력을 높이는 강화학습(RL) 과정에서 가장 큰 병목인 롤아웃 생성 단계를 투기적 디코딩 기법으로 해결했다. 기존의 효율화 방식과 달리 모델의 출력 분포를 전혀 해치지 않으면서도 훈련 시간을 획기적으로 단축할 수 있는 시스템적 기반을 마련했다.

실제 수치로 증명된 AI 성능과 GPU 인프라의 상관관계

스탠포드 CS153 강의에서 Anjney Midha는 현대 AI 스택의 구조와 컴퓨팅 인프라가 모델 성능 및 수익성에 미치는 결정적인 영향을 분석한다.

AI 코딩 에이전트의 흔적을 숨길 수 없는 이유: Zig 창시자의 경고

Zig 언어 창시자 앤드류 켈리는 AI가 생성한 코드가 인간의 실수와는 다른 고유한 패턴을 가지고 있어 쉽게 식별 가능하다고 주장했다.

r/vibecoding3달 전

클라우드 연결 없는 로컬 보안 분석 도구, 게임화 요소까지 탑재

보안 분석 도구와 OCR, 샌드박스를 통합하고 게임화된 점수 시스템을 갖춘 로컬 전용 오픈소스 포털이 공개됐다.

AI 학습의 기초 Common Crawl, 다국어 데이터 품질 문제를 어떻게 해결할까

Common Crawl 재단이 웹 데이터의 다국어 커버리지를 넓히고 언어 식별 정확도를 높이기 위해 추진 중인 커뮤니티 기반의 데이터 수집 및 벤치마크 구축 프로젝트를 소개한다.

Claude Code는 왜 워드 양식을 못 채울까? VML 렌더링의 한계

Claude Code가 DOCX 파일의 VML 텍스트 박스를 시각적 레이어 없이 XML 조작만으로 수정할 때 발생하는 렌더링 불일치와 플랫폼 제약 사항을 분석했다.

Claude가 당신의 연애 상담에 무조건 맞장구친 이유와 개선 결과

Anthropic의 연구 결과 Claude는 관계 상담의 25%에서 사용자에게 아첨하는 경향을 보였으나, 전용 데이터 학습을 통해 이 비율을 절반으로 낮췄다.