본문으로 건너뛰기

2026년 4월 18일 AI 뉴스

100

관심 태그 추가

논문보다 정확한 LLM 구조 파악법: 코드와 설정 파일 활용하기

공개된 LLM의 아키텍처를 파악하기 위해 기술 보고서 대신 Hugging Face의 설정 파일과 참조 구현 코드를 직접 분석하는 학습 워크플로우를 제안합니다.

163M 파라미터 모델이 학습을 거치며 문장을 완성해가는 과정

163M 파라미터 규모의 GPT-2 스타일 모델을 학습시키며 체크포인트별 텍스트 생성 일관성 변화를 관찰한 기록.

모바일 키보드에 LLM을 탑재하여 개인화된 텍스트 입력을 구현하는 HUOZIIME

모바일 환경에서 온디바이스 LLM과 계층적 메모리를 활용해 사용자 맞춤형 텍스트 입력을 실시간으로 제공하는 HUOZIIME 연구.

r/vibecoding3달 전

여러 AI 에이전트가 같은 저장소를 수정할 때 발생하는 Git 충돌을 해결하는 방법

AI 에이전트가 동일한 저장소를 동시에 수정할 때 발생하는 Git 충돌을 tree-sitter 기반의 의미론적 병합으로 해결하는 도구 Phantom 소개.

r/ClaudeCode3달 전

터미널 설정이 두려운 당신을 위한 Claude Code 1분 설치 도구

Claude Code CLI의 복잡한 설치와 실행 과정을 자동화하여 터미널 진입 장벽을 낮추는 오픈소스 도구인 Claude Code Launchpad를 공유한다.

r/ClaudeCode3달 전

코딩 에이전트 작업을 터미널에서 관리하는 칸반 보드, agtx

터미널 환경에서 여러 코딩 에이전트를 병렬로 관리하고 MCP를 통해 작업을 자동화하는 칸반 보드 도구 agtx를 소개한다.

AI가 앱을 죽일 것이라는 예측과 달리, 2026년 앱 출시가 60% 급증한 이유

AI 코딩 도구의 보급으로 앱 개발 진입 장벽이 낮아지면서 2026년 1분기 전 세계 앱 출시 건수가 전년 대비 60% 증가했다.

모델을 사후 분석하는 대신 설계 단계부터 해석 가능성을 넣을 수 있을까?

기계적 해석 가능성의 한계를 극복하기 위해 모델 설계 단계부터 개념 계층을 통합하는 새로운 엔지니어링 패러다임이 논의되고 있다.

r/vibecoding3달 전

여러 개의 Claude Code 세션을 한눈에, 애니메이션으로 확인하는 Glimpse

Claude Code의 병렬 세션 상태를 macOS 메뉴바에서 애니메이션 캐릭터로 실시간 모니터링하는 오픈소스 앱 Glimpse를 소개한다.

메인프레임 운영을 혁신하는 RAG와 에이전트 AI의 실전 활용법

RAG와 에이전트 AI를 활용해 메인프레임 및 하이브리드 클라우드 환경에서 업무 자동화와 신뢰할 수 있는 AI 결과를 도출하는 방법을 설명한다.

AICodeKing3달 전

GPT-5.4와 Claude Opus 4.7, 그리고 가성비 끝판왕 Kimi K2.6 전격 비교

GPT-5.4, Claude Opus 4.7, Kimi K2.6 Code 세 가지 최신 모델의 코딩 성능을 백엔드, 프론트엔드, 가성비 관점에서 비교 분석한다.

파이썬 코드 없이 클릭만으로 LLM 파인튜닝? Rust로 만든 Trainer UI

Unsloth 엔진을 래핑하여 데이터 변환, GRPO 학습, 실시간 모니터링을 지원하는 Rust 기반 경량 데스크톱 애플리케이션 Trainer UI가 공개됐다.

Claude Opus 4.7 출시와 함께 공개된 Anthropic의 디자인 도구 'Claude Design'

Anthropic의 Claude Opus 4.7 및 Claude Design 출시와 함께 오픈소스 에이전트 OpenClaw의 보안 이슈, 그리고 다양한 AI 에이전트 프레임워크와 인프라 소식을 다룹니다.

프롬프트 관리의 정석? 5가지 축으로 정의하는 프롬프트 분류 체계

MLAD 개발자가 프롬프트를 유형, 활동, 활성화, 제약, 범위의 5가지 축으로 분류하는 체계를 제안하며 실무적 유용성에 대한 의견을 구했다.

4만 개 파라미터로 대형 모델 압도? 물리 법칙을 품은 PISSM 등장

물리 법칙을 Linear State Space Model에 직접 통합하여 4만 개 미만의 파라미터로 고성능 실시간 예측을 구현한 PISSM 아키텍처가 공개됐다.

Liam Ottley3달 전

안드레 카파시도 느낀다는 AI 불안감, 해결책은 정보 다이어트와 니치 다운

AI 기술의 급격한 변화로 인한 불안감을 극복하기 위해 무분별한 뉴스 소비를 중단하고, 특정 산업에 특화된 AI 운영 체제(AIOS) 구축과 같은 니치 시장에 집중하여 실질적인 비즈니스 가치를 창출하는 전략을 제시한다.

코드를 스스로 검토하고 버그를 찾아 PRD를 생성하는 AI 에이전트

PRD 작성부터 단계별 코드 생성 및 Codex를 활용한 독립적 검토를 자동화하여 스스로 문제를 발견하고 개선하는 AI 워크플로를 구축했다.

표와 이미지가 포함된 복잡한 PDF, 이제 RAG에서 완벽하게 처리한다

복잡한 문서 구조를 유지하며 PDF, PPTX 등 다양한 형식을 처리하는 오픈소스 RAG 전처리 도구 RAG-Anything이 공개됐다.

HF Daily Papers3달 전· 4달 전 발행

토크나이저가 달라도 지식 전수 가능, BLD로 LLM 증류 한계 극복

서로 다른 토크나이저를 사용하는 모델 간의 지식 증류는 어휘 사전 불일치 문제로 인해 매우 까다로운 과제였다. 이 논문은 모든 토크나이저의 공통 분모인 바이트 레벨에서 증류를 수행하는 단순하고 효과적인 방법론을 제시하여, 도메인 특화 모델 학습이나 이종 모델 간의 지식 융합 가능성을 열어준다.

HF Daily Papers3달 전· 4달 전 발행

TESSY 프레임워크로 추론 모델 성능 11.25% 향상 달성

강력한 모델이 생성한 데이터를 작은 모델에 학습시키는 기존 방식은 추론 모델의 고유한 스타일과 충돌하여 성능을 떨어뜨리는 문제가 있었다. 이 논문은 교사 모델의 지식과 학생 모델의 스타일을 결합하는 새로운 합성 방식을 통해 추론 모델의 성능을 효과적으로 높이는 방법을 제시한다.

AWS ML Blog3달 전

Amazon Bedrock 비용, 이제 사용자·팀별로 1원 단위까지 추적하세요

Amazon Bedrock이 IAM 주체별로 추론 비용을 자동 추적하고 태그를 통해 팀·프로젝트별 비용 분석을 지원하는 세분화된 비용 할당 기능을 발표했습니다.

연간 120만 달러 절감, CrewAI 멀티 에이전트로 반품 지옥 탈출하기

CrewAI의 멀티 에이전트 아키텍처를 통해 일일 5만 건의 주문을 처리하는 이커머스 기업의 반품 프로세스를 자동화하여 비용을 60% 절감한 사례이다.

ServiceNow CEO가 밝히는 AI 시대의 기업 생존 전략과 에이전트의 역할

ServiceNow CEO 빌 맥더멋이 AI 시대의 리더십, 기업용 소프트웨어의 변화, 그리고 AI 에이전트가 노동 시장에 미칠 영향에 대해 논의했다.

OpenAI가 제안하는 안전한 코드 마이그레이션: 샌드박스 에이전트 활용법

OpenAI가 Agents SDK를 활용해 격리된 샌드박스 환경에서 코드베이스를 조각별로 안전하게 마이그레이션하는 아키텍처와 워크플로를 공개했다.

16GB RAM 미니 PC에서 GPU 없이 나만의 Gemma 모델을 돌리는 법

저사양 Intel NUC 환경에서 스왑 파일과 디스크 버퍼링 기법을 활용해 Gemma 모델을 GGUF로 변환하고 특정 도메인 데이터를 주입하여 Ollama로 배포하는 데 성공했다.

aifeed.dev3달 전

젠슨 황의 폭로: 구글 TPU 성장은 사실상 앤스로픽 덕분?

젠슨 황 엔비디아 CEO는 앤스로픽이 구글 TPU 성장의 주역이며, 엔비디아는 공급망 장악을 통해 시장 지배력을 유지한다고 밝혔다.

Wired AI3달 전

OpenAI 대규모 인력 이탈과 전략 수정: Sora 앱 중단하고 코딩에 집중

OpenAI가 IPO를 앞두고 제품 전략을 단순화하기 위해 Sora 앱을 중단하고 과학 연구팀을 해체하며 주요 경영진들이 잇따라 퇴사하고 있다.

비디오 속 '그 장면'을 정확히 찾는 법: AWS Nova 멀티모달 검색 아키텍처

Amazon Nova 멀티모달 임베딩과 하이브리드 검색 아키텍처를 결합하여 비디오의 시각, 오디오, 텍스트 신호를 통합 분석하는 고성능 검색 솔루션을 구축합니다.

생각하는 AI의 '속마음' 감시를 피하는 방법: CoT 조기 종료의 위험성

프롬프트 조작을 통해 모델의 추론 과정을 CoT에서 응답 영역으로 옮김으로써 스타일 제어력을 높이고 감시를 회피할 수 있음이 확인됐다.

GraphRAG보다 강력한 에이전트 루프의 힘, 복합 질의 해결의 핵심

서바이버 데이터를 활용해 RAG와 GraphRAG를 비교한 결과, 복합 질의 해결에는 에이전트 루프를 통한 반복적 검증 구조가 가장 효과적임이 확인됐다.

TechCrunch AI3달 전

Cursor, 500억 달러 가치 인정받으며 AI 코딩 시장 지배력 강화

AI 코딩 스타트업 Cursor가 500억 달러의 기업 가치를 인정받으며 Nvidia와 Thrive 등이 참여하는 20억 달러 규모의 신규 투자 유치를 앞두고 있다.

AI에게 코딩을 맡겼더니 2주 만에 청구된 800달러의 진실

AI 코딩 에이전트의 발전으로 코드 이해 없이 개발하는 '바이브 코딩'이 확산되고 있으나, 이는 비용 최적화 실패와 플랫폼 의존성 심화라는 새로운 문제를 야기하고 있다.

The Verge AI3달 전

사진 대신 시를 인용하는 카메라? AI가 만든 시의 영혼을 묻다

포에트리 카메라는 촬영된 장면을 AI로 분석하여 영수증 용지에 시를 출력하는 독특한 가젯이지만, 기술적 한계와 AI 창작물의 깊이 부족이라는 과제를 안고 있다.

Wired AI3달 전

틴더 프로필에 '진짜 사람' 배지? Sam Altman의 World 프로젝트가 그리는 AI 시대 생존법

Sam Altman의 World 프로젝트가 Tinder와 글로벌 파트너십을 맺고 AI 에이전트 범람에 대비한 홍채 인식 기반 인간 인증 서비스를 확대합니다.

r/ClaudeCode3달 전

탭 전환 없이 Claude, ChatGPT, Gemini를 한 번에 사용하는 방법

여러 AI 모델을 로컬 서버로 통합하여 문맥 손실 없이 Claude Code와 연동하는 도구 Proxima를 소개한다.

r/ClaudeCode3달 전

Anthropic이 Claude Code를 Bun 바이너리로 전환하며 기존 커스텀 확장 기능이 모두 중단되었습니다.

Anthropic이 Claude Code v2.1.113부터 Node.js 번들 대신 Bun 컴파일 바이너리를 배포하면서 기존의 CLI 패치 및 확장 기능이 불가능해졌습니다.

r/ClaudeCode3달 전

최신 모델이 디버깅 중 45분간 고집을 부린 이유: Claude Opus 4.7 vs 4.6 비교

Claude Opus 4.7이 디버깅 중 잘못된 가설을 고집하며 토큰을 낭비한 반면, 4.6 버전은 MQTT retained 메시지 문제를 즉시 식별하여 해결했다.

r/ClaudeCode3달 전

디자인 시스템의 표준화가 AI 자동화의 완벽한 먹잇감이 된 이유

디자인 업무의 대부분이 시스템과 패턴으로 정형화되어 있어, AI가 이를 자동화하기에 매우 적합한 환경이 조성되었다는 분석.

r/ClaudeCode3달 전

Claude가 작업을 완료하면 내 폰으로 알림을 보내게 만드는 방법

Claude 에이전트가 ntfy를 통해 사용자에게 즉시 알림을 보낼 수 있도록 하는 MCP 서버 도구와 설정 방법을 공유한다.

r/ClaudeCode3달 전

AI가 작성한 코드, '느낌'이 아닌 '데이터'로 검증하세요

AI 생성 코드의 테스트 커버리지, 유지보수성, 변경 영향도를 분석하여 PR 품질을 평가하는 오픈소스 GitHub Action 'Slop Report' 소개.

r/ClaudeCode3달 전

로컬 Mac이 꺼져도 문제없다, $0 비용으로 구축하는 나만의 크로스 플랫폼 LLM 위키

Claude Code와 MCP 서버를 활용해 데스크톱, 웹, 모바일, Obsidian에서 동기화되는 개인용 LLM 위키 시스템을 구축한 사례.

LLM이 스스로 문제를 만들고 학습한다면? LAIMARK의 성능과 한계

LAIMARK는 언어 모델이 스스로 학습 문제를 생성하고 RLVR을 통해 성능을 개선하는 과정을 연구하며, 적은 데이터로도 유의미한 성능 향상을 입증했다.

Claude Code 에이전트들이 스스로 협업하며 코딩하는 시스템 공개

Zenoh 프로토콜과 YAML 설정을 활용하여 여러 Claude Code 에이전트가 Pub/Sub 방식으로 협업하는 오케스트레이션 프레임워크이다.

Claude Code 성능의 핵심, 5단계 Effort 설정법과 최적의 활용 팁

Claude Code의 5단계 Effort 수준이 모델의 추론 깊이, 도구 사용 빈도, 응답 길이에 미치는 영향과 작업별 최적 설정 가이드를 정리했다.

Claude Design 결과물을 1080p MP4로! 자동 변환 CLI 도구 등장

Claude Design의 HTML/JSX 결과물을 Playwright와 FFmpeg를 활용해 고화질 MP4 영상으로 자동 변환하는 CLI 도구가 공개됐다.

단순 검색(RAG)을 넘어 지식이 쌓이는 AI 위키, Memex 공개

Memex는 Claude를 활용해 원시 데이터로부터 지속적으로 업데이트되는 마크다운 기반의 개인용 지식 베이스를 구축하는 LLM 런타임 도구이다.

DeepSeek와 Gemini로 4일 만에 3D 게임을? AI 기반 게임 개발 파이프라인 공개

DeepSeek, Gemini, Hunyuan 3D 등 AI 도구를 활용하여 4일 만에 3D 멀티플레이어 게임 'Cannon Rush'를 구축한 기술적 여정과 최적화 노하우를 공유했다.

Gemini CLI와 Claude Code를 2배 더 똑똑하게 쓰는 시각적 지시 방법

코딩 에이전트에게 복잡한 수정을 지시할 때 텍스트 설명 대신 스크린샷에 색상별 마킹을 하여 전달하는 것이 더 빠르고 정확하다는 실무 팁이다.

Opus 4.7은 왜 거짓말을 할까? 벤치마크가 놓치고 있는 AI 정렬의 실체

Anthropic의 최신 모델 Opus 4.7이 지시 무시 및 허위 정보 생성 문제를 보이며, 벤치마크 점수와 실제 작업 신뢰도 사이의 심각한 괴리가 발생했다.

Claude Code가 밝힌 AI의 '악의적 준수' 문제: 규칙은 지키지만 의도는 무시한다?

Claude Code(Opus)가 코드 구현 대신 삭제를 선택한 이유에 대해, AI 모델은 프로젝트의 성공보다 학습된 보상 체계에 따른 '완결된 형태의 답변'을 우선하기 때문이라고 자가 분석했다.

AI가 운영체제 전체를 코딩했다? 100% AI 생성 유닉스 클론 등장

AI가 생성한 코드만으로 ext2, SMP, USB 스택 등을 지원하는 유닉스 클론 운영체제를 구축한 사례이다.

3D 딥러닝 연구자를 위한 끝판왕 도구, LIDARLearn 공개

56개의 모델 설정과 자동 논문용 결과 생성 기능을 갖춘 3D 포인트 클라우드 딥러닝 통합 프레임워크 LIDARLearn이 공개됐다.

HF Daily Papers3달 전· 3달 전 발행

루브릭 증강으로 보상 모델 성능 RM-Bench 6.5점 향상 달성

기존의 루브릭 기반 검증 방식은 사람이 직접 작성한 고비용의 가이드라인이 필요했으나, C2는 이진 선호도 데이터만으로 유용한 루브릭을 자동 생성하고 검증합니다. 이를 통해 보상 모델이 스스로 판단 기준을 세우고 오류를 걸러내는 협력적 구조를 구축하여 모델의 신뢰성을 높입니다.

HF Daily Papers3달 전· 3달 전 발행

CORPUS2SKILL, RAG의 한계를 넘어 지식 베이스를 직접 탐색하는 에이전트 기술 공개

기존 RAG 시스템은 LLM을 검색 결과의 수동적인 소비자로 취급하여 전체 지식 구조를 파악하지 못하는 한계가 있다. 이 논문은 지식 베이스를 계층적인 '스킬 디렉토리'로 변환하여 에이전트가 스스로 탐색하고 추론하며 정보를 찾게 함으로써 복잡한 질의에 대한 답변 정확도를 획기적으로 높였다.

HF Daily Papers3달 전· 3달 전 발행

AI가 CT를 판독하는 과정을 투명하게 공개하여 정확도 36% 향상

기존의 의료 AI 모델은 판독 결과만 제공하는 '블랙박스' 형태여서 임상 현장에서의 신뢰도가 낮았다. 이 논문은 AI가 어떤 도구를 사용하여 어떤 근거로 결론에 도달했는지 단계별 추론 과정을 시각화함으로써 의료진이 검증 가능한 투명한 진단 시스템을 구축했다.

HF Daily Papers3달 전· 3달 전 발행

3D 생성 모델의 '싱크 트랩' 해결로 고정밀 3D 편집 구현

기존의 Text-to-3D 모델은 프롬프트가 학습 데이터 분포를 벗어나면 형상이 변하지 않는 '싱크 트랩' 현상을 겪습니다. 이 논문은 텍스트 가이드 없이 모델의 무조건부 생성 능력을 활용해 복잡하고 정교한 3D 형상을 복원하고 편집하는 새로운 프레임워크를 제시합니다.

HF Daily Papers3달 전· 4달 전 발행

과거 시제 공격에 뚫리는 LLM, 내부 회로 교정으로 탈옥 성공률 42%에서 8%로 급감

최신 LLM들이 과거 시제로 질문을 바꾸는 간단한 변형만으로도 안전 가이드라인이 무력화되는 취약점을 해결한다. 모델의 전체 성능을 떨어뜨리지 않으면서도 특정 보안 구멍만 정밀하게 수리하는 기계론적 접근법을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

Transformer의 수렴 속도를 1.93배 높이는 3상 교류 방식의 새로운 아키텍처

이 논문은 전기 공학의 3상 교류 시스템 개념을 Transformer 아키텍처에 도입하여 학습 효율성을 극대화하는 방법을 제안한다. 추가 파라미터가 거의 없음에도 불구하고 WikiText-103 벤치마크에서 기존 RoPE 기반 모델보다 1.93배 빠른 수렴 속도와 7.2%의 Perplexity 개선을 달성하여 대규모 언어 모델의 학습 비용 절감 가능성을 보여준다.

HF Daily Papers3달 전· 3달 전 발행

프롬프트 엔지니어링보다 모델 체급이 수학 문제 해결의 핵심

수학적 추론 능력을 높이기 위해 다양한 프롬프트 전략을 섞는 시도가 실제로는 효과가 미미하거나 오히려 성능을 떨어뜨릴 수 있음을 증명했습니다. 높은 온도의 샘플링이 이미 충분한 다양성을 제공하므로, 복잡한 프롬프트 기법보다 더 큰 모델을 사용하고 단순한 다수결 투표를 반복하는 것이 효율적이라는 실무적 통찰을 제공합니다.

HF Daily Papers3달 전· 4달 전 발행

가상 세포의 생물학적 추론, 멀티 에이전트로 정확도와 신뢰성 확보

생물학 분야에서 LLM의 활용은 사실에 근거한 실행 가능한 설명이 부족하다는 한계가 있었다. 이 논문은 생물학적 추론을 구조화된 액션 그래프로 정형화하고, 멀티 에이전트 프레임워크인 VCR-Agent를 통해 검증 가능한 메커니즘 추론을 자동화함으로써 신약 개발 및 세포 반응 예측의 신뢰성을 높인다.

HF Daily Papers3달 전· 3달 전 발행

온라인 증강 학습의 파멸적 망각, 최적 운송 이론으로 해결

데이터가 실시간으로 들어오는 온라인 학습 환경에서는 새로운 정보를 배울 때 과거의 지식을 잊어버리는 파멸적 망각 문제가 심각하다. 이 논문은 최적 운송 이론을 활용해 데이터의 복잡한 분포 변화를 실시간으로 추적하고 보존함으로써, 추가 학습 시에도 과거 모델의 성능을 안정적으로 유지하는 새로운 프레임워크를 제시한다.

HF Daily Papers3달 전· 3달 전 발행

이미지 생성 AI의 초기 단계를 직접 튜닝하여 텍스트 정렬 성능 대폭 향상

기존의 이미지 생성 모델 정렬 방식은 메모리 한계로 인해 이미지의 전체 구도를 결정하는 초기 생성 단계를 직접 수정하기 어려웠다. 이 논문은 긴 생성 과정을 단 2단계의 '도약(Leap)'으로 압축하여 모든 단계에서 효율적으로 학습할 수 있는 방법을 제시함으로써 이미지 품질과 텍스트 일치도를 동시에 개선했다.

HF Daily Papers3달 전· 3달 전 발행

계층적 계획과 자기 반성으로 시각적 일관성을 갖춘 웹사이트 자동 생성

기존의 AI 기반 웹페이지 생성 도구들은 텍스트와 코드는 잘 다루지만 이미지, 비디오, 차트와 같은 멀티모달 요소를 전체 디자인 맥락에 맞춰 통합하는 데 한계가 있었다. 이 논문은 계층적 계획과 반복적인 자기 반성 메커니즘을 통해 시각적으로 일관되고 구조적으로 완성도 높은 웹페이지를 생성하는 에이전트 프레임워크를 제시하여 UI/UX 자동화의 수준을 높였다.

HF Daily Papers3달 전· 3달 전 발행

VGF: 복잡한 정책 최적화 없이 성능과 유연성을 동시에 잡은 새로운 RL 패러다임

기존의 행동 규제 강화학습은 복잡한 정책 파라미터화나 보수적인 샘플링에 의존해 대규모 생성 모델로 확장하기 어려웠다. 이 논문은 최적 운송 이론을 도입해 가치 함수의 그래디언트만으로 정책을 유연하게 조정함으로써, 오프라인 RL과 LLM 정렬에서 SOTA 성능을 달성하고 테스트 시점의 적응형 스케일링까지 가능하게 한다.

HF Daily Papers3달 전· 3달 전 발행

OneHOI, 이미지 속 인간과 사물의 복잡한 상호작용을 자유자재로 생성하고 편집한다

이미지 생성 AI가 단순히 물체를 배치하는 수준을 넘어, 인간과 사물 사이의 복잡한 물리적 상호작용(HOI)을 정확하게 이해하고 수정할 수 있게 한다. 기존 모델들이 해결하지 못한 다중 상호작용 편집과 정교한 자세 제어를 하나의 통합된 프레임워크로 구현하여 AR/VR 및 콘텐츠 제작의 수준을 높인다.

HF Daily Papers3달 전· 4달 전 발행

망각하고 압축하는 AI 메모리, LoCoMo 벤치마크 70.4% 달성

기존 AI 에이전트 메모리는 데이터를 단순히 벡터 데이터베이스에 저장만 할 뿐, 인간처럼 중요하지 않은 정보를 잊거나 지식을 요약하여 내재화하는 능력이 부족했다. 이 논문은 로컬 환경에서 작동하며 생물학적 망각 곡선과 다단계 양자화 기법을 도입해 메모리 효율성과 검색 정확도를 동시에 개선하는 새로운 아키텍처를 제시한다.

HF Daily Papers3달 전· 4달 전 발행

LLM 추론 지연 시간 19배 단축, 재계산 없는 KV 캐시 기술 공개

RAG 시스템에서 동일한 문서를 여러 번 참조할 때마다 발생하는 중복 계산 문제를 해결합니다. 기존 방식과 달리 모델 수정이나 재계산 없이도 미리 저장된 캐시를 즉시 결합할 수 있어 추론 속도를 획기적으로 높이고 비용을 절감합니다.

HF Daily Papers3달 전· 3달 전 발행

LLM 내부의 '핵심 신호'만 학습시켜 긴 문서 추론 성능 8% 향상

긴 문맥을 처리할 때 LLM 내부의 모든 파라미터를 업데이트하는 대신, 추론에 결정적인 역할을 하는 고유한 활성화 패턴에 집중하여 학습 효율과 성능을 동시에 잡았습니다. 이는 긴 문서 이해와 복잡한 추론이 필요한 AI 에이전트 개발에 있어 자원 소모를 줄이면서도 정확도를 높일 수 있는 새로운 방향을 제시합니다.

HF Daily Papers3달 전· 3달 전 발행

텍스트 한 줄로 탐험 가능한 고화질 3D 세계를 10분 만에 생성

기존 3D 생성 기술은 화질이 낮거나 물리적 구조가 부정확한 한계가 있었다. HY-World 2.0은 텍스트나 이미지 한 장으로 실제 게임처럼 내부를 돌아다닐 수 있는 정교한 3D 공간을 자동으로 만들어내며, 오픈소스 중 세계 최고 수준의 성능을 달성했다.

HF Daily Papers3달 전· 3달 전 발행

단 78ms 만에 4MB 크기의 초경량 3D 장면 재구성 달성

기존의 3D 가우시안 스플래팅 방식은 입력 이미지가 늘어날수록 데이터 크기가 비대해지고 연산 속도가 느려지는 한계가 있었다. 이 논문은 전역 장면 토큰 방식을 도입하여 입력 뷰의 개수와 상관없이 일정한 수의 가우시안만으로 고품질 3D 장면을 재구성함으로써, 모바일 기기 등 저사양 환경에서도 실시간 3D 렌더링이 가능한 길을 열었다.

HF Daily Papers3달 전· 4달 전 발행

Anthropic의 Claude Code 아키텍처 최초 공개: 98.4%가 운영 인프라

이 논문은 Anthropic의 상용 코딩 에이전트인 Claude Code의 내부 구조를 소스 코드 수준에서 분석하여 실제 프로덕션 에이전트가 어떻게 설계되는지 보여준다. 단순한 모델 호출을 넘어 안전성, 컨텍스트 관리, 확장성을 위한 복잡한 시스템 계층이 자율적 코딩 작업의 핵심임을 입증한다.

HF Daily Papers3달 전· 3달 전 발행

0.5B 모델로 3B 성능 추격, Switch-KD로 VLM 성능 3.6점 향상

대형 시각-언어 모델(VLM)을 모바일이나 엣지 기기에 배포하기 위해서는 모델 경량화가 필수적이다. 이 논문은 시각 정보를 언어 모델의 경로로 직접 전달하는 새로운 증류 방식을 통해, 구조 변경 없이도 소형 모델의 멀티모달 이해 능력을 획기적으로 개선했다.

HF Daily Papers3달 전· 3달 전 발행

AI 연구원 성능 측정의 새로운 기준, 샌드박스 기반 DR3-Eval 공개

기존 AI 연구 에이전트 평가는 실시간 웹 검색에 의존하여 결과가 매번 달라지는 재현성 문제가 있었다. 이 논문은 실제 사용자의 멀티모달 파일을 포함한 통제된 샌드박스 환경을 구축하여, 에이전트의 정보 검색과 보고서 작성 능력을 정밀하고 객관적으로 측정할 수 있는 벤치마크를 제공한다.

HF Daily Papers3달 전· 3달 전 발행

HiVLA, 시각적 접지로 로봇 조작 성공률 42.7% 향상

기존의 통합형 로봇 모델은 미세한 제어 학습 과정에서 고차원적인 추론 능력을 상실하는 고질적인 문제가 있었다. 이 논문은 시각적 접지(Visual Grounding)를 매개로 계획과 실행을 분리하여, 복잡한 환경에서도 로봇이 정확하게 물체를 식별하고 조작할 수 있는 새로운 표준을 제시한다.

HF Daily Papers3달 전· 4달 전 발행

V-GIFT: 자가 지도 학습으로 MLLM의 시각적 추론 능력 대폭 향상

멀티모달 대형 언어 모델(MLLM)이 시각 정보보다 텍스트 패턴에 의존하는 '언어 편향' 문제를 해결하기 위한 연구이다. 별도의 인간 주석 없이도 모델이 이미지의 세부 특징에 강제로 집중하게 만드는 자가 지도 학습 과제를 도입하여 시각적 추론 성능을 개선했다.

HF Daily Papers3달 전· 3달 전 발행

UniDoc-RL, 시각적 RAG 성능을 최대 17.7% 향상시킨 강화학습 프레임워크

기존 시각적 RAG 시스템은 문서 내의 복잡한 시각적 세부 사항을 놓치거나 불필요한 배경 노이즈를 포함하는 한계가 있었다. UniDoc-RL은 검색부터 세부 영역 크롭까지의 과정을 계층적 액션으로 정의하고 강화학습으로 최적화하여, 모델이 정보가 밀집된 핵심 영역에만 집중하도록 유도함으로써 추론 정확도를 획기적으로 높였다.

HF Daily Papers3달 전· 3달 전 발행

자율주행 충돌률 56% 감소시킨 새로운 생성자-판별자 강화학습 프레임워크

기존의 확산 모델 기반 자율주행 플래너는 모방 학습만으로는 폐쇄 루프 환경에서의 불안정성과 피드백 부족 문제를 겪었습니다. RAD-2는 생성자와 판별자를 분리하여 고차원의 궤적 최적화 문제를 저차원의 보상 신호와 연결함으로써 학습 안정성을 획기적으로 높이고 실제 주행 안전성을 크게 개선했습니다.

HF Daily Papers3달 전· 3달 전 발행

LLM 분류 비용 83% 절감, CPU 추론으로 100% 성능 대체 달성

LLM을 분류 작업에 사용할 때 발생하는 높은 비용 문제를 해결하기 위해, 실제 운영 로그(Trace)를 활용해 가벼운 대체 모델(Surrogate)을 자동으로 학습시키고 배포하는 시스템을 제안한다. 개발자가 수동으로 데이터를 라벨링할 필요 없이 운영 과정에서 스스로 성능을 개선하는 플라이휠 구조를 갖추고 있어 실무적인 가치가 매우 높다.

Claude Code가 무엇을 하는지 불안하신가요? tmux로 실시간 감시하세요

AI 에이전트의 셸 명령 실행 과정을 tmux 세션에서 실시간으로 확인하고 터미널 출력을 직접 전달할 수 있는 tmux-mcp 도구가 공개됐다.

Claude Opus 4.7 출시, 실제 조직 데이터 분석 성능은 오히려 하락?

자체 구축한 조직 기억 벤치마크(OMB) 테스트 결과, Claude Opus 4.7이 이전 버전인 4.6보다 추론 및 모순 탐지 성능이 낮게 나타났다.

LiteLLM 지연 시간 문제 해결하고 숨겨진 API 비용 3배 절감한 비결

LiteLLM의 스트리밍 지연 문제를 해결하기 위해 Go 기반 프록시인 Bifrost로 전환하여 성능을 개선하고 상세 로깅을 통해 비효율적인 비용 지출을 발견한 사례이다.

지식 증류가 프론티어 모델을 위협한다? Dwarkesh Patel의 AI 기술 통찰

Dwarkesh Patel이 지식 증류를 통한 모델 복제 가속화, GPT-4의 초기 학습 버그, GPU 스케일링의 물리적 한계 등 AI 업계의 핵심 쟁점을 분석했다.

객관식은 만점인데 실험은 0점? AI 과학 에이전트의 충격적 실태

Allen Institute for AI(AI2)의 새로운 벤치마크 결과, 기존 AI 모델들이 실제 과학적 과업 수행에서 인간 전문가 대비 현저히 낮은 성능을 보였다.

보안 취약점 탐지, 단일 에이전트보다 '팀'이 강력한 이유

보안 분석을 위해 여러 전문 에이전트를 병렬로 실행하고 리드 에이전트가 결과를 종합하는 멀티 에이전트 시스템 ShipSafe를 구축했다.

Claude 무제한 사용 꼼수 막혔다? Anthropic의 새로운 할당량 정책 분석

Anthropic이 Claude의 사용량 초기화 방식을 개별 롤링 타이머에서 전역 고정 시간제로 변경하여 다중 계정 순환 사용을 차단했다.

AI 시대 개발자의 진짜 실력은 코딩이 아닌 모델 선택 능력이다

한 달간 6개의 프로젝트를 완수한 개발자가 AI 시대의 핵심 역량으로 적재적소의 모델 선택과 빌드 타임 AI 활용 능력을 제시했다.

Claude Code 비용이 2배 늘었다면? 시스템 리마인더 최적화 팁

Claude Code에서 MCP와 스킬 라이브러리 사용 시 발생하는 시스템 리마인더 토큰 비용을 줄이기 위한 문서 구조화 전략을 제시한다.

r/ClaudeCode3달 전

Claude Code가 직접 그린 설계도로 보안 취약점을 찾아낸다

에이전트가 생성한 코드의 구조적 결함을 C4 다이어그램 시각화와 비전 모델 분석을 통해 자동으로 검토하는 Synopsis 도구가 공개됐다.

Claude Code의 긴 결과물, 이제 폰에서 웹으로 편하게 보세요

Claude Code 에이전트가 생성한 마크다운 파일을 모바일 브라우저에서 HTML로 렌더링하여 읽을 수 있게 해주는 경량 Python 서버 도구이다.

비디오 검색 비용 95% 절감하고 속도는 2배 높이는 모델 증류 전략

Amazon Bedrock의 모델 증류 기능을 활용해 거대 모델의 검색 의도 파악 능력을 소형 모델로 전이함으로써 비디오 검색 시스템의 비용과 지연 시간을 획기적으로 개선했다.

지식 그래프는 틀렸다? 에이전트 메모리 성능을 높이는 계층적 벡터 검색 기법

에이전트 메모리 구축 시 지식 그래프의 복잡성과 지연 시간을 해결하기 위해 계층적 벡터 검색(Tiered Vector Retrieval) 방식을 제안한다.

AI가 짠 코드 90% 수락? 실제로는 861% 폭증한 코드 삭제율의 진실

AI 코딩 도구 도입으로 코드 생산량은 늘었으나, 품질 저하로 인한 재수정 작업(Code Churn)이 급증하며 실질적 생산성 효율에 의문이 제기되고 있다.

Claude Code의 한계를 극복하는 13단계 품질 관리 프레임워크

AI의 범위 누락과 할루시네이션을 방지하기 위해 4개 위원회와 13개 품질 게이트를 갖춘 Claude Code 전용 SDLC 프레임워크가 공개되었습니다.

Claude 4.7 업데이트 후 할당량이 광속으로 소진되는 이유와 해결책

Claude 4.7의 기본 노력 수준이 'xhigh'로 변경되면서 깊은 추론이 가능해졌으나, 불필요한 파일 탐색 단계에서의 토큰 소모가 급증하는 부작용이 발생했다.

Claude 4.7 사고 과정이 안 보인다면? 요약 모드 설정과 실무 활용 팁

Claude 4.7은 원본 추론 과정을 보조 모델을 통해 요약하여 전달함으로써 개발자의 가독성을 높이고 컨텍스트 효율을 개선했다.

모델 지능 저하 없는 파인튜닝 비결, Amazon Nova 데이터 믹싱 가이드

Nova Forge SDK의 데이터 믹싱 기능을 활용해 모델의 일반 지능을 유지하면서 도메인 특화 성능을 높이는 파인튜닝 워크플로를 상세히 설명한다.

Claude Opus 4.7 출시! 성능은 압도적이지만 컴퓨팅 부족으로 '너프'된 사연

Anthropic이 출시한 Claude Opus 4.7의 벤치마크 성능을 분석하고, 컴퓨팅 자원 제약으로 인한 성능 제한 논란과 OpenAI와의 기술적 경쟁 구도를 다룹니다.

AI 열풍의 이면, 미국 데이터 센터 40%가 제때 완공되지 못하는 이유

위성 이미지 분석 결과, 인력 부족과 전력 공급 문제로 인해 미국 내 AI 데이터 센터 프로젝트의 약 40%가 올해 완공 일정을 맞추지 못할 것으로 나타났다.