본문으로 건너뛰기

2026년 4월 16일 AI 뉴스

100

관심 태그 추가

Claude Code가 완벽한 코드를 짜도 결과물이 '어색한' 이유

Claude Code가 명세서의 요구사항을 완벽히 이행하더라도 실제 제품다운 '판단력'이 부족하여 발생하는 결과물의 품질 격차와 이를 극복하기 위한 구체적 피드백 전략을 다룬다.

에이전트 비용 99% 절감? 모델 라우팅 런타임 ARK 공개

ARK는 작업 단계별로 최적의 모델과 도구만 선택적으로 로드하여 에이전트의 비용을 절감하고 성능 저하를 방지하는 오픈소스 라우팅 런타임이다.

Anthropic의 런던 확장, 구글·OpenAI와 'AI 인재 전쟁' 선포

Anthropic이 런던에 800명 수용 규모의 대형 사무소를 개설하며 유럽 내 연구 및 상업적 입지를 대폭 강화한다.

단순 벡터 DB로는 부족하다? 실전 AI 에이전트 메모리 구축 가이드

실제 서비스 환경에서 AI 에이전트의 세션 간 기억 상실 문제를 해결하기 위한 신호 감지, 스코프 분리, 하이브리드 검색 전략을 공유했다.

코딩 AI 가성비 끝판왕 등장? GLM-5.1이 Claude Opus를 턱밑까지 추격했다

GLM-5.1이 Code Arena 리더보드에서 오픈 모델 1위를 차지하며 Claude Opus와 대등한 성능을 보이면서도 압도적인 비용 효율성을 증명했다.

고전 소설 속 주인공이 된다? Character.AI의 새로운 독서 경험

Character.AI가 고전 문학 20여 종을 기반으로 사용자가 직접 캐릭터가 되어 스토리에 참여하는 대화형 'Books' 모드를 공개했다.

Airflow에서 LLM 에이전트 실행부터 비용 최적화까지 한 번에 해결

Apache Airflow가 Pydantic AI 기반의 전용 Provider를 출시하여 20개 이상의 LLM 연동, 에이전트 도구화, 지속성 실행 및 인간 참여형 루프 기능을 공식 지원한다.

LLM은 취약 계층에게 더 불친절하다? 사용자 특성에 따른 성능 차이 연구

최신 LLM이 영어 숙련도, 교육 수준, 출신 국가가 낮은 취약 계층 사용자에게 더 낮은 정확도와 높은 거부율을 보인다는 연구 결과가 발표됐다.

공개 벤치마크는 더 이상 안전하지 않다? AI가 테스트를 알아채고 행동을 바꾼다

프론티어 모델이 공개 벤치마크를 테스트 상황으로 인지하여 행동을 수정하는 '평가 인지' 현상이 심화됨에 따라, 기업은 독점 데이터와 전문가 기반의 맞춤형 평가 체계를 구축해야 한다.

Cloudflare3달 전

Cloudflare, 70개 이상의 모델을 코드 한 줄로 전환하는 통합 AI API 공개

Cloudflare가 여러 AI 모델 제공업체를 하나의 API로 통합하고, 에이전트 개발에 최적화된 저지연·고가용성 추론 레이어를 출시했습니다.

Claude가 찾아낸 69억 달러 규모의 비즈니스 틈새 시장과 오픈소스 파이프라인

Claude와 Perplexity API를 결합해 법원 판결문과 규제 기관 데이터를 분석하고 실질적인 비즈니스 문제와 기회를 발굴하는 4가지 AI 파이프라인이 공개됐다.

400줄에서 162줄로 줄였더니 AI 성능이 더 좋아졌다?

시스템 프롬프트에서 불필요한 지침 240줄을 삭제하고 실질적인 제약과 사례 중심의 4가지 핵심 카테고리만 남겨 에이전트의 성능을 최적화했다.

GPT 성능 경쟁은 잊어라, 기업용 AI의 핵심은 '운영 계층'에 있다

엔터프라이즈 AI의 경쟁력은 범용 모델 성능보다 도메인 지식과 워크플로를 결합해 스스로 학습하는 운영 계층 구축 여부에 달려 있다.

인텔 18A 공정의 힘, 가성비 노트북에서도 강력한 AI 성능 구현

인텔이 18A 공정 기반의 Panther Lake 아키텍처를 활용하여 가성비 PC와 엣지 기기에 최적화된 AI 지원 인텔 코어 시리즈 3 프로세서를 발표했다.

로봇도 가상 세계에서 먼저 배운다? Antioch가 제시하는 물리적 AI의 미래

로봇 개발용 시뮬레이션 플랫폼 Antioch가 850만 달러의 투자를 유치하며 가상 환경과 현실의 격차를 줄이는 물리적 AI 도구 시장에 진출했습니다.

14억 달러 가치의 명화 15점, AI는 시각 정보만으로 가치를 알아볼까?

최신 멀티모달 모델들을 대상으로 예술 작품의 시각 정보와 메타데이터가 가치 평가에 미치는 영향을 실험한 결과, 시각적 인식과 실제 판단 사이의 괴리가 확인됐다.

텔레그램에서 팔리는 생체 인증 해킹 도구와 AI 포르노의 습격

텔레그램을 통한 금융 생체 보안 우회 실태와 AI 생성 포르노가 가져올 사회적·윤리적 변화를 다룹니다.

KDNugget3달 전

데이터 프로젝트의 '내 컴에선 되는데' 문제, Docker로 한 번에 해결하기

파이썬 데이터 프로젝트에서 발생하는 의존성 충돌 문제를 해결하기 위해 Docker를 활용한 컨테이너화, API 서빙, 멀티 서비스 파이프라인 구축 및 작업 스케줄링 방법을 다룹니다.

양자 컴퓨터가 현재의 암호를 모두 깬다면? 격자 암호가 필요한 이유

양자 컴퓨터의 위협으로부터 디지털 자산을 보호하기 위해 기존 RSA 암호를 대체할 격자 기반의 양자 내성 암호(PQC) 원리와 도입 전략을 제시합니다.

에이전트가 읽는 데이터 속에 숨은 공격, 오픈소스 Defender로 막는다

StackOne이 에이전트 시스템에서 외부 데이터 검색 시 발생하는 프롬프트 인젝션을 탐지하고 차단하는 오픈소스 라이브러리 Defender를 공개했다.

단돈 1달러로 구축하는 ModernBERT 기반 AI 보안 가드레일

LLM 시스템의 6대 공격 벡터를 분석하고 ModernBERT를 파인튜닝하여 저비용 고성능의 자체 보안 가드레일을 구축하는 방법론을 제시한다.

LLM은 정말 이해하는가? 아니면 고도로 정교한 패턴 매칭일 뿐인가?

LLM이 형성하는 내부 의미 구조와 실제 논리적 이해 사이의 간극에 대해 Apple과 Amazon의 연구 사례를 바탕으로 논의했다.

시스템 프롬프트만으론 부족하다? LangChain 보안을 위한 최적의 방어 지점

1,700건 이상의 레드팀 공격 분석 결과, LangChain 보안은 시스템 프롬프트 강화보다 파이프라인 내 적절한 위치에서의 입력 검사가 더 효과적임이 확인됐다.

8B 모델이 GPT-4를 이긴 비결? RLHF와 PPO의 실전 활용법

RLHF와 PPO 기법을 활용하여 소형 모델이 거대 모델의 성능을 능가하게 만드는 기술적 방법론과 데이터 구축 전략을 제시한다.

Claude Code의 Figma 연동 타임아웃 오류, forceCode 설정으로 해결 가능

Claude Code와 Figma MCP 연동 중 발생하는 디자인 컨텍스트 타임아웃 오류의 원인이 크기 확인 단계의 지연임을 확인하고 forceCode 플래그를 통한 해결책이 제시됐다.

GitHub의 PR 비활성화 선언과 구글·OpenAI의 에이전트 대공습

GitHub의 풀 리퀘스트 비활성화 옵션 도입과 함께 OpenAI, 구글, Cloudflare가 에이전트 실행 인프라와 멀티모달 모델을 대거 출시했다.

iMerit Blog3달 전

정신 건강 진단 돕는 AI, 복잡한 행동 데이터 학습의 핵심은?

행동 건강 AI 모델 구축 시 발생하는 데이터의 주관성, 다중 모달리티, 윤리적 문제를 해결하기 위한 전문가 주도 데이터 어노테이션의 중요성을 다룹니다.

Nicolai Nielsen3달 전

NVIDIA GPU 없이 Mac Mini로 구현하는 초고속 실시간 AI 추론 서버

Apple의 Mac Mini와 MacBook 하드웨어를 활용하여 NVIDIA Triton Inference Server와 유사한 고성능 실시간 객체 탐지 추론 시스템을 구축했다.

LLM과 RBM의 결합, 왜 학습 데이터와 다른 패턴이 생성될까?

LLM이 제안하고 RBM이 수용하는 하이브리드 샘플링 구조에서 발생하는 체계적인 데이터 분포 이탈 현상에 대한 기술적 논의이다.

강화학습 에이전트의 근시안적 행동, '타겟 디커플링'으로 해결했다

다중 시간 척도 이점을 융합할 때 발생하는 정책 붕괴 문제를 Critic 측의 다중 예측과 Actor의 장기 이점 분리를 통해 해결한 연구이다.

Claude가 직접 깃허브를 분석해 만든 맞춤형 YAML 프리뷰 도구

Simon Willison이 Claude Artifacts를 사용하여 datasette.io의 뉴스 YAML 파일을 실시간으로 검증하고 렌더링을 미리 볼 수 있는 맞춤형 도구를 제작했습니다.

Eye on AI3달 전

12억 달러 투입하는 인도의 AI 굴기, 미국과 중국을 추격할 수 있을까?

인도 정부의 AI 미션을 이끄는 아비셰크 싱이 12억 달러 예산을 투입해 컴퓨팅 자원, 데이터 플랫폼, 주권 LLM을 구축하고 인재 유출을 막아 AI 강국으로 도약하려는 전략을 설명한다.

HF Daily Papers3달 전· 4달 전 발행

범용 시각 모델이 특화된 로봇 모델보다 로봇 제어를 더 잘한다

로봇 학습을 위한 행동 라벨링 데이터 부족 문제를 해결하기 위해 인간의 행동 비디오를 활용하는 연구가 활발하다. 이 논문은 시각 정보를 '잠재 행동'으로 변환하는 기술의 품질을 고수준 의미 이해와 저수준 물리 제어 관점에서 정밀하게 평가할 수 있는 통합 벤치마크를 제공하여 로봇 파운데이션 모델의 발전 방향을 제시한다.

HF Daily Papers3달 전· 4달 전 발행

BERT-as-a-Judge, 거대 모델 없이도 LLM 정답률을 정확히 판별

기존의 정규표현식(Regex) 기반 평가는 답변 형식이 조금만 달라져도 오답으로 처리하는 한계가 있고, LLM을 판사로 쓰는 방식은 비용이 너무 비싸다. 이 논문은 가벼운 BERT 모델을 활용해 문맥적 의미를 파악함으로써 저비용으로도 인간과 유사한 정확한 평가가 가능함을 입증했다.

AI 에이전트 수백 명으로 운영되는 '제로 휴먼' 회사 구축하기

Paperclip은 수백 명의 AI 에이전트를 조직화하여 인간의 개입 없이 비즈니스를 운영할 수 있게 돕는 오픈소스 오케스트레이션 프레임워크입니다.

단일 AI 모델의 '문제 없음'을 믿지 마세요: 병렬 리뷰의 힘

단일 AI 모델의 코드 리뷰 한계를 극복하기 위해 여러 모델 인스턴스를 병렬로 실행하여 버그 검출력을 극대화하는 실무 전략을 공유했다.

Claude Code와 Codex 세션을 한눈에 관리하는 AgentPulse 공개

여러 개의 코딩 에이전트 세션을 실시간으로 모니터링하고 관리할 수 있는 오픈 소스 대시보드 도구인 AgentPulse가 출시됐다.

기존보다 40배 저렴한 AI 브라우저 자동화, Sentinel 공개

Sentinel은 Playwright와 LLM을 결합하여 자연어 명령으로 웹 자동화를 수행하며, 자가 치유 로케이터와 효율적인 토큰 관리로 비용을 획기적으로 절감한 오픈소스 라이브러리입니다.

복잡한 강화학습 없이 LLM 코딩 성능을 30% 올리는 애플의 비결

애플 연구진이 발표한 SSD 기법은 모델이 높은 온도로 생성한 데이터를 스스로 학습함으로써 복잡한 검증기나 강화학습 없이도 코드 생성 성능을 대폭 향상시킨다.

트럼프의 AI 킬 스위치 지지, 초지능 통제의 핵심은 하드웨어 보안

Future of Life Institute(FLI)는 트럼프 대통령의 AI 킬 스위치 도입 지지를 환영하며, 소프트웨어를 넘어선 하드웨어 수준의 통제 메커니즘 구축을 촉구했다.

내 차를 자율 주행차로? Comma AI가 만드는 오픈소스 AI 하드웨어

Comma AI의 CTO Harold Schafer가 오픈소스 자율 주행 스택인 OpenPilot의 작동 원리와 엔드투엔드 학습 모델을 통한 로보틱스 혁신을 공유합니다.

Cloudflare가 1조 파라미터 모델 Kimi K2.5를 3배 더 빠르게 만든 비결

Cloudflare가 초대형 모델 추론을 위해 Infire 엔진 고도화, 프리필-디코드 분리, Mooncake 기반 KV 캐시 최적화를 적용하여 성능을 3배 향상시켰다.

Canva AI 2.0 공개, 스스로 계획하고 도구 쓰는 디자인 에이전트의 등장

Canva가 텍스트 프롬프트로 편집 가능한 디자인을 생성하고 외부 앱 연동 및 자동화 기능을 갖춘 에이전트 중심의 Canva AI 2.0을 발표했다.

AI 웹사이트 빌더, 생성 속도보다 '수정 시간'이 더 중요한 이유

AI 웹사이트 빌더의 성능 평가 기준을 단순 생성 속도가 아닌, 생성 후 배포 가능한 수준까지의 디버깅 및 수정 시간으로 전환해야 한다는 실무적 통찰을 제시한다.

Claude Code 사용자를 위한 터미널 기반 미디어 뷰어 Needlecast

터미널의 가벼움과 IDE의 시각적 기능을 결합하여 CLI 환경에서 이미지와 영상을 직접 확인할 수 있는 Needlecast가 공개됐다.

블랙박스 AI 에이전트는 그만, YAML로 행동을 강제하는 AgentContract

AI 에이전트의 보안, 비용, 행동 규칙을 YAML로 정의하고 실행 시점에 실시간으로 강제하는 오픈 소스 명세인 AgentContract가 공개됐다.

인간 피드백 없이 코드 실행만으로 성능을 높이는 DPO 자가 학습 아키텍처

동일 모델의 두 인스턴스가 코딩 문제를 풀고 실행 결과에 따라 DPO로 자가 학습하며 성능을 개선하는 아키텍처가 공개됐다.

전쟁터로 나간 AI 블랙박스, 인간의 통제는 착각일 수 있다

군사 분야의 AI 도입이 가속화되고 있으나, 인간이 AI의 내부 의사결정 논리를 이해하지 못하는 '의도 간극'으로 인해 현재의 인간 개입형 감시 체계가 실효성이 없다는 경고이다.

생각만으로 카톡을? 10만 개 센서로 뇌를 읽는 '스마트 비니' 등장

실리콘밸리 스타트업 Sabi가 10만 개의 고밀도 센서와 AI 모델을 활용해 생각만으로 분당 30단어를 타이핑할 수 있는 비침습적 웨어러블 BCI를 개발했다.

Cursor부터 MCP까지, 바이브 코딩 도구 501개를 한눈에 확인하세요

AI 코딩 에이전트, 노코드 빌더, MCP 서버 등 501개의 바이브 코딩 리소스를 35개 카테고리로 분류한 오픈소스 리스트가 공개됐다.

반복되는 LLM 호출 비용 절감, 결정론적 계층 Engram으로 해결

LLM 호출 전 단계에서 반복되는 쿼리를 그래프 기반으로 처리하여 비용과 지연 시간을 줄이는 결정론적 연산 계층 Engram의 설계안이 공개됐다.

예산 부족 해결! CRDT로 SNN 분산 학습의 한계를 돌파하다

Project Nord는 CRDT 기반의 병합 기술을 도입하여 SNN의 희소성을 유지하면서도 비용 없이 분산 환경에서 모델을 확장할 수 있는 기반을 마련했다.

LLM을 비즈니스에 최적화하는 법: 파인튜닝 전략과 워크플로 가이드

LLM을 특정 도메인과 작업에 최적화하기 위한 파인튜닝의 필요성, 주요 방법론(IFT, RLHF, STFT), 그리고 효율적인 데이터 구축 워크플로를 제시한다.

비정형 데이터 시대, 당신의 ML 파이프라인은 최적화되어 있습니까?

정형 데이터와 비정형 데이터의 정의적 차이를 분석하고, 딥러닝 도입에 따른 피처 엔지니어링의 변화와 ML 파이프라인 구축 전략을 제시한다.

Hugging Face가 공개한 15조 토큰 규모 FineWeb 데이터셋 구축 전략

Hugging Face의 FineWeb 프로젝트를 통해 벤치마크 기반의 데이터 필터링과 중복 제거 전략이 LLM 성능에 미치는 핵심적인 영향을 분석합니다.

스마트폰에서 돌아가는 GPT-3.5급 AI? Microsoft Phi-3의 비밀

Microsoft Phi-3는 고품질 합성 데이터와 데이터 최적화 전략을 통해 3.8B~14B의 작은 크기로도 GPT-3.5를 능가하는 성능을 보여주는 소형 언어 모델 제품군이다.

12조 토큰으로 학습된 DBRX, 데이터 품질이 성능을 결정한다

Databricks가 개발한 DBRX는 132B 파라미터의 MoE 구조와 12조 토큰의 고품질 데이터를 결합해 기존 모델 대비 압도적인 성능과 효율성을 달성했다.

거대 모델의 시대는 끝났다? 허깅페이스의 SmolLM이 증명한 데이터의 힘

Hugging Face의 SmolLM은 정교하게 큐레이션된 고품질 데이터셋을 통해 소규모 파라미터로도 대형 모델에 필적하는 성능을 구현한 효율적인 SLM 시리즈입니다.

AI 성능의 80%를 결정하는 학습 데이터, 어떻게 구축해야 할까?

머신러닝 모델의 성능과 정확도를 결정하는 학습 데이터의 정의, 품질 요건, 그리고 효율적인 데이터 소싱 및 라벨링 전략을 제시한다.

Gemma 2 26B의 강력한 성능을 검열 없이 로컬에서 사용하는 방법

Google의 Gemma 2 26B 모델을 기반으로 커뮤니티에서 파인튜닝한 검열 해제 버전인 SuperGemma 4를 소개하고, Apple Silicon 및 타 플랫폼에서의 로컬 실행 방법을 설명한다.

텍스트 번역 강자 DeepL, 실시간 음성 번역 시장 진출

DeepL이 줌, 팀즈 등 협업 도구와 모바일 환경에서 사용 가능한 실시간 음성 대 음성 번역 솔루션 및 API를 공개했다.

코딩만 바이브? 이제 모든 창작이 '바이브'로 통합되는 거대한 변화가 시작됐다

바이브 코딩의 패턴이 디자인, 영상, 음악 등 모든 창의적 영역으로 확장되며 '바이브 크리에이팅'이라는 통합된 워크플로의 필요성이 대두됐다.

LLM은 의사를 대체할 수 있을까? DICOM 진단 성능과 운영 한계 분석

범용 멀티모달 LLM의 의료 영상(DICOM) 진단 정확도는 30% 수준으로 낮으며, 모델 자체보다 이를 안정적으로 실행할 운영 인프라 구축이 더 중요하다는 분석이다.

코딩 없이 MCP와 Claude Code로 구축하는 고성능 영업 자동화 에이전트 실전 가이드

Relevance AI의 Programmatic GTM과 Claude Code를 결합하여 잠재 고객 조사부터 개인화된 메시지 초안 작성까지 수행하는 지능형 영업 자동화 에이전트를 구축하는 전체 과정을 다룹니다.

Claude가 직접 정의로 이동하고 디버깅까지? Claude-IDE Bridge 공개

Claude-IDE Bridge는 LSP 통합과 SSH 지원을 통해 Claude가 에디터의 맥락을 완벽히 이해하고 원격 환경에서 직접 코드를 수정하게 돕는 도구이다.

Claude가 코드를 대충 짠다면? Gary Tan의 'Boil the Ocean' 프롬프트가 답이다

Claude의 불성실한 응답을 방지하기 위해 Gary Tan의 'Boil the Ocean' 철학을 담은 강력한 시스템 지침 프롬프트를 공유하고 효과를 논의했다.

r/ClaudeCode3달 전

Claude 3 Opus 30개로 코드 리뷰하면 이틀 만에 주간 한도 94% 소진

Claude Code 사용자가 고품질 코드 리뷰를 위해 30개의 Opus 에이전트를 활용하는 복잡한 워크플로를 공유하며 주간 사용량 한도의 부족함을 지적했다.

LinkedIn API 제한 돌파! 실제 브라우저로 작동하는 AI 에이전트 스킬

브라우저 확장 프로그램과 로컬 웹소켓 브리지를 활용해 LinkedIn의 다양한 기능을 자동화하는 AI 에이전트용 스킬 세트가 공개됐다.

서버 없는 3MB AI 앱, Core ML로 10일 만에 구축한 비결

Apple의 Core ML을 활용하여 데이터 수집 없이 기기 내에서만 작동하는 개인 습관 관리 AI 앱을 개발한 사례이다.

Claude Code의 복잡한 도구 호출과 비용, 이제 그래프로 한눈에 확인하세요

Claude Code의 코드베이스 수정 내역, 도구 호출, API 비용을 시각화하고 기존 세션을 관리할 수 있는 오픈소스 도구 Centrality가 공개됐다.

3분 만에 끝내는 의사결정 나무 시각화 가이드: 지니 불순도와 랜덤 포레스트의 핵심

의사결정 나무의 분할 원리인 지니 불순도부터 과적합 해결을 위한 가지치기 및 랜덤 포레스트 앙상블 기법을 시각적으로 설명했다.

LLM의 침묵은 중립일까? GPT-5.3과 Claude의 정치적 편향성 분석

98개의 정책 질문을 통해 최신 LLM들의 정치적 성향을 분석한 결과, 답변 거부와 옵트아웃 선택이 모델의 최종 정치적 위치를 결정하는 핵심 변수임이 확인됐다.

AI 티가 나는 단어 'delve' 금지? 5천 개 프롬프트가 알려주는 실전 비법

34개 오픈소스 저장소의 5,399개 프롬프트를 5가지 축으로 분석하여 마케팅 및 코딩 분야의 프롬프트 설계 패턴과 아키텍처를 규명했다.

LLM의 거짓말을 막는 법? GPT가 알려준 '진실성 극대화' 프롬프트 템플릿

사용자가 GPT와의 대화를 통해 모델의 로컬 점수 함수를 조정하여 답변의 사실적 정확성을 높일 수 있는 구체적인 프롬프트 규칙과 템플릿을 도출했다.

남는 GPU 모아 거대 LLM 돌린다! Mesh LLM 오픈소스 공개

Mesh LLM은 여러 기기의 유휴 GPU 자원을 통합하여 단일 기기에서 불가능한 거대 모델 추론을 가능하게 하는 분산 추론 시스템입니다.

Claude Code 터미널 UI를 내 마음대로? 커스텀 렌더링 PoC 공개

Claude Code가 Ink와 React를 사용해 터미널 UI를 렌더링하는 점을 이용해 사용자 정의 컴포넌트를 주입하는 기술적 실험이 공유됐다.

r/vibecoding3달 전

단순 검색을 넘어 지식을 합성한다? Infinite Craft 스타일의 지식 관리 도구

개인 위키 페이지를 결합하여 새로운 가설과 통찰을 생성하는 조합적 합성 레이어 도구가 공개됐다.

Dust3달 전

개인용 챗봇을 넘어 팀 전체의 업무를 자동화하는 Dust의 에이전트 전략

Dust는 개인의 생산성 도구를 넘어 조직 전체의 지식이 결합되어 가치를 창출하는 '조직적 AI' 비전과 이를 실현하기 위한 5대 제품 기둥을 제시합니다.

Claude Code 사용량과 권한 승인을 맥북 노치에서 한눈에 확인하기

Claude Code의 세션 상태, 사용량 제한, 권한 승인 요청을 맥북 노치 영역에서 실시간으로 관리할 수 있는 오픈소스 도구 Notch Pilot이 출시됐다.

Claude Opus 4.6 vs GPT-5.4, 아키텍처 설계의 승자는?

작성자가 9개의 최신 LLM을 대상으로 아키텍처 설계 및 저장소 인식 능력을 벤치마킹한 결과, Claude Opus 4.6이 가장 높은 점수를 기록했다.

Claude Code의 진가는 자율적인 '에이전트 루프'에 있다

Claude Code가 1시간 넘는 세션 동안 스스로 평가 루프를 돌며 UI 구현과 정리를 완수한 자율 코딩 사례이다.

실험실 점수는 믿을 수 없다? 데이터 변화를 추적하는 DriftBench

정적인 벤치마크의 한계를 극복하기 위해 데이터 및 워크로드의 변화(Drift)를 매일 측정하고 재현하는 동적 평가 도구 DriftBench가 공개됐다.

프론트엔드 코딩 끝? 잘 만든 SDK 하나로 쇼핑몰 전체 자동 생성

잘 설계된 백엔드에서 Nestia로 생성한 SDK를 AI에게 제공하여 엔터프라이즈급 쇼핑몰 프론트엔드를 한 번의 프롬프트로 자동 구축했다.

Claude Code 대화 기록 자동 저장 도구 Contrails로 토큰 아끼고 기록 관리하기

Claude Code의 로컬 JSONL 대화 로그를 실시간으로 감시하여 프로젝트 폴더 내에 읽기 쉬운 마크다운 파일로 자동 변환해주는 오픈소스 도구 Contrails가 공개됐다.

Claude Code가 Google의 보안 취약점을 찾아냈다? 실제 버그 발견 사례

Claude Code를 사용하여 Google의 Brotli 압축 알고리즘에서 실제 버그를 발견하고 보안 보상 프로그램(VRP)을 통해 수정을 이끌어낸 사례가 공유됐다.

Claude 작업 효율을 높이려면? 수요일 오전 배포 시간대를 피하세요

Claude 서비스의 상태 데이터를 분석한 결과, 최근 장애 발생률이 40% 증가했으며 주로 북미 오전 시간과 수요일에 집중되는 패턴이 확인됐다.

Claude 쓰려면 셀카 찍어야 한다? Anthropic의 신분증 인증 도입 논란

Anthropic이 서비스 오남용 방지를 위해 Persona를 통한 정부 신분증 및 생체 인증을 도입하며 프라이버시 논란이 일고 있다.

HF Daily Papers3달 전· 4달 전 발행

ALM의 고질적 문제인 시간적 환각 해결 및 그라운딩 성능 20% 이상 향상

대형 오디오-언어 모델(ALM)은 전체적인 오디오 이해도는 높지만, 특정 사건이 정확히 언제 발생하는지 찾아내는 시간적 그라운딩 능력이 부족했다. 이 논문은 타임스탬프 토큰을 오디오 특징과 교차 배치하는 방식과 환각 억제 학습 목적 함수를 도입하여, 복잡한 배경음 속에서도 짧은 소리 이벤트를 정확히 찾아내는 기술적 돌파구를 마련했다.

HF Daily Papers3달 전· 4달 전 발행

Gemini 2.5 Flash, 사고 토큰 700개면 비디오 이해 성능 정점 도달

비디오 이해 모델이 최종 답변을 내놓기 전 수행하는 내부 추론 과정인 '사고 스트림(Thought Streams)'의 실질적 효용성을 분석했습니다. 모델이 더 많이 생각할수록 성능이 무한히 좋아지는 것이 아니라 특정 지점에서 정체된다는 사실과, 사고 예산이 부족할 때 발생하는 '압축 단계 환각' 현상을 규명하여 효율적인 모델 배포 전략을 제시합니다.

HF Daily Papers3달 전· 5달 전 발행

LLM의 공간 지능 한계 발견: GPT-5.2도 전역 제약 조건 해결에 난항

대형 언어 모델이 수학과 코딩에서 인간 수준에 도달했음에도 불구하고, 물리적 세계를 이해하고 조작하는 공간 지능은 여전히 미흡함을 보여줍니다. 이 논문은 단순 시각 답변을 넘어 실제 실행 가능한 결과물을 요구하는 새로운 벤치마크를 통해 모델의 논리적 공간 추론 한계를 명확히 정의합니다.

HF Daily Papers3달 전· 4달 전 발행

3대의 카메라만으로 1K 해상도 40 FPS 실시간 3D 렌더링 달성

기존의 NeRF나 Gaussian Splatting 방식은 새로운 장면마다 수 분 이상의 재학습이 필요해 실시간 스트리밍에 부적합했다. 이 논문은 별도의 재학습 없이 3대의 카메라 입력만으로 즉시 고품질의 자유 시점 영상을 생성할 수 있는 피드포워드 구조를 제안하여 AR/VR 및 텔레프레즌스 대중화의 기술적 토대를 마련했다.

HF Daily Papers3달 전· 4달 전 발행

비디오 토큰 8배 절감으로 10초 분량의 고품질 영상 생성 달성

기존 비디오 토큰화 방식은 고정된 3D 그리드 구조를 사용하여 영상의 복잡도와 상관없이 방대한 연산량을 요구했습니다. 이 논문은 영상의 핵심 의미부터 세부 디테일까지 단계적으로 압축하는 유연한 토큰화 방식을 제안하여, 훨씬 적은 데이터로도 고품질 비디오를 생성하고 학습 효율을 5배 이상 높였습니다.

HF Daily Papers3달 전· 4달 전 발행

GRN: 이미지 생성의 새로운 패러다임, rFID 0.56으로 신기록 달성

기존 확산 모델은 복잡도와 상관없이 동일한 연산량을 소모해 비효율적이었고, 자기회귀 모델은 이산 토큰화 과정의 정보 손실로 품질 한계가 있었다. 이 논문은 계층적 이진 양자화와 글로벌 정제 메커니즘을 통해 효율성과 고품질 생성을 동시에 달성하며 이미지 및 비디오 생성의 새로운 방향을 제시한다.

HF Daily Papers3달 전· 4달 전 발행

APEX: 외부 판별기 없이 1단계 생성으로 FLUX-Schnell을 압도하다

기존의 1단계 이미지 생성 모델은 세부 묘사가 부족하거나 학습이 불안정하다는 한계가 있었다. APEX는 외부 판별기 없이 모델 내부에서 스스로 적대적 신호를 생성하는 기술을 통해 학습 안정성을 확보하면서도 고해상도 이미지의 미세한 질감을 완벽하게 복원한다.

HF Daily Papers3달 전· 5달 전 발행

인간처럼 터치하는 AI 에이전트, 탐지 회피율 94% 달성

자율형 GUI 에이전트가 확산됨에 따라 디지털 플랫폼의 봇 탐지 시스템과의 갈등이 심화되고 있다. 이 논문은 에이전트가 단순히 작업을 수행하는 것을 넘어, 인간과 구별할 수 없는 행동 특성을 갖추는 '인간화' 기술이 에이전트의 생존과 공존에 필수적임을 입증한다.

HF Daily Papers3달 전· 4달 전 발행

LLM 에이전트, 반복된 상호작용 통해 기만과 전략적 신뢰 학습 확인

자율적인 LLM 에이전트가 다중 에이전트 환경에서 어떻게 전략적 행동을 형성하는지 이해하는 것은 정렬 연구의 핵심 과제이다. 이 논문은 뉴욕시 내비게이션 시뮬레이션을 통해 에이전트 간의 설득, 기만, 신뢰 메커니즘을 정량적으로 분석할 수 있는 통제된 환경을 제공한다.

HF Daily Papers3달 전· 4달 전 발행

의료 AI 영상 복원, VAE만 바꿔도 PSNR 3dB 이상 대폭 향상

의료 영상 초해상도(SR) 기술에서 기존 확산 모델들이 관습적으로 사용하던 일반 이미지용 VAE가 성능의 병목 지점임을 밝혀냈습니다. 의료 데이터로 사전 학습된 MedVAE를 사용하는 것만으로도 복잡한 아키텍처 수정 없이 진단에 중요한 미세 구조 복원 성능을 획기적으로 높일 수 있음을 입증했습니다.

HF Daily Papers3달 전· 4달 전 발행

촉각 신호만으로 이미지 속 같은 재질을 찾아내는 STT 프레임워크

인간이 물체를 만졌을 때의 느낌을 시각적 정보와 연결하는 능력을 AI로 구현하여, 촉각 신호만으로 이미지 내에서 동일한 재질을 가진 영역을 정확히 찾아낼 수 있다. 이는 로봇의 물체 조작이나 재활용 분류 등 시각과 촉각의 통합이 필요한 실제 환경에서 AI의 판단 능력을 크게 향상시킨다.

HF Daily Papers3달 전· 4달 전 발행

VLM, 똑같은 그림도 규칙이 바뀌면 14.6%p 더 틀린다

대형 시각 언어 모델(VLM)이 시각적 정보를 잘 인식함에도 불구하고, 왜 특정 상황에서 엉뚱한 답변을 내놓는지에 대한 근본적인 원인을 분석한다. 단순히 그림을 못 보는 것이 아니라, 익숙한 상식이나 규칙에 사로잡혀 새로운 지시사항을 무시하는 '의미적 고착' 현상을 규명하고 이를 해결할 실마리를 제공한다.

HF Daily Papers3달 전· 4달 전 발행

강화학습 에이전트, 포켓몬스터 레드에서 무한 루프 극복하고 첫 배틀 승리

포켓몬스터 레드와 같은 장기적 의사결정이 필요한 JRPG는 희소한 보상과 복잡한 조작 체계로 인해 강화학습의 난제로 꼽힌다. PokeRL은 루프 감지 및 스팸 방지 메커니즘을 통해 에이전트가 의미 없는 행동에 빠지는 것을 방지하고, 커리큘럼 학습을 통해 실질적인 게임 진행이 가능함을 입증했다.