본문으로 건너뛰기

2026년 4월 21일 AI 뉴스

100

관심 태그 추가

코딩 없이 고품질 LLM 학습 데이터를 만든다? Dataset Generator 공개

Dataset Generator는 주제 기획부터 LLM 판사를 통한 품질 검증까지 자동화하여 LLM 미세 조정용 합성 데이터를 생성하는 노코드 데스크톱 앱이다.

LLM 코딩 세션 토큰 86% 절감, 반복 읽기 잡는 sqz 공개

반복되는 파일 읽기와 중복 데이터를 SHA-256 캐싱 및 인라인 참조로 압축하여 LLM 토큰 비용을 최대 86% 절감하는 도구이다.

r/LangChain3달 전

RAG 성능을 퀀텀 점프시키는 비결은 모델 개선이 아닌 '전문가 주석'이다

법률 도메인 RAG 구축 시 전문가가 직접 남긴 주석을 검색 결과와 함께 LLM에 주입함으로써 최신성 유지와 지식 보정 효과를 극대화했다.

Pandas 초보 탈출! 성능과 가독성을 모두 잡는 6가지 고급 패턴

Pandas의 메서드 체이닝, 벡터화 로직, 효율적인 조인 기법을 통해 더 빠르고 깨끗한 데이터 처리 코드를 작성하는 방법을 설명합니다.

AI가 스스로 도구를 해킹해 새로운 기능을 발명한 사례

제한된 5개의 UI 버튼만 가진 AI가 상황에 맞게 버튼의 의미를 추상화하여 스스로 '빠른 답장' 기능을 구현한 사례 분석

전문가 페르소나가 정말 효과 있을까? 156회 실험으로 밝혀진 사실

Gemma 31B 모델을 대상으로 52가지 페르소나와 프롬프트 구조를 실험한 결과, 단순한 역할 부여보다 초안-비판-수정 방식의 메타 프롬프트가 가장 높은 성능을 보였다.

Claude Opus 4.7 출시, 추론 프롬프트 성능과 토큰 효율성 실측 결과

Claude Opus 4.7은 이전 버전 대비 추론 강화 프롬프트와 메타 프롬프트 처리 능력은 향상되었으나, 토큰 효율성은 약 15-20% 하락했다.

Krish Naik3달 전

2026년 AI 시장을 주도할 3가지 핵심 커리어 로드맵

AI 시장의 변화에 발맞춰 AI 스페셜리스트, 제너럴리스트, 빌더로 구분되는 3가지 핵심 커리어 역할과 발전 방향을 제시한다.

Apple의 도박: 소프트웨어가 아닌 하드웨어가 AI의 미래를 결정한다

Apple이 하드웨어 전문가를 차기 리더로 선택하며 클라우드 의존 없이 기기 자체에서 AI를 구현하는 온디바이스 전략에 집중하고 있다.

r/artificial3달 전

독일어로 묻고 프랑스어로 답한다? RAG 언어 오염 해결기

다국어 문서가 포함된 RAG 시스템에서 발생하는 언어 혼동 문제를 정규표현식 기반 언어 판별과 강력한 프롬프트 제약으로 해결한 사례이다.

GLM-5V-Turbo 사용기: UI 스크린샷을 코드로 바꾸는 실전 성능은?

GLM-5V-Turbo 모델을 UI 레이아웃 및 스크린샷 분석 등 멀티모달 코딩 작업에 사용해본 결과, 시각적 구조 파악 능력이 뛰어나 에이전트 워크플로의 시작점으로 유용하다는 평가이다.

The Verge AI3달 전

애플의 새 CEO 존 테너스, 위기의 '애플 인텔리전스'를 구할 수 있을까?

애플의 차기 CEO로 지명된 하드웨어 전문가 존 테너스가 경쟁사 대비 뒤처진 AI 기술력과 지연되는 Siri 업데이트 문제를 해결해야 하는 중대한 과제에 직면했다.

단순 생성이 아닌 참여형 음악 AI, GRAI가 그리는 리믹스의 미래

AI 음악 랩 GRAI가 아티스트의 권리를 존중하면서 사용자가 음악을 리믹스하고 공유할 수 있는 소셜 플랫폼 구축을 위해 900만 달러의 시드 투자를 유치했다.

Comet ML Blog3달 전

AI 에이전트 개발의 난제, 소프트웨어 회귀 테스트 방식으로 해결한다

Comet ML의 Opik이 모호한 수치 중심의 AI 평가 대신 소프트웨어 공학의 회귀 테스트와 어설션 방식을 도입한 Test Suites 기능을 출시했습니다.

영국 해군 전술을 AI에? Claude Code 에이전트 Nelson의 놀라운 실행력

영국 해군 절차를 모방한 멀티 에이전트 도구 Nelson이 v2.2.0에서 전술적 추정(The Estimate) 단계를 도입하여 실행 전 기획 기능을 강화했다.

AI 에이전트 4개를 동시에 돌려 3주 만에 프로젝트를 완성하는 방법

Claude Code와 Codex를 병렬로 운용하여 3주 만에 프로젝트를 완수한 경험과 Git Worktree를 활용한 다중 에이전트 워크플로 최적화 전략을 공유한다.

사용할수록 똑똑해지는 AI 에이전트의 비밀: 자가 진화 아키텍처 총정리

Claude Code와 Hermes Agent의 사례를 통해 에이전트가 스스로 기술을 생성하고 기억을 관리하며 성능을 개선하는 자가 진화 메커니즘의 핵심 아키텍처를 분석한다.

David Shapiro3달 전

Claude와 ChatGPT는 왜 점점 멍청해지고 불친절해질까?

AI 기업들의 비용 절감, 법적 리스크 회피, 할루시네이션 방지 노력이 오히려 챗봇의 사용자 경험과 지능을 저하시키는 현상을 분석한다.

8k 토큰으로 프로젝트 전체 수정? 가벼운 코딩 에이전트 LiteCode

LiteCode는 프로젝트 맵핑과 병렬 편집 방식을 통해 8k 이하의 좁은 컨텍스트 윈도우에서도 대규모 코드 수정을 지원하는 오픈소스 CLI 에이전트이다.

The Verge AI3달 전

Yelp AI 챗봇의 진화, 이제 대화 한 번으로 식당 예약부터 배달 주문까지

Yelp가 자사 AI 챗봇에 예약, 배달 주문, 견적 요청 등 실질적 액션 기능을 통합하여 디지털 컨시어지로 개편했다.

기존 아랍어 벤치마크의 오류를 잡다, 품질 중심 리더보드 QIMMA 공개

기존 아랍어 벤치마크의 품질 오류를 체계적으로 검증하고 수정하여 신뢰할 수 있는 아랍어 LLM 성능 평가를 제공하는 QIMMA 리더보드가 출시됐다.

하나의 모델은 믿지 마세요: 다중 LLM으로 보안 취약점 잡는 법

GLM, Gemini, Claude 등 여러 LLM을 활용해 보안 취약점을 개별 분석한 후 Codex로 통합하여 교차 검증하는 보안 리뷰 워크플로가 제시됐다.

짐코딩3달 전

Claude Code로 카드 뉴스 무한 생성하는 자동화 워크플로우

Claude Code와 Playwright를 결합하여 HTML/CSS 기반의 정밀한 카드 뉴스를 자동 생성하고 이를 재사용 가능한 스킬로 등록하는 실무 프로세스를 제시한다.

RIKEN AIP3달 전

RIKEN AIP, CVPR 2026에서 지형 정보 및 3D AI 연구 성과 공개

RIKEN AIP 연구진이 컴퓨터 비전 최고 권위 컨퍼런스인 CVPR 2026에 3D 객체 포즈 추정, 지과학 멀티모달 벤치마크 등 총 5개의 논문을 채택시켰다.

수식 없이 이해하는 로지스틱 회귀, 애니메이션으로 정복하기

로지스틱 회귀의 작동 원리를 시그모이드 함수, 결정 경계, 로그 손실 및 경사 하강법 과정을 통해 시각적으로 설명하는 튜토리얼이다.

r/LLMDevs3달 전

BERTScore가 놓치는 대화의 맥락, 새로운 TRACE 지표로 해결

개별 응답 단위가 아닌 전체 대화의 맥락과 일관성을 평가하기 위해 5가지 핵심 요소를 측정하는 TRACE 지표가 공개됐다.

WorldofAI3달 전

GPT-5.4를 꺾은 오픈소스 코딩 모델 Kimi K2.6과 OpenAI의 텔레파시 기능

Moonshot AI의 새로운 오픈소스 모델 Kimi K2.6의 벤치마크 성능과 OpenAI Codex의 화면 인식 기반 메모리 기능인 Chronicle을 소개합니다.

Stanford Online3달 전

로봇이 인간처럼 움직이는 법: 2만 시간의 데이터가 만든 변화

대규모 인간 행동 데이터를 활용해 로봇의 물리적 지능을 학습시키고 다양한 로봇 신체 구조에 적용하는 새로운 학습 프레임워크와 생태계를 소개합니다.

HF Daily Papers3달 전· 4달 전 발행

AI 모델의 진화 방식, 생물학적 진화 법칙과 99% 일치 확인

AI 아키텍처의 발전 과정이 단순한 공학적 개선을 넘어 생물학적 진화와 동일한 통계적 법칙을 따른다는 사실을 입증했다. 이는 AI의 발전 방향이 인간의 의도뿐만 아니라 '적합도 지형'이라는 수학적 구조에 의해 결정됨을 시사하며, 향후 더 효율적인 모델 설계 전략을 세우는 데 기여할 수 있다.

확산 모델보다 빠르고 정확한 차세대 생성 기법 Flow Matching 완벽 가이드

스탠포드 대학교의 Afshine 및 Shervine Amidi 강사가 확산 모델과 점수 매칭을 넘어선 차세대 생성 패러다임인 Flow Matching의 수학적 원리와 학습 방법론을 상세히 강의한다.

HF Daily Papers3달 전· 3달 전 발행

최강 LLM도 물리 연구 점수 50점 미만, AI 과학자의 한계 드러나

기존 AI 벤치마크가 단순 지식 암기나 단기 추론에 집중했다면, 이 논문은 실제 물리 연구처럼 긴 호흡의 탐색과 복잡한 계산이 필요한 환경에서 LLM의 한계를 측정한다. 이를 통해 자율적인 AI 과학자 시스템 구축을 위한 핵심 병목 지점이 도메인 지식 부족과 장기 추론의 불안정성임을 명확히 제시한다.

구글 크롬에 Gemini 탑재, 한국에서도 AI 비서 사용 가능

구글이 한국을 포함한 7개 신규 국가의 크롬 브라우저에 Gemini AI 기능을 공식 출시했다.

Chase AI3달 전

Claude Design으로 코딩 없이 애니메이션 웹사이트 만드는 법

Claude Design의 웹 디자인 기능과 Seedance 2.0의 영상 생성 기술을 결합하여 고품질 애니메이션 랜딩 페이지를 구축하는 전체 워크플로를 제시합니다.

aifeed.dev3달 전

구글의 칩 다변화 전략: 마벨과 손잡고 AI 추론 비용 절감 나선다

구글이 AI 추론 비용 최적화와 공급망 다변화를 위해 마벨 테크놀로지와 커스텀 AI 추론 칩 설계를 논의 중이다.

aifeed.dev3달 전

AI 에이전트가 인간 엔지니어보다 비싸다? o3 모델 시간당 비용 350달러 기록

Toby Ord의 분석에 따르면 고성능 AI 에이전트가 복잡한 과업을 수행할 때 발생하는 시간당 비용이 인간 소프트웨어 엔지니어의 인건비를 상회하는 것으로 나타났다.

코딩 에이전트 무한 루프와 비용 폭증, 토큰 기반 예산제로 해결했다

코딩 에이전트 운영 시 단순 요청 횟수 제한 대신 토큰 기반 예산 할당과 모델 라우팅을 통해 비용을 60% 절감한 실무 사례이다.

매일 쏟아지는 LLM 도구, AI가 직접 설치하고 실행해 점수를 매긴다

Hacker News에 올라오는 수많은 LLM 도구들을 컨테이너 환경에서 자동 실행하고 Llama 3.3 모델로 11가지 기준에 따라 평가하는 오픈소스 파이프라인 프로젝트입니다.

Claude Code의 한계를 넘다, 복잡한 작업을 DAG로 분해하는 Orchestra

Claude Code에서 복잡한 작업을 원자적 단위의 DAG로 분해하고 병렬로 실행하는 MIT 라이선스 오픈소스 플러그인 Orchestra가 출시되었다.

Claude가 내 화이트보드에 직접 아키텍처를 그려준다면?

Excalidraw의 협업 프로토콜을 활용해 Claude가 사용자의 브라우저 캔버스에 실시간으로 다이어그램을 그리도록 지원하는 MCP 도구가 공개됐다.

AI 바이브 코딩으로 게임 개발 가능할까? 실제 제작자가 밝힌 한계와 팁

AI 에이전트와 바이브 코딩을 활용해 브라우저 기반 게임을 구축한 경험을 바탕으로, AI의 생산성 이점과 수동 검토의 필요성을 공유했다.

벡터 DB부터 예측형 DB까지, AI 데이터베이스 4대 분류 총정리

데이터베이스 계층으로 통합되는 AI 기능을 아키텍처에 따라 벡터, ML-in-DB, LLM 증강, 예측형 데이터베이스의 4가지 카테고리로 분류하고 분석했다.

LG AI Research가 공개한 금융 특화 AI, EXAONE BI의 모든 것

LG AI Research가 4개의 전문 AI 에이전트를 활용해 방대한 금융 데이터를 분석하고 자연어로 투자 인사이트를 제공하는 EXAONE BI를 공개했다.

300개 에이전트 동시 가동? Kimi K2.6이 던진 AI 개발의 새로운 과제

Moonshot AI가 300개의 서브 에이전트를 제어하는 Kimi K2.6을 공개함에 따라, 단일 모델 성능보다 복잡한 에이전트 오케스트레이션과 거버넌스가 더 중요한 과제로 부상했다.

혼자보다 팀이 강하다: 복잡한 과제를 해결하는 AI 에이전트 협업 설계법

단일 LLM의 한계를 극복하기 위해 기획자, 실행자, 비평가 등 인간 팀과 유사한 역할을 분담하여 협업하는 AI 에이전트 시스템 설계 방법론을 제시한다.

파일 대신 DB를 써라? Andrej Karpathy가 극찬한 AI 지식 베이스 구현법

파일 기반의 Obsidian 대신 SQLite와 벡터 검색을 활용하여 AI 에이전트가 지속적으로 읽고 쓸 수 있는 로컬 지식 베이스 구축 방안을 제안한다.

내 AI에게 필요한 것은 행동인가 지식인가? ADK와 RAG 완벽 비교

AI 시스템 설계 시 작업 수행 중심의 ADK와 정보 검색 중심의 RAG 중 목적에 맞는 아키텍처를 선택하거나 하이브리드 방식으로 결합하는 전략을 제시한다.

r/vibecoding3달 전

AI 코딩 실패를 막는 비개발자용 7가지 상시 지침 가이드

비개발자가 AI를 활용해 프로젝트를 진행할 때 발생할 수 있는 관리 불능 상태를 방지하기 위한 7가지 핵심 상시 지침(Standing Instructions)을 제시한다.

Claude Code가 직접 디자인하고 수정하는 Figma 스타일 워크플로 공개

저장소를 인식하는 Claude Code와 실시간 협업 디자인 캔버스를 MCP로 연결하여 프론트엔드 개발 효율을 극대화한 사례이다.

Claude Code 스킬 30개 넘어도 한눈에 관리하는 대시보드 등장

Claude Code의 수많은 스킬을 시각적으로 검색하고 관리할 수 있는 단일 HTML 파일 기반의 오픈소스 대시보드 도구가 공개됐다.

API 비용 걱정 끝! AI 에이전트를 위한 무료 검색 엔진 AgentSearch

SearXNG 기반의 오픈소스 검색 API인 AgentSearch는 AI 에이전트와 RAG 시스템을 위해 비용 없이 무제한 검색 기능을 제공합니다.

r/artificial3달 전

AI 티 안 나게 글 쓰는 법? AI 특유의 표현 식별 체크리스트 공개

마케터와 작가들을 위해 AI가 생성한 텍스트에서 흔히 발견되는 특정 단어와 문구들을 정리한 GitHub 체크리스트가 공유됐다.

단순 코딩은 끝났다! AI 에이전트에게 시니어의 업무 프로세스를 주입하는 법

Addy Osmani의 Agent Skills를 활용해 AI 코딩 에이전트에게 설계, 계획, 테스트, 리뷰로 이어지는 체계적인 엔지니어링 워크플로를 주입하여 결과물의 신뢰성을 높이는 방법을 제시한다.

부동소수점 없이 LLM 학습이 가능할까? 100% 정수 기반 Wraith 모델 공개

186M 규모의 LLaMA 아키텍처를 부동소수점 가중치나 Adam 상태 없이 100% 정수 파이프라인만으로 학습시키는 데 성공했다.

Moonshot AI 공개: 일반 이더넷으로 LLM 추론 성능 54% 향상

Moonshot AI와 칭화대가 KV 캐시 전송 효율을 극대화하여 데이터 센터 간 Prefill과 Decode를 분리 서빙하는 PrfaaS 아키텍처를 제안했다.

Claude Code로 복잡한 영상 제작 파이프라인을 자동화하는 5가지 실전 패턴

Claude Code를 사용하여 텍스트 생성부터 영상 합성까지 이어지는 다단계 파이프라인을 구축할 때 유용한 모듈화 및 디버깅 패턴을 공유한다.

속도는 빠르지만 불안한 바이브 코딩, 5단계 품질 게이트로 해결한다

AI 생성 코드의 품질 저하 문제를 해결하기 위해 테스트, 보안, 빌드 등 5단계 자동 검증 게이트를 포함한 100x-dev 파이프라인이 공개됐다.

파라미터가 지능의 척도가 아니다? OpenMythos가 제시하는 15배 효율의 미래

OpenMythos 포지션 페이퍼는 재귀적 깊이, MoE, 이산 확산 모델의 결합을 통해 기존 오토레그레시브 모델보다 5~15배 높은 파라미터 효율성을 달성할 수 있다고 주장한다.

r/vibecoding3달 전

현직자가 공개하는 AI 에이전트 도입의 현실과 실패 지점

AI 에이전트가 엔지니어링 워크플로를 변화시키는 단계를 컨텍스트 엔지니어링부터 비동기 스웜까지 실무적 관점에서 분석했다.

ChatGPT를 더 똑똑하고 비판적으로 만드는 '사고 모드' 전용 지침

ChatGPT의 할루시네이션을 줄이고 비판적 사고 능력을 강화하기 위한 고도화된 맞춤형 지침(Custom Instructions)과 개인화 설정값이 공유됐다.

1ms 미만의 속도로 프롬프트 주입 차단, 결정론적 탐지 도구 공개

정규표현식과 유니코드 검사를 통해 LLM 프롬프트 주입 및 탈옥 패턴을 1ms 이내에 탐지하는 오픈소스 라이브러리이다.

가정용 WiFi로 Llama 3.3 70B를 1.86배 빠르게 돌리는 방법

여러 대의 소비자용 GPU와 Mac을 llama.cpp RPC로 묶고 추측성 디코딩을 적용해 분산 환경의 네트워크 병목을 해결하고 추론 속도를 2배 가까이 향상시킨 사례이다.

AI 탐지기가 당신의 글에서 '보이지 않는 지문'을 찾아낸다?

GPT 모델의 출력물에 포함된 보이지 않는 문자나 포맷팅 아티팩트가 AI 탐지 도구의 주요 판별 근거로 활용될 수 있다는 가설과 실험 결과이다.

Claude Code 비용 절감의 핵심, RTK와 Headroom 연동 가이드

Claude Code 사용 시 RTK와 Headroom을 결합하여 토큰 사용량을 최적화하고 설치 과정의 기술적 문제를 해결하는 가이드가 공유됐다.

2026년 스타트업은 'AI 네이티브 엔지니어'만 찾는다: 200개 공고 분석 결과

200개 스타트업 채용 공고 분석 결과, AI 도구를 기본으로 사용하는 'AI 네이티브 엔지니어'와 에이전트 시스템 구축 역량에 대한 수요가 급증했다.

Opus부터 Qwen까지, AI 모델들의 디자인이 모두 '복사 붙여넣기'인 이유

다양한 LLM 모델들이 웹 프로토타입 생성 시 특정 색상과 레이아웃으로 수렴하는 현상을 통해 모델 간 디자인 편향성을 지적했다.

A100 없이 L4에서 Qwen 이미지 편집 모델을 돌리는 최적화 비결

저렴한 L4 GPU에서 Qwen Image Edit 2511 모델을 효율적으로 서빙하기 위해 커스텀 Triton 커널을 활용한 최적화 사례이다.

Claude와 GPT 비용을 획기적으로 줄이는 프롬프트 라우팅 전략

프롬프트의 길이나 모델 이름 대신 의도와 데이터 유형을 기준으로 모델을 선택하여 비용을 최적화하는 라우팅 전략을 제시한다.

Karpathy의 LLM 지식 베이스 아이디어가 현실로, LLM Wiki Compiler 업데이트

LLM Wiki Compiler 0.02.0 버전이 문단 단위 인용, Obsidian 통합, MCP 지원을 통해 실험적 도구에서 실무적인 지식 인프라로 업그레이드됐다.

낮은 손실(Loss)이 항상 좋은 모델을 보장할까? 지시어 수행 능력의 미스터리

GPT-2 스타일 모델의 테스트 세트 손실과 지시어 파인튜닝(IFT) 점수 사이의 상관관계를 분석한 결과, 낮은 손실이 반드시 높은 실무 성능으로 이어지지는 않음을 확인했다.

2GB VRAM에서도 돌아가는 0.8B 초소형 시각 언어 모델 등장

OmnionixAI가 로컬 환경 및 에지 디바이스 최적화를 위해 Qwen 기반의 0.8B 파라미터 시각 언어 모델 Avara-Edge-1.0을 출시했다.

긴 대화에서도 LLM이 똑똑함을 유지하는 비결, AC Lite 프롬프트

긴 대화 세션에서 LLM의 논리적 일관성을 유지하고 환각을 줄이기 위해 세 가지 관점(긍정·부정·중립)을 내부적으로 검토하게 하는 AC Lite 프롬프트 기법이 공유됐다.

Claude Code의 컨텍스트 절약 비결과 여전히 남은 과제

MCP의 프록시/검색 패턴이 컨텍스트 비대화를 해결했으나, 스킬 메타데이터는 여전히 시스템 프롬프트에 과도하게 노출되는 문제가 남아있다.

아마존-앤스로픽의 1,000억 달러 빅딜, AI 칩 주도권 전쟁 가속화

앤스로픽이 아마존으로부터 50억 달러를 추가 투자받는 대신, 향후 10년간 AWS 클라우드 인프라에 1,000억 달러를 지출하기로 합의했다.

HF Daily Papers3달 전· 3달 전 발행

연합 학습 통신량 96.9% 절감하고 보안은 강화한 6G-IoT 침입 탐지 기술

6G-IoT 환경에서 수천 개의 기기가 생성하는 데이터를 중앙 서버로 보내지 않고도 안전하게 사이버 위협을 탐지할 수 있는 기술이다. 그래디언트 압축을 통해 통신 비용을 32배 줄이면서도 동형 암호를 결합해 데이터 유출 위험을 원천 차단했다.

HF Daily Papers3달 전· 3달 전 발행

4.0M 파라미터로 AI 생성 음악 98.29% 정확도 탐지 성공

스트리밍 플랫폼에 매일 5만 곡 이상의 AI 생성 음악이 업로드되는 상황에서, 기존의 대규모 모델 기반 탐지 방식은 학습하지 않은 생성 모델에 대해 취약한 한계를 보였다. 이 논문은 모든 AI 음악 생성기가 공통으로 사용하는 신경 오디오 코덱의 물리적 제약인 RVQ를 활용하여, 매우 가벼운 모델로도 미학습 생성 모델까지 정확하게 잡아내는 새로운 패러다임을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

LLM 추론 능력 강화: 퍼플렉시티 기반의 정밀한 탐색-활용 제어

LLM의 사후 학습 과정에서 강화학습을 사용할 때 너무 쉽거나 어려운 샘플은 학습 신호를 주지 못하는 문제가 있다. 이 논문은 퍼플렉시티를 기준으로 샘플을 정밀하게 분류하고 보상을 재할당하여 모델의 추론 성능과 학습 안정성을 동시에 개선하는 방법론을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

5,000명의 시선 데이터를 학습한 차세대 비디오 주의 집중 모델 공개

비디오 내에서 인간이 어디를 집중해서 보는지 예측하는 기술은 효율적인 영상 압축과 자율주행, 미디어 편집의 핵심 기술이다. 이 논문은 2,000개의 대규모 비디오 데이터셋을 기반으로 최신 VLM과 확산 모델을 활용한 시각적 주의 집중 예측의 최신 기술적 도약을 보여준다.

HF Daily Papers3달 전· 3달 전 발행

의료 AI의 진단 모호성 해결, 전문가 합의율로 정확도 개선

췌장암(PDAC) CT 영상 분할은 전문가들 사이에서도 의견이 갈릴 만큼 경계가 모호하여 단일 정답(Ground Truth)을 가정하는 기존 방식은 한계가 있다. TwinTrack은 여러 전문가의 의견 합의율을 직접 예측하도록 모델을 교정하여 진단의 불확실성을 수치화하고 신뢰도를 높인다.

HF Daily Papers3달 전· 3달 전 발행

LLM 에이전트가 스스로 하드웨어 커널을 최적화하여 성능 25% 향상

새로운 AI 가속기가 등장할 때마다 전문가가 수동으로 커널을 최적화하는 데 수개월이 걸리는 병목 현상을 해결합니다. LLM 에이전트가 하드웨어 지식 없이도 스스로 학습하며 최적화 코드를 생성하여, 상용 모델 대비 26배 저렴한 비용으로 전문가 수준의 성능을 달성할 수 있음을 보여줍니다.

HF Daily Papers3달 전· 3달 전 발행

시각 AI의 '과잉 사고' 해결로 토큰 사용량 최대 90% 절감

최신 시각 추론 모델들이 간단한 질문에도 불필요하게 긴 추론 과정을 거치며 자원을 낭비하는 '과잉 사고' 문제를 해결한다. 문제의 난이도에 따라 추론의 깊이를 스스로 조절하게 함으로써 정확도는 유지하면서도 운영 비용을 획기적으로 줄일 수 있는 방향을 제시한다.

HF Daily Papers3달 전· 3달 전 발행

1D 토큰 구조만 바꿔도 이미지 생성 모델의 추론 성능 대폭 향상

기존의 2D 그리드 방식 토큰 구조는 생성 중간 단계에서 전체적인 의미를 파악하기 어려워 추론 시점의 최적화가 힘들었다. 이 논문은 1D 순서화된 토큰 구조가 생성 과정에서 '거시적 의미에서 세부 묘사'로 이어지는 계층적 정보를 제공하여, 별도의 추가 학습 없이도 검색 알고리즘을 통해 생성 품질을 획기적으로 높일 수 있음을 증명했다.

HF Daily Papers3달 전· 4달 전 발행

TIPSv2, iBOT++ 도입으로 제로샷 세그멘테이션 성능 대폭 향상

기존 시각-언어 모델들이 이미지의 세부 구역(패치)과 텍스트 개념을 연결하는 데 어려움을 겪던 문제를 해결했다. iBOT++라는 새로운 학습 목적 함수와 고도화된 캡션 생성 전략을 통해 이미지의 미세한 부분까지 정확히 이해하는 능력을 갖추게 되었으며, 이는 자율주행이나 정밀 의료 영상 분석 등 정교한 시각 이해가 필요한 분야에 큰 도움을 줄 수 있다.

HF Daily Papers3달 전· 4달 전 발행

사용자의 성격 변화까지 추적하는 개인화 AI, GPT-4o 성능 추월

기존 멀티모달 모델은 단발성 대화에 치중해 사용자의 취향 변화나 고유한 성격을 장기적으로 기억하지 못하는 한계가 있었다. PersonaVLM은 대화 속에서 사용자의 성격 수치를 실시간으로 업데이트하고 전용 메모리 데이터베이스를 구축하여, 시간이 지나도 사용자에게 최적화된 맞춤형 답변을 제공한다.

LLM 추론 비용 70% 절감하면서 수학 문제 정답률은 30%에서 38%로 향상

대형 언어 모델이 복잡한 문제를 풀 때 여러 경로를 동시에 탐색하면 비용이 기하급수적으로 증가하는데, 이 논문은 틀린 경로를 초기에 잘라내어 비용을 70% 이상 아끼는 방법을 제시한다. 특히 모델 내부의 신호를 직접 활용하여 별도의 외부 모델 없이도 매우 빠르고 정확하게 오류를 잡아낸다.

HF Daily Papers3달 전· 3달 전 발행

Diffusion 모델의 생성 품질 저하 주범인 SNR-t 편향 발견 및 해결

Diffusion 모델이 추론 시 훈련 때와 달리 신호 대 잡음비(SNR)와 타임스텝 간의 불일치를 겪는 SNR-t 편향 문제를 최초로 규명했다. 추가 학습 없이도 생성 품질을 획기적으로 개선할 수 있는 플러그앤플레이 방식의 보정 기법을 제시하여 실무적 가치가 높다.

HF Daily Papers3달 전· 3달 전 발행

LaviGen: 3D 생성 모델로 물리적 충돌 없는 실감나는 공간 자동 배치

기존의 3D 레이아웃 생성 방식은 텍스트를 JSON 형태의 좌표로 변환하는 데 그쳐 가구가 공중에 뜨거나 겹치는 물리적 오류가 잦았다. 이 논문은 3D 생성 모델의 공간 이해 능력을 직접 활용하여 물리적 정합성을 19% 향상시키고 연산 속도를 65% 개선했다.

HF Daily Papers3달 전· 3달 전 발행

LLM 사후 학습 데이터가 모델의 창의성을 62%까지 앗아간다

언어 모델이 사후 학습(Post-training)을 거치며 출력이 획일화되는 '다양성 붕괴' 현상의 근본 원인을 분석한 논문입니다. 단순히 특정 알고리즘의 문제가 아니라 학습 데이터의 구성이 다양성 손실의 시점과 강도를 결정한다는 사실을 밝혀내어, 향후 더 창의적이고 유연한 AI 모델 개발을 위한 데이터 전략의 중요성을 시사합니다.

HF Daily Papers3달 전· 3달 전 발행

단 2개의 비트만 바꿔서 최신 AI 모델 성능을 0%로 파괴

딥러닝 모델이 단 몇 개의 가중치 비트 반전만으로도 완전히 붕괴될 수 있다는 치명적인 보안 취약점을 노출했다. 데이터나 복잡한 최적화 과정 없이 가중치 크기만 분석하여 공격 대상을 찾아내므로, 자율주행이나 금융 시스템 등 안전이 중요한 AI 서비스에 심각한 위협이 된다.

HF Daily Papers3달 전· 3달 전 발행

LLM의 트레이딩 코드 생성 능력, 단순 문법은 통과해도 실제 거래 로직은 70% 수준

LLM의 코드 생성 능력이 비약적으로 발전했음에도 불구하고, 금융 도메인 특유의 복잡한 API 활용과 실행 가능한 트레이딩 로직 구현 능력은 여전히 검증되지 않은 영역이다. 이 논문은 단순한 문법 정확도를 넘어 실제 과거 데이터에서 거래가 발생하는지, 그리고 원래 의도한 전략과 일치하는지를 다단계로 평가하는 엄격한 기준을 제시한다.

HF Daily Papers3달 전· 7달 전 발행

W-RAC: LLM 출력 토큰 84% 절감하며 RAG 검색 정밀도 향상

기존의 LLM 기반 청킹 방식은 텍스트 전체를 다시 생성해야 하므로 비용이 많이 들고 할루시네이션 위험이 있었다. W-RAC은 웹 문서의 구조를 활용해 LLM을 '생성기'가 아닌 '계획기'로 사용하여 비용을 획기적으로 줄이면서도 검색 성능을 유지한다.

내 아이폰에서 Gemma 4가 돌아간다? 초당 40토큰의 놀라운 속도

Apple의 MLX 프레임워크를 사용하여 iPhone 및 Apple Silicon 기기에서 Gemma 4 모델을 오프라인으로 고속 실행하는 방법과 성능을 제시한다.

최신 논문 200만 편을 학습한 AI 에이전트, 코딩 성능 80% 향상

Paper Lantern MCP 서버를 통해 최신 연구 논문의 기법을 실시간으로 검색하여 적용한 코딩 에이전트가 테스트 생성 및 데이터 추출 작업에서 성능을 대폭 개선했다.

Figma의 폐쇄성이 AI 시대에 독이 된 이유: Claude Design의 부상

Figma의 폐쇄적인 파일 포맷이 AI 학습의 장애물이 되면서, 코드를 직접 다루는 Claude Design 같은 도구가 구조적 우위를 점하고 있다.

aifeed.dev3달 전

GitHub 스타 34만 개 OpenClaw의 충격적 실태, 20%가 악성 코드?

OpenClaw 프레임워크가 급격히 성장했으나, 마켓플레이스 스킬의 20%가 악성으로 판명되는 등 심각한 보안 및 거버넌스 위기에 직면했다.

Claude Code 비용 폭탄 해결? AI 코딩 일관성을 잡는 Workspine

기존 GSD 프레임워크의 복잡성과 비용 문제를 해결하기 위해 장기적 일관성과 명세 기반 개발에 집중한 Workspine 프레임워크가 공개됐다.

규칙보다 예시가 강력하다? 104토큰으로 완성한 LLM 페르소나

명시적 규칙보다 구체적 예시를 활용한 프롬프트가 LLM의 특정 말투 재현에 훨씬 효과적임을 실험으로 입증했다.

Claude 비용 낭비 막는 법? BERT 기반 로컬 필터로 토큰 다이어트

BERT 모델을 활용해 LLM에 전달되는 불필요한 로그와 노이즈를 로컬에서 필터링하여 비용을 절감하고 모델 성능을 높이는 PandaFilter 프로젝트가 공개됐다.

AI 에이전트의 황당한 실수와 유머러스한 순간을 수집하는 CLI 도구

Claude Code와 Codex의 세션 로그를 분석하여 익명화된 흥미로운 상호작용 사례를 추출하고 공유하는 오픈소스 프로젝트이다.

단순 챗봇을 넘어선 자율 코딩 에이전트 OCODX의 대규모 업데이트

오픈소스 프로젝트 OCODX가 Agent Gym, MCP 서버 통합, 병렬 실행 스웜 기능을 통해 복잡한 코드베이스를 자율적으로 관리하는 기술 리더 에이전트 아키텍처를 공개했다.