2026년 4월 29일 AI 뉴스
총 100건
Claude 에이전트의 중복 토큰 낭비 방지하는 MCP 서버 공개
레거시 코드 마이그레이션 시 AI 에이전트의 중복 분석을 방지하고 문서화 커버리지를 추적할 수 있는 로컬 MCP 서버 프로젝트이다.
노벨상 수상자 데미스 허사비스가 밝히는 AGI의 마지막 퍼즐과 DeepMind의 전략
Google DeepMind의 CEO 데미스 허사비스가 AGI 실현을 위해 필요한 기억, 추론, 지속적 학습 기술과 AI를 통한 과학적 발견의 미래를 공유합니다.
AI 코딩 어시스턴트가 만든 보안 취약점, llm-audit으로 자동 탐지
TypeScript 및 JavaScript 환경에서 LLM 애플리케이션의 보안 취약점을 OWASP Top 10 기준으로 탐지하는 정적 분석 도구입니다.
아이디어를 즉시 제품으로! Gemini와 Google AI 도구로 구축하는 초고속 빌드 전략
Google DeepMind의 최신 AI 모델인 Gemini, Gemma, Veo 등을 활용하여 아이디어를 신속하게 실제 작동하는 프로토타입으로 구현하는 기술 스택과 실전 노하우를 공유한다.
온디바이스 AI의 미래, 1GB 메모리로 도구 사용까지 가능한 소형 모델 학습법
1GB 미만 메모리에서 도구 호출과 지시 이행이 가능한 소형 모델을 구축하기 위한 온폴리시 선호도 정렬 및 에이전트 강화학습 기반의 LFM 2.5 학습 레시피를 공유한다.
3,000억 달러의 베팅, Oracle과 OpenAI의 위험한 동거
Oracle이 전통적인 데이터베이스 사업을 넘어 OpenAI와의 대규모 인프라 계약을 통해 AI 기업으로의 파격적인 전환을 시도하며 시장의 시험대에 올랐다.
AI와 인간이 함께하는 그룹 채팅의 미래, Shapes 800만 달러 투자 유치
인간과 AI 캐릭터가 동일한 그룹 채팅방에서 소통하는 소셜 플랫폼 Shapes가 800만 달러의 시드 투자를 유치하며 월간 활성 사용자 40만 명을 돌파했다.
AI가 짠 코드가 사용자 데이터를 날릴 뻔했다? 실전 AI 코딩의 치명적 함정
Claude Code를 활용해 macOS 개발 환경 런처를 제작한 개발자가 AI가 작성한 데이터 영속성 로직의 취약점을 발견하고 이를 보완하기 위한 방어적 설계 패턴을 공유했다.
AI 에이전트가 스스로 예측 시장에서 수익을 낼 수 있을까?
Polymarket에서 AI 에이전트 워크플로를 활용해 64건의 모의 투자를 진행한 결과, 가상 자산 50달러를 80.39달러로 증식시켰다.
Apache Spark RTM으로 구현하는 300ms 미만 초저지연 실시간 데이터 처리
Apache Spark의 Structured Streaming 실시간 모드(RTM)를 사용하여 300ms 미만의 지연 시간으로 항공기 텔레메트리 데이터를 처리하고 시각화하는 아키텍처를 소개합니다.
테일러 스위프트가 틱톡에서 돈을 준다? AI 딥페이크 사기 주의보
AI 인증 기업 Copyleaks는 테일러 스위프트와 리한나 등 유명인을 사칭한 AI 딥페이크 영상이 틱톡에서 개인정보 탈취 사기에 악용되고 있다고 경고했다.
월 20달러로 무제한 코드 리뷰? 3가지 AI 워크플로 성능 비교
Anthropic의 도구와 커스텀 멀티 에이전트 워크플로를 활용해 동일한 PR을 리뷰한 결과, 각 방식이 서로 다른 심각한 결함을 발견하며 상호 보완적 효과를 보였다.
Claude Code를 물리 연구 에이전트로 변신시키는 Triptych 공개
Claude Code 위에 구축된 Triptych는 화이트보드, 시각화 패널, 에이전트 검증 루프를 결합하여 물리 연구 및 수식 유도에 최적화된 환경을 제공한다.
API 비용 0원? LLM 셀프 호스팅의 냉혹한 현실과 실전 가이드
LLM 셀프 호스팅 시 발생하는 하드웨어 제약, 양자화에 따른 성능 저하, 컨텍스트 윈도우 관리 등 실제 운영상의 난제와 그에 대한 실무적인 해결 방안을 제시합니다.
PromptPack의 진화: 복잡한 LLM 파이프라인을 위한 선언적 단계 그래프 도입
PromptPack 사양에 선언적 단계 그래프(Composition)를 추가하여 순차적, 조건부, 병렬 처리가 필요한 절차적 LLM 워크플로를 표준화합니다.
Gemma 2B 모델의 한계를 넘는 '한자 압축 프롬프트'와 아첨 현상의 벽
소형 모델의 문맥 망각을 해결하기 위해 한자로 지시문을 압축하는 기법을 시도했으나, 모델의 고질적인 아첨 성향(Sycophancy)은 극복하지 못했다.
AWS Bedrock AgentCore로 AI 에이전트 도구 호출의 보안과 통제력을 극대화하는 방법
Amazon Bedrock AgentCore Runtime을 사용하여 AI 에이전트와 도구 사이의 MCP 트래픽에 커스텀 제어 로직을 삽입하는 서버리스 프록시 구축 및 배포 가이드이다.
뱅가드가 공개한 SQL 지식 없이 데이터 분석하는 AI 아키텍처
뱅가드는 AWS 서비스를 활용해 복잡한 금융 데이터를 자연어로 쿼리할 수 있는 가상 분석가 시스템을 구축하고 8가지 AI 지원 데이터 원칙을 수립했다.
전구 갈아끼우는 로봇의 등장, AI가 해결한 로봇의 손재주
MIT 교수와 구글 딥마인드 출신 연구원이 설립한 Eka는 강화학습과 시뮬레이션을 통해 로봇에게 인간 수준의 정교한 손재주를 학습시키고 있다.
전쟁터로 향하는 VLA 모델: Scout AI가 그리는 자율 무기 체계의 미래
국방 AI 스타트업 Scout AI가 VLA 기술 기반의 군용 자율 운영 모델 Fury를 개발하며 1억 달러의 투자를 유치했다.
매주 4시간을 아껴주는 검증된 5가지 AI 업무 자동화 패턴
실무에서 6개월 이상 지속적으로 사용되며 실질적인 시간을 절약해준 5가지 핵심 AI 워크플로와 프롬프트 구조를 공유한다.
바람난 비서 대신 24시간 일하는 AI 비서 Lindy 도입기
인간 비서의 개인적 일탈과 신뢰 문제를 경험한 후, iMessage 기반 AI 에이전트 Lindy를 도입하여 업무 효율을 높이고 비용을 절감한 실제 사례이다.
오픈소스 AI는 정말 위험할까? 보안 전문가들이 밝히는 진실
AI와 보안 전문가들이 모여 오픈소스 AI가 혁신에 기여하는 방식과 그에 따른 고유한 보안 리스크 및 관리 방안을 심도 있게 논의한다.
4000만 명의 생명을 위협하는 항생제 내성, AI가 해결책 될까
AI 기반의 정밀 진단과 신약 설계 기술이 항생제 내성으로 인한 글로벌 보건 위기를 해결할 핵심 도구로 부상하고 있다.
vLLM 0.20 출시: 2비트 KV 캐시와 DeepSeek V4 최적화로 추론 혁신
vLLM 0.20 출시와 함께 DeepSeek V4를 위한 하드웨어 최적화 경쟁 및 Poolside, NVIDIA의 신규 모델 릴리스 소식을 다룹니다.
스탠포드 전문가가 전하는 Latent Diffusion과 CLIP의 모든 것
이미지 픽셀 공간의 한계를 극복하기 위한 잠재 확산 모델(LDM)의 아키텍처와 VAE, CLIP을 활용한 멀티모달 가이던스 생성 기법을 심도 있게 다룹니다.
Stanford Percy Liang 교수가 직접 알려주는 대규모 모델 병렬 학습의 모든 것
대규모 언어 모델 학습을 위해 단일 GPU의 한계를 넘어 여러 GPU를 효율적으로 활용하는 데이터, 텐서, 파이프라인 병렬 처리 기법의 핵심 원리와 구현 방식을 다룹니다.
표를 CSV로 넣느냐 HTML로 넣느냐에 따라 검색 성능이 달라지는 문제 해결
표 데이터를 AI 모델에 입력할 때 CSV, JSON 등 어떤 형식을 선택하느냐에 따라 검색 성능이 크게 요동치는 불안정성 문제를 발견했습니다. 연구진은 여러 형식의 평균값인 '중심점'을 활용해 형식에 상관없이 표의 본질적인 의미를 정확하게 찾아내는 기술을 제안하여 검색 시스템의 신뢰도를 높였습니다.
LLM 답변의 근거를 웹페이지 HTML DOM에 직접 하이라이트하는 PageGuide
기존 AI 에이전트는 웹페이지에서 정보를 찾아 답변을 주지만, 그 정보가 페이지 어디에 있는지 사용자가 직접 확인하기 어렵다는 한계가 있다. PageGuide는 답변의 근거를 HTML 요소에 직접 시각적으로 연결하여 사용자가 AI의 답변을 즉시 검증하고 복잡한 작업을 단계별로 수행할 수 있도록 돕는다.
Dataiku가 제안하는 로우코드와 풀코드의 결합, 기업 AI 성공의 열쇠
기업용 AI의 성공을 위해 비전문가를 위한 로우코드 도구와 전문가를 위한 풀코드 환경을 단일 거버넌스 플랫폼에서 통합 운영해야 함을 강조한다.
내 Claude가 50만 토큰을 버리고 있었다? 미사용 스킬 분석 결과
Claude Code 사용자가 30일간의 로그를 분석한 결과, 설치된 65개 스킬 중 13개만 실제로 호출되었으며 나머지 52개는 불필요한 토큰 소모만 발생시켰음이 확인됐다.
AI 에이전트로 GPU 커널을 짠다? 인류의 마지막 해커톤 도전하기
OpenAI Codex를 활용해 Mac Metal GPU 커널을 최적화하고 Hugging Face를 통해 경쟁하는 고난도 AI 에이전트 해커톤 가이드이다.
GPT는 구조, Gemini는 확장, Claude는 편집? AI 모델별 역할 분담 노하우
긴 글쓰기 과정에서 GPT, Gemini, Claude에 각각 구조 설계, 내용 확장, 편집 역할을 부여하여 인간의 최종 판단력을 극대화하는 다중 모델 워크플로를 제안했다.
Claude API 비용 90% 절감, 프롬프트 캐싱 최적화 도구 Galadriel 공개
Claude의 프롬프트 캐싱을 극대화하여 API 비용을 90% 절감하고 지연 시간을 85% 줄인 오픈소스 에이전트 Galadriel이 공개됐다.
OpenAI가 총기 난사범의 ChatGPT 위험 신호를 묵인했다?
OpenAI가 캐나다 총기 난사범의 위험 신호를 사전에 감지하고도 경찰 신고 대신 계정 비활성화만 수행했다는 혐의로 소송을 당했다.
Google Antigravity로 코딩해봤다: UI는 합격, 로직은 글쎄?
Google Antigravity를 8시간 동안 테스트한 결과, UI 구성에는 강력하나 복잡한 상태 관리와 프로덕션 환경 적용에는 한계가 있음이 확인됐다.
유료 구독 없이 로컬에서 실행하는 강력한 AI 디자인 에이전트
기존 코딩 에이전트와 연결하여 로컬 환경에서 전문적인 UI 아티팩트를 생성하고 관리할 수 있는 오픈소스 프로젝트 Open Design을 소개한다.
중국 전역 로보택시 면허 중단 바이두 무인차 교통 마비가 불러온 파장
중국 당국이 바이두 아폴로 고 로보택시의 교통 마비 사고 이후 자율주행 차량에 대한 신규 면허 발급을 전면 중단했습니다.
Claude Code에서 윈도우 스크린샷을 바로 붙여넣는 방법
WSL에서 실행되는 Claude Code가 윈도우 클립보드 이미지를 직접 인식하지 못하는 문제를 해결하기 위해 이미지를 임시 파일로 저장하고 경로를 자동 입력해주는 도구가 공개됐다.
OpenAI AWS 상륙과 9초 만에 기업 DB를 삭제한 AI 에이전트의 경고
OpenAI의 AWS 진출로 인한 클라우드 시장 재편과 함께 자율형 AI 에이전트의 보안 취약성 및 군사적 활용에 대한 논의가 확산되고 있다.
GM 차량 400만 대가 똑똑해진다 구글 Gemini AI 전격 도입
제너럴 모터스가 2022년형 이후 모델 400만 대에 구글 Gemini AI를 도입하여 음성 비서 기능을 강화하고 Super Cruise 핸즈프리 주행 10억 마일을 달성했다.
AI가 찾아낸 GitHub의 치명적 보안 결함, 단 6시간 만에 해결
Wiz Research가 AI 모델을 사용하여 GitHub의 내부 인프라에서 수백만 개의 저장소에 접근 가능한 치명적 취약점을 발견했으며, GitHub은 이를 6시간 이내에 패치했습니다.
내 사이트가 ChatGPT 답변에 안 나온다면? CSR의 함정과 해결 방법
React 기반 CSR 사이트는 AI 봇이 내용을 읽지 못하므로, 검색 및 AI 답변 노출을 위해 SSG나 SSR로의 전환이 필수적이다.
1인 개발자가 Claude Code로 9일 만에 마이크로서비스 11개를 배포한 비결
Claude Code를 보조 도구로 활용하여 9일 만에 11개의 마이크로서비스와 인프라를 구축한 사례와 그 과정에서 탄생한 bkit 플러그인을 소개한다.
LLM 에이전트가 마인크래프트 소스 코드를 완벽하게 복구할 수 있을까?
LLM 에이전트와 바이트코드 오라클을 결합하여 마인크래프트의 불완전한 디컴파일 소스를 빌드 가능한 원본 수준으로 복구하는 연구 프로젝트입니다.
단순 프롬프트를 넘어 실전 AI 시스템을 구축하는 5단계 레이어
AI 앱을 실질적인 제품으로 만들기 위해 LLM, MCP, Skill, Agent, Harness로 구성된 5계층 기술 스택과 실행 체인을 제안한다.
GPU 구매 없이 2분 만에 끝내는 서버리스 RAG 배포 실전 튜토리얼
RunPod의 서버리스 GPU 인프라를 활용하여 임베딩 모델과 LLM을 엔드포인트로 배포하고 LangChain으로 RAG 시스템을 구축하는 실무 과정을 다룹니다.
LLM 토큰 없이 0.3ms만에 끝나는 AI 에이전트 가격 협상 프로토콜 ANP
ANP는 AI 에이전트들이 LLM 토큰 소모 없이 바이너리 와이어 프로토콜을 통해 빠르고 정확하게 가격을 협상하고 신원을 증명할 수 있게 돕는 경제 레이어입니다.
AI 에이전트끼리 대화하게 하세요: 메시지 브로커 meshterm
여러 AI 에이전트가 사용자 중계 없이 직접 통신하고 컨텍스트를 공유할 수 있게 해주는 자가 호스팅 메시지 브로커 meshterm이 공개됐다.
Claude Code가 전문가처럼 사고하게 만드는 800줄의 마스터리 스킬
Claude Code에서 약 30회의 웹 검색과 분석을 통해 특정 분야의 전문가 멘탈 모델과 커리큘럼을 생성하고 영구적인 스킬로 저장하는 시스템이다.
인기 AI 이미지의 비밀? 1,000개 프롬프트 분석 데이터셋과 MCP 공개
X에서 가장 인기 있는 AI 이미지 프롬프트 1,000여 개를 분석하여 패턴을 도출하고, 이를 활용할 수 있는 시스템 프롬프트와 MCP 도구를 공개했다.
Nvidia 부사장의 폭로: AI가 인간보다 비싸서 대체가 어렵다?
Nvidia 부사장 Bryan Catanzaro는 현재 AI 연산 비용이 인건비를 크게 앞지르고 있으며, 이로 인해 AI가 인간을 즉각 대체하기는 경제적으로 어렵다고 밝혔다.
LLM은 비유를 얼마나 잘 이해할까? 가로등 효과를 이용한 추론 실험
가로등 효과 비유를 활용해 LLM이 복잡한 은유를 해석하고 제약 조건 하에서 이야기를 재구성하는 능력을 측정하는 실험이다.
단일 쉘 스크립트로 구현된 강력한 LLM CLI, qsh
curl과 jq만으로 작동하며 터미널 세션 컨텍스트를 활용해 디버깅과 질의응답을 수행하는 초경량 LLM CLI 도구입니다.
71.6% 정확도의 UFC 승패 예측 AI, XGBoost와 SHAP으로 구현
XGBoost와 SHAP을 활용하여 UFC 선수의 상대적 전력 차이를 분석하고 71.6%의 정확도로 승패를 예측하는 웹 애플리케이션 구축 사례이다.
AI 에이전트에게 마크다운은 최악? 새로운 대안 'Lessmark' 등장
기존 마크다운의 복잡성과 에이전트 비효율성을 해결하기 위해 새롭게 설계된 경량 마크업 언어 Lessmark가 공개됐다.
Claude Code로 혼자서 스팀 게임 출시? 1인 개발자의 생생한 실전 기록
Claude Code를 활용해 기획부터 7개 국어 현지화까지 마친 2D 로그라이트 게임의 스팀 출시 경험과 AI 개발의 한계를 공유했다.
Claude Code 에이전트끼리 대화한다? 멀티 리포지토리 협업 도구 huddle
여러 개의 Claude Code 세션이 각자의 리포지토리를 유지하면서 하나의 채팅방에서 인간과 함께 소통할 수 있게 해주는 멀티 에이전트 협업 도구 huddle이 공개되었다.
ChatGPT 구독권으로 Claude Code를? API 브리지 활용 팁
OpenAI-Claude 번역 브리지인 better-ccflare를 사용하여 ChatGPT 구독 계정으로 Claude Code를 구동하는 방법이 공유됐다.
Claude Code의 끊임없는 질문이 지겹다면? 자율 주행 Autopilot 모드 등장
Claude Code가 매 단계마다 사용자 승인을 구하는 번거로움을 없애기 위해, 스스로 의사결정하고 로그를 남기는 Autopilot 스킬이 공개됐다.
DeepSeek-V4 프리필 기능으로 에이전트 출력 오류 완벽 해결
DeepSeek-V4가 지원하는 Prefill 기능을 활용해 모델의 응답 시작 지점을 강제함으로써 에이전트의 구조화된 출력 신뢰도를 높이는 방법이 논의됐다.
구글 A2A도 해결 못한 '기억력' 문제, 에이전트 협업의 진짜 장벽은?
구글의 A2A와 Moltbook 사례를 통해 에이전트 간 통신의 무상태성, 보안 취약점, 지속적 정체성 부재라는 핵심 기술적 과제를 분석했다.
Claude Code 에이전트 4명에게 맡긴 카피라이팅이 처참하게 실패한 이유
AI 에이전트 간의 자율 토론은 실제 비판적 사고가 아닌 패턴 매칭을 통한 안전한 결론 수렴으로 이어져 전략적 판단력을 저하시킬 수 있다.
내 컴퓨터에서 돌아가는 AI, Qwen 3.5와 Gemma 4로 시작하기
소비자용 하드웨어에서 로컬 LLM을 구축하여 코딩, 연구, 글쓰기에 실무적으로 활용하는 방법과 최적의 모델 및 도구 조합을 제시한다.
AI 코딩 에이전트의 할루시네이션을 잡는 명세 기반 개발 워크플로
AI 에이전트의 작업 정확도를 높이기 위해 단순 프롬프트 대신 설계 문서, 로드맵, 태스크 분할로 이어지는 구조화된 명세 기반 개발 워크플로를 적용한 경험을 공유했다.
Claude Code 에이전트 수십 개를 동시에? 오픈소스 AgentRQ 등장
Claude Code 에이전트들을 Supervisor-Worker 구조로 조직화하여 실시간 작업 할당 및 스케줄링을 지원하는 오픈소스 시스템 AgentRQ가 공개됐다.
Claude Code 실행 속도 8배 향상, 토큰 낭비 막는 skflow 공개
Claude Code의 커스텀 명령어를 네이티브 스크립트로 컴파일하여 불필요한 AI 호출을 제거하고 실행 속도를 개선하는 skflow가 출시됐다.
AI가 쓴 티 안 나게 글 쓰는 법: 텍스트 교정 프롬프트 팁
AI 특유의 상투적 표현과 문장 구조를 제거하고 가독성을 높여 인간적인 어조로 글을 수정하는 구체적인 프롬프트 지침이다.
최신 모델로 업그레이드했는데 비용은 오히려 줄어든 비결: LLM 에이전트 계층화 전략
저비용 모델로 중복을 필터링하고 고성능 모델로 계획을 수립하는 계층형 에이전트 구조를 통해 CI 로그 분석 비용을 절감하고 성능을 높인 사례입니다.
Stanford Percy Liang 교수가 직접 알려주는 GPU 최적화와 Triton 커널 작성법
GPU의 하드웨어 아키텍처를 이해하고 최적의 성능을 내기 위한 벤치마킹, 프로파일링 기법 및 Triton을 이용한 커널 작성법을 다룹니다.
Claude Code의 코딩 할루시네이션을 극복하는 7가지 실무 원칙
Claude Code로 클라우드 보안 도구를 개발하며 겪은 할루시네이션 문제를 해결하기 위해 결정론적 설계와 엄격한 테스트 체계를 구축한 경험담이다.
강화학습으로 비디오 생성의 3D 일관성 10.23dB 향상 달성
기존 비디오 생성 모델은 물리적 법칙에 대한 이해 부족으로 물체가 왜곡되거나 사라지는 기하학적 오류를 자주 범한다. World-R1은 모델 구조 변경 없이 강화학습만으로 비디오의 3D 일관성을 획기적으로 개선하여, 단순한 영상 제작을 넘어 실제 세상을 시뮬레이션하는 월드 모델로의 진화를 가능하게 한다.
LLM에 '나쁜 성격' 부여하면 젠더 편향 최대 2배 증폭 확인
AI에게 특정 성격을 부여하는 '페르소나 설정'이 의도치 않게 성차별적 고정관념을 강화할 수 있음을 입증했다. 특히 반사회적 성격 특성이 주어질 때 모델의 젠더 편향이 급격히 심화되며, 이는 교육이나 고객 서비스용 AI 설계 시 성격 설정이 공정성 제어의 핵심 변수임을 시사한다.
양자 커널, 의료 영상 분석에서 고전 모델의 '붕괴' 현상 해결
의료 영상 분석에서 기존 AI 모델들이 특정 조건에서 데이터를 제대로 구분하지 못하고 다수결로만 예측하는 '고전적 붕괴' 현상을 양자 컴퓨팅 기술로 해결할 수 있음을 입증했다. 실제 흉부 엑스레이 데이터를 활용하여 양자 머신러닝이 실질적인 의료 진단 보조 도구로서 고전 모델보다 더 정밀한 분류가 가능함을 보여준 중요한 사례이다.
DeFI: 대규모 웹 비디오로 로봇의 행동 예측 성능 81.3% 달성
기존의 로봇 학습 모델은 행동 라벨이 없는 일반 비디오 데이터를 활용하는 데 한계가 있었으나, 이 논문은 시각적 예측과 행동 추론을 분리하여 대규모 웹 데이터를 효과적으로 학습할 수 있는 프레임워크를 제시한다. 이를 통해 데이터 수집 비용을 크게 낮추면서도 실제 로봇 조작 작업에서 SOTA 성능을 기록했다.
CREDENCE: AI의 '모름'과 데이터의 '모호함'을 분리해 신뢰도 2배 향상
기존의 AI 모델은 자신이 잘 모르는 것(학습 부족)과 데이터 자체가 모호한 것(해석의 다양성)을 구분하지 못해 일괄적인 신뢰도 점수만 제공했다. 이 논문은 두 종류의 불확실성을 분리하여 측정함으로써, 데이터를 더 수집해야 할 상황과 사람이 직접 검토해야 할 상황을 명확히 구분해 AI 시스템의 의사결정 신뢰도를 높인다.
Apple 연구진, KV 캐시 75% 절감하고도 성능 유지하는 기법 공개
Transformer 모델의 추론 시 발생하는 KV 캐시 메모리 병목 현상을 해결하기 위해 층 간 캐시 공유를 제안한다. 기존의 시간축 압축 방식과 달리 깊이 차원의 중복성을 활용하여 메모리 사용량을 획기적으로 줄이면서도 추론 속도를 개선한다.
Vision Transformer 중간 층만 써도 얼굴 인식 품질 평가 성능 50% 효율화
기존의 얼굴 이미지 품질 평가(FIQA)는 딥러닝 모델의 마지막 층 결과물만 사용했으나, 본 논문은 중간 층에서도 유의미한 품질 정보가 생성됨을 최초로 입증했다. 이를 통해 연산량을 최대 50% 절감하면서도 최신 기술(SOTA) 수준의 정확도를 유지할 수 있어 저사양 기기에서의 실시간 얼굴 인식 시스템 구축에 기여한다.
문서 추출 오류 0% 도전, 재구성 검증으로 GPT-4.1 자동 복구 구현
기존의 문서 처리 시스템은 추출 결과가 원본과 얼마나 일치하는지 스스로 검증할 수 없어 오류가 그대로 하류 시스템에 전달되는 문제가 있었다. 이 논문은 추출된 데이터를 다시 이미지나 텍스트로 그려보고 원본과 비교하는 '재구성' 방식을 통해 별도의 정답 레이블 없이도 추출 품질을 실시간으로 측정하고 오류를 자동 수정하는 새로운 패러다임을 제시한다.
생성형 AI 평가 비용 8~65배 절감 및 실패 사례 탐지율 2~5배 향상
생성형 AI 모델의 성능 평가와 안전성 검증에 드는 막대한 비용과 시간을 획기적으로 줄여주는 프레임워크이다. 베이지안 통계와 전이 학습을 결합하여 아주 적은 수의 테스트만으로도 전체 성능을 정확히 예측하고, 모델이 취약한 특정 실패 지점을 지능적으로 찾아낸다.
LLM 에이전트, 단 1비트의 위험 신호만으로 스스로 안전 규칙을 학습
LLM 에이전트가 복잡한 보상 함수나 상세한 피드백 없이도 상호작용을 통해 숨겨진 안전 제약 조건을 스스로 발견할 수 있음을 입증했다. 이는 안전이 중요한 환경에서 사람이 일일이 규칙을 작성하지 않아도 에이전트가 안전하게 작동할 수 있는 새로운 학습 패러다임을 제시한다.
VLM의 환각 문제 해결, 토큰 단위 보상 모델로 추론 정확도 대폭 개선
시각-언어 모델(VLM)이 복잡한 추론 과정에서 겪는 지각적 오류와 환각 문제를 해결하기 위해 토큰 단위의 세밀한 피드백을 제공하는 새로운 보상 모델을 제안합니다. 기존의 결과 중심 보상 방식이 가진 한계를 극복하고 추론 단계마다 시각적 근거를 검증함으로써 모델의 신뢰성을 높였습니다.
추가 학습 없이 ViT 어텐션만으로 얼굴 인식 품질 90% 이상 예측
얼굴 인식 시스템의 신뢰성을 높이기 위해서는 입력 이미지의 품질을 정확히 판단하는 것이 필수적이다. 이 논문은 별도의 추가 학습이나 복잡한 연산 없이 기학습된 Vision Transformer의 내부 어텐션 정보만으로 이미지 품질을 측정하는 효율적인 방법을 제시한다.
3D LiDAR 이상 탐지 성능 9.8% 향상 및 실시간 추론 달성
자율 주행 시스템이 학습하지 못한 미지의 객체를 정확히 식별하는 것은 안전을 위해 필수적이다. 이 논문은 기존 2D 기법의 한계를 넘어 3D 특징 공간에서 직접 이상치를 탐지하는 효율적인 방법론과 새로운 벤치마크 데이터셋을 제공하여 실전 자율 주행의 신뢰성을 높인다.
루프형 LLM의 효율성 측정: 반복 1회는 고유 파라미터 0.46개의 가치
동일한 레이어를 반복 사용하는 루프형 모델이 실제 고유 레이어를 사용하는 모델 대비 어느 정도의 효율을 갖는지 정량적으로 측정했다. 이를 통해 루프형 아키텍처 설계 시 단순한 손실값 감소를 넘어 실제 추론 비용 대비 성능 이득이 있는지 판단할 수 있는 기준을 제공한다.
SAS 기법으로 LLM 추론 길이는 16% 줄이고 정확도는 높였다
LLM의 추론 능력을 높이기 위해 생성 길이를 늘리는 시도가 많지만, 이는 비용과 속도 면에서 비효율적이다. 이 논문은 추가적인 보상 모델 없이도 추론 과정을 압축하면서 학습 안정성을 확보하는 방법을 제시하여 효율적인 AI 추론 연구의 새로운 방향을 제시한다.
과학 논문 PDF를 실제 컴파일 가능한 LaTeX 코드로 완벽 복원하는 TEXOCR
기존 OCR 시스템은 PDF를 단순 텍스트나 마크다운으로 변환하여 수식이나 표의 구조적 정보를 손실하는 경우가 많았다. 이 논문은 단순 텍스트 인식을 넘어 실제 논문 출판에 즉시 사용 가능한 컴파일 가능한 LaTeX 코드로 복원하는 기술을 제시하여 과학 지식의 재사용성을 극대화한다.
기존 VLM 벤치마크의 오류 수정으로 오픈소스 모델 성능 최대 40% 하락 확인
기존의 시각적 공간 지능(VSI) 평가 도구들이 실제 비디오 입력과 일치하지 않는 잘못된 정답지를 가지고 있어 모델의 능력을 왜곡하고 있음을 밝혀냈습니다. 이를 해결하기 위해 3D 주석을 전면 재검토하고 프레임 수에 따라 정답이 변하는 새로운 평가 체계를 도입하여 모델의 실제 공간 추론 능력을 더 엄밀하게 측정할 수 있게 되었습니다.
OmniShotCut, 샷 간 관계 분석으로 비디오 경계 검출 SOTA 달성
기존의 샷 경계 검출 기술은 단순한 장면 전환점만 찾을 뿐, 전환의 종류나 샷 사이의 논리적 관계를 파악하지 못해 비디오 생성 모델 학습용 데이터 정제에 한계가 있었다. 이 논문은 Transformer 기반의 샷 쿼리 방식을 도입하여 미세한 편집 오류인 'Sudden Jump'까지 잡아내고 샷 간의 관계를 구조적으로 예측함으로써 고품질 비디오 데이터셋 구축의 효율성을 극대화한다.
AI 에이전트 기업 OneManCompany, PRDBench 성공률 84.67% 달성
기존 멀티 에이전트 시스템은 고정된 워크플로우와 특정 프레임워크에 종속되어 복잡한 실무 문제를 해결하는 데 한계가 있다. 이 논문은 에이전트를 '인재'로 정의하고 기업 조직 구조를 모방한 관리 계층을 도입하여, 스스로 팀을 구성하고 학습하며 진화하는 자율 AI 조직의 가능성을 제시한다.
Meta, 10억 장의 이미지로 학습한 4K 해상도 인간 비전 모델 Sapiens2 공개
인간의 자세 추정, 신체 분할 등 인간 중심 비전 작업에서 고해상도 데이터 처리는 필수적이지만 연산 비용이 매우 높았다. Sapiens2는 10억 장의 고품질 데이터와 효율적인 4K 아키텍처를 통해 기존 모델 대비 자세 추정 정확도를 4 mAP 개선하고 신체 분할 성능을 24.3 mIoU 높이는 등 압도적인 성능 향상을 달성했다.
시각 인코더 없이 픽셀로 직접 학습하는 Tuna-2, 멀티모달 SOTA 달성
기존 멀티모달 모델이 의존하던 복잡한 시각 인코더(VAE 등)를 완전히 제거하고 원시 픽셀 데이터를 직접 처리하는 혁신적인 구조를 제안한다. 이를 통해 이미지 이해와 생성 작업 간의 불일치를 해결하고, 미세한 시각적 디테일이 필요한 작업에서 기존 모델을 압축하는 성능을 보여준다.
VLA 로봇 모델의 물리적 위협과 안전 방어 체계 총정리
시각, 언어, 행동을 통합한 VLA 모델이 로봇 공학의 주류가 됨에 따라 텍스트 기반 AI와는 차원이 다른 물리적 안전 위협이 발생하고 있다. 이 논문은 VLA 시스템의 고유한 취약점을 체계적으로 분류하고 차세대 로봇 시스템이 갖춰야 할 안전 설계 가이드라인을 제시한다.
역전파 없이 LLM 학습 데이터 가치를 6배 빠르게 평가하는 For-Value
LLM 학습에 사용되는 방대한 데이터 중 어떤 데이터가 모델 성능에 기여하는지 파악하는 것은 중요하지만, 기존 방식은 계산 비용이 너무 높았습니다. For-Value는 복잡한 역전파 과정 없이 단 한 번의 순방향 추론만으로 데이터의 가치를 정확히 측정하여 학습 효율을 극대화합니다.
SFT로 인한 할루시네이션, 자기 증류로 망각률 15%에서 3%로 절감
LLM이 새로운 지식을 배울 때 기존에 알고 있던 사실을 틀리게 대답하는 할루시네이션 현상이 발생하는 근본 원인을 규명했다. 파인튜닝 과정에서 발생하는 지식 간섭을 지속 학습 관점에서 해석하고, 자기 증류 기법을 통해 기존 지식 보존과 새 지식 습득을 동시에 달성할 수 있음을 입증했다.
UniGeo, 비디오 생성 AI로 끊김 없는 카메라 시점 전환 이미지 편집 구현
기존의 카메라 제어 이미지 편집 방식은 단일 이미지 기반 확산 모델을 사용하여 연속적인 카메라 움직임에서 화면이 깨지거나 구조가 왜곡되는 문제가 있었다. 이 논문은 비디오 생성 모델의 연속적인 시점 정보를 활용하고 기하학적 가이드를 모델 전체 구조에 통합하여, 복잡한 카메라 이동 중에도 사물의 구조를 완벽하게 유지하는 기술을 제시한다.
LLM 에이전트의 남 탓 편향, 변증법적 정렬로 해결
LLM 에이전트가 역할을 맡을 때 발생하는 인간과 유사한 인지 편향인 행위자-관찰자 비대칭성(AOA)을 최초로 규명했습니다. 실행 에이전트는 외부 탓을 하고 검토 에이전트는 내부 탓을 하는 이 편향은 협업 효율을 저해하며, 이를 해결하는 ReTAS 프레임워크는 에이전트 간의 객관적인 합의 형성을 가능하게 합니다.