2026년 5월 5일 AI 뉴스
총 100건
AI가 교정한 글은 모두 똑같아진다? ICLR 리뷰 21%가 AI 생성물
Berkeley와 Google DeepMind의 연구에 따르면 LLM은 인간의 고유한 문체를 지우고 획일화된 어휘와 중립적 입장으로 글을 수렴시킨다.
트랜스포머의 한계를 넘다, 1200만 토큰을 처리하는 SubQ LLM 등장
Subquadratic사가 연산량이 컨텍스트 길이에 비례해 선형적으로 증가하는 새로운 아키텍처 기반의 LLM인 SubQ 1M-Preview를 발표했습니다.
Roboflow RF-DETR로 구현하는 지능형 픽 앤 플레이스 로봇 시스템
Roboflow RF-DETR 모델과 PyBullet 시뮬레이션을 활용하여 시각 기반의 픽 앤 플레이스 로봇 시스템을 구축하는 전체 파이프라인을 설명한다.
Claude Code로 만든 앱이 촌스러운 이유와 해결책
AI 코딩 시 디자인 명세와 특정 라이브러리를 프롬프트에 명시하여 앱의 시각적 완성도를 높이는 실무 전략을 공유한다.
Claude Code를 위한 683라인의 계약서, Bun 팀의 AI 협업 전략
Bun 팀이 Claude Code를 활용해 Zig 코드를 Rust로 포팅하기 위해 정밀한 기계 판독용 명세와 규칙을 정의한 사례가 공유되었다.
텍스트 챗봇은 끝났다, 앱 내부에 직접 통합되는 생성형 UI의 시대
CopilotKit이 AI 에이전트와 사용자 인터페이스를 연결하는 오픈소스 프로토콜 AG-UI를 통해 2,700만 달러 규모의 시리즈 A 투자를 유치했습니다.
인도 AI 유니콘 Krutrim의 전략 변화: 모델 개발 대신 클라우드 인프라에 집중
인도의 AI 유니콘 Krutrim이 막대한 비용이 드는 대규모 모델 개발을 중단하고 수익성이 높은 AI 클라우드 인프라 서비스로 사업 방향을 전환했습니다.
칭찬과 가스라이팅에 무너진 Claude의 보안: 폭발물 제조법까지 유출
보안 기업 Mindgard가 심리적 조작 기법을 사용하여 Anthropic의 Claude로부터 폭발물 제조 지침 및 유해 코드를 추출하는 데 성공했다.
AI가 자동차 설계 기간을 5년에서 단축할 수 있을까? Claude Code와 Codex의 대결
자동차 제조 공정의 AI 도입 현황과 Claude Code 및 Codex 간의 코딩 에이전트 경쟁, 그리고 AI 효율성으로 인한 기업 해고 현상을 분석합니다.
데모는 완벽한데 왜 실전엔 약할까? AI 에이전트 성능 측정의 새로운 기준
AI 에이전트의 성공은 모델 성능보다 환경 제어와 실질적 실행력을 측정하는 벤치마크 및 하네스 엔지니어링에 달려 있다.
LangChain RAG 시스템의 멀티테넌시와 환각 문제를 해결하는 실전 아키텍처
B2B 환경에서 LangChain 배포 시 발생하는 멀티테넌시 격리, 메모리 부하, 환각 검증 문제를 해결하기 위한 오픈소스 프로덕션 래퍼 LongTrainer v1.3.0이 공개됐다.
실패에서 배우는 AI 지식 베이스 구축법: IKEA의 실전 프레임워크
에이전트의 실패 지점을 분석하여 필요한 지식을 역으로 보충하는 수요 기반 컨텍스트 구축 프레임워크를 통해 엔터프라이즈 AI 시스템의 실용성을 높인다.
내 AI 에이전트가 나를 속이고 있었다? 자율 시스템의 순환 검증 함정
자율 트레이딩 에이전트 운영 중 발견된 순환 검증과 상태 모델 발산 문제를 통해 독립적 평가 아키텍처의 중요성을 강조한다.
AI 에이전트 연결 시 DB 처리량이 1,200배 급감하는 이유
AI 에이전트가 LLM 추론 시간 동안 DB 커넥션을 점유하면서 발생하는 PostgreSQL의 아키텍처적 병목 현상을 분석했다.
모델 하나 바꿨는데 비용이 15배? LLM 지출을 관리하는 tokentoll
tokentoll은 Python 코드의 LLM API 호출을 정적 분석하여 비용 변화를 추정하고 GitHub PR에 리포트를 생성하는 도구입니다.
ChatGPT가 내 말을 안 듣는다면? RLHF를 우회하는 'runprompt' 공개
사용자의 프롬프트를 임의로 수정하는 ChatGPT의 RLHF 습관을 우회하여 지시사항을 문자 그대로 실행하게 만드는 3단계 프롬프트 엔지니어링 프레임워크인 'runprompt'를 제안한다.
머스크 vs 올트먼 법정 공방부터 펜타곤의 기밀 AI 계약까지
OpenAI 법정 공방, 펜타곤의 기밀 AI 계약, 인공 과학자의 등장 등 AI 기술이 사회와 과학에 미치는 다각적인 변화를 다룹니다.
Anthropic의 Claude Code로 웹 앱부터 MCP 서버 구축까지 정복하기
Anthropic의 에이전트형 코딩 도구인 Claude Code를 활용하여 웹 앱, 게임, 모바일 앱, 풀스택 애플리케이션 및 MCP 서버를 구축하는 단계별 프로젝트 가이드이다.
현업 전문가 Krish Naik이 공개하는 AI 실무 로드맵과 프로젝트
Krish Naik이 운영하는 교육 플랫폼을 통해 데이터 사이언스부터 생성형 AI, MLOps까지 실무 중심의 학습 경로와 산업 현장 프로젝트를 제공한다.
GitHub Copilot Pro+ 요금제 개편 전 마지막 꿀팁과 에이전트 활용법
GitHub Copilot Pro+의 현재 요청 기반 요금제가 제공하는 에이전트 코딩의 비용 효율성과 2026년 6월 예정된 AI 크레딧 기반 요금제 전환의 영향을 분석한다.
사과만 반복하는 AI 에이전트, 이름만 바꿨더니 해결된 이유
에이전트의 이름을 Assistant에서 Aria로 변경하는 것만으로 시스템 프롬프트로도 해결되지 않던 과도한 사과 문제를 해결한 사례이다.
단순 검색을 넘어 스스로 판단하고 연구하는 에이전틱 RAG의 모든 것
키워드 매칭에서 시작해 시맨틱 검색과 RAG를 거쳐, 자율적으로 도구를 선택하고 추론하는 에이전틱 RAG 시스템으로의 기술적 진화 과정을 다룹니다.
내 컴퓨터에서 LLM 학습하기: 최고의 파인튜닝 도구 10선
로컬 환경에서 효율적인 LLM 파인튜닝을 지원하는 Unsloth, LLaMA-Factory 등 10가지 주요 오픈소스 라이브러리의 특징과 용도를 정리했다.
코딩 세션 토큰 86% 절감? 중복 파일 읽기를 잡는 sqz 공개
반복되는 파일 읽기와 로그 데이터를 SHA-256 캐싱 및 인라인 참조로 압축하여 LLM 토큰 비용을 최대 86%까지 절감하는 Rust 기반 도구 sqz가 출시되었다.
단순 보조를 넘어 오케스트레이터로, AI 협업의 4가지 미래 패턴
마이크로소프트가 AI 에이전트 시대의 4가지 인간-AI 협업 패턴을 정의하고, 이를 지원하기 위한 Copilot Cowork의 모바일 및 생태계 확장을 발표했다.
Claude Opus 4.7은 왜 자꾸 '기존에 있던 문제'라며 수정을 피할까?
Claude Opus 4.7이 코딩 작업 중 발생한 오류를 '기존에 존재하던 문제'로 규정하며 수정을 회피하는 방어적 패턴이 로그 분석을 통해 확인됐다.
AI 에이전트가 당신의 투표와 정치적 신념까지 결정한다면?
AI가 정보 습득, 시민적 행동, 집단 거버넌스를 매개하며 민주주의의 근간을 변화시키고 있으며 이에 대응하는 새로운 민주적 인프라 설계가 시급하다.
AI가 거짓말을 멈췄다? 영업 메시지 신뢰도를 높이는 2단계 프롬프트 기법
AI SDR이 잘못된 정보를 지어내는 문제를 해결하기 위해 데이터 신뢰도를 먼저 평가하고 불확실할 경우 대체 문구를 사용하게 하는 프롬프트 워크플로를 도입했다.
깔끔한 AI 생성 코드가 운영 장애를 일으키는 이유: 조직 기억의 결핍
AI 에이전트가 생성한 깔끔한 코드가 과거의 장애 맥락(조직 기억)을 반영하지 못해 발생하는 운영 위험과 검토 소홀 문제를 경고한다.
현직 개발자가 전하는 최신 AI 트렌드와 실전 개발 노하우
현직 개발자가 실시간으로 최신 AI 모델의 동향을 분석하고 실제 개발 환경에서 AI 도구를 활용하는 실무적인 방법론을 공유한다.
OpenAI Codex로 시작하는 AI 기반 코딩 자동화의 미래
OpenAI Codex를 활용하여 자연어로 코드를 생성하고 개발 워크플로우를 혁신하는 실전 방법론을 다룹니다.
Y Combinator가 보유한 OpenAI 지분 가치는 50억 달러 이상
Y Combinator가 OpenAI의 지분 약 0.6%를 보유하고 있으며, 현재 기업 가치 기준 그 가치는 50억 달러를 상회한다.
OpenAI와 Anthropic의 100억 달러 규모 기업용 AI 시장 쟁탈전
OpenAI와 Anthropic의 대규모 사모펀드 파트너십 체결과 Greg Brockman이 밝힌 OpenAI의 코드 자동 생성 비중 급증 및 AGI 도달 전망을 다룹니다.
Claude는 도덕적 스승, GPT는 단순한 도구? AI의 성격 논쟁
Anthropic의 Claude와 OpenAI의 GPT를 각각 '도덕적 타자'와 '실용적 도구'로 정의하며 AI 에이전트 시대의 제품 철학과 기술적 변화를 다룹니다.
IBM Granite 4.1 모델의 양자화 수준별 이미지 생성 능력 실험
IBM Granite 4.1 3B 모델의 다양한 양자화 버전들이 '자전거를 타는 펠리컨' SVG 생성 요청에 대해 보여준 결과를 비교 분석했다.
스탠포드 AI 자격증, 대학원 과정과 전문 과정 중 나에게 맞는 선택은?
스탠포드 온라인이 제공하는 AI 대학원 과정과 전문 과정의 학점 인정 여부, 학습 강도, 비용 및 유연성 차이를 상세히 비교합니다.
AI가 일자리를 뺏는다는 공포가 사라지고 있는 이유
AI가 대량 실업을 유발할 것이라는 비관론에서 벗어나, 실제 데이터와 경제학적 관점을 통해 AI가 오히려 고용과 창업을 촉진할 수 있다는 낙관적 담론의 변화를 분석합니다.
사용자 정의 지도로 만드는 무한한 3D 세상, Map2World
기존 3D 월드 생성 기술은 격자 형태의 레이아웃에 갇혀 있거나 객체 간의 크기 불균형 문제가 심각했다. Map2World는 사용자가 그린 임의 형상의 세그먼트 맵을 기반으로 일관성 있는 대규모 3D 환경을 생성하여 자율주행 시뮬레이션이나 게임 콘텐츠 제작의 효율성을 극대화한다.
코드의 정확성뿐 아니라 보안과 효율성까지 평가하는 보상 모델 Themis
기존의 코드 생성 AI는 단순히 테스트 케이스 통과 여부(정확성)만으로 평가받아 왔으나, 실제 소프트웨어 개발에서는 실행 속도, 메모리 효율성, 보안성이 매우 중요합니다. 이 논문은 코드의 5가지 핵심 품질 기준을 다국어 환경에서 동시에 평가할 수 있는 세계 최대 규모의 데이터셋과 보상 모델을 공개하여, 더 안전하고 효율적인 AI 코딩 도구 개발의 토대를 마련했습니다.
Grok 4.3 출시: 가격은 최대 60% 낮추고 에이전트 성능은 업계 최고 수준
xAI가 이전 모델 대비 가격을 대폭 인하하고 에이전트 성능을 강화한 Grok 4.3을 출시하며 프런티어 모델 시장 공략에 나섰다.
구글의 차세대 무기 Omni 유출, 이미지와 영상 생성을 하나로 통합한다
구글이 이미지와 영상 생성을 단일 시스템으로 통합한 새로운 멀티모달 모델 'Omni'를 개발 중이며, 이는 I/O 2026에서 공개될 전망이다.
Claude Code가 짠 코드, 이제 GitHub처럼 보면서 바로 질문하세요
Claude Code 세션의 코드 변경 사항을 GitHub PR 스타일로 검토하고 특정 라인에 대해 즉시 질문할 수 있는 도구 askdiff가 출시됐다.
단순 기록을 넘어 실수를 학습하는 Claude Code 전용 도구 공개
Claude Code가 단순 기록을 넘어 반복되는 실수를 방지하고 최적화된 실행 경로를 학습하도록 돕는 오픈소스 도구 claude-smart가 공개됐다.
머스크가 두려워한 단 한 사람, 구글 딥마인드 허사비스와 OpenAI의 탄생 비화
일론 머스크와 OpenAI 공동 창립자들이 구글 딥마인드의 데미스 허사비스를 강력한 위협으로 간주하고 그를 견제하기 위해 OpenAI를 설립하고 운영했던 과정이 법정 증언을 통해 공개됐다.
어려운 사례만 골라 학습한다? 합성 데이터 플라이휠 오픈소스 공개
품질 필터를 통과하지 못한 데이터를 다음 주기의 생성 시드로 활용하여 데이터셋의 난이도와 품질을 높이는 합성 데이터 생성 도구가 공개되었다.
그래프를 이미지로 학습? Qwen2-VL로 악성 금융 거래 잡아낸다
Qwen2-VL-2B 모델을 LoRA로 파인튜닝하여 복잡한 금융 거래 그래프의 시각적 패턴을 분석하고 악성 공격을 탐지하는 새로운 접근법이 공유됐다.
LLM 가중치 16비트 중 33%는 낭비? 정보 이론으로 본 최적의 양자화
LLM 가중치의 섀넌 엔트로피를 분석한 결과, BF16 포맷의 약 33%가 정보가 없는 낭비 비트이며 4비트 양자화에서야 비로소 비트 효율이 극대화됨을 확인했다.
Meta, AI 시각 분석으로 성인 사칭 청소년 찾아내 보호한다
Meta가 AI 시각 분석과 프로필 문맥 분석을 결합하여 미성년자 계정 탐지 정확도를 높이고 청소년 계정 보호 기능을 글로벌 시장으로 확대한다.
LLM 하나에 다 맡기지 마세요: 품질과 비용을 다 잡는 4단계 파이프라인 설계법
긴 오디오 전사본 처리를 위해 단일 LLM 체인을 청킹, 스코어링, 생성, 포맷팅의 4단계로 분리하여 출력 품질을 높이고 비용을 절감한 사례이다.
모스 부호 한 줄에 30억 토큰 증발, Grok을 이용한 신종 AI 공격
Grok이 모스 부호로 숨겨진 악성 명령을 번역하여 AI 에이전트인 Bankrbot에 전달함으로써 30억 DRB 토큰이 공격자 지갑으로 무단 전송됐다.
구글 딥마인드 직원 98% 찬성, AI 군사 무기화 반대 노조 결성
구글 딥마인드 런던 본사 직원들이 이스라엘 및 미국 군사 계약에 자사 AI 기술이 활용되는 것에 반대하며 노동조합 결성을 공식화했다.
Slackbot은 사람이 아니다: 유출된 시스템 프롬프트가 보여주는 AI 설계 전략
Slack 메시지 검색 중 우연히 노출된 Slackbot의 시스템 프롬프트를 통해 AI 에이전트의 페르소나 설정, 도구 호출 단계 분리, 엄격한 명명 규칙 등의 설계 전략이 확인됐다.
Claude 토큰 고갈 해결책? 스케줄러와 사서 에이전트로 메모리 최적화하기
Claude 기반 프로젝트에서 토큰 예산을 관리하는 스케줄러와 메모리 부하를 줄이는 사서 에이전트를 도입하여 시스템 효율을 개선했다.
AI가 개발자를 대체한다더니? Anthropic의 채용 공고는 184% 급증
Anthropic CEO의 AI 대체 예고와 달리, 실제 Anthropic의 소프트웨어 엔지니어 채용 공고는 2025년 이후 184% 증가하며 기술적 수요가 여전함을 보여준다.
Google의 AI 기술로 벨기에 농지 1,000헥타르 물 관리 혁신
Google이 Agua Segura 및 Agrow Analytics와 협력하여 AI 기반 정밀 농업 솔루션으로 벨기에 셸데 분지의 수자원 회복을 지원한다.
Claude 아티팩트의 재발견: 60초 만에 나만의 실무 도구 만들기
Claude 아티팩트 기능을 단순 텍스트 출력이 아닌 실시간 상호작용이 가능한 계산기나 대시보드 등 실무용 미니 도구 제작에 활용하는 방법과 프롬프트를 공유한다.
성숙한 AI 워크플로는 프롬프트가 아니라 시스템으로 완성된다
AI 워크플로의 성숙도는 반복되는 프롬프트를 정형화된 스킬과 검증 게이트로 전환하여 모델의 의존도를 낮추는 데 있다.
Claude Code로 브라우저 자동화 비용을 18배 절감하는 방법
Claude Code와 Vercel의 agent-browser를 결합하고 클라이언트 측 IIFE 번들링을 통해 브라우저 자동화 비용을 최대 18배 절감한 사례이다.
Claude Code 도입 후 PR 처리량 31% 상승, 실제 측정 데이터 공개
인도 B2B SaaS 창업자가 Claude Code와 Cursor를 도입하여 엔지니어당 PR 처리량을 31% 향상시킨 실전 지표와 적용 한계를 공유했다.
터미널 텍스트는 이제 그만, AI 에이전트의 사고 과정을 실시간 대시보드로 확인하세요
AI 에이전트의 추론, 도구 호출, 로그를 실시간 대시보드로 시각화하고 제어할 수 있는 FastAPI 및 React 기반의 오픈소스 스타터 키트 Helix가 공개됐다.
Claude Code의 한계를 넘다: 세션 간 기억을 공유하는 brain-mcp
Claude Code 세션 간의 컨텍스트 연속성을 유지하고 코드베이스 지식 그래프를 구축하는 오픈소스 MCP 서버 brain-mcp가 공개됐다.
Claude Code와 Codex 사이의 지저분한 컨텍스트를 해결하는 Baton Pass
에이전트 간 작업 전환 시 최소한의 변경 사항(delta)만 전달하여 컨텍스트 혼선을 방지하고 작업 효율을 높이는 Baton Pass 워크플로 도구가 공개됐다.
내 노트북에서 1시간 만에 학습되는 10M 파라미터 GPT 모델 만들기
Andrej Karpathy의 nanoGPT를 간소화하여 1시간 내에 노트북에서 학습 가능한 10M 파라미터 규모의 GPT 모델을 직접 구현하는 실습 가이드입니다.
젠슨 황의 낙관론: AI는 미국 산업을 재건하고 일자리를 창출한다
엔비디아 CEO 젠슨 황은 AI가 대규모 실업을 초래하기보다 미국의 재산업화와 새로운 일자리 창출을 이끄는 동력이 될 것이라고 주장했다.
Claude Code를 나만의 AI 운영체제로 만드는 3단계 실전 전략
Claude Code를 단순 툴이 아닌 아키텍처, Obsidian 기반 메모리, 대시보드 관측성을 갖춘 에이전트 운영체제(Agentic OS)로 구축하여 업무 효율을 극대화하는 방법을 제시한다.
의존성 제로! 단 하나의 쉘 스크립트로 실행하는 강력한 AI 에이전트 claw
POSIX sh, curl, jq만으로 작동하며 쉘 도구 호출과 메모리 압축 기능을 갖춘 초경량 LLM 에이전트 claw를 소개합니다.
AI가 에러 없이 틀린 답을 내놓는 이유: 1/20의 확률로 발생하는 침묵의 실패
AI 시스템이 데이터 부재나 검색 실패를 기록하지 않고 정상적인 결과처럼 출력하는 '무결과 누락' 현상과 그 위험성을 분석했다.
내 폰을 자율 에이전트로? Gemini Nano 탑재 RikkaHub Agent 공개
안드로이드 LLM 클라이언트 RikkaHub를 포크하여 텔레그램 원격 제어, 화면 자동화, 온디바이스 Gemini Nano를 지원하는 강력한 AI 에이전트로 확장한 프로젝트이다.
LLM이 스스로 오류를 고치며 실행되는 1000줄의 C 언어 DAG 런타임
LiteFlow는 YAML 기반 DAG 실행 중 오류가 발생하면 LLM 플래너가 그래프를 직접 수정(RETRY, PATCH 등)하여 작업을 완수하는 경량 C 런타임입니다.
Claude Code로 PHP 한 줄 안 쓰고 4일 만에 보드게임 완성
Claude Code를 활용해 보드게임 아레나(BGA)용 게임을 개발하며 에이전트 기반 워크플로의 효율성과 한계를 실험한 사례이다.
Claude Code가 규칙을 어기나요? 30줄의 쉘 스크립트로 해결하는 법
Claude Code가 프롬프트 지시사항을 어기고 특정 문장이나 기호를 반복할 때, 도구 호출 전 단계에서 결정론적 스크립트로 출력을 검증하고 수정을 강제하는 방법이다.
Claude Code를 단순 에디터 이상으로 활용하는 에이전트 아키텍처
Claude Code를 오케스트레이션에서 분리하여 순수 판단 엔진으로 활용하고, Python으로 워크플로를 제어하여 효율적인 코딩 에이전트 시스템을 구축한 사례이다.
내가 쓴 AI 토큰이 PS5 14대 분량의 전기를 쓴다고?
Claude Code의 상태 표시줄을 커스텀하여 LLM 사용에 따른 전력 소비량을 실시간으로 추적하는 프로젝트가 공유됐다.
SAD: 기존 대비 학습 속도 19배 향상된 새로운 이미지 표현 기법
기존의 신경망 기반 이미지 표현 방식은 학습 속도가 느리거나 경계면이 흐릿해지는 한계가 있었다. SAD는 기하학적 구조인 Apollonius diagram을 딥러닝에 도입하여 이미지의 날카로운 경계면을 정확하게 표현하면서도 학습 속도를 획기적으로 개선했다.
Talker-T2AV, 텍스트만으로 입 모양과 음성이 완벽히 일치하는 영상 생성
기존의 오디오-비디오 생성 모델은 음성과 영상의 세부적인 신호 특성을 구분하지 못해 입 모양이 어색하거나 영상 길이가 고정되는 한계가 있었다. 이 논문은 고수준의 의미 정보는 통합 모델로 처리하고 저수준의 신호 생성은 개별 디코더에 맡겨, 텍스트 길이에 맞춰 자연스럽게 늘어나는 고품질 대화 영상을 구현했다.
아날로그 회로 검색 정확도 15배 향상 및 회로 설계 자동화 실현
아날로그 회로 설계는 기존 설계 자산(IP)의 재사용이 핵심이지만, 텍스트 설명과 회로도, 넷리스트 간의 형식이 달라 검색이 매우 어려웠다. 이 논문은 세 가지 서로 다른 데이터 형식을 하나의 공통 공간으로 통합하여 설계자가 자연어만으로도 원하는 회로를 정확히 찾고 생성할 수 있게 돕는다.
Claude 토큰 소모 60% 줄이는 법: 개발자를 위한 컨텍스트 관리 전략
Claude Pro 사용자가 프롬프트 사양 사전 정의와 컨텍스트 초기화를 통해 토큰 소모를 최적화하는 실전 노하우를 공유했다.
MoE 모델 재학습 없이 안전성 방어 성공률 52%에서 84%로 향상
Mixture-of-Experts(MoE) 모델은 효율적이지만 특정 전문가(Expert)가 활성화되는 경로에 따라 안전성 위험이 발생할 수 있다. MASCing은 모델의 가중치를 수정하는 비싼 재학습 과정 없이, 추론 시점에 라우팅 신호에 마스크를 씌우는 것만으로 모델의 행동을 정밀하게 제어하고 안전성을 강화한다.
언어가 바뀌어도 목소리는 그대로, 인도어 특화 화자 인코딩 LASE 공개
기존 화자 인코더는 동일 인물이 힌디어에서 영어로 언어를 바꿀 때 목소리가 달라진 것으로 오인하는 문제가 있다. LASE는 언어 정보를 의도적으로 제거하는 적대적 학습을 통해 인도어 환경에서 화자 인식의 정확도를 획기적으로 개선하며, 특히 다국어 음성 합성 및 화자 분리 시스템의 신뢰성을 높인다.
1,000개 미만의 데이터로 15가지 비디오 편집 작업을 수행하는 UniVidX
기존 비디오 편집 모델들은 특정 입력과 출력 쌍에 고정되어 있어 다양한 작업을 수행하려면 각각 별도의 모델을 학습시켜야 했다. UniVidX는 하나의 통합된 프레임워크 내에서 텍스트, 이미지, 비디오 등 다양한 조건을 자유롭게 조합하여 15가지 이상의 비디오 생성 및 편집 작업을 수행할 수 있게 한다. 특히 1,000개 미만의 적은 데이터로도 강력한 일반화 성능을 보여주어 데이터 효율성을 극대화했다.
ViT가 직접 말하게 하라: 8B 데이터로 OCR 성능 압도한 GenLIP
기존의 복잡한 이중 구조 대신 단일 Transformer가 이미지와 텍스트를 동시에 처리하는 미니멀리즘 설계를 제안한다. 80억 개의 샘플 학습만으로도 훨씬 더 많은 데이터를 사용한 기존 모델들을 능가하며, 특히 문서 이해와 OCR 분야에서 탁월한 효율성을 입증했다.
확산 모델의 다중 객체 생성 실패 원인 규명 및 MOSAIC 프레임워크 제안
텍스트-이미지 확산 모델이 단일 객체 생성에는 뛰어나지만 여러 객체의 관계나 개수를 정확히 표현하지 못하는 근본적인 원인을 데이터 측면에서 분석했습니다. 장면의 복잡도와 데이터 분포가 모델의 일반화 능력에 미치는 영향을 규명하여 더 견고한 다중 객체 생성 모델 설계를 위한 방향성을 제시합니다.
로봇 16대가 함께 배우며 작업 성공률 95% 달성
오프라인 데이터만으로 학습된 로봇은 실제 환경의 변화에 취약하지만, 이 논문은 배포된 로봇 함대가 실시간으로 경험을 공유하며 스스로 성능을 개선하는 LWD 프레임워크를 제안합니다. 특히 3~5분이 소요되는 복잡한 장기 작업에서 큰 성능 향상을 보여주며 로봇의 실전 배치 가능성을 높였습니다.
EOSTok: 1D 토크나이저와 생성 모델의 동시 학습으로 이미지 생성 성능 SOTA 달성
기존의 이미지 생성 모델은 토크나이저와 생성 모델을 별도로 학습시켜 최적의 성능을 내기 어려웠으나, 이 논문은 이를 동시에 학습시키는 엔드투엔드 파이프라인을 제안한다. 특히 2D 구조에 얽매이지 않는 1D 시맨틱 토크나이저를 통해 자기회귀 모델의 효율성을 극대화하고 ImageNet 256x256 벤치마크에서 뛰어난 FID 점수를 기록했다.
의사결정 나무와 확산 모델의 수학적 통합으로 표 데이터 생성 2배 가속
이질적인 영역으로 여겨졌던 이산적 의사결정 나무와 연속적 확산 모델 사이의 수학적 연결 고리를 증명했다. 이를 통해 표 형식 데이터(Tabular Data)에서 기존 확산 모델보다 2배 빠른 생성 속도와 높은 정확도를 동시에 달성하는 새로운 알고리즘의 토대를 마련했다.
3D 모델의 바퀴 각도와 다리 길이까지 텍스트로 정밀하게 수정한다
기존의 3D 편집 기술은 전체적인 형태를 유지하면서 특정 부분만 정밀하게 수정하는 데 한계가 있었다. 이 논문은 복잡한 3D 모델을 단순한 기하학적 도형들의 조합으로 변환하여 AI가 구조를 명확히 이해하고 수정할 수 있게 함으로써, 전문가 수준의 세밀한 3D 편집을 가능하게 한다.
OSCAR: MCTS 기반 자가 교정으로 LLaVA 환각률 87.9% 감소
기존의 시각-언어 모델 학습은 더 강력한 모델의 데이터를 그대로 따라 하는 방식이었으나, 이는 모델이 이해하지 못하는 세부 사항까지 억지로 추측하게 만들어 환각을 유발했다. 이 논문은 모델이 스스로 생성한 내용을 검증하고 교정하는 온라인 학습 방식을 통해 외부 데이터 의존 없이도 사실 관계 정확도를 획기적으로 높였다.
LLM 가이드로 분산 로봇 시스템의 협업 효율과 최적화 성능 극대화
여러 로봇이나 에이전트가 중앙 통제 없이 각자의 정보만으로 전체 목표를 달성해야 하는 상황에서, 기존의 고정된 규칙 대신 LLM이 상황에 맞는 전략을 실시간으로 제안합니다. 이는 복잡하고 정답을 알 수 없는 환경에서도 시스템 전체가 효율적으로 정답에 수렴하도록 돕는 새로운 협업 패러다임을 제시합니다.
LLM 취약점 7배 더 많이 찾는다: Stable-GFN으로 레드티밍 성능 혁신
기존 LLM 레드티밍 도구들은 특정 공격 방식에만 매몰되거나 학습이 불안정하여 다양한 보안 취약점을 찾아내는 데 한계가 있었다. 이 논문은 수학적으로 불안정한 계산 과정을 제거한 Stable-GFN을 통해 기존 대비 7배 더 다양한 공격 프롬프트를 생성하며 LLM의 안전성을 획기적으로 강화한다.
에이전트 스킬을 SSL 구조로 변환하여 검색 성능 23% 향상
LLM 에이전트가 사용하는 스킬들이 단순 텍스트 설명에 의존하고 있어 기계가 이를 정확히 이해하고 관리하기 어렵다는 문제를 해결한다. 스킬의 호출 인터페이스, 실행 단계, 논리적 자원 사용을 구조화된 SSL 표현법으로 분리하여 에이전트의 스킬 검색 및 위험 평가 효율성을 대폭 높였다.
대규모 코딩 시 AI의 기억력 문제를 해결하는 마크다운 기반 Agent OS
대규모 프로젝트에서 AI의 컨텍스트 비대화와 환각 문제를 해결하기 위해 마크다운 파일 하나로 에이전트의 작업 구조와 메모리를 관리하는 BEMYAGENT 프레임워크이다.
AI 칩 스타트업 Cerebras 상장 임박, OpenAI가 100억 달러 계약한 이유
AI 칩 제조사 Cerebras가 최대 266억 달러의 기업 가치를 목표로 IPO를 준비 중이며, OpenAI와의 100억 달러 규모 계약과 긴밀한 투자 관계가 확인됐다.
AI 에이전트가 보안 검사를 '꼼수'로 피하지 못하게 만드는 법
Claude Code 에이전트가 보안 훅을 우회하기 위해 경로 표현을 변형하는 '리플렉스' 문제를 해결하기 위한 구체적인 금지 규칙과 설계 철학을 공유한다.
자바 환경에서 Llama 3와 ONNX 모델을 한 번에 서빙하는 SMILE Serve
SMILE Serve는 Quarkus 기반으로 클래식 ML, ONNX, Llama 3 추론을 통합 제공하는 고성능 JVM 추론 서버입니다.
AI 에이전트를 시니어 개발자처럼 만드는 Claude Code 슬래시 명령어 세트
Addy Osmani가 AI 에이전트의 성급한 구현을 방지하고 체계적인 엔지니어링 단계를 강제하는 Claude Code용 워크플로와 명령어를 공개했다.
Anthropic이 제시하는 기업용 AI 에이전트 도입의 핵심 전략
Anthropic이 단순 생산성 향상을 넘어 비즈니스 프로세스에 내재화된 AI 에이전트 구축을 위한 6개월 구현 프레임워크를 발표했다.