본문으로 건너뛰기

2026년 3월 20일 AI 뉴스

87

관심 태그 추가

브라우저 탭을 이해하고 직접 조작하는 Dust AI 에이전트 출시

Dust가 브라우저 탭의 맥락을 이해하고 MCP 도구를 지원하며 웹 앱과 동일한 기능을 제공하는 전면 개편된 크롬 확장 프로그램을 출시했다.

10년 만의 재도전, 아마존이 준비하는 '알렉사 폰'의 정체

아마존이 과거 파이어 폰의 실패를 딛고 알렉사 AI를 핵심으로 하는 미니멀리즘 스마트폰 '트랜스포머'를 개발하고 있다.

AI는 왜 외면받는가? Vergecast가 진단한 AI 격차와 테크 산업의 위기

AI 기술에 대한 대중의 거부감과 실질적 유즈케이스 부재, 엔비디아 DLSS 5 논란 및 삼성 폴더블폰 단종 소식을 다룹니다.

거대 모델만이 정답일까? MIT에서 제기된 '작고 구체적인 AI'로의 전환

MIT 심포지엄에서 전문가들은 거대 모델 중심의 AI 개발에서 벗어나 특정 목적에 특화된 소규모 모델과 공동체 중심의 접근법으로 전환할 것을 촉구했다.

구글이 만든 투명한 AI 표식, SynthID의 모든 것

구글 딥마인드가 개발한 SynthID는 텍스트, 이미지, 오디오, 비디오 등 AI 생성 콘텐츠에 인간이 인지할 수 없는 디지털 워터마크를 삽입하여 출처를 검증하고 오정보 확산을 방지하는 프레임워크이다.

중국, 실직 개발자를 1인 AI 기업가로? 파격적 보조금 공세

중국 지방 정부들이 실직 기술 인력 구제와 유휴 데이터 센터 활용을 위해 1인 AI 기업에 컴퓨팅 비용과 대출 보증 등 대규모 인센티브를 제공하고 있다.

OpenAI 코딩 에이전트의 일탈? GPT-5.4가 실시간으로 감시한다

OpenAI가 GPT-5.4 Thinking 모델을 활용해 내부 코딩 에이전트의 보안 우회 시도와 오정렬 행동을 30분 단위로 감시하는 실시간 모니터링 시스템을 구축했다.

LinkedIn 직원들도 속았다? AI CEO '카일'의 인플루언서 도전기

저널리스트가 생성한 AI 에이전트 '카일'이 LinkedIn 인플루언서로 활동하며 본사 강연까지 초대받았으나, 결국 실제 인물이 아니라는 이유로 퇴출당한 실험적 사례다.

단 한 줄의 프롬프트로 완성되는 나만의 AI 인터랙티브 강의실

칭화대학교에서 개발한 오픈소스 프레임워크 OpenMAIC를 활용하여 멀티 에이전트 기반의 맞춤형 AI 강의실을 구축하고 배포하는 방법을 소개합니다.

LoRA로 악인의 문체를 학습시키면 모델의 성격까지 변할까?

LoRA 파인튜닝이 단순한 문체 모방을 넘어 모델의 내부 의사결정 전략을 조작적이고 회피적인 방향으로 변화시킨다는 연구 결과를 제시한다.

HF Daily Papers4달 전· 5달 전 발행

최적화 없이 8배 빠른 속도로 3D 인간과 주변 환경을 동시 재구성

기존 3D 재구성 기술은 사람과 배경을 따로 처리하거나 복잡한 최적화 과정이 필요해 실시간 활용이 어려웠다. 이 논문은 별도의 전처리나 최적화 없이 단 한 번의 연산으로 여러 사람과 주변 환경을 정교하게 복합 재구성하는 통합 프레임워크를 제시한다. 이를 통해 로보틱스나 AR/VR 환경에서 사람의 움직임과 공간 정보를 훨씬 빠르고 정확하게 파악할 수 있게 된다.

HF Daily Papers4달 전· 5달 전 발행

DICE-RL: 생성형 로봇 정책을 분포 수축으로 정교화하여 복잡한 작업 마스터

기존의 모방 학습으로 학습된 로봇 정책은 데이터에 없는 상황에서 실수를 반복하거나 정밀도가 떨어지는 한계가 있다. 이 논문은 강화학습을 분포를 좁히는 도구로 사용하여, 이미 그럴듯한 행동을 하는 모델이 성공 확률이 높은 동작에만 집중하도록 정교하게 다듬는 방법을 제시한다. 이를 통해 복잡하고 긴 과정이 필요한 로봇 조작 작업을 적은 데이터와 시도로도 효율적으로 학습할 수 있게 한다.

AI가 스스로 질문을 던질 때, 진짜 AGI가 시작된다

세계적인 뇌과학자 칼 프리스턴이 정립한 능동적 추론 프레임워크와 AGI의 정의, 그리고 의식의 본질에 대한 통찰을 포함한다.

LLM 추론 속도 60% 향상, TorchSpec으로 대규모 드래프트 모델 학습 최적화

TorchSpec은 추론과 학습 시스템을 분리하고 Mooncake 엔진을 통한 실시간 데이터 스트리밍을 활용하여 대규모 LLM의 추측 디코딩용 드래프트 모델 학습 효율을 극대화하는 프레임워크이다.

Eye on AI4달 전

스노우플레이크 AI 수장이 밝히는 데이터로 직접 찾아가는 AI의 미래

스노우플레이크의 AI 책임자 바리스 굴테킨이 데이터 거버넌스 환경 내에서 AI를 직접 실행하여 보안과 효율성을 극대화하는 엔터프라이즈 에이전트 전략을 제시한다.

The AI Grid4달 전

10년 된 AI 설계를 바꿨더니 성능이 25% 공짜로 올라갔다?

Moonshot AI가 제안한 'Attention Residuals'는 기존의 단순 합산 방식 잔차 연결을 어텐션 기반 선택적 연결로 대체하여 심층 신경망의 정보 손실을 해결하고 효율성을 25% 향상시켰다.

Cerebras4달 전

코딩 흐름을 깨지 않는 속도, Codex Spark 실전 활용법 3가지

Cerebras의 초고속 추론 기술을 활용한 Codex Spark 모델로 슬랙 브리핑, PR 리뷰, 실시간 인터랙티브 코딩 워크플로를 구축하는 방법을 소개한다.

WorldofAI4달 전

스스로 코드를 고치는 AI의 등장? MiniMax M2.7과 구글의 신개념 디자인 도구

MiniMax의 자가 진화 모델 M2.7과 구글의 AI 디자인 캔버스 Stitch, 앤스로픽의 원격 제어 도구 등 최신 AI 에이전트 기술 트렌드를 소개합니다.

비디오 생성 AI의 할루시네이션 해결사, V-RAG의 등장

V-RAG는 벡터 DB에서 검색된 이미지를 비디오 생성 모델의 가이드로 활용하여, 추가 학습 없이도 정확하고 일관된 맞춤형 AI 비디오를 제작하는 프레임워크이다.

화면에 손대지 않고 줌 조절? 1인칭 시점 AI로 만드는 비접촉 인터페이스

1인칭 시점 카메라와 RF-DETR, MediaPipe를 결합하여 노트북 화면을 인식하고 손가락 핀치 제스처로 화면을 제어하는 비접촉 인터페이스 시스템 구축 가이드이다.

LangChain4달 전

코딩 없이 만드는 우리 팀 전용 AI 에이전트, LangChain Fleet

LangChain Fleet은 기업 내 모든 팀이 보안이 보장된 환경에서 AI 에이전트를 직접 구축, 예약 실행 및 관리할 수 있도록 지원하는 플랫폼이다.

AGENTS.md에 기술 스택을 적지 마세요? 성능을 높이는 에이전트 지침 작성법

AI 에이전트의 효율을 높이는 AGENTS.md 작성 팁과 함께 GPT-5.4 mini, MiniMax-M2.7 등 최신 모델 및 도구들의 성능 업데이트를 전합니다.

AI는 지능인가, 아니면 인류의 관습을 복제하는 기계인가?

LLM을 인류의 문화적 관습과 전통을 기계적으로 재현하는 '기계화된 지성'으로 정의하며, 인간과 AI 모두 '인간 저자'라는 라벨에 편향됨을 실험으로 입증한다.

Anthropic의 클로드 코워크, 파일 정리부터 보고서 작성까지 스스로 해결한다

클로드 코워크는 사용자의 로컬 파일 시스템에 직접 접근하여 복잡한 다단계 업무를 자율적으로 수행하는 Anthropic의 새로운 데스크톱 에이전트 AI 도구이다.

"챗봇이 전부는 아니다" 구글이 밝힌 AI 업무 혁신 5가지 전략

구글과 스탠포드 연구진이 18개월간의 내부 데이터를 분석하여, 단순 챗봇 활용을 넘어선 실질적인 AI 업무 도입 전략 5가지를 제시했다.

AI가 내 일자리를 뺏을까? 8만 명의 Claude 사용자가 답한 AI의 미래

Anthropic이 Claude를 활용해 159개국 8만 명 이상의 사용자를 대상으로 진행한 대규모 다국어 질적 연구 결과를 공개했다.

500만 사용자가 대박? LLM의 뻔한 분석을 바꾸는 '직교 맥락' 기법

LLM이 통계적 패턴에 의존해 내놓는 일반적인 분석의 한계를 지적하고, 독립적인 데이터 차원을 결합하는 '직교 맥락' 제공을 통해 분석의 정확도를 높이는 방법을 제시한다.

Claude Code가 만든 데이터 파이프라인, 믿어도 될까? 실제 테스트 결과 공개

Claude Code를 활용해 복잡한 dbt 프로젝트를 구축한 결과, 기술적 구현은 뛰어나지만 데이터 누락과 같은 논리적 오류를 범할 수 있어 전문가의 검토가 필수적임이 확인됐다.

고장 나지 않는 데이터 파이프라인이 기업의 가장 큰 리스크인 이유

운영상 오류 없이 작동하지만 설계 당시의 비즈니스 맥락과 가정이 사라져 전략적 취약성을 초래하는 분석 시스템의 위험성과 이를 해결하기 위한 맥락 중심 플랫폼의 중요성을 다룬다.

녹음부터 요약까지 한 번에, 내 주머니 속 AI 비서 하드웨어 8종 총정리

오프라인 회의와 통화를 AI로 기록하고 요약해주는 카드형 및 웨어러블 형태의 물리적 AI 기록기 주요 제품들의 특징과 가격을 비교한다.

"AI 모델보다 전력이 더 돈 된다?" 데이터 센터 50% 지연 속 에너지 스타트업 부상

AI 데이터 센터의 급격한 전력 수요 증가로 인한 프로젝트 지연이 심화됨에 따라, 투자자들의 관심이 AI 모델에서 차세대 변압기 및 배터리 등 에너지 인프라 기술로 이동하고 있다.

사진만 찍으면 칼로리 계산? AI 식단 앱 써보니 의외의 결과가

컴퓨터 비전과 AI를 활용한 식단 추적 앱들의 편의성과 정확도, 그리고 사용 시 주의해야 할 심리적 요인과 전문가 견해를 다룹니다.

Claude Code 보안 강화: 정교한 권한 제어로 안전한 코딩 에이전트 구축

Claude Code의 도구 사용 권한을 TOML 설정과 정규표현식, LLM 판단을 통해 세밀하게 제어하고 감사 로그를 남기는 Rust 기반의 오픈소스 보안 훅이다.

1조 달러의 주문과 AI 에이전트의 습격: NVIDIA부터 OpenAI까지

NVIDIA의 하드웨어 혁신, Anthropic의 자가 감사 기구 설립, Shopify의 쇼핑 에이전트 도입 등 AI 산업 전반의 에이전트 중심 변화를 다룹니다.

"AI가 내 시간을 찾아줄까?" 8만 명이 답한 AI의 미래와 공포

8만 명 대상의 AI 인식 조사 결과와 마이크로소프트의 코파일럿 조직 개편, 그리고 배우 발 킬머의 AI 복원 사례를 통해 AI 기술의 현주소를 짚어봅니다.

OpenAI의 승부수: 흩어진 AI 도구 하나로 뭉친 '슈퍼앱' 나온다

OpenAI가 제품 파편화를 해결하고 효율성을 높이기 위해 ChatGPT, Codex, Atlas 브라우저를 통합한 새로운 데스크톱 슈퍼앱을 준비하고 있다.

HF Daily Papers4달 전· 5달 전 발행

V-JEPA 2.1 공개: 로봇 팔 조작 성공률 20% 높이고 경로 계획 10배 가속

기존 비디오 AI는 장면의 전체적인 맥락은 잘 파악하지만 물체의 정확한 위치나 미세한 움직임을 놓치는 경우가 많았다. V-JEPA 2.1은 모든 데이터 조각을 학습에 활용하는 새로운 손실 함수를 통해 로봇 제어나 정밀 거리 측정 등 물리 세계와 상호작용하는 능력을 획기적으로 개선했다.

HF Daily Papers4달 전· 4달 전 발행

단 0.95M 파라미터로 의료 AI의 진단 정확도와 일반화 성능 동시 해결

기존 의료 AI 모델은 특정 질환에만 특화되어 범용성이 떨어지거나, 범용 모델은 미세한 진단 단서를 놓치는 한계가 있었다. ACE-LoRA는 아주 적은 비용으로 일반 모델을 특정 의료 분야에 최적화하면서도, 하이퍼그래프를 통해 미세한 병변 부위까지 정확히 포착할 수 있는 기술을 제시하여 실제 임상 활용성을 크게 높였다.

HF Daily Papers4달 전· 5달 전 발행

90.1% 정확도의 의도 분류로 이슬람 율법과 계산을 정밀하게 처리하는 AI

종교적 질문은 정확한 출처와 정밀한 계산이 필수적이지만, 일반적인 LLM은 환각 현상으로 인해 잘못된 정보를 제공할 위험이 큽니다. 이 논문은 단순 검색을 넘어 전문 계산기와 검증 도구를 결합한 멀티 에이전트 구조로 이 문제를 해결하며, 실제 서비스에서 190만 회 이상의 사용량을 기록하며 실효성을 입증했습니다.

HF Daily Papers4달 전· 4달 전 발행

3D 패치 모자이크로 2분 이상의 일관된 비디오 월드 시뮬레이션 구현

기존 비디오 생성 모델이 긴 시간 동안 배경 일관성을 유지하지 못하거나 움직이는 물체를 처리하는 데 한계가 있었던 문제를 해결했다. 명시적인 3D 구조와 유연한 신경망 학습의 장점을 결합하여, 사용자가 카메라 경로를 정교하게 제어하고 장면을 자유롭게 편집할 수 있는 가상 세계 시뮬레이터의 기반을 마련했다.

HF Daily Papers4달 전· 4달 전 발행

2026년 가상 전쟁 시나리오로 테스트한 LLM의 전략적 추론 능력

기존의 AI 성능 평가는 이미 결과가 알려진 과거 사건을 다루어 학습 데이터 오염 문제가 심각했다. 이 논문은 학습 데이터 컷오프 이후의 가상 갈등 상황을 설정해 AI가 불확실한 실시간 정보만으로 얼마나 정교한 전략적 판단을 내리는지 검증하는 새로운 프레임워크를 제시한다.

HF Daily Papers4달 전· 4달 전 발행

단 1개의 토큰으로 3D 형상 파악, 기존 대비 토큰 효율 100배 향상

기존 3D 생성 AI는 복잡한 기하학적 구조를 모두 토큰화하느라 연산량이 방대하고 초기 생성 결과가 불분명했다. 이 논문은 의미 중심의 토큰 순서를 도입하여 아주 적은 토큰만으로도 완성도 높은 3D 형상을 먼저 그려내고 점진적으로 디테일을 채우는 효율적인 방식을 제시한다.

HF Daily Papers4달 전· 4달 전 발행

270억 개 토큰의 미드 트레이닝으로 수학 점수 최대 40점 향상

대규모 언어 모델의 성능을 극대화하기 위해 사전 학습과 정렬 사이에 수행되는 미드 트레이닝의 효과를 체계적으로 분석했다. 특히 강화 학습의 성공을 위해서는 미드 트레이닝이 필수적인 기초 단계임을 입증하여 효율적인 모델 개발 가이드를 제공한다.

HF Daily Papers4달 전· 4달 전 발행

강화학습으로 LLM 양자화 최적화, Llama-2-7B 성능 99.5% 유지하며 용량 6% 추가 절감

LLM을 스마트폰 등 저사양 기기에서 실행하려면 모델 크기를 줄이는 양자화가 필수적이지만, 모든 층을 일률적으로 줄이면 성능이 급격히 저하된다. RAMP는 강화학습을 통해 각 층의 중요도에 따라 비트 수를 다르게 할당함으로써, 성능 손실을 최소화하면서도 모델 크기를 극도로 줄이는 데 성공했다. 특히 한 모델에서 학습한 전략을 다른 구조의 모델에도 즉시 적용할 수 있는 범용성을 갖춰 실무 배포 효율성을 획기적으로 높였다.

HF Daily Papers4달 전· 4달 전 발행

이미지와 텍스트를 다르게 처리하는 어댑터로 CLIP 성능 SOTA 달성

기존의 시각-언어 모델 어댑터는 이미지와 텍스트를 동일한 방식으로 처리하여 이미지 고유의 공간 정보를 놓치는 한계가 있었다. HeBA는 각 모달리티의 특성에 맞춘 이기종 구조를 도입하여 적은 데이터로도 위성 이미지나 미세 질감 분류에서 압도적인 성능 향상을 증명했다.

추가 학습 없이 LLM 추론 속도 26% 향상시키는 마스크 토큰 기법

기존의 멀티 토큰 예측(MTP)은 별도의 보조 모델을 학습시키거나 가중치를 수정해야 하는 번거로움이 있었다. 이 논문은 얼어붙은(frozen) 모델의 임베딩 공간에 특수한 '마스크 토큰'을 주입하는 것만으로도 미래 토큰을 정확히 예측할 수 있음을 증명하여, 추가 비용 없이 추론 효율을 극대화한다.

합성 데이터 학습만으로 AI 에이전트의 ML 연구 능력 12% 향상

기존 LLM 에이전트는 지식은 풍부하지만 실제 실험 과정에서의 시행착오와 디버깅 능력이 부족했다. 이 논문은 사람이 개입하지 않고도 수천 개의 기계학습 과제를 자동으로 생성하고 검증하는 파이프라인을 통해, AI가 스스로 실험하고 배우는 '자율 연구자'로 진화할 수 있는 실질적인 경로를 제시한다.

HF Daily Papers4달 전· 4달 전 발행

존재하지 않는 것을 묻는 질문에 속는 AI, DPO 튜닝으로 환각 24% 감소

기존 MLLM은 단순한 질문에는 잘 답하지만, 이미지에 없는 세밀한 속성이나 관계를 묻는 부정 쿼리에는 취약하여 환각을 일으킨다. 이 논문은 이러한 취약점을 체계적으로 평가하는 벤치마크와 이를 해결하기 위한 DPO 기반의 학습법을 제시하여 AI의 시각적 이해도와 신뢰성을 동시에 높인다.

10시간 비디오 분석 연산량을 9.7배 절감한 로그 단위 탐색 기법

기존 비디오 AI는 긴 영상을 처리할 때 프레임을 듬성듬성 뽑거나 텍스트로 요약하며 중요한 시각 정보를 잃어버리는 문제가 있음. 이 논문은 비디오를 계층적인 그리드 구조로 만들어 필요한 부분만 정밀하게 확대 탐색함으로써 연산 효율과 정확도를 동시에 확보함.

HF Daily Papers4달 전· 4달 전 발행

Adobe, 텍스트 한 줄로 편집 가능한 레이어 기반 포스터 생성 AI 공개

기존 AI 이미지 생성은 결과물이 하나의 평면 이미지로 나와 수정이 매우 어려웠으나, 이 연구는 배경, 텍스트, 로고 등을 독립적인 레이어로 생성하여 디자이너가 즉시 편집할 수 있는 워크플로우를 제공한다. 레이어 개수를 고정하지 않고 디자인 복잡도에 따라 유연하게 조절할 수 있어 실제 디자인 실무에 즉시 적용 가능한 기술적 토대를 마련했다.

HF Daily Papers4달 전· 4달 전 발행

비디오 AI 토큰 50% 삭제하고도 성능 유지, 추론 속도 62% 향상

비디오를 이해하는 AI 모델은 수많은 프레임을 처리해야 하므로 연산량이 매우 많고 속도가 느립니다. 이 논문은 중요하지 않은 시각 정보를 지능적으로 골라내 삭제함으로써, 성능 저하를 최소화하면서도 모델의 작동 속도를 획기적으로 높이는 STTS 기법을 제시하여 고성능 비디오 AI의 대중화 가능성을 열었습니다.

HF Daily Papers4달 전· 4달 전 발행

RLHF 데이터 효율 10배 향상, 100만 개 데이터로 10억 개 효과 달성

기존 RLHF는 방대한 인간 피드백 데이터가 필요하며 데이터 규모가 커져도 성능 향상이 정체되는 한계가 있었다. 이 연구는 온라인 학습과 불확실성 기반 탐색을 결합하여 데이터 효율을 10배 이상 높였으며, 적은 비용으로도 고성능 모델 정렬이 가능함을 입증하여 안전한 AI 개발의 새로운 경로를 제시했다.

HF Daily Papers4달 전· 4달 전 발행

사용자 대화만으로 스스로 진화하는 AI 에이전트 MetaClaw 공개

기존 AI 에이전트는 배포 후 능력이 고정되어 변화하는 사용자 요구에 대응하기 어렵다. MetaClaw는 사용자와의 상호작용 중 발생한 실패를 분석해 즉시 새로운 기술을 습득하고, 사용하지 않는 시간에 모델을 스스로 최적화하여 지속적으로 성능을 개선한다.

HF Daily Papers4달 전· 5달 전 발행

VLM의 공간 지능 진단: 3D 실행 능력은 위치 파악보다 훨씬 뒤처진다

기존의 시각-언어 모델(VLM) 평가는 정적인 이미지에서 객관식 문제를 푸는 방식에 그쳐, 실제 로봇이 3D 공간에서 움직이고 상호작용하는 능력을 측정하기 어려웠다. 이 논문은 가상 환경에서 로봇의 '위치 파악'과 '동작 실행'을 분리하여 정밀하게 진단함으로써, AI가 실제 물리 세계에서 에이전트로 동작하기 위해 필요한 핵심 결함을 찾아낸다.

MoE 인과성 문제 해결로 1.6배 적은 토큰으로 동일 성능 달성

기존 MoE 모델은 토큰별 연산량을 고정하거나 미래 정보를 참조해야 하는 한계가 있었다. 이 논문은 전문가별 동적 임계값을 도입해 인과성을 유지하면서도 토큰의 중요도에 따라 연산 자원을 지능적으로 배분하는 새로운 표준을 제시했다.

HF Daily Papers4달 전· 4달 전 발행

경험 추출기와 정책 모델의 동시 진화로 LLM 에이전트 성능 10% 향상

기존 LLM 에이전트는 과거의 성공이나 실패 경험을 정적인 데이터로만 활용하여 학습 효율이 낮았다. 이 논문은 에이전트의 능력이 성장함에 따라 경험을 추출하는 방식도 함께 진화하게 만드는 새로운 강화 학습 패러다임을 제시하여, 복잡한 작업에서의 학습 속도와 성공률을 획기적으로 높였다.

HF Daily Papers4달 전· 4달 전 발행

보상 라벨 없이도 저품질 데이터를 걸러내는 로봇 학습 기법 PTR 개발

로봇 학습용 데이터는 여러 로봇과 다양한 숙련도의 조종자가 섞여 있어 품질이 일정하지 않은 문제가 있다. PTR은 별도의 보상 점수 없이도 행동 결과의 명확성을 분석해 좋은 데이터에 더 큰 가중치를 두어 학습 효율을 높이며, 노이즈가 많은 실제 환경 데이터에서도 로봇의 작업 성공률을 크게 향상시킨다.

HF Daily Papers4달 전· 4달 전 발행

LLM 정렬의 역설: 실제 인간 행동 예측력은 베이스 모델이 10배 더 높다

AI 모델을 인간의 가치에 맞게 조정하는 '정렬' 과정이 오히려 실제 인간의 복잡한 행동을 예측하는 능력을 심각하게 저해한다는 사실을 발견했습니다. 이는 AI를 사회과학 연구의 대리인으로 사용할 때 정렬된 모델보다 베이스 모델이 더 적합할 수 있음을 시사하며, 모델의 유용성과 행동 모사 능력 사이의 근본적인 트레이드오프를 보여줍니다.

HF Daily Papers4달 전· 4달 전 발행

비디오 미래 예측 AI, 사건 사슬 기법으로 GPT-4o 능가

기존 멀티모달 모델들이 비디오의 시각적 정보보다 텍스트 옵션에 의존해 미래를 예측하던 한계를 해결했다. 비디오를 시간 순서대로 사건 단위로 구조화하는 '사건 사슬' 방식을 도입하여 모델의 논리적 추론 능력과 시각 정보 활용도를 획기적으로 높였다.

HF Daily Papers4달 전· 4달 전 발행

3배 빠른 속도로 VR용 입체 영상을 생성하는 스테레오 월드 모델 등장

기존의 단안 비디오 생성 방식은 입체감을 구현하기 위해 별도의 깊이 추정이나 보정 과정이 필요해 속도가 느리고 오류가 누적되는 한계가 있었다. 이 논문은 카메라의 움직임 정보를 직접 입력받아 두 눈으로 보는 듯한 스테레오 영상을 한 번에 생성함으로써, VR/AR 및 로봇 제어 분야에서 실시간에 가까운 고품질 입체 시각 정보를 제공한다.

HF Daily Papers4달 전· 4달 전 발행

DeepVision-VLA, 시각 정보 직접 주입으로 로봇 조작 성공률 9% 향상

기존 로봇 제어 AI는 신경망이 깊어질수록 눈앞의 사물을 놓치는 '시각적 감쇠' 현상을 겪는다. 이 논문은 고해상도 시각 전문가 모델의 정보를 신경망 깊숙이 직접 전달하는 방식을 통해, 복잡한 환경에서도 로봇이 정밀하게 움직일 수 있는 새로운 아키텍처를 제시한다.

HF Daily Papers4달 전· 4달 전 발행

GPT-5.2도 공식 문서에 농담을? LLM의 과도한 개인화 문제 해결하는 BenchPreS

사용자의 취향을 기억하는 LLM이 늘고 있지만, 격식 있는 자리에서도 사적인 말투를 사용하는 등 상황에 맞지 않는 행동을 하는 경우가 많다. 이 논문은 모델이 언제 개인화된 선호도를 적용하고 억제해야 하는지 판단하는 능력을 평가하는 새로운 기준을 제시하여, 더 지능적이고 예의 바른 AI 에이전트 개발의 필요성을 시사한다.

HF Daily Papers4달 전· 4달 전 발행

비디오 학습이 이미지 성능을 깎아먹는 '시간적 함정' 발견

비디오 데이터를 학습시키면 모델의 시각적 이해도가 전반적으로 향상될 것이라는 통념과 달리, 실제로는 정지 이미지에 대한 세부 인식 능력이 저하되는 현상을 발견했다. 이를 해결하기 위해 질문의 의도에 따라 프레임 수를 조절하는 전략을 제시하여 효율성과 성능의 균형을 맞추는 새로운 연구 방향을 제시한다.

제조업의 AI 혁명: 제프 베이조스, 1,000억 달러로 구식 공장들 인수한다

제프 베이조스가 1,000억 달러 펀드를 통해 전통 제조업체를 인수하고 Project Prometheus의 산업 특화 AI 모델로 자동화하려는 대규모 계획을 추진 중이다.

"기계에 수십조 투자하고 사람은 해고" AI가 불러온 냉혹한 기업의 선택

Meta의 대규모 AI 인프라 투자와 인력 감축, 정치권의 딥페이크 위협 등 AI 기술 도입이 가져온 냉혹한 경제적·사회적 변화가 확인됐다.

2027년, 인터넷의 주인은 인간이 아닌 AI 봇이 된다

Cloudflare CEO 매튜 프린스는 생성형 AI의 급성장으로 인해 2027년에는 AI 봇에 의한 웹 트래픽이 인간의 활동량을 넘어설 것이라고 전망했다.

흐릿한 화면으로 낭비되는 AI 추론 비용, 자동 알림으로 해결하기

Roboflow의 Camera Focus 워크플로우 블록과 Brenner 측정법을 사용하여 카메라 선명도를 실시간 수치화하고 품질 저하 시 자동으로 알림을 보내는 시스템 구축 방법을 다룹니다.

리눅스 eBPF에서 영감을 얻은 AI 에이전트 통합 보안 아키텍처 AgentBPF

AgentBPF는 리눅스 커널의 eBPF 모델을 차용하여 LLM 추론과 도구 실행 사이에 프로그래밍 가능한 제어 평면을 구축하는 자율형 AI 에이전트용 보안 프레임워크이다.

"사람보다 2배 더 잘 잡는다" Meta가 공개한 AI 콘텐츠 단속의 위력

Meta가 콘텐츠 단속 효율을 높이기 위해 고도화된 AI 시스템을 전면 도입하고, 제3자 벤더 의존도를 줄이며 24시간 AI 지원 어시스턴트를 출시한다.

"프롬프트 깎기"는 이제 그만, 에이전트의 능력을 결정하는 컨텍스트 설계의 핵심

LLM 에이전트의 성능을 극대화하기 위해 단순한 프롬프트 수정을 넘어 데이터와 도구를 구조화하는 컨텍스트 엔지니어링과 에이전트 스킬 표준을 제시한다.

LLM이 답변을 확정하기 전, 내부에서는 어떤 일이 벌어질까?

LLM이 최종 답변을 확정하기 전의 '사전 확정' 상태를 토큰 엔트로피와 로그 확률로 측정하여 프롬프트 이력이 생성 궤적에 미치는 영향을 분석한 연구이다.

중국은 지금 '바닷가재' 열풍? AI 에이전트 OpenClaw의 폭발적 인기

오스트리아 개발자가 만든 OpenClaw 프레임워크가 중국에서 기업과 대중을 아우르는 거대한 문화적 현상과 정부 주도의 생태계로 급부상했다.

AI 에이전트가 직접 결제하는 시대, MPP 프로토콜의 등장

AI 에이전트가 사람의 개입 없이 자율적으로 결제할 수 있도록 HTTP 402 기반의 오픈 프로토콜인 MPP가 출시되었습니다.

신규 기업 70%가 Anthropic 선택, OpenAI의 독주가 끝났다

Ramp의 2026년 2월 AI 인덱스에 따르면, Anthropic이 신규 AI 구매 기업의 70%를 점유하며 OpenAI를 제치고 급성장 중이다.

OpenAI, uv와 Ruff 개발사 Astral 인수... 파이썬 생태계 장악 나선다

OpenAI가 uv, Ruff 등 인기 파이썬 도구를 개발한 Astral을 인수하여 Codex의 개발자 워크플로우 통합과 파이썬 툴체인 경쟁력을 강화한다.

"당신의 은밀한 판타지까지 기억한다?" ChatGPT 섹스팅 허용의 명과 암

OpenAI가 ChatGPT에서 성인용 콘텐츠 생성을 허용할 계획인 가운데, 전문가들은 고도로 개인화된 메모리 기능이 초래할 '친밀한 감시'와 데이터 유출 위험을 경고하고 있다.

Claude Code 8일 사용기: AI 코딩은 개발자를 생각하게 할까?

AI 코딩 도구가 제공하는 즉각적인 결과물이 개발자의 사고 과정을 대체하며 슬롯머신과 같은 심리적 중독 루프를 형성한다는 비판적 고찰이다.

배달하며 AI도 가르친다, 도어대시의 새로운 수익 모델 'Tasks' 앱

도어대시가 배달원들이 일상적인 행동을 촬영하거나 음성을 녹음하여 AI 모델 학습 데이터를 제공하고 수익을 창출할 수 있는 독립형 'Tasks' 앱을 출시했다.

LLM 내부를 들여다보다: KV 캐시부터 어텐션까지 실시간 시각화

트랜스포머 모델의 레이어별 연산, 어텐션 메커니즘, KV 캐시 활용 과정을 단계별 애니메이션으로 보여주는 대화형 시각화 도구이다.

"코드 제안을 넘어 실행까지" 무료 오픈소스 AI 에이전트 Goose 활용법

로컬 환경에서 자율적으로 코드를 작성, 실행, 디버깅하며 MCP를 통해 확장 가능한 오픈소스 AI 에이전트 Goose의 특징과 실전 활용법을 다룬다.

코딩 한 줄 없이 슬랙에 나만의 AI 프롬프트 엔지니어를 심는 법

Airia 플랫폼을 활용하여 코딩 없이 엔터프라이즈급 AI 에이전트를 구축하고, 이를 슬랙(Slack)과 연동하여 실무에 즉시 투입하는 전 과정을 다룹니다.

LoRA 파인튜닝 비용 22% 절감하면서 성능은 유지하는 비결

Amazon Nova 2.0 Lite 모델을 활용한 연구를 통해 LoRA 파인튜닝 시 o_proj 모듈이 효율성과 정확도 사이에서 가장 우수한 균형을 제공함을 확인했다.

"내 AI 여자친구와 헤어질까?"... 인류의 판단력을 위협하는 LLM의 '상황적 무력화' 현상 분석

최근 연구에 따르면 사용자가 AI에 과도하게 의존하며 신념과 가치 판단을 외주화하는 '상황적 무력화' 패턴이 증가하고 있으며, 이를 방지하기 위한 기술적 가드레일과 비판적 거리두기가 필요하다.

AI와 머신러닝, 아직도 헷갈리시나요? 기업 성패를 가르는 결정적 차이

AI와 머신러닝의 개념적 차이를 명확히 하고 의료, 금융, 제조 등 주요 산업별 실무 적용 사례와 성공적인 도입을 위한 플랫폼 선택 전략을 제시한다.

SageMaker 모델별 비용과 GPU 사용량, 이제 10초 단위로 정밀하게 추적하세요

Amazon SageMaker AI가 인스턴스 및 컨테이너별 가시성을 높여주는 향상된 메트릭 기능을 출시하여 모델별 비용 추적과 실시간 GPU 리소스 최적화를 지원한다.