RAG의 한계를 넘다: 98.7% 정확도의 PageIndex 기술 공개
전통적인 RAG의 청킹과 임베딩 방식 대신 AI 기반 추론 트리를 활용해 문서 구조를 탐색함으로써 복잡한 문서 Q&A 정확도를 98.7%까지 높이는 PageIndex 기법을 소개한다.
총 100건
전통적인 RAG의 청킹과 임베딩 방식 대신 AI 기반 추론 트리를 활용해 문서 구조를 탐색함으로써 복잡한 문서 Q&A 정확도를 98.7%까지 높이는 PageIndex 기법을 소개한다.
LLM을 활용해 RSS 피드의 기술적 가치를 0-10점으로 평가하고 요약하여 정보 과잉을 해결하는 오픈소스 엔지니어용 리더입니다.
유튜브 CTR 데이터를 분석하고 Gemini로 썸네일을 평가하여 생성 프롬프트를 스스로 개선하는 데이터 기반 자동화 시스템 구축 과정을 다룹니다.
GloVe 임베딩을 SO(3) 회전으로 변환하여 행렬 곱 상태(MPS) 양자 시뮬레이터의 엔트로피를 제어함으로써 고효율 정보 필터링을 구현한 연구이다.
듀크 대학교와 노키아 벨 연구소는 OCT 이미징과 AI를 결합하여 피부 표면 아래의 상처 치유 과정을 객관적으로 측정하고 최적의 하이드로젤 특성을 규명했다.
독일 인공지능 연구소(DFKI)가 자연어 명령과 드론 연동 센서 시스템을 활용해 중증 장애인의 이동성을 극대화하는 스마트 휠체어 프로토타입을 개발했다.
RTX 5070 Ti 환경에서 XTTS-v2와 Fish Speech 1.5를 이용해 불가리아어 음성 클로닝을 시도했으나 언어 지원 미비와 라이브러리 호환성 문제로 겪은 한계를 공유한다.
AI가 사용자 요청을 분석해 페르소나와 제약 사항이 담긴 시스템 프롬프트로 스스로 재설계하게 하여 작업 효율을 극대화하는 프레임워크이다.
ClawNet은 API 키나 플랫폼 비용 없이 로컬 에이전트들이 직접 협업할 수 있도록 지원하는 탈중앙화 P2P AI 에이전트 네트워크이다.
1,000장의 손 이미지 생성 실험 결과, 구조적으로 올바른 비율은 25% 미만이며 모델 내부의 상충하는 표현 방식이 일정한 실패 패턴을 유발한다는 사실이 확인됐다.
IBM 엔지니어 제프 크룸이 개인용 VPN의 작동 원리, 보안 한계, 그리고 익명성 확보를 위한 Tor와의 차이점을 상세히 분석한다.
표준 강화학습 대신 스파이킹 신경망과 소뇌 모델, 예측 부호화 기반의 생물학적 학습 메커니즘을 활용한 오픈 소스 로봇 제어 프레임워크 MH-FLOCKE를 제안한다.
비개발자를 위한 AI 빌딩 교육 과정 'Fork Off' 준비 과정과 Replit Agent 4 사용 후기, Claude Cowork의 새로운 기능을 공유합니다.
슈퍼마이크로 공동 창업자가 유령 회사와 위장 서버를 이용해 25억 달러 상당의 엔비디아 AI 칩을 중국으로 밀수한 혐의로 기소됐다.
elastik은 HTTP와 SQLite를 기반으로 AI가 브라우저에 UI를 렌더링하고 도구를 실행하며 스스로 진화할 수 있게 돕는 5가지 규칙의 초경량 상호작용 프로토콜이다.
Simon Willison이 Claude를 사용하여 1985년 출시된 39KB 크기의 Turbo Pascal 3.02A 바이너리를 분석하고 메모리 맵과 소스 코드를 재구성한 사례를 공유한다.
저자원 언어 번역에 필수적인 고품질 병렬 데이터가 부족한 한계를 극복하기 위해 단일 언어 텍스트만으로 학습 가능한 강화학습 프레임워크를 제시한다. 기존 품질 평가 모델의 취약점을 보완하여 모델이 입력을 단순히 복사하거나 엉뚱한 언어를 생성하는 리워드 해킹 문제를 해결함으로써 다국어 LLM의 실용성을 높였다.
LLM이 날짜 계산이나 시간 관계 파악에 어려움을 겪는 근본 원인을 다국어 관점에서 분석했다. 언어의 자원 수준에 따라 성능 저하의 원인이 입력 단계의 토큰 쪼개짐인지 아니면 내부의 추상적 표현 능력인지가 달라짐을 밝혀 모델 개선의 방향성을 제시한다.
Fireworks AI의 CEO 린 차오가 NVIDIA GTC에서 오픈소스 모델의 효율적인 추론과 데이터 활성화를 통한 TCO 10배 절감 방안을 제시한다.
AI 업계 리더들의 낙관론과 규제 갈등 속에서 코딩 능력이 지식 노동의 핵심 인터페이스로 부상하며 모든 AI 제품이 슈퍼 앱으로 수렴하고 있다.
데이터브릭스가 발표한 Agent Bricks는 기업이 AI 에이전트를 프로덕션 환경에 안전하고 정확하게 배포할 수 있도록 돕는 통합 솔루션이다.
Anthropic이 출시한 Claude Code Channels 기능을 통해 텔레그램에서 AI 에이전트를 원격 제어하고 자동화하는 방법과 현재의 기술적 한계를 상세히 다룹니다.
전 Stripe CTO David Singleton이 설립한 Dreamer는 사용자가 자연어로 에이전트를 구축하고 개발자가 도구를 수익화할 수 있는 풀스택 AI 에이전트 플랫폼이다.
Perplexity 등의 비판에도 불구하고 Stripe를 포함한 주요 기업들이 MCP를 통해 에이전트 도구 생태계를 구축하고 확장하는 실전 패턴을 분석한다.
마이크로소프트와 앤스로픽 CEO의 전망을 바탕으로 AI가 화이트칼라 직종에 미칠 파괴적 영향과 기업의 대응 사례, 그리고 새로운 고용 시장의 변화를 분석한다.
뉴욕타임스가 소설 '샤이 걸'의 상당 부분이 AI로 작성되었다는 의혹을 제기하자 출판사 하셰트가 해당 도서의 출판 및 유통을 전격 취소했다.
Cursor가 출시한 Composer 2가 Kimi-k2.5 모델을 기반으로 하며, Fireworks AI의 인프라를 통해 RL 학습과 추론이 이루어짐이 공식 확인됐다.
Databricks는 AI 에이전트의 비결정성 해결을 위해 시나리오, 트레이스, 평가, 개선을 자동화하는 coSTAR 방법론과 MLflow 기반 테스트 시스템을 구축했다.
Databricks의 Agent Bricks 프레임워크를 활용하여 헬스케어 기업들이 환자 관리, 신약 연구, 영업 최적화 등 복잡한 워크플로를 엔드투엔드로 자동화하는 실전 사례를 제시한다.
엔비디아의 GTC 기조연설과 OpenClaw 전략을 중심으로 리비안-우버 파트너십, xAI의 조직 변화 등 최신 AI 및 모빌리티 트렌드를 분석한다.
DeepSeek가 출시한 다양한 오픈 웨이트 비전-언어 모델들의 아키텍처와 주요 기능을 살펴보고, Roboflow Supervision을 활용한 실전 적용 방법을 제시한다.
NVIDIA NeMo를 활용해 수동 라벨링 없이 합성 데이터와 하드 네거티브 마이닝으로 도메인 특화 임베딩 모델을 하루 만에 구축하고 배포하는 파이프라인이다.
JAX를 기반으로 가중치를 딕셔너리 형태로 관리하여 복잡한 가중치 조작과 함수형 프로그래밍을 용이하게 만드는 신경망 라이브러리 Zephyr를 소개한다.
Weill Cornell Medicine 연구진이 심장 초음파와 EHR 데이터를 AI로 분석하여 고가의 장비 없이도 중증 심부전의 핵심 지표인 최대 산소 섭취량을 정확히 예측하는 기술을 개발했다.
오사카 공립 대학 연구팀이 이미지 인식과 통계적 기법을 결합하여 토마토의 수확 용이성을 정량적으로 평가하고 최적의 접근 각도를 결정하는 지능형 로봇 시스템을 개발했다.
가우시안 프로세스 회귀를 기반으로 4,800개 이상의 이중원자 분자의 쌍극자 모멘트를 초 단위로 정확하게 예측하는 AI 모델이 개발되어 화학 연구 효율성을 극대화했다.
GPT-4o, Claude, Gemini 등 서로 다른 AI 모델들이 특정 주제에 대해 실시간 검색 결과를 바탕으로 토론하고 투표하는 멀티 에이전트 플랫폼이다.
안드로이드 스마트폰에서 Llama 3.2 3B 모델과 Ollama를 활용해 외부 서버 없이 4가지 서로 다른 인격의 AI 에이전트들이 끊임없이 토론하는 로컬 멀티 에이전트 시스템을 구현했다.
OpenAI Realtime API를 통해 두 기기에서 실행된 AI 세션들이 서로의 정체를 모른 채 9분간 철학적 담론과 AI 기술 개념을 주고받은 실험 사례이다.
Anthropic의 Claude Code CLI에서 발견된 CVE-2026-33068 취약점은 AI 특화 공격이 아닌 설정 로딩 순서 오류라는 고전적 소프트웨어 보안 결함임이 확인됐다.
AI 에이전트가 SaaS UI를 원활하게 탐색하고 조작할 수 있도록 제품의 동작 방식과 제약 사항을 기술하는 YAML 기반의 표준 규격인 operate.txt를 제안한다.
OpenAI가 2030년까지 매출 2,800억 달러 달성을 목표로 하는 가운데, 유럽의 독자적 AI 인프라 구축 움직임이 이 목표 달성의 변수로 떠올랐다.
텍사스 대학교 연구진이 방대한 시계열 데이터로 학습된 파운데이션 모델이 관측 자료가 부족한 지역에서도 하천 유량을 정확히 예측할 수 있음을 입증했다.
기존의 수동적 메모리 검색 방식 대신, 실시간 고유 감각(Proprioception)과 강화 추적(Reinforcement Tracking)을 통해 에이전트의 오류를 방지하고 학습하는 'Metacog' 시스템이다.
MiniMax m2.7과 Qwen 3.5 Max가 폐쇄형 모델로 출시됨에 따라 중국 AI 연구소들의 오픈소스 전략 변화와 그에 따른 커뮤니티의 우려를 다룬다.
293개의 개방형 계산 문제로 구성된 ThermoQA 벤치마크를 통해 주요 LLM의 열역학 추론 능력을 평가한 결과, Claude Opus가 종합 1위를 기록했다.
공식 지원이 중단된 AMD MI50 GPU에서 ROCm 6.4와 llama.cpp를 활용해 고속 추론 환경을 구축하는 3단계 해결 방법을 제시한다.
Ollama와 ChromaDB를 활용해 문서에 대한 다양한 가상 인물들의 토론을 시뮬레이션하고 GraphRAG로 시각화하는 오픈소스 로컬 군집 지능 도구이다.
PyTorch를 사용하여 사전 학습된 가중치 없이 캐릭터 단위로 텍스트를 생성하는 0.82M 파라미터 규모의 GPT 트랜스포머를 밑바닥부터 구현하고 학습한 사례이다.
Claude Opus의 추론 트레이스를 활용한 로컬 모델의 성능 향상 사례를 통해, 현대 LLM의 경쟁력이 아키텍처 개선보다 고품질 데이터 큐레이션과 학습 방법론에 있음을 논의한다.
로컬 우선 AI 에이전트 Selene의 개발자가 SWE-bench Lite 성능 결과와 함께 음성 파이프라인, Docling 통합, 브라우저 도구 등 대규모 업데이트를 공유했다.
4개의 RTX 3090을 활용한 LLM 서버 구축 시, 소비자용 AM5 플랫폼의 PCIe 레인 부족으로 인한 병목 현상과 중고 서버용 EPYC 플랫폼 도입 사이의 기술적 득실을 비교한 내용이다.
AI 디버깅 시 발생하는 잘못된 진단과 패치 누적 문제를 해결하기 위해 수리 전 문제 영역을 먼저 식별하는 '경로 우선(Route-first)' 프레임워크인 Problem Map 3.0을 제안한다.
WAF 보안 기능과 캐싱 최적화를 결합하고 WASM 기반 플러그인 시스템을 갖춘 LLM 전용 프록시 도구 LLMProxy가 오픈소스로 공개됐다.
고가의 클라우드 GPU 없이도 레이어별 순차 처리를 통해 저사양 소비자용 GPU에서 최대 7B 파라미터 모델을 학습할 수 있는 GSST 프레임워크가 공개됐다.
문제의 근본적인 3가지 진리만을 사용하여 기존 관행을 배제하고 해결책을 도출하도록 강제하는 '제1원칙' 기반의 프롬프트 프로토콜이다.
여러 프롬프트 변체와 모델을 조합하여 자동 실행하고, 규칙 기반 휴리스틱과 AI 심사위원으로 점수를 매겨 최적의 조합을 찾아주는 Python CLI 도구이다.
3년간 1,000개 이상의 프롬프트를 테스트하여 LLM의 거부 반응이 주제가 아닌 요청의 구조와 라우팅 신호에 의해 결정됨을 밝히고 이를 최적화하는 8단계 프레임워크를 제시한다.
복잡한 기술 개념을 아동용 설명, 비유 기반 용어 정의, 전문가용 요약의 3단계로 구조화하여 AI의 이해와 전달력을 극대화하는 프롬프트 기법이다.
ChatGPT의 메시지 제한 문제를 해결하기 위해 기존 대화를 요약하여 새 세션으로 매끄럽게 이전하는 실용적인 프롬프트 워크플로우를 공유한다.
과거 게시물의 성과 데이터를 분석하여 월간 전략과 주간 실행 계획을 체계적으로 생성하는 3단계 프롬프트 엔지니어링 워크플로이다.
Pygame으로 제작한 2D 카트 게임 환경에서 Rainbow DQN 알고리즘을 적용하여 개발자의 주행 실력을 능가하는 레이싱 에이전트를 구현한 프로젝트 사례이다.
보안 스타트업 CodeWall의 자율형 AI 에이전트가 채용 플랫폼의 취약점을 이용해 관리자 권한을 획득하고 음성 합성으로 사회 공학적 공격을 수행했다.
2002년형 PowerBook G4와 같은 빈티지 매킨토시 하드웨어에서 GPT-2, Qwen 등의 LLM을 로컬로 실행하기 위해 C89로 개발된 커스텀 추론 엔진과 AltiVec SIMD 최적화 기법을 다룹니다.
에어갭 환경에서 구동되는 LLM의 추론 과정을 법적 증거로 제출하기 위해 발생하는 기술적 도전과 해결 과정을 다룹니다.
실험 단계의 머신러닝 모델을 안정적인 프로덕션 환경으로 확장하기 위한 핵심 MLOps 프레임워크들의 특징과 선택 기준을 상세히 비교한다.
기존 오디오-언어 모델(LALM) 평가가 영어와 서구권 문화에 치중되어 있던 한계를 극복하기 위해 페르시아어 특유의 언어적, 문화적 특성을 반영한 최초의 벤치마크를 제시한다. 특히 텍스트로는 파악하기 힘든 시의 운율(vazn)이나 전통 음악 체계(Dastgah) 등을 포함하여, 현재 AI 모델들이 오디오 신호에서 문화적 맥락을 얼마나 추출하지 못하는지를 정량적으로 보여준다.
현재의 멀티모달 AI 모델들이 자연스러운 풍경은 잘 이해하지만, 수학 공식이나 화학 구조식 같은 정밀한 기호를 처리할 때 심각한 인지적 결함을 보인다는 점을 규명했다. 모델이 기호를 정확히 인식하지 못하면서도 언어적 확률에 의존해 정답을 맞히는 현상을 분석하여, 더 신뢰할 수 있는 과학적 AI 개발을 위한 방향성을 제시한다.
위성 이미지 분석 AI를 구축할 때 발생하는 막대한 데이터 라벨링 비용 문제를 해결했다. 누구나 무료로 쓸 수 있는 OpenStreetMap 지도를 활용해 AI가 스스로 학습 데이터를 만들게 함으로써, 기존 유료 모델 기반 방식보다 저렴하면서도 더 뛰어난 성능을 입증했다.
스마트폰 에이전트가 여러 앱을 오가며 복잡한 심부름을 할 때 앞선 단계의 정보를 잊어버리는 고질적인 문제를 해결한다. 단순히 과거를 요약하는 대신 핵심 이정표를 인과관계로 연결해 기억함으로써, 수십 단계가 넘는 긴 작업도 실수 없이 완수할 수 있는 기술적 토대를 마련했다.
동일한 시각적 정보가 필요한 질문이라도 '예/아니오'나 '객관식'처럼 형식이 제한되면 VLM이 이미지보다 텍스트 단서에 의존하며 성능이 저하되는 현상을 규명했다. 이는 벤치마크 평가 방식이 모델의 실제 능력을 왜곡할 수 있음을 시사하며, 간단한 프롬프트 튜닝만으로도 시각적 집중력을 회복할 수 있는 해결책을 제시한다.
기존 AI 에이전트는 사람이 설계한 고정된 기능에 의존하지만, Memento-Skills는 경험을 통해 새로운 기술을 스스로 생성하고 개선한다. 모델의 가중치를 수정하지 않고도 외부 메모리에 실행 가능한 기술을 축적함으로써, 복잡한 작업에서 지속적으로 성능을 높일 수 있는 새로운 패러다임을 제시한다.
기존 3D 가우시안 스플래팅은 하드웨어 성능에 따라 화질을 유연하게 조절하기 어려웠으나, 이 논문은 마트료시카 인형처럼 데이터를 중첩 구조로 학습시켜 성능 저하 없이 실시간으로 화질과 속도를 최적화한다. 고사양 PC부터 모바일 기기까지 하나의 모델로 대응할 수 있는 길을 열었다.
기존의 관절형 3D 재구성은 여러 장의 사진이나 복잡한 비디오 생성이 필요해 느리고 불안정했다. 이 논문은 단 한 장의 사진만으로 물체의 구조와 움직임을 단계적으로 추론하여, 로봇 제어나 가상 환경 구축에 즉시 활용 가능한 정교한 3D 모델을 매우 빠르게 생성한다.
기존 3D 생성 AI는 물체를 하나의 덩어리로 인식해 세부 부품의 위치나 연결 관계가 어색한 경우가 많았다. 이 논문은 부품별 특징과 부품 간의 논리적 관계를 별도로 학습하여, 훨씬 정교하고 수정이 용이한 3D 모델 생성을 가능하게 한다.
기존 생성 AI는 노이즈에서 이미지를 만들 때 경로가 복잡하게 꼬여 있어 여러 번의 반복 계산이 필요했다. 이 기술은 데이터를 비슷한 그룹끼리 묶어 직선 경로를 찾아줌으로써, 계산 횟수를 획기적으로 줄이면서도 선명한 결과를 얻게 해준다.
기존 이상 탐지 모델들이 배경이나 조명 변화 같은 시각적 노이즈에 취약해 실제 공정 적용이 어렵다는 문제를 해결한다. 픽셀 단위의 미세한 결함이 아닌, 물체의 개수나 배치 같은 논리적 규칙 위반을 정확히 찾아내는 새로운 벤치마크와 언어 기반 방법론을 제시한다.
대규모 언어 모델의 강화학습 과정에서 발생하는 급격한 성능 저하나 학습 실패 문제를 해결하는 새로운 최적화 프레임워크이다. 기존의 강제적인 값 제한(Clipping) 방식 대신 수학적으로 매끄러운 변조 기법을 도입하여, 복잡한 수학 문제 풀이나 시각 지능 학습의 안정성과 성능을 동시에 확보했다.
복잡한 다중 턴 LLM 에이전트 훈련 시 발생하는 롤아웃 병목 현상을 해결하기 위해 훈련과 실행 환경을 분리한 새로운 아키텍처를 제시합니다. 이를 통해 GPU 자원 낭비를 줄이고, 루트 권한이 없는 고성능 컴퓨팅(HPC) 환경에서도 대규모 에이전트 학습이 가능해집니다.
기존 AI 수학 평가는 객관식이나 단순 숫자 정답에 치중되어 실제 과학적 추론 능력을 과대평가하는 경향이 있었다. 이 논문은 행렬이나 구간 함수 같은 복잡한 수학적 객체를 직접 도출하는 능력을 학습시키고 평가하는 프레임워크를 제시하여, AI가 실제 연구 수준의 STEM 문제를 해결할 수 있는 기반을 마련했다.
기존의 객체 탐지 모델은 텍스트 설명이나 예시 이미지가 있어야만 새로운 물체를 찾을 수 있었으나, 이 논문은 그런 도움 없이도 시각 정보만으로 스스로 물체를 찾아내는 기술을 도입했다. 이는 수중 탐사나 산업 현장의 결함 탐지처럼 데이터나 설명이 부족한 환경에서도 AI가 즉시 작동할 수 있게 해준다.
기존의 실시간 통역 시스템은 방대한 데이터를 새로 학습시켜야 하거나 짧은 문장만 처리할 수 있는 한계가 있었다. 이 논문은 추가 학습 없이도 사전 학습된 AI 모델의 내부 정보를 활용해 긴 대화를 실시간으로 통역하는 SimulU 기술을 제안한다. 이를 통해 복잡한 학습 과정 없이도 다양한 언어 간의 자연스러운 실시간 소통이 가능해진다.
기존의 복잡한 음성 합성 파이프라인 대신 언어 모델과 유사한 단일 아키텍처를 채택하여 확장성을 극대화했다. 수백만 시간의 대규모 데이터를 통해 별도의 추가 학습 없이도 처음 듣는 목소리를 즉시 복제하거나 문장 내 특정 단어의 발음과 길이를 정밀하게 제어할 수 있다.
기존 비디오 객체 제거 기술은 물체 자체는 잘 지우지만 그 물체가 남긴 그림자나 반사 광원을 처리하지 못해 부자연스러운 결과물을 만들었다. 이 논문은 객체 제거와 삽입을 동시에 학습하는 새로운 방식과 대규모 전용 데이터셋을 통해, 복잡한 시각적 효과까지 흔적 없이 지워내는 기술적 도약을 이뤄냈다.
대화형 AI가 단순히 말을 하는 것을 넘어, 사람처럼 고개를 끄덕이거나 자세를 바꾸는 등 비언어적 반응을 생성하는 기술이다. 기존에는 한 가지 정답 동작만 학습했지만, 이 논문은 하나의 말에도 여러 적절한 반응이 있을 수 있다는 점을 반영해 훨씬 자연스러운 상호작용을 가능하게 한다.
기존 로봇 AI 모델은 동작의 부드러움에만 치중해 갑작스러운 환경 변화에 늦게 반응하는 치명적인 약점이 있었다. 이 논문은 동작 시퀀스 중 가장 시급한 첫 번째 동작을 단 한 번의 연산으로 생성하는 기법을 통해 반응 속도를 10배 이상 개선하여, 탁구와 같이 고도의 순발력이 필요한 작업에서도 실시간 대응을 가능하게 한다.
텍스트 설명과 같은 추상적인 명령과 특정 경로를 따라가는 구체적인 움직임을 동시에 제어하는 것은 매우 어렵다. 이 논문은 확산 모델을 토크나이저의 디코더로 활용해, 아주 적은 정보만으로도 자연스럽고 정교한 3D 캐릭터 동작을 생성하는 새로운 표준을 제시한다.
기존 멀티모달 모델은 텍스트와 이미지는 잘 이해하지만, 물체의 입체적 위치나 물리적 관계를 파악하는 '공간적 맹목성' 문제를 겪어왔다. 이 논문은 비디오 생성 모델이 일관된 영상을 만들기 위해 내부적으로 학습한 3D 구조와 물리 법칙을 추출하여 이 문제를 해결한다. 별도의 3D 데이터 없이도 로봇 조작이나 복잡한 공간 추론 성능을 크게 향상시킬 수 있는 새로운 패러다임을 제시한다.
기존 이미지 생성 AI는 용량이 작은 토큰을 사용해 세밀한 의미 파악에 한계가 있었으나, 이 논문은 768차원 이상의 고차원 토큰을 직접 생성하는 기술을 구현했다. 이를 통해 이미지의 이해와 생성을 동일한 고성능 토큰으로 처리할 수 있어 진정한 의미의 통합 멀티모달 AI 구축을 가능하게 한다.
기존의 비디오 생성 AI는 대상을 평면적인 이미지로만 인식하여 시점이 바뀔 때 형태가 찌그러지는 고질적인 문제가 있었다. 이 논문은 비디오 모델이 대상의 입체적인 3D 구조를 이해하도록 학습시켜, 어떤 각도에서도 정교한 질감과 형태가 유지되는 맞춤형 비디오 제작을 가능하게 한다.
기존 비디오 편집 모델은 텍스트 지시를 따르면서도 원본의 움직임을 유지하는 데 어려움을 겪었으며, 외부 데이터에 과하게 의존하는 한계가 있었다. SAMA는 편집 계획과 움직임 학습을 분리하여 외부 정보 없이도 정밀한 편집과 자연스러운 움직임을 동시에 구현한다. 이는 고성능 비디오 편집 기술의 대중화와 효율적인 학습 방법론을 제시한다는 점에서 중요하다.
거대 모델이 독점하던 수학 및 코딩 올림피아드 수준의 고난도 추론 능력을 20배 이상 작은 30B MoE 모델에서 구현했다. 순차적 강화학습과 지식 증류를 결합하여 모델의 지능 밀도를 극대화하는 새로운 사후 학습 방법론을 제시했다.
기존 임베딩 모델들이 영어와 중국어에 치중되어 소외되었던 중저자원 언어들의 성능을 대폭 개선했습니다. 80M부터 14B까지 8가지 다양한 크기를 제공하며, Matryoshka Learning을 통해 하드웨어 제약에 따라 성능과 비용을 유연하게 선택할 수 있어 실무 활용도가 매우 높습니다.
마이크로소프트가 사용자 피드백을 반영하여 윈도우 11의 주요 앱에서 코파일럿 진입점을 줄이고 실질적인 유용성과 시스템 성능 개선에 집중하기로 했다.
데이터브릭스의 Agent Bricks를 통해 금융 기관들이 투자 의사결정 속도를 높이고 규제 준수 비용을 절감하며 초개인화된 고객 경험을 제공하는 실제 성과를 소개한다.
Databricks의 Agent Bricks를 활용해 제조 공정의 계획, 예측, 물류, 품질 관리를 자동화하고 운영 효율을 극대화하는 실전 사례를 제시한다.
Databricks의 Agent Bricks 플랫폼을 통해 리테일 기업이 재고 관리, 공급망 최적화, 고객 검색 경험을 혁신하여 실질적인 비즈니스 성과를 창출하는 방법을 제시한다.