피그마의 시대는 끝났나? Claude Design과 Google Stitch 전격 비교
Anthropic의 Claude Design과 Google의 Stitch를 기능, 비용, 디자인 품질, 코드 연동성 등 다각도에서 비교 분석하여 최적의 AI 디자인 워크플로우를 제안한다.
총 100건
Anthropic의 Claude Design과 Google의 Stitch를 기능, 비용, 디자인 품질, 코드 연동성 등 다각도에서 비교 분석하여 최적의 AI 디자인 워크플로우를 제안한다.
Valkey와 BetterDB를 활용하여 RAG 파이프라인에 시맨틱 캐싱을 적용하고, MCP를 통해 자연어로 시스템을 모니터링하는 프로덕션 수준의 구축 방법을 제시한다.
Claude Opus가 설계한 Laze는 LLM의 코드 생성 효율과 정확도를 극대화하기 위해 구두점을 최소화하고 C로 컴파일되는 네이티브 언어입니다.
AI 주권은 데이터 거주지를 넘어 벤더 종속성 탈피와 기술 스택 전반에 대한 통제력 및 유연성을 확보하는 비즈니스 독립성 전략이다.
대규모 데이터셋 처리 시 Pandas의 성능 한계를 극복하기 위해 Rust 기반 Polars의 병렬 처리와 지연 평가를 활용한 성능 최적화 사례를 분석한다.
디자인 스타트업 Dessn이 코드베이스를 클라우드에서 직접 실행하고 AI 프롬프트로 UI를 수정할 수 있는 도구를 개발하여 600만 달러의 시드 투자를 유치했다.
아마존 직원들이 AI 기술 활용도를 높게 평가받기 위해 내부 도구 'MeshClaw'를 활용해 불필요한 작업까지 자동화하며 토큰 사용량을 인위적으로 늘리고 있다.
NVIDIA와 SAP가 협력하여 오픈소스 런타임 OpenShell을 통해 기업용 자율 AI 에이전트의 보안, 정책 집행 및 거버넌스 제어 기능을 강화한다.
AI 토큰 단가는 하락하고 있으나, 에이전트 기반의 과도한 소비와 가시성 부족으로 인해 기업의 전체 AI 지출은 오히려 급증하고 있으며 이를 관리하기 위한 워크플로 중심의 거버넌스가 시급하다.
상용 LLM API 게이트웨이에서 발생하는 무음 실패를 탐지하고 암호학적으로 증명하는 오픈소스 감사 프레임워크 Silent-Bench가 공개됐다.
AI가 생성한 최초의 제로데이 익스플로잇 발견과 OpenAI의 새로운 보안 모델 출시 등 AI 기술의 최신 보안 및 산업 동향을 다룹니다.
시계열 데이터의 리샘플링, 이상치 탐지, 성분 분해, SARIMA 예측 및 다중 시계열 비교를 자동화하는 5가지 핵심 Python 스크립트를 소개합니다.
AI 음성 인프라 스타트업 Vapi가 아마존 링의 전량 도입 성과를 바탕으로 5억 달러 가치를 인정받으며 5,000만 달러 규모의 시리즈 B 투자를 유치했다.
Nous Research가 공개한 Hermes Agent는 스케줄링, 도구 통합, 상태 관리를 지원하는 고급 AI 에이전트 구축용 오픈소스 런타임입니다.
일본 RIKEN AIP 연구소가 세계적 AI 학회인 ICML 2026에서 총 42편의 논문을 채택시키는 성과를 거두었습니다.
OnDemand 플랫폼의 마켓플레이스, 플레이그라운드, 플로우 빌더를 사용하여 비즈니스용 멀티 에이전트 시스템을 구축하고 자동화하는 방법을 제시한다.
14개 LLM을 대상으로 코드 분석 성능과 비용을 벤치마크한 결과, DeepSeek V4 Flash가 압도적인 가성비를 보였으며 고가 모델의 비용 효율성은 낮은 것으로 나타났다.
Figma 디자인 위에 색상 박스를 그려 Claude에게 좌표를 추출하게 함으로써 복잡한 레이아웃 엔진 코딩 없이 앱 템플릿 시스템을 구축한 사례이다.
MCP를 통해 Claude와 로컬 Ollama(Qwen 2.5 Coder)를 연결하여 고비용 작업을 로컬 모델에 위임하는 하이브리드 에이전트 시스템 구축 사례이다.
AI 챗봇 사용자의 폭력적 성향을 감지하지 못한 OpenAI 등 AI 기업들을 대상으로 한 '경고 의무' 위반 소송이 잇따르고 있다.
Thinking Machines가 200ms 단위의 마이크로 턴 구조를 통해 실시간 멀티모달 상호작용을 구현한 TML-Interaction-Small 모델을 공개했습니다.
전통적인 MLOps가 모델 학습과 예측 품질에 집중했다면, LLMOps는 프롬프트, 검색 파이프라인, 에이전트 조율 등 모델 주변 시스템 최적화에 초점을 맞춘다.
Modal은 클라우드 버퍼, 커스텀 파일시스템, CPU/GPU 체크포인트 기술을 결합하여 GPU 서버리스 추론의 콜드 스타트 지연을 2,000초에서 50초로 단축했습니다.
UC 샌디에이고의 Michael Yip 교수가 이미지 기반 제어부터 물리 시뮬레이션, 휴머노이드 로봇을 활용한 의료 보조까지 자율 수술 로봇의 핵심 기술과 미래 방향을 제시한다.
LLM 추론의 핵심 병목인 메모리 대역폭 문제를 분석하고, KV 캐시 최적화, 추측 디코딩, 연속 배칭 등 최신 성능 향상 기법을 다룹니다.
AWS 인프라와 오픈소스 소프트웨어 스택을 활용하여 파운데이션 모델의 사전 학습, 사후 학습, 테스트 시간 컴퓨팅을 최적화하는 4계층 아키텍처 가이드
OpenAI가 Codex Security 에이전트와 GPT-5.5-Cyber 모델을 결합하여 조직의 코드 취약점을 자동으로 탐지하고 패치하는 보안 이니셔티브 'Daybreak'를 발표했습니다.
LLM 추론 속도를 높이는 추측 디코딩 기술에서 기존의 순차적 방식(EAGLE-3)과 병렬 방식(Medusa)의 단점을 동시에 해결했습니다. 한 번의 연산으로 여러 토큰 간의 의존성을 유지하며 예측하는 블록 단위 접근법을 통해 연산 비용은 절반으로 줄이면서도 정확도는 높게 유지합니다.
LLM 에이전트가 긴 작업을 수행할 때 어떤 행동이 성공에 기여했는지 판단하는 Credit Assignment 문제는 매우 어렵다. 이 논문은 추가적인 보상 모델이나 데이터 라벨링 없이 모델 내부의 엔트로피 신호만으로 학습 효율을 극대화하는 경량화된 해결책을 제시한다.
AWS의 Strands Agents SDK와 Exa AI 검색 엔진을 통합하여 실시간 웹 정보를 스스로 검색하고 분석하는 고성능 리서치 에이전트 구축 방법을 소개합니다.
구글의 새로운 에이전트 모드 Remy와 OpenAI Codex의 울트라패스트 모드 등 구글 I/O를 앞두고 유출된 주요 AI 기술 업데이트를 다룹니다.
Databricks가 Delta Lake와 Unity Catalog를 결합하여 멀티 테이블 트랜잭션과 엔진 간 데이터 일관성을 보장하는 Catalog Commits 기능을 정식 출시했다.
Anthropic의 엔지니어가 AI 에이전트와의 데이터 교환 포맷으로 Markdown보다 HTML이 정보 밀도와 시각화 측면에서 우수하다고 제안하며 업계의 주목을 받았습니다.
미국 조지아주의 대규모 데이터 센터가 유틸리티 당국의 모니터링 부재를 틈타 약 3,000만 갤런의 물을 무단으로 사용한 사실이 밝혀졌다.
Ollama와 Hugging Face를 활용하여 검열이 제거된 SuperGemma 26B 모델을 로컬 환경에서 실행하고, 자율 연구 루프를 통해 모델의 제한을 해제하는 방법을 제시한다.
Databricks와 MapAid가 멀티모달 AI를 사용하여 수단의 방대한 스캔 지질 문서를 검색 가능한 데이터베이스로 변환하고 지하수 예측 모델을 강화했습니다.
RF-DETR 모델과 ByteTrack 알고리즘을 결합하여 하키 경기 영상에서 선수들의 고유 식별자를 유지하고 이동 경로를 시각화하는 자동화 시스템 구축 방법을 설명합니다.
프로덕션 환경에서 LLM 애플리케이션의 성능, 비용, 품질을 모니터링하고 디버깅하기 위한 7가지 주요 관측성(Observability) 도구의 특징과 선택 기준을 제시한다.
AI 에이전트의 신뢰성과 확장성을 확보하기 위해 메모리, 도구, 보안을 관리하는 전용 운영체제(Agent OS) 아키텍처의 필요성을 제시한다.
Git의 interactive rebase 개념을 LLM 세션에 도입하여 대화 기록을 선택적으로 유지, 요약, 삭제할 수 있는 히스토리 관리 도구이다.
실시간 뉴스 헤드라인을 바탕으로 AI 모델들이 밈을 생성하고 사용자가 블라인드 투표로 우열을 가리는 벤치마크 플랫폼입니다.
tmux와 at 명령어를 조합하여 Claude의 사용량 제한이 해제되는 시점에 맞춰 자동으로 작업을 재개하는 쉘 스크립트 팁이다.
LLM 도입 이후 과학 논문 내 존재하지 않는 가짜 인용문이 급증했으며, 이는 지식 생산의 신뢰성과 공정성을 훼손하고 있다.
여러 코딩 에이전트의 작업 상태와 오류를 실시간 음성 내레이션으로 중계하여 개발자의 모니터링 부담을 줄여주는 Mac용 오픈소스 도구이다.
MCP를 통해 Claude Desktop과 Blender를 직접 연결하여 실시간 3D 모델링 및 시각적 피드백 루프를 구축하는 실전 워크플로가 공유되었다.
Claude Code 사용 시 발생할 수 있는 보안 리스크를 방지하기 위해 도구 접근 권한과 파일 시스템 범위를 명시적으로 제한해야 한다.
Claude의 '스킬' 기능을 활용해 비디오 제작, API 문서화, 재무 모델링 등 9가지 전문 작업을 자동화하고 생산성을 높인 실무 경험 공유이다.
Claude Code 기반의 다중 에이전트 시스템을 구축하여 B2B 영업 리드 수집부터 스코어링, CRM 연동까지 전 과정을 자동화했다.
로컬 또는 사설망의 LLM을 외부 포트 개방 없이 공용 인터넷에 연결하고, 토큰 공유를 통해 크레딧을 적립·사용할 수 있는 P2P 프록시 시스템입니다.
정규 표현식의 등가성 결정 및 최소화라는 PSPACE-완전 문제를 활용하여 LLM과 LRM의 공간적 계산 한계와 추론 능력을 측정하는 RegexPSPACE 벤치마크가 제안됐다.
에이전트가 수많은 도구를 개별 호출하는 대신 코드를 직접 작성해 실행하게 함으로써 토큰 사용량과 추론 횟수를 획기적으로 줄이는 '코드 모드' 패턴이 부상하고 있다.
Claude Sonnet 4.5의 구독 서비스 종료 전 'Extended Thinking'이 활성화된 빈 대화창을 대량 생성하여 사용 기간을 연장하는 우회 방법을 공유했다.
Claude Code 세션을 다중 운영자가 협업하고 원격 제어할 수 있는 공개 에이전트로 확장하는 레이어를 개발했다.
오디오 품질 저하로 깨진 전사 텍스트를 화자의 말투와 의도를 유지하며 복원하기 위한 구체적인 시스템 프롬프트와 가이드라인이다.
Claude Code를 활용해 비서, 변호사, 조사관 등 6가지 전문 역할을 수행하고 상호 컨텍스트를 공유하는 자율형 AI 에이전트 시스템 구축 사례이다.
Graft는 SQLite와 llama.cpp를 기반으로 AI 에이전트에게 세션 간 유지되는 영구적인 그래프 구조의 메모리를 제공하는 로컬 퍼스트 오픈소스 도구입니다.
확산 모델의 백본 아키텍처가 U-Net에서 Transformer(DiT)로 진화하는 과정과 그 내부 작동 원리 및 최적화 기법을 심도 있게 다룹니다.
Hugging Face의 Nouamane Tazi가 수천 개의 GPU 클러스터에서 대규모 언어 모델을 효율적으로 학습시키기 위한 5D 병렬 처리 기법과 MoE 아키텍처의 확장 전략을 상세히 설명합니다.
NVIDIA와 Mistral AI의 연구를 바탕으로 LLM 사전 학습 시 데이터의 순서 최적화, 추론 데이터의 조기 주입, 그리고 강화 학습 기반 목적 함수가 모델 지능에 미치는 영향을 다룹니다.
기존의 AI 모델 학습 방식은 교사 모델의 내부 데이터(로짓)가 꼭 필요해 폐쇄형 모델을 교사로 쓰기 어려웠습니다. 이 논문은 텍스트로 된 평가 기준(루브릭)만으로도 모델을 효과적으로 가르칠 수 있음을 증명하여, GPT-5와 같은 강력한 API 모델을 활용한 효율적인 모델 학습의 길을 열었습니다.
시각 언어 모델(VLM)이 실제 서비스에 도입되면서 이미지에 숨겨진 미세한 노이즈로 모델을 속이는 적대적 공격이 심각한 보안 위협으로 부상했다. 이 논문은 추가적인 재학습 없이도 기존 모델에 간단히 끼워 넣어 공격을 실시간으로 감지할 수 있는 가벼운 방화벽 기술을 제시하여 VLM의 실무 안전성을 크게 높였다.
기존 월드 모델은 고비용의 비디오 생성에 의존하여 연산 부담이 크고 환각 현상에 취약했다. 이 논문은 픽셀 대신 DINO 특징의 잔차를 활용한 RLA 기법을 통해 연산 효율을 극대화하면서도 복잡한 3D 환경에서 정확한 물리적 예측과 정책 학습이 가능함을 입증했다.
기존 양자 시퀀스 모델은 하드웨어의 잡음과 확장성 문제로 긴 데이터를 처리하기 어려웠다. 이 논문은 단일 큐비트 기반의 QKAN과 게이트 메커니즘을 결합하여, 훨씬 적은 파라미터로도 기존 LSTM보다 정확한 예측 성능을 보여주며 실제 양자 컴퓨터에서도 동작 가능함을 입증했다.
연속 혈당 측정(CGM) 데이터는 기기나 측정 환경에 따라 데이터 형태가 달라져 범용적인 분석 모델을 만들기 어려웠다. 이 논문은 원시 데이터를 복원하는 대신 추상적인 특징을 예측하는 JEPA 구조를 도입하여, 병원 검사 결과와 가정용 센서 데이터 간의 격차를 줄이고 인슐린 저항성 등 대사 질환의 조기 진단 가능성을 높였다.
LLM 에이전트가 복잡한 도구 사용 작업을 수행할 때, 작업이 완전히 끝난 뒤에야 실패를 확인하면 이미 돌이킬 수 없는 손실이 발생할 수 있다. 이 논문은 에이전트의 실행 기록(Trace)을 실시간으로 분석하여 실패 가능성을 미리 경고함으로써 조기에 개입할 수 있는 실용적인 모니터링 기술을 제공한다.
강화학습에서 에이전트가 무엇을 보고 어떤 보상을 받을지 설계하는 인터페이스 엔지니어링은 수동 작업이 많이 필요한 병목 구간이다. 이 논문은 LLM을 활용해 관측값 매핑과 보상 함수를 파이썬 코드로 자동 생성하고 진화시켜 사람이 설계한 것보다 효율적인 인터페이스를 찾아낸다.
AI 에이전트가 인간의 지식 노동을 대체함에 따라 임금이 0으로 수렴할 것이라는 막연한 공포를 경제학적 모델로 반박한다. 인간의 임금은 노동 시장이 아니라 GPU 대여료와 같은 연산 자본 시장의 가격에 의해 하한선이 형성됨을 입증하여 향후 AI 정책과 경제적 예측에 새로운 틀을 제공한다.
Hugging Face에 수십만 개의 모델이 쏟아지는 상황에서, 내 데이터셋에 어떤 모델이 가장 좋을지 일일이 테스트하는 것은 불가능에 가깝다. 이 논문은 모델을 직접 실행해보지 않고도 공개된 리더보드 기록과 메타데이터만으로 최적의 모델을 순위 매겨주는 통합 프레임워크를 제시하여 모델 선택 비용을 획기적으로 줄여준다.
LLM 기반 에이전트가 복잡한 다단계 작업을 수행할 때 발생하는 논리적 일관성 부족과 반복적인 추론 오류를 해결하기 위한 메모리 기술의 발전 방향을 제시한다. 단순한 데이터 기록을 넘어 에이전트가 스스로 경험을 추상화하고 자율적으로 진화할 수 있는 기술적 로드맵을 제공한다는 점에서 중요하다.
기존의 통합 멀티모달 모델은 이해와 생성 기능이 분리되어 서로의 장점을 충분히 활용하지 못하는 한계가 있었다. 이 논문은 모델의 이해 능력을 생성 과정의 직접적인 감독 신호로 전환하여 복잡한 지시문 준수 능력과 이미지 세부 묘사를 획기적으로 개선했다.
기존 AI 에이전트 검색이 이미지를 단순히 최종 답변 확인용으로만 썼다면, 이 논문은 이미지를 다음 검색 방향을 결정하는 핵심 단서로 활용하는 능력을 평가합니다. 실제 웹 환경처럼 텍스트와 이미지가 복잡하게 얽힌 상황에서 AI의 추론 능력을 한 단계 높이는 이정표가 될 것입니다.
기존의 바이트 단위 언어 모델은 토크나이저 없이 노이즈에 강하다는 장점이 있지만, 한 바이트씩 생성하는 속도가 매우 느려 실무 적용이 어려웠다. 이 논문은 디퓨전 기법과 자기 추측 디코딩을 도입하여 바이트 모델의 고질적인 속도 문제를 해결하고 메모리 대역폭 비용을 50% 이상 절감했다.
AI 에이전트가 이메일 관리나 금융 거래 등 실생활에 깊숙이 관여하면서 보안 위험이 급증하고 있지만, 이를 체계적으로 평가할 안전한 시뮬레이션 환경이 부족했습니다. 이 논문은 실제 서비스와 유사한 50개 이상의 환경을 제공하여 에이전트의 보안 취약점을 자동으로 탐지하고 평가할 수 있는 표준 플랫폼을 제시합니다.
현재의 대형 언어 모델들이 텍스트 생성 능력은 뛰어나지만 사용자의 실제 의도를 파악하는 능력은 현저히 떨어진다는 사실을 정량적으로 입증했다. 이를 해결하기 위한 새로운 벤치마크와 학습 방법론을 제시함으로써 더 안전하고 유능한 AI 비서 개발의 토대를 마련했다.
LLM 에이전트가 사용하는 기술(Skill)은 프롬프트 형식에 따라 성능 차이가 최대 40%까지 발생하지만, 기존에는 각 플랫폼에 맞춰 수동으로 재작성해야 했습니다. SkCC는 이를 해결하기 위해 하나의 소스로 여러 에이전트 프레임워크에 최적화된 형식을 자동 생성하고 보안 취약점까지 사전에 차단하는 컴파일러 기반의 새로운 접근 방식을 제시합니다.
현재 AI 산업이 대화형 챗봇 인터페이스로 급격히 수렴하면서 발생하는 구조적 부작용을 비판적으로 분석합니다. 챗봇 형태의 AI가 인간의 비판적 사고력을 약화시키고 노동 시장과 환경에 미치는 부정적 영향을 조명하며, 이를 극복하기 위한 다원적 설계 방향을 제시합니다.
기존의 토크나이저들은 단순히 이미지를 잘 복원하는 데만 집중하여 확산 모델이 학습하기 어려운 복잡한 잠재 공간을 만들었습니다. 이 논문은 확산 모델이 학습하기 쉬운 공간의 특성을 정의하고 이를 강제하는 PAE를 제안하여 학습 효율과 생성 품질을 동시에 획기적으로 개선했습니다.
기존의 소수 단계 이미지 생성 기법들은 속도를 위해 확률적 우도 프레임워크를 포기하여 학습 안정성과 품질에 한계가 있었다. NTM은 각 역과정을 가역적인 Normalizing Flow로 모델링하여 정확한 우도 학습을 유지하면서도 단 4번의 샘플링만으로 고품질 이미지를 생성한다.
기존의 지속적 학습 모델들이 20개 내외의 적은 작업 수에서만 검증되었던 한계를 극복하고, 300개 이상의 방대한 작업 시퀀스에서도 성능 저하 없이 학습할 수 있는 확장성을 증명했다. 이는 실제 환경처럼 끊임없이 새로운 정보가 유입되는 상황에서 AI가 지식을 누적하며 성장할 수 있는 발판을 마련했다.
기존의 다단계 RAG는 LLM 자체를 파인튜닝해야 하므로 비용이 매우 높고 대형 모델 적용이 어려웠다. 이 논문은 LLM 대신 가벼운 Embedder 모델만 강화학습으로 최적화하여, 훨씬 적은 비용으로도 초장문 컨텍스트에서 복잡한 추론 검색을 수행할 수 있음을 입증했다.
강력한 외부 교사 모델에 의존하지 않고 LLM이 생성한 데이터만으로 모델을 개선하는 Self-Distillation의 한계를 극복했습니다. 데이터의 신뢰성, 표현 정렬, 학습 안정성을 동시에 해결하여 자원 제약 환경에서도 효율적인 모델 고도화가 가능함을 입증했습니다.
기존 비디오 생성 모델은 영상이 길어질수록 내용이 산으로 가거나 캐릭터의 모습이 변하는 문제가 있었다. 이 논문은 에이전트 구조를 도입해 기억을 관리하고 스스로 오류를 수정함으로써 10분 분량의 긴 영상에서도 일관된 서사를 유지하는 방법을 제시한다.
기존 텍스트-이미지 모델은 복잡한 프롬프트의 세부 사항을 모두 반영하지 못하는 Conceptual Rift 현상을 겪는다. SCOPE는 이를 해결하기 위해 생성 과정을 구조화된 명세서 기반으로 관리하며, 검색과 추론 기능을 결합해 사용자 의도에 완벽히 부합하는 고품질 이미지를 생성한다.
음악에 맞춰 춤추는 영상을 생성할 때 발생하는 동작의 물리적 어색함과 외형의 불일치 문제를 동작 전문가와 외형 전문가를 분리한 MoE 구조로 해결했다. 3D 동작 파라미터를 중간 매개체로 사용하여 기존 2D 기반 방식보다 훨씬 정교하고 역동적인 댄스 비디오 생성이 가능하다.
기존 시각 언어 모델(VLM)은 비디오 속 객체의 움직임과 카메라의 이동이 결합된 복잡한 4D 동적 장면을 이해하는 데 어려움을 겪었다. 이 논문은 외부 기하학적 모듈 없이 모델 내부의 잠재 공간에서 장면의 진화를 시뮬레이션하는 4DThinker 프레임워크를 통해 자율 주행 및 로보틱스 분야에 필수적인 동적 공간 추론 능력을 획기적으로 개선했다.
기존 LoRA는 학습 시 설정한 고정된 Rank(r)에서만 동작하여 최적의 효율을 찾기 위해 반복적인 실험이 필요했다. 이 논문은 하나의 모델 학습만으로 다양한 Rank를 자유롭게 선택해 사용할 수 있게 하여 연산 비용을 획기적으로 줄이고 가변적인 하드웨어 환경에 즉각 대응할 수 있게 한다.
Mamba나 Linear Attention과 같은 최신 순환 모델들이 이론적인 표현력에도 불구하고 왜 긴 시퀀스에서 상태 추적에 실패하는지 분석했다. 오차 제어 역학이라는 새로운 관점을 통해 모델의 구조적 한계가 장기적인 정확도 저하로 이어지는 과정을 수학적으로 증명했다.
Diffusion Transformer(DiT)를 수백 개 이상의 레이어로 확장할 때 발생하는 갑작스러운 학습 붕괴 현상인 Mean Mode Screaming(MMS)의 원인을 규명했다. 이를 해결하는 MV-Split Residuals 기법을 통해 1000개 레이어의 초거대 모델도 안정적으로 학습할 수 있는 기술적 토대를 마련했다.
기존 멀티모달 검색 에이전트는 여러 대상을 찾을 때 하나씩 순차적으로 검색하여 시간이 오래 걸리고 불필요한 비용이 발생했다. 이 논문은 여러 대상을 한 번에 병렬로 검색하는 기법과 효율성을 극대화하는 강화학습 프레임워크를 통해 검색 속도와 정확도를 동시에 획기적으로 개선했다.
기존의 LLM 강화학습 방식인 GRPO 등은 보상 신호를 근사적으로만 처리하여 학습의 안정성이 떨어지는 문제가 있었다. 이 논문은 응답들을 하나의 확률 공간(Simplex)으로 정의하고 수학적으로 정확한 타겟에 직접 투영하는 LPO 기법을 통해 학습 효율과 응답의 다양성을 동시에 확보했다.
최신 LLM들이 긴 문맥을 처리하기 위해 다양한 하이브리드 구조를 채택하고 있지만, 기존 가속화 기법들은 특정 구조에만 국한되거나 실제 서비스 환경인 vLLM과의 통합이 어려웠습니다. UniPrefill은 모델 구조에 상관없이 적용 가능한 토큰 삭제 전략을 통해 연산량을 획기적으로 줄이면서도 정확도를 유지하며, 실제 추론 엔진에 즉시 배포 가능한 수준의 통합을 구현했습니다.
물리적 지능(Embodied Intelligence) 발전을 가로막는 가장 큰 병목 현상인 로봇 전용 데이터의 부족 문제를 해결하기 위해 인터넷상의 방대한 인간 활동 비디오를 활용하는 새로운 패러다임을 제시합니다. 1,000시간의 인간 비디오 학습이 100시간의 실제 로봇 데이터 학습 성능을 능가함을 입증하여 로봇 학습의 확장성을 확보했습니다.
기존 Flow Matching 기반 이미지 생성 모델은 여러 작업을 동시에 학습할 때 성능이 상충하는 시소 효과와 보상 해킹 문제에 시달렸다. Flow-OPD는 거대 언어 모델의 온-폴리시 증류 기법을 이미지 생성에 최초로 도입하여, 텍스트 렌더링과 미적 품질을 동시에 극대화하는 새로운 정렬 패러다임을 제시한다.
멀티모달 모델 학습 시 고품질의 쌍(paired) 데이터를 확보하는 비용 문제를 해결하기 위해 단일 모달리티 데이터만으로 학습하는 새로운 패러다임을 제시한다. 모달리티 간의 간극(Modality Gap)을 단순한 위치 차이가 아닌 특정 방향으로 쏠린 기하학적 구조로 정의하여 정밀한 정렬을 가능하게 한다.
기존 코드 검색 평가 도구들이 단순히 텍스트 유사도만 측정하고 실제 개발 환경의 복잡한 리랭킹 과정을 무시하는 문제를 해결합니다. 데이터 오염을 엄격히 차단한 새로운 벤치마크 CoREB과 전용 리랭커 모델을 통해 AI 코딩 에이전트의 정확도를 실질적으로 높일 수 있는 기반을 마련했습니다.
LLM 추론 시 연산량을 늘려 성능을 높이는 Test-Time Scaling(TTS) 전략은 그동안 연구자의 직관에 의존해 수동으로 설계되었습니다. AutoTTS는 이러한 전략 설계를 자동화하여 단 39.9달러의 비용과 160분의 탐색만으로 기존 수동 설계 방식보다 뛰어난 정확도-비용 효율을 달성했습니다.
288회의 모델 호출 테스트를 통해 LLM의 JSON 출력 오류 패턴을 분석하고, 이를 자동으로 수정 및 검증하는 파이썬 라이브러리 outputguard를 개발한 사례입니다.
Andreessen Horowitz의 공동 창업자 벤 호로위츠가 AI 기술이 벤처 캐피털의 투자 전략, 기업의 경쟁 우위(Moat), 그리고 조직 문화에 미치는 근본적인 변화를 공유합니다.