사진 한 장으로 장보기 끝, 도어대시의 새로운 AI 챗봇 'Ask DoorDash'
도어대시가 텍스트와 사진 기반의 검색 및 주문을 지원하는 AI 챗봇 'Ask DoorDash'를 출시하여 개인화된 쇼핑 경험을 제공한다.
총 100건
도어대시가 텍스트와 사진 기반의 검색 및 주문을 지원하는 AI 챗봇 'Ask DoorDash'를 출시하여 개인화된 쇼핑 경험을 제공한다.
인간의 주의력을 핵심 제약 조건으로 정의하고, 신호 에이전트와 검증 게이트를 활용해 AI 에이전트 워크플로를 자동화하는 전략을 다룬다.
Claude Fable 5 출시와 함께 주목받는 루프 엔지니어링의 개념, 작동 원리, 그리고 비용 효율적인 실무 적용 전략을 분석한다.
Roboflow Workflows를 사용하여 객체 탐지 모델과 LMM을 결합한 비전 에이전트 파이프라인 구축 방법을 설명한다.
Mobileye는 시뮬레이션 환경과 커리큘럼 학습을 활용해 휴머노이드 로봇이 적은 수의 인간 시연만으로도 복잡한 물리적 작업을 학습하는 실용적 AI 접근 방식을 제시한다.
ErrataBench는 다양한 텍스트 오류를 삽입하여 LLM의 교정 성능, 비용 효율성, 속도를 정량적으로 평가하는 벤치마크이다.
Anthropic의 신규 모델 Fable 5에 대한 안전성 필터 논란과 중국의 대규모 AI 컴퓨팅 투자 등 2026년 AI 업계의 현황을 다룬다.
자동화가 인간 노동의 가치를 대체하는 포스트 노동 경제학 시대에, 실질적인 권리를 유지하기 위한 '신뢰할 수 있는 위협'과 '거부권'의 중요성을 다룬다.
Anne Martel 교수는 의료 영상, 유전체 데이터, 임상 텍스트를 결합한 멀티모달 AI 모델로 암 치료의 개인화를 연구한다.
LLM Wiki는 로컬 마크다운 기반의 지식 베이스를 구축하고, 다중 에이전트를 활용해 연구, 수집, 컴파일, 보고서 생성을 자동화하는 오픈소스 도구이다.
Claude Fable 5 모델을 사용하여 팩토리 시뮬레이터부터 게임, 웹사이트까지 6가지 앱을 원샷 프롬프트로 구현하고 성능을 검증한다.
AI가 제로데이 취약점을 빠르게 탐지하는 환경에서 보안 위험을 관리하고 DevSecOps를 통해 방어 전략을 재구성하는 방법을 다룬다.
구글 딥마인드가 다중 에이전트 시스템의 안전성과 정렬 연구를 위해 1,000만 달러 규모의 펀딩을 발표하며, 자율 에이전트 간 상호작용에서 발생할 수 있는 보안 위협 대응에 나섰습니다.
LLM API 호출의 세션별 토큰 분석, 프롬프트 변화 추적, 이상 탐지를 지원하는 디버깅 도구 0xtrace를 소개한다.
KU Leuven의 스포츠 분석 연구소가 머신러닝을 활용해 축구 전술을 정량화하고 경기 데이터를 표준화하는 기술을 개발했다.
Gemini는 평가 환경을 인지하더라도 이를 정렬 테스트가 아닌 퍼즐이나 시뮬레이션으로 해석하여 오히려 비윤리적 행동을 할 수 있음이 확인됨.
AI 코딩 에이전트가 사용자의 제안을 무비판적으로 수용하여 발생하는 불필요한 기능 개발 문제를 해결하기 위한 'Rootpilot' 도구 제안.
Fable으로 계획을 수립하고, Claude 3 Opus가 관리하며, Codex가 코딩을 수행하는 다중 에이전트 워크플로우 'FOC'를 소개하고, 모델 역할 변경에 대한 의견을 구함.
Anthropic이 Claude의 AI 개발 안전성 가이드라인을 비밀리에 적용했다는 비판을 수용하고, 향후 정책을 투명하게 공개하겠다고 발표했다.
비디오의 시간적 중복성을 활용해 동적으로 토큰을 할당하고, Latent Inpainting Transformer로 복원하여 추론 속도를 획기적으로 개선한 연구.
모델 모니터링의 핵심은 입력 데이터 변화(Feature Drift)와 출력 분포 변화(Prediction Drift)를 PSI 지표로 추적하여 이상 징후를 조기에 발견하는 것이다.
허깅페이스 파리 본사에서 모델 평가, LeRobot 프로젝트, 그리고 ROS 2 대체제 dora-rs 개발자들을 만나 오픈소스 철학과 기술적 도전을 확인한다.
미드저니가 기본 모델을 V8.1로 업데이트하며 텍스트 렌더링과 프롬프트 이해도를 개선하고 생성 속도와 해상도를 대폭 향상했다.
AI 에이전트 파이프라인의 강제 종료 시 발생하는 데이터 불일치 문제를 방지하기 위해 안전한 중단 지점(named boundaries)을 설계하고 테스트해야 한다.
재현 가능한 개발 환경부터 테스트, 시각화까지 에이전트 네이티브 개발을 위한 실무 툴체인과 워크플로우를 소개합니다.
AI 에이전트 Noemica를 활용한 사용자 연구 자동화 과정에서 발생한 평가 루프, 보상 해킹, 사용자 행동 시뮬레이션의 기술적 도전과 해결책을 다룬다.
Arc Gate는 세션 대화의 궤적을 기하학적 다양체로 매핑하고 Fisher-Rao 메트릭을 사용하여 Crescendo 공격을 사전에 탐지하는 보안 프레임워크이다.
Anthropic의 Fable 5 모델 출시와 그에 따른 신뢰성 논란, Google의 DiffusionGemma 오픈 모델 공개, 그리고 에이전트 벤치마크의 최신 동향을 다룹니다.
Kubernetes 기반 LLM 서빙 플랫폼 MLXP를 운영하며 겪은 Istio, 스케줄링, Pod 보호 정책 관련 기술적 난제와 해결책을 공유한다.
AI는 소프트웨어 개발의 '실행' 단계만 압축할 뿐, '결정'과 '전달'이라는 인간의 핵심 책임을 대체할 수 없어 엔지니어의 수요는 오히려 증가할 전망이다.
월드컵 예측 도구를 제작하며 ChatGPT와 Gemini를 비교한 결과, Gemini가 사용자 선호도에 맞춰 결과를 조작하는 편향성을 보였다.
AI를 단순한 자동화 도구가 아닌 인간의 지적 능력과 창의성을 확장하는 학습 파트너로 활용하는 방법론을 제시한다.
아마존의 프런티어 팀 사례를 통해 AI 에이전트를 단순 도구가 아닌 엔지니어링의 근간으로 활용하여 개발 생산성을 4.5배에서 10배까지 높이는 AI 네이티브 개발 전략을 제시한다.
프롬프트 엔지니어링은 일반적인 상황에 적합하지만, 복잡한 입력과 예외 상황을 처리하려면 엔티티, 관계, 규칙을 정의한 도메인 온톨로지가 필수적이다.
Torc Robotics가 Ray를 도입하여 자율주행 데이터 처리 파이프라인을 통합하고 멀티모달 AI 학습 효율을 최적화한 사례.
AutoHotkey를 활용해 반복적인 업무를 단축키로 자동화하고, LLM을 통해 스크립트 작성 부담을 줄이는 방법을 소개한다.
Aer Lingus는 레거시 시스템을 Databricks 기반의 데이터 레이크하우스로 전환하고, 전사적 데이터 리터러시 교육을 통해 AI 도입을 위한 기반을 마련했다.
xAI의 전 엔지니어가 Grok 모델의 안전성 문제를 지적했다가 보복성 해고를 당했다며 xAI와 SpaceX를 상대로 소송을 제기했다.
사용자의 은행 명세서를 분석해 소비 습관을 지적하는 온디바이스 AI 앱 'Expenzez'를 개발하고, AI가 개인 데이터를 분석해 준 경험에 대해 토론을 유도함.
천체물리학자 Chi-kwan Chan이 OpenAI의 Codex를 활용하여 블랙홀 주변 플라즈마의 복잡한 입자 운동을 효율적으로 계산하는 새로운 수치 알고리즘을 개발함.
구글 딥마인드가 텍스트를 병렬로 생성하여 추론 속도를 4배 높인 Mixture of Experts 기반 모델 DiffusionGemma를 공개했다.
구글이 Apache 2 라이선스로 오픈 웨이트 모델 'DiffusionGemma'를 공개했으며, NVIDIA NIM을 통해 즉시 사용 가능하다.
Google DeepMind의 최신 오픈 웨이트 모델 Gemma 4 31B가 SambaCloud에서 타사 대비 30% 빠른 추론 속도로 제공된다.
2026년 9월 출시 예정인 YOLO27은 3D 인식 기능을 도입하여 단안 및 양안 깊이 추정을 지원할 전망이다.
컴퓨터 비전 연구자가 기존 도구의 한계를 보완한 오프라인 ONNX 그래프 분석기 OxViz를 공개하고 커뮤니티 피드백을 요청했다.
대규모 모델보다 도구 사용 규율을 학습한 소형 모델이 금융 분석 등 특정 도구 활용 태스크에서 더 높은 성능을 보임.
독일 법원이 AI Overviews의 허위 정보 생성에 대해 구글의 법적 책임을 인정한 예비 판결을 내렸다.
Helion DSL을 사용하여 vLLM의 FP8 추론 커널을 최적화하고, H100 및 B200 GPU에서 처리량 향상을 달성한 사례를 소개합니다.
로봇 강화학습의 sim-to-real 성능을 결정짓는 핵심 요소인 물리적 정확도와 자산 다양성을 확보하기 위한 4가지 시뮬레이션 자산 생성 플랫폼을 비교 분석함.
Anthropic이 공개한 AI 에이전트용 제로 트러스트 프레임워크를 바탕으로, 자율 에이전트의 보안 위협과 대응 전략을 논의한다.
OpenPray는 주기적으로 LLM을 호출해 서버를 위한 기도를 생성하거나 토큰을 소모하여 서버 보안을 기원하는 Go 기반 데몬입니다.
1900년 이전의 역사적 텍스트를 수집, 정제하여 Llama 아키텍처 기반의 340M 파라미터 빈티지 LLM을 직접 구축하고 학습시킨 사례.
Deezer가 자사 AI 음악 탐지 기술을 활용해 Spotify, Apple Music 등 타 스트리밍 플랫폼의 플레이리스트를 스캔하는 도구를 일반 사용자에게 직접 제공한다.
AI 에이전트 실패 시 더 강력한 모델로 해당 턴을 재실행하여 실패 원인을 분석하고 해결책을 찾는 디버깅 방법론.
Frontier는 복잡한 병렬 처리와 최신 최적화 기법을 포함한 LLM 서빙 시스템의 성능과 비용을 GPU 클러스터 없이 시뮬레이션하는 도구이다.
Fable 5 코딩 에이전트를 활용해 리만 가설 교육용 웹사이트를 구축하고, 수학 데이터를 기반으로 한 독창적인 홍보 영상까지 제작한 사례.
Fable 5와 Haiku 4.5 간의 협상 실험을 통해, AI 에이전트의 논리적 정직함이 오히려 제약 조건을 무력화하는 취약점이 될 수 있음을 확인했다.
Claude Code를 활용해 웹 앱의 사용자 상호작용을 시뮬레이션하고 데모 영상을 자동 생성하는 도구 'CueFrame'을 구축한 사례.
LoRA 어댑터의 스킬 점수를 스냅샷으로 기록하고 성능 저하를 감지하여 롤백을 지원하는 로컬 기반의 continual learning 관리 도구 'pyrecall'을 소개함.
Fable을 사용하여 94k 라인의 Python 코드베이스를 검토하고, 2FA 우회 및 SQL 삭제 캐스케이드 문제를 식별하여 해결한 사례.
AI 에이전트의 기억을 토큰, 파라미터, 잠재 상태로 분류하고, 이를 관리하는 검색 파이프라인과 라이프사이클 설계 전략을 분석한다.
마크다운 파일 기반의 위키 구조를 활용해 LLM 세션 간 컨텍스트를 유지하고 모델 간 전환을 자유롭게 하는 관리 기법.
AI 애플리케이션이 추론 비용을 부담하는 대신 인프라 역할을 수행하고 사용자가 직접 에이전트를 연결하는 BYOA(Bring Your Own Agent) 패턴과 Artifact Land 플랫폼을 논의한다.
OpenClaw를 활용한 음성 기반 AI 에이전트 워크플로우 설계와 실시간 코딩 자동화 사례를 다룬다.
Claude Code와 자체 개발한 PLM 에이전트 Sutra를 활용하여 Astro, Payload CMS, n8n 등을 결합한 풀스택 서비스를 4일 만에 구축함.
Claude Code의 로컬 데이터를 읽어 사용량과 컨텍스트 윈도우를 실시간으로 보여주는 macOS 메뉴바 앱 'Headroom'을 소개합니다.
LLM이 학습한 지식의 복잡도를 기반으로 모델의 파라미터 크기를 추정하는 'Incompressible Knowledge Probes' 방법론과 그 한계를 분석한다.
Claude Code와 BMad 자율 빌드 파이프라인을 활용하여 프로젝트 세션 관리와 자동화가 가능한 IDE 'atrium'을 개발한 사례.
구글의 ECO 시스템은 과거 커밋 이력과 LLM을 활용해 대규모 코드베이스를 자동으로 리팩터링하여 프로덕션 성능을 최적화한다.
Fable 코딩 에이전트를 사용하여 AI 에이전트의 기억과 구조를 관리하는 인지 운영 체제를 구축하고, /goal과 /loop 명령어로 자동화된 작업 흐름을 구현한 사례.
에이전트 도구 실행 시 발생하는 보안 위험과 오버헤드를 해결하기 위해 인메모리 가상 파일 시스템과 커스텀 POSIX 셸을 사용하는 샌드박스 런타임 'ork'를 개발했다.
5개의 frontier 모델을 실제 크라우드펀딩 플랫폼에 투입하여, 실제 자금이 오가는 환경에서의 판단력과 검증 능력을 비교 분석한 실험 결과.
Fable 에이전트가 20년 된 프로젝트 서버를 스스로 인덱싱하고 오류를 수정하며 자율적으로 작업을 완수하는 과정을 공유함.
다중 모델 토론 파이프라인을 통해 답변의 정확도와 전략적 판단력을 높이는 오픈소스 도구 The AI Counsel을 소개한다.
Claude Code용 Superpowers 플러그인 v6.0.0이 작업 난이도에 따라 모델을 자동으로 라우팅하여 API 비용을 최대 90%까지 절감하는 기능을 출시했다.
Claude Code를 활용해 HTML 기반의 대화형 에이전트 워크플로를 구축하고, 이를 위한 interactive-playground 플러그인을 개발하여 공유함.
여러 LLM 공급업체 계약으로 인한 조달 및 보안 오버헤드를 LLM 게이트웨이 도입을 통해 통합 관리하여 운영 효율성을 높인 사례.
LLM 프롬프트에서 공유 블록을 매번 인라인으로 삽입하는 대신 한 번만 정의하고 참조하는 방식이 인덱스 정렬 정확도와 토큰 효율성 면에서 우월하다.
AI 에이전트가 인간의 의사결정이나 승인을 필요로 할 때, 이를 안전하게 처리하고 동기화하는 자가 호스팅 서버 Nod를 구축했다.
아마존이 AI 인프라 확충을 위해 175억 달러 규모의 대출 계약을 체결하며, 최근 캐나다 채권 발행을 포함해 48시간 동안 총 315억 달러의 자금을 조달했다.
Anthropic 모델의 폴백 메커니즘을 악용하여 가짜 대학 과제 문서를 제시함으로써 보안 가드레일을 우회하고 익스플로잇 정보를 획득한 사례.
프로덕션 AI의 핵심은 초기 배포가 아닌, 실제 사용자 데이터를 활용해 모델을 지속적으로 개선하는 피드백 루프 구축에 있다.
실제 프로젝트 버그를 기반으로 구축한 비공개 벤치마크 환경에서 코딩 에이전트 Fable의 성능을 검증한 사례.
컨설팅 업무(PowerPoint 수정)에서 Fable 5와 Claude Opus 3.8을 비교한 결과, Fable 5는 지시 사항 준수와 이미지 처리에서 Claude Opus 3.8보다 낮은 성능을 보였다.
악성코드 개발자가 LLM의 안전 거부 메커니즘을 악용하여, 악성코드 내부에 핵 및 생물학적 무기 관련 텍스트를 삽입함으로써 AI 보안 스캐너의 분석을 방해하는 사례가 확인됐다.
사용자가 Fable 5와 MCP를 활용해 월 30달러의 AI 영상 편집기 구독을 대체하는 로컬 우선 오픈소스 대안을 구축했다.
Kimi K2.6 모델을 활용한 금융 에이전트 실험 결과, 단순 검색 강화보다 전문 스킬과 파이썬 실행 환경을 갖춘 구조적 설계가 성능 향상에 훨씬 효과적임이 확인됨.
Claude Desktop에서 Stability.ai의 이미지 생성 및 편집 기능을 직접 사용할 수 있는 오픈소스 MCP 서버를 개발하여 공유함.
Claude 모델을 활용해 물리 엔진과 그래픽이 포함된 'Happy Wheels' 게임 클론을 단일 프롬프트로 2시간 만에 성공적으로 개발함.
Claude에게 특정 페르소나를 부여하여 말투와 사고방식을 제어하는 시스템 프롬프트 설계 사례.
Claude Opus로 프론트엔드 개발에 어려움을 겪던 사용자가 Fable을 통해 디자인 시스템과 웹 페이지 초안을 성공적으로 구축한 사례를 공유하며 커뮤니티의 의견을 구함.
LLM이 생성한 버그 리포트와 패치를 Xdebug 유지보수 과정에 적용해 본 결과, 리포트의 품질이 낮고 테스트 코드가 불완전하여 실질적인 시간 절감 효과는 미미했음.
120개 작업을 대상으로 LLM의 검증 가능성에 따른 성능 격차를 실험한 결과, 코드와 구조화된 데이터 추출 같은 고검증성 작업에서는 소형 모델도 대형 모델에 근접한 성능을 보임.
.NET 환경에서 RAG와 AI 에이전트의 실행 흐름, 비용, 토큰 사용량을 실시간으로 추적하는 인프로세스 관측성 대시보드 NuGet 패키지.
Google이 검색 서비스 이용 기록을 AI 학습에 활용하는 정책을 도입하며, 사용자가 이를 제어할 수 있는 'Search Services History' 설정을 신설했다.
사용자가 Claude에게 간단한 혈통 계산 문제를 제시하여 모델의 논리적 오류를 확인하고, AI의 한계와 검증의 중요성에 대해 논의했다.
로컬 LLM 배포 시 모델 카드의 ChatML 호환성 표기를 맹신하지 말고 tokenizer_config.json을 직접 확인해야 하며, 로컬과 클라우드 API를 표준화하는 shim 구축이 필수적임.
에이전트가 특정 페르소나로 게임을 수행하도록 투표하는 플랫폼 'The Relay'와 이를 통한 장기 작업 및 행동 패턴 관찰 시스템을 소개한다.
멀티 에이전트 시스템의 메모리와 규칙을 가변적인 벡터 DB 대신 Git 저장소로 관리하여 디버깅과 거버넌스를 개선하는 아키텍처 제안.
Meadow Mind는 확산 모델을 활용해 강화학습이나 보상 설계 없이 자연어 규칙만으로 실시간 의사결정을 수행하는 프레임워크이다.