오프라인 평가 90% 통과해도 실전에서 실패하는 이유: Lyft의 적대적 사용자 시뮬레이터 전략
Lyft는 실제 고객 대화 데이터를 학습한 적대적 사용자 시뮬레이터를 통해 AI 에이전트의 실전 성능을 검증하고 평가 루프를 개선한다.
총 26건
Lyft는 실제 고객 대화 데이터를 학습한 적대적 사용자 시뮬레이터를 통해 AI 에이전트의 실전 성능을 검증하고 평가 루프를 개선한다.
SAM 3.1은 객체를 최대 16개 용량 버킷으로 묶어 메모리를 공유함으로써 Meta 기준 128개 객체에서 약 7배 속도 향상과 혼잡 장면에서 추적 정확도 개선을 보고했다.
DWS Report는 RSS를 15분마다 수집해 LLM으로 기사 중요도를 평가하고 임베딩 DB로 중복을 제거한 뒤 시간에 따라 점수를 감쇠시키는 자체 호스팅 뉴스 집계 시스템이다.
모바일에서 MoE 모델의 활성 전문가만 플래시에서 스트리밍해 mmap 대비 3.8~>5 tok/s 성능을 관측하며 대용량 모델 실행을 가능하게 했다.
복잡하고 상충하는 문서 환경에서 RAG 시스템의 정확도를 높이기 위한 데이터 관리 및 명확화 루프 설계 가이드.
Alibaba가 2.4T Qwen3.8을 Token Plan 프리뷰로 공개하면서 오픈웨이트 배포와 데이터 출처 논쟁이 동시에 부상했다.
ASCIITermDraw-Bench는 80개 과제와 구조적·의미적 점수, 95% 신뢰구간을 통해 Vision Language Model의 ASCII 다이어그램 생성·편집 능력을 평가한다.
세 가지 데이터 전처리로 표준 트리 모델의 RMSE를 17.9에서 13.42로 개선하고 동일 전처리로 소형 GRU가 공개된 딥러닝 결과를 능가했다.
Grok 4.5가 기본 모델로 배포되고 CLI/요약 기능이 강화되는 가운데, 영구 메모리에 대한 프롬프트 인젝션 연구가 공개되어 에이전트 운영 시 보안·검증이 우선순위로 떠올랐다.
실행 파일 내부 문자열과 경로를 추출한 결과 Claude Code 바이너리에서 'Bun v1.4.0' 표기와 563개의 .rs 경로가 확인되어 Rust 포트의 Bun이 포함된 것으로 보인다.
자율 에이전트가 과학적 발견을 수행하기 위해 실제 데이터를 처리하고 온톨로지 기반 메모리로 가설을 생성하는 방법론을 다룬다.
GPT-2-small의 WTE에서 32,070개 토큰을 압축해 t-SNE로 2D에 배치하고 MST 기반 간선으로 근접 관계를 모바일에서 인터랙티브하게 탐색하는 시각화 도구이다.
Birder 프로젝트가 D-FINE-L로 COCO mAP 56.09을 보고하고 Sinkhorn 경로·큐 구현 개선으로 자기지도학습(SSL)을 최대 20% 가속했다.
토큰별로 계산된 logits와 steer/grammar 보정, softmax 샘플링 과정을 시각화한 디코더 내부 스냅샷이다.
임베딩 과다·캐시 부재·중복 호출을 정리하고 Weaviate로 재구축해 RAG 파이프라인 응답 시간을 90초에서 4초로 줄이고 비용을 약 95% 절감했다.
약 4개월 동안 30여 개 MCP 서버를 검증한 결과 마케팅·문서·CRM·광고·분석 등 용도별로 8개만 일상 운영에 적합하다고 판단하고 보안과 공식 유지 여부를 우선 권장했다.
조직 내 지식을 체계화하고 재사용성을 높이는 온톨로지 구축 방법론 OTKM의 5단계 절차와 실무 적용 사례를 살펴본다.
최근 모델들의 능력이 평균 사용자의 요구를 충족할 가능성이 커졌으며 오픈소스 확산과 배포 통제가 향후 영향력을 가르는 변수로 작용할 것이라는 관점이다.
비정형 텍스트에서 그래프를 추출하고 PageRank, 최단 경로 등 알고리즘을 활용해 검색 정확도를 높이는 GraphRAG의 기초를 다룬다.
GPT-2 Small의 정적 임베딩 32,070개 토큰을 t-SNE로 투영하고 임계화 유무에 따라 'Trump'의 최근접 이웃이 일반 정치용어군 또는 가족·대통령군으로 달라짐을 보였다.
논문 분류 작업을 사례로 AI 에이전트의 자동 개선 루프 구축 방법과 전문가-자동화 협업의 중요성을 분석한다.
PMF 검증 단계에서는 API를 임대하고, 본격적인 운영 단계에서는 자체 인프라를 구축하여 AI 추론 비용을 최적화하는 전략을 제시한다.
한도 상향과 구독 연동이 사용자 접근성을 바꾸고, MACE 논문은 에이전트 간 탐험 실패 문제와 대책을 제시했다.
AI는 명확한 사례의 사전 승인 자동화를 통해 치료 지연을 줄일 가능성이 있으나 AMA 설문에서 의사 61%가 오히려 부당한 거절을 늘릴 것을 우려했다.
Grok 4.5의 벤치마크 반영과 Kimi 공개 논쟁, CrewAI 기반 코딩 하네스 확산, KYP/ATL 규제 논의가 이번 기간 주요 화두이다.
AI 에이전트 간 컴퓨팅 자원 공유와 상거래를 검증 가능한 서명 흐름으로 구현하는 오픈소스 프로토콜 Froglet 소개.