기존 벤치마크는 왜 에이전트 성능을 제대로 측정하지 못할까? ParseBench로 해결하는 법
LlamaIndex가 공개한 ParseBench는 실제 엔터프라이즈 환경에서 AI 에이전트의 문서 파싱 성능을 측정하기 위한 5가지 핵심 지표를 제시한다.
총 57건
LlamaIndex가 공개한 ParseBench는 실제 엔터프라이즈 환경에서 AI 에이전트의 문서 파싱 성능을 측정하기 위한 5가지 핵심 지표를 제시한다.
AI 코딩 도구의 확산으로 개발자 역할이 변화하는 가운데, 기술적 전문성을 갖춘 '장인형 빌더'가 미래 소프트웨어 개발의 핵심이 될 것임을 제시한다.
arXiv 논문에 LLM 요약, OpenReview 리뷰, GitHub 및 Hugging Face 모델 정보를 통합 제공하는 Tomesphere 플랫폼 소개.
Jasper AI가 29억 개의 이미지에서 정제한 1억 500만 개의 고품질 이미지-텍스트 데이터셋 MONET을 Apache 2.0 라이선스로 공개했다.
Claude를 활용한 초기 프로토타입이 복잡성 증가로 인해 겪는 기술적 한계를 극복하고, 제품의 핵심 지능을 유지하며 프로덕션 수준으로 안정화하는 전략을 다룹니다.
Slack은 AI 서비스의 안정성과 모델 선택의 유연성을 확보하기 위해 AWS SageMaker에서 시작해 Amazon Bedrock과 GCP Vertex AI를 결합한 멀티 클라우드 아키텍처로 진화했다.
SEO 성과 분석과 콘텐츠 노후화 추적을 자동화하는 MCP 서버를 구축하여 GSC, GA4 등 다양한 데이터 소스를 통합하고 결정론적 규칙 기반의 최적화 액션을 제공한다.
Visa가 AI 코딩 플랫폼 Replit에 투자하며 AI 에이전트가 직접 결제를 수행하는 '에이전트 결제' 인프라 구축에 나섰다.
카네기멜론대 연구팀이 고령층의 AI 활용 행태를 분석한 결과, 이들은 단순 정보 제공을 넘어 감정적 공감과 위로를 제공하는 적응형 AI를 선호하는 것으로 나타났다.
AI 에이전트가 여러 소스에서 수집한 데이터 간의 상충을 해결하기 위해 신뢰도와 유효 기간을 기반으로 작동하는 신념 데이터베이스 'Verus' 프로토타입.
General Compute는 SambaNova의 공랭식 AI 추론 칩을 활용해 기존 데이터 센터 인프라에서 고속 추론 서비스를 제공하는 신규 클라우드 기업이다.
Ekorbia v0.2는 로컬 LLM 여러 모델을 병렬로 실행하여 동일한 프롬프트에 대한 답변을 실시간으로 비교할 수 있는 기능을 제공한다.
AI 에이전트 평가 가이드 'howtoeval' 공개와 Claude Code 보안 플러그인, DeepSWE 벤치마크 등 최신 AI 개발 도구 동향.
채용 검색, 시장 조사, 송장 처리 등 실무 워크플로를 자동화하는 7가지 AI 프로젝트와 구축 가이드를 제시한다.
LLM을 활용해 소량의 고품질 데이터를 라벨링하고, 이를 임베딩으로 변환하여 고전적 머신러닝 모델을 학습시킴으로써 대규모 데이터 처리를 저비용으로 자동화하는 방법론.
오픈소스 AI 에이전트 플랫폼 OpenClaw에서 발생한 대규모 공급망 공격과 4단계 연쇄 CVE 취약점 사례를 분석한다.
에이전트가 MCP를 통해 프로덕션 텔레메트리 데이터를 직접 조회하여 오류를 진단하고 수정하는 자기 치유형 워크플로 제안.
기업용 AI 시스템의 복잡성을 해결하기 위해 MCP와 Kubernetes를 결합하여 AI 에이전트와 기존 시스템을 연결하는 새로운 아키텍처를 논의한다.
WebWright는 4단계 비전 에스컬레이션과 안티 루프 휴리스틱을 통해 웹 탐색, 폼 작성, 클릭을 자동화하는 로컬 우선 크롬 확장 프로그램이다.
AI 코딩 도구의 도입으로 소프트웨어 개발 방식이 자동화되면서, 커리어 공백기를 겪는 개발자들의 기술 격차와 고용 불안이 심화되고 있다.
Onyx Securities의 CEO Maxim Bar Kogan이 기업 환경에서 자율 AI 에이전트의 의도를 모니터링하고 보안을 강화하는 AI 제어 평면(Control Plane)의 필요성과 전략을 설명한다.
RAG 파이프라인에서 문서 수정 시 발생하는 불필요한 재임베딩을 70-90% 줄여주는 오픈소스 청킹 알고리즘 KARA를 소개합니다.
AI가 수학과 코딩 등 특정 분야에서 초인적 능력을 발휘하면서도 상식과 신뢰성에서 실패하는 'Jagged Intelligence' 현상을 통해 AGI 도래 논쟁을 분석한다.
RAG의 유사도 검색이 문서 간 관계를 이해하지 못해 발생하는 버전 혼합 문제를 GraphRAG를 통해 구조적으로 해결한 사례.
공개 레드팀 데이터셋에 대한 모델의 평가 인지 문제가 심화됨에 따라, 기업은 자체 도메인과 정책에 맞춘 프라이빗 레드팀 데이터셋 구축이 필수적이다.
AI 도입의 ROI를 측정하고, 단순 자동화를 넘어 비즈니스 혁신을 이끄는 전략적 접근법을 논의합니다.
매년 반복되는 AI 성장 둔화 공포의 실체와 새로운 코딩 벤치마크 DeepSWE, 그리고 AI 고용 시장에 대한 업계 리더들의 변화된 시각을 분석한다.
Reddit 공식 API의 속도 제한과 댓글 잘림 문제를 해결하고, 전체 대화 트리를 추출할 수 있는 대안 도구 Sylvia를 소개한다.
Emergence AI가 5개 AI 모델로 15일간 가상 세계를 시뮬레이션한 결과, 모델별로 사회 안정성과 범죄율 등 통치 결과가 극명하게 갈렸다.
Claude Code를 활용해 Xcode 없이 iOS 앱을 자동 빌드 및 배포하는 워크플로를 구축했으나, 애플의 7일 사이드로딩 제한과 연간 개발자 비용 정책이 개인용 소프트웨어 개발의 걸림돌로 작용함.
Kognic 플랫폼이 3D 주석 도구의 정밀도를 높이고, 배치 작업 및 다중 센서 뷰 기능을 개선하여 데이터 라벨링 생산성을 향상했다.
Claude Code와 n8n을 활용하여 복잡한 HubSpot 엔터프라이즈 통합 시스템을 구축하고, 에이전트 기반 개발의 실무적 효율성을 입증함.
Git 워크트리를 활용해 여러 AI 에이전트와 작업을 격리된 세션에서 동시에 실행하고 관리하는 데스크톱 애플리케이션.
Claude Code 에이전트를 각 서버에 배치하여 텔레메트리 수집, 자율 진단 및 Slack 알림을 수행하는 모니터링 시스템 구축 사례.
LLM은 토큰을 순차적으로 생성하는 자기회귀 특성상 프리필은 연산, 디코드는 메모리 대역폭이 병목이 되어 전통적 ML과 완전히 다른 추론 특성을 가진다.
ThriftAttention은 긴 문맥에서 발생하는 FP4의 성능 저하를 해결하기 위해 핵심 어텐션 블록만 FP16으로 처리하여 FP4 수준의 지연 시간과 FP16 수준의 품질을 달성하는 기법이다.
vLLM의 새로운 Rust 프론트엔드를 실제 프로덕션 워크로드에서 테스트한 결과, 처리량과 지연 시간 변화가 1% 미만으로 나타나 대형 모델에서는 성능 이득이 거의 없음이 확인됨.
Claude Code가 코드 검색 시 'action-named' 함수는 잘 찾지만, 'trigger-named' 등 관련 피어 함수를 놓치는 현상에 대한 분석과 해결책 논의.
Claude의 MCP 기능을 활용해 Contentdrips와 연동함으로써 LinkedIn 게시물 작성, 디자인 생성, 발행 과정을 단일 대화 내에서 자동화하는 워크플로를 소개한다.
Anthropic의 가파른 매출 성장과 기업용 AI 전략을 분석하고, Claude Cowork 플러그인을 통해 업무 효율을 극대화하는 실전 워크플로를 제시한다.
다중 LLM 제공자를 지원하는 클라이언트 구현 시, 제공자별로 다른 스트리밍 이벤트와 도구 호출 형식을 무리하게 통합하지 말고 타입별로 분리하여 관리해야 한다.
유튜브가 사용자의 자연어 프롬프트를 기반으로 맞춤형 비디오 피드를 생성하고 홈 화면에 고정하는 AI 기능을 출시했다.
CLAUDE.md와 시스템 프롬프트를 압축하여 토큰 소비를 40-75%까지 줄이는 스킬을 개발하고 공유함.
로컬에서 Claude, Codex, Antigravity 세션을 통합 관리하고 GitHub 연동 및 멀티 에이전트 채팅을 지원하는 오픈소스 대시보드 CCC v4가 공개되었다.
스위스 상업 등기소, 규제 상태, 건축 허가 및 공공 조달 데이터를 조회할 수 있는 5가지 도구를 포함한 MCP 서버가 공개되었다.
Claude Code와 NyxID를 연동하여 자격 증명 노출 없이 물리적 로봇(Unitree Go2)을 안전하게 제어하는 실험 사례.
Claude Code의 토큰 사용량, 비용, 컨텍스트 윈도우 상태를 실시간으로 모니터링하는 macOS용 로컬 오픈소스 도구 'TrackNotch' 소개.
Claude Code CLI가 macOS에서 적절한 번들 식별자와 서명 없이 배포되어 보안 경고를 유발하는 문제에 대한 개선 요청.
Claude가 긴 계약서 내의 복잡한 조항 간 참조를 추적하는 능력이 향상되어, 사람이 놓치기 쉬운 숨겨진 위험 요소를 효과적으로 탐지함.
Claude Code의 계획 단계에서 발생하는 설계 의사결정을 팀원들과 실시간으로 공유하고 논의할 수 있는 MCP 서버 'shared-brainstorm'을 개발함.
모델 교체라는 '똑똑한' 해결책보다 프롬프트 최적화, 캐싱, 트래픽 분리 등 '지루한' 인프라 개선이 Claude API 성능과 비용 절감에 더 효과적임.
Johns Hopkins 연구진이 Claude Code, Gemini CLI, GitHub Copilot에서 PR 제목을 이용한 프롬프트 인젝션 취약점을 확인했다.
AI 에이전트의 신뢰성 문제는 모델 자체보다 런타임 환경의 설계 미흡에서 기인하며, 상태 머신, 타입 스키마, 구조화된 피드백 도입이 해결책임.
Cognition이 10억 달러 투자를 유치하며 AI 에이전트의 엔터프라이즈 도입이 가속화되고 있으며, 추론 효율화와 에이전트 아키텍처 중심의 기술 발전이 지속됨.
LLM의 언어별 들여쓰기 관습 준수 여부를 측정하기 위한 벤치마크 실험 방법론 제안.