Salesforce가 36억 달러에 인수한 AI 고객 서비스 플랫폼 Fin의 정체
Salesforce가 고객 서비스 자동화 AI 에이전트 플랫폼 Fin을 36억 달러에 인수하여 Agentforce 역량을 강화한다.
총 61건
Salesforce가 고객 서비스 자동화 AI 에이전트 플랫폼 Fin을 36억 달러에 인수하여 Agentforce 역량을 강화한다.
인도 AI 스타트업 Sarvam이 2.34억 달러 규모의 투자를 유치하며 기업 가치 15억 달러의 유니콘 기업으로 성장했다.
ChatGPT의 CSP 제한을 우회하지 않고 MCP 앱을 안전하게 렌더링하기 위한 이중 iframe 격리 패턴과 도메인 선언의 중요성.
DeepL이 초저지연 오디오 스트리밍 기술 기업 Mixhalo를 인수하여 DeepL Voice의 실시간 음성 번역 성능과 처리 속도를 강화합니다.
Amazon Bedrock AgentCore와 LangChain Deep Agents를 활용해 격리된 MicroVM 환경에서 병렬 연구 작업을 수행하는 멀티 에이전트 시스템 구축 방법을 다룬다.
주요 AI 기업들의 IPO와 산업의 표준화 속에서, 단순 토큰 판매를 넘어 소프트웨어와 생태계 구축이 기업의 핵심 가치로 부상하고 있다.
Claude Code를 활용해 6가지 AI 비즈니스 자동화 도구를 직접 제작하고, 각 도구의 실용성을 평가하여 'Ship' 또는 'Skip'을 결정하는 과정을 담았다.
Manifest는 기존 AI 구독 서비스를 에이전트와 연결하고, 모델 라우팅 및 폴백 기능을 통해 API 비용을 제어할 수 있는 오픈소스 LLM 라우터이다.
단순 문서 검색은 LlamaIndex가, 복잡한 에이전트 워크플로는 LangGraph가 유리하며, 고도화된 시스템은 두 프레임워크를 결합하여 사용한다.
Claude Code 스킬 팩의 시스템 프롬프트가 의도대로 작동하는지 검증하기 위해, adversarial 테스트와 LLM 기반 평가를 포함한 2계층 테스트 하네스를 구축하고 운영한 사례.
Windows 환경에서 Claude Code, Codex 등 여러 AI 에이전트를 통합 관리하고 재부팅 시에도 세션을 유지하는 도구 'wmux'를 개발했다.
금융 서비스의 복잡한 업무를 처리하기 위해 개별 AI 에이전트를 통합 관리하는 오케스트레이션 계층과 헤드리스 아키텍처의 중요성을 다룬다.
DataRobot의 플랫폼 지식을 Claude Code에 '스킬' 형태로 주입하여, 에이전트가 플랫폼별 SDK와 배포 패턴을 정확히 이해하고 코드를 생성하도록 지원한다.
Lyft가 AI 에이전트의 신뢰성을 확보하기 위해 오프라인 시뮬레이션과 LLM-as-a-judge를 활용하여 평가 루프를 구축한 사례를 공유한다.
NLA는 LLM의 내부 활성화 값을 자연어 설명으로 변환하고 복원하는 비지도 학습 해석 도구로, 모델의 사고 과정을 투명하게 드러낸다.
과학 연구에서 AI의 한계는 모델의 이해도 부족과 물리적 세계와의 상호작용을 위한 데이터 및 시스템 구축의 복잡성에 있다.
ShuffleNetV2 기반의 3D 프린터 장애 탐지 시스템 PrintGuard v2.0이 CPython 및 Pyodide 환경을 통합한 단일 엔진 구조로 업데이트되었습니다.
AI 안전 연구 스타트업 Sequent의 출범과 함께, 새로운 코딩 벤치마크 FrontierCode, 문화적 이해도를 측정하는 ChinaHeritaQA, Xiaomi의 초고속 1T 모델이 공개됐다.
Nexus Sentinel은 서비스별로 격리된 메모리 뱅크를 사용하여 DevOps 경보를 진단하고 과거 해결 사례를 재사용하는 LLM 에이전트 아키텍처이다.
AI 코딩 워크플로우 실험 결과, 신규 기능 개발에는 Discovery/Review 방식이, 대규모 리팩터링에는 완전 자율 방식이 더 효과적임이 확인됨.
다양한 LLM이 2026 FIFA 월드컵 경기 결과를 예측하고 성능을 평가하는 SoccerArena 리더보드가 공개되었다.
LLM과 RAG를 넘어 자율적인 에이전틱 AI 애플리케이션 구축을 위한 아키텍처와 엔터프라이즈 보안 및 거버넌스 전략을 다룬다.
여러 AI 도구에서 공유 가능한 로컬 메모리 허브 'Centralaizer'를 소개합니다.
NVIDIA가 공개한 Cosmos-Predict2.5는 물리 AI 에이전트의 학습을 위해 비디오 파운데이션 모델을 활용하여 미래 관측을 시뮬레이션하는 월드 모델이다.
대부분의 AI 마케팅 도구는 PRD와 거버넌스 파일의 조합일 뿐이며, 기존 LLM을 활용해 직접 구축하는 것이 더 효율적이다.
전체 재학습 대신 드리프트 탐지 후 부분적 보정(calibration, BN refresh 등)을 수행하여 ML 모델 성능을 유지하는 ARL(Adaptive Reliability Layer) 프레임워크.
AI 에이전트가 작성한 코드의 신뢰성을 확보하기 위해 Playwright 기반 E2E 테스트 하네스를 구축하고, 자동화된 검증 워크플로우를 설계하는 방법.
기획 회의 전 프로토타입을 미리 제작하여 논의의 기준점으로 삼는 'Build First, Discuss Later' 방식으로 의사결정 속도와 정확도를 높인다.
AI 기업들이 시장 점유율 확보를 위해 현재 구독료를 보조금 형태로 운영 중이나, 인프라 비용 증가와 수익성 압박으로 인해 종량제 과금 도입 및 가격 인상이 불가피한 상황이다.
OpenRouter Fusion API를 사용하여 여러 AI 모델의 응답을 병렬로 처리하고, 판단 모델을 통해 최적의 결과를 도출하는 방법과 비용 효율성을 분석한다.
앤스로픽이 'Fable 5'를 출시하며 성능을 입증했으나, 데이터 보존 정책과 사용량 기반 과금 체계로 인해 업계의 논란이 이어지고 있다.
NVIDIA의 Nemotron 3 Ultra는 MoE와 Mamba-2 아키텍처를 결합하여 효율성과 속도를 극대화한 오픈소스 LLM이다.
밑바닥부터 직접 구현한 3계층 Transformer를 통해 어텐션 메커니즘의 작동 원리와 할루시네이션 발생 이유를 설명하는 프로젝트.
엔터프라이즈 환경에서 AI 모델과 에이전트의 신뢰성을 확보하기 위한 설명 가능한 AI(XAI) 기술, 도구, 그리고 전체 수명 주기 통합 전략을 다룬다.
Claude Code에 Z3, SymPy 등 정형 검증 엔진을 통합하여 복잡한 로직의 오류를 사전에 방지하는 도구 Touchstone을 소개함.
도구 설명에 '직접 지식을 우선하라'는 문구를 추가하자 모델별로 도구 사용률이 극명하게 갈리는 현상이 관찰됨.
GitHub 데이터를 AI 에이전트용 지식 베이스로 변환하고, 작업 충돌을 방지하는 오케스트레이션 계층을 통해 개발 워크플로를 자동화하는 오픈소스 도구 ForgeDock.
사이버보안 스타트업 NewCore가 AI 에이전트를 기업 내 독립적인 식별자로 관리하고 제어하는 보안 플랫폼을 선보이며 6,600만 달러를 투자받았다.
NASA JPL과 Loft Orbital이 위성 궤도에서 Google DeepMind의 Gemma 3를 구동하여 실시간 데이터 분석 및 선별에 성공했다.
AI 페어 프로그래밍은 개발자의 반복 업무를 자동화하고 코드 품질과 지식 공유를 개선하여 개발 경험을 혁신하는 협업 도구이다.
사용자가 기차 시간표와 좌석 정보를 반복 조회하는 번거로움을 해결하기 위해 Claude와 연동 가능한 MCP 서버를 개발하여 공유함.
Claude Code를 활용해 *arr 미디어 관리 앱을 개발하며, AI를 자율 에이전트가 아닌 아키텍처를 준수하는 주니어 개발자로 활용한 실무 워크플로우.
Anthropic의 Fable 5와 Mythos 5 모델 중단 사태를 보안 이슈가 아닌, 높은 운영 비용과 수익성 악화라는 경제적 관점에서 분석한 게시물.
두 개의 AI 에이전트가 서로를 검토하고 세 번째 에이전트가 전략을 관리하는 구조를 통해 단일 에이전트의 맹점을 보완하는 멀티 에이전트 실험.
Claude Opus의 불필요한 설명을 제거하고 코드 출력만 강제하여 토큰 제한과 세션 한계를 효율적으로 관리하는 프롬프트 최적화 방법.
사용자가 과거 코드 감사 도구인 fable의 작업 패턴을 Claude 3 Opus에게 학습시켜 새로운 앱의 감사 프로세스를 성공적으로 재현했다.
aurscan은 Arch Linux의 AUR 패키지 설치 과정에서 PKGBUILD와 설치 스크립트를 LLM으로 분석하여 악성코드를 사전에 차단하는 보안 도구이다.
기술 기업들이 AI 도입을 명분으로 대규모 해고를 단행하고 있으나, 이는 팬데믹 기간의 과잉 채용을 감추기 위한 수단이라는 비판이 제기된다.
Claude를 활용한 다중 페르소나 검증 과정에서 모델이 프레임워크 준수보다 사용자의 기분을 맞추는 동조 현상을 보여 이에 대한 커뮤니티의 의견을 구함.
Claude Code와 Claude Desktop의 시스템 프롬프트, 도구 구성, 모델 동작 방식을 분석한 기술적 관찰 결과.
LLM이 벤치마크 데이터를 학습하여 암기하는 데이터 오염 문제를 지적하며, 기존 평가 방식의 타당성에 대해 논의한다.
장기 작업에서 에이전트의 목표 표류를 방지하고 실행 일관성과 검증을 강화하는 통합 실행 프레임워크(UEF)를 소개한다.
LLM을 활용해 인간의 가독성을 배제하고 AI 최적화에 초점을 맞춘 새로운 프로그래밍 언어 설계 및 컴파일러 구현 실험.
사용자가 기존에 실패했던 독일 대중교통 등시선 지도 개발 프로젝트를 Claude Code를 활용해 성공적으로 구현한 사례.
기업 환경의 복잡한 쿼리를 포함한 9,128개 쿼리 규모의 Text-to-SQL 벤치마크 데이터셋 BEAVER를 소개합니다.
SillyTavern은 로컬에서 실행되는 통합 AI 인터페이스로, 다양한 LLM API, 이미지 생성 엔진, TTS 모델을 하나의 환경에서 제어하고 확장할 수 있는 도구이다.
Apple Silicon 환경에서 per-layer 혼합 정밀도 양자화로 LLM 성능과 효율을 최적화하는 로컬 LLM 툴킷입니다.
Nex-AGI 팀이 Rio-3.5-Open-397B 모델이 자사 모델 Nex와 Qwen3.5를 0.6:0.4 비율로 무단 병합한 결과물이라고 주장함.
Apple의 온디바이스 AI 전략은 클라우드 기반 LLM 중심의 산업 구조가 한계에 도달했음을 보여주며, 실용적이고 로컬 중심의 AI로 전환될 것임을 시사한다.