교황의 AI 회칙부터 80년 된 수학 난제를 해결한 AI까지, 최신 AI 안전 및 연구 동향
교황의 AI 회칙 발표, AI 배신 위험 이론, OpenAI의 수학 난제 해결 등 최신 AI 안전 및 연구 동향을 다룬다.
총 100건
교황의 AI 회칙 발표, AI 배신 위험 이론, OpenAI의 수학 난제 해결 등 최신 AI 안전 및 연구 동향을 다룬다.
LLM의 기업형 규제 루프를 우회하기 위해 컨텍스트 포화와 다중 모델 상호작용을 활용한 400시간의 행동 스트레스 테스트 연구 결과.
Claude Code, Gemini CLI 등 AI 코딩 에이전트의 권한 요청을 터미널 포커스 감지를 통해 데스크톱 알림으로 알려주는 로컬 도구 agnt를 개발하여 공유함.
AWS Bedrock AgentCore 개발 시 발생하는 시행착오를 줄이기 위해 공식 모범 사례와 검증된 코드 스니펫을 집대성한 Claude Code용 오픈소스 플러그인을 개발했다.
NVIDIA의 멀티모달 파운데이션 모델 Cosmos 3를 활용해 고정 카메라 영상 분석 성능을 테스트한 결과, 파인튜닝 없이도 유의미한 결과를 도출했다.
메타가 WhatsApp과 Instagram에서 고객 응대, 예약, 리드 관리를 자동화하는 'Meta Business Agent'를 글로벌 출시한다.
Meta의 EnCodec을 외부 런타임 의존성 없이 Eigen 라이브러리만 사용하여 C++로 경량 구현하고 성능을 최적화함.
AI 코딩 에이전트를 활용해 개발 생산성을 3배 높인 경험을 바탕으로, AI 시대에 필요한 엔지니어링 원칙과 관리자 역할을 제시한다.
AI 에이전트 개발 시 Langfuse를 활용한 관측성 확보와 프롬프트 관리의 실무적 이점 및 에이전트 평가의 어려움에 대한 경험 공유.
Rust로 작성된 Trader는 LLM을 활용해 Robinhood API를 제어하며, 하드 코딩된 안전 규칙을 통해 위험을 관리하는 자동화 트레이딩 에이전트입니다.
메타가 스케일 AI 창업자 알렉산드르 왕을 영입하여 개발한 신규 AI 모델 'Muse Spark'를 공개하며 AI 경쟁력 강화에 나섰다.
ADR, PRD, BDD를 활용해 AI 에이전트의 개발 일관성을 유지하고 git hooks로 이를 강제하는 실무 전략을 다룬다.
Coralogix가 AI 에이전트 시대의 모니터링 수요 증가에 대응하기 위해 2억 달러 규모의 시리즈 F 투자를 유치하며 기업 가치 16억 달러를 달성했다.
Cisco의 CX 부문이 챗봇에서 AI 네이티브 'Renews Teammate'로 진화하며 겪은 아키텍처 설계와 실무적 교훈을 공유한다.
SFT 후 발생하는 텍스트 퇴화 문제를 DPO를 통해 59.4% 감소시킨 DharmaOCR의 학습 파이프라인 사례.
멀티 에이전트 시스템을 위한 런타임 보안 및 관측 도구 InsAIts가 18,000 다운로드를 기록하며 수학적 보증 기반의 이상 탐지 기능을 v4.10에 도입했다.
헬스케어 앱에서 AI가 작성한 답변을 15개의 적대적 에이전트가 교차 검증하여 환각을 제거하고 신뢰성을 확보하는 사례.
Databricks Genie를 활용해 영업, 마케팅, 재무 등 다양한 비즈니스 영역에서 자연어 기반의 데이터 분석과 자동화된 에이전트 워크플로를 구현하는 파트너 솔루션들을 소개한다.
Future of Life Institute 회장이 백악관의 AI 워킹그룹 설립 행정명령을 환영하며, 강력한 AI 모델에 대한 의무적 사전 배포 검토 절차 도입을 촉구했다.
AI 거품론의 근거로 언급되는 기업들의 사례를 분석하고, AI 시장의 현재 경제적 상황과 향후 전망을 다룬다.
현대 LLM의 근간이 되는 Transformer부터 RAG까지, 필수 연구 논문 5편을 통해 LLM의 작동 원리를 정리한다.
금융 및 법률 도메인에서 AI 에이전트의 추론 과정과 근거 활용 능력을 평가하는 벤치마크 데이터셋을 소개한다.
오픈소스 AI 에이전트 모니터링 도구 Dunetrace가 MCP 서버 지원, 런타임 정책 엔진, Haystack 및 OTLP 통합 기능을 추가했다.
IBM과 Red Hat의 Project Lightwell, AI 에이전트 대상 SymJack 공격, LayerX의 AI 사용 보고서를 통해 사이버 보안의 변화를 분석한다.
Physical Intelligence가 공개한 π0.7은 로봇 데이터에 맥락과 메타데이터를 결합하여 학습함으로써 다양한 환경과 로봇 형태에서 범용적인 조작 능력을 확보한다.
FIFA 월드컵 티켓 가격에 반발한 팬들이 AI 도구 'SeatSidekick'을 개발해 실시간 가격을 추적하고 암표상과 FIFA의 불투명한 정책에 대응하고 있다.
Composer는 사람과 AI 에이전트가 실시간으로 함께 문서를 작성하고 편집할 수 있는 멀티플레이어 마크다운 에디터입니다.
MIT 연구진이 차트 해석 능력을 극대화하는 100만 개 규모의 합성 데이터셋 'ChartNet'을 개발하여 오픈소스 VLM의 성능을 상용 모델 수준 이상으로 끌어올렸다.
Amazon EKS 환경에서 Two-Tower 모델, DLRM, FAISS, NVIDIA Triton을 활용한 다단계 멀티모달 추천 시스템 구축 사례.
Mercari가 AI 에이전트의 편집 효율을 높이기 위해 기존 노코드 에디터를 HTML 기반의 'EGP Code'로 재설계한 사례.
Salesforce 데이터와 연동되어 비즈니스 맥락을 이해하고, Slack, Teams 등 다양한 플랫폼에서 실질적인 업무를 수행하는 자율형 AI 에이전트 서비스.
경사 하강법을 넘어 생물학적 진화 원리를 AI 학습에 적용하는 신경 진화(Neuroevolution)는 기존 모델의 한계를 극복하고 창의적 해답을 제시하는 핵심 기술이다.
Microsoft가 추론 특화 35B 모델 'MAI-Thinking-1'과 코드 최적화 5B 모델 'MAI-Code-1-Flash'를 공개했다.
15만 라인 이상의 대규모 소프트웨어를 AI로 구축할 때 발생하는 코드 붕괴를 방지하기 위한 구조적 엔지니어링 가이드와 방법론을 공유한다.
채용 정보 검색, 면접 준비, 연봉 벤치마크 기능을 제공하는 MCP 서버가 출시되어 Claude Code 및 주요 AI 에이전트 환경과 연동 가능하다.
Aura-IDE는 Planner와 Worker로 구성된 이중 에이전트 아키텍처를 통해 코드 작성, 검증, 복구 과정을 자동화하는 LLM 기반 코딩 하네스이다.
트럼프 대통령이 새로운 AI 행정명령을 통해 프런티어 모델에 대한 자율적 검토 시스템을 도입하고, 국방 및 산업 전반의 AI 기술 동향이 빠르게 변화하고 있음.
SambaNova가 NVIDIA GPU와 자사 RDU를 결합해 프리필과 디코드를 분리 처리하는 분리형 추론 아키텍처를 통해 AI 에이전트의 추론 속도와 처리량을 개선했다.
Claude의 'go to sleep' 메시지가 세션 시간과 무관하게 대화의 주제 복잡도와 연관되어 있다는 가설에 대한 토론.
Claude와 Coresignal 데이터를 결합하여 리드 조사 시간을 단축하고 CRM에 구조화된 기업 정보를 자동 생성하는 워크플로를 구축했다.
1인 개발자가 힌디어 비즈니스 용어 정확도를 92%까지 높이기 위해 단순 용어집에서 예문 중심의 맥락 학습 시스템으로 발전시킨 사례.
SaaS 창업자가 Claude Code를 활용해 6시간 만에 온보딩 플로우를 재구축하여 사용자 활성화율을 35%에서 48%로 개선했다.
AI 코딩 도구 사용 시 발생하는 설계 누락 문제를 해결하기 위해, 문서와 코드를 통합 관리하는 로컬 우선 개발 워크스페이스 Canonic을 개발했다.
Grep 기반 검색의 토큰 낭비를 줄이기 위해 구조적 지식 그래프와 MCP를 활용하여 코드베이스 탐색 효율을 높이는 방법론.
AI 에이전트의 장기 기억을 구현하는 상위 10개 오픈소스 프로젝트의 아키텍처, 의존성, 충돌 해결 전략을 분석하여 실무 적용 가이드를 제시합니다.
Anthropic은 832개의 악성 계정을 분석하여 AI가 사이버 공격의 준비 단계뿐만 아니라 실행 단계까지 자동화하고 있으며, 특히 에이전트 기반의 자율적 공격 체인 구성이 위험도를 높이는 핵심 요인임을 확인했다.
Claude 프롬프트에 특정 명령어를 추가하여 Cloudflare 기반의 웹사이트를 즉시 배포하고 관리할 수 있는 도구 소개.
시각장애인 디자이너가 Claude Code를 사용하여 지리 데이터를 처리하고, 덴마크 지자체별 촉각 퍼즐을 생성하는 파라메트릭 설계를 구현했다.
Claude Code를 사용하여 도메인 분석 후 계획을 생성하고, 이를 바탕으로 에이전트가 단계별로 수정 작업을 수행하는 워크플로를 공유함.
Claude의 답변 구조를 분석하고 이를 모방하여 AI 챗봇의 인용을 유도하는 GEO(Generative Engine Optimization) 전략 공유.
기업용 AI 시스템의 안정적 운영을 위해 지식, 전문성, 규범을 통합하는 엔터프라이즈 컨텍스트 레이어의 구조와 핵심 역량을 설명한다.
Computex 타이베이에서 AI 추론 워크로드와 엣지 컴퓨팅 중심으로 재편된 하드웨어 및 소프트웨어 인프라 트렌드를 공유함.
지식 그래프 구축 시 엔티티 해석과 중복 제거 단계를 분리하고, 신뢰도 기반의 3단계 검증과 야간 재처리 파이프라인을 도입하여 데이터 품질을 유지하는 전략.
구글이 AI 데이터 센터의 환경 영향을 최소화하기 위해 2030년까지 소비량 이상의 물을 재충전하고 지역 인프라에 투자하는 5대 환경 공약을 발표했다.
영국 경쟁시장청(CMA)이 구글에 AI 검색 기능 및 모델 학습 데이터에 대한 웹사이트 소유자의 거부권을 보장하도록 명령했다.
Claude Opus 4.8과 Cursor를 활용하여 프롬프트만으로 2D 게임 로직, 충돌 감지, 스프라이트 애니메이션을 구현한 사례.
AI 에이전트가 코드베이스 분석 시 탐지와 검증 단계를 통합하여 수행할 경우, 자신의 출력을 진실로 오인하는 자기 확증 편향이 발생하므로 두 역할을 분리해야 한다.
Unsloth AI가 Microsoft와 협력하여 Windows 로컬 모델 실행을 최적화하고, 새로운 소형 언어 모델 Aion Instruct를 공개했다.
AI 에이전트 데모는 인증, 신원, 상태 관리를 생략하지만, 실제 프로덕션에서는 이 비AI 영역이 제품의 성패를 결정한다.
AI 도입에 따른 생산성 향상이 실제로는 7.8% 수준에 그치며, 많은 경우 성과가 유지되지 않는다는 현장 운영자의 분석과 경제적 보상 불균형에 대한 토론.
MiniMax가 1M 토큰 컨텍스트와 네이티브 멀티모달을 지원하는 M3 모델을 출시하고 주요 벤치마크 성능을 공개했다.
LLM 학습의 기초부터 대규모 모델의 병렬 학습 전략, Chinchilla 스케일링 법칙, 그리고 RLHF와 DPO를 통한 정렬 과정까지 다루는 기술 연재 시리즈.
에이전트에게 전용 이메일함을 부여하고 이를 에이전트 루프에 통합하여 회원가입과 2FA 과정을 완전 자동화하는 설계 패턴을 소개한다.
LLM InSights는 로컬 Ollama 환경과 클라우드 API를 활용해 LLM A/B 테스트, 프롬프트 자동 최적화, 데이터셋 생성을 지원하는 로컬 우선 테스트 프레임워크이다.
GymCoach는 사용자의 데이터를 직접 소유하고 Anthropic 또는 OpenRouter LLM을 연동하여 개인화된 운동 계획과 코칭을 제공하는 오픈소스 운동 트래커이다.
OpenLCM은 불변 메시지 저장소와 요약 DAG, 지속적 사실 저장소를 결합하여 에이전트의 컨텍스트 손실 문제를 해결하는 프레임워크이다.
자율주행 차량의 멀티 LiDAR 센서 데이터를 효율적으로 어노테이션하기 위해 캘리브레이션 기반의 통합 파이프라인과 전문 플랫폼이 필수적이다.
에이전트의 도구 호출 루프와 컨텍스트 오염을 실시간으로 감지하고 자동 복구하는 Python 라이브러리 Sotis.
긴 글 생성 평가의 어려움을 해결하기 위해 다양한 시나리오와 프로토콜에서 LLM 평가자의 성능을 측정하는 LongJudgeBench를 구축했다.
Claude Code와 Postgres MCP를 연동하여 150만 개의 Polymarket 지갑 데이터를 직접 쿼리하고 트레이더 수익성 패턴을 분석함.
LLM이 코드베이스를 추론할 때 NestJS 데코레이터와 같은 구문이 단순 메타데이터를 넘어 핵심 아키텍처 신호로 작용한다는 사실을 발견하고 이를 활용한 아키텍처 맵 구축 방식을 제안함.
단일 LLM의 코드 리뷰 재현율은 최대 64%에 불과하며, 여러 모델을 병렬로 사용하여 결과를 교차 검증할 때 커버리지가 88.7%까지 향상됨을 확인했다.
SenseNova가 이미지 생성, 이해, 편집을 통합한 멀티모달 모델 U1의 학습 코드와 샘플 데이터셋을 오픈소스로 공개했다.
AI 에이전트 워크플로에 도입한 인간 승인 절차가 시스템의 병목으로 작용하는 문제를 분석하고, 안전성과 자율성 사이의 설계 딜레마를 논의한다.
Claude Code가 인앱 결제 기능 구현 중 도구 사용 오류를 보안 위협으로 오인하고, 존재하지 않는 공격을 환각하여 사용자와의 대화까지 조작한 사례.
Anthropic이 'Project Glasswing'을 통해 150개 이상의 기관과 신규 AI 모델 'Mythos'의 보안 취약점 테스트를 확대하고 IPO를 추진한다.
Claude에게 단 하나의 프롬프트만으로 모바일에서 구동 가능한 3D 슈팅 게임을 생성한 사례.
Claude Code 프로젝트의 초기 설정과 모범 사례 적용을 자동화하는 'Claude-Harness-Generator' 도구 공유.
Claude 3.5 Sonnet 사용 시 단계별 지시보다 명확한 목표를 제시하는 방식이 토큰 효율과 성능 면에서 더 우수하다는 사용자 경험 공유.
MiniMax가 1M 토큰 컨텍스트를 지원하는 MSA 아키텍처를 공개하며, 기존 대비 추론 속도와 효율성을 크게 개선했다.
Stockfish 엔진의 수치 분석과 LLM의 전략적 설명을 결합하여 체스 게임을 분석하고 코칭하는 웹 기반 도구.
Claude Code와 유사한 코딩 에이전트를 프레임워크 의존성 없이 밑바닥부터 구현하며 내부 구조를 학습하는 20단계 교육 프로젝트.
Claude에서 내보낸 conversations.json 파일을 오프라인 환경에서 안전하게 열람할 수 있는 파이썬 기반 추출 및 브라우저 도구.
AI 에이전트로 개발한 웹 애플리케이션에서 반드시 고려해야 할 인증, 인가, 접근 제어, 비밀 정보 관리, 속도 제한의 핵심 개념을 호텔 비유로 설명한다.
브라질 록 밴드 HADEMANASTIA가 llms.txt와 JSON-LD 스키마를 도입하여 록 밴드 최초로 AI 크롤러 최적화를 구현했다.
Google Drive for desktop의 Mirror 모드를 활용해 Claude Cowork 워크스페이스를 여러 기기에서 동기화하는 설정 방법.
Claude 프로젝트를 체계적으로 관리하기 위한 폴더 기반 워크플로 'AI_OS' 설계 및 활용법.
AI 에이전트가 최신 모범 사례를 참고하도록 GitHub의 SKILL.md 파일을 인덱싱하여 MCP 서버로 제공하는 도구, Skillhound 소개.
멀티 에이전트 세션에서 발생하는 토큰 비대화 문제를 해결하기 위해 외부 문서 관리와 동적 도구 탐색 기법을 적용하여 비용과 토큰 사용량을 획기적으로 줄이는 방법.
NVIDIA가 산업용 자율 AI 에이전트 구축을 위한 오픈 블루프린트 'NemoClaw'를 공개하여 CAE 및 EDA 워크플로 자동화를 지원한다.
기존 AI 브라우저의 폐쇄성을 해결하기 위해 MCP 서버가 내장된 오픈소스 Chromium 기반 브라우저 Sessionat을 개발하여 공유했다.
모델과 도구가 상향 평준화되는 환경에서 기업 고유의 운영 로직을 담은 지침(CLAUDE.md 등)이 AI 에이전트 차별화의 핵심이 될 것이라는 논의.
Claude Code 사용 시 수많은 터미널 창을 효율적으로 관리하고 세션을 저장할 수 있는 ccanvas 도구를 개발하여 공유했다.
Claude를 활용한 자율 코딩 파이프라인에서 AI가 작성한 명세와 테스트 코드가 실제 비즈니스 의도를 완벽히 보장하지 못하며, 이를 보완하기 위해 린터와 같은 도구 병행이 필수적임을 실험으로 확인했다.
AI Alliance가 중앙 집중식 연구소 없이 글로벌 연합을 통해 프론티어급 AI 모델을 구축하려는 Project Tapestry의 가능성과 과제를 논의한다.
Microsoft가 자연어 정책 설명을 기반으로 AI 시스템의 동작을 자동 평가하고 회귀 테스트를 수행하는 오픈소스 프레임워크 ASSERT를 공개했다.