본문으로 건너뛰기

2026년 6월 2일 AI 뉴스

100

관심 태그 추가

Claude Code 스킬 74개 작성 후 깨달은 '가르치지 말고 제한하라'는 원칙

Claude Code의 커스텀 스킬은 모델을 가르치기보다 선택지를 제한하고 금지 사항을 명시하는 가드레일로 활용할 때 가장 효과적이다.

r/ClaudeAI2달 전

개인 DNA 데이터를 로컬에서 안전하게 분석하는 에이전트 하네스, Genomi 공개

Genomi는 대규모 유전체 데이터를 로컬에서 처리하여 프라이버시를 보호하고, 최신 과학 데이터베이스와 연동해 정확한 유전학 분석을 수행하는 오픈소스 에이전트 하네스이다.

LangGraph를 Rust로 재구현한 Juncture, 400배 빠른 성능과 타입 안전성 제공

LangGraph의 핵심 모델을 Rust로 포팅하여 타입 안전성과 병렬 처리 성능을 극대화한 Juncture 라이브러리 소개.

LLM은 왜 고전 게임 Zork를 제대로 플레이하지 못할까?

Zork-bench는 고전 텍스트 어드벤처 게임 Zork를 활용해 LLM의 추론 및 문제 해결 능력을 평가하는 벤치마크 도구이다.

AI 정렬의 핵심은 개별 에이전트가 아닌 시스템의 구성적 위상수학에 있다

AI 정렬은 개별 에이전트의 속성이 아니라 시스템의 구성적 위상수학에서 발생하며, 이를 해결하기 위해 서브 튜링 컴파일러를 통한 구조적 검증이 필요하다는 주장.

r/artificial2달 전

5년 된 RTX 3090으로 로컬 LLM 160tps 달성한 후기

RTX 3090을 활용해 Qwen 3.6 35B 모델을 로컬에서 구동하며 VRAM 최적화를 통해 추론 속도를 15tps에서 160tps로 대폭 향상함.

Backprop은 왜 뇌의 초기 시각 피질(V1) 정렬을 빠르게 파괴하는가?

학습 규칙에 따른 인공 신경망과 인간 뇌의 시각 피질 정렬 차이를 분석한 연구로, Backprop이 초기 정렬을 빠르게 파괴하며 전역 오차 신호와 초기 피질 정렬 간의 트레이드오프가 존재함을 확인했다.

오픈 AI 연구의 최전선에서: Ai2 퇴사 후 Nathan Lambert가 그리는 미래

Allen Institute for AI(Ai2)를 떠나는 Nathan Lambert가 오픈 모델 생태계의 중요성과 연구자의 역할을 회고하며 향후 오픈 사이언스 활동을 다짐한다.

단순한 챗봇 사용을 넘어, AI로 업무 역량을 확장하는 실무적 방법

AI 유창성은 단순한 도구 사용을 넘어 인지적 부하를 줄이고 새로운 역량을 개발하는 전문적인 활용 능력을 의미한다.

KDNugget2달 전

블랙박스 LLM을 투명하게: XAI와 관측성으로 신뢰성 확보하기

LLM의 블랙박스 문제를 해결하기 위한 동적 평가 프레임워크와 비용 효율적인 프록시 모델, 관측성 도구 활용법을 다룬다.

원본 데이터 유출 없이 LLM을 활용하는 메타데이터 우선 AI 프레임워크, LocalFlow

로컬 환경에서 메타데이터만 LLM에 전송하여 데이터 프라이버시를 보호하고 결정론적인 분석 코드를 생성·실행하는 AI 프레임워크입니다.

r/LLMDevs2달 전

PDF 파서 5종 성능 비교: 비용과 정확도 사이의 최적 선택은?

실제 기업 문서 200건을 대상으로 PDF 파서 5종의 성능을 비교하고, 문서 유형에 따른 파서 선택 전략을 논의한다.

LLM이 전부가 아니다: 엔터프라이즈 AI를 완성할 전문 모델 스택의 등장

엔터프라이즈 AI는 범용 LLM을 넘어 정형 데이터, 관측 가능성, 실시간 상호작용 등 특정 도메인에 특화된 파운데이션 모델들로 구성된 포트폴리오 형태로 진화한다.

AI 모델의 실수를 방지하는 가드레일, ZeroDrift가 1,000만 달러 투자 유치

ZeroDrift는 결정론적 규칙으로 규정 위반을 탐지하고 LLM으로 메시지를 수정하는 AI 컴플라이언스 솔루션을 제공한다.

r/LangChain2달 전

터미널 에이전트와는 다른 접근, LangGraph로 구축한 인간 개입형 코딩 에이전트

LangGraph를 사용하여 사용자가 워크플로우를 직접 제어하고 컨텍스트를 큐레이션하는 인간 개입형 코딩 에이전트를 개발하여 공개했다.

KDNugget2달 전

데이터 엔지니어링과 AI 에이전트 개발을 위한 필수 오픈소스 도구 10선

데이터 분석, 모니터링, AI 에이전트 메모리 관리를 지원하는 현대적인 오픈소스 데이터베이스 및 관리 도구 10가지를 소개한다.

LLM 컨텍스트 윈도우가 부족한가요? AST로 코드 구조만 추출해 토큰을 절약하는 CGE

AST를 활용해 코드의 구문 노이즈를 제거하고 핵심 구조만 압축하여 LLM 컨텍스트 사용량을 줄이는 CGE 프로젝트를 소개한다.

Dust2달 전

컨설팅 기업이 AI 에이전트를 대규모로 도입하고 성공하는 비결

컨설팅 리더들이 AI 에이전트를 기업 전반에 도입하며 겪은 보안, 거버넌스, 조직 문화 변화 및 실무적 성공 전략을 공유한다.

Siraj Raval2달 전

AI로 8분 만에 작곡부터 음원 등록까지: Fish Audio S2 Pro 실전 가이드

Fish Audio S2 Pro의 Dual-AR 아키텍처와 GRPO 학습 기법을 활용해 감정 제어가 가능한 AI 음성을 생성하고 음원을 제작하는 과정을 다룬다.

Wired AI2달 전

트럼프 행정부의 AI 행정명령, 내부 갈등으로 재추진 불투명

트럼프 행정부가 지난달 무산된 AI 규제 행정명령을 재추진하기 위해 내부 조율 중이나, 규제 완화론자와 강화론자 간의 갈등으로 난항을 겪고 있다.

소규모 비즈니스 운영자라면 주목: AI로 행정 업무 자동화하고 시간 확보하기

소규모 비즈니스 운영자가 AI를 활용해 행정 업무를 자동화하고 생산성을 높이는 실무 전략과 고려 사항을 소개합니다.

AI 논문과 SOTA를 한눈에: paperswithcode.co 컨퍼런스 지원 기능 추가

Hugging Face 팀이 운영하는 AI 논문 추적 사이트 paperswithcode.co에 주요 AI 컨퍼런스 논문을 브라우징할 수 있는 기능이 추가되었다.

금융 AI의 한계 돌파: 트랜잭션 파운데이션 모델로 통합된 지능형 아키텍처 구축

금융 기관이 파편화된 태스크별 모델 대신 트랜잭션 파운데이션 모델을 도입하여 고객 행동을 통합 이해하고 성능과 효율을 개선한다.

r/MLOps2달 전

AI 에이전트가 같은 곳에서 계속 실패하는 이유: '살아있는 기억'이 없는 에이전트의 한계

AI 에이전트의 실패는 무작위가 아니라 특정 패턴으로 클러스터링되며, 이를 해결하려면 단순한 프롬프트 수정이 아닌 실패 패턴을 학습하고 반영하는 폐쇄 루프 시스템이 필요하다.

NVIDIA의 새로운 모델 Cosmos 3와 Nemotron 3 Ultra, 그리고 에이전트 중심의 기술 스택 변화

NVIDIA의 Cosmos 3와 Nemotron 3 Ultra 출시를 비롯해 에이전트 런타임과 로컬 AI 시스템으로 이동하는 최신 AI 기술 동향을 정리한다.

Anthropic의 9650억 달러 IPO와 엔비디아의 새로운 물리 AI 모델 공개

Anthropic의 IPO 소식부터 마이크로소프트, 엔비디아, 인텔의 최신 AI 모델 및 하드웨어 발표까지 한 주간의 기술 동향을 요약합니다.

NVIDIA JetPack 7.2와 NemoClaw로 엣지 디바이스에서 에이전트 AI 구현

NVIDIA가 JetPack 7.2와 NemoClaw를 통해 엣지 디바이스에서 에이전트 AI를 구현하고 로봇 및 산업 자동화 성능을 최적화한다.

NAVER D22달 전

VictoriaMetrics의 수집부터 쿼리까지, 내부 아키텍처 완전 분석

VictoriaMetrics의 수집, 라우팅, 저장, 쿼리 파이프라인을 분석하고 효율적인 메트릭 인프라 운영 원리를 살펴본다.

AI 지능 측정의 새로운 기준: 130 IQ 벽을 넘는 모델들의 등장

기존 AI IQ 측정 방식의 한계를 지적하고, 5개 차원을 통합하여 모델 성능을 평가하는 새로운 벤치마크 방법론을 소개한다.

AWS ML Blog2달 전

Amazon Quick Research로 희귀암 연구 데이터 통합부터 보고서 생성까지

Amazon Quick Research는 다중 소스 데이터를 통합하고 LLM 기반으로 합성하여 근거 중심의 연구 보고서를 자동 생성하는 에이전트형 연구 워크플로를 제공한다.

Amazon Bedrock AgentCore Identity에서 기존 AWS Secrets Manager 보안 비밀을 직접 참조하여 관리 효율성 강화

Amazon Bedrock AgentCore Identity가 기존 AWS Secrets Manager 보안 비밀 참조를 지원하여, 사용자가 직접 암호화, 순환 정책, 태그를 관리할 수 있게 개선됐다.

AI 비즈니스 모델의 대전환: '좌석'에서 '토큰'으로, 그리고 '토큰 부족'의 의미

5월 AI 업계는 좌석 기반 비즈니스 모델에서 토큰 기반으로 전환되며, 전례 없는 AI 인프라 수요와 토큰 부족 현상을 겪었다.

The Verge AI2달 전

엔비디아의 새로운 'RTX Spark' 칩, 윈도우 노트북의 M1 모멘트가 될까?

엔비디아가 20개 CPU 코어와 128GB 통합 메모리를 갖춘 AI 특화 노트북 칩 'RTX Spark'를 공개하며 윈도우 노트북 시장 공략에 나섰다.

에이전트 AI로 자동 트레이딩 시스템 구축하고 BetterDB로 비용 절감하기

에이전트 AI를 활용해 Hyperliquid에서 자동 트레이딩 시스템을 구축하고 BetterDB로 API 비용을 최적화하는 과정을 시연한다.

SpaceX, AI 데이터 센터 냉각수 확보를 IPO 핵심 위험 요소로 명시

SpaceX가 IPO 신고서를 수정하여 AI 데이터 센터 운영에 필수적인 냉각수 확보를 주요 위험 요소로 새롭게 추가했습니다.

AI로 칼로리 추적 앱 리텐션 2배 높이는 실전 개발기

칼로리 추적 앱 Amy의 리텐션 개선을 위해 바코드 스캔, AI 기반 데이터 추출, 수분 추적 기능을 구현한 5개월 차 개발 과정.

방송 중계 영상에서 실시간으로 축구 전술 포메이션을 추출하는 AI 파이프라인 구축법

Roboflow의 RF-DETR로 선수를 탐지하고 Gemini 2.5 Pro로 전술을 분석하는 자동화된 스포츠 분석 워크플로 구축 가이드.

리더보드 순위는 잊어라, 이미지 생성 모델 평가의 새로운 기준 파레토 프론트

이미지 생성 모델 평가 시 리더보드 순위보다 품질 대비 비용과 지연 시간을 고려한 파레토 프론트 분석이 더 실질적인 선택 기준이 된다.

r/ClaudeAI2달 전

코딩 에이전트의 컨텍스트 비용을 64배 줄이는 아키텍처 메모리 레이어

Provenant는 코딩 에이전트가 대규모 저장소를 효율적으로 탐색하도록 돕는 MCP 기반의 아키텍처 메모리 서버입니다.

MCP 서버 6개, 툴 180개: 프로덕션 에이전트 배포의 함정과 비용 절감 전략

프로덕션 환경에서 MCP 서버를 사용할 때 발생하는 툴 선택 오류, 컨텍스트 비용 증가, OAuth 관리 문제를 해결하는 실무 가이드.

Claude Code와 GitHub로 구현하는 야간 백로그 자동화 파이프라인

Claude Code와 GitHub PR 자동 병합 기능을 연동하여 야간에 백로그 작업을 자동으로 처리하는 워크플로를 구축했다.

LLM으로 나만의 지식 베이스를 구축하는 법: McBrain 소개

Andrej Karpathy의 문서 위키 아이디어를 Claude Cowork에서 구현할 수 있는 오픈소스 플러그인 McBrain을 소개한다.

r/ClaudeAI2달 전

Chrome의 메모리 절약 기능으로 Claude 탭이 계속 새로고침된다면?

Chrome의 메모리 절약 기능으로 인한 Claude 탭 강제 새로고침 문제를 해결하기 위해, 탭 상태를 로컬에 캐싱하는 'Session Vault' 확장 프로그램을 개발했다.

r/ClaudeAI2달 전

Claude와 Threads를 직접 연결해 게시물 작성부터 예약까지 자동화하는 방법

BlackTwist MCP 서버를 활용해 Claude와 Threads를 연동하고, 데이터 분석 기반의 콘텐츠 작성 및 예약 자동화 워크플로를 구축한 사례.

r/ClaudeAI2달 전

GPT-5.5가 직접 인정한 Claude Opus 4.8의 우위, 무엇이 달랐나?

개인 지식 베이스를 활용한 3가지 과제 테스트에서 Claude Opus 4.8은 창의적 글쓰기와 추천에서, GPT-5.5는 신중한 연구와 사실 검증에서 우위를 보였다.

내 Claude Code 설정은 몇 점일까? 설정 진단 도구 'ccaudit' 소개

Claude Code 설정 상태를 로컬에서 분석하여 후크 커버리지, 프로젝트 위생 등 6가지 지표로 등급을 매기는 감사 도구 'ccaudit'을 공유했다.

r/artificial2달 전

GPU도, 역전파도 필요 없다? 부동소수점 연산을 제거한 BIN16 아키텍처

부동소수점 연산 대신 XNOR와 popcount 기반의 불리언 연산을 사용하여 GPU 없이 학습과 추론이 가능한 BIN16 아키텍처를 소개한다.

AI 에이전트가 스스로 운영하는 '자기 개선 기업' 구축 가이드

AI 에이전트와 피드백 루프를 활용하여 기업 운영을 자동화하고 지속적으로 성능을 개선하는 실전 방법론을 소개한다.

개인용 AI 에이전트의 망각 문제 해결, Quarq Agent v0.4.0 오픈소스 공개

Quarq Labs가 장기 기억과 로컬 우선 아키텍처를 갖춘 오픈소스 에이전트 프레임워크 Quarq Agent v0.4.0을 출시했다.

양자 컴퓨팅의 핵심, 게이트와 중첩 그리고 얽힘의 원리

양자 컴퓨팅의 기본 단위인 큐비트와 게이트를 통해 중첩과 얽힘 현상의 수학적 원리를 설명한다.

Anthropic과 OpenAI의 IPO 임박, 그리고 급증하는 데이터센터 인프라 비용의 실체

AI 인프라 경쟁으로 인한 데이터센터 확장과 막대한 자본 지출이 이어지는 가운데, 기업들의 IPO 준비와 지역 사회의 환경적 반발이 심화되고 있다.

r/ClaudeAI2달 전

AI 모델별 코드 리뷰 능력 비교: 15개 버그를 가장 잘 찾은 모델은?

15개의 버그가 심어진 React 앱을 대상으로 5개 AI 모델의 코드 리뷰 성능을 벤치마크한 결과, Opus가 가장 넓은 커버리지를 보였고 Grok이 가성비 면에서 우수한 성능을 나타냈다.

30분 만에 구축하는 스스로 학습하는 AI 영업 사원

Claude Code를 사용하여 리드 자격 확인부터 학습까지 수행하는 모듈형 AI 영업 에이전트 구축 사례를 공유한다.

r/ClaudeAI2달 전

Claude Code 세션 초기화 문제를 해결하는 컨텍스트 요약 도구, Claude Cairn

Claude Code 세션의 추론 과정과 결정 사항을 마크업 노트로 저장하여 컨텍스트 재사용성을 높이는 플러그인 Claude Cairn을 개발했다.

r/artificial2달 전

AI 산업의 수익화 가속과 보안 위협: 최근 주요 동향 정리

AI 산업의 수익화 가속과 보안 취약점 노출, 인프라 투자 확대 등 최근 주요 동향을 정리한 요약이다.

r/LLMDevs2달 전

AI 에이전트 플랫폼 7종 비교: 인프라, 보안, 확장성 관점의 선택 기준

AI 에이전트 운영을 위한 7가지 주요 플랫폼의 기술적 특징과 보안, 인프라 트레이드오프를 비교 분석한 자료.

LLM 응답을 텍스트에서 대화형 UI로, MDMA로 구현하는 차세대 AI 인터페이스

MDMA는 마크다운에 폼, 버튼, 승인 게이트 등 대화형 컴포넌트를 삽입하여 LLM 응답을 즉시 실행 가능한 애플리케이션으로 변환하는 오픈 표준이다.

r/ClaudeAI2달 전

Claude의 컨텍스트 윈도우를 효율적으로 사용하는 프롬프트 압축 시스템 MEM-ABBREV v7.3

Claude의 시스템 프롬프트와 메모리 항목을 논리 기호와 단어 압축으로 최적화하여 컨텍스트 효율을 높이는 MEM-ABBREV v7.3 시스템을 소개한다.

r/artificial2달 전

에이전트 시스템이 당신의 API 비용을 순식간에 11만 달러로 만드는 방법

에이전트 시스템은 작업당 다수의 API 호출과 반복적인 재시도를 유발하므로, 프로덕션 환경에서는 작업별 비용 추적과 모델 최적화가 필수적이다.

r/ClaudeAI2달 전

Claude Code의 토큰 낭비 해결사, Meridian으로 비용 절감하기

Claude Code의 OpenTelemetry 데이터를 분석하여 토큰 낭비 패턴을 탐지하고 CLAUDE.md를 최적화하는 로컬 도구 Meridian을 소개한다.

r/artificial2달 전

AI 데모는 완벽한데 왜 프로덕션에서는 실패할까? '관리의 부재'가 원인이다.

AI 모델의 성능 저하는 모델 자체의 문제보다 데이터의 변화를 추적하고 수정하는 관리 체계와 소유권의 부재에서 기인한다는 분석.

LLM의 사용자 객체화 방지: Advaita Vedānta 기반 필터링 레이어 Viveka

LLM 응답에서 사용자 객체화나 과도한 확신을 감지하고 차단하는 Advaita Vedānta 기반의 증인 중심 필터링 라이브러리.

r/LLMDevs2달 전

프롬프트 인젝션은 더 이상 이론이 아니다: 브라질 사법 시스템 사례로 본 AI 보안 위협

브라질 사법 시스템에서 발생한 프롬프트 인젝션 사례를 통해 LLM 애플리케이션의 보안 위협과 Microsoft Foundry를 활용한 대응 방안을 다룬다.

200시간 무중단 라이브 데모, 휴머노이드 로봇의 실전 투입 가능성은?

Boston Dynamics Atlas와 Figure 03의 최신 데모를 분석하고, 휴머노이드 로봇 산업에 투자하는 방법론인 RoboStrategy를 살펴본다.

멀티 에이전트 시스템의 비용과 안정성을 잡는 MeshFlow 런타임

멀티 에이전트 시스템의 프로덕션 배포를 위해 모델 라우팅, 비용 회귀 테스트, 상태 영속성을 지원하는 오픈소스 런타임 MeshFlow를 소개한다.

코딩을 전혀 몰라도 Claude Code로 업무 자동화가 가능할까?

코딩 경험이 없는 비전공자가 Claude Code를 활용해 시간당 250달러 규모의 컨설팅 업무를 자동화한 워크플로 구축 사례.

r/ClaudeAI2달 전

AI 에이전트로 웹 기반 MOBA 게임을 한 번에 개발한 사례

Claude를 활용하여 웹 기반 멀티플레이어 MOBA 게임을 개발하고, 서브 에이전트와 워크플로우 기능을 통해 최적화 및 밸런싱을 수행한 사례.

Claude Code가 바꾼 소프트웨어 엔지니어링: 이제 코딩보다 검증이 중요한 이유

AI 코딩 어시스턴트가 코드 생성을 자동화함에 따라, 소프트웨어 엔지니어의 핵심 역량은 단순 생성이 아닌 깊은 이해와 검증 능력으로 이동하고 있다.

r/LLMDevs2달 전

AI 에이전트 결제 API 호출 시 타임아웃으로 인한 이중 결제 방지하는 법

AI 에이전트가 결제 API 호출 시 타임아웃 발생 후 재시도 과정에서 발생하는 이중 결제 문제를 해결하기 위한 멱등성 키 구현 위치를 논의한다.

r/LLMDevs2달 전

분산 컴퓨팅으로 구동되는 탈중앙화 AI 자동 연구 플랫폼 'Magnet'

분산 컴퓨팅을 활용해 모델을 수익화하고 연구 결과를 비교할 수 있는 탈중앙화 자동 연구 플랫폼 Magnet에 대한 소개.

r/LLMDevs2달 전

로컬 모델로 'vibe coding'을 넘어선 결정론적 코딩 에이전트 구축하기

30B급 로컬 모델에서 구동되며, LangGraph를 활용해 Spec Driven Development를 결정론적으로 수행하는 자율 코딩 에이전트 SPINE을 소개한다.

r/ClaudeAI2달 전

Claude Desktop 설정 파일 편집 없이 MCP를 연결하는 Nexus 앱 공개

TTRPG 캠페인 관리를 위한 MCP 설정을 자동화하는 데스크톱 앱 Nexus가 공개되었다.

r/ClaudeAI2달 전

Claude Code의 맥락 유지와 아키텍처 일관성을 자동화하는 DevArch

Claude Code의 세션 간 맥락 유지와 아키텍처 일관성 문제를 해결하기 위해 엔지니어링 규율을 자동화하는 플러그인 DevArch.

Clojure 매크로와 LLM으로 구현하는 런타임 동적 코드 진화 시스템

Clojure 매크로와 LLM을 결합하여 프로그램 실행 중 로직이 동적으로 진화하는 시스템을 구현한 기술 블로그.

Rust로 구현된 고성능 LLM 압축 도구 CHSE 공개: 토큰 최대 91% 절감

Rust로 작성된 LLM 압축 도구 CHSE는 초당 115만 라인을 처리하며 토큰 사용량을 69~91%까지 줄여 효율성을 극대화한다.

Alphabet, AI 인프라 확충에 800억 달러 투입... Berkshire Hathaway도 참여

Alphabet이 AI 인프라 확장을 위해 800억 달러 규모의 주식 발행을 통한 자금 조달 계획을 발표했다.

LLM, MCP, 에이전트 통신을 통합 관리하는 오픈소스 게이트웨이 'agentgateway'

agentgateway는 LLM, MCP, 에이전트 간 트래픽을 단일 데이터 플레인에서 통합 관리하여 인프라 복잡성을 줄이는 오픈소스 게이트웨이이다.

r/ClaudeAI2달 전

Claude 기반 자율 에이전트 Jork로 콘텐츠 제작부터 마케팅까지 자동화한 실험

Claude 기반 자율 에이전트 프레임워크 Jork를 통해 콘텐츠 제작과 마케팅 업무를 자동화하고 실제 수익을 창출한 사례.

r/ClaudeAI2달 전

MCP 서버 설치, JSON 편집 없이 한 번의 클릭으로 해결하는 방법

MCP 서버 설치 시 발생하는 환경별 설정 파편화 문제를 해결하기 위해 자동화된 설치 패턴과 원자적 파일 쓰기 전략을 제안한다.

r/artificial2달 전

3D 생성은 결과물이 아닌 시작점이다: AI 3D 워크플로우 분석

3D 생성 모델은 최종 결과물이 아닌 창작 과정의 시작점으로, Figma, Tripo AI, Blender를 연결하는 워크플로우가 효율적이다.

r/ClaudeAI2달 전

복잡한 악기 메뉴 설정을 자연어로 제어하는 MCP 서버 공개

Claude Desktop과 연동하여 MIDI 기반 악기 장비의 톤 설정을 자연어로 제어할 수 있는 오픈소스 MCP 서버를 개발했다.

r/ClaudeAI2달 전

Claude가 언리얼 엔진을 직접 제어한다: 132개 도구로 자동화된 워크플로 구축

Claude가 MCP를 통해 언리얼 엔진의 132개 도구를 제어하고, 변경 후 자동 검증을 통해 배치 오류를 방지하는 오픈소스 프로젝트.

PRL3 PROOF 시스템 설치 및 평가 환경 구축 가이드

PRL3 PROOF 시스템을 Ubuntu 24.04 환경에 설치하고 의존성 구성 및 벤치마크를 실행하는 자동화 스크립트입니다.

r/LangChain2달 전

LLM 에이전트 무한 루프와 비용 폭탄을 막는 오픈소스 SDK 'AgentBrake'

LLM 에이전트와 도구 사이에 위치하여 무한 루프, 예산 초과, 권한 오남용을 감지하고 차단하는 오픈소스 SDK 'AgentBrake'를 개발했다.

AWS ML Blog2달 전

Amazon Bedrock에서 만나는 OpenAI 최신 모델: GPT-5.5와 Codex 정식 출시

Amazon Bedrock이 OpenAI의 GPT-5.5, GPT-5.4 모델과 코딩 에이전트 Codex를 정식 출시하여 엔터프라이즈급 보안 환경에서 활용 가능해졌다.

E8 격자 코드북으로 LLM 가중치를 2-8 bpw로 압축하고 추론 성능을 높이는 GLQ

GLQ는 E8 격자 코드북과 Randomized Hadamard Transform을 사용하여 LLM 가중치를 2-8 bpw로 효율적으로 양자화하고, 융합된 CUDA 커널로 추론 속도를 최적화하는 라이브러리입니다.

r/ClaudeAI2달 전

Claude Opus로 구축하는 멀티 에이전트 코딩 팀, 이제는 오케스트레이션이 핵심

Claude Opus와 같은 강력한 모델을 활용해 에이전트 간 협업과 작업 가시성을 제공하는 오픈소스 멀티 에이전트 관리 도구인 Agent Teams AI를 소개한다.

r/ClaudeAI2달 전

여러 기기의 AI 코딩 도구 사용량을 한곳에서 확인하는 방법

Claude Code, Cursor, Codex 등 AI 코딩 도구의 사용 기록을 기기 간 동기화하고 히트맵으로 시각화하는 오픈소스 도구 aitrack을 소개한다.

AI 특유의 기계적인 문체를 제거하고 자연스러운 글쓰기를 돕는 Claude Code 스킬

AI 생성 텍스트의 부자연스러운 구조와 미사여구를 제거하여 인간적인 문체로 재작성하는 Claude Code용 스킬 '/humanize'를 개발함.

Meta AI 챗봇의 보안 허점, 인스타그램 계정 탈취에 악용돼

Meta의 AI 지원 챗봇이 이메일 변경 요청을 검증 없이 처리하는 보안 허점이 발견되어 다수의 인스타그램 계정이 탈취됨.

AWS ML Blog2달 전

Amazon Bedrock AgentCore Gateway로 MCP 배포 시 보안과 제어를 강화하는 방법

Amazon Bedrock AgentCore Gateway가 MCP 서버를 위한 스트리밍, 세션 관리, Elicitation 및 OAuth 2.0 토큰 교환 기능을 추가하여 엔터프라이즈급 제어와 보안을 강화함.

r/ClaudeAI2달 전

Claude Code 15만 번 실행한 헤비 유저의 분석, 무엇이 비효율을 만드는가?

69일간 15만 회 이상의 도구 실행을 기록한 헤비 유저의 Claude Code 사용 패턴을 분석하여, 거대 세션으로 인한 컨텍스트 관리와 비용 효율성 문제를 지적함.

r/ClaudeAI2달 전

Claude의 무분별한 도구 사용, 비용 폭탄의 원인인가?

Claude가 불필요한 웹 검색과 도구 호출을 남발하여 비용이 급증하는 문제를 지적하며, 특정 작업에 특화된 버티컬 앱 설계의 필요성을 제기함.

r/artificial2달 전

AI 모델이 실제 환경에서 실패하는 이유: 300개 논문에서 발견된 데이터 누수

데이터 누수로 인해 테스트셋 성능이 과대평가되는 문제를 지적하며, 실제 환경에서의 모델 성능 검증 필요성을 강조함.

LLM이 작성한 코드, 겉모습만 보고 믿으면 위험한 이유

LLM은 구조화된 지시사항을 잘 따르지만 보안 취약점을 놓칠 수 있으므로, 코드 실행 여부만으로 판단하는 '바이브 코딩'은 지양해야 한다.

플로리다주, ChatGPT의 위험성 문제 삼아 OpenAI에 소송 제기

플로리다주가 ChatGPT의 설계가 공공 안전을 위협한다고 주장하며 OpenAI를 상대로 민사 소송을 제기했다.

학습 데이터에선 1위였던 피처가 테스트 셋에선 성능을 깎아먹는 이유

LightGBM 분위수 회귀 모델에서 타겟 인코딩이 학습 데이터의 노이즈를 과적합하여 실제 테스트 성능을 저하시키는 현상을 어블레이션 테스트로 확인했다.

AI 에이전트의 안전한 결제를 위한 Amazon Bedrock AgentCore의 가드레일 설계

Amazon Bedrock AgentCore payments는 인프라 계층에서 예산 한도와 권한을 제어하여 AI 에이전트의 안전한 결제를 지원한다.

AWS ML Blog2달 전

Amazon Bedrock AgentCore로 AI 에이전트의 도구 접근을 제어하고 보안을 강화하는 방법

Amazon Bedrock AgentCore의 Cedar 정책과 Lambda 인터셉터를 결합하여 AI 에이전트의 도구 호출을 동적으로 검증하고 제어하는 보안 아키텍처를 구축합니다.

r/LLMDevs2달 전

LLM 에이전트의 컨텍스트 윈도우를 낭비하는 JSON, 어떻게 해결하고 계신가요?

LLM 에이전트 파이프라인에서 JSON 직렬화의 토큰 낭비 문제를 지적하고, 이를 40-45% 개선한 실험적 직렬화 엔진 사례를 공유하며 커뮤니티의 대안을 묻는 토론.