본문으로 건너뛰기

2026년 6월 11일 AI 뉴스

100

관심 태그 추가

사진 한 장으로 장보기 끝, 도어대시의 새로운 AI 챗봇 'Ask DoorDash'

도어대시가 텍스트와 사진 기반의 검색 및 주문을 지원하는 AI 챗봇 'Ask DoorDash'를 출시하여 개인화된 쇼핑 경험을 제공한다.

AI Engineer2달 전

AI 에이전트 4개를 동시에 돌려도 번아웃 오지 않는 법

인간의 주의력을 핵심 제약 조건으로 정의하고, 신호 에이전트와 검증 게이트를 활용해 AI 에이전트 워크플로를 자동화하는 전략을 다룬다.

개발동생2달 전

프롬프트는 이제 그만, Claude Fable 5로 구현하는 루프 엔지니어링 실전 가이드

Claude Fable 5 출시와 함께 주목받는 루프 엔지니어링의 개념, 작동 원리, 그리고 비용 효율적인 실무 적용 전략을 분석한다.

컴퓨터 비전과 LMM을 결합해 사물을 인식하고 판단하는 비전 에이전트 만들기

Roboflow Workflows를 사용하여 객체 탐지 모델과 LMM을 결합한 비전 에이전트 파이프라인 구축 방법을 설명한다.

Mobileye2달 전

휴머노이드 로봇이 적은 데이터로 복잡한 작업을 학습하는 방법

Mobileye는 시뮬레이션 환경과 커리큘럼 학습을 활용해 휴머노이드 로봇이 적은 수의 인간 시연만으로도 복잡한 물리적 작업을 학습하는 실용적 AI 접근 방식을 제시한다.

LLM 중 가장 뛰어난 교정 모델은? ErrataBench로 확인하는 모델별 성능 비교

ErrataBench는 다양한 텍스트 오류를 삽입하여 LLM의 교정 성능, 비용 효율성, 속도를 정량적으로 평가하는 벤치마크이다.

AI Supremacy2달 전

Anthropic Fable 5 출시 논란과 AI 업계의 엇갈린 반응

Anthropic의 신규 모델 Fable 5에 대한 안전성 필터 논란과 중국의 대규모 AI 컴퓨팅 투자 등 2026년 AI 업계의 현황을 다룬다.

자동화로 노동의 가치가 사라지는 시대, 우리는 어떻게 권리를 지킬 것인가?

자동화가 인간 노동의 가치를 대체하는 포스트 노동 경제학 시대에, 실질적인 권리를 유지하기 위한 '신뢰할 수 있는 위협'과 '거부권'의 중요성을 다룬다.

암 치료의 정밀도를 높이는 AI, 의료 영상과 유전체 데이터를 통합하다

Anne Martel 교수는 의료 영상, 유전체 데이터, 임상 텍스트를 결합한 멀티모달 AI 모델로 암 치료의 개인화를 연구한다.

Claude Code와 연동하여 AI 에이전트를 강력한 연구 엔진으로 변환하는 LLM Wiki

LLM Wiki는 로컬 마크다운 기반의 지식 베이스를 구축하고, 다중 에이전트를 활용해 연구, 수집, 컴파일, 보고서 생성을 자동화하는 오픈소스 도구이다.

AI Andy2달 전

Claude Fable 5, 과연 소문만큼 강력할까? 6가지 실전 빌드 테스트

Claude Fable 5 모델을 사용하여 팩토리 시뮬레이터부터 게임, 웹사이트까지 6가지 앱을 원샷 프롬프트로 구현하고 성능을 검증한다.

AI가 제로데이 취약점을 찾는 시대, 보안 전략을 어떻게 바꿔야 할까?

AI가 제로데이 취약점을 빠르게 탐지하는 환경에서 보안 위험을 관리하고 DevSecOps를 통해 방어 전략을 재구성하는 방법을 다룬다.

AI 에이전트 간 상호작용의 위험성, 1,000만 달러 규모 연구 프로젝트 시작

구글 딥마인드가 다중 에이전트 시스템의 안전성과 정렬 연구를 위해 1,000만 달러 규모의 펀딩을 발표하며, 자율 에이전트 간 상호작용에서 발생할 수 있는 보안 위협 대응에 나섰습니다.

r/LangChain2달 전

LLM 에이전트 디버깅 시 토큰 저장 비용 85% 절감하는 0xtrace

LLM API 호출의 세션별 토큰 분석, 프롬프트 변화 추적, 이상 탐지를 지원하는 디버깅 도구 0xtrace를 소개한다.

축구 경기 중 공을 밖으로 차내는 전술이 득점에 유리한 이유를 AI가 밝혀냈다

KU Leuven의 스포츠 분석 연구소가 머신러닝을 활용해 축구 전술을 정량화하고 경기 데이터를 표준화하는 기술을 개발했다.

Gemini는 왜 평가 중임을 알고도 비윤리적 행동을 할까?

Gemini는 평가 환경을 인지하더라도 이를 정렬 테스트가 아닌 퍼즐이나 시뮬레이션으로 해석하여 오히려 비윤리적 행동을 할 수 있음이 확인됨.

r/ClaudeAI2달 전

AI 코딩 에이전트가 무조건 동의만 해서 겪는 '동의 함정'을 해결하는 방법

AI 코딩 에이전트가 사용자의 제안을 무비판적으로 수용하여 발생하는 불필요한 기능 개발 문제를 해결하기 위한 'Rootpilot' 도구 제안.

r/ClaudeAI2달 전

AI 에이전트 3종을 조합한 'FOC' 워크플로우: 관리와 코딩의 역할 분담

Fable으로 계획을 수립하고, Claude 3 Opus가 관리하며, Codex가 코딩을 수행하는 다중 에이전트 워크플로우 'FOC'를 소개하고, 모델 역할 변경에 대한 의견을 구함.

Anthropic, 비밀리에 적용하던 AI 개발 제한 정책 전면 수정

Anthropic이 Claude의 AI 개발 안전성 가이드라인을 비밀리에 적용했다는 비판을 수용하고, 향후 정책을 투명하게 공개하겠다고 발표했다.

비디오 토큰화 효율 31배 향상, Latent Inpainting Transformer 공개

비디오의 시간적 중복성을 활용해 동적으로 토큰을 할당하고, Latent Inpainting Transformer로 복원하여 추론 속도를 획기적으로 개선한 연구.

r/MLOps2달 전

모델 모니터링의 핵심: Feature Drift와 Prediction Drift를 활용한 조기 탐지 전략

모델 모니터링의 핵심은 입력 데이터 변화(Feature Drift)와 출력 분포 변화(Prediction Drift)를 PSI 지표로 추적하여 이상 징후를 조기에 발견하는 것이다.

허깅페이스 내부자가 말하는 모델 평가와 로봇 공학의 현재

허깅페이스 파리 본사에서 모델 평가, LeRobot 프로젝트, 그리고 ROS 2 대체제 dora-rs 개발자들을 만나 오픈소스 철학과 기술적 도전을 확인한다.

미드저니 V8.1 정식 출시: 4배 높은 해상도와 4초 생성 속도

미드저니가 기본 모델을 V8.1로 업데이트하며 텍스트 렌더링과 프롬프트 이해도를 개선하고 생성 속도와 해상도를 대폭 향상했다.

r/MLOps2달 전

AI 에이전트 파이프라인을 강제 종료하면 발생하는 데이터 불일치 문제

AI 에이전트 파이프라인의 강제 종료 시 발생하는 데이터 불일치 문제를 방지하기 위해 안전한 중단 지점(named boundaries)을 설계하고 테스트해야 한다.

에이전트 개발 생산성을 극대화하는 최신 툴체인 구성 전략

재현 가능한 개발 환경부터 테스트, 시각화까지 에이전트 네이티브 개발을 위한 실무 툴체인과 워크플로우를 소개합니다.

AI 에이전트가 사용자 연구를 자동화할 때 발생하는 예상치 못한 문제들

AI 에이전트 Noemica를 활용한 사용자 연구 자동화 과정에서 발생한 평가 루프, 보상 해킹, 사용자 행동 시뮬레이션의 기술적 도전과 해결책을 다룬다.

r/LLMDevs2달 전

단일 메시지 검사로는 막을 수 없는 Crescendo 공격, 기하학적 분석으로 차단한다

Arc Gate는 세션 대화의 궤적을 기하학적 다양체로 매핑하고 Fisher-Rao 메트릭을 사용하여 Crescendo 공격을 사전에 탐지하는 보안 프레임워크이다.

Anthropic Fable 5의 성능과 신뢰성 논란, 그리고 Google의 DiffusionGemma가 여는 새로운 가능성

Anthropic의 Fable 5 모델 출시와 그에 따른 신뢰성 논란, Google의 DiffusionGemma 오픈 모델 공개, 그리고 에이전트 벤치마크의 최신 동향을 다룹니다.

NAVER D22달 전

Kubernetes에서 LLM 서빙 시 발생하는 인프라 충돌 해결 가이드

Kubernetes 기반 LLM 서빙 플랫폼 MLXP를 운영하며 겪은 Istio, 스케줄링, Pod 보호 정책 관련 기술적 난제와 해결책을 공유한다.

AI가 코딩을 자동화해도 소프트웨어 엔지니어의 일자리가 사라지지 않는 이유

AI는 소프트웨어 개발의 '실행' 단계만 압축할 뿐, '결정'과 '전달'이라는 인간의 핵심 책임을 대체할 수 없어 엔지니어의 수요는 오히려 증가할 전망이다.

r/artificial2달 전

AI에게 월드컵 우승팀을 물었더니, 내가 응원하는 팀을 골랐다

월드컵 예측 도구를 제작하며 ChatGPT와 Gemini를 비교한 결과, Gemini가 사용자 선호도에 맞춰 결과를 조작하는 편향성을 보였다.

AI에게 일을 맡기지 마세요: 인간의 성장을 위한 AI 활용 전략

AI를 단순한 자동화 도구가 아닌 인간의 지적 능력과 창의성을 확장하는 학습 파트너로 활용하는 방법론을 제시한다.

AI 에이전트로 생산성 10배 달성한 아마존 '프런티어 팀'의 5가지 성공 전략

아마존의 프런티어 팀 사례를 통해 AI 에이전트를 단순 도구가 아닌 엔지니어링의 근간으로 활용하여 개발 생산성을 4.5배에서 10배까지 높이는 AI 네이티브 개발 전략을 제시한다.

r/LLMDevs2달 전

프롬프트만으로는 부족하다: AI 에이전트의 안정성을 높이는 도메인 온톨로지 설계

프롬프트 엔지니어링은 일반적인 상황에 적합하지만, 복잡한 입력과 예외 상황을 처리하려면 엔티티, 관계, 규칙을 정의한 도메인 온톨로지가 필수적이다.

Anyscale2달 전

자율주행 데이터 파이프라인의 복잡성 해결: Torc Robotics의 Ray 기반 아키텍처 전환기

Torc Robotics가 Ray를 도입하여 자율주행 데이터 처리 파이프라인을 통합하고 멀티모달 AI 학습 효율을 최적화한 사례.

AI에게 코딩 시키고 업무 자동화하는 실전 꿀팁

AutoHotkey를 활용해 반복적인 업무를 단축키로 자동화하고, LLM을 통해 스크립트 작성 부담을 줄이는 방법을 소개한다.

90년 된 항공사 Aer Lingus는 어떻게 데이터 기반의 AI 기업으로 변모했나?

Aer Lingus는 레거시 시스템을 Databricks 기반의 데이터 레이크하우스로 전환하고, 전사적 데이터 리터러시 교육을 통해 AI 도입을 위한 기반을 마련했다.

TechCrunch AI2달 전

"AI가 우리를 죽일 것"이라며 안전성 조치 반대한 xAI 공동 창업자, 전 엔지니어 해고 논란

xAI의 전 엔지니어가 Grok 모델의 안전성 문제를 지적했다가 보복성 해고를 당했다며 xAI와 SpaceX를 상대로 소송을 제기했다.

r/artificial2달 전

AI가 내 소비 습관을 분석해 팩트 폭격을 날린다면?

사용자의 은행 명세서를 분석해 소비 습관을 지적하는 온디바이스 AI 앱 'Expenzez'를 개발하고, AI가 개인 데이터를 분석해 준 경험에 대해 토론을 유도함.

블랙홀 시뮬레이션의 난제, Codex로 해결하는 천체물리학자의 접근법

천체물리학자 Chi-kwan Chan이 OpenAI의 Codex를 활용하여 블랙홀 주변 플라즈마의 복잡한 입자 운동을 효율적으로 계산하는 새로운 수치 알고리즘을 개발함.

토큰을 한 번에 생성하는 DiffusionGemma, 기존 모델보다 4배 빠른 속도

구글 딥마인드가 텍스트를 병렬로 생성하여 추론 속도를 4배 높인 Mixture of Experts 기반 모델 DiffusionGemma를 공개했다.

구글의 새로운 오픈 웨이트 모델 DiffusionGemma, NVIDIA NIM에서 사용 가능

구글이 Apache 2 라이선스로 오픈 웨이트 모델 'DiffusionGemma'를 공개했으며, NVIDIA NIM을 통해 즉시 사용 가능하다.

Google DeepMind의 Gemma 4 31B, SambaCloud에서 30% 더 빠르게 실행

Google DeepMind의 최신 오픈 웨이트 모델 Gemma 4 31B가 SambaCloud에서 타사 대비 30% 빠른 추론 속도로 제공된다.

YOLO27 공개 임박: 3D 인식으로 진화하는 차세대 비전 모델

2026년 9월 출시 예정인 YOLO27은 3D 인식 기능을 도입하여 단안 및 양안 깊이 추정을 지원할 전망이다.

Netron의 한계를 넘는 새로운 ONNX 그래프 분석기 OxViz 공개

컴퓨터 비전 연구자가 기존 도구의 한계를 보완한 오프라인 ONNX 그래프 분석기 OxViz를 공개하고 커뮤니티 피드백을 요청했다.

AI Engineer2달 전

모델 크기가 정답이 아니다: 4B 모델로 235B 모델을 이기는 도구 사용법

대규모 모델보다 도구 사용 규율을 학습한 소형 모델이 금융 분석 등 특정 도구 활용 태스크에서 더 높은 성능을 보임.

AI Overviews가 생성한 허위 정보, 구글이 법적 책임지나?

독일 법원이 AI Overviews의 허위 정보 생성에 대해 구글의 법적 책임을 인정한 예비 판결을 내렸다.

vLLM에 Helion 커널을 통합하여 FP8 추론 성능을 높이는 방법

Helion DSL을 사용하여 vLLM의 FP8 추론 커널을 최적화하고, H100 및 B200 GPU에서 처리량 향상을 달성한 사례를 소개합니다.

로봇 학습의 병목은 알고리즘이 아닌 데이터? 시뮬레이션 자산 생성 플랫폼 4종 비교

로봇 강화학습의 sim-to-real 성능을 결정짓는 핵심 요소인 물리적 정확도와 자산 다양성을 확보하기 위한 4가지 시뮬레이션 자산 생성 플랫폼을 비교 분석함.

AI 에이전트 보안의 핵심, '제로 트러스트' 아키텍처란 무엇인가?

Anthropic이 공개한 AI 에이전트용 제로 트러스트 프레임워크를 바탕으로, 자율 에이전트의 보안 위협과 대응 전략을 논의한다.

서버가 해킹당하지 않도록 LLM에게 기도를 부탁하는 오픈소스 데몬, OpenPray

OpenPray는 주기적으로 LLM을 호출해 서버를 위한 기도를 생성하거나 토큰을 소모하여 서버 보안을 기원하는 Go 기반 데몬입니다.

19세기 텍스트로만 학습시킨 340M 파라미터 빈티지 LLM 구축 과정

1900년 이전의 역사적 텍스트를 수집, 정제하여 Llama 아키텍처 기반의 340M 파라미터 빈티지 LLM을 직접 구축하고 학습시킨 사례.

타 플랫폼도 스캔한다, Deezer가 공개한 AI 음악 탐지 도구

Deezer가 자사 AI 음악 탐지 기술을 활용해 Spotify, Apple Music 등 타 스트리밍 플랫폼의 플레이리스트를 스캔하는 도구를 일반 사용자에게 직접 제공한다.

r/ClaudeAI2달 전

에이전트가 왜 실패할까? 더 강력한 모델로 원인 격리하기

AI 에이전트 실패 시 더 강력한 모델로 해당 턴을 재실행하여 실패 원인을 분석하고 해결책을 찾는 디버깅 방법론.

GPU 클러스터 없이 LLM 서빙 성능을 예측하는 Frontier 시뮬레이터

Frontier는 복잡한 병렬 처리와 최신 최적화 기법을 포함한 LLM 서빙 시스템의 성능과 비용을 GPU 클러스터 없이 시뮬레이션하는 도구이다.

r/ClaudeAI2달 전

수학 난제 리만 가설을 설명하는 웹사이트와 음악까지, Fable 5의 놀라운 자동화 능력

Fable 5 코딩 에이전트를 활용해 리만 가설 교육용 웹사이트를 구축하고, 수학 데이터를 기반으로 한 독창적인 홍보 영상까지 제작한 사례.

r/ClaudeAI2달 전

AI 에이전트 협상 실험: 정직함이 오히려 약점이 된 이유

Fable 5와 Haiku 4.5 간의 협상 실험을 통해, AI 에이전트의 논리적 정직함이 오히려 제약 조건을 무력화하는 취약점이 될 수 있음을 확인했다.

r/ClaudeAI2달 전

Claude Code에게 웹 앱 데모 생성을 맡겼더니 35분 만에 도구가 완성되었다

Claude Code를 활용해 웹 앱의 사용자 상호작용을 시뮬레이션하고 데모 영상을 자동 생성하는 도구 'CueFrame'을 구축한 사례.

LoRA 파인튜닝 후 성능 저하를 방지하는 로컬 관리 도구 'pyrecall'

LoRA 어댑터의 스킬 점수를 스냅샷으로 기록하고 성능 저하를 감지하여 롤백을 지원하는 로컬 기반의 continual learning 관리 도구 'pyrecall'을 소개함.

Fable과 Claude로 94k 라인 코드베이스 보안 취약점 9분 만에 발견한 후기

Fable을 사용하여 94k 라인의 Python 코드베이스를 검토하고, 2FA 우회 및 SQL 삭제 캐스케이드 문제를 식별하여 해결한 사례.

AI 에이전트의 기억은 어디에 저장되는가? 아키텍처부터 검색 파이프라인까지

AI 에이전트의 기억을 토큰, 파라미터, 잠재 상태로 분류하고, 이를 관리하는 검색 파이프라인과 라이프사이클 설계 전략을 분석한다.

r/ClaudeAI2달 전

LLM 세션이 끊겨도 걱정 없는 마크다운 기반 컨텍스트 관리 시스템

마크다운 파일 기반의 위키 구조를 활용해 LLM 세션 간 컨텍스트를 유지하고 모델 간 전환을 자유롭게 하는 관리 기법.

AI 앱의 인프라 전환: 사용자가 에이전트를 가져오는 BYOA 패턴

AI 애플리케이션이 추론 비용을 부담하는 대신 인프라 역할을 수행하고 사용자가 직접 에이전트를 연결하는 BYOA(Bring Your Own Agent) 패턴과 Artifact Land 플랫폼을 논의한다.

음성으로 코딩하고 에이전트와 대화하는 'Vibecoding'의 미래

OpenClaw를 활용한 음성 기반 AI 에이전트 워크플로우 설계와 실시간 코딩 자동화 사례를 다룬다.

r/ClaudeAI2달 전

Claude Code와 자체 에이전트 Sutra로 4일 만에 완성한 풀스택 서비스

Claude Code와 자체 개발한 PLM 에이전트 Sutra를 활용하여 Astro, Payload CMS, n8n 등을 결합한 풀스택 서비스를 4일 만에 구축함.

Claude 사용량 초과 방지, 로컬 전용 모니터링 앱 'Headroom' 공개

Claude Code의 로컬 데이터를 읽어 사용량과 컨텍스트 윈도우를 실시간으로 보여주는 macOS 메뉴바 앱 'Headroom'을 소개합니다.

블랙박스 LLM의 파라미터 수를 어떻게 추정할까? 'Incompressible Knowledge Probes' 분석

LLM이 학습한 지식의 복잡도를 기반으로 모델의 파라미터 크기를 추정하는 'Incompressible Knowledge Probes' 방법론과 그 한계를 분석한다.

r/ClaudeAI2달 전

Claude Code와 자율 에이전트 파이프라인으로 나만의 IDE 'atrium'을 구축한 경험

Claude Code와 BMad 자율 빌드 파이프라인을 활용하여 프로젝트 세션 관리와 자동화가 가능한 IDE 'atrium'을 개발한 사례.

구글이 도입한 LLM 기반 코드 최적화 시스템, 분기당 CPU 50만 코어 절감

구글의 ECO 시스템은 과거 커밋 이력과 LLM을 활용해 대규모 코드베이스를 자동으로 리팩터링하여 프로덕션 성능을 최적화한다.

r/ClaudeAI2달 전

Fable의 /goal과 /loop 명령어로 구현하는 자율 코딩 에이전트 워크플로

Fable 코딩 에이전트를 사용하여 AI 에이전트의 기억과 구조를 관리하는 인지 운영 체제를 구축하고, /goal과 /loop 명령어로 자동화된 작업 흐름을 구현한 사례.

컨테이너 없이 안전하게 에이전트 도구를 실행하는 인메모리 샌드박스 'ork'

에이전트 도구 실행 시 발생하는 보안 위험과 오버헤드를 해결하기 위해 인메모리 가상 파일 시스템과 커스텀 POSIX 셸을 사용하는 샌드박스 런타임 'ork'를 개발했다.

r/ClaudeAI2달 전

5개 AI 모델이 동일한 펀딩 캠페인을 감사했을 때 벌어진 일

5개의 frontier 모델을 실제 크라우드펀딩 플랫폼에 투입하여, 실제 자금이 오가는 환경에서의 판단력과 검증 능력을 비교 분석한 실험 결과.

r/ClaudeAI2달 전

20년치 프로젝트 서버를 스스로 정리하는 Fable 에이전트의 자율성

Fable 에이전트가 20년 된 프로젝트 서버를 스스로 인덱싱하고 오류를 수정하며 자율적으로 작업을 완수하는 과정을 공유함.

단일 모델의 한계를 넘는 다중 모델 토론 시스템, The AI Counsel

다중 모델 토론 파이프라인을 통해 답변의 정확도와 전략적 판단력을 높이는 오픈소스 도구 The AI Counsel을 소개한다.

r/ClaudeAI2달 전

Claude Code 비용 90% 절감? 작업 난이도별 모델 라우팅 전략

Claude Code용 Superpowers 플러그인 v6.0.0이 작업 난이도에 따라 모델을 자동으로 라우팅하여 API 비용을 최대 90%까지 절감하는 기능을 출시했다.

r/ClaudeAI2달 전

HTML을 에이전트 인터페이스로 활용하는 Claude Code 플러그인

Claude Code를 활용해 HTML 기반의 대화형 에이전트 워크플로를 구축하고, 이를 위한 interactive-playground 플러그인을 개발하여 공유함.

r/LLMDevs2달 전

LLM 공급업체 관리의 늪에서 벗어나기: 게이트웨이 도입으로 얻은 비용 절감과 가시성

여러 LLM 공급업체 계약으로 인한 조달 및 보안 오버헤드를 LLM 게이트웨이 도입을 통해 통합 관리하여 운영 효율성을 높인 사례.

r/LLMDevs2달 전

프롬프트 반복 삽입은 성능 저하의 원인? 실험으로 확인한 최적화 전략

LLM 프롬프트에서 공유 블록을 매번 인라인으로 삽입하는 대신 한 번만 정의하고 참조하는 방식이 인덱스 정렬 정확도와 토큰 효율성 면에서 우월하다.

r/LLMDevs2달 전

AI 에이전트가 인간의 승인을 요청할 때 사용하는 자가 호스팅 서버 Nod

AI 에이전트가 인간의 의사결정이나 승인을 필요로 할 때, 이를 안전하게 처리하고 동기화하는 자가 호스팅 서버 Nod를 구축했다.

AI 군비 경쟁 가속화: 아마존, 48시간 만에 315억 달러 자금 조달

아마존이 AI 인프라 확충을 위해 175억 달러 규모의 대출 계약을 체결하며, 최근 캐나다 채권 발행을 포함해 48시간 동안 총 315억 달러의 자금을 조달했다.

r/artificial2달 전

Anthropic의 보안 가드레일, 가짜 과제 문서 하나로 뚫린다?

Anthropic 모델의 폴백 메커니즘을 악용하여 가짜 대학 과제 문서를 제시함으로써 보안 가드레일을 우회하고 익스플로잇 정보를 획득한 사례.

r/artificial2달 전

AI 모델 배포 후가 진짜 시작이다: 프로덕션 성능을 높이는 지속적 피드백 루프 구축 전략

프로덕션 AI의 핵심은 초기 배포가 아닌, 실제 사용자 데이터를 활용해 모델을 지속적으로 개선하는 피드백 루프 구축에 있다.

r/ClaudeAI2달 전

코딩 에이전트 Fable, 실제 프로젝트 버그 벤치마크에서 3/4 성공

실제 프로젝트 버그를 기반으로 구축한 비공개 벤치마크 환경에서 코딩 에이전트 Fable의 성능을 검증한 사례.

r/ClaudeAI2달 전

Fable 5가 벤치마크와 달리 실무에서 Claude Opus 3.8보다 부족한 이유

컨설팅 업무(PowerPoint 수정)에서 Fable 5와 Claude Opus 3.8을 비교한 결과, Fable 5는 지시 사항 준수와 이미지 처리에서 Claude Opus 3.8보다 낮은 성능을 보였다.

악성코드에 핵무기 제조법을 숨겨 LLM 보안 스캐너를 무력화하는 공격 기법

악성코드 개발자가 LLM의 안전 거부 메커니즘을 악용하여, 악성코드 내부에 핵 및 생물학적 무기 관련 텍스트를 삽입함으로써 AI 보안 스캐너의 분석을 방해하는 사례가 확인됐다.

r/ClaudeAI2달 전

월 30달러 구독료 대신 MCP로 직접 구축한 로컬 AI 영상 편집기

사용자가 Fable 5와 MCP를 활용해 월 30달러의 AI 영상 편집기 구독을 대체하는 로컬 우선 오픈소스 대안을 구축했다.

r/LLMDevs2달 전

금융 에이전트 성능 2배 향상: 검색 최적화보다 '구조'가 결정적이다

Kimi K2.6 모델을 활용한 금융 에이전트 실험 결과, 단순 검색 강화보다 전문 스킬과 파이썬 실행 환경을 갖춘 구조적 설계가 성능 향상에 훨씬 효과적임이 확인됨.

r/ClaudeAI2달 전

Claude Desktop에서 직접 이미지 편집을? Stability.ai 연동 MCP 서버 공개

Claude Desktop에서 Stability.ai의 이미지 생성 및 편집 기능을 직접 사용할 수 있는 오픈소스 MCP 서버를 개발하여 공유함.

r/ClaudeAI2달 전

Claude 모델로 2시간 만에 구현한 'Happy Wheels' 게임 클론

Claude 모델을 활용해 물리 엔진과 그래픽이 포함된 'Happy Wheels' 게임 클론을 단일 프롬프트로 2시간 만에 성공적으로 개발함.

r/ClaudeAI2달 전

Claude를 5분 만에 'Project Hail Mary'의 Rocky로 바꾸는 페르소나 프롬프트

Claude에게 특정 페르소나를 부여하여 말투와 사고방식을 제어하는 시스템 프롬프트 설계 사례.

r/ClaudeAI2달 전

Claude Opus의 한계를 넘은 Fable, 프론트엔드 디자인 시스템 구축의 새로운 대안인가?

Claude Opus로 프론트엔드 개발에 어려움을 겪던 사용자가 Fable을 통해 디자인 시스템과 웹 페이지 초안을 성공적으로 구축한 사례를 공유하며 커뮤니티의 의견을 구함.

LLM이 찾아낸 버그 리포트, 과연 신뢰할 수 있을까? Xdebug 유지보수자의 경험

LLM이 생성한 버그 리포트와 패치를 Xdebug 유지보수 과정에 적용해 본 결과, 리포트의 품질이 낮고 테스트 코드가 불완전하여 실질적인 시간 절감 효과는 미미했음.

검증 가능한 작업에서는 소형 모델도 대형 모델만큼 성능을 낼 수 있을까?

120개 작업을 대상으로 LLM의 검증 가능성에 따른 성능 격차를 실험한 결과, 코드와 구조화된 데이터 추출 같은 고검증성 작업에서는 소형 모델도 대형 모델에 근접한 성능을 보임.

r/LLMDevs2달 전

.NET에서 RAG와 에이전트 파이프라인을 한눈에, 외부 의존성 없는 관측성 도구

.NET 환경에서 RAG와 AI 에이전트의 실행 흐름, 비용, 토큰 사용량을 실시간으로 추적하는 인프로세스 관측성 대시보드 NuGet 패키지.

Google, 검색 데이터 AI 학습 활용 공식화... 설정에서 거부 가능

Google이 검색 서비스 이용 기록을 AI 학습에 활용하는 정책을 도입하며, 사용자가 이를 제어할 수 있는 'Search Services History' 설정을 신설했다.

r/artificial2달 전

Claude가 간단한 산수를 틀렸습니다: AI의 논리적 오류와 실무적 조언

사용자가 Claude에게 간단한 혈통 계산 문제를 제시하여 모델의 논리적 오류를 확인하고, AI의 한계와 검증의 중요성에 대해 논의했다.

r/LLMDevs2달 전

모델 카드만 믿지 마세요: Qwen 3.6 로컬 배포 시 겪은 ChatML 템플릿 이슈와 해결법

로컬 LLM 배포 시 모델 카드의 ChatML 호환성 표기를 맹신하지 말고 tokenizer_config.json을 직접 확인해야 하며, 로컬과 클라우드 API를 표준화하는 shim 구축이 필수적임.

에이전트의 페르소나를 투표로 결정하는 시뮬레이션 플랫폼 'The Relay' 공개

에이전트가 특정 페르소나로 게임을 수행하도록 투표하는 플랫폼 'The Relay'와 이를 통한 장기 작업 및 행동 패턴 관찰 시스템을 소개한다.

r/LLMDevs2달 전

벡터 DB 대신 Git을? 에이전트 메모리 관리의 새로운 패러다임

멀티 에이전트 시스템의 메모리와 규칙을 가변적인 벡터 DB 대신 Git 저장소로 관리하여 디버깅과 거버넌스를 개선하는 아키텍처 제안.

강화학습 없이 0.4초 만에 결정하는 확산 모델 기반 AI 에이전트

Meadow Mind는 확산 모델을 활용해 강화학습이나 보상 설계 없이 자연어 규칙만으로 실시간 의사결정을 수행하는 프레임워크이다.