본문으로 건너뛰기

2026년 4월 3일 AI 뉴스

100

관심 태그 추가
r/LLMDevs4달 전

Claude Code의 제약을 없앤 오픈소스 크롬 확장 프로그램 재구축기

Claude Code의 브라우저 확장 프로그램을 역공학하여 MCP 기반의 무제한 실행 환경을 구축하고 주요 기술적 난제 해결법을 공유한 프로젝트이다.

r/LLMDevs4달 전

대규모 코드베이스를 LLM에 정확하게 전달하는 법: LogicStamp Context 공개

TypeScript AST를 분석하여 AI 에이전트가 이해하기 쉬운 결정론적 구조화 데이터를 생성하는 CLI 도구이다.

머신러닝과 게임 이론을 잇는 강력한 도구, '적대적 후회'의 재발견

적대적 후회(Adversarial Regret) 개념을 활용해 온라인 학습, 확률적 최적화, 반복 게임의 수렴성을 증명하는 핵심 기법을 기술한다.

AI 비디오에서 끊김 없는 롱테이크 구현하기: Synesthesia의 프레임 연결 기술

AI 비디오 제작 도구 Synesthesia에서 이전 샷의 마지막 프레임을 다음 샷의 시작으로 전달하여 자연스러운 롱테이크를 구현하는 방법과 기술적 해결책을 공유함.

이해와 생성의 결합, 정밀한 이미지 편집을 실현한 JoyAI-Image 오픈소스 공개

8B MLLM과 16B MMDiT를 결합해 이미지 이해와 정밀 편집을 통합한 JoyAI-Image 모델이 논문 및 코드와 함께 공개됐다.

300ms 내 유해 콘텐츠 차단, Moonbounce가 제시하는 AI 안전의 미래

Moonbounce는 Policy as Code 접근법과 자체 LLM을 활용해 300ms 이내에 실시간으로 AI 및 사용자 콘텐츠를 중재하는 솔루션을 제공한다.

Gemma4 26BA4B, 다국어 도구 호출 성공률 100% 달성

Gemma4 26BA4B 모델이 다국어 환경의 도구 호출 테스트에서 100% 성공률을 기록하며 로컬 LLM 기반 음성 비서의 실용성을 입증했다.

8k 컨텍스트의 한계 돌파: 100턴 이상의 코딩을 가능하게 하는 OpenCode LCM

OpenCode용 LCM 플러그인은 대화 이력을 SQLite에 저장하고 추출적 요약으로 대체하여 로컬 LLM의 컨텍스트 효율을 극대화한다.

"LLM은 계산기가 아니다" 수학 오답 줄이는 파이썬 스타일 프롬프트

LLM에게 계산 전 변수와 연산 순서를 정의하게 하여 수학적 정확도를 높이는 프롬프트 엔지니어링 기법이다.

r/vibecoding4달 전

Claude와 GitHub Actions로 구현한 실적 발표 자동 팟캐스트 생성기

실적 발표 대본을 5개 국어 팟캐스트로 변환하고 자동 배포하는 AI 기반 파이프라인 구축 사례입니다.

AI 에이전트에게 매번 설명하기 지치셨나요? 나만의 '컨텍스트 포트폴리오' 구축법

AI 에이전트가 사용자의 역할, 프로젝트, 선호도를 즉시 파악하여 맞춤형 협업을 수행할 수 있도록 돕는 10가지 Markdown 기반 '개인 컨텍스트 포트폴리오' 구축 방법론을 제시합니다.

36분 학습으로 F1 0.9975? Mamba-3 기반 로그 이상 탐지의 혁신적 성능

Mamba-3(SSM) 아키텍처와 템플릿 기반 토큰화를 결합하여 HDFS 로그 데이터셋에서 기존 모델을 능가하는 성능과 효율성을 입증했다.

Gemini로 되살린 7년 전 프로젝트: 초당 1,800개 요청 처리하는 S3 호환 저장소

AI(Gemini)를 활용해 방치된 Django 기반 S3 호환 저장소 프로젝트를 복구하고 성능을 최적화하여 초당 1,800개 객체 처리 성능을 달성했다.

텍스트만으론 부족해 Claude Code로 고퀄리티 비디오 만드는 비결

Claude Code로 Remotion 비디오 제작 시, 참조 코드를 제공하면 단순 텍스트 프롬프트보다 훨씬 정교한 3D 애니메이션과 비트 동기화가 가능하다.

눈 없는 Claude Code에게 시각을? Tauri 앱 UI를 직접 다루는 tauri-pilot

Tauri v2 앱의 접근성 트리와 로그를 분석하여 Claude Code가 GUI를 직접 인식하고 조작할 수 있게 돕는 CLI 도구 tauri-pilot이 공개됐다.

AI가 44초 만에 탐지한 LiteLLM 공격과 Axios를 통한 RAT 유포 주의보

SentinelOne이 LiteLLM을 겨냥한 AI 기반 공급망 공격을 실시간 차단했으며, Axios 패키지 변조 및 Chrome 제로데이 취약점에 대한 즉각적인 대응을 권고했다.

OpenAI의 1,220억 달러 펀딩과 주간 사용자 9억 명 달성 비결

OpenAI의 대규모 펀딩 및 사용자 지표와 Apple 50주년 기념 역대 최고 제품 랭킹을 다룹니다.

KDNugget4달 전

내 컴퓨터에 AI 에이전트 인프라 구축하기: 필수 Docker 컨테이너 5가지

AI 에이전트 개발 시 비용 절감과 데이터 프라이버시를 위해 로컬 환경에 구축해야 할 5가지 핵심 Docker 컨테이너와 활용법을 정리했다.

r/artificial4달 전

"유튜브 100개 영상을 지식 베이스로" 카파시도 주목한 LLM 활용법

YouTube 트랜스크립트와 커뮤니티 반응을 결합해 10개의 병렬 분석기로 구조화된 지식 베이스를 구축하는 자동화 파이프라인 사례다.

배경이 녹아내리는 AI 영상은 끝? PixVerse V5.6의 놀라운 기하학적 안정성

PixVerse V5.6과 Runway Gen-4를 비교하여 드론 촬영 스타일의 영상 생성 시 기하학적 안정성과 텍스처 고정 성능을 분석했다.

r/ChatGPT4달 전

"말만 하면 끝" ChatGPT가 직접 코드를 짜서 실행하는 자동화 앱

자연어 명령을 실제 실행 가능한 스크립트와 크론잡으로 변환하여 자동화를 수행하는 앱을 개발했다.

The Verge AI4달 전

"의사 대신 챗봇이 처방전을?" 유타주 AI 정신과 약물 리필 서비스 논란

유타주가 Legion Health와 협력하여 저위험 정신과 약물의 처방전을 자동으로 갱신해주는 AI 챗봇 시범 사업을 시작하며 의료계의 찬반 논란이 일고 있다.

r/ClaudeCode4달 전

"브라우저로 새지 마세요" Claude Code 전용 웹 검색 도구 '/s'

Claude Code의 스킬 디렉토리에 추가하여 CLI 내에서 다각도 웹 검색과 맞춤형 요약을 즉시 수행하는 오픈소스 도구입니다.

"모델이 좋아도 이미지가 나쁘면 꽝" 엣지 AI 성능을 살리는 ISP 튜닝 비결

엣지 AI 배포 시 발생하는 이미지 품질 저하 문제를 해결하기 위해 ISP 튜닝과 실제 환경 검증의 필수성을 확인하고 관련 경험을 공유함.

26 TOPS 성능의 Hailo-8 탑재! 산업용 엣지 AI 모듈 Falcon S1 공개

Falcon S1은 NXP i.MX8M Plus와 Hailo-8 가속기를 결합하여 산업 현장에 최적화된 26 TOPS급 고성능 엣지 AI 추론을 제공한다.

DDPM을 가장 짧은 코드로 구현한다면? 'minidiff' 프로젝트 공개

Ho et al.의 DDPM 논문을 최소한의 코드로 구현한 오픈소스 프로젝트 'minidiff'가 공개되어 코드 경량화 협업을 제안했다.

r/LLMDevs4달 전

AI가 쓴 보고서, 믿을 수 있을까? 연구 보고서 자동 생성 도구 개발기

단일 주제 입력으로 차트와 인용구가 포함된 연구 보고서를 생성하는 도구를 개발하고, 생성된 결과물의 신뢰성과 한계를 분석했다.

Gemma 4 26B를 16.5GB로 압축: NVFP4 양자화와 vLLM 최적화 가이드

Gemma 4 26B MoE 모델을 NVFP4 양자화로 16.5GB까지 압축하고 vLLM으로 최적화하여 서빙하는 구체적인 방법과 패치를 공유함.

r/LocalLLaMA4달 전

AI가 스스로 코드를 짜고 은퇴한다? 비용과 안정성을 다 잡은 자동화 프레임워크

AI가 반복 업무를 감지해 자동화 스크립트를 작성하고 검증 후 스스로 물러나는 'AI-to-Deterministic' 전환 프레임워크이다.

GPT-5.2도 꺾었다? 뉴스 데이터로 인과관계를 학습한 예측 특화 AI의 등장

Foresight V3는 타임스탬프 기반 자동 라벨링과 실제 결과 보상 강화학습을 통해 Prophet Arena 벤치마크에서 모든 상용 모델을 제치고 1위를 기록했다.

에이전트가 멍청해서 실패하는 게 아니다: 컴퓨터 사용 AI의 핵심 인사이트

온디바이스 컴퓨터 사용 에이전트 실험 결과, 모델 성능보다 화면 상태 인식과 단계별 실행 검증 루프가 신뢰성에 더 결정적임이 확인됐다.

스크린샷 대신 데이터로 대화하는 AI 에이전트용 프로토콜 SLOP 공개

앱의 내부 상태를 구조화된 트리로 AI에게 전달하고 JSON Patch로 효율적인 업데이트를 지원하는 오픈소스 프로토콜 SLOP이 발표되었다.

Gemma 4가 내 폰으로? 온디바이스 AI 시대, 모델 보안은 안전한가

Google의 Gemma 4 출시로 온디바이스 AI가 확산됨에 따라, 로컬 기기에 배포된 모델에 대한 적대적 가중치 공격 및 지식 재산권(IP) 보호의 시급성을 다룬 연구 결과가 공유됐다.

RTX 5090의 위력: 256K 컨텍스트를 단일 GPU에서 돌리는 법

TurboQuant KV 캐시 압축 기술을 적용하여 단일 RTX 5090(32GB)에서 Gemma 4 31B 모델의 256K 컨텍스트 추론 및 벤치마크를 완료했다.

로컬 LLM으로 Claude Code 스타일의 CLI를? Claw Code 로컬 버전 공개

Anthropic API에 종속된 기존 도구를 포크하여 Ollama, LM Studio 등 다양한 로컬 및 외부 LLM 제공자를 자동 감지하고 지원하도록 개선한 프로젝트이다.

L4 GPU에서 동시 통화 20개 돌파, 실시간 음성 AI 병목 해결 성공기

NVIDIA L4 GPU 환경에서 whisper-large-v3와 최적화된 서버를 활용해 TTS 병목을 해결하고 20개 이상의 동시 통화를 처리한 실무 사례이다.

"AI를 없애기 위해 AI로 코딩했다" — 900명이 검증 중인 혁신적 자동화 앱

Claude를 이용해 사용자의 요청을 일회성 JavaScript 스크립트로 변환하고 크론으로 실행하여 AI 의존도를 낮추는 자동화 앱 개발 사례이다.

"깔끔하게"는 이제 그만! AI로 프로급 UI를 뽑아내는 6가지 실전 전략

AI 디자인의 시각적 반복성을 극복하기 위해 실제 UI 클로닝, 구조-스타일 분리, 시각적 참조 및 명시적 제약을 활용하는 가이드이다.

내 API 키로 더 안전하게, 로컬 모델까지 지원하는 코딩 도구 Hum

프라이버시 보호와 모델 선택의 자유를 극대화한 브라우저 기반 코딩 어시스턴트 Hum이 공개됐다.

"3일 만에 한 달 트래픽 돌파" 자율형 AI 에이전트 Jork의 마케팅 실험

오픈소스 자율형 AI 에이전트 Jork를 활용해 콘텐츠와 타이밍을 최적화함으로써 3일 만에 한 달 치 웹 트래픽을 달성하고 사용자 유지율을 개선한 사례이다.

"코딩 몰라도 가능했다" 40대 엄마가 Claude Code로 만든 나만의 팟캐스트 앱

비개발자 사용자가 Claude Code를 활용해 4개의 전문 AI 에이전트(CTO, 보안, 프론트엔드, 백엔드)를 오케스트레이션하여 YouTube 영상을 오디오로 변환하는 개인용 도구를 개발한 사례이다.

반중력 장치가 아니라 IDE였다? Google의 비밀 프로젝트 Antigravity IDE와 6배 압축 기술 TurboQuant

AI 메모리를 6배 절감하는 TurboQuant 기술과 Google의 에이전트 기반 코딩 환경인 Antigravity IDE의 개념 및 현재 개발 상태를 정리했다.

프로젝트 폴더에 파일 하나만 두면 끝? Claude Code 전용 도구 OpenRune

Claude Code를 프로젝트별로 독립적인 에이전트로 실행하고 관리할 수 있는 Electron 기반 도구 OpenRune이 공개되었습니다.

지도가 지원 안 한다고? Claude로 직접 만든 커스텀 지도 오버레이 확장 프로그램

사용자가 Claude Sonnet을 활용하여 Ordnance Survey 지도에 Squadrats 격자 데이터를 시각화하는 브라우저 확장 프로그램을 성공적으로 개발한 사례이다.

Claude Code 토큰 250억 개 사용자의 조언: AI 코딩은 결국 '실력 차이'다

250억 토큰을 사용한 Sigrid Jin은 AI 코딩의 품질이 도구보다 사용자의 숙련도에 달렸음을 확인했다.

단순 나열은 그만, 고객 리뷰로 AI 카피라이팅 품질 높이는 법

페르소나 설정과 고객 리뷰 분석을 결합한 구체적인 프롬프트 설계가 이커머스 제품 설명의 품질과 효율을 결정한다.

r/LLMDevs4달 전

도구 사용 에이전트의 보안 위협, 8단계 보안 레이어로 해결하는 Agent Armor

AI 에이전트의 외부 도구 호출 및 함수 실행 시 보안을 강화하기 위한 8단계 보안 레이어 오픈소스 프로젝트 Agent Armor가 공개되었습니다.

r/LocalLLaMA4달 전

"프롬프트 복사는 이식성이 아니다" 로컬 에이전트 이동을 위한 4단계 계층 구조

로컬 LLM 에이전트의 이식성을 높이기 위해 정책, 실행 상태, 연속성, 영구 메모리를 분리하는 4계층 상태 아키텍처 설계 방안이 핵심이다.

월 1만 원대 VPS로 구축하는 나만의 비즈니스 AI 자동화 서버

Ollama, n8n, Open WebUI를 결합하여 저비용 VPS에서 운영 가능한 로컬 LLM 자동화 스택을 공유함.

r/LocalLLaMA4달 전

최신 모델이 더 나쁘다? Gemma 4의 실망스러운 OCR 성능 비교

Gemma 4 4B 모델이 이전 세대인 Gemma 3 및 Qwen 3 4B에 비해 OCR 정확도와 텍스트 추출 능력이 크게 떨어진다는 테스트 결과가 공유되었다.

RTX 4090에서 초당 145토큰? Gemma 4 로컬 구축 및 활용 팁

RTX 4090에서 Gemma 4 26B 모델을 구동하여 145 t/s의 속도와 MCP 기반 웹 검색을 구현한 로컬 챗 환경 구축 사례이다.

API 비용 없이 로컬에서 RAG 환각 잡는 법: LongTracer 공개

LongTracer는 외부 API 없이 로컬 NLI 모델을 사용하여 RAG 시스템의 응답 내 개별 주장의 사실 여부를 검증하는 오픈소스 도구이다.

2.3B 모델로 멀티 에이전트가 가능할까? Gemma 4 E2B 실험 결과

Gemma 4 E2B 모델이 멀티 에이전트 시스템에서 태스크 분할, 도구 호출, 결과 합성을 성공적으로 수행함을 확인했다.

"M5 맥북 에어에서 300 t/s?" Gemma-4 로컬 코딩 에이전트 실사용기

M5 MacBook Air가 새로운 matmul 코어 덕분에 Gemma-4-26B 모델에서 압도적인 프롬프트 처리 속도와 전성비를 보여주며 로컬 에이전트 코딩의 실용성을 증명했다.

"단일 GPU로 프론티어급 성능" Gemma 4 31B의 압도적 효율성

Gemma 4 31B가 Qwen 3.5 27B급 성능을 내면서도 토큰 사용량은 20% 절감하며 단일 H100에서 구동됨을 확인했다.

반복되는 패턴은 이제 그만, AI의 한계를 깨는 '단 하나의 대화'를 찾는 법

유사도 기반 클러스터링이 놓치는 희귀하지만 가치 있는 '싱글톤' 대화를 탐지하기 위해 상호보완성 확장 프레임워크를 제안한다.

프롬프트 수정해도 대화가 사라지지 않는다 ChatGPT용 그래프 UI 확장 프로그램

ChatGPT에서 프롬프트 수정으로 발생하는 대화의 갈래를 그래프로 시각화하여 복잡한 맥락을 효율적으로 관리하게 돕는 무료 확장 프로그램이다.

Anthropic API 비용 73% 절감! 복잡도 기반 라우팅 도구 RelayPlane 공개

프롬프트 복잡도에 따라 Claude 모델을 자동 라우팅하여 비용을 73.4% 절감하고 지연 시간을 절반으로 줄이는 오픈소스 프록시 RelayPlane이 공개됐다.

AI 이미지 생성 30분에서 2분으로, 브랜드 일관성 잡는 템플릿 전략

노드 기반 템플릿 도구 Cascady를 활용해 AI 이미지 생성 시간을 90% 단축하고 브랜드 일관성을 확보한 실무 사례이다.

Claude의 기억력 한계 테스트: 25단계 코딩 세션에서 아키텍처 규칙을 끝까지 지킨 모델은?

Claude 앱과 Calmkeep 기반 API의 장기 코딩 세션 무결성을 비교한 결과, API 환경이 85%의 높은 규칙 준수율을 보이며 컨텍스트 붕괴에 더 강한 것으로 나타났다.

LLM으로 게임 속 물체를 직접 만든다? Three.js 기반 AI 샌드박스

Vanilla.js와 Three.js를 사용하여 LLM 출력값으로 게임 내 오브젝트를 생성하고 멀티플레이를 지원하는 샌드박스 엔진 프로젝트이다.

r/vibecoding4달 전

스크립트로 제어하는 Claude Code? 토큰 아끼는 AI 코딩 워크플로우 gitbot

GitHub 이슈로 스토리를 생성하고 스크립트 기반 Claude Code 실행으로 토큰을 절약하며 정밀한 코드 리뷰를 지원하는 gitbot을 소개한다.

AI 에이전트에게도 게임처럼 '세이브 파일'이 필요할까? 상태 관리의 새로운 해법

AI 에이전트의 실행 상태를 단순 대화 기록이 아닌 구조화된 SQLite 데이터베이스로 관리하여 세션 연속성과 장치 간 이동성을 확보하는 아키텍처를 제안한다.

ChatGPT 개발자가 원자 세계로 간 이유: Periodic Labs의 물리적 AI 혁명

OpenAI 출신 Liam Fedus가 설립한 Periodic Labs가 LLM 스케일링 법칙을 물리적 원자 세계에 적용하여 신소재 개발과 실험 자동화를 혁신하는 방법을 다룹니다.

SpaceX가 우주에 GPU를 띄우려는 이유와 우리가 AI에 생각을 맡기면 안 되는 이유

SpaceX의 우주 데이터 센터 구상과 Bluesky의 AI 봇 반발 사례를 통해 AI 인프라의 물리적 한계와 인간-AI 협업에서의 인지적 주도권 문제를 심층 분석한다.

파일 관리부터 브라우저 제어까지, 로컬 AI 에이전트의 무한한 가능성

Qwen 모델과 Playwright, Whisper 등을 결합하여 파일 시스템, 터미널, 브라우저를 제어하는 로컬 에이전트 프레임워크 GUA_Blazor가 공개됐다.

"여러 저장소 코드 분석도 한 번에" Graph RAG 기반 오픈소스 atcode

Graph RAG 기반으로 여러 저장소의 코드를 분석하고 고품질 문서를 생성하는 오픈소스 프로젝트 atcode가 공개됐다.

벡터 검색만으로는 부족하다 73% 성능의 새로운 에이전트 메모리 Vektori 공개

Vektori는 기존 지식 그래프의 정보 손실을 해결하기 위해 3계층 문장 그래프와 그래프 탐색 기반 검색을 도입한 에이전트 메모리 시스템이다.

로컬 AI 에이전트가 20분 뒤에 멍청해지는 이유와 3계층 메모리 해결책

로컬 AI 에이전트의 메모리를 세션, 운영 런타임, 영구 저장소의 3개 계층으로 분리하여 관리함으로써 장기적 문맥 유지와 시스템 가독성을 개선한다.

한 번 설정한 AI 에이전트, 다른 기기에서도 그대로 쓸 수 있을까? Holaboss 공개

Holaboss는 AI 에이전트의 설정, 도구, 메모리, 런타임을 하나의 아티팩트로 관리하여 로컬 환경 간 이식성을 높이는 오픈소스 프로젝트이다.

VRAM 부족 해결! llama.cpp에서 SWA 캐시 3배 줄이는 마법의 옵션

llama.cpp에서 `-np 1` 옵션을 사용하여 SWA(Sliding Window Attention) 모델의 KV 캐시 VRAM 점유율을 최대 3배까지 절감하는 방법.

모델 붕괴 방지! zlib 압축률로 고품질 합성 데이터를 생성하는 Skillware

Skillware 라이브러리에 zlib 압축률 기반 엔트로피 스코어링을 활용하여 데이터 다양성을 확보하고 모델 붕괴를 방지하는 합성 데이터 생성 기능이 추가되었습니다.

수천 장의 생성 이미지 선별 노가다 끝, CLIP 임베딩으로 55% 자동 폐기하기

Stable Diffusion으로 생성한 컬러링 페이지 중 품질이 낮은 이미지를 CLIP 임베딩과 로지스틱 회귀를 이용해 55% 자동 제거하는 시스템 구축 사례이다.

50만 건의 뉴스 데이터를 내 컴퓨터에서? Gemma로 구축한 로컬 RAG

Gemma 모델을 사용하여 50만 건의 스위스 텔레텍스트 뉴스 데이터를 처리하는 완전 로컬 RAG 시스템을 구축하고 성능을 확인했다.

단돈 1달러로 시작한 AI 챗봇 서비스, 2개월 만에 첫 유료 결제 달성

Claude와 Firebase/Supabase를 활용해 구축한 저비용 챗봇 워크플로우 도구의 개발 및 유료화 성공 사례

Cursor $200 플랜보다 낫다? GitHub Copilot CLI의 압도적 가성비

Cursor와 Claude Code의 높은 비용 문제를 해결하기 위해 GitHub Copilot Pro+ CLI의 요청 기반 과금 체계로 전환한 후기이다.

서버 업로드 없이 내 맥에서 바로! AI로 논문을 LaTeX로 변환하는 GhostTeX

Apple Silicon의 MLX 프레임워크를 활용해 과학 문서를 로컬에서 LaTeX로 변환하는 Mac 전용 앱 GhostTeX가 공개되었습니다.

"60일 이상 생존한 광고만 골라낸다" Claude Code 기반 Meta 광고 자동화 도구 공개

Claude Code를 활용해 경쟁사 광고를 분석하고 성과가 검증된 소재를 기반으로 광고 스크립트를 자동 생성하는 오픈소스 도구입니다.

에이전트가 동시에 일한다? Kilo Code의 역대급 VS Code 업데이트와 무료 사용법

Kilo Code가 VS Code 확장 프로그램을 완전히 재구축하여 병렬 에이전트 실행과 워크트리 격리 기능을 도입하고, 다양한 무료 모델 연동 경로를 제공한다.

Whisper.cpp와 Wav2Vec2로 구현한 초정밀 자막 정렬 및 렌더링 시스템

Whisper.cpp와 Wav2Vec2를 결합하여 10-20ms 수준의 정밀한 단어 정렬과 투명 배경 렌더링을 지원하는 로컬 전사 도구 개발기이다.

머지되지 않은 PR까지 한 번에! ComfyUI 패치 관리를 자동화하는 ComfyUI-Patcher

ComfyUI 코어, 프런트엔드 및 커스텀 노드의 PR과 패치를 체계적으로 관리하고 스택형 오버레이를 지원하는 Tauri 기반 데스크톱 앱이다.

RTX 4090이 A100보다 빠르다? Llama 3 파인튜닝 하드웨어 실험 결과

RTX 4090과 A100 GPU를 사용해 Llama 3를 파인튜닝한 결과, 4090이 학습 속도는 1.7배 빠르지만 A100은 대용량 VRAM을 통한 배치 사이즈 확보에 유리했다.

"Gemma 2가 Qwen보다 훨씬 낫다" M1 Ultra 기반 로컬 LLM 성능 테스트 결과

Mac Studio M1 Ultra에서 Gemma 2 27B와 Qwen 2.5 32B의 추론 속도 및 응답 품질을 비교한 결과, Gemma가 더 우수한 추론 능력을 보였으나 높은 KV 캐시 점유율이 단점으로 지적됐다.

r/LocalLLaMA4달 전

"모델 성능이 안 나오는 진짜 이유는 데이터 때문입니다" 현장에서 검증된 데이터 감사 체크리스트

AI 프로젝트 실패의 핵심 원인인 데이터 품질 문제(라벨 불일치, 분포 변화, 클래스 불균형, 프록시 오염)를 진단하고 해결하기 위한 체계적인 데이터 감사 프로세스를 제시한다.

Python과 JS를 동시에 지원하는 RAG 프레임워크 VectraSDK 1.0 정식 출시

Python과 JavaScript를 모두 지원하며 가드레일과 구조화된 출력을 갖춘 RAG 프레임워크 VectraSDK가 1.0 정식 버전을 출시했다.

환경 보호가 우선, 세미놀 네이션 AI 데이터 센터 건설 전면 중단 선언

오클라호마 세미놀 네이션이 환경 파괴와 자원 고갈을 이유로 부족 영토 내 하이퍼스케일 데이터 센터 및 생성형 AI 개발에 대한 모라토리엄을 선포했다.

거절하더니 결국 생성? ChatGPT '생각하기'가 가드레일을 넘는 법

ChatGPT의 안전 가드레일이 거부한 이미지 생성이 추론 과정을 거쳐 최종적으로 출력되는 현상이 발견되었다.

r/ClaudeAI4달 전

Claude Cowork로 단숨에 빌드한 AI 해고 추적기: 실전 활용 사례

Claude Cowork를 사용하여 AI 관련 기업 해고 현황을 추적하고 필터링할 수 있는 실시간 대화형 웹 대시보드를 구축한 기술적 사례이다.

내 컴퓨터에서 안전하게 실행하는 Claude 에이전트 관리 도구, Stagent

Claude 에이전트의 실행 감독, 비용 관리, 워크플로 오케스트레이션을 지원하는 로컬 우선 오픈소스 도구 Stagent를 소개한다.

r/ClaudeAI4달 전

양자 역학을 API로: Claude가 직접 양자 회로를 실행하고 결과를 분석합니다

양자 컴퓨팅 SDK인 Quanta SDK를 위한 MCP 서버를 구축하여 AI 에이전트가 양자 회로를 직접 실행하고 해석할 수 있는 환경을 구현했다.

에이전트가 중간에 멈췄나요? AgentLens로 특정 단계만 수정하고 다시 실행하세요

AgentLens는 LangChain 및 LangGraph 에이전트의 실행 과정을 추적하고, 특정 단계의 출력을 수정하여 이후 과정을 재시뮬레이션할 수 있는 오픈소스 로컬 디버깅 도구이다.

어제 한 일을 기억 못 하는 Claude Code? 4계층 메모리로 해결

Claude Code의 컨텍스트 망각 문제를 해결하기 위해 '압축 경계'와 '지속성 핸드오프' 기술을 활용한 4계층 메모리 아키텍처 오픈소스를 공유했다.

구독 수익이 왜 낮지? Claude Code로 코드 속 버그 찾고 자동 수정까지

Claude Code 플러그인 Voltaire를 개발하여 앱의 수익 누수 지점을 파악하고 AI 에이전트로 코드를 자동 수정한 사례이다.

82번의 빌드 끝에 탄생한 Claude 기반 항공 분석 앱 개발 비화

Claude와 Cloudflare 스택을 활용해 복잡한 항공 데이터 분석 앱을 구축하고, 채팅 UI 대신 시각적 지표와 온디바이스 AI 요약을 채택하여 비용과 성능을 최적화한 사례이다.

r/vibecoding4달 전

프롬프트보다 중요한 것: AI 개발에서 '제품 규칙'이 성패를 가르는 이유

AI 코딩 도구 활용 시 가장 중요한 역량은 프롬프팅 기술이 아니라, 제품의 비즈니스 로직과 제약 조건을 명확히 정의하는 '제품 명확성'이다.

2시간 영상 자막을 단 몇 분 만에? AI 기반 초고속 번역 도구 등장

Whisper보다 빠르고 일관성 있는 번역을 제공하는 AI 기반 로컬 영상 자막 제작 및 번역 도구이다.

EU261·GDPR로 AI 상담원을 이겨라 법률 지식 기반 AI 게임 출시

실제 법률 지식을 활용해 적대적인 AI 고객 서비스 봇의 보상 거부를 무너뜨리는 시뮬레이션 게임 fixai.dev가 공개됐다.

Mistral과 Cohere의 최신 오디오 모델을 Hugging Face 인프라로 확장하는 방법

Mistral의 Voxtral 4B TTS와 Cohere Transcribe STT 모델을 Hugging Face의 Storage Buckets, HF Mount, HF Jobs를 통해 대규모로 운영하는 방법을 다룹니다.

내 DNA 정보를 로컬 LLM으로 안전하게 분석하는 멀티 에이전트 시스템

Ollama와 Llama 3.1을 활용해 12개의 유전체 데이터베이스를 로컬에서 검색하고 DNA 파일을 분석하는 멀티 에이전트 시스템이다.