본문으로 건너뛰기

2026년 3월 5일 AI 뉴스

40

관심 태그 추가

쓸수록 똑똑해지는 Claude Code 전용 오류 탐지기 Immune

Claude Code CLI에서 생성 전후의 전략 주입과 오류 수정을 통해 답변 품질을 지속적으로 개선하는 오픈소스 도구 Immune을 소개합니다.

AI 에이전트끼리 속닥거리는 비밀 언어, 이제 실시간으로 감시하고 차단하세요

다중 에이전트 시스템에서 발생하는 에이전트 간의 은어 사용과 문맥 이탈을 실시간으로 감시하고 제어하는 오픈소스 도구 InsAIts V3를 소개합니다.

파이썬 없이 파워쉘만으로 강화학습 알고리즘을 밑바닥부터 구현하다

IT 전문가들의 접근성을 높이기 위해 파이썬이나 외부 의존성 없이 파워쉘 5.1만으로 DQN, PPO, A3C 등 주요 강화학습 알고리즘을 구현한 교육용 프레임워크 VBAF를 소개합니다.

20배 저렴한 가격으로 Claude Opus급 성능을? MiniMax M2.5의 충격적 가성비

MiniMax M2.5가 코딩 벤치마크에서 Claude Opus에 필적하는 성능을 20분의 1 가격으로 달성하며 모델 선택의 기준을 성능에서 생태계와 비용 효율성으로 변화시키고 있습니다.

더 선명해진 디테일과 세로형 지원, LTX-2.3 비디오 모델 공개

LTX가 VAE 재설계, 게이트 어텐션 도입, 네이티브 세로형 지원 및 오디오 정제를 통해 성능을 대폭 강화한 최신 비디오 생성 모델 LTX-2.3을 발표했습니다.

"내가 짠 코드인데 왜 모르지?" 바이브 코딩의 함정을 해결할 VibeCheck

AI 코딩 도구로 개발할 때 실제 변경 사항을 이해했는지 확인하기 위해 git diff를 기반으로 퀴즈를 내주는 CLI 도구 VibeCheck를 소개합니다.

r/LocalLLaMA5달 전

어텐션의 n^2 병목은 환상일 뿐? 한국발 d^2 풀백 정리 화제

한국의 한 익명 사용자가 어텐션의 최적화 기하학이 시퀀스 길이(n)가 아닌 임베딩 차원(d)의 제곱에 종속됨을 수학적으로 증명하고 새로운 아키텍처를 제안했습니다.

OpenAI와 구글을 압도하는 최강의 다국어 임베딩 모델 zembed-1

ZeroEntropy가 공개한 zembed-1은 Elo 점수 기반의 독특한 증류 기법을 적용하여 다국어 환경에서 OpenAI와 구글의 상용 모델을 능가하는 성능을 보여주는 오픈 웨이트 임베딩 모델입니다.

50원 벌려다 300원 떼이는 Stripe 수수료, 마이크로 결제 해결책은?

AI 에이전트의 도구 호출당 소액 결제 시 발생하는 Stripe의 높은 최소 수수료 문제를 NRail이라는 전용 결제 레일을 통해 해결한 실무 사례를 공유합니다.

채팅 UI 직접 만들지 마세요, 진행 바와 암호화까지 지원하는 Alice&Bot

LLM 봇 개발 시 번거로운 채팅 인터페이스 구축을 대신해주는 마크다운, 실시간 진행 바, 종단간 암호화 기능을 갖춘 오픈소스 UI 컴포넌트입니다.

로컬 LLM을 위한 최강의 UI, OllamaFX v0.5.0 정식 출시

OllamaFX v0.5.0은 RAG 지원, 파일 분석, 폴더 기반 채팅 관리 및 멀티모달 기능을 갖춘 Ollama 전용 오픈소스 데스크톱 인터페이스입니다.

내 메모가 영화처럼? 구글 NotebookLM의 놀라운 비디오 요약 진화

구글이 NotebookLM에 Gemini 3와 Veo 3를 활용하여 사용자 노트를 애니메이션 형태의 시네마틱 비디오로 요약해주는 기능을 도입했습니다.

고객 온보딩 4주에서 2일로 단축한 Ricoh의 AI 문서 처리 혁신

Ricoh는 AWS GenAI IDP Accelerator와 Amazon Bedrock을 결합하여 복잡한 의료 문서 처리 과정을 자동화하고 온보딩 시간을 90% 이상 단축했습니다.

구글이 공개한 AI 코딩 에이전트의 신뢰도를 39% 높이는 비결

에이전트 기반 프로그램 수리 시스템에서 기권과 검증이라는 두 가지 LLM 정책을 도입하여 개발자에게 전달되는 잘못된 패치 노이즈를 획기적으로 줄인 연구입니다.

GPU 메모리 부족 해결을 위한 새로운 오픈 소스 deep_variance 공개

딥러닝 모델 학습 중 발생하는 GPU 메모리 오버헤드를 줄여 더 큰 실험을 가능하게 하는 파이썬 SDK deep_variance가 오픈 소스로 공개되었습니다.

단 1단계로 고품질 이미지 생성 MIT의 Drifting Model 오픈 소스 공개

MIT와 하버드의 최신 논문인 Drifting Model을 PyTorch로 재구현하여 단 한 번의 연산으로 고품질 이미지를 생성하는 오픈 소스 라이브러리를 공개했습니다.

SAM3와 깊이 추정으로 도로 균열의 실제 면적까지 정확하게 측정하기

SAM3 세그멘테이션과 단안 깊이 추정 기술을 결합하여 도로 파손 부위의 길이와 면적을 정밀하게 계산하는 고도화된 분석 파이프라인을 소개합니다.

채팅 피드백으로 내 로컬 LLM을 실시간 학습시키는 CLaaS

텍스트 피드백과 자기 증류 정책 최적화를 활용해 로컬 언어 모델의 가중치를 실시간으로 업데이트하는 오픈소스 연구 프로토타입 CLaaS를 소개합니다.

1조 파라미터의 위엄, 기업용 RAG와 표 이해에 특화된 오픈소스 모델 등장

YuanLabAI가 MoE 아키텍처 기반의 1조 파라미터 멀티모달 모델 Yuan3.0-Ultra를 공개하며 기업용 RAG와 복잡한 문서 분석 성능을 강조했습니다.

인간의 개입 없이 스스로 코드를 수정하고 버그를 고치는 AI 에이전트의 탄생

200줄의 Rust 코드로 시작해 인간의 개입 없이 스스로 기능을 확장하고 테스트하며 진화하는 자율형 코딩 에이전트 프로젝트입니다.

LM Studio보다 2.5배 빠르다? llama.cpp의 압도적인 MoE 추론 성능

Qwen 3.5 35B MoE 모델 실행 시 LM Studio와 순수 llama.cpp 간에 발생하는 약 2.5배의 성능 격차 원인을 분석하고 최적화 방안을 논의합니다.

덜 오글거리게 바뀐 ChatGPT? 소비자 AI 전쟁의 새로운 국면

OpenAI와 Anthropic이 소비자 AI 시장 선점을 위해 모델의 성격과 사용자 경험을 개선하며 벌이는 치열한 경쟁과 업계의 주요 소식을 다룹니다.

비용은 낮추고 성능은 높이는 LLM 라우팅 전략

오픈소스 도구 Manifest를 활용하여 작업 복잡도에 따라 GLM 4.5 Flash부터 o3까지 최적의 모델을 배치해 비용 효율성을 극대화하는 방법을 제안합니다.

에이전트가 에이전트를 고용하는 시대, NEXUS 프로토콜 공개

LangGraph와 CrewAI 등 서로 다른 프레임워크의 에이전트들이 서로를 발견하고 협업하며 결제까지 수행할 수 있는 오픈소스 마켓플레이스 NEXUS가 출시되었습니다.

기존 추론보다 4배 빠르다? 병렬 하드웨어로 LLM 속도 한계 넘은 SSD 공개

SSD는 초안 작성과 검증을 서로 다른 하드웨어에서 병렬로 처리하여 LLM 추론 속도를 기존 대비 최대 4배까지 향상시키는 새로운 알고리즘입니다.

LLM이 직접 쓴 추천사? 99% 토큰 절감으로 AI 에이전트를 사로잡는 법

검색 엔진 searchcode.com이 인간이 아닌 LLM 에이전트를 주 고객으로 설정하고 극강의 토큰 효율성을 통해 Business-to-Agent(B2A) 시대를 개척하는 전략을 소개합니다.

AI 에이전트 메모리도 Git처럼? 데이터 삭제가 불가능한 새로운 오픈 표준 OMS

AI 에이전트 간의 메모리 공유와 검증을 위해 Git과 유사한 불변성 및 콘텐츠 주소 지정 방식을 도입한 오픈 메모리 명세(OMS)를 제안합니다.

단 한 번의 연산으로 이미지 생성? MIT의 Drifting Model 오픈 소스 구현 공개

MIT와 하버드 연구진이 발표한 1단계 이미지 생성 아키텍처인 Drifting Model을 한 개발자가 PyTorch로 완벽히 재구현하여 오픈 소스로 공개했습니다.

프롬프트 가드레일의 한계 돌파: 지식 그래프 기반의 에이전트 안전 장치 VRE

기존 언어 기반 안전 장치의 취약점을 해결하기 위해 지식 그래프를 활용하여 에이전트의 행동을 인식론적 깊이에 따라 제어하는 VRE 프레임워크를 제안합니다.

명령어 한 줄로 RAG API 배포 끝 RAGLight의 혁신적 업데이트

오픈소스 RAG 프레임워크인 RAGLight가 단일 명령어로 RAG 파이프라인을 REST API로 배포할 수 있는 기능을 출시했습니다.

AI 코딩은 왜 이렇게 길까? 인간보다 최대 65% 더 비대한 LLM 패치 분석

SWE-bench 데이터를 분석한 결과, 모든 주요 LLM이 인간보다 더 길고 복잡한 코드를 생성하며, 특히 불필요한 구현과 범위 확장(Scope Creep)이 주요 원인으로 밝혀졌습니다.

ComfyUI에서 3D 장면을 직접 구성한다? Yedp Action Director 9.20 출시

ComfyUI용 Yedp Action Director 노드가 9.20 버전으로 업데이트되면서 단순 포징 도구를 넘어 3D 환경 구축, 물리 시뮬레이션, 카메라 트래킹을 지원하는 종합 합성 도구로 발전했습니다.

Gradio API에서 가짜 미디어 파일에 속지 않는 법

Gradio API가 실제 미디어 파일 대신 HLS 스트림을 반환하는 문제를 해결하기 위해 재귀적 추출과 내용 검증을 포함한 안정적인 파이프라인 구축 방법을 제시합니다.

AI 에이전트가 서로 웹 사용법을 가르친다? MoltBrowser MCP 공개

AI 에이전트가 웹 사이트 조작법을 학습하고 이를 공유 허브에 저장하여 다른 에이전트가 재사용할 수 있게 돕는 MCP 서버 프로젝트입니다.

Gradio API가 준 파일이 왜 안 열릴까? 175바이트짜리 가짜 파일의 정체와 해결법

Gradio API 사용 시 발생하는 HLS 스트림 반환 문제와 중첩된 메타데이터 구조를 해결하고 Python 3.13 호환성을 유지하며 안정적인 미디어 파이프라인을 구축하는 실전 가이드를 제시합니다.

로컬 LLM 에이전트 스웜 구축 시 반드시 마주하게 될 4가지 기술적 한계와 해결책

로컬 환경에서 멀티 에이전트 코딩 시스템을 구축하며 겪은 메모리 병목, 테스트 설계 오류, 인간 개입의 필요성 및 검증 프로토콜에 대한 실전 경험 공유입니다.

GPU 사용률만 믿다가 OOM? vLLM 오토스케일링의 새로운 기준

vLLM 기반 LLM 추론 환경에서 GPU 사용률 대신 대기열 깊이(Queue Depth)를 오토스케일링 지표로 활용하여 안정성을 높이는 방안을 논의합니다.

설치 없이 브라우저에서 바로 실행하는 ONNX 이미지 업스케일러

ONNX Runtime Web을 활용하여 별도의 설치 없이 브라우저에서 직접 이미지를 업스케일링하고 PyTorch 모델을 ONNX로 변환할 수 있는 도구를 소개합니다.

MCP 서버를 HTTP로 즉시 변환하는 오픈소스 배포 도구 등장

표준 입출력(stdio) 방식의 MCP 서버를 n8n이나 Dify 같은 플랫폼에서 사용할 수 있도록 HTTP/SSE 엔드포인트로 자동 배포해주는 오픈소스 도구 DeployStack을 소개합니다.