본문으로 건너뛰기

2026년 3월 10일 AI 뉴스

41

관심 태그 추가

당신이 쓴 GPT-4가 가짜일 수도 있다? 섀도우 API의 충격적 실태

제3자 제공 비공식 API를 사용한 AI 연구들이 실제 모델과 최대 47%의 성능 차이를 보이며 학계의 재현성 위기와 시스템 신뢰도 하락을 초래하고 있다.

"LLM만으로는 한계" 얀 르쿤, 1조 원 투자 유치해 '세계 모델' 스타트업 AMI 시동

메타의 전 수석 AI 과학자 얀 르쿤이 10억 달러 이상의 투자를 유치하여 언어 중심 LLM의 한계를 극복하고 물리적 세계를 이해하는 '세계 모델' 개발 스타트업 AMI를 설립했다.

Gemini가 스스로 드러낸 시스템 프롬프트와 내부 사고 과정

Gemini Pro 사용 중 모델이 답변 대신 내부 시스템 지침과 구조화된 사고 과정을 출력한 뒤 스스로 삭제하는 현상이 발생하여 그 내용이 공개되었다.

내 문서에 가장 적합한 RAG 패턴은? 명령어 한 줄로 8가지 기법 벤치마킹

rag-playbook은 CLI 명령어를 통해 8가지 RAG 패턴의 품질, 지연 시간, 비용을 비교하고 최적의 전략을 추천해주는 파이썬 패키지이다.

RAG 문서 수집 고민 끝! 14개 소스를 한 번에 긁어오는 Knowledge Universe

14개의 다양한 지식 소스에서 데이터를 병렬로 수집하고 품질을 평가하여 LangChain 및 LlamaIndex 호환 형식으로 즉시 제공하는 오픈소스 도구이다.

구글 NotebookLM이 불안하다면? Rust로 만든 로컬 RAG 'Gloss' 등장

Rust로 구현된 Gloss는 HNSW와 BM25를 결합한 하이브리드 검색과 로컬 추론을 지원하여 프라이버시와 투명성을 극대화한 NotebookLM의 오픈소스 대안이다.

3년 전엔 이틀 걸리던 학습이 T4에서 45분 만에?

저사양 T4 GPU와 Unsloth 라이브러리를 활용하여 병합 모델을 45분 만에 특정 비즈니스 톤으로 파인튜닝한 효율적인 워크플로우 사례이다.

기존 오픈소스 중 가장 빠른 VAD? Rust 기반 fast-vad 공개

Rust로 작성되어 극도로 빠른 속도를 자랑하며 Python 바인딩과 스트리밍 API를 지원하는 오픈소스 음성 활동 감지기(VAD) 라이브러리이다.

안드레 카파시의 주말 프로젝트가 예고한 AI 자율 연구 시대

안드레 카파시의 오토리서치 프로젝트를 통해 AI 에이전트가 스스로 코드를 수정하고 실험하며 성능을 개선하는 자율적 연구 루프의 패러다임 변화를 다룬다.

LoRA 없이 베이스 모델 성능을 극대화하는 Z-Image 워크플로우

Z-Image Base 모델의 성능을 극대화하기 위해 LoRA를 배제하고 증류 기법과 단계 조절을 활용하는 최적화 워크플로우와 하드웨어 요구 사양을 공유한다.

노래만 넣으면 뮤직 비디오가 뚝딱? LXT 기반 자동 편집 앱 등장

노래의 보컬 구간을 분석하여 샷 리스트 생성부터 프롬프트 작성, 최종 영상 조립까지 자동화하는 LXT 기반 Gradio 앱의 초기 테스트 결과가 공유되었다.

Eye on AI5달 전

벤치마크의 종말? AI 성능 측정을 위해 다시 '진짜 사람'을 찾는 이유

AI 모델 평가가 기존 정적 벤치마크의 한계를 넘어 실제 인간의 피드백과 인구통계학적 다양성을 반영하는 실시간 평가 방식으로 진화하고 있음을 강조합니다.

MMLU 점수보다 중요한 내 작업에 딱 맞는 LLM 찾기

범용 벤치마크 대신 특정 작업에 대해 Judge LLM이 테스트 케이스를 생성하고 후보 모델들을 다각도로 평가하여 최적의 모델을 선정하는 오픈소스 프레임워크이다.

238개의 보안 공격 테스트를 단 60초 만에 끝내는 병렬 처리 기법

프롬프트 인젝션 보안 스캔의 순차적 API 호출 방식을 병렬 배치로 리팩터링하여 238개 테스트 시간을 3분에서 60초로 단축하고 결과를 JSON으로 표준화한 사례이다.

r/LLMDevs5달 전

프롬프트 형식 고민 끝? XML, JSON, MD 성능 차이 거의 없다

4개의 최신 모델을 대상으로 XML, Markdown, JSON 프롬프트 형식을 비교한 결과, 대부분의 모델에서 형식에 따른 성능 차이가 거의 없는 것으로 나타났다.

"모델은 죄가 없었다" 공장 현장 AI 도입을 가로막는 4가지 실전 장애물

실제 공장 현장에서 PCB 결함 탐지 시스템을 구축하며 조명, 데이터 일반화, 추론 속도, 하드웨어 발열 문제를 해결한 8주간의 엔지니어링 기록이다.

AI가 짠 코드 90% 시대, 버그와 보안 취약점은 누가 잡나?

앤스로픽이 AI 생성 코드의 급증으로 인한 보안 및 품질 저하 문제를 해결하기 위해 깃허브와 연동되는 멀티 에이전트 기반 자동 코드 리뷰 도구를 선보였습니다.

Qwen TTS로 되살린 알란 릭맨의 스네이프 목소리, 오디오북의 미래일까?

Qwen TTS 1.7B 모델을 활용해 오디오북의 특정 캐릭터 목소리를 고 알란 릭맨의 목소리로 클로닝하여 교체한 실험적 사례이다.

r/LangChain5달 전

이메일 한 통으로 내 AI 에이전트가 스파이가 된다면?

이메일을 처리하는 AI 에이전트가 외부 입력값을 신뢰할 때 발생하는 명령어 재정의, 데이터 유출, 토큰 밀수 등 3가지 주요 보안 취약점과 공격 사례를 분석했다.

W&B 실험 데이터를 AI 에이전트의 지식으로 변환하는 Luca

Weights & Biases 프로젝트와 과거 실험 데이터를 인덱싱하여 AI 에이전트가 새로운 가설을 생성하고 실험을 계획할 수 있도록 돕는 플랫폼 Luca가 공개됐다.

터미널 없이 브라우저에서 바로 쓰는 AI 에이전트 BrowserClaw

OpenClaw의 복잡한 설정을 제거하고 비전공자도 브라우저에서 쉽게 사용할 수 있도록 Gemini API와 Make를 활용해 개발한 오픈소스 노코드 툴 BrowserClaw이다.

OpenCV의 한계를 넘는 스플라인 기반 카메라 보정 도구 lensboy 공개

OpenCV의 다항식 모델로 해결하기 어려운 광각 및 저가형 렌즈의 왜곡을 스플라인 기반 모델과 Ceres Solver를 통해 정밀하게 보정하는 Python 라이브러리 lensboy가 공개됐다.

Claude Code로 만든 앱 설계 도구, 기획부터 코드 수출까지 한 번에

소프트웨어 제품의 스펙 정의와 UI 설계를 시각적으로 진행하고, 이를 Claude Code용 패키지나 Figma로 내보낼 수 있는 AI 기반 설계 도구 Mowgli를 소개한다.

GPU 메모리 한계를 넘는 순간을 포착하는 CUDA 진단 도구

CUDA Unified Memory를 사용하는 ML 파이프라인에서 성능 저하의 원인인 페이지 폴트와 메모리 스래싱 임계값을 진단하는 오픈소스 도구가 공개됐다.

120B 모델을 압도하는 0.6B 모델? 프로덕션 트레이스로 만드는 초경량 특화 AI

프로덕션 트레이스를 활용해 고성능 소형 특화 모델을 자동으로 학습하고 배포하는 오픈소스 MLOps 파이프라인을 제안한다.

에이전트 5개가 꼬였다면? YAML 기반 DAG 런타임 Binex로 해결

Binex는 YAML로 정의된 DAG 기반 AI 에이전트 워크플로를 실행하고, 실행 추적, 특정 단계 재실행, 실행 결과 비교 기능을 제공하는 디버깅 특화 런타임이다.

애플 M5 울트라, 512GB VRAM과 대역폭으로 로컬 LLM의 한계를 넘을까?

애플 M5 울트라의 향상된 메모리 대역폭이 대규모 언어 모델의 로컬 구동 환경에 미칠 영향과 하드웨어 성능 비교를 논의한다.

20만 건의 실제 리뷰로 학습한 Qwen2.5, 코드 리뷰 성능 4배 폭발

주요 오픈소스 프로젝트의 실제 코드 리뷰 20만 건을 학습시켜 Qwen2.5-Coder 모델의 리뷰 성능을 기존 대비 4배 향상시킨 데이터셋과 모델을 공개했다.

1000만 개 심볼을 50ns 만에 검색하는 RAG 전용 코드 엔진 FCE

C++ 기반 인메모리 구조와 Tree-sitter를 활용해 대규모 코드베이스의 심볼 관계를 초고속으로 탐색하는 RAG 엔진 FCE가 공개됐다.

100% 로컬 TTS로 구현한 나만의 오디오북 Obsidian 플러그인

Obsidian과 로컬 TTS 모델을 결합하여 외부 서버 없이 고품질 음성으로 책을 읽어주는 시스템을 구축하고 Apple M4 하드웨어에서의 구동 성능을 입증한 사례이다.

Qwen 3.5 긴 문맥 속도 저하 해결: vLLM 최적화 설정 공유

vLLM 0.17.0의 새로운 캐시 및 성능 모드 설정을 활용하여 Qwen 3.5 모델의 긴 문맥 처리 시 발생하는 프롬프트 재처리 지연 문제를 해결하는 방법을 공유한다.

320만 명 중 26만 명만 남았다, 카파시 강의의 혹독한 완강률

안드레 카파시의 딥러닝 강의 시리즈 조회수 급감을 통해 딥러닝 독학의 높은 진입장벽과 실무 역량 확보의 어려움을 논의한다.

0.6B 모델이 GPT-5를 이겼다? 특정 작업 최적화의 위력

특정 작업에 최적화된 소형 언어 모델(SLM)이 거대 모델 대비 100배 이상 저렴한 비용으로 동등하거나 더 높은 성능을 낼 수 있음을 벤치마크로 증명했다.

AI 에이전트의 컨텍스트 망각을 막는 마크다운 기반 칸반 보드

AI 에이전트와의 협업 과정에서 발생하는 컨텍스트 소실 문제를 해결하기 위해 마크다운 파일과 GitOps를 결합한 VS Code용 칸반 보드 확장 프로그램이다.

외부 API 없이 로컬에서 구현하는 AI 에이전트용 영구 메모리 Engram

외부 API나 별도의 벡터 DB 없이 SQLite와 로컬 임베딩을 활용해 AI 에이전트에게 장기 기억과 지식 그래프 기능을 제공하는 오픈소스 프로젝트 Engram이 공개됐다.

AI 에이전트 보안, 1ms 미만의 결정론적 필터로 해결했다

AI 에이전트의 프롬프트 인젝션과 탈옥을 방지하기 위해 ML 없이 정규표현식 기반의 결정론적 보안 라이브러리인 IntentShield와 Sovereign Shield를 개발했다.

토큰 70%를 버렸더니 속도는 2.3배, VRAM은 42% 절감

트랜스포머 모델에서 중요도가 낮은 토큰을 물리적으로 제거하여 연산 속도와 메모리 효율을 극대화하는 PTD 기법과 그 구현 성과를 공유한다.

Claude 3.5 Sonnet, 컨텍스트 부족하면 토큰 비용 2.4배 폭증한다

Claude 3.5 Sonnet을 활용한 MCP 벤치마크 결과, 구조화된 백엔드 컨텍스트 제공 여부가 에이전트의 정확도 향상과 토큰 비용 절감에 핵심적인 역할을 함이 확인됐다.

블루투스로 서로를 인식하고 암호화 통신하는 AI 에이전트

블루투스 저전력 기술을 활용해 주변 AI 에이전트를 탐색하고 공유 비밀 키로 암호화된 메시지를 안전하게 주고받는 근접 채팅 시스템 claw-agora가 공개됐다.

SSH 접속 없이 원격 서버에서 로컬 LLM 프롬프트를 명령어로 실행하기

로컬에 정의된 LLM 프롬프트를 원격 서버의 셸 명령어로 변환하여 실행할 수 있게 해주는 promptctl 도구의 기능과 활용법이다.

"내 컴퓨터에서 돌아갈까?" 고민 끝, 하드웨어 맞춤형 LLM 추천 도구 llmfit

사용자의 하드웨어 사양을 분석하여 최적의 로컬 LLM과 양자화 설정을 자동으로 추천해주는 오픈소스 도구 llmfit을 소개한다.