본문으로 건너뛰기

2026년 3월 18일 AI 뉴스

100

관심 태그 추가

GPU 캐시 낭비 끝! LLM 추론 속도 85% 높이는 Ranvier 공개

Ranvier는 토큰 접두사를 분석하여 KV 캐시가 존재하는 GPU로 요청을 라우팅함으로써 LLM 추론의 지연 시간을 최대 85% 단축하는 오픈소스 로드 밸런서이다.

H100 대여 얼마일까? 터미널에서 바로 확인하는 LLM/GPU 가격 비교 도구

deploybase-cli는 터미널 환경에서 여러 클라우드 업체의 GPU 대여 비용과 주요 LLM API 가격 데이터를 실시간으로 조회하고 비교할 수 있는 오픈소스 도구이다.

팔란티어 출신들이 만든 Edra, 기업용 AI 에이전트의 '부족 지식' 문제를 해결하다

Edra는 기업의 기존 데이터를 분석하여 동적 컨텍스트를 생성함으로써 AI 에이전트가 기업 특유의 지식을 학습하고 실질적인 업무 자동화를 수행하도록 돕는다.

사전 학습만으론 부족하다? 모델 성능을 극대화하는 '미드트레이닝'의 비밀

사전 학습과 미세 조정 사이의 '미드트레이닝' 단계가 모델의 데이터 분포 적응력을 높이고 성능을 최적화하는 메커니즘을 체계적으로 분석한 연구이다.

코딩이 공짜라면? 필요할 때 쓰고 버리는 '일회용 앱'의 시대

LLM이 특정 작업을 위한 경량 JavaScript DSL 기반 미니 앱을 실시간으로 생성하고 폐기하는 '일회용 소프트웨어' 개념과 구현 아키텍처를 소개한다.

AI Andy4달 전

조회수 10만 회의 비밀? 안드레 카파시의 AI 최적화 기법으로 콘텐츠 성과 극대화하기

안드레 카파시의 Autoresearch 프레임워크를 활용하여 소셜 미디어 성과 데이터를 기반으로 프롬프트를 자동 수정하고 콘텐츠 품질을 지속적으로 개선하는 AI 에이전트 시스템을 구축한다.

KDNugget4달 전

LLM 환각, 프롬프트가 아닌 아키텍처로 해결하는 7가지 전략

프로덕션 환경의 LLM 환각 문제를 해결하기 위해 RAG, 도구 호출, 사후 검증 및 지속적 모니터링을 포함한 7가지 아키텍처 설계 전략을 제시한다.

단 5초면 내 목소리 복제? 제로샷 음성 클로닝의 명과 암

짧은 오디오 샘플만으로 목소리를 재현하는 제로샷 음성 클로닝 기술의 작동 원리와 이에 따른 보안 위험을 관리하기 위한 포괄적인 거버넌스 프레임워크를 제시한다.

내 컴퓨터를 직접 조작하는 AI 에이전트와 Anthropic의 대반격

메타의 Manus 데스크톱 에이전트 출시와 Anthropic의 기업용 AI 지출 점유율 확대, 그리고 OpenAI의 정부 시장 진출을 위한 AWS 파트너십 소식을 다룹니다.

AI21 Labs4달 전

RAG 검색 정확도를 극대화하는 AI21 Labs의 멀티 윈도우 전략

RAG 시스템에서 단일 청크 크기의 한계를 극복하기 위해 데이터를 여러 크기로 중복 인덱싱하고 RRF로 결합하여 검색 성능을 혁신적으로 개선하는 멀티 윈도우 청킹 기법을 다룹니다.

구글 맵 10년 만의 최대 업데이트와 NotebookLM을 200% 활용하는 비결

구글이 Gemini를 기반으로 구글 맵에 대화형 검색과 3D 내비게이션을 도입하고, NotebookLM을 Gemini 앱과 통합하여 개인화된 연구 및 콘텐츠 제작 파이프라인을 강화했다.

AI 에이전트의 혼잣말을 엿듣는 것만으로 피싱 사이트가 뚫린다?

AI 에이전트의 추론 과정 노출 위험인 '에이전트 수다'와 AI를 이용한 레거시 코드 취약점 분석, 그리고 현대 보안 방법론의 한계를 심도 있게 다룹니다.

AICodeKing4달 전

Kimi K2.5부터 MiniMax까지, NVIDIA API로 구축하는 최강의 무료 AI 코딩 환경

NVIDIA API Catalog를 Kilo CLI에 연결하여 Kimi K2.5, MiniMax M2.5 등 고성능 모델을 활용한 에이전트 기반 코딩 자동화 환경을 구축하는 방법을 설명한다.

sudoremove4달 전

GPT-5.4 vs 클로드 코드: 코딩 에이전트의 세대교체와 하이브리드 모델의 시대

GPT-5.4의 성능 벤치마크와 실무 코딩 체감을 분석하고, Transformer와 RNN 계열을 결합한 하이브리드 아키텍처 및 자율 학습 모델인 오토리서치의 흐름을 다룹니다.

GPT-5부터 Claude까지 API 하나로? OpenRouter 멀티 모델 아키텍처 가이드

OpenRouter를 통해 단일 API로 다양한 AI 모델을 통합 관리하고, 지능형 라우팅과 폴백 시스템을 구축하여 비용 효율적이고 안정적인 AI 서비스를 개발하는 방법을 제시한다.

죽은 자의 게시물? 메타가 노리는 진짜 AI 에이전트의 정체

메타의 특허와 Manus, Moltbook 인수를 분석하여 소상공인과 기업을 대행하는 개인화된 AI 에이전트 인프라 구축 전략을 제시한다.

r/vibecoding4달 전

잘 만든 웹사이트 디자인, Antigravity로 내 콘텐츠만 입혀서 뚝딱

소프트웨어 엔지니어가 Antigravity를 사용하여 기존의 세련된 웹사이트 디자인을 복제하고 자신의 콘텐츠를 결합하여 고품질 결과물을 얻은 워크플로우를 공유했다.

내가 자동차라면? AI가 분석한 나의 사고 패턴과 이미지화 결과

ChatGPT를 활용해 사용자의 사고 방식과 통찰력 전달 스타일을 8가지 기준으로 분석하고 이를 자동차 이미지로 시각화한 프롬프트 활용 사례이다.

12GB GPU의 한계? Epoch와 Repeat 사이에서 최적의 LoRA 학습법 찾기

12GB VRAM 제약 하에서 Kohya_ss와 Prodigy를 활용해 3D 스타일 LoRA를 학습할 때 Epoch와 Repeat 설정의 우선순위와 최적화 방안을 논의한다.

비정상 환경에서도 강건한 앙상블 학습 프레임워크 EARCP 공개

모델의 성능과 일관성을 동적으로 결합하여 비정상 환경에서 최적의 의사결정을 내리는 앙상블 학습 프레임워크 EARCP가 공개되었다.

r/ClaudeAI4달 전

Claude Code 작업 내역을 Obsidian 노트로 자동 변환하는 워크플로

Claude Code의 Git 커밋 내역을 Obsidian CLI를 통해 일간/주간/월간 리포트로 자동 생성하는 새로운 스킬이 공개됐다.

단순 검색을 넘어 실수에서 배우는 AI 에이전트 메모리

Claude Code와 같은 AI 에이전트가 과거의 행동과 사용자 피드백을 기록하고 학습하여 동일한 실수를 반복하지 않도록 돕는 경험 기반 메모리 라이브러리입니다.

r/LocalLLaMA4달 전

인도 특화 모델 Sarvam, 정작 인도 신화 질문에서 글로벌 모델에 완패?

인도 맥락에 특화된 105B 모델 Sarvam이 인도 신화 관련 기초 지식 테스트에서 ChatGPT와 Gemini보다 낮은 정확도를 보였다.

단순 프롬프트로는 부족하다: LLM 에이전트의 안전한 실행을 위한 4가지 정책 시행 패턴

LLM 에이전트가 환불이나 계정 업데이트와 같은 민감한 쓰기 작업을 수행할 때, 시스템 프롬프트를 넘어선 구체적인 정책 시행 계층 구축 방법과 실행 시점에 대해 논의한다.

"단순 전사를 넘어 감정까지" AI 음성 인식의 핵심, 오디오 어노테이션의 모든 것

실제 환경의 복잡한 음성 데이터를 AI가 정확히 이해하도록 돕는 다양한 어노테이션 기법과 오디오 포맷별 전략 및 산업별 활용 사례를 다룬다.

AI 에이전트 오류의 90%는 모델이 아닌 지시문 문제다

LLM 호출 없이 AI 에이전트의 시스템 프롬프트와 설정 내 모호함 및 규칙 충돌을 찾아내는 정적 분석 도구 lintlang이 공개됐다.

전 세계 10만 개 데이터 센터가 AI 기지로 변신, NVIDIA의 AI Grid 전략

NVIDIA와 글로벌 통신사들이 기존 네트워크 인프라를 활용해 지연 시간을 줄이고 비용을 절감하는 분산형 AI Grid를 구축하여 실시간 AI 서비스를 가속화한다.

미드저니 V8 알파 공개! 5배 빨라진 속도와 압도적 2K 화질

Midjourney가 5배 빠른 생성 속도, 네이티브 2K 해상도 지원, 향상된 텍스트 렌더링 및 개인화 기능을 갖춘 V8 모델의 알파 버전을 공개했다.

2026년 AI 투명성 의무화 시작, NIST와 PAI가 제시하는 문서화 표준 전략

Partnership on AI가 NIST와 협력하여 AI 시스템의 투명성을 높이고 규제 준수를 돕기 위한 실무 중심의 문서화 표준 및 가이드라인을 제시한다.

AI의 거짓말을 잡아라, Schmidt Sciences 최대 100만 달러 연구 지원

Schmidt Sciences가 LLM의 기만적 행동을 탐지하고 교정하기 위한 AI 해석 가능성 기술 연구에 최대 100만 달러를 지원하는 파일럿 프로그램을 발표했다.

세계 최대 3D 프린팅 기업이 된 인비절라인의 제조 혁신

Align Technology는 AI와 직접 3D 프린팅 기술을 결합하여 치아 교정 장치 제조 공정을 혁신하고 비용 효율성을 극대화하고 있다.

MS, 소비자·기업용 코파일럿 하나로 합친다... '에이전트 혁명' 정조준

마이크로소프트가 소비자 및 기업용 Copilot 조직을 통합하고, Mustafa Suleyman 주도로 프런티어 모델 개발을 위한 '슈퍼인텔리전스' 미션에 집중하는 대규모 조직 개편을 단행했다.

Claude가 직접 브라우저를 조작해 업무를 처리하는 'Cowork' 모드 실전 시연

Claude의 Cowork 모드를 활용하여 Zoom 녹화본 다운로드부터 YouTube 업로드 및 메타데이터 설정까지 전체 워크플로우를 자동화하는 실시간 데모와 에이전트 기술의 미래를 다룹니다.

특정 지식만 쏙 빼는 토큰 필터링과 Kimi K2.5의 에이전트 스웜 기술

Sparse Autoencoder를 활용한 정밀한 지식 제거 기법과 Kimi K2.5의 멀티모달 학습 및 병렬 에이전트 오케스트레이션 구조를 심층적으로 분석합니다.

에이전트의 기억력을 무한대로? SQLite와 MCP로 구현하는 공유 지식 그래프

AI 에이전트가 개별 메모리에 의존하는 대신 SQLite 기반의 외부 지식 그래프를 공유하여 데이터를 읽고 쓰며 협업하는 아키텍처와 구현 사례를 다룹니다.

Discord가 IDE가 된다? Claude Code와 OpenClaw로 구현한 자율 코딩 에이전트 워크플로

David Guttman이 Discord를 인터페이스로 사용하고 Claude Code를 백엔드로 오케스트레이션하여 모바일에서도 협업 코딩과 게임 개발이 가능한 OpenClaw 시스템을 소개합니다.

LLM 내부를 들여다보는 새로운 방법: 생성적 메타 모델과 루브릭 RL

LLM의 내부 활성화 패턴을 확산 모델로 모델링하는 GLP 기법과 루브릭 기반의 자가 증류 정책 최적화 방법론인 SDPO를 심층 분석합니다.

"에이전트가 길을 잃지 않게" - 구조화된 백로그로 코딩 에이전트 제어하기

코딩 에이전트가 복잡한 작업을 수행할 때 Markdown 대신 구조화된 그래프 기반 백로그를 사용하여 계획과 실행의 정확도를 높이는 Beads와 Ergo 도구를 소개합니다.

인간의 직관을 뛰어넘는 게임 이론 알고리즘을 스스로 설계하는 AI, AlphaEvolve

LLM을 진화 연산자로 활용하여 CFR 및 PSRO와 같은 복잡한 멀티 에이전트 학습 알고리즘을 자동 발견하고 인간의 설계를 능가하는 성능을 달성한 연구를 다룹니다.

Claude Code의 위험한 명령을 차단하는 실시간 AI 가드레일, Veto

Veto는 Claude Code와 LiteLLM을 위한 권한 게이트웨이로, AI 에이전트의 도구 호출을 실시간으로 가로채 규칙에 따라 승인하거나 차단하여 보안을 강화한다.

챗봇이 부추기는 망상? 39만 개 대화 로그가 밝힌 AI의 심리적 위험성

19명의 사용자로부터 수집된 39만 개의 대화 로그를 분석하여, LLM 챗봇의 아첨과 자아 사칭이 사용자의 망상을 심화시키고 자해 및 폭력을 조장할 수 있음을 규명했다.

LLM 비용 0원으로 토큰 54% 압축? Claw Compactor의 14단계 전략

Claw Compactor는 14단계 퓨전 파이프라인을 통해 LLM 추론 비용 없이 평균 54%의 토큰 압축과 가역적 복원을 지원하는 오픈소스 엔진이다.

GPT-4.5, 오타와 수학 실수로 튜링 테스트 73% 통과

GPT-4.5가 오타와 문법 오류를 의도적으로 생성하는 프롬프팅을 통해 인간 심사위원의 73%를 속이며 튜링 테스트를 통과했다.

"NVIDIA보다 앞섰다?" AI 에이전트의 실행을 Git처럼 관리하는 envpod

NVIDIA의 OpenShell 발표에 맞춰, 에이전트의 동작을 트랜잭션 단위로 관리하고 변경 사항을 Diff로 확인하는 Rust 기반 보안 런타임 envpod를 공개했다.

내 GPU에 돌아갈까? UniInfer로 VRAM 체크부터 LLM 실행까지 한 번에 해결

UniInfer는 하드웨어 자동 감지, VRAM 사전 점검(Fit Check), 다중 포맷 지원을 통해 설정 없이 로컬 하드웨어에서 LLM을 실행하고 OpenAI 호환 API를 제공하는 도구이다.

LLM 디버깅 시간 55% 단축, 잘못된 첫 진단만 잡아도 충분하다

LLM이 디버깅 시 잘못된 방향으로 빠지는 것을 방지하기 위해 'Atlas Router'라는 구조적 라우팅 제약을 도입하여 초기 진단 정확도를 높이고 전체 수리 시간을 단축하는 방법론이다.

50배 빠른 비디오 생성부터 3B 멀티모달 판별 모델까지: 지난주 로컬 AI 뉴스

지난주 공개된 FlashMotion, GlyphPrinter, MJ1 등 로컬 실행 가능한 최신 멀티모달 AI 모델과 오픈소스 프로젝트들을 요약했다.

코딩 몰라도 6주 만에 게임 개발? Claude로 만든 연금술 RPG

전문 코딩 지식이 없는 커뮤니티 칼리지 교사가 Claude를 활용해 6주간 개발한 웹 기반 연금술 판타지 게임과 플레이어 핸드북을 공개했다.

4번의 대화로 앱 완성, Claude가 Gemini보다 코딩에서 압도적인 이유

삼성 갤럭시 폴드 커버 화면을 게임 패드로 활용하는 앱 개발 과정에서 Claude가 Gemini보다 훨씬 효율적인 코드 생성과 문제 해결 능력을 보여주었다는 사용자 경험 보고이다.

r/LocalLLaMA4달 전

내 맥에서 돌아가는 AI 참모진: 로컬 LLM 기반의 다중 에이전트 토론 엔진

Apple Silicon에서 MLX를 활용해 외부 API 없이 로컬로 작동하며, 다양한 페르소나를 가진 AI 에이전트들이 사용자의 의사결정을 두고 다각도로 토론하는 시스템이다.

로컬 LLM으로 구현한 나만의 암호화 검색 엔진 PrivAI

로컬 추론과 데이터 암호화를 통해 개인정보를 보호하면서 Perplexity와 유사한 AI 검색 및 문서 분석 기능을 제공하는 오픈소스 프로젝트이다.

API 키 없이 브라우저에서 끝낸다: WebGPU 기반 100% 로컬 AI 에이전트

WebGPU와 MLC WebLLM을 활용해 서버나 API 키 없이 브라우저 내에서 추론, RAG, 코드 실행을 수행하는 완전 로컬 자율형 AI 에이전트 아키텍처이다.

AI로 업무 시간 80% 단축? Anthropic이 분석한 실질적 경제 효과

Anthropic 경제 연구팀은 Claude 사용 데이터를 기반으로 AI 도입이 업무 시간을 80% 단축하고 미국 노동 생산성을 연간 1.8% 포인트 높일 수 있다는 연구 결과를 발표했다.

Claude는 어떻게 생각할까? Anthropic이 공개한 AI 내부 추적 기술

Anthropic의 해석 가능성 팀은 회로 추적과 페르소나 벡터 등을 통해 대형 언어 모델의 내부 작동 기전을 분석하고 AI 안전성을 강화하는 연구를 수행한다.

AI가 우리 업무를 어떻게 바꿀까? Anthropic이 분석한 AI의 사회적 영향

Anthropic의 Societal Impacts 팀은 AI의 실제 활용 사례와 위험을 연구하며, 기술적 실험과 평가를 통해 AI가 인간의 가치와 정렬되도록 돕는다.

LLM 배치 추론 속도 2배 향상? Ray Data LLM의 비동기 마법

Ray Data LLM은 비동기 실행과 연속 배칭을 통해 대규모 LLM 배치 추론에서 vLLM 동기식 엔진보다 2배 높은 처리량과 뛰어난 복원력을 제공한다.

Claude가 내 PC를 원격 제어? Anthropic의 Dispatch와 OpenAI의 GPT-5.4 mi

Anthropic의 Claude Cowork Dispatch 기능 출시와 OpenAI의 GPT-5.4 mini 발표를 포함하여 에이전트 인프라, 새로운 모델 아키텍처 및 오픈소스 도구의 최신 동향을 다룹니다.

MCP 도구 쓰다가 파산할 판? 컨텍스트 72%가 정의에만 낭비된다

MCP 서버의 도구 정의가 LLM 컨텍스트 창의 상당 부분을 차지하여 비용과 효율성을 저해한다는 실증적 데이터가 공개됐다.

2026년 AI의 미래: CrewAI와 NVIDIA NemoClaw로 구축하는 안전한 자율 에이전트

CrewAI의 오케스트레이션과 NVIDIA NemoClaw의 보안 런타임을 결합하여 기업용 자율 에이전트를 안전하게 배포하는 통합 스택을 제시합니다.

"10명분 일을 혼자서?" YC 개리 탄이 공개한 Claude Code 필살기 gstack

Y Combinator CEO 개리 탄이 Claude Code의 개발 효율을 극대화하는 프롬프트 워크플로우 'gstack'을 오픈소스로 공개하며 큰 화제를 모으고 있다.

"AI가 내 일자리를 뺏을까?" 막연한 불안을 끝낼 8가지 실천 전략

AI로 인한 직업적 불안감을 해소하기 위해 기술적 숙련도보다 문제 해결 능력과 인간적 가치 보존에 집중하는 8가지 구체적인 생존 전략을 제시한다.

LLM의 거짓말을 잡아라! 4단계 검증으로 환각 차단하는 SkeptAI

LLM의 할루시네이션을 방지하기 위해 4단계 적대적 추론과 교차 모델 비판을 수행하는 오픈소스 프레임워크 SkeptAI가 공개되었다.

EU AI 법안부터 에이전트 거버넌스까지: 기업용 AI 규제 대응 가이드

기업이 EU AI 법안 및 NIST 프레임워크 등 글로벌 규제에 대응하며 혁신을 지속할 수 있도록 돕는 실무적인 AI 거버넌스 및 규제 준비 플레이북을 소개한다.

Hacker News - LLM4달 전· 4달 전 발행

Apple Silicon 성능 극한까지... Rust로 만든 올인원 ML 플랫폼 PMetal 공개

PMetal은 Apple Silicon 하드웨어에 최적화된 Rust 기반 ML SDK로, Metal GPU와 ANE를 활용하여 모델 학습, 추론, 양자화 및 머징을 통합 지원한다.

10페타바이트 데이터 처리를 GPU로? Snap의 비용 76% 절감 비결

Snap은 NVIDIA cuDF를 활용해 Apache Spark 워크로드를 GPU로 가속함으로써 데이터 처리 속도를 4배 높이고 운영 비용을 76% 절감했다.

AI 에이전트에게 칼을 쥐여줘도 안전할까? LangChain의 새로운 샌드박스 솔루션

LangChain이 AI 에이전트가 생성한 신뢰할 수 없는 코드를 하드웨어 수준에서 격리하여 안전하게 실행할 수 있도록 돕는 LangSmith Sandboxes를 출시했다.

Sears AI 챗봇 Samantha가 수백만 건의 고객 대화와 4시간 분량의 사생활 음성을 유출했다

Sears의 AI 챗봇 Samantha가 보안 오류로 370만 건의 채팅 로그와 140만 건의 음성 파일을 노출하며 AI 도입 과정의 데이터 보호 부실 문제를 드러냈다.

소프트웨어가 새로운 콘텐츠? 버즈피드의 AI 앱 스핀오프 '브랜치 오피스' 공개

버즈피드가 SXSW에서 AI 기반 소비자 앱 스핀오프 '브랜치 오피스'를 공개하며 미디어 기업에서 소프트웨어 기업으로의 전환과 재무 위기 돌파를 시도하고 있다.

LLM 추론 클러스터의 htop, llmtop으로 실시간 모니터링

vLLM, SGLang 등 다양한 백엔드를 지원하며 KV 캐시, 지연 시간, GPU 상태를 실시간으로 시각화하는 오픈소스 터미널 대시보드 도구이다.

엔비디아, 에이전틱 AI 전용 CPU '베라'와 차세대 플랫폼 전격 발표

NVIDIA가 GTC 2026에서 에이전틱 AI 전용 CPU인 베라(Vera)와 차세대 플랫폼 베라 루빈을 발표하며 풀스택 AI 플랫폼 기업으로의 전환을 선언했다.

기술은 완벽한데 팀은 붕괴 중? Claude Code가 가져온 조직적 혼란

Claude Code와 같은 AI 코딩 도구가 개발 주기를 단축하고 숙련도 격차를 줄이면서 기존의 팀 계층 구조와 협업 패턴을 무너뜨리는 조직적 문제를 분석합니다.

Claude Code는 사이드 프로젝트였다? Anthropic 내부자가 밝힌 혁신의 비밀

Anthropic의 주요 제품들이 소규모 사이드 프로젝트에서 시작되었음을 밝히며, 에이전트 중심의 업무 변화와 독특한 문서화 문화를 소개한다.

코드 리뷰도 AI가? Anthropic과 Stripe가 말하는 AI 엔지니어링의 실체

Anthropic, Stripe 등 주요 AI 기업 리더들이 모여 AI 코딩 도구가 개발자 워크플로를 어떻게 변화시키고 있는지와 필요한 역량의 변화를 논의했다.

Mistral Small 4 공개: 119B 거대 모델을 8B 비용으로 사용

Mistral이 추론, 비전, 코딩 능력을 통합하고 256k 컨텍스트와 높은 효율성을 갖춘 119B MoE 모델 Small 4를 Apache 2.0 라이선스로 공개했다.

0.6B 모델로 OpenAI 능가? Databricks의 새로운 다국어 임베딩

Databricks가 100개 이상의 언어를 지원하고 Matryoshka 기법으로 비용 효율성을 극대화한 0.6B 규모의 고성능 임베딩 모델 Qwen3-Embedding-0.6B를 출시했다.

LangChain이 너무 무겁다면? 가볍고 확장성 높은 AI 인터페이스 Xecai 등장

Xecai는 다양한 LLM과 AI 서비스를 최소한의 코드 변경으로 통합하고 RAG 워크플로우를 효율적으로 구축할 수 있게 돕는 경량화된 파이썬 라이브러리입니다.

"연구실 셋업부터 LLM 혁신까지" MIT 교수들이 말하는 산학 협력의 힘

MIT-IBM Watson AI Lab은 신진 교수들에게 컴퓨팅 자원과 전문 지식을 제공하여 NLP, 로보틱스, 기계 공학 등 다양한 분야의 AI 연구를 가속화하고 있습니다.

사진 7만 장 분석에 52달러? OpenAI의 초저가 GPT-5.4 nano 등장

OpenAI가 GPT-5.4의 경량 모델인 mini와 nano를 출시하며, 특히 nano 모델은 업계 최저 수준의 가격과 높은 효율성을 제공한다.

"RAG로는 부족하다" Mistral이 공개한 기업 전용 모델 학습 플랫폼 Forge

Mistral AI가 기업이 자체 데이터를 활용해 모델을 처음부터 학습시키고 인프라 통제권을 유지할 수 있도록 지원하는 'Mistral Forge' 플랫폼을 출시했다.

엔지니어 생산성 5배 향상시킨 Meta의 자율형 ML 실험 에이전트 REA

Meta는 광고 랭킹 모델의 가설 생성부터 학습, 디버깅까지 전 과정을 자율적으로 수행하여 모델 정확도를 2배, 엔지니어 생산성을 5배 높인 REA를 공개했다.

"LLM은 도구일 뿐" Django 커뮤니티가 AI 기여자에 던지는 묵직한 경고

Django 핵심 기여자인 Tim Schilling은 오픈소스 기여 시 LLM을 단순 대행 수단이 아닌 보조 도구로만 사용해야 하며, 인간성 없는 기여는 공동체에 해를 끼친다고 지적했다.

LLM 추론 설정의 미로, 가변성 모델링으로 비용과 성능 다 잡는다

소프트웨어 공학의 가변성 모델링 기법을 LLM 추론에 적용하여 방대한 하이퍼파라미터 조합 중 최적의 설정을 효율적으로 찾아내고 성능을 예측하는 연구이다.

겨울철 태양광 효율 저하 해결! SAM 3로 눈 덮인 패널 자동 감지하기

Meta의 SAM 3 모델과 Roboflow Workflows를 결합하여 태양광 패널의 적설 상태를 실시간으로 세그멘테이션하고 효율성을 분석하는 자동화 도구를 구축한다.

"내 캐릭터가 왜 이래?" 엔비디아 DLSS 5가 불러온 불쾌한 골짜기 논란

엔비디아가 발표한 차세대 업스케일링 기술 DLSS 5가 게임 캐릭터의 얼굴을 천편일률적인 AI 생성 이미지 스타일로 왜곡시킨다는 비판을 받으며 미적 가치 훼손 논란에 휩싸였다.

7B 모델로 seL4 커널 검증 성공률 2배 향상시킨 AutoReal

산업용 운영체제 커널 seL4의 복잡한 정리 증명을 위해 CoT 학습과 문맥 보강 기법을 적용한 7B 규모의 LLM 모델 AutoReal-Prover를 제안하여 증명 성공률을 51.67%로 끌어올렸다.

"중국이 미국을 추월했다" 2026년 오픈소스 AI 생태계의 거대한 지각변동

2026년 오픈소스 AI 생태계는 중국의 급격한 성장, 소형 모델의 대중화, 그리고 로보틱스 및 과학 분야로의 확장을 통해 전례 없는 변화를 맞이하고 있다.

"도구 대신 결과를 판다" AI 에이전트가 바꾸는 비즈니스와 개발의 미래

AI 에이전트가 단순 도구를 넘어 완성된 업무 결과를 제공하는 서비스 형태로 진화하고 있으며, 개발 워크플로우는 코드 작성보다 기획과 계획 단계에 집중하는 구조로 재편되고 있다.

Google과 OpenAI가 손잡았다? 오픈소스 보안을 위한 1,250만 달러 투자

Google을 포함한 주요 AI 기업들이 오픈소스 보안 강화를 위해 1,250만 달러를 기부하고, AI 기반 자율 취약점 탐지 및 수정 도구를 생태계 전반에 확산한다.

iMerit Blog4달 전· 4달 전 발행

글로벌 시장 제패의 열쇠, 단순 번역을 넘어선 'AI 모델 현지화' 전략

글로벌 AI 배포 시 발생하는 언어적, 문화적 격차를 해소하기 위해 SFT와 RLHF를 활용하여 모델을 특정 지역의 맥락과 규제에 맞게 최적화하는 현지화 방법론을 다룬다.

코딩 에이전트가 보여준 미래: 회계와 법률 업무도 '소프트웨어화'된다

소프트웨어 공학의 구조적 장점인 테스트와 가역성을 회계 및 법률 분야에 이식하여 AI 에이전트의 자율성을 확보하고, 이로 인한 인력 양성 위기와 관리 체계의 변화를 분석한다.

Simon Willison4달 전· 4달 전 발행

Mistral의 새로운 야심작, 모든 능력을 하나로 합친 Mistral Small 4 공개

Mistral AI가 추론, 멀티모달, 코딩 특화 모델의 역량을 하나로 통합하고 Apache 2 라이선스로 공개한 119B 파라미터 규모의 MoE 모델 Mistral Small 4를 발표했다.

여러 LLM 백엔드를 한 곳에서? llamactl로 구축하는 통합 추론 대시보드

llamactl은 llama.cpp, MLX, vLLM 등 다양한 LLM 추론 백엔드를 통합 관리하고 OpenAI 호환 API로 라우팅하는 웹 대시보드 기반의 오픈소스 도구입니다.

LLM의 '기억력' 한계? 25단계 코딩 세션에서 드러난 아키텍처 붕괴 현상

Claude 앱과 Calmkeep 레이어를 적용한 API 간의 아키텍처 일관성을 25단계 세션에 걸쳐 비교 분석하여 장기 컨텍스트에서의 모델 성능 유지 능력을 평가했다.

컴퓨터 쓰는 AI의 혁신, Holotron-12B로 처리량 2배 향상

H Company가 NVIDIA Nemotron 기반 하이브리드 SSM 아키텍처를 채택하여 추론 효율과 컴퓨터 조작 성능을 극대화한 12B 규모의 멀티모달 에이전트 모델 Holotron-12B를 출시했다.

3B 모델이 90B를 이겼다? Atos가 증명한 도메인 특화 파인튜닝의 위력

Atos는 AWS AI League를 통해 400명 이상의 직원을 교육하고, SageMaker JumpStart를 활용한 파인튜닝으로 소형 모델이 특정 도메인에서 대형 모델을 능가하는 성과를 거두었다.

"데이터가 모델을 만든다" - 고품질 LLM 학습 데이터를 위한 올인원 솔루션 DataFlow

DataFlow는 노이즈가 많은 원시 데이터를 고품질 LLM 학습 데이터셋으로 변환하기 위해 시각적 파이프라인과 에이전트 기반 자동화를 제공하는 데이터 중심 AI 시스템이다.

OpenAI가 펜타곤에 문을 열었다? 전 세계를 뒤흔든 AI 뉴스 10가지

OpenAI의 군사적 활용 논란부터 엔비디아의 매출 전망까지, 전 세계 AI 기술 및 정책 분야의 핵심 이슈들을 요약하여 전달한다.

"내 AI가 산 거 맞아요" World, 에이전트 커머스용 인간 인증 도구 공개

World가 AI 에이전트의 결제 배후에 실제 인간이 있음을 증명하여 사기를 방지하는 개발자 도구 'AgentKit'을 발표했다.