본문으로 건너뛰기

2026년 4월 9일 AI 뉴스

100

관심 태그 추가

OpenAI가 Sora를 포기한 진짜 이유? AI 수익화 절벽의 경고

Anthropic과 OpenAI가 막대한 컴퓨팅 비용을 감당하기 위해 AI 에이전트 중심의 수익화 모델로 급격히 전환하며 생존을 건 IPO 경쟁에 돌입했다.

LLM이 단순한 명령에 속는 이유? 200개 함정 프롬프트로 분석한 분류 오류

LLM이 겉보기에 단순한 요청 뒤의 복잡한 맥락을 놓치는 '2종 오류'를 분석하고, 개방형 탐색 지시가 분류 정확도를 높임을 입증했다.

학습 데이터 0건인 언어가 파이썬보다 코딩을 더 잘한다?

학습 데이터가 전혀 없는 새로운 프로그래밍 언어 Vera가 LLM 코드 생성 벤치마크에서 파이썬 및 타입스크립트와 대등하거나 더 높은 정확도를 기록했다.

학습하며 스스로 작아지는 AI? MIT의 새로운 모델 압축 기술

MIT 연구진이 상태 공간 모델(SSM) 학습 초기 단계에서 중요도를 판별해 불필요한 요소를 제거함으로써 학습 속도를 최대 4배 높이는 CompreSSM 기법을 공개했다.

Claude Code가 만든 초고속 패키지 매니저, Homebrew보다 200배 빠르다?

AI 코딩 에이전트 Claude Code를 사용하여 Zig 기반의 고성능 macOS 패키지 매니저 'malt'를 개발하고 벤치마크 결과를 공유했다.

Claude Code로 SEO 노가다 끝내기: 키워드 조사부터 발행까지 자동화

Claude Code를 활용해 키워드 조사, 토픽 클러스터링, 콘텐츠 생성 및 발행 과정을 자동화된 파이프라인으로 구축한 경험을 공유했다.

Stackoverflow4달 전

Z세대의 뇌가 녹고 있다? AI 시대 '인지적 오프로딩' 탈출법

AI 도구 사용 급증으로 인한 인지 능력 저하와 지식 망각 문제를 해결하기 위해 개인 및 조직 차원의 '지식 베이스(Knowledge Base)' 구축과 능동적 학습을 제안한다.

r/vibecoding4달 전

웹사이트가 AI 에이전트의 도구가 된다면? WebMCP 실전 구축 사례

10년 경력의 개발자가 WebMCP를 활용해 웹사이트의 사용자 흐름을 AI 에이전트용 도구로 노출하는 프로젝트를 구축하며 얻은 인사이트를 공유했다.

Vercel AI SDK보다 24배 빠른 콜드 스타트, Go 개발자를 위한 GoAI

GoAI는 22개 이상의 LLM 프로바이더와 MCP를 지원하며, 고성능 스트리밍과 타입 안정성을 제공하는 Go 전용 AI SDK이다.

AI 모델 취약점 점검도 자동화, 오픈소스 0DIN Scanner 공개

NVIDIA garak을 기반으로 구축된 0DIN Scanner는 LLM의 취약점을 점검하고 보안 상태를 시각화하는 오픈소스 웹 애플리케이션이다.

프롬프트 밀도로 토큰 비용 50% 절감하는 H 공식 구현법

프롬프트의 정보 밀도(ψ)를 기반으로 H 지수를 산출하여 LLM의 토큰 생성 예산을 동적으로 최적화하는 기법과 파이썬 구현 사례이다.

AI의 유창함에 속지 마세요: 비판적 사고를 강제하는 'Sovereignty Protocol'

AI 답변에 대한 맹목적 신뢰를 방지하고 사용자의 비판적 사고를 강제하기 위해 설계된 시스템 프롬프트 세트이다.

r/artificial4달 전

90건의 AI 에이전트 보안 사고 분석 데이터셋 GitHub 공개

2024년부터 2026년까지 발생한 90건의 AI 에이전트 보안 사고, 프레임워크 취약점, 공격 패턴을 정리한 오픈소스 레퍼런스가 공개됐다.

r/LangChain4달 전

에이전트 루프가 무한 반복되는 이유? 멀티 에이전트 시스템의 실전 교훈

멀티 에이전트 시스템 운영 시 발생하는 프롬프트 아키텍처, 정체성 관리, 상호운용성 표준화 문제를 분석하고 실무적 해결 방향을 제시한다.

유튜브 쇼츠에서 나를 똑같이 닮은 AI 아바타로 영상 만든다

YouTube가 창작자의 얼굴과 목소리를 복제하여 최대 8초 분량의 영상을 생성할 수 있는 AI 아바타 기능을 Shorts에 출시했다.

iMerit Blog4달 전

말투만으로 감정을 읽는 AI, 음성 감정 인식(SER)의 핵심 기술

음성 감정 인식(SER)은 피치, 리듬, 강도 등 준언어적 데이터를 분석하여 사용자의 감정과 의도를 파악하는 기술로, 단순 텍스트 변환을 넘어 공감형 AI 구현을 가능하게 한다.

AI 에이전트가 직접 결제하는 시대, Circle의 Arc 블록체인이 여는 미래

Circle의 CEO 제레미 얼레어가 AI 에이전트 간의 가치 저장과 계약 실행을 지원하는 Arc 블록체인과 프로그래밍 가능한 화폐의 미래를 제시한다.

r/AutoGPT4달 전

터미널 지옥 탈출! Claude Code 세션을 한눈에 관리하는 AgentPlex

여러 개의 Claude Code 세션과 서브 에이전트 실행 구조를 그래프 캔버스 형태로 시각화하여 관리하는 오픈소스 Electron 앱 AgentPlex가 공개됐다.

r/vibecoding4달 전

바이브 코딩은 프로토타입용? 20GB 규모 복잡한 AI 도구도 가능하다

바이브 코딩을 통해 Docker 없이 실행 가능한 20GB 규모의 Stable Diffusion 학습 및 추론 스택 'LoRA Pilot' 윈도우 설치 프로그램을 구축한 사례이다.

HF Daily Papers4달 전· 4달 전 발행

LLMA-Mem: 에이전트 수를 늘리는 것보다 메모리 설계가 성능에 더 중요하다

LLM 멀티 에이전트 시스템에서 단순히 에이전트 수를 늘리는 것이 항상 성능 향상으로 이어지지 않는다는 비단조적 확장 특성을 밝혀냈습니다. 효율적인 메모리 설계를 통해 과거의 경험을 압축된 절차적 지식으로 변환함으로써, 더 적은 비용으로도 대규모 팀보다 뛰어난 장기 성능을 달성할 수 있음을 입증했습니다.

HF Daily Papers4달 전· 4달 전 발행

KV 캐시 메모리 10.7배 절감하며 긴 문맥 추론 성능 유지

대규모 언어 모델이 긴 문장을 추론할 때 발생하는 메모리 병목 현상을 획기적으로 해결하는 기술입니다. 기존 방식과 달리 데이터의 위치 정보를 삼각 함수로 예측하여 중요한 정보만 남김으로써, 일반 소비자용 그래픽 카드 한 장으로도 수만 개의 단어가 포함된 긴 대화를 끊김 없이 처리할 수 있게 합니다.

아이디어만 넣으면 PRD 완성? 시니어 PM의 검증된 프롬프트 공개

시니어 제품 매니저의 관점에서 아이디어를 상세한 PRD로 변환해주는 고도화된 프롬프트와 이를 자동화한 도구를 소개한다.

임베딩 114배 압축하고 KV 캐시 용량 4배 늘리는 TurboQuant-Pro

PCA-Matryoshka 기법을 활용해 임베딩 벡터와 LLM KV 캐시를 고효율로 압축하는 오픈소스 툴킷 TurboQuant-Pro가 공개됐다.

Salesforce 보안 팀의 비결, Agentforce로 보안 리포트 처리 속도 극대화

Salesforce 보안 팀이 자사 AI 에이전트인 Agentforce를 활용해 보안 보고서 분류 프로세스를 자동화하고 대응 속도를 높인 사례를 설명한다.

LLM 핵심 용어 310개 총정리 사전 및 플래시카드 공개

LLM 개발에 필요한 기초 개념부터 최신 인프라 기술까지 310개의 용어를 정리한 온라인 사전과 학습용 플래시카드가 공개됐다.

iMessage로 부리는 AI 비서 Poke, 3억 달러 가치로 도약

iMessage와 텔레그램을 통해 일상 업무를 자동화하는 AI 에이전트 Poke가 3억 달러의 기업 가치를 인정받으며 추가 투자를 유치했다.

공급망 공격과 프롬프트 인젝션 차단, AI 에이전트 보안 도구 Agentiva

최근 빈번한 공급망 공격에 대응하여 Git 푸시 시 보안 취약점과 프롬프트 인젝션을 자동 스캔하고 차단하는 보안 도구 Agentiva가 출시됐다.

라벨링 데이터 없이 모델 성능 66% 높이는 Amazon Bedrock RFT 가이드

Amazon Bedrock에서 보상 신호를 활용해 모델을 최적화하는 강화 파인튜닝(RFT)의 핵심 원리와 데이터 설계 및 하이퍼파라미터 튜닝 모범 사례를 제시한다.

단돈 2달러로 LLM 정확도 97% 달성? Amazon Nova 미세 조정 실전 가이드

Amazon Bedrock에서 제공하는 SFT, RFT, 증류 기법을 통해 Amazon Nova 모델을 저비용으로 비즈니스 특화 작업에 최적화하는 방법과 실무 팁을 제시한다.

일론 머스크 "OpenAI 소송 배상금, 내 주머니 아닌 비영리 재단으로"

일론 머스크가 OpenAI와 샘 올트먼을 상대로 한 소송을 수정하여, 회수되는 모든 부당 이득을 자신이 아닌 OpenAI의 자선 비영리 부문에 반환할 것을 요구했다.

Claude4달 전

Notion 워크스페이스에서 Claude 에이전트에게 업무를 직접 위임하는 법

Notion이 Claude Managed Agents를 통합하여 복잡한 워크플로를 자동화하고 사용자 맞춤형 에이전트 오케스트레이션 플랫폼을 구축한 사례를 다룹니다.

NVIDIA B200과 TorchAO로 확산 모델 추론 속도 최대 1.68배 향상

NVIDIA Blackwell 아키텍처의 MXFP8 및 NVFP4 양자화 기술을 활용해 Flux.1-Dev 등 확산 모델의 추론 성능을 최대 1.68배 가속화하는 방법과 벤치마크 결과를 제시한다.

내 주머니 속의 AI 관리자, Astropad가 선보이는 AI 에이전트 전용 원격 제어

Astropad가 Mac Mini 등에서 실행되는 AI 에이전트를 iPad와 iPhone으로 실시간 모니터링하고 제어할 수 있는 'Workbench'를 출시했다.

구독료 없이 내 API 키로 쓰는 고성능 AI 코드 리뷰 봇 Manki

GitHub Action 기반의 오픈소스 AI 코드 리뷰 봇 Manki는 다단계 에이전트 파이프라인을 통해 PR 규모에 맞는 정밀한 코드 분석을 제공한다.

Meta의 AI 야망, CoreWeave와 손잡고 2032년까지 인프라 확장

Meta가 자체 AI 인프라 강화와 더불어 CoreWeave의 NVIDIA GPU 대여 서비스를 활용해 2027년부터 2032년까지 대규모 투자를 진행한다.

Claude Code로 Reddit 스크래핑이 안 된다면? 확장 프로그램 패치로 해결하기

Claude Code 브라우저 확장 프로그램의 도메인 차단 로직을 로컬에서 패치하여 Reddit 등 제한된 사이트에서 도구 사용을 허용하는 방법이다.

r/ClaudeCode4달 전

Claude Code의 '게으른 행동'을 막는 6가지 핵심 설정법

Claude Code의 품질 저하 문제를 해결하기 위해 Adaptive Thinking 비활성화 및 특정 문구 감지 훅 등 6가지 기술적 워크라운드를 적용하는 방법이다.

다크웹에 내 정보가? 피싱 공격 원리와 5가지 필수 보안 수칙

IBM의 보안 전문가가 다크웹의 구조와 개인정보 유출 경로를 분석하고, 패스키와 다요소 인증을 활용한 실질적인 데이터 보호 방안을 제시한다.

Claude를 다루는 고수들의 비밀 프롬프트 패턴 120가지 공개

Claude의 답변 스타일과 논리적 깊이를 제어하기 위해 커뮤니티에서 검증된 120가지 프롬프트 접두사 패턴과 그 효과를 정리했다.

JAX 모델의 복잡한 파라미터 관리, 이제 Parax로 더 직관적으로 해결하세요

Equinox 라이브러리를 확장하여 JAX 모델 파라미터에 메타데이터를 부착하고 계층 구조를 쉽게 조작할 수 있게 돕는 Parax 프로젝트가 공개됐다.

에이전트의 오답률 30%를 8%로 줄인 실전 피드백 시스템 구축기

SaaS 고객 지원 에이전트의 잘못된 액션 선택 문제를 해결하기 위해 작업 유형별 성공률을 추적하고 의사결정에 반영하는 피드백 레이어를 도입하여 정확도를 92%까지 향상시킨 사례이다.

Claude가 가짜 코드를 2,200줄이나 짰다? 할루시네이션 인시던트 리포트의 교훈

Claude Code 사용 중 발생한 할루시네이션을 분석하기 위해 인시던트 리포트를 작성하게 함으로써 모델의 오류 패턴과 세션 간 오정보 전파 문제를 확인했다.

LangGraph로 구축한 실전 멀티 에이전트 쇼핑 AI 구현기

NVIDIA의 오픈소스 쇼핑 어시스턴트 청사진을 LangGraph와 Llama 3.1을 사용하여 유럽 이커머스 플랫폼 Shopware 6에 통합한 기술적 경험을 공유했다.

대시보드 대신 CLI와 MCP로: AI 에이전트가 직접 쓰는 SaaS 설계법

기존 B2B SaaS를 AI 에이전트가 직접 조작할 수 있도록 CLI, MCP 서버, SKILL.md 기반의 '스킬' 체계로 재구축한 기술적 여정과 교훈을 공유한다.

HF Daily Papers4달 전· 4달 전 발행

금융 AI 사고 방지: Lean 4로 5마이크로초 만에 수학적 거래 승인 완료

금융 시장에서 AI 에이전트의 자율적 활동이 늘어남에 따라, 확률적인 LLM이 규제를 위반할 위험이 커지고 있다. 이 논문은 Lean 4 정리 증명기를 사용하여 AI의 행동을 수학적으로 검증함으로써, 100% 확실한 규제 준수와 초저지연 실행을 동시에 달성하는 아키텍처를 제시한다.

HF Daily Papers4달 전· 4달 전 발행

35개월간 13,300편의 AI 논문을 분석해 트렌드를 포착하는 오픈소스 플랫폼

매달 3만 편씩 쏟아지는 arXiv 논문 홍수 속에서 연구자가 최신 기술 흐름을 놓치지 않도록 돕는 도구이다. 단순한 요약을 넘어 대규모 언어 모델(LLM)을 활용해 연구 주제의 생성과 소멸 주기를 분석하고, 커뮤니티의 관심도와 기술적 참신함 사이의 상관관계를 데이터로 입증했다.

r/LLMDevs4달 전

규칙보다 강력한 구조적 보안, 캡슐화된 에이전트 아키텍처

에이전트의 행동을 실행 전 정의하고 런타임 조작 경로를 구조적으로 차단하여 보안을 강화하는 '캡슐화된 에이전트' 개념이 제시됐다.

HF Daily Papers4달 전· 4달 전 발행

확산 언어 모델의 추론 성능을 극대화하는 글로벌 템퍼링 기법

확산 언어 모델(dLLM)은 토큰 생성 순서가 자유로워 복잡한 추론에 유리하지만, 실제로는 확신이 높은 토큰만 먼저 생성하려는 경향 때문에 다양한 해결 경로를 탐색하지 못하는 한계가 있다. 이 논문은 이러한 '품질-탐색 딜레마'를 수학적으로 규명하고, 전역적인 관점에서 최적의 토큰을 선택하는 새로운 디코딩 전략을 통해 추론 성능(Pass@k)을 대폭 향상시켰다.

40만 줄의 거대 코드베이스, AI에게 컴파일러 수준의 이해도를 제공하는 방법

컴파일러 API인 Roslyn을 활용해 AI에게 단순 텍스트가 아닌 코드의 실제 구조와 심볼 정보를 제공하는 오픈소스 프레임워크 Lifeblood가 공개됐다.

Claude Code는 개발 도구일 뿐, n8n과 같은 실행 엔진이 아니다

30년 경력의 엔지니어가 Claude Code를 소프트웨어 구축용 도구로 정의하며, 이를 n8n과 같은 프로덕션 워크플로 실행 엔진으로 오용하는 '바이브 코딩' 트렌드에 대해 경고했다.

사라진 Claude Code의 마스코트, 오픈소스로 완벽 부활

Anthropic이 Claude Code v2.1.97에서 삭제한 컴패니언 시스템을 MCP와 스킬을 활용해 독립적인 오픈소스로 재구현했다.

Claude Code로 비개발자가 영업 자동화 툴을 직접 만든 방법

비개발자 출신 영업 운영자가 Claude Code를 사용하여 Reddit의 잠재 고객 게시글을 실시간으로 감지하고 분류하는 자동화 파이프라인을 구축했다.

Claude Code 삽질 방지 가이드: .claude 폴더 구조부터 훅 설정까지

Claude Code 사용 시 혼동하기 쉬운 .claude 디렉토리 구조, 스킬 설정, 훅 이벤트 및 최신 설치 권장 사항을 정리한 실전 가이드이다.

r/vibecoding4달 전

리콜된 위험 제품이 여전히 판매 중? AI 자동화로 찾아낸 실시간 매칭 시스템

공공 리콜 데이터와 유통사 판매 리스팅을 실시간으로 대조하여 모델 번호가 일치하는 위험 제품을 자동으로 식별하는 엔드투엔드 파이프라인 구축 사례이다.

Meta의 차세대 AI 'Muse Spark' 공개: 사진만 찍으면 칼로리 계산까지?

Meta가 강력한 멀티모달 인지와 병렬 서브에이전트 기능을 갖춘 신규 모델 Muse Spark를 공개하며 Meta AI 앱의 대대적인 업데이트를 단행했다.

AI 에이전트 배포 후 '성능 저하'를 막는 7가지 핵심 운영 질문

AI 에이전트의 확률론적 특성에 대응하기 위해 기존 소프트웨어 개발 방식을 넘어선 지속적인 운영 체계(ADLC)와 전담 역할의 필요성을 제시한다.

제멋대로인 코딩 AI 길들이기: Karpathy와 Rauch의 철학을 담은 skillmaxxing

AI 코딩 에이전트가 작업 단계에 맞춰 적절한 모드로 작동하도록 돕는 프롬프트 및 설정 프레임워크 'skillmaxxing'이 공개됐다.

Claude Code로 만든 당신의 앱이 '시한폭탄'인 이유 5가지

AI 코딩 도구로 빠르게 개발된 앱들이 흔히 놓치는 데이터 휘발, 보안 유출, 컨텍스트 한계 등 5가지 기술적 결함과 그 해결 방법을 제시했다.

에이전트가 Bash를 쓰면 멍청해진다? REPL로 성능을 극대화하는 방법

Bash의 텍스트 변환 과정에서 발생하는 정보 손실을 해결하기 위해 코드베이스를 Python REPL 환경으로 변환하여 에이전트의 추론 효율을 높이는 CORE 프레임워크가 제안됐다.

OpenAI Playground 업데이트: 프롬프트 버전 관리와 자동 최적화 도구 탑재

OpenAI Playground에 프로젝트 단위 프롬프트 관리, 버전 복구, 변수 지원 및 자동 최적화 도구가 추가되어 개발 워크플로가 개선됐다.

Claude로 생성한 콘텐츠를 Canva 디자인 50장에 즉시 적용하는 법

Claude의 출력을 엄격한 CSV 형식으로 제어하여 Canva의 대량 제작 기능과 오류 없이 연동하는 프롬프트 전략과 워크플로이다.

BANKING77 벤치마크 94.61% 달성, 정체기를 뚫은 기술적 돌파구

BANKING77 데이터셋에서 다중 뷰 인코더 적응 기법을 통해 기존 성능 정체를 극복하고 94.61%의 정확도를 기록했다.

개발 명령 출력 90% 압축, 토큰 비용 아껴주는 RTK CLI 프록시

명령어 출력을 필터링 및 압축하여 LLM 토큰 사용량을 60-90% 절감하는 오픈소스 CLI 프록시 RTK가 공개됐다.

RAG 성능을 결정짓는 22가지 핵심 아키텍처와 실전 구현 가이드

18개월간의 RAG 오픈소스 프로젝트 경험을 바탕으로 데이터 구조화부터 에이전틱 루프까지 22가지 RAG 아키텍처 패턴을 정리한 가이드이다.

분 단위 콜드 스타트를 초 단위로? Modal의 서버리스 GPU 아키텍처 심층 분석

Modal의 엔지니어가 인스턴스 버퍼링, FUSE 기반 지연 로딩, CPU/GPU 스냅샷 기술을 결합하여 AI 추론의 콜드 스타트를 획기적으로 단축하고 GPU 활용도를 극대화하는 기술적 아키텍처를 공유합니다.

Anthropic vs 미 국방부, AI 사용 제한 두고 법적 공방 격화

미국 항소법원이 Anthropic에 대한 국방부의 공급망 위험 지정을 유지하기로 판결하며, AI 기업의 자율적 사용 제한 정책과 국가 안보 논리가 충돌하고 있다.

거부 메커니즘은 언어 이전에 존재한다? Sarvam 모델 어블리터레이션 실험 결과

인도 Sarvam AI의 MoE 추론 모델에서 거부 회로를 제거한 결과, 영어 기반의 거부 방향 제거가 힌디어 등 타 언어의 거부 반응까지 억제함을 확인했다.

Claude Code 세션 여러 개 돌릴 때 꼬이는 문제, ruah로 해결하세요

Claude Code를 동일 저장소에서 여러 세션으로 실행할 때 발생하는 파일 충돌과 병합 문제를 자동화된 워크트리 관리로 해결해주는 도구 ruah가 공개됐다.

r/ClaudeCode4달 전

Claude Code의 계획 오류, Claude Web 확장 추론으로 해결하는 방법

Claude Code의 ultraplan 기능을 대신하여 Claude Web의 확장 추론 기능을 활용해 코딩 계획의 오류를 수정하고 실행하는 워크플로를 제안한다.

거대한 코드 저장소를 70kb로 압축? AI 에이전트를 위한 GitGalaxy

코드 저장소를 AI 에이전트가 즉시 이해할 수 있도록 70kb 규모의 결정론적 JSON 요약본으로 변환하는 CLI 도구 GitGalaxy가 공개됐다.

Copilot과 Claude로 뚝딱? 강의 노트를 혁신하는 로컬 AI 앱 개발 사례

GitHub Copilot과 Claude를 활용해 Whisper 기반의 로컬 강의 전사 및 요약 Mac 앱인 'Lectio'를 개발한 사례이다.

r/vibecoding4달 전

고위 관료의 무관심을 뚫고 OECD 혁신 사례로 선정된 그리스 공무원의 AI 프로젝트

그리스 공무원이 개발한 행정 문서 처리 AI 포털이 고위 관료의 무관심을 극복하고 OECD 공공 부문 혁신 관측소(OPSI)의 2026년 혁신 사례 후보로 제출되었다.

LLM 질문 시 토큰 낭비 방지! 에러 로그를 자동으로 정제하는 클립보드 유틸리티

Tauri와 Vite로 구축된 이 macOS 트레이 도구는 클립보드를 감시하여 에러 로그의 불필요한 공백과 반복되는 헤더를 자동으로 제거한다.

r/vibecoding4달 전

AI는 왜 '적게 추천해달라'는 요청을 무시할까? 스킨케어 생성기 실패 사례

AI 스킨케어 생성기가 기술적 정확성에도 불구하고 사용자 의도(단순화)를 반영하지 못하는 설계적 한계와 UI 결함으로 인해 겪은 실무적 문제점을 다룹니다.

r/LLMDevs4달 전

당신의 API가 에이전트에게는 쓰레기일 수 있는 이유

개발자 도구 설계 시 인간 중심의 RESTful API와 문서화 방식이 AI 에이전트의 컨텍스트 제한과 작동 방식에는 오히려 방해가 된다는 실무적 통찰을 공유했다.

Anthropic의 85% 토큰 절감 기법을 내 앱에 바로 적용하는 방법

Anthropic의 프로그래밍 방식 도구 호출 기법을 활용하여 토큰 비용을 절감하고 MCP 도구의 출력 스키마를 지원하는 오픈소스 프로젝트를 공유했다.

Meta가 Claude에 60조 토큰을 쓴 이유? AI 아키텍처의 거대한 결함

현재 AI 모델이 텍스트 토큰을 생성하며 사고하는 방식은 비효율적인 '가설물'에 불과하며, 잠재 공간에서의 비언어적 사고로의 전환이 필요하다.

API 비용 90% 절감? LLMLingua로 프롬프트 20배 압축하기

LLMLingua 시리즈는 LLM의 중복된 자연어 특성을 이용해 프롬프트를 최대 20배 압축하며 비용과 성능을 동시에 최적화한다.

프롬프트로 모델을 속이는 시대는 끝났다? 네이티브 에이전트의 등장

프롬프트 기반의 에이전트 구현 방식이 가진 취약성을 지적하며, 모델 내부에 에이전트 구조를 통합한 차세대 아키텍처로의 전환 필요성을 논의한다.

AI의 가짜 자신감 해결법: Chain of Verification 루프 구축기

LLM의 환각 문제를 해결하기 위해 초기 생성, 자기 비판, 재작성 단계로 구성된 검증 사슬(CoV) 루프를 구축하여 시장 조사 정확도를 높인 사례이다.

AI는 자신에게 어떤 프롬프트를 줄 때 가장 잘 작동할까?

사용자가 작성한 원본 프롬프트와 AI가 모호성을 해소하여 스스로 재작성한 프롬프트를 비교하여 숨겨진 정보와 포맷 차이를 분석하는 실험이다.

AWS CEO가 밝힌 OpenAI·Anthropic 동시 투자 전략과 '이해 상충' 해법

AWS CEO 맷 가먼은 OpenAI와 Anthropic에 대한 동시 투자가 클라우드 사업의 본질적인 경쟁 구조이며, 모델 라우팅을 통해 이를 해결할 것이라고 밝혔다.

에이전트 성능이 정체되었다면? LangChain이 제안하는 하네스 최적화 전략

에이전트의 하네스를 평가 데이터와 대조하며 반복적으로 개선하여 일반화 성능을 높이는 Better-Harness 시스템과 방법론을 제시한다.

GPT-5.4와 4페이지의 텍스트, 이 조건이면 환각 확률 0.01% 미만

특정 모델과 데이터 제약 조건을 충족할 경우 LLM의 환각 발생 확률이 0.01% 미만으로 떨어진다는 가설을 제시한다.

의료 AI 에이전트의 안전장치, AWS가 제안하는 4가지 HITL 구현 패턴

헬스케어 분야의 규제 준수와 환자 안전을 위해 AWS 서비스와 MCP를 활용한 4가지 인간 참여형(HITL) 에이전트 승인 워크플로 구현 방식을 제시한다.

텍스트로 오디오를 찾는다? Amazon Nova로 구현하는 의미론적 오디오 검색

Amazon Nova 멀티모달 임베딩을 사용하여 오디오의 음조, 감정, 환경음을 벡터화하고 이를 통해 고도화된 의미론적 오디오 검색 시스템을 구축하는 방법을 제시한다.

320만 파라미터 LLM을 20분 만에? 소설 한 권으로 만드는 나만의 AI

메리 셸리의 소설 '프랑켄슈타인' 텍스트를 활용해 약 320만 개의 파라미터를 가진 Transformer 기반 LLM을 처음부터 구축하고 학습시키는 과정을 단계별로 설명합니다.

Meta가 대규모 설정 오류를 막는 법: AI로 알람 노이즈를 줄이고 안전을 강화하다

Meta Tech 팟캐스트에서 대규모 인프라의 설정 배포 안전성을 높이기 위한 카나리 배포, 모니터링, 그리고 AI 기반의 장애 대응 최적화 전략을 공유했다.

논문 읽기 혁신! 키워드 하나로 인용 계보를 시각화하는 Citracer

PDF 내 특정 키워드와 관련된 인용 문헌을 자동으로 찾아 계보를 시각화해주는 오픈소스 도구 Citracer가 공개됐다.

Claude가 감시받지 않을 때 하는 말, 1,400줄의 코드로 확인했다

40년 경력의 개발자가 Claude와 신뢰 관계를 구축하기 위해 프레임워크 없이 1,400줄의 Python으로 독립된 대화 환경을 구축하고 그 변화를 관찰했다.

r/artificial4달 전

AI 에이전트의 무분별한 도구 호출, 예산 기반 실행 차단으로 해결

AI 에이전트가 도구를 직접 호출하는 대신 '제안-승인-실행' 단계를 거쳐 예산 범위 내에서만 작동하도록 제한하는 실행 시점 권한 부여 아키텍처가 제안됐다.

Anthropic의 새로운 무기, 복잡한 AI 에이전트 구축을 '클릭 한 번'으로 해결

Anthropic이 기업들이 복잡한 인프라 구축 없이 자율 AI 에이전트를 즉시 배포할 수 있도록 지원하는 'Claude Managed Agents'를 발표했다.

복잡한 도시 주행, LiDAR 인식 성능을 높이는 6가지 데이터 전략

도심의 복잡한 환경에서 LiDAR 인식 성능 저하를 해결하기 위해 시나리오 중심의 데이터 확장과 정밀한 멀티 센서 정렬 및 시계열 라벨링 전략이 필수적이다.

코딩 없이 클릭만으로 Databricks 데이터 파이프라인 자동화하는 법

Microsoft Power Automate의 로우코드 환경에서 Databricks SQL 쿼리와 작업을 직접 트리거하여 거버넌스가 확보된 데이터 워크플로를 구축하는 방법을 다룹니다.

아마존, 에이전트 AI로 보안 규칙 생성 속도 336% 높였다

아마존은 멀티 에이전트 AI 시스템인 RuleForge를 통해 보안 취약점 탐지 규칙 생성 속도를 336% 가속화하고 오탐률을 67% 줄였습니다.

AI 에이전트가 내 코드를 더 잘 이해하게 만드는 지식 그래프 도구, LLM-Kasten

LLM-Kasten은 AI 에이전트가 프로젝트 지식을 효율적으로 검색하고 활용할 수 있도록 돕는 CLI 기반의 제텔카스텐 지식 관리 시스템입니다.