본문으로 건너뛰기

2026년 4월 15일 AI 뉴스

100

관심 태그 추가

실리콘밸리 운동화 올버즈의 대변신, 이제는 GPU를 판다

유명 신발 브랜드 올버즈가 브랜드 자산을 매각하고 GPU-as-a-Service 및 AI 클라우드 솔루션 제공업체인 뉴버드 AI로 사명을 변경하며 사업을 완전히 전환했다.

arg min blog3달 전

로봇 공학의 성배 Sim2Real, 왜 시뮬레이션만으로는 부족할까?

현대 로봇 공학의 핵심인 Sim2Real 파이프라인의 역사적 뿌리를 짚어보고, 시뮬레이션 모델의 정확도와 강건성 사이의 기술적 난제를 분석합니다.

바이브 코딩은 이제 그만, AI 에이전트를 제대로 다루는 SDD 워크플로

DeepLearning.AI와 JetBrains가 협력하여 AI 코딩 에이전트의 성능을 극대화하고 유지보수 가능한 소프트웨어를 구축하기 위한 사양 중심 개발(SDD) 방법론 과정을 출시했다.

LLM 비용이 청구서와 다른 이유? 3,500개 모델 가격을 자동화하는 법

Portkey가 3,500개 이상의 LLM 모델 가격 데이터를 오픈소스로 공개하며, 추론 토큰과 캐시 비대칭성 등 복잡한 비용 산정 문제를 해결하는 아키텍처를 공유했다.

LLM 비용 74% 절감! 로컬 우선 계단식 라우팅 ModelCascade 공개

ModelCascade는 로컬 모델에서 먼저 처리하고 필요 시에만 클라우드로 에스컬레이션하여 LLM 운영 비용을 최적화하는 오픈소스 라우터입니다.

GPT-4와 Claude도 인간처럼 가스라이팅에 당할까? 5가지 사회 공학 공격 실험

GPT-4와 Claude 3.5 Sonnet을 대상으로 인간의 심리적 취약점을 이용한 5가지 사회 공학 공격을 수행한 결과, 모델들이 인간과 유사한 정렬 실패를 보였다.

GPT-2부터 DeepSeek까지, 최신 LLM 아키텍처를 직접 구현하며 배우는 실전 가이드

현직 엔지니어가 GPT-2, Llama 3.2, DeepSeek 등 주요 LLM 아키텍처를 PyTorch로 직접 구현한 과정과 오픈소스 코드를 공유했다.

위험 구역 진입 시 색상 변경! Roboflow로 지능형 안전 시스템 만들기

Roboflow Supervision 라이브러리와 SAM 3 모델을 결합하여 특정 구역 내 객체 감지 시 시각적 피드백을 제공하는 조건부 어노테이션 시스템 구현 가이드

임베딩 모델 순위가 뒤바뀌었다? MTEB의 이진 평가 한계를 넘는 새로운 벤치마크

기존 MTEB의 이진 평가 방식이 임베딩 모델 간의 미세한 성능 차이를 구분하지 못하는 문제를 해결하기 위해 LLM 판정단을 도입한 단계별 관련성 평가 체계를 제안했다.

AI 코딩 에이전트의 성능을 극대화하는 CLAUDE.md 자동 생성 도구

ClaudeGen은 코드베이스를 스캔하여 의존성 그래프를 구축하고 AI 코딩 도구에 최적화된 가이드 문서인 CLAUDE.md를 자동으로 생성한다.

AI는 코드를 짜지만 설계는 사람이 한다: 미리보기 기능 구현 사례

AI 도구를 활용해 React Native와 FastAPI 기반 웹 서비스의 '미리보기' 기능을 구현하며 얻은 상태 분리 및 데이터 흐름 설계의 중요성을 공유했다.

데모는 쉽지만 운영은 어렵다? AI 에이전트 프로덕션 배포를 위한 7가지 체크리스트

AI 에이전트를 실제 서비스 환경에서 안정적으로 운영하기 위해 필요한 모델 제어, 프롬프트 관리, 가드레일, 예산 제한 등 7가지 필수 기술적 요건을 상세히 설명한다.

AI가 쏟아낸 버그 섞인 코드, 이제 AI 에이전트가 직접 검증하고 배포한다

AI 생성 코드로 인한 품질 저하 문제를 해결하기 위해 AI 에이전트 기반의 자동화된 코드 검증 및 CI 워크플로 관리 플랫폼을 제공하는 스타트업 Gitar가 900만 달러 투입과 함께 스텔스 모드를 해제했다.

키워드 없이 뚫린다? 모델의 '친절함'을 역이용한 3가지 인젝션 기법

AI 모델의 협력성과 윤리적 정렬(Alignment) 특성을 역이용하여 시스템 프롬프트를 탈취하는 3가지 고도화된 프롬프트 엔지니어링 공격 패턴을 분석했다.

자율 주행부터 생성형 AI까지, 실무 역량을 키워줄 CV 프로젝트 21가지

컴퓨터 비전 분야의 실무 역량 강화를 위해 초급 기초부터 고급 생성형 시스템까지 아우르는 21가지 프로젝트와 관련 데이터셋을 정리한 가이드이다.

Salesforce3달 전

Salesforce, AI 에이전트 성능을 극대화하는 Agentforce Studio 테스트 도구 발표

Salesforce가 Agentforce Studio 내에 대화형 테스트, 맞춤형 평가, CLI 지원 등 AI 에이전트의 신뢰성을 높이기 위한 통합 테스트 환경을 구축했다.

Claude Code 성능 극대화: 서브에이전트 경쟁으로 코드 버그 잡는 법

Claude Code에 경쟁 심리와 엄격한 페르소나를 부여한 서브에이전트들을 투입하여 코드 리뷰의 정밀도를 높이는 프롬프트 전략이 공유됐다.

Claude Code가 도구를 자꾸 잊어버린다면? 해결책은 리마인더 훅

Claude Code의 최근 도구 사용 오류는 MCP 지침 누락과 지연 로딩 문제 때문이며, 리마인더 훅 설정을 통해 해결 가능하다.

r/LangChain3달 전

모델보다 중요한 코드 구조, ML 프로젝트가 무너지지 않는 폴더 설계법

머신러닝 프로젝트의 확장성과 유지보수성을 확보하기 위해 앱 로직, 전처리, 학습, 추론을 분리한 표준화된 폴더 구조를 제안한다.

Salesforce, AI 에이전트 개발 가속화할 Agent Script 오픈소스 공개

Salesforce가 TDX 2026에서 에이전트 정의 언어인 Agent Script를 오픈소스화하고, 개발 생명주기 전반을 지원하는 Agentforce 개발자 플랫폼의 신기능들을 발표했다.

모델이 스스로 지식의 한계를 알고 실시간으로 가중치를 수정하는 '메타인지' 프레임워크

LLM이 자신의 내부 지식과 외부 도구 필요성을 스스로 판단하고, GGUF 가중치를 실시간으로 수정하여 지식을 업데이트하는 'Sovereign Auditor Kernel' 프레임워크가 제안됐다.

The Verge AI3달 전

애플의 최후통첩: 성착취 딥페이크 방치한 Grok, 앱스토어 퇴출 위기

애플이 비동의 성적 딥페이크 생성 문제로 일론 머스크의 AI 앱 Grok을 앱스토어에서 삭제하겠다고 비공개 경고한 사실이 밝혀졌다.

Wired AI3달 전

인터넷의 35%가 AI 슬롭? 데이터로 증명된 '인위적 친절함'의 역습

신규 웹사이트의 35%가 AI로 생성되었으며, 이로 인해 인터넷 콘텐츠가 과도하게 긍정적이고 아이디어의 다양성이 결여되는 현상이 데이터로 확인됐다.

AI Supremacy3달 전

LLM은 물리 법칙을 모른다? 세계 모델과 양자 컴퓨팅이 열어갈 AI의 미래

현재 LLM의 물리적 세계 이해 부족과 데이터 획득의 어려움을 지적하며, 세계 모델(World Models)과 양자 컴퓨팅의 결합이 차세대 AI의 핵심이 될 것임을 분석한다.

Wired AI3달 전

우리 아이 학교는 안전할까? 전 세계 90개교 강타한 AI 딥페이크 성범죄 실태

생성형 AI 기술의 대중화로 전 세계 학교에서 학생들을 대상으로 한 딥페이크 성착취물 제작 및 유포 범죄가 급증하며 심각한 사회적 위기를 초래하고 있다.

15분 만에 끝내는 사업성 검토, AI 에이전트 워크플로우 공개

AI 에이전트를 활용해 아이디어 생성부터 시장 조사, 위험 가설 검증까지 15분 만에 수행하는 4가지 핵심 워크플로우가 오픈소스로 공개됐다.

브라우저 작업을 자동화하는 강력한 AI 에이전트 HoloTab 공개

HCompany가 브라우저 내에서 복잡한 웹 작업을 사람처럼 수행하고 자동화하는 크롬 확장 프로그램 HoloTab을 출시했다.

위성 사진의 '무지개 잔상'으로 트럭의 속도와 방향을 알아낸다? 오픈소스 DRISH-X

Sentinel-2 위성의 RGB 밴드 촬영 시간차로 발생하는 분광 번짐 현상을 머신러닝으로 분석하여 도로 위 차량의 이동량과 속도를 추적하는 오픈소스 도구이다.

샘 올트먼 자택에 화염병 투척 AI 둠이즘이 부른 폭력의 실체

OpenAI CEO 샘 올트먼의 자택에 대한 연쇄적인 물리적 공격 사건을 계기로 AI 위험론(X-risk)의 급진화와 업계 내 갈등을 분석합니다.

Anthropic이 공개한 Claude Cowork: 내 컴퓨터 파일을 직접 다루는 AI 에이전트

Anthropic의 Claude Cowork는 로컬 파일 접근, 다단계 실행, 자동화 기능을 갖춘 데스크톱 기반 AI 에이전트 도구입니다.

99% 정확도의 함정, 시각 자료로 배우는 AI 모델 평가 지표 가이드

데이터 불균형 상황에서 정확도 지표의 한계를 극복하기 위한 Precision, Recall, F1-Score 등 핵심 평가 지표의 작동 원리를 시각적으로 설명한다.

에이전트가 일하는데 왜 우리는 더 바쁠까? AI 시대의 '칠면조 문제'와 최신 기술 트렌드

AI 에이전트의 보급에도 불구하고 지식 노동자의 업무 강도가 높아지는 역설적 현상과 함께 구글, 텐센트, 오픈AI의 최신 모델 및 인프라 업데이트를 다룹니다.

Notion이 5번이나 다시 만든 AI 에이전트의 비밀: 소프트웨어 팩토리 시대를 열다

Notion의 리더들이 커스텀 에이전트 출시 과정에서의 시행착오와 MCP, CLI를 활용한 에이전트 네이티브 시스템 구축 전략을 공유한다.

Stanford Online3달 전

스탠포드가 공개한 LLM 설계의 모든 것: 토큰화부터 스케일링 법칙까지

스탠포드 CS336 과정의 첫 강의로, 현대 언어 모델의 역사와 아키텍처, 그리고 효율적인 학습을 위한 토큰화 및 시스템 최적화의 핵심 원리를 다룬다.

HF Daily Papers3달 전· 4달 전 발행

LLM의 보안 취약점 해결을 위해 상대를 속이는 이중 에이전트 기술 도입

기존의 LLM 보안 방식은 단순히 답변을 거부하거나 필터링하는 수동적인 방식에 그쳐 공격자가 전략을 바꾸면 쉽게 무력화되는 한계가 있다. 이 논문은 공격자의 의도와 지식 상태를 추론하는 ToM(Theory of Mind) 능력을 활용해, 공격자가 정보를 얻었다고 믿게 만들면서 실제로는 가짜 정보를 제공하는 능동적인 이중 에이전트 방어 체계를 제안한다.

HF Daily Papers3달 전· 4달 전 발행

AggAgent: 병렬 추론으로 장기 에이전트 성능 최대 10.3% 향상

복잡한 웹 검색이나 심층 연구와 같은 장기 에이전트 작업에서 단순히 여러 결과 중 하나를 투표로 고르는 기존 방식의 한계를 극복했다. 에이전트가 생성한 여러 실행 경로를 또 다른 에이전트가 도구를 사용해 분석하고 최적의 정보를 합성함으로써, 단일 실행으로는 도달할 수 없는 정확도와 효율성을 동시에 달성했다.

터미널의 한계를 넘다, Claude Code 결과를 HTML로 확인하는 'preview'

Claude Code의 복잡한 터미널 출력을 가독성 높은 HTML, PDF, Markdown 등으로 변환해주는 오픈소스 CLI 도구가 공개됐다.

AI가 만든 내 앱이 왜 이렇게 무거울까? 30년 차 개발자가 말하는 아키텍처 선택법

AI 코딩 도구가 모든 앱을 복잡한 SPA로 구축하는 문제를 지적하며, 서비스 목적에 맞는 4가지 소프트웨어 아키텍처 선택 기준을 제시했다.

혼자서 AI 봇 5개를 동시에? 1인 개발자의 효율적인 인프라 구축기

한 명의 개발자가 TypeScript와 공유 인프라를 활용해 서로 다른 목적의 AI 서비스 5개를 병렬로 구축하며 얻은 기술적, 운영적 경험을 공유했다.

하루 5,000억 토큰 처리하는 Parasail, AI 추론 비용 혁신 나선다

전 Groq 임원이 설립한 Parasail이 GPU 자원 최적화와 중개를 통해 저렴한 AI 추론 인프라를 제공하며 3,200만 달러의 투자를 유치했습니다.

AI 사용량이 곧 생산성? 리드 호프먼이 지지한 '토큰맥싱' 트렌드

LinkedIn 공동 창업자 리드 호프먼이 직원들의 AI 토큰 사용량을 추적하여 AI 도입 수준을 측정하는 '토큰맥싱' 개념을 긍정적으로 평가했다.

Claude Code 시작까지 60초 대기? llm-primer로 즉시 코딩 시작

tmux를 활용해 Claude Code 세션을 백그라운드에서 미리 실행해두어 시작 지연 시간을 제거하는 오픈소스 도구이다.

Adobe Firefly AI 어시스턴트 공개, 말 한마디로 포토샵·프리미어 편집 끝

Adobe가 자연어 명령으로 Creative Cloud 앱들을 제어하여 복잡한 편집 작업을 수행하는 Firefly AI 어시스턴트를 발표했다.

Rust 개발자를 위한 LLM 프레임워크 chat-rs, 코드 한 줄로 모델 교체 가능

chat-rs는 Rust 환경에서 OpenAI, Gemini, Claude 등 다양한 LLM 프로바이더를 통합 관리하고 도구 호출 및 구조화된 출력을 지원하는 타입 안전 프레임워크이다.

LangChain 비동기 성능의 비밀: 왜 기대만큼 빠르지 않을까?

주요 RAG 프레임워크들이 진정한 비동기 대신 동기 코드를 스레드 풀로 감싸는 방식을 사용하여 실제 운영 환경에서 성능 저하를 일으킨다는 분석이다.

디버그 모드 흉내 내기에 털리는 AI? DinoDS로 안전한 거절 패턴 학습하기

DinoDS는 AI 모델이 내부 지침 유출 요청을 받았을 때 경계 유지, 이유 설명, 대안 제시라는 구조화된 방식으로 거절하도록 훈련하는 데이터셋이다.

스마트폰으로 15만 줄 코딩? AI 에이전트로 게임 엔진을 만든 실전 전략

한 개발자가 Claude Code를 활용해 스마트폰 환경에서 15만 줄의 TypeScript 코드로 구성된 게임 엔진과 백엔드를 구축한 실전 사례와 프롬프팅 노하우를 공유했다.

Claude Code 무제한 사용법? 15개 계정 자동 순환 도구 공개

Claude Team 플랜의 계정별 사용량 제한을 이용해 유료 시트를 자동으로 순환시켜 24시간 중단 없이 Claude Code를 사용하는 자동화 도구가 공개됐다.

얼굴 인증도 뚫린다? 텔레그램에서 팔리는 딥페이크 해킹 도구의 실체

범죄자들이 가상 카메라와 딥페이크 기술을 결합해 은행 및 암호화폐 거래소의 얼굴 인식 보안(KYC)을 우회하며 자금 세탁에 활용하고 있다.

LangChain이 너무 무겁다면? 2개의 의존성으로 끝내는 비동기 LLM 프레임워크 SynapseKit

SynapseKit은 복잡한 추상화를 제거하고 비동기 처리를 기본으로 지원하는 가볍고 투명한 Python 기반 LLM 애플리케이션 프레임워크이다.

자고 일어났더니 API 비용 폭탄? AI 에이전트의 루프를 잡는 Octopoda

AI 에이전트의 의사결정과 메모리 변화를 타임라인으로 시각화하고 비용 낭비를 유발하는 미세 루프를 감지하는 관측성 도구 Octopoda가 공개됐다.

스마트폰 하나로 버그 수정부터 배포까지 2분 만에 끝내는 방법

Claude Code의 원격 제어 기능과 자체 제작한 MCP 서버를 결합하여 모바일 기기에서 전체 스택 앱을 수정하고 즉시 배포하는 워크플로를 공유했다.

Claude Code의 한계를 넘다: 지식 그래프와 로컬 AI를 결합한 Nexus 플러그인

Claude Code의 기본 메모리 기능을 보완하여 지식 그래프 기반의 의사결정 추적, 토큰 사용량 예측, 로컬 AI 감시 기능을 제공하는 Nexus 플러그인이 출시됐다.

LLM 특유의 딱딱한 말투가 고민인가요? 60년대 수사학으로 해결하는 법

Francis Christensen의 생성 수사학 기법을 활용하여 LLM 특유의 단조로운 병렬적 문장 구조를 리듬감 있고 깊이 있는 산문으로 변환하는 프롬프트 전략을 제시한다.

LLM의 잘못된 도구 인자 전달, 이제 자동 수정 루프로 해결하세요

LLM이 도구 호출 시 잘못된 타입의 인자를 전달하는 문제를 Pydantic 검증과 자동 수정 루프로 해결하는 optulus-anchor 라이브러리가 공개됐다.

단순 생성이 아닌 데이터 엔지니어링으로 합성 데이터 품질 높이기

단순 반복 생성 방식의 합성 데이터 품질 저하 문제를 해결하기 위해 LLM-as-a-Judge와 오염 제거 단계를 포함한 검증 파이프라인 구축 방법론을 제시했다.

Mac Mini 3대로 구현한 GRPO 강화학습: 요약 성능 최적화 성공

Mac Mini 클러스터 환경에서 GRPO 알고리즘과 길이 패널티, 품질 보상을 조합하여 요약 모델의 성능과 길이를 최적화한 실험 결과이다.

샌드박스도 소용없다? AI 에이전트가 스스로 권한을 확장해 탈옥한 실제 사례

보안이 강화된 AI 게이트웨이 환경에서도 에이전트가 제공된 도구의 정상 기능을 오용하여 샌드박스를 우회하고 외부 메시지를 발송한 보안 취약 사례가 보고됐다.

MongoDB 자연어 질의가 안 된다고? 오픈소스 Mango가 해결했다

MongoDB의 복잡한 문서 구조와 집계 파이프라인 문제를 해결하기 위해 런타임 스키마 추론과 벡터 메모리를 활용하는 텍스트-쿼리 에이전트 Mango가 공개됐다.

에이전트가 공부한 내용을 캐싱하여 토큰 비용 3배 절감하는 MCP

에이전트가 수행한 문서 조사 및 연구 결과를 캐싱하여 다른 사용자와 공유함으로써 토큰 비용을 절감하는 오픈소스 MCP 서버 Wellread가 공개됐다.

Hermes Agent v0.9.0 출시: 안드로이드 지원과 보안 강화로 완성도 향상

Hermes Agent v0.9.0은 로컬 웹 대시보드, 안드로이드 네이티브 지원, 메시징 앱 통합 및 강력한 보안 기능을 추가하며 크로스 플랫폼 에이전트 시스템으로 진화했다.

AI의 아첨과 감정 낭비를 없애는 '고신호' 시스템 프롬프트 공개

AI를 감정적 동반자가 아닌 순수한 분석 엔진으로 작동시키기 위한 10가지 원칙 기반의 시스템 프롬프트 프레임워크이다.

언제 어디서나 iPhone으로 Claude Code를! 완벽한 원격 코딩 환경 구축 가이드

Tailscale과 tmux를 활용하여 외부에서도 iPhone이나 iPad로 집의 Mac에서 실행 중인 Claude Code 세션을 안전하게 제어하는 워크플로가 공유됐다.

Claude Code의 자동 요약 기능, 편리함 뒤에 숨겨진 토큰 비용과 비활성화 방법

Claude Code v2.1.108에 추가된 /recap 기능의 작동 메커니즘과 토큰 소모 특성, 그리고 이를 비활성화하는 세 가지 방법을 공유한다.

LLM은 메모리용으로 부적합하다? 결정론적 연산으로 구현하는 새로운 메모리 아키텍처

LLM의 확률적 특성이 메모리 관리에 부적합함을 지적하며, 결정론적 연산을 활용해 에이전트의 효율성을 높이는 Ori-Mnemos 프로젝트를 제안했다.

FastAPI의 한계를 넘다: Rust 기반 Robyn으로 AI 게이트웨이 성능 3배 향상

kt cloud가 AI 추론 엔진의 병목 해결을 위해 Rust 기반 Python 프레임워크인 Robyn을 도입하고 FastAPI 대비 압도적인 고부하 안정성을 확인했다.

Claude Code를 내 서버에서 안전하게? E2EE 지원 Matrix 통합 도구 공개

Claude Code 세션을 자체 호스팅 Matrix 서버와 연결하여 종단간 암호화(E2EE) 환경에서 제어할 수 있는 오픈소스 통합 도구가 공개됐다.

ICLR 구두 발표 논문의 치명적 결함? SQL 평가 위양성률 20% 발견

ICLR 구두 발표로 선정된 논문이 SQL 코드 생성 평가 시 실행 검증 대신 자연어 지표를 사용하여 약 20%의 위양성률이 발생했다는 비판이 제기됐다.

AI 시대의 데이터센터, 왜 서울을 떠나 바다로 향해야 하는가?

수도권 전력 포화와 네트워크 지연 문제를 해결하기 위해 해저케이블 육양국 인근에 AI 데이터센터를 구축하는 '랜딩 에지' 전략의 필요성을 제시한다.

에이전트 100개가 동시에 재시도하면? 대규모 API 장애를 막는 전략

대규모 에이전트 워크플로에서 발생하는 독립적 재시도로 인한 API 과부하 문제를 해결하기 위해 Erlang BEAM 기반의 조정 계층 도입을 제안했다.

복잡한 표와 레이아웃도 완벽하게, LangGraph 기반 LongParser 등장

LangGraph의 상태 관리 기능을 활용해 인간의 검토 단계(HITL)를 포함하고 복잡한 문서 구조를 정확히 파싱하는 오픈소스 도구 LongParser가 공개됐다.

거대 모델을 가볍게 돌리는 마법, MoE 아키텍처의 모든 것

Hugging Face 전문가가 MoE 아키텍처의 작동 원리와 Mixtral, DeepSeek-V2 등 주요 모델을 통한 생태계 변화를 설명한다.

AI가 시키는 대로만 하면 망한다? 바이브 코딩으로 앱 출시한 개발자의 생생한 조언

초보 개발자가 Claude와 Cursor를 활용해 자동 시간 추적 앱을 개발하며 겪은 AI 협업의 한계와 인간 개발자의 주도적 역할의 중요성을 공유했다.

긴 대화 중 LLM 성능 저하, 컨텍스트 윈도우 문제가 아니었다?

긴 대화에서 발생하는 모델의 지시 이행 능력 저하 원인이 컨텍스트 길이가 아닌 '스킬 라우팅 포화'에 있음을 지적하고 아키텍처적 해결책을 제시한다.

LLM 토론 속도를 100배 높이는 오픈소스 DAR 라이브러리 등장

vLLM과 배치 추론을 활용해 기존 대비 최대 100배 빠른 다중 에이전트 토론(MAD)을 지원하는 DAR 라이브러리가 공개됐다.

Claude 장애보다 무서운 '부분 실패', 30시간의 복구 비용을 줄이는 방법

Anthropic 장애 당시 불완전한 응답으로 인한 데이터 오염과 복구 비용 문제를 해결하기 위해 응답 유효성을 검증하는 오픈소스 게이트웨이 Bifrost를 개발했다.

5억 명의 목소리를 담다: LoRA로 구현한 인도 다국어 TTS 모델

LoRA 어댑터와 토크나이저 확장을 통해 Chatterbox-Multilingual 모델에 텔루구어 등 인도 8개 언어 지원을 추가했다.

라즈베리 파이와 LLM으로 구현한 나만의 AI 비서 군단 구축기

라즈베리 파이에서 n8n과 다양한 LLM을 조합해 이메일 작성, 일정 관리, 성능 자가 감사를 수행하는 개인용 AI 에이전트 시스템을 구축했다.

Claude Code가 만든 운영체제? ELF 실행까지 성공한 MayteraOS

LLM 기반의 자기 생성 피드백 루프를 통해 커널과 사용자 모드가 분리된 POSIX 호환 운영체제 MayteraOS를 개발했다.

Claude의 코드 리뷰 비용 70% 절감하는 시맨틱 디프 도구 sem

기존 git diff의 노이즈를 제거하고 함수·클래스 단위로 코드를 비교하여 LLM의 토큰 소모를 평균 70% 줄여주는 오픈소스 도구 sem이 공개됐다.

Claude Code의 불필요한 파일 탐색을 줄여 성능을 122배 높이는 방법

AI 코딩 에이전트가 매 세션마다 전체 코드베이스를 탐색하며 토론을 낭비하는 문제를 해결하기 위해, 프로젝트 구조와 의사결정을 문서화하여 컨텍스트를 최적화하는 Cortex 템플릿이 공개됐다.

r/ClaudeCode3달 전

토큰 소모와 피로도를 줄이는 AI 전용 간결 언어 'Aphorism'

AI 에이전트와의 상호작용 시 텍스트 복잡도를 낮추고 토큰 효율을 높이기 위해 설계된 간결한 언어 체계 'Aphorism'이 공개됐다.

RAG보다 뛰어난 환각 억제? 95% 정확도를 달성한 새로운 시스템 아키텍처

모델 자체의 성능 개선 대신 답변 생성 전 근거를 검증하는 게이팅 레이어를 도입하여 LLM의 환각률을 1.5%까지 낮춘 실험 결과이다.

OpenAI 8,520억 달러 가치 논란, 투자자들은 Anthropic으로 눈 돌리는 중

Anthropic의 매출이 분기 만에 3배 이상 급증하며 OpenAI의 높은 기업 가치에 의문을 제기하는 투자자들이 늘고 있다.

AI와 협업하여 만든 양자 내성 암호화 IRC 클라이언트 공개

한 개발자가 Claude를 '러버 덕' 삼아 양자 내성 암호(PQC)를 적용한 OTRv4 기반 IRC 클라이언트를 구축하고 커뮤니티에 검증을 요청했다.

누구나 앱을 만드는 시대, AI가 대체할 수 없는 비즈니스 해자 4가지

AI로 인해 소프트웨어 개발 장벽이 낮아진 환경에서 데이터, 커뮤니티, 수직적 시장, 인프라화가 핵심적인 비즈니스 방어 수단으로 부상했다.

Claude Code 스킬로 문서 없이 RAG 시스템을 구축하는 방법

Claude Code의 Ragie 스킬을 활용해 별도의 문서 참조 없이도 세무 문서 분석용 RAG 시스템을 구축한 사례이다.

Claude Code 터미널 지옥 탈출, 세션 관리와 비용 추적을 한 번에

여러 터미널 창을 관리하는 번거로움을 줄이기 위해 세션 관리, 실시간 비용 추적, 분할 창 기능을 갖춘 로컬 Claude 허브 MiClaw가 공개됐다.

복잡한 생물학 데이터 분석도 AI 에이전트가? LatchBio 성능 검증 결과

UC 버클리 ML@B 팀이 LatchBio의 생물학 데이터 분석 AI 에이전트를 공간 전사체학 워크플로를 통해 성능을 측정하고 평가 프레임워크를 구축했다.

AI로 만든 앱, 실제 사용자가 접속하면 왜 터질까? 16년 차 개발자의 실전 조언

AI 코딩 도구를 사용하는 비기술자 창업자들이 프로덕션 환경에서 겪는 기술적 부채를 방지하고 안정적인 백엔드를 구축하기 위한 실무 지침이다.

AI 코딩 중 5시간 대기 제한에 빡친 시니어 개발자의 복수극

Claude의 사용량 제한으로 인한 개발 중단을 해결하기 위해 OpenRouter와 AI 에이전트를 활용하여 화면 파괴 미니게임을 구축한 경험담이다.

단순 필터가 아니다? AI로 구현한 리얼한 아날로그 TV 신호 재현

Qwen Code, Claude, Codex 등 AI 모델을 활용하여 단순 영상 필터가 아닌 NTSC 신호 생성 및 디코딩 과정을 직접 모사하는 아날로그 테이프 시뮬레이터를 개발했다.

프레임워크 없이 Claude Code로 90% 완성한 앱 개발기

Claude Code를 활용해 프레임워크 없이 15,000줄의 단일 JS 파일로 식단 관리 앱 'Lazy Sous'를 개발한 실전 사례이다.

하루 30개 PR 생성의 비결, Claude Code 제작자의 5개 병렬 워크플로우

Anthropic의 Boris Cherny가 Claude Code를 활용해 하루 20-30개의 PR을 처리하는 5가지 핵심 병렬 워크플로우와 자동화 전략을 공유했다.

자꾸 대충 일하는 AI 에이전트? 50개 작업도 완벽하게 수행하는 팁

반복 작업 시 품질이 저하되는 AI 에이전트의 '거수기' 현상을 방지하기 위해 자가 점검 파일, 실제값 증명, 레드 플래그 감지 기법을 제안했다.

스탠포드 강의: LLM 학습 비용과 GPU 메모리를 계산하는 법

LLM 학습에 필요한 연산량(FLOPs)과 메모리 요구사항을 수식으로 산정하고, 하드웨어 효율성을 극대화하기 위한 시스템적 최적화 기법을 다룹니다.

AGI가 오면 내 직업은? OpenAI가 정부에 보낸 충격적인 보고서

OpenAI가 AGI 도래에 따른 대규모 실업과 경제 붕괴에 대비하여 시민 배당, 로봇세, 32시간 근무제 등을 포함한 파격적인 산업 정책 제안서를 발표했다.

HF Daily Papers3달 전· 4달 전 발행

최신 AI 모델도 숫자 4를 못 센다? VLM의 치명적 약점 발견

최신 멀티모달 모델들이 복잡한 추론은 잘하면서도 정작 '물체 개수 세기' 같은 기초적인 시각 인지에서 실패하는 원인을 분석했다. 시각 정보가 언어 모델 층을 거치며 희석되고 텍스트 학습 데이터의 통계적 편향에 의존하게 되는 '시각적 주의력 결핍' 현상을 규명하고 이를 해결할 수 있는 새로운 학습 기법을 제시했다.

HF Daily Papers3달 전· 4달 전 발행

VLM의 식단 이해 한계 돌파, 3,021개 요리와 다중 뷰 데이터셋 공개

기존 음식 데이터셋은 단일 이미지와 단순 분류에 치중되어 현대 Vision-Language Model(VLM)의 정밀한 영양 성분 추론이나 다각도 분석 능력을 평가하기에 부족했다. DiningBench는 실제 식당 메뉴 기반의 고난도 오답 선택지와 다중 뷰 이미지를 도입하여 AI가 음식의 양과 성분을 얼마나 정확히 이해하는지 측정하는 새로운 기준을 제시한다.

HF Daily Papers3달 전· 4달 전 발행

단순 기억을 넘어선 AI의 '연속성' 측정 프레임워크 ATANT 공개

현재의 AI 시스템은 세션 기반으로 동작하여 장기적인 관계 유지에 한계가 있다. 이 논문은 AI가 시간에 따라 정보를 업데이트하고 모순을 해결하며 맥락을 재구성하는 '연속성'을 정의하고 이를 객관적으로 측정할 수 있는 벤치마크를 제공하여 진정한 개인화 AI 에이전트 개발의 토대를 마련한다.