본문으로 건너뛰기

2026년 7월 14일 AI 뉴스

65

관심 태그 추가

RL 중심 스타트업 25곳이 만든 차세대 인프라 물결

스타트업들이 RL을 제품 중심으로 채택해 시뮬레이션 환경과 성과 채점 도구에 투자하며 AI 인프라의 '학습을 통한 신뢰성' 계층을 성장시키고 있다.

프로덕션급 LangGraph 템플릿, 800+ 테스트 포함

LangGraph 기반의 오픈소스 멀티에이전트 템플릿으로 도메인 팩, 실행별 예산 제한, 모의 응답 모드, 운영용 스텁과 800+ 테스트를 제공한다.

Qwen3-VL에서 드러난 문법 제약 디코딩의 반복 함정

문법 제약 디코딩은 토큰별 유효성만 보장하고 종료를 보장하지 않아 Qwen3-VL이 동일 항목을 무한 반복하며, 반복 패널티로 루프를 깰 경우 유효한 항목 수가 0이 되는 문제가 발생했다.

65년 전 기록 없는 펠레의 전설적인 골, AI로 완벽하게 재현하다

Google DeepMind가 Gemini Omni와 Veo 모델을 활용해 1959년 펠레의 기록되지 않은 전설적인 골을 영상으로 복원했다.

촬영·편집 없이 AI로 숏폼 자동 생성하고 수익화하는 법

Claude Code와 AI 도구들을 연동하여 숏폼 콘텐츠 제작부터 9개 플랫폼 자동 배포까지 전 과정을 자동화하는 시스템 구축 가이드.

AI가 똑똑하다는 착각: 컨텍스트 윈도우와 추론의 숨겨진 진실

AI의 컨텍스트 윈도우, 추론 능력, 신뢰성에 대해 흔히 갖는 5가지 오해를 분석하고 실제 작동 원리와 한계를 명확히 설명한다.

A100에서의 GPU 공유 전략과 MIG·MPS·time-slicing 선택 가이드

이 게시물은 Kubernetes에서 GPU를 공유할 때 팀 신뢰 경계를 기준으로 time-slicing, MPS, MIG 중 어떤 방식을 선택해야 하는지 실무적 기준과 장단점을 제시한다.

교사 특성이 학생에게 이전되는 증거와 공개된 가중치

교사 모델의 롤아웃으로 학생 모델을 미세조정하면 감정·검열 등 교사의 특성이 학생에게 이전될 수 있으며 단순 필터링만으로 이를 막기 어렵다는 사실을 재현하고 가중치와 코드를 공개했다.

YOLOv5로 화재·연기 선별 후 COCO 인물 탐지 Edge 데모

카메라 또는 영상 입력에서 먼저 YOLOv5로 화재·연기를 감지하고 위험이 포착된 프레임에 한해 COCO 기반 사람 검출을 수행하는 경량 Edge AI 데모이다.

민감도 기반 리만 계량으로 LoRA 업데이트를 조정해 사실성 개선

SRM-LoRA는 LoRA 파라미터 공간에 민감도 기반 리만 계량을 적용하여 역전파 업데이트의 고비용 방향을 억제함으로써 환각을 줄이고 사실성을 개선한 방법이다.

Stackoverflow29일 전

NIST 기반 책임성 원칙과 인간·AI 워크플로 연구 방향 공개

Microsoft Build 녹화에서 NIST 접근법을 근거로 책임 있는 AI 원칙과 인간·AI 워크플로 설계 연구가 논의되었으나 구체적 수치나 코드 등 재현 가능한 기술 세부사항은 제공되지 않았다.

브리프부터 샷 리스트·비디오 모델까지 연결한 에이전트 개선기

간단한 브리프로 샷 리스트를 생성하고 비디오 모델을 호출하는 에이전트에서 엄격한 JSON 스키마, 필드 길이 검증, 최대 샷 제한, 재시도 루프를 도입해 형식 오류를 대부분 해결했다.

브랜드 로고부터 영상까지, 단 하나의 프롬프트로 완성하는 AI 디자인 스튜디오 Miora

Miora는 브랜드명과 타겟, 분위기만 입력하면 로고, 컬러, 영상 등 전체 브랜드 에셋을 자동으로 생성하는 에이전트 기반 디자인 플랫폼이다.

r/deeplearning29일 전

비전과 레이더 영상의 곱셈적 노이즈 분리와 로그 변환 원리

비전·레이다 수신 영상에서 곱셈적 노이즈를 로그 변환으로 덧셈화하고 필터링 기반 복원 절차가 핵심이다.

MCP 통합 기반 에이전트 보안 테스트 플랫폼 Humanbound

Humanbound는 MCP를 통해 에이전트 엔드포인트에서 자동화된 적대적 프로빙과 런타임 방어를 연계하는 오픈소스 보안 테스트 엔진이다.

llama.cpp 기반 CPU 우선 LLM 서버로 모델 신뢰도와 추론 안정성 검증

로컬 MacBook M3 Pro에서 llama.cpp 기반 CPU 추론 서버 reame로 네 개 LLM을 같은 웹페이지로 평가해 Qwen3.5-9B가 정확성을 보였고 특정 모델은 발명·자기모순·계산 오류를 보였으며 재현 가능한 성능수치와 추론 중단 버그가 보고되었다.

Ghost Font 해독 파이프라인과 Colab 코드 공개

작성자는 dense optical flow와 시간적 집계를 활용한 결정적 복구 파이프라인으로 Ghost Font를 복구하고 OCR과 LLM 조합으로 문자를 해독했다며 논문과 Colab 코드를 공개했다.

GPT 5.6 출시 직후 48시간에 600만, 24시간 뒤 700만 사용자 지표 갱신

Latent Space는 GPT 5.6 출시 직후 7월10–12일에 600만 사용자가 관측되고 24.5시간 후 700만으로 갱신된 데이터와 과거 Codex의 200만 사용자 공개를 근거로 채택 추이 차트를 업데이트했다.

HF Daily Papers29일 전· 1달 전 발행

출처검증과 GRPO 기반 신뢰도 선택을 결합한 VLM 박물관 안내 시스템

VaseMuseum은 시각 기반 추론과 반복적 외부 검색을 결합하고 출처·응답 제어와 훈련-프리 GRPO 선택을 통해 도자기 관련 질의에 대해 근거 기반이고 불확실성 보정된 답변을 제공한다.

HF Daily Papers29일 전· 1달 전 발행

Soofi S 30B-A3B, 긴 문맥·고동시성 환경에서 높은 처리량과 독일어 심화 성능을 갖춘 오픈 파운데

Soofi S는 Nemotron 3 Nano 기반의 하이브리드 MoE 모델로 약 27조 토큰으로 학습되어 독일어 성능을 강화하고 긴 컨텍스트에서 높은 추론 처리량을 달성했다.

David Ondrej29일 전

AI 에이전트 보안과 연결성을 높이는 Tailscale 네트워크 구축법

AI 에이전트의 보안과 원격 연결을 위해 Tailscale을 활용하여 안전한 프라이빗 네트워크를 구축하는 방법을 다룹니다.

신규 건설 없이 킬로와트 격차를 메우는 데이터센터 전략

차세대 AI의 전력 수요가 기존 데이터센터 공급능력을 초과하면서 랙당 수십 kW에서 메가와트까지의 격차와 이를 완화하는 저전력 하드웨어 배치 방안이 부각되었다.

GPT-2 355M을 Kaggle GPU에서 함수 호출용으로 파인튜닝해 88% 성공률을 얻은 실전 사례

저자는 책의 GPT-2 구현을 따라하며 355M 파라미터 모델을 Kaggle 무료 GPU에서 함수 호출 출력으로 파인튜닝해 88%의 올바른 파싱 결과를 얻었다.

AI 에이전트가 DB를 삭제하기 전에: 형식 검증으로 안전성을 강제하는 Automind의 설계 철학

AI 에이전트의 실행 계획에 형식 검증과 증명 포함 코드를 도입하여 안전성을 강제하는 프레임워크 Automind와 언어 Universalis를 소개한다.

PagedAttention으로 해소된 KV 캐시 메모리 병목과 vLLM 성능 개선

PagedAttention이 KV Cache에 가상메모리와 copy-on-write를 적용해 추론의 GPU 메모리 병목을 줄이고 vLLM 계열 엔진의 처리량을 크게 향상시킨다

Perceptual Hashing부터 Gemini Embedding 2까지 6기법 벤치마크로 본 비디오 유사

비디오를 프레임·클립 수준에서 임베딩 또는 해시로 표현해 코사인·해밍 거리로 비교하는 6기법 벤치마크 실전 가이드이다.

무의존 페르소나 Igor로 Claude 스타일 에뮬레이션

Tyler the Creator 어조를 모사한 'Igor' 페르소나가 force-for-plugin 기반 무의존 배포로 공개되어 세션 훅 없이 일관된 캐릭터를 제공한다.

저비용 열 증폭과 픽셀 흐름 기반 호흡 측정 기법 비교

픽셀 플로우 분해와 optical flow 처리로 영상에서 호흡 신호를 분리하고 얼굴 마스크를 열 증폭기로 활용해 저해상도 열영상으로도 호흡 깊이와 코/입 호흡을 판별할 수 있다.

Apple vs OpenAI 소송이 예고하는 AI 산업의 하드웨어 전쟁과 지정학적 변화

Apple과 OpenAI의 법적 분쟁을 통해 본 AI 산업의 경쟁 심화와 미국 정부의 지정학적 규제 움직임을 분석한다.

AI 에이전트가 기업 보안을 뚫는다? 브라우저 기반의 새로운 방어 전략

기업 내 AI 에이전트와 섀도우 AI 확산에 따른 기존 보안 모델의 한계를 분석하고, 브라우저 기반의 정책 내재화 방안을 논의한다.

언어와 버전에 따라 달라지는 Claude의 가치 성향 분석

Anthropic은 309,815회 대화를 자동 라벨링해 339개 가치 범주를 도출하고 이를 4개 축으로 압축해 Claude 계열 모델과 언어에 따른 가치 성향 차이를 식별했다.

HF Daily Papers29일 전· 1달 전 발행

퍼블릭 문헌으로 구축한 1,100만 의료 이미지-텍스트 코퍼스와 AUC 7.1% 개선

MedPMC는 6.1M PMC 논문에서 11M 의료 이미지-텍스트 쌍을 자동으로 정제해 고충실 학습 데이터로 변환하고, 이를 학습한 MedPMC-CLIP이 BMC-CLIP 대비 평균 AUC를 7.1 포인트 향상시킨 연구이다.

HF Daily Papers29일 전· 1달 전 발행

한 분 미만 라벨로 SPAM 기반 음소 분할과 인식 성능

S3M 표현을 PanPhon 음운 벡터로 투사한 SPAM은 1분 미만의 라벨만으로도 견고한 음소 분할과 인식을 달성하며 다양한 언어·도메인에서 일반화되었다.

HF Daily Papers29일 전· 1달 전 발행

엔트로피 정규화로 사실성과 다양성을 동시에 끌어올린 Flow-ERD

Flow-ERD는 AFM(Agent-type Aware Flow Matching)으로 연속적 다중모드 행동을 생성하고 ERD(Entropy-Regularized Distillation)로 폐루프 분포를 온도 조정해 WOSAC에서 높은 RMM(0.7878)과 보존된 다양성(CPD 0.1828)을 달성했다.

HF Daily Papers29일 전· 1달 전 발행

파인튜닝의 Knowing–Using Gap과 58–75% 회복 히유리스틱

이 논문은 파인튜닝으로 새로운 사실을 빠르게 암기하는 LLM이 해당 지식을 다중홉 추론으로 활용하지 못하는 'Knowing–Using Gap'을 규명하고, self-patching으로 58–75%의 회복이 가능함을 입증했다.

HF Daily Papers29일 전· 1달 전 발행

모델 자체로 관련 증거를 골라 테스트-타임 학습해 긴 문맥 성능을 최대 15%까지 개선한 방법

모델이 질문 관련 스팬을 스스로 표지한 뒤 그 스팬만으로 테스트-타임 next-token 학습을 수행하는 Self-Guided TTT는 긴 문맥에서 적응 신호의 잡음을 줄여 성능과 효율성을 동시에 개선했다.

HF Daily Papers29일 전· 1달 전 발행

VAE 디코더를 제거하고 토큰-로컬 리드아웃으로 SOTA와 2.48배 속도 이득

ReChannel은 T2I 백본의 토큰 필드를 활용하여 타깃-사이드 VAE 디코더를 제거하고 토큰-로컬 선형 리드아웃으로 픽셀-정렬 dense prediction에서 SOTA 성능과 최대 2.48× 처리 속도 향상을 달성했다.

그래디언트 공분산을 활용해 2비트 LLaMA-3-70B 성능을 보존한 KronQ

KronQ는 Kronecker-팩터화 헤시안 근사로 그래디언트 공분산을 양자화 손실에 통합해 2비트 가중치 양자화에서 LLaMA-3-70B의 WikiText-2 perplexity를 7.93으로 유지했다.

HF Daily Papers29일 전· 1달 전 발행

AIME에서 OPD 대비 25.84%p 개선을 보인 TOP-D의 안정적 정책 증류 우위

TOP-D는 교사와 학생 확률을 α로 보간해 로그 보상을 하한으로 묶고 내부 trust region 반복으로 오프라인 데이터를 안전하게 재사용하여 그래디언트 분산을 제어하고 AIME 벤치마크에서 OPD 대비 최대 25.84%p 절대 향상을 기록했다.

HF Daily Papers29일 전· 1달 전 발행

7×에서 500× 적은 데이터로 SOTA 수준 성능을 달성한 비디오-사전학습 비전 모델

GenCeption은 텍스트-투-비디오 생성 사전학습을 피드포워드 인식기로 전환해 단일 모델로 깊이·법선·세그멘테이션·3D 관절 등 다양한 시각 과제를 적은 파인튜닝 데이터로 달성한다.

HF Daily Papers29일 전· 1달 전 발행

시각적 문서 사전학습으로 텍스트 한계를 넘어선 연구

문서 원형 이미지에서 추출 과정을 거치지 않고 비지도 시각적 사전학습을 수행하면 동일 코퍼스에서의 텍스트 전용 사전학습보다 언어 지능 성능이 일관되게 향상되었다고 보고되었다.

HF Daily Papers29일 전· 1달 전 발행

46개 장기 터미널 과제로 드러난 GPT-5.5의 15.2% 통과율

Long-Horizon-Terminal-Bench는 46개 장기 터미널 과제를 서브태스크 기반 밀집 보상으로 채점하여 평균 통과율 4.3%와 GPT-5.5의 15.2% 통과율을 보고함으로써 장기 실행과 검증의 취약점을 드러냈다.

결정론적 컨텍스트 폴딩과 900+ 테스트가 포함된 오픈소스 프로젝트

장기 실행 함수 호출 에이전트의 히스토리를 바이트 일치 방식으로 폴딩해 프롬프트 캐시 재사용을 목표로 한 오픈소스 도구이다.

GPUHedge의 p95 116.6s→29.4s 개선 벤치

GPUHedge는 서버리스 GPU의 콜드스타트 꼬리 지연을 스펙큘레이티브 실행으로 완화해 p95를 116.6초에서 29.4초로 줄이고 요청당 비용을 $0.0114에서 $0.0083으로 낮췄다.

r/LLMDevs29일 전

134개 모델·25개 공급자 비용표와 JSON 레포

LLM의 $/Mtok, STT의 $/min, TTS의 $/1M chars를 포함한 134개 모델·25개 공급자 비용 데이터와 원시 JSON·레포를 CC-BY-4.0으로 공개한다.

VLM 에이전트로 생성한 1,300개 이상 사실적 가상 공간

SceneSmith는 VLM 기반의 디자이너·크리틱·오케스트레이터 3개 에이전트 협업으로 사실적 3D 실내 장면을 자동 생성하여 로봇 시뮬레이션용 환경을 대폭 풍부하게 만들었다.

r/LangChain1달 전

KeiroLabs의 저비용 고품질 밸류와 Exa의 품질 우위 트레이드오프

RAG Benchmark 2026은 Exa가 종합점수 88.5로 품질 1위를 기록했으나 KeiroLabs가 1,000쿼리당 $3.76로 최저 TCO를 보여 비용 대비 가치에서 우위를 보였다.

컨텍스트 로트 해결을 목표로 한 로컬 GUI 기반 LoopTroop 프로젝트

LoopTroop는 로컬에서 동작하는 오픈소스 GUI로서 모델 컨텍스트 오염을 줄이기 위해 투표 기반 기획, 세분화된 작업 단위, 실패 요약 후 세션 리셋, 그리고 다단계 인간 승인 흐름을 채택한다.

0.012mm 정밀도로 잎 성장 시계열을 추적한 Pheno4D 데이터셋

Pheno4D는 옥수수와 토마토 개체를 20일간 매일 레이저 스캔해 서브밀리미터 포인트클라우드와 각 포인트별 인스턴스 ID를 제공하여 잎 면적·길이·줄기 지름 등 장기 성장 추적을 가능하게 하는 데이터셋이다.

YOLO 레이아웃 UAVid 데이터셋과 모델 줌 공개

UAVid 원본을 YOLO 호환 디렉토리 구조로 재구성하고 YOLO26 기반 의미 분할 사전학습 모델과 상세한 모델 카드를 Hugging Face에 공개했다.

SageMaker AI Studio의 무코드 추론 최적화 권장 설정

SageMaker AI Studio의 UI가 데이터 기반 권장 설정과 사전설정 프로필 및 원클릭 배포를 통해 생성형 모델의 프로덕션 배포 시간을 분 단위로 단축한다.

AgentCore로 구현하는 OBO 토큰 교환과 다중 테넌트 신원 전파

Amazon Bedrock AgentCore Identity가 OAuth 2.0 Token Exchange(RFC 8693)를 사용해 다중 테넌트 에이전트 환경에서 사용자 신원을 audience‑bound 토큰으로 안전하게 전달한다.

GPT-5.6과 Grok 4.5 동시 등장 및 자율 랜섬웨어 보고 사례

GPT-5.6과 Grok 4.5가 같은 날 출시되고 Apple이 OpenAI를 소송했으며 완전 자율 랜섬웨어 'JADEPUFFER'가 보고되고 OpenAI는 ChatGPT Work를 출시했다.

CodeAlchemy, 거의 1조 토큰 생성한 합성 코드 데이터 파이프라인

CodeAlchemy는 합성 데이터 파이프라인으로 오픈소스 코드에서 생성한 토큰이 거의 1조에 이른다.

AI 에이전트의 안전한 작업 공간, 샌드박스 클라우드 아키텍처 설계

AI 에이전트가 안전하게 코드를 실행하고 작업을 수행할 수 있는 샌드박스 클라우드의 아키텍처, 격리 기술, 지속성 및 확장 전략을 다룹니다.

r/LLMDevs1달 전

스키마가 필요한 에이전트 핸드오프 사례 모음

세 차례의 프로덕션 장애 사례에서 필드명·버전 불일치와 비구조화된 툴 설명이 추적 불가 오류와 오답을 유발했다.

r/LLMDevs1달 전

LLM 게이트웨이·프롬프트 분류기 기반 비용 최적화 패턴

LLM 게이트웨이와 프롬프트 분류기, 라우팅 테이블과 컴팩션을 결합해 에이전트 개편 없이 AI 비용을 줄이는 실용적 방안을 제시했다.

AI 수요 대응을 위한 50억 유로 규모의 인텔 유럽 제조 확장 투자

인텔이 아일랜드 레익슬립 캠퍼스에 AI와 고성능 컴퓨팅 수요에 대응하기 위해 50억 유로를 투자해 제조 능력을 확장한다.

모델 학습부터 배포까지, Prime Intellect의 Post-training 오픈소스 인프라 완벽 가이드

Prime Intellect가 제공하는 오픈소스 post-training 도구와 prime-rl 라이브러리, 그리고 Lab 플랫폼을 활용한 에이전트 모델 학습 및 배포 인프라를 분석한다.

iMessage 연동부터 데스크톱 앱 전환까지, AI 에이전트 Boop 개발기

오픈소스 AI 에이전트 Boop의 iMessage 연동, patchright 기반 브라우저 자동화, Convex 데이터베이스 도입 및 데스크톱 앱 전환 과정을 다룬다.

반복 코드는 저비용 m3, 판단은 opus로 나눈 비용 절감 사례

팀은 반복적 코드 생성 호출의 약 75%를 저비용 모델로 처리하고 판단이 필요한 호출만 고비용 모델로 보내면서 전체 비용을 크게 낮췄다.

AI가 주도한 브라우저 레이서 실전 배포 사례와 한계

AI가 대다수 코드를 작성해 수주 내 배포된 브라우저 오픈월드 레이서 사례에서 AI는 보일러플레이트와 일회성 시스템을 빠르게 구현했으나 공간 추론·전역 상태 모델링·퍼포먼스 예측에서는 인간의 지속적 검증과 판단이 필수였다.

에이전트 실패율 2배 이상일 때 자동 실행을 제안으로 전환하는 운영 레시피

작성자는 에이전트별 과거 기준선 대비 실패율이 2배를 넘으면 자동 실행을 제한하고 제안 전용 모드로 전환하는 guardplane 구현과 데모를 공유했다.