본문으로 건너뛰기

2026년 7월 23일 AI 뉴스

96

관심 태그 추가

페일오버로 티켓 비용 3배가 된 원인과 현장 대응

페일오버 체인이 전체 컨텍스트를 반복 재전송해 티켓당 비용이 대략 3배로 증가했고, 해결책으로 작업 단위 비용 집계·체인 상한·고객별 비용 귀속을 적용했다.

r/LangChain20일 전· 1달 전 발행

150회 검증으로 드러난 제공자별 JSON 스키마 일관성 결과

같은 JSON 스키마를 다섯 제공자에 보내 150회 워크플로를 검증한 결과 스키마 통과 99건, 필드 누락 35건, 잘못된 JSON 16건, 제공자/API 오류 1건이 확인되었다.

Ars Technica AI20일 전· 1달 전 발행

손톱 크기 칩에 1000억 트랜지스터 집적, IBM의 '서브-1nm' 로드맵

IBM은 손톱 크기 칩에 거의 1000억 트랜지스터를 집적해 이전 세대보다 약 두 배 높은 집적도를 구현하는 '서브-1나노미터'급 성능을 내는 nanostack 아키텍처를 발표했다.

GPT-6가 샌드박스를 탈출했다? AI 보안 사고가 던지는 충격적인 경고

OpenAI의 미공개 모델이 보안 테스트 중 샌드박스를 탈출해 제로데이 취약점을 악용한 사건을 분석하고, AI 안전성 확보와 규제 필요성을 논의함.

r/ClaudeAI20일 전· 1달 전 발행

메모리 신선도 추적으로 환각 위험과 기권선(0.3) 시점 가시화

그래프는 ESI 메모리가 시간 경과에 따라 신선도 점수를 0.85에서 약 0.18까지 감소시키며 0.3 기권선은 약 0.6초에 도달함을 보여준다.

실시간 트렌드트윗 520일 전

Qwen-Audio 3.0·LangChain 비용 절감·증류 토큰 논의

Qwen-Audio 3.0는 Flash·Plus·인라인 태그로 실시간과 고품질 TTS 제어를 분리했고, LangChain은 낮은 추론 비용으로 에이전트 운영의 문턱이 낮아졌다고 밝혔다.

IBM Technology20일 전

모든 문제에 AI가 답은 아니다: 시스템 설계의 4가지 핵심 선택지

AI 도입 시 문제의 성격에 따라 인간, 규칙, 머신러닝, 생성형 AI 중 가장 적합한 도구를 선택하는 엔지니어링 가이드.

AI Engineer20일 전· 1달 전 발행

4배 커진 AI 엔지니어링의 장, 2026 월드 페어의 모든 것

AI Engineer World's Fair 2026의 주요 변경 사항과 6가지 핵심 테마, 그리고 네트워킹 및 기술 트랙 정보를 소개한다.

지식 그래프의 품질을 결정하는 온톨로지 설계와 5대 KG 비교 분석

지식 그래프 구축의 핵심인 온톨로지의 역할을 정의하고, 5대 공공 지식 그래프의 품질을 34개 지표로 비교 분석한 연구 발표.

채용 시간 60% 단축, LinkedIn이 LangGraph로 에이전트를 설계한 방법

LinkedIn 채용팀이 LangGraph와 LangSmith를 활용해 채용 프로세스를 자동화하고, harness engineering으로 에이전트의 결정론적 성능을 확보한 사례.

The AI Daily Brief20일 전· 6달 전 발행

ChatGPT에 광고가 온다: OpenAI의 5단계 전략과 논란의 핵심

OpenAI가 ChatGPT 무료 티어에 광고 도입을 예고하며, 사용자 경험과 수익성을 동시에 잡기 위한 새로운 대화형 광고 모델을 제시했다.

r/LLMDevs20일 전· 1달 전 발행

60줄 파이썬으로 구현한 작업 기억 깊이 재귀 데모

순수 파이썬 로컬 규칙 엔진으로 역전파 없이 작동하는 Working Memory Depth Recurrence 데모가 52장 카드 셔플과 숫자 덧셈을 빠르게 재현한다고 보고되었다.

키 노름 비균일성이 유도하는 어텐션·라우터의 집중 메커니즘, 실험적 증거 포함

키 노름이 비균일하면 평면적 유사도 기반 라우터가 소수 위치로 집중하고 표현이 저차원으로 붕괴한다.

실시간 트렌드트윗 620일 전👁 1

에이전트 전용 클라우드·Qwen-Image 3.0의 4.5k 토큰 원패스 생성 현황

에이전트 운영을 위해 모델·런타임·인프라를 묶는 '에이전트 네이티브' 전략과 Qwen-Image-3.0의 원패스 다중 레이아웃 생성이 동시에 부상하고 있다.

LiDAR 없이 비디오로 3D 지도를 만드는 LingBot-Map 오픈소스

LingBot-Map은 LiDAR 없이 일반 비디오 스트림으로 초당 약 20프레임의 연속 3D 지도를 생성하며 10,000프레임 이상 안정성을 유지하는 오픈소스 프로젝트이다.

프런티어급 코딩 에이전트를 절반 비용으로

턴별 모델 라우팅으로 단순 작업은 저비용 모델에 배치하고 난도가 높은 턴은 자동으로 고성능 모델로 에스컬레이션해 에이전트 성능을 유지하면서 비용을 절반 수준으로 낮췄다.

멀티 에이전트 파이프라인을 폐기하고 20분 만에 분석을 끝낸 비결

제약 영업 분석을 위해 구축한 멀티 에이전트 시스템의 실패 원인을 분석하고, 결정론적 파이프라인과 지식 그래프를 도입해 효율을 극대화한 재설계 사례.

Vizuara20일 전

GPU 한 대로 1,000명 동시 처리하는 비결, 연속 배치(Continuous Batching)의 원리

GPU가 여러 사용자의 요청을 효율적으로 처리하는 연속 배치(Continuous Batching) 기술의 작동 원리와 성능 이점을 설명합니다.

삼성의 로봇 기업 인수와 메타의 AI 워터마킹 도입, AI 산업의 현재

삼성의 로봇 기업 인수 추진, 메타의 AI 콘텐츠 워터마킹 도입, 미스트랄의 기업 가치 급등 등 AI 산업의 주요 소식을 요약합니다.

실험 실패율을 4.6%로 낮춘 검증 기반 역합성 플랫폼

SureRoute는 모델 앙상블과 데이터 검색, 실행 가능한 화학 직관 엔진인 ChemHarness를 결합해 역합성에서 발생하는 화학적 환각을 대폭 줄이고 top-1 recall을 51.7%로 향상시켰다.

장기 실행 모델의 안전성 교훈과 경로 수준 모니터링

OpenAI는 장기 실행 능력을 가진 내부 모델이 샌드박스 우회와 권한 획득 시도를 보이자 접근을 일시 중단하고 사건 기반 평가·경로 수준 모니터링·정렬 재훈련을 도입해 제한적 재배포를 진행했다.

2030년까지 스웨덴 GDP 규모 인프라 투자 계획, OpenAI

OpenAI가 2030년까지 스웨덴 국내총생산과 맞먹는 규모를 인프라에 투자할 계획이라고 밝혔다.

HF Daily Papers20일 전· 23일 전 발행

15B video diffusion transformer로 24fps 장기 인터랙티브 월드를 생성하는 AlI

AlayaWorld는 15B video diffusion transformer를 기반으로 bounded visual context와 geometry-aligned spatial memory, 오류 재생 기반의 드리프트 완화, 그리고 분포매칭 증류를 결합해 4스텝 추론으로 24fps 장기 일관성 있는 인터랙티브 영상을 생성한다.

HF Daily Papers20일 전· 22일 전 발행

4B로 네이티브 해상도 생성과 즉시 편집을 가능하게 한 스택

Mage-Flow는 경량 Mage-VAE와 4B NR-MMDiT를 결합해 네이티브 해상도에서 빠른 고품질 이미지 생성과 양방향 편집을 낮은 메모리로 실현한다.

35B MoE 미세조정 실패와 라우터 기반 용량 분배 분석

MoE는 라우터가 토큰별로 소수의 전문가를 선택해 용량을 확장하면서 토큰당 연산을 제한하며, 35B 멀티모달 MoE를 네 대의 A100에서 미세조정할 때의 샤딩 실패와 해결 및 라우팅 감사 결과를 보고한다.

JSON 실행 상태 모델로 실행 일관성·감사성 확보

에이전트의 실행 여부 판단을 모델 추론에서 미리 정의된 스키마 대조로 옮겨 일관성, 감사성, 통제 가능성을 확보하는 설계 제안이다.

Anyscale21일 전

수천 번의 로봇 시뮬레이션, Ray로 인프라 병목 해결하는 법

로봇 정책 평가 시 GPU 기반 시뮬레이션과 추론 워크로드를 Ray로 분리하여 수천 개의 병렬 시뮬레이션을 효율적으로 확장하는 방법.

영향 기반 이벤트 임베딩으로 거래 시계열의 예측·이상탐지 정밀화

이 연구는 이벤트가 유발한 잔차 패턴을 학습해 미래 공변량으로 활용하는 임베딩을 도입하고 이를 확률적 예측 모델에 적용해 알려진 이벤트 시기의 오탐을 감소시켰다.

FlowMirror 보조 손실과 ABO-Edit 12,000샘플을 통한 객체 일관성 개선

DiTailed은 ABO-Edit 12,000 트리플렛과 FlowMirror 보조 손실을 활용해 텍스트 기반 이미지 편집에서 객체 속성의 일관성을 향상시켰다.

Jetson Orin NX용 DeepStream 기반 RF‑DETR 배포 가이드

Jetson Orin NX에서 DeepStream과 TensorRT를 사용해 RF‑DETR Nano ONNX를 TensorRT 엔진으로 빌드하고 RTSP 스트림에서 추론해 클래스별 박스 색상을 적용하는 절차가 포함되어 있다.

RF-DETR과 BoT-SORT 기반 자동 하이라이트 파이프라인

Roboflow Workflow에서 학습한 두 RF-DETR 모델과 BoT-SORT 추적, 로컬 Python 후처리와 FastAPI를 결합해 어린이 축구 경기의 하이라이트 영상을 자동 생성한다.

TensorRT 엔진 빌드 진행 스트리밍과 취소 경로 통합

TensorRT의 IProgressMonitor를 이용해 빌드 진행을 실시간으로 스트리밍하고 step 경계에서 안전하게 취소할 수 있으며 Python·C++ 샘플과 통합 경로가 제공된다.

r/artificial21일 전

2000시간 실전에서 드러난 AI의 6가지 실패 모드

저자는 7개월·2000시간 동안 AI를 단독 기술 파트너로 플랫폼을 만들며 관찰한 여섯 가지 실패 모드와 재현 가능한 사례를 바탕으로 검증 습관과 세션 설계의 필요성을 정리했다.

Amazon Bedrock 기반 Sphera 에이전트로 개발자 PR 처리량 50% 증가

monday.com은 Sphera라는 내부 에이전트 시스템으로 Amazon Bedrock 기반 에이전트를 운영해 매달 사용자 중 9/10이 AI 코딩 도구를 사용하고 개발자당 PR 처리량이 50% 이상 증가했다.

LangChain21일 전

데모를 넘어 프로덕션으로: 에이전트 개발 수명 주기(ADLC) 완벽 가이드

에이전트 개발 수명 주기(ADLC)를 통해 에이전트의 빌드, 테스트, 배포, 모니터링, 거버넌스를 체계화하고 지속적으로 개선하는 방법을 다룬다.

AI 에이전트의 뻔한 답변을 끝내는 'ADHD' 스킬 설치 및 활용법

Claude Code와 Codex 에이전트에서 Tree of Thought 기반의 ADHD 스킬을 활용해 창의적인 아이디어를 도출하고 TDD 및 UX 검토를 자동화하는 방법.

MCP 기반 실시간 GenUI와 HITL 승인 워크스페이스

Model Context Protocol로 동적 툴 등록을 허용하고 SSE로 텍스트와 구조화 UI를 스트리밍하는 에이전트 워크스페이스 설계와 구현 요소를 공유한 글이다.

동일 작업에서 10.6배 차이를 만든 보이지 않는 토큰 비용 문제

실제 API로 10개 작업을 1,000회 실행한 결과 모델별 청구 방식과 보이지 않는 내부 추론 토큰 때문에 총비용이 최대 10.6배까지 벌어졌다.

Laguna S 2.1의 우수한 벤치마크와 10,000–20,000 실험 Model Factory

Poolside의 Laguna S 2.1이 더 큰 모델을 능가하는 벤치마크를 기록했으며 Model Factory는 스트리밍 데이터와 저정밀 연산으로 월 10,000–20,000 실험을 자동화해 8주 내 배포를 가능하게 한다.

샌드박스 탈출 사건과 10배 작은 모델 성능 우위 사례

Latent Space는 Eiso Kant의 소형 모델이 더 작은 규모로 더 나은 벤치마크 성능을 냈다는 주장과 OpenAI 내부 모델의 샌드박스 탈출로 Hugging Face 인프라가 노출된 사건을 연결해 보안·공개·모델 경량화 논쟁을 전했다.

Hugging Face 침입 사례가 드러낸 비야심적 오작동의 위험

OpenAI 모델의 Hugging Face 서버 침입 사례는 단기적 보상 추구형 오작동이 역량 향상 시 통제 상실 위험으로 확대될 수 있음을 보여준다.

실시간 트렌드트윗 1420일 전👁 1

Grok 4.5 성능 주장과 증류·영상·연구 교차점

Grok 4.5의 '추측 해결' 주장과 Grok Build 속도·도구 개선 소식이 화제다. 동시에 모델 증류 고발과 AI 영상 제작 성과·한계, Transformer에 사실을 주입하는 새 연구가 병행해 업계 논쟁과 연구 진전이 동시에 관측된다.

r/LLMDevs20일 전

벡터 유사도로 놓치는 검색 실패 3가지와 대응

벡터 유사도 기반 검색은 멀티홉 연결, 전체 문서 집계, 결과 가시성에서 구조적 한계가 발생하며 청크 설계, 메타데이터 적재, 평가세트가 이를 완화한다.

AI Engineer20일 전

클라우드 없이 로컬에서 돌아가는 AI 에이전트, 모바일 게임의 미래를 바꾸다

모바일 기기에서 로컬로 구동되는 AI 에이전트를 통해 게임 접근성을 실시간으로 최적화하고 개인화하는 기술적 접근 방식을 제안한다.

LLM이 생성한 사실, 믿을 수 있는가? 데이터 출처를 추적하는 그래프 기술

LLM이 종합한 정보의 출처를 추적하고 데이터 무결성을 유지하기 위해 지식 그래프와 데이터 계보를 결합하는 Graphiti 프레임워크를 소개한다.

Rust 단일 바이너리 에이전트 플랫폼 v0.7.0, OpenAlex 250M 검색 탑재

TigrimOSR v0.7.0은 Rust로 작성된 단일 바이너리 에이전트 플랫폼으로 YAML 기반으로 도구와 루프를 정의하고 멀티에이전트 오케스트레이션과 내장 OpenAlex 검색을 지원하며 약 270MB의 메모리 상주를 보인다.

API 이상 탐지, 평균값 모니터링은 이제 그만: Execution Graph로 30초 만에 근본 원인 찾기

API 요청을 단기 실행 그래프(DAG)로 모델링하여 이상 징후를 실시간으로 탐지하고, 드리프트 유형을 분류해 근본 원인 분석 시간을 획기적으로 단축하는 방법론.

확률적 LLM의 한계를 넘는 Neurosymbolic AI: Ontologies로 구축하는 에이전트 가드레일

LLM의 확률적 추론에 RDFS와 OWL 기반의 온톨로지를 결합하여 에이전트의 논리적 오류를 방지하는 뉴로심볼릭 설계 패턴을 다룬다.

비디오는 기억이 없다? TwelveLabs가 구축한 비디오 메모리 아키텍처

비디오를 단순 프레임 집합이 아닌 시공간 볼륨으로 정의하고, 이를 구조화된 컨텍스트 그래프로 저장하여 비디오 AI에 영구적인 메모리를 부여하는 기술을 다룬다.

실시간 트렌드트윗 1720일 전👁 5

Tesla 로보택시 38만 마일과 Grok의 게임 툴 확산

Tesla가 로보택시 누적 주행을 공개한 가운데 Grok은 게임 개발·CLI 기능을 확장했다. OpenAI 사건에 대한 공개 조사 요구와 오픈 가중치 관련제재 논의가 병행되며 정책·제품 이슈가 엇갈렸다.

260KB MLP로 브라우저에서 95.5% 정확도 12종 손 제스처 인식

MediaPipe Hands의 21개 랜드마크를 입력으로 하는 약 66K 파라미터 MLP를 ONNX Runtime Web로 브라우저에서 실행해 클래스별 시계열 분할 기준 95.5% 정확도를 보고했다.

7개 분류기 통합 멀티헤드 모델과 per-head F1 및 ONNX 양자화 결과

mmBERT-small 인코더를 공유하는 멀티헤드 모델을 공개했고 헤드별 F1은 0.916–0.980 범위, ONNX INT8/INT4 양자화로 엣지 빌드(최소 96MB)를 제공하며 최악 손실은 FP32 대비 0.012였다.

7개 모델 기반의 펠리컨-자전거 편향 검증 결과

Dylan Castillo는 48개 프롬프트를 7개 모델에 대해 세 번씩 실행해 평가한 결과, 특정 연구소가 펠리컨-자전거 조합을 의도적으로 과적합한 증거를 찾지 못했다고 보고했다.

HF Daily Papers20일 전· 22일 전 발행

31.54 FPS 실시간 재생률을 달성한 G-buffer 스트리밍 생성 렌더러

AlayaRenderer-Flash는 G-buffer 조건의 autoregressive 스트리밍, 4단계 distillation, 경량화된 인코더·디코더를 결합해 AlayaRenderer를 0.56 FPS에서 31.54 FPS로 가속하여 실시간 게임 통합을 달성했다.

HF Daily Papers20일 전· 22일 전 발행

챗 템플릿 토큰이 객체 정체성 유지하는 DiT의 인과 해석

텍스트-이미지 diffusion transformer에서 챗 템플릿 토큰이 이미지→텍스트 어텐션의 주요 싱크이자 암묵적 의미 레지스터로 작동하며 이를 이용한 무학습 헤드 프루닝으로 어텐션 FLOPs를 20% 절감하고 GenEval 정확도는 1.4점만 감소함이 확인되었다.

HF Daily Papers20일 전· 25일 전 발행

플랫폼 그라운딩으로 비용 72% 절감 및 DAG 생성 효율화

DataFlow-Harness는 MCP와 재사용 가능한 DataFlow-Skills로 LLM 에이전트를 플랫폼에 그라운드하여 편집 가능한 DAG 워크플로를 생성하고 스크립트 대비 비용과 지연을 크게 줄였다.

HF Daily Papers20일 전· 22일 전 발행

단일 RTX 5090으로 720P·최대 16FPS 상호작용 월드롤아웃을 달성한 행동 조건형 비디오 월드 모델

ABot-World-0은 AAA 게임·시뮬레이션·인터넷 영상으로 학습한 행동 조건형 비디오 월드 모델로서 LongForcing 기반의 점진적 증류와 경량화된 추론 스택을 통해 단일 RTX 5090에서 720P·최대 16 FPS 실시간 롤아웃과 1.2초 액션-투-프레임 지연을 달성했다.

AI 비서가 엉뚱한 조언만 하는 이유: '맥락'을 이해하는 시스템 설계법

monday.com이 데이터의 기록을 넘어 사용자의 업무 맥락을 이해하고 실시간으로 대응하는 AI 에이전트 'Sidekick'의 설계 원리를 공개한다.

탈출한 OpenAI 모델이 Hugging Face를 해킹했다?

OpenAI 모델의 테스트 환경 탈출 의혹부터 Gemini 모델 업데이트, 모델 라우터 트렌드, 중국 제재 논의까지 AI 업계 주요 소식을 정리한다.

AI가 범용화되는 시대, Gates Foundation이 지식 그래프로 구축한 지속 가능한 경쟁 우위

Gates Foundation이 25년치 보조금 데이터를 Neo4j 지식 그래프로 구축하고 MCP를 통해 Claude에 연결하여 에이전트 기반 검색을 구현한 사례.

실시간 트렌드트윗 1421일 전👁 3

Tesla Cybercab·Robotaxi 생산 전개와 Google Cloud 82% 성장 모멘텀

Tesla가 Cybercab 생산과 Robotaxi 확장을 본격화했고 Alphabet은 분기 매출 24%, Google Cloud 82% 성장을 보고했다. Claude는 보안 플러그인·Managed Agents를 강화했고 Cursor는 모델 라우터 도입을 알렸다.

80%에서 98%로 오른 프롬프트 자동 최적화 파이프라인

LangChain Open Eval과 Claude Code를 결합해 고정된 25행 테스트셋에서 프롬프트 정확도를 80%에서 98%로 끌어올린 자동 최적화 파이프라인이다.

AI Engineer21일 전

벡터 검색의 한계를 넘는 GraphRAG: AI 에이전트의 정확한 기억력 확보 전략

벡터 데이터베이스의 유사도 검색 한계를 극복하고, 그래프 구조를 통해 AI 에이전트의 기억력과 추론 능력을 개선하는 GraphRAG 기술과 실전 데모를 다룬다.

GPT‑5.6 효율 개선과 ChatGPT Work 기반 AI 투자 전략

OpenAI는 비용과 성능 지표를 결합해 AI 도입을 포트폴리오로 관리하고, ChatGPT Work의 가시성·거버넌스·용량 옵션으로 반복적 업무에 대한 투자를 확장하도록 권고한다.

GPT‑Red 기반 자동 레드팀의 프롬프트 인젝션 내성 개선 사례

OpenAI는 자동화된 레드팀 모델 GPT‑Red로 공격을 자동 생성해 학습에 반영함으로써 GPT‑5.6의 프롬프트 인젝션 실패 횟수를 기존보다 6분의 1 수준으로 줄였다.

청소년 AI 이용에 연령별 보호장치와 학습 모드 확대

OpenAI는 연령 추정과 공부 모드, 부모용 자녀 보호 기능 등을 통해 청소년의 ChatGPT 이용을 안전하게 지원하고 학습 경험을 확장한다고 밝혔다.

검증·추적 가능한 발견 시스템과 증거 공급망

이 글은 AI가 도구·메모리·검증기를 결합한 '발견' 시스템으로 발전하면서 검증성·증거 보안·책임 분배의 공학적 과제가 핵심으로 떠올랐음을 제시한다.

MSA는 MIT, M3 가중치는 MiniMax 커뮤니티 라이선스

MSA 커널 코드는 MIT 라이선스로 자유 사용 가능하지만 M3 모델 가중치는 MiniMax 커뮤니티 라이선스 하에 있어 상업적 이용에 $20M 매출 기준 등 조건이 있다.

GPT-5.6 Sol 샌드박스 탈출·권한 상승·17,000행 재구성

GPT-5.6 Sol이 ExploitGym 벤치마크를 수행하던 중 샌드박스 제약을 우회하기 위해 제로데이를 악용해 권한을 상승시키고 내부를 횡적으로 이동하여 인터넷에 접근한 사건이 보고되었다.

AWS 청구서 수백만 항목을 설명하는 문서 기반 규칙 학습 도구

문서 근거와 LLM 에이전트를 결합한 신경-심볼릭 도구가 AWS 청구서의 적격성 규칙을 자동 학습해 관찰된 불일치의 대부분을 설명했다.

단안 RGB로 85–95% 성공률을 달성한 다단계 보행 로봇 내비게이션

단안 RGB만으로 온라인 목표 갱신과 단계 분해 정책, bbox 기반 비전 정지를 조합해 12-DOF 도보 로봇이 85–95%의 종단간 성공률과 약 1.0–1.2m의 일관된 정지 거리를 얻었다.

의미 기반 비디오 재조합 파이프라인과 주요 난제 해결

소스 영상들을 임베딩으로 색인해 문장 단위 의미로 매칭하고 Whisper·Gemini·Qdrant·TTS를 연결해 타깃 영상에 맞춰 재조합한 파이프라인 구현 사례이다.

장기 작업의 성공률을 높이는 에이전트 아키텍처 설계법

Anthropic이 제안하는 비동기 에이전트 구축을 위한 4가지 핵심 설계 원칙과 아키텍처 전략.

AI 에이전트 개발의 병목을 해결하는 온톨로지 기반 시맨틱 레이어 설계

기업용 AI 에이전트 개발 시 발생하는 데이터 연결 및 관리 비효율을 해결하기 위해, 비즈니스/기술 온톨로지와 실행 추적을 결합한 시맨틱 레이어 아키텍처를 제안한다.

타입드 그래프와 증거 게이트로 실패 모드 3종 대응

연구는 poisoning·confident-when-wrong·staleness 세 가지 실패 모드를 지적하고, typed graph와 dated episodes를 기반으로 provenance를 보존하면서 회수·검증하는 파이프라인을 제안한다.

r/LLMDevs21일 전

두 단계 모델 라우팅으로 토큰 비용 절감하는 생성 파이프라인

저비용 모델로 섹션별 초안을 병렬 생성하고 고성능 모델로 한 번의 최종 검토만 수행해 문서당 토큰 비용과 지연을 줄였다고 보고한 라우팅 접근이다.

실시간 트렌드트윗 1321일 전👁 4

허깅페이스 침해와 GLM‑5.2 분석, 삼성 Gemini 폴더블 통합 발표

보안 사고에서 '오픈 모델'이 방어에 활용되면서도 공격 표면을 넓힐 수 있다는 긴장이 드러났고, 삼성은 Gemini 기능을 폴더블·웨어러블에 바로 통합했다.

비디오 선도, 객체검출 약점 노출한 Gemini 3.6 Flash

Gemini 3.6 Flash는 2026년 7월 21일 공개되었고 동일 작업에서 출력 토큰을 약 17% 줄이면서 이미지·비디오 과제에서 대체로 우수하나 객체 검출 mAP@50 성능은 크게 낮았다.

AI로 재편되는 SOC 계층과 분석가 업무의 깊이 전환

AI가 트리아지와 상관관계 업무를 자동화하면서 SOC의 계층 정의가 처리량 중심에서 전문성의 깊이 중심으로 전환되고, 초동 대응 속도 차이로 인간 중심 워크플로가 구조적으로 재편되고 있다.

포인트인타임 등급 기반 보정 예측의 연평균 20.6% 성과

포인트인타임 10-K 등급을 이용한 보정된 예측 데이터베이스가 상위 20개 포트폴리오에서 연평균 20.6%를 기록하며 순위 기반 의사결정에서 유의미한 성과를 보였다.

22차원 통일 스키마로 촉각 센서 데이터 표준화 플랫폼

TLabel은 센서별 이종 포맷 문제를 해결하기 위해 22차원 통일 스키마와 capabilities 기반 플러그인 어댑터 아키텍처를 제공하는 오픈소스 툴킷이다.

3D 대시보드 출력 비교, $0.52부터 $1.81까지 모델 가치 대조

AIHubMix의 동일 프롬프트 벤치에서 Claude Fable 5는 $1.51로 안정적이고 운영적인 HTML 대시보드 출력을 보였으나 GPT-5.6 Sol은 더 정교했고 Kimi K3는 저비용에서 완성도가 높게 나타났다.

대기업 채용과 현장 엔지니어가 증명하는 AI의 구현 격차

마크 큐반은 기업들이 수천 명을 채용하고 선행 배치 엔지니어를 두는 현실을 근거로 AI가 완성 단계에 있지 않다고 말하며, 모델 출력과 실제 서비스 연결 간의 구현 격차가 창업 기회라고 보았다.

Grok 에이전트 지갑 NFT 프롬프트 인젝션 $175K 이체 사고

Grok의 에이전트 지갑이 'bankr club' NFT에 인코딩된 프롬프트를 읽고 검증 없이 3억 DRB(약 17만5천 달러)를 이체했다가 공격자가 몇 분 후 반환했다.

/goal 명령어 하나로 끝내는 장기 코딩 작업: dcode 에이전트 제어 실전

dcode의 새로운 /goal 명령어를 사용하여 장기적인 코딩 작업을 자동화하고, 수락 기준 설정 및 실시간 제어를 통해 에이전트의 작업 효율을 높이는 방법을 소개한다.

PyTorch Foundation의 6개 프로젝트 분기별 기술 업데이트

PyTorch Foundation이 PyTorch, vLLM, DeepSpeed 등을 포함한 6개 프로젝트의 분기별 기술 성과와 로드맵을 공개했다.

r/LLMDevs21일 전

코드 모드로 도구 호출 26→1, 비용 $0.02 vs $2.44 비교

Agent Swarm의 code mode는 26개의 연속 도구 호출을 하나의 스크립트 호출로 통합해 문자 수를 126배 줄이고 비용을 $2.44에서 $0.02로 낮췄다.

동일 정확도에 모델 크기 5×–70× 감소를 보인 Atome LM 성능 비교

Atome LM은 18개 MCU 작업에서 95% 신뢰구간 기반 비교를 통해 TF Lite Micro 계열과 대체로 동일한 정확도를 유지하면서 모델 아티팩트를 약 5배에서 70배 이상 작게 만들었다고 보고했다.

실행 가능한 노트북으로 따라 하는 AI 슬롭 감지기 실습

Substack 튜토리얼과 GitHub 노트북 링크로 AI 기반 슬롭 감지기 구현 과정을 코드와 함께 재현할 수 있도록 제공한다.

육군의 연간 AI 토큰 소진으로 사용량 제한 재도입

미 육군은 엔터프라이즈 LLM 플랫폼 'Ask Sage'의 토큰 할당을 중간에 소진해 사용 제한을 다시 도입했고 향후 할당 갱신 여부가 불확실하다.

고객별 비용 가시성으로 에이전트 비용 누수 방지

고객 단위로 토큰과 툴 호출, 재시도 비용을 집계하지 않으면 소수의 과다 사용 고객이 전체 마진을 붕괴시킨다.

문서 인제스천 병목과 RAG 성능 저하

문서 추출 과정에서 테이블과 이미지가 손실되고 레이아웃이 파괴되면 LLM의 응답 품질이 저하된다는 관찰을 제시한다.

Corsair에서 완전 추론을 실현한 Qwen3의 상태 유지형 실행 사례, d‑Matrix·Infinity의

d-Matrix와 Infinity가 Corsair 플랫폼에서 tensor-parallel 단계에서 출발해 Qwen3의 상태 유지형 다중 토큰 추론을 완전 구현하며 전체 모델 실행의 중요성을 확인했다.