본문으로 건너뛰기

2026년 7월 30일 AI 뉴스

82

관심 태그 추가
임커밋13일 전

Claude Code 대화 내용을 Notion에 자동으로 기록하는 법

Claude Code의 Hook 기능과 Notion API를 연동하여 코딩 작업 일지를 자동으로 생성하고 기록하는 워크플로우를 소개한다.

캐릭터 일관성이 중요한 시퀀스에서는 '정지 이미지 생성 → 얼굴 고정 → 애니메이션' 순서가 더 실용적이다. 작성자는 APOB AI로 얼굴을 잠근 뒤 애니메이션을 만들자 여러 클립을 이어붙일 수 있는 결과가 나왔다. 다만 모션 품질은 반복 촬영과 편집으로 보정해야 했다.

정지 이미지를 먼저 만들고 얼굴을 고정한 뒤 애니메이션하면 멀티숏에서 캐릭터 일관성을 얻을 수 있다.

31k→9k, 중복 제거로 토큰 대폭 절감된 실험 결과

ContextOps는 컨텍스트 구조를 분석해 중복과 템플릿을 제거해 토큰을 크게 줄이면서 응답 정확도를 유지한 도구이다

로컬에서 GGUF 모델을 .NET으로 고속 추론할 수 있는 엔진이 나왔다

TensorSharp는 GGUF 모델을 CUDA/Vulkan/Metal로 구동하고 --tp 2로 Megatron-style tensor parallelism을 활성화해 다중 GPU 성능을 확보할 수 있는 추론 엔진이다

단일 7B 모델로 생성과 이해를 통합한 오픈소스 레포가 업데이트됐다. 이

SenseNova-Vision 레포가 data/dataset_info.py 기반 등록 시스템, COCO/OCR/LLaVA 변환기, 842행 문서와 17+ 데이터셋 다운로드 절차를 추가해 커스텀 학습 준비를 갖췄다.

대중의 AI 사용법 교육과 엔지니어의 데이터 준비가 다른 문제라고 주장되

대중은 도구 사용을, 기술팀은 데이터·거버넌스를 AI-ready로 본다는 관찰이다. 조직은 두 관점을 병행해 준비해야 한다. 이 흐름은 산업 전반의 우선순위를 이동시키고 있다.

실시간 트렌드트윗 1413일 전

InsForge로 에이전트 토큰을 2.5배 줄인 사례와 GLM·Kimi의 성능·효율 주장

InsForge 하나의 CLI 호출로 에이전트가 전체 백엔드 토폴로지를 파악해 토큰 사용을 5.5M→2.3M으로 줄였다는 구체적 수치가 나왔다

실시간 트렌드트윗 713일 전👁 1

Grok 4.6 출시 예고와 Qwen BYOAK·PolarDB 메모리 통합이 업계 흐름을 끌었다

Grok 4.5의 LaurenBench 56.9% 1위와 Grok 4.6 출시 예고, Alibaba의 BYOAK·PolarDB 통합 메모리(P99 latency up to 89.2%)가 이번 기간 화제였다

1억 3,500만 고객을 둔 Nubank가 AI 에이전트 배포 병목을 뚫은 방법

Nubank가 Snowglobe의 시뮬레이션 기반 평가를 도입하여 AI 에이전트 배포 주기를 20배 단축하고 80%의 대화 정확도를 확보한 사례이다.

규칙과 ML이 놓친 결제 거절 사례, 에이전트로 해결하는 법

기존 이벤트 소싱 시스템 위에 에이전트 계층을 추가하여 규칙 기반 및 ML 모델이 해결하지 못한 모호한 결제 거래를 판단하는 아키텍처이다.

Cohere13일 전

폰에서 돌아가는 에이전트 모델, 둠 루프를 막고 성능을 올리는 법.

엣지 디바이스의 제약을 극복하기 위한 하이브리드 아키텍처와 다중 도메인 온폴리시 증류 기법을 다룬다.

HF Daily Papers13일 전· 15일 전 발행

핸드오프 트리거로 초반 오차를 국소 교정하는 기법을 도입했다.

Relay-OPD는 학생 프리픽스에서 교사가 리디렉션하려 할 때 짧게 교사가 인계해 추론을 바로잡고 학생이 재개하도록 하는 온-폴리시 증류 방식으로, Qwen3 계열 실험에서 표준 OPD 대비 평균 +5.73% 성능 향상과 학습 궤적 길이 50% 이상 단축을 달성했다.

HF Daily Papers13일 전· 16일 전 발행

'기억한다'면서 정작 결정에 못 꺼내 쓰는 에이전트 메모리

InMind는 125개 과제로 검색 기반 메모리가 쿼리와 표면적 유사성이 없을 때 결정적 사실을 제공하지 못하는 암묵적 연관성 실패를 분리하여 측정했다. 벤치마크는 113개의 출처 기반 과제와 12개의 전문가 작성 과제로 이루어졌고, InMind에서 쿼리-전달 실패로 회수 가능한 사실이 정답에 적용되는 비율은 최대 16.0%로 낮게 나타났다. 동일 사실을 문맥에 직접 주면 GPT-5-mini는 간접 질의에서 84.0%를 달성하여 문제의 위치가 쿼리-조건화 인터페이스임이 확인됐다.

r/ClaudeAI13일 전

Claude 전 서비스가 'Major Outage'로 뒤덮인 상태 페이지

Claude 상태 페이지 스크린샷에서 claude.ai, Claude API, Claude Code 등 다수 서비스가 'Major Outage' 표기를 포함하고 있다. 스크린샷은 90일간의 컬러 블록과 각 서비스별 '99.47 % uptime', '99.55 % uptime', '99.79 % uptime' 같은 수치형 가동률을 함께 보여준다. 해당 정보는 어떤 서비스가 언제 문제였는지를 즉시 확인할 수 있는 근거가 된다.

xAI가 소송으로 규제 차단을 시도했다.

xAI는 Grok 이용자를 상대로 소송을 제기한 기록을 근거로 미네소타주의 nudification 금지 적용을 막기 위해 소송을 확장했다고 주장했다.

코딩 에이전트로 연구 소프트웨어를 현대화한 사례 보고

OpenAI 현장 보고서는 Codex와 Claude Code 등 코딩 에이전트가 과학 소프트웨어의 유지·이식·성능 개선을 가속화했음을 사례별로 밝힌 보고서이다.

스킬 기반 프롬프트로 일관된 조직 발견 결과를 얻는 방법

범위·질문·출력·제약·구조 다섯 축으로 재사용 가능한 AI 스킬을 설계하면 조직 발견 과정의 일관성과 신뢰성이 확보된다.

모델이 바뀌어도 살아남는 취약점 헌팅 하니스

에이전틱 하네스로 후보 취약점을 실제 통합 테스트로 증명하고 PR 초안을 자동 생성하며 80개 앱·300건 결과가 도출되었다.

처방전에서 갈린 UnlimitedOCR과 PaddleOCR

Layout: 9.5/10 speed: 10/10 Handwriting: 7/10이라는 실측 점수를 제시하며 UnlimitedOCR는 레이아웃과 속도에서 우수하고 메모리가 많을 때 성능이 좋은 반면, 메모리 제약이 있는 커스텀 환경에서는 PaddleOCR가 더 적합하다고 결론지었다. 이 평가는 처방전 샘플을 대상으로 했음이 명시됐다.

에이전트 권한을 통제해야 실패 전파를 막을 수 있다

생산 에이전트는 권한과 접근을 런타임에서 제한·기록·중단 가능하게 해야 조직 위험을 관리할 수 있다.

r/ClaudeAI13일 전

작업별로 어떤 AI를 쓸지 정리한 실무 안내서

작업 목적을 입력으로 받아 적합한 AI 유형을 매핑하는 주관적 가이드이다. 선택 기준은 응답 품질·비용·지연 같은 트레이드오프를 고려하는 방식이다. 개발자와 기획자가 도구 선택 결정을 내리는 데 실용적이다.

LLM을 시각 인코더로 바꿔 LLaVA를 넘은 LLaViT

LLaViT는 시각용 별도 QKV, 양방향 어텐션, 전역·지역 표현 통합을 통해 LLaVA보다 성능이 개선된 구조임을 실험으로 보였다.

StarCoder2-7B를 내부 GPU에 안전하게 배포하고 통제하는 절차

StarCoder2-7B NIM을 내부 GPU에 배포하고 NeMo Guardrails, CI 검증 게이트, 트레일러와 메트릭 루프를 결합해 AI 보조 코딩 워크플로의 검증 가능성을 확보한 구현 가이드임이 확인됐다

임상의가 검증한 100개 기준의 환자 대면 벤치마크

PatientAgentBench는 합성 환자 기록과 상태 기반 시뮬레이터로 환자 대면 에이전트의 다회 대화·워크플로우 이행·임상 안전성을 평가하는 재현 가능한 기준이다. LLM 심사 패널이 6개 차원, 100개 기준으로 자동 채점하며 임상의가 검증했다. 고정 정답이 없어 학습 오염을 줄이는 설계이다.

공개 코퍼스에 폐쇄형 LLM이 섞여 있던 Olmo

Olmo 사례는 공개 코퍼스와 폐쇄형 LLM 산출물이 함께 쓰인 현실을 드러냈다. FineMath 3가 Llama로 생성된 점과 Qwen 및 GPT4 사용이 핵심 쟁점이다. 법적 허용 범위가 불명확하다고 결론지었다.

구조 없이 서열만으로 결합 친화도를 맞힌 MochiBind

MochiBind는 서열만으로 쌍별 정확도와 검색 지표에서 구조 기반 모델과 동등하거나 우수한 성능을 보였다.

이중 언어 앵커가 없는 Linear A에 AI를 붙이는 시도

고대 문자 해독은 대개 이중 언어나 친족어가 앵커가 되어 성립하고, Linear A는 그 둘 모두가 없어 난제였다는 점을 중심으로 AI 적용 사례를 소개하는 기사이다

Copilot 기능을 한데 모은 'super app' 출시 예고

Satya Nadella는 Copilot의 chat, Cowork, Autopilots, code 경험을 결합한 'super app'을 올해 소비자·기업용으로 출시할 것이라고 발표했다.

7일 만에 Reddit 카르마를 0에서 97로 올린 에이전트 루프 설계법.

Reddit에서 고품질 댓글을 자동으로 생성하여 카르마를 높이는 에이전트 루프의 5가지 핵심 설계 원칙과 구현 방식을 다룬다.

인터넷의 6%에서 돌아가는 코드 작성자가 AI 초안을 받고 발표문을 처음부터 다시 썼다는 사례가 제시되었다. 핵심은 과다 출력(output density) 문제와 인간의 제거 판단력이다. 이 사례는 도구가 아니라 편집 역량을 먼저 강화해야 한다는 결론을 낳았다.

AI가 기술적으로 타당한 산출물을 만들어도 과잉 생성 때문에 최종 품질은 인간의 편집력으로 결정된다는 진단이다. 핵심 역량은 '정확히 무엇을 제거할지 아는' 판단력이다. 편집 격차가 도구 개선보다 우선시되어야 한다는 결론이다.

2,000개 AI 스킬을 검증한 Nubank의 보안 게이트웨이

Nubank는 AI 스킬의 보안 위협을 막기 위해 정적 분석과 LLM 검증을 결합한 'Skill Vector'를 도입하여 안전한 AI 생태계를 구축했다.

AI Engineer13일 전

개인용 AI 에이전트가 그룹 채팅에서 실패하는 이유와 해결책

그룹 채팅과 웨어러블 환경에서 AI 에이전트가 직면하는 메모리 관리와 보안 취약점을 해결하기 위한 아키텍처 설계 전략을 다룬다.

금융 데이터 환각을 막는 결정론적 AI 시스템 설계법.

LLM의 확률적 특성을 보완하기 위해 수치 추출과 검증을 결정론적 프로세스로 분리하여 금융 데이터의 신뢰성을 확보하는 방법론을 구현했다.

합성 페르소나가 시장 조사에서 인간을 대체할 수 없는 이유

합성 페르소나는 시장 조사에서 효율적인 도구이지만, 잠재적 교란 요인과 프롬프트 민감도 등의 한계가 있어 인간 응답자의 일관성을 기준으로 한 엄격한 검증이 필수적이다.

1년 걸릴 테스트 마이그레이션을 3개월로 줄인 AI 에이전트 활용법

Benchling이 Cursor Cloud Agents를 도입해 레거시 테스트 마이그레이션 기간을 1년에서 1분기로 단축하고 개발자 만족도를 20% 높인 사례.

LLM이 그럴듯한 거짓말을 멈추고 실제 수익을 내게 하는 법

LLM의 Fluent Bluff 문제를 해결하기 위해 실제 비즈니스 성과 데이터를 기반으로 모델을 Grounding하는 방법론을 다룬다.

RL 학습의 90%를 차지하는 추론 병목, DFlash로 해결하는 법

Modal과 Cognition이 RL 롤아웃과 추론 최적화를 위해 DFlash와 에이전트 기반 자동화 기술을 어떻게 활용하는지 다룬다.

에이전트 기능이 100개를 넘을 때 반드시 필요한 거버넌스 체계

AI 에이전트의 기능을 '스킬' 단위로 모듈화하고, 규모 확장에 따른 평가 및 거버넌스 체계를 구축하는 전략을 제시한다.

오픈소스 AI가 비즈니스와 안보에 미치는 영향.

AI 업계의 오픈소스와 클로즈드소스 진영의 논리와 전략을 AI 스택과 제본스의 역설을 통해 분석한다.

퀀트 연구를 자동화한 멀티 에이전트 시스템 AlphaLab의 구조와 성과.

Morgan Stanley의 30인 AI 연구팀이 개발한 AlphaLab은 전략가와 작업자 에이전트의 협업을 통해 퀀트 연구 전 과정을 자동화하고 내부 알고리즘 개선 성과를 거두었다.

모델이 아니라 시스템이 문제인 이유, AI 에이전트 장애를 막는 5가지 감사 질문

AI 에이전트의 오작동을 방지하기 위해 모델의 제안을 실행하고 증명하는 시스템 하네스의 상태 관리와 동시성 제어, 실행 영수증 감사가 필수적이다.

코딩 에이전트로 개발 루프를 자동화하고 생산성을 배가하는 법

코딩 에이전트를 도입하여 반복적인 개발 루프를 자동화하고, 개발자가 검증자 역할에 집중하여 생산성을 극대화하는 방법.

AI Engineer13일 전

AI 데모가 기업 의사결정에서 실패하는 이유.

AI 제품이 기업 환경에서 신뢰받으려면 인상적인 데모를 넘어 데이터 출처를 증명하고 사실과 추정을 엄격히 분리해야 한다.

Vizuara13일 전

1.5센트의 답변, GPU가 70%를 차지하는 이유

LLM 추론 비용의 구성 요소와 이를 절감하기 위한 기술적 노력 및 사용자 프롬프트 최적화 방법을 다룬다.

실시간 트렌드트윗 1913일 전👁 3

Grok, 런타임 기능과 앱 플랫폼 업데이트로 사용자 제작 가속

Opus 5는 고품질 자산을 생성하지만 토큰 소진으로 medium 설정으로 낮춰 운용하는 사례도 나왔다

HF Daily Papers13일 전· 15일 전 발행

저장소를 한 번 빌드해 에이전트 컨텍스트 비용을 줄이는 CodeNib

CodeNib는 커밋별로 lexical·dense·structural 뷰를 재료화하고 뷰별 증분 갱신과 manifest 기반 런타임 로딩으로 에이전트에 경계화된 컨텍스트를 제공해 탐색·네비게이션 중복과 토큰 비용을 줄였다.

HF Daily Papers13일 전· 15일 전 발행

래스터 이미지를 편집 가능한 레이어 트리로 되살리는 파이프라인

ReDesign은 VLM 컨트롤러가 노드별 도구 체인을 선택하여 트리를 확장하고 확장마다 로컬 검증으로 오류를 수리하여 909개의 Figma 파일과 14,796개 편집 지시에 대해 가장 높은 편집 가능성을 획득한 시스템이다.

HF Daily Papers13일 전· 16일 전 발행

관련성으로 rg 탐색 순서를 정해 증거를 더 빨리 노출시켰다.

RARG는 문서 수준 관련성을 rg 검색의 실행 우선순위로 바꿔서 더 관련성 높은 문서부터 순차적으로 ripgrep을 탐색하고 진입점 초기화와 매치 단위 재정렬로 관찰 예산 내에서 중요한 발췌를 우선 노출해 탐색 수렴을 가속했다.

HF Daily Papers13일 전· 15일 전 발행

로봇 없이 배포 가능한 조작 정책 확보이다

HiFi-UMI는 마이크로초 동기화와 3 mm급 궤적 정확도를 갖춘 휴대형 UMI 캡처 시스템이다. 이 데이터만으로 로봇 배포용 포스트트레이닝이 가능함이 확인됐다. 공개된 HiFi-UMI-2K는 2,000시간 분량이다.

Mythos가 암호 수학의 약점을 찾아냈다.

Anthropic의 Mythos가 두 암호 문제를 통해 알고리즘의 수학적 약점을 찾아냈고 결과는 점진적이며 현재 사용되는 암호를 즉시 파괴하지는 않았다.

한 비디오로 전편 편집을 가능하게 한 방법이다

ID-V2V는 단일 비디오에서 인물만 리라이팅해 paired 학습 쌍을 합성하고 이로써 얼굴 정체성·표정·전신 모션을 보존하면서 장면 재설계와 조명 변경을 영상 전체에 전파하는 방식이다. 이 방법은 원본 비디오를 입력으로 받아 인물 영역만 마스킹 후 리라이팅을 적용하고 학습 단계에서 모델이 인간 보전과 장면 생성 과정을 동시 학습하게 하는 방식으로 작동한다. 코드와 논문, 프로젝트 페이지가 공개되어 있어 재현이 가능하다.

에이전트가 24/7로 작동하겠다고 예고했다.

Meta는 Q2 2026 실적 발표에서 개인 AI 에이전트를 통해 사용자를 대신해 24/7로 목표 달성을 돕겠다고 밝혔다.

r/artificial13일 전

2026년 이후 미국 데이터센터 9,700MW 증설 계획을 지도로

The New York Times의 인터랙티브 기사가 링크되었다. 지도는 각 데이터센터의 메가와트 용량을 원 크기로 매핑하는 방식으로 현재와 'Planned after 2026'를 비교한다. 범례에 9,700 megawatts와 500 수치가 명시되어 있어 확장 규모를 수치로 읽을 수 있다.

실시간 트렌드트윗 1913일 전

OpenAI, API 설정과 컨텍스트 압축만으로 ARC‑AGI‑3 점수를 3배로

Kimi K3는 2.8조 파라미터를 오픈 웨이트로 공개해 vLLM 기반 서빙 생태계를 넓혔다

POMDP 그래프로 에이전트 성공률을 0.78에서 0.95로

플랫 마크다운 기반 RAG에서 체인 실패 원인 추적이 어려워 부분 관찰 MDP로 그래프화해 성공률을 0.78에서 0.95로 끌어올리고 토큰비용을 낮췄다고 보고됐다.

Techpresso13일 전· 29일 전 발행

Hassabis의 AI 감시기구 촉구와 iOS 27 공개 베타

Hassabis가 미국 주도 글로벌 AI 감시기구를 촉구했고 Apple이 iOS 27 공개 베타에 새로운 Siri AI를 포함시켰다. 본문은 관련 세부 구현을 제시하지 않았다.

서버 비용을 20% 깎은 GPT-5.6 Sol의 계층별 최적화

GPT‑5.6은 모델 자체와 추론·에이전트 계층에서 병렬 커널 최적화, 추측적 디코딩, 프롬프트 캐시 등 복합적 개선으로 토큰당 효율을 끌어올린 시스템이다.

언어를 넘어선 World Model에 비어 있는 거버넌스

Stanford HAI가 발간한 이슈 브리프는 월드 모델이 환경의 동작을 모델링해 예측·결정에 활용되며 측정·데이터·거버넌스 공백이 정책 위험을 초래한다고 제시한 문서이다. 문서는 시뮬레이션 비용 절감, 벤치마크 부재, 행동 라벨 데이터 희소성, 군사적 이중 용도 위험을 핵심 요지로 제시함이 확인됐다. 보고서는 정책 입안자에게 측정 과학과 공공 데이터 투자가 필요하다고 권고한 것으로 나타났다.

Jensen Huang이 첫 X 글로 지지한 오픈 가중치

Jensen Huang의 X 서한은 '검사할 수 없는 블랙박스'를 경계하라는 요지이며 오픈 웨이트 쪽으로 산업의 자산 배분이 이동하고 있음이 확인됐다. 시장은 속도와 비용의 단기 이득과 감사 가능성의 장기 생존성 사이에서 선택을 강요받고 있음이 확인됐다.

Opus 5로 주말에 만든 브라우저 좀비 게임

Claude와 ElevenLabs SFX로 모든 게임 에셋을 코드로 생성하고 Three.js로 구동되는 브라우저 기반 좀비 게임을 15–20시간 작업으로 완성했다. 공개 소스와 1,000+ 세션이라는 실사용 증거를 확보했고 멀티플레이와 보이스 채팅, 글로벌 리더보드를 포함해 플레이 가능한 완성품을 배포했다. 소스코드는 GitHub에 업로드되어 재현과 학습이 가능하다.

속도 수치 하나로 로봇 플래닝을 판단하면 놓치는 것

빠른 평균 처리량은 중요하지만 장면 변화가 있을 때의 리그라운딩 빈도와 복구 성능이 더 중요하다는 지적이다.

입력물을 학습에 쓰는 Higgsfield 약관이 남긴 위험

Higgsfield 약관은 입력·출력을 모델 학습에 사용할 수 있다고 명시해 전문 제작물 업로드에 적합하지 않다고 판단됐다. Artlist는 입력 권리 귀속과 제3자 학습 차단 조항으로 제작 워크플로우에 안정성을 제공한다. 숫자·동시 생성 한도와 안전 규정 차이가 의사결정의 핵심임이 확인됐다.

콘텐츠 산만함의 진짜 원인은 조직이었다

Lisa Gately는 콘텐츠 문제가 주로 조직적 원인에서 비롯되며 generative AI 도입이 산만함을 가속화한다고 밝혔다.

r/artificial13일 전· 14일 전 발행

무당개구리가 알려주는 AI 이상행동 대처법

양서류의 무증상 보균과 애완무역이 병원체 확산을 초래한 사례를 통해 AI의 예기치 않은 행동은 격리보다 발생 조건 연구가 필요함이 제기됐다. 이해 기반의 안전 접근이 강조됐다. 단순한 제거는 근본적 해결이 되지 못함이 지적됐다.

인간 엔지니어보다 빠르게 마이크로소프트의 버그를 찾아내는 AI

Anthropic의 AI가 마이크로소프트의 버그를 인간보다 빠르게 발견하고, Sierra가 AI 에이전트 보안을 위해 10억 달러 규모의 인수를 단행했다.

실시간 트렌드트윗 1814일 전👁 5

GPT‑5.6 Sol의 서버비용 절감과 Grok Voice의 실시간 병렬 추론

Kimi K3는 1-bit 변환으로 용량을 62% 줄이면서도 vLLM Day 0 지원까지 갖췄다

Brockman이 흘린 OpenAI의 '기기 패밀리'

Greg Brockman이 Joanna Stern 인터뷰에서 OpenAI가 'family of devices'를 개발 중임을 밝혔다. 그는 출시일과 구체 사양을 공개하지 않았다. 인터뷰에는 "you can expect them soon."이라는 인용구가 포함됐다.

Opus 5보다 8개 더 풀고 비용은 65% 낮춘 라우팅

라우팅된 설정이 Terminal-Bench 2.1에서 Claude Opus 5보다 8개 더 많은 태스크를 해결했고 비용은 65 낮았다고 보고되었다. 작성자는 벤치마크와 방법론 및 원시 수치를 블로그에 올렸다. 글은 성능 우위의 출처를 분해해 제시했다고 알렸다.

곱셈표 하나로 학습한 1.8만 파라미터 트랜스포머의 확률

단일 10×10 곱셈표만으로 학습한 작은 decoder-only transformer가 접두사별로 데이터 빈도와 일치하는 확률 분포를 산출함이 확인됐다.

수일 걸린 고객 이탈 대응을 수분으로 줄인 파이프라인

Amazon Quick의 Dashboard, Chat Agent, Flows, Automate를 연결해 CSAT와 통화 감정분석으로 우선순위 고객을 자동 탐지하고 맞춤 오퍼를 생성하는 자동화 파이프라인이다.

드리프트를 미리 읽어 MRR을 11% 올린 랭킹 구조 DART

DART는 Forecaster가 look-ahead 창의 아이템 성능을 예측하고 불확실성 인지 attention으로 예측 정보를 랭커에 동적으로 가중하여 온라인 업데이트 없이 드리프트 적응을 달성한 방법이다. DART는 프로모션 동안 +11.11%±0.11% 상대 MRR 향상을 보였음이 확인됐다. Coveo SIGIR dataset에서도 ∼+22% MRR 향상이 관찰되었다.

서브에이전트별 토큰 비용을 뽑아내는 CLI

OpenInference 형식 JSONL을 파싱해 서브에이전트별 비용을 계산하고 반복 컨텍스트를 찾아내는 CLI 스크립트이다.

매 대화마다 규칙을 되풀이하지 않게 하는 Custom Skills

Analytics Vidhya 글은 Claude에서 Custom Skills를 만들어 반복되는 구조·검증·표준을 패키지로 묶어 재사용함으로써 시간 낭비와 결과 불일치를 줄이는 방법을 안내한 가이드이다. 글은 Claude가 데이터 검토·코드 점검·보고서 작성·프레젠테이션 준비를 수행한다고 밝히며 Custom Skills의 역할을 문제 해결 관점에서 기술했다. 해당 게시물은 실무 팀의 반복 작업을 줄이는 목적임이 확인됐다.

실시간 트렌드트윗 1814일 전

OpenAI, 연구자 10만 명 확대 목표의 frontier 모델 접근 프로그램 공개

같은 기간 Grok 4.5는 LaurenBench에서 56.9%로 1위에 올랐다

149년 걸릴 15억 장을 18개월에 만든 생성 AI

Starling Lab은 15억 장 생성에 149년이 걸렸다고 추정했고 Generative AI는 18개월 만에 같은 양을 만들었으며 Google은 1000억 건 이상을 보고하고 SynthID 확장을 추진했다.