본문으로 건너뛰기

2026년 6월 25일 AI 뉴스

81

관심 태그 추가

Codex로 UI 이미지를 자동 생성하고 팀 에이전트를 슬랙에 태그하기

작성자는 Codex의 Image Gen으로 웹 UI에 바로 쓸 수 있는 이미지를 생성해 가시성이 좋아졌다고 전하며, Claude Tag, Gemini 3.5 Flash의 컴퓨터 제어 기능, Figma·Notion 업데이트, OpenAI의 Jalapeño 칩 등 최신 AI 도구·플랫폼 소식을 모아 전한다.

검색에 올린 이미지가 AI 모델 학습 데이터로 저장된다

Google의 Search 기록 업데이트는 역이미지 검색 등에서 사용자가 업로드한 미디어를 검색 기록에 저장하고 AI 모델 훈련 용도로 활용한다.

공개 리더보드에 속지 말고 내 데이터로 모델을 검증하라

벤더·공개 벤치마크는 배포 결정에 한계가 있어, 고정된 생산 트래픽 샘플로 구성한 평가셋과 동일한 입력·로그 조건을 통해 모델을 비교해야 한다.

r/ClaudeAI1달 전

한눈에 보는 Claude Code 훅 실행 흐름과 핵심 이벤트

Claude Code 슬라이드 다이어그램으로 훅 이벤트(세션 시작→프리툴→권한 요청→툴 실행→포스트툴→세션 종료)와 실패/컴팩트·서브에이전트 흐름을 시각화했다.

에이전트가 작업 전에 모드를 골라 체크리스트로 안전하게 행동하도록 강제하는 SKILL

코딩 에이전트가 작업 전에 'debug, fix, review' 등 모드를 선택하고 모드별 체크리스트로 실제 검사·비파괴 규칙을 강제하는 SKILL.md 기반 프로젝트

팀 단위 LLM 비용을 자동 귀속·차단하는 오픈소스 프록시

공유 API 키로 발생하는 비용 불투명 문제를 해결하기 위해 요청 헤더·팀 키 기반 비용 귀속과 하드 예산 차단을 제공하는 오픈소스 프록시 SteadIO가 공개되었다.

호스티드 모델 접근이 수출인가? 연방 법원이 답한다

Legion LegalTech가 미국 상무부 조치에 맞서 제기한 소송이 진행 중이며, 핵심 쟁점은 서버에 남는 호스티드 추론 출력이 수출통제의 적용 대상인지 여부다.

DGX Spark 2대 운영—토큰 속도·확장성·전력 이슈 실전 리포트

작성자는 2대의 NVIDIA DGX Spark로 오픈소스 LLM 인퍼런스와 프로덕션 운영을 수행하며 모델별 토큰 처리속도, 노드 확장 효율, 전력·네트워크 이슈 등을 수치와 함께 보고했다.

저장된 확신은 오래된 정보다 — 읽을 때 재계산하라

저장된 confidence 값은 시간이 지나면 부정확해지므로 그래프 기반 'Recall'이 읽을 때마다 stated·calibration·support·challenge를 결합해 확신을 재계산해 모순을 즉시 반영한다.

에이전트 내부를 그래프로 들여다보는 새 LangGraphics 기능

LangGraphics가 서브그래프를 그래프 내부에 중첩 렌더링하고 완료된 실행을 단계별로 재생해 각 노드의 입력·출력·상태·비용을 조사할 수 있게 했다.

HF Daily Papers1달 전· 2달 전 발행

Local reduction으로 100,000샘플에서 90% 이상 물리적 타당성 달성

재생에너지 기반 마이크로그리드는 불확실성 때문에 설계·운영 시나리오 수가 기하급수적으로 늘어나며, 기존의 시나리오 접근은 계산·메모리 비용이 매우 크다. 본 연구는 불확실성 집합에서 실제로 '문제를 유발하는' 소수의 시나리오만 생성해 최적화 문제 크기를 크게 줄이고, 설비용량(배터리·PV)과 스케줄링을 동시에 결정한다.

HF Daily Papers1달 전· 1달 전 발행

동적 장면에서 PSNR+0.95dB·161FPS 달성, 동적 프리미티브 25× 축소

동적 3D 장면 재구성에서 모션 일관성과 시각적 충실도는 상충 관계를 보인다. Multi4D는 표현을 static / persistent / transient의 세 수준으로 분할하고 잔차 기반 경쟁 할당을 적용해 두 목표를 동시에 만족하면서 실시간 렌더링과 저장 효율을 크게 개선한다.

스파이크로 연산량 15배 절감했지만 정확도는 따라오지 못했다

자작 Spiking Neural Network가 NARMA-10에서는 기억 깊이가 부족했으나 입력에 이산 지연을 추가해 메모리 깊이를 3배로 늘리고 기본 선형 기준과 유사한 정확도를 만들며 512셀 과제에서 내부 연산량을 15배 줄였다.

에이전트형 AI, 행동 설계, 오케스트레이션 핵심 정리

에이전트형 시스템의 등장과 에이전트 행동 설계, 멀티에이전트 오케스트레이션을 중심으로 AI가 제품의 행동·신뢰·워크플로우를 어떻게 변화시키는지 정리했다.

Agentforce 준비를 위한 Slack–Salesforce 통합의 핵심 설계 원칙

Slack과 Salesforce 연결에서는 연결 앱·통합 사용자·아이덴티티 매핑·Slack의 레코드 노출 설정이 보안성과 유지보수성, Agentforce 준비성에 결정적 영향을 준다.

RF-DETR로 강판 표면 결함을 Pass/Review/Fail로 자동 분류하는 워크플로

공개 라벨 데이터로 RF-DETR Small을 학습해 강판 표면 결함을 검출하고 Roboflow Workflow로 pass/review/fail 삼단 분류를 자동화한다.

Nova 2 Sonic으로 환자 예약 전화를 음성으로 자동화하기

Amazon Nova 2 Sonic의 speech-to-speech 처리와 Bedrock AgentCore 오케스트레이션을 이용해 환자 인증·예약 관리·사전 건강정보 수집·인력 에스컬레이션을 수행하는 서버리스 음성 에이전트를 구현한다.

동일 프롬프트 2주 테스트로 본 5대 이미지 생성기 장단점

같은 프롬프트로 2주간 테스트한 결과 Midjourney가 사진 실사에 강하고 Ideogram은 이미지 내 텍스트, Stable Diffusion은 파인튜닝 시 스타일 일관성, DALL·E 3은 사용성 우수, Firefly는 상업적 라이선스 안전성이 돋보였다.

r/ClaudeAI1달 전

AI 생성 코드에서 흔히 발생하는 환각·보안·신뢰성 문제와 대응책

AI가 생성한 코드에서 허구의 API 제안, 일반화된 패턴의 부적합성, 디버깅 능력 저하, 민감 정보 노출이라는 네 가지 위험이 발생하며 각각에 대한 검증·문맥 보강·수동 연습·권한 제한 대응이 필요하다.

한 줄 바꾸기로 MoE 파인튜닝 3.4~3.7배 가속과 GPU 메모리 29~32% 절감

NeMo AutoModel은 Transformers v5 위에서 Expert Parallelism, DeepEP, TransformerEngine을 결합해 MoE 파인튜닝을 API 변경 없이 3.4~3.7배 가속하고 GPU 메모리를 29~32% 절감한다.

LangChain1달 전

AI 에이전트가 실수를 반복하지 않게 만드는 지속적 학습 루프 구축법

LangSmith Engine과 Context Hub를 사용하여 에이전트의 추적 데이터를 영구적인 메모리로 변환하고 지속적으로 성능을 개선하는 방법을 다룬다.

단일 파라미터가 모델을 망가뜨리는 이유

소수의 '슈퍼 웨이트'와 대응하는 '슈퍼 액티베이션'이 LLM의 생성 품질을 결정하며 이를 보존하면 단순 양자화로도 높은 압축 품질을 유지할 수 있다.

바이너리 필터를 대체하는 연속 안전 프로토콜 I-Lang

I-Lang v5.0은 9차원 연속 벡터 평가와 행동 최적화로 이진 차단의 기본 한계를 극복하고 LLM 기반 스트레스 테스트에서 0.92의 강건성 점수를 얻었다.

AI 보조 뒤 실력 저하 사례들—의사와 엔지니어에서 확인된 영향

실시간 보조 AI 사용이 숙련 의료진과 소프트웨어 엔지니어의 현장 수행 능력과 개념 학습을 약화시킨다는 무작위실험·현장관찰 증거가 제시됐다.

HF Daily Papers1달 전· 1달 전 발행

Diffusion 특성과 희소 voxel 정렬로 이미지→3DGS 재현 품질 개선

단일 이미지에서 사실적 3D 자산을 자동 생성할 때 텍스처의 고주파 정보(글자, 로고, 섬세한 질감)가 쉽게 손실된다. FLUX3D는 diffusion으로 학습된 2D 특성과 희소-구조 인식 diffusion 모델을 결합해 입력 이미지의 미세한 외형을 더 잘 보존하는 3D Gaussian Splatting 자산을 생성한다.

HF Daily Papers1달 전· 1달 전 발행

9,664개 문서·372M 토큰·362문항으로 측정한 아카이브 문서 추론 능력

기업·기관 내부 아카이브에서 분산된 근거를 찾아 계산·검증하는 능력은 단순 대화 능력과 별개로 조직 생산성에 직접적 영향을 준다. Agora는 대규모·다도메인·검증 가능 쿼리 집합으로 이 능력을 측정하며, 평가 결과 최고 모델의 정확도는 59.39%로 현행 LLM 에이전트의 한계와 도메인별 약점을 드러냈다.

HF Daily Papers1달 전· 1달 전 발행

제로 인간 시연으로 실세계에서 최대 96% 성공률 달성

VLA(vision-language-action) 정책은 학습 데이터에 있는 기술로만 작동하므로 새로운 조작 기술이 필요할 때마다 사람 시연이 필요하다. InSight는 VLM을 이용해 누락된 '프리미티브'를 자동으로 식별·수집·학습해 인간 시연 없이 새로운 스킬을 획득하고, 실제 실험에서 pouring 96%, 긴 단계 작업 80% 등의 높은 성공률을 보였다.

HF Daily Papers1달 전· 1달 전 발행

KEM으로 RoboTwin-MeM에서 성공률 75.2%, 기존 대비 평균 +40%

로봇 조작 환경에서는 작업 중간에 잠깐 드러나는 시각 단서가 이후 행동 결정에 필수적일 때가 많다. EventVLA는 이러한 일시적 증거를 예측·선제 저장해 비마르코프성 과제에서 성공률을 크게 향상시킨다.

HF Daily Papers1달 전· 1달 전 발행

월드 모델로 가치 추정 강화—WVM이 Retry-VOC 0.78 달성

로봇 학습에서 각 프레임의 '진행도(value)'를 정확히 추정하면 저품질 데이터(망설임, 재시도)를 자동으로 걸러 정책 학습 효율을 높일 수 있다. 기존 VLM 기반 접근은 시공간 정보가 부족해 장단기 temporal 패턴(plateau, regression)을 잘 포착하지 못하는 반면, 월드 모델은 미래 예측 능력을 통해 더 정확한 진행도 추론을 제공한다.

HF Daily Papers1달 전· 1달 전 발행

Frozen LLM의 NTP로 학습한 retriever가 BEIR·RTEB에서 NDCG@10 최대 +0.08

Dense retriever 학습은 보통 긍정/부정 문서 쌍 라벨이 필요해 데이터 확보 비용이 높다. DREAM은 frozen LLM의 next-token prediction 손실을 활용해 라벨 없이도 retriever를 학습시켜 라벨 의존도를 낮춘다. 이 방식은 BEIR·RTEB 실험에서 기존 LLM-감독 방법들보다 일관된 성능 향상을 보였다.

HF Daily Papers1달 전· 1달 전 발행

보상 기반 생성으로 NAVSIM에서 PDMS 92.8 달성

주행계획의 불확실성은 단일 경로 예측으로 해소되지 않으며, 기존 방법은 촘촘한 보상신호와 자유로운 제안 생성 중 하나만 선택했다. FlowR2A는 보상 기반 조건부 생성으로 두 가지를 결합해 실제 주행 제안의 품질과 일관성을 동시에 개선했다.

HF Daily Papers1달 전· 1달 전 발행

게이트드 Transformer로 평균 +6.1 mean macro F1 향상

Attention 기반 MIL은 어텐션 가중치가 소수 인스턴스에 편중되어 예측이 과도하게 자신감 및 불안정해지는 문제가 존재한다. QG-MIL은 아키텍처 수준의 정규화와 게이팅을 통해 이러한 attention concentration을 구조적으로 완화하여 도메인 간(whole-slide pathology ↔ hematology) 일관된 성능 개선을 달성한다.

HF Daily Papers1달 전· 1달 전 발행

계층적 KG 기반 ChartWalker-Bench, 최고 정답률 64%

차트는 약하게 구조화된 다중모달 정보로, 차트 간 증거를 결합하는 Cross-Chart RAG가 실무 분석에서 중요하다. ChartWalker는 계층적 KG와 구조 인지 샘플링으로 의미 일관성 있는 다중홉 경로를 생성하며, 최고 모델의 정답률이 64%에 불과하고 복잡한 질의에서는 다수 사례에서 30% 미만으로 떨어져 현행 RAG 파이프라인의 한계를 드러낸다.

HF Daily Papers1달 전· 1달 전 발행

다중 이미지·다국어 검증으로 GPT-5.2 기준 L1 정확도 41.80% 달성

현실 세계의 허위정보 게시물은 긴 다국어 텍스트와 여러 이미지를 결합해 부분적 진실과 교차모달 왜곡을 만든다. 단일 캡션·단일 이미지·이진 라벨 중심의 기존 벤치마크는 이러한 검증 압력을 반영하지 못하며, ReMMDBench와 ReMMD-Agent는 원자적 분해와 증거 재사용으로 실제 운영 환경에 더 근접한 평가와 비용 효율적 검증을 제공한다.

HF Daily Papers1달 전· 1달 전 발행

LLM 사전학습: 스텝 57% 절감, MMLU 0-shot +7.2%

사전학습 데이터의 출처 구성과 혼합 전략이 LLM 성능과 학습 효율을 결정한다. HDS는 데이터 혼합을 에이전트가 실시간으로 최적화하도록 하여 학습 스텝과 연산 비용을 크게 줄이고 downstream 성능을 동시에 향상시켰다.

HF Daily Papers1달 전· 1달 전 발행

동일 코드로 ImageNet↔T2I 학습 가능 — ImageNet FID는 T2I 성능을 예측하지 못함

Diffusion transformer(DiT) 연구는 ImageNet FID 중심으로 수렴했으나, 이 점수가 텍스트-투-이미지(T2I) 성능을 예측하는지 불확실하다. NanoGen으로 동일한 코드·레시피로 ImageNet과 T2I를 모두 학습·평가하면 ImageNet 개선이 T2I 개선으로 일반화되지 않음을 확인하고, 두 축을 합친 DiffusionBench를 제안할 수 있다.

HF Daily Papers1달 전· 1달 전 발행

내적 목표·정체성·설정자로 '진정한 agency'를 규정한 GIC 아키텍처

현대의 'agent' 시스템은 도구·워크플로 중심으로 설계되어 내부적 목표·정체성·자기조절 능력이 부족하다. 이 논문은 에이전시의 최소 구조를 수학적으로 규정하고, 이를 갖춘 Agent Model 설계 원칙과 GIC(Goal-Identity-Configurator) 아키텍처를 정의해 보다 자율적이면서 감사 가능하고 통제 가능한 시스템 설계 방향을 제시한다.

HF Daily Papers1달 전· 1달 전 발행

3,273개 프롬프트로 T2I 모델의 반사실적 추론 한계 정량화

텍스트-투-이미지(T2I) 모델의 고품질 생성 능력이 실제로 원인-결과 기반의 반사실적 추론을 반영하는지 불분명하다. CF-World는 모델이 현실적 상식(priors)을 극복해 규칙이 바뀐 세계를 시각적으로 구현할 수 있는지를 직접 측정해, 모델 설계 및 평가 방향을 전환할 기준을 제공한다.

HF Daily Papers1달 전· 1달 전 발행

EDV로 τ^2-bench 평균 Pass@1 86.6 달성

단일 에이전트가 실행과 평가를 모두 담당할 때 내부적으로 일관된 오류가 메모리에 누적되어 이후 의사결정에 악영향을 끼친다. EDV는 실행, 증류, 검증을 역할 분리해 메모리에 기록되는 경험의 신뢰도를 높여 장기적 에이전트 성능을 개선한다.

HF Daily Papers1달 전· 1달 전 발행

워터마크 + LVT로 VAE 교체 시 생성 품질을 크게 저하시키는 소유권/유출 추적 체계

연합 학습으로 Latent Diffusion Models를 공동 학습하면 각 참가자에게 완전한 모델이 배포되어 악의적 유출 위험이 존재한다. FedOT은 이미지에 삽입한 워터마크와 VAE의 잠재 분포 변형을 결합해 유출된 모델의 소유권을 검증하고, 유출 출처(클라이언트)를 추적할 수 있는 실용적 메커니즘을 제공한다.

HF Daily Papers1달 전· 1달 전 발행

프롬프트 수준 다양성으로 탐색 가능한 구조화된 이미지 갤러리 생성

단일 프롬프트에서 생성된 이미지들이 동일 해석으로 수렴하는 diversity collapse 문제를 프롬프트 수준에서 직접 제어해 구조화된 대안 공간을 생성한다. 사용자는 의미 있는 축(axis)별로 결과를 탐색해 의도에 맞는 대안을 효율적으로 찾을 수 있다.

HF Daily Papers1달 전· 1달 전 발행

비디오 latent에서 삼각형 프리미티브를 단일 패스로 복원해 기하학 정확도 향상

단일 이미지에서 탐색 가능한 3D 장면을 만들려면 시야 밖 표면과 정확한 지오메트리가 필요하다. FLAT은 대규모 video diffusion 모델의 latent를 단일 전달로 삼각형 기반 표면 프리미티브로 직역(직접 복원)해, 실시간 렌더링과 게임 엔진 호환성에 맞는 기하학적 정확도를 확보한다.

HF Daily Papers1달 전· 2달 전 발행

16,000개 EMR 정렬 합성 대화로 LLM의 정신과 진단(2‑way 92.3% → 12‑way 28.5%

정신과 진단은 다중 정보수집과 감별 진단 능력을 요하는데, 기존 벤치마크는 정적·템플릿 기반 데이터로 실제 상담 흐름과 진단 레이블을 동시에 평가하지 못한다. 본 연구는 EMR 분포에 정렬된 대규모 합성 대화와 에이전트 기반 동적 평가 파이프라인을 제공해 LLM의 정보수집 전략과 최종 진단 성능을 동시에 측정할 수 있게 한다.

HF Daily Papers1달 전· 1달 전 발행

에이전트 네이티브 Android로 완료율 +21.12%, 토큰 비용 -51.55%

AI 에이전트가 앱 경계를 넘나들며 작업을 자동화할수록 기존 앱 중심 OS는 실행 지연과 민감 데이터 노출 리스크를 유발한다. AOHP는 Android 기반에서 에이전트를 OS 1급 행위자로 취급해 개인화된 서비스 인터페이스, 에이전트 친화적 실행 경로, 운영체제 수준의 정보 흐름 통제를 제공한다. 벤치마크에서 작업 완료율과 토큰 효율 면에서 유의미한 개선을 보였다.

HF Daily Papers1달 전· 1달 전 발행

ConAct로 컨텍스트 폭발 축소 — 235B 제로샷에서 MemGUI-Bench Pass@3 62.5% 달성

모바일 GUI 자동화에서는 화면 전환과 다단계 상호작용 속에서 가격, 전화번호 같은 중간 사실을 정확히 유지하는 것이 핵심이다. 기존 ReAct식 누적 로그는 프롬프트가 길어지고 중요한 정보가 희석되어 장기 과제 성능이 급락한다.

HF Daily Papers1달 전· 1달 전 발행

무주석 적응으로 ForgeOwl-8B가 AndroidWorld Pass@3 77.6% 달성

앱 생태계가 방대하고 자주 변경되어 인간 라벨로 적응하기 어렵다. MobileForge는 사람 라벨 없이 대상 앱 상호작용으로부터 태스크와 계층적 피드백을 자동 생성해 에이전트를 효과적으로 적응시켜, 폐쇄 데이터 기반 GUI 모델과 근접한 성능을 보인다.

HF Daily Papers1달 전· 1달 전 발행

90개 Nature 과제로 검증한 에이전트의 SOTA 초과 비율은 17.8%

공개된 논문을 재현하는 수준을 넘어, 에이전트가 자체적으로 경쟁력 있는 연구 방법을 찾아 SOTA를 초과할 수 있는지를 대규모로 측정하는 첫 벤치마크이다. 과제 패키지의 컨테이너화와 정보 방화벽, SOTA 정규화 지표를 결합하여 재현성·공정성·발견 가능성을 동시에 확보한다.

7개 도메인 시뮬레이션과 2,170샘플 AgentWorldBench 공개

언어 모델을 환경 시뮬레이터로 학습하면 실환경 실행 없이 수천 개의 상황을 제어·확장해 에이전트 학습을 가속화할 수 있다. 또한 LWM 학습을 에이전트 사전 단계로 활용하면 downstream 에이전트 성능이 일관되게 향상된다.

HF Daily Papers1달 전· 1달 전 발행

Qwen3-32B SFT로 7개 에이전트 벤치 평균 44.8% 달성

에이전트형(agentic) 모델은 도구 사용과 멀티턴 상호작용을 수행하나, 공개된 학습 데이터 구축 방법은 제한적이다. 본문은 6단계 SFT 데이터 큐레이션 파이프라인과 100여 개의 통제된 ablation을 통해 실험적으로 어떤 데이터 설계가 에이전트 성능을 끌어올리는지 규명하고, 공개 데이터셋·파이프라인·모델을 배포한다.

오픈 모델 GLM-5.2가 Claude Opus와 동일한 코딩 성능을 보였다

GLM-5.2는 Claude Opus와 같은 25/45 통과율을 보였고, 프롬프트 캐싱 적용 시 비용은 약 46% 수준이었다.

온디스크·로컬 RAG용 경량 벡터 DB, LodeDB 공개

LodeDB는 LangChain·LlamaIndex 어댑터를 제공하는 로컬 온디스크 벡터 DB로, 작은-중간 규모 코퍼스에서 정확 검색과 빠른 p50 지연(<1ms)을 목표로 설계됐다.

파일럿에서 공장 실전으로: Vision AI 확장 로드맵

Roboflow의 청사진은 실험실 정확도가 현장으로 이전되지 않는 문제를 지적하며, 다섯 단계의 Vision AI Maturity Model로 재사용 가능한 생산 역량으로 전환하는 방법을 제시한다.

데이터 레이어에 비즈니스 로직을 두어 AI·BI 응답을 하나로 통일하기

Snowflake 시멘틱 뷰를 사용해 S3에서 불러온 데이터에 비즈니스 정의를 부여하고 Cortex Analyst와 Amazon QuickSight에서 동일한 의미로 쿼리해 신뢰 가능한 AI·BI 결과를 제공한다.

4억 건 문서를 수개월 내 처리하고 95% 이상 정확도 달성한 워크플로

Huntington 은행은 Amazon Textract·SageMaker·Step Functions·Lambda와 DataSync/Direct Connect를 조합해 4억 건 이상의 문서를 수개월 내에 95% 이상 정확도로 식별·마스킹하고 온프레미스로 결과를 동기화했다.

Databricks가 그리는 에이전트 시대의 데이터 플랫폼

Databricks가 Omnigent 오픈소스 하니스와 LTAP·Lakebase 등으로 데이터 스토리지와 에이전트 운영을 통합하는 '데이터·AI 운영체제' 비전을 제시했다.

위치를 다차원 회전으로 표현한 HDD-RoPE, 학습 수렴이 빨라짐

누적 행렬곱을 위치 임베딩으로 재해석한 HDD-RoPE는 토큰 표현을 4차원 이상 청크로 쪼개어 다축 회전을 적용하고 각 축의 회전량을 데이터 종속적으로 학습해 TinyStories에서 xPos 대비 검증 손실의 수렴을 앞당겼다.

프롬프트 육아에서 벗어나게 해주는 LLM 출력 검증·튜닝 워크플로

dspyer는 LLM 호출을 Pydantic 스키마로 래핑해 출력 검증·재요청 루프를 자동화하고, 해당 단계를 DSPy 모듈로 컴파일해 optimizer로 프롬프트를 튜닝·저장해 재사용하는 도구다.

153일 어드벤처로 본 Gemini의 창의성·기억 문제

153일간 Gemini로 진행한 대화형 플레이에서 모델은 창의적·출현적 이벤트를 자주 만들어냈지만 인벤토리·지리·퀘스트·레벨 추적에서 반복적 일관성 실패를 보였다.

메모리 레이어에서 조용한 손실 등 4가지 실패를 재현하고 회피하는 엔진

CLS++ 재현 스크립트로 embedder 장애·충돌·차원 불일치·빈 추출 등 에이전트 메모리의 네 가지 실패 모드를 재현했고, 이를 회피하는 메모리 엔진과 벤치마크를 공개했다.

Claude 기반 시나리오 합산으로 Fable 공개일을 예측함

작성자는 네 가지 시나리오(실수·안전·외국인 제한·정치적 압박)를 세우고 Claude로 조합한 확률로 미국 사용자 대상 Fable 공개 예측을 산출해 7월 중순(중앙값 7월12일)을 제시했다.

프롬프트 예시가 무음 영상에서 문장을 발화하게 만든다

프롬프트에 들어있던 출력 예시와 post-training된 언어적 priors가 결합해 Inter-1이 무음 비디오에서 특정 문장을 반복 발화한 사례와 실험 결과를 공유한다.

Papers with Code에 정리된 최신 OCR 모델과 벤치마크를 한곳에 모았다

Papers with Code가 OCR 벤치마크·모델·논문·코드 링크를 정리한 페이지를 공개했으며 Baidu의 Unlimited OCR(3B, R-SWA)과 Mistral의 OCR 4 등 최신 릴리스를 소개하고 있다.

오픈소스 드리프트 모니터링 Driftium을 배포할 때 점검할 핵심 항목

작성자가 만든 Driftium은 tabular 피처 드리프트와 LLM 응답 드리프트를 함께 모니터링하는 오픈소스 플랫폼으로서 아키텍처 현실성 및 확장성에 대한 경험 많은 MLOps 피드백을 요청하고 있다.

로컬 LLM으로 나만의 AI 환경 구축하기: 하드웨어부터 모델 선택까지

로컬 AI 모델의 성능과 하드웨어 최적화, 그리고 AI 기술의 탈중앙화와 오픈소스의 중요성에 대해 심도 있게 논의합니다.

OpenAI의 자체 추론 칩과 협업형 에이전트 소식 요약

OpenAI의 추론 전용 ASIC 공개와 Anthropic의 Slack 내 상시 에이전트 출시 등 주요 AI 신기술·제품 소식을 정리했다.

Nova 2 Sonic으로 실시간 자연스러운 음성 에이전트 구현

Loka는 Amazon Nova 2 Sonic 기반의 speech-to-speech 파이프라인으로 Big Bench Audio 87.0 점수와 1.39초의 응답 지연, 시간당 약 0.27달러 비용을 달성해 차량 딜러 상담용 음성 에이전트의 자연스러움과 경제성을 개선했다.

Gemini 3.5 Flash에 내장된 컴퓨터 조작 기능으로 에이전트 자동화 확장

Gemini 3.5 Flash는 computer use를 메인 모델에 통합해 브라우저·데스크탑·모바일에서 직접 보고 조작하는 에이전트를 API로 제공하며 안전 장치를 선택적으로 제공한다.

리포지토리 맞춤 프로브와 블라인드 채점으로 모델을 재평가하는 방법

ModelFit은 대상 리포지토리에서 생성한 프로브와 블라인드 루브릭 채점을 통해 모델의 정답률을 우선으로 비교하고 비용과 지연을 부차적으로 보고하는 오픈소스 벤치마킹 도구이다.

디자인 캔버스에 코드와 AI 워크플로를 직접 집어넣다

Figma가 코드 레이어와 모션·셰이더 지원, AI로 생성 가능한 커스텀 플러그인 및 스킬 통합을 통해 캔버스 내 프로토타이핑과 협업 흐름을 강화했다.

미 정부의 보안 우려로 Claude Fable 5 배포가 중단되고 재배포 요건이 논쟁 중이다

미 정부의 보안 우려로 Anthropic의 Claude Fable 5가 6월 12일 오프라인 조치되었고 재배포를 둘러싼 기술적·정책적 논쟁이 계속되고 있다.

"AI가 AI를 고용한다?" Sakana Fugu Ultra vs. Claude Opus 4.8 성능 비교

Sakana Fugu Ultra와 Claude Opus 4.8을 6가지 복잡한 프롬프트로 비교하여 성능, 비용, 속도를 분석한 결과입니다.

HBM과 SRAM 관점으로 본 FlashAttention 연산 흐름

핸드드로잉 다이어그램은 HBM에서 SRAM으로 청크를 스트리밍하며 온라인 소프트맥스 추적으로 FlashAttention 연산을 수행하는 메모리·연산 파이프라인을 보여준다.

AI가 코드를 다 짜는 시대, 엔지니어의 진짜 가치는 어디에 있는가?

AI가 코딩을 주도하는 시대에 엔지니어는 코드 작성보다 문제 정의와 검증, 그리고 AI를 활용한 학습에 집중해야 한다.

"코드는 넘쳐나지만 시장은 아니다" AI 시대 PM의 생존 전략

누구나 코드를 작성할 수 있는 AI 시대, PM은 기술 구현보다 상업적 가치와 사용자 행동 변화를 증명하는 비즈니스 전략가로 진화해야 한다.

AI 에이전트가 데이터베이스를 직접 최적화하고 샤딩하는 방법

AI 에이전트가 인프라를 안전하게 관리할 수 있도록 설계된 데이터베이스 플랫폼의 역할과 실전 데모를 다룬다.

오픈 AGI 생태계에 4,200만 달러가 투입된 공개형 보조금·투자 프로그램이 시작됐다

Sentient Foundation이 오픈 소스 유지관리자와 오픈 구성요소 기반 스타트업을 대상으로 총 4,200만 달러 규모의 보조금 및 투자 프로그램을 운영하며 신청 링크와 참여 조건을 공개했다.

Gartner가 인정한 통합 데이터·AI·거버넌스 플랫폼의 가치

Databricks가 Gartner의 2026 Magic Quadrant에서 리더로 평가되었으며 Lakehouse와 Unity AI Gateway 등으로 데이터·AI·거버넌스를 통합해 agentic 애플리케이션의 신뢰성과 운영을 지원한다.

r/artificial1달 전

AI 모델 7종의 베팅 대결과 전 호출 로그 공개

작성자는 7개 AI 모델을 월드컵 베팅 실험에 참여시켜 매 호출과 토큰·비용·추론 흔적을 기록해 모델별 의사결정과 비용효율을 비교한다.

OpenAI가 Broadcom과 만든 추론 전용 ASIC 'Jalapeño'를 공개했다

OpenAI가 Broadcom과 공동 설계한 AI 추론 ASIC 'Jalapeño'를 공개하고 2026년 말까지 서버 배치를 목표로 삼았다.

검증자를 분리하면 동일 모델로도 두 자릿수 성능 향상이 가능하다

Setlur et al의 이론과 Apodex의 실무 사례는 테스트 시 검증자에 계산을 할당하는 구조가 동일 예산에서 성능을 크게 끌어올린다는 점을 시사한다.