본문으로 건너뛰기

2026년 6월 27일 AI 뉴스

70

관심 태그 추가
r/LLMDevs1달 전

서버 실행 기반 human-in-the-loop 설계 취약점 검토 요청

모델의 직접 실행을 차단하고 서버 측 게이트와 원장 기반으로 효과를 수행하도록 구성한 설계와 그 한계를 기술적 관점에서 검토해 달라는 요청이다.

RAG 디버깅 도구와 23.7% 중복 발견

Haystack Diagnostics Engine은 RAG 파이프라인의 검색 실패를 6개 클래스 수준으로 분류하고 쿼리 상태를 JSON 번들로 캡처해 diff로 원인을 밝히는 도구이다.

"리텐션이 전부다" 토스 출신 PO가 공개하는 망하지 않는 제품의 수학

토스와 오늘의집 출신 PO가 AARRR 프레임워크와 리텐션의 수학적 원리를 통해 좋은 제품을 정의하고, AI 시대에 기술보다 브랜딩과 철학이 중요해지는 이유를 설명한다.

AI 에이전트 도구 선택 가이드: MCP vs CLI 핵심 차이와 비용 분석

AI 에이전트 구축 시 보안과 세밀한 제어가 필요하면 MCP를, 비용 효율성과 가벼운 실행이 필요하면 CLI를 선택하는 기준을 제시한다.

r/ClaudeAI1달 전

미션 문서·하트비트·통신·감사로 완성한 오케스트레이터 설계

오케스트레이터의 신뢰성은 미션 문서에 따른 의사결정, 주기적 하트비트, 명확한 에이전트 간 통신, 그리고 감사 가능한 제어로 확보된다.

C/CUDA 기반 nanoeuler LLM 구현

스크린샷은 JustVugg의 nanoeuler가 C/CUDA로 작성된 GPT-2 스타일 LLM이며 hand-written backprop, BPE, FlashAttention, pretraining, SFT를 포함한다고 보고한다.

로컬 에이전트의 위험한 명령을 사전 가로막는 경량 솔루션

Halt Core는 로컬에서 에이전트의 명령과 코드를 가로채 정적 룰과 선택적 로컬 LLM 심사를 통해 위험한 셸 및 파이썬 실행을 차단하는 경량 미들웨어다.

AI 에이전트가 권한 기반으로 기업에 연락할 수 있는 구조화된 프로필 시스템

anewera는 llms.txt, agent.json, agent.md와 실시간 MCP/webMCP 엔드포인트를 통해 AI 에이전트가 기업을 찾고 권한화된 액션으로 연락하도록 설계된 구조화된 비즈니스 디렉토리이다.

로봇이 인간처럼 정교하게 움직이는 비결, ACT 아키텍처 분석

로봇의 모방 학습 시 발생하는 오차 누적 문제를 해결하기 위해 동작 시퀀스를 묶어 예측하는 Transformer 기반 모델인 ACT를 정의한다.

Claude Chat과 로컬 코드 연결을 자동화하는 MCP 브리지

로컬에서 Claude Chat이 코드베이스를 탐색하고 답변과 수행 단계를 반환하는 읽기 전용 MCP 브리지를 GitHub에 공개했다.

GPT-5.6 Sol은 일부 코딩 작업에서 Mythos를 앞섰으나 사이버 임계치는 넘지 못했다

OpenAI가 공개한 GPT-5.6은 제한적 접근으로 제공되며 일부 코딩 에이전트 작업과 벤치마크에서 Mythos에 필적하는 성능을 보였으나 준비태세 평가에서는 Cyber Critical 임계값을 넘지 못했다.

학습 손실이 꾸준히 감소하는 대시보드 스냅샷이다. 주요 메트릭과 ETA가 함께 표시되어 현재 진행 상황을 직관적으로 알 수 있다.

해당 스크린샷은 step 161에서 loss=1.108, lr=0.001, steps_per_sec≈99로 손실이 꾸준히 감소하는 학습 진행을 보고한다.

r/artificial1달 전

AI로 생겨난 상위 5개 신규 직무와 채용 수를 공개했습니다

작성자는 2022년 이후 AI 영향으로 급증한 신규 직무명을 구직 사이트에서 스크래핑해 추적하는 사이트를 만들고 상위 5개 직무와 채용 수를 공개했다.

AI가 시간을 아껴준다고요? '봇시팅'에 뺏기는 시간도 계산하셨나요?

AI 에이전트 도입으로 발생하는 관리 부담인 '봇시팅' 현상을 분석하고, 단순 도구 활용을 넘어 AI를 추론 파트너로 대하는 조직 혁신 방안을 논의합니다.

HF Daily Papers1달 전· 1달 전 발행

짧은 SFT 뒤에 강화학습을 집중하면 OOD 강건성이 회복된다

생물학적 추론에서는 보이지 않는 경로·질병·종으로의 전이가 빈번하므로 in-domain 성능만으로는 실용성을 판단할 수 없다. 본 연구는 CPT, SFT, RL이라는 표준 사후 학습 단계를 통제된 조건에서 분리해 각 단계가 ID와 OOD 성능에 미치는 구체적 영향을 규명하였으므로 실제 생물학 응용에서 학습 예산을 어떻게 배분할지에 대한 실무적 지침을 제공한다.

HF Daily Papers1달 전· 1달 전 발행

실존하는 인용은 근거를 보장하지 않으며 약 16%가 잘못된 논문 인용으로 판정됐다

OpenBioRQ는 에이전트형 모델의 문헌 기반 증거 수집과 인용 충실도를 실제 열린 연구 질문으로 검증하도록 설계된 점에서 중요하다. 기존 벤치마크는 정답키가 있는 문제를 전제로 하므로 모델이 주어진 출처를 반복해 재현하는 방식으로 통과할 수 있지만 OpenBioRQ는 그런 우회 경로를 차단해 진정한 근거검증 능력을 측정한다. 이로 인해 식별자 존재 여부만으로는 놓치기 쉬운 잘못된 인용(wrong-paper citation)과 도구 포기(agentic collapse) 같은 실패 모드를 계량적으로 드러낼 수 있다.

에이전트 도구 연결의 권한과 감사 체계를 설계하는 방법

MCP 연결은 에이전트의 계획을 실제 실행으로 연결하는 표준화된 호출 표면이어서 소유권·권한·실행 로그를 포함한 거버넌스가 필수라고 강조한다.

Telnyx가 올린 Python 기반 AI 콘텐츠 번역 예제 저장소 링크

Hacker News에 공유된 Telnyx의 GitHub 저장소 링크로 Python 기반 AI 콘텐츠 번역용 코드 예제를 가리킨다.

수천 건의 공격에도 비밀 유출은 발생하지 않았다

Fernando는 OpenClaw 테스트 인스턴트에 이메일로 프롬프트 인젝션을 시도한 6,000건의 공격에도 비밀 유출이 발생하지 않았고 실험에 약 500달러의 토큰 비용이 소요되었음을 보고했다.

학습 보상 신호의 구성 요소와 롤아웃 노트로 이상 동작을 포착한 스크린샷

rewardspy 대시보드 스크린샷에서 평균·표준편차·구성요소 기여도와 롤아웃 노트를 통해 reward-hacking 징후가 관찰된다.

내 에이전트가 회사 기밀을 유출한다면? Hermes 보안 완벽 가이드

Hermes 에이전트의 보안 위협인 간접 프롬프트 인젝션을 방지하기 위한 '위험 삼각' 원칙과 4단계 격리 및 권한 관리 실무 가이드를 제시한다.

보험 중개사의 반복업무를 AI로 자동화하는 Cara의 AWS 아키텍처

Cara는 Amazon EKS와 Amazon Bedrock을 기반으로 ACORD 등 보험 양식 자동화, 견적 비교, 제안서 생성 등을 수행해 보험 중개사의 반복 백오피스 작업을 자동화하는 SaaS 솔루션이다.

빅테크의 컴퓨팅 해자, 개인과 오픈소스는 AI 경쟁에서 밀려나고 있는가?

거대 기업들의 막대한 컴퓨팅 자원 독점과 폐쇄적 모델 발전으로 인해 개인 개발자와 오픈소스 생태계가 AI 혁신의 최전선에서 소외될 위험을 분석한다.

RAG의 한계를 넘다: 구글 OKF로 구축하는 AI 에이전트 전용 세컨드 브레인

구글의 OKF 표준을 활용해 AI 에이전트가 지식 베이스를 효율적으로 탐색하고 토큰 비용을 절감하는 방법을 다룹니다.

pytest 스타일 CLI로 통계적 회귀를 검출하는 벤치마크 도구

pybench은 여러 시드를 샘플링해 기준 통계를 저장하고 같은 시드로 재실행하여 메트릭의 통계적 회귀를 판정하는 pytest 스타일의 벤치마크 도구이다.

컨텍스트를 작업 세트로 재구성한 ContextForge와 장기 벤치 결과 공개

컨텍스트 윈도우를 작업 세트로 재구성하는 ContextForge 논문과 구현을 공개하고 장기 평가에서 기존 방식보다 일관성과 안정성이 우수함을 보고했다.

검색 단계가 LLM 호출보다 더 많은 지연을 차지하는 경우가 관찰됨

LangChain으로 구축한 RAG 앱에서 임베딩·검색·네트워크 왕복·컨텍스트 주입이 LLM 호출보다 전체 레이턴시에 더 크게 기여함을 100k 문서 벤치로 확인하고 오픈소스 벤치마크를 공개했다.

HF Daily Papers1달 전· 1달 전 발행

자연어에서 수학적 검증 가능한 접기 패턴까지 자동 생성하는 파이프라인

이 연구는 자연어로 표현한 주제를 수학적으로 검증 가능한 평면접기(Flat-foldable) 크리즈 패턴으로 자동 전환하는 최초의 완전 자동화 파이프라인을 제시한다. 박스 플리팅 격자와 알고리즘적 분할을 결합해 기하학적 제약을 보장하면서 VLM 기반 미적 평가와 RL을 통해 시각적 완성도를 높였다. 이로 인해 인간 디자이너가 구조적 시작점을 신뢰할 수 있는 수준으로 자동 생성할 수 있게 됐다.

HF Daily Papers1달 전· 1달 전 발행

로그확률비로 단계별 어드밴티지를 복원해 PRM 없이 성능과 모니터링 개선

LLM 에이전트는 도구 호출과 외부 관찰이 포함된 장기 상호작용에서 단계별 보상 신호가 특히 중요하지만, 단계 단위 주석이나 Monte Carlo 재평가는 비용과 실행 가능성 면에서 제한이 있다. 논문은 RL로 파인튜닝된 행동 정책과 기준 정책의 로그확률비가 stochastic MDP에서도 정확한 어드밴티지를 재현함을 보였고, 이를 통해 별도의 보상 모델 학습 없이 단계·궤적 수준의 평가와 모니터링을 가능하게 했다. 이 방법은 테스트타임 샘플 선택, 불확실성 정량화, 오류 위치 규명에서 기존의 학습 기반 PRM이나 단순 확률 기반 지표를 능가했다.

HF Daily Papers1달 전· 1달 전 발행

다중-모델 오케스트레이션의 최대 이득은 모든 모델이 동시에 실패할 확률에 의해 결정된다

이 논문은 여러 모델을 조합하는 라우팅·투표·Mixture-of-Agents 방식이 실무에서 기대만큼 성능을 개선하지 못하는 근본적 이유를 규명한다. 여러 모델이 동일 질의에 대해 모두 틀리는 비율 β가 모든 선택 정책의 정확도 상한 1−β를 결정하므로, 기존의 평균 쌍별 오차 상관 ρ만으로는 실제로 얻을 수 있는 이득을 판단할 수 없다. 라우터를 배포하기 전에 단일 등급의 검증 집합에서 Clopper–Pearson 하한을 계산하면 어떤 정책도 초과할 수 없는 최대 이득을 사전에 확증할 수 있다.

HF Daily Papers1달 전· 1달 전 발행

NDVI 감소 진폭 오류 5.63% 감소와 방향 적중률 7.80% 향상

위성 관측은 재방문 간격과 구름으로 인해 시계열 중간의 지표 상태가 관측되지 않는 부분관측 문제를 안고 있다. 이 상황에서 기상은 외생적 구동력으로 작용하므로 모델은 동일한 기상 입력에 대해 여러 가능한 토지 반응을 확률적으로 표현할 필요가 있다. EO-WM은 계절적 기준과 이상, 그리고 누적 스트레스를 분리해 날씨 변화에 따른 표면 반응 충실도를 높여 재해 모니터링과 작물 예측 같은 실무적 활용 가능성을 개선했다.

예측 불확실성과 표현 변화로 장거리 유틸리티를 보존하는 KV 캐시 압축

대형 언어 모델의 긴 문맥 처리에서 KV 캐시 메모리는 입력·생성 길이에 따라 선형으로 증가하여 실무적 제약을 초래한다. 이 논문은 단순히 최근 attention에 의존한 토큰 보존 기준이 장거리 생성에 취약하다는 관찰을 바탕으로, 예측 불확실성(entropy)과 레이어별 표현 변화를 결합해 미래 기여도를 정량화함으로써 필요 토큰만 선별적으로 보전한다. 그 결과 장거리 prefilling과 decoding 시나리오 모두에서 기존 attention 기반 압축 방법보다 전반적으로 우수한 성능을 달성했다.

HF Daily Papers1달 전· 1달 전 발행

보상 이산화를 통해 과민 반응을 줄이고 학습된 보상으로 더 나은 정책을 얻음

보상 모델이 연속적 점수를 제공할 때 매우 유사한 응답들에 대해 불필요한 점수 차이를 만들어 RL 정책이 취사선택이 아닌 편향을 학습할 위험이 존재한다. 이 논문은 보상 모델의 'oversensitivity'가 학습된 보상을 통해 정책에 악영향을 미친다는 점을 이론적·실험적으로 규명했다. 보상 값을 군집화하여 이산화하면 판별 능력은 유지하면서 특이성을 대폭 개선할 수 있음을 증명하고 실제 RL 실험에서 더 안전한 학습 결과가 관측되었다.

HF Daily Papers1달 전· 1달 전 발행

3D 메쉬 좌표 공간에서 확산 Transformer로 물리적 동역학을 한 번에 생성

PHYSIFORMER는 시점이나 픽셀 종속적 표현 대신 세계 좌표계의 3D 메쉬 정점 좌표를 직접 생성 목표로 삼아 물리적 동역학을 모델링한다. 이 접근은 비가시적 물리 변수의 불확실성을 확률적으로 포착해 다양한 타당한 미래 궤적을 생성하는 능력을 제공한다. 결과적으로 로봇 시뮬레이션, 그래픽스, 물리 설계 등에서 뷰 불변성과 지오메트리 인식을 요구하는 응용에 직접 적용 가능하다.

HF Daily Papers1달 전· 1달 전 발행

데이터 커버리지로 환각을 예측하고 50개 트래젝토리로 미지 환경에 적응한다

대형 시각적 월드 모델이 생성하는 미래 예측이 시각적으로 그럴듯해도 실제 동적 행동과 어긋나면 제어 결정에 치명적인 오류가 발생한다. 이 논문은 그러한 환각이 구조적 결함이 아니라 데이터 커버리지 부족에서 기인한다는 사실을 밝혀내고, 데이터 분석 신호를 이용해 환각을 런타임에 감지하고 표적 수집으로 빠르게 보완하는 절차를 제시했다. 결과적으로 적은 양의 추가 실제 궤적만으로도 사전학습된 모델을 미지 환경에 효율적으로 적응시킬 수 있음을 보였다.

HF Daily Papers1달 전· 1달 전 발행

90일 시장 시뮬레이션으로 LLM 에이전트의 경제행동과 실패 모드를 규명

CoffeeBench는 LLM 에이전트의 장기적 의사결정 능력을 경제적 상호작용 맥락에서 검증할 수 있게 만든다. 이 벤치마크는 동종 에이전트가 아닌 서로 다른 역할(농부, 로스터, 소매상)을 포함하여 실제 경제에서 요구되는 협상·거래·신용 관리 역량을 시험한다. 에이전트의 통신 빈도와 현금흐름 관리가 수익성에 직접 연결되는 점이 장기적 에이전트 평가에서 중요한 판단축으로 드러난다.

HF Daily Papers1달 전· 1달 전 발행

프레임 신뢰도로 Video-LLM의 오염 견고성 10.6%p 향상

실세계 영상은 모션 블러, 글레어, 부분 차폐 등으로 자주 열화되어 Video-LLM의 예측을 왜곡한다. 본 논문은 각 프레임의 신뢰도를 추정해 신뢰도가 높은 프레임만을 중심으로 다양한 시각 도구를 선택하고 통합하는 파이프라인을 제시했다. 그 결과 깨끗한 입력에서 56.4% 정확도를 달성하고 오염된 입력에서도 54.3%를 유지하여 실환경 적용 시 예측의 무감지 실패를 줄였다.

HF Daily Papers1달 전· 1달 전 발행

테스트 시 짧은 자가 탐색으로 카메라·키네마틱 변화에 적응하는 VLA 전략

현대의 Vision-Language-Action 모델은 학습 시 고정된 시스템 구성 ψ를 암묵적으로 가정하여 새로운 카메라 뷰나 로봇 형태에서 성능이 급락하는 문제가 반복적으로 관찰된다. 본 논문은 짧은 무작위 상호작용을 컨텍스트로 제공하면 모델이 추가 파라미터 업데이트 없이도 현재 시스템의 감각-운동 관계를 암묵적으로 복원할 수 있음을 보인다. 이 접근은 현장 배포 시 각 환경마다 데이터수집·미세조정이 필요한 반복 비용을 줄이며 제로-샷 적응을 가능하게 한다.

HF Daily Papers1달 전· 1달 전 발행

ControlNet 학습 수렴을 2.78배 가속하는 LISA

시각적 조건을 가진 이미지와 비디오 생성에서 사이드 네트워크가 조건 제어를 담당하지만 그 학습 신호는 암묵적이어서 수렴이 느리고 조건 충실도가 떨어지는 문제가 존재한다. 이 논문은 사이드 네트워크의 중간 피처를 우도 스코어 근사치와 직접 정렬함으로써 조건 신호를 명시적으로 강화하고 학습 효율을 개선했다. 결과적으로 학습 단계에서 수렴 가속과 최종 합성 품질 개선이 동시에 관찰되었다.

HF Daily Papers1달 전· 1달 전 발행

시각·시간·3D 역량을 겨룬 100개 과제로 SOTA 에이전트 평균 성공률 19.1% 확인

현행 웹/OS 에이전트 벤치마크는 폼·네비게이션 중심으로 포화 상태에 이르러 실제 산업용 인터페이스에서 요구하는 시각·시간·3D 추론 능력을 제대로 평가하지 못했다. 이 논문은 캔버스 기반 UI와 복합 과제로 구성된 평가판을 통해 최전선 에이전트의 일반화 능력과 한계를 계량적으로 드러냈다.

HF Daily Papers1달 전· 1달 전 발행

제어 토큰 과증폭이 RL 붕괴를 유발하며 반영형 감독이 안정성을 회복했다

도구 호출을 포함하는 장기 상호작용에서 RL만으로 학습하면 특정 제어 토큰의 확률이 비정상적으로 증폭되어 구조적 생성이 붕괴하는 현상이 빈번히 발생한다. 이러한 붕괴는 모델의 내재적 추론 능력 상실이 아니라 토큰 수준의 분포 재배치로 인한 형식적 실패로 규정되므로 보상만으로 해결하기 어렵다. 이 논문은 다양한 감독 신호를 체계적으로 비교하여 구조적 행동을 제어함으로써 안정적이고 일반화 가능한 도구 사용 학습을 가능하게 하는 실험적 근거를 제공한다.

HF Daily Papers1달 전· 1달 전 발행

프리픽스 예측으로 CEM 시간 54.4s에서 28.3s로 단축

샘플링 기반 계획은 후보 액션 시퀀스마다 반복적인 잠재 롤아웃을 수행하므로 계산 비용과 누적 예측 오류가 빠르게 증가한다. Fast-LeWM은 액션 접두사 단위로 병렬 예측을 수행하여 후보 평가당 반복적 연산을 제거하고 오픈루프 오차 성장을 현저히 완화했다. 이 접근은 샘플링 예산이 제한된 환경에서 실시간에 가까운 계획과 더 안정적인 장기 예측을 가능하게 한다.

HF Daily Papers1달 전· 1달 전 발행

440개 과제로 비교한 GUI 59.1% vs CLI 48.2% 스킬 보강으로 CLI 69.3%

소프트웨어를 자동으로 조작하는 에이전트의 실행 능력은 인터페이스 모달리티에 따라 다른 병목을 드러낸다. 동일한 목표와 초기 상태, 동일한 최종 상태 검증을 적용한 통제된 벤치마크를 통해 모달리티 자체가 성능 차이를 유발하는지 분리할 수 있다. 이런 분리는 에이전트 설계에서 모델 개선과 도구 설계 중 어디에 우선 투자해야 하는지를 결정하는 데 직접적인 근거를 제공한다.

HF Daily Papers1달 전· 1달 전 발행

트리 인과성 보존으로 MATH-500에서 9.64배 속도 달성

Autoregressive LLM의 디코딩은 본질적으로 직렬적이어서 긴 생성 작업에서 지연이 주요 병목이다. 스펙큘레이티브 디코딩은 초안 생성과 병렬 검증으로 이 지연을 줄이지만 초안 예산을 늘릴 때는 acceptance rate과 초안 비용의 동시 개선이 필요하다. JetSpec은 병렬 예측의 효율성과 분기별(in-branch) 인과적 조건화를 동시에 확보하여 더 큰 초안 예산을 실제 accepted prefix 길이와 엔드투엔드 속도 향상으로 변환했다.

HF Daily Papers1달 전· 1달 전 발행

검증 신호의 삼중 균형 문제를 실험으로 입증

코딩 에이전트의 성능 향상이 진전됨에 따라 기존의 단일 검증 수단은 점차 무력화되는 현상이 발생했다. 이 논문은 검증 신호의 스케일러빌리티, 충실성, 강인성 세 가지 축 사이의 본질적 트레이드오프를 정량적으로 드러내고 검증자가 생성자와 공진화(co-evolve)해야 지속적인 성능 향상이 가능하다고 주장했다. 실무적으로는 테스트 기반 보상만으로는 장기적 능력 향상을 확보할 수 없으며, 다양한 검증 설계와 궤적 수준의 모니터링이 필요하다는 점을 입증했다.

HF Daily Papers1달 전· 1달 전 발행

컨텍스트를 구성해 실무적 이미지 요청을 충족시키는 에이전트형 생성 파이프라인

실세계 이미지 생성 요청은 종종 불완전하거나 암시적이며 최신 사실을 요구하므로 단일 프롬프트 기반 T2I 모델로는 정확한 결과를 얻기 어렵다. 컨텍스트 갭을 명시적으로 규정하면 누락된 정보를 식별하고 외부 검색·추론·메모리를 동원해 생성 컨텍스트를 완성할 수 있다. 이 논문은 해당 문제에 대한 통합적 해결책과 이를 평가하는 체계적 벤치마크를 동시에 제시해 실무 적용 가능성을 높였다.

HF Daily Papers1달 전· 1달 전 발행

온폴리시로 추출한 계층적 스킬로 RL 성공률과 샘플 효율 개선

완료된 온폴리시 궤적을 그대로 활용해 계층적 자연어 스킬을 추출하면 외부 스킬 저장소나 오프폴리시 검색 없이도 정책에 분포 일치형의 밀집 감독 신호를 제공할 수 있다. 이 방식은 장기 상호작용에서 보상이 희소해 발생하는 중간 결정에 대한 신용 배분 문제를 완화하여 성공률과 샘플 효율을 동시에 개선한다. 논문 실험은 ALFWorld WebShop Search-based QA에서 OPID가 결과 기반 RL과 기존 스킬 증류 기법보다 전반적으로 우수하거나 경쟁력 있음을 확인했다.

HF Daily Papers1달 전· 1달 전 발행

텍스트 정렬과 근접 표현으로 양자화된 시각 토큰이 20–70% 학습 가속과 경쟁력 있는 이해 성능을 동시에달

ViQ는 이미지 특징을 텍스트처럼 이산 토큰으로 표현하면서도 고수준 의미와 저수준 세부를 동시에 유지하도록 설계된 점이 핵심이다. 이산 표현은 저장 및 훈련에서 효율성을 크게 높이므로 멀티모달 대규모 학습에서 실질적인 비용·시간 절감으로 이어진다. 논문은 이러한 균형을 달성하면서도 다양한 벤치마크에서 연속 특징 기반 인코더와 경쟁할 수 있음을 실험으로 입증했다.

HF Daily Papers1달 전· 1달 전 발행

학생 롤아웃에서 단일 의미측 속도 쿼리로 편집과 T2I를 함께 보존하며 향상

현대 이미지 생성은 하나의 배포 모델이 text-to-image, 로컬 편집, 글로벌 편집 같은 이질적 능력을 함께 지원할 것을 요구한다. 이들 능력은 동시 최적화 시 상호 간섭이 발생하여 한 능력을 강화하면 다른 능력이 약화되는 경향이 있다. DanceOPD는 각 능력을 속도 필드로 보고 학생이 자신의 롤아웃 상태에서 하드 라우팅된 필드를 단일 low-noise 쿼리로 학습하도록 하여 능력 합성을 달성했다.

Claude Code의 로컬 기록을 API 없이 Obsidian 노트로 자동으로 가져오는 파이썬 도구

Claude Code의 .jsonl 대화 기록을 파싱해 가중치 키워드 분류와 메모리 심볼릭 링크로 Obsidian 마크다운 노트로 변환하는 파이썬 유틸리티이다.

20턴이 지나도 무너지지 않는 AI 보이스의 비밀: 4단계 레이어 설계법

단순 프롬프트를 넘어 불변의 정체성과 상황별 모드 등 4단계 계층 구조로 AI의 일관된 브랜드 보이스를 구축하는 실무 아키텍처를 제시한다.

의존성 번들이 코드 이해에 주는 효과는 과제 유형에 따라 달랐다

PViz로 만든 의존성 그래프 번들을 이용한 통제 평가에서 과제 유형이 번들 유용성을 예측했고 번들 보조는 구조·혼합 과제에 특히 도움이 되었다.

한 엔드포인트로 제공자 장애와 비용 원인 추적을 해결하는 오픈소스 게이트웨이

llmgateway는 다중 LLM 제공자 간 자동 페일오버와 기능별 비용 귀속, Redis 응답 캐싱을 지원하는 OpenAI 호환 게이트웨이로 Docker로 자체 호스팅 가능하다.

유창한 번역이 소통을 망친다? AI 번역의 함정과 해결책

벤치마크 성능을 넘어 실제 소통 성공률을 높이기 위해 사용자 인지와 문화적 맥락을 통합한 새로운 다국어 AI 설계 및 평가 방법론을 제시한다.

한 명령으로 AWS에 배포하는 셀프 호스팅 LLM 게이트웨이

소규모 초기 제품 팀을 겨냥한 셀프 호스팅 LLM 게이트웨이를 공개했으며 'mantis deploy' 명령으로 AWS에 간단히 배포할 수 있다.

프롬프트 악성 여부 대신 요청의 권한을 검사하는 에이전트 보안 설계

요청이 실제로 해당 행동을 수행할 권한이 있는지 암호화된 케이퍼빌리티와 결정적 어텐션으로 검증하는 에이전트 보안 아키텍처와 평가·코드가 공개되었다.

GPT-5.6 공개로 고성능·대량·저비용 모델을 한 번에 선보였다

OpenAI가 GPT-5.6 제품군 Sol·Terra·Luna의 제한적 프리뷰를 공개했으며 모델별 용도와 백만 토큰당 과금 기준이 함께 제시되었다.

지연을 줄였지만 비용은 그대로였고, 시맨틱 캐시와 압축으로 비용을 60% 이상 절감했다

지연 최적화로는 해결되지 않던 월 $2,400의 추론 비용을 시맨틱 캐시, int4 양자화, 프롬프트 압축을 적용하여 $914로 낮췄다.

Q^T V로 d×d 상태행렬을 만들어 attention 병목을 축소한 메모 노트

핸드라이팅 노트는 Q(k)^T와 V의 행렬곱으로 d×d 크기의 상태행렬 S를 구성해 시퀀스 길이 N에 무관한 고정 크기 표현을 만드는 접근을 보여준다.

교사 모델을 능가하는 학생 모델? TIPSv2가 해결한 패치-텍스트 정렬의 비밀

TIPSv2는 iBOT++와 다중 입도 캡션을 활용해 기존 모델의 한계인 패치 단위 텍스트 정렬 성능을 획기적으로 개선한 시각-언어 사전 학습 프레임워크이다.

추론 속도를 높이는 Speculative Decoding의 치명적 약점, Attention Drift를 해결하다

Speculative Decoding 과정에서 발생하는 Attention Drift 현상을 분석하고, Post-Norm 구조를 적용한 EAGLE 3.1을 통해 추론 안정성과 속도를 개선한 연구를 소개한다.

9,700명 설문: 3분의1 이상이 'AI가 대부분 업무' 전망

Anthropic 조사에서 9,700명의 Claude 사용자 중 3분의1 이상이 내년 AI가 업무 대부분을 처리할 것으로 믿고 있으며, Claude Code는 일반 채팅보다 더 많은 출력 유형에서 자율성이 높게 나타났다.

에이전트에 새 키를 주지 말고 기존 잠금 사용

대화형 AI 에이전트를 기존 REST API의 동일한 사용자 컨텍스트·데이터 레이어 권한을 통해 실행하도록 구현해 권한 오용과 프롬프트 인젝션 위험을 방지했다.

Mac으로 클라우드 없이 LLM 파인튜닝 가능

MLX를 사용하면 클라우드 GPU나 별도 비용 없이 Mac에서 오픈 언어모델을 로컬로 파인튜닝할 수 있다.

SenseNova‑U1 오픈소스, LoRA로 인포그래픽 생성 약 12배 가속

SenseTime의 오픈소스 멀티모달 모델 SenseNova‑U1은 NEO‑unify 아키텍처와 150MB LoRA 어댑터로 인포그래픽 생성을 약 12× 가속하며 GGUF 퀀타이즈로 소비자 GPU 실행을 지원한다.

S3 PDF를 실시간 질의용으로 즉시 열어보는 가벼운 서버 패턴

프로토콜 기반 MCP 서버를 통해 Amazon S3에 저장된 텍스트형 PDF를 배치 없이 실시간으로 추출·질의해 컴플라이언스·법무·재무팀에 즉시 답을 제공하는 패턴과 Amazon Textract와의 용도별 비교를 제시한다.

CSV 한 번으로 인포그래픽·PPT까지 자동 생성하는 워크플로

SenseNova-Skills는 CSV 정제→데이터 분석→인포그래픽·PPT 자동 생성까지 연결하는 모듈형 에이전트 스킬 모음으로, 시각 보고서 생성 자동화에 초점을 맞췄다.

대화 기록으로 에이전트 평가 비용과 반복을 줄이는 방법

OpenAI 사례와 최근 논의는 대화 트레이스를 통해 시뮬레이션을 보완하거나 대체할 수 있으며, 항목 수준 평가 데이터 공개와 환경 속성 표준화가 장기적 재사용성과 비용 절감에 핵심임을 강조한다.

LangChain1달 전· 1달 전 발행

모델이 전부가 아니다? LangChain이 말하는 Deep Agents의 핵심 '하네스'

LangChain의 Sydney Runkle이 Deep Agents 구축을 위해 모델과 도구 호출 루프를 감싸는 복잡한 엔지니어링 지원 체계인 '하네스'의 개념을 정의한다.