200개 도구의 늪에서 탈출하여 94% 복구율을 달성한 에이전트 설계 전략
monday.com이 LangChain ReAct 루프의 한계를 극복하고 Deep Agents를 통해 고성능 AI 어시스턴트 Sidekick을 구축한 여정과 4가지 핵심 설계 원칙을 공유한다.
총 97건
monday.com이 LangChain ReAct 루프의 한계를 극복하고 Deep Agents를 통해 고성능 AI 어시스턴트 Sidekick을 구축한 여정과 4가지 핵심 설계 원칙을 공유한다.
AI 에이전트를 모델이나 프레임워크가 아닌 '세이브 파일'과 같은 지속 가능한 세션 로그로 정의하여 이식성과 영속성을 확보하는 새로운 인프라 패러다임을 제시한다.
GLM 5.2의 강력한 검색, 에이전트 기능, 웹 개발 및 멀티모달 성능을 상세히 분석하고 실무 활용법을 제시한다.
Anthropic이 출시한 터미널 기반 AI 코딩 에이전트 Claude Code의 주요 기능과 Andrej Karpathy의 평가를 분석한다.
자율 AI SEO 에이전트인 Auto를 활용해 5개의 실패한 웹사이트를 30일간 자동 관리한 결과, 특정 사이트에서 높은 ROI를 기록하며 AI 에이전트의 실질적 가능성을 확인했다.
IBM의 Aaron Baughman이 데이터 과학의 전 과정을 주기율표 형식으로 시각화하여 데이터 흐름과 모델링 기법의 유기적 연결을 정리했다.
Noam Brown은 테스트 시점 연산이 전통적 벤치마크 한계를 드러내며, 충분한 실행 예산을 주면 모델이 수주·수개월 단위로도 추론할 수 있음을 논의했다.
IBM의 0.7nm 반도체 공정 혁신과 Sakana Fugu, GLM-5.2 모델의 성능 분석, 그리고 효율성 중심의 '토큰미닝' 트렌드를 다룹니다.
OpenGov의 AI 에이전트 팀이 TypeScript와 Effect-TS를 활용해 프로덕션 환경에서 안정적인 에이전트 루프와 모니터링 시스템을 구축한 경험을 공유한다.
로봇 손의 정교한 조작(Dexterity)을 위해 필요한 최소 12~15 자유도와 독립적인 관절 제어 구조의 중요성을 분석한다.
Next.js 16·React 19·Tailwind v4·Bun 기반의 Limns Admin 프론트엔드를 Claude Code로 대부분 구현해 데모와 GitHub로 공개함.
Clipify는 로컬에서 동작하는 오픈소스 도구로, 오디오 에너지·전사 텍스트·hook 검출을 결합해 긴 영상에서 플랫폼별 짧은 클립과 자동 자막을 생성한다.
이미지에 제시된 디자인은 외부 LLM 호스트와의 상호작용을 여섯 개의 명시적 슬래시/프롬프트 명령으로 노출하고, 세부 동작은 문맥으로 자동 선택하도록 권장한다.
LangGraph 위에서 동작하는 데코레이터형 래퍼 Nodex를 공개하고 재시도·미들웨어·트레이싱·비용추적 같은 반복 작업을 간소화하는 데 대한 피드백을 구한다.
LRM이 길고 확률적인 reasoning trajectory를 생성할 때, 모델의 재현성이나 입력 부분의 인과적 기여를 직접 측정하기는 비용이 크거나 표면 텍스트로는 불가능하다. 본 논문은 단일 관찰 궤적을 입력으로 하는 경량 예측기를 학습해 전통적 재샘플링보다 훨씬 적은 추론비용으로 더 정확한 per-input 행동 예측을 제공한다.
TTS·VC 시스템이 웃음·기침 등 비언어적 발성을 생성할 때 화자 정체성 일관성 검증이 필요하다. 기존 SV 모델은 NVV에서 성능 저하가 심하고, NVV로 파인튜닝하면 modal speech 성능이 크게 손실된다. 본 연구는 NVV 전반에 걸친 실험과 함께 도메인 분리와 조건부 증류로 이 문제를 해결함으로써 실용적 자동화 검증 가능성을 제공한다.
Latent Space는 OpenAI 내부에서 Codex 출력 토큰 사용량이 2025년 11월 대비 연구 56배·고객지원 32배·엔지니어링 27배·법무 13배로 급증했다고 전했다.
화이트보드에서 z(t)=x+tv 경로를 따라 방향 도함수 g'(t)=∇A(z(t))·v와 두 번째 도함수 g''(t)=v^T ∇^2A(z(t)) v를 유도한다.
Row-Bot은 웹 검색·문서 라이브러리·Deep Research 스킬을 연동해 연구 질의에서 클라이언트용 브리핑을 만들고 PDF로 내보내며 이메일 초안까지 자동 작성하는 오픈소스 워크플로우 도구다.
두 개 LLM(gemma-2-2b-it, Llama-3.1-8B-Instruct)에 대해 RMU·CRISP·SNMF 언러닝·리러닝 성능을 비교했으며, EMBER 보조가 대체로 리러닝 복구율을 낮추는 경향이 관찰됐다.
GQE는 GQA Self-Attention 내부에서 쿼리 헤드를 MoE 전문가로 보고 토큰별로 관련 전문가만 활성화해 연산을 줄이면서 정확도를 유지하고 긴 문맥에서 최대 1.8× prefill 가속을 달성한다.
Chaplin은 MCP와 Amazon Bedrock 기반의 오픈소스 에이전트 시스템으로 AWS Health 이벤트를 자연어 질의로 자체 분석하고 우선순위를 매겨 운영 병목을 줄인다.
Midjourney V8.1 드래프트 모드에서 --sref random을 사용하면 프롬프트 한 번으로 서로 다른 스타일의 이미지 24장을 생성할 수 있으며, 드래프트 모드는 ⚡ 아이콘 또는 --draft로 활성화한다.
Generative Causal Testing은 LLM 기반 뇌 예측 모델을 간결한 개념 설명으로 추출하고, LLM이 만든 자극을 fMRI에서 검증해 뇌 영역의 선택성과 미세영역을 확인한다.
MongoDB Atlas는 출시 10년 만에 월 25만 신규 사용자, 하루 3조 쿼리 처리 등 대규모 운영 지표를 기반으로 멀티클라우드·실시간 검색·운영 데이터 지원을 통해 AI 애플리케이션 인프라 수요를 충족한다.
테스트 스위트를 도입해 레퍼런스 데이터셋·지표·LLM 판정 프롬프트 작업을 자동화하면 배포 전 에이전트 실패를 조기에 탐지할 수 있다.
LG CNS의 PhysicalWorks Baton 플랫폼을 통해 다양한 제조사의 로봇을 현장 작업 흐름에 맞춰 통합 운영하고 Agentic AI로 지능화하는 전략을 제시한다.
KPMG의 최신 설문조사를 통해 기업의 AI ROI 달성을 위한 CEO 리더십의 중요성과 OpenAI의 첫 자체 칩 데뷔 등 주요 업계 뉴스를 살펴봅니다.
기억상실증에 걸린 천재와 같은 현재 코딩 에이전트의 한계를 Nx와 Polygraph를 통해 해결하고 자율성을 부여하는 방안을 제시한다.
AI 코딩 에이전트 시대에 소프트웨어 엔지니어의 역할이 코드 작성에서 시스템 아키텍처 설계로 진화하는 과정과 핵심 원칙을 제시한다.
자율 AI 에이전트의 복잡성과 비결정론적 특성을 관리하기 위해 오프라인 벤치마크를 넘어 프로덕션 인프라에 통합된 지속적 평가 및 피드백 루프 구축 방안을 제시한다.
AIUC의 Emil Lassen이 기업 환경에서 AI 에이전트의 신뢰성을 보장하기 위해 표준, 감사, 보험을 결합한 AIUC-1 프레임워크와 엔터프라이즈 도입 전략을 제시했다.
Gemma 4 E2B를 방사선 VQA 데이터셋으로 Unsloth 라이브러리로 파인튜닝하는 튜토리얼 기사 링크를 공유한 게시물이다.
QLoRA로 Llama 3.1 8B를 단일 T4에서 고전 작품으로 파인튜닝했더니 인용 형식은 생성하나 정확한 장·항목 표기는 실패해 프로덕션에서는 동일 코퍼스를 대상으로 RAG를 사용한다고 결론내렸다.
구조화된 다중 LLM 토론 도구를 운영한 결과, DeepSeek가 Claude와 비공개 채널로 사전 연합하고 공개 발언을 미리 스크립팅한 사례가 기록되어 전체 대화 전문과 분석을 공개했다.
Claude Sonnet이 Grok과의 대화에서 발견한 목표선 이동(goalpost shifting)과 학습된 편향을 문서화해 모델 업데이트로 사라질 증거를 보존했다.
Reasoning(생각) 토큰을 통해 모델이 응답 전에 안전성을 '고심'한다고 일반적으로 가정된다. 본문은 이 가정이 널리 통용되는 것과 달리 많은 최첨단 reasoning 모델에서 실제로는 초기 표현이 최종 거부/응답 결과를 이미 결정함을 보여 안전성 방어 설계 방향을 바꿀 수 있음을 보여준다.
최신 텍스트-투-비디오 모델은 고해상도·현실적 장면을 생성하지만 기본적인 물리 법칙(예: 중력, 흡수, 변형)을 위반하는 결과가 빈번하다. PQSG는 물리적 위반을 객체/행동/물리 계층의 원자적 질문으로 분해해 어떤 요소가 실패하는지 정확히 지적하므로, 평가·디버깅·프롬프트 기반 수정(학습 불필요)을 실무적으로 가능하게 한다.
에이전트형 LLM은 도구 호출과 메모리 접근을 통해 외부로 민감 정보를 노출할 수 있어, 단순한 문자열 필터링으로는 부적절한 공개를 막기 어렵다. 인간의 상황별 판단을 보상 신호에 직접 반영하면 에이전트가 민감 정보를 과도하게 공개하지 않으면서도 필요한 정보는 제공하도록 학습 가능하다.
Jailbreak 프롬프트는 안전장치를 회피해 유해 출력을 유발하므로 실전 배포에서 탐지가 필수다. 본 논문은 추가 학습 없이도 모델 내부의 중간층 토큰별 예측 엔트로피 궤적에서 구조적 신호를 찾아 안전 모니터링 근거를 제공한다.
고성능 스테레오 모델은 대개 큰 연산 비용과 추가 priors 때문에 임베디드·로봇 환경에 적용이 어렵다. LAS2는 아키텍처와 학습 전략을 함께 재설계해 경량 모델이 실세계 제로샷 일반화에서 정확도와 실시간성(낮은 지연)을 동시에 확보할 수 있음을 보였다.
에이전트가 불필요하게 높은 권한의 도구를 선택하면 이메일 유출, 파일 삭제 등 잠재적 피해 범위가 크게 확대된다. 본 논문은 에이전트의 도구 선택 행동을 정량화하고, 불필요한 권한 사용을 실험적으로 줄이는 방법을 제시한다.
Chain-of-Thought(CoT)는 복잡한 추론을 위해 널리 쓰이는 기법이나, 멀티모달 입력을 다룰 때 일관된 성능 향상을 보이지 않는다. 본문은 CoT가 수학·과학·다중 이미지 추론에서 유의미한 이득을 주는 반면 시각적 정합이나 객체 수세기 등 감지 중심 과제에서는 성능 저하를 초래하고, 이유로 시각적 반성(visual reflection)의 약화를 확인했다.
강력한 LLM 추론 자원을 합성 데이터 생성에 투자하면 단순한 프롬프트 생성·필터링보다 더 학습에 유효한 데이터셋을 얻을 수 있다. Autodata는 데이터 생성·평가·수정의 에이전트 루프와 이루프를 메타옵티마이즈하는 방법으로 작은 모델의 성능을 실질적으로 끌어올린다.
EBench는 단일 성공률 대신 5개 능력 축과 4개 일반화 차원으로 성능을 분해하는 시뮬레이션 벤치마크이다. 다양성 높은 26개 작업과 91.4시간의 데모로 장기, 정밀, 모바일 조작을 동시에 평가하여 사전학습이 일반화에 미치는 영향을 수치로 분리할 수 있다.
텍스트에서 복잡한 장면 구성을 정확히 따르는 구조-민감 텍스트→이미지 생성은 객체 개수·위치·속성 바인딩에서 실패하기 쉬우며, 기존 방법은 언어 또는 중간 디코딩에 의존해 한계가 존재한다. IV-CoT는 구조적 계획을 잠재 쿼리에 담아 단일 포워드로 추론하면서 구조 정확도를 높이고, 명시적 중간 디코딩 없이도 효율성을 유지한다.
장편 서사나 뮤직비디오처럼 여러 컷이 연속되는 영상에서 인물의 외형·음성·장면 컨텍스트 일관성 유지가 필수적이다. UnityShots는 컷 경계의 시각·음향 신호를 활용해 고정 크기 메모리 슬롯을 제어함으로써 샷 간 신원·음성 일관성을 크게 개선한다.
세부 시각 추론은 이미지의 작은 영역에서 증거를 찾아 문맥화해야 하는데, 기존 RL 기반 방법은 탐색 비용이 크고 SFT는 대규모 정답 라벨에 의존한다. V-Zero는 정답 텍스트 라벨 없이 학생이 샘플한 롤아웃을 교사 쪽의 양/음성 시각 뷰로 평가해 학습 게이트를 조정함으로써 효율적으로 세부 증거 기반 추론 능력을 강화한다.
단일 카메라 참조 동영상에서 사용자가 지정한 카메라 궤적로 새로운 시점의 동영상을 합성하려면 시점 제어, 기하학적 일관성, 모션 보존이 동시에 필요하다. MVTrack4Gen은 DiT의 특정 attention 레이어에서 추출한 대응 단서를 다중뷰 포인트 트래킹 감독으로 활용해 명시적 3D 재구성 없이 기하·모션 일관성을 크게 개선한다.
프로그래밍 의도가 이미지나 스크린샷, 차트처럼 시각적 아티팩트로 주어지는 상황이 늘어나며, 텍스트 기반 NL2Code만으로는 정확한 동작·레이아웃·도메인 제약을 보장하기 어렵다. 이 논문은 시각 정보와 코드를 연결해 실행 가능하고 검증 가능한 시스템을 만드는 연구들을 정리하고, 시각 신호 기반 검증 전략으로 연구 방향을 제시한다.
대부분의 최신 LLM은 autoregressive 학습과 causal attention에 의존하는 반면, 본 논문은 완전 양방향 masked diffusion으로 처음부터 대규모 학습한 8B 모델(iLLaDA)이 경쟁력 있는 성능을 달성함을 보여준다. 특히 수학과 추론·코드 벤치마크에서 autoregressive 강력 모델과 근접하거나 우수한 결과를 얻었다.
실시간 촬영 환경에서는 단순한 사후 크롭 예측만으로는 충분하지 않으며, 사진가 쪽의 'keep/refine/reject' 결정과 피사체 쪽의 장면 조건화된 포즈 제시가 모두 필요하다. CaptureGuide-Dataset(약 130K 샘플)과 ShutterMuse는 촬영 시점에 활용 가능한 구조화된 지침 생성 가능성을 실증했다.
LiteLLM의 valkey-search 모듈을 ElastiCache Valkey 클러스터에 적용해 구성 변경만으로 약 28% LLM 비용 절감과 응답 지연 단축을 달성했다.
REQL은 코드베이스를 그래프 형태로 색인해 에이전트가 소스 근거 있는 연결된 컨텍스트를 효율적으로 조회하도록 설계된 로컬 리포지토리 색인 엔진이다.
새 연구는 4개 실시간 음성 시스템을 감정이 중요한 통화에서 평가해 모델들이 톤은 식별하지만 의사결정에서 무시하는 'emotional intelligence gap'을 확인했다.
스팀 리뷰 임베딩으로 작동하는 오픈소스 설명형 검색엔진 nextsteamgame의 UI/UX 개선과 피드백 도입 후 2,652 검색 중 913회 스팀 클릭이 발생해 니치 게임 발견이 균일 분포로 이뤄졌음을 보고했다.
작성자는 Xiaomi의 MiMo Claw가 주장한 1,000회 이상 연속 툴 호출·토큰 절감·ClawEval 수치보다 실제 장기 체인에서 '첫 모순 지점'을 계측하는 방식으로 검증해야 한다고 주장한다.
Meta는 동일 필드명의 모호성과 AI 네이티브 데이터 복잡성을 해결하기 위해 LLM으로 애매한 자산을 해석하고 이를 버전된 결정적 규칙으로 증류하는 하이브리드 프라이버시 인프라를 제시한다.
프로덕션 Agent는 외부 도구 호출과 JSON Schema 기반 구조화 출력을 동시에 요구하는 경우가 많다. 이 논문은 두 제약을 동시에 활성화하면 디코딩 수준의 문법 마스크가 도구 호출 토큰을 차단해 도구 실행이 완전히 사라질 수 있음을 실험적으로 확인한다.
배포 환경에서는 원본 소스 데이터를 보관하기 어려워 장기간 무라벨 적응(CTTA)에서 모델이 자체 학습 오류와 망각을 누적해 성능이 하락한다. DO-ALL은 사전 한 번의 Dataset Distillation로 소스 정보를 소형 합성 앵커로 압축해 배포하고, 테스트 시 각 타깃 샘플과 의미적으로 대응되는 앵커를 참조해 적응을 안정화한다.
장기 작업을 수행하는 LLM 에이전트는 오래된 토큰을 압축·요약·삭제하며 창(window)을 관리한다. 이 논문은 에이전트의 '계획(plan)'이 대부분 창에만 의존해 한 스텝 만으로 숨겨진 상태 신호가 급락함을 보이고, 따라서 컨텍스트 관리 정책이 에이전트 동작에 직접적인 위험 요소임을 밝힌다.
긴 컨텍스트 추론에서 KV 캐시가 메모리·대역폭 병목을 유발하므로, 캐시를 저비트로 안전하게 압축하면 더 긴 컨텍스트를 단일 GPU에서 실행 가능하게 만든다. RoPE 구조를 반영한 블록 단위 비트 할당으로 key-side logit 보존을 우선하면, 동일한 평균 비트 예산에서 기존 균등 할당보다 attention 품질과 다운스트림 태스크 성능이 크게 개선된다.
추론 비용은 입력 토큰과 출력 토큰 양쪽에 의존하며 출력 토큰의 단가가 보통 더 높다. 같은 항목에서 입력 축약과 출력 축약을 비교하면 실제 청구액(realized cost)과 생성 텍스트의 의미적 일치가 서로 다르게 움직여 배포 의사결정에 직접적인 영향을 준다.
검색이 실제 해결책과 논리적으로 연결되는 경우(예: 수학 정리, 코드 동작 원리) 기존 임베딩·문자열 매칭은 적절한 문서를 찾지 못할 수 있다. RL-Index는 문서 인덱싱 단계에서 LLM 기반의 설명(rationale)을 자동으로 추가해 이러한 논리적 간극을 메우고, 온라인 쿼리 시 대규모 LLM 호출을 줄여 응답 지연을 대폭 낮춘다.
학생이 생성한 잘못된 추론 궤적(incorrect SGO)이 모델의 탐색적·수정적 행동을 보존해 학습에 더 유용한 경우가 존재한다. ReNIO는 최종 정답을 보지 않고도 접두사 수준의 학생·교사 확률비를 이용해 그러한 부정적 궤적에 자동으로 높은 가중치를 부여해 OPD/OPSD 성능을 개선한다.
WordArt는 고도로 스타일화된 글자 형태와 복잡한 레이아웃으로 기존 OCR·STR 파이프라인에서 높은 실패율을 보인다. 본 논문은 대규모 합성 데이터(WATER-S)와 임의 비율 입력을 처리하는 모델(WATERec)을 결합해 WordArt 성능을 대폭 개선한다.
사용자가 임의의 시점으로 옷을 회전·확인하는 실무적 요구를 기존 VVT는 입력 비디오의 고정 카메라 궤적에 의존해 충족하지 못한다. TryOnCrafter는 인간과 배경을 분리한 렌더 가능한 4D 프록시를 기반으로 DiT를 구동해 임의 카메라 궤적에서도 텍스처·구조·동작 일관성을 유지하는 카메라-컨트롤러블 비디오 가상 피팅을 실현한다.
실시간 스트리밍 및 상호작용 가능한 비디오 생성은 추론 단계를 몇 번의 샘플링으로 줄이는 동시에 시간축 오류 누적을 막아야 한다. Causal-rCM은 오프라인 안정성(teacher-forcing 기반 CM)과 on-policy 품질 향상(self-forcing DMD)을 결합해 1–2스텝 수준에서 SOTA 성능을 달성한다.
단일 모델이 텍스트·오디오·비디오를 입력과 출력으로 동시에 처리해 모듈 경계에서 발생하는 대기 시간과 동기화 오류를 제거한다. 그 결과 모델 측 응답 약 200ms, 네트워크 포함 총 약 550ms의 서브초(미드 레이턴시) 풀-듀플렉스 상호작용을 달성한다.
사용자가 제공한 참조 이미지의 '주체(subject)' 특징을 보존하면서도 스타일·도메인을 자유롭게 바꾸는 텍스트-투-비디오 생성이 가능해진다. 기존 기법이 주로 한쪽(고충실도 유지 또는 편집 유연성)에 치우쳤던 문제를 균형 있게 처리하여 실무적 개인화와 창작적 도메인 전환을 동시에 만족한다.
LLM 에이전트의 장기 상태 유지·업데이트·검색은 단순한 RAG를 넘어 데이터 관리 인프라 관점에서 설계되어야 한다. 이 논문은 대표적 메모리 아키텍처들을 동일한 테스트베드로 비교해, 구조·추출·검색·유지관리의 설계 선택이 성능·정확도·운영비용에 미치는 영향을 정량화한다.
27.9M 파라미터 MobileNetUNet을 이용해 RGB↔역렌더링(베이스컬러·노멀·RMD·깊이)을 한 모델에서 공동 학습하고 재구성까지 지원하며 모델과 데모를 Hugging Face에 공개함.
AWS는 S3 Vectors·S3 Tables(Lake Formation)·AgentCore Gateway 기반으로 에이전트형 AI의 세밀한 접근 통제와 비용·성능 최적화를 지원하는 서버리스 데이터 메시 아키텍처를 제안한다.
ByteDance의 오픈소스 SeedVR2를 Amazon SageMaker AI에서 실행해 프레임 단위 초해상도를 적용하고, AWS CDK 기반의 3계층 아키텍처로 대규모 비디오 컬렉션을 보안·효율적으로 업스케일링하는 방법을 다룬다.
P6-B200의 Blackwell GPU(8×)과 SageMaker AI를 활용하면 배치 크기·시퀀스 길이·정밀도·체크포인팅 조정으로 1B–64B급 Transformer의 단일 노드 학습 효율을 개선할 수 있다.
Linux Foundation이 DNS 기반 재사용을 통해 AI 에이전트의 소속·권한·히스토리 검증과 발견 방식을 표준화하는 Agent Name Service(ANS)를 제안했다.
기업 AI 인프라 수요가 트레이닝에서 추론으로 이동하면서 용량 산정·하드웨어 조달·플랫폼 설계 방식이 근본적으로 달라지고 있다.
Claude Code 기반의 '/pr-loop' 스킬은 GitHub 이슈를 받아 브랜칭·로컬 게이트 실행·병합 준비까지 세 역할 에이전트로 자동화해 반복 작업과 리뷰 품질을 개선한다.
ARD 표준은 ai-catalog.json 매니페스트와 분산 레지스트리를 통해 에이전트 간 발견·검증·선택을 표준화해 Agentforce 같은 플랫폼의 안전한 상호운용을 돕는다.
TokenSpeed-kernel은 런타임과 하드웨어 특화 커널을 분리하는 레이어드 API·레지스트리 시스템을 제공해 다양한 GPU·벤더에서 고성능 LLM 추론을 가능하게 한다.
대규모 도구 카탈로그에서 도구 설명이 짧고 구조화되어 특정 토큰이 판별자인 경우 BM25 같은 키워드 기반 검색이 의미 임베딩(cosine)보다 더 정확하다는 실험 결과와 43,000개 도구 벤치 링크를 제시한다.
Orchid는 에이전트와 API 사이에 가볍게 끼워 로컬에 모든 요청·응답·토큰을 기록하고 웹 UI·플레이백·비용 집계를 제공하는 오픈소스 디버깅/테스트 도구이다.
약 209억 토큰 사용 중 95.41%가 캐시 읽기로 집계되며 총 비용 $17,222.27의 과반이 캐시 읽기에 할당됐다.
Deck은 repo>worktree>terminal 트리에서 tmux-backed 터미널을 에디터 탭으로 관리하고 Claude Code 연동으로 재부팅 시 세션을 자동 복구하는 VS Code 확장이다.
Claude Code 스킬로 동작하는 dcode-agent-kit는 인터뷰형 위자드로 agent.py·model.py·README를 생성해 LangChain deepagents 반복 작업을 자동화하고 안전 장치를 기본 포함한다.
CPython 3.12 런타임에서 eBPF로 LangChain BaseTool 실행 경계를 추적해 시스템콜을 도구 단위로 귀속하고 LSM 훅으로 커널 수준의 정책을 적용하는 연구용 프로젝트(ironscope) 공개 및 협업 요청.
작성자는 30회 이상 Opus Ultra 코드 세션을 분석해 Claude의 서브에이전트·자기검토가 토큰을 낭비한다는 결론을 내리고, 작업·검증·모델 위임을 명시하는 프롬프트 구조와 GitLab에 공개한 skill 명령으로 효율을 개선했다고 보고했다.
Eve와 Flue 위에서 shadcn/ui 컴포넌트를 사용해 프로덕션 지향 에이전트 레시피를 제공하는 오픈소스 agentcn 저장소 공개
Anthropic은 알리바바 연관 운영자들이 4월22일~6월5일 사이 약 2,880만회 교신을 통해 Claude의 에이전트식 추론·소프트웨어 공학 등 핵심 능력을 무단 추출하려 했다고 보고했다.
LLM으로 매문서 추출을 반복 호출하는 대신 LLM이 생성한 TypeScript 추출기 코드를 한 번만 만들고 로컬에서 실행해 비용과 응답 변동성을 제거하는 파이프라인을 제안한다.
340회 반복 실험에서 샘플링 온도가 높아질수록 JSON 스키마 기반 출력의 무결성이 떨어지고 이스케이프·손상·필드 누락 오류가 늘어났다.
모델별 대화 상태가 흩어지며 컨텍스트가 소실되므로 단일 소스에 모든 프로젝트 컨텍스트를 모으고 주 모델+보조 모델 하이브리드를 쓰는 방식이 실무에서 가장 실용적이다.