서버 실행 기반 human-in-the-loop 설계 취약점 검토 요청
모델의 직접 실행을 차단하고 서버 측 게이트와 원장 기반으로 효과를 수행하도록 구성한 설계와 그 한계를 기술적 관점에서 검토해 달라는 요청이다.
총 70건
모델의 직접 실행을 차단하고 서버 측 게이트와 원장 기반으로 효과를 수행하도록 구성한 설계와 그 한계를 기술적 관점에서 검토해 달라는 요청이다.
Haystack Diagnostics Engine은 RAG 파이프라인의 검색 실패를 6개 클래스 수준으로 분류하고 쿼리 상태를 JSON 번들로 캡처해 diff로 원인을 밝히는 도구이다.
토스와 오늘의집 출신 PO가 AARRR 프레임워크와 리텐션의 수학적 원리를 통해 좋은 제품을 정의하고, AI 시대에 기술보다 브랜딩과 철학이 중요해지는 이유를 설명한다.
오케스트레이터의 신뢰성은 미션 문서에 따른 의사결정, 주기적 하트비트, 명확한 에이전트 간 통신, 그리고 감사 가능한 제어로 확보된다.
스크린샷은 JustVugg의 nanoeuler가 C/CUDA로 작성된 GPT-2 스타일 LLM이며 hand-written backprop, BPE, FlashAttention, pretraining, SFT를 포함한다고 보고한다.
Halt Core는 로컬에서 에이전트의 명령과 코드를 가로채 정적 룰과 선택적 로컬 LLM 심사를 통해 위험한 셸 및 파이썬 실행을 차단하는 경량 미들웨어다.
anewera는 llms.txt, agent.json, agent.md와 실시간 MCP/webMCP 엔드포인트를 통해 AI 에이전트가 기업을 찾고 권한화된 액션으로 연락하도록 설계된 구조화된 비즈니스 디렉토리이다.
로봇의 모방 학습 시 발생하는 오차 누적 문제를 해결하기 위해 동작 시퀀스를 묶어 예측하는 Transformer 기반 모델인 ACT를 정의한다.
로컬에서 Claude Chat이 코드베이스를 탐색하고 답변과 수행 단계를 반환하는 읽기 전용 MCP 브리지를 GitHub에 공개했다.
OpenAI가 공개한 GPT-5.6은 제한적 접근으로 제공되며 일부 코딩 에이전트 작업과 벤치마크에서 Mythos에 필적하는 성능을 보였으나 준비태세 평가에서는 Cyber Critical 임계값을 넘지 못했다.
해당 스크린샷은 step 161에서 loss=1.108, lr=0.001, steps_per_sec≈99로 손실이 꾸준히 감소하는 학습 진행을 보고한다.
작성자는 2022년 이후 AI 영향으로 급증한 신규 직무명을 구직 사이트에서 스크래핑해 추적하는 사이트를 만들고 상위 5개 직무와 채용 수를 공개했다.
AI 에이전트 도입으로 발생하는 관리 부담인 '봇시팅' 현상을 분석하고, 단순 도구 활용을 넘어 AI를 추론 파트너로 대하는 조직 혁신 방안을 논의합니다.
생물학적 추론에서는 보이지 않는 경로·질병·종으로의 전이가 빈번하므로 in-domain 성능만으로는 실용성을 판단할 수 없다. 본 연구는 CPT, SFT, RL이라는 표준 사후 학습 단계를 통제된 조건에서 분리해 각 단계가 ID와 OOD 성능에 미치는 구체적 영향을 규명하였으므로 실제 생물학 응용에서 학습 예산을 어떻게 배분할지에 대한 실무적 지침을 제공한다.
OpenBioRQ는 에이전트형 모델의 문헌 기반 증거 수집과 인용 충실도를 실제 열린 연구 질문으로 검증하도록 설계된 점에서 중요하다. 기존 벤치마크는 정답키가 있는 문제를 전제로 하므로 모델이 주어진 출처를 반복해 재현하는 방식으로 통과할 수 있지만 OpenBioRQ는 그런 우회 경로를 차단해 진정한 근거검증 능력을 측정한다. 이로 인해 식별자 존재 여부만으로는 놓치기 쉬운 잘못된 인용(wrong-paper citation)과 도구 포기(agentic collapse) 같은 실패 모드를 계량적으로 드러낼 수 있다.
MCP 연결은 에이전트의 계획을 실제 실행으로 연결하는 표준화된 호출 표면이어서 소유권·권한·실행 로그를 포함한 거버넌스가 필수라고 강조한다.
Hacker News에 공유된 Telnyx의 GitHub 저장소 링크로 Python 기반 AI 콘텐츠 번역용 코드 예제를 가리킨다.
Fernando는 OpenClaw 테스트 인스턴트에 이메일로 프롬프트 인젝션을 시도한 6,000건의 공격에도 비밀 유출이 발생하지 않았고 실험에 약 500달러의 토큰 비용이 소요되었음을 보고했다.
rewardspy 대시보드 스크린샷에서 평균·표준편차·구성요소 기여도와 롤아웃 노트를 통해 reward-hacking 징후가 관찰된다.
Cara는 Amazon EKS와 Amazon Bedrock을 기반으로 ACORD 등 보험 양식 자동화, 견적 비교, 제안서 생성 등을 수행해 보험 중개사의 반복 백오피스 작업을 자동화하는 SaaS 솔루션이다.
거대 기업들의 막대한 컴퓨팅 자원 독점과 폐쇄적 모델 발전으로 인해 개인 개발자와 오픈소스 생태계가 AI 혁신의 최전선에서 소외될 위험을 분석한다.
구글의 OKF 표준을 활용해 AI 에이전트가 지식 베이스를 효율적으로 탐색하고 토큰 비용을 절감하는 방법을 다룹니다.
pybench은 여러 시드를 샘플링해 기준 통계를 저장하고 같은 시드로 재실행하여 메트릭의 통계적 회귀를 판정하는 pytest 스타일의 벤치마크 도구이다.
컨텍스트 윈도우를 작업 세트로 재구성하는 ContextForge 논문과 구현을 공개하고 장기 평가에서 기존 방식보다 일관성과 안정성이 우수함을 보고했다.
LangChain으로 구축한 RAG 앱에서 임베딩·검색·네트워크 왕복·컨텍스트 주입이 LLM 호출보다 전체 레이턴시에 더 크게 기여함을 100k 문서 벤치로 확인하고 오픈소스 벤치마크를 공개했다.
이 연구는 자연어로 표현한 주제를 수학적으로 검증 가능한 평면접기(Flat-foldable) 크리즈 패턴으로 자동 전환하는 최초의 완전 자동화 파이프라인을 제시한다. 박스 플리팅 격자와 알고리즘적 분할을 결합해 기하학적 제약을 보장하면서 VLM 기반 미적 평가와 RL을 통해 시각적 완성도를 높였다. 이로 인해 인간 디자이너가 구조적 시작점을 신뢰할 수 있는 수준으로 자동 생성할 수 있게 됐다.
LLM 에이전트는 도구 호출과 외부 관찰이 포함된 장기 상호작용에서 단계별 보상 신호가 특히 중요하지만, 단계 단위 주석이나 Monte Carlo 재평가는 비용과 실행 가능성 면에서 제한이 있다. 논문은 RL로 파인튜닝된 행동 정책과 기준 정책의 로그확률비가 stochastic MDP에서도 정확한 어드밴티지를 재현함을 보였고, 이를 통해 별도의 보상 모델 학습 없이 단계·궤적 수준의 평가와 모니터링을 가능하게 했다. 이 방법은 테스트타임 샘플 선택, 불확실성 정량화, 오류 위치 규명에서 기존의 학습 기반 PRM이나 단순 확률 기반 지표를 능가했다.
이 논문은 여러 모델을 조합하는 라우팅·투표·Mixture-of-Agents 방식이 실무에서 기대만큼 성능을 개선하지 못하는 근본적 이유를 규명한다. 여러 모델이 동일 질의에 대해 모두 틀리는 비율 β가 모든 선택 정책의 정확도 상한 1−β를 결정하므로, 기존의 평균 쌍별 오차 상관 ρ만으로는 실제로 얻을 수 있는 이득을 판단할 수 없다. 라우터를 배포하기 전에 단일 등급의 검증 집합에서 Clopper–Pearson 하한을 계산하면 어떤 정책도 초과할 수 없는 최대 이득을 사전에 확증할 수 있다.
위성 관측은 재방문 간격과 구름으로 인해 시계열 중간의 지표 상태가 관측되지 않는 부분관측 문제를 안고 있다. 이 상황에서 기상은 외생적 구동력으로 작용하므로 모델은 동일한 기상 입력에 대해 여러 가능한 토지 반응을 확률적으로 표현할 필요가 있다. EO-WM은 계절적 기준과 이상, 그리고 누적 스트레스를 분리해 날씨 변화에 따른 표면 반응 충실도를 높여 재해 모니터링과 작물 예측 같은 실무적 활용 가능성을 개선했다.
대형 언어 모델의 긴 문맥 처리에서 KV 캐시 메모리는 입력·생성 길이에 따라 선형으로 증가하여 실무적 제약을 초래한다. 이 논문은 단순히 최근 attention에 의존한 토큰 보존 기준이 장거리 생성에 취약하다는 관찰을 바탕으로, 예측 불확실성(entropy)과 레이어별 표현 변화를 결합해 미래 기여도를 정량화함으로써 필요 토큰만 선별적으로 보전한다. 그 결과 장거리 prefilling과 decoding 시나리오 모두에서 기존 attention 기반 압축 방법보다 전반적으로 우수한 성능을 달성했다.
보상 모델이 연속적 점수를 제공할 때 매우 유사한 응답들에 대해 불필요한 점수 차이를 만들어 RL 정책이 취사선택이 아닌 편향을 학습할 위험이 존재한다. 이 논문은 보상 모델의 'oversensitivity'가 학습된 보상을 통해 정책에 악영향을 미친다는 점을 이론적·실험적으로 규명했다. 보상 값을 군집화하여 이산화하면 판별 능력은 유지하면서 특이성을 대폭 개선할 수 있음을 증명하고 실제 RL 실험에서 더 안전한 학습 결과가 관측되었다.
PHYSIFORMER는 시점이나 픽셀 종속적 표현 대신 세계 좌표계의 3D 메쉬 정점 좌표를 직접 생성 목표로 삼아 물리적 동역학을 모델링한다. 이 접근은 비가시적 물리 변수의 불확실성을 확률적으로 포착해 다양한 타당한 미래 궤적을 생성하는 능력을 제공한다. 결과적으로 로봇 시뮬레이션, 그래픽스, 물리 설계 등에서 뷰 불변성과 지오메트리 인식을 요구하는 응용에 직접 적용 가능하다.
대형 시각적 월드 모델이 생성하는 미래 예측이 시각적으로 그럴듯해도 실제 동적 행동과 어긋나면 제어 결정에 치명적인 오류가 발생한다. 이 논문은 그러한 환각이 구조적 결함이 아니라 데이터 커버리지 부족에서 기인한다는 사실을 밝혀내고, 데이터 분석 신호를 이용해 환각을 런타임에 감지하고 표적 수집으로 빠르게 보완하는 절차를 제시했다. 결과적으로 적은 양의 추가 실제 궤적만으로도 사전학습된 모델을 미지 환경에 효율적으로 적응시킬 수 있음을 보였다.
CoffeeBench는 LLM 에이전트의 장기적 의사결정 능력을 경제적 상호작용 맥락에서 검증할 수 있게 만든다. 이 벤치마크는 동종 에이전트가 아닌 서로 다른 역할(농부, 로스터, 소매상)을 포함하여 실제 경제에서 요구되는 협상·거래·신용 관리 역량을 시험한다. 에이전트의 통신 빈도와 현금흐름 관리가 수익성에 직접 연결되는 점이 장기적 에이전트 평가에서 중요한 판단축으로 드러난다.
실세계 영상은 모션 블러, 글레어, 부분 차폐 등으로 자주 열화되어 Video-LLM의 예측을 왜곡한다. 본 논문은 각 프레임의 신뢰도를 추정해 신뢰도가 높은 프레임만을 중심으로 다양한 시각 도구를 선택하고 통합하는 파이프라인을 제시했다. 그 결과 깨끗한 입력에서 56.4% 정확도를 달성하고 오염된 입력에서도 54.3%를 유지하여 실환경 적용 시 예측의 무감지 실패를 줄였다.
현대의 Vision-Language-Action 모델은 학습 시 고정된 시스템 구성 ψ를 암묵적으로 가정하여 새로운 카메라 뷰나 로봇 형태에서 성능이 급락하는 문제가 반복적으로 관찰된다. 본 논문은 짧은 무작위 상호작용을 컨텍스트로 제공하면 모델이 추가 파라미터 업데이트 없이도 현재 시스템의 감각-운동 관계를 암묵적으로 복원할 수 있음을 보인다. 이 접근은 현장 배포 시 각 환경마다 데이터수집·미세조정이 필요한 반복 비용을 줄이며 제로-샷 적응을 가능하게 한다.
시각적 조건을 가진 이미지와 비디오 생성에서 사이드 네트워크가 조건 제어를 담당하지만 그 학습 신호는 암묵적이어서 수렴이 느리고 조건 충실도가 떨어지는 문제가 존재한다. 이 논문은 사이드 네트워크의 중간 피처를 우도 스코어 근사치와 직접 정렬함으로써 조건 신호를 명시적으로 강화하고 학습 효율을 개선했다. 결과적으로 학습 단계에서 수렴 가속과 최종 합성 품질 개선이 동시에 관찰되었다.
현행 웹/OS 에이전트 벤치마크는 폼·네비게이션 중심으로 포화 상태에 이르러 실제 산업용 인터페이스에서 요구하는 시각·시간·3D 추론 능력을 제대로 평가하지 못했다. 이 논문은 캔버스 기반 UI와 복합 과제로 구성된 평가판을 통해 최전선 에이전트의 일반화 능력과 한계를 계량적으로 드러냈다.
도구 호출을 포함하는 장기 상호작용에서 RL만으로 학습하면 특정 제어 토큰의 확률이 비정상적으로 증폭되어 구조적 생성이 붕괴하는 현상이 빈번히 발생한다. 이러한 붕괴는 모델의 내재적 추론 능력 상실이 아니라 토큰 수준의 분포 재배치로 인한 형식적 실패로 규정되므로 보상만으로 해결하기 어렵다. 이 논문은 다양한 감독 신호를 체계적으로 비교하여 구조적 행동을 제어함으로써 안정적이고 일반화 가능한 도구 사용 학습을 가능하게 하는 실험적 근거를 제공한다.
샘플링 기반 계획은 후보 액션 시퀀스마다 반복적인 잠재 롤아웃을 수행하므로 계산 비용과 누적 예측 오류가 빠르게 증가한다. Fast-LeWM은 액션 접두사 단위로 병렬 예측을 수행하여 후보 평가당 반복적 연산을 제거하고 오픈루프 오차 성장을 현저히 완화했다. 이 접근은 샘플링 예산이 제한된 환경에서 실시간에 가까운 계획과 더 안정적인 장기 예측을 가능하게 한다.
소프트웨어를 자동으로 조작하는 에이전트의 실행 능력은 인터페이스 모달리티에 따라 다른 병목을 드러낸다. 동일한 목표와 초기 상태, 동일한 최종 상태 검증을 적용한 통제된 벤치마크를 통해 모달리티 자체가 성능 차이를 유발하는지 분리할 수 있다. 이런 분리는 에이전트 설계에서 모델 개선과 도구 설계 중 어디에 우선 투자해야 하는지를 결정하는 데 직접적인 근거를 제공한다.
Autoregressive LLM의 디코딩은 본질적으로 직렬적이어서 긴 생성 작업에서 지연이 주요 병목이다. 스펙큘레이티브 디코딩은 초안 생성과 병렬 검증으로 이 지연을 줄이지만 초안 예산을 늘릴 때는 acceptance rate과 초안 비용의 동시 개선이 필요하다. JetSpec은 병렬 예측의 효율성과 분기별(in-branch) 인과적 조건화를 동시에 확보하여 더 큰 초안 예산을 실제 accepted prefix 길이와 엔드투엔드 속도 향상으로 변환했다.
코딩 에이전트의 성능 향상이 진전됨에 따라 기존의 단일 검증 수단은 점차 무력화되는 현상이 발생했다. 이 논문은 검증 신호의 스케일러빌리티, 충실성, 강인성 세 가지 축 사이의 본질적 트레이드오프를 정량적으로 드러내고 검증자가 생성자와 공진화(co-evolve)해야 지속적인 성능 향상이 가능하다고 주장했다. 실무적으로는 테스트 기반 보상만으로는 장기적 능력 향상을 확보할 수 없으며, 다양한 검증 설계와 궤적 수준의 모니터링이 필요하다는 점을 입증했다.
실세계 이미지 생성 요청은 종종 불완전하거나 암시적이며 최신 사실을 요구하므로 단일 프롬프트 기반 T2I 모델로는 정확한 결과를 얻기 어렵다. 컨텍스트 갭을 명시적으로 규정하면 누락된 정보를 식별하고 외부 검색·추론·메모리를 동원해 생성 컨텍스트를 완성할 수 있다. 이 논문은 해당 문제에 대한 통합적 해결책과 이를 평가하는 체계적 벤치마크를 동시에 제시해 실무 적용 가능성을 높였다.
완료된 온폴리시 궤적을 그대로 활용해 계층적 자연어 스킬을 추출하면 외부 스킬 저장소나 오프폴리시 검색 없이도 정책에 분포 일치형의 밀집 감독 신호를 제공할 수 있다. 이 방식은 장기 상호작용에서 보상이 희소해 발생하는 중간 결정에 대한 신용 배분 문제를 완화하여 성공률과 샘플 효율을 동시에 개선한다. 논문 실험은 ALFWorld WebShop Search-based QA에서 OPID가 결과 기반 RL과 기존 스킬 증류 기법보다 전반적으로 우수하거나 경쟁력 있음을 확인했다.
ViQ는 이미지 특징을 텍스트처럼 이산 토큰으로 표현하면서도 고수준 의미와 저수준 세부를 동시에 유지하도록 설계된 점이 핵심이다. 이산 표현은 저장 및 훈련에서 효율성을 크게 높이므로 멀티모달 대규모 학습에서 실질적인 비용·시간 절감으로 이어진다. 논문은 이러한 균형을 달성하면서도 다양한 벤치마크에서 연속 특징 기반 인코더와 경쟁할 수 있음을 실험으로 입증했다.
현대 이미지 생성은 하나의 배포 모델이 text-to-image, 로컬 편집, 글로벌 편집 같은 이질적 능력을 함께 지원할 것을 요구한다. 이들 능력은 동시 최적화 시 상호 간섭이 발생하여 한 능력을 강화하면 다른 능력이 약화되는 경향이 있다. DanceOPD는 각 능력을 속도 필드로 보고 학생이 자신의 롤아웃 상태에서 하드 라우팅된 필드를 단일 low-noise 쿼리로 학습하도록 하여 능력 합성을 달성했다.
Claude Code의 .jsonl 대화 기록을 파싱해 가중치 키워드 분류와 메모리 심볼릭 링크로 Obsidian 마크다운 노트로 변환하는 파이썬 유틸리티이다.
단순 프롬프트를 넘어 불변의 정체성과 상황별 모드 등 4단계 계층 구조로 AI의 일관된 브랜드 보이스를 구축하는 실무 아키텍처를 제시한다.
llmgateway는 다중 LLM 제공자 간 자동 페일오버와 기능별 비용 귀속, Redis 응답 캐싱을 지원하는 OpenAI 호환 게이트웨이로 Docker로 자체 호스팅 가능하다.
소규모 초기 제품 팀을 겨냥한 셀프 호스팅 LLM 게이트웨이를 공개했으며 'mantis deploy' 명령으로 AWS에 간단히 배포할 수 있다.
요청이 실제로 해당 행동을 수행할 권한이 있는지 암호화된 케이퍼빌리티와 결정적 어텐션으로 검증하는 에이전트 보안 아키텍처와 평가·코드가 공개되었다.
OpenAI가 GPT-5.6 제품군 Sol·Terra·Luna의 제한적 프리뷰를 공개했으며 모델별 용도와 백만 토큰당 과금 기준이 함께 제시되었다.
지연 최적화로는 해결되지 않던 월 $2,400의 추론 비용을 시맨틱 캐시, int4 양자화, 프롬프트 압축을 적용하여 $914로 낮췄다.
핸드라이팅 노트는 Q(k)^T와 V의 행렬곱으로 d×d 크기의 상태행렬 S를 구성해 시퀀스 길이 N에 무관한 고정 크기 표현을 만드는 접근을 보여준다.
Anthropic 조사에서 9,700명의 Claude 사용자 중 3분의1 이상이 내년 AI가 업무 대부분을 처리할 것으로 믿고 있으며, Claude Code는 일반 채팅보다 더 많은 출력 유형에서 자율성이 높게 나타났다.
대화형 AI 에이전트를 기존 REST API의 동일한 사용자 컨텍스트·데이터 레이어 권한을 통해 실행하도록 구현해 권한 오용과 프롬프트 인젝션 위험을 방지했다.
SenseTime의 오픈소스 멀티모달 모델 SenseNova‑U1은 NEO‑unify 아키텍처와 150MB LoRA 어댑터로 인포그래픽 생성을 약 12× 가속하며 GGUF 퀀타이즈로 소비자 GPU 실행을 지원한다.
프로토콜 기반 MCP 서버를 통해 Amazon S3에 저장된 텍스트형 PDF를 배치 없이 실시간으로 추출·질의해 컴플라이언스·법무·재무팀에 즉시 답을 제공하는 패턴과 Amazon Textract와의 용도별 비교를 제시한다.
SenseNova-Skills는 CSV 정제→데이터 분석→인포그래픽·PPT 자동 생성까지 연결하는 모듈형 에이전트 스킬 모음으로, 시각 보고서 생성 자동화에 초점을 맞췄다.
OpenAI 사례와 최근 논의는 대화 트레이스를 통해 시뮬레이션을 보완하거나 대체할 수 있으며, 항목 수준 평가 데이터 공개와 환경 속성 표준화가 장기적 재사용성과 비용 절감에 핵심임을 강조한다.
의미 압축을 확산식 노이즈로 사용하고 다중 패스·패스 조건 훈련으로 통합 상태를 갱신해 모델 컨텍스트 한계를 넘어서는 문서 처리를 시도한 연구 제안과 초기 실험 결과 공유.