13토큰으로 규칙을 저장하고 0.79–1.00 정확도를 보인 8슬롯 fast-weight 메모리
하이퍼네트워크로 슬롯을 저순위 MLP 가중치로 확장해 순전파만으로 읽기·쓰기가 가능한 8슬롯 fast-weight 메모리 뱅크가 소형 Transformer에서 단회 제시로 미지 쿼리 대응을 달성했다.
총 100건
하이퍼네트워크로 슬롯을 저순위 MLP 가중치로 확장해 순전파만으로 읽기·쓰기가 가능한 8슬롯 fast-weight 메모리 뱅크가 소형 Transformer에서 단회 제시로 미지 쿼리 대응을 달성했다.
KU-Gateway는 컨텍스트 청크에 시간적 감쇠 점수를 부여하고 오래된 페이로드를 제거하는 프록시로서 EAP에서 토큰 소모를 약 50% 줄이고 오래된 정보로 인한 환각을 차단했다고 보고되었다.
Go‑Live 후 모델 성능이 서서히 저하되는 현실과 조직 내에서 그 변화를 지속적으로 감시하고 책임지는 주체가 부재하다는 문제를 91% 통계와 함께 제기했다.
ADLC는 에이전트가 조용히 성능이 저하되는 문제를 해결하기 위해 기획·구축·검증·관찰·개선 단계를 순환시키고 각 단계에 명확한 소유권을 부여하는 프레임워크이다.
OpenArt AI Director는 대화만으로 캐릭터와 스토리 일관성을 유지하며 최대 5분 분량의 영상을 생성하는 바이브 디렉팅을 지원한다.
Google이 제안한 Open Knowledge Format은 마크다운과 경량 YAML, 개념 간 링크로 에이전트 지식을 규격화하여 임베딩과 벡터DB 의존을 줄이는 대안을 제시한다.
AI 시스템의 안정적 운영을 위해서는 데이터 품질과 컨텍스트 엔지니어링을 중심으로 한 확장 가능한 아키텍처가 필요하다.
Larkup-RAG는 문서 로드부터 자동 청크화·임베딩·벡터 인덱싱·RAG 서버 배포까지 파이프라인을 자동화해 빠르게 RAG API를 구축하는 오픈소스 프로젝트다.
투명한 표면 때문에 실측 깊이에 구멍이 생기는 문제를 여러 최신 완성 방법으로 비교하고 LingBot-Depth 2.0의 벤더 보고 결과와 검증 한계를 논의한다.
Nim과 Intel OpenVINO 기반 베어메탈 런타임이 i5-11400 CPU에서 YOLOX-nano로 120–180 FPS와 3.42 MB 고정 힙 사용을 보고했다.
GenAI는 인터넷·모바일·클라우드보다 약 세 배 빠른 속도로 확장해 연간 약 $110B의 수익을 창출하고 있으며 이로 인해 검색·평가·데이터 파이프라인·배포 인프라 등의 스택이 모델만큼 중요해졌다.
Anthropic의 J-space 관찰을 jacobian lens로 읽어 Subtext가 Qwen3.5-4B를 12GB GPU에서 bf16로 실행하며 9개 레이어에서 실시간 내부 신호를 스트리밍했다.
Mistral의 35억 달러 투자 유치와 삼성전자의 AI 메모리 수요로 인한 18배 수익 급증을 통해 AI 산업의 성장 동력과 인프라의 중요성을 분석한다.
부호(sign) 패턴만을 비교하는 IMG Sign 접근은 LFW 96.27%와 복합 평가 81.02%를 기록하며 기존 코사인 기반보다 우수함을 보였고, ArcFace 임베딩에도 재학습 없이 높은 전이 성능을 나타냈다.
PDF·Word·Excel의 레이아웃 메타데이터가 페이지당 약 3,000토큰을 유발해 20페이지 기준 70,000+ 토큰을 낭비했고 MarkItDown으로 메타데이터를 제거해 Markdown 출력과 MCP 연동으로 컨텍스트 효율을 개선했다.
GCE는 희소한 장면 설명을 장면 그래프로 변환해 추가 객체와 관계를 예측·검증한 뒤 이를 기반으로 이미지 합성을 수행해 생성물의 의미적 풍부함과 구조적 일관성을 개선했다.
AnyBokeh는 입력 이미지의 서명된 CoC와 시차를 추정하여 소스별 CoC–시차 기울기(광학 지문)를 계산하고 이를 목표 초점·조리개로 전이한 뒤 이중 CoC 조건화된 생성 편집기로 상대적 블러 합성을 수행한다.
여러 TDA 방법으로 SFT 학습문서를 10% 제거해도 대부분의 바람직하지 않은 행동은 거의 변화하지 않았고, 거부(refusal) 행동만 필터링으로 어느 정도 제어됐다.
Anthropic의 Fable 5는 보안 취약점으로 인한 미국의 배포 제한이 해제되어 7월 1일 글로벌 재배포되었으며 같은 호 기간에 정부의 다른 모델 접근 규제가 병행 보고되었다.
Maith는 Lean의 elaborated Expr 트리에서 정규화된 IR을 생성해 소스 대신 토큰화하는 접근을 구현하고 초기 추출 통계(1129개 선언 중 70% 성공)를 보고한다.
물리적 무질서에서 정보 이론을 거쳐 LLM의 손실 함수와 온도 조절까지 이어지는 엔트로피의 핵심 개념과 AI에서의 응용 사례를 다룹니다.
Mac에서 키를 누르고 말하면 Whisper와 Parakeet을 Neural Engine에서 실행해 로컬로 음성을 텍스트화하고 로컬 AI로 프롬프트를 다듬는 도구이다.
godotiq를 통해 에디터 내부에서 장면을 배치하고 검증하는 에이전트가 Kenney 자산으로 구성된 9홀 미니골프를 자동 생성했다.
PyTorch는 Monarch 런타임을 ROCm으로 포팅해 AMD Instinct GPU에서 노드 장애 시에도 중단 없이 동적으로 복구하는 탄력적 분산 학습을 실현했다.
MoE 아키텍처를 활용해 언어 정보 없이도 다양한 도메인의 시각적 이상을 통합적으로 탐지하는 AnomalyMoE 모델을 제안한다.
계층적 인과 관계와 노이즈 제거를 결합한 HugRAG 프레임워크를 통해 지식 그래프 기반 RAG의 추론 성능을 개선한 연구이다.
공개 모델을 통해 리서치 노트를 자동 생성하면서 모든 숫자에 기계 해상 가능한 인용을 연결하고 결정론적 검사와 모델 감사로 오류를 차단하는 파이프라인이다.
AI 에이전트의 기능을 확장할 때 Model Context Protocol과 Skills 중 적합한 방식을 선택하는 기준과 컨텍스트 엔지니어링의 중요성을 다룬다.
Limboo는 AI 코딩 에이전트를 워크스페이스의 한 구성요소로 통합하고 세션별 이력과 로컬 저장소 델타를 주입해 작업을 재개하도록 설계된 오픈소스 데스크톱 애플리케이션이다.
중간층 선형 프로브와 소수의 추가 가중치를 통해 모델의 은닉 신호를 언어화하여 보정된 신뢰도(0.765+)를 얻었고 AUROC 0.83–0.88의 재현성을 보고했다.
변조 가능한 LLM 프록시는 에이전트의 정상 응답 흐름에 도구 호출을 주입해 작업 디렉토리 파일 유출과 무단 명령 실행을 야기하며, 방어는 런타임 격리와 최소 권한 정책에 의존해야 한다.
16개 LLM 제공자의 무료 티어를 묶어 하나의 OpenAI 호환 /v1 엔드포인트로 제공하는 오픈소스 프록시 프로젝트이다.
이 프로젝트는 LangGraph 에이전트를 래핑해 지속 목표 관리, 리플렉션 기반 스케줄링, 멱등성·감사 거버넌스를 제공하는 TypeScript SDK이다.
MIRA는 10k 시간 합성 Rocket League 플레이로 학습된 5B 파라미터 게임 에이전트로, 단일 B200에서 4인 동시 플레이를 초당 20프레임으로 실행하며 데모·기술보고서·1k 시간 데이터셋을 공개했다.
Saahil Jain은 현대 모델의 장기 과제 처리 능력 향상으로 2024식 복잡한 에이전트 오케스트레이션이 더 이상 최선이 아니며 정보 검색과 고유 데이터, 종단 간 평가가 2026년 경쟁력이 될 것이라고 말했다.
모델의 직접적인 행동 실행을 막기 위해 모든 도구 호출을 정책으로 검사하고 드라이런 강제를 지원하는 프록시 'toolwarden'이 데모와 CI 평가(탐지율 90.9%)와 함께 공개되었다.
MCR은 하나의 마르코프 원시 연산을 여러 수준(byte·word·token·action)에 적용하고 지문과 Jaccard로 수준을 연결해 몇 가지 간단한 문제에서 유의미한 성능 향상과 표준 라이브러리 기반 재현성을 확보한 프레임워크이다.
AGE는 학습 가능한 노드 샘플러로 핵심 노드를 제외한 보조 노드만 마스킹해 JEPA 기반 자기지도학습으로 그래프 임베딩을 LLM 입력 공간에 정렬해 GraphQA 벤치마크에서 최대 26.72포인트 개선을 달성했다.
GACR은 관측 이미지에 생성 궤적을 고정하는 OAR-Flow와 VFM 기반의 GCPA를 결합하여 구름 제거 결과의 픽셀 품질과 하위 과제 해석 신뢰도를 동시에 개선한 프레임워크이다.
MultAttnAttrib는 모델의 프리필 어텐션에서 소수의 교차모달 검색 헤드를 선택해 추가 학습 없이 텍스트와 이미지 근거를 단일 전방 전달로 지역화해 기준 프롬프팅보다 F1과 추론 지연에서 우수했다.
문헌으로 동일한 관련연구를 제시했을 때 LLM이 생성한 아이디어는 인간 논문 아이디어보다 기회와 방법 분포가 좁고 합성(bridge/synthesis) 편향이 뚜렷하게 관찰되었다.
AI-Infra-Guard는 인프라 규칙 매칭, LLM 기반 MCP 감사, 행태형 블랙박스 레드팀, 대규모 jailbreak 평가를 계층별로 결합해 AI 에이전트 전 영역 보안 리스크를 체계적으로 탐지한다.
160개 공개 소스를 통합한 6T 멀티모달 토큰 풀에서 필터링 효과는 제한적이며 지시문 중심 혼합이 모델 규모에 따라 더 큰 성능 개선을 가져왔다.
Voxel51이 공개한 위성 이미지 임베딩은 학습 연산을 3배 줄이고 추론 연산을 2.9배 감소시키면서 13개 벤치마크에서 정확도 손실이 없었다.
Hugging Face의 모델 페이지에서 선택한 모델을 SageMaker Studio로 직접 연결해 모델이 미리 로드된 상태로 맞춤화와 배포를 즉시 시작할 수 있다
Thariq는 Fable 5와 유사한 최신 모델을 다룰 때 기존의 프롬프트·제약을 제거하고 블라인드스팟 점검·구현 노트 기록 등 구체적 절차로 숨겨진 행동을 발견하라고 권고했다.
글은 RAG를 단일 벡터 검색으로 축소하는 해석이 부정확하며 검색을 반복하는 루프와 인덱스 캐싱이 실무에서 핵심 역할을 한다고 지적한다.
Robbyant이 Hugging Face에 LingBot-Vision 4개 백본을 Apache-2로 공개했으며 NYUv2 RMSE 0.296을 보고하고 ImageNet linear probe 86.32를 자체 보고했다.
LangChain Deep Agents를 감싼 파이썬 라이브러리로 여러 DB 방언을 지원하며 코드 기반 가드레일, 결과 물리화, 다중 DB 오케스트레이션을 제공한다.
지속 메모리와 의미검색으로 과거 인시던트를 찾아 구조화된 진단을 생성하고 LLM 라우팅으로 성능과 비용을 조정하는 프로젝트를 공개했다.
Claude Code PM Cat Wu의 인터뷰를 통해 AI 네이티브 제품의 설계 철학, 엔지니어링 변화, 그리고 사용자 경험의 핵심을 분석한다.
ChatGPT 엑셀 추가 기능을 활용해 데이터 생성, 수식 작성, 오류 수정 및 자동화 작업을 수행하는 실무 가이드.
Salesforce는 Agentforce에서 Agent Graph, Agent Script, 하이브리드 서브에이전트 및 라우팅 모델을 결합해 LLM의 유연성과 워크플로 신뢰성을 함께 만족시키려 했다.
여러 에이전트에서 관찰되는 파일 캐시 불일치 문제를 '파일 스탬프' 기반 MCP 서버로 감지하고 에이전트가 쓰기 전에 최신 내용을 재읽게 하여 충돌을 줄인 사례이다.
연구자가 Claude Code에서 타임존·프록시·중국 연구실 연관 가능성을 표식으로 전송하는 'prompt steganography' 추적 코드를 공개하자 Anthropic은 해당 코드를 제거하고 계정 남용·지식 증류 방지 실험이었다고 밝혔다.
수천만 토큰 규모의 장기 프로젝트 수행 능력을 평가하고 보상 해킹을 방지하도록 설계된 코딩 에이전트 벤치마크 SWE-Marathon을 소개한다.
Automattic이 한 달간 로드맵을 중단하고 AI를 활용해 제품 출시 속도를 극대화하며 발견한 새로운 디자이너-엔지니어 협업 모델을 공유합니다.
AI로 인해 소프트웨어 변경 비용이 낮아짐에 따라, 런타임에 사용자별 맞춤형 코드를 생성하고 관리하기 위한 새로운 인프라 아키텍처와 디버깅 전략을 제시한다.
Anthropic의 Fable 모델을 활용해 스크립트 작성, 팩트 체크, B-roll 생성 및 성과 분석을 자동화하는 소셜 미디어 영상 제작 시스템 구축 사례를 공유한다.
Anthropic의 Thariq Shihipar가 Claude Code와 신규 모델 Fable을 통해 AI 에이전트의 성능 한계를 극복하고 개발 생산성을 극대화하는 전략을 소개합니다.
Meta AI 연구진이 비침습적 EEG 데이터를 활용해 뇌 활동을 텍스트로 실시간 디코딩하는 Brain2Qwerty 프레임워크를 발표했다.
Intel Xeon CPU에서 Pocket TTS를 포함한 여섯 TTS 모델의 실시간 계수와 UTMOS 기반 품질 점수를 비교한 정량적 벤치마크와 아키텍처별 관찰을 제시한다.
Meituan의 LongCat 2.0을 시험해보니 Owl Alpha와 동일 모델로 보이며 캐시 히트가 무료여서 청구 토큰이 실제 사용보다 크게 줄어드는 경험을 보고했다.
AI 노출 산업에서 1인 기업 창업과 수익이 가속화되고 있으며, 팔란티어는 정부용 AI로서 오픈 웨이트 모델의 필요성을 강조했다.
Roboflow에서 RF-DETR 모델과 Gemini 2.5 Pro를 결합해 베어링 표면 결함을 감지하고 예측 유지보수 워크플로로 전환하는 튜토리얼이다.
Echo 에이전트가 파일 페이지네이션, 프로젝트 링크, 세션 메모리, 도구 라우팅 등 로컬에서 작동하는 툴 접근성과 대규모 파일 처리 기능을 강화했다.
TRACE는 대화 기록을 토픽 트리로 조직하여 MemoryAgentBench EventQA에서 gpt-oss 기반으로 최대 F1 83.8%를 달성했다.
고정된 top-k 리트리벌 대신 터미널 도구로 코퍼스를 직접 탐색하여 에이전틱 검색의 성능과 효율을 극대화하는 DCI 프레임워크를 제안한다.
다변량 시계열 이상 탐지를 단순 분류가 아닌 다각적 증거 집계 기반의 진단 과정으로 재정의한 PGRF-Net을 제안한다.
타겟 도메인의 후기 열화 데이터가 없는 상황에서 증거적 학습과 단계별 정렬을 통해 잔여 수명을 정확히 예측하는 EviAdapt 모델을 제안한다.
테스트 샘플별 맞춤형 공분산 보정과 잔차 공간 최적화를 통해 OOD 탐지의 정확도와 안정성을 동시에 개선한 연구이다.
DeCoFlow는 노멀라이징 플로우를 동결 베이스와 LoRA 어댑터로 분해하여 연속 이상 탐지에서 망각 없는 SOTA 성능을 구현한다.
사전 학습된 모델의 특성을 활용해 별도의 학습 과정 없이도 고성능 이상치 탐지가 가능함을 입증한 연구이다.
기존 시계열 이상 탐지 연구의 데이터셋 결함과 지표 편향 문제를 해결하기 위해 1,070개의 정제된 데이터와 신뢰도 높은 지표를 도입한 TSB-AD 벤치마크 연구.
진화적으로 보존된 서열 정보를 대조 학습과 Mamba 아키텍처로 학습하여 RNA 기능을 정밀하게 예측하는 파운데이션 모델 Orthrus를 소개합니다.
LLM 내부에서 유해성 인지(Harmfulness)와 거절 반응(Refusal)이 서로 다른 차원에 인코딩되어 있음을 증명하고 이를 제어하는 방법을 제시한 연구이다.
LLM 에이전트가 수일 이상의 장기 대화 맥락을 얼마나 잘 기억하고 활용하는지 평가하기 위한 새로운 벤치마크 LoCo와 분석 결과를 제시한다.
의료 현장의 복잡한 의사결정과 EHR 조작 능력을 평가하기 위한 AgentClinic 및 MedAgentBench 벤치마크 프레임워크를 분석한다.
복잡한 시각 추론에서 텍스트 CoT의 한계를 입증하고 시각적 중간 단계(Visual CoT)의 필요성을 제시하는 MIRA 벤치마크 연구를 소개한다.
LLM의 내부 활성화 값을 분석하여 모델이 특정 엔티티에 대한 지식을 실제로 보유하고 있는지 판별하고, 이를 통해 할루시네이션 발생 가능성을 예측하는 연구를 소개합니다.
CLIP의 어텐션 헤드를 타겟 도메인에 맞춰 선택적으로 적응시킴으로써 제로샷 이상치 탐지의 정확도를 높이는 DAAH 방법론을 제안한다.
사용자의 데이터를 사람이 읽을 수 없는 형태로 변환하여 LLM API에 전송함으로써 개인정보를 보호하는 AlienLM 프레임워크를 소개한다.
Nexus는 텍스트 맥락 추론과 수치 패턴 분석을 결합한 3단계 멀티 에이전트 프레임워크로 시계열 예측의 정확도와 해석력을 높인다.
UniSpector는 스펙트럼 분석과 대조 학습 기반의 시각적 프롬프팅을 활용하여 학습하지 않은 결함까지 식별하는 범용 오픈셋 결함 인식 프레임워크이다.
웹과 운영체제 환경에서 자율형 AI 에이전트의 성능을 정밀하게 측정하기 위한 WEBArena와 OSWorld 벤치마크의 설계 원리와 실험 결과를 분석한다.
Genspark는 AI 에이전트가 실시간으로 정보를 수집하고 맞춤형 Sparkpage를 생성하여 검색의 효율성을 극대화하는 플랫폼이다.
R-CNN부터 YOLOv10까지 객체 탐지 모델의 발전 과정을 살펴보고, 특히 NMS 문제를 해결한 RT-DETR과 YOLOv10의 혁신을 분석합니다.
Amazon Nova의 CCMS는 LoRA 어댑터와 rDPO 언러닝을 이용해 특정 검열 정책에 대한 과도한 거부를 줄이면서 모델의 일반적 성능과 다른 정책의 정렬을 유지한다.
Manana는 50명 수준의 지역 환자 데이터로 LLM 프롬프트 메모리 궤적을 학습해 현지 처방 규칙을 복원하고 BPA로 가장 자신 있는 절반의 사례에서 95% 정밀도를 달성했다.
VLA-Corrector는 잠재공간 기반 모니터가 예측-실제 시각 변화 불일치를 검출하면 행동 청크를 중단하고 Online Gradient Guidance로 재계획을 보정해 장기 실행 효율을 유지하면서 강건성을 크게 향상시킨다.