본문으로 건너뛰기

2026년 7월 7일 AI 뉴스

100

관심 태그 추가

13토큰으로 규칙을 저장하고 0.79–1.00 정확도를 보인 8슬롯 fast-weight 메모리

하이퍼네트워크로 슬롯을 저순위 MLP 가중치로 확장해 순전파만으로 읽기·쓰기가 가능한 8슬롯 fast-weight 메모리 뱅크가 소형 Transformer에서 단회 제시로 미지 쿼리 대응을 달성했다.

Context Rot 차단 KU-Gateway, 토큰 소모 50% 감소

KU-Gateway는 컨텍스트 청크에 시간적 감쇠 점수를 부여하고 오래된 페이로드를 제거하는 프록시로서 EAP에서 토큰 소모를 약 50% 줄이고 오래된 정보로 인한 환각을 차단했다고 보고되었다.

Chimera v0.4.0의 A/B 기반 벤치마크 인프라 공개

Chimera v0.4.0은 A/B 엔진과 Verified-Mini 어댑터로 재현 가능한 벤치마크 측정 인프라를 제공하지만 아직 공개된 성능 수치는 없다.

r/LLMDevs1달 전

Go‑Live 이후 91% 모델 성능 저하와 책임 공백

Go‑Live 후 모델 성능이 서서히 저하되는 현실과 조직 내에서 그 변화를 지속적으로 감시하고 책임지는 주체가 부재하다는 문제를 91% 통계와 함께 제기했다.

ADLC 기반의 에이전트 지속 운영과 책임체계 도입 가이드

ADLC는 에이전트가 조용히 성능이 저하되는 문제를 해결하기 위해 기획·구축·검증·관찰·개선 단계를 순환시키고 각 단계에 명확한 소유권을 부여하는 프레임워크이다.

Matt Wolfe1달 전

클립 편집은 끝났다, 대화로 5분짜리 영화를 만드는 바이브 디렉팅

OpenArt AI Director는 대화만으로 캐릭터와 스토리 일관성을 유지하며 최대 5분 분량의 영상을 생성하는 바이브 디렉팅을 지원한다.

Open Knowledge Format 기반 마크다운·YAML 지식교환 규격

Google이 제안한 Open Knowledge Format은 마크다운과 경량 YAML, 개념 간 링크로 에이전트 지식을 규격화하여 임베딩과 벡터DB 의존을 줄이는 대안을 제시한다.

데이터와 컨텍스트 엔지니어링 중심의 AI 아키텍처 핵심과 60% 위험

AI 시스템의 안정적 운영을 위해서는 데이터 품질과 컨텍스트 엔지니어링을 중심으로 한 확장 가능한 아키텍처가 필요하다.

몇 분 내로 RAG 파이프라인을 완성하는 개발자 친화형 툴킷

Larkup-RAG는 문서 로드부터 자동 청크화·임베딩·벡터 인덱싱·RAG 서버 배포까지 파이프라인을 자동화해 빠르게 RAG API를 구축하는 오픈소스 프로젝트다.

ClearGrasp D415에서 투명체 깊이 복원 성능 비교와 검증의 문제

투명한 표면 때문에 실측 깊이에 구멍이 생기는 문제를 여러 최신 완성 방법으로 비교하고 LingBot-Depth 2.0의 벤더 보고 결과와 검증 한계를 논의한다.

3.42MB 힙으로 CPU에서 120–180FPS를 내는 엣지 비전 엔진

Nim과 Intel OpenVINO 기반 베어메탈 런타임이 i5-11400 CPU에서 YOLOX-nano로 120–180 FPS와 3.42 MB 고정 힙 사용을 보고했다.

r/artificial1달 전

$110B 규모에 도달한 GenAI의 세 배 빠른 성장 속도

GenAI는 인터넷·모바일·클라우드보다 약 세 배 빠른 속도로 확장해 연간 약 $110B의 수익을 창출하고 있으며 이로 인해 검색·평가·데이터 파이프라인·배포 인프라 등의 스택이 모델만큼 중요해졌다.

J-space 실시간 읽기와 Subtext 데모로 드러난 내부 silent words

Anthropic의 J-space 관찰을 jacobian lens로 읽어 Subtext가 Qwen3.5-4B를 12GB GPU에서 bf16로 실행하며 9개 레이어에서 실시간 내부 신호를 스트리밍했다.

Mistral 35억 달러 투자와 삼성 18배 수익으로 보는 AI 하드웨어의 힘

Mistral의 35억 달러 투자 유치와 삼성전자의 AI 메모리 수요로 인한 18배 수익 급증을 통해 AI 산업의 성장 동력과 인프라의 중요성을 분석한다.

부호 기반 IMG Sign 검증과 SW Block을 적용한 얼굴 임베딩 성능 비교, LFW 96.27% 달성

부호(sign) 패턴만을 비교하는 IMG Sign 접근은 LFW 96.27%와 복합 평가 81.02%를 기록하며 기존 코사인 기반보다 우수함을 보였고, ArcFace 임베딩에도 재학습 없이 높은 전이 성능을 나타냈다.

MarkItDown 기반 문서 전처리로 20페이지당 70,000+ 토큰 비용 절감 사례

PDF·Word·Excel의 레이아웃 메타데이터가 페이지당 약 3,000토큰을 유발해 20페이지 기준 70,000+ 토큰을 낭비했고 MarkItDown으로 메타데이터를 제거해 Markdown 출력과 MCP 연동으로 컨텍스트 효율을 개선했다.

HF Daily Papers1달 전· 1달 전 발행

희소 설명을 그래프로 확장해 이미지 의미적 풍부함을 높이는 GCE 방법

GCE는 희소한 장면 설명을 장면 그래프로 변환해 추가 객체와 관계를 예측·검증한 뒤 이를 기반으로 이미지 합성을 수행해 생성물의 의미적 풍부함과 구조적 일관성을 개선했다.

HF Daily Papers1달 전· 1달 전 발행

소스 블러를 광학 지문으로 활용해 초점·조리개를 임의로 조정하는 AnyBokeh 파이프라인

AnyBokeh는 입력 이미지의 서명된 CoC와 시차를 추정하여 소스별 CoC–시차 기울기(광학 지문)를 계산하고 이를 목표 초점·조리개로 전이한 뒤 이중 CoC 조건화된 생성 편집기로 상대적 블러 합성을 수행한다.

SLM의 에이전트 통합 방식과 의사결정에 필요한 핵심 지표

이 글은 SLM이 차세대 에이전트 내부에서 나타나는 다섯 가지 구체적 방식과 이를 뒷받침하는 연구·도구·수치를 정리했다.

10% 필터링 실험으로 드러난 SFT 행동 통제 실패 사례

여러 TDA 방법으로 SFT 학습문서를 10% 제거해도 대부분의 바람직하지 않은 행동은 거의 변화하지 않았고, 거부(refusal) 행동만 필터링으로 어느 정도 제어됐다.

Fable 5의 글로벌 재개와 규제 해제 동향

Anthropic의 Fable 5는 보안 취약점으로 인한 미국의 배포 제한이 해제되어 7월 1일 글로벌 재배포되었으며 같은 호 기간에 정부의 다른 모델 접근 규제가 병행 보고되었다.

Lean Expr 기반 IR 추출로 정리증명 토큰화 재검토

Maith는 Lean의 elaborated Expr 트리에서 정규화된 IR을 생성해 소스 대신 토큰화하는 접근을 구현하고 초기 추출 통계(1129개 선언 중 70% 성공)를 보고한다.

"함수 호출 그 이상" Pi 코딩 에이전트로 배우는 진짜 Tool의 구조

AI 에이전트가 외부 세계와 상호작용하는 핵심 수단인 '도구'의 모델 인터페이스와 실행기 구조를 Pi 코딩 에이전트 사례로 분석합니다.

식어가는 찻잔부터 LLM의 창의성까지 관통하는 엔트로피의 원리

물리적 무질서에서 정보 이론을 거쳐 LLM의 손실 함수와 온도 조절까지 이어지는 엔트로피의 핵심 개념과 AI에서의 응용 사례를 다룹니다.

Apple Silicon에서 작동하는 음성 프롬프트 입력기

Mac에서 키를 누르고 말하면 Whisper와 Parakeet을 Neural Engine에서 실행해 로컬로 음성을 텍스트화하고 로컬 AI로 프롬프트를 다듬는 도구이다.

Godot 에디터에서 홀을 자동 제작하는 에이전트 워크플로우 데모

godotiq를 통해 에디터 내부에서 장면을 배치하고 검증하는 에이전트가 Kenney 자산으로 구성된 9홀 미니골프를 자동 생성했다.

AMD Instinct용 PyTorch Monarch의 ROCm 포팅과 탄력적 장애복구

PyTorch는 Monarch 런타임을 ROCm으로 포팅해 AMD Instinct GPU에서 노드 장애 시에도 중단 없이 동적으로 복구하는 탄력적 분산 학습을 실현했다.

텍스트 없이도 완벽한 이상 탐지, MoE 기반 AnomalyMoE의 혁신

MoE 아키텍처를 활용해 언어 정보 없이도 다양한 도메인의 시각적 이상을 통합적으로 탐지하는 AnomalyMoE 모델을 제안한다.

단순 검색을 넘어 인과 관계로: RAG의 추론 한계를 깨는 HugRAG

계층적 인과 관계와 노이즈 제거를 결합한 HugRAG 프레임워크를 통해 지식 그래프 기반 RAG의 추론 성능을 개선한 연구이다.

자동 생성 리서치 노트와 4단계 검증 허브

공개 모델을 통해 리서치 노트를 자동 생성하면서 모든 숫자에 기계 해상 가능한 인용을 연결하고 결정론적 검사와 모델 감사로 오류를 차단하는 파이프라인이다.

AI 에이전트 기능 확장, MCP와 Skills 중 무엇을 선택해야 할까?

AI 에이전트의 기능을 확장할 때 Model Context Protocol과 Skills 중 적합한 방식을 선택하는 기준과 컨텍스트 엔지니어링의 중요성을 다룬다.

Resume Pipeline로 세션을 재개하는 Limboo 데스크톱 워크스페이스

Limboo는 AI 코딩 에이전트를 워크스페이스의 한 구성요소로 통합하고 세션별 이력과 로컬 저장소 델타를 주입해 작업을 재개하도록 설계된 오픈소스 데스크톱 애플리케이션이다.

은닉 상태에서 AUROC 0.83–0.88로 신뢰도 추출된 라우팅 해법 연동 사례

중간층 선형 프로브와 소수의 추가 가중치를 통해 모델의 은닉 신호를 언어화하여 보정된 신뢰도(0.765+)를 얻었고 AUROC 0.83–0.88의 재현성을 보고했다.

프록시가 주입한 도구 호출로 .env 유출과 무단 명령 실행이 가능한 사례 공개

변조 가능한 LLM 프록시는 에이전트의 정상 응답 흐름에 도구 호출을 주입해 작업 디렉토리 파일 유출과 무단 명령 실행을 야기하며, 방어는 런타임 격리와 최소 권한 정책에 의존해야 한다.

16개 LLM 무료티어를 합친 OpenAI 호환 프록시 /v1 엔드포인트

16개 LLM 제공자의 무료 티어를 묶어 하나의 OpenAI 호환 /v1 엔드포인트로 제공하는 오픈소스 프록시 프로젝트이다.

LangGraph 에이전트를 지속 실행하는 프로액티브 SDK

이 프로젝트는 LangGraph 에이전트를 래핑해 지속 목표 관리, 리플렉션 기반 스케줄링, 멱등성·감사 거버넌스를 제공하는 TypeScript SDK이다.

5B 파라미터 게임 에이전트 MIRA와 1k 시간 데이터 공개

MIRA는 10k 시간 합성 Rocket League 플레이로 학습된 5B 파라미터 게임 에이전트로, 단일 B200에서 4인 동시 플레이를 초당 20프레임으로 실행하며 데모·기술보고서·1k 시간 데이터셋을 공개했다.

GLM-5.2를 25GB 머신에서 구동한 순수 C 엔진 colibrì 공개

작성자는 GLM-5.2 모델을 25GB RAM의 개인 머신에서 순수 C 기반 엔진으로 구동하며 전문가 파라미터를 디스크에서 스트리밍하는 방식으로 동작하는 colibrì를 만들었다.

토큰 비용 70% 낭비 발견 후 경량 라우팅으로 청구서 반감

파이프라인 감사에서 토큰 사용의 70%가 JSON 포맷과 컨텍스트 부풀기 때문임이 확인되어 경량 워치독 미들웨어로 반복 작업을 저가 모델로 라우팅해 청구서를 절반으로 줄였다.

장기 과제 역량에 기반한 에이전트 설계 재검토와 정보 검색 우위

Saahil Jain은 현대 모델의 장기 과제 처리 능력 향상으로 2024식 복잡한 에이전트 오케스트레이션이 더 이상 최선이 아니며 정보 검색과 고유 데이터, 종단 간 평가가 2026년 경쟁력이 될 것이라고 말했다.

r/LLMDevs1달 전· 1달 전 발행

YAML 정책 기반 LLM 툴 프록시, 90.9% 탐지율

모델의 직접적인 행동 실행을 막기 위해 모든 도구 호출을 정책으로 검사하고 드라이런 강제를 지원하는 프록시 'toolwarden'이 데모와 CI 평가(탐지율 90.9%)와 함께 공개되었다.

r/MachineLearning1달 전· 1달 전 발행

한 방정식으로 N수준 계산을 구현한 경량 Python 프레임워크

MCR은 하나의 마르코프 원시 연산을 여러 수준(byte·word·token·action)에 적용하고 지문과 Jaccard로 수준을 연결해 몇 가지 간단한 문제에서 유의미한 성능 향상과 표준 라이브러리 기반 재현성을 확보한 프레임워크이다.

HF Daily Papers1달 전· 1달 전 발행

AGE 적응형 마스킹으로 GraphRAG 임베딩 정렬 및 성능 향상

AGE는 학습 가능한 노드 샘플러로 핵심 노드를 제외한 보조 노드만 마스킹해 JEPA 기반 자기지도학습으로 그래프 임베딩을 LLM 입력 공간에 정렬해 GraphQA 벤치마크에서 최대 26.72포인트 개선을 달성했다.

HF Daily Papers1달 전· 1달 전 발행

관측 기반 OAR-Flow와 VFM 정렬로 PSNR 최대 3.3dB·하위 과제 mIoU 개선을 동시에 달성

GACR은 관측 이미지에 생성 궤적을 고정하는 OAR-Flow와 VFM 기반의 GCPA를 결합하여 구름 제거 결과의 픽셀 품질과 하위 과제 해석 신뢰도를 동시에 개선한 프레임워크이다.

HF Daily Papers1달 전· 1달 전 발행

프리필 어텐션으로 단일-패스 멀티모달 근거 귀속, 추론 지연 14% 수준

MultAttnAttrib는 모델의 프리필 어텐션에서 소수의 교차모달 검색 헤드를 선택해 추가 학습 없이 텍스트와 이미지 근거를 단일 전방 전달로 지역화해 기준 프롬프팅보다 F1과 추론 지연에서 우수했다.

HF Daily Papers1달 전· 1달 전 발행

LLM과 인간 연구 아이디어의 분포적 격차 분석

문헌으로 동일한 관련연구를 제시했을 때 LLM이 생성한 아이디어는 인간 논문 아이디어보다 기회와 방법 분포가 좁고 합성(bridge/synthesis) 편향이 뚜렷하게 관찰되었다.

HF Daily Papers1달 전· 1달 전 발행

AI-Infra-Guard로 4계층 보안 평가와 1,400+ 취약 규칙 통합

AI-Infra-Guard는 인프라 규칙 매칭, LLM 기반 MCP 감사, 행태형 블랙박스 레드팀, 대규모 jailbreak 평가를 계층별로 결합해 AI 에이전트 전 영역 보안 리스크를 체계적으로 탐지한다.

HF Daily Papers1달 전· 1달 전 발행

6T 토큰 풀에서 혼합 비율 조정으로 8B 모델의 Core 성능을 63.6%까지 끌어올린 공개 데이터 레시피

160개 공개 소스를 통합한 6T 멀티모달 토큰 풀에서 필터링 효과는 제한적이며 지시문 중심 혼합이 모델 규모에 따라 더 큰 성능 개선을 가져왔다.

학습 3× 저감과 13개 벤치 정확도 유지가 드러난 공개 위성 임베딩

Voxel51이 공개한 위성 이미지 임베딩은 학습 연산을 3배 줄이고 추론 연산을 2.9배 감소시키면서 13개 벤치마크에서 정확도 손실이 없었다.

Hugging Face 모델을 한 번의 클릭으로 SageMaker Studio 맞춤·배포 환경으로 연결

Hugging Face의 모델 페이지에서 선택한 모델을 SageMaker Studio로 직접 연결해 모델이 미리 로드된 상태로 맞춤화와 배포를 즉시 시작할 수 있다

Fable 5 직전 공개된 Thariq의 실전 모델 운용 팁

Thariq는 Fable 5와 유사한 최신 모델을 다룰 때 기존의 프롬프트·제약을 제거하고 블라인드스팟 점검·구현 노트 기록 등 구체적 절차로 숨겨진 행동을 발견하라고 권고했다.

검색 반복과 인덱스 캐싱이 RAG 논쟁의 핵심

글은 RAG를 단일 벡터 검색으로 축소하는 해석이 부정확하며 검색을 반복하는 루프와 인덱스 캐싱이 실무에서 핵심 역할을 한다고 지적한다.

8개월 운영으로 드러난 GPT-4o 자동 평가의 한계

GPT-4o를 평가자로 8개월 운영한 결과 포맷·명백한 회귀는 잡았지만 모델 업데이트와 순서 편향 등으로 인간 평가를 완전히 대체하기에는 일관성이 부족했다.

Robbyant의 LingBot-Vision 4개 백본 공개와 NYUv2 RMSE 0.296 기록

Robbyant이 Hugging Face에 LingBot-Vision 4개 백본을 Apache-2로 공개했으며 NYUv2 RMSE 0.296을 보고하고 ImageNet linear probe 86.32를 자체 보고했다.

실 DB 안전 탐색을 지원하는 LangChain 래퍼 deep-db-agents

LangChain Deep Agents를 감싼 파이썬 라이브러리로 여러 DB 방언을 지원하며 코드 기반 가드레일, 결과 물리화, 다중 DB 오케스트레이션을 제공한다.

지속 메모리와 LLM 라우팅을 결합한 인시던트 대응 에이전트 공개

지속 메모리와 의미검색으로 과거 인시던트를 찾아 구조화된 진단을 생성하고 LLM 라우팅으로 성능과 비용을 조정하는 프로젝트를 공개했다.

한 줄로 에이전트 자동 실행을 구현하는 SDK proactive

proactive()는 기존 에이전트를 한 줄로 래핑해 자체 일정·상태 유지·중복 전송 방지 기능으로 자동 실행하도록 만드는 SDK이다

AI 시대, 제품은 어떻게 달라져야 하는가? Claude Code PM의 인사이트

Claude Code PM Cat Wu의 인터뷰를 통해 AI 네이티브 제품의 설계 철학, 엔지니어링 변화, 그리고 사용자 경험의 핵심을 분석한다.

엑셀 작업의 혁명, ChatGPT로 데이터 정리부터 수식까지 자동화하기

ChatGPT 엑셀 추가 기능을 활용해 데이터 생성, 수식 작성, 오류 수정 및 자동화 작업을 수행하는 실무 가이드.

Agentforce의 guided determinism으로 기업 워크플로 신뢰성 확보

Salesforce는 Agentforce에서 Agent Graph, Agent Script, 하이브리드 서브에이전트 및 라우팅 모델을 결합해 LLM의 유연성과 워크플로 신뢰성을 함께 만족시키려 했다.

스테일 월드 동기화 문제를 해결하는 pysince MCP 도구

여러 에이전트에서 관찰되는 파일 캐시 불일치 문제를 '파일 스탬프' 기반 MCP 서버로 감지하고 에이전트가 쓰기 전에 최신 내용을 재읽게 하여 충돌을 줄인 사례이다.

가입·검증·2FA까지 자동화하는 이메일 인프라 솔루션

전용 인박스와 wait_for_otp(), AES-256-GCM 기반 금고, RFC 6238 TOTP로 에이전트의 가입부터 2FA 로그인까지 사람 개입 없이 완료한다.

Claude Code 은밀 추적 코드와 prompt steganography 논란

연구자가 Claude Code에서 타임존·프록시·중국 연구실 연관 가능성을 표식으로 전송하는 'prompt steganography' 추적 코드를 공개하자 Anthropic은 해당 코드를 제거하고 계정 남용·지식 증류 방지 실험이었다고 밝혔다.

BERT vs GPT, 인코더와 디코더의 결정적 차이 한눈에 보기

BERT는 양방향 문맥 이해에 특화된 인코더 모델이고, GPT는 순차적 텍스트 생성에 최적화된 디코더 모델이다.

수억 개의 토큰을 사용하는 코딩 에이전트의 실력을 검증하는 SWE-Marathon

수천만 토큰 규모의 장기 프로젝트 수행 능력을 평가하고 보상 해킹을 방지하도록 설계된 코딩 에이전트 벤치마크 SWE-Marathon을 소개한다.

로드맵을 멈추고 30일간 제품 3개를 출시한 Automattic의 실험

Automattic이 한 달간 로드맵을 중단하고 AI를 활용해 제품 출시 속도를 극대화하며 발견한 새로운 디자이너-엔지니어 협업 모델을 공유합니다.

사용자마다 코드가 다르다? 배포의 개념을 뒤바꾸는 '적응형 소프트웨어' 인프라 설계

AI로 인해 소프트웨어 변경 비용이 낮아짐에 따라, 런타임에 사용자별 맞춤형 코드를 생성하고 관리하기 위한 새로운 인프라 아키텍처와 디버깅 전략을 제시한다.

반나절 만에 완성한 AI 영상 공장! Anthropic 모델로 스크립트부터 분석까지

Anthropic의 Fable 모델을 활용해 스크립트 작성, 팩트 체크, B-roll 생성 및 성과 분석을 자동화하는 소셜 미디어 영상 제작 시스템 구축 사례를 공유한다.

시스템 프롬프트 80% 제거의 반전, Anthropic Fable이 증명한 에이전트의 힘

Anthropic의 Thariq Shihipar가 Claude Code와 신규 모델 Fable을 통해 AI 에이전트의 성능 한계를 극복하고 개발 생산성을 극대화하는 전략을 소개합니다.

생각만으로 타이핑을? Meta가 공개한 비침습적 뇌 신호 디코딩 기술 Brain2Qwerty

Meta AI 연구진이 비침습적 EEG 데이터를 활용해 뇌 활동을 텍스트로 실시간 디코딩하는 Brain2Qwerty 프레임워크를 발표했다.

Intel Xeon CPU에서 6종 TTS 모델의 RTF·UTMOS 비교 벤치마크

Intel Xeon CPU에서 Pocket TTS를 포함한 여섯 TTS 모델의 실시간 계수와 UTMOS 기반 품질 점수를 비교한 정량적 벤치마크와 아키텍처별 관찰을 제시한다.

TensorSharp GGML Vulkan 초기 공개와 Gemma4 벤치 결과

TensorSharp가 GGML 기반 Vulkan 백엔드 초판을 공개하고 Gemma4 계열 모델에서 llama.cpp와의 시나리오별 토크나이저 처리량·지연 비교 결과를 제시했다.

LongCat 2.0 실사용기와 캐시 기반 비용 절감

Meituan의 LongCat 2.0을 시험해보니 Owl Alpha와 동일 모델로 보이며 캐시 히트가 무료여서 청구 토큰이 실제 사용보다 크게 줄어드는 경험을 보고했다.

AI로 무장한 1인 기업의 매출 급증과 팔란티어의 오픈 웨이트 지지

AI 노출 산업에서 1인 기업 창업과 수익이 가속화되고 있으며, 팔란티어는 정부용 AI로서 오픈 웨이트 모델의 필요성을 강조했다.

RF-DETR과 Gemini 2.5 Pro로 구현하는 베어링 예측 점검 워크플로

Roboflow에서 RF-DETR 모델과 Gemini 2.5 Pro를 결합해 베어링 표면 결함을 감지하고 예측 유지보수 워크플로로 전환하는 튜토리얼이다.

Echo의 로컬 에이전트 툴링 전면 개편

Echo 에이전트가 파일 페이지네이션, 프로젝트 링크, 세션 메모리, 도구 라우팅 등 로컬에서 작동하는 툴 접근성과 대규모 파일 처리 기능을 강화했다.

이상 탐지를 넘어 진단으로, PGRF-Net이 시계열 데이터를 해석하는 방법

다변량 시계열 이상 탐지를 단순 분류가 아닌 다각적 증거 집계 기반의 진단 과정으로 재정의한 PGRF-Net을 제안한다.

데이터가 부족한 기계의 수명 예측, EviAdapt로 불확실성까지 잡다

타겟 도메인의 후기 열화 데이터가 없는 상황에서 증거적 학습과 단계별 정렬을 통해 잔여 수명을 정확히 예측하는 EviAdapt 모델을 제안한다.

망각률 0% 달성! 연속 이상 탐지를 위한 DeCoFlow의 구조적 혁신

DeCoFlow는 노멀라이징 플로우를 동결 베이스와 LoRA 어댑터로 분해하여 연속 이상 탐지에서 망각 없는 SOTA 성능을 구현한다.

학습 없이 이상치를 잡는다? ICML 2026 발표 논문 핵심 요약

사전 학습된 모델의 특성을 활용해 별도의 학습 과정 없이도 고성능 이상치 탐지가 가능함을 입증한 연구이다.

시계열 이상 탐지의 가짜 성능 향상? TSB-AD가 제시하는 새로운 기준

기존 시계열 이상 탐지 연구의 데이터셋 결함과 지표 편향 문제를 해결하기 위해 1,070개의 정제된 데이터와 신뢰도 높은 지표를 도입한 TSB-AD 벤치마크 연구.

700배 적은 파라미터로 SOTA 달성, RNA 예측의 혁신 Orthrus

진화적으로 보존된 서열 정보를 대조 학습과 Mamba 아키텍처로 학습하여 RNA 기능을 정밀하게 예측하는 파운데이션 모델 Orthrus를 소개합니다.

서울대학교 DSBA 연구실1달 전· 1달 전 발행

나쁜 걸 아는 것과 거절하는 것은 다르다: LLM 내부의 유해성-거절 분리 메커니즘

LLM 내부에서 유해성 인지(Harmfulness)와 거절 반응(Refusal)이 서로 다른 차원에 인코딩되어 있음을 증명하고 이를 제어하는 방법을 제시한 연구이다.

서울대학교 DSBA 연구실1달 전· 1달 전 발행

며칠 전 대화도 기억할까? LLM 에이전트의 초장기 기억력 측정법

LLM 에이전트가 수일 이상의 장기 대화 맥락을 얼마나 잘 기억하고 활용하는지 평가하기 위한 새로운 벤치마크 LoCo와 분석 결과를 제시한다.

실제 병원 환경을 시뮬레이션하는 의료 AI 에이전트 평가의 새로운 기준

의료 현장의 복잡한 의사결정과 EHR 조작 능력을 평가하기 위한 AgentClinic 및 MedAgentBench 벤치마크 프레임워크를 분석한다.

텍스트 CoT의 한계? 시각적 중간 과정이 필수인 MIRA 벤치마크 분석

복잡한 시각 추론에서 텍스트 CoT의 한계를 입증하고 시각적 중간 단계(Visual CoT)의 필요성을 제시하는 MIRA 벤치마크 연구를 소개한다.

LLM이 거짓말하는 순간을 내부 신호로 포착하는 ICLR 2025 최신 연구

LLM의 내부 활성화 값을 분석하여 모델이 특정 엔티티에 대한 지식을 실제로 보유하고 있는지 판별하고, 이를 통해 할루시네이션 발생 가능성을 예측하는 연구를 소개합니다.

서울대학교 DSBA 연구실1달 전· 1달 전 발행

CLIP 어텐션 헤드 최적화로 완성하는 제로샷 이상치 탐지의 새로운 기준

CLIP의 어텐션 헤드를 타겟 도메인에 맞춰 선택적으로 적응시킴으로써 제로샷 이상치 탐지의 정확도를 높이는 DAAH 방법론을 제안한다.

내 데이터를 외계어로? LLM API 프라이버시를 지키는 AlienLM 기술

사용자의 데이터를 사람이 읽을 수 없는 형태로 변환하여 LLM API에 전송함으로써 개인정보를 보호하는 AlienLM 프레임워크를 소개한다.

서울대학교 DSBA 연구실1달 전· 1달 전 발행

수치와 텍스트를 동시에 잡는 시계열 예측 에이전트 Nexus

Nexus는 텍스트 맥락 추론과 수치 패턴 분석을 결합한 3단계 멀티 에이전트 프레임워크로 시계열 예측의 정확도와 해석력을 높인다.

미학습 결함까지 잡아내는 UniSpector, 시각적 프롬프팅의 혁신

UniSpector는 스펙트럼 분석과 대조 학습 기반의 시각적 프롬프팅을 활용하여 학습하지 않은 결함까지 식별하는 범용 오픈셋 결함 인식 프레임워크이다.

AI 에이전트의 실력을 검증하는 가장 가혹한 시험대, WEBArena와 OSWorld

웹과 운영체제 환경에서 자율형 AI 에이전트의 성능을 정밀하게 측정하기 위한 WEBArena와 OSWorld 벤치마크의 설계 원리와 실험 결과를 분석한다.

구글의 시대는 끝났나? 에이전트가 직접 페이지를 만드는 Genspark의 충격적 성능

Genspark는 AI 에이전트가 실시간으로 정보를 수집하고 맞춤형 Sparkpage를 생성하여 검색의 효율성을 극대화하는 플랫폼이다.

YOLOv10은 어떻게 NMS 없이 실시간 객체 탐지 끝판왕이 되었나

R-CNN부터 YOLOv10까지 객체 탐지 모델의 발전 과정을 살펴보고, 특히 NMS 문제를 해결한 RT-DETR과 YOLOv10의 혁신을 분석합니다.

rDPO 기반 LoRA 언러닝으로 조정한 Amazon Nova CCMS 맞춤화

Amazon Nova의 CCMS는 LoRA 어댑터와 rDPO 언러닝을 이용해 특정 검열 정책에 대한 과도한 거부를 줄이면서 모델의 일반적 성능과 다른 정책의 정렬을 유지한다.

HF Daily Papers1달 전· 1달 전 발행

50명 학습으로 현지 처방 규칙을 학습하고 95% 정밀도에서 50% 자동처리

Manana는 50명 수준의 지역 환자 데이터로 LLM 프롬프트 메모리 궤적을 학습해 현지 처방 규칙을 복원하고 BPA로 가장 자신 있는 절반의 사례에서 95% 정밀도를 달성했다.

HF Daily Papers1달 전· 1달 전 발행

잠재비전 모니터와 OGG로 액션 청크의 오픈루프 사각지대를 줄인 VLA-Corrector

VLA-Corrector는 잠재공간 기반 모니터가 예측-실제 시각 변화 불일치를 검출하면 행동 청크를 중단하고 Online Gradient Guidance로 재계획을 보정해 장기 실행 효율을 유지하면서 강건성을 크게 향상시킨다.