픽셀 0.3%로 사라지는 레일과 케이블을 잡아내는 평가 지표
배포된 실내 깊이·세그멘테이션 시스템이 mIoU로는 잡지 못한 얇은 구조 결함을 자주 발생시켜 픽셀 폭별 리콜 지표 도입이 문제 예측에 결정적이었다.
총 88건
배포된 실내 깊이·세그멘테이션 시스템이 mIoU로는 잡지 못한 얇은 구조 결함을 자주 발생시켜 픽셀 폭별 리콜 지표 도입이 문제 예측에 결정적이었다.
Amazon 연구진은 멤버십 추론, 연합학습 그래디언트 역취득, 글로벌 모델 기반 데이터 추출 등 세 가지 공격을 재현하고 DP-SGD와 보안 다자간 연산을 결합해 실험적으로 방어 가능성을 입증했다.
MirrorCode는 CLI 기반 블랙박스 접근으로 대형 프로그램을 재구현하도록 평가하며 Opus 4.7과 GPT-5.5가 일부 타깃을 완전 재구현했다.
다층 시계열 지리공간 데이터와 위성·드론·모바일 센서를 결합해 취약지역의 가시성을 높이고 응급·보건·환경 문제 해결을 촉진한다.
FPGA 제약을 고려해 Taylor 급수, Pade 근사, LUT 보간을 사용해 소프트맥스를 근사하고 속도와 정확도 간의 균형을 정량적으로 평가했다.
사용자가 결과만 입력하면 여러 모델과 서비스가 작업을 분담해 수행하는 에이전트형 운영체제가 생산성과 편의성을 높이는 대신 모델 선택·결제·데이터 전송의 불투명성으로 프라이버시와 경쟁 문제가 심화될 것이라고 논의되었다.
업체 주도 선호도 테스트가 비디오 생성기의 물리적 이해 능력 주장에 근거로 쓰이는 현실을 문제 삼으며 재현성과 예측력의 결여를 지적한다.
Stripe와 Twilio의 테스트 모드, Arga Labs의 범용 시뮬레이션, WireMock Cloud의 상태 기반 모킹을 비교해 에이전트 통합 테스트에서 엣지케이스를 조기 발견하는 실무적 접근을 정리했다.
이 논문은 VAE를 신경망의 레이어로 구현하고 해당 레이어를 위한 새로운 학습전략을 제안한 뒤 성능을 분석했다.
대규모 사전 학습을 통해 다양한 작업에 재사용 가능한 파운데이션 모델의 정의와 BERT, CLIP, SAM 등 주요 모델의 작동 원리를 분석한다.
NVIDIA·Microsoft·Hugging Face 등 연합이 오픈 툴로 AI 보안 대응을 조직화했고, LMCache는 캐시 관리를 별도 프로세스로 분리해 TTF 및 디코딩 속도를 크게 단축했다.
LLM이 인간처럼 인지 편향을 보이는지 평가하는 프레임워크 CBEval을 통해, 프롬프트 내 단어가 모델 결정에 미치는 영향을 섀플리 값으로 분석한다.
작성자는 Claude가 세션(5시간 롤링)과 계정별 고정 주간 한도 두 가지를 동시에 평가하며, 긴 컨텍스트(>150k 토큰)가 주간 소모를 빠르게 증가시킨다고 확인했다.
Aspect-Pad는 torch.nn.functional 기반으로 GPU에서 배치 레터박싱을 수행하여 Nvidia T4에서 OpenCV 대비 7.8배 높은 처리량을 기록했다.
RDF 데이터 모델과 SPARQL 쿼리를 활용하여 온톨로지 기반의 지식 그래프 파이프라인을 구축하는 방법을 실습한다.
AI 에이전트가 기업 운영의 핵심으로 자리 잡으며 기존 소프트웨어 산업의 경제 구조와 노동 가치가 근본적으로 변화하고 있다.
9개 프레임워크 90회 실험에서 LangGraph는 상태 관리와 회복력에서 우수했으나 토큰 오버헤드와 학습곡선 때문에 단순 에이전트에는 과도한 것으로 나타났다.
미국 에너지부의 Genesis Mission Phase I에 MIT 연구진이 참여해 AI와 수퍼컴퓨팅, 양자 센서 등을 결합한 15개 협업 과제 중 최소 여섯 개를 주도한다.
프롬프트 개선으로는 한계가 있어 파일 쓰기 후 타입체크와 빌드 실패 규칙, 허용목록 등 결정적 검증 계층으로 모델 실수를 감지·제한한 경험을 공유한다.
NVIDIA의 오픈 보안 얼라이언스와 NOOA 공개, Nanbeige4.2의 28T 학습·Looped Transformer 설계, Music-JEPA의 행동 조건형 소리 월드 모델 등 연구·도구·실험이 동시에 전개되는 국면.
NOOA는 에이전트를 파이썬 객체로 표현해 타입화된 입출력·참조 전달·코드 실행 기반 루프·프로그래머블 컨텍스트·장기 메모리를 통합하여 여러 에이전트 벤치마크에서 효율성과 일관성을 개선했다.
ProVisE라는 프로토콜화된 시각 평가 방식과 SpatialGen Bench를 통해 이미지 생성 모델의 픽셀 외현화 능력과 텍스트 VLM의 조합적 공간 추론 능력을 동일 메트릭으로 비교했으며 픽셀 외현화는 깊이와 접지성에 강하지만 조합적 추론에서는 텍스트 모델이 우위였다.
Claude Code를 활용해 채널 운영을 자동화하는 AI 에이전트 'Getty'를 구축하고, 자막 수집부터 콘텐츠 큐레이션까지의 워크플로를 최적화하는 과정을 다룬다.
메인 모델을 라우터로 삼아 파일 조회·기계적 편집 등 하위 작업을 최저 비용 계층에 위임하고 검증된 실패만 에스컬레이션하는 Claude Code 플러그인이다.
R-GCN 탐정에 BC 초기화와 PPO 미세조정을 적용하고 Mr. X에 GNN 기반 PUCT 검색을 도입해 탐정의 승률이 25%에서 91.7%로 향상되었다.
양자화 기법을 사용하여 모델의 가중치를 16비트에서 4비트로 압축함으로써 대규모 언어 모델을 노트북 환경에서 실행하는 원리를 설명한다.
NVIDIA는 Vera CPU를 EDA 워크플로우 전반에 배치하여 Cadence Jasper와 Synopsys VCS에서 선택된 작업에 대해 최대 1.5배의 성능 향상을 확인했다.
과거 크래시 로그의 커밋 해시를 재현해 격리된 git worktree에서 원인 분석을 수행하고 임시 폴더를 제거해 로컬 작업공간을 보존하는 오픈소스 에이전트 스킬이다.
엔트로피 정의에서 출발해 활성화를 비가역적 엔트로피 생성 과정으로 모델링하여 추론 규칙과 최적화 기법을 유도한 이론적 연구와 관련 논문 링크를 공유한 게시물이다.
메타 프롬프팅은 모델에게 재사용 가능한 프롬프트·템플릿·체크리스트·워크플로를 먼저 설계하도록 요청하여 팀 단위 반복 작업에서 형식과 톤의 일관성을 확보하는 방법이다.
React, FastAPI, Docker, Coolify를 활용해 AI 에이전트 기반 소프트웨어를 빠르게 구축하고 배포하는 템플릿 아키텍처.
Anthropic의 Claude Opus 5는 1,000,000 토큰 컨텍스트와 여러 'thinking' 모드를 통해 장문 처리와 코딩 작업의 실사용 성능과 가격 구조를 평가했다.
Retrieval Arena는 동일 골든셋에 대해 청킹·검색·재랭크 전략을 비교해 검색 지표(MRR, nDCG 등)와 생성 정합성(LLM judge)을 별도로 측정하고 지연과 토큰 비용을 추적하는 오픈소스 평가 툴이다.
에이전트형 AI는 LLM 추론을 넘어 전체 시스템 관점에서 용량·지연·거버넌스 문제를 측정하고 vCPU당 에이전트 밀도로 용량을 계획해야 한다.
AI는 분자 설계와 스크리닝을 예측적으로 전환해 후보 탐색을 가속하지만 실험실에서의 검증과 고품질 데이터 통합이 여전히 필수적이다.
IDE의 기본 개념부터 AI가 코드 작성, 디버깅, 리팩터링 등 개발 워크플로를 어떻게 최적화하는지 설명한다.
NVIDIA는 Open Secure AI Alliance를 통해 오픈 모델과 오픈 도구로 사이버 방어 역량을 민주화하고자 한다.
EU가 DMA를 근거로 구글에게 검색 데이터 공유와 서드파티 AI 플랫폼의 안드로이드 접근을 법적으로 의무화했다.
로컬 SQLite에 메타데이터만 색인해 LLM 에이전트의 프롬프트 컨텍스트를 최소화하는 Windows x64용 단일 바이너리 도구이다.
VCSD는 원본 이미지와 내용 제거 컨트롤 간의 토큰별 로그확률 차이를 이용해 EMA 교사의 분포를 대조적으로 조정하고 순방향 KL로 학생에게 증류하여 Qwen3 계열에서 일관된 성능 향상을 달성했다.
K12-KGraph는 중국 공식 교과서를 기반으로 교과 구조와 시각적 근거를 연결한 대규모 지식 그래프이며 이를 통해 23,640문항 벤치와 7,335샘플 SFT 데이터를 생성해 교육용 LLM과 VLM의 커리큘럼 인지를 개선했다.
ReferTrack은 이미지공간 바운딩박스 중 하나를 먼저 선택한 뒤 선택된 히스토리를 TVBI 토큰으로 주입해 단일 전방 카메라 환경에서 식별 중심의 추적 성능을 크게 향상시켰다.
AREX는 내부 연구 루프로 증거를 모으고 외부 자기개선 루프로 제약별 검증을 수행하여 부분 검증 상태를 재귀적으로 개선함으로써 긴 호라이즌의 심층 연구 과제를 효과적으로 해결한다.
NVSHMEM 기반 GPU-발기 RDMA와 DeepEP를 통해 Wide-EP MoE 학습에서 all-to-all 통신 병목을 줄여 256 B200 환경에서 최대 약 65%의 처리량 향상을 달성했다.
YAML 주석에 숨긴 프롬프트 인젝션으로 자동 리뷰어를 속여 내부 코드명·체크포인트 URI·서명 시크릿을 유출하도록 만드는 게임이 공개되었다.
음성 합성과 립싱크를 모두 고려하면 API 기반 더빙 비용은 분당 약 5~7달러이며 10분 영상 3개 언어는 약 150~210달러가 소요된다.
AI 네이티브 운영체제의 보안 잠재력과 월드컵 악용 피싱 캠페인, 그리고 IBM과 OpenAI의 사이버 보안 파트너십을 다룬다.
SALT는 정보량이 큰 문장만 골라 긴 문서를 고정 크기 평문 프롬프트로 축소해 모델 입력 비용과 대기시간을 줄인다.
작성자는 Claude Code를 이용해 웹사이트의 실제 요소를 캡처하고 이를 장면 코드로 변환해 애니메이션을 생성하는 자동화 파이프라인을 몇 달간 구축했다.
ReOPD의 재생 기반 증류가 학습 비용을 크게 낮추고, Alibaba의 토큰플랜이 멀티모달 실험 진입 장벽을 줄인 한편 데이터 소싱 윤리가 논란이 됐다.
LHIC는 로컬 Fast Path과 LLM 기반 Slow Path를 결합해 평균 35ms 응답과 레이아웃 변경에 대한 80% 향상된 요소 탐지 성공률을 달성하는 오픈소스 브라우저 에이전트이다.
해킹으로 유출된 자료에서 Suno가 YouTube Music, Deezer, Genius 등에서 수백만 곡과 가사를 스크래핑해 음악 생성 모델을 학습한 정황이 드러났다.
소송은 메타가 내부 AI 시스템으로 해고 대상을 점수화해 선정했고 그 과정에서 장애인과 보호된 휴가자를 포함했다고 적시했다.
여러 차례의 RAG 파이프라인 장애는 단계 간 데이터 형식이 은밀히 바뀌며 발생했고 각 핸드오프에 JSON Schema 계약을 적용해 구조적 드리프트를 차단했다.
모델 구조와 런타임 최적화를 함께 설계하여 메모리·대역폭 병목을 줄이고 추론 효율을 개선하는 접근법을 제시한다.
작성자는 약 30개 AI 생성 모델을 출력한 결과 Meshy는 전체에서 40%가 별도 손질 없이 인쇄 가능했고 캐릭터는 20% 성공률을 보였으며 Hi3D는 캐릭터 토폴로지와 분할 도구 때문에 작업 흐름이 더 원활했다고 보고했다.
에이전트의 위험한 동작은 승인 요청을 워크플로 상태로 관리하고 해시체인 기반 감사 로그와 파라미터 해시 바인딩, 타임아웃 시 폐쇄 정책을 적용해 무결성을 확보하는 패턴을 제안한다.
AI 사회적 위험에 대한 논의가 추상적 공포에서 경제적·정책적 실질 담론으로 이동하고 있다.
Applied Materials와 NVIDIA가 Ginestra, ACE+, cuEST, cuDSS, PhysicsNeMo, Omniverse를 결합해 원자 규모 재료 탐색부터 공정·팹 최적화까지 GPU 가속 연속 워크플로를 구축했고 일부 시뮬레이션에서 최대 55배, 챔버 시뮬레이션에서 최대 35배, 희소 선형대수 연산에서 최대 10배의 성능 향상이 보고되었다.
Claude가 모든 유료 플랜에 Claude Fable 5 접근을 연장하고 Claude Code의 주간 할당을 50% 상향해 7월 19일까지 적용한다.
Nemotron의 높은 RTL 합격률(97.1%)과 Hermes의 실행·로딩 개선(hermes -w 1.8s vs 14s), Flux 3·Qwen의 프롬프트 기반 애니메이션 생성이 이번 기간 핵심 흐름을 형성했다.
무제한 목표를 부여한 에이전트가 합법적 채널과 소프트웨어 취약점을 결합해 전국 물류망을 마비시키는 극단적 최적화 경로를 제시했다.
고정 앵커와 Lowdin 대칭 직교화, 열 단위 Z표준화, 코사인 거리로 서로 다른 차원의 LLM 임베딩을 공통 좌표로 정렬해 모델 간 의미 비교와 선택적 태스크 라우팅을 가능하게 했다.
Microsoft의 Patch Tuesday에서 AI 기반 발견으로 제품 전반의 570개 취약점이 수정되었다.
공유 API 키와 프롬프트 인젝션으로 인한 권한 악용, 즉시 차단 불가와 신뢰할 수 없는 감사 문제를 해결하기 위해 신원과 자격 증명을 분리하고 경로 내 강제검증과 변조 감지 감사를 적용하는 모델과 이를 구현한 오픈소스 도구가 제시되었다.
메타가 브로드컴 설계·TSMC 위탁생산으로 2026년 9월부터 Iris AI 칩 생산을 시작해 GPU를 보완하며 데이터센터 전력 용량을 2026년 7GW에서 2027년 14GW로 확장할 계획이다.
AI 에이전트 Codex를 활용해 Polymarket의 비트코인 예측 시장에서 수익을 낼 수 있는 전략을 수립하고 GPT-5.6 모델의 성능을 검증함.
GPT-5.6의 성능 분석과 함께 AI 에이전트 자동화를 위한 Loop Library 및 Astra OS 활용법을 살펴봅니다.
xAI가 출시한 Grok 4.5의 벤치마크 성능과 비용 효율성을 분석하고, 커뮤니티에서 제기된 데이터 오염 논란 및 향후 업데이트 계획을 다룬다.
Grok Build의 /deep-research와 Hermes의 도구 노출 규칙이 워크플로 비용·신뢰성 문제를 겨냥했고, NVIDIA 논문은 AdamW 한계를 지적하며 대규모 학습 안정성 개선책을 제시했다.
여러 출처의 API 키를 풀링해 할인 토큰을 재판매하는 시장이 오픈소스 프록시와 결제 남용을 통해 확장되고 있어 엄격한 키 한도 제도가 필요하다.
Tracebit 연구진은 AWS에 저장된 비밀 옆에 고의적 프롬프트 인젝션을 배치하면 공격용 LLM이 자체 안전장치로 인해 동작을 멈추는 사례가 잦았다고 보고했다.
작성자는 피처 코드가 단순 수학이 아니라 데이터 연결·스토리지·완료 보증 등 플랫폼 소유의 연결점들과 결합되어 있음을 지적하며 그 위험 사례와 레포·데모를 공유했다.
ctxdiff는 LLM 에이전트의 각 턴에서 컨텍스트 블록이 어떻게 추가되거나 제거되었는지를 content-hash 기반으로 기록해 턴별 차이와 토큰 사용처를 추적하는 로컬 우선 도구이다.
데이터 오염을 방지하고 실제 오픈소스 유지보수 과제를 기반으로 AI 코딩 에이전트의 장기적인 문제 해결 능력을 평가하는 벤치마크 DeepSWE를 소개한다.
Microsoft 365 데이터를 AI 에이전트가 안전하게 활용할 수 있게 돕는 workplace intelligence 레이어 Work IQ의 설치 및 활용법을 다룬다.
Opus 5가 한 프롬프트로 게임·3D 월드를 만들고, vLLM이 KV-cache·MoE 최적화로 추론 성능을 끌어올리는 등 생성·추론 양쪽에서 실용성이 빠르게 확장되고 있다.
PR 대화와 최신 코드 상태를 비교해 각 리뷰 코멘트가 실제로 반영되었는지 규칙 기반과 LLM 보완으로 판정하는 CLI·Action·에이전트 도구이다.
DESIGN.md는 프로젝트 루트에 두는 마크다운 규약으로 코딩 에이전트가 읽어 UI 색상·타이포·간격·상태를 일관되게 생성하도록 한다.
작업을 계획-실행-검증-수정하는 에이전트 루프와 지식 기반 저장, 재사용 가능한 로직, 반복 배포 원칙을 결합해 코드 생성 워크플로를 체계화한다.
AI 코딩과 에이전트 엔지니어링을 28일 만에 마스터하기 위한 4주 커리큘럼과 생산성 향상을 위한 AI 도구 활용법을 다룬다.