CUDA로 557× 가속된 Eulerian Video Magnification 구현
원저와 비트-대-비트 유사성을 유지하면서 순수 CUDA C++ 핸드-작성 커널로 최대 557배 컴퓨트 가속과 RMSE < 0.01을 달성한 Eulerian Video Magnification 공개 기록이다.
총 80건
원저와 비트-대-비트 유사성을 유지하면서 순수 CUDA C++ 핸드-작성 커널로 최대 557배 컴퓨트 가속과 RMSE < 0.01을 달성한 Eulerian Video Magnification 공개 기록이다.
GPT-5.6 Sol은 여러 크기와 다단계 reasoning-effort 설정을 통해 비용과 인덱스 성능 사이의 트레이드오프를 제공하며 Ultra는 서브에이전트 병렬화로 Max와 유사한 성능을 목표로 한다.
asyncio와 trafilatura를 활용해 대규모 문서 사이트를 노이즈 제거한 마크다운으로 변환하고 Apify Actor로 패키징해 RAG 파이프라인에 곧바로 투입 가능한 형식으로 제공했다.
온톨로지와 지식 그래프의 기본 개념, 구성 요소, 그리고 WordNet, UMLS 등 대표적인 사례를 통해 데이터 구조화의 기초를 학습합니다.
토큰 엔지니어링은 비용·지연·신뢰성을 동시에 최적화하는 시스템 공학으로, 모델·기법·하드웨어 선택에 따라 동일한 작업 비용이 100배까지 달라질 수 있음을 지적한다.
작은 초안 모델이 큰 모델보다 가볍게 여러 토큰을 미리 예측하고 큰 모델이 그 예측을 병렬로 검증해 정답이 유지되는 한 예측 토큰을 즉시 채택하면서 추론 지연을 줄이는 방식이다. 이 구조는 초안 모델의 선행 예측과 큰 모델의 병렬 검증이라는 두 단계로 동작하며 최종 출력의 변경 없이 처리량을 향상시킨다. 영상 링크와 재생목록을 통해 생산 환경에서의 적용 맥락과 관련 최적화 기법들을 연계해 다루고 있다.
AI 에이전트 시스템의 안정적인 배포를 위해 프롬프트, 모델 라우팅, 자율성 수준을 제어하는 피처 플래그 패턴과 킬 스위치 도입 전략을 다룬다.
에이전트의 대기 시간을 줄이고 실행 상태를 영구 저장하는 체크포인팅 기술을 통해, 비용 효율적인 대규모 에이전트 운영과 반복적인 성능 개선이 가능하다.
world-model-mcp는 사실별 유효기간과 증거 유형, 감쇠 반감기를 기록하는 시간 기반 구조화 메모리와 모순 해소·Coach-Player 검증 루프를 통해 코딩 에이전트의 지속 메모리 오류를 줄이는 오픈소스 프로젝트이다.
Anthropic API는 메시지의 완전 일치에만 캐시를 적용하며 컨텍스트를 변경하는 압축 플러그인은 오히려 비용을 증가시킬 수 있다.
AI 코딩 에이전트 Enter Pro를 활용해 데이터 영속성과 결제 시스템을 갖춘 멀티테넌트 이커머스 SaaS를 구축하고 실전 성능을 검증한다.
그래프 신경망 기반의 P2LNet을 통해 HD 지도 요소 간의 토폴로지와 연결성을 자동으로 검증하는 방법과 논문 및 포스트프린트를 공유한다.
스테레오 입력을 잠재공간과 원파형 두 경로로 변환하는 flow-matching 기반 모델을 공개했으며 amplitude lifting으로 웨이브폼 학습 불안정성을 해결하고 코드·모델·앱을 배포했다.
특정 인간 판단자의 응답을 예측하도록 AI를 평가하는 방식을 통해 주관적·논쟁적 개념적 추론 과제에서 순수한 역량 변화를 추적하는 방안과 그 설계상 제약을 밝힌다.
TTCD는 연속 공간 확산과 토큰별 시간 개념을 결합하여 고속 생성에서 이산 확산 모델보다 조건부 생성 품질이 우수하다고 보고했다.
Chat2Scenic은 RAG 기반의 이터레이티브 컴포넌트 생성과 다양한 프롬프트 기법을 결합해 Scenic DSL로 규제 기반 자율주행 테스트 시나리오를 자동 생성하며 Gemini-3-Flash에서 76.42% CSR을 달성했다.
Fable 모델이 백엔드를 주도하고 수동 확인을 결합한 자동 커밋 시스템이 30수 동안 84% 자동 커밋 정확도를 기록했다.
비디오 생성 모델에서 경계 상자를 모델의 내부 어텐션과 정렬하여 사용자 의도대로 영상을 제어하는 최적화 프레임워크.
복잡한 장기 실행 작업을 처리하는 Deep Agents의 핵심 구성 요소와 배포 전략을 알아본다.
작성자는 CPU 중심 최적화로 cpubrrr가 동일 랩탑에서 llama.cpp의 약 14.5 tok/s 대비 약 72–77 tok/s를 기록했다고 보고했다.
세일즈포스는 반복되는 코드 리뷰 피드백을 메타 스킬 생성기로 전환하고 트리거 정확도와 구조적 검증을 포함한 3단계 평가로 개선 효과를 측정했다.
60건의 실증 사례를 모은 CVE 스타일 데이터베이스에서 보안 취약성과 파괴적 행위가 약 절반을 차지했고 47%가 치명적이며 가장 흔한 근본 원인은 검증되지 않은 가정에 따라 결정적으로 행동하는 신뢰도 오차로 확인되었다.
Smartsheet는 AWS 위에 원격 MCP 서버를 두어 AI 클라이언트가 구조적 데이터에 효율적으로 접근하도록 하고 토큰 비용·환각 위험을 줄여 내부 텔레메트리 기준 30억 토큰을 절감했다.
게임 도우미용 LLM이 플레이어보다 앞선 정보를 제공하는 문제를 상태 감지, 프롬프트 제한, 스크린샷 기반 그라운딩으로 실무적으로 완화했다고 보고한다.
FirstMate와 Herdr를 활용해 다수의 AI 에이전트 세션을 효율적으로 관리하고, CodeRabbit으로 코드 리뷰를 자동화하는 실전 개발 워크플로.
에이전트 하니스는 재시도 로직과 런타임 시스템 프롬프트 조립 등 LLM 기능의 운영적 구성요소를 포괄하는 계층이다.
Claude Code의 인앱 브라우저 기능, Google 앱 연동, Kimi K3 및 Bonsai 27B 모델 공개 등 주요 AI 기술 업데이트를 요약한다.
로컬에서 활성화해 텔레그램으로 접근 가능한 AliceWiki 스타일의 LangChain 기반 봇을 JavaScript와 Bun으로 구현하고 채팅 모드와 LLM을 사용하지 않는 툴 전용 모드를 지원한다.
여러 LLM 렌즈(Logit Lens, Patchscopes, Jacobian Lens, Geometric Lens)를 겹쳐 모델의 결정 경계와 토큰 예측 궤적을 공동 시각화하는 도구와 관련 코드 및 논문 링크이다.
OpenScanVision은 ArUco 추적과 호모그래피 보정을 이용해 Android에서 QR 디코딩과 OMR을 동일 프레임에서 병렬로 수행하여 단일 ScanResult를 반환한다.
중국어 발표 동영상으로 RAG의 핵심 원리와 전체 워크플로를 단계별로 정리하고 적용 시나리오별 선택 기준을 비교한다.
Anthropic이 7월 20일부터 Claude Fable 5를 Max 및 Team Premium 요금제에 포함하고 사용 한도를 50%로 적용하며 Pro·Team Standard 고객엔 사용 크레딧 방식과 일회성 100달러 크레딧을 유지한다.
DS4에 Metal 경로와 SSD 스트리밍 기반 전문가 캐시를 더해 Qwen3.6-35B-A3B를 16GB Mac에서 실사용 수준으로 동작시켰으며 사전채우기 15.04 tok/s·생성 9.77 tok/s의 워밍 미디언 성능을 기록했다.
AI 에이전트 루프의 실무 적용 가능성과 경제적 타당성, 그리고 소프트웨어 엔지니어링 관점에서의 한계를 다룬 토론.
HDR은 트리 구조 잠재와 계층별 디노이징 스케줄 및 SHAP를 결합해 스트리밍 영상 생성에서 논리적 일관성과 낮은 대기시간을 동시에 달성했다.
RxBrain은 언어 기반 계획 구조와 시각적 상상을 단일 계획 시퀀스로 결합해 단계별 물리 상태 예측과 공동 하위목표 계획을 수행하는 멀티모달 Mixture-of-Transformers 기반 파운데이션 모델이다.
SUFLECA는 대규모 NOC 약지도 학습과 상호 k-NN 기반 기하학 합의 필터를 결합해 제로샷 CAD-이미지 9D 정렬에서 ScanNet25k 기준으로 33.4% 범주 정확도와 42.3% 인스턴스 정확도를 달성했다.
GRASP는 문장 수준 검색과 문단 확장을 도구로 삼아 GRPO로 정책을 학습하고 보상으로 정확도·근거읽기·보완적 검색·턴 효율을 합산해 다중 홉 QA의 회수율과 정답률을 향상시켰다.
AsySplat은 기하와 외형을 분리해 계산을 재할당하여 32뷰 960P 입력에서 최적화 기반 방법과 유사한 품질을 유지하면서 추론 속도를 거의 800배까지 단축했다.
논문은 law of total probability를 기반으로 binary tree로 분할한 서브집단 추정을 집계해 LLM의 자기일관성을 검증하고, 세분화 응답에서 더 좋은 정합성이 관찰되는 'macro fallacy'를 보고했다.
바이트-정확 KV 상태를 디스크에 저장하고 동일 위치에 복원하는 그래프트로 동결된 12B 모델의 AIME 정확도를 80.0%에서 93.3%로 끌어올리고 반복 질의의 토큰 비용을 6,574배 줄였다.
VIABench는 시각장애인이 직접 녹화한 761개 장기 동영상(총 46.9시간)과 TPAD 평가법을 통해 MLLM의 사전 알림, VQA, 상호작용 능력을 실세계 조건에서 평가하는 벤치마크이다.
DeepLoop은 루프드 Transformer에서 반복 방문의 정렬 효과를 반영하여 α=(2N)^{1/2}, β=(8N)^{-1/2} 스케일링을 사용해 공유된 블록을 반복할 때의 학습 안정성을 확보한다.
WanSong v1.0은 연속 오디오 토큰을 단일 확산 백본으로 직접 생성해 최대 5분 길이의 다국어 노래를 보컬과 BGM 분리 스템으로 한 번에 출력하고 VAE 1024 압축률과 RLHF로 품질을 개선했다.
MeanFlowNFT는 MeanFlow의 평균 속도 네트워크를 유지한 채 MeanFlow 항등식을 이용해 유도된 순간 속도 예측기를 학습시켜 4스텝 같은 few-step 샘플링에서 DiffusionNFT 수준의 정책 개선과 품질 향상을 달성했다.
RoboTTT는 Test‑Time Training으로 fast weights를 활용해 시각·동작 문맥을 8K 타임스텝까지 확장하여 장기 다단계 조립 및 한 번 보기 모방에서 성능과 복원력을 크게 개선했다.
이 논문은 온-폴리시 증류가 모델 능력 상한을 높이지 않고 탐색을 촉진하며 학생-교사 불일치와 길이 악용 병리를 어드밴티지 클리핑과 로그 압축으로 규제해 안정적 증류를 달성한다고 보고한다.
Wan-Streamer v0.3은 비디오를 지속적 세계와 시간적 이벤트 스트림으로 분해하여 160ms 스트리밍 단위에서 640×368@25FPS 실시간 오디오·비주얼 응답을 약 200ms 모델 지연으로 생성하는 사전학습 프레임워크이다.
SAR은 RL로 얻은 전체 가중치 변화를 사전학습된 SVD 좌표로 투영하여 전체 파라미터의 약 0.58% 내외로 추론 성능을 보존하고 대규모 샘플링에서 탐색을 개선했다.
UniVR는 텍스트 지도 없이 순수 시각 시연으로부터 장기 계획과 물리적 추론을 학습하기 위해 VR-GRPO 보상 구조와 대규모 VR-X 데이터셋을 활용한 통합 생성 모델이다.
CO2 Jump는 텍스트와 이미지의 확신도를 교차 어텐션으로 결합하고 리마스킹을 허용하는 자기보정 결합 마르코프 점프 프로세스로 공동 생성·이해 성능을 향상시켰다.
이 논문은 행동-상태-관찰 루프를 기준으로 상호작용형 월드 모델을 네 가지 차원으로 체계화하고, Black Myth: Wukong에서 수집한 90시간 분량의 프레임 정렬 플레이 데이터와 슬롯형 주석을 공개했다.
MultiRef-Compass는 350개 샘플과 재심판을 포함한 MLLM 기반 평가체계를 결합해 다중 참조 조건에서 오디오·비디오 생성의 참조 보존, 참조 바인딩, 음성-시각 정합 및 지침 준수 능력을 정량적으로 진단하는 벤치마크이다. 이 데이터셋은 보드별 자산 조합과 구조화된 프롬프트로 구성되어 동일 대상의 다중 뷰와 이종 엔티티 결합을 체계적으로 평가한다. 자동 지표와 MLLM 채점의 결합으로 사람 선호와 높은 상관을 확보했다.
KeyFrame-Compass는 386개 샘플과 여섯 가지 실행성 지표, 증거 기반 MLLM 품질판단을 결합해 키프레임 조건화 비디오 생성의 충실도와 합성 품질 간 트레이드오프를 체계적으로 평가한다.
BadWAM은 작은 ℓ∞ 제한 시각적 교란을 통해 WAM의 예측 미래는 보존하면서도 실행 행동을 크게 변경하여 폐쇄 루프 성공률을 크게 낮춘다.
LongStraw는 공유 프롬프트를 autograd 없이 평가하고 모델별로 필요한 내부 상태만 보존한 뒤 응답 브랜치를 순차적으로 재생하는 방식으로 백만 토큰급 RL 포스트트레이닝을 고정 GPU 예산에서 가능하게 한 아키텍처 인식 실행 스택이다. 이 접근은 메모리 축소와 재연산 비용을 명시적으로 트레이드오프하며 GRPO(Group Relative Policy Optimization)로 구현되어 실험에서 수백만 토큰 처리 능력을 입증했다. 구현 사례로 Qwen3.6-27B와 GLM-5.2에서 대규모 토큰 처리 검증이 수행되었다.
SearchOS는 관계형 스키마 완성과 근거 기반 인용을 중심으로 공유 상태와 미들웨어 거버넌스를 도입하여 장기 정보 탐색의 완전성과 효율성을 높여 WideSearch Item F1 80.3과 GISA Set F1 76.5를 기록했다.
SEED는 완료된 온-정책 궤적에서 자연어 회고 스킬을 생성해 동일 정책에서 재평가한 로그확률 변화로 토큰 수준의 증류 신호를 만들어 RL 손실과 공동 최적화해 장기 의사결정 성능과 샘플 효율을 개선했다.
I3D-ViT와 적응형 프레임 해상도, 3종의 대규모 데이터셋을 결합해 4B 파라미터 모델이 장기·스트리밍·미세 동작 이해에서 오픈 소스 상위 성능과 실행 효율을 달성했다.
Senti는 사용자의 음성을 256차원 벡터로 온디바이스 검증해 권한 다이얼로 PC 상의 AI 에이전트 접근을 제어하는 오픈소스 프로젝트다.
AI 모델을 활용해 소스 코드 취약점을 탐지하고, 검증·분류·패치까지 자동화하는 6단계 에이전트 워크플로를 설명한다.
자율 코딩 에이전트가 Antigravity CLI와 FiftyOne Skills로 WikiArt 81,444장을 전수 수집하고 임베딩을 GPU로 강제 이관하며 모델 전환까지 자동화했다.
언어 모델의 세계 사건 예측 능력을 평가하고, 뉴스 데이터를 활용한 사후 학습과 보정 평가 기법을 통해 예측 정확도를 높이는 연구를 다룬다.
The Gut Benchmark는 사용자가 체감한 모델 회귀와 개선 사례를 시계열 투표와 필드노트로 기록해 블랙박스 상태를 관찰 가능한 신호로 전환하는 커뮤니티 기반 플랫폼이다.
Cate는 무한 캔버스 UI로 편집기·터미널·브라우저·에이전트를 공간적으로 배치하고 Git 워크트리 기반 병렬 오케스트레이션과 CLI 제어를 지원하는 오픈소스 데스크톱 IDE이다.
proveai-sdk는 에이전트별 프롬프트와 I/O, 툴 호출을 해시로 고정해 파이프라인 회귀를 감지하는 오픈소스 스냅샷 테스팅 도구이다.
Patreon이 Cloudflare와 협력하여 허가 없는 AI 학습용 봇 크롤링을 기술적으로 차단하는 조치를 도입했다.
AI 에이전트의 성능을 극대화하기 위해 모델의 내재적 지식, 외부 데이터 검색, 그리고 학습 루프를 결합하는 지식 시스템 아키텍처를 다룬다.
브라우저 정적 번들로 동작하고 BYOK 구조를 사용하는 yesbrainer는 중재자 모델이 논점을 추출해 라운드별로 모델들이 재응답하며 합의와 남은 쟁점을 구조화해 보고하는 합의 모드를 구현한 오픈소스 프로젝트이다.
정확일치 캐시는 안전하지만 유사 표현에 취약하고 의미 기반 캐시는 적중률을 높이나 서로 다른 정답을 잘못 재사용할 위험이 존재한다.
AI가 코딩 문법을 해결함에 따라 소프트웨어 엔지니어링의 핵심은 아키텍처 설계와 검증, 그리고 모델의 추론 능력 향상으로 이동하고 있다.
LLM을 개별 '마음'으로 사용하고 기억을 보유하는 영구 가상세계 Artificiety의 첫 프로토타입이 공개되어 관찰 기준과 '자연발생적' 구조 판별 질문이 제기되었다.
다양한 코드 관련 벤치마크 차트에서 모델별 강점이 벤치마다 달라 Kimi K3가 Program Bench와 SWE Marathon에서 높은 점수를 기록하는 등 활용 목적에 따라 모델 선택 우선순위가 달라진다.
CoreWeave의 Corey Sanders와 함께 AI 학습 및 추론 워크로드에 최적화된 인프라 설계와 GPU 성능 최적화 전략을 알아본다.