FP16·CUDA Graph로 2ms 검출, 6ms 분할 성능을 내는 RF-DETR C++ 추론 라이브러리
C++로 작성한 RF-DETR 추론 라이브러리는 CUDA Graph 캡처와 비동기 H2D 전송, GPU 기반 마스크 디코딩을 결합해 RTX 5070 Ti에서 FP16 기준 검출 2ms, 인스턴스 분할 6ms 성능을 달성했다.
컴퓨터 비전 연구, 논문, 실무 적용 사례 (6.8만+ 구독자)
C++로 작성한 RF-DETR 추론 라이브러리는 CUDA Graph 캡처와 비동기 H2D 전송, GPU 기반 마스크 디코딩을 결합해 RTX 5070 Ti에서 FP16 기준 검출 2ms, 인스턴스 분할 6ms 성능을 달성했다.
PP-OCR 모델을 ONNX로 변환해 ONNX Runtime으로 추론하고 OpenCV로 전후처리하는 순수 C++ 단일 실행파일로 HTTP API와 내장 웹 UI를 제공한다.
VideoDB 팀이 공개한 VLM 비디오 벤치마크는 샘플링·프레임 선택·프롬프트 구조 같은 구성 결정이 모델 선택보다 평가 결과에 더 큰 영향을 미친다고 보고하면서 재현 가능한 오픈소스 레포를 제공했다.
W4A8 양자화와 NPU 기반 다중 스케일 타일링을 결합해 MobileNet 계열에서 임베디드 고성능 암석 분류를 구현한 기술 시연이다.
IQA-T1은 15개의 지각 도구와 Q-Tool(11k 체인) 기반 학습, GRPO 강화학습 정책으로 증거 기반 품질 점수를 산출하여 7개 벤치 평균 PLCC 0.795를 달성했다.
Rendersynth는 Blender 내부에서 비개발자도 사용할 수 있는 시각적 노코드 인터페이스로 YOLO·COCO·키포인트·깊이·노말·포인트클라우드 주석을 포함한 합성 CV 데이터셋을 생성하고 시드 기반 재현성을 제공한다.
현업 배포 경험에서 모델 자체보다 PII 전처리·엣지 하드웨어 제약·지연과 오탐 비용 같은 운영 요소가 더 큰 문제로 작용한다는 세 가지 사례를 공유했다.
YOLO 기반 포즈 추적과 ByteTrack 트래킹으로 선수 궤적을 확보하고 Hilbert transform으로 바운스 경계를 찾은 뒤 TCN으로 트릭을 분류하는 파이프라인이 초기 공통 트릭에서 괜찮은 성능을 보였다.
공식 OpenCV 튜토리얼을 기반으로 브라우저에서 바로 실행 가능한 노트북 시리즈와 해당 소스가 올라간 GitHub 리포지토리를 공개했다.
LingBot-Map은 LiDAR 없이 일반 비디오 스트림으로 초당 약 20프레임의 연속 3D 지도를 생성하며 10,000프레임 이상 안정성을 유지하는 오픈소스 프로젝트이다.
MediaPipe Hands의 21개 랜드마크를 입력으로 하는 약 66K 파라미터 MLP를 ONNX Runtime Web로 브라우저에서 실행해 클래스별 시계열 분할 기준 95.5% 정확도를 보고했다.
LingBot-Vision의 Masked Boundary Modeling과 ViT/16 백본을 경계 오류·깊이 단절·작은 객체 중심으로 검증하라고 권고하는 글이다.
소스 영상들을 임베딩으로 색인해 문장 단위 의미로 매칭하고 Whisper·Gemini·Qdrant·TTS를 연결해 타깃 영상에 맞춰 재조합한 파이프라인 구현 사례이다.
OpenCV로 공 위치를 실시간 추적해 서보가 골키퍼 팔을 움직여 슛을 차단하는 로봇 프로젝트와 관련 펌웨어가 GitHub에 공개되었다.
D-FINE-seg은 실시간 DETR 백본으로 객체 검출과 인스턴스·시맨틱 분할을 동시에 수행하며 코드와 가중치는 상업적 이용을 포함해 무료로 제공된다.
Residual Network는 층이 직접 아이덴티티를 학습하기 어려운 문제를 잔차 학습으로 재구성하여 매우 깊은 네트워크의 최적화를 용이하게 한다.
SAM 3.1은 객체를 최대 16개 용량 버킷으로 묶어 메모리를 공유함으로써 Meta 기준 128개 객체에서 약 7배 속도 향상과 혼잡 장면에서 추적 정확도 개선을 보고했다.
Birder 프로젝트가 D-FINE-L로 COCO mAP 56.09을 보고하고 Sinkhorn 경로·큐 구현 개선으로 자기지도학습(SSL)을 최대 20% 가속했다.
원저와 비트-대-비트 유사성을 유지하면서 순수 CUDA C++ 핸드-작성 커널로 최대 557배 컴퓨트 가속과 RMSE < 0.01을 달성한 Eulerian Video Magnification 공개 기록이다.
OpenScanVision은 ArUco 추적과 호모그래피 보정을 이용해 Android에서 QR 디코딩과 OMR을 동일 프레임에서 병렬로 수행하여 단일 ScanResult를 반환한다.
Fable 모델이 백엔드를 주도하고 수동 확인을 결합한 자동 커밋 시스템이 30수 동안 84% 자동 커밋 정확도를 기록했다.
자율 코딩 에이전트가 Antigravity CLI와 FiftyOne Skills로 WikiArt 81,444장을 전수 수집하고 임베딩을 GPU로 강제 이관하며 모델 전환까지 자동화했다.
SenseNova-Vision은 단일 7B-MoT 멀티모달 모델로 이미지와 자연어 지시를 결합해 검출·세그먼트·깊이·노말 등 다양한 CV 출력을 생성하며 체크포인트는 약 29.6GB이다.
MobileAgeNet은 MobileNetV3-Large 기반으로 설계되어 UTKFace에서 4.65년 MAE를 기록하고 3.23M 파라미터와 약 14.4ms 온디바이스 추론 성능을 달성한 경량 얼굴 연령 추정 모델이다.