파이프라인 연결점과 Feature-Training Skew 실제 사례 리포지터리
작성자는 피처 코드가 단순 수학이 아니라 데이터 연결·스토리지·완료 보증 등 플랫폼 소유의 연결점들과 결합되어 있음을 지적하며 그 위험 사례와 레포·데모를 공유했다.
머신러닝 운영, 모델 배포, 인프라 관리 (4만+ 구독자)
작성자는 피처 코드가 단순 수학이 아니라 데이터 연결·스토리지·완료 보증 등 플랫폼 소유의 연결점들과 결합되어 있음을 지적하며 그 위험 사례와 레포·데모를 공유했다.
API 게이트웨이, 링 버퍼 큐, 동적 배처, 토큰 스트리밍을 결합해 GPU 활용과 P99 지연을 균형시키는 실무 아키텍처를 제시한다.
브라우저에서 작동하고 로컬 파일 처리를 지원하는 도구 호출용 데이터셋 검증기와 오픈소스 데스크톱 버전을 공개했다.
카메라 펌웨어의 미세한 크롭·보정 변화가 기존 마스크 경계를 어긋나게 만들 수 있으며 전역 기하 정렬 후 LingBot-Vision으로 국지적 변화를 랭킹해 정상화 또는 주석 버전화를 결정할 근거를 제공한다.
토큰 엔지니어링은 비용·지연·신뢰성을 동시에 최적화하는 시스템 공학으로, 모델·기법·하드웨어 선택에 따라 동일한 작업 비용이 100배까지 달라질 수 있음을 지적한다.
작은 초안 모델이 큰 모델보다 가볍게 여러 토큰을 미리 예측하고 큰 모델이 그 예측을 병렬로 검증해 정답이 유지되는 한 예측 토큰을 즉시 채택하면서 추론 지연을 줄이는 방식이다. 이 구조는 초안 모델의 선행 예측과 큰 모델의 병렬 검증이라는 두 단계로 동작하며 최종 출력의 변경 없이 처리량을 향상시킨다. 영상 링크와 재생목록을 통해 생산 환경에서의 적용 맥락과 관련 최적화 기법들을 연계해 다루고 있다.
Databricks 블로그의 MLOps 체크리스트와 GitHub 레포를 통해 CI/CD·추론·버전관리·IaC 관련 실무 예제를 Free Edition에서 실행해 볼 수 있다.
이 게시물은 Kubernetes에서 GPU를 공유할 때 팀 신뢰 경계를 기준으로 time-slicing, MPS, MIG 중 어떤 방식을 선택해야 하는지 실무적 기준과 장단점을 제시한다.
PagedAttention이 KV Cache에 가상메모리와 copy-on-write를 적용해 추론의 GPU 메모리 병목을 줄이고 vLLM 계열 엔진의 처리량을 크게 향상시킨다
작성자는 이더넷 기반 분산 학습에서 그래디언트 동기화로 GPU가 유휴 상태가 되어 실효율이 약 40% 감소하며 이를 반영한 비용 계산기를 공개했다.
작성자는 Databricks Lakebase의 synced tables와 PgBouncer를 활용해 reverse-ETL 부담을 줄이고 온라인 피처 서빙을 단순화하는 방안을 공유했다.
작성자는 100GbE 환경에서 70B 이상 모델 학습 시 네트워크 대역폭으로 인해 GPU 유휴가 발생해 비용이 최대 40% 증가한다고 지적하며 이를 계산하는 무료 TCO 계산기를 공개했다.
작성자는 LLM 거버넌스를 액세스 제어, 콘텐츠 거버넌스, 감사·가시성, 모델 리스크 관리, 에이전트·툴 거버넌스의 다섯 층위로 구분해 실무적 설계 포인트를 제안했다.
유휴 타임아웃을 포아송 도착 모델로 수식화하면 R_gpu와 λP_cold를 비교해 타임아웃을 결정하는 것이 합리적임을 보였다.
전체 재학습 대신 드리프트 탐지 후 부분적 보정(calibration, BN refresh 등)을 수행하여 ML 모델 성능을 유지하는 ARL(Adaptive Reliability Layer) 프레임워크.
모델 모니터링의 핵심은 입력 데이터 변화(Feature Drift)와 출력 분포 변화(Prediction Drift)를 PSI 지표로 추적하여 이상 징후를 조기에 발견하는 것이다.