AI로 모든 업무를 자동화한 직원의 결과물, 과연 신뢰할 수 있을까?
AI 코딩 도구에 전적으로 의존하여 데이터 분석 및 파이프라인을 구축한 직원이 발생시킨 기술적 오류와 조직적 문제에 대한 사례 공유.
데이터 과학 전문가들이 기술적 주제, 커리어 고민, 업계 동향 및 취업 준비에 대해 자유롭게 토론하고 정보를 공유하는 커뮤니티입니다.
AI 코딩 도구에 전적으로 의존하여 데이터 분석 및 파이프라인을 구축한 직원이 발생시킨 기술적 오류와 조직적 문제에 대한 사례 공유.
클래스 불균형은 단순히 SMOTE로 해결할 문제가 아니며, 메트릭 선택, 학습 목표, 비즈니스 비용에 따라 적절한 기법을 선택해야 한다.
AI 에이전트가 내부 논리는 정확하지만 외부 상황 인식 오류로 잘못된 결정을 내리는 문제와 이를 해결하기 위한 업스트림 검증 방안을 논의한다.
1,000개 vCPU 클러스터와 Burla 라이브러리를 활용해 1조 번의 몬테카를로 시뮬레이션을 수행하고 켄터키 더비 우승 확률을 예측한 프로젝트이다.
HTTP Range 요청과 병렬 워커를 활용해 275GB 규모의 아마존 리뷰 데이터셋 5.7억 건을 4분 만에 분석한 기술적 사례이다.
Claude Code를 Jupyter MCP 서버와 연결하여 AI가 직접 커널을 제어하고 노트북을 자동 디버깅하는 효율적인 워크플로를 구축했다.
LLM에 검증된 Python 패키지를 도구로 제공하여 분석 업무를 자동화하는 방식이 단순 에이전트보다 신뢰도가 높다는 경험 공유.
Kaggle의 고대 아시리아어 번역 대회 우승 사례들을 통해 저자원 언어 환경에서 데이터 구축과 정제가 모델 아키텍처보다 성능에 더 큰 영향을 미침이 확인됐다.
Jax를 사용하여 리프 노드가 단일 값 대신 분포의 스플라인 계수를 예측하도록 학습하는 그래디언트 부스팅 스플라인 모델을 구현했다.
데이터 사이언스 채용 담당자가 복잡한 기술보다 문제 해결 과정과 비즈니스 임팩트를 중시하는 CRAIG 포트폴리오 구성 전략을 권고했다.
Bruin과 MCP를 활용해 데이터베이스 스키마를 이해하고 도메인 지식을 갖춘 오픈소스 AI 데이터 분석가를 빠르게 구축하는 방법이다.
데이터 과학자가 복잡한 인프라 설정 없이 Python 코드 내에서 직접 수천 개의 CPU/GPU로 연산을 확장할 수 있게 돕는 오픈소스 도구 Burla를 소개한다.
Nix 기반의 샌드박싱과 Apache Arrow를 활용해 R, Python 간 데이터 교환 및 재현성을 강제하는 데이터 사이언스 전용 DSL 'T'가 공개됐다.
PySpark, DuckDB, Postgres 등 다양한 엔진에서 동일한 데이터 클리닝 로직을 실행할 수 있는 'Copy-to-own' 방식의 프레임워크이다.
중급 이상의 데이터 사이언티스트 채용을 위해 결과물보다 과정과 소통을 중시하는 POC 과제 및 후보자가 직접 선택하는 용어 설명 면접 방식을 제안했다.
현실 세계의 결측치, 중복, 이상치를 포함한 복잡한 데이터를 생성하고 Claude 에이전트와 연동할 수 있는 Python 라이브러리 MessyData가 공개됐다.
AI 에이전트 기반의 자동화된 워크플로우를 위해 기존의 파일 유형별 폴더 구조를 탈피하고 산출물 중심의 독립적 구조와 DVC 기반의 이력 관리를 제안한다.
파이썬을 활용한 신용 리스크 모델링 파이프라인의 단계별 구성과 WoE 인코딩, VIF 검증, XGBoost 튜닝 및 모델 안정성 평가 방식을 다룬다.
데이터 과학 실무에서 LLM을 무분별하게 사용하여 기술적 깊이와 문서 품질이 저하된 동료의 문제를 해결하기 위한 시니어 전문가의 고민과 전략을 다룹니다.