챕터별 상세
FDR의 개념과 필요성
거짓 발견 비율(FDR)은 잘못된 데이터를 유의미한 것으로 잘못 판단하는 오류를 걸러내는 도구이다. 고차원 데이터 분석에서 필수적인 통계적 보정 기법이다.
RNA-seq 데이터와 p-value 분포
RNA-seq 데이터는 샘플마다 측정값이 미세하게 다르며, 이를 정규 분포 형태의 곡선으로 요약한다. 대부분의 측정값은 평균 근처에 위치하지만, 드물게 평균보다 훨씬 크거나 작은 값이 존재한다.
다중 검정의 오류
10,000개의 유전자를 각각 검정할 때, p-value가 0.05 미만인 경우를 유의미하다고 판단하면 500개의 거짓 양성이 발생한다. 이는 실제로는 차이가 없는데 차이가 있는 것처럼 보이는 통계적 오류이다.
Benjamini-Hochberg 방법의 원리
이 방법은 p-value를 조정하여 거짓 양성의 수를 제어한다. p-value가 균일하게 분포하는 구간과 치우친 구간을 구분하여, 유의미한 결과의 신뢰도를 높인다.
p-value 분포의 차이
동일한 분포에서 샘플을 추출하면 p-value는 균일하게 분포한다. 반면, 서로 다른 분포에서 추출하면 p-value는 0에 가깝게 치우친 분포를 보인다.
BH 방법의 단계별 계산
p-value를 작은 순서대로 정렬하고 순위를 매긴다. 각 p-value에 (전체 개수 / 순위)를 곱하여 조정된 p-value를 산출하고, 이를 통해 유의미한 임계값을 결정한다.
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 06. 09.수집 2026. 06. 09.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.