CHAPTER 05.9 / STATISTICAL SIGNIFICANCE
5.9 통계적으로 드문 결과의 의미와 한계
시험 점수 사례로 통계적 유의성, 효과 크기와 다중검정 보정을 구분합니다.
5.9 통계적으로 드문 결과의 의미와 한계
5.7과 5.8의 시험 점수 사례를 그대로 이어 간다. 이 페이지의 목표는 P값을 미리 정한 판단선과 비교하는 순서, 실제 점수 차이와 표본의 흔들림이 맡는 역할, 검정을 여러 번 할 때 생기는 문제를 구분하는 것이다.
5.7에서는 새로운 수업을 받은 학생들의 실제 평균이 70점이라고 놓았다. 이것이 Null hypothesis(귀무가설) 다. 5.8에서는 학생 25명의 Sample mean(표본평균) 74.2점이 기준 70점에서 Standard error(표준오차) 2점의 2.1배만큼 떨어졌고, Two-sided test(양측검정)의 P-value(P값)가 약 3.6%라는 것을 계산했다.
지금까지 얻은 숫자를 한 문장으로 먼저 이어 보자.
실제 평균을 70점으로 놓으면 이번처럼 멀어진 표본평균은 약 3.6% 나타난다. 이 값은 자료를 보기 전에 정한 Significance level(유의수준) 5%보다 작다.
P값을 판단선과 비교한 뒤 이름을 붙인다
이 검정은 자료를 보기 전에 P값이 5%보다 작으면 귀무가설을 기각한다는 규칙을 정했다. 실제로 얻은 P값 약 3.6%는 5%보다 작으므로 귀무가설을 기각한다.
이처럼 P값이 미리 정한 유의수준보다 작아 귀무가설을 기각하는 결과를 5% 기준에서 Statistical significance(통계적 유의성)가 있다고 말한다.
여기서 5% 기준에서라는 조건을 빼면 안 된다. 5%는 진실과 거짓을 나누는 자연법칙이 아니라 연구자가 자료를 보기 전에 정한 판단선이다. 같은 P값도 1% 기준에서는 통계적으로 유의하지 않을 수 있다.
통계적으로 유의하다는 말은 다음 세 문장과 다르다.
- 귀무가설이 참일 확률이 3.6%라는 뜻이 아니다.
- 이번 기각 판단이 맞을 확률이 96.4%라는 뜻이 아니다.
- 평균 차이 4.2점이 크거나 중요한 차이라는 뜻이 아니다.
통계적 유의성은 귀무가설과 계산 가정을 놓았을 때 현재 자료가 미리 정한 판단선을 넘었는지를 말한다. 가설의 확률과 차이의 중요도까지 한꺼번에 판정하지 않는다.
실제 차이와 표본의 흔들림을 차례로 비교한다
표본평균 74.2점과 귀무가설 평균 70점의 차이는 4.2점이다. 이처럼 관측한 차이 자체를 Effect size(효과 크기)라고 한다. 이 예시의 효과 크기 단위는 점이다.
같은 4.2점이라도 표본평균이 평소에 얼마나 흔들리는지에 따라 드문 정도는 달라진다. Z test statistic(Z 검정통계량)은 관측한 차이를 표준오차로 나누어 표준오차 몇 배만큼 떨어졌는가를 나타낸다.
- 관측한 차이를 표준오차 단위로 나타낸 Z test statistic(Z 검정통계량)
- 단위: 없음
- 학생 25명에게서 관측한 Sample mean(표본평균)
- 예시 값:
- 단위: 점
- Null hypothesis(귀무가설)가 주장하는 Population mean(모집단 평균)
- 예시 값:
- 단위: 점
- 표본을 바꿔 뽑을 때 표본평균이 흔들리는 정도인 Standard error(표준오차)
- 예시 값:
- 단위: 점
이 사례에서는 점수 차이 4.2점을 표준오차 2점으로 나누므로 이다. 그 거리에 해당하는 양측 P값은 약 3.6%이고, 이 P값을 유의수준 5%와 비교해 기각 여부를 판단한다.
| 순서 | 숫자 | 이 사례에서 답하는 질문 |
|---|---|---|
| 1. 실제 차이 | Effect size(효과 크기) 4.2점 | 표본평균이 70점보다 몇 점 높은가? |
| 2. 흔들림과 비교 | Z통계량 2.1 | 그 차이는 표준오차의 몇 배인가? |
| 3. 드문 정도 | P값 약 3.6% | 평균을 70점으로 놓으면 이만큼 먼 결과가 얼마나 자주 나오는가? |
| 4. 판단선과 비교 | 유의수준 5% | 어디부터 귀무가설을 기각하기로 미리 정했는가? |
고정 조건: Null hypothesis(귀무가설)의 평균 70점, Two-sided test(양측검정), Significance level(유의수준) 5%
- 70점과의 실제 차이
- +4.2점
- 표준오차 단위 거리
- z = +2.10
- 정확한 양측 P값
- 3.57%
- 5% 판단선과 비교
- 3.57% < 5.00%
귀무가설을 기각합니다. 5% 기준에서 통계적으로 유의합니다.
표본평균을 그대로 둔 채 표준오차만 움직여 보세요. 점수 차이는 같아도 Z통계량과 P값은 달라집니다.
도구에서 표본평균을 74.2점으로 둔 채 표준오차만 바꿔 보자. 실제 점수 차이는 계속 4.2점이지만 Z통계량과 P값은 달라진다. 효과 크기는 관측한 차이를 말하고, 통계적 유의성은 그 차이를 표본의 흔들림과 비교한 뒤 판단선까지 넘었는지를 말한다.
5.6에서 본 것처럼 같은 방식으로 자료를 모으고 학생 점수의 변동성도 같다면, 표본 크기가 커질수록 표본평균의 표준오차는 대체로 작아진다. 그러면 같은 점수 차이도 Z통계량의 절댓값이 커지고 P값이 작아질 수 있다. 표본을 많이 모았다고 점수 차이 자체가 자동으로 커지는 것은 아니다.
검정 기회가 늘면 우연한 통과도 늘어난다
5.7에서 Type I error(제1종 오류)는 귀무가설이 실제로 맞는데도 기각하는 판단이었다. 이 페이지의 시험 사례로 말하면 실제 평균이 70점인데 우연히 드문 표본이 뽑혀 평균이 70점과 다르다고 판단하는 경우다. 효과가 없는데도 있다고 판단한다는 뜻에서 False positive(거짓 양성)라고도 한다.
이제 실제로는 평균을 바꾸지 않는 서로 독립된 수업 방법 20개를 각각 시험한다고 하자. 모든 방법에 같은 5% 기준을 적용하면 각 검정에는 거짓 양성이 나올 기회가 하나씩 생긴다. 검정 하나의 기회는 5%지만, 20개 가운데 적어도 하나가 우연히 통과할 가능성은 약 64.2%다.
여러 가설을 함께 시험하면서 이런 기회가 늘어나는 문제를 Multiple testing(다중검정)이라고 한다.
독립된 검정 개가 모두 효과가 없고 각 검정이 유의수준 를 사용할 때, 적어도 하나의 거짓 양성이 나올 확률은 다음과 같다.
- 효과가 없는 독립 검정들 가운데 적어도 하나를 잘못 기각할 Probability(확률)
- 예시 값: 약 또는
- 단위: 0~1의 비율 또는 %
- 각 검정에 보정 없이 적용한 Significance level(유의수준)
- 예시 값: 또는
- 단위: 0~1의 비율 또는 %
- 서로 독립이라고 가정한 검정의 수
- 예시 값:
- 단위: 개
모든 귀무가설이 실제로 맞고 각 검정이 서로 독립이라고 놓습니다. 각 검정은 보정 전에 같은 5% 기준을 사용합니다.
- 함께 시험한 가설
- 20개
- 보정 전 하나 이상 거짓 양성
- 64.2%
- 각 검정의 본페로니 기준
- 0.250%
첫 확률은 검정들이 서로 독립이라는 가정에서 계산합니다. 본페로니 기준은 검정 묶음 전체의 오류율을 5% 이하로 관리하기 위한 보수적인 판단선입니다.
본페로니 보정은 각 검정의 판단선을 낮춘다
Bonferroni correction(본페로니 보정)은 검정 묶음 전체에서 거짓 양성 위험을 관리하는 단순한 방법이다. 전체 기준을 검정 수로 나누어 각 검정에 더 낮은 판단선을 적용한다.
- 본페로니 보정 뒤 각 검정에 적용하는 유의수준
- 예시 값: 또는
- 단위: 0~1의 비율 또는 %
- 검정 묶음 전체에서 관리하려는 유의수준
- 예시 값: 또는
- 단위: 0~1의 비율 또는 %
- 한 묶음으로 함께 고려한 검정의 수
- 예시 값:
- 단위: 개
20개 검정에서는 각 P값을 5%가 아니라 0.25%와 비교한다. 이 기준은 검정들이 서로 의존하더라도 검정 묶음 전체의 제1종 오류 확률을 5% 이하로 관리한다. 대신 기준이 엄격해져 실제 차이도 놓칠 수 있으므로 본페로니 보정은 보수적이라고 한다.
보정은 처음부터 함께 고려한 검정 수를 정직하게 세었을 때 의미가 있다. 결과가 좋지 않은 검정을 숨기거나, 자료를 본 뒤 분석 방법을 계속 바꾸면서 마지막 검정만 보고하면 을 실제보다 작게 세게 된다. 본페로니 보정도 잘못 모은 자료와 잘못된 검정 가정을 고쳐 주지는 않는다.
숫자를 판단 하나로 줄이지 않는다
유의함이라는 한 단어만 보고하면 실제 차이와 불확실성을 알 수 없다. 최소한 다음 내용을 함께 기록한다.
- Effect size(효과 크기): 표본평균이 기준과 실제로 얼마나 다른가?
- Standard error(표준오차) 또는 Confidence interval(신뢰구간): 추정값은 표본에 따라 얼마나 흔들리는가?
- 정확한 P-value(P값)와 미리 정한 Significance level(유의수준): 어떤 판단 규칙을 사용했는가?
- 함께 시험한 전체 가설 수와 보정 방법: 작은 P값을 얻을 기회가 몇 번 있었는가?
자주 생기는 오해
- 오해:
P값 3.6%이므로 귀무가설이 참일 확률은 3.6%다.올바른 뜻: 실제 평균을 70점으로 놓았을 때 이번처럼 멀어진 표본 결과가 나올 비율이 약 3.6%라는 뜻이다. - 오해:
통계적으로 유의하므로 평균 차이 4.2점은 반드시 크고 중요하다.올바른 뜻: 4.2점은 효과 크기로 따로 읽고, 그 중요도는 통계적 유의성만으로 결정하지 않는다. - 오해:
표본을 늘려 P값이 작아졌으니 효과 크기도 커졌다.올바른 뜻: 표준오차가 작아져 같은 효과를 더 정밀하게 구분했을 수 있다. - 오해:
20개 검정을 각각 5%로 판단해도 전체 오류 가능성은 5%다.올바른 뜻: 독립 검정이라면 적어도 하나의 거짓 양성이 나올 확률이 약 64.2%까지 커진다. - 오해:
본페로니 보정을 적용했으니 유의한 결과는 모두 참이다.올바른 뜻: 보정은 정한 검정 묶음의 제1종 오류만 관리하며 자료와 가정의 오류까지 없애지 않는다.
이해 점검
P값 약 3.6%와 유의수준 5%를 어떤 순서로 비교하는가?
유의수준 5%를 자료보다 먼저 정하고, 자료에서 계산한 P값 약 3.6%가 그보다 작은지 확인한다. 3.6%가 5%보다 작으므로 귀무가설을 기각하고 5% 기준에서 통계적으로 유의하다고 말한다.
표본평균이 74.2점으로 같아도 표준오차가 달라지면 P값이 달라지는 이유는 무엇인가?
70점과의 차이 4.2점을 표준오차로 나누어 Z통계량을 계산하기 때문이다. 표준오차가 작으면 같은 차이가 표준오차 단위로 더 멀리 놓이고, 양측 P값도 작아질 수 있다.
효과가 없는 독립 검정 20개를 각각 5%로 시험할 때 적어도 하나의 거짓 양성이 나올 확률은 얼마인가?
으로 계산한 약 64.2%다. 각 검정의 5%를 단순히 더한 값은 아니며, 모든 검정이 효과가 없고 서로 독립이라는 조건에서 계산한 확률이다.
20개 검정에 본페로니 보정을 적용하면 각 P값을 무엇과 비교하는가?
검정 묶음 전체 기준 5%를 20으로 나눈 0.25%와 비교한다. 이 보정은 검정 묶음 전체의 제1종 오류 확률을 5% 이하로 관리하기 위한 보수적인 방법이다.
완료 기준
다음 네 가지를 자신의 말로 설명할 수 있으면 5.9를 마친 것이다.
- P값과 유의수준을 비교한 뒤 통계적 유의성이라는 판단을 내리는 순서
- 효과 크기 4.2점과 표준오차 단위 거리 이 답하는 질문의 차이
- 독립 검정 20개에서 적어도 하나의 거짓 양성이 나올 확률이 약 64.2%로 커지는 이유
- 본페로니 보정이 각 검정의 판단선을 0.25%로 낮추는 이유와 해결하지 못하는 문제
다음 5.10에서는 모집단 표준편차를 모르는 작은 두 표본의 평균 차이를 t분포로 비교한다.
이 자료의 점수, P값과 반복 검정은 통계 개념을 설명하기 위한 가상 계산이며 실제 수업 효과를 주장하지 않는다.