CHAPTER 05.7 / HYPOTHESIS TESTING
5.7 기준 주장을 세우고 자료로 판단하기
평균 70점이라는 기준과 표본평균을 비교하며 가설과 판단 규칙을 세우는 순서를 살펴봅니다.
5.7 기준 주장을 세우고 자료로 판단하기
기존 시험의 평균이 70점일 때 새로운 수업을 받은 학생들의 평균이 달라졌다고 판단할 수 있는지 살펴보자. 이 페이지의 목표는 Hypothesis testing(가설검정)에서 가정하는 것, 관측하는 것, 판단하는 것과 오류를 명확히 구분하는 것이다.
지난 여러 해 동안 같은 방식으로 치른 시험의 평균이 70점이었다고 하자. 새로운 수업을 받은 학생 25명의 평균은 74.2점이었다. 이 4.2점 차이는 수업과 관련된 변화일 수도 있고, 우연히 점수가 높은 학생들이 표본에 들어와 생긴 흔들림일 수도 있다.
먼저 아래 도구에서 70점과 다른가, 70점보다 높은가, 70점보다 낮은가 가운데 질문을 고르고 25명의 평균을 움직여 보자. 화면에 나오는 계산 용어는 해당 값 옆에서 바로 쉬운 말로 설명한다.
질문 방향과 유의수준 5%는 자료를 보기 전에 정했다고 가정합니다. 25명의 평균을 움직이면 Z통계량과 기각역 포함 여부가 바뀌지만, 기각역의 전체 비율 5%는 바뀌지 않습니다.
- 판단할 기준 주장
- Null hypothesis(귀무가설): Population mean(모집단 평균)은 70점
- 선택한 질문
- 양측 · 다른가?
- 관측 평균 → 표준오차로 잰 거리
- 74.2점 → 2.10배
- Z test statistic(Z 검정통계량)으로 표시한 기각 범위
- z ≤ -1.96 또는 z ≥ 1.96
- 점수로 바꾼 Rejection region(기각역)
- 66.08점 이하 또는 73.92점 이상
- 기각 범위 전체 비율인 유의수준 α
- 왼쪽 2.5% + 오른쪽 2.5% = 전체 5%
모집단 평균이 70점과 다르다는 통계적 증거가 있습니다. 표본에서 관측된 차이의 방향은 70점보다 높은 쪽입니다.
표본평균은 판단에 사용하는 관측값입니다. 기각하거나 기각하지 못하는 대상은 표본평균이 아니라 귀무가설입니다. 이 판단은 새 수업의 Causal effect(인과효과)를 증명하지 않습니다.
방금 도구에서 한 일을 이해하려면 현실의 상태, 계산을 위한 가정, 관측한 자료와 검정의 판단을 분리해야 한다.
| 구분 | 이 예시의 내용 | 연구자가 아는가? |
|---|---|---|
| 현실의 상태 | Population mean(모집단 평균)이 실제로 70점인가? | 알 수 없다 |
| 계산의 가정 | 평균이 70점이라고 놓고 표본평균의 분포를 계산한다 | 연구자가 정한다 |
| 관측한 자료 | Sample mean(표본평균) 74.2점 | 표본에서 계산한다 |
| 검정의 판단 | 70점이라는 기준 주장을 기각하거나 기각하지 못한다 | 미리 정한 규칙으로 결정한다 |
표본평균 74.2점은 판단에 사용하는 관측값이다. 표본평균을 기각하는 것이 아니라, 표본평균으로 계산한 결과를 이용해 70점이라는 기준 주장을 기각할지 판단한다.
참이라고 가정하는 것과 참이라고 판정하는 것은 다르다
Null hypothesis(귀무가설) 는 검정 계산의 기준으로 놓는 구체적인 주장이다. Alternative hypothesis(대립가설) 은 자료가 귀무가설 아래에서 보기 드물 때 지지하려는 방향이다.
- : 새로운 수업을 받은 학생들의 모집단 평균은 70점이다.
- : 새로운 수업을 받은 학생들의 모집단 평균은 70점과 다르다.
귀무가설이 참이라고 가정한다는 말은 귀무가설이 참이라고 이미 판정했다는 뜻이 아니다. 만약 실제 평균이 70점이라면 여러 표본평균은 어떻게 분포할까?라는 조건을 놓고 계산한다는 뜻이다. 실제 평균이 70점인지 아닌지는 여전히 알 수 없다.
검정 결과도 귀무가설이 참이다와 귀무가설이 거짓이다로 확정하지 않는다.
- Reject(기각): 관측 결과가 귀무가설 아래에서 미리 정한 기각역에 들어가므로 귀무가설을 유지하기 어렵다고 판단한다.
- Fail to reject(기각하지 못함): 관측 결과가 기각역에 들어가지 않아 귀무가설을 버릴 근거가 부족하다고 판단한다.
귀무가설이 맞아도 드문 표본은 나올 수 있다. 따라서 기각은 이런 결과는 절대로 나올 수 없다고 판단하는 것이 아니다. 기각하지 못함도 귀무가설이 참이라는 증명이 아니다.
찾고 싶은 차이에 따라 보는 방향을 먼저 정한다
실제 평균이 70점이라고 놓으면 표본평균은 대부분 70점 근처에 나오지만 가끔 매우 낮거나 높은 값도 나온다. Sampling distribution(표본분포)의 중심에서 멀리 떨어진 끝부분을 Tail(꼬리)이라고 한다.
어느 꼬리를 기각 후보로 볼지는 자료를 확인하기 전에 연구 질문으로 정한다.
| 검정 방향 | 자료를 보기 전에 묻는 질문 | 사용하는 꼬리 | 대립가설 |
|---|---|---|---|
| Two-sided test(양측검정) | 70점과 다른가? | 왼쪽과 오른쪽 | |
| Right-tailed test(상측검정) | 70점보다 높은가? | 오른쪽 | |
| Left-tailed test(하측검정) | 70점보다 낮은가? | 왼쪽 |
수업 뒤 점수가 높아졌는지만 확인하려면 상측검정을 정할 수 있다. 높아지거나 낮아지는 변화가 모두 중요하면 양측검정을 정한다. 표본평균 74.2점을 본 뒤 유리한 방향으로 바꾸면 처음 계획한 오류율을 유지할 수 없다.
유의수준 하나를 두 관점으로 읽는다
Significance level(유의수준) 는 자료를 보기 전에 정하는 값이다. 이 예시에서는 양측검정과 유의수준 5%를 먼저 정했다고 하자.
귀무가설이 참이라고 놓고 만든 표본분포에서 양쪽 꼬리를 합해 5%가 되도록 범위를 표시한다. 이 범위가 Rejection region(기각역)이다. 양측검정이라면 왼쪽 2.5%와 오른쪽 2.5%가 기각역이 된다.
같은 5%는 다음 두 관점으로 읽을 수 있다.
- 분포 관점: 귀무가설 아래에서 기각역이 차지하는 전체 확률은 5%다.
- 오류 관점: 귀무가설이 실제로 참일 때 기각역에 들어가 잘못 기각할 확률은 5%다.
평균 70점 예시로 이 관계를 짧게 이어 보자.
- 현실에서도 실제 평균이 70점이라면 는 참이다.
- 표본 결과가 기각역에 들어오면 미리 정한 규칙에 따라 를 기각한다.
- 참인 를 기각했으므로 이 판단은 Type I error(제1종 오류)다.
따라서 가 참이라는 조건에서는 기각역에 들어감과 제1종 오류가 발생함이 같은 사건이다.
수식의 는 오른쪽 조건이 참이라고 놓았을 때라고 읽는다. 라면 를 조건으로 놓았을 때 가 일어날 확률이라는 뜻이다.
- : 귀무가설이 참이라고 가정했을 때, 즉 모집단 평균을 70점으로 놓았을 때 표본 결과가 기각역에 들어갈 확률
- : 같은 가정 아래에서 표본 결과 때문에 귀무가설을 잘못 기각할 확률
- 괄호 안의 사건이 일어날 Probability(확률)
- 단위: % 또는 0과 1 사이의 값
- 오른쪽 내용을 조건으로 놓는다는 뜻
- 단위: 없음
- 검정 계산의 기준으로 놓은 Null hypothesis(귀무가설)
- 예시: 실제 평균이 이다
- 귀무가설 아래에서 기각역이 차지하는 전체 확률인 Significance level(유의수준)
- 예시 값:
- 단위: %
두 확률을 따로 정했는데 우연히 같은 값이 된 것이 아니다. 가 참일 때는 기각역에 들어가 귀무가설을 기각하는 일이 곧 제1종 오류이므로, 같은 사건을 두 관점에서 읽는 것이다.
α를 낮추면 경계가 중심에서 멀어져 기각역이 좁아지고, α를 높이면 경계가 중심에 가까워져 기각역이 넓어집니다. 이 기준은 자료를 보기 전에 정합니다.
- 귀무가설 아래 기각역 전체 확률
- 왼쪽 2.5% + 오른쪽 2.5% = 전체 5%
- 기각하는 Z 범위
- z ≤ -1.96 또는 z ≥ 1.96
- 귀무가설이 실제로 참일 때
- 잘못 기각할 확률 = 5%
두 확률을 따로 정한 것이 아닙니다. 귀무가설이 실제로 참이라면 기각역에 들어간 결과를 기각하는 일이 곧 제1종 오류이므로 같은 α로 나타납니다.
유의수준을 낮추면 기각역이 좁아져 귀무가설을 기각하기 어려워진다. 유의수준을 높이면 기각역이 넓어져 기각하기 쉬워진다. 어느 쪽이든 결과를 본 뒤 기준을 바꾸지 않는다.
실제 상태와 검정 판단을 교차해 오류를 구분한다
실제 상태와 검정 판단을 교차하면 네 가지 경우가 생긴다.
| 실제 상태 | 귀무가설을 기각 | 귀무가설을 기각하지 못함 |
|---|---|---|
| 가 참 실제 평균이 70점 | Type I error(제1종 오류) False alarm(거짓 경보) | 올바른 판단 |
| 가 거짓 실제 평균이 70점과 다름 | 올바른 판단 | Type II error(제2종 오류) Miss(놓침) |
이제 표에 나온 오류를 화재경보기로 비유해 보자. 경보기는 센서가 측정한 연기나 열이 미리 정한 경보 기준을 넘으면 울린다. 실제 화재가 없어도 요리 연기나 수증기 때문에 경보가 울릴 수 있고, 화재가 나도 연기나 열이 충분히 감지되지 않으면 경보가 울리지 않을 수 있다.
이 비유에서는 화재가 없다를 귀무가설 로 놓고, 경보가 울리면 를 기각한다고 생각한다.
- Type I error(제1종 오류): 화재가 없는데 경보가 울린다. 이 False alarm(거짓 경보)의 확률이 다.
- Type II error(제2종 오류): 화재가 있는데 경보가 울리지 않는다. 이 Miss(놓침)의 확률이 다.
- Statistical power(검정력): 화재가 있을 때 경보가 제대로 울린다. 이 Sensitivity(탐지 민감도)는 실제 화재를 감지할 확률이며 다.
경보 기준을 낮추면 적은 연기에도 경보가 울린다. 그러면 실제 화재를 더 잘 감지하지만 요리 연기에도 잘못 울릴 수 있다. 다른 조건이 같을 때 와 검정력은 커지고 는 작아진다. 경보 기준을 높이면 반대가 된다. 가설검정에서 기각역을 넓히거나 좁힐 때도 같은 관계가 나타난다.
여기서 경보기 설정 화면의 민감도 설정은 경보 기준을 조절하는 행위다. Statistical power(검정력)는 그 설정 자체가 아니라, 정해진 기준에서 실제 화재가 났을 때 경보가 울리는 실제 화재 탐지율이다.
또한 와 검정력은 만으로 정해지지 않는다. 화재가 얼마나 강한지, 센서의 수와 관측 정보가 얼마나 충분한지, 수증기나 먼지 같은 잡음이 얼마나 큰지에 따라 화재를 놓칠 가능성이 달라진다. 따라서 유의수준 하나만 보고 제2종 오류 확률을 숫자로 정할 수는 없다.
조건의 방향도 구분해야 한다. 이 비유에서 유의수준 5%는 , 즉 화재가 없다고 놓았을 때 경보가 잘못 울릴 확률이다. 경보가 울린 뒤 우리가 궁금해할 수 있는 와는 조건의 순서가 반대다. 뒤의 확률을 구하려면 실제 화재가 얼마나 자주 발생하는지와 경보기의 화재 탐지율 같은 정보도 필요하다.
평균 70점 사례로 돌아오면 는 실제 평균이 70점인데도 70점과 다르다고 잘못 판단할 확률이다. 는 실제 평균이 70점과 다른데도 그 차이를 발견하지 못할 확률이고, 는 실제 차이를 제대로 발견할 확률이다. 연구자는 실제 모집단 평균을 모르므로, 이번 기각이 올바른 판단인지 제1종 오류인지 즉시 알 수 없다.
여기서 유의수준 5%는 모집단 평균이 정말 70점이라고 가정했을 때, 표본의 우연한 흔들림 때문에 잘못 기각할 확률이 5%라는 뜻이다. 이미 이번 자료로 귀무가설을 기각한 뒤 이번 기각이 잘못되었을 확률이 5%라는 뜻은 아니다. 두 문장은 조건의 순서가 다르다.
표본평균을 Z통계량으로 바꿔 귀무가설을 판단한다
이제 관측한 표본평균을 미리 정한 기각역과 비교해 보자. 5.6에서 살펴본 Standard error(표준오차)는 표본을 바꿔 뽑을 때 표본평균이 흔들리는 정도다. 이 예시에서는 표준오차가 2점이라고 알고 있다고 가정한다.
Z test statistic(Z 검정통계량)은 표본평균이 귀무가설의 기준에서 표준오차 몇 배만큼 떨어졌는지를 나타낸다.
- 귀무가설의 기준과 표본평균 사이의 거리를 표준오차 단위로 나타낸 Z test statistic(Z 검정통계량)
- 단위: 없음
- 새로운 수업을 받은 25명에게서 관측한 Sample mean(표본평균)
- 예시 값:
- 단위: 점
- Null hypothesis(귀무가설)가 주장하는 Population mean(모집단 평균)
- 예시 값:
- 단위: 점
- 표본을 바꿔 뽑을 때 표본평균이 흔들리는 정도인 Standard error(표준오차)
- 예시 값:
- 단위: 점
표본평균 74.2점은 기준 70점에서 4.2점 떨어져 있고, 이는 표준오차 2점의 2.1배다.
유의수준 5%에서 검정 방향에 따른 기각역은 다음과 같다.
| 검정 방향 | 기각역 확률 | Z 경계 | 점수 경계 |
|---|---|---|---|
| Two-sided test(양측검정) | 왼쪽 2.5% 오른쪽 2.5% | 또는 | 66.08점 이하 또는 73.92점 이상 |
| Right-tailed test(상측검정) | 오른쪽 5% | 73.29점 이상 | |
| Left-tailed test(하측검정) | 왼쪽 5% | 66.71점 이하 |
앞의 도구에서 본 표본평균 74.2점과 을 정식 용어로 다시 읽으면 다음과 같다.
- 양측검정에서는 오른쪽 기각역에 들어가므로
모집단 평균이 70점과 다르다는 방향으로 귀무가설을 기각한다. - 상측검정에서는 오른쪽 기각역에 들어가므로, 높은 방향을 자료보다 먼저 정했다는 전제에서
모집단 평균이 70점보다 높다는 방향으로 귀무가설을 기각한다. - 하측검정에서는 기각역에 들어가지 않는다. 높은 표본평균은
모집단 평균이 70점보다 낮다는 질문의 증거가 아니다.
기각 대상은 표본평균 74.2점이 아니라 모집단 평균은 70점이다라는 귀무가설이다. 이 판단은 모집단 평균이 정확히 74.2점이라는 뜻도, 새 수업이 점수를 높인 Causal effect(인과효과)가 있다는 뜻도 아니다.
기각역 판단을 P값으로도 표현할 수 있다
귀무가설과 검정모형이 맞다면 표본평균이 74.2점 이상이거나 반대쪽으로 같은 만큼 떨어진 65.8점 이하가 나올 가능성은 약 3.6%다. 이것은 표본평균이 정확히 74.2점일 가능성이 아니라, 현재 결과와 같거나 더 극단적인 양쪽 결과 전체의 가능성이다.
약 3.6%의 결과는 실제로 나올 수 있다. 다만 미리 정한 유의수준 5%보다 작으므로 이번 양측검정에서는 귀무가설을 기각한다. 이 3.6%를 P-value(P값)라고 하며 다음 5.8에서 계산 방법을 살펴본다.
P값 3.6%는 이번 판단이 틀릴 확률이 3.6%라는 뜻이 아니다. 귀무가설이 틀릴 확률이 96.4%라는 뜻도 아니다. 귀무가설이 맞다고 놓았을 때 현재 결과와 같거나 더 극단적인 결과가 나올 확률이다.
기각하지 못함은 70점이 참이라는 증명이 아니다
표본평균이 72점이고 표준오차가 2점이라면 이다. 이 값은 5% 양측검정의 경계인 약 과 사이에 있다. 평균이 70점이어도 충분히 나올 수 있는 범위이므로 귀무가설을 기각하지 못한다.
올바른 문장은 현재 자료만으로 모집단 평균이 70점이라는 주장을 버릴 근거가 충분하지 않았다이다. 평균이 70점으로 증명되었다거나 새 수업은 효과가 없다고 확정하면 안 된다. 실제 차이가 작거나 학생 수가 적고 점수의 흔들림이 크면 차이가 있어도 발견하지 못할 수 있다.
계산 전에 검정이 자료에 맞는지도 확인한다
Z통계량의 계산이 맞더라도 자료를 모은 방법과 검정의 가정이 맞지 않으면 결론을 믿기 어렵다. 숫자를 공식에 넣기 전에 다음 네 가지를 확인한다.
- 누구를 대표하는 표본인가? Sample(표본)은 확인하려는 학생 집단을 대표해야 한다. 성적이 높은 학생만 골라 조사했다면 표본평균 74.2점은 새로운 수업을 받은 전체 학생의 평균을 보여 주지 못한다.
- 각 점수가 서로 다른 정보인가? Independence(독립성)는 한 학생의 점수가 다른 학생의 점수를 직접 결정하지 않는다는 가정이다. 같은 학생의 점수를 두 번 넣거나 서로 답을 공유한 학생들을 모두 별개로 세면, 25개의 점수가 독립적인 정보 25개가 되지 않는다.
- 표준오차를 자료 수집 방법에 맞게 계산했는가? 한 반이나 한 학교 단위로 학생을 뽑으면 같은 환경의 학생 점수가 서로 비슷할 수 있다. 이를 개인 25명을 완전히 무작위로 뽑은 것처럼 계산하면 Standard error(표준오차)를 실제보다 작게 볼 수 있다.
- 판단 규칙을 결과보다 먼저 정했는가? 제외할 학생, 이상치 처리, 검정 방향과 유의수준은 점수를 보기 전에 정한다. 74.2점을 본 뒤 낮은 점수만 제외하거나 양측검정을 상측검정으로 바꾸면 원하는 결론이 나오기 쉬워지고 처음 계획한 오류율도 유지되지 않는다.
가설검정 공식은 대표성이 부족한 표본, 중복된 정보와 잘못 계산한 표준오차를 자동으로 고쳐 주지 않는다. 계산 결과가 정확해 보여도 이 조건이 맞지 않으면 Z통계량과 오류율의 의미도 달라진다.
자주 생기는 오해
- 오해:
귀무가설을 참이라고 가정했으니 평균은 70점이다.올바른 뜻: 평균이 70점이라고 판정한 것이 아니라, 평균이 70점이라고 놓았을 때 가능한 표본 결과를 계산한 것이다. - 오해:
표본평균 74.2점을 기각한다.올바른 뜻: 74.2점은 판단에 사용한 관측값이다. 기각하는 대상은모집단 평균은 70점이다라는 귀무가설이다. - 오해:
귀무가설을 기각하지 못했으니 평균이 70점으로 증명되었다.올바른 뜻: 현재 자료만으로 70점이라는 주장을 버릴 근거가 충분하지 않았다는 뜻이다. 실제 차이가 작거나 자료가 부족해 놓쳤을 수도 있다. - 오해:
귀무가설을 기각했으니 새 수업의 효과가 크고 실제로 유용하다.올바른 뜻: 관측 결과가 70점이라는 기준과 양립하기 어려웠다는 뜻일 뿐이다. Effect size(효과 크기), Causal effect(인과효과)와 실제 활용 가치는 별도로 확인해야 한다.
이해 점검
귀무가설을 참이라고 가정한다는 말은 무엇을 뜻하는가?
귀무가설을 참으로 판정했다는 뜻이 아니라, 귀무가설이 참인 조건에서 표본평균의 분포와 기각역 확률을 계산한다는 뜻이다.
표본평균과 귀무가설 가운데 무엇을 기각하는가?
표본평균은 Z통계량을 계산하는 관측값으로 사용하고, 기각 여부를 판단하는 대상은 귀무가설이다.
기각역 확률 5%와 제1종 오류 확률 5%가 같은 이유는 무엇인가?
귀무가설이 실제로 참이라면 기각역에 들어간 결과를 기각하는 모든 경우가 제1종 오류이므로 같은 유의수준으로 나타난다. 제2종 오류 확률은 이 값과 같지 않으며 표본 크기, 실제 차이와 잡음에도 영향을 받는다.
귀무가설을 기각하지 못했을 때 어떻게 써야 하는가?
현재 자료만으로 귀무가설을 버릴 근거가 충분하지 않았다고 쓴다. 귀무가설이 참으로 증명되었다고 쓰지 않는다.
완료 기준
다음 세 가지를 자신의 말로 설명할 수 있으면 5.7을 마친 것이다.
평균이 70점이라고 가정한다는 말은 계산의 기준으로 놓는다는 뜻이며, 실제 평균이 70점으로 확인되었다는 뜻이 아니다.- 실제 평균이 70점인데 표본 결과가 기각역에 들어가면 참인 귀무가설을 잘못 기각한 Type I error(제1종 오류)가 된다.
- Z통계량은 표본평균이 기준 70점에서 표준오차 몇 배만큼 떨어졌는지 보여 준다. 이 값을 기각역과 비교해 귀무가설을 기각할지 판단한다.
다음 5.8에서는 P-value(P값)를 배운다. P값은 귀무가설을 기준으로 현재 결과와 같거나 더 극단적인 결과가 나올 확률이다.
이 자료의 시험 점수와 전략 가설은 통계 절차를 설명하기 위한 가상 예시이며 실제 수업 효과나 투자 성과를 입증하지 않는다.