Q

PRIVATE NAVIGATION MODE

ML4T 탭 잠금 해제

패스워드를 확인하면 이 브라우저에서 ML4T 탭과 검색 결과를 표시합니다.

STUDY SEARCH

학습 자료 검색

제목과 설명, 키워드, 학습 본문에서 찾습니다.

검색 범위

검색어를 입력해 주세요.

SEARCH THE NOTEBOOK

찾고 싶은 금융·통계·전략 개념을 입력해 보세요.

CHAPTER 05.8 / P-VALUE

5.8 귀무가설 아래에서 관측 이상 결과가 나올 정도

귀무가설 아래에서 관측 Z통계량과 같거나 더 극단적인 꼬리 면적을 계산합니다.

5장. 기댓값·공분산·가설검정·회귀와 자기상관초급 학습 노트

5.8 귀무가설 아래에서 관측 이상 결과가 나올 정도

이 페이지는 5장의 필수 개념이다. 5.7의 시험 점수 사례를 이어서 P-value(P값)가 어떤 질문에 답하는 숫자인지 이해하고, P값과 유의수준·효과 크기·가설의 확률을 구분하는 것이 목표다.

5.7에서는 새로운 수업을 받은 학생들의 실제 평균은 70점이다를 계산의 기준으로 놓았다. 이것이 Null hypothesis(귀무가설) H0H_0다. 학생 25명의 Sample mean(표본평균)은 74.2점이었고, 기준 70점에서 Standard error(표준오차)의 2.1배만큼 떨어져 있었다. 이를 Z test statistic(Z 검정통계량) z=2.1z=2.1이라고 나타냈다.

Normal distribution(정규분포)에서 Z 거리와 양쪽 비율을 함께 보기65.8점 이하와 74.2점 이상은 모두 기준에서 표준오차 2.1배 이상 떨어진 결과입니다.
Z값 마이너스 2.1 이하와 플러스 2.1 이상의 양쪽 영역평균 70점을 중심으로 한 정규분포에서 65.8점 이하는 Z값 마이너스 2.1 이하이고, 74.2점 이상은 Z값 플러스 2.1 이상입니다. 왼쪽 약 1.8%와 오른쪽 약 1.8%를 합한 P값은 약 3.6%입니다.약 1.8%기준 70점약 1.8%z = −2.1z = 0z = +2.1가로축: 기준에서 떨어진 거리, Z 단위
왼쪽
z ≤ −2.1
65.8점 이하
가운데
z = 0
기준 70점
오른쪽
z ≥ +2.1
74.2점 이상

왼쪽 약 1.8% + 오른쪽 약 1.8% = P-value(P값) 약 3.6%

가상으로 1,000번 반복하면 양쪽을 합해 평균적으로 약 36번 나타날 정도입니다.

먼저 P값이 답하는 질문을 숫자로 본다

실제 평균이 70점이어도 어떤 학생 25명이 뽑혔는지에 따라 표본평균은 달라질 수 있다. 그러므로 다음과 같은 반복을 상상해 보자.

  1. 실제 평균은 70점이라고 놓는다.
  2. 같은 방법으로 학생 25명을 새로 뽑는다.
  3. 뽑힌 25명의 표본평균을 계산한다.
  4. 이 과정을 매우 많이 반복한다.

이번 표본평균 74.2점은 기준 70점보다 4.2점 높다. 5.7에서 높거나 낮은 변화를 모두 확인하는 Two-sided test(양측검정)를 먼저 정했으므로, 반대쪽으로도 4.2점 이상 떨어진 결과를 함께 세어야 한다. 따라서 다음 두 범위를 센다.

  • 표본평균이 74.2점 이상인 경우
  • 표본평균이 65.8점 이하인 경우

평균을 70점으로 놓고 계산하면 이 두 범위는 전체 가능한 반복 결과의 약 3.6%를 차지한다. 가상의 반복이 1,000번이라면 평균적으로 약 36번 나타날 정도라는 뜻이다. 실제로 1,000번 반복했을 때 반드시 정확히 36번 나온다는 뜻은 아니다.

이 약 3.6%가 이번 양측검정의 P-value(P값)다.

P값은 다음 질문에 답하는 숫자라고 읽으면 된다.

실제 평균이 70점이라고 놓고 학생 25명을 계속 다시 뽑는다면, 이번처럼 표본평균이 70점에서 4.2점 이상 떨어지는 일은 얼마나 자주 생길까?

통계에서는 이번처럼 70점에서 4.2점 이상 떨어진 결과현재 결과와 같거나 더 Extreme result(극단적인 결과)라고 부른다. 여기서 극단적이라는 말은 놀랍거나 나쁘다는 뜻이 아니라, 미리 정한 방향에서 기준 70점보다 멀리 떨어져 있다는 뜻이다.

반복해서 얻을 수 있는 Z통계량을 모두 모아 만든 분포를 Null distribution(귀무분포)이라고 한다. 이 예시에서는 실제 평균이 70점이다라고 놓았을 때 나올 수 있는 Z통계량들의 분포다. 분포 곡선의 양 끝부분인 Tail(꼬리) 가운데 이번 결과와 같은 거리이거나 더 먼 부분의 비율이 약 3.6%다.

서로 다른 네 숫자를 같은 사례로 구분한다

P값 3.6%만으로 다른 종류의 질문까지 답할 수는 없다. 각 숫자가 답하는 질문을 같은 시험 점수 사례로 비교해 보자.

숫자쉽게 묻는 질문이 예시의 답
P-value(P값)평균을 70점으로 놓으면 이번만큼 멀어진 표본이 얼마나 자주 나오는가?약 3.6%
Significance level(유의수준)P값이 얼마보다 작을 때 기준 주장을 기각하기로 했는가?자료 전에 정한 5%
Effect size(효과 크기)관측한 표본평균은 기준보다 실제로 몇 점 높은가?74.270=4.274.2-70=4.2\text{점}
Posterior probability(사후확률)74.2점이라는 자료를 본 뒤에도 실제 평균이 70점일 가능성은 얼마인가?P값만으로는 알 수 없음

P값은 자료를 본 뒤 계산하지만, Significance level(유의수준) α\alpha는 자료를 보기 전에 정한 판단선이다. 이 예시에서는 p3.6%p\approx3.6\%α=5%\alpha=5\%보다 작으므로 5.7에서 정한 규칙에 따라 귀무가설을 기각한다.

Effect size(효과 크기)는 관측한 차이 자체다. 이 예시의 효과 크기는 4.2점이다. P값은 이 차이가 표본을 바꿔 뽑을 때의 흔들림과 비교해 얼마나 드문지를 나타내므로, P값 3.6%와 효과 크기 4.2점은 서로 다른 숫자다.

사후확률은 출발점과 질문이 다르다

Posterior probability(사후확률)는 자료를 본 뒤 어떤 주장이 맞을 가능성을 묻는 숫자다. 시험 점수 사례에서는 표본평균 74.2점을 본 뒤, 새로운 수업을 받은 학생들의 실제 평균이 여전히 70점일 가능성은 얼마인가?라고 묻는다.

P값과 사후확률은 다음처럼 질문의 출발점이 반대다.

구분먼저 놓는 내용그다음 묻는 내용
P값실제 평균은 70점이다74.2점처럼 멀어진 표본이 얼마나 자주 나오는가?
사후확률표본평균 74.2점을 관측했다실제 평균이 70점일 가능성은 얼마인가?

5.7의 화재경보기 예시로도 같은 차이를 볼 수 있다. 화재가 없을 때 경보가 울릴 가능성을 안다고 해서 경보가 울린 뒤 화재가 없을 가능성을 바로 알 수는 없다. 실제 화재가 얼마나 자주 발생하는지와 화재가 있을 때 경보가 얼마나 잘 울리는지도 알아야 한다. 화재가 거의 없는 건물과 화재가 자주 나는 장소에서는 같은 경보가 울려도 실제 화재일 가능성이 다를 수 있다.

같은 P값 3.6%를 얻어도 사후확률은 배경 정보에 따라 달라질 수 있다. 두 상황을 비교해 보자.

  • 비슷한 새 수업을 여러 번 시험했지만 대부분 평균이 달라지지 않았다면, 자료를 보기 전에는 이번에도 실제 평균은 70점일 것이라는 주장에 비교적 큰 무게를 둘 수 있다.
  • 같은 방식의 새 수업이 여러 연구에서 꾸준히 점수를 높였다면, 자료를 보기 전부터 실제 평균은 70점보다 높을 것이라는 주장에 더 큰 무게를 둘 수 있다.

두 상황에서 이번 표본평균이 똑같이 74.2점이고 P값도 똑같이 3.6%일 수 있다. 그러나 과거 정보가 다르므로 자료를 본 뒤 실제 평균이 70점일 가능성은 서로 다를 수 있다.

사후확률을 계산하려면 자료를 보기 전에 각 주장에 어느 정도 무게를 둘지와, 실제 평균이 70점이 아닐 때 74.2점 같은 자료가 얼마나 잘 나오는지도 필요하다. 자료를 보기 전에 주장에 두는 무게를 Prior probability(사전확률)라고 한다. P값은 이 정보들을 모두 제공하지 않으므로 P값만 보고 사후확률을 계산할 수 없다.

이제 꼬리의 비율을 수식으로 계산한다

앞에서는 3.6%의 뜻을 반복해서 표본을 뽑는 상황으로 이해했다. 이제 그 비율을 계산하는 기호를 살펴보자.

Φ(z)\Phi(z)는 평균이 0이고 표준편차가 1인 Standard normal distribution(표준정규분포)에서 특정 zz보다 왼쪽에 놓인 전체 비율을 알려 주는 함수다. 정식 이름은 Cumulative distribution function(누적분포함수)이다.

zobsz_{\mathrm{obs}}는 이번 표본에서 관측한 Z통계량이다. zobs\lvert z_{\mathrm{obs}}\rvert는 양수와 음수 방향을 무시하고 0에서 떨어진 거리만 본다는 뜻이다. 1Φ(zobs)1-\Phi(\lvert z_{\mathrm{obs}}\rvert)로 오른쪽 꼬리의 비율을 구하고, 양측검정에서는 반대쪽 꼬리도 포함하므로 2를 곱한다.

p=2[1Φ(zobs)]p = 2\left[1-\Phi(\lvert z_{\mathrm{obs}}\rvert)\right]
pp
양측 Z검정에서 두 꼬리의 비율을 합한 P-value(P값)
예시 값: 약 0.0360.036 또는 3.6%3.6\%
단위: 0~1의 비율 또는 %
Φ\Phi
표준정규분포에서 입력한 Z값보다 왼쪽에 놓인 비율을 반환하는 Cumulative distribution function(누적분포함수)
단위: 0~1의 비율
zobsz_{\mathrm{obs}}
이번 표본에서 계산한 Z test statistic(Z 검정통계량)
예시 값: 2.12.1
단위: 없음
zobs\lvert z_{\mathrm{obs}}\rvert
Z통계량의 부호를 제외하고 0에서 떨어진 거리만 나타낸 Absolute value(절댓값)
예시 값: 2.12.1
단위: 없음

같은 관측값도 미리 정한 질문에 따라 세는 영역이 다르다

아래 도구는 관측 Z통계량과 검정 방향을 바꿀 수 있다. 음영으로 칠한 부분이 선택한 검정에서 P값으로 세는 영역이다.

INTERACTIVE STUDY TOOLP값 꼬리 면적표준정규분포에서 귀무가설 기준점, 관측 Z통계량과 P값으로 세는 영역을 방향별로 비교합니다.
검정에서 묻는 방향
1.96
귀무가설 기준점
z = 0
관측값·P값 계산 경계
z = +1.96
귀무가설 기준점 z=0관측·경계 z=+1.96가로축: Z값

음영은 선택한 검정에서 P값으로 세는 영역입니다. 귀무가설 기준점 z=0과 관측값·P값 계산 경계를 구분해 보세요.

P값0.0500
현재 관측값
z = +1.96
P값으로 세는 범위
Z ≤ -1.96 또는 Z ≥ +1.96

귀무가설 기준점에서 1.96 이상 떨어진 양쪽 영역을 함께 셉니다.

귀무가설이 참일 확률이나 결과가 우연일 확률이 아닙니다.

도구의 처음 관측값인 zobs=+1.96z_{\mathrm{obs}}=+1.96을 예로 들어 보자. 아래 세 검정은 모두 **같은 관측값 +1.96+1.96**을 사용한다.

여기에는 서로 다른 두 위치가 있다. Null hypothesis(귀무가설)가 주장하는 평균 70점은 Z축에서 z=0z=0이며, 높은가·낮은가·다른가를 판단할 때 비교하는 귀무가설 기준점이다. zobs=+1.96z_{\mathrm{obs}}=+1.96은 이번 자료에서 계산한 관측값이자 P값 면적의 경계다.

  • Right-tailed test(상측검정)는 모집단 평균이 귀무가설의 70점보다 높은가?를 묻는다. 관측값 +1.96+1.96을 경계로 Z+1.96Z\ge+1.96을 세므로 P값은 약 0.025다.
  • Two-sided test(양측검정)는 모집단 평균이 귀무가설의 70점과 다른가?를 묻는다. 0에서 관측값과 같은 거리인 1.96-1.96+1.96+1.96을 경계로 Z1.96Z\le-1.96Z+1.96Z\ge+1.96을 함께 세므로 P값은 약 0.05다.
  • Left-tailed test(하측검정)는 모집단 평균이 귀무가설의 70점보다 낮은가?를 묻는다. 같은 관측값 +1.96+1.96을 경계로 Z+1.96Z\le+1.96을 세므로 P값은 약 0.975다. 관측값이 질문과 반대인 높은 방향에 있으므로 왼쪽의 거의 전체가 포함된다.
pright0.025ptwo0.050pleft0.975\begin{aligned} p_{\mathrm{right}} &\approx 0.025 \\ p_{\mathrm{two}} &\approx 0.050 \\ p_{\mathrm{left}} &\approx 0.975 \end{aligned}
prightp_{\mathrm{right}}
기준보다 높은지를 묻는 Right-tailed test(상측검정)의 P값
단위: 0~1의 비율
ptwop_{\mathrm{two}}
기준과 다른지를 묻는 Two-sided test(양측검정)의 P값
단위: 0~1의 비율
pleftp_{\mathrm{left}}
기준보다 낮은지를 묻는 Left-tailed test(하측검정)의 P값
단위: 0~1의 비율

같은 관측값 zobs=+1.96z_{\mathrm{obs}}=+1.96도 어떤 질문을 자료보다 먼저 정했는지에 따라 세는 영역이 달라진다. 결과를 본 뒤 P값이 작아지는 방향으로 질문을 바꾸면 처음 정한 판단 규칙을 지킬 수 없다.

하측검정은 관측값의 왼쪽을 항상 센다

Left-tailed test(하측검정)의 P값은 항상 관측한 Z값의 왼쪽 전체 면적이다.

pleft=P(Zzobs)p_{\mathrm{left}} = P(Z\le z_{\mathrm{obs}})
pleftp_{\mathrm{left}}
기준보다 낮은지를 묻는 Left-tailed test(하측검정)의 P-value(P값)
단위: 0~1의 비율
P()P(\cdot)
괄호 안의 조건을 만족할 Probability(확률)
단위: 0~1의 비율
ZZ
귀무가설이 맞다고 놓았을 때 가능한 Z test statistic(Z 검정통계량)
단위: 없음
zobsz_{\mathrm{obs}}
이번 표본에서 실제로 계산한 관측 Z통계량이자 왼쪽 면적의 끝
단위: 없음

귀무가설 기준점과 Standard error(표준오차) 2점은 그대로 두고, 서로 다른 표본을 관측한 두 경우를 비교해 보자.

구분낮게 관측된 표본높게 관측된 표본
귀무가설 기준평균 70점, z=0z=0평균 70점, z=0z=0
관측 표본평균66.08점73.92점
관측 Z값zobs=1.96z_{\mathrm{obs}}=-1.96zobs=+1.96z_{\mathrm{obs}}=+1.96
세는 영역Z1.96Z\le-1.96Z+1.96Z\le+1.96
하측 P값약 0.025약 0.975
해석낮은 방향의 강한 근거70점일 때 가능한 결과의 약 97.5%가 관측값 이하이며, 관측값 자체도 높은 방향이므로 낮다는 근거가 없음

두 사례 모두 왼쪽을 세는 규칙은 같다. 달라진 것은 왼쪽 영역의 끝인 관측 Z값이다. 관측값이 1.96-1.96이면 작은 왼쪽 꼬리만 포함되어 P값이 약 0.025이고, 관측값이 +1.96+1.96이면 정규분포의 대부분이 포함되어 P값이 약 0.975다.

하측 P값 약 0.975를 해석하는 과정

  1. 실제 평균을 귀무가설의 70점으로 놓는다.
  2. 이번 표본평균 73.92점은 70점보다 높으며, 관측 Z값은 +1.96+1.96이다.
  3. Left-tailed test(하측검정)는 관측 Z값까지의 왼쪽 전체인 Z+1.96Z\le+1.96을 센다.
  4. 평균이 70점이라고 놓고 표본을 1,000번 반복해서 뽑는다고 상상하면, 약 975번의 결과가 이 범위에 들어간다.
  5. 이 범위가 큰 이유는 관측값이 낮은 쪽이 아니라 높은 쪽에 있기 때문이다. 따라서 현재 자료로는 모집단 평균이 70점보다 낮다는 주장을 지지할 수 없다.

P값 0.975는 모집단 평균이 70점보다 낮지 않을 확률이 97.5%라는 뜻도 아니고, 귀무가설이 맞을 확률이 97.5%라는 뜻도 아니다. 현재 자료가 하측검정이 찾는 낮은 방향에 있지 않다는 뜻이다.

P값이 말하지 않는 것

P값 3.6%는 다음과 같이 읽지 않는다.

  • 실제 평균이 70점일 확률이 3.6%라는 뜻이 아니다.
  • 실제 평균이 70점이 아닐 확률이 96.4%라는 뜻이 아니다.
  • 새 수업의 효과가 우연일 확률이 3.6%라는 뜻이 아니다.
  • 이번 판단이 틀릴 확률이 3.6%라는 뜻이 아니다.
  • 같은 연구를 다시 하면 같은 결론이 나올 확률이 96.4%라는 뜻이 아니다.

P값 계산은 학생을 어떻게 뽑았는지, 각 점수가 서로 독립적인지, 표본평균의 흔들림을 표준정규분포로 계산해도 되는지 같은 약속에 의존한다. 이런 계산의 가정과 규칙을 Statistical model(통계모형)이라고 한다. 표본이 학생 집단을 대표하지 못하거나 계산 가정이 맞지 않으면 작은 P값도 믿기 어렵다.

따라서 P값은 Effect size(효과 크기), Confidence interval(신뢰구간), Sample size(표본 크기)와 자료를 모은 방법을 함께 보고한다. 다음 5.9에서는 P값을 판단에 사용할 때 추가로 확인할 내용을 배운다.

이해 점검

이 예시의 P값 약 3.6%를 반복 표집으로 설명하면 무엇인가?

실제 평균을 70점으로 놓고 학생 25명을 같은 방법으로 계속 다시 뽑을 때, 표본평균이 74.2점 이상이거나 65.8점 이하인 경우가 전체 반복의 약 3.6%를 차지한다는 뜻이다.

양측검정에서 74.2점 이상과 65.8점 이하를 함께 세는 이유는 무엇인가?

두 값 모두 기준 70점에서 4.2점 이상 떨어져 있으며, 양측검정은 높고 낮은 변화를 모두 질문하기 때문이다.

P값 3.6%만으로 실제 평균이 70점일 사후확률을 알 수 없는 이유는 무엇인가?

P값은 실제 평균을 70점으로 먼저 놓고 자료가 얼마나 자주 나오는지 묻는다. 사후확률은 자료를 먼저 본 뒤 실제 평균이 70점일 가능성을 묻고, 이를 계산하려면 자료 전 정보와 다른 평균에서 자료가 나올 가능성도 필요하다.

P값이 작아도 효과 크기를 따로 확인해야 하는 이유는 무엇인가?

P값은 표본 크기와 표본평균의 흔들림에도 영향을 받으므로 관측한 차이가 실제로 크거나 중요한지를 직접 보여 주지 않기 때문이다.

완료 기준

다음 세 가지를 자신의 말로 설명할 수 있으면 5.8을 마친 것이다.

  1. 평균을 70점으로 놓고 표본을 반복해서 뽑을 때 74.2점 이상 또는 65.8점 이하가 나타나는 비율이 약 3.6%이며, 이것이 이번 양측검정의 P값이다.
  2. P값 3.6%, 유의수준 5%와 효과 크기 4.2점은 서로 다른 질문에 답한다.
  3. P값은 평균이 70점이라고 놓았을 때 자료가 나올 비율이고, 사후확률은 자료를 본 뒤 평균이 70점일 가능성이므로 P값만으로 사후확률을 알 수 없다.

다음 5.9에서는 P값과 유의수준을 사용한 판단이 실제로 중요한 효과와 어떻게 다른지 살펴본다.

이 자료의 P값은 통계 해석을 설명하기 위한 가상 계산이며 실제 수업 효과나 재현 가능성을 보장하지 않는다.