Q

PRIVATE NAVIGATION MODE

ML4T 탭 잠금 해제

패스워드를 확인하면 이 브라우저에서 ML4T 탭과 검색 결과를 표시합니다.

STUDY SEARCH

학습 자료 검색

제목과 설명, 키워드, 학습 본문에서 찾습니다.

검색 범위

검색어를 입력해 주세요.

SEARCH THE NOTEBOOK

찾고 싶은 금융·통계·전략 개념을 입력해 보세요.

CHAPTER 05.7 / HYPOTHESIS TESTING

5.7 기준 주장을 세우고 자료로 판단하기

평균 70점이라는 기준과 표본평균을 비교하며 가설과 판단 규칙을 세우는 순서를 살펴봅니다.

5장. 기댓값·공분산·가설검정·회귀와 자기상관초급 학습 노트

5.7 기준 주장을 세우고 자료로 판단하기

기존 시험의 평균이 70점일 때 새로운 수업을 받은 학생들의 평균이 달라졌다고 판단할 수 있는지 살펴보자. 이 페이지의 목표는 Hypothesis testing(가설검정)에서 가정하는 것, 관측하는 것, 판단하는 것과 오류를 명확히 구분하는 것이다.

지난 여러 해 동안 같은 방식으로 치른 시험의 평균이 70점이었다고 하자. 새로운 수업을 받은 학생 25명의 평균은 74.2점이었다. 이 4.2점 차이는 수업과 관련된 변화일 수도 있고, 우연히 점수가 높은 학생들이 표본에 들어와 생긴 흔들림일 수도 있다.

먼저 아래 도구에서 70점과 다른가, 70점보다 높은가, 70점보다 낮은가 가운데 질문을 고르고 25명의 평균을 움직여 보자. 화면에 나오는 계산 용어는 해당 값 옆에서 바로 쉬운 말로 설명한다.

INTERACTIVE STUDY TOOL25명 평균으로 70점 기준 판단하기Sample mean(표본평균)은 뽑힌 25명의 평균입니다. Standard error(표준오차) 2점은 표본평균이 흔들리는 정도이고, Significance level(유의수준) 5%는 기준을 기각하도록 미리 정한 전체 비율입니다.
자료를 보기 전에 정할 질문
74.2점
양측 질문의 기각 범위와 25명 평균 위치기준 주장은 모집단 평균 70점이다. 표본평균이 흔들리는 정도인 표준오차는 2점이고, 색칠된 기각역은 기준 주장을 기각하기로 정한 범위다. 기각역의 전체 비율인 유의수준은 5%이며 점수 경계는 66.08점 이하 또는 73.92점 이상이다. 현재 25명의 평균은 74.2점이고, 70점에서 표준오차 몇 배 떨어졌는지를 나타내는 Z통계량은 2.10이므로 기준 주장을 기각한다. 기준 주장이 실제로 맞는데 관측값이 색칠된 영역에 들어가 잘못 기각하면 Type I error(제1종 오류)다.z=-1.9666.08점2.5%z=+1.9673.92점2.5%표본 74.2점 · z=2.10z=0기준 70점70점보다 낮은 표본평균70점보다 높은 표본평균점수 경계 = 70점 + Z 경계 × 표준오차 2점

질문 방향과 유의수준 5%는 자료를 보기 전에 정했다고 가정합니다. 25명의 평균을 움직이면 Z통계량과 기각역 포함 여부가 바뀌지만, 기각역의 전체 비율 5%는 바뀌지 않습니다.

판단70점이라는 기준을 기각
판단할 기준 주장
Null hypothesis(귀무가설): Population mean(모집단 평균)은 70점
선택한 질문
양측 · 다른가?
관측 평균 → 표준오차로 잰 거리
74.2점 → 2.10
Z test statistic(Z 검정통계량)으로 표시한 기각 범위
z ≤ -1.96 또는 z ≥ 1.96
점수로 바꾼 Rejection region(기각역)
66.08점 이하 또는 73.92점 이상
기각 범위 전체 비율인 유의수준 α
왼쪽 2.5% + 오른쪽 2.5% = 전체 5%

모집단 평균이 70점과 다르다는 통계적 증거가 있습니다. 표본에서 관측된 차이의 방향은 70점보다 높은 쪽입니다.

표본평균은 판단에 사용하는 관측값입니다. 기각하거나 기각하지 못하는 대상은 표본평균이 아니라 귀무가설입니다. 이 판단은 새 수업의 Causal effect(인과효과)를 증명하지 않습니다.

방금 도구에서 한 일을 이해하려면 현실의 상태, 계산을 위한 가정, 관측한 자료와 검정의 판단을 분리해야 한다.

구분이 예시의 내용연구자가 아는가?
현실의 상태Population mean(모집단 평균)이 실제로 70점인가?알 수 없다
계산의 가정평균이 70점이라고 놓고 표본평균의 분포를 계산한다연구자가 정한다
관측한 자료Sample mean(표본평균) 74.2점표본에서 계산한다
검정의 판단70점이라는 기준 주장을 기각하거나 기각하지 못한다미리 정한 규칙으로 결정한다

표본평균 74.2점은 판단에 사용하는 관측값이다. 표본평균을 기각하는 것이 아니라, 표본평균으로 계산한 결과를 이용해 70점이라는 기준 주장을 기각할지 판단한다.

참이라고 가정하는 것과 참이라고 판정하는 것은 다르다

Null hypothesis(귀무가설) H0H_0는 검정 계산의 기준으로 놓는 구체적인 주장이다. Alternative hypothesis(대립가설) H1H_1은 자료가 귀무가설 아래에서 보기 드물 때 지지하려는 방향이다.

  • H0:μ=70H_0:\mu=70\text{점}: 새로운 수업을 받은 학생들의 모집단 평균은 70점이다.
  • H1:μ70H_1:\mu\ne70\text{점}: 새로운 수업을 받은 학생들의 모집단 평균은 70점과 다르다.

귀무가설이 참이라고 가정한다는 말은 귀무가설이 참이라고 이미 판정했다는 뜻이 아니다. 만약 실제 평균이 70점이라면 여러 표본평균은 어떻게 분포할까?라는 조건을 놓고 계산한다는 뜻이다. 실제 평균이 70점인지 아닌지는 여전히 알 수 없다.

검정 결과도 귀무가설이 참이다귀무가설이 거짓이다로 확정하지 않는다.

  • Reject(기각): 관측 결과가 귀무가설 아래에서 미리 정한 기각역에 들어가므로 귀무가설을 유지하기 어렵다고 판단한다.
  • Fail to reject(기각하지 못함): 관측 결과가 기각역에 들어가지 않아 귀무가설을 버릴 근거가 부족하다고 판단한다.

귀무가설이 맞아도 드문 표본은 나올 수 있다. 따라서 기각은 이런 결과는 절대로 나올 수 없다고 판단하는 것이 아니다. 기각하지 못함도 귀무가설이 참이라는 증명이 아니다.

찾고 싶은 차이에 따라 보는 방향을 먼저 정한다

실제 평균이 70점이라고 놓으면 표본평균은 대부분 70점 근처에 나오지만 가끔 매우 낮거나 높은 값도 나온다. Sampling distribution(표본분포)의 중심에서 멀리 떨어진 끝부분을 Tail(꼬리)이라고 한다.

어느 꼬리를 기각 후보로 볼지는 자료를 확인하기 전에 연구 질문으로 정한다.

검정 방향자료를 보기 전에 묻는 질문사용하는 꼬리대립가설
Two-sided test(양측검정)70점과 다른가?왼쪽과 오른쪽H1:μ70H_1:\mu\ne70\text{점}
Right-tailed test(상측검정)70점보다 높은가?오른쪽H1:μ>70H_1:\mu>70\text{점}
Left-tailed test(하측검정)70점보다 낮은가?왼쪽H1:μ<70H_1:\mu<70\text{점}

수업 뒤 점수가 높아졌는지만 확인하려면 상측검정을 정할 수 있다. 높아지거나 낮아지는 변화가 모두 중요하면 양측검정을 정한다. 표본평균 74.2점을 본 뒤 유리한 방향으로 바꾸면 처음 계획한 오류율을 유지할 수 없다.

유의수준 하나를 두 관점으로 읽는다

Significance level(유의수준) α\alpha는 자료를 보기 전에 정하는 값이다. 이 예시에서는 양측검정과 유의수준 5%를 먼저 정했다고 하자.

귀무가설이 참이라고 놓고 만든 표본분포에서 양쪽 꼬리를 합해 5%가 되도록 범위를 표시한다. 이 범위가 Rejection region(기각역)이다. 양측검정이라면 왼쪽 2.5%와 오른쪽 2.5%가 기각역이 된다.

같은 5%는 다음 두 관점으로 읽을 수 있다.

  • 분포 관점: 귀무가설 아래에서 기각역이 차지하는 전체 확률은 5%다.
  • 오류 관점: 귀무가설이 실제로 참일 때 기각역에 들어가 잘못 기각할 확률은 5%다.

평균 70점 예시로 이 관계를 짧게 이어 보자.

  1. 현실에서도 실제 평균이 70점이라면 H0H_0는 참이다.
  2. 표본 결과가 기각역에 들어오면 미리 정한 규칙에 따라 H0H_0를 기각한다.
  3. 참인 H0H_0를 기각했으므로 이 판단은 Type I error(제1종 오류)다.

따라서 H0H_0가 참이라는 조건에서는 기각역에 들어감제1종 오류가 발생함이 같은 사건이다.

수식의 \mid오른쪽 조건이 참이라고 놓았을 때라고 읽는다. P(AB)P(A\mid B)라면 BB를 조건으로 놓았을 때 AA가 일어날 확률이라는 뜻이다.

  • P(기각역에 들어감H0가 참)P(\text{기각역에 들어감}\mid H_0\text{가 참}): 귀무가설이 참이라고 가정했을 때, 즉 모집단 평균을 70점으로 놓았을 때 표본 결과가 기각역에 들어갈 확률
  • P(제1종 오류H0가 참)P(\text{제1종 오류}\mid H_0\text{가 참}): 같은 가정 아래에서 표본 결과 때문에 귀무가설을 잘못 기각할 확률
P(기각역에 들어감H0가 참)=αP(제1종 오류H0가 참)=α\begin{aligned} P(\text{기각역에 들어감}\mid H_0\text{가 참}) &=\alpha \\ P(\text{제1종 오류}\mid H_0\text{가 참}) &=\alpha \end{aligned}
P()P(\cdot)
괄호 안의 사건이 일어날 Probability(확률)
단위: % 또는 0과 1 사이의 값
\mid
오른쪽 내용을 조건으로 놓는다는 뜻
단위: 없음
H0H_0
검정 계산의 기준으로 놓은 Null hypothesis(귀무가설)
예시: 실제 평균이 7070\text{점}이다
α\alpha
귀무가설 아래에서 기각역이 차지하는 전체 확률인 Significance level(유의수준)
예시 값: 5%5\%
단위: %

두 확률을 따로 정했는데 우연히 같은 값이 된 것이 아니다. H0H_0가 참일 때는 기각역에 들어가 귀무가설을 기각하는 일이 곧 제1종 오류이므로, 같은 사건을 두 관점에서 읽는 것이다.

INTERACTIVE STUDY TOOL유의수준 하나를 두 관점으로 보기양측검정의 유의수준을 바꾸며 기각역 전체 확률과 조건부 제1종 오류 확률이 같은 값임을 확인합니다.
5%

α를 낮추면 경계가 중심에서 멀어져 기각역이 좁아지고, α를 높이면 경계가 중심에 가까워져 기각역이 넓어집니다. 이 기준은 자료를 보기 전에 정합니다.

같은 유의수준 α기각역 5% = 제1종 오류 확률 5%
귀무가설 아래 기각역 전체 확률
왼쪽 2.5% + 오른쪽 2.5% = 전체 5%
기각하는 Z 범위
z ≤ -1.96 또는 z ≥ 1.96
귀무가설이 실제로 참일 때
잘못 기각할 확률 = 5%

두 확률을 따로 정한 것이 아닙니다. 귀무가설이 실제로 참이라면 기각역에 들어간 결과를 기각하는 일이 곧 제1종 오류이므로 같은 α로 나타납니다.

유의수준을 낮추면 기각역이 좁아져 귀무가설을 기각하기 어려워진다. 유의수준을 높이면 기각역이 넓어져 기각하기 쉬워진다. 어느 쪽이든 결과를 본 뒤 기준을 바꾸지 않는다.

실제 상태와 검정 판단을 교차해 오류를 구분한다

실제 상태와 검정 판단을 교차하면 네 가지 경우가 생긴다.

실제 상태귀무가설을 기각귀무가설을 기각하지 못함
H0H_0가 참
실제 평균이 70점
Type I error(제1종 오류)
False alarm(거짓 경보)
올바른 판단
H0H_0가 거짓
실제 평균이 70점과 다름
올바른 판단Type II error(제2종 오류)
Miss(놓침)

이제 표에 나온 오류를 화재경보기로 비유해 보자. 경보기는 센서가 측정한 연기나 열이 미리 정한 경보 기준을 넘으면 울린다. 실제 화재가 없어도 요리 연기나 수증기 때문에 경보가 울릴 수 있고, 화재가 나도 연기나 열이 충분히 감지되지 않으면 경보가 울리지 않을 수 있다.

이 비유에서는 화재가 없다를 귀무가설 H0H_0로 놓고, 경보가 울리면 H0H_0를 기각한다고 생각한다.

  • Type I error(제1종 오류): 화재가 없는데 경보가 울린다. 이 False alarm(거짓 경보)의 확률이 α\alpha다.
  • Type II error(제2종 오류): 화재가 있는데 경보가 울리지 않는다. 이 Miss(놓침)의 확률이 β\beta다.
  • Statistical power(검정력): 화재가 있을 때 경보가 제대로 울린다. 이 Sensitivity(탐지 민감도)는 실제 화재를 감지할 확률이며 1β1-\beta다.

경보 기준을 낮추면 적은 연기에도 경보가 울린다. 그러면 실제 화재를 더 잘 감지하지만 요리 연기에도 잘못 울릴 수 있다. 다른 조건이 같을 때 α\alpha와 검정력은 커지고 β\beta는 작아진다. 경보 기준을 높이면 반대가 된다. 가설검정에서 기각역을 넓히거나 좁힐 때도 같은 관계가 나타난다.

여기서 경보기 설정 화면의 민감도 설정은 경보 기준을 조절하는 행위다. Statistical power(검정력)는 그 설정 자체가 아니라, 정해진 기준에서 실제 화재가 났을 때 경보가 울리는 실제 화재 탐지율이다.

또한 β\beta와 검정력은 α\alpha만으로 정해지지 않는다. 화재가 얼마나 강한지, 센서의 수와 관측 정보가 얼마나 충분한지, 수증기나 먼지 같은 잡음이 얼마나 큰지에 따라 화재를 놓칠 가능성이 달라진다. 따라서 유의수준 하나만 보고 제2종 오류 확률을 숫자로 정할 수는 없다.

조건의 방향도 구분해야 한다. 이 비유에서 유의수준 5%는 P(경보화재 없음)=5%P(\text{경보}\mid\text{화재 없음})=5\%, 즉 화재가 없다고 놓았을 때 경보가 잘못 울릴 확률이다. 경보가 울린 뒤 우리가 궁금해할 수 있는 P(화재 없음경보)P(\text{화재 없음}\mid\text{경보})와는 조건의 순서가 반대다. 뒤의 확률을 구하려면 실제 화재가 얼마나 자주 발생하는지와 경보기의 화재 탐지율 같은 정보도 필요하다.

평균 70점 사례로 돌아오면 α\alpha는 실제 평균이 70점인데도 70점과 다르다고 잘못 판단할 확률이다. β\beta는 실제 평균이 70점과 다른데도 그 차이를 발견하지 못할 확률이고, 1β1-\beta는 실제 차이를 제대로 발견할 확률이다. 연구자는 실제 모집단 평균을 모르므로, 이번 기각이 올바른 판단인지 제1종 오류인지 즉시 알 수 없다.

여기서 유의수준 5%는 모집단 평균이 정말 70점이라고 가정했을 때, 표본의 우연한 흔들림 때문에 잘못 기각할 확률이 5%라는 뜻이다. 이미 이번 자료로 귀무가설을 기각한 뒤 이번 기각이 잘못되었을 확률이 5%라는 뜻은 아니다. 두 문장은 조건의 순서가 다르다.

표본평균을 Z통계량으로 바꿔 귀무가설을 판단한다

이제 관측한 표본평균을 미리 정한 기각역과 비교해 보자. 5.6에서 살펴본 Standard error(표준오차)는 표본을 바꿔 뽑을 때 표본평균이 흔들리는 정도다. 이 예시에서는 표준오차가 2점이라고 알고 있다고 가정한다.

Z test statistic(Z 검정통계량)은 표본평균이 귀무가설의 기준에서 표준오차 몇 배만큼 떨어졌는지를 나타낸다.

z=xˉμ0SEz = \frac{\bar{x}-\mu_0}{SE}
zz
귀무가설의 기준과 표본평균 사이의 거리를 표준오차 단위로 나타낸 Z test statistic(Z 검정통계량)
단위: 없음
xˉ\bar{x}
새로운 수업을 받은 25명에게서 관측한 Sample mean(표본평균)
예시 값: 74.274.2\text{점}
단위: 점
μ0\mu_0
Null hypothesis(귀무가설)가 주장하는 Population mean(모집단 평균)
예시 값: 7070\text{점}
단위: 점
SESE
표본을 바꿔 뽑을 때 표본평균이 흔들리는 정도인 Standard error(표준오차)
예시 값: 22\text{점}
단위: 점

표본평균 74.2점은 기준 70점에서 4.2점 떨어져 있고, 이는 표준오차 2점의 2.1배다.

74.2702=2.1\frac{74.2\text{점}-70\text{점}}{2\text{점}} =2.1

유의수준 5%에서 검정 방향에 따른 기각역은 다음과 같다.

검정 방향기각역 확률Z 경계점수 경계
Two-sided test(양측검정)왼쪽 2.5%
오른쪽 2.5%
z1.96z\le-1.96
또는 z1.96z\ge1.96
66.08점 이하
또는 73.92점 이상
Right-tailed test(상측검정)오른쪽 5%z1.645z\ge1.64573.29점 이상
Left-tailed test(하측검정)왼쪽 5%z1.645z\le-1.64566.71점 이하

앞의 도구에서 본 표본평균 74.2점과 z=2.1z=2.1을 정식 용어로 다시 읽으면 다음과 같다.

  1. 양측검정에서는 오른쪽 기각역에 들어가므로 모집단 평균이 70점과 다르다는 방향으로 귀무가설을 기각한다.
  2. 상측검정에서는 오른쪽 기각역에 들어가므로, 높은 방향을 자료보다 먼저 정했다는 전제에서 모집단 평균이 70점보다 높다는 방향으로 귀무가설을 기각한다.
  3. 하측검정에서는 기각역에 들어가지 않는다. 높은 표본평균은 모집단 평균이 70점보다 낮다는 질문의 증거가 아니다.

기각 대상은 표본평균 74.2점이 아니라 모집단 평균은 70점이다라는 귀무가설이다. 이 판단은 모집단 평균이 정확히 74.2점이라는 뜻도, 새 수업이 점수를 높인 Causal effect(인과효과)가 있다는 뜻도 아니다.

기각역 판단을 P값으로도 표현할 수 있다

귀무가설과 검정모형이 맞다면 표본평균이 74.2점 이상이거나 반대쪽으로 같은 만큼 떨어진 65.8점 이하가 나올 가능성은 약 3.6%다. 이것은 표본평균이 정확히 74.2점일 가능성이 아니라, 현재 결과와 같거나 더 극단적인 양쪽 결과 전체의 가능성이다.

약 3.6%의 결과는 실제로 나올 수 있다. 다만 미리 정한 유의수준 5%보다 작으므로 이번 양측검정에서는 귀무가설을 기각한다. 이 3.6%를 P-value(P값)라고 하며 다음 5.8에서 계산 방법을 살펴본다.

P값 3.6%는 이번 판단이 틀릴 확률이 3.6%라는 뜻이 아니다. 귀무가설이 틀릴 확률이 96.4%라는 뜻도 아니다. 귀무가설이 맞다고 놓았을 때 현재 결과와 같거나 더 극단적인 결과가 나올 확률이다.

기각하지 못함은 70점이 참이라는 증명이 아니다

표본평균이 72점이고 표준오차가 2점이라면 z=(7270)/2=1z=(72-70)/2=1이다. 이 값은 5% 양측검정의 경계인 약 1.96-1.96+1.96+1.96 사이에 있다. 평균이 70점이어도 충분히 나올 수 있는 범위이므로 귀무가설을 기각하지 못한다.

올바른 문장은 현재 자료만으로 모집단 평균이 70점이라는 주장을 버릴 근거가 충분하지 않았다이다. 평균이 70점으로 증명되었다거나 새 수업은 효과가 없다고 확정하면 안 된다. 실제 차이가 작거나 학생 수가 적고 점수의 흔들림이 크면 차이가 있어도 발견하지 못할 수 있다.

계산 전에 검정이 자료에 맞는지도 확인한다

Z통계량의 계산이 맞더라도 자료를 모은 방법과 검정의 가정이 맞지 않으면 결론을 믿기 어렵다. 숫자를 공식에 넣기 전에 다음 네 가지를 확인한다.

  1. 누구를 대표하는 표본인가? Sample(표본)은 확인하려는 학생 집단을 대표해야 한다. 성적이 높은 학생만 골라 조사했다면 표본평균 74.2점은 새로운 수업을 받은 전체 학생의 평균을 보여 주지 못한다.
  2. 각 점수가 서로 다른 정보인가? Independence(독립성)는 한 학생의 점수가 다른 학생의 점수를 직접 결정하지 않는다는 가정이다. 같은 학생의 점수를 두 번 넣거나 서로 답을 공유한 학생들을 모두 별개로 세면, 25개의 점수가 독립적인 정보 25개가 되지 않는다.
  3. 표준오차를 자료 수집 방법에 맞게 계산했는가? 한 반이나 한 학교 단위로 학생을 뽑으면 같은 환경의 학생 점수가 서로 비슷할 수 있다. 이를 개인 25명을 완전히 무작위로 뽑은 것처럼 계산하면 Standard error(표준오차)를 실제보다 작게 볼 수 있다.
  4. 판단 규칙을 결과보다 먼저 정했는가? 제외할 학생, 이상치 처리, 검정 방향과 유의수준은 점수를 보기 전에 정한다. 74.2점을 본 뒤 낮은 점수만 제외하거나 양측검정을 상측검정으로 바꾸면 원하는 결론이 나오기 쉬워지고 처음 계획한 오류율도 유지되지 않는다.

가설검정 공식은 대표성이 부족한 표본, 중복된 정보와 잘못 계산한 표준오차를 자동으로 고쳐 주지 않는다. 계산 결과가 정확해 보여도 이 조건이 맞지 않으면 Z통계량과 오류율의 의미도 달라진다.

자주 생기는 오해

  • 오해: 귀무가설을 참이라고 가정했으니 평균은 70점이다. 올바른 뜻: 평균이 70점이라고 판정한 것이 아니라, 평균이 70점이라고 놓았을 때 가능한 표본 결과를 계산한 것이다.
  • 오해: 표본평균 74.2점을 기각한다. 올바른 뜻: 74.2점은 판단에 사용한 관측값이다. 기각하는 대상은 모집단 평균은 70점이다라는 귀무가설이다.
  • 오해: 귀무가설을 기각하지 못했으니 평균이 70점으로 증명되었다. 올바른 뜻: 현재 자료만으로 70점이라는 주장을 버릴 근거가 충분하지 않았다는 뜻이다. 실제 차이가 작거나 자료가 부족해 놓쳤을 수도 있다.
  • 오해: 귀무가설을 기각했으니 새 수업의 효과가 크고 실제로 유용하다. 올바른 뜻: 관측 결과가 70점이라는 기준과 양립하기 어려웠다는 뜻일 뿐이다. Effect size(효과 크기), Causal effect(인과효과)와 실제 활용 가치는 별도로 확인해야 한다.

이해 점검

귀무가설을 참이라고 가정한다는 말은 무엇을 뜻하는가?

귀무가설을 참으로 판정했다는 뜻이 아니라, 귀무가설이 참인 조건에서 표본평균의 분포와 기각역 확률을 계산한다는 뜻이다.

표본평균과 귀무가설 가운데 무엇을 기각하는가?

표본평균은 Z통계량을 계산하는 관측값으로 사용하고, 기각 여부를 판단하는 대상은 귀무가설이다.

기각역 확률 5%와 제1종 오류 확률 5%가 같은 이유는 무엇인가?

귀무가설이 실제로 참이라면 기각역에 들어간 결과를 기각하는 모든 경우가 제1종 오류이므로 같은 유의수준으로 나타난다. 제2종 오류 확률은 이 값과 같지 않으며 표본 크기, 실제 차이와 잡음에도 영향을 받는다.

귀무가설을 기각하지 못했을 때 어떻게 써야 하는가?

현재 자료만으로 귀무가설을 버릴 근거가 충분하지 않았다고 쓴다. 귀무가설이 참으로 증명되었다고 쓰지 않는다.

완료 기준

다음 세 가지를 자신의 말로 설명할 수 있으면 5.7을 마친 것이다.

  1. 평균이 70점이라고 가정한다는 말은 계산의 기준으로 놓는다는 뜻이며, 실제 평균이 70점으로 확인되었다는 뜻이 아니다.
  2. 실제 평균이 70점인데 표본 결과가 기각역에 들어가면 참인 귀무가설을 잘못 기각한 Type I error(제1종 오류)가 된다.
  3. Z통계량은 표본평균이 기준 70점에서 표준오차 몇 배만큼 떨어졌는지 보여 준다. 이 값을 기각역과 비교해 귀무가설을 기각할지 판단한다.

다음 5.8에서는 P-value(P값)를 배운다. P값은 귀무가설을 기준으로 현재 결과와 같거나 더 극단적인 결과가 나올 확률이다.

이 자료의 시험 점수와 전략 가설은 통계 절차를 설명하기 위한 가상 예시이며 실제 수업 효과나 투자 성과를 입증하지 않는다.