CHAPTER 05.10 / WELCH T-TEST
5.10 평균 차이를 표준오차와 비교하기
두 독립 집단의 평균 차이가 표본의 흔들림에 비해 큰지 Welch t 검정으로 살펴봅니다.
5.10 평균 차이를 표준오차와 비교하기
서로 다른 두 집단의 평균이 다르게 나왔을 때, 그 차이가 실제 집단의 차이를 의심할 만큼 큰지 아니면 사람을 다시 뽑으면 흔히 달라질 수 있는 정도인지 살펴보는 것이 이 페이지의 목표다.
서로 다른 수업을 받은 A반과 B반에서 학생 5명씩을 뽑았다고 하자. A반 5명의 평균은 4점, B반 5명의 평균은 3점이어서 관측한 차이는 1점이다. 하지만 학생을 다시 뽑아도 늘 1점 차이가 날지는 알 수 없다.
이때 먼저 물어야 할 질문은 1점 차이가 있는가?에서 끝나지 않는다.
- 다른 학생 5명씩을 뽑아도 비슷한 차이가 나타날까?
- 각 반의 점수가 평균 가까이에 모여 있는가, 아니면 넓게 퍼져 있는가?
- 같은 1점 차이라도 점수가 촘촘한 경우와 넓게 퍼진 경우를 똑같이 판단해야 할까?
두 평균의 차이와 표본을 다시 뽑을 때 생기는 자연스러운 흔들림을 함께 비교하는 것이 Welch's t-test(웰치 t 검정)의 사용 목적이다. 평균 차이만 보는 것이 아니라 그 차이가 자료의 흔들림에 비해 얼마나 큰지를 확인한다.
값이 촘촘한 경우
두 집단 모두 값이 평균 가까이에 모여 있어 평균 1점 차이가 퍼짐에 비해 크게 보입니다.
값이 넓게 퍼진 경우
두 집단 모두 값이 넓게 퍼져 있어 같은 평균 1점 차이가 퍼짐에 비해 작게 보입니다.
두 표본에서 판단까지 이어지는 순서
- 01두 표본서로 짝지어지지 않은 두 집단에서 값을 모읍니다.
- 02평균 차이각 집단의 중심이 얼마나 떨어졌는지 확인합니다.
- 03값의 퍼짐각 집단 안에서 값들이 얼마나 흩어졌는지 봅니다.
- 04차이와 흔들림관측한 차이가 자연스러운 흔들림보다 큰지 비교합니다.
- 05드문 정도현재 정도의 차이가 얼마나 흔한지 판단합니다.
어떤 자료에 사용하는가
Independent samples(독립 표본)는 한 집단의 관측값이 다른 집단의 특정 관측값과 짝으로 연결되지 않은 두 표본이다. 이 예시에서는 A반 학생 한 명의 점수가 B반 학생 한 명의 점수와 일대일로 연결되지 않는다.
Welch's t-test(웰치 t 검정)는 이런 독립된 두 집단의 Population mean(모집단 평균)을 비교하고 싶지만, Population variance(모집단 분산)를 모르고 두 집단의 퍼짐이 같다고 확신할 수도 없을 때 사용한다. 표본에서 각 집단의 퍼짐을 따로 추정한다는 점이 핵심이다.
같은 학생의 수업 전후 점수처럼 두 값이 짝을 이루거나, 평균이 아니라 분포 전체의 모양을 비교하려는 질문에는 이 페이지의 검정을 그대로 사용하지 않는다. 어떤 검정을 고를지는 계산 공식보다 자료를 만든 구조가 먼저 결정한다.
5.7부터 이어지는 판단의 뼈대
5.7에서는 기준 주장과 반대 방향을 정했고, 5.8에서는 기준 주장 아래에서 현재보다 극단적인 결과의 비율인 P-value(P값)를 배웠다. 5.9에서는 그 P값을 자료보다 먼저 정한 Significance level(유의수준)과 비교했다.
이번에도 흐름은 같다. 다만 한 집단의 평균을 기준값과 비교하는 대신 두 집단의 평균 차이를 0과 비교한다. Two-sided test(양측검정)를 사용해 높은 방향과 낮은 방향을 모두 본다고 하자.
- 두 모집단 평균 차이가 0이라는 Null hypothesis(귀무가설)
- 단위: 없음
- 두 모집단 평균 차이가 0이 아니라는 Alternative hypothesis(대립가설)
- 단위: 없음
- ,
- A반과 B반 전체의 Population mean(모집단 평균)
- 단위: 점
귀무가설은 이번에 뽑힌 5명의 평균이 우연히 같아야 한다는 말이 아니다. A반과 B반 전체의 실제 평균 차이를 0으로 놓고, 그 조건에서도 현재 표본처럼 평균 차이가 나타날 수 있는지 계산한다는 뜻이다.
평균 차이를 이해하려면 각 표본의 퍼짐이 먼저 필요하다
Sample mean(표본평균)은 각 표본의 중심이고, Sample variance(표본분산)는 표본의 값들이 그 중심 주변에 퍼진 정도다. 표본분산은 각 값의 평균편차를 제곱해 더한 뒤 로 나눈다.
- 표본 X의 Sample variance(표본분산)
- 단위: 관측값 단위의 제곱
- 표본 X의 번째 관측값
- 단위: 점
- 표본 X의 Sample mean(표본평균)
- 단위: 점
- 표본 X의 Sample size(표본 크기)
- 단위: 명
점수들이 평균 가까이에 모여 있으면 학생을 다시 뽑아도 표본평균이 비교적 안정적이다. 점수들이 넓게 퍼져 있으면 누구를 뽑았는지에 따라 표본평균도 더 크게 달라질 수 있다. 따라서 두 평균의 차이가 흔들리는 정도는 두 표본의 분산과 표본 크기를 모두 반영해야 한다.
Standard error of the mean difference(평균 차이의 표준오차)는 두 표본을 같은 방법으로 다시 뽑을 때 표본평균 A − 표본평균 B가 흔들리는 정도다.
- 두 표본평균 차이의 Standard error(표준오차)
- 단위: 점
- ,
- 두 표본의 Sample variance(표본분산)
- 단위: 점의 제곱
- ,
- 두 독립 표본의 Sample size(표본 크기)
- 단위: 명
같은 평균 차이 1점이라도 표준오차가 작으면 1점은 흔들림에 비해 큰 차이다. 표준오차가 크면 1점은 흔들림 안에서 자주 생길 수 있는 차이다.
t값은 차이가 흔들림의 몇 배인지 보여 준다
t statistic(t 통계량)은 관측한 평균 차이에서 귀무가설이 주장하는 차이 0을 뺀 뒤, 평균 차이의 표준오차로 나눈 값이다.
- 관측 평균 차이가 귀무가설의 차이에서 표준오차 몇 배 떨어졌는지 나타내는 t statistic(t 통계량)
- 단위: 없음
- 두 표본에서 관측한 Sample mean difference(표본평균 차이)
- 단위: 점
- Null hypothesis(귀무가설)가 주장하는 모집단 평균 차이
- 이 페이지의 값:
- 단위: 점
- 두 표본평균 차이의 Standard error(표준오차)
- 단위: 점
가 크면 관측한 차이가 표본의 흔들림에 비해 멀리 떨어져 있다는 뜻이다. 하지만 t값만으로 기각 여부를 정하지 않는다. 표본에서 퍼짐을 추정했다는 추가 불확실성까지 반영해 P값을 계산해야 한다.
자유도는 퍼짐을 추정할 때 남은 정보량이다
Degrees of freedom(자유도)는 표본에서 퍼짐을 추정할 때 독립적으로 움직일 수 있는 정보가 얼마나 남아 있는지를 나타낸다. 다섯 값의 평균을 이미 정했다면 네 값을 자유롭게 바꾼 뒤 마지막 한 값은 평균을 맞추도록 결정된다. 그래서 한 표본의 분산을 추정할 때 기본 자유도는 이다.
Welch's t-test(웰치 t 검정)는 두 표본분산을 따로 사용하므로 두 정보량을 하나의 값으로 근사한다. 이를 Welch–Satterthwaite approximation(웰치–새터스웨이트 근사)이라고 한다.
- Welch–Satterthwaite approximation(웰치–새터스웨이트 근사)으로 계산한 Degrees of freedom(자유도)
- 단위: 없음
- ,
- 두 표본의 Sample variance(표본분산)
- 단위: 점의 제곱
- ,
- 두 독립 표본의 Sample size(표본 크기)
- 단위: 명
자유도는 정수일 필요가 없다. 표본 크기와 두 표본분산이 다르면 근사 자유도는 소수가 될 수 있다.
Student's t distribution(t분포)은 자유도에 따라 모양이 달라지는 기준 분포다. 작은 표본에서는 모집단의 퍼짐을 정확히 모르기 때문에 극단적인 t값이 Normal distribution(정규분포)보다 조금 더 나올 수 있다고 본다. 그래서 작은 자유도의 t분포는 정규분포보다 꼬리가 두껍다. 자유도가 커지면 퍼짐 추정이 안정되어 t분포는 정규분포에 가까워진다.
작은 표본을 순서대로 계산한다
가상 점수 표본 A는 [2,3,4,5,6], 표본 B는 [1,2,3,4,5]다. 두 표본의 평균은 4점과 3점이고 표본분산은 모두 이다.
- 표본 A 평균에서 표본 B 평균을 뺀 Sample mean difference(표본평균 차이)
- 예시 값:
- 단위: 점
- ,
- 두 표본의 Sample variance(표본분산)
- 예시 값: 각각
- 단위: 점의 제곱
- 두 표본평균 차이의 Standard error(표준오차)
- 예시 값:
- 단위: 점
- 평균 차이 0을 기준으로 한 t statistic(t 통계량)
- 예시 값:
- 단위: 없음
두 표본의 크기와 분산이 같으므로 이 예시의 자유도는 8이다.
- 예시에 적용할 t분포의 Welch–Satterthwaite Degrees of freedom(웰치–새터스웨이트 자유도)
- 예시 값:
- 단위: 없음
Two-sided P-value(양측 P값)는 자유도 8인 t분포에서 이하와 이상인 양쪽 영역을 합한 값이다.
- 관측한 절댓값 1과 같거나 더 극단적인 양쪽 결과의 P-value(P값)
- 예시 값: 약 또는
- 단위: 0~1의 비율 또는 %
- Degrees of freedom(자유도)가 8인 Student's t distribution(t분포)을 따르는 값
- 단위: 없음
- 괄호 안의 영역이 차지하는 Probability(확률)
- 단위: 0~1의 비율
P값 약 34.66%는 두 모집단 평균이 같다고 놓아도 현재처럼 평균 차이가 표준오차의 1배 이상 떨어지는 결과가 비교적 흔하게 나타날 수 있다는 뜻이다. 이 값은 미리 정한 유의수준 5%보다 크므로 귀무가설을 기각하지 못한다.
이 결론은 두 평균이 정확히 같다는 증명이 아니다. 현재 표본에서는 평균 차이 0을 버릴 만큼 강한 증거를 얻지 못했다는 뜻이다.
- 표본 A 표준편차
- 1.581점
- 표본 B 표준편차
- 1.581점
고정 조건: 각 표본 5개, Independent samples(독립 표본), Two-sided test(양측검정), Significance level(유의수준) 5%
관측 평균 차이가 표준오차의 1.00배만큼 0에서 떨어져 있습니다.
- 1. 관측 평균 차이
- +1.00점
- 2. 차이의 표준오차
- 1.000점
- 3. 차이 ÷ 표준오차
- +1.00 ÷ 1.000
- 4. 근사 자유도
- 8.00
- 5. 양측 P값
- 34.66%
34.66% ≥ 5.00%이므로 평균 차이 0이라는 주장을 기각하지 못합니다.
두 표본의 값과 평균 위치
A [2.0, 3.0, 4.0, 5.0, 6.0]
B [1.0, 2.0, 3.0, 4.0, 5.0]
t분포에서 양측 P값으로 세는 영역
도구에서 평균 차이를 1점으로 유지한 채 표본 B의 퍼짐 배율만 키워 보자. 관측한 1점 차이는 그대로지만 차이의 표준오차가 커지고, t값의 절댓값은 작아지며, P값은 커진다. 반대로 퍼짐을 줄이면 같은 1점 차이도 표본의 흔들림에 비해 더 멀리 놓인다.
어떤 검정을 고를지는 자료 구조가 정한다
검정 이름을 먼저 외우기보다 한쪽 값과 다른 쪽 값이 자연스럽게 한 쌍을 이루는지부터 확인하면 된다.
예시 1. 서로 다른 두 반의 학생을 비교한다
A반에서 학생 5명, B반에서 다른 학생 5명을 뽑아 평균 점수를 비교한다고 하자. A반 1번 학생과 B반 1번 학생은 표에 같은 순서로 적혔을 뿐 서로 짝이 아니다. A반 학생 한 명의 점수를 빼더라도 특정한 B반 학생의 점수를 함께 빼야 할 이유도 없다.
이처럼 서로 다른 대상들로 구성되고 자연스러운 짝이 없는 두 표본에는 Welch's t-test(웰치 t 검정)를 사용한다. 두 반의 Population variance(모집단 분산)가 같다고 가정하지 않고 각 표본의 퍼짐을 따로 반영해 평균 차이를 계산한다.
예시 2. 같은 학생의 수업 전후 점수를 비교한다
민수의 점수가 60점에서 70점으로 바뀌고, 지수의 점수가 80점에서 83점으로 바뀌었다고 하자. 민수에게는 70점 − 60점 = +10점, 지수에게는 83점 − 80점 = +3점이라는 개인별 변화가 있다. 민수의 수업 전 점수와 지수의 수업 후 점수를 임의로 짝지으면 이 변화를 잃어버린다.
이처럼 같은 대상에서 두 번 측정해 값마다 짝이 있는 자료에는 Paired t-test(대응표본 t 검정)를 고려한다. 두 집단의 평균을 따로 비교하는 대신 각 사람의 수업 후 점수 − 수업 전 점수를 먼저 구하고, 그 차이들의 평균이 0과 다른지 살펴본다. 이 페이지에서는 대응표본 검정의 계산법까지 다루지는 않는다.
| 먼저 확인할 질문 | 자료의 구조 | 선택할 검정 |
|---|---|---|
| 값마다 정해진 짝이 없는가? | 서로 다른 학생들로 구성된 A반과 B반 | Welch's t-test(웰치 t 검정) |
| 같은 대상을 두 번 측정했거나 값마다 정해진 짝이 있는가? | 같은 학생의 수업 전후 점수 | Paired t-test(대응표본 t 검정) |
Welch 검정은 두 표본분산이 반드시 달라야만 사용할 수 있는 검정이 아니다. 두 분산이 같다고 자동 가정하지 않을 뿐이며, 예시처럼 관측한 두 표본분산이 같아도 계산할 수 있다.
퀀트 연구에서도 같은 기준을 적용한다. 서로 다른 대상에서 얻은 독립적인 관측값 두 집단의 평균을 비교한다면 Welch 검정을 고려할 수 있다. 반면 같은 날짜의 전략 A와 전략 B 수익률은 같은 월요일끼리, 같은 화요일끼리 시장 상황을 공유하므로 날짜별로 짝지어진 자료다. 다만 날짜별 수익률이 앞뒤 시점과 연결되어 있다면 각 날짜의 차이도 서로 독립이 아닐 수 있으므로 단순한 대응표본 검정만으로 충분하지 않을 수 있다.
계산 전에 확인할 조건과 해석의 한계
- 두 표본이 정말 독립인가? 같은 사람, 같은 날짜 또는 짝지어진 대상을 두 독립 표본처럼 처리하지 않는다.
- 각 표본이 비교하려는 집단을 대표하는가? 특정한 결과만 골랐다면 정확한 공식도 Selection bias(선택 편향)를 고치지 못한다.
- 극단적인 값이 결과를 지배하지 않는가? 작은 표본에서는 Outlier(이상치) 하나가 평균과 표본분산을 크게 바꿀 수 있다.
- 평균 비교가 연구 질문과 맞는가? t검정은 두 분포의 모양 전체가 같은지 검정하지 않는다.
P값이 작더라도 평균 차이 자체가 실제로 중요한지는 Effect size(효과 크기)와 연구 맥락으로 따로 판단해야 한다. 무작위 배정이나 적절한 연구 설계가 없다면 Causal effect(인과효과)도 t검정 하나로 확인할 수 없다. 미래 표본에서 같은 결과가 재현되는지도 보장하지 않는다.
자주 생기는 오해
- 오해:
P값이 34.66%이므로 두 평균이 같을 확률이 34.66%다.올바른 뜻: 두 모집단 평균을 같다고 놓았을 때 현재 정도로 멀어진 결과가 나올 비율이다. - 오해:
귀무가설을 기각하지 못했으므로 두 평균은 정확히 같다.올바른 뜻: 현재 표본으로 평균 차이 0을 버릴 증거가 충분하지 않았다는 뜻이다. - 오해:
P값이 작으면 평균 차이도 반드시 크다.올바른 뜻: P값은 평균 차이뿐 아니라 표본의 퍼짐과 표본 크기에도 영향을 받는다. - 오해:
t검정은 두 집단의 모든 분포 차이를 검정한다.올바른 뜻: 이 페이지의 Welch 검정은 두 모집단 평균의 차이를 검정한다. - 오해:
Welch 검정은 두 표본분산이 다를 때만 쓸 수 있다.올바른 뜻: 두 모집단 분산이 같다는 추가 가정을 요구하지 않는 방법이며 표본분산이 같게 관측되어도 사용할 수 있다.
이해 점검
Welch t 검정을 사용하는 가장 쉬운 목적은 무엇인가?
두 독립 집단에서 관측한 평균 차이가 표본을 다시 뽑을 때 생기는 자연스러운 흔들림에 비해 큰지 살펴보는 것이다.
평균 차이가 같아도 표준오차가 커지면 t값은 어떻게 되는가?
t값의 절댓값이 작아진다. 같은 차이를 더 큰 흔들림으로 나누므로 평균 차이 0에서 덜 멀리 떨어진 결과로 보인다.
예시의 P값 약 34.66%를 어떻게 읽는가?
두 모집단 평균 차이를 0으로 놓았을 때 자유도 8인 t분포에서 절댓값이 1 이상인 결과가 양쪽을 합해 약 34.66% 나타난다는 뜻이다.
같은 학생의 수업 전후 점수를 Welch 독립 두 표본 검정으로 계산하면 왜 안 되는가?
한 학생의 전후 점수는 서로 짝지어져 독립이 아니므로, 학생별 변화량을 사용하는 Paired t-test(대응표본 t 검정) 질문에 가깝기 때문이다.
완료 기준
다음을 쉬운 말과 계산으로 설명할 수 있으면 다음 페이지로 넘어간다.
- Welch's t-test(웰치 t 검정)는 두 독립 집단의 평균 차이를 표본의 흔들림과 비교하기 위해 사용한다.
- 평균 차이 1점과 차이의 표준오차 1점에서 t값은 1이다.
- 자유도 8인 t분포에서 양측 P값은 약 0.3466이며, 5% 기준에서는 귀무가설을 기각하지 못한다.
- 기각하지 못했다는 결과는 두 평균이 같다는 증명이나 차이가 중요하지 않다는 판정이 아니다.
다음 5.11에서는 두 변수 사이의 평균적인 선형관계를 추정한다.
이 자료의 두 표본과 점수는 검정 원리를 설명하기 위한 가상값이며 실제 수업 효과나 투자 성과를 주장하지 않는다.