CHAPTER 05.6 / CONFIDENCE INTERVAL
5.6 표본평균으로 모집단 평균의 범위를 추정하기
표본평균의 흔들림에서 출발해 표준오차, 신뢰수준, 임계값과 오차한계를 차례로 연결합니다.
5.6 표본평균으로 모집단 평균의 범위를 추정하기
학교 전체 학생의 평균 점수를 알고 싶지만 모든 학생을 조사할 수 없다고 생각해 보자. 일부 학생의 평균으로 전체 평균을 어느 범위까지 추정할 수 있는지 한 단계씩 살펴보는 것이 이 페이지의 목표다.
한 학교에 학생이 1,000명 있고 그중 25명의 점수만 조사한다고 하자. 조사할 학생이 달라지면 25명의 평균도 101점, 102점, 99점처럼 달라질 수 있다. 이렇게 일부를 조사해 계산한 평균을 Sample mean(표본평균)이라고 한다.
학생 1,000명 전체의 실제 평균 점수는 조사한 표본이 바뀌어도 하나의 값으로 정해져 있다. 이처럼 우리가 알고 싶은 전체 집단의 실제 평균을 Population mean(모집단 평균)이라고 한다. Confidence interval(신뢰구간)은 한 번 계산한 표본평균 주변에 모집단 평균을 추정하는 범위를 만드는 방법이다.
이 페이지에서는 계산 구조를 한 단계씩 보기 위해 Population standard deviation(모집단 표준편차)이 10점이라는 사실을 이미 알고 있고, 한 학생의 점수가 다른 학생의 점수에 영향을 주지 않으며, 표본평균의 분포를 Normal distribution(정규분포)으로 나타낼 수 있다고 가정한다. 이 가정이 실제 자료에 언제나 맞는다는 뜻은 아니다.
4.10에서 배운 표본평균의 흔들림을 다시 보자
4.10 표본평균 분포가 정규분포에 가까워지는 조건에서는 같은 크기의 표본을 여러 번 만들면 표본평균도 여러 개 생기고, 그 평균들이 모집단 평균 주변에 모인다는 내용을 살펴봤다.
이번에는 모집단 표준편차가 10점인 자료에서 매번 25명씩 뽑는다고 하자. 반복해서 얻은 표본평균들이 모집단 평균 주변에 퍼지는 정도는 Standard error(표준오차)로 나타낸다.
- 반복해서 얻은 Sample mean(표본평균)들이 모집단 평균 주변에 퍼지는 정도인 Standard error(표준오차)
- 단위: 점
- 이미 알고 있다고 가정한 Population standard deviation(모집단 표준편차)
- 예시 값:
- 단위: 점
- 표본평균 하나를 계산할 때 조사한 학생 수인 Sample size(표본 크기)
- 예시 값:
- 단위: 명
은 모든 표본평균이 모집단 평균에서 정확히 2점 떨어진다는 뜻이 아니다. 표본을 계속 다시 뽑았을 때 생기는 여러 표본평균의 전체적인 퍼짐이 2점 규모라는 뜻이다.
슬라이더를 움직여 95%의 경계 1.96을 확인한다
5.5 평균에서 표준편차 몇 배 떨어졌는지에서는 Z-score(표준점수)와 Tail probability(꼬리확률)를 살펴봤다. Standard normal distribution(표준정규분포)은 평균이 0이고 표준편차가 1인 정규분포이며, 곡선 아래 전체 면적은 100%다.
슬라이더를 오른쪽으로 옮길수록 가운데 면적이 넓어지고, 두 경계는 중심 0에서 더 멀어집니다.
- 가운데 면적95%
- 양쪽 각각2.5%
- 오른쪽 경계까지 누적97.5%
- Critical value(임계값)1.96
임계값은 중심 0에서 한쪽 경계까지 떨어진 Z 거리입니다.
가운데 면적을 95%로 맞추면 정규곡선의 왼쪽과 오른쪽 끝에 각각 2.5%가 남고, 그 가운데 면적이 끝나는 경계는 약 과 에 놓인다. 중심 0에서 한쪽 경계까지 떨어진 거리 1.96을 Critical value(임계값)라고 한다. 1.96은 95%를 소수로 바꾸거나 곱해서 얻은 숫자가 아니라, 표준정규곡선에서 가운데 95%가 차지하는 위치를 읽은 값이다.
표본평균 102를 중심으로 95% 구간을 계산한다
이 예시에서는 모집단 표준편차 10점, 표본 크기 25명과 신뢰수준 95%를 고정했다. 따라서 표준오차 2점, 임계값 1.96과 Margin of error(오차한계) 3.92점도 고정된다. 신뢰구간의 중심에는 조사한 25명에서 계산한 표본평균 102점이 놓인다.
- 오차한계는 이다.
- Lower bound(하한)은 표본평균에서 오차한계를 뺀 이다.
- Upper bound(상한)은 표본평균에 오차한계를 더한 이다.
- 왼쪽 끝 98.08점부터 오른쪽 끝 105.92점까지 전체 범위인
[98.08점, 105.92점]이 이 표본에서 계산한 Confidence interval(신뢰구간)이다.
- Sample mean standard error(표본평균 표준오차)
- 예시 값:
- 단위: 점
- 표본평균에서 신뢰구간의 한쪽 끝까지 떨어진 거리인 Margin of error(오차한계)
- 예시 값:
- 단위: 점
- 표본평균에서 오차한계를 빼고 더해 만든 Confidence interval(신뢰구간)
- 예시 범위: 부터
- 단위: 점
오차한계 3.92점은 표본평균에서 한쪽 끝까지의 거리다. 따라서 구간의 전체 폭은 이다. 오차한계가 실제 모집단 평균과 표본평균의 차이가 반드시 3.92점 이하임을 보장하지는 않는다.
같은 표본평균 102점과 같은 표준오차 2점을 두고 신뢰수준만 바꾸면 다음과 같이 임계값, 오차한계와 구간이 함께 달라진다.
| 목표 신뢰수준 | 표준정규곡선의 양쪽 경계 | 일 때 표본평균에서 양 끝까지의 거리 | 표본평균 102점으로 계산한 범위 |
|---|---|---|---|
| 90% | 약 , | 3.29점 | [98.71점, 105.29점] |
| 95% | 약 , | 3.92점 | [98.08점, 105.92점] |
| 99% | 약 , | 5.15점 | [96.85점, 107.15점] |
더 높은 신뢰수준은 같은 표본평균을 중심으로 더 넓은 구간을 만든다. 표본평균 102점이 더 정확해진 것이 아니라, 임계값과 구간 폭이 커진 것이다.
계산 과정을 한 줄의 공식으로 정리한다
알려진 모집단 표준편차를 사용하고 양쪽에 경계를 두는 Z confidence interval(Z 신뢰구간)은 다음과 같다.
- 한 표본에서 계산한 Sample mean(표본평균)이자 신뢰구간의 중심
- 단위: 관측값과 같은 단위
- 선택한 신뢰수준에 맞춰 Standard normal distribution(표준정규분포)에서 찾은 양의 Critical value(임계값)
- 95% 예시 값: 약 1.96
- 단위: 없음
- 이미 알고 있다고 가정한 Population standard deviation(모집단 표준편차)
- 단위: 관측값과 같은 단위
- 표본평균 하나를 계산할 때 사용한 Sample size(표본 크기)
- 단위: 개
- 전체 1에서 신뢰수준을 뺀 비율
- 95% 신뢰수준의 예시 값:
- 단위: 0부터 1 사이의 비율
이 공식에서도 먼저 표본평균 를 계산한다. 그다음 고정된 오차한계를 표본평균에서 빼고 더하므로 표본평균이 달라지면 구간 전체가 함께 이동한다.
조사할 25명이 달라지면 표본평균과 구간도 함께 움직인다
학교 전체 1,000명의 점수가 이미 정해져 있다면 그 전체의 Population mean(모집단 평균)도 하나의 값으로 정해져 있다. 그중 어떤 25명을 조사할지만 바꾼다고 해서 학생 1,000명 전체의 평균이 바뀌지는 않는다.
반면 조사한 25명의 Sample mean(표본평균)은 누구를 뽑았는지에 따라 달라질 수 있다. 이 예시에서는 모집단 표준편차, 표본 크기와 신뢰수준을 고정했으므로 오차한계는 계속 3.92점이다. 바뀐 표본평균을 새 중심으로 삼아 3.92점을 빼고 더하면 구간의 폭은 7.84점으로 같고 위치만 이동한다.
| 조사한 25명 | 계산된 표본평균 | 같은 오차한계를 적용한 계산 | 신뢰구간 | 모집단 평균 100 포함 여부 |
|---|---|---|---|---|
| 표본 A | 102점 | [98.08점, 105.92점] | 포함 | |
| 표본 B | 99점 | [95.08점, 102.92점] | 포함 | |
| 표본 C | 104.5점 | [100.58점, 108.42점] | 미포함 |
실제 조사에서는 모집단 평균을 모르기 때문에 한 번 계산한 구간의 포함 여부를 바로 확인할 수 없다. 아래 교육용 실험에서는 움직이지 않는 기준선을 보여주기 위해 모집단 평균을 100점으로 정해 두고, 표본을 바꿀 때 계산된 구간이 어떻게 이동하는지 확인한다.
고정되는 값
- 모집단 표준편차
- 10점
- 표본 크기
- 25명
- 임계값
- 1.96
- 오차한계
- ±3.92점
표본마다 바뀌는 값
- 조사한 25명
- 달라질 수 있음
- 표본평균
- 중심이 이동
- 구간 하한·상한
- 함께 이동
- 구간의 전체 폭
- 7.84점으로 같음
서로 다른 25명을 조사한 세 표본
점은 표본평균, 가로선은 같은 오차한계 3.92점을 빼고 더한 구간입니다. 세로선 100은 움직이지 않습니다.
- 이번 100번 결과
- 94/100
- 고정한 모집단 평균
- 100점
- 고정한 오차한계
- 3.92점
- 고정한 구간 폭
- 7.84점
95%는 설정한 기준이고 94/100은 이번에 관찰한 결과입니다. 두 숫자는 매번 정확히 같지 않을 수 있습니다.
같은 조건으로 100번 계산한 결과
아래에는 이번 100개 중 처음 20개를 표시합니다. 점은 각 표본평균이고, 가로선 전체는 그 표본평균을 중심으로 계산한 신뢰구간입니다.
95%는 이번 구간이 아니라 계산 방법을 반복할 때의 설정값이다
그림에서 각 가로선은 서로 다른 25명을 조사해 얻은 표본평균을 중심으로 계산한 구간이다. 세로선은 실험에서 100점으로 정해 둔 모집단 평균이다. 가로선이 세로선을 지나면 모집단 평균을 포함하고, 지나지 않으면 포함하지 않는다.
Confidence level(신뢰수준) 95%는 이번에 계산한 [98.08점, 105.92점] 안에 모집단 평균이 있을 확률이 95%라는 뜻이 아니다. 같은 조건으로 표본을 바꾸고 구간을 매우 많이 계산했을 때, 그중 모집단 평균을 포함하는 구간의 비율이 약 95%가 되도록 정한 계산 방법이라는 뜻이다.
100번만 반복한 결과는 매번 정확히 95개가 아니다. 첫 실험에서는 94개, 다른 실험에서는 95개나 97개가 포함될 수 있다. 다른 100번 보기를 눌러 표본을 바꾸면 표본평균과 구간의 위치, 이번 포함 개수가 함께 바뀌지만 설정한 기준 95%는 바뀌지 않는다.
표본을 많이 뽑으면 해결되는 것과 해결되지 않는 것을 나눈다
표본 수가 커지면 누구를 뽑았는지에 따라 표본평균이 흔들리는 문제는 줄어든다. 모집단 표준편차가 10점일 때 25명을 조사하면 표준오차는 2점이지만, 100명을 조사하면 다음처럼 1점으로 줄어든다.
- 100명의 표본평균이 반복해서 흔들리는 정도인 Standard error(표준오차)
- 예시 값:
- 단위: 점
같은 95% 신뢰수준이라면 표준오차가 절반이 되었으므로 오차한계도 약 3.92점에서 1.96점으로 줄어든다. 표본을 더 많이 조사하면 평균을 더 정밀하게 추정할 수 있다는 뜻이다.
하지만 표본 수를 늘려도 조사 방법 자체의 문제는 사라지지 않는다.
- 성적이 높은 학생들만 골라 조사하는 Bias(편향)가 있다면 25명 대신 500명을 조사해도 학교 전체를 제대로 대표하지 못한다.
- 한 학생의 점수가 다른 학생의 점수와 함께 움직여 Independence(독립성)가 깨지면, 서로 다른 정보를 25개 얻었다고 보기 어렵다.
- 금융시장의 상승기 자료만 모았거나 시간이 지나며 시장의 규칙이 달라지면, 과거 표본을 많이 모아도 앞으로의 환경을 그대로 나타내지 못한다.
- 원래 자료가 한쪽으로 심하게 치우치거나 매우 큰 값이 자주 나오는 Heavy tail(두꺼운 꼬리)을 가지면, 표본평균을 정규분포로 보는 근사가 작은 표본에서 잘 맞지 않을 수 있다.
이 페이지의 Z 신뢰구간을 그대로 사용하려면 다음 세 가지를 확인해야 한다.
- 모집단이 정규분포이거나, 표본이 충분히 커서 여러 표본평균의 분포를 정규분포에 가깝다고 볼 수 있어야 한다.
- 각 관측값이 서로 영향을 주지 않는다고 볼 수 있어야 한다.
- 모집단 표준편차가 10점이라는 값을 표본 밖에서 이미 알고 있어야 한다.
세 조건이 잘 맞으면 앞에서 본 95% 계산 방법도 반복했을 때 약 95%의 구간이 모집단 평균을 포함한다. 첫 번째 조건이 근사적으로만 맞으면 실제 포함 비율도 정확한 95%가 아니라 그 주변이 될 수 있다.
실제 조사에서는 세 번째 조건처럼 모집단 표준편차를 미리 아는 경우가 드물다. 표본에서 표준편차까지 추정해야 한다면 불확실성이 하나 더 생긴다. 특히 표본이 작을 때는 Z 임계값 1.96을 그대로 쓰기보다 Student's t distribution(t분포)의 임계값을 사용한다. t분포는 표준편차를 추정하면서 생긴 추가 불확실성을 반영해 정규분포보다 경계를 조금 더 멀리 둔다. 이 차이는 5.10 평균 차이를 표준오차와 비교하기에서 다시 살펴본다.
장기 평균의 범위와 다음 한 기간의 범위는 서로 다르다
학교 전체의 평균 점수를 [98점, 102점]으로 추정했다고 해도 다음에 만날 학생 한 명의 점수가 반드시 98점과 102점 사이에 있는 것은 아니다. 학생 한 명의 점수는 전체 평균보다 훨씬 크게 흔들릴 수 있기 때문이다. 학교 전체 평균의 범위와 학생 한 명의 점수 범위는 서로 다른 질문이다.
퀀트 연구에서도 같은 구분이 필요하다.
- Confidence interval(신뢰구간)은
이 전략의 장기 평균수익률은 어느 정도인가?를 묻는다. 범위가 나타내는 대상은 하나의 장기 평균수익률이다. - Prediction interval(예측구간)은
다음 한 기간의 수익률은 어느 범위에서 나올 수 있는가?를 묻는다. 범위가 나타내는 대상은 앞으로 관측할 개별 수익률 하나다.
가상의 월별 전략 수익률로 두 범위를 숫자로 비교해 보자. 계산을 단순하게 보기 위해 다음 조건을 가정한다.
- 과거 100개월의 Sample mean(표본평균)은 월 0.5%다.
- 월별 수익률의 Population standard deviation(모집단 표준편차)은 2%p라고 이미 알고 있다.
- 월별 수익률은 서로 독립이고 정규분포를 따른다.
장기 평균수익률을 묻는 경우
평균의 Standard error(표준오차)는 다. 따라서 95% Confidence interval(신뢰구간)은 로 계산한 약 [0.11%, 0.89%]다. 이 범위가 나타내는 대상은 다음 달 수익률이 아니라 하나의 장기 월평균 수익률이다.
다음 한 달의 수익률을 묻는 경우
다음 한 달에는 평균을 추정하는 0.2%p의 불확실성뿐 아니라, 개별 월 수익률 자체의 2%p 흔들림도 다시 나타난다. 두 흔들림을 함께 반영하면 95% 구간의 한쪽 폭은 약 3.94%p가 된다. 표본평균 0.5%에서 3.94%p를 빼고 더한 Prediction interval(예측구간)은 약 [-3.44%, 4.44%]로 훨씬 넓다.
같은 자료를 사용했는데도 장기 평균의 구간은 [0.11%, 0.89%], 다음 한 달의 구간은 [-3.44%, 4.44%]다. 장기 평균수익률이 양수 범위로 추정되었다고 해서 다음 달에도 반드시 수익이 난다는 뜻은 아니다.
한 기간의 수익률은 장기 평균 주변에서 크게 오르내릴 수 있다. 따라서 Prediction interval(예측구간)은 평균을 정확히 모르는 불확실성에 개별 수익률 자체의 흔들림까지 더해야 하므로 Confidence interval(신뢰구간)보다 보통 훨씬 넓다.
이 페이지에서 계산한 Z 신뢰구간은 장기 평균수익률을 추정하는 범위다. 다음 달이나 다음 거래일의 수익률이 그 안에 들어간다는 뜻이 아니다.
자주 생기는 오해
- 특정 95% 구간에 모집단 평균이 들어 있을 확률이 95%라는 뜻이 아니다.
- 표본에 들어 있는 관측값의 95%가 신뢰구간 안에 있다는 뜻이 아니다.
- 오차한계는 실제 오차가 절대로 넘지 못하는 최대값이 아니다.
- 신뢰수준을 높이면 같은 자료에서 구간은 보통 넓어진다.
- 큰 표본은 선택편향이나 잘못된 계산 가정을 자동으로 제거하지 않는다.
이해 점검
95% 신뢰수준은 무엇을 95%로 만들려는 목표인가?
같은 표본추출과 계산 방법으로 구간을 매우 많이 만들었을 때, 그중 모집단 평균을 포함하는 구간의 비율을 약 95%로 만들려는 목표다.
95% 신뢰수준에서 임계값 1.96은 무엇을 나타내는가?
표준정규곡선의 가운데 95%를 남겼을 때 중심 0에서 양쪽 경계까지 떨어진 Z 거리다. 경계 자체는 약 과 이다.
오차한계 3.92점은 무엇을 나타내는가?
표본평균 102점에서 계산한 신뢰구간의 한쪽 끝까지 떨어진 거리다. 실제 오차의 절대적인 최대값을 보장하지 않는다.
같은 신뢰수준에서 표본 크기를 25명에서 100명으로 늘리면 표준오차는 어떻게 되는가?
이 5에서 10으로 두 배가 되므로 같은 모집단 표준편차에서 표준오차는 2점에서 1점으로 절반이 된다.
완료 기준
표본평균과 모집단 평균을 구분하고, 표준오차 2점·95% 임계값 1.96·오차한계 3.92점에서 [98.08점, 105.92점]을 계산하며, 95%가 한 번 만든 특정 구간의 확률이 아니라 반복해서 만든 구간에 관한 목표임을 설명할 수 있으면 다음 페이지로 넘어간다. 다음 페이지에서는 반증할 가설과 판단 규칙을 먼저 정한다.
이 자료의 표본과 구간은 통계 계산을 설명하기 위한 가상값이며 실제 투자 성과 범위를 예측하지 않는다.