CHAPTER 04.10 / CENTRAL LIMIT THEOREM
4.10 표본평균 분포가 정규분포에 가까워지는 조건
반복 주사위 표본평균의 분포와 표준오차로 중심극한정리의 대상과 조건을 살펴봅니다.
4.10 표본평균 분포가 정규분포에 가까워지는 조건
이 페이지는 4장의 필수 개념이다. 주사위 한 번의 결과, 같은 크기의 한 묶음, 묶음의 평균과 평균들의 분포를 구분하고 표준오차를 계산하는 것이 목표다.
주사위를 5번씩 던지는 표본을 네 번 만든다고 생각해 보자. 모든 표본의 크기는 5개로 같아도 들어 있는 주사위 눈이 다르므로 평균도 3.0, 3.2, 3.6, 3.8처럼 조금씩 달라질 수 있다.
이렇게 여러 표본에서 얻은 평균만 모아 만든 분포가 Sampling distribution(표집분포)이다. 4.10에서는 주사위 눈 자체가 아니라 이 평균들이 Population mean(모집단 평균) 3.5 주변에 어떤 모양으로 모이는지 살펴본다.
- 표본 A크기 512444표본평균3.0
- 표본 B크기 513444표본평균3.2
- 표본 C크기 523445표본평균3.6
- 표본 D크기 523446표본평균3.8
- 표본평균 4개의 평균
- 3.4
- 네 평균의 합계
- 13.6
- 표본평균 수
- 4개
- 합계를 개수로 나눈 값
- 3.4
- Population mean(모집단 평균)
- 3.5
- 주사위 눈 1~6의 합계
- 1 + 2 + 3 + 4 + 5 + 6 = 21
- 가능한 눈의 수
- 6개
- 합계를 개수로 나눈 값
- 3.5
여기서 모아 보는 것은 주사위 눈 20개가 아니라, 각 표본에서 계산한 표본평균 4개입니다.표본을 다시 뽑으면 표본평균들의 평균 3.4는 바뀔 수 있지만, 공정한 주사위의 모집단 평균 3.5는 기준값으로 유지됩니다.
주사위 한 번의 결과와 표본평균의 분포는 다르다
주사위를 한 번 던지면 1부터 6 가운데 하나가 나온다. 공정한 주사위에서는 여섯 숫자가 모두 같은 확률로 나오므로, 각 숫자의 막대 높이도 모두 같다. 종 모양이 아니다.
이제 주사위를 번 던진 결과를 한 묶음으로 보고 평균 하나를 구해 보자. 이 한 묶음을 Sample(표본)이라고 한다. 같은 크기의 묶음을 여러 번 만들면 평균도 여러 개 생기고, 이 평균들을 모은 것이 Sampling distribution(표집분포)이다.
| 무엇을 보는가 | 주사위 예시 |
|---|---|
| 주사위 한 번의 결과 | 1~6 가운데 하나 |
| 같은 크기의 한 묶음 | 주사위 번의 결과 |
| 한 묶음의 평균 | 결과 개의 평균 하나 |
| 평균들을 모은 분포 | 여러 묶음에서 얻은 평균들의 모양 |
중심극한정리는 표본평균의 분포를 말한다
Central limit theorem(중심극한정리)은 같은 크기의 표본을 여러 번 만들고 평균을 구할 때, 한 표본에 들어가는 값이 많아질수록 그 평균들이 가운데에 많이 모이고 양쪽으로 갈수록 적어져 종 모양에 가까워진다는 내용이다.
이 설명을 적용하려면 다음 조건이 필요하다.
- 각 값은 같은 규칙에서 나와야 한다.
- 한 번의 결과가 다음 결과에 영향을 주지 않아야 한다.
- 전체 평균과 값들이 흩어진 정도를 숫자로 계산할 수 있어야 한다.
통계책에서 말하는 Independent and identically distributed(독립 동일분포)는 앞의 두 조건, 즉 같은 규칙에서 나오고 서로 영향을 주지 않는다는 뜻이다.
| 구분 | 쉽게 말하면 |
|---|---|
| Sample mean(표본평균) | 한 묶음의 결과만 보고 계산한 평균이다. 표본 A는 3.0, 표본 B는 3.2처럼 묶음이 바뀌면 값도 달라질 수 있다. |
| Population mean(모집단 평균) | 가능한 모든 결과와 확률이 정하는 기준 평균이다. 공정한 주사위에서는 표본을 뽑기 전에도 다. |
표본 크기가 모두 같다면 표본평균 여러 개를 다시 평균내어 를 추정할 수 있다. 하지만 그 결과는 뽑힌 표본으로 계산한 추정값이며, 실제 와 정확히 같다고 보장되지는 않는다. 표본을 많이 반복할수록 표본평균들의 평균이 에 가까워진다.
이 페이지의 네 표본평균을 다시 평균내면 다. 모집단 평균 3.5와 같지 않으며, 표본을 다시 뽑으면 이 3.4도 다른 값으로 바뀔 수 있다.
같은 크기의 표본을 여러 번 만들면 표본평균도 여러 개 생긴다. 각 표본평균은 서로 다를 수 있지만, 대체로 위 표의 기준값 주변에 모인다. 평균들이 그 중심에서 얼마나 넓게 흩어지는지를 Standard error(표준오차)라고 한다.
공정한 주사위의 를 먼저 계산한다
먼저 각 주사위 눈이 평균 3.5에서 얼마나 떨어져 있는지 구한다. 거리를 그대로 더하면 음수와 양수가 서로 지워져 0이 되므로, 거리를 제곱한 뒤 평균을 낸다. 마지막으로 제곱근을 취하면 주사위 눈과 같은 단위의 Standard deviation(표준편차)이 된다.
| 계산 단계 | 공정한 주사위 계산 |
|---|---|
| 기준 평균 | |
| 평균과의 거리 | , , , , , |
| 거리를 제곱 | |
| 제곱한 거리의 평균 | |
| 마지막에 제곱근 |
따라서 공정한 주사위 한 번의 결과가 3.5 주변에서 흩어진 정도는 이다.
계산한 와 표본 크기로 표준오차를 구한다
계산한 를 표본 크기 의 제곱근으로 나누면 표준오차가 된다.
- 한 묶음에서 계산한 Sample mean(표본평균) 하나
- 예: 1, 3, 4, 4, 4의 평균은 3.2
- 단위: 주사위 눈과 같은 단위
- 같은 크기의 표본을 여러 번 만들었을 때, 표본평균들이 모집단 평균 3.5 주변에서 얼마나 넓게 퍼지는지 나타내는 값
- 값이 작을수록 표본평균들이 3.5 가까이에 모임
- 공정한 주사위에서 일 때 예: 약 0.7638
- 단위: 주사위 눈과 같은 단위
- 계산에 사용하는 값: 주사위 눈 1~6과 평균 3.5 사이의 거리
- 공정한 주사위 계산 결과:
- 단위: 주사위 눈과 같은 단위
- 표본평균 하나를 만들 때 사용한 주사위 횟수
- 예: 5번 던졌다면
- 단위: 관측 개수
공정한 주사위에서 이고 이므로, 표준오차는 이다.
| 계산 | ||
|---|---|---|
| 사용하는 값 | 주사위 눈 1~6과 평균 3.5 | 과 |
| 계산식 | ||
| 결과 | 약 1.7078 | 약 0.7638 |
| 이 커질 때 | 변하지 않음 | 비율로 작아짐 |
0.7638은 모든 표본평균이 3.5에서 정확히 0.7638만큼 떨어진다는 뜻이 아니라, 평균들이 3.5 주변에 흩어진 전체적인 폭을 나타낸다.
표본 크기가 커지면 평균들이 더 촘촘히 모인다
위에서 계산한 을 표준오차 공식에 넣으면 표본 크기별 결과는 다음과 같다.
| 표본 크기 | 표준오차 |
|---|---|
| 1 | 약 1.7078 |
| 2 | 약 1.2076 |
| 5 | 약 0.7638 |
| 30 | 약 0.3118 |
표본 크기가 커질수록 표본평균은 모집단 평균 3.5 주변에 더 좁게 모인다.
가로축은 표본평균이고, 막대 높이는 해당 구간에 들어온 표본평균의 개수입니다.
- 이론 중심
- 3.5
- 이론 표준오차
- 0.3118
- 시뮬레이션 표준편차
- 0.3141
표본 크기 30, 반복 2,000회, 시드 20260812
표본 크기와 반복 횟수를 구분한다
Sample size(표본 크기) 은 표본평균 하나를 만들 때 들어가는 관측 수다. Repetition count(반복 횟수)는 표본평균을 몇 개 만들어 히스토그램을 그릴지 정한다.
- 을 늘리면 이론 표준오차가 비율로 줄어든다.
- 반복 횟수를 늘리면 화면의 히스토그램이 이론 표집분포를 더 매끄럽게 근사한다.
- 반복 횟수 2,000은 표본 크기 2,000을 뜻하지 않는다.
표본 30개가 항상 충분한 것은 아니다
교과서에서 “표본이 30개면 평균의 분포가 종 모양에 가까워진다”는 설명을 자주 볼 수 있다. 하지만 30은 이해를 돕기 위해 자주 쓰는 숫자일 뿐, 모든 데이터에 통하는 약속은 아니다.
다음과 같은 데이터는 30개보다 더 많이 모아야 할 수 있다.
- 값들이 한쪽에 몰려 있는 경우
- 대부분은 비슷하지만 가끔 매우 크거나 작은 값이 나오는 경우
- 앞의 값이 다음 값에 영향을 주는 경우
- 시간이 지나면서 데이터가 만들어지는 규칙이 바뀌는 경우
금융수익률에서도 큰 변동 뒤에 큰 변동이 이어지거나 시장 상황이 바뀔 수 있다. 따라서 일간 수익률 30개만 보고 평균의 분포가 충분히 종 모양에 가까워졌다고 단정하면 안 된다.
자주 생기는 오해
- 중심극한정리가 살펴보는 대상은 주사위 눈 1~6이 아니라, 여러 표본에서 얻은 평균들이다.
- Law of large numbers(대수의 법칙)은 한 묶음에 값을 계속 추가할 때 평균이 기준값에 가까워지는 과정을 설명한다.
- 중심극한정리는 같은 크기의 묶음을 여러 번 만들었을 때, 그 평균들이 어떤 모양으로 모이는지 설명한다.
- 표본 크기는 평균 하나에 들어간 값의 수이고, 반복 표본 수는 그런 평균을 몇 개 만들었는지를 뜻한다.
- 표본 30개는 자주 쓰는 예시일 뿐이다. 데이터의 모양에 따라 더 많이 필요할 수 있다.
- 표준오차가 작다는 것은 평균들이 좁게 모였다는 뜻이다. 처음부터 한쪽으로 치우친 데이터를 뽑았거나 계산할 때 세운 가정이 잘못됐다면 결과도 잘못될 수 있다.
이해 점검
주사위 한 번의 결과가 1~6 균등분포일 때 정규분포에 가까워지는 대상은 무엇인가?
크기 의 표본을 반복해 계산한 표본평균들의 표집분포다. 주사위 결과 자체가 아니다.
표본 크기를 4배로 늘리면 표준오차는 어떻게 되는가?
로 나누므로 절반이 된다.
표본 크기 30과 반복 횟수 2,000은 각각 무엇을 뜻하는가?
30은 평균 하나에 들어가는 관측 수이고, 2,000은 그런 표본평균을 히스토그램에 몇 개 만들지 뜻한다.
왜 일간 수익률 30개만으로 충분하다고 단정하면 안 되는가?
큰 변동이 이어지거나, 가끔 매우 큰 값이 나오거나, 시장 상황에 따라 데이터의 규칙이 바뀔 수 있기 때문이다.
완료 기준
주사위 한 번의 결과·한 표본·표본평균·표집분포를 구분하고, 주사위 표본 크기별 표준오차를 계산하며, 대수의 법칙과 중심극한정리의 대상과 조건을 각각 설명할 수 있으면 다음 페이지로 넘어간다. 다음 선택 실습에서는 반복 표본 생성 자체를 계산 도구로 사용한다.
이 자료는 중심극한정리의 대표적인 조건과 직관을 설명하는 교육 자료이며 금융시계열의 정규성을 보장하지 않는다.