Q

PRIVATE NAVIGATION MODE

ML4T 탭 잠금 해제

패스워드를 확인하면 이 브라우저에서 ML4T 탭과 검색 결과를 표시합니다.

STUDY SEARCH

학습 자료 검색

제목과 설명, 키워드, 학습 본문에서 찾습니다.

검색 범위

검색어를 입력해 주세요.

SEARCH THE NOTEBOOK

찾고 싶은 금융·통계·전략 개념을 입력해 보세요.

CHAPTER 04.10 / CENTRAL LIMIT THEOREM

4.10 표본평균 분포가 정규분포에 가까워지는 조건

반복 주사위 표본평균의 분포와 표준오차로 중심극한정리의 대상과 조건을 살펴봅니다.

4장. 확률분포·조건부확률·베이즈와 중심극한정리초급 학습 노트

4.10 표본평균 분포가 정규분포에 가까워지는 조건

이 페이지는 4장의 필수 개념이다. 주사위 한 번의 결과, 같은 크기의 한 묶음, 묶음의 평균과 평균들의 분포를 구분하고 표준오차를 계산하는 것이 목표다.

주사위를 5번씩 던지는 표본을 네 번 만든다고 생각해 보자. 모든 표본의 크기는 5개로 같아도 들어 있는 주사위 눈이 다르므로 평균도 3.0, 3.2, 3.6, 3.8처럼 조금씩 달라질 수 있다.

이렇게 여러 표본에서 얻은 평균만 모아 만든 분포가 Sampling distribution(표집분포)이다. 4.10에서는 주사위 눈 자체가 아니라 이 평균들이 Population mean(모집단 평균) 3.5 주변에 어떤 모양으로 모이는지 살펴본다.

크기가 같은 표본도 평균은 조금씩 다르다모든 표본은 주사위를 5번 던진 결과입니다. 들어 있는 주사위 눈이 다르므로 Sample mean(표본평균)도 달라집니다.
  1. 표본 A크기 5
    12444
    표본평균3.0
  2. 표본 B크기 5
    13444
    표본평균3.2
  3. 표본 C크기 5
    23445
    표본평균3.6
  4. 표본 D크기 5
    23446
    표본평균3.8
표본평균 4개표본평균들의 평균 3.4Population mean(모집단 평균) 3.5
표본평균 4개의 평균
3.4
네 평균의 합계
13.6
표본평균 수
4개
합계를 개수로 나눈 값
3.4
Population mean(모집단 평균)
3.5
주사위 눈 1~6의 합계
1 + 2 + 3 + 4 + 5 + 6 = 21
가능한 눈의 수
6개
합계를 개수로 나눈 값
3.5

여기서 모아 보는 것은 주사위 눈 20개가 아니라, 각 표본에서 계산한 표본평균 4개입니다.표본을 다시 뽑으면 표본평균들의 평균 3.4는 바뀔 수 있지만, 공정한 주사위의 모집단 평균 3.5는 기준값으로 유지됩니다.

주사위 한 번의 결과와 표본평균의 분포는 다르다

주사위를 한 번 던지면 1부터 6 가운데 하나가 나온다. 공정한 주사위에서는 여섯 숫자가 모두 같은 확률로 나오므로, 각 숫자의 막대 높이도 모두 같다. 종 모양이 아니다.

이제 주사위를 nn번 던진 결과를 한 묶음으로 보고 평균 하나를 구해 보자. 이 한 묶음을 Sample(표본)이라고 한다. 같은 크기의 묶음을 여러 번 만들면 평균도 여러 개 생기고, 이 평균들을 모은 것이 Sampling distribution(표집분포)이다.

무엇을 보는가주사위 예시
주사위 한 번의 결과1~6 가운데 하나
같은 크기의 한 묶음주사위 nn번의 결과
한 묶음의 평균결과 nn개의 평균 하나
평균들을 모은 분포여러 묶음에서 얻은 평균들의 모양

중심극한정리는 표본평균의 분포를 말한다

Central limit theorem(중심극한정리)은 같은 크기의 표본을 여러 번 만들고 평균을 구할 때, 한 표본에 들어가는 값이 많아질수록 그 평균들이 가운데에 많이 모이고 양쪽으로 갈수록 적어져 종 모양에 가까워진다는 내용이다.

이 설명을 적용하려면 다음 조건이 필요하다.

  • 각 값은 같은 규칙에서 나와야 한다.
  • 한 번의 결과가 다음 결과에 영향을 주지 않아야 한다.
  • 전체 평균과 값들이 흩어진 정도를 숫자로 계산할 수 있어야 한다.

통계책에서 말하는 Independent and identically distributed(독립 동일분포)는 앞의 두 조건, 즉 같은 규칙에서 나오고 서로 영향을 주지 않는다는 뜻이다.

구분쉽게 말하면
Sample mean(표본평균) Xˉ\bar{X}한 묶음의 결과만 보고 계산한 평균이다. 표본 A는 3.0, 표본 B는 3.2처럼 묶음이 바뀌면 값도 달라질 수 있다.
Population mean(모집단 평균) μ\mu가능한 모든 결과와 확률이 정하는 기준 평균이다. 공정한 주사위에서는 표본을 뽑기 전에도 (1+2+3+4+5+6)/6=3.5(1+2+3+4+5+6)/6=3.5다.

표본 크기가 모두 같다면 표본평균 여러 개를 다시 평균내어 μ\mu를 추정할 수 있다. 하지만 그 결과는 뽑힌 표본으로 계산한 추정값이며, 실제 μ\mu와 정확히 같다고 보장되지는 않는다. 표본을 많이 반복할수록 표본평균들의 평균이 μ\mu에 가까워진다.

이 페이지의 네 표본평균을 다시 평균내면 (3.0+3.2+3.6+3.8)/4=3.4(3.0+3.2+3.6+3.8)/4=3.4다. 모집단 평균 3.5와 같지 않으며, 표본을 다시 뽑으면 이 3.4도 다른 값으로 바뀔 수 있다.

같은 크기의 표본을 여러 번 만들면 표본평균도 여러 개 생긴다. 각 표본평균은 서로 다를 수 있지만, 대체로 위 표의 기준값 μ=3.5\mu=3.5 주변에 모인다. 평균들이 그 중심에서 얼마나 넓게 흩어지는지를 Standard error(표준오차)라고 한다.

공정한 주사위의 σ\sigma를 먼저 계산한다

먼저 각 주사위 눈이 평균 3.5에서 얼마나 떨어져 있는지 구한다. 거리를 그대로 더하면 음수와 양수가 서로 지워져 0이 되므로, 거리를 제곱한 뒤 평균을 낸다. 마지막으로 제곱근을 취하면 주사위 눈과 같은 단위의 Standard deviation(표준편차)이 된다.

계산 단계공정한 주사위 계산
기준 평균(1+2+3+4+5+6)/6=3.5(1+2+3+4+5+6)/6=3.5
평균과의 거리13.5=2.51-3.5=-2.5, 23.5=1.52-3.5=-1.5, 33.5=0.53-3.5=-0.5, 43.5=0.54-3.5=0.5, 53.5=1.55-3.5=1.5, 63.5=2.56-3.5=2.5
거리를 제곱6.25,2.25,0.25,0.25,2.25,6.256.25, 2.25, 0.25, 0.25, 2.25, 6.25
제곱한 거리의 평균(6.25+2.25+0.25+0.25+2.25+6.25)/6=35/122.9167(6.25+2.25+0.25+0.25+2.25+6.25)/6=35/12\approx2.9167
마지막에 제곱근35/121.7078\sqrt{35/12}\approx1.7078

따라서 공정한 주사위 한 번의 결과가 3.5 주변에서 흩어진 정도는 σ1.7078\sigma\approx1.7078이다.

계산한 σ\sigma와 표본 크기로 표준오차를 구한다

계산한 σ\sigma를 표본 크기 nn의 제곱근으로 나누면 표준오차가 된다.

SE(Xˉ)=σn\operatorname{SE}(\bar{X}) = \frac{\sigma}{\sqrt{n}}
Xˉ\bar{X}
한 묶음에서 계산한 Sample mean(표본평균) 하나
예: 1, 3, 4, 4, 4의 평균은 3.2
단위: 주사위 눈과 같은 단위
SE(Xˉ)\operatorname{SE}(\bar{X})
같은 크기의 표본을 여러 번 만들었을 때, 표본평균들이 모집단 평균 3.5 주변에서 얼마나 넓게 퍼지는지 나타내는 값
값이 작을수록 표본평균들이 3.5 가까이에 모임
공정한 주사위에서 n=5n=5일 때 예: 약 0.7638
단위: 주사위 눈과 같은 단위
σ\sigma
계산에 사용하는 값: 주사위 눈 1~6과 평균 3.5 사이의 거리
공정한 주사위 계산 결과: 35/121.7078\sqrt{35/12}\approx1.7078
단위: 주사위 눈과 같은 단위
nn
표본평균 하나를 만들 때 사용한 주사위 횟수
예: 5번 던졌다면 n=5n=5
단위: 관측 개수

공정한 주사위에서 σ1.7078\sigma\approx1.7078이고 n=5n=5이므로, 표준오차는 1.7078/50.76381.7078/\sqrt{5}\approx0.7638이다.

계산σ\sigmaSE(Xˉ)\operatorname{SE}(\bar{X})
사용하는 값주사위 눈 1~6과 평균 3.5σ1.7078\sigma\approx1.7078n=5n=5
계산식35/12\sqrt{35/12}1.7078/51.7078/\sqrt{5}
결과약 1.7078약 0.7638
nn이 커질 때변하지 않음1/n1/\sqrt{n} 비율로 작아짐

0.7638은 모든 표본평균이 3.5에서 정확히 0.7638만큼 떨어진다는 뜻이 아니라, 평균들이 3.5 주변에 흩어진 전체적인 폭을 나타낸다.

표본 크기가 커지면 평균들이 더 촘촘히 모인다

위에서 계산한 σ1.7078\sigma\approx1.7078을 표준오차 공식에 넣으면 표본 크기별 결과는 다음과 같다.

표본 크기 nn표준오차 35/12/n\sqrt{35/12}/\sqrt{n}
1약 1.7078
2약 1.2076
5약 0.7638
30약 0.3118

표본 크기가 커질수록 표본평균은 모집단 평균 3.5 주변에 더 좁게 모인다.

INTERACTIVE STUDY TOOL표본평균 분포 실험공정한 주사위에서 같은 크기의 표본을 반복해 표본평균의 분포와 표준오차를 확인합니다.
구간별 표본평균 개수모집단 평균 3.5

가로축은 표본평균이고, 막대 높이는 해당 구간에 들어온 표본평균의 개수입니다.

표본평균 분포
이론 중심
3.5
이론 표준오차
0.3118
시뮬레이션 표준편차
0.3141

표본 크기 30, 반복 2,000회, 시드 20260812

표본 크기와 반복 횟수를 구분한다

Sample size(표본 크기) nn은 표본평균 하나를 만들 때 들어가는 관측 수다. Repetition count(반복 횟수)는 표본평균을 몇 개 만들어 히스토그램을 그릴지 정한다.

  • nn을 늘리면 이론 표준오차가 1/n1/\sqrt{n} 비율로 줄어든다.
  • 반복 횟수를 늘리면 화면의 히스토그램이 이론 표집분포를 더 매끄럽게 근사한다.
  • 반복 횟수 2,000은 표본 크기 2,000을 뜻하지 않는다.

표본 30개가 항상 충분한 것은 아니다

교과서에서 “표본이 30개면 평균의 분포가 종 모양에 가까워진다”는 설명을 자주 볼 수 있다. 하지만 30은 이해를 돕기 위해 자주 쓰는 숫자일 뿐, 모든 데이터에 통하는 약속은 아니다.

다음과 같은 데이터는 30개보다 더 많이 모아야 할 수 있다.

  • 값들이 한쪽에 몰려 있는 경우
  • 대부분은 비슷하지만 가끔 매우 크거나 작은 값이 나오는 경우
  • 앞의 값이 다음 값에 영향을 주는 경우
  • 시간이 지나면서 데이터가 만들어지는 규칙이 바뀌는 경우

금융수익률에서도 큰 변동 뒤에 큰 변동이 이어지거나 시장 상황이 바뀔 수 있다. 따라서 일간 수익률 30개만 보고 평균의 분포가 충분히 종 모양에 가까워졌다고 단정하면 안 된다.

자주 생기는 오해

  • 중심극한정리가 살펴보는 대상은 주사위 눈 1~6이 아니라, 여러 표본에서 얻은 평균들이다.
  • Law of large numbers(대수의 법칙)은 한 묶음에 값을 계속 추가할 때 평균이 기준값에 가까워지는 과정을 설명한다.
  • 중심극한정리는 같은 크기의 묶음을 여러 번 만들었을 때, 그 평균들이 어떤 모양으로 모이는지 설명한다.
  • 표본 크기는 평균 하나에 들어간 값의 수이고, 반복 표본 수는 그런 평균을 몇 개 만들었는지를 뜻한다.
  • 표본 30개는 자주 쓰는 예시일 뿐이다. 데이터의 모양에 따라 더 많이 필요할 수 있다.
  • 표준오차가 작다는 것은 평균들이 좁게 모였다는 뜻이다. 처음부터 한쪽으로 치우친 데이터를 뽑았거나 계산할 때 세운 가정이 잘못됐다면 결과도 잘못될 수 있다.

이해 점검

주사위 한 번의 결과가 1~6 균등분포일 때 정규분포에 가까워지는 대상은 무엇인가?

크기 nn의 표본을 반복해 계산한 표본평균들의 표집분포다. 주사위 결과 자체가 아니다.

표본 크기를 4배로 늘리면 표준오차는 어떻게 되는가?

4=2\sqrt{4}=2로 나누므로 절반이 된다.

표본 크기 30과 반복 횟수 2,000은 각각 무엇을 뜻하는가?

30은 평균 하나에 들어가는 관측 수이고, 2,000은 그런 표본평균을 히스토그램에 몇 개 만들지 뜻한다.

왜 일간 수익률 30개만으로 충분하다고 단정하면 안 되는가?

큰 변동이 이어지거나, 가끔 매우 큰 값이 나오거나, 시장 상황에 따라 데이터의 규칙이 바뀔 수 있기 때문이다.

완료 기준

주사위 한 번의 결과·한 표본·표본평균·표집분포를 구분하고, 주사위 표본 크기별 표준오차를 계산하며, 대수의 법칙과 중심극한정리의 대상과 조건을 각각 설명할 수 있으면 다음 페이지로 넘어간다. 다음 선택 실습에서는 반복 표본 생성 자체를 계산 도구로 사용한다.

이 자료는 중심극한정리의 대표적인 조건과 직관을 설명하는 교육 자료이며 금융시계열의 정규성을 보장하지 않는다.