Q

PRIVATE NAVIGATION MODE

ML4T 탭 잠금 해제

패스워드를 확인하면 이 브라우저에서 ML4T 탭과 검색 결과를 표시합니다.

STUDY SEARCH

학습 자료 검색

제목과 설명, 키워드, 학습 본문에서 찾습니다.

검색 범위

검색어를 입력해 주세요.

SEARCH THE NOTEBOOK

찾고 싶은 금융·통계·전략 개념을 입력해 보세요.

CHAPTER 04.9 / LAW OF LARGE NUMBERS

4.9 반복 평균이 장기 평균에 가까워지는 이유

반복 시행에서 누적 표본평균이 장기 평균 주변에서 안정되는 성질과 한계를 살펴봅니다.

4장. 확률분포·조건부확률·베이즈와 중심극한정리초급 학습 노트

4.9 반복 평균이 장기 평균에 가까워지는 이유

이 페이지는 4장의 필수 개념이다. 같은 확률모형을 반복할 때 한 실행의 표본평균이 장기 평균 주변에서 안정되는 의미와 한계를 설명하는 것이 목표다.

4.8까지는 확률을 알고 계산했다. 실제 연구에서는 과거 표본으로 알 수 없는 확률이나 평균을 추정한다. 시행 수가 늘면 왜 평균이 덜 흔들리는 것처럼 보일까?

0과 1의 평균은 성공비율이다

Bernoulli trial(베르누이 시행)은 성공을 1, 실패를 0으로 표현하는 시행이다. 성공확률이 pp라면 장기 평균의 기준은 pp다. 처음 nn개 관측의 Sample mean(표본평균)은 다음과 같다.

Xˉn=1ni=1nXi\bar{X}_n = \frac{1}{n}\sum_{i=1}^{n}X_i
XiX_i
ii번째 Bernoulli trial(베르누이 시행)의 결과
단위: 성공 1, 실패 0
nn
현재까지의 시행 수
단위: 시행 개수
Xˉn\bar{X}_n
처음 nn개 결과의 Sample mean(표본평균)
단위: 성공비율

예를 들어 10회 중 7회 성공이면 표본평균은 0.7, 즉 70%다. 성공과 실패의 순서는 달라도 성공 수가 같으면 마지막 표본평균은 같다.

반복 횟수가 늘면 누적 평균이 덜 흔들린다

공정한 동전을 반복해서 던지고 앞면을 1, 뒷면을 0으로 기록해 보자. 초반에는 동전을 한 번 더 던질 때마다 누적 앞면 비율이 크게 바뀐다. 하지만 매번 같은 규칙으로 동전을 던지고 앞선 결과가 다음 결과를 바꾸지 않는다면, 반복 횟수가 많아질수록 누적 앞면 비율은 50% 주변에서 덜 흔들린다. Law of large numbers(대수의 법칙)는 이러한 장기적인 안정화를 설명한다.

누적 앞면 비율50%\text{누적 앞면 비율} \longrightarrow 50\%

화살표는 동전을 한 번 더 던질 때마다 비율이 반드시 50%에 가까워진다는 뜻이 아니다. 1,000회까지의 누적 앞면 비율이 100회 때보다 잠시 더 멀어질 수도 있다. 반복을 충분히 늘리면 50%에서 크게 벗어난 상태가 계속될 가능성이 작아진다는 뜻이다.

INTERACTIVE STUDY TOOL누적평균 안정화 실험베르누이 반복 시행에서 시행 수가 늘어날 때 한 경로의 누적 성공비율이 어떻게 움직이는지 확인합니다.
55%
1회10,000
마지막 누적평균54.84%
10
50.00%
100
54.00%
1,000
56.30%
10,000
54.84%

목표 확률은 55%입니다. 중간 경로가 단조롭게 가까워질 필요는 없습니다.

10회와 10,000회의 불확실성은 다르다

성공확률이 55%인 가상 시행을 생각하자. 10회에서는 성공 한 번이 비율을 10퍼센트포인트 바꾸지만 10,000회에서는 0.01퍼센트포인트만 바꾼다. 그래서 큰 표본의 평균은 개별 관측 하나에 덜 민감하다.

그러나 성공확률 55%는 수익 전략을 뜻하지 않는다. 평균 이익과 평균 손실, 비용, 연속 손실과 표본 의존성이 빠져 있다.

Gambler's fallacy(도박사의 오류)는 독립 시행을 잘못 읽는다

공정한 동전에서 앞면이 여러 번 나왔다고 다음 시행의 뒷면 확률이 50%보다 높아지는 것은 아니다. 독립 시행에서는 과거 순서가 다음 확률을 바꾸지 않는다. 대수의 법칙은 장기 비율이 50% 주변에서 안정된다는 말이지 단기 불균형을 다음 결과가 반드시 보상한다는 말이 아니다.

큰 표본은 편향된 질문을 고치지 못한다

표본 수를 늘리면 같은 모형 안의 random error(무작위 오차)는 줄어들 수 있다. 다음 문제는 자동으로 해결되지 않는다.

  • 특정 시기나 살아남은 종목만 고른 Sampling bias(표본편향)
  • 연속된 수익률이나 겹치는 포지션의 강한 의존성
  • 평균과 분포가 시간에 따라 바뀌는 구조 변화
  • 거래비용, 상장폐지와 체결 실패 누락
  • 애초에 잘못 정의한 성공 사건

백테스트 관측 수 100만 개가 있어도 같은 하루의 중복 데이터라면 독립적인 정보 100만 개가 아니다.

자주 생기는 오해

  • 많이 반복해도 다음 동전이 앞면인지 뒷면인지는 알 수 없다.
  • 누적 평균은 오르내리면서 안정되므로 매번 장기 평균에 가까워지는 것은 아니다.
  • 데이터를 많이 모아도 한쪽으로 치우친 데이터나 잘못된 가정은 그대로 남는다.
  • 손실이 여러 번 이어졌다고 해서 다음번에 이익이 날 가능성이 저절로 높아지지는 않는다.
  • 성공 횟수가 많아도 한 번의 손실이 크거나 비용이 많이 들면 전체 결과는 손실일 수 있다.

이해 점검

베르누이 결과 1, 0, 1, 1의 표본평균은 얼마인가?

합은 3이고 시행 수는 4이므로 3/4=75%3/4=75\%다.

대수의 법칙이 표본평균의 단조 수렴을 보장하는가?

아니다. 표본평균은 중간에 멀어질 수 있으며 장기적인 수렴 성질을 말한다.

연속 실패 뒤 독립적인 다음 시행의 성공확률이 높아지는가?

아니다. 독립 시행에서는 과거 결과가 다음 성공확률을 바꾸지 않는다.

표본 수를 늘려도 잘못된 결과가 남을 수 있는 이유는 무엇인가?

표본 선택이 편향되거나 관측이 의존적이고 데이터 생성 과정이 변하면 같은 오류를 더 정밀하게 측정할 수 있기 때문이다.

완료 기준

0·1 결과 배열에서 누적 표본평균을 계산하고, 시행 수 증가가 평균을 안정시키는 의미를 설명하되 단조 수렴·다음 결과 예측·편향 제거를 보장하지 않는다고 말할 수 있으면 다음 페이지로 넘어간다. 다음 페이지에서는 한 경로가 아니라 반복해서 얻은 표본평균들의 분포를 본다.

이 자료는 대수의 법칙을 설명하는 교육 자료이며 가상 성공확률을 실제 투자 성과 가능성으로 해석하지 않는다.