Q

PRIVATE NAVIGATION MODE

ML4T 탭 잠금 해제

패스워드를 확인하면 이 브라우저에서 ML4T 탭과 검색 결과를 표시합니다.

STUDY SEARCH

학습 자료 검색

제목과 설명, 키워드, 학습 본문에서 찾습니다.

검색 범위

검색어를 입력해 주세요.

SEARCH THE NOTEBOOK

찾고 싶은 금융·통계·전략 개념을 입력해 보세요.

CHAPTER 04.4 / VARIANCE AND STANDARD DEVIATION

4.4 평균 주변의 퍼짐을 재는 분산과 표준편차

학생 키 모집단에서 평균, 편차, 분산과 표준편차를 단계별로 계산합니다.

4장. 확률분포·조건부확률·베이즈와 중심극한정리초급 학습 노트

4.4 평균 주변의 퍼짐을 재는 분산과 표준편차

이 페이지는 4장의 필수 개념이다. 모집단 전체 값에서 Variance(분산)와 Standard deviation(표준편차)을 직접 계산하고 두 값의 단위를 구분하는 것이 목표다.

4.2와 4.3에서는 가능한 값들이 분포를 이루는 모습을 살펴보았다. 이제 값들이 중심 주변에 얼마나 좁게 모이거나 넓게 퍼져 있는지를 숫자 하나로 요약해 보자. 이 계산은 다음 페이지에서 정규분포의 폭을 읽을 때 사용한다.

Population(모집단)과 Sample(표본)이란?

한 학교 학생 1,000명의 시험 점수를 알고 싶다고 하자.

  • Population(모집단): 학생 1,000명의 시험 점수 전체
  • Sample(표본): 그중 실제로 조사한 30명의 시험 점수

모집단은 알고 싶은 전체이고, 표본은 그 전체를 알아보기 위해 뽑아 관찰한 일부다. 조사할 30명이 달라지면 표본에서 계산한 평균과 표준편차도 달라질 수 있다.

학생 다섯 명의 평균 키를 구한다

학생이 다섯 명인 가상 학급을 생각하자. 학생들의 키는 각각 160cm160\text{cm}, 165cm165\text{cm}, 170cm170\text{cm}, 175cm175\text{cm}, 180cm180\text{cm}다. 여기서는 이 다섯 명 전원이 관심 대상이므로 하나의 Population(모집단)이다.

Population mean(모집단 평균) μ\mu는 모든 키를 더한 뒤 모집단 크기 NN으로 나눈 값이다.

μ=1Ni=1Nxi=160+165+170+175+1805=170cm\begin{aligned} \mu &= \frac{1}{N}\sum_{i=1}^{N}x_i \\ &= \frac{160+165+170+175+180}{5} \\ &= 170\text{cm} \end{aligned}
μ\mu
Population mean(모집단 평균)
단위: cm\text{cm}
NN
모집단 전체 학생 수
단위: 명
xix_i
ii번째 학생의 키
단위: cm\text{cm}

평균을 빼서 편차를 구한다

Deviation(편차)은 각 값에서 평균을 뺀 차이다. 평균보다 작으면 음수이고, 평균보다 크면 양수다.

di=xiμd_i=x_i-\mu
did_i
ii번째 학생 키의 Deviation(편차)
단위: cm\text{cm}
xix_i
ii번째 학생의 키
단위: cm\text{cm}
μ\mu
학급 전체의 Population mean(모집단 평균)
단위: cm\text{cm}

다섯 편차는 10cm-10\text{cm}, 5cm-5\text{cm}, 0cm0\text{cm}, 5cm5\text{cm}, 10cm10\text{cm}다. 편차를 그대로 더하면 음수와 양수가 서로 지워져 0이 된다. 모든 키가 평균과 같아서 0이 된 것이 아니므로, 편차 합만으로는 퍼진 정도를 잴 수 없다.

편차를 제곱하고 개수로 나누면 분산이다

편차를 각각 제곱하면 음수도 양수가 되고, 평균에서 멀리 떨어진 값에는 더 큰 수가 붙는다. 편차제곱은 100cm2100\text{cm}^2, 25cm225\text{cm}^2, 0cm20\text{cm}^2, 25cm225\text{cm}^2, 100cm2100\text{cm}^2이고 합은 250cm2250\text{cm}^2다.

Population variance(모집단 분산) σ2\sigma^2은 편차제곱합을 모집단의 값 개수 NN으로 나눈 값이다.

σ2=1Ni=1N(xiμ)2=100+25+0+25+1005=50cm2\begin{aligned} \sigma^2 &= \frac{1}{N}\sum_{i=1}^{N}(x_i-\mu)^2 \\ &= \frac{100+25+0+25+100}{5} \\ &= 50\text{cm}^2 \end{aligned}
σ2\sigma^2
Population variance(모집단 분산)
단위: cm2\text{cm}^2
NN
모집단 전체 학생 수
단위: 명
xix_i
ii번째 학생의 키
단위: cm\text{cm}
μ\mu
학급 전체의 Population mean(모집단 평균)
단위: cm\text{cm}

따라서 편차들의 제곱합 250cm2250\text{cm}^2 자체가 분산은 아니다. 제곱합을 값의 개수 5로 나눈 50cm250\text{cm}^2이 이 학급의 분산이다.

분산에 제곱근을 취하면 표준편차다

분산은 키를 제곱한 단위인 cm2\text{cm}^2을 사용해 원래 키와 바로 비교하기 어렵다. 분산에 제곱근을 취하면 다시 키와 같은 cm\text{cm} 단위로 돌아온다.

σ=σ2=50cm27.07cm\begin{aligned} \sigma &= \sqrt{\sigma^2} \\ &= \sqrt{50\text{cm}^2} \\ &\approx 7.07\text{cm} \end{aligned}
σ\sigma
Population standard deviation(모집단 표준편차)
단위: cm\text{cm}
σ2\sigma^2
Population variance(모집단 분산)
단위: cm2\text{cm}^2

이 학급의 키는 평균 170cm 주변에서 표준편차 약 7.07cm만큼 퍼져 있다고 요약할 수 있다. 표준편차는 모든 학생이 평균에서 정확히 7.07cm 떨어져 있다는 뜻이 아니라, 다섯 편차의 전체적인 크기를 하나의 값으로 나타낸 것이다.

INTERACTIVE STUDY TOOL학생 키로 퍼짐 계산하기학급 전체 다섯 명의 키를 바꾸며 평균, 편차, 편차제곱, 모집단 분산과 모집단 표준편차를 순서대로 확인합니다.
학급 전체 학생 5명의 키
σ = 7.07cm
Population mean(모집단 평균)
170cm
편차제곱합
250cm²
Population variance(모집단 분산)
50cm²

분산은 편차제곱합을 5로 나눈 값이고, 표준편차는 그 분산의 제곱근입니다.

학생평균과의 편차편차제곱
1160cm-10cm100cm²
2165cm-5cm25cm²
3170cm0cm0cm²
4175cm5cm25cm²
5180cm10cm100cm²

같은 숫자도 모집단인지 표본인지 먼저 정한다

이번 예시에서는 다섯 명이 관심 대상인 학급 전체이므로 편차제곱합을 N=5N=5로 나눴다. 같은 다섯 명이 더 큰 학교에서 일부만 뽑은 Sample(표본)이고 학교 전체의 분산을 추정하려는 목적이라면 분모로 n1n-1을 흔히 사용한다.

같은 숫자 배열이라도 질문의 대상에 따라 계산 목적이 달라진다.

상황계산 목적분모
학급 다섯 명 전체가 관심 대상모집단의 실제 퍼짐을 기술N=5N=5
학교에서 다섯 명만 선택더 큰 모집단의 퍼짐을 추정n1=4n-1=4

표본에서 n1n-1을 사용하는 이유와 수익률 예시는 3.4 가격 변화의 흔들림을 재는 방법에서 자세히 다룬다.

분산과 표준편차를 해석할 때 남는 한계

  • 모든 값이 같으면 모든 편차가 0이므로 분산과 표준편차도 0이다.
  • 평균에서 멀리 떨어진 값을 제곱하므로 극단적인 값 하나에 크게 영향을 받을 수 있다.
  • 표준편차가 같아도 분포의 비대칭과 꼬리 모양은 서로 다를 수 있다.
  • 표준편차는 퍼진 정도를 요약하지만 손실 가능성이나 위험 전체를 보장해 주는 숫자는 아니다.

자주 생기는 오해

  • 편차제곱합 자체를 분산이라고 부르지 않는다. 모집단 분산은 제곱합을 NN으로 나눈 값이다.
  • 표준편차는 편차제곱합을 나눈 값이 아니라, 그렇게 구한 분산에 제곱근을 취한 값이다.
  • 편차 합이 0이라고 값들이 모두 평균과 같은 것은 아니다.
  • 모든 표준편차 계산에서 자동으로 n1n-1을 사용하지 않는다. 모집단을 기술하는지 표본으로 추정하는지 먼저 정한다.
  • 표준편차가 작다고 큰 손실이 불가능한 것은 아니다.

이해 점검

편차들의 제곱합을 값의 개수로 나누면 무엇인가?

모집단 전체 값을 다루는 이 페이지의 조건에서는 Population variance(모집단 분산)다. Standard deviation(표준편차)은 그 분산의 제곱근이다.

분산이 50cm250\text{cm}^2이면 표준편차는 얼마인가?

50cm7.07cm\sqrt{50}\text{cm}\approx7.07\text{cm}다.

다섯 학생의 키가 모두 170cm라면 분산과 표준편차는 얼마인가?

모든 편차가 0이므로 분산은 0cm20\text{cm}^2, 표준편차는 0cm0\text{cm}다.

왜 같은 다섯 개의 키에 때로는 5, 때로는 4를 분모로 사용하는가?

다섯 명 전체의 실제 퍼짐을 기술하면 N=5N=5로 나누고, 더 큰 모집단을 추정하기 위한 표본이면 n1=4n-1=4로 나누기 때문이다.

완료 기준

모집단 전체 값에서 평균·편차·편차제곱합·분산·표준편차를 순서대로 계산하고, 분산과 표준편차의 단위 및 모집단 분모 NN과 표본 추정 분모 n1n-1의 사용 조건을 구분할 수 있으면 다음 페이지로 넘어간다. 다음 필독 페이지에서는 평균과 표준편차가 정규분포의 중심과 폭을 어떻게 정하는지 살펴본다.

이 자료의 학생 키는 계산 원리를 설명하기 위한 가상 값이며 실제 학급이나 집단을 나타내지 않는다.