CHAPTER 04.4 / VARIANCE AND STANDARD DEVIATION
4.4 평균 주변의 퍼짐을 재는 분산과 표준편차
학생 키 모집단에서 평균, 편차, 분산과 표준편차를 단계별로 계산합니다.
4.4 평균 주변의 퍼짐을 재는 분산과 표준편차
이 페이지는 4장의 필수 개념이다. 모집단 전체 값에서 Variance(분산)와 Standard deviation(표준편차)을 직접 계산하고 두 값의 단위를 구분하는 것이 목표다.
4.2와 4.3에서는 가능한 값들이 분포를 이루는 모습을 살펴보았다. 이제 값들이 중심 주변에 얼마나 좁게 모이거나 넓게 퍼져 있는지를 숫자 하나로 요약해 보자. 이 계산은 다음 페이지에서 정규분포의 폭을 읽을 때 사용한다.
Population(모집단)과 Sample(표본)이란?
한 학교 학생 1,000명의 시험 점수를 알고 싶다고 하자.
- Population(모집단): 학생 1,000명의 시험 점수 전체
- Sample(표본): 그중 실제로 조사한 30명의 시험 점수
모집단은 알고 싶은 전체이고, 표본은 그 전체를 알아보기 위해 뽑아 관찰한 일부다. 조사할 30명이 달라지면 표본에서 계산한 평균과 표준편차도 달라질 수 있다.
학생 다섯 명의 평균 키를 구한다
학생이 다섯 명인 가상 학급을 생각하자. 학생들의 키는 각각 , , , , 다. 여기서는 이 다섯 명 전원이 관심 대상이므로 하나의 Population(모집단)이다.
Population mean(모집단 평균) 는 모든 키를 더한 뒤 모집단 크기 으로 나눈 값이다.
- Population mean(모집단 평균)
- 단위:
- 모집단 전체 학생 수
- 단위: 명
- 번째 학생의 키
- 단위:
평균을 빼서 편차를 구한다
Deviation(편차)은 각 값에서 평균을 뺀 차이다. 평균보다 작으면 음수이고, 평균보다 크면 양수다.
- 번째 학생 키의 Deviation(편차)
- 단위:
- 번째 학생의 키
- 단위:
- 학급 전체의 Population mean(모집단 평균)
- 단위:
다섯 편차는 , , , , 다. 편차를 그대로 더하면 음수와 양수가 서로 지워져 0이 된다. 모든 키가 평균과 같아서 0이 된 것이 아니므로, 편차 합만으로는 퍼진 정도를 잴 수 없다.
편차를 제곱하고 개수로 나누면 분산이다
편차를 각각 제곱하면 음수도 양수가 되고, 평균에서 멀리 떨어진 값에는 더 큰 수가 붙는다. 편차제곱은 , , , , 이고 합은 다.
Population variance(모집단 분산) 은 편차제곱합을 모집단의 값 개수 으로 나눈 값이다.
- Population variance(모집단 분산)
- 단위:
- 모집단 전체 학생 수
- 단위: 명
- 번째 학생의 키
- 단위:
- 학급 전체의 Population mean(모집단 평균)
- 단위:
따라서 편차들의 제곱합 자체가 분산은 아니다. 제곱합을 값의 개수 5로 나눈 이 이 학급의 분산이다.
분산에 제곱근을 취하면 표준편차다
분산은 키를 제곱한 단위인 을 사용해 원래 키와 바로 비교하기 어렵다. 분산에 제곱근을 취하면 다시 키와 같은 단위로 돌아온다.
- Population standard deviation(모집단 표준편차)
- 단위:
- Population variance(모집단 분산)
- 단위:
이 학급의 키는 평균 170cm 주변에서 표준편차 약 7.07cm만큼 퍼져 있다고 요약할 수 있다. 표준편차는 모든 학생이 평균에서 정확히 7.07cm 떨어져 있다는 뜻이 아니라, 다섯 편차의 전체적인 크기를 하나의 값으로 나타낸 것이다.
- Population mean(모집단 평균)
- 170cm
- 편차제곱합
- 250cm²
- Population variance(모집단 분산)
- 50cm²
분산은 편차제곱합을 5로 나눈 값이고, 표준편차는 그 분산의 제곱근입니다.
| 학생 | 키 | 평균과의 편차 | 편차제곱 |
|---|---|---|---|
| 1 | 160cm | -10cm | 100cm² |
| 2 | 165cm | -5cm | 25cm² |
| 3 | 170cm | 0cm | 0cm² |
| 4 | 175cm | 5cm | 25cm² |
| 5 | 180cm | 10cm | 100cm² |
같은 숫자도 모집단인지 표본인지 먼저 정한다
이번 예시에서는 다섯 명이 관심 대상인 학급 전체이므로 편차제곱합을 로 나눴다. 같은 다섯 명이 더 큰 학교에서 일부만 뽑은 Sample(표본)이고 학교 전체의 분산을 추정하려는 목적이라면 분모로 을 흔히 사용한다.
같은 숫자 배열이라도 질문의 대상에 따라 계산 목적이 달라진다.
| 상황 | 계산 목적 | 분모 |
|---|---|---|
| 학급 다섯 명 전체가 관심 대상 | 모집단의 실제 퍼짐을 기술 | |
| 학교에서 다섯 명만 선택 | 더 큰 모집단의 퍼짐을 추정 |
표본에서 을 사용하는 이유와 수익률 예시는 3.4 가격 변화의 흔들림을 재는 방법에서 자세히 다룬다.
분산과 표준편차를 해석할 때 남는 한계
- 모든 값이 같으면 모든 편차가 0이므로 분산과 표준편차도 0이다.
- 평균에서 멀리 떨어진 값을 제곱하므로 극단적인 값 하나에 크게 영향을 받을 수 있다.
- 표준편차가 같아도 분포의 비대칭과 꼬리 모양은 서로 다를 수 있다.
- 표준편차는 퍼진 정도를 요약하지만 손실 가능성이나 위험 전체를 보장해 주는 숫자는 아니다.
자주 생기는 오해
- 편차제곱합 자체를 분산이라고 부르지 않는다. 모집단 분산은 제곱합을 으로 나눈 값이다.
- 표준편차는 편차제곱합을 나눈 값이 아니라, 그렇게 구한 분산에 제곱근을 취한 값이다.
- 편차 합이 0이라고 값들이 모두 평균과 같은 것은 아니다.
- 모든 표준편차 계산에서 자동으로 을 사용하지 않는다. 모집단을 기술하는지 표본으로 추정하는지 먼저 정한다.
- 표준편차가 작다고 큰 손실이 불가능한 것은 아니다.
이해 점검
편차들의 제곱합을 값의 개수로 나누면 무엇인가?
모집단 전체 값을 다루는 이 페이지의 조건에서는 Population variance(모집단 분산)다. Standard deviation(표준편차)은 그 분산의 제곱근이다.
분산이 이면 표준편차는 얼마인가?
다.
다섯 학생의 키가 모두 170cm라면 분산과 표준편차는 얼마인가?
모든 편차가 0이므로 분산은 , 표준편차는 다.
왜 같은 다섯 개의 키에 때로는 5, 때로는 4를 분모로 사용하는가?
다섯 명 전체의 실제 퍼짐을 기술하면 로 나누고, 더 큰 모집단을 추정하기 위한 표본이면 로 나누기 때문이다.
완료 기준
모집단 전체 값에서 평균·편차·편차제곱합·분산·표준편차를 순서대로 계산하고, 분산과 표준편차의 단위 및 모집단 분모 과 표본 추정 분모 의 사용 조건을 구분할 수 있으면 다음 페이지로 넘어간다. 다음 필독 페이지에서는 평균과 표준편차가 정규분포의 중심과 폭을 어떻게 정하는지 살펴본다.
이 자료의 학생 키는 계산 원리를 설명하기 위한 가상 값이며 실제 학급이나 집단을 나타내지 않는다.