CHAPTER 04.5 / NORMAL DISTRIBUTION
4.5 평균 주변의 종 모양 분포
정규분포의 평균과 표준편차가 곡선 모양을 정하는 원리와 밀도 높이, 표준점수, 구간확률을 살펴봅니다.
4.5 평균 주변의 종 모양 분포
이 페이지는 4장의 필수 개념이다. 정규분포의 중심과 폭을 평균·표준편차로 읽고, 밀도 높이·표준점수와 구간확률을 구분하는 것이 목표다.
4.3을 건너뛰었어도 알아야 할 핵심은 간단하다. 연속분포의 확률은 밀도곡선 아래 면적이다. 4.4에서는 학생 키로 모집단 표준편차를 직접 계산했다. 이제 표준편차가 정규분포의 폭을 어떻게 정하는지 살펴본다.
평균은 중심을, 표준편차는 폭을 정한다
Normal distribution(정규분포)은 평균을 중심으로 좌우 대칭인 연속분포다. 중심에 값이 가장 많이 모이고, 중심에서 멀어질수록 값은 드물어진다. Mean(평균), Median(중앙값)과 Mode(최빈값)는 중심에서 일치한다.
Population(모집단)은 우리가 관심을 두는 전체 값의 모임이다. 한 반 학생들의 키를 살펴본다면 그 반 학생 전원의 키가 모집단이다. Population mean(모집단 평균) 는 반 전체의 평균 키다. Population standard deviation(모집단 표준편차) 가 작으면 학생들의 키가 평균 주변에 비슷하게 모여 있고, 크면 학생들의 키 차이가 커서 더 넓게 퍼져 있다. 이 예시에서 와 의 단위는 모두 다. 는 반드시 0보다 커야 하며, 와 가 정해지면 정규곡선 전체가 정해진다.
먼저 아래 차트에서 를 움직여 곡선의 폭을 바꾸고, 를 움직여 선택한 점의 세로 높이 를 확인해 보자. 가 커지면 곡선은 넓고 낮아지고, 작아지면 좁고 높아진다.
수식에 x=100을 넣어 계산한 곡선의 세로 높이입니다. 값 100이 나올 확률을 뜻하지는 않습니다.
- Population mean(모집단 평균) μ
- 100
- Population standard deviation(모집단 표준편차) σ
- 10
차트에 그려진 곡선과 선택한 점의 높이는 다음 Probability density function(확률밀도함수)으로 계산한다.
- 아직 어떤 값이 관측될지 정해지지 않은 Random variable(확률변수)
- 단위: 문제에서 정한 값의 단위
- 가 가질 수 있는 값 중 곡선에서 확인하려는 특정 값
- 단위: 와 같은 단위
- 특정 값 를 수식에 넣어 계산한 Probability density(확률밀도), 즉 곡선의 세로 높이
- 단위: 단위의 역수
- 모집단 전체 값의 중심인 Population mean(모집단 평균)
- 단위: 와 같은 단위
- 모집단 전체 값이 중심 주변에 퍼진 정도인 Population standard deviation(모집단 표준편차)
- 단위: 와 같은 단위
는 에서 정규곡선이 얼마나 높은지를 나타낸다. 높을수록 그 값 주변에 관측값이 더 조밀하게 모인다는 뜻이지만, 정확히 그 값이 나올 확률은 아니다. 연속분포에서 한 점의 확률 는 0이고, 폭이 있는 구간의 확률은 곡선 아래 면적으로 읽는다.
표준점수는 평균에서 몇 표준편차 떨어졌는지 말한다
Z-score(표준점수)는 값의 원래 단위를 없애고 평균에서 떨어진 거리를 표준편차 단위로 바꾼다.
- 평균에서 떨어진 거리를 나타내는 Z-score(표준점수)
- 단위: 없음
- 표준화할 관측값
- 단위: 확률변수와 같은 단위
- 정규분포의 평균
- 단위: 와 같은 단위
- 정규분포의 표준편차
- 단위: 와 같은 단위
평균 100, 표준편차 10인 분포에서 90과 110을 계산해 보자.
- 값 90의 Z-score(표준점수)
- 단위: 없음
- 값 110의 Z-score(표준점수)
- 단위: 없음
따라서 90은 평균보다 한 표준편차 아래, 110은 한 표준편차 위에 있다.
정규분포에서만 적용하는 경험법칙
정규분포에서는 평균을 중심으로 다음 구간확률이 성립한다.
| 평균 중심 구간 | 포함 확률 |
|---|---|
| 약 68.27% | |
| 약 95.45% | |
| 약 99.73% |
평균 100과 표준편차 10에서 90~110은 이므로 확률은 약 68.27%다. 이 숫자는 정규분포 가정 아래의 면적이며 모든 종 모양 데이터나 모든 분포에 적용되는 법칙이 아니다.
- 하한 Z-score(표준점수)
- -1
- 상한 Z-score(표준점수)
- 1
- 전체 곡선 면적
- 1.0000
표준편차 밖은 불가능 영역이 아니다
평균에서 두 표준편차 밖에도 약 4.55%의 확률이 남는다. 세 표준편차 밖에도 약 0.27%가 남는다. 평균 ± 3표준편차를 절대 경계로 사용하면 드문 결과를 불가능으로 잘못 처리한다.
표준점수의 절댓값이 크다는 사실은 정규분포 안에서 평균으로부터 멀리 떨어져 있다는 뜻이다. 그 값이 불가능하거나 반드시 데이터 오류라는 뜻은 아니다.
자주 생기는 오해
- 종 모양으로 보이는 모든 데이터가 정확한 정규분포는 아니다.
- 표준편차가 커져도 전체 곡선 아래 면적은 1이다.
- 정규분포의 밀도 높이는 한 점의 확률이 아니다.
- 68%·95%·99.7% 규칙은 정규분포에서의 근삿값이다.
- 절댓값이 큰 Z-score가 자동으로 데이터 오류를 뜻하지 않는다.
이해 점검
평균 100, 표준편차 10에서 값 120의 표준점수는 얼마인가?
다. 평균보다 두 표준편차 위에 있다.
표준편차가 10에서 20으로 커지면 곡선은 어떻게 달라지는가?
곡선은 더 넓고 낮아진다. 그러나 전체 면적은 계속 1이다.
평균 ±1표준편차 안에 항상 약 68%가 들어가는가?
아니다. 약 68.27%는 정규분포 가정에서 성립한다. 다른 분포에는 그대로 적용할 수 없다.
가 크면 정확히 일 확률도 큰가?
아니다. 는 값 에서의 밀도 높이다. 연속분포에서 한 점의 확률 는 0이며, 확률은 폭이 있는 구간 아래의 면적으로 구한다.
완료 기준
평균과 표준편차가 정규곡선의 중심과 폭을 어떻게 정하는지 설명하고, 밀도 높이와 한 점의 확률을 구분하며, 관측값의 Z-score와 평균 ±1표준편차 구간확률을 계산할 수 있으면 다음 페이지로 넘어간다. 다음 페이지에서는 두 사건이 함께 일어나는 교집합 확률을 계산한다.