CHAPTER 05.5 / Z-SCORE
5.5 평균에서 표준편차 몇 배 떨어졌는지
관측값을 평균에서 떨어진 표준편차 단위로 바꾸고 확률 해석에 필요한 추가 가정을 구분합니다.
5.5 평균에서 표준편차 몇 배 떨어졌는지
이 페이지는 5장의 필수 개념이다. Z-score(표준점수)로 관측값의 평균 대비 위치를 표준편차 단위로 바꾸고, 위치 비교와 확률 해석에 필요한 가정을 구분하는 것이 목표다.
5.4를 건너뛰었어도 필요한 핵심은 간단하다. 원래 단위를 없앤 비율은 서로 다른 자료를 비교하게 해 주지만, 분모가 무엇이고 어떤 조건에서 의미가 있는지 먼저 확인해야 한다.
| 값 | 무엇을 말하는가 | 추가로 필요한 것 |
|---|---|---|
| 원래 편차 | 평균과의 거리 | 원래 단위 |
| Z-score(표준점수) | 표준편차 몇 배 거리인지 | 양의 표준편차 |
| 확률 해석 | 기준값과 같거나 더 바깥쪽 값이 나올 확률 | 정규분포 등 구체적 분포 가정 |
평균을 0으로 맞추고, 표준편차 1개를 거리 1로 센다
쉽게 말하면 평균을 출발점 0으로 놓고, 표준편차 1개만큼의 거리를 1로 세는 것이다. 예를 들어 평균이 100이고 표준편차가 10이면 Z점수로 바꾼 값 100은 0, 값 110은 1, 값 90은 -1이 된다.
모집단 평균과 표준편차를 아는 경우 한 관측값의 Z-score(표준점수)는 다음과 같다.
- 관측값의 Z-score(표준점수)
- 단위: 없음
- 표준화할 관측값
- 단위: 원래 변수의 단위
- Population mean(모집단 평균)
- 단위: 와 같은 단위
- 양의 Population standard deviation(모집단 표준편차)
- 단위: 와 같은 단위
- : 관측값이 평균과 같다.
- : 평균보다 두 표준편차 위다.
- : 평균보다 1.5표준편차 아래다.
Population(모집단)과 Sample(표본)이란?
한 학교 학생 1,000명의 시험 점수를 알고 싶다고 하자.
- Population(모집단): 학생 1,000명의 시험 점수 전체
- Sample(표본): 그중 실제로 조사한 30명의 시험 점수
모집단은 알고 싶은 전체이고, 표본은 그 전체를 알아보기 위해 뽑아 관찰한 일부다. 조사할 30명이 달라지면 표본에서 계산한 평균과 표준편차도 달라질 수 있다.
Population(모집단) 전체의 평균과 표준편차를 모를 때는 가지고 있는 Sample(표본)에서 계산한 평균과 표준편차를 대신 사용할 수 있다. 다만 표본이 바뀌면 계산한 평균과 표준편차도 달라져 같은 관측값의 Z-score(표준점수)가 달라질 수 있다. 따라서 어떤 자료에서 구한 평균과 표준편차를 사용했는지 함께 기록한다.
원래 단위가 달라도 상대 위치를 비교한다
자료 A는 평균 100, 표준편차 10, 관측값 120이고 자료 B는 평균 50, 표준편차 2, 관측값 54라고 하자.
- ,
- 두 관측값의 Z-score(표준점수)
- 단위: 없음
- ,
- 평균과 표준편차가 서로 다른 두 가상 자료
- 단위: 각 자료의 원래 단위
원래 차이는 20과 4로 다르지만 둘 다 자기 평균보다 두 표준편차 위에 있다.
계산을 한 줄씩 보면 A의 원래 편차는 120-100=20, 이를 표준편차 10으로 나누어 2다. B의 편차는 54-50=4, 이를 표준편차 2로 나누어 역시 2다. 표준화는 두 편차를 같게 만드는 것이 아니라 각 자료의 평소 흔들림을 기준으로 다시 표현한다.
- 관측 A: 원래 편차 → Z점수
- 20.00 → 2.00
- 관측 B: 원래 편차 → Z점수
- 4.00 → 2.00
같은 Z점수는 같은 상대 위치를 뜻하지만, 그 값이 얼마나 드문지는 분포를 가정해야 판단할 수 있습니다.
Tail probability(꼬리확률)는 무엇인가
분포 그래프에서 값이 드물게 나타나는 양쪽 끝부분을 꼬리라고 부른다. 예를 들어 시험 점수 분포에서 90점 이상을 기준으로 정했다면 90점과 그보다 높은 점수가 오른쪽 꼬리에 들어간다.
정한 기준값과 같거나 더 끝쪽 값이 나올 확률이 Tail probability(꼬리확률)다. 오른쪽 끝을 세면 Right-tail probability(오른쪽 꼬리확률), 왼쪽 끝을 세면 Left-tail probability(왼쪽 꼬리확률)다. 어느 방향을 볼지와 어떤 분포를 가정할지를 먼저 정해야 한다.
Standard normal distribution(표준정규분포)에서 z가 2.0이상인 영역입니다.
분포 가정이 달라지면 같은 Z값의 꼬리확률도 달라질 수 있습니다.
Z점수가 크다고 바로 드문 일이나 매매 신호는 아니다
Z점수는 관측값이 평균에서 얼마나 멀리 떨어졌는지만 알려 준다. 예를 들어 는 평균보다 표준편차 2개만큼 위에 있다는 뜻이다. 모집단이 Standard normal distribution(표준정규분포)을 따른다고 가정하고 인 오른쪽 영역을 셀 때 꼬리확률은 약 2.3%다. 다른 분포를 가정하면 같은 Z점수의 꼬리확률도 달라질 수 있다.
실제 금융수익률은 정규분포와 다를 수 있다
실제 금융수익률의 분포 모양은 정규분포와 다를 수 있다.
- Fat tails(두꺼운 꼬리): 큰 상승이나 하락이 정규분포의 예상보다 자주 나타날 수 있다.
- Skewness(왜도): 상승 쪽과 하락 쪽의 분포 모양이 서로 다를 수 있다.
- Volatility clustering(변동성 군집): 큰 변동이 특정 시기에 연달아 나타날 수 있다.
분포 모양은 양쪽 끝과 좌우가 다를 수 있다
실선의 양쪽 작은 봉우리는 두꺼운 꼬리를, 더 크고 넓은 하락 쪽 봉우리는 왜도를 강조한 가상 개념도입니다.
꼬리의 작은 봉우리는 차이를 쉽게 보기 위해 강조한 교육용 표현이며, 실제 금융수익률 분포가 항상 이런 봉우리 모양이라는 뜻은 아닙니다.
큰 변동은 특정 시기에 몰릴 수 있다
가운데 구간처럼 큰 상승과 하락이 연달아 나타나는 모습을 Volatility clustering(변동성 군집)이라고 합니다.
이 그림의 수익률과 분포는 개념을 설명하기 위한 교육용 가상값이며, 실제 자산의 수익률이나 미래 성과를 나타내지 않습니다.
따라서 금융수익률의 를 언제나 오른쪽 꼬리확률 2.3%로 바꾸면 안 된다. 먼저 실제 분포 모양과 시간에 따른 변동성 변화를 확인한다.
또 여러 종목과 날짜를 계속 살펴보면 우연히 큰 Z점수가 하나쯤 나올 수 있다. 따라서 큰 Z점수 하나만으로 데이터 오류, Outlier(이상치) 또는 매매 기회라고 판단하지 않는다. 먼저 원본 데이터에 오류가 없는지, 전체 값들이 어떻게 퍼져 있는지, 왜 그 종목과 기간을 선택했는지 확인한다.
자주 생기는 오해
- Z점수 2는 관측값이 평균의 두 배라는 뜻이 아니다.
- 큰 절댓값만으로 정규분포 꼬리확률이 정해지지 않는다.
- Z점수 0은 관측값이 0이라는 뜻이 아니라 평균과 같다는 뜻이다.
- 표준편차가 0이면 Z점수는 정의되지 않는다.
- 큰 Z점수는 자동으로 데이터 오류나 매매신호가 아니다.
이해 점검
평균 100, 표준편차 10에서 값 80의 Z점수는 얼마인가?
다. 평균보다 두 표준편차 아래에 있다.
Z점수 2인 두 관측값의 원래 단위 차이도 같은가?
아니다. 각 자료의 평균과 표준편차가 다를 수 있다. 같은 것은 자기 분포 안에서의 상대 위치다.
Z점수 0은 관측값 0을 뜻하는가?
아니다. 관측값이 사용한 평균과 같다는 뜻이다. 평균이 100이면 값 100의 Z점수가 0이다.
Z점수에서 꼬리확률을 계산하려면 무엇이 더 필요한가?
정규분포 같은 구체적인 확률분포 가정이 필요하다. 위치만으로 확률은 자동 결정되지 않는다.
완료 기준
평균·표준편차·관측값에서 Z점수를 계산하고 부호와 거리를 설명하며, Z점수와 정규분포 꼬리확률을 구분할 수 있으면 다음 페이지로 넘어간다. 다음 페이지에서는 표본평균의 불확실성을 하나의 구간으로 표현한다.
이 자료의 표준점수는 통계적 위치를 설명하기 위한 가상값이며 실제 이상치, 거래신호나 미래 성과를 확정하지 않는다.