Q

PRIVATE NAVIGATION MODE

ML4T 탭 잠금 해제

패스워드를 확인하면 이 브라우저에서 ML4T 탭과 검색 결과를 표시합니다.

STUDY SEARCH

학습 자료 검색

제목과 설명, 키워드, 학습 본문에서 찾습니다.

검색 범위

검색어를 입력해 주세요.

SEARCH THE NOTEBOOK

찾고 싶은 금융·통계·전략 개념을 입력해 보세요.

CHAPTER 05.5 / Z-SCORE

5.5 평균에서 표준편차 몇 배 떨어졌는지

관측값을 평균에서 떨어진 표준편차 단위로 바꾸고 확률 해석에 필요한 추가 가정을 구분합니다.

5장. 기댓값·공분산·가설검정·회귀와 자기상관초급 학습 노트

5.5 평균에서 표준편차 몇 배 떨어졌는지

이 페이지는 5장의 필수 개념이다. Z-score(표준점수)로 관측값의 평균 대비 위치를 표준편차 단위로 바꾸고, 위치 비교와 확률 해석에 필요한 가정을 구분하는 것이 목표다.

5.4를 건너뛰었어도 필요한 핵심은 간단하다. 원래 단위를 없앤 비율은 서로 다른 자료를 비교하게 해 주지만, 분모가 무엇이고 어떤 조건에서 의미가 있는지 먼저 확인해야 한다.

무엇을 말하는가추가로 필요한 것
원래 편차 xμx-\mu평균과의 거리원래 단위
Z-score(표준점수)표준편차 몇 배 거리인지양의 표준편차
확률 해석기준값과 같거나 더 바깥쪽 값이 나올 확률정규분포 등 구체적 분포 가정

평균을 0으로 맞추고, 표준편차 1개를 거리 1로 센다

쉽게 말하면 평균을 출발점 0으로 놓고, 표준편차 1개만큼의 거리를 1로 세는 것이다. 예를 들어 평균이 100이고 표준편차가 10이면 Z점수로 바꾼 값 100은 0, 값 110은 1, 값 90은 -1이 된다.

모집단 평균과 표준편차를 아는 경우 한 관측값의 Z-score(표준점수)는 다음과 같다.

z=xμσz = \frac{x-\mu}{\sigma}
zz
관측값의 Z-score(표준점수)
단위: 없음
xx
표준화할 관측값
단위: 원래 변수의 단위
μ\mu
Population mean(모집단 평균)
단위: xx와 같은 단위
σ\sigma
양의 Population standard deviation(모집단 표준편차)
단위: xx와 같은 단위
  • z=0z=0: 관측값이 평균과 같다.
  • z=2z=2: 평균보다 두 표준편차 위다.
  • z=1.5z=-1.5: 평균보다 1.5표준편차 아래다.

Population(모집단)과 Sample(표본)이란?

한 학교 학생 1,000명의 시험 점수를 알고 싶다고 하자.

  • Population(모집단): 학생 1,000명의 시험 점수 전체
  • Sample(표본): 그중 실제로 조사한 30명의 시험 점수

모집단은 알고 싶은 전체이고, 표본은 그 전체를 알아보기 위해 뽑아 관찰한 일부다. 조사할 30명이 달라지면 표본에서 계산한 평균과 표준편차도 달라질 수 있다.

Population(모집단) 전체의 평균과 표준편차를 모를 때는 가지고 있는 Sample(표본)에서 계산한 평균과 표준편차를 대신 사용할 수 있다. 다만 표본이 바뀌면 계산한 평균과 표준편차도 달라져 같은 관측값의 Z-score(표준점수)가 달라질 수 있다. 따라서 어떤 자료에서 구한 평균과 표준편차를 사용했는지 함께 기록한다.

원래 단위가 달라도 상대 위치를 비교한다

자료 A는 평균 100, 표준편차 10, 관측값 120이고 자료 B는 평균 50, 표준편차 2, 관측값 54라고 하자.

zA=12010010=2zB=54502=2\begin{aligned} z_A &= \frac{120-100}{10}=2 \\ z_B &= \frac{54-50}{2}=2 \end{aligned}
zAz_A, zBz_B
두 관측값의 Z-score(표준점수)
단위: 없음
AA, BB
평균과 표준편차가 서로 다른 두 가상 자료
단위: 각 자료의 원래 단위

원래 차이는 20과 4로 다르지만 둘 다 자기 평균보다 두 표준편차 위에 있다.

계산을 한 줄씩 보면 A의 원래 편차는 120-100=20, 이를 표준편차 10으로 나누어 2다. B의 편차는 54-50=4, 이를 표준편차 2로 나누어 역시 2다. 표준화는 두 편차를 같게 만드는 것이 아니라 각 자료의 평소 흔들림을 기준으로 다시 표현한다.

INTERACTIVE STUDY TOOL표준점수 비교기단위와 평균 수준이 다른 두 관측값을 표준편차 단위의 상대 위치로 바꿉니다.
관측 A
관측 B
관측 A: 원래 편차 → Z점수
20.002.00
관측 B: 원래 편차 → Z점수
4.002.00

같은 Z점수는 같은 상대 위치를 뜻하지만, 그 값이 얼마나 드문지는 분포를 가정해야 판단할 수 있습니다.

Tail probability(꼬리확률)는 무엇인가

분포 그래프에서 값이 드물게 나타나는 양쪽 끝부분을 꼬리라고 부른다. 예를 들어 시험 점수 분포에서 90점 이상을 기준으로 정했다면 90점과 그보다 높은 점수가 오른쪽 꼬리에 들어간다.

정한 기준값과 같거나 더 끝쪽 값이 나올 확률이 Tail probability(꼬리확률)다. 오른쪽 끝을 세면 Right-tail probability(오른쪽 꼬리확률), 왼쪽 끝을 세면 Left-tail probability(왼쪽 꼬리확률)다. 어느 방향을 볼지와 어떤 분포를 가정할지를 먼저 정해야 한다.

INTERACTIVE STUDY TOOL오른쪽 꼬리확률 탐색기기준 Z값을 움직이며 표준정규분포에서 그 값과 같거나 더 큰 오른쪽 영역을 확인합니다.
z = 2.0
오른쪽 꼬리확률2.28%

Standard normal distribution(표준정규분포)에서 z가 2.0이상인 영역입니다.

분포 가정이 달라지면 같은 Z값의 꼬리확률도 달라질 수 있습니다.

오른쪽 꼬리확률 그래프평균이 0이고 표준편차가 1인 표준정규분포에서 Z값 2.0이상인 오른쪽 영역을 음영으로 표시했다. 이 영역의 확률은 2.28%다.기준 z=2.0오른쪽 꼬리상대 밀도-4평균 z=04Z-score(표준점수)

Z점수가 크다고 바로 드문 일이나 매매 신호는 아니다

Z점수는 관측값이 평균에서 얼마나 멀리 떨어졌는지만 알려 준다. 예를 들어 z=2z=2는 평균보다 표준편차 2개만큼 위에 있다는 뜻이다. 모집단이 Standard normal distribution(표준정규분포)을 따른다고 가정하고 z2z \ge 2인 오른쪽 영역을 셀 때 꼬리확률은 약 2.3%다. 다른 분포를 가정하면 같은 Z점수의 꼬리확률도 달라질 수 있다.

실제 금융수익률은 정규분포와 다를 수 있다

실제 금융수익률의 분포 모양은 정규분포와 다를 수 있다.

  • Fat tails(두꺼운 꼬리): 큰 상승이나 하락이 정규분포의 예상보다 자주 나타날 수 있다.
  • Skewness(왜도): 상승 쪽과 하락 쪽의 분포 모양이 서로 다를 수 있다.
  • Volatility clustering(변동성 군집): 큰 변동이 특정 시기에 연달아 나타날 수 있다.
정규분포와 가상 금융수익률의 모양 비교분포의 양 끝 모양과 시간에 따른 변동 크기를 함께 보면 정규분포 가정이 실제 수익률을 놓칠 수 있는 이유를 확인할 수 있습니다.

분포 모양은 양쪽 끝과 좌우가 다를 수 있다

실선의 양쪽 작은 봉우리는 두꺼운 꼬리를, 더 크고 넓은 하락 쪽 봉우리는 왜도를 강조한 가상 개념도입니다.

정규분포와 가상 금융수익률 분포 비교점선 정규분포와 비교해 가상 금융수익률 실선은 양쪽 꼬리에서 작은 봉우리가 나타난다. 하락 쪽 봉우리가 상승 쪽보다 더 크고 넓어 왼쪽 꼬리가 더 길고 높은 비대칭을 이룬다.하락 쪽이 더 길고 높다Skewness(왜도)양쪽 끝이 다시 높아진다Fat tails(두꺼운 꼬리)정규분포가상 금융수익률표준화한 수익률

꼬리의 작은 봉우리는 차이를 쉽게 보기 위해 강조한 교육용 표현이며, 실제 금융수익률 분포가 항상 이런 봉우리 모양이라는 뜻은 아닙니다.

큰 변동은 특정 시기에 몰릴 수 있다

가운데 구간처럼 큰 상승과 하락이 연달아 나타나는 모습을 Volatility clustering(변동성 군집)이라고 합니다.

가상 일간 수익률의 변동성 군집24개의 가상 일간 수익률 가운데 처음과 마지막 구간은 0퍼센트 가까이에서 움직이고, 9번째부터 16번째까지는 약 마이너스 4.1퍼센트와 플러스 3.3퍼센트 사이의 큰 변동이 연달아 나타난다.4%0%-4%조용한 구간큰 변동이 몰린 구간조용한 구간11224관측 순서

이 그림의 수익률과 분포는 개념을 설명하기 위한 교육용 가상값이며, 실제 자산의 수익률이나 미래 성과를 나타내지 않습니다.

따라서 금융수익률의 z=2z=2를 언제나 오른쪽 꼬리확률 2.3%로 바꾸면 안 된다. 먼저 실제 분포 모양과 시간에 따른 변동성 변화를 확인한다.

또 여러 종목과 날짜를 계속 살펴보면 우연히 큰 Z점수가 하나쯤 나올 수 있다. 따라서 큰 Z점수 하나만으로 데이터 오류, Outlier(이상치) 또는 매매 기회라고 판단하지 않는다. 먼저 원본 데이터에 오류가 없는지, 전체 값들이 어떻게 퍼져 있는지, 왜 그 종목과 기간을 선택했는지 확인한다.

자주 생기는 오해

  • Z점수 2는 관측값이 평균의 두 배라는 뜻이 아니다.
  • 큰 절댓값만으로 정규분포 꼬리확률이 정해지지 않는다.
  • Z점수 0은 관측값이 0이라는 뜻이 아니라 평균과 같다는 뜻이다.
  • 표준편차가 0이면 Z점수는 정의되지 않는다.
  • 큰 Z점수는 자동으로 데이터 오류나 매매신호가 아니다.

이해 점검

평균 100, 표준편차 10에서 값 80의 Z점수는 얼마인가?

(80100)/10=2(80-100)/10=-2다. 평균보다 두 표준편차 아래에 있다.

Z점수 2인 두 관측값의 원래 단위 차이도 같은가?

아니다. 각 자료의 평균과 표준편차가 다를 수 있다. 같은 것은 자기 분포 안에서의 상대 위치다.

Z점수 0은 관측값 0을 뜻하는가?

아니다. 관측값이 사용한 평균과 같다는 뜻이다. 평균이 100이면 값 100의 Z점수가 0이다.

Z점수에서 꼬리확률을 계산하려면 무엇이 더 필요한가?

정규분포 같은 구체적인 확률분포 가정이 필요하다. 위치만으로 확률은 자동 결정되지 않는다.

완료 기준

평균·표준편차·관측값에서 Z점수를 계산하고 부호와 거리를 설명하며, Z점수와 정규분포 꼬리확률을 구분할 수 있으면 다음 페이지로 넘어간다. 다음 페이지에서는 표본평균의 불확실성을 하나의 구간으로 표현한다.

이 자료의 표준점수는 통계적 위치를 설명하기 위한 가상값이며 실제 이상치, 거래신호나 미래 성과를 확정하지 않는다.