CHAPTER 04.2 / PROBABILITY DISTRIBUTIONS
4.2 가능한 값과 확률을 함께 표현하기
가능한 값과 확률질량을 연결하고 이산 확률질량과 연속 확률밀도의 차이를 살펴봅니다.
4.2 가능한 값과 확률을 함께 표현하기
이 페이지는 4장의 필수 개념이다. 무작위 결과를 숫자로 바꾸고, 가능한 값과 그 확률을 한 표에서 읽는 것이 목표다.
4.1에서는 사건 하나의 확률을 계산했다. 그러나 퀀트 연구에서는 상승 여부뿐 아니라 여러 수익률 값이 각각 얼마나 가능한지 함께 봐야 한다.
확률변수는 결과를 숫자로 바꾸는 규칙이다
Random variable(확률변수)은 표본공간의 각 결과를 숫자 하나에 대응시키는 규칙이다. 공정한 동전을 두 번 던지고 를 앞면 개수라고 정하자.
| 동전 결과 | 의 값 |
|---|---|
| 뒷면, 뒷면 | 0 |
| 앞면, 뒷면 | 1 |
| 뒷면, 앞면 | 1 |
| 앞면, 앞면 | 2 |
표본공간에는 결과가 네 개지만 확률변수 가 가질 수 있는 숫자는 0, 1, 2 세 개다. 서로 다른 원래 결과가 같은 숫자로 대응될 수 있다.
이산 확률분포는 값마다 확률질량을 붙인다
앞의 동전 예시에서 가 가질 수 있는 값은 0, 1, 2다. 이제 네 개의 동전 결과를 이 세 값에 나누어 담아 보자.
| 의 값 | 해당하는 동전 결과 수 | 확률 |
|---|---|---|
| 0 | 1개 | |
| 1 | 2개 | |
| 2 | 1개 |
이처럼 가능한 숫자 옆에 그 숫자가 나올 확률을 붙여 정리한 것이 Discrete distribution(이산분포)이다. 각 숫자에 붙인 확률을 Probability mass(확률질량)라고 한다. 여기서는 값 1에 해당하는 동전 결과가 두 개이므로 값 1의 확률질량이 가장 크다.
기호 는 “Random variable(확률변수) 의 값이 특정 숫자 와 같을 확률”이라는 뜻이다. 예를 들어 는 “앞면 개수 가 1일 확률은 ”라고 읽는다.
올바른 이산분포는 두 가지만 확인하면 된다.
- 각 값에 붙인 확률은 0보다 작을 수 없다.
- 가능한 모든 값의 확률을 더하면 1, 즉 100%가 되어야 한다.
- 결과를 숫자로 바꾸는 Random variable(확률변수). 이 예시에서는 앞면 개수
- 단위: 개
- 와 비교할 특정 숫자. 이 예시에서는 0, 1 또는 2
- 단위: 개
- 가 특정 숫자 와 같을 Probability mass(확률질량)
- 단위: 0~1의 무차원 비율
두 번째 식의 는 “모두 더하라”는 뜻이다. 아래에 적힌 는 가 가질 수 있는 모든 값을 차례로 넣으라는 표시다. 이 예시에서는 에 0, 1, 2를 넣어 세 확률을 다음과 같이 더한다.
- 동전을 두 번 던졌을 때 앞면 개수
- 단위: 개
- 에 가 가질 수 있는 값 0, 1, 2를 차례로 넣는다는 뜻
- 단위: 개
- 앞면 개수 가 특정 값 일 확률질량
- 단위: 0~1의 무차원 비율
즉, 은 어려운 새 계산법이 아니라 “가능한 값의 확률을 빠짐없이 더하면 100%가 된다”는 말을 짧게 쓴 것이다.
위 표의 확률을 기호로 쓰면 다음과 같다.
- 동전을 두 번 던졌을 때 앞면 개수
- 단위: 앞면 개수
- 앞면이 개 나올 확률질량
- 단위: 비율
세 확률의 합은 이다. 따라서 가능한 모든 경우를 빠짐없이 담았다. 확률이 가장 큰 값 1만 보고 0과 2의 가능성을 버리면 분포가 주는 정보를 잃는다.
| 앞면 개수 | 확률질량 |
|---|---|
| 0 | 25.00% |
| 1 | 50.00% |
| 2 | 25.00% |
연속분포는 구간의 확률을 면적으로 읽는다
앞의 동전 예시에서는 앞면 개수가 0, 1, 2 중 하나였다. 이렇게 값을 하나씩 셀 수 있을 때는 각 값에 확률을 붙일 수 있다.
이번에는 길이가 10cm인 자를 떠올려 보자. 눈을 감고 자 위의 한 곳을 무작위로 짚은 뒤, 왼쪽 끝에서 그 지점까지의 거리를 잰다. 결과는 2cm나 3cm뿐 아니라 2.1cm, 2.01cm처럼 두 값 사이의 값도 될 수 있다. Continuous distribution(연속분포)은 이처럼 값이 끊김 없이 이어지는 경우를 표현한다.
자 위의 모든 위치가 똑같이 선택될 수 있다고 하자. 정확히 2cm인 점 하나는 폭이 없으므로 그 점만 선택될 확률도 0으로 본다. 대신 “2cm에서 5cm 사이를 짚을 확률”처럼 폭이 있는 구간을 묻는다. 그래프에서는 관심 구간 아래의 면적이 그 구간에 들어올 확률이다.
동전처럼 값을 셀 수 있으면 값마다 확률을 붙이고, 자 위의 거리처럼 값이 끊김 없이 이어지면 구간 아래 면적으로 확률을 구한다.
Probability density(확률밀도)는 곡선의 높이다. 높이가 큰 곳은 그 주변에 값이 더 많이 모여 있다는 뜻이지만, 높이 자체가 확률은 아니다. 관심 구간의 가로 길이까지 포함한 면적을 봐야 확률이 된다.
0cm부터 10cm까지 모든 위치가 똑같이 선택될 수 있으므로 그래프의 높이는 로 일정하다. 아래 차트에서 자의 초록색 구간과 밀도 그래프의 초록색 면적을 비교해 보자.
밀도 0.1/cm × 선택 길이 3cm = 확률 30%
차트의 처음 설정인 2cm부터 5cm까지의 구간은 전체 10cm 중 3cm를 차지한다. 밀도 그래프에서도 이 구간 아래의 직사각형 면적을 계산하면 같은 확률을 얻는다.
계산은 다.
분자의 cm와 분모의 cm가 서로 약분되므로 계산 결과에는 단위가 남지 않는다. 이 계산에서 밀도 은 그 자체로 10%의 확률이 아니다. 구간 길이 3cm를 곱해 얻은 면적 0.3이 “2cm에서 5cm 사이를 짚을 확률 30%”다. 자 전체는 길이가 10cm이므로 전체 면적은 , 즉 100%가 된다.
지금까지 살펴본 두 가지 표현의 차이를 정리하면 다음과 같다.
| 표현 | 쉽게 읽는 법 | 확률 확인 방법 |
|---|---|---|
| Probability mass(확률질량) | 셀 수 있는 특정 값에 붙인 확률 | 모든 값의 확률을 더한다 |
| Probability density(확률밀도) | 연속된 값이 어느 주변에 많이 모이는지 보여 주는 높이 | 관심 구간 아래의 면적을 구한다 |
확률밀도 높이는 1보다 클 수 있다
Probability density(확률밀도)의 높이를 확률로 오해하면 “높이가 1보다 크면 100%를 넘는 것 아닌가?”라는 의문이 생긴다. 그러나 확률은 높이가 아니라 구간 아래의 면적이다.
이번에는 결과가 0cm부터 0.5cm 사이에만 고르게 나올 수 있다고 하자. 전체 확률 1을 폭 0.5cm인 구간에 담으려면 그래프의 높이는 2/cm가 된다.
계산은 이다. 밀도 높이 2는 1보다 크지만, 좁은 가로 길이 0.5를 곱한 전체 면적은 정확히 1이다. 따라서 이 분포는 유효하다.
확률밀도에서는 높이가 1을 넘는지가 아니라, 전체 구간 아래의 면적이 1인지 확인한다.
이론 분포와 관측 히스토그램은 다르다
동전을 두 번 던져 앞면 개수를 세는 실험으로 돌아가 보자. 실험하기 전부터 앞면이 0개, 1개, 2개 나올 이론 확률은 각각 25%, 50%, 25%로 정해져 있다. 이것이 Theoretical distribution(이론 분포)이다.
하지만 이 실험을 실제로 10번 반복하면 반드시 앞면 0개 25%, 1개 50%, 2개 25%가 나오지는 않는다. 예를 들어 앞면 0개가 1번, 1개가 6번, 2개가 3번 나올 수도 있다. 이렇게 실제로 관측한 결과를 값별로 세어 그린 막대가 Histogram(히스토그램)이다.
이론 분포는 실험 전에 예상하는 비율이고, 관측 히스토그램은 이번에 실제로 나온 기록이다.
아래 차트에서 실험 횟수를 바꾸거나 새 표본을 뽑아 두 막대를 비교해 보자.
10회처럼 표본이 작으면 우연 때문에 실제 막대가 이론 확률과 크게 다를 수 있다. 실험 횟수를 늘리면 실제 비율은 대체로 이론 확률 주변에서 더 안정되지만 매번 정확히 같아지는 것은 아니다. 따라서 한 번의 작은 표본이 다르게 나왔다는 이유만으로 이론 분포가 틀렸다고 결론 내릴 수 없다.
두 그림이 답하는 질문도 다르다. 이론 분포는 “어떤 값이 얼마나 자주 나올 것으로 예상하는가?”에 답하고, 관측 히스토그램은 “이번 데이터에서는 실제로 무엇이 얼마나 나왔는가?”에 답한다. 분포의 Expected value(기대값)는 5장에서 계산한다.
과거 수익률 그래프를 미래 모습으로 그대로 믿지 않는다
과거 데이터로 만든 수익률 히스토그램은 그 기간에 실제로 관측된 결과를 보여 줄 뿐이다. 이 모양이 미래에도 비슷할 것이라고 생각하려면 몇 가지 조건을 먼저 확인해야 한다.
- 어느 기간의 데이터를 사용했는가?
- 수익률을 일별로 계산했는가, 월별로 계산했는가?
- 거래 수수료와 세금을 반영했는가?
- 당시 시장이 상승장, 하락장 또는 위기 상황이었는가?
이 조건이 달라지면 같은 자산이라도 히스토그램의 모양이 달라질 수 있다. 막대를 나누는 구간의 폭을 넓게 또는 좁게 잡아도 그림이 달라진다. 따라서 히스토그램 모양만 보고 미래 수익률과 위험을 확정하지 말고, 어떤 데이터와 조건으로 만든 그림인지 함께 살펴봐야 한다.
자주 생기는 오해
- 원래 결과의 수와 숫자로 바꾼 뒤의 값 수가 항상 같지는 않다. 동전을 두 번 던지면 원래 결과는 네 가지지만, 앞면 개수로 바꾸면 0개, 1개, 2개라는 세 값만 남는다.
- 셀 수 있는 값과 끊김 없이 이어지는 값은 확률을 읽는 방법이 다르다. 앞면 개수처럼 셀 수 있으면 각 값에 붙은 Probability mass(확률질량)를 본다. 길이처럼 값이 이어지면 한 점의 높이가 아니라 관심 구간 아래의 면적을 본다.
- 한 번 관측한 그래프가 원래 확률을 그대로 보여 주는 것은 아니다. 동전 실험을 10번만 하면 우연 때문에 실제 막대가 이론 확률과 다르게 나올 수 있다. Histogram(히스토그램)은 이번에 나온 기록이고, Theoretical distribution(이론 분포)은 실험 전에 예상한 비율이다.
- 평균이 같아도 결과가 퍼진 정도는 다를 수 있다. 수익률이 항상 0%인 경우와 -10% 또는 +10%가 나오는 경우는 평균이 모두 0%지만, 두 번째 경우의 변동 범위와 위험이 훨씬 크다.
이해 점검
동전 두 번의 결과는 네 개인데 앞면 개수는 왜 세 값뿐인가?
앞면-뒷면과 뒷면-앞면이라는 서로 다른 결과가 모두 앞면 개수 1에 대응되기 때문이다.
앞면 개수 0, 1, 2의 확률질량 합은 얼마인가?
이다. 가능한 값을 모두 포함한 확률질량은 합이 1이어야 한다.
연속분포 곡선의 한 점 높이를 바로 확률로 읽을 수 없는 이유는 무엇인가?
연속분포의 확률은 구간 아래 면적이기 때문이다. 높이는 밀도이며 구간 길이와 함께 해석해야 한다.
관측 히스토그램이 이론 분포와 정확히 같지 않으면 모형은 반드시 틀렸는가?
아니다. 유한 표본에는 무작위 오차가 있다. 표본 크기와 생성 과정의 안정성, 구간 설정을 함께 검토해야 한다.
완료 기준
동전 두 번의 네 결과를 앞면 개수 0, 1, 2로 대응시키고 확률질량 합을 확인하며, 이산 확률질량과 연속 확률밀도의 차이를 설명할 수 있으면 다음 페이지로 넘어간다. 다음 선택 페이지에서는 일정한 밀도의 직사각형 면적으로 구간확률을 계산한다.
이 자료는 확률분포의 표현을 설명하는 교육 자료이며 실제 금융수익률의 미래 분포를 제공하지 않는다.