Q

PRIVATE NAVIGATION MODE

ML4T 탭 잠금 해제

패스워드를 확인하면 이 브라우저에서 ML4T 탭과 검색 결과를 표시합니다.

STUDY SEARCH

학습 자료 검색

제목과 설명, 키워드, 학습 본문에서 찾습니다.

검색 범위

검색어를 입력해 주세요.

SEARCH THE NOTEBOOK

찾고 싶은 금융·통계·전략 개념을 입력해 보세요.

CHAPTER 05.14 / AUTOCORRELATION

5.14 시간이 다른 같은 변수 사이의 관계

시간순 관측값을 시차만큼 옮겨 짝짓고, 자기상관의 방향과 시차별 ACF를 직관적으로 이해합니다.

5장. 기댓값·공분산·가설검정·회귀와 자기상관초급 학습 노트

5.14 시간이 다른 같은 변수 사이의 관계

이 페이지는 5장의 필수 개념이다. 시간순으로 기록한 한 변수와 그 변수의 과거 값을 짝지어, 앞뒤 값이 반복되는 방향과 정도를 이해하는 것이 목표다.

5.13에서는 서로 직접 관련이 없는 두 값도 시간에 따라 나란히 오르면 높은 R2R^2가 나올 수 있다고 보았다. 이번에는 서로 다른 두 변수가 아니라, 오늘의 값과 어제의 값처럼 한 변수의 현재와 과거가 연결되어 있는지 묻는다.

시간을 순서대로 놓고 한 칸 옮긴다

날짜처럼 순서가 있는 시점마다 같은 변수를 기록한 자료를 Time series(시계열)라고 한다. 다음은 5일 동안 기록한 가상 관측값이다.

시간순으로 기록한 다섯 관측값
시점1일2일3일4일5일
관측값12345

서로 몇 관측 간격 떨어진 값을 비교할지 나타내는 간격을 Time lag(시차)라고 한다. 시차 1은 바로 이웃한 값을 비교하므로 (1, 2), (2, 3), (3, 4), (4, 5)의 네 쌍을 만든다. 시차 2라면 (1, 3), (2, 4), (3, 5)의 세 쌍만 남는다.

이처럼 같은 변수의 값이 시간 간격을 두고 비슷하거나 반대 방향으로 반복되는 정도를 Autocorrelation(자기상관)이라고 한다.

한 칸 옮기면 바로 이웃한 값이 한 쌍이 된다시차 1에서 앞선 값과 한 시점 뒤의 값을 같은 열에 맞춰 봅니다.
시차 1에서 만드는 네 관측쌍앞선 값 1, 2, 3, 4와 한 시점 뒤의 값 2, 3, 4, 5를 세로로 맞춰 1과 2, 2와 3, 3과 4, 4와 5의 네 쌍을 만듭니다.앞선 값 Yₜ한 시점 뒤 Yₜ₊₁12(1, 2)23(2, 3)34(3, 4)45(4, 5)시간이 흐르는 방향
  1. 01시계열을 확인한다날짜 순서를 유지한 채 같은 변수의 값을 왼쪽에서 오른쪽으로 놓습니다.
  2. 02시차를 선택한다바로 이웃한 값을 비교하도록 시차를 1로 정합니다.
  3. 03값을 짝짓는다앞선 값과 한 시점 뒤의 값을 같은 열에 놓아 네 쌍을 만듭니다.
  4. 04움직임을 비교한다각 쌍이 평균을 기준으로 같은 방향인지 반대 방향인지 확인합니다.
  • 양의 자기상관은 큰 값 뒤에 큰 값, 작은 값 뒤에 작은 값이 이어지는 경향을 나타낸다.
  • 음의 자기상관은 큰 값과 작은 값이 번갈아 이어지는 경향을 나타낸다.
  • 0에 가까운 자기상관은 선택한 시차에서 뚜렷한 선형 반복이 보이지 않는다는 뜻이다.

자기상관의 부호만으로 다음 값을 정확히 예측할 수 있는 것은 아니다. 또한 한 시차의 자기상관이 0에 가깝다고 모든 시간 의존성이 사라지거나 관측값이 완전히 독립이라는 뜻도 아니다.

짝의 같은 방향 움직임을 한 숫자로 모은다

시차 kk의 표본 자기상관은 전체 시계열의 평균을 기준으로 각 시차쌍이 같은 방향에 있는지 계산한다. 이 페이지에서는 다음 정의를 사용한다.

rk=t=1nk(YtYˉ)(Yt+kYˉ)t=1n(YtYˉ)2r_k = \frac{\sum_{t=1}^{n-k}(Y_t-\bar{Y})(Y_{t+k}-\bar{Y})} {\sum_{t=1}^{n}(Y_t-\bar{Y})^2}
rkr_k
시차 kk의 Sample autocorrelation(표본 자기상관)
단위: 없음
YtY_t
기준 시점 tt의 시계열 관측값
단위: Y의 단위
Yt+kY_{t+k}
YtY_t보다 kk관측 간격 뒤의 관측값
단위: Y의 단위
Yˉ\bar{Y}
전체 시계열 관측값의 Mean(평균)
단위: Y의 단위
nn
전체 관측값의 수
단위: 개
kk
두 값을 떨어뜨려 비교하는 Time lag(시차)
단위: 관측 간격

증가 수열 [1, 2, 3, 4, 5]의 전체 평균은 3이다. 시차 1에서 각 값을 평균 3과 비교하면 다음 네 곱이 만들어진다.

시차 1 관측쌍의 평균편차 곱
시차쌍앞선 값의 편차뒤 값의 편차편차의 곱
(1, 2)13=21-3=-223=12-3=-1(2)(1)=2(-2)(-1)=2
(2, 3)23=12-3=-133=03-3=0(1)(0)=0(-1)(0)=0
(3, 4)33=03-3=043=14-3=1(0)(1)=0(0)(1)=0
(4, 5)43=14-3=153=25-3=2(1)(2)=2(1)(2)=2

분자는 네 곱을 더한 4다. 분모는 다섯 관측값이 전체 평균에서 떨어진 거리를 제곱해 더한 10이다.

분자=2+0+0+2=4분모=(2)2+(1)2+02+12+22=10r1=410=0.4\begin{aligned} \text{분자} &=2+0+0+2=4 \\ \text{분모} &=(-2)^2+(-1)^2+0^2+1^2+2^2=10 \\ r_1 &=\frac{4}{10}=0.4 \end{aligned}

r1=0.4r_1=0.4는 이 짧은 수열에서 바로 이웃한 값들이 양의 방향으로 이어졌다는 뜻이다. 반대로 [1, -1, 1, -1, 1]처럼 값이 번갈아 바뀌는 수열의 시차 1 자기상관은 0.8-0.8이다.

여러 시차를 한눈에 비교한다

시차 1의 r1r_1, 시차 2의 r2r_2처럼 여러 시차의 자기상관을 나란히 그린 것을 Autocorrelation function(자기상관함수, ACF)이라고 한다. ACF에서는 막대 하나가 시차 하나를 나타내므로, 어느 간격에서 같은 방향이나 반대 방향의 반복이 나타나는지 비교할 수 있다.

INTERACTIVE STUDY TOOL시차쌍과 ACF 탐색기시계열 모양과 시차를 바꾸면서 대응하는 관측점, 자기상관의 방향과 시차별 ACF를 함께 확인합니다.
시계열 모양
1
상승 추세과 시차 1 관측쌍10개 관측값을 시간순 선 그래프로 표시하고, 시차 1만큼 떨어진 9개 관측쌍을 점선으로 연결했습니다.1357910190.000관측 시점
시간순 관측값시차 1 관측쌍 첫 번째 시차쌍
시차 1 자기상관r1 = 0.700
움직임의 방향
양의 방향
유효 관측쌍
9
첫 번째 시차쌍
(10, 11)

선택한 시차에서 비슷한 방향의 값이 이어지는 경향이 있습니다. 이 값 하나만으로 다음 값을 정확히 예측하거나 독립성을 판단하지 않습니다.

시차 1~5의 ACF

0선 위의 막대는 양의 방향, 아래의 막대는 음의 방향입니다. 진한 테두리는 현재 선택한 시차입니다.

상승 추세의 시차 1부터 5까지 자기상관시차 1은 0.700, 시차 2은 0.412, 시차 3은 0.148, 시차 4은 -0.079, 시차 5은 -0.258입니다. 시차 1가 선택되어 있습니다.0+1-10.70시차 10.41시차 20.15시차 3-0.08시차 4-0.26시차 5

실제 자료에서는 질문을 먼저 구분한다

가격 수준은 장기간 상승하거나 하락하는 추세 때문에 시차 1 자기상관이 높게 나타날 수 있다. 그러나 가격 수준이 과거 가격과 비슷하게 이어진다는 사실은 다음 수익률의 방향을 쉽게 예측할 수 있다는 뜻이 아니다. 가격 변화율이나 수익률로 바꾸면 수준의 추세는 줄어들 수 있지만, 시간 의존성이 모두 사라진다고 단정할 수도 없다.

실제 시계열에서는 다음 순서로 확인한다.

  1. 관측값이 일별·주별처럼 같은 간격으로 정렬되어 있는지 확인한다.
  2. 연구 질문이 가격 수준인지 가격 변화나 수익률인지 구분한다.
  3. 한 시차만 고르지 않고 연구 질문에 맞는 여러 시차의 ACF를 살펴본다.
  4. 평균, 퍼짐과 시간 연결 방식이 기간마다 크게 바뀌지 않는 성질인 Stationarity(정상성)가 타당한지 추세와 국면 변화를 함께 확인한다.

독립을 가정한 표준오차가 작게 보일 수 있다

5.6에서 배운 Standard error(표준오차)는 표본을 다시 모을 때 추정값이 얼마나 흔들리는지 나타낸다. 양의 자기상관이 강하면 서로 비슷한 관측이 반복되므로, 관측값 100개가 서로 독립적인 정보 100개와 같지 않을 수 있다.

이런 자료를 모두 독립이라고 놓으면 표준오차를 지나치게 작게 계산하고 P-value(P값)도 실제보다 낙관적으로 해석할 수 있다. 5.14에서는 보정 공식을 유도하지 않고, 자기상관이 발견되면 독립 가정을 그대로 사용해도 되는지 별도로 점검해야 한다는 원칙까지만 다룬다.

자주 생기는 오해

  • 가격 수준의 높은 자기상관이 다음 수익률 방향의 예측 가능성을 뜻하지 않는다.
  • 자기상관이 0에 가깝다고 완전한 무작위성이나 독립성이 보장되지는 않는다.
  • 시차가 바뀌면 비교하는 관측쌍의 수와 자기상관 값도 바뀐다.
  • 한 시차의 큰 자기상관만 보고 전체 ACF 패턴을 단정하지 않는다.
  • 추세나 국면 변화가 있으면 과거에 계산한 자기상관이 계속 유지되지 않을 수 있다.

이해 점검

[1, 2, 3, 4, 5]에서 시차 1은 어떤 관측값을 짝짓는가?

(1, 2), (2, 3), (3, 4), (4, 5)의 네 쌍을 만든다.

증가 수열의 시차 1 자기상관 r1=0.4r_1=0.4는 어떤 방향을 나타내는가?

바로 이웃한 값들이 양의 방향으로 이어졌음을 나타낸다. 이 값만으로 다음 값을 정확히 예측할 수 있다는 뜻은 아니다.

교대 수열의 시차 1 자기상관이 음수인 이유는 무엇인가?

큰 값 다음에 작은 값, 작은 값 다음에 큰 값이 반복되어 이웃한 값이 반대 방향으로 움직이기 때문이다.

가격 수준의 높은 자기상관을 바로 수익률 매매신호로 읽으면 왜 안 되는가?

가격 수준의 추세가 높은 자기상관을 만들 수 있고, 다음 가격 변화나 수익률의 방향은 가격 수준과 다른 질문이기 때문이다.

완료 기준

시간순 관측값에서 원하는 시차의 관측쌍을 만들고, 자기상관의 양·음·0 근처를 구분하며, 예시의 r1=0.4r_1=0.4를 계산하고 가격 수준과 수익률의 질문이 다른 이유를 설명할 수 있으면 선택 페이지로 넘어간다. 다음 페이지에서는 여러 설명변수를 동시에 사용하는 회귀를 다룬다.

이 자료의 시계열은 자기상관 원리를 설명하기 위한 가상값이며 실제 가격이나 수익률의 예측 가능성을 주장하지 않는다.