Q

PRIVATE NAVIGATION MODE

ML4T 탭 잠금 해제

패스워드를 확인하면 이 브라우저에서 ML4T 탭과 검색 결과를 표시합니다.

STUDY SEARCH

학습 자료 검색

제목과 설명, 키워드, 학습 본문에서 찾습니다.

검색 범위

검색어를 입력해 주세요.

SEARCH THE NOTEBOOK

찾고 싶은 금융·통계·전략 개념을 입력해 보세요.

CHAPTER 05.17 / VARIANCE INFLATION FACTOR

5.17 공선성이 분산을 부풀리는 정도

설명변수 하나를 나머지 설명변수로 재구성한 비율에서 고유 정보, VIF와 계수 표준오차 배율을 차례로 이해합니다.

5장. 기댓값·공분산·가설검정·회귀와 자기상관초급 학습 노트

5.17 공선성이 분산을 부풀리는 정도

이 페이지는 5장의 선택 개념이다. 5.16에서 본 설명변수의 겹침을 한 변수씩 측정하고, 그 숫자가 계수의 흔들림과 어떻게 연결되는지 이해하는 것이 목표다.

5.16에서는 두 설명변수가 비슷한 정보를 담으면 작은 자료 변화에도 한 계수는 커지고 다른 계수는 작아질 수 있음을 확인했다. 이번에는 먼저 한 설명변수의 정보 가운데 다른 설명변수와 겹치지 않고 남은 부분이 얼마나 되는가?를 묻는다.

결과 Y 대신 설명변수 하나를 잠시 결과로 놓는다

5.15의 원래 회귀는 공부 시간과 이전 시험 점수 같은 설명변수로 최종 점수 YY를 설명했다. 지금 확인하려는 것은 최종 점수가 아니라 설명변수끼리의 겹침이다. 따라서 이 계산에서는 반응변수 YY를 사용하지 않는다.

겹침을 확인할 설명변수 하나를 XjX_j로 고른다. 그런 다음 나머지 설명변수만 사용해 XjX_j를 얼마나 잘 예측할 수 있는지 확인한다. 원래 회귀를 돕기 위해 따로 수행하는 이 회귀를 Auxiliary regression(보조 회귀)이라고 한다.

예를 들어 공부 시간 X1X_1의 겹침을 확인한다면 X1X_1을 잠시 결과로 놓고, 이전 시험 점수 X2X_2와 다른 설명변수들로 X1X_1을 예측한다. 이번에는 X2X_2의 겹침을 확인하고 싶다면 대상을 바꾸어 X2X_2를 나머지 설명변수로 예측한다. 그래서 겹침의 숫자는 모형 전체에 하나가 아니라 설명변수마다 하나씩 나온다.

5.13에서 배운 R-squared(결정계수)는 무엇을 결과로 놓느냐에 따라 답하는 질문이 달라진다.

구분결과로 놓는 값R2R^2가 답하는 질문
원래 회귀반응변수 YY설명변수들이 YY의 변동을 얼마나 설명하는가?
보조 회귀확인할 설명변수 XjX_j나머지 설명변수들이 XjX_j의 변동을 얼마나 재구성하는가?

보조 R2R^2에서 고유하게 남은 정보를 찾는다

보조 회귀에서 얻은 Rj2R_j^2가 0.75라면 나머지 설명변수가 대상 변수 XjX_j의 변동 가운데 75%를 재구성했다는 뜻이다. 그러면 겹치지 않고 고유하게 남은 비율은 10.75=0.251-0.75=0.25, 즉 25%다.

Rj2=0R_j^2=0이면 다른 설명변수가 대상 변수를 재구성하지 못해 고유한 정보가 100% 남는다. Rj2=1R_j^2=1이면 다른 설명변수만으로 대상 변수를 완전히 재구성할 수 있어 고유한 정보가 남지 않는다. 5.16의 2시간과 120분처럼 하나를 알면 다른 하나가 정확히 정해지는 경우가 여기에 해당한다.

겹친 정보를 VIF 하나로 바꾸는 순서보조 R²가 0.75인 예시입니다. 먼저 다른 설명변수가 재구성한 부분과 고유하게 남은 부분을 나눠 봅니다.

다른 설명변수가 이미 알려 주는 부분이 많을수록 대상 변수만의 정보는 적게 남습니다.

  1. 01TARGET
    대상 변수를 고른다겹침을 확인할 설명변수 하나를 Xⱼ로 고릅니다.
  2. 02AUXILIARY REGRESSION
    다른 X로 재구성한다반응변수 Y는 빼고 나머지 설명변수만으로 Xⱼ를 예측합니다.
  3. 03UNIQUE PART
    남은 정보를 확인한다보조 R²가 0.75이면 75%는 겹치고 25%는 고유하게 남습니다.
  4. 04VIF
    남은 비율을 뒤집는다남은 비율 0.25의 역수는 4이므로 VIF는 4입니다.

적게 남은 고유 정보는 계수를 더 흔들리게 한다

같은 방법으로 표본을 다시 모아 회귀를 적합하면 추정한 계수는 표본마다 조금씩 달라진다. 이렇게 반복해서 얻은 계수들이 퍼지는 정도를 Coefficient variance(계수 분산)라고 한다.

Coefficient standard error(계수 표준오차)는 계수 분산의 제곱근이다. 5.6에서 표본평균의 Standard error(표준오차)를 표본을 다시 뽑을 때 표본평균이 흔들리는 정도로 읽었던 것과 같은 생각을 이제 회귀계수에 적용한다.

대상 변수에 고유하게 남은 정보가 적으면 자료는 그 변수만의 관계를 구분할 단서를 적게 준다. 그 결과 5.16에서 본 것처럼 표본이 조금 달라질 때 계수가 더 크게 흔들릴 수 있다.

고유하게 남은 비율 1Rj21-R_j^2의 역수를 Variance inflation factor(분산팽창인자, VIF)라고 한다.

VIFj=11Rj2VIF_j = \frac{1}{1-R_j^2}
VIFjVIF_j
jj번째 설명변수 계수의 Variance inflation factor(분산팽창인자)
단위: 없음, 최소값: 1
Rj2R_j^2
나머지 설명변수로 XjX_j를 예측한 보조 회귀의 R-squared(결정계수)
단위: 없음
jj
겹침을 확인할 설명변수의 순서
단위: 없음

VIF는 공선성이 없을 때와 비교해 계수 분산이 몇 배가 되었는지 나타낸다. 계수 표준오차는 분산의 제곱근이므로 상대 배율은 VIFj\sqrt{VIF_j}다.

보조 Rj2=0.75R_j^2=0.75인 앞의 예시를 그대로 계산하면 다음과 같다.

1Rj2=10.75=0.25VIFj=10.25=4계수 표준오차의 상대 배율=4=2\begin{aligned} 1-R_j^2 &=1-0.75=0.25 \\ VIF_j &=\frac{1}{0.25}=4 \\ \text{계수 표준오차의 상대 배율} &=\sqrt{4}=2 \end{aligned}
Rj2R_j^2
나머지 설명변수가 대상 설명변수를 재구성한 비율
예시 값: 0.75
단위: 없음
1Rj21-R_j^2
대상 설명변수에 고유하게 남은 정보의 비율
예시 값: 0.25
단위: 없음
VIFjVIF_j
공선성이 없을 때와 비교한 계수 분산의 상대 배율
예시 값: 4
단위: 배
VIFj\sqrt{VIF_j}
공선성이 없을 때와 비교한 계수 표준오차의 상대 배율
예시 값: 2
단위: 배

즉 대상 변수의 정보 중 25%만 고유하게 남은 조건에서는 계수 분산이 4배, 계수 표준오차가 2배가 된다. VIF 4를 계수가 4배 커진다는 뜻으로 읽으면 안 된다.

설명변수가 두 개일 때만 상관으로 바로 계산한다

설명변수가 정확히 두 개뿐이면 한 변수를 다른 한 변수로 예측한다. 이 특별한 경우에는 두 설명변수의 Pearson correlation coefficient(피어슨 상관계수) rr을 제곱한 값이 보조 R2R^2와 같다.

Rj2=r2R_j^2=r^2
Rj2R_j^2
설명변수가 두 개뿐일 때 한 변수를 다른 변수로 예측한 보조 결정계수
단위: 없음
rr
두 설명변수의 Pearson correlation coefficient(피어슨 상관계수)
단위: 없음, 범위: -1에서 1

두 설명변수의 상관이 0.8이라면 다음처럼 계산한다.

Rj2=0.82=0.641Rj2=10.64=0.36VIFj=10.362.7778VIFj1.6667\begin{aligned} R_j^2 &=0.8^2=0.64 \\ 1-R_j^2 &=1-0.64=0.36 \\ VIF_j &=\frac{1}{0.36}\approx2.7778 \\ \sqrt{VIF_j} &\approx1.6667 \end{aligned}
Rj2R_j^2
상관 0.8을 제곱해 얻은 보조 결정계수
예시 값: 0.64
단위: 없음
1Rj21-R_j^2
대상 설명변수에 고유하게 남은 정보의 비율
예시 값: 0.36
단위: 없음
VIFjVIF_j
공선성이 없을 때와 비교한 계수 분산의 상대 배율
예시 값: 약 2.7778
단위: 배
VIFj\sqrt{VIF_j}
공선성이 없을 때와 비교한 계수 표준오차의 상대 배율
예시 값: 약 1.6667
단위: 배

설명변수가 세 개 이상이면 대상 변수 하나를 나머지 여러 설명변수로 함께 예측해 보조 Rj2R_j^2를 구한다. 이때는 특정 두 변수의 상관 하나만 제곱해서 VIF를 계산할 수 없다.

INTERACTIVE STUDY TOOL보조 R²에서 VIF까지반응변수 Y는 사용하지 않습니다. 대상 설명변수 하나가 나머지 설명변수와 얼마나 겹치는지 바꾸며, 고유하게 남은 정보와 VIF를 함께 확인합니다.
보조 R² 0.75

대상 변수 정보 100% 나누기

겹침 + 고유 정보
다른 X가 재구성
75%
고유하게 남음
25%

다른 설명변수가 대상 변수의 75%를 재구성하고, 25%가 고유하게 남습니다.

VIF = 1 / 0.25 = 4.000

CALCULATION RESULT

계산 결과

VIF4.000
보조 R²
0.75
고유하게 남은 비율
0.25
표준오차 상대 배율
2.000

VIF만으로 변수를 자동 삭제하거나 모형 전체 품질을 판단하지 않습니다.

값은 변수별 경고등으로 사용한다

보조 Rj2R_j^2가 커질수록 고유하게 남은 비율은 작아지고 VIF는 빠르게 커진다.

보조 Rj2R_j^2고유하게 남은 비율VIFjVIF_j계수 표준오차 배율
0111배
0.640.36약 2.7778약 1.6667배
0.750.2542배
0.90.110약 3.1623배
10\infty\infty

VIF 1은 해당 설명변수를 나머지 설명변수가 선형으로 재구성하지 못했다는 뜻이다. 값이 커질수록 그 계수에 고유한 정보를 구분하기 어려워진다. VIF가 무한대라면 대상 변수가 나머지 설명변수로 완전히 정해져 고유한 계수를 하나로 정할 수 없다.

VIF 5나 10을 점검 기준으로 사용하는 경우가 있지만, 이 숫자는 경고등이지 자동 삭제 명령이 아니다. 높은 VIF를 확인했다면 먼저 연구 질문에서 그 변수가 필요한지, 같은 정보를 담은 변수를 합칠 수 있는지, 서로 다른 정보를 주는 관측을 더 모을 수 있는지 검토한다.

VIF는 설명변수끼리의 선형 겹침만 요약한다. 반응변수와의 관계가 강한지, 인과관계가 있는지, 모형 전체가 올바른지, 사용하지 않은 새 자료를 잘 예측할지는 별도로 확인해야 한다.

자주 생기는 오해

  • VIF는 반응변수 YY와 설명변수의 관계 강도를 측정하지 않는다.
  • VIF 4는 계수 자체가 4배라는 뜻이 아니라 계수 분산의 상대 배율이 4라는 뜻이다.
  • 계수 표준오차의 배율은 VIF가 아니라 VIF\sqrt{VIF}다.
  • 두 변수의 상관을 제곱하는 방법은 설명변수가 두 개뿐인 특별한 경우에만 바로 사용할 수 있다.
  • VIF가 5나 10을 넘었다는 이유만으로 변수를 자동 삭제하면 안 된다.

이해 점검

보조 회귀에서 반응변수 YY를 사용하지 않는 이유는 무엇인가?

확인하려는 것은 설명변수와 YY의 관계가 아니라 대상 설명변수 XjX_j가 나머지 설명변수와 얼마나 겹치는지이기 때문이다.

보조 Rj2=0.75R_j^2=0.75라면 고유하게 남은 비율과 VIF는 얼마인가?

고유하게 남은 비율은 10.75=0.251-0.75=0.25이고, VIF는 1/0.25=41/0.25=4다.

VIF가 4일 때 계수 표준오차는 몇 배가 되는가?

표준오차 배율은 4=2\sqrt{4}=2이므로 공선성이 없을 때의 2배다.

VIF가 6이면 해당 설명변수를 반드시 삭제해야 하는가?

아니다. VIF는 설명변수의 선형 겹침을 알려 주는 경고등이다. 연구 목적, 변수의 필요성, 추가 자료와 대체 방법을 함께 판단해야 한다.

완료 기준

반응변수 YY를 사용하지 않는 보조 회귀의 목적을 설명하고, 보조 Rj2R_j^2에서 고유하게 남은 비율·VIF·계수 표준오차 배율을 순서대로 계산하며, VIF가 자동 변수 삭제 규칙이 아님을 말할 수 있으면 5장을 마친다. 다음 장에서는 수익을 위험과 공통 요인 노출로 나누어 평가한다.

이 자료의 VIF는 통계 개념을 설명하기 위한 가상값이며 실제 변수 제거, 전략 선택이나 투자 결정을 지시하지 않는다.