CHAPTER 05.17 / VARIANCE INFLATION FACTOR
5.17 공선성이 분산을 부풀리는 정도
설명변수 하나를 나머지 설명변수로 재구성한 비율에서 고유 정보, VIF와 계수 표준오차 배율을 차례로 이해합니다.
5.17 공선성이 분산을 부풀리는 정도
이 페이지는 5장의 선택 개념이다. 5.16에서 본 설명변수의 겹침을 한 변수씩 측정하고, 그 숫자가 계수의 흔들림과 어떻게 연결되는지 이해하는 것이 목표다.
5.16에서는 두 설명변수가 비슷한 정보를 담으면 작은 자료 변화에도 한 계수는 커지고 다른 계수는 작아질 수 있음을 확인했다. 이번에는 먼저 한 설명변수의 정보 가운데 다른 설명변수와 겹치지 않고 남은 부분이 얼마나 되는가?를 묻는다.
결과 Y 대신 설명변수 하나를 잠시 결과로 놓는다
5.15의 원래 회귀는 공부 시간과 이전 시험 점수 같은 설명변수로 최종 점수 를 설명했다. 지금 확인하려는 것은 최종 점수가 아니라 설명변수끼리의 겹침이다. 따라서 이 계산에서는 반응변수 를 사용하지 않는다.
겹침을 확인할 설명변수 하나를 로 고른다. 그런 다음 나머지 설명변수만 사용해 를 얼마나 잘 예측할 수 있는지 확인한다. 원래 회귀를 돕기 위해 따로 수행하는 이 회귀를 Auxiliary regression(보조 회귀)이라고 한다.
예를 들어 공부 시간 의 겹침을 확인한다면 을 잠시 결과로 놓고, 이전 시험 점수 와 다른 설명변수들로 을 예측한다. 이번에는 의 겹침을 확인하고 싶다면 대상을 바꾸어 를 나머지 설명변수로 예측한다. 그래서 겹침의 숫자는 모형 전체에 하나가 아니라 설명변수마다 하나씩 나온다.
5.13에서 배운 R-squared(결정계수)는 무엇을 결과로 놓느냐에 따라 답하는 질문이 달라진다.
| 구분 | 결과로 놓는 값 | 가 답하는 질문 |
|---|---|---|
| 원래 회귀 | 반응변수 | 설명변수들이 의 변동을 얼마나 설명하는가? |
| 보조 회귀 | 확인할 설명변수 | 나머지 설명변수들이 의 변동을 얼마나 재구성하는가? |
보조 에서 고유하게 남은 정보를 찾는다
보조 회귀에서 얻은 가 0.75라면 나머지 설명변수가 대상 변수 의 변동 가운데 75%를 재구성했다는 뜻이다. 그러면 겹치지 않고 고유하게 남은 비율은 , 즉 25%다.
이면 다른 설명변수가 대상 변수를 재구성하지 못해 고유한 정보가 100% 남는다. 이면 다른 설명변수만으로 대상 변수를 완전히 재구성할 수 있어 고유한 정보가 남지 않는다. 5.16의 2시간과 120분처럼 하나를 알면 다른 하나가 정확히 정해지는 경우가 여기에 해당한다.
다른 설명변수가 이미 알려 주는 부분이 많을수록 대상 변수만의 정보는 적게 남습니다.
- 01TARGET대상 변수를 고른다겹침을 확인할 설명변수 하나를 Xⱼ로 고릅니다.
- 02AUXILIARY REGRESSION다른 X로 재구성한다반응변수 Y는 빼고 나머지 설명변수만으로 Xⱼ를 예측합니다.
- 03UNIQUE PART남은 정보를 확인한다보조 R²가 0.75이면 75%는 겹치고 25%는 고유하게 남습니다.
- 04VIF남은 비율을 뒤집는다남은 비율 0.25의 역수는 4이므로 VIF는 4입니다.
적게 남은 고유 정보는 계수를 더 흔들리게 한다
같은 방법으로 표본을 다시 모아 회귀를 적합하면 추정한 계수는 표본마다 조금씩 달라진다. 이렇게 반복해서 얻은 계수들이 퍼지는 정도를 Coefficient variance(계수 분산)라고 한다.
Coefficient standard error(계수 표준오차)는 계수 분산의 제곱근이다. 5.6에서 표본평균의 Standard error(표준오차)를 표본을 다시 뽑을 때 표본평균이 흔들리는 정도로 읽었던 것과 같은 생각을 이제 회귀계수에 적용한다.
대상 변수에 고유하게 남은 정보가 적으면 자료는 그 변수만의 관계를 구분할 단서를 적게 준다. 그 결과 5.16에서 본 것처럼 표본이 조금 달라질 때 계수가 더 크게 흔들릴 수 있다.
고유하게 남은 비율 의 역수를 Variance inflation factor(분산팽창인자, VIF)라고 한다.
- 번째 설명변수 계수의 Variance inflation factor(분산팽창인자)
- 단위: 없음, 최소값: 1
- 나머지 설명변수로 를 예측한 보조 회귀의 R-squared(결정계수)
- 단위: 없음
- 겹침을 확인할 설명변수의 순서
- 단위: 없음
VIF는 공선성이 없을 때와 비교해 계수 분산이 몇 배가 되었는지 나타낸다. 계수 표준오차는 분산의 제곱근이므로 상대 배율은 다.
보조 인 앞의 예시를 그대로 계산하면 다음과 같다.
- 나머지 설명변수가 대상 설명변수를 재구성한 비율
- 예시 값: 0.75
- 단위: 없음
- 대상 설명변수에 고유하게 남은 정보의 비율
- 예시 값: 0.25
- 단위: 없음
- 공선성이 없을 때와 비교한 계수 분산의 상대 배율
- 예시 값: 4
- 단위: 배
- 공선성이 없을 때와 비교한 계수 표준오차의 상대 배율
- 예시 값: 2
- 단위: 배
즉 대상 변수의 정보 중 25%만 고유하게 남은 조건에서는 계수 분산이 4배, 계수 표준오차가 2배가 된다. VIF 4를 계수가 4배 커진다는 뜻으로 읽으면 안 된다.
설명변수가 두 개일 때만 상관으로 바로 계산한다
설명변수가 정확히 두 개뿐이면 한 변수를 다른 한 변수로 예측한다. 이 특별한 경우에는 두 설명변수의 Pearson correlation coefficient(피어슨 상관계수) 을 제곱한 값이 보조 와 같다.
- 설명변수가 두 개뿐일 때 한 변수를 다른 변수로 예측한 보조 결정계수
- 단위: 없음
- 두 설명변수의 Pearson correlation coefficient(피어슨 상관계수)
- 단위: 없음, 범위: -1에서 1
두 설명변수의 상관이 0.8이라면 다음처럼 계산한다.
- 상관 0.8을 제곱해 얻은 보조 결정계수
- 예시 값: 0.64
- 단위: 없음
- 대상 설명변수에 고유하게 남은 정보의 비율
- 예시 값: 0.36
- 단위: 없음
- 공선성이 없을 때와 비교한 계수 분산의 상대 배율
- 예시 값: 약 2.7778
- 단위: 배
- 공선성이 없을 때와 비교한 계수 표준오차의 상대 배율
- 예시 값: 약 1.6667
- 단위: 배
설명변수가 세 개 이상이면 대상 변수 하나를 나머지 여러 설명변수로 함께 예측해 보조 를 구한다. 이때는 특정 두 변수의 상관 하나만 제곱해서 VIF를 계산할 수 없다.
대상 변수 정보 100% 나누기
겹침 + 고유 정보- 다른 X가 재구성
- 75%
- 고유하게 남음
- 25%
다른 설명변수가 대상 변수의 75%를 재구성하고, 25%가 고유하게 남습니다.
VIF = 1 / 0.25 = 4.000
계산 결과
- 보조 R²
- 0.75
- 고유하게 남은 비율
- 0.25
- 표준오차 상대 배율
- 2.000배
VIF만으로 변수를 자동 삭제하거나 모형 전체 품질을 판단하지 않습니다.
값은 변수별 경고등으로 사용한다
보조 가 커질수록 고유하게 남은 비율은 작아지고 VIF는 빠르게 커진다.
| 보조 | 고유하게 남은 비율 | 계수 표준오차 배율 | |
|---|---|---|---|
| 0 | 1 | 1 | 1배 |
| 0.64 | 0.36 | 약 2.7778 | 약 1.6667배 |
| 0.75 | 0.25 | 4 | 2배 |
| 0.9 | 0.1 | 10 | 약 3.1623배 |
| 1 | 0 |
VIF 1은 해당 설명변수를 나머지 설명변수가 선형으로 재구성하지 못했다는 뜻이다. 값이 커질수록 그 계수에 고유한 정보를 구분하기 어려워진다. VIF가 무한대라면 대상 변수가 나머지 설명변수로 완전히 정해져 고유한 계수를 하나로 정할 수 없다.
VIF 5나 10을 점검 기준으로 사용하는 경우가 있지만, 이 숫자는 경고등이지 자동 삭제 명령이 아니다. 높은 VIF를 확인했다면 먼저 연구 질문에서 그 변수가 필요한지, 같은 정보를 담은 변수를 합칠 수 있는지, 서로 다른 정보를 주는 관측을 더 모을 수 있는지 검토한다.
VIF는 설명변수끼리의 선형 겹침만 요약한다. 반응변수와의 관계가 강한지, 인과관계가 있는지, 모형 전체가 올바른지, 사용하지 않은 새 자료를 잘 예측할지는 별도로 확인해야 한다.
자주 생기는 오해
- VIF는 반응변수 와 설명변수의 관계 강도를 측정하지 않는다.
- VIF 4는 계수 자체가 4배라는 뜻이 아니라 계수 분산의 상대 배율이 4라는 뜻이다.
- 계수 표준오차의 배율은 VIF가 아니라 다.
- 두 변수의 상관을 제곱하는 방법은 설명변수가 두 개뿐인 특별한 경우에만 바로 사용할 수 있다.
- VIF가 5나 10을 넘었다는 이유만으로 변수를 자동 삭제하면 안 된다.
이해 점검
보조 회귀에서 반응변수 를 사용하지 않는 이유는 무엇인가?
확인하려는 것은 설명변수와 의 관계가 아니라 대상 설명변수 가 나머지 설명변수와 얼마나 겹치는지이기 때문이다.
보조 라면 고유하게 남은 비율과 VIF는 얼마인가?
고유하게 남은 비율은 이고, VIF는 다.
VIF가 4일 때 계수 표준오차는 몇 배가 되는가?
표준오차 배율은 이므로 공선성이 없을 때의 2배다.
VIF가 6이면 해당 설명변수를 반드시 삭제해야 하는가?
아니다. VIF는 설명변수의 선형 겹침을 알려 주는 경고등이다. 연구 목적, 변수의 필요성, 추가 자료와 대체 방법을 함께 판단해야 한다.
완료 기준
반응변수 를 사용하지 않는 보조 회귀의 목적을 설명하고, 보조 에서 고유하게 남은 비율·VIF·계수 표준오차 배율을 순서대로 계산하며, VIF가 자동 변수 삭제 규칙이 아님을 말할 수 있으면 5장을 마친다. 다음 장에서는 수익을 위험과 공통 요인 노출로 나누어 평가한다.
이 자료의 VIF는 통계 개념을 설명하기 위한 가상값이며 실제 변수 제거, 전략 선택이나 투자 결정을 지시하지 않는다.