CHAPTER 05.16 / MULTICOLLINEARITY
5.16 설명변수끼리 겹치는 문제
같은 정보를 담은 설명변수가 개별 회귀계수를 불안정하게 만들면서도 합친 예측은 덜 흔들릴 수 있는 이유를 살펴봅니다.
5.16 설명변수끼리 겹치는 문제
이 페이지는 5장의 선택 개념이다. 같은 정보를 담은 설명변수를 회귀식에 함께 넣었을 때 두 계수는 크게 달라져도 학생별 예측값은 비슷할 수 있는 이유를 이해하는 것이 목표다.
5.15에서는 공부 시간과 이전 시험 점수를 함께 사용해 최종 점수를 설명했다. 두 입력이 서로 다른 정보를 더해 주었기 때문에 각 계수를 따로 해석할 수 있었다.
그런데 같은 공부 시간을 시간과 분으로 바꾸어 두 칸에 함께 넣으면 어떨까? 입력 칸은 두 개지만 새 정보는 하나도 늘지 않는다.
2시간과 120분은 같은 공부량이다
시간 단위 공부량을 , 분 단위 공부량을 이라고 하자. 두 값은 언제나 다음 관계를 만족한다.
- 시간 단위로 기록한 공부 시간
- 단위: 시간
- 분 단위로 기록한 같은 공부 시간
- 단위: 분
- 1시간을 분으로 바꾸는 단위 변환값
- 단위: 분/시간
이면 이다. 하나를 알면 다른 하나도 정확히 알 수 있으므로 둘을 함께 기록해도 학생에 관한 새로운 정보가 생기지 않는다.
이때 공부 시간이 예측점수에 더하는 10점을 다음처럼 서로 다르게 나눌 수 있다.
배분 A는 시간 계수에 10점을 모두 맡기고, 배분 B는 시간 계수와 분 계수에 6점과 4점을 나눈다. 계수는 다르지만 두 배분의 합계와 예측은 같다. 이 자료만 보고는 어느 계수 배분이 하나뿐인 정답인지 고를 수 없다.
입력은 두 개, 공부량은 하나
X₂는 언제나 X₁의 60배이므로 한 입력을 알면 다른 입력도 정확히 알 수 있습니다.
계수를 다르게 나눠도 결과는 같다
두 배분 모두 2시간·120분인 학생에게 같은 10점을 더합니다. 이 자료만으로는 어느 배분이 유일하게 맞는지 고를 수 없습니다.
- 01같은 정보가 두 번 들어간다시간과 분은 이름과 단위만 다르고 같은 공부량을 가리킵니다.
- 02기여도를 나누기 어렵다두 입력 중 어느 쪽 계수에 점수 변화를 맡겨도 같은 결과를 만들 수 있습니다.
- 03개별 계수가 흔들린다자료가 조금 바뀌면 한 계수는 커지고 다른 계수는 작아질 수 있습니다.
- 04합친 예측은 덜 변할 수 있다두 계수의 기여도를 합치면 표본 안 예측은 비슷하게 남을 수 있습니다.
같은 정보를 나눠 가진 설명변수
여러 설명변수가 같거나 매우 비슷한 정보를 담는 상태를 Multicollinearity(다중공선성)라고 한다. 시간과 분처럼 한 설명변수가 다른 설명변수로 정확히 정해지는 경우는 Perfect multicollinearity(완전 다중공선성, 이하 완전 공선성)다.
완전 공선성에서는 같은 예측을 만드는 계수 배분이 여러 개라서 각 계수를 하나로 정할 수 없다. 이는 계산 방법이 부족해서가 아니라 자료가 두 입력의 기여도를 구분할 정보를 주지 않기 때문이다.
두 입력이 완전히 같지 않아도 거의 함께 움직이면 비슷한 문제가 생긴다. 예를 들어 학생별 학습 지표 X₁과 학습 지표 X₂가 조금씩 다르지만 거의 같은 순서로 높아진다고 하자. 두 계수를 계산할 수는 있어도 어느 지표의 기여도가 더 큰지 구분해 주는 관측이 적다.
작은 자료 변화가 두 OLS 계수를 반대 방향으로 움직인다
OLS를 두 번 적합하는 순서
- 1원자료 OLS 적합X₁·X₂·Y 일곱 개를 함께 사용
- 2결과 하나만 수정X₁·X₂ 고정, Y₂ → Y₂ +0.1
- 3OLS 재적합수정된 Y로 절편과 두 계수를 다시 계산
번호는 같은 학생을 나타냅니다. 완전 겹침에서는 모든 점이 한 직선 위에 놓이고 두 입력이 같은 정보를 전달합니다.
OLS 계수의 변경 전과 후
OLS는 절편도 다시 계산하지만, 아래에는 설명변수 X₁과 X₂의 계수만 표시합니다.
OLS 계수로 만든 예측
회색 원·실선은 변경 전, 강조색 사각형·점선은 변경 후입니다. 두 OLS 계수가 움직여도 합친 예측선은 가까이 남을 수 있습니다.
작은 자료 변화에 계산 결과가 얼마나 달라지는지를 Sensitivity(민감도)라고 한다. 방금 확인한 도구는 선택한 겹침 상태에서 일곱 학생의 , , 를 사용해 Ordinary least squares(최소제곱법, OLS)를 먼저 적합한다. 두 학습 지표의 관계는 5.3에서 배운 Pearson correlation coefficient(피어슨 상관계수)로 표시한다.
그다음 과 는 그대로 두고 두 번째 학생의 결과만 로 바꾼 뒤 OLS를 다시 적합한다. 변경 전과 후 모두 OLS가 절편, , 를 동시에 다시 계산한다. 도구는 이 가운데 두 설명변수의 계수와 적합값을 비교한다.
원래 자료에서는 의 OLS 계수 과 의 OLS 계수 가 모두 2.000이다. 겹침이 높은 상관 0.99에서 OLS를 다시 적합하면 은 약 2.069로 커지고 는 약 1.923으로 작아진다. 한 계수가 맡던 몫을 다른 계수가 가져가는 모습이다.
X₁의 OLS 계수는 커지고 X₂의 OLS 계수는 작아졌다. 한쪽이 커진 만큼 다른 쪽이 작아졌기 때문에 학생별 예측값은 거의 그대로였다. 가장 크게 달라진 예측값도 0.062뿐이다.
자주 생기는 오해
- 다중공선성은 반응변수와 설명변수의 관계가 강하다는 뜻이 아니다.
- 높은 상관만으로 회귀모형 전체가 틀렸거나 인과관계가 있다고 결론낼 수 없다.
- 두 OLS 계수가 크게 달라져도 학생별 예측값은 비슷할 수 있다.
- 완전 공선성에서는 두 계수를 각각 하나로 정할 수 없다.
이해 점검
공부 시간을 시간과 분으로 함께 넣어도 정보가 늘지 않는 이유는 무엇인가?
분 단위 값은 언제나 시간 단위 값의 60배이므로 하나를 알면 다른 하나를 정확히 알 수 있기 때문이다.
결과 한 개를 조금 바꿨을 때 두 계수가 반대 방향으로 움직일 수 있는 이유는 무엇인가?
두 설명변수가 비슷한 정보를 담아 공통 기여도를 어느 계수에 맡길지 구분하기 어렵기 때문이다. 한 계수가 더 맡으면 다른 계수는 덜 맡아 비슷한 예측을 만들 수 있다.
도구에서 결과 하나를 0.1 올릴 때 그대로 두는 값은 무엇인가?
두 설명변수 과 는 그대로 둔다. 두 번째 학생의 결과 만 0.1 올린 뒤 OLS를 다시 적합한다.
두 OLS 계수가 달라져도 학생별 예측값이 비슷한 이유는 무엇인가?
한 계수가 커질 때 다른 계수가 작아져 서로의 변화를 일부 없애 주기 때문이다.
완료 기준
같은 정보를 담은 설명변수가 왜 두 OLS 계수를 크게 바꿀 수 있는지, 두 계수가 달라져도 학생별 예측값은 왜 비슷할 수 있는지 설명할 수 있으면 다음 페이지로 넘어간다. 5.17에서는 설명변수 겹침의 정도를 숫자로 측정한다.
이 자료의 학생과 회귀계수는 원리를 설명하기 위한 가상값이며 실제 변수 선택이나 투자 결정을 자동화하지 않는다.