Q

PRIVATE NAVIGATION MODE

ML4T 탭 잠금 해제

패스워드를 확인하면 이 브라우저에서 ML4T 탭과 검색 결과를 표시합니다.

STUDY SEARCH

학습 자료 검색

제목과 설명, 키워드, 학습 본문에서 찾습니다.

검색 범위

검색어를 입력해 주세요.

SEARCH THE NOTEBOOK

찾고 싶은 금융·통계·전략 개념을 입력해 보세요.

CHAPTER 05.16 / MULTICOLLINEARITY

5.16 설명변수끼리 겹치는 문제

같은 정보를 담은 설명변수가 개별 회귀계수를 불안정하게 만들면서도 합친 예측은 덜 흔들릴 수 있는 이유를 살펴봅니다.

5장. 기댓값·공분산·가설검정·회귀와 자기상관초급 학습 노트

5.16 설명변수끼리 겹치는 문제

이 페이지는 5장의 선택 개념이다. 같은 정보를 담은 설명변수를 회귀식에 함께 넣었을 때 두 계수는 크게 달라져도 학생별 예측값은 비슷할 수 있는 이유를 이해하는 것이 목표다.

5.15에서는 공부 시간과 이전 시험 점수를 함께 사용해 최종 점수를 설명했다. 두 입력이 서로 다른 정보를 더해 주었기 때문에 각 계수를 따로 해석할 수 있었다.

그런데 같은 공부 시간을 시간으로 바꾸어 두 칸에 함께 넣으면 어떨까? 입력 칸은 두 개지만 새 정보는 하나도 늘지 않는다.

2시간과 120분은 같은 공부량이다

시간 단위 공부량을 XhX_h, 분 단위 공부량을 XmX_m이라고 하자. 두 값은 언제나 다음 관계를 만족한다.

Xm=60XhX_m = 60X_h
XhX_h
시간 단위로 기록한 공부 시간
단위: 시간
XmX_m
분 단위로 기록한 같은 공부 시간
단위: 분
6060
1시간을 분으로 바꾸는 단위 변환값
단위: 분/시간

Xh=2시간X_h=2\text{시간}이면 Xm=120X_m=120\text{분}이다. 하나를 알면 다른 하나도 정확히 알 수 있으므로 둘을 함께 기록해도 학생에 관한 새로운 정보가 생기지 않는다.

이때 공부 시간이 예측점수에 더하는 10점을 다음처럼 서로 다르게 나눌 수 있다.

배분 A: 51시간×2시간+01×120=10배분 B: 31시간×2시간+260×120=10\begin{aligned} \text{배분 A: }& \frac{5\text{점}}{1\text{시간}} \times 2\text{시간} + \frac{0\text{점}}{1\text{분}} \times 120\text{분} =10\text{점} \\ \text{배분 B: }& \frac{3\text{점}}{1\text{시간}} \times 2\text{시간} + \frac{2\text{점}}{60\text{분}} \times 120\text{분} =10\text{점} \end{aligned}

배분 A는 시간 계수에 10점을 모두 맡기고, 배분 B는 시간 계수와 분 계수에 6점과 4점을 나눈다. 계수는 다르지만 두 배분의 합계와 예측은 같다. 이 자료만 보고는 어느 계수 배분이 하나뿐인 정답인지 고를 수 없다.

같은 공부량을 두 변수로 넣으면 생기는 일2시간과 120분은 같은 공부량입니다. 입력이 두 칸이어도 새로운 정보가 늘어난 것은 아닙니다.
SAME INFORMATION

입력은 두 개, 공부량은 하나

시간 단위 X₁2시간
분 단위 X₂120분

X₂는 언제나 X₁의 60배이므로 한 입력을 알면 다른 입력도 정확히 알 수 있습니다.

SAME PREDICTION

계수를 다르게 나눠도 결과는 같다

배분 A
시간 계수 5점/시간분 계수 0점/분
합계 10점
배분 B
시간 계수 3점/시간분 계수 2점/60분
합계 10점

두 배분 모두 2시간·120분인 학생에게 같은 10점을 더합니다. 이 자료만으로는 어느 배분이 유일하게 맞는지 고를 수 없습니다.

  1. 01같은 정보가 두 번 들어간다시간과 분은 이름과 단위만 다르고 같은 공부량을 가리킵니다.
  2. 02기여도를 나누기 어렵다두 입력 중 어느 쪽 계수에 점수 변화를 맡겨도 같은 결과를 만들 수 있습니다.
  3. 03개별 계수가 흔들린다자료가 조금 바뀌면 한 계수는 커지고 다른 계수는 작아질 수 있습니다.
  4. 04합친 예측은 덜 변할 수 있다두 계수의 기여도를 합치면 표본 안 예측은 비슷하게 남을 수 있습니다.

같은 정보를 나눠 가진 설명변수

여러 설명변수가 같거나 매우 비슷한 정보를 담는 상태를 Multicollinearity(다중공선성)라고 한다. 시간과 분처럼 한 설명변수가 다른 설명변수로 정확히 정해지는 경우는 Perfect multicollinearity(완전 다중공선성, 이하 완전 공선성)다.

완전 공선성에서는 같은 예측을 만드는 계수 배분이 여러 개라서 각 계수를 하나로 정할 수 없다. 이는 계산 방법이 부족해서가 아니라 자료가 두 입력의 기여도를 구분할 정보를 주지 않기 때문이다.

두 입력이 완전히 같지 않아도 거의 함께 움직이면 비슷한 문제가 생긴다. 예를 들어 학생별 학습 지표 X₁학습 지표 X₂가 조금씩 다르지만 거의 같은 순서로 높아진다고 하자. 두 계수를 계산할 수는 있어도 어느 지표의 기여도가 더 큰지 구분해 주는 관측이 적다.

작은 자료 변화가 두 OLS 계수를 반대 방향으로 움직인다

INTERACTIVE STUDY TOOL설명변수 겹침 실험Ordinary least squares(최소제곱법, OLS)는 일곱 학생의 X₁, X₂와 Y로 절편과 두 계수를 동시에 추정합니다. X₁·X₂는 그대로 두고 Y 하나만 0.1 올린 뒤 OLS를 다시 적합해 결과를 비교합니다.

OLS를 두 번 적합하는 순서

  1. 1원자료 OLS 적합X₁·X₂·Y 일곱 개를 함께 사용
  2. 2결과 하나만 수정X₁·X₂ 고정, Y₂ → Y₂ +0.1
  3. 3OLS 재적합수정된 Y로 절편과 두 계수를 다시 계산
두 설명변수의 겹침 정도
실제 상관계수0.99
겹침 정도에 따른 두 설명변수의 산점도가로축은 첫 번째 학습 지표, 세로축은 두 번째 학습 지표입니다. 겹침이 커질수록 일곱 점이 오른쪽 위로 향하는 한 직선에 가까워집니다.-3-300331234567학습 지표 X₁학습 지표 X₂

번호는 같은 학생을 나타냅니다. 완전 겹침에서는 모든 점이 한 직선 위에 놓이고 두 입력이 같은 정보를 전달합니다.

COEFFICIENTS

OLS 계수의 변경 전과 후

Y 하나만 +0.1 후 OLS 재적합

OLS는 절편도 다시 계산하지만, 아래에는 설명변수 X₁과 X₂의 계수만 표시합니다.

X₁의 OLS 계수2.0002.069 (+0.069)
회색은 변경 전, 강조색은 변경 후입니다.
X₂의 OLS 계수2.0001.923 (-0.077)
회색은 변경 전, 강조색은 변경 후입니다.
FITTED VALUES

OLS 계수로 만든 예측

최대 변화 0.062
일곱 학생의 OLS 적합값 변경 전후 비교회색 원과 실선은 원래 Y로 OLS를 적합한 예측, 강조색 사각형과 점선은 Y 하나만 0.1 올리고 OLS를 다시 적합한 예측입니다. 높은 겹침에서도 두 선은 서로 가깝게 나타납니다.13.91.0-11.91234567관측 순서

회색 원·실선은 변경 전, 강조색 사각형·점선은 변경 후입니다. 두 OLS 계수가 움직여도 합친 예측선은 가까이 남을 수 있습니다.

작은 자료 변화에 계산 결과가 얼마나 달라지는지를 Sensitivity(민감도)라고 한다. 방금 확인한 도구는 선택한 겹침 상태에서 일곱 학생의 X1X_1, X2X_2, YY를 사용해 Ordinary least squares(최소제곱법, OLS)를 먼저 적합한다. 두 학습 지표의 관계는 5.3에서 배운 Pearson correlation coefficient(피어슨 상관계수)로 표시한다.

그다음 X1X_1X2X_2는 그대로 두고 두 번째 학생의 결과만 Y2Y2+0.1Y_2 \rightarrow Y_2+0.1로 바꾼 뒤 OLS를 다시 적합한다. 변경 전과 후 모두 OLS가 절편, β^1\widehat{\beta}_1, β^2\widehat{\beta}_2를 동시에 다시 계산한다. 도구는 이 가운데 두 설명변수의 계수와 적합값을 비교한다.

원래 자료에서는 X1X_1의 OLS 계수 β^1\widehat{\beta}_1X2X_2의 OLS 계수 β^2\widehat{\beta}_2가 모두 2.000이다. 겹침이 높은 상관 0.99에서 OLS를 다시 적합하면 β^1\widehat{\beta}_1은 약 2.069로 커지고 β^2\widehat{\beta}_2는 약 1.923으로 작아진다. 한 계수가 맡던 몫을 다른 계수가 가져가는 모습이다.

X₁의 OLS 계수는 커지고 X₂의 OLS 계수는 작아졌다. 한쪽이 커진 만큼 다른 쪽이 작아졌기 때문에 학생별 예측값은 거의 그대로였다. 가장 크게 달라진 예측값도 0.062뿐이다.

자주 생기는 오해

  • 다중공선성은 반응변수와 설명변수의 관계가 강하다는 뜻이 아니다.
  • 높은 상관만으로 회귀모형 전체가 틀렸거나 인과관계가 있다고 결론낼 수 없다.
  • 두 OLS 계수가 크게 달라져도 학생별 예측값은 비슷할 수 있다.
  • 완전 공선성에서는 두 계수를 각각 하나로 정할 수 없다.

이해 점검

공부 시간을 시간과 분으로 함께 넣어도 정보가 늘지 않는 이유는 무엇인가?

분 단위 값은 언제나 시간 단위 값의 60배이므로 하나를 알면 다른 하나를 정확히 알 수 있기 때문이다.

결과 한 개를 조금 바꿨을 때 두 계수가 반대 방향으로 움직일 수 있는 이유는 무엇인가?

두 설명변수가 비슷한 정보를 담아 공통 기여도를 어느 계수에 맡길지 구분하기 어렵기 때문이다. 한 계수가 더 맡으면 다른 계수는 덜 맡아 비슷한 예측을 만들 수 있다.

도구에서 결과 하나를 0.1 올릴 때 그대로 두는 값은 무엇인가?

두 설명변수 X1X_1X2X_2는 그대로 둔다. 두 번째 학생의 결과 Y2Y_2만 0.1 올린 뒤 OLS를 다시 적합한다.

두 OLS 계수가 달라져도 학생별 예측값이 비슷한 이유는 무엇인가?

한 계수가 커질 때 다른 계수가 작아져 서로의 변화를 일부 없애 주기 때문이다.

완료 기준

같은 정보를 담은 설명변수가 왜 두 OLS 계수를 크게 바꿀 수 있는지, 두 계수가 달라져도 학생별 예측값은 왜 비슷할 수 있는지 설명할 수 있으면 다음 페이지로 넘어간다. 5.17에서는 설명변수 겹침의 정도를 숫자로 측정한다.

이 자료의 학생과 회귀계수는 원리를 설명하기 위한 가상값이며 실제 변수 선택이나 투자 결정을 자동화하지 않는다.