CHAPTER 05.13 / R-SQUARED
5.13 모델이 설명하는 변동의 비율
5.11과 5.12의 공부 시간과 시험 점수 예시를 이어서, 평균 기준과 회귀선을 비교해 제곱거리가 줄어든 비율을 이해합니다.
5.13 모델이 설명하는 변동의 비율
5.11과 5.12에서 사용한 공부 시간과 시험 점수 자료를 그대로 이어서, 평균만 사용한 기준과 회귀선을 비교하고 제곱거리가 줄어든 비율을 이해하는 것이 이 페이지의 목표다.
5.11에서는 학생 네 명의 공부 시간과 시험 점수를 직선 로 요약했다. 5.12에서는 실제 점수와 이 직선 사이에 남은 잔차를 제곱해 더했고, Residual sum of squares(잔차제곱합, RSS)가 임을 확인했다.
RSS가 작을수록 직선이 관측점에 가깝다는 사실은 알 수 있다. 하지만 만 보고 얼마나 작은지는 판단하기 어렵다. 회귀선을 사용하지 않았을 때의 가장 단순한 기준과 먼저 비교해야 한다.
평균만 말하는 기준을 먼저 만든다
네 점수의 Mean(평균)은 55점이다.
공부 시간을 전혀 사용하지 않고 모든 학생의 점수를 55점이라고 말하는 방법을 Baseline model(기준모형)로 삼는다. 그림으로 그리면 높이가 55점인 수평선이다.
각 실제 점수에서 평균 55점을 뺀 거리를 제곱해 더한 값이 Total sum of squares(총제곱합, TSS)다. 회귀선을 사용하기 전에 점수들이 평균에서 전체적으로 얼마나 퍼져 있었는지를 나타낸다.
| 학생 | 실제 점수 | 평균 기준 | 평균과의 거리 | 거리의 제곱 |
|---|---|---|---|---|
| A | 44점 | 55점 | -11점 | |
| B | 46점 | 55점 | -9점 | |
| C | 56점 | 55점 | +1점 | |
| D | 74점 | 55점 | +19점 |
- Total sum of squares(총제곱합)
- 단위:
- 학생을 구분하는 순서
- 단위: 없음
- 번째 학생의 실제 시험 점수
- 단위: 점
- 네 학생의 Mean(평균)이자 기준모형의 예측값
- 단위: 점
회귀선이 남긴 제곱거리와 비교한다
평균 기준모형의 예측값은 [55, 55, 55, 55]점이고 TSS는 다. 회귀선의 적합값은 [40, 50, 60, 70]점이고 잔차는 [+4, -4, -4, +4]점이었다.
회귀선이 남긴 제곱거리를 다시 더하면 RSS는 다.
| 비교 대상 | 네 학생에게 제시한 값 | 제곱거리의 합 |
|---|---|---|
| 평균 기준모형 | [55, 55, 55, 55]점 | |
| 회귀선 | [40, 50, 60, 70]점 |
회귀선을 사용하면서 제곱거리의 합이 에서 로 줄었다. 줄어든 가 전체 에서 차지하는 비율이 R-squared(결정계수)다.
- R-squared(결정계수)
- 단위: 없음
- 회귀선과 실제 점수 사이의 Residual sum of squares(잔차제곱합)
- 단위:
- 평균 기준모형과 실제 점수 사이의 Total sum of squares(총제곱합)
- 단위:
는 같은 네 학생 자료에서 회귀선이 평균만 말하는 기준보다 제곱거리의 합을 약 88.7% 줄였다는 뜻이다. 예측한 점수의 88.7%가 맞았다는 뜻은 아니다.
- 평균 기준 TSS
- 564점 제곱
- 회귀 후 RSS
- 64점 제곱
- 줄어든 제곱거리
- 500점 제곱
같은 네 학생 자료에서 회귀선은 평균 기준보다 제곱거리의 합을 88.7% 줄였습니다.
전체 제곱거리에서 남은 몫
평균 기준의 전체 길이를 100%로 놓고 회귀선 뒤에 남은 RSS를 비교합니다.
평균 기준선의 학생별 제곱거리
현재 선택한 선에서 멀리 떨어질수록 막대가 길어집니다.
- A121점 제곱
- B81점 제곱
- C1점 제곱
- D361점 제곱
TSS 합계564점 제곱
0과 1을 기준으로 값을 읽는다
회귀선을 만들 때 사용한 자료에서 다시 를 계산하는 것을 In-sample evaluation(표본내 평가)이라고 한다. 절편을 포함한 Ordinary least squares(최소제곱법)는 평균 수평선보다 RSS가 커지지 않는 직선을 고르므로, 이때의 는 0에서 1 사이에 있다.
- 이면 모든 관측점이 회귀선 위에 있어 RSS가 0이다.
- 이면 회귀선이 평균 기준모형보다 제곱거리를 줄이지 못했다.
- 값이 1에 가까울수록 같은 자료의 관측점이 회귀선에 더 가깝다.
높은 값도 인과관계나 미래 예측력을 증명하지 않는다. 5.11에서 보았듯이 두 변수가 함께 움직여도 한 변수가 다른 변수를 일으켰다고 단정할 수 없다.
새 자료에서는 음수가 될 수도 있다
회귀선을 만들 때 사용하지 않은 새 자료로 성능을 확인하는 것을 Out-of-sample evaluation(표본외 평가)이라고 한다. 이때는 모형을 만들 때 정한 평균 기준을 그대로 고정해 회귀선의 제곱오차와 비교한다.
새 자료에서 회귀선의 제곱오차가 평균 기준모형의 제곱오차보다 크면 가 1보다 커지고 는 음수가 된다. 이는 계산이 잘못되었다는 뜻이 아니라, 새 자료에서는 회귀선이 평균만 말하는 기준보다 못했다는 뜻이다.
서로 직접 관련이 없는 두 값도 시간에 따라 나란히 오르면 높은 가 나올 수 있다. 다음 페이지에서는 시간 순서가 있는 자료에서 앞 시점과 뒤 시점의 연결을 확인한다.
자주 생기는 오해
- 는 예측이 88.7% 정확하다는 뜻이 아니다.
- 높은 는 설명변수와 반응변수 사이의 인과관계를 증명하지 않는다.
- 같은 자료에서 계산한 높은 가 새 자료의 좋은 예측을 보장하지 않는다.
- 새 자료에서 평균 기준보다 제곱오차가 크면 는 음수가 될 수 있다.
- 시간에 따라 함께 움직인다는 이유만으로 두 값의 관계가 유용하다고 단정하지 않는다.
이해 점검
네 학생 점수의 평균과 TSS는 얼마인가?
평균은 55점이다. 각 점수와 평균의 거리 제곱을 더하면 이므로 TSS는 다.
TSS가 이고 RSS가 일 때 는 얼마인가?
이므로 약 88.7%다.
는 시험 점수를 88.7% 정확하게 맞혔다는 뜻인가?
아니다. 같은 네 학생 자료에서 평균 기준모형보다 제곱거리의 합을 약 88.7% 줄였다는 뜻이다.
표본외 가 음수라면 무엇을 뜻하는가?
새 자료에서 회귀선의 제곱오차가 고정한 평균 기준모형의 제곱오차보다 컸다는 뜻이다.
완료 기준
평균 기준모형에서 TSS를 계산하고, 회귀선의 RSS와 비교해 를 구하며, 같은 자료의 설명 정도와 새 자료의 예측 성능이 다를 수 있음을 말할 수 있으면 다음 페이지로 넘어간다.
이 자료의 공부 시간과 시험 점수는 통계 원리를 설명하기 위한 가상 자료이며 실제 학습 효과, 인과관계나 미래 점수를 확정하지 않는다.