이번 문서의 목표: 단순선형회귀 모형을 이해하고, 최소제곱법으로 회귀직선의 절편과 기울기를 직접 계산하며, 결정계수로 모형의 적합도를 평가하고 예측 시 외삽의 위험을 피할 수 있게 된다.
왜 회귀분석이 필요한가
21편에서는 공부 시간과 시험 점수 사이에 매우 강한 양의 상관관계(약 0.9970)가 있다는 것을 확인했다. 그런데 상관계수는 “관계가 얼마나 강한가”만 알려줄 뿐, “공부를 한 시간 더 하면 점수가 몇 점 오르는가”, “7시간 공부하면 점수가 몇 점일 것으로 예상되는가” 같은 구체적인 질문에는 답하지 못한다.
이 질문에 답하려면 점들 사이를 지나가는 하나의 직선을 찾아야 한다. 이 직선을 구하고 해석하는 방법이 단순선형회귀(simple linear regression)다. “단순(simple)“이라는 말은 설명변수가 하나뿐이라는 뜻이고, “선형(linear)“이라는 말은 그 관계를 직선으로 모형화한다는 뜻이다.
쉽게 말하면: 회귀분석은 산점도 위의 점들 사이를 가장 잘 대표하는 직선 하나를 찾아, 그 직선으로 관계를 설명하고 새로운 값을 예측하는 방법이다.
이 문서에서 쓰는 데이터
21편과 같은 자료를 그대로 쓴다. 학생 9명의 공부 시간(, 단위: 시간)과 시험 점수(, 단위: 점)다.
| 학생 | A | B | C | D | E | F | G | H | I |
|---|---|---|---|---|---|---|---|---|---|
| 공부 시간 | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 |
| 시험 점수 | 38 | 42 | 44 | 48 | 50 | 52 | 56 | 58 | 62 |
같은 자료를 이어 쓰는 이유는, 이번 편 끝에서 계산할 결정계수(coefficient of determination)가 21편에서 구한 상관계수의 제곱과 정확히 일치하는 것을 직접 눈으로 확인하기 위해서다.
단순선형회귀 모형: 설명변수와 반응변수
회귀분석에서는 두 변수의 역할을 구분한다.
- 설명변수(explanatory variable, 독립변수라고도 한다): 원인 역할로 놓는 변수. 여기서는 공부 시간 다.
- 반응변수(response variable, 종속변수라고도 한다): 설명변수에 의해 설명되는 변수. 여기서는 시험 점수 다.
단순선형회귀 모형은 반응변수를 설명변수의 일차식과 오차항의 합으로 나타낸다.
- : 번째 관측값의 반응변수 값
- (베타 제로, 모집단 절편): 일 때 의 이론적인 값
- (베타 원, 모집단 기울기): 가 1단위 늘어날 때 가 평균적으로 변하는 양
- : 번째 관측값의 설명변수 값
- (엡실론, 오차항): 직선으로 설명되지 않는 나머지 부분(측정 오차, 다른 요인의 영향 등)
, 은 모집단 전체를 다 조사해야 정확히 알 수 있는 값이라 실제로는 표본 자료로 추정한다. 표본에서 추정한 값은 , 또는 , (베타 햇, “베타의 추정값”이라는 뜻)로 쓴다. 추정된 직선은 다음과 같이 쓴다.
- (와이 햇, 의 추정값 또는 예측값): 이 직선이 예측하는 값
- : 추정된 절편(직선이 축과 만나는 점)
- : 추정된 기울기(직선의 방향과 가파른 정도)
최소제곱법의 직관
쉽게 말하면: 최소제곱법은 “실제 점과 직선 사이의 세로 거리를 제곱해서 더한 값”이 가장 작아지는 직선을 찾는 방법이다.
산점도 위에 직선을 하나 그으면, 그 직선과 각 점 사이에는 세로 방향으로 거리가 생긴다. 이 거리를 잔차(residual)라고 부르고, 번째 관측값의 잔차는 실제값에서 예측값을 뺀 값이다.
- : 번째 관측값의 잔차
- : 실제 관측값
- : 그 직선이 예측한 값
직선을 하나로 정하는 기준이 필요한데, 잔차를 그냥 더하면 양수와 음수가 서로 상쇄되어 항상 0에 가까워지는 문제가 생긴다(06편에서 편차를 그냥 더하면 0이 되던 것과 같은 이유다). 그래서 06편에서 분산을 정의할 때처럼 잔차를 제곱해서 더한 값을 기준으로 삼는다. 이 값을 잔차제곱합(sum of squared errors, SSE)이라고 부른다.
최소제곱법(method of least squares)은 이 를 가장 작게 만드는 , 을 찾는 방법이다. 미분을 이용해 이 최솟값 조건을 풀면(계산 과정 자체는 독학사 기초통계학 수준을 넘어서므로 결과 공식만 쓴다), 다음 두 공식이 나온다.
- : 추정된 기울기
- 분자: 21편에서 계산한 , 의 편차곱의 합
- 분모: 21편에서 계산한 편차제곱합
- : 추정된 절편
- , : , 의 표본평균
- : 위에서 구한 기울기
이 두 공식을 눈여겨보면, 의 분자와 분모가 21편에서 상관계수를 구할 때 이미 만든 편차표의 값과 완전히 같다는 것을 알 수 있다. 상관계수와 회귀직선은 같은 편차표에서 나온 두 얼굴인 셈이다.
회귀계수 계산하기: 절편과 기울기
21편에서 만든 편차표를 그대로 가져와 다시 확인한다.
| 학생 | ||||||
|---|---|---|---|---|---|---|
| A | 1 | 38 | -4 | -12 | 48 | 16 |
| B | 2 | 42 | -3 | -8 | 24 | 9 |
| C | 3 | 44 | -2 | -6 | 12 | 4 |
| D | 4 | 48 | -1 | -2 | 2 | 1 |
| E | 5 | 50 | 0 | 0 | 0 | 0 |
| F | 6 | 52 | 1 | 2 | 2 | 1 |
| G | 7 | 56 | 2 | 6 | 12 | 4 |
| H | 8 | 58 | 3 | 8 | 24 | 9 |
| I | 9 | 62 | 4 | 12 | 48 | 16 |
| 합계 | 45 | 450 | 0 | 0 | 172 | 60 |
, 이었다(21편 참고). 이제 기울기부터 구한다.
소수 넷째 자리까지 반올림하면 기울기는 약 2.8667이다. 이제 절편을 구한다.
따라서 추정된 회귀직선은 다음과 같다.
회귀계수의 의미
- 기울기 : 공부 시간이 1시간 늘어날 때마다 시험 점수가 평균적으로 약 2.8667점 오른다는 뜻이다. 기울기의 부호가 양수이므로, 21편에서 확인한 상관계수의 부호(양수)와 방향이 일치한다.
- 절편 : 이론적으로는 “공부 시간이 0시간일 때 예측되는 점수”다. 다만 이 자료에서는 가 1부터 9까지만 관측되었고 은 관측 범위 밖이므로, 절편을 “공부를 전혀 안 해도 35.67점을 받는다”처럼 실제 의미로 해석하는 데는 주의가 필요하다(관측 범위 밖 해석의 위험은 아래 “외삽의 위험”에서 자세히 다룬다). 절편은 어디까지나 직선의 위치를 고정하는 수학적 기준점으로 이해하는 것이 안전하다.
검산: 회귀직선은 반드시 평균점을 지난다
최소제곱법으로 구한 회귀직선은 항상 , 즉 두 변수의 평균으로 이루어진 점을 지난다는 성질이 있다. 이는 라는 절편 공식 자체가 애초에 그렇게 만들어졌기 때문이다. 직접 확인해 보자. 를 회귀직선에 대입한다.
계산 결과 으로 과 정확히 일치한다. 만약 이 값이 와 다르게 나온다면 이나 계산 어딘가에서 오류가 있었다는 뜻이므로, 평균점을 대입해 보는 것은 회귀계수 계산의 표준적인 검산 절차다.
예측값과 잔차: 결정계수 계산 준비
회귀직선이 각 관측값을 얼마나 잘 맞추는지 확인하려면, 모든 를 직선에 대입해 예측값 를 구하고, 실제값과의 차이인 잔차 를 계산해야 한다. 반올림 오차를 줄이기 위해 이번 계산은 , 이라는 분수 형태로 계산한 뒤 소수 여섯째 자리까지 구하고, 최종 표에는 소수 넷째 자리로 반올림해 싣는다.
| 학생 | |||||
|---|---|---|---|---|---|
| A | 1 | 38 | 38.5333 | -0.5333 | 0.2844 |
| B | 2 | 42 | 41.4000 | 0.6000 | 0.3600 |
| C | 3 | 44 | 44.2667 | -0.2667 | 0.0711 |
| D | 4 | 48 | 47.1333 | 0.8667 | 0.7511 |
| E | 5 | 50 | 50.0000 | 0.0000 | 0.0000 |
| F | 6 | 52 | 52.8667 | -0.8667 | 0.7511 |
| G | 7 | 56 | 55.7333 | 0.2667 | 0.0711 |
| H | 8 | 58 | 58.6000 | -0.6000 | 0.3600 |
| I | 9 | 62 | 61.4667 | 0.5333 | 0.2844 |
| 합계 | 45 | 450 | 450.0000 | 0.0000 | 2.9333 |
잔차 열의 합계가 0인 것도 최소제곱법의 성질에서 나오는 검산 포인트다(잔차 제곱을 최소화하도록 직선을 맞추면, 잔차 자체의 합은 항상 0이 된다).
결정계수: 회귀직선이 설명하는 비율
쉽게 말하면: 결정계수는 “전체 흩어짐 중에서 회귀직선이 설명해내는 부분이 몇 퍼센트인가”를 나타내는 값이다.
값들은 원래 평균 를 중심으로 흩어져 있다. 이 전체 흩어짐을 총제곱합(total sum of squares, SST)이라고 부르며, 21편에서 이미 구한 편차제곱합과 같다.
이 전체 흩어짐은 두 부분으로 나뉜다. 회귀직선이 설명하는 부분(회귀제곱합, SSR)과, 회귀직선으로도 설명되지 않고 남는 부분(잔차제곱합, SSE)이다.
앞서 잔차표에서 을 구했으므로, 회귀제곱합은 다음과 같다.
결정계수(coefficient of determination) 은 회귀직선이 설명하는 비율이다.
- : 0과 1 사이의 값을 가지며, 1에 가까울수록 회귀직선이 자료를 잘 설명한다는 뜻이다.
- : 회귀직선으로 설명되는 흩어짐의 양
- : 전체의 흩어짐
소수 넷째 자리까지 반올림하면 이다. 이는 시험 점수가 흩어진 정도의 약 99.41퍼센트를 공부 시간이라는 하나의 설명변수로 설명할 수 있다는 뜻이다. 나머지 약 0.59퍼센트는 공부 시간 외의 다른 요인(컨디션, 문제 난이도 체감, 측정 오차 등)에 의한 것으로 남는다.
검산: 결정계수는 상관계수의 제곱과 같아야 한다
단순선형회귀에서는 결정계수 이 21편에서 구한 피어슨 상관계수 의 제곱과 항상 정확히 같아야 한다는 성질이 있다. 21편에서는 반올림 이전의 정밀한 값으로 을 얻었다(보고용으로는 소수 넷째 자리인 0.9970으로 반올림했다). 이 값을 제곱해 보자.
방금 SSR과 SST로 독립적으로 계산한 과 정확히 일치한다. 두 계산 경로(상관계수의 제곱, 그리고 회귀제곱합 나누기 총제곱합)가 같은 값에 도달했으므로, 21편과 22편의 계산이 서로 어긋나지 않았다는 것을 확인할 수 있다. 여기서 반올림 순서에 주의할 점이 하나 있다 — 만약 21편에서 이미 반올림된 을 그대로 제곱하면 으로 마지막 자리에서 미세한 차이가 생길 수 있다. 이는 계산 오류가 아니라 반올림을 어느 단계에서 했는지의 차이이므로, 중간 계산은 되도록 반올림하지 않은 값을 유지하다가 최종 결과만 지정된 자리수로 반올림하는 것이 안전하다.
회귀선의 예측과 해석
회귀직선을 얻고 나면, 관측된 값 사이나 근처의 값을 대입해 를 예측할 수 있다. 예를 들어 공부 시간이 7.5시간인 학생의 점수를 예측해 보자.
는 관측된 자료의 범위인 1부터 9 사이에 들어 있으므로, 이 예측은 내삽(interpolation, 관측된 범위 안에서의 예측)에 해당하며 비교적 신뢰할 수 있다. 예측값을 말로 풀면 “이 자료의 패턴이 유지된다면, 7.5시간 공부한 학생의 점수는 약 57.17점으로 예상된다”는 뜻이다. 이때 “정확히 57.17점을 받는다”가 아니라 “그 근처일 것으로 예상된다”는 확률적인 진술이라는 점도 함께 밝혀야 한다 — 잔차표에서 봤듯 실제 자료도 직선에서 소폭씩 벗어나 있었기 때문이다.
외삽의 위험
쉽게 말하면: 외삽은 “내가 실제로 본 적 없는 구간까지 직선을 억지로 늘려서 예측하는 것”이라 위험하다.
관측된 의 범위(이 자료에서는 1시간부터 9시간까지) 밖에 있는 값을 회귀직선에 대입해 예측하는 것을 외삽(extrapolation)이라고 한다. 예를 들어 공부 시간이 20시간인 경우를 예측해 보면 다음과 같다.
숫자만 보면 그럴듯해 보이지만, 이 예측은 신뢰하기 어렵다. 이유는 다음과 같다.
- 관측되지 않은 구간에서도 직선 관계가 계속된다는 보장이 없다. 하루 24시간 중 20시간을 공부에 쓰는 학생은 수면 부족이나 피로 누적으로 오히려 점수가 떨어질 수도 있다. 우리가 가진 자료(1–9시간)는 이런 구간의 정보를 전혀 담고 있지 않다.
- 점수는 보통 100점을 넘을 수 없다는 현실적 제약이 있다. 직선은 수학적으로 끝없이 뻗어나가지만, 반응변수가 가질 수 있는 값에는 현실적인 한계(예: 시험 점수의 상한)가 있는 경우가 많다. 직선 모형은 이런 한계를 자동으로 반영하지 못한다.
- 관측 범위에서 멀어질수록 예측의 불확실성이 커진다. 회귀직선은 관측된 자료를 기준으로 맞춘 것이므로, 그 범위에서 멀어질수록 실제 관계가 직선에서 벗어날 가능성이 커진다.
그래서 회귀직선으로 예측할 때는 항상 “이 값이 관측된 자료의 범위 안에 있는가”를 먼저 확인해야 한다. 범위를 크게 벗어난 값을 예측해야 하는 상황이라면, 그 예측은 참고용으로만 쓰고 반드시 “관측 범위를 벗어난 외삽이라 신뢰도가 낮다”는 점을 함께 밝혀야 한다.
자주 틀리는 점
- 상관과 인과를 회귀계수에도 그대로 적용하는 경우: 기울기 이 양수이고 크다고 해서 “공부 시간이 점수를 확실히 끌어올린다”고 단정할 수는 없다. 21편에서 다룬 상관-인과 혼동은 회귀분석에도 그대로 적용된다 — 회귀분석 역시 관측 자료에 나타난 연관성을 직선으로 요약할 뿐, 인과관계를 증명하는 것은 아니다.
- 관측 범위 밖 예측(외삽)을 관측 범위 안 예측(내삽)과 똑같이 신뢰하는 경우: 위에서 다룬 대로, 처럼 자료 범위를 벗어난 값을 대입한 예측은 자료 범위 안의 예측보다 훨씬 불확실하다.
- 절편 을 항상 실제 의미로 해석하려는 경우: 이 자료의 관측 범위 밖이거나 애초에 현실적으로 의미가 없는 경우(예: 공부 시간이 정확히 0), 절편은 직선의 위치를 잡아주는 수학적 기준점일 뿐 실제 현상의 의미로 곧바로 해석하면 안 된다.
- 결정계수가 높으면 그 모형이 항상 옳다고 믿는 경우: 이 높다는 것은 “직선으로 잘 설명된다”는 뜻이지, 그 변수 선택이나 인과 구조가 옳다는 것을 보장하지 않는다. 앞서 21편에서 다룬 앤스컴의 사인방처럼, 전혀 다른 형태의 자료가 비슷한 과 회귀직선을 만들어낼 수도 있다.
- 기울기의 단위를 빼먹고 숫자만 말하는 경우: 은 “공부 시간 1시간당 점수 약 2.8667점 증가”처럼 반드시 두 변수의 단위를 함께 말해야 의미가 분명해진다.
핵심 정리
- 단순선형회귀는 형태의 직선으로 설명변수와 반응변수의 관계를 요약하고 예측에 활용하는 방법이다.
- 최소제곱법은 잔차제곱합 를 최소로 만드는 절편과 기울기를 구하는 방법이며, , 공식으로 계산한다.
- 회귀직선은 항상 평균점 을 지나며, 이는 계산 검산에 활용할 수 있다.
- 결정계수 는 회귀직선이 설명하는 비율을 나타내며, 단순선형회귀에서는 상관계수의 제곱 과 정확히 일치한다.
- 관측된 자료 범위 안의 예측(내삽)은 비교적 신뢰할 수 있지만, 범위 밖의 예측(외삽)은 근거가 약해 신중해야 한다.