이번 문서의 목표: 로지스틱 회귀가 왜 회귀인데 분류에 쓰이는지, 시그모이드 함수·오즈·로그 오즈가 어떻게 서로 연결되는지 실제 숫자로 계산해 보이고, 이진분류의 결정경계와 다중분류의 소프트맥스 계산까지 직접 검산할 수 있게 한다.
왜 회귀로 분류를 하는가 — 선형회귀의 한계
08편에서 배운 선형회귀는 예측값 가 부터 까지 어떤 값이든 나올 수 있습니다. 그런데 “합격/불합격”, “스팸/정상” 같은 분류(Classification) 문제는 예측값이 확률, 즉 과 사이의 값이어야 의미가 있습니다. 선형회귀의 출력 를 그대로 확률로 쓰면 나 처럼 확률 범위를 벗어난 값이 나올 수 있어 그대로 쓸 수 없습니다.
쉽게 말하면: 로지스틱 회귀(Logistic Regression)는 “선형회귀의 출력을 0과 1 사이로 눌러 담아 확률처럼 쓰는 방법”입니다. 이름에 회귀가 들어가지만 실제 용도는 분류입니다.
1. 시그모이드 함수 — 실수를 확률로 바꾸기
로지스틱 회귀는 선형회귀와 마찬가지로 먼저 를 계산합니다. 이 를 시그모이드 함수(Sigmoid Function, S자 모양의 곡선이라는 뜻)에 통과시켜 확률로 바꿉니다.
- (시그마): 시그모이드 함수의 출력값, 항상 과 사이
- : 자연로그의 밑(약 )
- : 선형결합 의 값
실제 숫자로 계산해 보겠습니다. 공부 시간(x, 시간 단위)으로 합격 여부를 예측하는 모델이 학습을 마쳐 , 가 나왔다고 합시다. 공부 시간이 시간인 학생의 합격 확률을 구합니다.
이 학생의 합격 확률은 약 92.4퍼센트입니다. 시그모이드 함수는 가 커질수록 에 가까워지고, 가 작아질수록(음수로 커질수록) 에 가까워지며, 일 때 정확히 가 되는 S자 곡선입니다.
2. 오즈와 로그 오즈 — 계수를 해석하는 방법
로지스틱 회귀의 계수 가 왜 저 자리에 곱해지는지 이해하려면 오즈(Odds, 승산)라는 개념이 필요합니다. 오즈는 “일어날 확률이 일어나지 않을 확률의 몇 배인가”를 나타냅니다.
- : 사건이 일어날 확률(여기서는 합격 확률)
- : 사건이 일어나지 않을 확률(불합격 확률)
앞서 구한 를 대입합니다.
합격할 가능성이 불합격할 가능성의 약 배라는 뜻입니다. 이 오즈에 자연로그를 씌운 것이 로그 오즈(Log-Odds, 로짓·Logit이라고도 부름)이며, 놀랍게도 이것이 처음 계산했던 값과 정확히 같습니다.
즉 로지스틱 회귀는 “로그 오즈를 에 대한 직선으로 모델링한 것”입니다. 이 관계 덕분에 계수 를 다음과 같이 해석할 수 있습니다.
결과 해석: 공부 시간이 시간 늘어날 때마다 합격의 오즈가 약 배로 곱해집니다(더해지는 것이 아니라 곱해지는 관계라는 점이 중요합니다). 이것이 로지스틱 회귀 계수를 “오즈비(Odds Ratio)로 해석한다”고 말하는 이유입니다.
3. 결정경계 — 확률을 클래스로 바꾸는 기준선
모델이 확률을 출력해도 최종적으로는 “합격” 또는 “불합격” 하나로 결론을 내려야 합니다. 보통 확률 를 기준으로 그 이상이면 양성 클래스(1), 미만이면 음성 클래스(0)로 분류합니다. 가 되는 지점은 정확히 인 지점이므로, 결정경계(Decision Boundary)는 을 만족하는 입니다.
결과 해석: 이 모델은 공부 시간이 약 시간을 넘으면 합격 쪽으로, 그보다 적으면 불합격 쪽으로 예측합니다. 로지스틱 회귀의 결정경계는 가 1개 특징일 때는 하나의 점이지만, 특징이 2개면 하나의 직선, 특징이 3개면 하나의 평면이 되며, 항상 선형(직선·평면) 형태라는 점이 핵심 성질입니다.
4. 이진분류를 넘어 — 다중분류와 소프트맥스
클래스가 3개 이상이면 시그모이드 하나로는 부족합니다. 이때는 각 클래스마다 점수 를 계산한 뒤 소프트맥스 함수(Softmax Function)로 전체 클래스에 대한 확률 분포를 만듭니다.
- : 번째 클래스에 대한 선형결합 점수
- : 전체 클래스 개수
- 분모 : 모든 클래스의 지수값을 더한 정규화 상수(확률의 합이 이 되도록 맞춰줌)
세 클래스(사과·바나나·포도)에 대한 점수가 로 나왔다고 합시다.
검산: 으로 확률의 합이 정확히 이 됩니다. 가장 높은 확률을 가진 사과가 최종 예측 클래스가 됩니다. 이렇게 여러 클래스에 소프트맥스를 적용하는 확장을 다항 로지스틱 회귀(Multinomial Logistic Regression)라고 부르며, 그 외에도 이진분류기를 클래스 수만큼 여러 개 만들어 조합하는 일대다(One-vs-Rest, OvR) 방식도 있습니다.
5. 로지스틱 회귀의 가정과 장단점
| 항목 | 내용 |
|---|---|
| 핵심 가정 | 로그 오즈가 특징들의 선형결합이다(결정경계가 선형이다) |
| 장점 | 계수를 오즈비로 해석할 수 있어 설명력이 높다, 학습·예측이 빠르다, 확률값 자체를 출력한다 |
| 단점 | 클래스가 선형으로 분리되지 않는 데이터(비선형 경계)에는 성능이 떨어진다, 특징 간 다중공선성에 민감하다 |
| 대응 | 비선형 경계가 필요하면 다항 특징을 추가하거나 트리·SVM 계열(11–12편)을 검토한다 |
자주 틀리는 점: “로지스틱 회귀는 회귀 문제에 쓰인다”는 설명은 틀렸습니다. 이름은 회귀이지만 실제로는 분류 알고리즘입니다. 또한 “로지스틱 회귀 계수가 커지면 예측 확률이 그 값만큼 더해진다”는 설명도 틀렸습니다 — 계수는 확률에 더해지는 것이 아니라 오즈에 곱해지는 방식으로 작용합니다.
핵심 정리
- 로지스틱 회귀는 선형결합 를 시그모이드 함수 에 통과시켜 확률을 출력하는 분류 알고리즘이다.
- 로그 오즈 가 곧 이므로, 계수 는 만큼 오즈에 곱해지는 오즈비로 해석한다.
- 결정경계는 이 되는 지점이며 항상 선형(직선·평면)이다.
- 클래스가 3개 이상이면 소프트맥스로 확장하며, 각 클래스 확률의 합은 항상 이다.