이번 문서의 목표: 로지스틱 회귀가 왜 필요한지, 오즈·로짓·시그모이드가 서로 어떻게 연결되는지, 그리고 배깅·부스팅·랜덤포레스트의 차이를 설명하고 회귀계수를 오즈비로 해석할 수 있다.
로지스틱 회귀는 왜 필요한가
왜 필요한가
18편에서 다룬 회귀분석은 종속변수(예: 시험 점수, 매출액)가 연속적인 숫자일 때 쓰는 기법이다. 그런데 실무에서는 “이 고객이 이탈할 것인가, 안 할 것인가”, “이 이메일이 스팸인가, 아닌가”처럼 결과가 두 가지 범주 중 하나로만 나오는 문제가 훨씬 많다. 이런 종속변수를 이진 종속변수(binary dependent variable, 0 아니면 1의 값만 갖는 변수)라 부른다.
이때 그냥 일반 선형회귀를 써서 를 0 또는 1로 예측하면 어떻게 될까? 선형회귀의 예측값은 직선을 따라가므로 입력값이 아주 크거나 작으면 예측값이 1보다 커지거나 0보다 작아질 수 있다. “이탈 확률이 1.3”이라거나 “이탈 확률이 마이너스 0.2”라는 결과는 확률의 정의(0 이상 1 이하)에 어긋나므로 말이 안 된다. 그래서 예측값을 반드시 0과 1 사이로 눌러주는 새로운 함수가 필요했고, 이 필요에서 나온 것이 로지스틱 회귀(logistic regression)다.
쉽게 말하면: 로지스틱 회귀는 “예/아니오”를 맞히는 문제에서, 선형회귀의 직선 예측값을 0과 1 사이의 확률로 눌러 바꿔주는 회귀 기법이다.
정의
로지스틱 회귀(logistic regression)는 독립변수들의 선형결합을 이용해 특정 범주(보통 “1”로 코딩한 사건, 예: 이탈함·불량임·양성임)에 속할 확률을 예측하는 지도학습(supervised learning, 정답 레이블이 있는 상태로 학습하는 방식) 분류 기법이다. 이름에 “회귀”가 들어가지만 실제로는 분류(classification, 범주를 구분하는 문제)에 쓰인다는 점이 첫 번째 함정이다. 회귀라는 이름이 붙은 이유는 선형회귀처럼 계수를 추정하는 방식(최대우도추정)으로 모형을 적합하기 때문이다.
오즈와 로짓, 그리고 시그모이드
왜 필요한가
선형회귀의 예측값 범위(마이너스 무한대부터 플러스 무한대까지)와 확률의 범위(0부터 1까지)는 서로 다르다. 이 둘을 이어주려면 중간 다리가 필요한데, 그 다리 역할을 하는 개념이 오즈(odds)와 로짓(logit)이다.
쉽게 말하면: 오즈는 “일어날 확률이 안 일어날 확률의 몇 배인가”이고, 로짓은 그 오즈에 로그를 씌워 마이너스 무한대부터 플러스 무한대까지 자유롭게 움직이게 만든 값이다.
정의: 오즈
어떤 사건이 일어날 확률을 라 하면, 오즈(odds, 승산)는 그 사건이 일어날 확률과 일어나지 않을 확률의 비(比)다.
- : 사건이 일어날 확률(예: 어떤 환자가 완치될 확률)
- : 사건이 일어나지 않을 확률
- : 오즈. 값의 범위는 0부터 플러스 무한대까지다.
예를 들어 완치 확률이 이라면, 오즈는 다. “완치될 가능성이 완치되지 않을 가능성의 4배”라는 뜻이며, 흔히 “4대 1”이라고 부르는 표현과 같다. 확률 가 0.5보다 크면 오즈는 1보다 크고, 가 0.5보다 작으면 오즈는 1보다 작다.
정의: 로짓
오즈는 0부터 무한대까지만 움직이므로 여전히 마이너스 값은 가질 수 없다. 여기에 자연로그를 씌우면 범위가 마이너스 무한대부터 플러스 무한대까지로 넓어지는데, 이렇게 만든 값이 로짓(logit)이다.
- : 자연로그(natural logarithm, 밑이 자연상수 인 로그)
- : 확률 를 로그오즈(log-odds)로 변환한 값. 이제 마이너스 무한대부터 플러스 무한대까지 자유롭게 움직인다.
로지스틱 회귀는 바로 이 로짓값을 독립변수들의 선형결합으로 모형화한다.
- (베타 제로): 절편(intercept)
- : 각 독립변수 에 대응하는 회귀계수
- 좌변의 로짓이 우변의 선형식과 같아지도록 데이터를 최대우도추정(maximum likelihood estimation, 관측된 데이터가 나올 가능성이 가장 높아지도록 모수를 추정하는 방법)으로 적합한다.
이렇게 확률을 선형식으로 바로 연결하지 않고, 로짓이라는 중간 함수를 거쳐 연결하는 함수를 연결함수(link function)라 부른다. 로지스틱 회귀의 연결함수는 로짓함수다. 46편 이후 기출 확인 결과, “로지스틱 회귀의 연결함수는 시그모이드 함수다”라고 서술해 오답을 유도하는 문항이 반복 출제된다. 시그모이드는 로짓의 역함수이지 연결함수 자체가 아니다.
정의: 시그모이드 함수
로짓 식을 세운 다음에는 이를 다시 확률 로 되돌려야 실제 예측에 쓸 수 있다. 로짓 식을 에 대해 풀면 다음과 같은 시그모이드 함수(sigmoid function, 로지스틱 함수)가 나온다.
- : 자연상수(약 2.718)
- 우변의 지수 부분이 아주 커지면 이 0에 가까워져 는 1에 가까워지고, 아주 작아지면(마이너스로 커지면) 는 0에 가까워진다.
시그모이드 함수를 그래프로 그리면 완만한 S자 곡선이 된다. 입력값이 얼마나 극단적이든 출력은 항상 0과 1 사이에 갇히므로, 앞서 지적한 “선형회귀로 확률을 예측하면 0~1 범위를 벗어난다”는 문제가 해결된다.
회귀계수의 해석: 오즈비
왜 필요한가
선형회귀에서는 회귀계수 이 “이 1 증가할 때 가 만큼 증가한다”는 뜻이었다. 로지스틱 회귀에서는 좌변이 확률이 아니라 로짓(로그오즈)이므로 계수의 의미도 달라진다. 이 차이를 모르면 “계수가 0.5니까 확률이 0.5만큼 오른다”는 식으로 잘못 해석하기 쉽다. 이는 기출에서 반복적으로 지적되는 대표 함정이다.
쉽게 말하면: 로지스틱 회귀계수는 확률의 증가량이 아니라, “오즈가 몇 배가 되는가”를 로그 스케일로 나타낸 값이다.
정의와 계산
로짓 식에서 이 1 증가할 때 로짓은 만큼 증가한다. 이 로짓의 증가량을 다시 오즈의 배율로 바꾸려면 지수함수를 씌운다.
- (odds ratio): 이 1 증가할 때 오즈가 몇 배가 되는지를 나타내는 값
- : 계수 에 자연상수를 밑으로 하는 지수를 취한 값
예를 들어 “신용카드 연체 여부”를 종속변수로, “잔고(Balance)“를 독립변수로 로지스틱 회귀를 적합했더니 이 나왔다고 하자. 오즈비는 다음과 같다.
이 결과는 “잔고가 1(단위) 늘어날 때마다 연체의 오즈가 약 1.0056배가 된다”는 뜻이다. 여기서 흔히 저지르는 착각이 “연체 확률이 0.56퍼센트포인트 늘어난다”는 해석이다. 확률과 오즈는 다른 값이고, 계수가 일정해도 확률의 실제 증가폭은 원래 확률 수준(기준점이 0.1이냐 0.5냐)에 따라 달라지므로 “확률이 일정하게 얼마 늘어난다”는 식으로 단정할 수 없다. 계수는 오즈의 곱셈 배율로만 해석해야 정확하다.
만약 오즈비가 1보다 작다면(예: ), 그 독립변수가 1 증가할 때 오즈가 0.489배로 줄어든다는 뜻이며, 이는 사건이 일어날 가능성을 낮추는 방향(음의 영향)이라고 해석한다.
자주 틀리는 점
- 로지스틱 회귀의 연결함수는 로짓함수이며, 시그모이드는 그 역함수다. 두 함수의 방향을 뒤바꿔 설명하는 보기가 자주 나온다.
- 회귀계수 자체를 “확률의 증가량”으로 해석하면 틀린다. 반드시 지수를 취해 오즈비로 해석해야 한다.
- 오즈비가 1이면 그 변수는 사건 발생에 영향이 없다는 뜻이고, 1보다 크면 발생 가능성을 높이는 방향, 1보다 작으면 낮추는 방향이다. 오즈비가 0보다 작을 수 있다고 착각하면 안 된다(지수함수의 결과는 항상 0보다 크다).
앙상블 기법: 여러 모델의 힘을 합친다
왜 필요한가
의사결정나무(21편) 하나만 사용하면 데이터가 조금만 바뀌어도 나무 모양이 크게 달라지는 등 예측이 불안정할 수 있다. 이런 불안정성을 줄이고 예측 성능을 높이기 위해, 여러 개의 모델(주로 여러 개의 나무)을 만들어 그 예측을 결합하는 방법이 고안되었는데 이를 앙상블(ensemble, 합주단이라는 뜻으로 여러 연주자가 함께 소리를 내듯 여러 모델이 힘을 합친다는 비유)이라 한다.
쉽게 말하면: 한 명의 전문가에게 묻는 대신, 여러 전문가에게 물어 의견을 종합하면 더 안정적인 결론을 얻을 수 있다는 아이디어다.
정의
앙상블 학습(ensemble learning)은 여러 개의 개별 모델(기저 학습기, base learner)을 만들고, 그 예측 결과를 투표나 평균으로 종합해 하나의 최종 예측을 내는 기법이다. 대표적으로 배깅(bagging)과 부스팅(boosting)이라는 두 가지 큰 흐름이 있으며, 랜덤포레스트(random forest)는 배깅 계열에 속하는 대표 알고리즘이다. 다만 앙상블이 항상 단일 모형보다 성능이 좋은 것은 아니다. 데이터 특성이나 기저 모형의 선택에 따라 예외가 있을 수 있다는 점도 기출에서 오답 함정으로 자주 등장한다.
배깅과 부스팅의 차이
배깅과 부스팅은 둘 다 여러 모델을 만들어 합친다는 점은 같지만, 모델을 만드는 순서와 방식이 근본적으로 다르다.
| 구분 | 배깅(Bagging) | 부스팅(Boosting) |
|---|---|---|
| 학습 방식 | 병렬(parallel) — 여러 모델을 동시에 독립적으로 학습 | 순차(sequential) — 이전 모델의 결과를 반영해 다음 모델을 학습 |
| 표본 추출 | 부트스트랩(bootstrap, 복원추출로 원본과 같은 크기의 표본을 여러 번 뽑는 방법)으로 매번 다른 표본 생성 | 전체 데이터를 그대로 쓰되, 잘못 예측된 데이터에 가중치를 높여 다음 모델이 더 집중하게 함 |
| 표본(관측치) 가중치 | 모든 표본을 동등하게 취급(가중치 없음) | 오분류된 표본의 가중치를 매 단계 갱신 |
| 최종 결합 방식 | 다수결 투표(분류) 또는 평균(회귀) | 각 모델의 성능에 따라 가중 합산 |
| 주된 목적 | 분산(variance) 감소 — 모델이 데이터에 따라 크게 흔들리는 정도를 줄임 | 편향(bias) 감소 — 모델이 정답을 계속 못 맞히는 경향 자체를 줄임 |
| 대표 알고리즘 | 랜덤포레스트 | AdaBoost, 그래디언트 부스팅(Gradient Boosting) |
| 과적합 위험 | 상대적으로 낮음 | 반복 횟수가 지나치면 과적합 위험이 배깅보다 큼 |
배깅을 생활 비유로 설명하면, 같은 시험 문제지를 여러 명의 학생에게 각각 다르게 편집한(일부 문제를 중복 포함하거나 뺀) 버전으로 나눠 풀게 한 다음 다수결로 답을 정하는 것과 비슷하다. 각 학생은 서로 독립적으로 풀기 때문에 동시에(병렬로) 진행할 수 있다.
부스팅은 반대로, 첫 번째 학생이 틀린 문제를 표시해두고, 두 번째 학생에게는 “이 문제들을 특히 신경 써서 풀라”고 알려준 뒤 풀게 하는 것과 같다. 각 단계가 이전 단계의 결과에 의존하므로 반드시 순서대로(순차로) 진행해야 한다.
검산: 배깅이 병렬인 이유
배깅에서 개의 부트스트랩 표본을 만들 때, 각 표본은 원본 데이터와 독립적으로 복원추출되므로 표본 사이에 순서 의존성이 없다. 즉 두 번째 표본을 만들 때 첫 번째 표본이나 그 모델의 학습 결과를 알 필요가 전혀 없다. 이 성질 때문에 배깅의 여러 모델은 동시에(병렬로) 학습할 수 있다. 반대로 부스팅은 번째 모델의 가중치 갱신이 번째 모델의 오차에 의존하므로, 정의상 순서를 건너뛸 수 없다. 이 논리로 위 표의 “학습 방식” 행이 서로 반대인 이유를 검산할 수 있다.
랜덤포레스트
랜덤포레스트(random forest)는 배깅에 한 가지 장치를 더한 알고리즘이다. 일반적인 배깅은 부트스트랩 표본마다 나무를 만들 때 모든 독립변수를 다 고려하지만, 랜덤포레스트는 각 분할 지점(노드)에서 전체 변수 중 무작위로 뽑은 일부 변수만 후보로 고려해 분할 기준을 정한다. 이렇게 하면 개별 나무들이 서로 비슷한 변수에 의존해 비슷비슷한 모양이 되는 것을 막아, 나무들 사이의 상관을 낮추는 효과가 생긴다. 여러 예측을 합칠 때는 서로 다른 관점을 가진 예측일수록 평균의 효과가 커지므로, 이 상관 감소가 랜덤포레스트의 성능 향상 원리다.
기출 확인 결과, “부스팅은 병렬 학습 후 보팅으로 결과를 합친다”거나 “배깅은 재표본 추출을 사용하지 않는다”처럼 배깅과 부스팅의 정의를 통째로 뒤바꾼 오답 보기가 반복 출제된다. 표의 각 행을 짝지어 정확히 구분해서 기억해야 한다.
핵심 정리
- 로지스틱 회귀는 종속변수가 이진(0 또는 1)일 때 쓰는 분류 기법이며, 로짓(로그오즈)을 독립변수의 선형결합으로 모형화한다.
- 오즈는 , 로짓은 오즈에 자연로그를 취한 값이다. 로짓을 다시 확률로 되돌리는 함수가 시그모이드다.
- 로지스틱 회귀계수는 지수를 취해 오즈비로 해석해야 하며, 확률의 직접적인 증가량으로 해석하면 안 된다.
- 배깅은 병렬·가중치 없음·분산 감소, 부스팅은 순차·가중치 갱신·편향 감소가 핵심 대조축이다.
- 랜덤포레스트는 배깅에 변수 무작위 선택을 더해 나무 간 상관을 낮춘 앙상블 기법이다.