이번 문서의 목표: 정규분포의 모양과 모수를 이해하고, z 변환으로 표준정규분포표를 조회해 확률을 구하며, 이항분포를 정규분포로 근사하는 절차를 설명할 수 있게 된다.
왜 정규분포가 중요한가
09편에서 연속형 확률변수는 확률밀도함수(probability density function) 곡선 아래의 넓이로 확률을 표현한다고 배웠다. 키, 몸무게, 시험 점수, 측정 오차처럼 자연·사회 현상에서 관찰되는 값들은 놀라울 만큼 자주 종 모양(bell shape)의 좌우 대칭 분포를 따르는데, 이 모양을 수학적으로 표현한 것이 정규분포(normal distribution)다. 정규분포는 06편에서 배운 표준화(standardization)와 직접 연결되고, 12편의 중심극한정리(central limit theorem)를 이해하는 데도 반드시 필요한 기초가 된다.
정규분포의 개념과 모수
쉽게 말하면: 정규분포는 평균을 중심으로 좌우가 완전히 대칭인 종 모양 곡선이며, 평균과 표준편차 두 숫자만 알면 곡선의 모양이 완전히 정해진다.
정규분포를 따르는 확률변수 는 로 쓴다.
- : 정규분포(Normal distribution)를 뜻하는 기호
- (뮤): 정규분포의 평균이자 곡선의 중심(가장 높은 봉우리의 위치)
- (시그마 제곱): 정규분포의 분산. 값이 클수록 곡선이 옆으로 넓게 퍼진다
정규분포의 확률밀도함수는 다음과 같다.
- (파이, 약 3.14159): 원주율
- (자연상수, 약 2.71828)
- , : 위에서 설명한 평균과 표준편차
이 식 자체를 손으로 계산할 일은 독학사 시험 범위에서는 거의 없다. 중요한 것은 모양의 성질이다.
- 곡선은 를 중심으로 완전히 좌우 대칭이다.
- 곡선 아래 전체 넓이는 항상 1이다(확률밀도함수의 기본 조건, 09편 참고).
- 가 달라지면 곡선이 좌우로 평행이동하고, 가 커지면 곡선이 옆으로 넓게 퍼지면서 낮아진다(전체 넓이는 항상 1을 유지해야 하므로).
표준정규분포와 z 변환
쉽게 말하면: 세상의 모든 정규분포를 일일이 표로 만들 수는 없으니, 평균 0·표준편차 1인 “표준 버전” 하나로 통일해서 계산한다.
정규분포는 와 의 조합에 따라 무한히 많은 모양이 나올 수 있다. 매번 다른 모양의 표를 만들 수 없으므로, 평균이 0이고 표준편차가 1인 특별한 정규분포 하나를 기준으로 삼는데, 이를 표준정규분포(standard normal distribution)라 하고 로 쓴다.
임의의 정규분포 를 표준정규분포로 바꾸는 계산을 z 변환(z-transformation) 또는 표준화라 하며, 공식은 다음과 같다.
- : 원래 관찰값
- : 가 속한 정규분포의 평균
- : 가 속한 정규분포의 표준편차
- : 표준화된 값으로, “평균에서 표준편차 몇 개만큼 떨어져 있는가”를 나타낸다
이 공식은 06편에서 배운 z점수(z-score) 공식과 정확히 같다. 그때는 자료의 상대적 위치를 비교하는 도구였다면, 여기서는 정규분포표를 조회하기 위한 변환 도구로 쓰인다는 점이 다르다.
표준정규분포표 사용법
표준정규분포표(z-table)는 값에 대해 , 즉 표준정규분포 곡선에서 보다 왼쪽에 있는 넓이(누적확률)를 미리 계산해 정리한 표다. 아래는 실제 표의 일부를 발췌한 예시다(행은 의 소수점 첫째 자리까지, 열은 둘째 자리를 나타낸다).
| 0.00 | 0.01 | 0.02 | 0.03 | |
|---|---|---|---|---|
| 0.0 | 0.5000 | 0.5040 | 0.5080 | 0.5120 |
| 0.5 | 0.6915 | 0.6950 | 0.6985 | 0.7019 |
| 1.0 | 0.8413 | 0.8438 | 0.8461 | 0.8485 |
| 1.5 | 0.9332 | 0.9345 | 0.9357 | 0.9370 |
| 2.0 | 0.9772 | 0.9778 | 0.9783 | 0.9788 |
표를 읽는 절차는 다음과 같다.
- 구하려는 값을 z 변환 공식으로 값으로 바꾼다.
- 값의 소수점 첫째 자리까지(예: 1.5)로 표의 행을 찾는다.
- 값의 소수점 둘째 자리(예: 0.03)로 표의 열을 찾는다.
- 행과 열이 만나는 칸의 값이 , 즉 보다 왼쪽 넓이(누적확률)다.
계산 예시: z 변환부터 표 조회까지
어느 시험 점수가 (평균 70점, 분산 100이므로 표준편차 )을 따른다고 하자. 85점 이하를 받을 확률 를 구해보자.
먼저 z 변환을 한다.
표에서 행 1.5, 열 0.00을 찾으면 다. z 변환은 원래 분포의 넓이 비율을 그대로 유지하므로,
85점 이하를 받을 확률은 약 93.32퍼센트다.
이번에는 특정 구간의 확률을 구해보자. 같은 분포에서 60점 이상 85점 이하를 받을 확률 를 구한다. 먼저 두 값을 각각 z 변환한다.
표준정규분포는 0을 중심으로 좌우 대칭이므로 이 성립한다. 표에서 이므로,
앞서 구한 와 함께, 구간 확률은 두 누적확률의 차이다.
60점 이상 85점 이하를 받을 확률은 약 77.45퍼센트다.
자주 틀리는 점
- 표준정규분포표의 값은 , 즉 왼쪽 누적확률이라는 것을 잊고 그대로 로 착각하는 경우가 많다. 오른쪽 확률이 필요하면 로 반드시 뒤집어야 한다.
- 값이 음수일 때 표에 음수 행이 없다고 당황하는 경우가 있다. 대칭성을 이용해 로 바꿔 계산하면 된다.
- 구간 확률을 구할 때 큰 z값의 누적확률에서 작은 z값의 누적확률을 빼야 하는데, 순서를 반대로 빼서 음수 확률이 나오는 실수가 흔하다. 확률은 절대 음수가 될 수 없으므로 결과가 음수면 순서를 다시 확인해야 한다.
정규근사: 이항분포를 정규분포로 근사하기
쉽게 말하면: 이항분포도 시행 횟수가 충분히 많아지면 종 모양에 가까워지므로, 계산이 훨씬 쉬운 정규분포로 바꿔서 근사할 수 있다.
10편에서 이항분포를 포아송분포로 근사하는 조건(이 크고 가 작음)을 배웠다. 이번에는 반대로 가 0.5에 가까워 극단적으로 작거나 크지 않은 경우, 이 충분히 크면 이항분포를 정규분포로 근사할 수 있다. 일반적으로 다음 조건을 근사 가능 기준으로 삼는다.
- : 평균적으로 기대되는 성공 횟수
- : 평균적으로 기대되는 실패 횟수
- 두 값이 모두 충분히 크면(각각 5 이상), 성공과 실패 양쪽 모두 표본이 한쪽으로 쏠리지 않을 만큼 확보된다는 뜻이다
이 조건을 만족하면, 를 다음 정규분포로 근사한다.
이항분포의 기댓값 와 분산 (10편 참고)를 그대로 정규분포의 모수로 사용한다는 뜻이다.
계산 예시: 정규근사 적용하기
어느 여론조사에서 특정 후보 지지율이 이고, 명을 조사한다고 하자. 지지자가 정확히 50명을 넘을 확률, 즉 를 정규근사로 구해보자.
먼저 근사 조건을 확인한다. 이고, 이므로 정규근사를 적용할 수 있다.
근사할 정규분포의 평균과 분산을 구한다.
표준편차는 이다. 이제 을 z 변환한다.
표에서 행, 에 가장 가까운 열을 조회하면(위 표에는 0.04 열이 없으므로 실제 표에서는 수준의 값을 찾게 된다) 근사적으로 을 얻는다. 따라서,
지지자가 50명을 넘을 확률은 약 2.07퍼센트로 근사된다.
어떤 분포를 쓸지 판단하는 흐름
자주 틀리는 점
- 정규근사 조건 와 를 하나만 확인하고 넘어가는 실수가 있다. 둘 다 만족해야 근사가 안정적이다.
- 정규근사에서 분산은 이지 표준편차가 아니다. z 변환에는 표준편차 를 써야 하므로 제곱근 취하는 것을 빠뜨리지 않아야 한다.
- 정규분포표는 , 인 표준정규분포 전용이다. 원래 분포의 , 를 표에 바로 대입하는 것이 아니라, 반드시 z 변환을 거친 뒤 조회해야 한다.
핵심 정리
- 정규분포 는 평균 를 중심으로 좌우 대칭인 종 모양이며, 와 두 모수로 모양이 완전히 결정된다.
- z 변환 으로 임의의 정규분포를 표준정규분포 로 바꾸면, 표준정규분포표에서 를 바로 조회할 수 있다.
- 구간 확률은 두 z값의 누적확률 차이로, 오른쪽 확률은 에서 왼쪽 누적확률을 빼서 구한다.
- 이항분포는 이고 일 때 로 정규근사할 수 있다.
마무리 복습
참고 자료
- Introduction to Applied Statistics: Lecture Notes — 정규분포·표준정규분포표 사용법 구조 참고
- NIST/SEMATECH e-Handbook of Statistical Methods — 정규분포 및 정규근사 관련 공식 참고