이번 문서의 목표: 이 문서를 다 읽으면 모비율의 신뢰구간을 정규근사로, 모분산의 신뢰구간을 카이제곱분포로 계산하고, 신뢰수준이 구간의 길이에 어떤 영향을 주는지 설명할 수 있습니다.
모비율의 신뢰구간 — “찬성 비율”을 추정한다
쉽게 말하면: 표본에서 관찰한 찬성 비율을 중심으로, 얼마나 오차를 허용할지 폭을 정해주는 것이 모비율 신뢰구간입니다.
15편에서는 평균처럼 연속적인 값을 추정했습니다. 이번에는 “찬성/반대”, “불량/양품”처럼 두 가지 중 하나로 나뉘는 자료에서 모비율(population proportion) 의 신뢰구간을 구합니다. 예를 들어 여론조사에서 특정 정책에 대한 전체 국민의 찬성 비율 는 모르지만, 표본을 뽑아 계산한 표본비율 (피햇, p hat, 표본에서 계산한 비율)로 를 추정할 수 있습니다.
- : 표본에서 “성공”(관심 있는 특성)에 해당하는 개체 수
- : 표본크기
표본비율 은 표본크기 이 충분히 크면 근사적으로 정규분포를 따른다는 사실이 알려져 있습니다(10편에서 다룬 이항분포의 정규근사와 같은 원리입니다). 이 근사가 잘 성립하려면 이고 라는 조건을 관행적으로 확인합니다. 이 조건이 깨지면(표본크기가 작거나 비율이 극단적으로 0 또는 1에 가까우면) 정규근사가 부정확해집니다.
공식
- : 표본비율
- : 신뢰수준에 대응하는 z 임계값(15편의 표 참고: 90%는 1.645, 95%는 1.96, 99%는 2.576)
- : 표본비율의 표준오차. 는 이항분포에서 유도되는 분산의 표본 추정값이고, 이를 으로 나눈 뒤 제곱근을 씌운 것입니다.
예시: 정책 찬성 여론조사
한 정책에 대한 찬반 여론조사에서 명을 조사했더니 명이 찬성했습니다. 모비율 의 95% 신뢰구간을 구합니다.
1단계 — 표본비율 계산
2단계 — 정규근사 조건 확인
두 값 모두 5보다 훨씬 크므로 정규근사를 써도 됩니다.
3단계 — 표준오차 계산
4단계 — 오차한계 계산 (95%이므로 )
5단계 — 신뢰구간 계산
검산: 중심 (표본비율과 일치), 반폭 (오차한계와 일치).
해석: 이 정책에 대한 전체 모집단의 찬성 비율은 95% 신뢰수준에서 약 29.35퍼센트(29.35%)에서 38.65퍼센트(38.65%) 사이로 추정됩니다. 표본에서는 34퍼센트(34%)가 찬성했지만, 표본 하나의 결과만으로 “정확히 34%가 찬성한다”고 단정할 수는 없다는 뜻입니다.
모분산의 신뢰구간 — 카이제곱분포를 이용한다
쉽게 말하면: 분산의 신뢰구간은 평균의 신뢰구간과 달리 좌우가 똑같이 벌어지지 않고 한쪽으로 치우친 모양이 됩니다.
품질관리에서는 “평균이 목표치에 맞는가”뿐 아니라 “제품 간 편차(산포)가 기준 이내인가”도 중요합니다. 이 산포를 나타내는 모분산 (시그마 제곱)의 신뢰구간을 구할 때는 13편에서 다룬 카이제곱분포(chi-square distribution, 기호 )를 사용합니다.
정규분포를 따르는 모집단에서 뽑은 표본에 대해, 다음 통계량이 자유도 인 카이제곱분포를 따른다는 사실이 알려져 있습니다(자세한 유도는 13편 참고).
- : 표본분산(분모가 인 공식으로 계산, 06편 참고)
- : 모분산(미지수)
- : 자유도 인 카이제곱분포
이 식을 에 대해 정리하면 모분산의 신뢰구간 공식이 나옵니다.
- : 자유도 인 카이제곱분포에서 오른쪽 꼬리 넓이가 인 임계값(더 큰 값)
- : 같은 분포에서 오른쪽 꼬리 넓이가 인 임계값(더 작은 값, 즉 왼쪽 꼬리 넓이가 인 지점)
주의: 분모의 위치가 z, t 신뢰구간과 반대로 뒤바뀌어 있습니다. 하한을 구할 때는 더 큰 카이제곱 값으로 나누고, 상한을 구할 때는 더 작은 카이제곱 값으로 나눕니다. 나누는 수가 클수록 결과값(구간의 경계)이 작아지기 때문입니다.
예시: 부품 무게의 산포
한 부품의 무게 산포(분산)가 기준 이내인지 확인하려고 개를 뽑아 표본분산 (단위: , 그람제곱)를 얻었습니다. 모분산 의 95% 신뢰구간을 구합니다.
1단계 — 자유도 계산
2단계 — 카이제곱 임계값 찾기
카이제곱분포표에서 자유도 19 행을 찾아, 오른쪽 꼬리 넓이 0.025와 0.975에 해당하는 값을 읽습니다.
3단계 — 계산
4단계 — 하한 계산 (큰 임계값 32.852로 나눔)
5단계 — 상한 계산 (작은 임계값 8.907로 나눔)
6단계 — 신뢰구간 정리
검산: z, t 신뢰구간과 달리 과 는 (점추정값)를 기준으로 대칭이 아닙니다. 인 반면 로 위쪽이 훨씬 더 넓게 벌어져 있습니다. 이것이 정상입니다 — 카이제곱분포 자체가 좌우 대칭이 아니기 때문입니다.
해석: 이 부품 무게의 모분산은 95% 신뢰수준에서 약 8.91그람제곱에서 32.85그람제곱 사이로 추정됩니다. 표준편차 단위로 보고 싶다면 양 끝에 제곱근을 씌워 그람에서 그람 사이라고 말할 수 있습니다(분산의 신뢰구간에 제곱근을 씌우면 표준편차의 신뢰구간이 됩니다 — 단, 신뢰수준 자체는 그대로 유지됩니다).
신뢰구간의 문장 해석 — “95%“가 정확히 뜻하는 것
15편에서 z 신뢰구간을 다루며 짧게 짚었던 내용을 이 편에서 한 번 더 정확히 정리합니다. 시험에서 가장 자주 함정으로 나오는 부분이기 때문입니다.
틀린 해석: “모비율 가 (0.2935, 0.3865) 구간 안에 있을 확률이 95%다.”
이 문장이 왜 틀렸는지는 가 무엇인지를 다시 생각하면 명확해집니다. 는 전체 모집단의 실제 찬성 비율로, 조사와 무관하게 이미 하나의 값으로 정해져 있는 상수입니다. 표본을 뽑기 전에는 가 몇 인지 모르지만, 표본을 뽑는다고 해서 자체가 이리저리 움직이는 확률변수가 되는 것은 아닙니다. 반대로 랜덤한 것은 신뢰구간 쪽입니다. 어떤 400명이 뽑히느냐에 따라 가 달라지고, 그에 따라 구간의 양 끝값도 매번 달라집니다.
정확한 해석: “이 조사 절차(같은 방식으로 400명씩 뽑아 신뢰구간을 계산하는 절차)를 여러 번 반복한다면, 그렇게 만들어지는 구간들 중 약 95%가 실제 모비율 를 포함할 것이다. 오늘 뽑은 표본으로 계산한 구간은 (29.35%, 38.65%)이며, 이는 그 95%에 속하는 성공적인 구간일 수도, 실패한 5%에 속하는 구간일 수도 있다 — 다만 그 성공 여부를 확률로 다시 말할 수는 없다.”
확률은 “표본을 뽑기 전, 어떤 구간이 나올지 모르는 상태”에 대한 진술입니다. 표본을 뽑고 구간의 두 끝값이 구체적인 숫자로 확정되는 순간, 그 구간이 를 포함하는지 여부는 이미 결정되어 있는 사실이지 더 이상 확률의 대상이 아닙니다. 이는 17편에서 다룰 가설검정의 p값 해석과도 이어지는, 통계적 추론 전체를 관통하는 핵심 논리입니다.
신뢰수준과 구간 길이의 관계 — 트레이드오프
쉽게 말하면: 더 확실하게 맞히고 싶으면(신뢰수준을 높이면) 구간이 넓어지고, 구간을 좁게 잡고 싶으면 확실성을 조금 포기해야 합니다.
15편의 볼트 예시(모표준편차 , 표본크기 , 표준오차 )를 그대로 이용해, 신뢰수준을 바꾸면 오차한계와 구간 폭이 어떻게 달라지는지 비교합니다.
| 신뢰수준 | z 임계값 | 오차한계 계산 | 오차한계 | 구간 폭(오차한계의 2배) |
|---|---|---|---|---|
| 90% | 1.645 | 0.4935 | 0.987 | |
| 95% | 1.96 | 0.588 | 1.176 | |
| 99% | 2.576 | 0.7728 | 1.5456 |
표에서 보듯, 신뢰수준을 90%에서 99%로 올릴수록 z 임계값이 커지고, 그만큼 오차한계와 구간 폭도 함께 커집니다. 이는 자연스러운 트레이드오프입니다.
- 신뢰수준을 높이면(예: 99%) → “이 절차가 성공할 확률”은 올라가지만, 그 대신 구간이 넓어져서 “모평균이 대략 이 근처”라는 정보의 정밀도는 떨어집니다.
- 신뢰수준을 낮추면(예: 90%) → 구간은 좁아져 더 정밀한 정보를 주지만, 그 절차가 실제로 모수를 포함하지 못할 위험(5% 대신 10%)이 커집니다.
구간을 좁히면서도 신뢰수준을 유지하고 싶다면 남은 방법은 하나, 15편에서 다룬 것처럼 표본크기 을 늘리는 것입니다. 이 커지면 표준오차 이 작아지므로, 같은 신뢰수준에서도 구간이 좁아집니다.
자주 틀리는 점
- 모비율 신뢰구간에서 정규근사 조건(, )을 확인하지 않는 실수. 조건이 깨지면 정규근사 자체가 부정확해 신뢰구간의 실제 성공률이 명목상 신뢰수준(예: 95%)과 크게 어긋날 수 있습니다.
- 모분산 신뢰구간을 z, t처럼 대칭이라고 착각. 카이제곱분포는 좌우 비대칭이므로 점추정값 을 중심으로 좌우 폭이 다릅니다. “점추정값 ± 오차한계” 형태로 계산하려는 시도는 이 신뢰구간에는 적용되지 않습니다.
- 카이제곱 임계값 두 개(와 )의 위치를 혼동. 하한을 구할 때 큰 값(예: 32.852)으로 나누고, 상한을 구할 때 작은 값(예: 8.907)으로 나눕니다. 이를 반대로 넣으면 하한이 상한보다 커지는 말이 안 되는 결과가 나오므로, 계산 후 하한 < 상한인지 반드시 확인합니다.
- 비율을 퍼센트로 바꿀 때 소수점 자리 실수. 는 이지 가 아닙니다. 최종 답을 퍼센트로 쓸 때 100을 곱하는 것을 잊지 않습니다.
- “신뢰구간에 모수가 있을 확률이 95%“라는 표현을 그대로 답으로 고르는 실수. 앞서 다룬 것처럼 정확한 표현은 “절차를 반복했을 때 모수를 포함하는 구간의 비율이 95%“입니다.
핵심 정리
- 모비율의 신뢰구간은 이며, 와 조건에서 정규근사를 사용합니다.
- 모분산의 신뢰구간은 카이제곱분포를 이용하며 형태로, 점추정값을 기준으로 좌우 대칭이 아닙니다.
- “신뢰구간이 모수를 포함할 확률이 95%“라는 표현은 이미 계산된 특정 구간이 아니라, 절차를 반복했을 때의 장기적 성공률을 뜻합니다.
- 신뢰수준을 높이면 구간이 넓어지고, 낮추면 좁아집니다. 신뢰수준을 유지하면서 구간을 좁히려면 표본크기를 늘려야 합니다.