Skip to Content
독학사독학사 1단계기초통계학15. 모비율·모분산 신뢰구간

이번 문서의 목표: 이 문서를 다 읽으면 모비율의 신뢰구간을 정규근사로, 모분산의 신뢰구간을 카이제곱분포로 계산하고, 신뢰수준이 구간의 길이에 어떤 영향을 주는지 설명할 수 있습니다.

모비율의 신뢰구간 — “찬성 비율”을 추정한다

쉽게 말하면: 표본에서 관찰한 찬성 비율을 중심으로, 얼마나 오차를 허용할지 폭을 정해주는 것이 모비율 신뢰구간입니다.

15편에서는 평균처럼 연속적인 값을 추정했습니다. 이번에는 “찬성/반대”, “불량/양품”처럼 두 가지 중 하나로 나뉘는 자료에서 모비율(population proportion) pp의 신뢰구간을 구합니다. 예를 들어 여론조사에서 특정 정책에 대한 전체 국민의 찬성 비율 pp는 모르지만, 표본을 뽑아 계산한 표본비율 p^\hat{p}(피햇, p hat, 표본에서 계산한 비율)로 pp를 추정할 수 있습니다.

p^=xn\hat{p} = \frac{x}{n}
  • xx: 표본에서 “성공”(관심 있는 특성)에 해당하는 개체 수
  • nn: 표본크기

표본비율 p^\hat{p}은 표본크기 nn이 충분히 크면 근사적으로 정규분포를 따른다는 사실이 알려져 있습니다(10편에서 다룬 이항분포의 정규근사와 같은 원리입니다). 이 근사가 잘 성립하려면 np^5n\hat{p} \ge 5이고 n(1p^)5n(1-\hat{p}) \ge 5라는 조건을 관행적으로 확인합니다. 이 조건이 깨지면(표본크기가 작거나 비율이 극단적으로 0 또는 1에 가까우면) 정규근사가 부정확해집니다.

공식

p^zα/2p^(1p^)npp^+zα/2p^(1p^)n\hat{p} - z_{\alpha/2}\sqrt{\frac{\hat{p}(1-\hat{p})}{n}} \le p \le \hat{p} + z_{\alpha/2}\sqrt{\frac{\hat{p}(1-\hat{p})}{n}}
  • p^\hat{p}: 표본비율
  • zα/2z_{\alpha/2}: 신뢰수준에 대응하는 z 임계값(15편의 표 참고: 90%는 1.645, 95%는 1.96, 99%는 2.576)
  • p^(1p^)/n\sqrt{\hat{p}(1-\hat{p})/n}: 표본비율의 표준오차. p^(1p^)\hat{p}(1-\hat{p})는 이항분포에서 유도되는 분산의 표본 추정값이고, 이를 nn으로 나눈 뒤 제곱근을 씌운 것입니다.

예시: 정책 찬성 여론조사

한 정책에 대한 찬반 여론조사에서 n=400n=400명을 조사했더니 x=136x=136명이 찬성했습니다. 모비율 pp의 95% 신뢰구간을 구합니다.

1단계 — 표본비율 계산

p^=136400=0.34\hat{p} = \frac{136}{400} = 0.34

2단계 — 정규근사 조건 확인

np^=400×0.34=136,n(1p^)=400×0.66=264n\hat{p} = 400 \times 0.34 = 136, \qquad n(1-\hat{p}) = 400 \times 0.66 = 264

두 값 모두 5보다 훨씬 크므로 정규근사를 써도 됩니다.

3단계 — 표준오차 계산

SE=0.34×0.66400=0.2244400=0.0005610.0237SE = \sqrt{\frac{0.34 \times 0.66}{400}} = \sqrt{\frac{0.2244}{400}} = \sqrt{0.000561} \approx 0.0237

4단계 — 오차한계 계산 (95%이므로 z0.025=1.96z_{0.025}=1.96)

E=1.96×0.02370.0465E = 1.96 \times 0.0237 \approx 0.0465

5단계 — 신뢰구간 계산

0.340.0465p0.34+0.04650.34 - 0.0465 \le p \le 0.34 + 0.0465 0.2935p0.38650.2935 \le p \le 0.3865

검산: 중심 (0.2935+0.3865)/2=0.34(0.2935+0.3865)/2=0.34(표본비율과 일치), 반폭 (0.38650.2935)/2=0.0465(0.3865-0.2935)/2=0.0465(오차한계와 일치).

해석: 이 정책에 대한 전체 모집단의 찬성 비율은 95% 신뢰수준에서 약 29.35퍼센트(29.35%)에서 38.65퍼센트(38.65%) 사이로 추정됩니다. 표본에서는 34퍼센트(34%)가 찬성했지만, 표본 하나의 결과만으로 “정확히 34%가 찬성한다”고 단정할 수는 없다는 뜻입니다.

모분산의 신뢰구간 — 카이제곱분포를 이용한다

쉽게 말하면: 분산의 신뢰구간은 평균의 신뢰구간과 달리 좌우가 똑같이 벌어지지 않고 한쪽으로 치우친 모양이 됩니다.

품질관리에서는 “평균이 목표치에 맞는가”뿐 아니라 “제품 간 편차(산포)가 기준 이내인가”도 중요합니다. 이 산포를 나타내는 모분산 σ2\sigma^2(시그마 제곱)의 신뢰구간을 구할 때는 13편에서 다룬 카이제곱분포(chi-square distribution, 기호 χ2\chi^2)를 사용합니다.

정규분포를 따르는 모집단에서 뽑은 표본에 대해, 다음 통계량이 자유도 n1n-1인 카이제곱분포를 따른다는 사실이 알려져 있습니다(자세한 유도는 13편 참고).

(n1)s2σ2χn12\frac{(n-1)s^2}{\sigma^2} \sim \chi^2_{n-1}
  • s2s^2: 표본분산(분모가 n1n-1인 공식으로 계산, 06편 참고)
  • σ2\sigma^2: 모분산(미지수)
  • χn12\chi^2_{n-1}: 자유도 n1n-1인 카이제곱분포

이 식을 σ2\sigma^2에 대해 정리하면 모분산의 신뢰구간 공식이 나옵니다.

(n1)s2χα/2,n12σ2(n1)s2χ1α/2,n12\frac{(n-1)s^2}{\chi^2_{\alpha/2,\, n-1}} \le \sigma^2 \le \frac{(n-1)s^2}{\chi^2_{1-\alpha/2,\, n-1}}
  • χα/2,n12\chi^2_{\alpha/2,\, n-1}: 자유도 n1n-1인 카이제곱분포에서 오른쪽 꼬리 넓이가 α/2\alpha/2인 임계값(더 큰 값)
  • χ1α/2,n12\chi^2_{1-\alpha/2,\, n-1}: 같은 분포에서 오른쪽 꼬리 넓이가 1α/21-\alpha/2인 임계값(더 작은 값, 즉 왼쪽 꼬리 넓이가 α/2\alpha/2인 지점)

주의: 분모의 위치가 z, t 신뢰구간과 반대로 뒤바뀌어 있습니다. 하한을 구할 때는 더 큰 카이제곱 값으로 나누고, 상한을 구할 때는 더 작은 카이제곱 값으로 나눕니다. 나누는 수가 클수록 결과값(구간의 경계)이 작아지기 때문입니다.

예시: 부품 무게의 산포

한 부품의 무게 산포(분산)가 기준 이내인지 확인하려고 n=20n=20개를 뽑아 표본분산 s2=15.4s^2=15.4(단위: g2\text{g}^2, 그람제곱)를 얻었습니다. 모분산 σ2\sigma^2의 95% 신뢰구간을 구합니다.

1단계 — 자유도 계산

df=n1=201=19df = n - 1 = 20 - 1 = 19

2단계 — 카이제곱 임계값 찾기

카이제곱분포표에서 자유도 19 행을 찾아, 오른쪽 꼬리 넓이 0.025와 0.975에 해당하는 값을 읽습니다.

χ0.025,192=32.852,χ0.975,192=8.907\chi^2_{0.025,19} = 32.852, \qquad \chi^2_{0.975,19} = 8.907

3단계 — (n1)s2(n-1)s^2 계산

(n1)s2=19×15.4=292.6(n-1)s^2 = 19 \times 15.4 = 292.6

4단계 — 하한 계산 (큰 임계값 32.852로 나눔)

292.632.8528.91\frac{292.6}{32.852} \approx 8.91

5단계 — 상한 계산 (작은 임계값 8.907로 나눔)

292.68.90732.85\frac{292.6}{8.907} \approx 32.85

6단계 — 신뢰구간 정리

8.91σ232.858.91 \le \sigma^2 \le 32.85

검산: z, t 신뢰구간과 달리 8.918.9132.8532.8515.415.4(점추정값)를 기준으로 대칭이 아닙니다. 15.48.91=6.4915.4-8.91=6.49인 반면 32.8515.4=17.4532.85-15.4=17.45로 위쪽이 훨씬 더 넓게 벌어져 있습니다. 이것이 정상입니다 — 카이제곱분포 자체가 좌우 대칭이 아니기 때문입니다.

해석: 이 부품 무게의 모분산은 95% 신뢰수준에서 약 8.91그람제곱에서 32.85그람제곱 사이로 추정됩니다. 표준편차 단위로 보고 싶다면 양 끝에 제곱근을 씌워 8.912.98\sqrt{8.91}\approx 2.98그람에서 32.855.73\sqrt{32.85}\approx 5.73그람 사이라고 말할 수 있습니다(분산의 신뢰구간에 제곱근을 씌우면 표준편차의 신뢰구간이 됩니다 — 단, 신뢰수준 자체는 그대로 유지됩니다).

신뢰구간의 문장 해석 — “95%“가 정확히 뜻하는 것

15편에서 z 신뢰구간을 다루며 짧게 짚었던 내용을 이 편에서 한 번 더 정확히 정리합니다. 시험에서 가장 자주 함정으로 나오는 부분이기 때문입니다.

틀린 해석: “모비율 pp가 (0.2935, 0.3865) 구간 안에 있을 확률이 95%다.”

이 문장이 왜 틀렸는지는 pp가 무엇인지를 다시 생각하면 명확해집니다. pp는 전체 모집단의 실제 찬성 비율로, 조사와 무관하게 이미 하나의 값으로 정해져 있는 상수입니다. 표본을 뽑기 전에는 pp가 몇 인지 모르지만, 표본을 뽑는다고 해서 pp 자체가 이리저리 움직이는 확률변수가 되는 것은 아닙니다. 반대로 랜덤한 것은 신뢰구간 쪽입니다. 어떤 400명이 뽑히느냐에 따라 p^\hat{p}가 달라지고, 그에 따라 구간의 양 끝값도 매번 달라집니다.

정확한 해석: “이 조사 절차(같은 방식으로 400명씩 뽑아 신뢰구간을 계산하는 절차)를 여러 번 반복한다면, 그렇게 만들어지는 구간들 중 약 95%가 실제 모비율 pp를 포함할 것이다. 오늘 뽑은 표본으로 계산한 구간은 (29.35%, 38.65%)이며, 이는 그 95%에 속하는 성공적인 구간일 수도, 실패한 5%에 속하는 구간일 수도 있다 — 다만 그 성공 여부를 확률로 다시 말할 수는 없다.”

확률은 “표본을 뽑기 전, 어떤 구간이 나올지 모르는 상태”에 대한 진술입니다. 표본을 뽑고 구간의 두 끝값이 구체적인 숫자로 확정되는 순간, 그 구간이 pp를 포함하는지 여부는 이미 결정되어 있는 사실이지 더 이상 확률의 대상이 아닙니다. 이는 17편에서 다룰 가설검정의 p값 해석과도 이어지는, 통계적 추론 전체를 관통하는 핵심 논리입니다.

신뢰수준과 구간 길이의 관계 — 트레이드오프

쉽게 말하면: 더 확실하게 맞히고 싶으면(신뢰수준을 높이면) 구간이 넓어지고, 구간을 좁게 잡고 싶으면 확실성을 조금 포기해야 합니다.

15편의 볼트 예시(모표준편차 σ=1.5\sigma=1.5, 표본크기 n=25n=25, 표준오차 SE=0.3SE=0.3)를 그대로 이용해, 신뢰수준을 바꾸면 오차한계와 구간 폭이 어떻게 달라지는지 비교합니다.

신뢰수준z 임계값오차한계 계산오차한계구간 폭(오차한계의 2배)
90%1.6451.645×0.31.645 \times 0.30.49350.987
95%1.961.96×0.31.96 \times 0.30.5881.176
99%2.5762.576×0.32.576 \times 0.30.77281.5456

표에서 보듯, 신뢰수준을 90%에서 99%로 올릴수록 z 임계값이 커지고, 그만큼 오차한계와 구간 폭도 함께 커집니다. 이는 자연스러운 트레이드오프입니다.

  • 신뢰수준을 높이면(예: 99%) → “이 절차가 성공할 확률”은 올라가지만, 그 대신 구간이 넓어져서 “모평균이 대략 이 근처”라는 정보의 정밀도는 떨어집니다.
  • 신뢰수준을 낮추면(예: 90%) → 구간은 좁아져 더 정밀한 정보를 주지만, 그 절차가 실제로 모수를 포함하지 못할 위험(5% 대신 10%)이 커집니다.

구간을 좁히면서도 신뢰수준을 유지하고 싶다면 남은 방법은 하나, 15편에서 다룬 것처럼 표본크기 nn을 늘리는 것입니다. nn이 커지면 표준오차 σ/n\sigma/\sqrt{n}이 작아지므로, 같은 신뢰수준에서도 구간이 좁아집니다.

자주 틀리는 점

  • 모비율 신뢰구간에서 정규근사 조건(np^5n\hat{p}\ge5, n(1p^)5n(1-\hat{p})\ge5)을 확인하지 않는 실수. 조건이 깨지면 정규근사 자체가 부정확해 신뢰구간의 실제 성공률이 명목상 신뢰수준(예: 95%)과 크게 어긋날 수 있습니다.
  • 모분산 신뢰구간을 z, t처럼 대칭이라고 착각. 카이제곱분포는 좌우 비대칭이므로 점추정값 s2s^2을 중심으로 좌우 폭이 다릅니다. “점추정값 ± 오차한계” 형태로 계산하려는 시도는 이 신뢰구간에는 적용되지 않습니다.
  • 카이제곱 임계값 두 개(χα/22\chi^2_{\alpha/2}χ1α/22\chi^2_{1-\alpha/2})의 위치를 혼동. 하한을 구할 때 큰 값(예: 32.852)으로 나누고, 상한을 구할 때 작은 값(예: 8.907)으로 나눕니다. 이를 반대로 넣으면 하한이 상한보다 커지는 말이 안 되는 결과가 나오므로, 계산 후 하한 < 상한인지 반드시 확인합니다.
  • 비율을 퍼센트로 바꿀 때 소수점 자리 실수. 0.340.3434%34\%이지 0.34%0.34\%가 아닙니다. 최종 답을 퍼센트로 쓸 때 100을 곱하는 것을 잊지 않습니다.
  • “신뢰구간에 모수가 있을 확률이 95%“라는 표현을 그대로 답으로 고르는 실수. 앞서 다룬 것처럼 정확한 표현은 “절차를 반복했을 때 모수를 포함하는 구간의 비율이 95%“입니다.

핵심 정리

  • 모비율의 신뢰구간은 p^±zα/2p^(1p^)/n\hat{p} \pm z_{\alpha/2}\sqrt{\hat{p}(1-\hat{p})/n}이며, np^5n\hat{p}\ge5n(1p^)5n(1-\hat{p})\ge5 조건에서 정규근사를 사용합니다.
  • 모분산의 신뢰구간은 카이제곱분포를 이용하며 [(n1)s2/χα/2,n12, (n1)s2/χ1α/2,n12][(n-1)s^2/\chi^2_{\alpha/2,n-1},\ (n-1)s^2/\chi^2_{1-\alpha/2,n-1}] 형태로, 점추정값을 기준으로 좌우 대칭이 아닙니다.
  • “신뢰구간이 모수를 포함할 확률이 95%“라는 표현은 이미 계산된 특정 구간이 아니라, 절차를 반복했을 때의 장기적 성공률을 뜻합니다.
  • 신뢰수준을 높이면 구간이 넓어지고, 낮추면 좁아집니다. 신뢰수준을 유지하면서 구간을 좁히려면 표본크기를 늘려야 합니다.

마무리 복습

문제 14지선다
표본 400명 중 136명이 찬성했을 때 표본비율은 얼마인가?
문제 24지선다
모비율 신뢰구간에서 정규근사를 사용하기 위해 확인해야 하는 조건은 무엇인가?
문제 34지선다
모분산의 신뢰구간을 구할 때 사용하는 분포는 무엇인가?
문제 44지선다
표본크기 20, 표본분산 15.4로 모분산 95% 신뢰구간을 구할 때 (n-1)s제곱 값은 얼마인가?
문제 54지선다
모분산 95% 신뢰구간을 구할 때, 자유도 19에서 카이제곱 임계값이 32.852와 8.907로 주어졌다. 신뢰구간의 하한을 구하는 올바른 계산은?
문제 64지선다
95% 신뢰구간에 대한 다음 설명 중 가장 정확한 것은?
문제 74지선다
다른 조건이 모두 같을 때, 신뢰수준을 95%에서 99%로 높이면 신뢰구간의 폭은 어떻게 변하는가?

참고 자료

Last updated on