이번 문서의 목표: 이 파일을 다 읽으면 점추정량이 무엇인지 설명하고, 불편성·일치성·효율성이라는 세 조건으로 추정량의 좋고 나쁨을 판단하며, 평균·비율·분산을 점추정하는 계산을 직접 할 수 있다.
점추정이란: 모수를 하나의 값으로 찍는다
왜 필요한가
03편에서 배운 것처럼 모수(parameter)는 모집단 전체를 요약하는 값(예: 모평균 , 모비율 , 모분산 )이지만, 모집단 전체를 다 조사하는 경우는 현실에서 드물다. 대신 표본을 뽑아 표본에서 계산한 값으로 모수를 추측한다. 이렇게 모수를 딱 하나의 숫자로 추측하는 것을 점추정(point estimation)이라 한다.
쉽게 말하면: “모평균이 정확히 얼마다”라고 콕 집어 하나의 숫자로 대답하는 것이 점추정이다. (반대로 “70점에서 80점 사이일 것이다”처럼 범위로 대답하는 것은 15~16편에서 다루는 구간추정이다.)
정의
- 추정량(estimator): 모수를 추측하기 위해 표본으로 만든 통계량의 “계산 규칙” 자체. 예를 들어 라는 공식 자체가 추정량이다.
- 추정값(estimate): 실제 표본 데이터를 그 규칙에 대입해서 나온 구체적인 숫자. 예를 들어 표본평균 공식에 실제 데이터를 넣어 나온 78.5라는 숫자가 추정값이다.
- 표기: 모수 (세타, 알 수 없는 모수를 대표하는 일반적인 기호)의 추정량은 (세타햇)로 쓴다. 예를 들어 의 점추정량은 로 쓴다.
추정량은 표본을 어떻게 뽑느냐에 따라 값이 달라지는 확률변수이기도 하다(12편에서 배운 표본분포와 같은 맥락이다). 그래서 “어떤 추정량을 쓸 것인가”라는 선택 자체가 통계학에서 중요한 문제가 된다. 예를 들어 모평균을 추정할 때 표본평균 대신 표본의 중앙값(05편)을 쓸 수도 있는데, 어느 쪽이 더 “좋은” 추정량인지 판단할 기준이 필요하다. 이 기준이 바로 불편성·일치성·효율성이다.
조건 1: 불편성 — 평균적으로 정확히 맞힌다
왜 필요한가
추정량이 특정 표본 하나에서는 모수보다 크게 나오거나 작게 나올 수 있다. 하지만 표본을 반복해서 뽑아 그때마다의 추정값을 평균 내면, 그 평균이 모수와 정확히 일치해야 “치우침 없이 공정한” 추정량이라 할 수 있다. 이 성질을 불편성(unbiasedness)이라 한다.
쉽게 말하면: 화살을 여러 번 쏘았을 때 화살이 매번 과녁 중앙에서 조금씩 벗어나더라도, 그 화살들의 평균 위치가 정확히 과녁 중앙이라면 “조준 자체는 치우치지 않았다”고 말할 수 있다.
정의
- : 추정량 의 기댓값(=표본을 무한히 반복해서 뽑았을 때 추정값들의 평균)
- : 참 모수값
- 이 등식이 성립하면 를 의 불편추정량(unbiased estimator)이라 한다.
12편에서 이미 증명했듯이 이므로, 표본평균은 모평균의 불편추정량이다.
표본분산이 이 아니라 로 나누는 이유
06편에서 표본분산 공식이 로, 분모가 이 아니라 이라고 배웠다. 이제 그 이유를 불편성으로 설명할 수 있다.
편차를 모평균 가 아니라 표본평균 기준으로 계산하면, 편차의 제곱합이 원래보다 살짝 작게 나온다(표본평균은 그 표본 안에서 편차 제곱합을 최소로 만드는 값이기 때문에, 참값인 를 기준으로 잰 편차 제곱합보다 작거나 같을 수밖에 없다). 그래서 단순히 으로 나누면 분산을 체계적으로 과소평가(작게 추정)하게 된다. 분모를 보다 하나 작은 로 나누어 그만큼 값을 키워 보정한 것이 바로 이 공식이며, 이 보정 덕분에 이 성립해 이 의 불편추정량이 된다. 이러한 보정을 베셀의 보정(Bessel’s correction)이라 부른다.
대조 계산: 표본 ()로 두 방식을 비교해 보자. 먼저 표본평균을 구한다.
편차 제곱을 구하면 , , , , 이다.
으로 나눈 “편향된” 버전(모집단 분산 공식을 표본에 그대로 적용한 것)은 다음과 같다.
로 나눈 불편추정량(표본분산 )은 다음과 같다.
결과 해석: 같은 데이터인데도 분모를 무엇으로 나누느냐에 따라 8과 10이라는 서로 다른 값이 나온다. 로 나눈 10이 모분산의 불편추정값이며, 시험에서 “표본분산을 구하라”는 문제는 특별한 언급이 없는 한 이 버전을 요구한다.
조건 2: 일치성 — 표본이 커질수록 정확해진다
왜 필요한가
불편성은 “평균적으로” 맞다는 것이지, 표본 하나하나가 모수에 가깝다는 보장은 아니다. 표본크기가 커질수록 추정값이 점점 더 확실하게 모수 근처로 모여드는 성질도 따로 필요하다. 이를 일치성(consistency)이라 한다.
쉽게 말하면: 표본을 더 많이 뽑을수록 추정값이 진짜 정답에 점점 더 가까워지고, 표본이 무한히 커지면 결국 정답과 일치하게 된다.
정의와 12편과의 연결
12편에서 이미 이 성질의 근거를 다뤘다. 표본평균의 분산은 다음과 같다.
(표본크기가 한없이 커짐)이면 이 된다. 불편성 덕분에 의 중심은 이미 에 있는데, 여기에 더해 퍼짐마저 0으로 줄어드니 는 결국 라는 한 점에 붙어버린다. 이것이 표본평균이 일치추정량(consistent estimator)인 이유다. 즉 일치성은 불편성과 분산이 0으로 줄어드는 성질이 함께 만들어내는 결과다.
주의할 점은, 불편성과 일치성은 서로 다른 조건이라 하나가 성립해도 다른 하나가 자동으로 성립하지는 않는다는 것이다. 예를 들어 표본크기가 커져도 분산이 줄어들지 않는 이상한 추정량이 있다면, 그 추정량이 불편추정량이더라도 일치추정량은 아닐 수 있다.
조건 3: 효율성 — 같은 조건이면 덜 흔들리는 쪽이 낫다
왜 필요한가
모평균 의 불편추정량은 표본평균 하나만 있는 것이 아니다. 예를 들어 표본의 중앙값도 (좌우 대칭인 모집단이라면) 모평균의 불편추정량이 될 수 있다. 이렇게 후보가 여러 개일 때, 어느 것을 골라야 할지 판단하는 기준이 효율성(efficiency)이다.
쉽게 말하면: 두 저울이 평균적으로는 둘 다 정확한 무게를 알려주더라도(둘 다 불편추정량), 잴 때마다 눈금이 덜 흔들리는 저울이 더 믿을 만하다.
정의
같은 모수 에 대한 두 불편추정량 , 가 있을 때, 다음 조건을 만족하면 이 보다 더 효율적(efficient)이라 한다.
- , : 각 추정량의 분산 (표본을 반복해서 뽑을 때 추정값들이 얼마나 흩어지는지)
- 분산이 작을수록 표본마다 추정값이 덜 흔들리므로, 개별 추정값 하나를 믿을 때의 위험이 더 작다.
직관적 비교: 정규분포를 따르는 모집단에서는, 모평균을 추정할 때 표본평균의 분산이 표본중앙값의 분산보다 항상 더 작다는 것이 알려져 있다(구체적인 비율은 대학 수리통계 수준이라 이 시험 범위를 넘지만, “표본평균이 표본중앙값보다 덜 흔들린다”는 결론만은 꼭 기억해 둔다). 그래서 두 추정량 모두 불편추정량이라도, 정규분포 모집단에서는 표본평균이 더 효율적인 추정량으로 선호된다.
평균·비율·분산의 점추정
지금까지의 세 조건을 바탕으로, 시험에서 실제로 쓰는 세 가지 점추정량을 정리한다.
| 모수 | 점추정량 | 표기 | 불편성 |
|---|---|---|---|
| 모평균 | 표본평균 | 불편 | |
| 모비율 | 표본비율 | (는 성공 횟수) | 불편 |
| 모분산 | 표본분산 | 불편 |
모평균 점추정 계산 예시
어느 카페의 하루 방문객 대기시간(분)을 8명 조사해 을 얻었다. 모평균의 점추정값을 구한다.
결과 해석: 이 카페 전체 방문객의 평균 대기시간은 7.25분으로 점추정된다.
모비율 점추정 계산 예시
유권자 명을 조사했더니 특정 후보 지지자가 명이었다. 모비율의 점추정값을 구한다.
결과 해석: 전체 유권자 중 이 후보를 지지하는 비율은 62퍼센트(0.62)로 점추정된다.
모분산 점추정 계산 예시
앞의 대기시간 자료 으로 모분산도 점추정해 보자. 표본평균은 이미 로 구했다.
편차 제곱을 하나씩 구하면 , , , , , , , 이다.
결과 해석: 이 카페 전체 방문객 대기시간의 분산은 약 2.79(분의 제곱)로 점추정된다. 표준편차로 바꾸면 분이다.
표본평균·표본비율의 성질 요약
표본평균과 표본비율은 사실 같은 논리 구조를 공유한다. 표본비율 은 “성공을 1, 실패를 0으로 코딩한 데이터의 표본평균”과 완전히 같은 계산이기 때문이다(09~10편의 베르누이 시행 참고). 그래서 12편에서 배운 표본평균의 성질이 표본비율에도 그대로 대응된다.
| 성질 | 표본평균 | 표본비율 |
|---|---|---|
| 기댓값 (불편성) | ||
| 분산 | ||
| 표준오차 | ||
| 일 때 | 일치추정량 (로 수렴) | 일치추정량 (로 수렴) |
| 근사 분포 (중심극한정리) |
표본비율 표준오차 계산 예시: 앞의 유권자 조사(, )에서 표본비율의 표준오차를 계산해 보자. 모비율 를 모르므로 점추정값 로 대신 대입한다.
검산: 로, 반올림 오차 범위 내에서 원래 값 과 일치한다.
결과 해석: 이 조사에서 지지율의 표준오차는 약 0.0343(3.43퍼센트포인트)이다. 표본을 반복해서 뽑는다면, 표본비율은 62퍼센트 주위로 약 3.43퍼센트포인트만큼 흔들릴 수 있다는 뜻이며, 이 값이 15~16편에서 다루는 신뢰구간의 폭을 결정하는 핵심 재료가 된다.
자주 틀리는 점
- 표본분산을 으로 나눈다. 점추정으로 모분산을 구할 때는 반드시 로 나눈 불편추정량 을 쓴다. 으로 나눈 값은 모분산을 체계적으로 과소평가한다.
- 불편성과 일치성을 같은 개념으로 착각한다. 불편성은 “기댓값이 모수와 같다”는 조건이고, 일치성은 “표본크기가 커지면 확률적으로 모수에 가까워진다”는 조건이다. 둘은 독립적인 개념이며, 하나가 성립한다고 다른 하나가 자동으로 성립하지 않는다.
- 효율성을 “계산이 간단한 정도”로 오해한다. 효율성은 계산 난이도가 아니라 추정량의 분산 크기로 판단하는 기준이다. 분산이 더 작은 불편추정량이 더 효율적이다.
- 추정량과 추정값을 혼동한다. 처럼 공식 형태로 쓰인 것은 추정량(확률변수), 실제 숫자로 계산된 78.5 같은 것은 추정값이다. 시험 문제에서 “추정량을 쓰라”와 “추정값을 구하라”는 요구하는 답의 형태가 다르다.
- 표본비율의 표준오차 공식에서 대신 분산 공식 을 그대로 쓴다. 표본비율은 이산적인 성공·실패 자료의 평균이므로 분산 공식이 으로 따로 정해져 있다. 자리에 가 대신 들어간다고 이해하면 헷갈리지 않는다.
핵심 정리
- 점추정은 모수를 하나의 숫자(추정값)로 추측하는 것이며, 그 계산 규칙이 추정량이다.
- 좋은 추정량의 세 조건: 불편성(), 일치성(일 때 모수로 수렴), 효율성(같은 불편추정량 중 분산이 더 작음).
- 표본분산이 로 나누는 이유는 표본평균 기준 편차 제곱합이 참값 기준보다 작게 나오는 편향을 보정하기 위해서다(베셀의 보정).
- 모평균은 , 모비율은 , 모분산은 으로 점추정하며 셋 모두 불편추정량이다.
- 표본비율은 성공·실패를 0과 1로 코딩한 자료의 표본평균과 같은 구조이므로, 표본평균의 성질(기댓값·분산·표준오차·중심극한정리)이 그대로 대응된다.