이번 문서의 목표: 이 파일을 다 읽으면 자료가 평균 주위에 얼마나 퍼져 있는지 계산하고, 왜 표본분산은 n이 아니라 n-1로 나누는지 설명할 수 있다.
왜 평균만으로는 부족한가
05편에서 구한 8명의 점수(62, 68, 71, 75, 75, 80, 85, 92)는 평균이 76점이었다. 그런데 다른 반 학생 8명의 점수가 74, 75, 76, 76, 76, 77, 77, 78이라고 하자. 이 반의 평균도 마찬가지로 76점이다.
두 반의 평균은 똑같이 76점이지만, 첫 번째 반은 62점부터 92점까지 널리 퍼져 있고, 두 번째 반은 74점부터 78점까지 촘촘히 몰려 있다. 평균만 보면 두 반이 똑같다고 착각하게 된다. 이 차이를 숫자로 나타내는 것이 산포도(measure of dispersion), 즉 자료가 평균 주위에 얼마나 흩어져 있는지를 나타내는 값이다. 이 편에서는 범위, 사분위범위, 분산, 표준편차, 변동계수, 표준화(z점수)를 차례로 다룬다.
범위와 사분위범위: 가장 단순한 산포도
쉽게 말하면: 범위는 최댓값에서 최솟값을 뺀 값이고, 사분위범위는 자료의 가운데 절반이 퍼진 폭이다.
범위(range)는 자료의 최댓값에서 최솟값을 뺀 값으로, 산포를 나타내는 가장 단순한 지표다.
8명 점수(62, …, 92)에서 범위는 다음과 같다.
범위는 계산이 쉽지만 극단값 두 개(최댓값, 최솟값)에만 의존하기 때문에, 05편에서 다룬 극단값 문제에 그대로 취약하다. 이를 보완하는 것이 사분위범위(interquartile range, IQR)다. 05편에서 구한 , 를 이용한다.
결과 해석: IQR은 자료의 중간 50퍼센트(하위 25퍼센트와 상위 25퍼센트를 잘라낸 나머지)가 퍼진 폭이 13점이라는 뜻이다. 범위(30점)보다 훨씬 작은 이유는, 극단값의 영향을 받는 최댓값·최솟값을 아예 계산에서 제외했기 때문이다. 그래서 IQR은 극단값이 있는 자료에서 범위보다 더 안정적인 산포 지표로 쓰인다.
분산과 표준편차: 편차를 제곱해서 평균 낸다
쉽게 말하면: 각 값이 평균에서 얼마나 떨어져 있는지(편차)를 제곱해서 평균 낸 것이 분산이고, 분산에 제곱근을 씌워 원래 단위로 되돌린 것이 표준편차다.
평균과 각 자료값의 차이를 편차(deviation)라 부른다. 편차를 그냥 평균 내면 항상 0이 되어버린다(양의 편차와 음의 편차가 서로 상쇄되기 때문이다). 그래서 편차를 제곱한 뒤 평균을 내는데, 이렇게 구한 값이 분산(variance)이다.
여기서 중요한 구분이 등장한다. 계산 대상이 모집단 전체냐 표본이냐에 따라 분산을 부르는 이름과 나누는 수가 달라진다.
모분산: 모집단 전체를 다 안다면
모집단 전체 자료를 다 가지고 있을 때 구하는 분산을 모분산(population variance)이라 하고 (시그마 제곱)으로 쓴다.
- : 모분산 (읽는 법: 시그마 제곱)
- : 번째 자료값
- : 모평균 (읽는 법: 뮤)
- : 모집단 전체의 자료 개수
표본분산: 표본으로 모집단을 추정한다면
현실에서는 모집단 전체를 조사하기 어려워서, 표본(일부)만 뽑아 모집단의 특성을 추정하는 경우가 대부분이다. 이때 구하는 분산을 표본분산(sample variance)이라 하고 으로 쓰는데, 나누는 수가 이 아니라 이다.
- : 표본분산
- : 번째 표본 자료값
- : 표본평균 (읽는 법: 엑스 바)
- : 표본 크기에서 1을 뺀 값, 자유도(degrees of freedom)라 부른다
왜 하필 n-1로 나눌까
이 대목이 이 편에서 가장 자주 헷갈리는 부분이다. 직관부터 잡아보자.
모분산 공식은 편차를 **참값인 모평균 **에서 잰다. 하지만 표본만 가지고 있을 때는 를 모르기 때문에, 어쩔 수 없이 표본 자체의 평균인 로 대신 잰다. 문제는 가 그 표본 자료들로부터 계산된 값이라는 점이다. 표본평균의 정의상 편차 를 모두 더하면 항상 정확히 0이 된다.
이 말은, 개의 편차 중 개가 정해지면 마지막 하나는 자동으로 결정된다는 뜻이다(전체 합이 0이 되도록 강제되기 때문). 즉 자유롭게 값을 정할 수 있는 편차는 개가 아니라 개뿐이다. 이 “자유롭게 움직일 수 있는 정보의 개수”를 자유도라 부른다.
그런데 는 모평균 가 아니라 자료 자신의 중심이다. 통계량의 성질상, 자료와 자기 자신의 평균 사이 거리(편차)의 제곱합은 자료와 참값 사이 거리의 제곱합보다 항상 작거나 같다. 다시 말해 를 기준으로 잰 편차 제곱합은 를 기준으로 잰 편차 제곱합보다 체계적으로 작게 나온다. 이 제곱합을 그대로 으로 나누면, 표본에서 구한 분산이 모분산보다 평균적으로 작게 나오는 편향(bias)이 생긴다. 이를 보정하기 위해 표본에서는 더 작은 수인 로 나누어 그 값을 인위적으로 키워준다. 이렇게 하면 표본분산의 기댓값이 정확히 모분산과 같아지는데, 이런 성질을 가진 추정량을 불편추정량(unbiased estimator, 편향되지 않은 추정량)이라 하며, 14편에서 다시 다룬다.
쉽게 말하면: 표본평균은 표본 자료에 맞춰 이미 한 번 조정된 값이라, 그 표본평균을 기준으로 잰 퍼짐은 실제보다 작게 잡힌다. n-1로 나누는 것은 이 “과소평가”를 보정하는 장치다.
같은 자료로 모분산과 표본분산을 나란히 계산해 보자
05편의 8명 점수(62, 68, 71, 75, 75, 80, 85, 92, 평균 76점)를 그대로 쓴다. 먼저 각 편차와 편차 제곱을 정리한다.
| 자료 | 편차 | 편차 제곱 |
|---|---|---|
| 62 | -14 | 196 |
| 68 | -8 | 64 |
| 71 | -5 | 25 |
| 75 | -1 | 1 |
| 75 | -1 | 1 |
| 80 | 4 | 16 |
| 85 | 9 | 81 |
| 92 | 16 | 256 |
편차 제곱을 모두 더한다.
이 8명이 모집단 전체라고 가정하면 모분산은 다음과 같다.
같은 자료를 모집단에서 뽑은 표본이라고 가정하면 표본분산은 다음과 같다.
결과 해석: 편차 제곱합(640)은 완전히 동일한데, 나누는 수만 8에서 7로 줄었을 뿐인데도 분산 값이 80에서 91.43으로 커졌다. 나누는 수가 작아질수록 결과값은 커진다는 점을 기억하면, “표본분산이 모분산보다 항상 더 크게 나온다(같은 편차 제곱합 기준)“는 관계를 직관적으로 이해할 수 있다.
계산 검산: 정의식과 계산식이 같은 값을 주는가
편차를 일일이 구하는 위 방법을 정의식이라 하고, 아래처럼 자료값의 제곱을 먼저 더하는 방법을 계산식(전개식)이라 한다. 두 방법이 같은 값을 주는지 검산해 보면 계산 실수를 잡아낼 수 있다.
이었다(05편). 을 구해보자.
검산 결과: 계산식으로 구한 640이 정의식으로 구한 640과 정확히 일치한다. 두 방법이 같은 값을 준다는 것을 확인했으므로, 앞서 구한 모분산 80과 표본분산 약 91.43은 계산이 맞았다고 검증된다.
표준편차: 원래 단위로 되돌리기
분산은 편차를 제곱했기 때문에 단위도 제곱이 된다(점수의 분산이라면 “점 제곱”이라는, 실감하기 어려운 단위가 된다). 그래서 분산에 제곱근을 씌워 원래 단위로 되돌린 값을 표준편차(standard deviation)라 부른다. 모집단이면 (시그마), 표본이면 로 쓴다.
결과 해석: 표준편차 약 8.94점(모집단 기준) 또는 약 9.56점(표본 기준)은 “이 반 학생들의 점수가 평균 76점에서 대략 9점 안팎으로 퍼져 있다”는 뜻으로 해석한다. 앞서 든 두 번째 반(74~78점, 촘촘히 몰림)이라면 표준편차가 이보다 훨씬 작게 나왔을 것이다.
변동계수: 단위가 다른 자료끼리 산포를 비교하려면
쉽게 말하면: 표준편차를 평균으로 나누어 비율로 만들면, 단위나 크기가 전혀 다른 두 자료의 산포도를 공정하게 비교할 수 있다.
표준편차는 원래 자료의 단위를 그대로 갖기 때문에, 단위가 다른 두 자료(예: 키의 산포와 몸무게의 산포)나 평균의 크기 자체가 크게 다른 두 자료를 직접 비교하기 어렵다. 이때 표준편차를 평균으로 나눈 변동계수(coefficient of variation, CV)를 쓰면 단위가 사라져(무차원화) 공정하게 비교할 수 있다.
- : 변동계수, 보통 퍼센트(%)로 나타낸다
- : 표본표준편차
- : 표본평균
8명 점수 자료(표본 기준, , )의 변동계수를 구해보자.
결과 해석: 이 반의 점수는 평균 대비 약 12.58퍼센트만큼 흩어져 있다는 뜻이다. 만약 다른 반의 점수 평균이 40점, 표준편차가 8점이라면 표준편차만 보면 두 반이 비슷해 보이지만, 변동계수를 구하면 로 오히려 더 많이 흩어져 있다는 것을 알 수 있다. 이렇게 변동계수는 평균의 크기 차이를 보정해서 산포를 비교하게 해준다.
선형변환이 평균·분산에 미치는 영향
쉽게 말하면: 자료 전체에 똑같이 곱하고 더하는 변환을 하면, 평균은 그대로 곱하고 더한 값이 되지만 분산은 곱한 수의 제곱만 반영된다(더하는 수는 분산에 영향을 주지 않는다).
자료 전체에 상수 를 곱하고 상수 를 더하는 변환을 선형변환(linear transformation)이라 하고, 새 자료를 로 쓴다. 예컨대 100점 만점 점수를 50점 만점으로 절반씩 줄이고 기본점수 5점을 더해주는 상황이 이런 경우다.
- : 곱하는 상수 (척도 변화)
- : 더하는 상수 (위치 이동)
- 표준편차는 분산에 제곱근을 씌운 것이므로
왜 는 분산에 영향을 주지 않을까? 분산은 “평균으로부터의 떨어진 정도”를 재는 값인데, 자료 전체와 평균에 똑같이 를 더하면 자료와 평균 사이의 거리(편차)는 조금도 변하지 않기 때문이다. 반면 를 곱하면 자료 사이의 간격 자체가 배로 벌어지거나 좁혀지므로, 제곱해서 구하는 분산에는 배로 반영된다.
8명 점수 자료를 으로 변환한다고 하자(표본 기준 , ).
결과 해석: 평균은 단순히 2배 하고 10을 더한 162가 되었지만, 분산은 91.43의 4배(제곱인 )인 365.72가 되었다. 더한 10은 분산 계산에 전혀 나타나지 않는다는 점이 핵심이다.
표준화와 z점수: 서로 다른 자료를 같은 잣대로
쉽게 말하면: z점수는 어떤 값이 평균에서 표준편차 몇 배만큼 떨어져 있는지를 나타낸 값이다.
표준화(standardization)는 자료값에서 평균을 빼고 표준편차로 나누어, 평균 0, 표준편차 1인 공통의 척도로 바꾸는 작업이다. 이렇게 변환된 값을 z점수(z-score)라 부른다.
- : z점수 (표준화된 값)
- : 원래 자료값
- : 표본평균
- : 표본표준편차
8명 점수 중 92점 학생의 z점수를 구해보자(, ).
결과 해석: z점수 약 1.67은 “이 학생의 점수가 평균보다 표준편차의 약 1.67배만큼 높다”는 뜻이다. z점수의 진짜 위력은 단위가 다른 두 시험 성적을 직접 비교할 때 드러난다. 예를 들어 국어 시험(평균 70, 표준편차 8)에서 82점을 받은 것과, 수학 시험(평균 60, 표준편차 15)에서 82점을 받은 것은 같은 82점이라도 상대적 위치가 다르다. 국어의 z점수는 , 수학의 z점수는 로, 두 값을 같은 잣대(표준편차 단위)로 놓고 보면 국어 성적이 상대적으로 조금 더 높았다는 것을 알 수 있다. z점수는 11편에서 배울 표준정규분포와 곧바로 연결된다.
자주 틀리는 점
- 표본분산을 구할 때 n으로 나눈다. 문제에서 “표본”이라는 단어가 나오면 반드시 로 나눈다. 모집단 전체 자료라고 명시된 경우에만 으로 나눈다.
- 분산과 표준편차를 헷갈린다. 분산에 제곱근을 씌운 것이 표준편차다. 단위를 확인하면 구분할 수 있다.
- 선형변환에서 더하는 수 까지 분산에 반영한다. 는 평균에는 영향을 주지만 분산·표준편차에는 전혀 영향을 주지 않는다.
- 변동계수를 표준편차만으로 판단한다. 평균 크기가 다른 두 자료는 표준편차만으로 비교하면 안 되고, 반드시 변동계수(비율)로 바꿔서 비교해야 한다.
- z점수 공식에서 분모에 분산을 쓴다. 분모는 분산이 아니라 표준편차다. 분산을 쓰면 단위가 맞지 않는다.
핵심 정리
- 범위는 최댓값-최솟값, 사분위범위는 로, 극단값에 덜 민감한 쪽은 사분위범위다.
- 모분산은 , 표본분산은 이다. 표본평균이 자료에 맞춰 조정된 값이라 편차 제곱합이 과소평가되므로, (자유도)로 나누어 편향을 보정한다.
- 표준편차는 분산에 제곱근을 씌운 값으로, 원래 자료와 같은 단위를 가진다.
- 변동계수는 표준편차를 평균으로 나눈 비율로, 단위나 평균 크기가 다른 자료의 산포를 비교할 때 쓴다.
- 선형변환 에서 평균은 , 분산은 이며, z점수는 로 자료를 공통 척도로 표준화한 값이다.
마무리 복습
참고 자료
- Introduction to Applied Statistics: Lecture Notes — 산포도(분산·표준편차) 단원의 정의·공식 정리 방식 참고
- NIST/SEMATECH e-Handbook of Statistical Methods — 표본분산과 자유도(n-1) 정의, 변동계수 정의 확인