이번 문서의 목표: 이 파일을 다 읽으면 자료 하나를 보고 평균·중앙값·최빈값을 직접 계산하고, 상황에 맞는 대표값을 고를 수 있다.
왜 대표값이 필요한가
시험 점수가 8명분 있다고 하자. “우리 반 성적이 어때?”라는 질문에 62, 68, 71, 75, 75, 80, 85, 92라는 숫자 8개를 그대로 나열해서 답하는 사람은 없다. 대신 “평균 76점 정도”처럼 자료 전체를 대표하는 숫자 하나로 요약해서 말한다.
이렇게 자료 집합 전체의 중심 위치를 하나의 숫자로 나타낸 값을 중심경향치(measure of central tendency)라고 부른다. 중심경향치에는 여러 종류가 있고, 어떤 것을 쓰느냐에 따라 같은 자료도 다르게 보일 수 있다. 이 편에서는 가장 널리 쓰이는 세 가지, 산술평균(mean), 중앙값(median), 최빈값(mode)을 다루고, 어느 상황에 어떤 값을 써야 하는지까지 판단하는 법을 배운다.
이 편에서 계속 쓸 기본 자료는 앞서 예로 든 학생 8명의 시험 점수다.
| 학생 | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 |
|---|---|---|---|---|---|---|---|---|
| 점수 | 62 | 68 | 71 | 75 | 75 | 80 | 85 | 92 |
산술평균: 다 더해서 인원수로 나눈다
쉽게 말하면: 모든 값을 똑같은 비중으로 취급해 더한 뒤, 개수로 나눈 값이다.
산술평균(arithmetic mean)은 자료값을 모두 더한 다음 자료의 개수로 나눈 값이다. 03편에서 배웠듯이, 모집단 전체를 대상으로 하면 이 값을 모평균이라 하고 그리스 문자 (뮤)로 쓰며, 표본을 대상으로 하면 표본평균이라 하고 (엑스 바)로 쓴다. 계산 방법 자체는 동일하다.
- : 표본평균 (읽는 법: 엑스 바)
- : 시그마, “부터 까지 모두 더하라”는 뜻. 02편에서 배운 시그마(Σ) 표기 그대로다.
- : 번째 자료값 (예: , , …)
- : 자료의 개수 (여기서는 8)
위 8명 점수로 직접 계산해 보자.
결과 해석: 이 반 학생 8명의 시험 점수를 하나의 숫자로 요약하면 76점이다. 평균은 “자료를 저울 위에 늘어놓았을 때 균형이 잡히는 지점”이라고 이해하면 직관적이다. 62점처럼 평균보다 훨씬 낮은 값과 92점처럼 훨씬 높은 값이 서로 균형을 맞추면서 76이라는 지점에서 저울이 평형을 이룬다.
가중평균: 값마다 중요도가 다를 때
쉽게 말하면: 모든 값을 똑같이 취급하지 않고, 각 값에 붙은 비중(가중치)만큼 더 크게 반영해서 구하는 평균이다.
산술평균은 모든 자료값의 비중이 동일하다고 가정한다. 하지만 현실에서는 값마다 중요도(가중치, weight)가 다른 경우가 많다. 예를 들어 성적처럼 과목마다 이수 학점이 다르면, 학점이 큰 과목의 점수를 더 크게 반영해야 공정한 평균이 나온다. 이럴 때 쓰는 것이 가중평균(weighted mean)이다.
- : 가중평균 (아래 첨자 는 weight, 가중치의 약자)
- : 번째 자료값에 매겨진 가중치 (여기서는 이수 학점)
- : 번째 자료값 (여기서는 과목 점수)
한 학생이 국어(3학점, 90점), 영어(2학점, 85점), 수학(4학점, 78점)을 들었다고 하자. 학점을 고려하지 않은 단순 평균은 점이지만, 실제 성적표에서 쓰는 가중평균은 다음과 같이 계산한다.
결과 해석: 단순 평균(84.33점)과 가중평균(83.56점)이 다르게 나왔다. 학점이 가장 큰 수학(4학점) 점수가 상대적으로 낮았기 때문에, 학점을 반영한 가중평균이 단순 평균보다 낮아졌다. 학점이 큰 과목의 영향력이 더 커진 것이다.
중앙값: 줄을 세웠을 때 한가운데 값
쉽게 말하면: 자료를 크기순으로 세웠을 때 정확히 가운데에 오는 값이다.
중앙값(median)은 자료를 오름차순으로 정렬했을 때 정중앙에 위치하는 값이다. 자료 개수 이 홀수인지 짝수인지에 따라 계산법이 다르다.
- 이 홀수면, 정렬한 자료의 번째 값이 중앙값이다.
- 이 짝수면, 가운데에 오는 두 값( 번째와 번째)의 평균이 중앙값이다.
8명 점수는 이미 오름차순 정렬되어 있다: 62, 68, 71, 75, 75, 80, 85, 92. 은 짝수이므로 4번째 값(75)과 5번째 값(75)의 평균을 구한다.
결과 해석: 중앙값 75점은 산술평균 76점과 거의 비슷하다. 이는 이 자료가 한쪽으로 크게 치우치지 않은, 비교적 고른 분포임을 시사한다. 평균과 중앙값이 크게 차이 나면 극단값이나 비대칭 분포를 의심해야 하는데, 이 내용은 바로 다음 소절에서 다룬다.
사분위수: 자료를 넷으로 나누는 세 지점
쉽게 말하면: 중앙값이 자료를 반으로 가르는 값이라면, 사분위수는 자료를 4등분하는 세 개의 경계값이다.
사분위수(quartile)는 정렬된 자료를 4등분하는 세 값 , , 을 말한다. 는 중앙값과 같다. (제1사분위수, 하위 25퍼센트 지점)은 중앙값보다 아래쪽 절반 자료의 중앙값이고, (제3사분위수, 상위 25퍼센트 지점)은 중앙값보다 위쪽 절반 자료의 중앙값이다.
8명 점수를 중앙값 기준으로 반씩 나누면 다음과 같다.
- 하위 절반: 62, 68, 71, 75
- 상위 절반: 75, 80, 85, 92
결과 해석: 점, 점이라는 뜻은, 이 반 학생의 하위 25퍼센트는 69.5점 이하, 상위 25퍼센트는 82.5점 이상이라는 의미다. 을 사분위범위라 부르며, 이는 06편에서 산포도로 다시 다룬다.
최빈값: 가장 자주 나오는 값
쉽게 말하면: 자료 중 가장 많이 등장한 값이다.
최빈값(mode)은 자료에서 빈도(frequency)가 가장 높은 값이다. 8명 점수 중 75점이 두 번(학생 4, 5) 등장해 다른 값보다 빈도가 높으므로, 최빈값은 75다.
최빈값은 평균·중앙값과 달리 질적 변수(03편 참고: 명목·서열 척도로 측정한 자료)에도 쓸 수 있다는 특징이 있다. 예를 들어 “가장 선호하는 색깔”처럼 숫자로 평균을 낼 수 없는 자료도 최빈값은 구할 수 있다. 반대로 모든 값이 한 번씩만 나오면 최빈값이 없고(무최빈), 빈도가 같은 값이 여러 개면 최빈값이 여러 개(다봉, multimodal)일 수도 있다.
극단값과 척도 선택: 언제 어떤 대표값을 쓸까
쉽게 말하면: 평균은 극단값에 쉽게 흔들리지만, 중앙값은 잘 흔들리지 않는다. 자료에 극단값이 있으면 중앙값을 우선 고려한다.
극단값(outlier)이란 나머지 자료와 동떨어지게 크거나 작은 값을 말한다. 산술평균은 모든 자료를 더해서 나누는 방식이라, 극단값 하나가 전체 평균을 크게 끌어올리거나 끌어내릴 수 있다. 반면 중앙값은 “가운데 순서”만 보기 때문에 극단값의 크기 자체에는 영향을 받지 않는다.
예를 들어 8명 점수 중 92점이 오타로 992점이 되었다고 가정하자.
평균은 76점에서 188.5점으로 완전히 뒤틀렸다. 하지만 중앙값은 정렬 순서상 여전히 4번째·5번째 값인 75, 75의 평균, 즉 75점 그대로다. 이처럼 극단값이 있을 때는 중앙값이 산술평균보다 자료를 더 안정적으로 대표한다. 대표적인 실생활 예가 가구 소득 통계다. 소수의 초고소득 가구가 평균 소득을 크게 끌어올리기 때문에, 뉴스에서 소득을 이야기할 때 “평균 소득”보다 “중위 소득”(중앙값)을 더 자주 인용하는 이유가 여기에 있다.
아래 표로 언제 어떤 대표값을 우선할지 정리한다.
| 상황 | 우선 고려할 대표값 | 이유 |
|---|---|---|
| 극단값이 없고 자료가 대칭적 | 산술평균 | 모든 자료 정보를 반영해 통계적으로 다루기 쉬움 |
| 극단값이 있거나 자료가 심하게 치우침 | 중앙값 | 극단값의 영향을 받지 않음 |
| 질적 변수(명목·서열 척도) | 최빈값 | 평균·중앙값 계산 자체가 불가능한 경우가 많음 |
| ”가장 흔한 선택”이 궁금할 때 | 최빈값 | 빈도 자체가 관심 대상 |
그룹화 자료의 평균·중앙값 근사
쉽게 말하면: 원자료 없이 도수분포표만 있을 때는, 각 계급의 대푯값(계급값)으로 원자료를 대신해서 근사 계산한다.
04편에서 다룬 도수분포표처럼, 원자료 하나하나가 아니라 계급(class interval)별 도수(frequency)만 주어질 때가 있다. 이런 그룹화 자료(grouped data)에서는 정확한 평균·중앙값을 구할 수 없고, 각 계급의 중간값인 계급값(class mark, 계급의 최솟값과 최댓값의 평균)을 그 계급에 속한 모든 자료의 대표값으로 가정해 근사한다.
앞서 쓴 8명 점수를 계급 폭 10점 단위로 묶으면 다음 도수분포표가 된다.
| 계급 | 계급값 | 도수() |
|---|---|---|
| 60–69 | 64.5 | 2 |
| 70–79 | 74.5 | 3 |
| 80–89 | 84.5 | 2 |
| 90–99 | 94.5 | 1 |
그룹화 자료의 평균 근사
- : 번째 계급의 도수
- : 번째 계급의 계급값
- : 전체 도수의 합 ()
결과 해석: 원자료로 구한 정확한 평균은 76점이었는데, 그룹화 자료 근사값은 77점으로 1점 차이가 난다. 이는 계급값(구간의 중간)이 실제 값을 완벽히 대신하지 못하기 때문에 생기는 근사 오차다. 계급 폭이 좁을수록 이 오차는 줄어든다.
그룹화 자료의 중앙값 근사
그룹화 자료의 중앙값은 중앙값이 속한 계급(중앙값 계급)을 찾은 뒤, 그 계급 안에서 누적도수가 선형으로 고르게 분포한다고 가정하고 다음 식으로 보간한다.
- : 중앙값이 속한 계급의 하한 경계값
- : 전체 도수의 합
- : 중앙값 계급 바로 이전까지의 누적도수
- : 중앙값 계급의 도수
- : 계급 폭
위 표에서 다. 누적도수를 보면 60–69 계급까지 누적 2, 70–79 계급까지 누적 이므로, 누적도수가 4를 처음 넘는 계급인 70–79가 중앙값 계급이다. 여기서 (70의 하한 경계, 계급 사이 경계는 정수 자료 기준으로 0.5를 뺀 값), , , 이다.
결과 해석: 정확한 중앙값 75점과 근사값 76.17점 사이에 약 1.17점의 오차가 있다. 그룹화 자료 근사는 원자료가 없을 때 어쩔 수 없이 쓰는 방법이며, 시험에서는 공식에 값을 정확히 대입하는 절차 자체가 채점 포인트가 된다.
자주 틀리는 점
- 평균과 중앙값을 혼동한다. “정중앙에 있는 값”은 중앙값이지 평균이 아니다. 자료가 비대칭이면 두 값은 다르게 나온다.
- 짝수 개 자료의 중앙값에서 평균 내는 것을 빠뜨린다. 이 짝수면 가운데 두 값의 평균을 내야 하는데, 둘 중 하나만 답으로 쓰는 실수가 잦다.
- 가중평균을 단순 평균처럼 계산한다. 가중치를 무시하고 으로 계산하면 틀린다. 반드시 를 써야 한다.
- 그룹화 자료 중앙값 공식에서 을 계급의 시작 숫자 그대로 쓴다. 정수 자료(60, 61, …, 69)라면 계급 경계는 59.5–69.5처럼 0.5를 보정한 값을 써야 하는 것이 원칙이다. 다만 독학사 수준 문제에서는 계급 경계가 이미 표에 제시되는 경우가 많으므로, 표에 주어진 경계값을 그대로 로 쓰면 된다.
- 극단값이 있는데도 무조건 평균만 계산한다. 문제에서 “극단값이 있다”, “왜곡되었다” 같은 표현이 나오면 중앙값을 우선 검토해야 한다.
핵심 정리
- 산술평균은 , 모든 자료를 동일한 비중으로 반영한다.
- 가중평균은 , 값마다 중요도가 다를 때 쓴다.
- 중앙값은 정렬된 자료의 정가운데 값(짝수 개면 가운데 두 값의 평균)이며, 극단값에 영향을 받지 않는다.
- 사분위수 , 은 자료를 4등분하는 경계값이고, 최빈값은 가장 빈도가 높은 값이다.
- 그룹화 자료에서는 계급값·계급 경계를 이용해 평균·중앙값을 근사하며, 이는 원자료 대비 오차를 동반한다.
마무리 복습
참고 자료
- Introduction to Applied Statistics: Lecture Notes — 기술통계(중심경향·산포) 단원 구조와 예제 흐름 참고
- 국가평생교육진흥원 독학학위제 — 기초통계학 출제범위 중 중심경향치 항목 확인