이번 문서의 목표: 이 문서를 다 읽으면 범주형 자료가 주어졌을 때 적합도 검정과 독립성 검정을 구분하고, 각 칸의 기대도수를 정확히 계산해 카이제곱 통계량과 자유도를 구한 뒤 결론까지 내릴 수 있다.
이 편에서 하는 일
지금까지 다룬 검정(18편·19편)은 모두 평균·비율·분산처럼 숫자로 된 값을 비교했다. 이번 편에서 다루는 카이제곱 검정(chi-square test, 그리스 문자 (카이)를 제곱한 값을 쓰는 검정)은 “관찰된 도수(count, 개수)가 기대한 도수와 얼마나 다른가”를 다룬다. 즉 대상이 범주형 자료(categorical data, 성별·혈액형·선호 브랜드처럼 숫자가 아니라 범주로 나뉘는 자료)라는 점이 이전 두 편과 다르다. 13편에서 배운 카이제곱분포가 여기서 검정통계량의 분포로 실제 쓰인다.
쉽게 말하면: 실제로 세어 보니 나온 숫자(관찰도수)와, 원래 그래야 한다고 기대했던 숫자(기대도수)의 차이를 하나의 점수로 합쳐 “이 정도 차이는 우연이라 보기엔 너무 크다”를 판정한다.
카이제곱 통계량: 하나의 공식, 두 가지 쓰임
공식과 뜻
적합도 검정이든 독립성 검정이든 카이제곱 통계량의 계산 방식은 완전히 같다.
- (카이제곱): 관찰도수와 기대도수의 차이를 합산한 검정통계량
- (observed, 관찰도수): 실제로 자료에서 센 번째 칸의 개수
- (expected, 기대도수): 귀무가설이 맞다고 가정했을 때 이론적으로 기대되는 번째 칸의 개수
- (시그마, 모두 더하라는 기호): 모든 칸에 대해 를 구해 다 더한다
각 칸에서 관찰도수와 기대도수의 차이를 제곱해서 기대도수로 나누는 이유는, 차이의 부호(더 많음/더 적음)를 없애면서도(제곱), 원래 기대되는 규모가 큰 칸에서 생긴 차이보다 작은 칸에서 생긴 같은 크기의 차이를 상대적으로 더 크게 반영하기 위해서다(기대도수로 나눔). 예를 들어 기대도수 100인 칸에서 차이 10과, 기대도수 5인 칸에서 차이 10은 후자가 훨씬 더 심각한 어긋남이다.
카이제곱분포와 자유도
이렇게 계산한 값은 자유도(degree of freedom)가 정해진 카이제곱분포를 따른다. 카이제곱분포는 항상 0 이상의 값만 가지며 오른쪽으로 긴 꼬리를 가진 분포이므로, 카이제곱 검정의 기각역은 오른쪽 꼬리 한쪽에만 있다. “차이가 크다”는 것은 항상 값이 크다는 뜻이지, 방향(더 많다/적다)의 개념이 없기 때문이다.
자주 틀리는 점: 다른 검정에서 배운 “양측이냐 단측이냐”의 구분을 카이제곱 검정에 그대로 적용하려는 실수가 많다. 카이제곱 검정은 와 의 차이를 제곱해 부호를 없애 버렸으므로 애초에 방향이라는 개념이 없다. 기각역은 예외 없이 오른쪽 꼬리 하나뿐이다.
적합도 검정: 자료가 특정 분포를 따르는가
언제 쓰는가
적합도 검정(goodness-of-fit test)은 “이 자료가 특정한 이론적 비율(또는 분포)을 따른다고 볼 수 있는가”를 검정한다. 예를 들어 주사위가 공정한지(6개 눈이 각각 1/6씩 나오는지), 어느 매장의 요일별 방문객 비율이 예상한 비율과 같은지를 확인할 때 쓴다.
자유도
적합도 검정의 자유도는 범주의 개수 에서 1을 뺀 값이다.
- : 범주(칸)의 개수
- : 전체 도수의 합이 이미 정해져 있으므로( 들의 합이 표본크기로 고정), 마지막 칸의 기대도수는 나머지 칸이 정해지면 자동으로 결정되어 자유롭게 정할 수 없기 때문이다
예제로 다섯 단계 밟기
한 주사위를 120번 굴려 나온 눈의 도수가 아래와 같았다. 유의수준 에서 이 주사위가 공정한지(각 눈이 같은 확률로 나오는지) 검정한다.
| 눈 | 1 | 2 | 3 | 4 | 5 | 6 | 합계 |
|---|---|---|---|---|---|---|---|
| 관찰도수 | 25 | 17 | 15 | 23 | 24 | 16 | 120 |
공정한 주사위라면 각 눈이 나올 확률은 이므로, 기대도수는 모든 칸에서 으로 동일하다.
| 눈 | 1 | 2 | 3 | 4 | 5 | 6 | 합계 |
|---|---|---|---|---|---|---|---|
| 기대도수 | 20 | 20 | 20 | 20 | 20 | 20 | 120 |
기대도수의 합(120)이 관찰도수의 합(120)과 정확히 같은지 먼저 확인한다. 같으므로 다음 단계로 넘어간다.
- 가설 설정
- 유의수준: , 자유도
- 검정통계량: 칸마다 를 구해 더한다. 이 여섯 값을 모두 더하면
- 기각역/p값 판정: 자유도 5인 카이제곱분포에서 의 임계값은 이다. 계산된 은 보다 작으므로 기각역 밖에 있다. p값으로 확인해도 자유도 5, 에서 으로 보다 훨씬 크다. 두 판정이 일치한다.
- 결론: 귀무가설을 기각하지 않는다. 관찰된 눈의 분포는 공정한 주사위에서 우연히 나올 수 있는 변동의 범위 안에 있다고 볼 수 있다.
독립성 검정: 두 범주형 변수가 서로 관련이 있는가
언제 쓰는가
독립성 검정(test of independence)은 교차표(contingency table, 두 범주형 변수를 행과 열로 교차시켜 만든 표)에서 “두 변수가 서로 독립인가, 아니면 관련이 있는가”를 검정한다. 예를 들어 “성별과 특정 상품 선호도 사이에 관련이 있는가”가 전형적인 질문이다.
기대도수 계산: 셀마다 직접
교차표에서 칸 (행 , 열 )의 기대도수는 다음 공식으로 구한다. 이 공식은 “두 변수가 독립이라면, 어떤 칸의 비율은 그 행의 합과 열의 합에서 결정되는 확률의 곱과 같아야 한다”는 독립성의 정의를 그대로 숫자로 옮긴 것이다.
- : 행 , 열 칸의 기대도수
- 행의 합, 열의 합: 해당 행 또는 열에 속한 모든 관찰도수의 합
- 전체 합: 교차표 전체 관찰도수의 총합
자유도
독립성 검정의 자유도는 행의 개수 과 열의 개수 로 정해진다.
- : 교차표의 행 개수
- : 교차표의 열 개수
- 이 값이 이런 형태인 이유는, 각 행의 합과 각 열의 합이 이미 고정되어 있는 상태에서 자유롭게 값을 정할 수 있는 칸은 전체 칸 중 가로·세로 마지막 줄을 뺀 칸뿐이기 때문이다. 나머지 칸은 행 합·열 합을 맞추기 위해 자동으로 결정된다
기대도수 조건
카이제곱 근사가 정확하려면 모든 칸의 기대도수가 5 이상이어야 한다는 것이 일반적인 기준이다. 기대도수가 5 미만인 칸이 있으면 근사가 부정확해지므로, 인접한 범주를 합치거나 다른 검정(예: 피셔의 정확검정)을 고려해야 한다. 독학사 시험 수준에서는 이 조건을 “왜 확인해야 하는지” 이해하고 있으면 충분하다.
예제로 다섯 단계 밟기: 교차표 전체를 채운다
성별과 특정 온라인 강의 선호 여부를 조사해 아래 교차표(관찰도수)를 얻었다. 유의수준 에서 “성별과 강의 선호 여부는 독립인지” 검정한다.
| 구분 | 선호함 | 선호하지 않음 | 행 합계 |
|---|---|---|---|
| 남성 | 30 | 20 | 50 |
| 여성 | 45 | 25 | 70 |
| 열 합계 | 75 | 45 | 120 |
먼저 칸마다 기대도수를 전부 계산한다.
기대도수 표로 정리하면 다음과 같다.
| 구분 | 선호함 | 선호하지 않음 | 행 합계 |
|---|---|---|---|
| 남성 | 31.25 | 18.75 | 50 |
| 여성 | 43.75 | 26.25 | 70 |
| 열 합계 | 75.00 | 45.00 | 120 |
기대도수의 행 합계·열 합계가 관찰도수의 행 합계·열 합계와 정확히 같은지 확인한다: , , , , 전체 합 . 관찰도수 전체 합 120과 일치하므로 검산 통과다. 네 칸 모두 기대도수가 5 이상이므로 근사 조건도 충족한다.
- 가설 설정
- 유의수준: , 자유도
- 검정통계량: 네 칸의 를 각각 구한다. 네 값을 더하면
- 기각역/p값 판정: 자유도 1인 카이제곱분포에서 의 임계값은 이다. 계산된 는 보다 훨씬 작으므로 기각역 밖에 있다. p값으로 확인해도 자유도 1, 에서 로 보다 크다. 두 판정이 일치한다.
- 결론: 귀무가설을 기각하지 않는다. 표본에서 관찰된 남녀 간 선호 비율의 차이는, 성별과 강의 선호 여부가 서로 관련이 있다고 볼 만큼 크지 않다. 즉 이 조사 결과만으로는 두 변수가 독립이 아니라고 말할 통계적 근거가 부족하다.
적합도 검정과 독립성 검정 비교
| 구분 | 적합도 검정 | 독립성 검정 |
|---|---|---|
| 무엇을 묻는가 | 자료가 특정 이론적 비율(분포)을 따르는가 | 두 범주형 변수가 서로 관련이 있는가 |
| 자료 형태 | 범주 하나에 대한 도수표 | 두 변수를 교차시킨 교차표 |
| 기대도수 계산 | 전체 표본크기 × 이론적 비율 | (행 합계 × 열 합계) ÷ 전체 합 |
| 자유도 | (범주 개수 − 1) | (행–1, 열–1의 곱) |
| 공통점 | 검정통계량 공식, 기각역이 오른쪽 꼬리 하나뿐이라는 점은 동일 | 좌동 |
자주 틀리는 점 모음
- 기대도수의 합이 관찰도수의 합과 다르게 계산된다. 계산 실수가 있으면 두 합이 어긋난다. 항상 계산 직후 전체 합을 비교해 검산한다.
- 독립성 검정의 자유도를 로 착각한다. 올바른 자유도는 이다. 위 예제처럼 표는 자유도가 이지 가 아니다.
- 적합도 검정의 자유도에서 을 빠뜨린다. 범주가 6개면 자유도는 5이지 6이 아니다.
- 기대도수가 5 미만인 칸을 확인하지 않고 그대로 검정한다. 근사 조건을 벗어나면 카이제곱분포로 근사한 p값 자체가 부정확해진다.
- 카이제곱 검정에 단측·양측 개념을 적용하려 한다. 기각역은 항상 오른쪽 꼬리 하나뿐이며, 방향의 개념 자체가 없다.
핵심 정리
- 카이제곱 통계량은 로 계산하며, 적합도·독립성 검정 모두 같은 공식을 쓴다.
- 기각역은 항상 오른쪽 꼬리 하나이며, 계산 직후 기대도수 합이 관찰도수 합과 같은지 반드시 검산한다.
- 적합도 검정의 자유도는 , 독립성 검정의 자유도는 이다.
- 독립성 검정의 기대도수는 칸마다 (행 합계 × 열 합계) ÷ 전체 합으로 따로 계산해야 한다.
- 모든 칸의 기대도수가 5 이상이어야 카이제곱 근사가 정확하다는 조건을 확인한다.