Skip to Content
독학사독학사 1단계기초통계학19. 카이제곱 검정: 적합도·독립성 검정

이번 문서의 목표: 이 문서를 다 읽으면 범주형 자료가 주어졌을 때 적합도 검정과 독립성 검정을 구분하고, 각 칸의 기대도수를 정확히 계산해 카이제곱 통계량과 자유도를 구한 뒤 결론까지 내릴 수 있다.

이 편에서 하는 일

지금까지 다룬 검정(18편·19편)은 모두 평균·비율·분산처럼 숫자로 된 값을 비교했다. 이번 편에서 다루는 카이제곱 검정(chi-square test, 그리스 문자 χ\chi(카이)를 제곱한 값을 쓰는 검정)은 “관찰된 도수(count, 개수)가 기대한 도수와 얼마나 다른가”를 다룬다. 즉 대상이 범주형 자료(categorical data, 성별·혈액형·선호 브랜드처럼 숫자가 아니라 범주로 나뉘는 자료)라는 점이 이전 두 편과 다르다. 13편에서 배운 카이제곱분포가 여기서 검정통계량의 분포로 실제 쓰인다.

쉽게 말하면: 실제로 세어 보니 나온 숫자(관찰도수)와, 원래 그래야 한다고 기대했던 숫자(기대도수)의 차이를 하나의 점수로 합쳐 “이 정도 차이는 우연이라 보기엔 너무 크다”를 판정한다.

카이제곱 통계량: 하나의 공식, 두 가지 쓰임

공식과 뜻

적합도 검정이든 독립성 검정이든 카이제곱 통계량의 계산 방식은 완전히 같다.

χ2=(OiEi)2Ei\chi^2 = \sum \frac{(O_i - E_i)^2}{E_i}
  • χ2\chi^2 (카이제곱): 관찰도수와 기대도수의 차이를 합산한 검정통계량
  • OiO_i (observed, 관찰도수): 실제로 자료에서 센 ii번째 칸의 개수
  • EiE_i (expected, 기대도수): 귀무가설이 맞다고 가정했을 때 이론적으로 기대되는 ii번째 칸의 개수
  • \sum (시그마, 모두 더하라는 기호): 모든 칸에 대해 (OiEi)2/Ei(O_i-E_i)^2/E_i 를 구해 다 더한다

각 칸에서 관찰도수와 기대도수의 차이를 제곱해서 기대도수로 나누는 이유는, 차이의 부호(더 많음/더 적음)를 없애면서도(제곱), 원래 기대되는 규모가 큰 칸에서 생긴 차이보다 작은 칸에서 생긴 같은 크기의 차이를 상대적으로 더 크게 반영하기 위해서다(기대도수로 나눔). 예를 들어 기대도수 100인 칸에서 차이 10과, 기대도수 5인 칸에서 차이 10은 후자가 훨씬 더 심각한 어긋남이다.

카이제곱분포와 자유도

이렇게 계산한 χ2\chi^2 값은 자유도(degree of freedom)가 정해진 카이제곱분포를 따른다. 카이제곱분포는 항상 0 이상의 값만 가지며 오른쪽으로 긴 꼬리를 가진 분포이므로, 카이제곱 검정의 기각역은 오른쪽 꼬리 한쪽에만 있다. “차이가 크다”는 것은 항상 χ2\chi^2 값이 크다는 뜻이지, 방향(더 많다/적다)의 개념이 없기 때문이다.

자주 틀리는 점: 다른 검정에서 배운 “양측이냐 단측이냐”의 구분을 카이제곱 검정에 그대로 적용하려는 실수가 많다. 카이제곱 검정은 OOEE의 차이를 제곱해 부호를 없애 버렸으므로 애초에 방향이라는 개념이 없다. 기각역은 예외 없이 오른쪽 꼬리 하나뿐이다.

적합도 검정: 자료가 특정 분포를 따르는가

언제 쓰는가

적합도 검정(goodness-of-fit test)은 “이 자료가 특정한 이론적 비율(또는 분포)을 따른다고 볼 수 있는가”를 검정한다. 예를 들어 주사위가 공정한지(6개 눈이 각각 1/6씩 나오는지), 어느 매장의 요일별 방문객 비율이 예상한 비율과 같은지를 확인할 때 쓴다.

자유도

적합도 검정의 자유도는 범주의 개수 kk 에서 1을 뺀 값이다.

df=k1df = k - 1
  • kk: 범주(칸)의 개수
  • 1-1: 전체 도수의 합이 이미 정해져 있으므로(OiO_i 들의 합이 표본크기로 고정), 마지막 칸의 기대도수는 나머지 칸이 정해지면 자동으로 결정되어 자유롭게 정할 수 없기 때문이다

예제로 다섯 단계 밟기

한 주사위를 120번 굴려 나온 눈의 도수가 아래와 같았다. 유의수준 α=0.05\alpha = 0.05 에서 이 주사위가 공정한지(각 눈이 같은 확률로 나오는지) 검정한다.

123456합계
관찰도수 OiO_i251715232416120

공정한 주사위라면 각 눈이 나올 확률은 1/61/6 이므로, 기대도수는 모든 칸에서 120×1/6=20120 \times 1/6 = 20 으로 동일하다.

123456합계
기대도수 EiE_i202020202020120

기대도수의 합(120)이 관찰도수의 합(120)과 정확히 같은지 먼저 확인한다. 같으므로 다음 단계로 넘어간다.

  1. 가설 설정 H0:각 눈이 나올 확률은 모두 1/6이다 (공정하다)H_0: \text{각 눈이 나올 확률은 모두 } 1/6 \text{이다 (공정하다)} H1:적어도 한 눈의 확률이 1/6과 다르다 (공정하지 않다)H_1: \text{적어도 한 눈의 확률이 } 1/6 \text{과 다르다 (공정하지 않다)}
  2. 유의수준: α=0.05\alpha = 0.05, 자유도 df=k1=61=5df = k-1 = 6-1 = 5
  3. 검정통계량: 칸마다 (OiEi)2/Ei(O_i-E_i)^2/E_i 를 구해 더한다. (2520)220=2520=1.25\frac{(25-20)^2}{20} = \frac{25}{20} = 1.25 (1720)220=920=0.45\frac{(17-20)^2}{20} = \frac{9}{20} = 0.45 (1520)220=2520=1.25\frac{(15-20)^2}{20} = \frac{25}{20} = 1.25 (2320)220=920=0.45\frac{(23-20)^2}{20} = \frac{9}{20} = 0.45 (2420)220=1620=0.80\frac{(24-20)^2}{20} = \frac{16}{20} = 0.80 (1620)220=1620=0.80\frac{(16-20)^2}{20} = \frac{16}{20} = 0.80 이 여섯 값을 모두 더하면 χ2=1.25+0.45+1.25+0.45+0.80+0.80=5.00\chi^2 = 1.25+0.45+1.25+0.45+0.80+0.80 = 5.00
  4. 기각역/p값 판정: 자유도 5인 카이제곱분포에서 α=0.05\alpha=0.05 의 임계값은 χ0.052(5)=11.07\chi^2_{0.05}(5) = 11.07 이다. 계산된 χ2=5.00\chi^2 = 5.0011.0711.07 보다 작으므로 기각역 밖에 있다. p값으로 확인해도 자유도 5, χ2=5.00\chi^2=5.00 에서 p0.416p \approx 0.416 으로 α=0.05\alpha=0.05 보다 훨씬 크다. 두 판정이 일치한다.
  5. 결론: 귀무가설을 기각하지 않는다. 관찰된 눈의 분포는 공정한 주사위에서 우연히 나올 수 있는 변동의 범위 안에 있다고 볼 수 있다.

독립성 검정: 두 범주형 변수가 서로 관련이 있는가

언제 쓰는가

독립성 검정(test of independence)은 교차표(contingency table, 두 범주형 변수를 행과 열로 교차시켜 만든 표)에서 “두 변수가 서로 독립인가, 아니면 관련이 있는가”를 검정한다. 예를 들어 “성별과 특정 상품 선호도 사이에 관련이 있는가”가 전형적인 질문이다.

기대도수 계산: 셀마다 직접

교차표에서 칸 (i,j)(i,j)(행 ii, 열 jj)의 기대도수는 다음 공식으로 구한다. 이 공식은 “두 변수가 독립이라면, 어떤 칸의 비율은 그 행의 합과 열의 합에서 결정되는 확률의 곱과 같아야 한다”는 독립성의 정의를 그대로 숫자로 옮긴 것이다.

Eij=(행 i의 합)×(열 j의 합)전체 합E_{ij} = \frac{(\text{행 } i \text{의 합}) \times (\text{열 } j \text{의 합})}{\text{전체 합}}
  • EijE_{ij}: 행 ii, 열 jj 칸의 기대도수
  • 행의 합, 열의 합: 해당 행 또는 열에 속한 모든 관찰도수의 합
  • 전체 합: 교차표 전체 관찰도수의 총합

자유도

독립성 검정의 자유도는 행의 개수 rr 과 열의 개수 cc 로 정해진다.

df=(r1)(c1)df = (r-1)(c-1)
  • rr: 교차표의 행 개수
  • cc: 교차표의 열 개수
  • 이 값이 이런 형태인 이유는, 각 행의 합과 각 열의 합이 이미 고정되어 있는 상태에서 자유롭게 값을 정할 수 있는 칸은 전체 r×cr \times c 칸 중 가로·세로 마지막 줄을 뺀 (r1)×(c1)(r-1) \times (c-1) 칸뿐이기 때문이다. 나머지 칸은 행 합·열 합을 맞추기 위해 자동으로 결정된다

기대도수 조건

카이제곱 근사가 정확하려면 모든 칸의 기대도수가 5 이상이어야 한다는 것이 일반적인 기준이다. 기대도수가 5 미만인 칸이 있으면 근사가 부정확해지므로, 인접한 범주를 합치거나 다른 검정(예: 피셔의 정확검정)을 고려해야 한다. 독학사 시험 수준에서는 이 조건을 “왜 확인해야 하는지” 이해하고 있으면 충분하다.

예제로 다섯 단계 밟기: 교차표 전체를 채운다

성별과 특정 온라인 강의 선호 여부를 조사해 아래 교차표(관찰도수)를 얻었다. 유의수준 α=0.05\alpha=0.05 에서 “성별과 강의 선호 여부는 독립인지” 검정한다.

구분선호함선호하지 않음행 합계
남성302050
여성452570
열 합계7545120

먼저 칸마다 기대도수를 전부 계산한다.

E남,선호=50×75120=3750120=31.25E_{\text{남,선호}} = \frac{50 \times 75}{120} = \frac{3750}{120} = 31.25 E남,비선호=50×45120=2250120=18.75E_{\text{남,비선호}} = \frac{50 \times 45}{120} = \frac{2250}{120} = 18.75 E여,선호=70×75120=5250120=43.75E_{\text{여,선호}} = \frac{70 \times 75}{120} = \frac{5250}{120} = 43.75 E여,비선호=70×45120=3150120=26.25E_{\text{여,비선호}} = \frac{70 \times 45}{120} = \frac{3150}{120} = 26.25

기대도수 표로 정리하면 다음과 같다.

구분선호함선호하지 않음행 합계
남성31.2518.7550
여성43.7526.2570
열 합계75.0045.00120

기대도수의 행 합계·열 합계가 관찰도수의 행 합계·열 합계와 정확히 같은지 확인한다: 31.25+18.75=5031.25+18.75=50, 43.75+26.25=7043.75+26.25=70, 31.25+43.75=7531.25+43.75=75, 18.75+26.25=4518.75+26.25=45, 전체 합 31.25+18.75+43.75+26.25=12031.25+18.75+43.75+26.25=120. 관찰도수 전체 합 120과 일치하므로 검산 통과다. 네 칸 모두 기대도수가 5 이상이므로 근사 조건도 충족한다.

  1. 가설 설정 H0:성별과 강의 선호 여부는 독립이다 (관련 없다)H_0: \text{성별과 강의 선호 여부는 독립이다 (관련 없다)} H1:성별과 강의 선호 여부는 독립이 아니다 (관련 있다)H_1: \text{성별과 강의 선호 여부는 독립이 아니다 (관련 있다)}
  2. 유의수준: α=0.05\alpha=0.05, 자유도 df=(r1)(c1)=(21)(21)=1df=(r-1)(c-1)=(2-1)(2-1)=1
  3. 검정통계량: 네 칸의 (OE)2/E(O-E)^2/E 를 각각 구한다. (3031.25)231.25=1.562531.25=0.05\frac{(30-31.25)^2}{31.25} = \frac{1.5625}{31.25} = 0.05 (2018.75)218.75=1.562518.750.0833\frac{(20-18.75)^2}{18.75} = \frac{1.5625}{18.75} \approx 0.0833 (4543.75)243.75=1.562543.750.0357\frac{(45-43.75)^2}{43.75} = \frac{1.5625}{43.75} \approx 0.0357 (2526.25)226.25=1.562526.250.0595\frac{(25-26.25)^2}{26.25} = \frac{1.5625}{26.25} \approx 0.0595 네 값을 더하면 χ2=0.05+0.0833+0.0357+0.05950.229\chi^2 = 0.05+0.0833+0.0357+0.0595 \approx 0.229
  4. 기각역/p값 판정: 자유도 1인 카이제곱분포에서 α=0.05\alpha=0.05 의 임계값은 χ0.052(1)=3.841\chi^2_{0.05}(1)=3.841 이다. 계산된 χ20.229\chi^2 \approx 0.2293.8413.841 보다 훨씬 작으므로 기각역 밖에 있다. p값으로 확인해도 자유도 1, χ20.229\chi^2 \approx 0.229 에서 p0.632p \approx 0.632α=0.05\alpha=0.05 보다 크다. 두 판정이 일치한다.
  5. 결론: 귀무가설을 기각하지 않는다. 표본에서 관찰된 남녀 간 선호 비율의 차이는, 성별과 강의 선호 여부가 서로 관련이 있다고 볼 만큼 크지 않다. 즉 이 조사 결과만으로는 두 변수가 독립이 아니라고 말할 통계적 근거가 부족하다.

적합도 검정과 독립성 검정 비교

구분적합도 검정독립성 검정
무엇을 묻는가자료가 특정 이론적 비율(분포)을 따르는가두 범주형 변수가 서로 관련이 있는가
자료 형태범주 하나에 대한 도수표두 변수를 교차시킨 교차표
기대도수 계산전체 표본크기 × 이론적 비율(행 합계 × 열 합계) ÷ 전체 합
자유도k1k-1 (범주 개수 − 1)(r1)(c1)(r-1)(c-1) (행–1, 열–1의 곱)
공통점검정통계량 공식, 기각역이 오른쪽 꼬리 하나뿐이라는 점은 동일좌동

자주 틀리는 점 모음

  • 기대도수의 합이 관찰도수의 합과 다르게 계산된다. 계산 실수가 있으면 두 합이 어긋난다. 항상 계산 직후 전체 합을 비교해 검산한다.
  • 독립성 검정의 자유도를 r×cr \times c 로 착각한다. 올바른 자유도는 (r1)(c1)(r-1)(c-1) 이다. 위 예제처럼 2×22\times2 표는 자유도가 11 이지 44 가 아니다.
  • 적합도 검정의 자유도에서 1-1 을 빠뜨린다. 범주가 6개면 자유도는 5이지 6이 아니다.
  • 기대도수가 5 미만인 칸을 확인하지 않고 그대로 검정한다. 근사 조건을 벗어나면 카이제곱분포로 근사한 p값 자체가 부정확해진다.
  • 카이제곱 검정에 단측·양측 개념을 적용하려 한다. 기각역은 항상 오른쪽 꼬리 하나뿐이며, 방향의 개념 자체가 없다.

핵심 정리

  • 카이제곱 통계량은 χ2=(OiEi)2/Ei\chi^2 = \sum (O_i-E_i)^2/E_i 로 계산하며, 적합도·독립성 검정 모두 같은 공식을 쓴다.
  • 기각역은 항상 오른쪽 꼬리 하나이며, 계산 직후 기대도수 합이 관찰도수 합과 같은지 반드시 검산한다.
  • 적합도 검정의 자유도는 k1k-1, 독립성 검정의 자유도는 (r1)(c1)(r-1)(c-1) 이다.
  • 독립성 검정의 기대도수는 칸마다 (행 합계 × 열 합계) ÷ 전체 합으로 따로 계산해야 한다.
  • 모든 칸의 기대도수가 5 이상이어야 카이제곱 근사가 정확하다는 조건을 확인한다.

마무리 복습

문제 14지선다
카이제곱 검정의 기각역에 대한 설명으로 옳은 것은?
문제 24지선다
4개 범주로 이루어진 자료로 적합도 검정을 할 때 자유도로 옳은 것은?
문제 34지선다
3행 4열로 이루어진 교차표로 독립성 검정을 할 때 자유도로 옳은 것은?
문제 44지선다
교차표에서 어느 행의 합계가 60, 어느 열의 합계가 90, 전체 합계가 200일 때 그 칸의 기대도수는? (반올림 없음)
문제 54지선다
어느 칸의 관찰도수가 O=40, 기대도수가 E=25일 때 이 칸이 카이제곱 통계량에 기여하는 값 (O-E)^2/E는? (반올림 없음)
문제 64지선다
적합도 검정에서 기대도수를 모두 더한 값과 반드시 같아야 하는 것은?
문제 74지선다
2행 2열 교차표에서 모든 칸의 기대도수가 3, 2, 4, 3으로 계산되었다. 이 결과에 대한 올바른 판단은?

참고 자료

Last updated on