이번 문서의 목표: 이 문서를 다 읽으면 “두 집단을 비교하라”는 문제를 받았을 때 독립표본인지 대응표본인지부터 판단하고, 등분산 가정 여부를 확인해 올바른 검정통계량으로 평균·비율·분산 비교 검정을 끝까지 풀 수 있다.
이 편에서 하는 일
18편에서는 모집단 하나의 평균·비율을 어떤 값과 비교했다. 이번 편은 모집단 둘을 서로 비교한다. “신약을 먹은 그룹과 안 먹은 그룹의 평균 회복 시간이 다른가”, “남녀 지지율에 차이가 있는가”, “두 공정의 산포가 같은가” 같은 문제가 여기에 해당한다. 검정 절차의 다섯 단계 틀(가설 설정 → 유의수준 → 검정통계량 → 기각역/p값 → 결론)은 18편과 동일하며, 이번 편의 핵심은 상황을 정확히 분류해 올바른 공식을 고르는 것이다.
쉽게 말하면: 두 집단이 서로 남남인지(독립표본), 같은 대상을 전후로 비교한 것인지(대응표본)를 먼저 가르고, 그다음 각 상황에 맞는 공식으로 차이를 검정한다.
독립표본과 대응표본: 가장 먼저 갈리는 갈림길
두 상황이 왜 다른가
독립표본(independent samples, 서로 관련 없는 두 집단에서 각각 뽑은 표본)은 두 그룹의 개체가 완전히 다른 대상이다. 예를 들어 남학생 30명과 여학생 30명의 시험 점수를 비교하는 경우, 어떤 남학생과 어떤 여학생을 짝지을 이유가 없다.
대응표본(paired samples, 같은 대상을 두 번 측정하거나 자연스럽게 짝지어진 표본)은 개체 하나하나가 짝을 이룬다. 예를 들어 다이어트 프로그램 참가자 20명의 “시작 전 체중”과 “6주 후 체중”을 비교하는 경우, 같은 사람의 전후 값이므로 자연스럽게 짝이 생긴다. 이 짝은 개인차(원래 체중이 높은 사람은 전후 모두 높게 나오는 경향 등)를 공유하기 때문에, 독립표본처럼 취급하면 이 개인차가 잡음으로 섞여 들어가 검정의 정확도가 떨어진다.
판단 기준을 표로 정리
| 구분 | 판단 근거 | 검정통계량이 보는 대상 | 예시 |
|---|---|---|---|
| 독립표본 | 두 그룹의 개체가 서로 무관 | 두 표본평균의 차이 | 남녀 지지율, 두 회사 제품의 수명 |
| 대응표본 | 같은 개체를 전후로 측정, 또는 자연스러운 짝 | 짝별 차이값의 평균 | 다이어트 전후 체중, 교육 전후 점수 |
자주 틀리는 점: 문제에 “두 그룹”이라는 말이 나온다고 무조건 독립표본으로 단정하면 안 된다. “같은 사람을”, “같은 기계를”, “전 · 후” 같은 표현이 있으면 대응표본이다. 대응표본인데 독립표본 공식을 쓰면 개인차가 표준오차에 그대로 섞여 들어가 검정력(power, 실제로 차이가 있을 때 그 차이를 찾아낼 능력)이 부당하게 낮아진다.
두 모평균 비교 — 독립표본
등분산인지 이분산인지부터 확인
독립표본 t검정은 두 모집단의 분산이 같다고 볼 수 있는지(등분산 가정)에 따라 공식이 갈린다. 등분산 여부는 문제에서 “두 모집단의 분산은 같다고 가정한다”처럼 직접 알려주거나, 20편 이전 단원에서 배운 두 분산 비교 검정(이 편의 뒷부분)으로 먼저 확인한다.
등분산을 가정할 때는 두 표본의 분산을 하나로 합친 합동분산(pooled variance) 을 쓴다.
- : 두 표본의 크기
- : 두 표본의 분산(각각 자유도 , 로 계산)
- 분모의 : 합동분산의 자유도. 두 표본에서 각각 평균 하나씩을 추정하는 데 자유도를 하나씩 썼으므로 전체 자유도에서 2를 뺀다
검정통계량은 다음과 같다.
- : 두 표본의 평균
- : 귀무가설이 보통 “두 모평균에 차이가 없다”()이므로 0을 뺀다
- 이 통계량은 자유도 인 t분포를 따른다
예제로 다섯 단계 밟기
두 학원 A, B의 모의고사 평균 점수를 비교한다. A학원 명의 평균 점, 분산 . B학원 명의 평균 점, 분산 . 두 모집단의 분산은 같다고 가정하며, 유의수준 에서 “두 학원의 평균이 다른지” 검정한다.
- 가설 설정: “다른지”만 물었으므로 양측검정이다.
- 유의수준: , 자유도
- 검정통계량: 먼저 합동분산을 구한다. 이어서 검정통계량을 계산한다.
- 기각역/p값 판정: 자유도 20인 t분포에서 양측 의 임계값은 이다. 계산된 은 보다 작으므로 기각역 밖에 있다. p값으로 확인하면 자유도 20인 t분포에서 로 보다 크다. 두 판정이 일치한다.
- 결론: 귀무가설을 기각하지 않는다. 두 학원의 평균 점수 차이 4점은, 표본크기와 산포를 고려할 때 통계적으로 유의한 차이라고 보기 어렵다.
두 모평균 비교 — 대응표본
차이값으로 문제를 바꾼다
대응표본은 짝별 차이 를 만들면, “차이값들의 모평균이 0인지”를 검정하는 단일 모평균 검정(18편)으로 그대로 환원된다. 즉 새로운 공식을 외울 필요 없이, 원자료 대신 차이값을 표본으로 삼아 18편의 t검정을 적용하면 된다.
- : 차이값들의 평균
- : 차이값들의 표본표준편차
- : 짝(대응)의 개수
- 자유도는 (차이값 하나짜리 표본을 다루므로 18편의 t검정과 동일한 자유도 규칙)
예제로 다섯 단계 밟기
수면 교육 프로그램 전후로 5명의 수면 시간(시간 단위)을 측정했다.
| 참가자 | 전 | 후 | 차이 = 후 − 전 |
|---|---|---|---|
| 1 | 6.0 | 6.8 | 0.8 |
| 2 | 5.5 | 6.0 | 0.5 |
| 3 | 7.0 | 7.4 | 0.4 |
| 4 | 6.2 | 6.5 | 0.3 |
| 5 | 5.8 | 6.8 | 1.0 |
유의수준 에서 “수면 시간이 늘었는지” 검정한다.
- 가설 설정: “늘었는지”는 방향이 있으므로 오른쪽 단측검정이다. 차이를 후 − 전으로 정의했으므로 늘었다면 의 모평균이 0보다 크다.
- 유의수준: , 자유도
- 검정통계량: 차이값의 평균은 차이값의 표본분산은 각 편차제곱합을 구해 계산한다. 편차는 이고 제곱합은 이다. 검정통계량은
- 기각역/p값 판정: 자유도 4, 오른쪽 단측 의 임계값은 다. 계산된 은 보다 크므로 기각역 안에 든다. p값은 로 보다 작다. 두 판정이 일치한다.
- 결론: 귀무가설을 기각한다. 유의수준 5퍼센트에서 수면 교육 프로그램 이후 수면 시간이 늘었다고 볼 통계적 근거가 있다.
두 모비율 비교
두 모집단의 비율을 비교할 때는 두 표본을 합쳐 만든 합동비율(pooled proportion) 를 표준오차 계산에 쓴다. 귀무가설이 “두 비율이 같다”()이므로, 그 공통값을 두 표본을 합쳐 추정하는 것이다.
- : 각 표본에서 특성을 가진 개체 수
- : 각 표본크기
- : 각 표본에서 따로 계산한 비율
- 이 통계량은 표준정규분포를 따른다(표본이 충분히 클 때)
두 모분산 비교: F검정
왜 F분포를 쓰는가
두 모집단의 분산이 같은지 검정할 때는 두 표본분산의 비율을 본다. 13편에서 배웠듯 F분포(F distribution)는 “두 카이제곱분포를 각자의 자유도로 나눈 뒤 그 비율을 취한 분포”로, 두 분산의 비율이 우연히 이 정도로 벌어질 수 있는지를 판단하는 데 알맞다.
- : 두 표본의 분산
- 관례상 큰 분산을 분자에 놓아 이 되게 계산한다(표에서 오른쪽 꼬리 값만 찾으면 되도록 하기 위함)
- 이 통계량은 자유도 인 F분포를 따른다. 분자의 자유도를 먼저, 분모의 자유도를 나중에 쓴다
예제로 다섯 단계 밟기
두 기계 A, B가 만드는 부품 지름의 산포를 비교한다. A기계 개 표본의 분산 , B기계 개 표본의 분산 . 유의수준 에서 “두 기계의 산포가 다른지” 검정한다.
- 가설 설정: “다른지”만 물었으므로 양측검정이다.
- 유의수준: , 양측이므로 위쪽 꼬리에
- 검정통계량: 큰 분산을 분자에 놓는다. 자유도는 분자 , 분모 다.
- 기각역/p값 판정: 자유도 (12, 9), 양측 의 위쪽 임계값은 이다. 계산된 은 보다 작으므로 기각역 밖에 있다. p값으로 확인해도 수준으로 양측 p값은 대략 이며 보다 크다. 두 판정이 일치한다.
- 결론: 귀무가설을 기각하지 않는다. 두 기계의 산포 차이는 표본크기를 고려할 때 통계적으로 유의하다고 보기 어렵다. (이 결과는 앞선 두 모평균 비교에서 “등분산을 가정한다”는 전제를 뒷받침하는 근거로도 쓰인다.)
자주 틀리는 점 모음
- 독립표본과 대응표본을 헷갈린다. “같은 대상을 전후로”, “짝지어진” 표현을 놓치면 대응표본을 독립표본처럼 계산해 자유도와 표준오차가 모두 틀어진다.
- 합동분산의 자유도를 로 잘못 쓴다. 두 표본에서 각각 평균을 추정하느라 자유도를 하나씩 잃으므로 반드시 다.
- F검정에서 분자·분모를 바꿔 자유도를 뒤섞는다. 분자에 놓은 표본의 자유도가 F분포 표기의 첫 번째 자유도다. 큰 분산을 분자에 놓는 관례를 지키지 않으면 이 나와 표를 찾기 어려워진다.
- 두 모비율 검정에서 합동비율 대신 각 표본의 비율을 따로 표준오차에 쓴다. 귀무가설이 “두 비율이 같다”고 전제하므로 공통값(합동비율)으로 표준오차를 계산해야 한다.
- 대응표본 차이값의 방향을 정의만 해두고 결론에서 반대로 해석한다. 후 − 전으로 정의했다면 은 “늘었다”는 뜻이다. 정의와 해석의 방향을 반드시 맞춰 확인한다.
핵심 정리
- 두 집단 비교는 독립표본인지 대응표본인지를 가장 먼저 가른다. 개체가 짝지어지면 대응표본이다.
- 독립표본 평균 비교는 등분산 가정 시 합동분산으로 표준오차를 만들고, 자유도는 다.
- 대응표본 평균 비교는 차이값 를 만들어 단일 모평균 t검정(18편)으로 그대로 환원한다.
- 두 모비율 비교는 표준오차 계산에 두 표본을 합친 합동비율을 쓴다.
- 두 모분산 비교는 F검정을 쓰며, 큰 분산을 분자에 놓아 자유도 인 F분포와 비교한다.