이번 문서의 목표: 이 파일을 다 읽으면 t분포·분포·F분포가 각각 무엇의 표본분포인지 설명하고, 상황에 맞는 자유도를 계산하며, 분포표를 읽어 임계값을 찾을 수 있다.
표준정규분포로는 부족한 상황: t분포가 필요한 이유
왜 필요한가
12편에서 배운 것처럼, 모표준편차 (시그마)를 알고 있다면 표본평균을 표준화한 는 정확히(또는 중심극한정리에 의해 근사적으로) 표준정규분포 을 따른다. 그런데 현실에서는 를 아는 경우가 거의 없다. 그래서 대신 표본에서 계산한 표본표준편차 (06편)를 대신 넣는다.
- : t통계량. 표본에서 매번 계산되는 확률변수다.
- : 표본표준편차. 의 추정값일 뿐 참값이 아니므로, 표본마다 조금씩 다르게 나온다.
자체가 표본마다 흔들리는 추정값이기 때문에, 는 보다 변동성이 더 크다. 이 추가된 불확실성을 반영한 분포가 바로 t분포(t-distribution)다.
쉽게 말하면: 모표준편차를 정확히 몰라서 표본표준편차로 대신 어림잡아 쓸 때, 그 어림짐작 때문에 생기는 여분의 불확실성까지 감안해서 만든 분포가 t분포다.
정의: 모양과 자유도
t분포는 표준정규분포처럼 0을 중심으로 좌우 대칭인 종 모양이지만, 양쪽 꼬리가 표준정규분포보다 더 두껍다(극단값이 나올 가능성을 더 높게 잡는다는 뜻이다). t분포의 모양은 자유도(degrees of freedom, df)라는 하나의 모수로 결정된다.
- : 자유도. 표본크기 에서 표본평균을 이미 계산하는 데 정보 하나를 “써버렸기” 때문에 이 된다(직관: 표본평균이 고정되면 개 값 중 개만 자유롭게 정해도 나머지 하나는 자동으로 결정되므로 “자유롭게 움직이는” 값의 개수가 이라는 뜻이다).
- 가 커질수록(즉 표본크기가 커질수록) t분포는 표준정규분포에 점점 가까워진다. 실무적으로 정도면 거의 구분이 안 될 만큼 비슷해진다.
계산 예시
어느 학원에서 학생 명을 뽑아 시험 점수를 조사했더니 표본평균 , 표본표준편차 이 나왔다. 모평균이 라는 주장을 검정하기 위한 t통계량을 계산해보자.
이 t값은 자유도 인 t분포를 따른다. 17~18편에서 이 값을 t표의 임계값과 비교해 가설을 기각할지 판단하는 절차를 다룬다.
분포: 분산의 표본분포
왜 필요한가
06편에서 배운 표본분산 도 표본마다 다른 값이 나오는 확률변수다. 표본분산이 모분산 주위로 어떻게 흩어지는지를 알아야 분산의 신뢰구간(16편)이나 분산 검정(19~20편)을 만들 수 있다. 이때 등장하는 분포가 카이제곱분포(분포)다.
쉽게 말하면: 표본에서 계산한 분산이 진짜 모분산과 얼마나 다르게 나올 수 있는지를 설명해 주는 분포다.
정의
- (카이제곱, chi-squared): 항상 0 이상의 값만 가지는 확률변수. 표준정규분포를 따르는 확률변수 개를 각각 제곱해서 더한 것과 같은 분포다(정의상 음수 제곱합이 나올 수 없어 왼쪽 경계가 0이다).
- : 표본분산, : 모분산
- : 자유도. 단일 표본에서 분산을 추정할 때는 이다.
분포는 t분포·표준정규분포와 달리 좌우 대칭이 아니라 오른쪽으로 긴 꼬리를 가진 비대칭 분포다. 자유도가 커질수록 점점 좌우 대칭인 종 모양에 가까워진다.
계산 예시
인 표본에서 표본분산이 로 나왔고 모분산이 이라고 알려져 있다고 하자.
이 값은 자유도 인 분포를 따르는 통계량이며, 16편의 분산 신뢰구간과 20편의 카이제곱 검정에서 이런 식으로 계산한 값을 카이제곱표의 임계값과 비교한다.
F분포: 두 분산의 비율
왜 필요한가
두 모집단의 분산이 같은지 비교하고 싶을 때가 있다(예: 두 반의 시험 점수 흩어짐이 비슷한가). 이때는 두 표본분산의 비율을 살펴본다. 두 독립된 분포를 각각의 자유도로 나눈 뒤 그 둘을 다시 비율로 만든 분포가 F분포다.
쉽게 말하면: “두 그룹 중 어느 쪽이 더 들쭉날쭉한가”를 판단하기 위해, 두 표본분산의 비율이 얼마나 1에서 벗어날 수 있는지를 설명하는 분포다.
정의
- : F통계량. 두 표본분산의 비율에서 유도된다. 두 모집단의 분산이 같다는 가정() 아래에서는 로 단순화된다.
- : 분자 쪽 표본의 자유도 ()
- : 분모 쪽 표본의 자유도 ()
- F분포는 분포처럼 0 이상의 값만 가지며 오른쪽으로 긴 꼬리를 가진 비대칭 분포다. F분포는 두 개의 자유도(분자, 분모)로 모양이 결정되는 점이 t분포·분포와 다르다.
계산 예시
A반 명의 표본분산이 , B반 명의 표본분산이 라고 하자. 두 모분산이 같다는 가정 아래 F통계량을 구한다(관행적으로 더 큰 분산을 분자에 놓는다).
이 값은 자유도 인 F분포를 따르는 통계량이며, F표에서 해당 자유도 쌍의 임계값과 비교해 “두 반의 분산이 같다”는 가정을 기각할지 19편에서 판단한다.
세 분포 대조표
| 구분 | t분포 | 분포 | F분포 |
|---|---|---|---|
| 무엇을 설명하는가 | 모표준편차를 모를 때 표준화한 평균 | 표본분산과 모분산의 비 | 두 표본분산의 비 |
| 모양 | 좌우 대칭, 표준정규분포보다 두꺼운 꼬리 | 오른쪽 꼬리를 가진 비대칭, 0 이상 | 오른쪽 꼬리를 가진 비대칭, 0 이상 |
| 자유도 개수 | 1개 | 1개 | 2개(분자, 분모) |
| 자유도가 커지면 | 표준정규분포에 수렴 | 좌우 대칭에 가까워짐 | 모양이 안정화됨 |
| 대표적 쓰임 | 단일·두 모평균 검정, 평균의 신뢰구간 | 단일 모분산 검정·신뢰구간, 적합도·독립성 검정 | 두 모분산 비교, 분산분석(참고 수준) |
| 관련 단원 | 15, 17–19편 | 16, 20편 | 19편 |
분포표 읽는 법
세 분포표 모두 “면적(확률)을 알고 있을 때 그에 대응하는 임계값(경계선 위치)을 찾는” 방식으로 쓴다는 점은 같지만, 표의 생김새는 서로 다르다.
| 표 | 가로축(열) | 세로축(행) | 표 안의 값 |
|---|---|---|---|
| 표준정규분포표(11편) | 소수점 둘째 자리 | 정수와 소수점 첫째 자리 | 누적확률 |
| t분포표 | 유의수준(꼬리 확률, 예: 0.05, 0.025, 0.01) | 자유도 | 임계값 |
| 분포표 | 유의수준(꼬리 확률) | 자유도 | 임계값 |
| F분포표 | 분자 자유도 | 분모 자유도 (표 자체가 유의수준별로 여러 장) | 임계값 |
t분포표와 분포표는 자유도 하나만 확인하면 행을 바로 찾을 수 있지만, F분포표는 자유도가 두 개이므로 먼저 유의수준에 맞는 표를 고른 다음, 분자 자유도로 열을, 분모 자유도로 행을 찾아 교차하는 값을 읽는다. 이 구조 때문에 F표는 유의수준별로 여러 장이 따로 존재한다.
어떤 분포를 언제 쓰는가: 판단 트리
자유도 계산 규칙: 상황별 표
자유도 계산 실수는 시험에서 가장 잦은 실수 중 하나다. 상황별로 정리한다.
| 상황 | 쓰는 분포 | 자유도 계산 | 비고 |
|---|---|---|---|
| 단일 모평균 검정·신뢰구간 ( 모름) | t분포 | 은 표본크기 | |
| 두 독립표본 평균 비교 (등분산 가정) | t분포 | 두 표본 각각 정보 하나씩 총 2개를 씀 | |
| 대응(짝지은) 표본 평균 비교 | t분포 | 는 차이값의 개수(=쌍의 수) | |
| 단일 모분산 검정·신뢰구간 | 분포 | ||
| 카이제곱 적합도 검정 | 분포 | 는 범주(칸)의 개수 | |
| 카이제곱 독립성 검정 | 분포 | 은 교차표의 행 개수, 는 열 개수 | |
| 두 모분산 비교 | F분포 | , | 자유도가 두 개(분자·분모) |
카이제곱 독립성 검정의 자유도 계산 예시: 교차표가 3행(행 개수 ) 4열(열 개수 )이라면 자유도는 다음과 같다.
- : 행 개수에서 1을 뺀 값
- : 열 개수에서 1을 뺀 값
- 곱하는 이유(직관): 교차표의 각 칸(cell)은 행의 합·열의 합이라는 제약을 만족해야 하므로, 행과 열 각각에서 “자유롭게 정할 수 있는” 개수를 곱한 만큼만 실제로 자유롭게 움직인다.
자주 틀리는 점
- t분포의 자유도를 으로 쓴다. 단일표본 t분포는 이지, 이 아니다. 표본평균을 계산하면서 정보 1개를 이미 소모했다는 점을 잊지 않는다.
- 두 독립표본 t검정의 자유도를 이나 하나만 쓴다. 등분산을 가정하는 경우 두 표본 각각에서 정보 1개씩을 쓰므로 가 맞다.
- 카이제곱 독립성 검정에서 자유도를 로 계산한다. 옳은 공식은 이다. 행 개수와 열 개수에서 각각 1씩 뺀 뒤 곱한다.
- F통계량을 만들 때 분자·분모를 마음대로 바꾼다. 어느 표본분산을 분자에 놓느냐에 따라 F값과 그에 대응하는 자유도 순서()가 함께 바뀐다는 점을 주의해야 한다. 관행적으로 더 큰 분산을 분자로 놓지만, 문제에서 순서를 지정했다면 그 순서를 그대로 따라야 한다.
- 분포와 F분포도 t분포·표준정규분포처럼 좌우 대칭일 것이라 생각한다. 이 둘은 0 이상의 값만 가지는 오른쪽 꼬리 분포이며, 표에서 임계값을 찾을 때 좌우 대칭을 가정한 지름길(예: 절댓값 처리)을 쓸 수 없다.
- 자유도가 커지면 t분포가 정규분포와 완전히 같아진다고 착각한다. 자유도가 커질수록 “가까워질” 뿐, 자유도가 유한한 한 t분포는 표준정규분포보다 꼬리가 항상 조금 더 두껍다.
핵심 정리
- t분포는 모표준편차를 몰라 표본표준편차로 대신할 때 생기는 여분의 불확실성을 반영한 분포이며, 자유도는 이다.
- 분포는 표본분산과 모분산의 비율에서 나오는 분포로, 자유도 을 가지며 0 이상의 비대칭 분포다.
- F분포는 두 표본분산의 비율에서 나오는 분포로, 분자·분모 각각의 자유도 두 개로 모양이 결정된다.
- 자유도 계산은 상황마다 다르다: 단일평균 , 두 독립표본평균 , 카이제곱 적합도 , 카이제곱 독립성 , F분포는 .
- “평균이냐 분산이냐”, “모집단이 한 개냐 두 개냐”, “를 아느냐 모르느냐”의 세 가지 질문으로 어떤 분포를 쓸지 판단할 수 있다.