Skip to Content
자격증ADsP16. 가설검정과 유의수준

이번 문서의 목표: 귀무가설과 대립가설을 올바르게 세우고, p값이 무엇을 뜻하는 확률인지 정확히 설명하며, 제1종·제2종 오류의 관계를 이용해 가설검정 결과를 해석할 수 있다.

가설검정이 필요한 이유

왜 필요한가

15편에서 표본(sample, 모집단 중 실제로 관측한 일부)으로 모집단(population, 관심 대상 전체)의 특성을 추정하는 방법을 배웠다. 그런데 데이터분석 현장에서는 “추정”에서 한 걸음 더 나아가 “판단”이 필요한 순간이 훨씬 많다. 예를 들어 “새 광고 문구를 쓰면 클릭률이 오르는가?”, “새 약이 기존 약보다 효과가 좋은가?”, “이 동전은 조작되지 않은 정상 동전인가?” 같은 질문들이다. 이런 질문에 답하려면 표본에서 관찰된 차이가 진짜 의미 있는 차이인지, 아니면 우연히 생긴 흔들림(표본 오차)인지를 통계적으로 판별하는 절차가 필요하다. 이 절차가 바로 가설검정(hypothesis testing)이다.

쉽게 말하면: 가설검정은 “지금 관찰된 차이가 우연의 장난인지, 진짜 효과인지”를 숫자로 따져보는 절차다.

동전을 10번 던져 앞면이 7번 나왔다고 해보자. 이 동전이 조작된 것인지, 아니면 정상 동전인데 우연히 앞면이 좀 많이 나온 것인지 눈으로는 알 수 없다. 가설검정은 “정상 동전이라면 앞면이 7번 이상 나올 확률이 얼마나 되는가”를 계산해서, 그 확률이 너무 작으면 “이 동전은 정상이 아니다”라고 판단하는 방식으로 작동한다.

귀무가설과 대립가설

왜 필요한가

가설검정을 하려면 먼저 “무엇을 검정할 것인가”를 명확한 두 개의 주장으로 정리해야 한다. 이때 서로 반대되는 두 가설을 세우고, 데이터가 어느 쪽을 지지하는지 판단하는 방식을 쓴다.

쉽게 말하면: 귀무가설은 “아무 일도 없다”는 기본 전제이고, 대립가설은 “뭔가 달라졌다”는 우리가 증명하고 싶은 주장이다.

정의

귀무가설(null hypothesis, 기호 H0H_0, “에이치 놋”이라 읽는다)은 “차이가 없다”, “효과가 없다”, “관계가 없다”처럼 현재 상태를 그대로 유지한다는 기본 전제다. 귀무(null)라는 말 자체가 “0” 또는 “없음”을 뜻하는 데서 온 이름이다.

대립가설(alternative hypothesis, 기호 H1H_1 또는 HaH_a)은 귀무가설과 반대로 “차이가 있다”, “효과가 있다”, “관계가 있다”는, 연구자가 실제로 입증하고 싶은 주장이다.

가설검정의 논리는 법정의 재판과 비슷하다. 법정에서는 “피고인은 무죄다”를 기본 전제(귀무가설)로 놓고 재판을 시작한다. 검사가 “유죄”라는 증거(대립가설을 지지하는 데이터)를 충분히 강하게 제시하지 못하면, 무죄 추정의 원칙에 따라 “무죄”(귀무가설 유지)로 판결한다. 이때 판사가 내리는 결론은 “무죄가 확실히 입증됐다”가 아니라 “유죄라고 볼 근거가 부족하다”는 소극적인 결론이라는 점이 중요하다. 가설검정도 마찬가지로, 귀무가설을 기각하지 못했다고 해서 “귀무가설이 참이라고 증명됐다”는 뜻은 아니다. 단지 “귀무가설을 뒤집을 만큼 강한 증거가 없었다”는 뜻일 뿐이다.

작은 예시

새로 나온 다이어트 보조제가 체중 감량에 효과가 있는지 검증한다고 하자.

  • H0H_0: 보조제를 먹어도 체중 변화가 없다(효과가 없다). 기호로는 모평균 변화량 μ=0\mu = 0.
  • H1H_1: 보조제를 먹으면 체중이 감소한다(효과가 있다). 기호로는 μ<0\mu < 0.

연구자의 목표는 언제나 대립가설을 지지하는 증거를 찾는 것이다. 하지만 검정 절차는 거꾸로, “귀무가설이 참이라고 가정했을 때 지금 관찰된 데이터가 얼마나 이상한가”를 계산하는 방식으로 진행된다.

유의수준과 p값

왜 필요한가

“데이터가 귀무가설과 얼마나 안 맞는가”를 판단하려면, 그 안 맞는 정도를 하나의 숫자(확률)로 표현할 기준이 필요하다. 이때 등장하는 두 핵심 개념이 유의수준(significance level)과 p값(p-value)이다. 이 두 개념, 특히 p값의 정확한 의미는 ADsP 시험에서 회차마다 빠지지 않고 출제되는 최우선 개념이다.

쉽게 말하면: p값은 “귀무가설이 맞다고 치면, 지금 본 것만큼(또는 더) 극단적인 결과가 나올 확률”이다. 이 확률이 아주 작으면 “귀무가설이 맞다는 전제 자체가 의심스럽다”고 판단한다.

정의: p값의 정확한 뜻

p값(p-value)은 다음과 같이 정의된다.

귀무가설이 참이라고 가정했을 때, 실제로 관측된 통계량(검정통계량) 이상으로 극단적인 결과가 나타날 확률

이 정의를 동전 던지기 예시에 대입해 보자. 귀무가설은 “이 동전은 정상 동전이다(앞면이 나올 확률 = 0.5)“이고, 10번 던져 앞면이 7번 나왔다. p값은 “정상 동전을 10번 던졌을 때 앞면이 7번 이상 나올 확률”이다. 이 확률을 계산해 보면 약 0.172(17.2퍼센트)가 나온다. 즉 정상 동전이라도 이 정도로 앞면이 몰려 나오는 일이 드물지 않다는 뜻이므로, 이 동전이 조작됐다고 볼 근거는 약하다.

자주 틀리는 함정 (46회·ADsP 48회 기출 반복 출제): “p값은 귀무가설이 참일 확률이다”라는 서술은 틀렸다. 이 오해가 가설검정 문항에서 가장 자주 나오는 함정이다. p값은 “귀무가설이 참이라는 가정 하에서” 계산되는 조건부 확률이지, “귀무가설 자체가 참일 확률”이 아니다. 비유하자면 p값은 “피고인이 무죄라고 가정했을 때, 지금 제시된 증거 수준이 나타날 가능성”이지 “피고인이 무죄일 확률”이 아닌 것과 같다. 이 둘을 뒤바꿔 말하는 서술(p값 = 귀무가설이 참일 확률, 혹은 1 − p값 = 대립가설이 참일 확률)은 모두 오답으로 출제된다.

정의: 유의수준

유의수준(significance level, 기호 α\alpha, “알파”라 읽는다)은 연구자가 검정을 시작하기 전에 미리 정해두는 기준값으로, “귀무가설이 참인데도 이를 기각해 버리는 실수를 허용할 최대 확률”이다. 관행적으로 0.05(5퍼센트)를 가장 많이 쓰고, 더 엄격한 기준이 필요하면 0.01(1퍼센트)을 쓴다.

α=0.05\alpha = 0.05
  • α\alpha (알파): 검정 전에 미리 설정하는 유의수준. 제1종 오류를 허용하는 최대 확률.

가설검정의 최종 판단 규칙은 p값과 유의수준을 비교하는 것으로 끝난다.

  1. 귀무가설과 대립가설을 세운다. (H0H_0, H1H_1)
  2. 유의수준 α\alpha를 미리 정한다. (보통 0.05)
  3. 표본 데이터로 검정통계량을 계산한다. (t값, 카이제곱값 등)
  4. 검정통계량으로부터 p값을 구한다.
  5. p값과 α\alpha를 비교해 결론을 내린다.
    • p값이 α\alpha보다 작다 → 귀무가설을 기각하고 대립가설을 채택한다.
    • p값이 α\alpha보다 크거나 같다 → 귀무가설을 기각하지 못한다(채택한다고도 표현하지만, “참이라고 증명됐다”는 뜻은 아니다).

동전 예시에서 p값 0.172는 유의수준 0.05보다 크므로, “이 동전이 조작됐다”는 대립가설을 채택할 만큼 강한 증거가 아니라고 결론 내린다.

제1종 오류와 제2종 오류

왜 필요한가

가설검정은 표본이라는 제한된 정보로 판단을 내리는 절차이기 때문에, 아무리 신중하게 진행해도 틀린 결론을 내릴 가능성이 항상 남아 있다. 이 오류의 종류를 구분해 이해하면, “유의수준을 얼마나 엄격하게 잡아야 하는가”라는 실무적 질문에 답할 수 있다.

쉽게 말하면: 제1종 오류는 “멀쩡한 걸 문제 있다고 오판”하는 것이고, 제2종 오류는 “문제 있는 걸 멀쩡하다고 오판”하는 것이다.

정의: 2×2 표로 정리하는 4가지 상황

가설검정의 결과는 “실제로 귀무가설이 참인가 거짓인가”와 “검정에서 귀무가설을 기각했는가 안 했는가”의 조합으로 4가지 경우의 수가 생긴다.

구분귀무가설이 실제로 참귀무가설이 실제로 거짓
검정에서 귀무가설을 기각제1종 오류(false positive, 확률 α\alpha)옳은 결정(검정력, 확률 1β1-\beta)
검정에서 귀무가설을 기각하지 못함옳은 결정(확률 1α1-\alpha)제2종 오류(false negative, 확률 β\beta)

제1종 오류(Type I error)는 귀무가설이 실제로는 참인데(정말로 효과가 없는데) 데이터를 잘못 해석해 기각해 버리는 오류다. 법정 비유로는 “무죄인 사람에게 유죄를 선고”하는 것이다. 이 오류를 범할 확률의 상한이 바로 앞서 정의한 유의수준 α\alpha다.

제2종 오류(Type II error, 기호 β\beta, “베타”라 읽는다)는 귀무가설이 실제로는 거짓인데(정말로 효과가 있는데) 증거가 부족해 기각하지 못하는 오류다. 법정 비유로는 “유죄인 사람을 무죄로 방면”하는 것이다.

검정력(power of the test)은 1β1 - \beta로 정의되며, “실제로 효과가 있을 때 그 효과를 올바르게 잡아낼 확률”이다. 검정력이 높을수록 좋은 검정이다.

검정력=1β\text{검정력} = 1 - \beta
  • β\beta (베타): 제2종 오류를 범할 확률.
  • 1β1-\beta: 대립가설이 참일 때 이를 옳게 기각(채택)해낼 확률, 즉 검정력.

계산·적용: 유의수준을 낮추면 생기는 트레이드오프

가장 헷갈리기 쉬운 지점은 “유의수준 α\alpha를 더 낮추면(예: 0.05 → 0.01) 검정이 무조건 더 좋아지는가”라는 질문이다. 답은 “아니다”이다. α\alpha를 낮추면 다음과 같은 트레이드오프(trade-off, 하나를 얻으면 다른 하나를 잃는 관계)가 발생한다.

  1. α\alpha를 낮춘다 → 귀무가설을 기각하는 기준이 더 까다로워진다 → 제1종 오류(멀쩡한 것을 문제 있다고 오판)를 범할 확률은 줄어든다.
  2. 하지만 기준이 까다로워진 만큼, 실제로 효과가 있는데도 “증거가 그 정도로 강하지는 않다”며 놓치는 경우가 늘어난다 → 제2종 오류 β\beta가 커진다 → 검정력 1β1-\beta는 낮아진다.

즉 표본 크기가 고정된 상태에서는 α\alphaβ\beta서로 반비례 관계에 있다. 한쪽 오류를 줄이면 다른 쪽 오류가 늘어난다. 이를 줄이는 유일한 방법은 유의수준을 조절하는 것이 아니라 표본 크기 자체를 늘리는 것이다. 표본이 커지면 추정이 더 정밀해져서 α\alpha를 그대로 유지하면서도 β\beta를 함께 줄일 수 있다.

비유하자면, 화재경보기의 민감도를 아주 낮게(작은 연기에는 절대 울리지 않도록) 설정하는 것이 유의수준 α\alpha를 낮추는 것과 같다. 이렇게 하면 요리 연기 같은 사소한 신호에 경보가 오작동하는 일(제1종 오류에 해당하는 실수, 멀쩡한데 문제라고 오판)은 확실히 줄어든다. 하지만 그 대가로, 정말 불이 났는데도 연기가 충분히 짙어질 때까지 경보가 울리지 않아 화재를 늦게 알아차리는 일(제2종 오류에 해당하는 실수, 진짜 문제인데 놓침)이 늘어난다. 두 오류 중 하나만 완전히 없앨 수는 없고, 상황에 따라 어느 오류가 더 치명적인지를 보고 기준을 정해야 한다. 예를 들어 신약 승인 검정처럼 “효과 없는 약을 효과 있다고 잘못 승인”하는 제1종 오류가 훨씬 위험한 상황에서는 α\alpha를 아주 낮게(0.01 이하) 잡는다.

자주 틀리는 점

자주 틀리는 함정: “제1종 오류를 줄이면 제2종 오류도 함께 줄어든다”는 서술은 표본 크기가 고정된 상황에서는 옳지 않다. 표본 크기가 그대로라면 두 오류는 트레이드오프 관계이지 같은 방향으로 움직이지 않는다. 또한 “검정력은 표본 크기와 무관하다”는 서술도 틀렸다 — 표본이 커질수록 검정력은 높아진다. 마지막으로 “귀무가설을 기각하지 못하면 귀무가설이 참임이 증명된 것이다”라는 서술도 틀렸다. 증거 부족일 뿐, 참이라고 적극적으로 증명된 것이 아니다.

핵심 정리

  • 귀무가설(H0H_0)은 “차이·효과가 없다”는 기본 전제, 대립가설(H1H_1)은 연구자가 입증하려는 주장이다.
  • p값은 “귀무가설이 참일 때 관측값 이상으로 극단적인 결과가 나올 확률”이며, “귀무가설이 참일 확률”이 아니다.
  • p값이 유의수준 α\alpha보다 작으면 귀무가설을 기각, 크거나 같으면 기각하지 못한다.
  • 제1종 오류(참인 귀무가설을 기각)의 확률 상한이 α\alpha, 제2종 오류(거짓인 귀무가설을 채택)의 확률이 β\beta이며, 검정력은 1β1-\beta다.
  • 표본 크기가 고정된 상태에서 α\alpha를 낮추면 제1종 오류는 줄지만 제2종 오류(=검정력 저하)는 늘어나는 트레이드오프가 생긴다.

마무리 복습

문제 14지선다
가설검정에서 귀무가설(H0)에 대한 설명으로 가장 적절한 것은?
문제 24지선다
p값에 대한 설명으로 가장 적절한 것은?
문제 34지선다
어떤 검정에서 p값이 0.03이고 유의수준이 0.05일 때 내려야 할 결론으로 가장 적절한 것은?
문제 44지선다
제1종 오류에 대한 설명으로 가장 적절한 것은?
문제 54지선다
표본 크기를 그대로 둔 채 유의수준(알파)을 0.05에서 0.01로 낮췄을 때 나타나는 변화로 가장 적절한 것은?
문제 64지선다
검정력(power of the test)에 대한 설명으로 가장 적절한 것은?
문제 74지선다
귀무가설을 기각하지 못했을 때의 올바른 해석은?

참고 자료

Last updated on