Skip to Content
독학사독학사 1단계기초통계학09. 이산형 분포: 이항분포·포아송분포

이번 문서의 목표: 베르누이 시행이 무엇인지 이해하고, 이항분포와 포아송분포의 확률·기댓값·분산을 직접 계산하며, 언제 이항분포를 포아송분포로 근사할 수 있는지 판단할 수 있게 된다.

왜 이 두 분포부터 배우는가

09편에서 확률변수와 확률질량함수(probability mass function)라는 일반적인 틀을 배웠다. 이제 그 틀 안에서 실제로 가장 많이 쓰이는 이산형 분포 두 가지를 다룬다. “성공/실패가 반복되는 상황”을 다루는 이항분포(binomial distribution)와 “일정 기간·구간에서 드물게 일어나는 사건의 횟수”를 다루는 포아송분포(Poisson distribution)다. 이 둘은 독학사 기초통계학에서 계산 문제로 가장 자주 출제되는 분포이므로, 정의뿐 아니라 숫자를 직접 넣어보는 연습이 중요하다.

베르누이 시행: 모든 것의 출발점

쉽게 말하면: 베르누이 시행은 결과가 “성공” 아니면 “실패” 둘 중 하나뿐인 한 번의 실험이다.

베르누이 시행(Bernoulli trial)은 다음 조건을 만족하는 실험이다.

  • 결과가 오직 두 가지(성공 또는 실패)뿐이다.
  • 성공 확률을 pp(피, 확률을 나타내는 기호로 이 단원에서는 관례적으로 소문자 pp를 성공 확률에 쓴다)라 하면, 실패 확률은 1p1-p다.

예를 들어 동전 던지기(앞면=성공), 불량품 검사(불량=성공으로 정의할 수도 있음), 시험 문제 하나를 맞히는지 여부가 모두 베르누이 시행이다. 확률변수 XX를 “성공하면 1, 실패하면 0”으로 정의하면, XX의 확률질량함수는 다음과 같다.

f(x)=px(1p)1x,x=0 또는 1f(x) = p^x (1-p)^{1-x}, \quad x = 0 \text{ 또는 } 1
  • pxp^x: x=1x=1(성공)이면 p1=pp^1=p, x=0x=0(실패)이면 p0=1p^0=1이 되어 식이 자동으로 맞물린다
  • (1p)1x(1-p)^{1-x}: 반대로 실패 확률 쪽이 작동하는 부분

베르누이 시행 하나만으로는 큰 의미가 없지만, 이를 여러 번 독립적으로 반복하면 이항분포가 된다.

이항분포의 정의와 모수

쉽게 말하면: 이항분포는 “성공 확률이 pp인 시행을 nn번 반복했을 때, 성공이 몇 번 나오는가”를 나타내는 분포다.

이항분포를 따르는 확률변수 XX는 다음 조건에서 나온다.

  1. 같은 시행을 독립적으로 nn번 반복한다.
  2. 매 시행의 성공 확률은 항상 pp로 동일하다.
  3. XXnn번 중 성공한 횟수다.

이때 XX는 이항분포를 따른다고 하고, XB(n,p)X \sim B(n, p)라고 쓴다.

  • \sim: “~를 따른다”는 뜻의 기호(물결표이지만 표 밖 산문·수식에서 사용하는 것으로, 이 문서의 en dash 금지 규칙과는 무관한 별개의 통계 표기다)
  • BB: 이항분포(Binomial distribution)를 뜻하는 기호
  • nn, pp: 이항분포를 결정짓는 두 모수(parameter, 분포의 모양을 정하는 상수). nn은 시행 횟수, pp는 매 시행의 성공 확률

이항분포의 확률질량함수는 다음과 같다.

f(x)=(nx)px(1p)nx,x=0,1,2,,nf(x) = \binom{n}{x} p^x (1-p)^{n-x}, \quad x = 0, 1, 2, \ldots, n
  • (nx)\binom{n}{x} (엔 콤비네이션 엑스, nn개 중 xx개를 순서 없이 뽑는 조합의 수): nn번의 시행 중 정확히 어느 xx번이 성공이었는지 배치하는 경우의 수
  • pxp^x: 그 xx번이 모두 성공할 확률
  • (1p)nx(1-p)^{n-x}: 나머지 nxn-x번이 모두 실패할 확률

조합 (nx)\binom{n}{x}는 다음과 같이 계산한다.

(nx)=n!x!(nx)!\binom{n}{x} = \frac{n!}{x!(n-x)!}
  • n!n! (엔 팩토리얼): nn부터 1까지 모든 정수를 곱한 값. 예: 4!=4×3×2×1=244! = 4 \times 3 \times 2 \times 1 = 24
  • x!(nx)!x!(n-x)!: 성공한 xx개끼리, 실패한 nxn-x개끼리는 순서를 구분하지 않으므로 각각의 순서 경우의 수로 나눠준다

계산 예시: 조합을 실제 숫자로 전개하기

주사위를 5번 던져 “6이 나오는 횟수”를 XX라고 하자. 이때 n=5n=5, 성공(6이 나옴) 확률 p=16p=\frac{1}{6}이다. X=2X=2(정확히 2번 6이 나올) 확률을 구해보자.

먼저 조합 (52)\binom{5}{2}를 계산한다.

(52)=5!2!(52)!=5!2!3!\binom{5}{2} = \frac{5!}{2!(5-2)!} = \frac{5!}{2! \cdot 3!}

분자와 분모를 각각 숫자로 풀어 쓴다.

(52)=5×4×3×2×1(2×1)(3×2×1)=1202×6=12012=10\binom{5}{2} = \frac{5 \times 4 \times 3 \times 2 \times 1}{(2 \times 1)(3 \times 2 \times 1)} = \frac{120}{2 \times 6} = \frac{120}{12} = 10

이제 확률질량함수에 n=5n=5, x=2x=2, p=16p=\frac{1}{6}을 대입한다.

f(2)=(52)(16)2(56)3f(2) = \binom{5}{2} \left(\frac{1}{6}\right)^2 \left(\frac{5}{6}\right)^{3}

각 부분을 따로 계산한다. (16)2=136\left(\frac{1}{6}\right)^2 = \frac{1}{36}이고, (56)3=125216\left(\frac{5}{6}\right)^3 = \frac{125}{216}이다.

f(2)=10×136×125216f(2) = 10 \times \frac{1}{36} \times \frac{125}{216}

분자끼리, 분모끼리 곱하면,

f(2)=10×12536×216=125077760.1608f(2) = \frac{10 \times 125}{36 \times 216} = \frac{1250}{7776} \approx 0.1608

주사위를 5번 던져 정확히 2번 6이 나올 확률은 약 16.08퍼센트(0.1608)다.

이항분포의 기댓값과 분산

이항분포는 매번 확률질량함수 전체를 더해 기댓값·분산을 구하지 않아도, 다음과 같은 간단한 공식이 성립한다(베르누이 시행을 nn번 더한 것이 이항분포이므로, 09편의 선형결합 성질을 이용해 유도된다).

E(X)=npE(X) = np Var(X)=np(1p)\text{Var}(X) = np(1-p)
  • nn: 시행 횟수
  • pp: 성공 확률
  • 1p1-p: 실패 확률

검산: 정의식으로도 같은 결과가 나오는지 확인

공식이 맞는지, 아주 작은 경우(n=2n=2)로 정의식과 비교해서 검산해보자. 동전을 2번 던져 앞면 나온 횟수 XB(2,0.5)X \sim B(2, 0.5)를 생각한다. 확률질량함수를 표로 만들면 다음과 같다.

xx012
f(x)f(x)0.250.50.25

먼저 공식으로 기댓값을 구하면,

E(X)=np=2×0.5=1E(X) = np = 2 \times 0.5 = 1

이제 정의식 E(X)=xxf(x)E(X) = \sum_x x f(x)로도 구해본다.

E(X)=0×0.25+1×0.5+2×0.25=0+0.5+0.5=1E(X) = 0 \times 0.25 + 1 \times 0.5 + 2 \times 0.25 = 0 + 0.5 + 0.5 = 1

공식으로 구한 값 1과 정의식으로 구한 값 1이 정확히 일치한다. 분산도 같은 방식으로 검산할 수 있다. 공식으로는,

Var(X)=np(1p)=2×0.5×0.5=0.5\text{Var}(X) = np(1-p) = 2 \times 0.5 \times 0.5 = 0.5

정의식 E(X2)[E(X)]2E(X^2) - [E(X)]^2으로 구하면, 먼저 E(X2)=02×0.25+12×0.5+22×0.25=0+0.5+1=1.5E(X^2) = 0^2 \times 0.25 + 1^2 \times 0.5 + 2^2 \times 0.25 = 0 + 0.5 + 1 = 1.5이고, [E(X)]2=12=1[E(X)]^2 = 1^2 = 1이므로 Var(X)=1.51=0.5\text{Var}(X) = 1.5 - 1 = 0.5다. 공식과 정의식 모두 0.5로 일치한다. 이렇게 공식은 계산을 줄여주는 지름길일 뿐, 정의식과 항상 같은 답을 낸다는 것을 확인했다.

자주 틀리는 점

  • 분산 공식을 npnp로만 쓰고 (1p)(1-p)를 빼먹는 실수가 매우 흔하다. 이항분포의 분산은 반드시 np(1p)np(1-p)이며, pp가 0.5일 때 분산이 최대가 되고 pp가 0이나 1에 가까울수록 분산이 작아진다는 것도 함께 기억하면 실수를 줄일 수 있다.
  • 조합 (nx)\binom{n}{x}을 계산할 때 x!(nx)!x!(n-x)! 대신 x!×n!x! \times n!처럼 잘못 나누는 실수가 있다. 반드시 분모는 “성공 개수의 팩토리얼 곱하기 실패 개수의 팩토리얼”이다.

포아송분포: 희귀사건의 발생 횟수

쉽게 말하면: 포아송분포는 “정해진 시간이나 공간 안에서, 평균적으로 몇 번 일어나는지 알고 있는 드문 사건이 정확히 몇 번 일어날까”를 나타내는 분포다.

포아송분포(Poisson distribution)는 콜센터에 한 시간 동안 걸려오는 전화 수, 하루 동안 발생하는 교통사고 건수, 한 페이지에 있는 오타 개수처럼 “특정 구간에서 드물게, 서로 독립적으로 발생하는 사건의 횟수”를 다룰 때 쓴다. 모수는 단 하나, 평균 발생 횟수 λ\lambda (람다, 그 구간에서 평균적으로 몇 번 일어나는지를 나타내는 상수) 뿐이다. XPoisson(λ)X \sim \text{Poisson}(\lambda)로 쓰고, 확률질량함수는 다음과 같다.

f(x)=eλλxx!,x=0,1,2,f(x) = \frac{e^{-\lambda} \lambda^x}{x!}, \quad x = 0, 1, 2, \ldots
  • ee (자연상수, 약 2.71828): 수학에서 자주 등장하는 고정된 상수
  • λ\lambda: 그 구간에서 평균적으로 발생하는 사건의 횟수
  • x!x!: xx의 팩토리얼

포아송분포의 기댓값과 분산은 특이하게도 둘 다 λ\lambda로 같다.

E(X)=λE(X) = \lambda Var(X)=λ\text{Var}(X) = \lambda

기댓값과 분산이 똑같이 λ\lambda라는 것은 포아송분포만의 독특한 성질이다.

계산 예시: 콜센터 문의 건수

어느 콜센터에 10분 동안 평균 3건의 문의 전화가 걸려온다고 하자(λ=3\lambda = 3). 정확히 2건이 걸려올 확률 f(2)f(2)를 구해보자.

f(2)=e3322!f(2) = \frac{e^{-3} \cdot 3^2}{2!}

e30.0498e^{-3} \approx 0.0498이고, 32=93^2 = 9, 2!=22! = 2이므로,

f(2)=0.0498×92=0.448220.2241f(2) = \frac{0.0498 \times 9}{2} = \frac{0.4482}{2} \approx 0.2241

10분 동안 정확히 2건의 문의가 걸려올 확률은 약 22.41퍼센트다. 이 경우 기댓값은 E(X)=λ=3E(X) = \lambda = 3이고 분산도 Var(X)=λ=3\text{Var}(X) = \lambda = 3이다.

이항분포를 포아송분포로 근사하기

쉽게 말하면: 시행 횟수 nn이 아주 크고 성공 확률 pp가 아주 작을 때는, 복잡한 이항분포 계산 대신 훨씬 간단한 포아송분포로 대략 계산해도 된다.

이항분포의 확률질량함수는 nn이 커질수록 조합 (nx)\binom{n}{x} 계산이 급격히 복잡해진다. 그런데 다음 조건을 만족하면, 이항분포 B(n,p)B(n, p)를 포아송분포로 근사할 수 있다는 것이 알려져 있다.

  • nn이 충분히 크다(일반적으로 n30n \geq 30 정도가 기준으로 자주 쓰인다)
  • pp가 충분히 작다(일반적으로 p0.05p \leq 0.05 정도)
  • 이때 근사에 사용하는 포아송분포의 모수는 λ=np\lambda = np
λ=np\lambda = np
  • nn: 이항분포의 시행 횟수
  • pp: 이항분포의 성공 확률
  • 이렇게 구한 λ\lambda를 포아송분포의 확률질량함수에 그대로 대입해 확률을 근사한다

이 근사가 성립하는 이유는 직관적으로 이렇다. nn이 아주 크고 pp가 아주 작으면, 평균 성공 횟수 npnp는 적당한 크기로 유지되면서도 “매번 성공할 확률은 낮지만 시행 횟수가 워낙 많아 어쩌다 몇 번은 성공하는” 상황이 되는데, 이것이 바로 포아송분포가 설명하는 “희귀사건의 발생 횟수” 상황과 정확히 같아지기 때문이다.

계산 예시: 근사 적용하기

어느 공장에서 부품의 불량률이 p=0.01p=0.01(1퍼센트)이고, 하루에 n=200n=200개를 생산한다고 하자. 불량품이 정확히 3개 나올 확률을 구해보자.

이항분포로 직접 계산하려면 (2003)\binom{200}{3}처럼 매우 큰 조합을 계산해야 하므로, 근사 조건(n=200n=200은 충분히 크고, p=0.01p=0.01은 충분히 작음)을 확인하고 포아송분포로 근사한다. 먼저 λ\lambda를 구한다.

λ=np=200×0.01=2\lambda = np = 200 \times 0.01 = 2

이제 포아송분포의 확률질량함수에 λ=2\lambda=2, x=3x=3을 대입한다.

f(3)=e2233!f(3) = \frac{e^{-2} \cdot 2^3}{3!}

e20.1353e^{-2} \approx 0.1353이고, 23=82^3=8, 3!=63!=6이므로,

f(3)=0.1353×86=1.082460.1804f(3) = \frac{0.1353 \times 8}{6} = \frac{1.0824}{6} \approx 0.1804

불량품이 정확히 3개 나올 확률은 약 18.04퍼센트로 근사된다. 실제 이항분포로 정확히 계산한 값과 비교해도 이 근사값은 매우 가깝다 — nn이 크고 pp가 작을수록 근사 오차는 더 작아진다.

어떤 분포를 쓸지 판단하는 흐름

자주 틀리는 점

  • 근사 조건을 확인하지 않고 무조건 계산이 편하다는 이유로 포아송분포를 쓰면 안 된다. nn이 작거나 pp가 크면 근사 오차가 커져 답이 틀릴 수 있다.
  • λ=np\lambda = np를 계산할 때 pp 대신 1p1-p를 곱하는 실수가 있다. λ\lambda는 항상 “평균적으로 성공(사건 발생)하는 횟수”이므로 성공 확률 pp를 곱해야 한다.
  • 포아송분포는 기댓값과 분산이 똑같이 λ\lambda라는 점이 이항분포(기댓값 npnp, 분산 np(1p)np(1-p)로 서로 다름)와 뚜렷이 다르다는 것을 혼동하지 않아야 한다.

핵심 정리

  • 베르누이 시행은 성공/실패 두 결과만 있는 단일 시행이며, 이를 nn번 독립 반복한 것이 이항분포 B(n,p)B(n,p)다.
  • 이항분포의 확률질량함수는 f(x)=(nx)px(1p)nxf(x)=\binom{n}{x}p^x(1-p)^{n-x}이고, 기댓값은 npnp, 분산은 np(1p)np(1-p)다.
  • 포아송분포는 평균 발생 횟수 λ\lambda 하나만으로 정해지며, 기댓값과 분산이 모두 λ\lambda로 같다.
  • nn이 크고 pp가 작을 때(n30n \geq 30, p0.05p \leq 0.05가 기준) 이항분포를 λ=np\lambda=np인 포아송분포로 근사할 수 있다.

마무리 복습

문제 14지선다
이항분포 B(n, p)의 조건으로 옳지 않은 것은?
문제 24지선다
주사위를 4번 던져 정확히 1번 6이 나올 확률을 구할 때 필요한 조합 C(4,1)의 값은?
문제 34지선다
X ~ B(10, 0.3)일 때 E(X)와 Var(X)를 순서대로 구하면?
문제 44지선다
이항분포를 포아송분포로 근사하기 위한 조건으로 가장 적절한 것은?
문제 54지선다
어느 도서관에 한 시간당 평균 4건의 분실물 신고가 접수된다(포아송분포, lambda=4). 정확히 0건이 접수될 확률 f(0)에 가장 가까운 값은?
문제 64지선다
포아송분포 X~Poisson(5)에 대한 설명으로 옳은 것은?
문제 74지선다
이항분포의 확률질량함수 f(x) = C(n,x) p^x (1-p)^(n-x)에서 각 부분의 역할을 잘못 설명한 것은?

참고 자료

Last updated on