Skip to Content
독학사독학사 1단계기초통계학08. 확률변수와 기댓값·분산

이번 문서의 목표: 확률변수가 무엇인지 설명하고, 이산형·연속형 확률변수의 확률분포를 구분하며, 기댓값과 분산을 정의식과 계산식 두 가지 방법으로 직접 계산할 수 있게 된다.

왜 확률변수가 필요한가

07편에서는 “동전을 던져 앞면이 나온다”, “주사위에서 짝수가 나온다”처럼 사건(event) 자체를 다뤘다. 그런데 실제 문제에서는 “동전을 세 번 던졌을 때 앞면이 몇 번 나오는가”, “고객이 하루에 몇 번 문의하는가”처럼 결과를 숫자로 바꿔서 다루고 싶을 때가 훨씬 많다. 사건을 숫자로 연결해주는 다리 역할을 하는 것이 바로 확률변수(random variable)다.

쉽게 말하면: 확률변수는 “실험 결과를 숫자로 바꿔주는 규칙”이다. 결과 자체가 아니라, 그 결과에 붙이는 숫자표다.

확률변수의 정의

확률변수는 보통 대문자 XX, YY처럼 쓰고, 그 확률변수가 실제로 취하는 값은 소문자 xx, yy로 쓴다. 예를 들어 동전을 두 번 던지는 실험에서 표본공간(sample space, 가능한 모든 결과의 집합)은 다음과 같다.

S={앞앞,앞뒤,뒤앞,뒤뒤}S = \{\text{앞앞}, \text{앞뒤}, \text{뒤앞}, \text{뒤뒤}\}

여기서 XX를 “앞면이 나온 횟수”라고 정의하면, XX는 표본공간의 각 결과에 숫자를 대응시킨다.

결과앞앞앞뒤뒤앞뒤뒤
XX의 값2110

이렇게 확률변수는 표본공간의 원소(결과)마다 실수 하나를 대응시키는 함수(function)다. “함수”라는 말이 낯설 수 있는데, 여기서는 그냥 “입력(실험 결과)을 넣으면 출력(숫자)이 하나 정해지는 규칙” 정도로 이해하면 충분하다.

확률변수는 취하는 값의 성질에 따라 크게 두 종류로 나뉜다.

  • 이산형 확률변수(discrete random variable): 값을 하나씩 셀 수 있다. 예: 동전을 던진 횟수 중 앞면이 나온 횟수(0, 1, 2, …), 하루 동안 걸려온 전화 건수.
  • 연속형 확률변수(continuous random variable): 특정 구간 안의 어떤 실수든 값이 될 수 있어 셀 수 없다. 예: 사람의 키, 배터리 수명, 반응 시간.

이 구분이 중요한 이유는 확률을 표현하는 방식 자체가 달라지기 때문이다. 아래에서 각각을 살펴본다.

자주 틀리는 점

  • 확률변수 XX와 그 값 xx를 헷갈리는 경우가 많다. XX는 규칙(함수) 자체이고, xx는 그 규칙이 만들어낸 구체적인 숫자다. P(X=x)P(X = x)라고 쓰면 “확률변수 XX가 값 xx를 가질 확률”이라는 뜻이다.
  • “확률변수는 항상 정수다”라고 착각하기 쉬운데, 이산형이라고 해서 반드시 정수인 것은 아니다(예: 동전 던지기 결과에 상금을 곱해 1.5배로 정의할 수도 있다). 핵심은 “셀 수 있는가”이지 “정수인가”가 아니다.

확률질량함수: 이산형 확률변수의 확률 표현

쉽게 말하면: 확률질량함수는 “이 확률변수가 이 값 하나를 가질 확률이 얼마인가”를 알려주는 표(table) 같은 함수다.

이산형 확률변수 XX가 취할 수 있는 값이 x1,x2,x_1, x_2, \ldots일 때, 각 값에 확률을 대응시키는 함수를 확률질량함수(probability mass function, 줄여서 PMF)라고 부르고 보통 f(x)f(x) 또는 p(x)p(x)로 쓴다.

f(x)=P(X=x)f(x) = P(X = x)
  • PP (피, probability): 확률
  • X=xX = x: 확률변수 XX가 값 xx를 가진다는 뜻

확률질량함수는 다음 두 조건을 반드시 만족해야 한다.

  1. 모든 xx에 대해 f(x)0f(x) \geq 0 (확률은 음수가 될 수 없다)
  2. 가능한 모든 값에 대한 확률의 합이 1이다: xf(x)=1\sum_x f(x) = 1

여기서 \sum (시그마, 모두 더하라는 기호)는 아래 첨자로 지정된 범위의 모든 항을 더하라는 뜻이다.

작은 예시: 동전 두 번 던지기

위에서 정의한 XX(앞면 횟수)의 확률질량함수를 직접 만들어보자. 공정한 동전이므로 앞앞, 앞뒤, 뒤앞, 뒤뒤 네 가지 결과가 각각 14\frac{1}{4}의 확률로 일어난다.

  • X=0X = 0인 경우: 뒤뒤 1가지 → f(0)=14f(0) = \frac{1}{4}
  • X=1X = 1인 경우: 앞뒤, 뒤앞 2가지 → f(1)=24=12f(1) = \frac{2}{4} = \frac{1}{2}
  • X=2X = 2인 경우: 앞앞 1가지 → f(2)=14f(2) = \frac{1}{4}

표로 정리하면 다음과 같다.

xx012
f(x)f(x)14\frac{1}{4}12\frac{1}{2}14\frac{1}{4}

검산: 확률질량함수는 반드시 전체 합이 1이어야 한다.

f(0)+f(1)+f(2)=14+12+14=1f(0) + f(1) + f(2) = \frac{1}{4} + \frac{1}{2} + \frac{1}{4} = 1

합이 정확히 1이 나왔으므로 이 확률질량함수는 유효하다. 이런 검산은 문제를 풀 때마다 습관처럼 해야 한다 — 합이 1이 아니면 계산 어딘가에서 실수한 것이다.

확률밀도함수: 연속형 확률변수의 확률 표현

연속형 확률변수는 특정 “한 점”의 확률을 물어보는 것 자체가 의미가 없다. 예를 들어 사람의 키가 정확히 170.000000…cm일 확률은 사실상 0이다(소수점 아래로 무한히 값이 있으므로). 그래서 연속형 확률변수는 “특정 구간에 속할 확률”을 다루고, 이를 위해 확률밀도함수(probability density function, 줄여서 PDF)를 사용한다.

쉽게 말하면: 확률밀도함수는 그래프 아래의 “넓이”가 확률이 되는 곡선이다. 특정 점의 높이 자체는 확률이 아니다.

확률밀도함수 f(x)f(x)가 있을 때, XX가 구간 [a,b][a, b]에 속할 확률은 그 구간에서 곡선과 x축 사이의 넓이로 정의된다. 이 넓이를 구하는 계산은 적분(integral)이라는 도구를 쓰는데, 독학사 기초통계학 시험에서는 적분 계산 자체보다 개념과 성질을 이해했는지를 주로 묻는다. 확률밀도함수도 확률질량함수처럼 다음 조건을 만족해야 한다.

  1. 모든 xx에 대해 f(x)0f(x) \geq 0
  2. 전체 구간에서 곡선 아래 넓이의 합이 1이다

이산형의 “확률의 합 = 1”이 연속형에서는 “넓이의 합 = 1”로 바뀐다고 이해하면 된다. 대표적인 연속형 분포인 정규분포(normal distribution)는 11편에서 자세히 다룬다.

자주 틀리는 점

  • 연속형 확률변수에서 P(X=a)P(X = a)(정확히 한 점일 확률)는 항상 0이다. 그래서 P(Xa)P(X \leq a)P(X<a)P(X < a)는 연속형에서는 같은 값이다(이산형에서는 다르다 — 이산형은 등호 포함 여부에 따라 특정 값의 확률만큼 차이가 난다).
  • 확률밀도함수의 값 f(x)f(x) 자체는 확률이 아니라 “밀도”다. 밀도는 1보다 커질 수도 있다. 확률이 되는 것은 구간에 대한 넓이뿐이다.

기댓값: 확률변수의 평균적인 값

쉽게 말하면: 기댓값은 “이 확률변수를 무한히 반복하면 평균적으로 어떤 값이 나올까”를 미리 계산한 값이다.

이산형 확률변수 XX의 기댓값(expected value, expectation)은 각 값에 그 값이 나올 확률을 곱해서 모두 더한 것으로 정의한다. 기호로는 E(X)E(X) 또는 μ\mu (뮤, 평균을 나타내는 그리스 문자)로 쓴다.

E(X)=xxf(x)E(X) = \sum_x x \cdot f(x)
  • EE (이, expectation): 기댓값을 구하라는 연산자
  • xx: 확률변수가 취하는 각각의 값
  • f(x)f(x): 그 값이 나올 확률(확률질량함수)
  • x\sum_x: 가능한 모든 xx에 대해 더하라는 뜻

계산 예시: 동전 두 번 던지기의 기댓값

앞서 만든 확률질량함수를 그대로 사용한다.

E(X)=0×14+1×12+2×14E(X) = 0 \times \frac{1}{4} + 1 \times \frac{1}{2} + 2 \times \frac{1}{4}

각 항을 계산하면 0×14=00 \times \frac{1}{4} = 0, 1×12=121 \times \frac{1}{2} = \frac{1}{2}, 2×14=122 \times \frac{1}{4} = \frac{1}{2}이므로,

E(X)=0+12+12=1E(X) = 0 + \frac{1}{2} + \frac{1}{2} = 1

동전을 두 번 던지면 평균적으로 앞면이 1번 나온다는 뜻이다. 직관적으로도 맞다 — 동전 한 번에 앞면이 나올 확률이 12\frac{1}{2}이므로, 두 번이면 평균 2×12=12 \times \frac{1}{2} = 1번이 되어야 자연스럽다(이 성질은 뒤에서 나올 선형결합의 기댓값 공식으로 정확히 설명된다).

기댓값에는 유용한 성질이 하나 있다. 확률변수를 함수에 넣은 g(X)g(X)의 기댓값도 같은 방식으로 구할 수 있다.

E[g(X)]=xg(x)f(x)E[g(X)] = \sum_x g(x) \cdot f(x)

이 성질은 바로 다음에 나올 분산 계산에서 핵심적으로 쓰인다.

분산: 확률변수가 평균에서 얼마나 퍼져 있는가

쉽게 말하면: 분산은 “값들이 평균에서 평균적으로 얼마나 멀리 떨어져 있는가”를 제곱해서 잰 숫자다.

분산(variance)은 기호로 Var(X)\text{Var}(X) 또는 σ2\sigma^2 (시그마 제곱, 모분산을 나타내는 그리스 문자)로 쓴다. 정의식은 다음과 같다.

Var(X)=E[(Xμ)2]\text{Var}(X) = E[(X - \mu)^2]
  • XμX - \mu: 각 값이 평균에서 얼마나 떨어져 있는지(편차)
  • (Xμ)2(X - \mu)^2: 편차를 제곱한 값(음수 편차가 상쇄되지 않도록)
  • E[]E[\cdot]: 그 제곱값들의 기댓값(평균)

이 정의식을 그대로 전개하면 계산에 더 편한 형태가 나온다. 이를 계산식이라고 부르며, 독학사 시험에서는 이 계산식을 훨씬 자주 사용한다.

Var(X)=E(X2)[E(X)]2\text{Var}(X) = E(X^2) - [E(X)]^2
  • E(X2)E(X^2): XX 제곱의 기댓값 (먼저 제곱한 다음 평균을 낸다)
  • [E(X)]2[E(X)]^2: XX의 기댓값을 먼저 구한 다음 그 값을 제곱한다

두 식은 겉모양이 달라도 항상 같은 값을 준다. 아래에서 같은 문제를 두 방법으로 풀어 직접 확인한다.

계산 예시 1: 정의식 E[(Xμ)2]E[(X-\mu)^2]으로 분산 구하기

동전 두 번 던지기의 XX(앞면 횟수)를 그대로 사용한다. 앞에서 μ=E(X)=1\mu = E(X) = 1을 구했다.

각 값의 편차 제곱을 먼저 구한다.

  • x=0x = 0일 때: (01)2=1(0 - 1)^2 = 1
  • x=1x = 1일 때: (11)2=0(1 - 1)^2 = 0
  • x=2x = 2일 때: (21)2=1(2 - 1)^2 = 1

이제 각 편차 제곱에 확률을 곱해서 더한다.

Var(X)=1×14+0×12+1×14\text{Var}(X) = 1 \times \frac{1}{4} + 0 \times \frac{1}{2} + 1 \times \frac{1}{4}

계산을 진행하면,

Var(X)=14+0+14=12\text{Var}(X) = \frac{1}{4} + 0 + \frac{1}{4} = \frac{1}{2}

정의식으로 구한 분산은 12\frac{1}{2}이다.

계산 예시 2: 계산식 E(X2)[E(X)]2E(X^2) - [E(X)]^2으로 같은 문제 풀기

이번에는 같은 문제를 계산식으로 풀어본다. 먼저 E(X2)E(X^2)을 구해야 한다. g(X)=X2g(X) = X^2이라고 보고 앞서 배운 E[g(X)]=xg(x)f(x)E[g(X)] = \sum_x g(x) f(x)를 적용한다.

E(X2)=02×14+12×12+22×14E(X^2) = 0^2 \times \frac{1}{4} + 1^2 \times \frac{1}{2} + 2^2 \times \frac{1}{4}

각 항을 계산하면 0×14=00 \times \frac{1}{4} = 0, 1×12=121 \times \frac{1}{2} = \frac{1}{2}, 4×14=14 \times \frac{1}{4} = 1이므로,

E(X2)=0+12+1=32E(X^2) = 0 + \frac{1}{2} + 1 = \frac{3}{2}

이제 [E(X)]2[E(X)]^2을 구한다. 앞서 E(X)=1E(X) = 1이었으므로,

[E(X)]2=12=1[E(X)]^2 = 1^2 = 1

두 값을 계산식에 대입한다.

Var(X)=321=12\text{Var}(X) = \frac{3}{2} - 1 = \frac{1}{2}

결과 비교: 정의식으로 구한 값도 12\frac{1}{2}, 계산식으로 구한 값도 12\frac{1}{2}로 정확히 일치한다. 두 방법이 항상 같은 답을 준다는 것을 확인했으니, 실전에서는 대입과 전개가 더 간단한 계산식 E(X2)[E(X)]2E(X^2) - [E(X)]^2을 주로 쓰면 된다.

표준편차(standard deviation)는 분산에 제곱근을 씌운 값이며 σ\sigma (시그마)로 쓴다.

σ=Var(X)=120.71\sigma = \sqrt{\text{Var}(X)} = \sqrt{\frac{1}{2}} \approx 0.71

분산은 단위가 원래 값의 제곱(예: cm²)이라 해석이 어색할 때가 있는데, 표준편차는 원래 단위(cm)로 돌아오기 때문에 “평균적인 흩어짐 정도”를 말할 때 더 자주 쓰인다. 06편에서 다룬 표준편차·변동계수 개념과 정확히 같은 도구다.

자주 틀리는 점

  • 분산 공식에서 E(X2)E(X^2)[E(X)]2[E(X)]^2의 순서를 바꿔 [E(X)]2E(X2)[E(X)]^2 - E(X^2)로 계산하는 실수가 많다. 분산은 항상 0 이상이어야 하므로, 계산 결과가 음수로 나오면 순서가 바뀐 것이다.
  • E(X2)E(X^2)을 구할 때 XX 값을 먼저 다 더한 다음 제곱하는 실수를 저지르기 쉽다. E(X2)E(X^2)은 “각 값을 먼저 제곱한 뒤” 확률을 곱해 더하는 것이다. [E(X)]2[E(X)]^2과는 계산 순서가 완전히 다르다.

선형결합의 기댓값과 분산

실제 문제에서는 확률변수를 그대로 쓰기보다, 상수를 곱하거나 더한 형태(예: 원화를 달러로 환산, 점수에 가산점 부여)로 다루는 경우가 많다. aabb가 상수일 때 aX+baX + b 형태를 선형결합(linear combination)이라 부르고, 다음 공식이 성립한다.

E(aX+b)=aE(X)+bE(aX + b) = aE(X) + b Var(aX+b)=a2Var(X)\text{Var}(aX + b) = a^2 \text{Var}(X)
  • aa, bb: 확률변수가 아닌 상수
  • 기댓값은 aabb가 그대로 따라오지만, 분산은 상수를 더하는 bb가 사라지고 aa는 제곱되어 남는다

분산에서 bb가 사라지는 이유는 직관적으로 이해할 수 있다. 모든 값에 똑같은 상수 bb를 더하면 전체 분포가 그대로 옆으로 이동할 뿐, 값들 사이의 “퍼진 정도”는 전혀 변하지 않기 때문이다. 반면 aa를 곱하면 값들 사이의 간격 자체가 aa배로 벌어지므로, 편차의 제곱인 분산은 a2a^2배가 된다.

계산 예시: 선형결합 적용하기

앞선 예시의 XX(E(X)=1E(X) = 1, Var(X)=12\text{Var}(X) = \frac{1}{2})에 대해, Y=3X+2Y = 3X + 2라는 새로운 확률변수를 정의했다고 하자(예: 앞면 1회당 3점을 주고 기본점수 2점을 더하는 규칙).

YY의 기댓값을 구한다.

E(Y)=3×E(X)+2=3×1+2=5E(Y) = 3 \times E(X) + 2 = 3 \times 1 + 2 = 5

YY의 분산을 구한다.

Var(Y)=32×Var(X)=9×12=92\text{Var}(Y) = 3^2 \times \text{Var}(X) = 9 \times \frac{1}{2} = \frac{9}{2}

기본점수 2점을 더하는 것은 평균만 2만큼 밀어 올릴 뿐 분산에는 전혀 영향을 주지 않고, 3배로 점수를 매기는 것은 분산을 32=93^2 = 9배로 키운다는 것을 확인할 수 있다.

자주 틀리는 점

  • Var(aX+b)=aVar(X)+b\text{Var}(aX + b) = a \cdot \text{Var}(X) + b처럼 상수 bb를 그대로 더하거나 aa를 제곱하지 않는 실수가 매우 흔하다. 분산 공식에서 bb는 반드시 사라지고, aa는 반드시 제곱된다.
  • 두 확률변수 XX, YY가 서로 독립(independent, 08편 참고)일 때만 Var(X+Y)=Var(X)+Var(Y)\text{Var}(X + Y) = \text{Var}(X) + \text{Var}(Y)가 성립한다. 독립이 아니면 공분산(covariance) 항이 추가로 필요하므로, 이 단원의 범위를 벗어나는 별도 조건임을 기억해야 한다.

어떤 개념을 언제 쓰는지 흐름으로 정리

핵심 정리

  • 확률변수는 실험 결과를 숫자로 대응시키는 규칙이며, 값을 셀 수 있으면 이산형, 셀 수 없으면 연속형이다.
  • 이산형은 확률질량함수 f(x)=P(X=x)f(x) = P(X=x)로, 연속형은 확률밀도함수(구간 넓이가 확률)로 확률을 표현하며, 두 경우 모두 전체 합(또는 넓이)이 반드시 1이다.
  • 기댓값 E(X)=xxf(x)E(X) = \sum_x x f(x)는 확률변수의 평균적인 값을, 분산 Var(X)=E(X2)[E(X)]2\text{Var}(X) = E(X^2) - [E(X)]^2은 평균에서 얼마나 퍼져 있는지를 나타낸다.
  • 선형결합에서 E(aX+b)=aE(X)+bE(aX+b) = aE(X)+b이지만 Var(aX+b)=a2Var(X)\text{Var}(aX+b) = a^2 \text{Var}(X)로, 상수 bb는 분산에 영향을 주지 않는다.

마무리 복습

문제 14지선다
확률변수에 대한 설명으로 옳은 것은?
문제 24지선다
이산형 확률변수의 확률질량함수 f(x)가 반드시 만족해야 하는 조건은?
문제 34지선다
확률변수 X의 확률질량함수가 f(0)=0.2, f(1)=0.5, f(2)=0.3일 때 E(X)의 값은?
문제 44지선다
위 문제(f(0)=0.2, f(1)=0.5, f(2)=0.3, E(X)=1.1)에서 Var(X)를 계산식 E(X^2)-[E(X)]^2으로 구한 값은?
문제 54지선다
확률변수 X에 대해 E(X)=4, Var(X)=3일 때, Y=2X-1의 분산 Var(Y)는?
문제 64지선다
연속형 확률변수와 확률밀도함수에 대한 설명으로 옳은 것은?

참고 자료

Last updated on