Skip to Content
자격증빅데이터분석기사 필기12. 기술통계와 확률분포

이번 문서의 목표: 평균·중앙값·최빈값의 순서만 보고 분포가 어느 쪽으로 치우쳤는지 판정하고, 이항분포의 평균과 분산을 즉시 계산하며, 문제 속 단서에서 어떤 확률분포를 써야 하는지 골라낼 수 있게 된다.

이 편이 2과목의 계산 문제를 담당한다

빅분기 필기 2과목에서 계산 문제는 대부분 이 편의 범위에서 나옵니다. 분산 계산, 표준화, 기대값, 이항분포의 분산, 사분위범위 같은 것들입니다.

좋은 소식: 유형이 정해져 있고 숫자가 작습니다. 공식을 알면 30초 안에 풀립니다. 나쁜 소식: 공식을 헷갈리면 손도 못 댑니다. 특히 분산인지 표준편차인지, 모집단인지 표본인지를 놓치면 그대로 오답입니다.

쉽게 말하면: 이 편은 외워서 즉시 대입하는 공식 창고입니다. 다만 왜 그 공식인지도 함께 봐 둬야 변형 문제에 대응할 수 있습니다.

1. 중심경향 척도

세 가지 대표값

척도정의계산 가능한 자료극단값에
평균모든 값의 합을 개수로 나눔등간척도 이상매우 민감
중앙값정렬했을 때 가운데 순위의 값서열척도 이상강건
최빈값가장 자주 나타난 값명목척도 이상강건

아래로 갈수록 쓸 수 있는 자료가 넓어집니다. 최빈값은 색상 같은 명목형에도 쓸 수 있고, 중앙값은 순서가 있어야 하며, 평균은 더하고 나눌 수 있어야 합니다. 11편에서 “명목형 결측은 최빈값으로 대치”한 이유가 여기 있습니다.

손계산 — 하나의 자료로 전부 구하기

자료가 2, 4, 4, 4, 5, 5, 7, 9 (8개, 이미 정렬됨)라고 합시다. 이 편 내내 이 자료를 씁니다.

평균

xˉ=2+4+4+4+5+5+7+98=408=5\bar{x} = \frac{2 + 4 + 4 + 4 + 5 + 5 + 7 + 9}{8} = \frac{40}{8} = 5

중앙값. 개수가 8개로 짝수이므로 4번째와 5번째 값의 평균입니다. 4번째는 4, 5번째는 5입니다.

M=4+52=4.5M = \frac{4 + 5}{2} = 4.5

최빈값. 4가 세 번, 5가 두 번, 나머지는 한 번씩입니다.

최빈값=4\text{최빈값} = 4

결과를 나란히 놓아 봅시다.

4<4.5<54 < 4.5 < 5

최빈값 < 중앙값 < 평균 입니다.

세 값의 순서로 치우침을 판정하기 — 기출 핵심

이 순서는 우연이 아닙니다. 자료에 9라는 큰 값이 하나 있어서 평균만 오른쪽으로 끌려갔습니다. 최빈값은 봉우리에 그대로 있고, 중앙값은 순위만 보므로 조금만 움직였습니다.

분포 모양세 값의 순서꼬리 방향왜도 부호
오른쪽 꼬리가 김최빈값 → 중앙값 → 평균오른쪽양수
좌우 대칭세 값이 거의 같음없음0에 가까움
왼쪽 꼬리가 김평균 → 중앙값 → 최빈값왼쪽음수

기출 그대로의 사례 판단. “정비센터의 장비 수리시간은 2시간대에 봉우리가 하나 있고 대부분 1–4시간이지만, 드물게 12–18시간이 걸린 작업도 있다. 히스토그램에 왼쪽부터 A, B, C 세로선을 표시했을 때 최빈값·중앙값·평균의 대응은?”

풀이 과정:

  1. 봉우리 위치를 찾습니다 — 2시간대에 봉우리가 있으므로 최빈값은 왼쪽인 A
  2. 꼬리 방향을 봅니다 — 12–18시간이라는 드문 긴 작업이 오른쪽으로 뻗어 있으므로 오른쪽 꼬리
  3. 평균이 끌려가는 방향을 정합니다 — 평균은 값의 크기를 모두 쓰므로 오른쪽 꼬리에 끌려 가장 오른쪽인 C
  4. 남은 자리 — 중앙값은 그 사이인 B

답: A는 최빈값, B는 중앙값, C는 평균.

여기서 틀리는 지점: “드물게 긴 작업이 있으니 중앙값이 커지겠지”라고 생각해 중앙값과 평균을 바꿔 답하는 경우입니다. 중앙값은 가운데 순위만 보므로 그 몇 건이 아무리 길어도 거의 움직이지 않습니다. 크기에 반응하는 것은 평균뿐입니다.

2. 산포 척도

척도정의단위극단값에
범위최댓값 – 최솟값원자료와 같음극단값 두 개만 사용해 매우 불안정
사분위범위Q3Q1Q_3 - Q_1원자료와 같음강건
분산편차 제곱의 평균원자료 단위의 제곱민감
표준편차분산의 제곱근원자료와 같음민감
변동계수표준편차를 평균으로 나눈 값단위 없음민감

기출 함정: “범위 — 극단값 두 개만 사용하므로 안정적이다”라는 보기는 틀린 서술입니다. 극단값 두 개 쓰기 때문에 오히려 가장 불안정합니다. 안정적인 것은 순서의 가운데를 쓰는 중앙값과 IQR입니다.

분산 손계산 — 모분산과 표본분산

같은 자료 2, 4, 4, 4, 5, 5, 7, 9의 평균은 5입니다.

1단계 — 편차. 각 값에서 5를 빼면 –3, –1, –1, –1, 0, 0, 2, 4입니다.

편차의 합은 항상 0입니다. 확인해 봅시다. 3111+0+0+2+4=0-3-1-1-1+0+0+2+4 = 0 입니다. 그래서 편차를 그냥 더하면 산포를 잴 수 없고, 제곱해서 더합니다.

2단계 — 편차 제곱. 9, 1, 1, 1, 0, 0, 4, 16이 되고 그 합은 다음과 같습니다.

(xixˉ)2=9+1+1+1+0+0+4+16=32\sum (x_i - \bar{x})^2 = 9 + 1 + 1 + 1 + 0 + 0 + 4 + 16 = 32

3단계 — 모분산 (n으로 나눔)

σ2=328=4\sigma^2 = \frac{32}{8} = 4 σ=4=2\sigma = \sqrt{4} = 2

4단계 — 표본분산 (n–1로 나눔)

s2=3281=3274.571s^2 = \frac{32}{8 - 1} = \frac{32}{7} \approx 4.571 s=4.5712.138s = \sqrt{4.571} \approx 2.138

해석: 같은 자료인데 답이 둘입니다. 이 자료를 전체로 볼 것인가, 더 큰 모집단에서 뽑은 표본으로 볼 것인가에 따라 갈립니다. 문제에 “모집단”, “전체”가 있으면 nn, “표본”, “확률표본”이 있으면 n1n-1 입니다.

변동계수

CV=σxˉ=25=0.4CV = \frac{\sigma}{\bar{x}} = \frac{2}{5} = 0.4

곧 40퍼센트입니다.

변동계수를 언제 쓰는가: 평균이 크게 다른 두 집단의 산포를 비교할 때입니다. 성인 몸무게의 표준편차 10kg과 신생아 몸무게의 표준편차 0.5kg 중 어느 쪽이 더 흩어져 있을까요? 절댓값으로는 성인이지만, 평균 대비로 보면 신생아 쪽이 더 클 수 있습니다. 표준편차를 평균으로 나눠 단위를 지우면 비교가 가능해집니다.

왜 표본분산은 n–1로 나누는가

표본평균 xˉ\bar{x} 를 이미 계산해 알고 있으면, 관측값 nn 개 중 n1n-1 개를 알게 되는 순간 나머지 하나가 자동으로 정해집니다. 편차의 합이 0이어야 하기 때문입니다.

위 자료로 확인해 봅시다. 편차 8개 중 앞의 7개가 –3, –1, –1, –1, 0, 0, 2로 주어지면, 합이 0이 되려면 마지막 편차는 반드시 4여야 합니다. 선택의 여지가 없습니다.

곧 자유롭게 정할 수 있는 값이 nn 개가 아니라 n1n-1 개입니다. 이 개수를 자유도(degrees of freedom)라 하고, 이것으로 나눠야 모분산을 치우침 없이 추정합니다. nn 으로 나누면 모분산보다 체계적으로 작게 나옵니다.

3. 왜도와 첨도

통계량무엇을 재는가판정
왜도분포의 비대칭 정도0보다 크면 오른쪽 꼬리가 김, 0보다 작으면 왼쪽 꼬리가 김
첨도분포의 뾰족한 정도와 꼬리의 두께정규분포보다 뾰족하면 큼, 납작하면 작음

왜도 부호를 외우는 요령: 부호가 가리키는 쪽으로 꼬리가 뻗습니다. 양의 왜도면 오른쪽(양의 방향)으로 꼬리, 음의 왜도면 왼쪽(음의 방향)으로 꼬리입니다. 소득 분포는 대표적인 양의 왜도이고, 시험 점수가 대부분 만점 근처에 몰려 있으면 음의 왜도입니다.

첨도의 기준값 주의: 정규분포의 첨도는 정의에 따라 3입니다. 다만 많은 통계 프로그램이 여기서 3을 빼서 정규분포가 0이 되게 표시합니다. 문제에 “정규분포의 첨도가 3”, “정규분포 기준 0” 중 어느 표현이 나왔는지를 보고 따라가면 됩니다.

4. 모집단과 표본

구분대상계산된 수치의 이름기호
모집단관심 있는 대상 전체모수(parameter)μ\mu, σ2\sigma^2, pp
표본모집단에서 뽑은 일부통계량(statistic)xˉ\bar{x}, s2s^2, p^\hat{p}

핵심: 모수는 정해진 상수이지만 우리는 그 값을 모릅니다. 통계량은 표본을 뽑을 때마다 값이 달라지는 확률변수입니다. 이 구분이 15편 추론통계의 출발점입니다.

표본추출 방법

방법절차구분 요령
단순임의추출모든 개체가 같은 확률로 뽑힘아무 조건 없이 무작위
계통추출첫 번째만 무작위로 고르고 이후 일정 간격으로”매 kk 번째”라는 말이 나옴
층화추출집단으로 나눈 뒤 각 집단에서 일부씩 뽑음집단이 서로 이질적, 집단 내부는 동질적
군집추출집단을 나눈 뒤 일부 집단을 통째로 조사집단 내부에 전체 특성이 골고루 들어 있음

층화와 군집을 가르는 한 문장: 층화는 모든 집단에서 조금씩, 군집은 일부 집단을 전부입니다.

기출 사례 판단. “각 학교가 지역 전체 학생 구성을 잘 반영하도록 군집을 정의하고, 학교 20곳을 무작위로 고른 뒤 선택된 학교의 모든 학생을 조사했다.” 선택된 집단을 통째로 조사했으므로 1단계 군집추출입니다. 층화추출이라면 모든 학교에서 몇 명씩 뽑았을 것입니다.

표본평균의 성질 — 반드시 나오는 유형

크기 nn 의 확률표본에서 얻은 표본평균 Xˉ\bar{X} 에 대해 다음이 성립합니다.

E(Xˉ)=μE(\bar{X}) = \mu Var(Xˉ)=σ2nVar(\bar{X}) = \frac{\sigma^2}{n}
  • μ\mu: 모평균
  • σ2\sigma^2: 모분산
  • nn: 표본 크기

첫 식의 뜻: 표본평균은 평균적으로 모평균과 같습니다. 이것을 불편추정량이라 합니다. 어떤 분포 가정도 필요 없이 항상 성립합니다.

둘째 식의 뜻: 표본이 커질수록 표본평균이 흔들리는 폭이 작아집니다. 분모에 nn 이 있기 때문입니다. 여기에 제곱근을 씌운 것이 표준오차입니다.

SE=σnSE = \frac{\sigma}{\sqrt{n}}

손계산. 모표준편차가 6이고 표본 크기가 9라면

SE=69=63=2SE = \frac{6}{\sqrt{9}} = \frac{6}{3} = 2

해석: 표본 크기를 9에서 36으로 4배 늘리면 분모의 제곱근이 3에서 6이 되어 표준오차가 절반이 됩니다. 정밀도를 2배로 올리려면 표본을 4배 모아야 한다는 뜻입니다.

기출에서 걸러야 할 오답 세 개:

  • Var(Xˉ)=σ2Var(\bar{X}) = \sigma^2 이다” — 아닙니다. nn 으로 나눠야 합니다
  • Xˉ\bar{X} 는 모든 nn 에서 정확히 정규분포다” — 아닙니다. 모집단이 정규분포일 때만 그렇고, 그렇지 않으면 nn 이 클 때 근사적으로 정규에 가까워집니다
  • Xˉ\bar{X}μ\mu 와 항상 같은 값이다” — 아닙니다. 평균적으로 같을 뿐 매번 다릅니다

중심극한정리

모집단이 어떤 분포를 따르든, 표본 크기가 충분히 크면 표본평균의 분포가 정규분포에 가까워집니다.

왜 중요한가: 우리는 모집단의 분포를 모릅니다. 그런데도 표본평균에 대해서는 정규분포를 써서 신뢰구간을 만들고 검정을 할 수 있게 해 주는 것이 이 정리입니다. 15편 전체가 이 위에 서 있습니다.

정확히 읽어야 할 지점: 정규에 가까워지는 것은 표본평균의 분포이지 원자료의 분포가 아닙니다. 소득 자료를 아무리 많이 모아도 소득 자체는 여전히 오른쪽으로 치우쳐 있습니다.

5. 확률변수와 기대값

확률변수는 표본공간의 각 결과에 실수를 대응시키는 함수입니다. 주사위 눈, 동전 앞뒤를 0과 1로 나타낸 것 등이 해당합니다.

E(X)=xiP(xi)E(X) = \sum x_i \cdot P(x_i)
  • xix_i: 확률변수가 가질 수 있는 값
  • P(xi)P(x_i): 그 값을 가질 확률

손계산. 확률변수 YY 가 확률 0.7로 4를, 확률 0.3으로 –6을 갖습니다.

E(Y)=4×0.7+(6)×0.3E(Y) = 4 \times 0.7 + (-6) \times 0.3 E(Y)=2.81.8=1E(Y) = 2.8 - 1.8 = 1

해석: 가능한 값 두 개 중 어느 것도 1이 아닙니다. 기대값은 실제로 나올 값이 아니라 장기 평균입니다. 이 시행을 수없이 반복하면 평균이 1에 가까워진다는 뜻입니다.

여기서 틀리는 지점: –6의 부호를 빠뜨려 2.8+1.8=4.62.8 + 1.8 = 4.6 으로 답하거나, 확률을 곱하지 않고 값만 평균 내어 (46)÷2=1(4 - 6) \div 2 = -1 로 답하는 경우입니다. 각 값에 자기 확률을 가중해야 합니다.

분산도 같은 방식입니다. 제곱의 기대값 E(Y2)E(Y^2)16×0.7+36×0.3=2216 \times 0.7 + 36 \times 0.3 = 22 이고, 여기서 기대값의 제곱 121^2 을 빼면 분산은 21입니다.

6. 이산확률분포

분포언제 쓰는가문제 속 단서
이항분포성공확률 pp 인 시행을 nn독립적으로 반복했을 때의 성공 횟수”각각 독립”, “확률이 일정”, “n개 중 몇 개”
포아송분포일정한 시간·공간에서 사건이 발생한 횟수”1시간당 평균 몇 건”, “단위 면적당”
초기하분포유한 모집단에서 비복원추출할 때의 성공 개수”되돌려 놓지 않는다”, “상자에서 꺼내”
기하분포첫 성공이 나올 때까지 필요한 시행 횟수”처음 성공할 때까지”

이항분포 — 계산 문제의 단골

E(X)=npE(X) = np Var(X)=np(1p)Var(X) = np(1 - p)
  • nn: 시행 횟수
  • pp: 각 시행의 성공확률

손계산. 각 부품이 불량일 확률이 0.2이고 서로 독립일 때, 50개 중 불량품 수 XX 의 분산을 구합니다.

1단계 — 분포 확인. 독립이고 확률이 일정하며 50번 시행이므로 이항분포입니다.

2단계 — 기대값

E(X)=50×0.2=10E(X) = 50 \times 0.2 = 10

3단계 — 분산

Var(X)=50×0.2×0.8=8Var(X) = 50 \times 0.2 \times 0.8 = 8

4단계 — 표준편차

σ=82.83\sigma = \sqrt{8} \approx 2.83

여기서 틀리는 지점 세 개:

  • 1p1 - p 를 빼먹고 np=10np = 10 을 답하는 경우 — 10은 분산이 아니라 기대값입니다
  • p2p^2 를 써서 50×0.04=250 \times 0.04 = 2 로 계산하는 경우
  • p(1p)=0.16p(1-p) = 0.16 만 답하는 경우 — nn 을 곱하지 않았습니다

선택지에 8, 10, 0.16, 40이 함께 놓이는 이유가 바로 이 세 실수를 잡기 위해서입니다.

초기하분포 판정 — 사례형

“불량품 12개가 포함된 60개 납품 상자에서 8개를 검사하며, 검사한 제품은 되돌려 놓지 않는다.

왜 이항이 아닌가: 이항분포는 각 시행이 독립이고 성공확률이 일정해야 합니다. 그런데 되돌려 놓지 않으면 첫 번째로 불량을 꺼낸 순간 남은 상자의 불량 비율이 12/60에서 11/59로 바뀝니다. 다음 추출의 확률이 앞의 결과에 의존하므로 독립이 아닙니다.

따라서 답: 유한 모집단에서 비복원추출해 추출 간 의존성과 성공확률 변화가 생기기 때문에 초기하분포를 씁니다.

실전 요령: “되돌려 놓는다”가 보이면 이항, “되돌려 놓지 않는다”가 보이면 초기하입니다. 이 한 문장이 문제 전체를 결정합니다.

7. 연속확률분포

분포무엇의 분포인가
정규분포평균과 표준편차가 주어진 자료가 따르는 종 모양 분포
t분포모표준편차를 모른 채 표본표준편차를 쓸 때 표본평균이 따르는 분포
카이제곱분포자료가 NN 개 있을 때 분산이 따르는 분포
F분포두 개의 분산이 주어졌을 때 분산비가 따르는 분포

t분포의 성질: 정규분포보다 꼬리가 두껍고 봉우리가 낮습니다. 모표준편차를 모르는 불확실성이 더해졌기 때문입니다. 표본이 커지면 정규분포에 가까워집니다.

카이제곱분포와 F분포의 성질: 분산은 음수가 될 수 없으므로 두 분포 모두 0 이상에서만 정의되고 오른쪽으로 꼬리가 깁니다.

정규분포의 68–95–99.7 규칙

구간포함 비율
평균 기준 표준편차 1개 이내약 68퍼센트
평균 기준 표준편차 2개 이내약 95퍼센트
평균 기준 표준편차 3개 이내약 99.7퍼센트

11편의 z-score 기준이 여기서 나옵니다. z|z| 가 2 이상이면 정규분포에서 상하위 합쳐 약 5퍼센트에만 해당하는 드문 값이고, 3 이상이면 약 0.3퍼센트입니다. 그래서 2나 3을 이상치 기준으로 씁니다.

표준정규분포: 평균 0, 표준편차 1인 정규분포입니다. 어떤 정규분포도 12편의 표준화를 거치면 표준정규분포가 됩니다.

8. 어떤 분포를 쓸지 고르는 흐름

핵심 정리

  • 대표값은 최빈값 → 중앙값 → 평균 순으로 적용 가능한 자료가 좁아지고, 극단값에 민감해진다.
  • 세 값의 순서가 최빈값 < 중앙값 < 평균이면 오른쪽 꼬리가 긴 양의 왜도이고, 반대면 음의 왜도다. 평균만 크기에 반응한다.
  • 범위는 극단값 두 개만 쓰므로 가장 불안정하고, 중앙값과 IQR이 강건하다. 변동계수는 표준편차를 평균으로 나눠 단위를 없앤 상대적 산포다.
  • 모분산은 nn, 표본분산은 자유도 n1n-1 로 나눈다. 표본평균을 이미 썼기 때문에 자유롭게 정할 수 있는 값이 하나 줄어든다.
  • E(Xˉ)=μE(\bar{X}) = \mu 는 분포 가정 없이 항상 성립하고, Var(Xˉ)=σ2/nVar(\bar{X}) = \sigma^2 / n 이므로 표본을 4배 늘려야 표준오차가 절반이 된다.
  • 중심극한정리가 정규에 가깝게 만드는 것은 표본평균의 분포이지 원자료가 아니다.
  • 기대값은 각 값에 자기 확률을 가중한 합이며 실제로 나올 값이 아니라 장기 평균이다.
  • 이항분포는 E=npE = np, Var=np(1p)Var = np(1-p) 다. 되돌려 놓지 않으면 초기하분포로 바뀐다.
  • 층화추출은 모든 집단에서 조금씩, 군집추출은 일부 집단을 통째로 조사한다.

마무리 복습

문제 14지선다
각 부품이 불량일 확률이 0.2이고 서로 독립일 때, 50개 중 불량품 수 X의 분산은?
문제 24지선다
정비센터의 장비 수리시간은 2시간대에 봉우리가 하나 있고 대부분 1–4시간이지만, 드물게 12–18시간이 걸린 작업도 있다. 히스토그램에 왼쪽부터 A, B, C 세로선을 표시했을 때 최빈값·중앙값·평균의 대응으로 옳은 것은?
문제 34지선다
평균이 μ이고 분산이 σ제곱인 모집단에서 크기 n의 확률표본을 뽑아 표본평균을 구했다. 추가 분포 가정 없이 항상 성립하는 것은?
문제 44지선다
확률변수 Y가 확률 0.7로 4를, 확률 0.3으로 -6을 갖는다. Y의 기대값은?
문제 54지선다
불량품 12개가 포함된 60개 납품 상자에서 8개를 검사하며 검사한 제품은 상자에 되돌려 놓지 않는다. 불량품 수에 초기하분포를 적용해야 하는 이유로 가장 적절한 것은?
문제 64지선다
자료 2, 4, 4, 4, 5, 5, 7, 9의 평균, 중앙값, 최빈값을 바르게 구한 것은?
문제 74지선다
소득 자료에 매우 큰 극단값이 몇 개 포함되어 있다. 중심 위치를 비교적 강건하게 요약하는 통계량과 그 이유의 연결로 가장 적절한 것은?
문제 84지선다
모표준편차가 6인 모집단에서 크기 9의 표본을 뽑았을 때 표본평균의 표준오차와, 표준오차를 절반으로 줄이기 위해 필요한 표본 크기를 바르게 짝지은 것은?

참고 자료

Last updated on