Skip to Content
자격증빅데이터분석기사 필기01. 필기 대비를 위한 기초 수학·통계

이번 문서의 목표: 시험에 나오는 수식 기호를 소리 내어 읽고, 평균·분산·표준편차·사분위수를 종이에 손으로 계산할 수 있으며, 모집단과 표본의 차이를 설명할 수 있게 된다.

왜 수학을 먼저 정리하는가

빅데이터분석기사 필기의 계산 문제는 어렵지 않습니다. 진짜 어려움은 수식을 읽지 못해서 문제가 무엇을 요구하는지조차 모르는 상태에서 옵니다. 예를 들어 아래 식이 나오면 많은 수험생이 그 자리에서 멈춥니다.

s2=1n1i=1n(xixˉ)2s^2 = \frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar{x})^2

이 식은 사실 “각 값에서 평균을 빼고, 제곱하고, 다 더한 다음, 개수보다 하나 적은 수로 나눠라”는 문장을 기호로 줄여 쓴 것뿐입니다. 이 편은 그 번역 능력을 만듭니다.

쉽게 말하면: 수식은 외국어이고, 이 편은 그 외국어의 단어장입니다.

1. 기호 읽는 법 — 시험에 나오는 것만

기호읽는 법
\sum시그마모두 더하라
xˉ\bar{x}엑스 바표본평균
μ\mu모평균
σ\sigma시그마(소문자)모표준편차
σ2\sigma^2시그마 제곱모분산
ss에스표본표준편차
s2s^2에스 제곱표본분산
nn표본 크기(자료 개수)
NN대문자 엔모집단 크기
xix_i엑스 아이i번째 관측값
α\alpha알파유의수준
ρ\rho모상관계수

시그마 기호를 직접 풀어 보기

\sum(시그마)는 그리스 문자 시그마의 대문자로, 영어 Sum(합)의 첫 글자에 해당합니다. 아래 첨자와 위 첨자가 “어디서부터 어디까지 더할지”를 알려 줍니다.

i=15xi=x1+x2+x3+x4+x5\sum_{i=1}^{5} x_i = x_1 + x_2 + x_3 + x_4 + x_5
  • ii: 세는 번호(index, 인덱스). 1번부터 시작합니다.
  • 아래 첨자 i=1i=1: 1번 값부터 더하기 시작
  • 위 첨자 55: 5번 값까지 더하고 멈춤
  • xix_i: i번째 관측값

예시: 자료가 4, 7, 9, 10, 20이라면

i=15xi=4+7+9+10+20=50\sum_{i=1}^{5} x_i = 4 + 7 + 9 + 10 + 20 = 50

생활 비유로는 장바구니에 담은 다섯 상품의 가격표를 하나씩 순서대로 읽으며 계산기에 더하는 행동이 곧 시그마입니다.

2. 지수와 로그 — 왜 데이터 분석에 나오나

지수

ana^naann번 곱하라는 뜻입니다. 23=2×2×2=82^3 = 2 \times 2 \times 2 = 8입니다. 데이터 크기 단위가 지수로 표현됩니다.

1 KB=210 B=1024 B1\ \text{KB} = 2^{10}\ \text{B} = 1024\ \text{B}
  • 22: 컴퓨터가 0과 1 두 가지 상태를 쓰기 때문에 2를 밑으로 씁니다
  • 지수 1010: 2를 열 번 곱함

같은 방식으로 MB는 2202^{20}바이트, GB는 2302^{30}, TB는 2402^{40}, PB는 2502^{50}바이트입니다. 빅데이터의 크기(Volume, 볼륨)를 말할 때 “테라바이트(TB)·페타바이트(PB) 이상”이라는 표현이 나오는데, 이 순서를 헷갈리지 않도록 KB → MB → GB → TB → PB → EB 를 외워 둡니다.

로그

로그(log, logarithm, 로가리듬)는 지수의 반대 연산입니다. “밑을 몇 번 곱해야 이 수가 되는가”를 답합니다.

log28=3\log_{2} 8 = 3
  • 22: 곱할 수
  • 진수 88: 만들고 싶은 결과
  • 33: 2를 세 번 곱하면 8이 되므로 3

데이터 분석에서 로그를 쓰는 이유는 12편의 로그 변환에서 자세히 다루지만, 직관은 여기서 잡아 둡니다. 소득처럼 한쪽으로 심하게 치우친(오른쪽 꼬리가 긴) 자료는 값이 100, 200, 300, 그리고 갑자기 100000처럼 벌어집니다. 로그를 씌우면 큰 값이 훨씬 크게 줄어들어 분포가 대칭에 가까워집니다.

원래 값상용로그 값
101
1002
10003
1000005

해석: 원래 값이 10배씩 커질 때 로그 값은 1씩만 커집니다. 값의 폭이 10만이었던 자료가 로그 후에는 폭이 4로 줄어듭니다. 이것이 “로그 변환은 산포를 균일화한다”는 문장의 실제 의미입니다.

3. 중심을 나타내는 값 — 평균·중앙값·최빈값

쉽게 말하면: 자료 덩어리를 대표하는 숫자 하나를 고르는 세 가지 방법입니다.

이 세 가지를 중심경향척도(measure of central tendency)라고 부릅니다.

평균

xˉ=1ni=1nxi\bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i
  • xˉ\bar{x}: 표본평균(엑스 바)
  • nn: 자료 개수
  • xi\sum x_i: 모든 값의 합

예시 자료: 4, 7, 9, 10, 20 (5개)

xˉ=4+7+9+10+205=505=10\bar{x} = \frac{4+7+9+10+20}{5} = \frac{50}{5} = 10

중앙값

자료를 크기 순으로 정렬한 뒤 가운데 있는 값입니다. 개수가 홀수면 정확히 가운데 값, 짝수면 가운데 두 값의 평균입니다.

위 자료를 정렬하면 4, 7, 9, 10, 20이고 개수가 5개(홀수)이므로 3번째 값인 9가 중앙값입니다.

자료가 하나 더 늘어 4, 7, 9, 10, 20, 30이 되면 개수가 6개(짝수)이므로 3번째와 4번째의 평균입니다.

중앙값=9+102=9.5\text{중앙값} = \frac{9 + 10}{2} = 9.5

최빈값

가장 자주 나타난 값 또는 범주입니다. 자료 3, 3, 5, 7, 7, 7, 9라면 7이 세 번으로 가장 많으므로 최빈값은 7입니다.

셋의 관계로 분포의 치우침을 읽는다 — 기출 단골

관계분포 모양대표 사례
평균 = 중앙값 = 최빈값좌우 대칭정규분포
평균 > 중앙값오른쪽 꼬리가 김 (양의 왜도)소득, 매출
평균 < 중앙값왼쪽 꼬리가 김 (음의 왜도)만점이 몰린 시험 점수

왜 그런가: 평균은 모든 값을 더해서 나누므로 극단값에 끌려갑니다. 반면 중앙값은 순서만 보므로 극단값이 아무리 커도 자리를 지킵니다. 그래서 아주 큰 값이 몇 개 섞이면 평균만 위로 끌려 올라가 “평균이 중앙값보다 크다”는 상태가 됩니다.

계산으로 확인: 자료 11, 12, 12, 13, 14, 15, 41을 봅시다.

xˉ=11+12+12+13+14+15+417=118716.86\bar{x} = \frac{11+12+12+13+14+15+41}{7} = \frac{118}{7} \approx 16.86

정렬된 7개의 가운데(4번째) 값이 중앙값이므로 13입니다.

해석: 평균 약 16.86이 중앙값 13보다 큽니다. 41이라는 큰 값 하나가 평균만 끌어올린 것입니다. 따라서 이 분포는 오른쪽으로 꼬리가 긴 형태를 의심해야 합니다. 기출에서는 “높은 극단값이 있으므로 분포는 왼쪽으로 치우친다”는 보기를 틀린 설명으로 넣습니다. 높은 값 쪽에 꼬리 → 오른쪽 치우침(양의 왜도) 이라는 방향을 반드시 고정해 두세요.

4. 흩어짐을 나타내는 값 — 분산·표준편차·범위

쉽게 말하면: 값들이 평균 주위에 얼마나 몰려 있는지, 아니면 넓게 퍼져 있는지를 재는 자입니다.

중심만으로는 자료를 설명할 수 없습니다. 평균이 같은 두 반이 있어도, 한 반은 전원이 70점 근처이고 다른 반은 30점과 100점이 섞여 있을 수 있습니다. 이 차이를 재는 것이 산포경향척도(measure of dispersion)입니다.

편차와 분산

편차는 각 값에서 평균을 뺀 값 (xixˉ)(x_i - \bar{x}) 입니다. 그런데 편차를 그냥 다 더하면 항상 0이 됩니다. 위쪽으로 벗어난 만큼과 아래쪽으로 벗어난 만큼이 상쇄되기 때문입니다. 그래서 제곱해서 부호를 없앤 뒤 평균을 냅니다. 이것이 분산입니다.

s2=1n1i=1n(xixˉ)2s^2 = \frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar{x})^2
  • s2s^2: 표본분산
  • xixˉx_i - \bar{x}: i번째 편차
  • 제곱: 음수 부호를 없애고, 크게 벗어난 값에 더 큰 벌점을 준다
  • n1n-1: 자유도(degree of freedom). 표본분산에서만 쓰는 나눗수

손으로 계산해 보기 — 중간 단계 전부

자료: 4, 7, 9, 10, 20 (앞에서 평균 10을 구했습니다)

1단계 — 편차 구하기

xix_ixixˉx_i - \bar{x}(xixˉ)2(x_i - \bar{x})^2
4–636
7–39
9–11
1000
2010100
합계0146

2단계 — 편차 제곱의 합

(xixˉ)2=36+9+1+0+100=146\sum (x_i - \bar{x})^2 = 36 + 9 + 1 + 0 + 100 = 146

3단계 — 표본분산

s2=14651=1464=36.5s^2 = \frac{146}{5-1} = \frac{146}{4} = 36.5

4단계 — 표본표준편차(분산의 제곱근)

s=36.56.04s = \sqrt{36.5} \approx 6.04

해석: 표준편차 약 6.04는 “값들이 평균 10에서 대체로 6 정도씩 벗어나 있다”는 뜻입니다. 분산 36.5는 제곱된 값이라 원래 자료와 단위가 다릅니다(자료가 ‘점’이면 분산은 ‘점의 제곱’). 그래서 해석할 때는 원래 단위로 돌아온 표준편차를 씁니다.

왜 표본분산은 nn이 아니라 n1n-1로 나누는가

이 질문은 기출에 자주 등장하고, 대부분의 수험생이 “그냥 그렇다”로 넘겨서 함정에 걸립니다.

표본분산을 계산할 때 우리는 이미 표본평균 xˉ\bar{x} 를 자료로부터 계산해서 썼습니다. 그런데 편차의 합은 반드시 0이 되어야 하므로, nn개의 편차 중 n1n-1개를 알면 나머지 하나는 자동으로 결정됩니다. 위 표에서도 편차 –6, –3, –1, 0을 알면 마지막 편차는 합이 0이 되도록 반드시 10이어야 합니다.

쉽게 말하면: 자유롭게 움직일 수 있는 값이 nn개가 아니라 n1n-1개뿐이므로, n1n-1로 나눠야 모분산을 치우침 없이 추정합니다.

n1n-1자유도(degree of freedom, df)라고 부릅니다. 자유도는 뒤에서 t분포·카이제곱분포에서도 계속 나오는 개념이므로 여기서 확실히 잡아 둡니다.

구분기호나눗수이유
모분산σ2\sigma^2NN모집단 전체를 알고 있으므로 보정 불필요
표본분산s2s^2n1n-1표본평균을 이미 썼으므로 자유도 1 감소

변동계수

단위가 다른 두 자료의 흩어짐을 비교할 때는 표준편차를 그대로 비교할 수 없습니다. 키(cm)의 표준편차 5와 몸무게(kg)의 표준편차 5는 의미가 다르기 때문입니다. 그래서 평균 대비 비율로 봅니다.

CV=sxˉCV = \frac{s}{\bar{x}}
  • CVCV: 변동계수(Coefficient of Variation)
  • ss: 표준편차
  • xˉ\bar{x}: 평균

위 자료라면 CV=6.04÷10=0.604CV = 6.04 \div 10 = 0.604 이고, 백분율로는 약 60.4퍼센트입니다.

5. 분위수와 사분위수 범위

쉽게 말하면: 자료를 크기 순으로 세워 놓고 4등분하는 지점의 값입니다.

  • Q1(제1사분위수): 아래에서 25퍼센트 지점
  • Q2(제2사분위수): 50퍼센트 지점 = 중앙값
  • Q3(제3사분위수): 아래에서 75퍼센트 지점
IQR=Q3Q1IQR = Q_3 - Q_1
  • IQRIQR: 사분위수 범위(Interquartile Range). 가운데 50퍼센트가 차지하는 폭

이상치 판정 기준 — 11편으로 이어지는 계산

상자그림(box plot, 박스플롯)이 이상치를 표시하는 규칙은 다음과 같습니다.

하한 경계=Q11.5×IQR\text{하한 경계} = Q_1 - 1.5 \times IQR 상한 경계=Q3+1.5×IQR\text{상한 경계} = Q_3 + 1.5 \times IQR

이 두 경계 밖의 값을 이상치 후보로 봅니다.

계산 예시: Q1=20Q_1 = 20, Q3=40Q_3 = 40 인 자료에서

IQR=4020=20IQR = 40 - 20 = 20 하한=201.5×20=2030=10\text{하한} = 20 - 1.5 \times 20 = 20 - 30 = -10 상한=40+1.5×20=40+30=70\text{상한} = 40 + 1.5 \times 20 = 40 + 30 = 70

해석: 값이 –10보다 작거나 70보다 크면 이상치 후보입니다. 값 75는 상한 70을 넘으므로 이상치 후보이고, 값 65는 경계 안이므로 정상 범위입니다. 1.5라는 배수는 관례이며 프로그램·상황에 따라 다르게 쓸 수 있다는 점도 기출 함정으로 나옵니다.

6. 확률의 기초

확률의 뜻

확률은 어떤 사건이 일어날 가능성을 0과 1 사이 숫자로 나타낸 값입니다. 주사위 하나를 던져 짝수가 나올 확률은 짝수 눈이 2, 4, 6의 세 가지이므로

P(짝수)=36=0.5P(\text{짝수}) = \frac{3}{6} = 0.5
  • PP: 확률(Probability)의 첫 글자
  • 분자 3: 조건을 만족하는 경우의 수
  • 분모 6: 전체 경우의 수

조건부확률

사건 B가 이미 일어났다는 정보가 있을 때 사건 A가 일어날 확률입니다.

P(AB)=P(AB)P(B)P(A \mid B) = \frac{P(A \cap B)}{P(B)}
  • P(AB)P(A \mid B): “B가 주어졌을 때 A의 확률”이라고 읽습니다. 세로 막대는 조건 기호입니다
  • P(AB)P(A \cap B): A와 B가 동시에 일어날 확률. \cap 은 교집합(캡, cap) 기호
  • P(B)P(B): 조건이 되는 사건의 확률

예시: 주사위 눈이 짝수(B)라는 정보가 있을 때, 그 눈이 4(A)일 확률은?

P(B)=36P(B) = \frac{3}{6} P(AB)=16P(A \cap B) = \frac{1}{6} P(AB)=1/63/6=13P(A \mid B) = \frac{1/6}{3/6} = \frac{1}{3}

해석: 아무 정보 없이 4가 나올 확률은 6분의 1이지만, “짝수다”라는 정보가 들어오면 후보가 2, 4, 6 셋으로 줄어 확률이 3분의 1로 올라갑니다. 정보가 들어오면 분모(가능한 세계)가 줄어든다는 것이 조건부확률의 핵심 직관입니다.

전체확률과 역방향 계산 — 기출 계산 유형

기출에는 다음 형태가 자주 나옵니다. “집단 A와 B의 비율이 각각 0.6, 0.4이고, 기준 초과가 나타날 확률이 A에서 0.25, B에서 0.10일 때, 기준 초과가 관찰된 사람이 A일 확률은?”

1단계 — A이면서 초과일 확률

P(A초과)=0.6×0.25=0.15P(A \cap \text{초과}) = 0.6 \times 0.25 = 0.15

2단계 — B이면서 초과일 확률

P(B초과)=0.4×0.10=0.04P(B \cap \text{초과}) = 0.4 \times 0.10 = 0.04

3단계 — 초과가 나타날 전체 확률

P(초과)=0.15+0.04=0.19P(\text{초과}) = 0.15 + 0.04 = 0.19

4단계 — 초과인 사람이 A일 확률

P(A초과)=0.150.190.789P(A \mid \text{초과}) = \frac{0.15}{0.19} \approx 0.789

해석: 원래 A는 전체의 60퍼센트였는데, “기준 초과”라는 정보를 얻고 나니 A일 확률이 약 78.9퍼센트로 올라갔습니다. A에서 초과가 더 자주 일어나기 때문입니다. 이 계산의 뼈대는 각 갈래의 확률을 곱해서 더하고(전체확률), 관심 갈래를 그 합으로 나눈다는 두 단계뿐입니다.

7. 모집단과 표본

쉽게 말하면: 알고 싶은 대상 전체가 모집단이고, 실제로 손에 넣은 일부가 표본입니다.

구분대상값의 이름기호
모집단관심 대상 전체모수(parameter)μ\mu, σ2\sigma^2
표본모집단에서 뽑은 일부통계량(statistic)xˉ\bar{x}, s2s^2

왜 표본을 쓰는가: 전국 성인 남성 전체의 키를 재는 것은 비용과 시간 면에서 불가능합니다. 그래서 1000명을 뽑아 재고, 그 표본평균으로 모평균을 추정합니다. 여기서 생기는 오차를 다루는 것이 15편의 추론통계입니다.

자주 틀리는 점: 모수와 통계량을 반대로 쓰는 실수가 잦습니다. 모수는 모집단의 값이라 보통 알 수 없는 미지수이고, 통계량은 표본에서 실제로 계산해 낸 값입니다. 기호로는 그리스 문자(μ\mu, σ\sigma)가 모수, 로마 문자(xˉ\bar{x}, ss)가 통계량이라고 외우면 헷갈리지 않습니다.

핵심 정리

  • \sum 는 “모두 더하라”는 기호이며, 아래·위 첨자가 더하는 범위를 나타낸다. 수식은 문장을 줄여 쓴 것이므로 그대로 풀어 읽으면 된다.
  • 중심경향척도는 평균·중앙값·최빈값이며, 평균이 중앙값보다 크면 오른쪽 꼬리(양의 왜도) 를 의심한다. 평균만 극단값에 끌려간다.
  • 표본분산은 nn이 아니라 n1n-1(자유도)로 나눈다. 표본평균을 이미 썼기 때문에 자유롭게 움직일 값이 하나 줄기 때문이다.
  • IQR=Q3Q1IQR = Q_3 - Q_1 이고, 이상치 경계는 Q11.5×IQRQ_1 - 1.5 \times IQRQ3+1.5×IQRQ_3 + 1.5 \times IQR 이다.
  • 조건부확률은 “정보가 들어오면 분모가 줄어든다”는 계산이며, 전체확률로 분모를 만들고 관심 갈래를 나누면 역방향 확률을 얻는다.
  • 모수는 모집단의 미지수(그리스 문자), 통계량은 표본에서 계산한 값(로마 문자)이다.

마무리 복습

문제 14지선다
자료 4, 7, 9, 10, 20의 표본분산으로 옳은 것은?
문제 24지선다
어떤 자료의 평균이 54, 중앙값이 49로 관찰되었다. 이로부터 가장 타당한 해석은?
문제 34지선다
표본분산을 계산할 때 관측치 개수 n이 아니라 n-1로 나누는 이유로 가장 적절한 것은?
문제 44지선다
어떤 변수의 제1사분위수가 20, 제3사분위수가 40이다. 1.5 IQR 규칙에 따른 상한 경계값은?
문제 54지선다
집단 A와 B의 비율이 각각 0.6과 0.4이고, 기준 초과가 나타날 확률이 A에서 0.25, B에서 0.10일 때 기준 초과가 관찰된 사람이 A에 속할 확률은?
문제 64지선다
모수와 통계량에 대한 설명으로 옳은 것은?
문제 74지선다
변동계수(CV)를 사용하는 가장 적절한 상황은?

참고 자료

Last updated on