먼저 읽어 주세요. 이 편의 문제는 실제 기출을 그대로 복제한 것이 아니라, 같은 개념·같은 난이도로 재구성한 문항입니다. 기출 중 정답이 모호하거나 조건이 부족했던 문항은 조건을 명확히 다듬어 새로 출제했습니다. 그러므로 “이 숫자가 시험에 그대로 나온다”가 아니라 “이 계산 절차가 시험에 나온다”로 읽어 주세요.
이번 문서의 목표: 필기에서 계산으로 출제되는 모든 공식을 한자리에 모아 각 기호의 뜻까지 확인하고, 22개 문항을 통해 “공식 확인 → 값 대입 → 산술 계산 → 보기 대조”의 절차를 몸에 익힌다. 특히 오답 보기가 어떤 잘못된 계산에서 나온 값인지를 하나하나 확인해, 시험장에서 같은 실수를 반복하지 않게 된다.
이 편을 이렇게 쓰세요
계산 문제는 필기에서 버리면 안 되는 문제입니다. 개념 문제는 애매한 표현 때문에 헷갈릴 수 있지만, 계산 문제는 공식만 정확히 알면 정답이 하나로 확정됩니다. 즉 계산 문제는 이 시험에서 가장 확실하게 점수를 챙길 수 있는 구간입니다.
쉽게 말하면: 개념 문제는 “출제자의 마음”을 읽어야 하지만, 계산 문제는 “산수”만 하면 됩니다. 그래서 계산 문제를 틀리는 건 아깝습니다.
문제를 먼저 풀고 해설을 보는 것도 좋지만, 이 편은 해설을 읽는 것 자체가 학습이 되도록 썼습니다. 맞힌 문제도 해설의 “오답 보기가 어디서 나온 값인지”까지 읽어 주세요. 시험장에서 마주칠 함정이 바로 그 값들입니다.
1. 공식 요약 — 이 편에 나오는 모든 공식
계산 문제를 풀 때 가장 먼저 하는 일은 공식을 정확히 떠올리는 것입니다. 여기서 한 번에 정리합니다. 각 공식 아래에 기호의 뜻을 붙였으니, 기호가 낯설면 반드시 확인하고 넘어가세요.
1-1. 기술통계(Descriptive Statistics)
평균(mean, 산술평균):
- (엑스바): 표본평균. 자료 전체를 대표하는 중심값입니다.
- (시그마): “모두 더하라”는 기호입니다.
- : 자료의 개수(표본 크기).
- : 번째 관측값.
중앙값(median): 값을 크기순으로 정렬한 뒤 한가운데 오는 값. 개수가 짝수면 가운데 두 값의 평균입니다. 최빈값(mode): 가장 자주 나온 값. 가장 큰 값이 아닙니다.
불편표본분산(unbiased sample variance):
- : 표본분산. 자료가 평균에서 얼마나 흩어져 있는지를 나타냅니다.
- : 자유도(degrees of freedom). 표본으로 모집단 분산을 추정할 때 이 아니라 로 나눕니다. 필기에서 가장 자주 나오는 함정입니다.
표준편차(standard deviation):
- 분산에 제곱근(square root)을 씌운 값입니다. 단위가 원자료와 같아져서 해석하기 쉽습니다.
사분위범위(IQR, Interquartile Range):
- (제1사분위수): 아래에서 25퍼센트 지점의 값.
- (제3사분위수): 아래에서 75퍼센트 지점의 값.
- 상자그림(box plot)에서 상자의 폭에 해당하며, 이상치 판정 경계는
Q1 - 1.5×IQR아래와Q3 + 1.5×IQR위입니다.
변동계수(CV, Coefficient of Variation):
- 표준편차를 평균으로 나눈 상대적 산포입니다. 단위가 다르거나 평균 규모가 크게 다른 두 집단의 흩어짐을 비교할 때 씁니다. 보통 백분율로 보고합니다.
왜도(skewness, 비대칭도) 방향 판단: 평균·중앙값·최빈값의 순서로 읽습니다.
| 순서 | 왜도 | 꼬리 방향 | 예시 |
|---|---|---|---|
| 최빈값 < 중앙값 < 평균 | 양의 왜도(오른쪽 왜도) | 오른쪽으로 긴 꼬리 | 소득, 재산 |
| 평균 < 중앙값 < 최빈값 | 음의 왜도(왼쪽 왜도) | 왼쪽으로 긴 꼬리 | 만점에 몰린 쉬운 시험 |
| 세 값이 거의 같음 | 대칭 | 좌우 대칭 | 성인 키 |
쉽게 말하면: 평균은 극단값에 끌려갑니다. 평균이 중앙값보다 크면 오른쪽에 극단값이 있는 것이고, 그쪽으로 꼬리가 깁니다.
1-2. 확률·분포(Probability and Distributions)
이항분포(Binomial Distribution) :
- : 시행 횟수(고정).
- : 각 시행에서 성공할 확률.
- : 기대값(평균). : 분산.
- 조건: 시행 횟수가 고정, 각 시행이 독립, 성공확률이 일정.
기대값(expected value, 이산형):
- 각 값에 그 값이 나올 확률을 가중치로 곱해 더합니다. 단순 산술평균이 아닙니다.
조건부확률(conditional probability)과 베이즈 정리(Bayes Theorem):
- : 가 일어났다는 조건에서 가 일어날 확률. 세로줄 기호는 “주어졌을 때”로 읽습니다.
- : 질병 보유, : 질병 없음, : 검사 양성.
- : 민감도(sensitivity). : 특이도(specificity), 따라서 특이도.
- 분모는 “양성이 나올 모든 경로”의 합입니다. 진짜 환자의 양성과 건강한 사람의 위양성을 둘 다 더해야 합니다.
분포 판별 요령:
| 상황 | 분포 | 결정적 단서 |
|---|---|---|
| 고정된 번 시행, 복원(또는 매우 큰 모집단) | 이항분포 | 성공확률이 매 시행 동일 |
| 유한 모집단에서 비복원 추출 | 초기하분포(Hypergeometric) | 뽑을수록 남은 구성이 바뀜 |
| 단위 시간·단위 면적당 발생 건수 | 포아송분포(Poisson) | 평균 발생률 람다 하나만 주어짐 |
| 사건과 사건 사이의 대기 시간 | 지수분포(Exponential) | 연속형 시간 |
포아송분포는 평균과 분산이 모두 람다로 같습니다. 이 성질 자체가 자주 출제됩니다.
표준화(standardization, z점수):
- (뮤): 모평균. (시그마): 모표준편차.
- 의미: “이 값은 평균에서 표준편차 몇 개만큼 떨어져 있는가”. 단위가 사라지므로 서로 다른 시험 점수를 비교할 수 있습니다.
1-3. 추론·검정(Inference and Hypothesis Testing)
표준오차(SE, Standard Error):
- 표본평균이 표본마다 얼마나 흔들리는지를 나타냅니다. 분모는 이 아니라 (루트 )입니다. 여기서 제곱근을 빠뜨리는 실수가 매우 흔합니다.
신뢰구간(confidence interval, 모평균, 대표본):
- 95퍼센트 신뢰구간이면 , 99퍼센트면 을 씁니다.
- 해석: “이 구간에 모평균이 있을 확률이 95퍼센트”가 아니라, “같은 절차를 반복하면 만들어지는 구간들 중 95퍼센트가 모평균을 포함한다”입니다.
t통계량(t-statistic, 단일표본):
- : 귀무가설이 주장하는 평균값.
- 분자는 “관측된 차이”, 분모는 “그 차이가 우연히 생길 만한 크기”. 즉 t값은 차이를 잡음 크기로 나눈 비율입니다.
오류의 종류:
| 구분 | 실제 귀무가설이 참 | 실제 귀무가설이 거짓 |
|---|---|---|
| 귀무가설 기각 | 제1종 오류(알파) | 옳은 판단(검정력) |
| 귀무가설 기각 못 함 | 옳은 판단 | 제2종 오류(베타) |
- 제1종 오류: 아무 효과도 없는데 “효과 있다”고 선언. 유의수준 알파가 이 오류의 허용 한도입니다.
- 제2종 오류: 실제로 효과가 있는데 놓침.
p값(p-value): 귀무가설이 참이라고 가정했을 때, 관측된 것만큼 또는 그보다 극단적인 결과가 나올 확률입니다. p값 < 유의수준이면 귀무가설을 기각합니다. p값은 “귀무가설이 참일 확률”이 아닙니다. 이 오해가 보기로 자주 등장합니다.
1-4. 거리와 유사도(Distance and Similarity)
두 점 와 에 대해,
유클리드 거리(Euclidean distance):
맨해튼 거리(Manhattan distance):
민코프스키 거리(Minkowski distance):
- 이면 맨해튼, 이면 유클리드가 됩니다. 즉 민코프스키는 두 거리를 아우르는 일반형입니다.
코사인 유사도(cosine similarity):
- : 두 벡터의 내적. 성분끼리 곱해서 모두 더합니다.
- : 벡터 의 크기(norm). 각 성분을 제곱해 더한 뒤 제곱근을 씌웁니다.
- 값은 0부터 1 사이(음수 성분이 없을 때). 1이면 방향이 완전히 같습니다. 크기가 아니라 방향만 봅니다.
쉽게 말하면: 유클리드는 “직선으로 몇 미터”, 맨해튼은 “블록을 몇 칸 돌아서”, 코사인은 “어느 쪽을 바라보고 있는가”입니다.
1-5. 분류 평가지표(Classification Metrics)
혼동행렬(confusion matrix)의 네 칸:
| 구분 | 예측 양성 | 예측 음성 |
|---|---|---|
| 실제 양성 | TP(True Positive) | FN(False Negative) |
| 실제 음성 | FP(False Positive) | TN(True Negative) |
- 분모가 핵심입니다. 정밀도는 “예측해서 양성이라 한 것들” 중에서, 재현율은 “실제 양성인 것들” 중에서 맞힌 비율입니다.
- F1은 조화평균(harmonic mean)입니다. 산술평균이 아닙니다. 조화평균은 두 값 중 작은 쪽에 끌려가므로, 한쪽만 높은 모델을 걸러냅니다.
- AUC(Area Under the ROC Curve): ROC 곡선 아래 면적. 0.5는 무작위 추측 수준, 1.0은 완벽한 분류입니다. 0.5 미만이면 예측을 뒤집는 게 나은 상태입니다.
1-6. 회귀 평가지표(Regression Metrics)
- : 실제값, (와이햇): 예측값.
- MSE(Mean Squared Error, 평균제곱오차)는 오차를 제곱하므로 큰 오차에 민감합니다. 단위는 원자료의 제곱입니다.
- RMSE(Root Mean Squared Error)는 제곱근을 씌워 단위를 원자료와 맞춘 값입니다.
- MAE(Mean Absolute Error, 평균절대오차)는 절댓값을 씁니다. 부호를 살려서 더하면 오차가 상쇄돼 0이 나올 수 있습니다.
- MAPE(Mean Absolute Percentage Error)는 오차를 실제값 대비 비율로 봅니다. 실제값이 0이면 계산이 불가능합니다.
제곱합 분해와 결정계수:
- SST(Total Sum of Squares, 총제곱합): 실제값이 평균에서 얼마나 흩어졌는가.
- SSR(Regression Sum of Squares, 회귀제곱합): 그중 모형이 설명한 부분.
- SSE(Error Sum of Squares, 잔차제곱합): 모형이 설명하지 못한 부분.
- : 설명된 비율. 0부터 1 사이입니다.
- (수정결정계수): 은 표본 크기, 는 설명변수 개수. 쓸모없는 변수를 넣으면 오히려 값이 떨어집니다. 이 성질이 출제 포인트입니다.
1-7. 군집·차원축소·연관규칙
PCA 설명분산비율(explained variance ratio):
- (람다): 번째 주성분의 고윳값(eigenvalue). 그 주성분이 담고 있는 분산의 크기입니다.
- 분모는 모든 고윳값의 합입니다. 누적 설명분산은 앞에서부터 차례로 더해 나갑니다.
실루엣 계수(silhouette coefficient):
- : 점 가 자기 군집 안 다른 점들과의 평균 거리(응집도, 작을수록 좋음).
- : 점 가 가장 가까운 다른 군집의 점들과의 평균 거리(분리도, 클수록 좋음).
- 값은 부터 사이. 1에 가까울수록 군집이 잘 나뉜 것입니다. 분모는 두 값 중 큰 쪽입니다.
연관규칙(association rule) :
- : 전체 거래 수, : 를 포함한 거래 수.
- 지지도의 분모는 전체 거래, 신뢰도의 분모는 A를 포함한 거래입니다. 이 분모 차이가 출제 포인트입니다.
- 향상도가 1이면 A와 B는 독립(관계 없음), 1보다 크면 양의 관계, 1보다 작으면 음의 관계입니다.
2. 계산 문제 푸는 순서
시험장에서는 시간이 부족하고 마음이 급합니다. 순서를 미리 정해 두면 실수가 크게 줄어듭니다.
- 무엇을 묻는지 확정한다. “분산인가 표준편차인가”, “정밀도인가 재현율인가”를 먼저 못 박습니다.
- 공식을 먼저 적는다. 값을 보면서 공식을 떠올리면 유도되기 쉽습니다. 값을 보기 전에 공식부터 적으세요.
- 값을 기호에 대입한다. , , 각각에 무엇이 들어가는지 문제 옆에 적습니다.
- 단위와 분모를 확인한다. 백분율인가 소수인가, 분모가 인가 인가, 인가 인가.
- 중간값을 남기며 계산한다. 한 번에 계산기로 밀지 말고 단계를 남기면 검산이 쉽습니다.
- 보기와 대조한다. 내 답이 보기에 없으면 대개 4번(분모)에서 틀린 것입니다.
계산 문제에서 자주 틀리는 함정 다섯 가지
- 표본분산의 분모는 이 아니라 이다. “표본”이라는 단어가 보이면 자유도를 의심하세요.
- 표준오차의 분모는 이 아니라 이다. 표준편차와 표준오차를 같은 것으로 쓰면 신뢰구간이 통째로 틀립니다.
- F1은 조화평균이지 산술평균이 아니다. 정밀도와 재현율을 더해 2로 나눈 값은 항상 F1보다 큽니다.
- 정밀도와 재현율은 분모가 다르다. 정밀도는
TP+FP, 재현율은TP+FN입니다. 세로로 보느냐 가로로 보느냐의 차이입니다. - 분산과 표준편차를 바꿔 쓴다. 문제가 분산을 물었는데 제곱근을 씌운 값을 고르거나 그 반대인 경우가 매우 흔합니다.
한 가지 예를 손으로 풀어 보겠습니다. 어떤 점의 응집도 , 분리도 일 때 실루엣 계수는,
분모에 인 2를 쓰면 가 나오는데, 실루엣 계수는 1을 넘을 수 없으므로 답이 나온 순간 틀렸다는 걸 알 수 있습니다. 이렇게 값의 범위를 알고 있으면 자기 검산이 됩니다.
핵심 정리
- 계산 문제는 정답이 하나로 확정되는 구간이므로 가장 확실한 득점원입니다. 공식을 먼저 적고 값을 대입하는 순서를 고정하세요.
- 오답 보기의 대부분은 분모를 잘못 쓴 값입니다. 대 , 대 ,
TP+FP대TP+FN, 전체 거래 대 A 포함 거래를 항상 확인하세요. - 지표에는 값의 범위가 있습니다. 상관계수와 실루엣은 부터 1, 결정계수와 AUC와 각종 분류지표는 0부터 1입니다. 범위를 벗어난 값이 나오면 계산이 틀린 것입니다.
- F1은 조화평균, 기대값은 확률 가중합, MAE는 절댓값 평균입니다. 산술평균으로 대충 계산하면 반드시 함정에 걸립니다.
- 값을 구한 뒤에는 말로 해석하는 연습을 하세요. 최근 회차는 “값을 구하라”보다 “이 값이 무엇을 뜻하는가”를 묻는 비중이 커지고 있습니다.