Skip to Content
자격증빅데이터분석기사 필기24. 기출·복원 문항으로 보는 계산·평가지표(최근 회차 2)

먼저 읽어 주세요. 이 편의 문제는 실제 기출을 그대로 복제한 것이 아니라, 같은 개념·같은 난이도로 재구성한 문항입니다. 기출 중 정답이 모호하거나 조건이 부족했던 문항은 조건을 명확히 다듬어 새로 출제했습니다. 그러므로 “이 숫자가 시험에 그대로 나온다”가 아니라 “이 계산 절차가 시험에 나온다”로 읽어 주세요.

이번 문서의 목표: 필기에서 계산으로 출제되는 모든 공식을 한자리에 모아 각 기호의 뜻까지 확인하고, 22개 문항을 통해 “공식 확인 → 값 대입 → 산술 계산 → 보기 대조”의 절차를 몸에 익힌다. 특히 오답 보기가 어떤 잘못된 계산에서 나온 값인지를 하나하나 확인해, 시험장에서 같은 실수를 반복하지 않게 된다.

이 편을 이렇게 쓰세요

계산 문제는 필기에서 버리면 안 되는 문제입니다. 개념 문제는 애매한 표현 때문에 헷갈릴 수 있지만, 계산 문제는 공식만 정확히 알면 정답이 하나로 확정됩니다. 즉 계산 문제는 이 시험에서 가장 확실하게 점수를 챙길 수 있는 구간입니다.

쉽게 말하면: 개념 문제는 “출제자의 마음”을 읽어야 하지만, 계산 문제는 “산수”만 하면 됩니다. 그래서 계산 문제를 틀리는 건 아깝습니다.

문제를 먼저 풀고 해설을 보는 것도 좋지만, 이 편은 해설을 읽는 것 자체가 학습이 되도록 썼습니다. 맞힌 문제도 해설의 “오답 보기가 어디서 나온 값인지”까지 읽어 주세요. 시험장에서 마주칠 함정이 바로 그 값들입니다.

1. 공식 요약 — 이 편에 나오는 모든 공식

계산 문제를 풀 때 가장 먼저 하는 일은 공식을 정확히 떠올리는 것입니다. 여기서 한 번에 정리합니다. 각 공식 아래에 기호의 뜻을 붙였으니, 기호가 낯설면 반드시 확인하고 넘어가세요.

1-1. 기술통계(Descriptive Statistics)

평균(mean, 산술평균):

xˉ=1ni=1nxi\bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i
  • xˉ\bar{x} (엑스바): 표본평균. 자료 전체를 대표하는 중심값입니다.
  • \sum (시그마): “모두 더하라”는 기호입니다.
  • nn: 자료의 개수(표본 크기).
  • xix_i: ii번째 관측값.

중앙값(median): 값을 크기순으로 정렬한 뒤 한가운데 오는 값. 개수가 짝수면 가운데 두 값의 평균입니다. 최빈값(mode): 가장 자주 나온 값. 가장 큰 값이 아닙니다.

불편표본분산(unbiased sample variance):

s2=1n1i=1n(xixˉ)2s^2 = \frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar{x})^2
  • s2s^2: 표본분산. 자료가 평균에서 얼마나 흩어져 있는지를 나타냅니다.
  • n1n-1: 자유도(degrees of freedom). 표본으로 모집단 분산을 추정할 때 nn이 아니라 n1n-1로 나눕니다. 필기에서 가장 자주 나오는 함정입니다.

표준편차(standard deviation):

s=s2s = \sqrt{s^2}
  • 분산에 제곱근(square root)을 씌운 값입니다. 단위가 원자료와 같아져서 해석하기 쉽습니다.

사분위범위(IQR, Interquartile Range):

IQR=Q3Q1IQR = Q_3 - Q_1
  • Q1Q_1 (제1사분위수): 아래에서 25퍼센트 지점의 값.
  • Q3Q_3 (제3사분위수): 아래에서 75퍼센트 지점의 값.
  • 상자그림(box plot)에서 상자의 에 해당하며, 이상치 판정 경계는 Q1 - 1.5×IQR 아래와 Q3 + 1.5×IQR 위입니다.

변동계수(CV, Coefficient of Variation):

CV=sxˉCV = \frac{s}{\bar{x}}
  • 표준편차를 평균으로 나눈 상대적 산포입니다. 단위가 다르거나 평균 규모가 크게 다른 두 집단의 흩어짐을 비교할 때 씁니다. 보통 백분율로 보고합니다.

왜도(skewness, 비대칭도) 방향 판단: 평균·중앙값·최빈값의 순서로 읽습니다.

순서왜도꼬리 방향예시
최빈값 < 중앙값 < 평균양의 왜도(오른쪽 왜도)오른쪽으로 긴 꼬리소득, 재산
평균 < 중앙값 < 최빈값음의 왜도(왼쪽 왜도)왼쪽으로 긴 꼬리만점에 몰린 쉬운 시험
세 값이 거의 같음대칭좌우 대칭성인 키

쉽게 말하면: 평균은 극단값에 끌려갑니다. 평균이 중앙값보다 크면 오른쪽에 극단값이 있는 것이고, 그쪽으로 꼬리가 깁니다.

1-2. 확률·분포(Probability and Distributions)

이항분포(Binomial Distribution) B(n,p)B(n, p):

E[X]=npE[X] = np Var[X]=np(1p)Var[X] = np(1-p)
  • nn: 시행 횟수(고정).
  • pp: 각 시행에서 성공할 확률.
  • E[X]E[X]: 기대값(평균). Var[X]Var[X]: 분산.
  • 조건: 시행 횟수가 고정, 각 시행이 독립, 성공확률이 일정.

기대값(expected value, 이산형):

E[X]=ixiP(xi)E[X] = \sum_i x_i \cdot P(x_i)
  • 각 값에 그 값이 나올 확률을 가중치로 곱해 더합니다. 단순 산술평균이 아닙니다.

조건부확률(conditional probability)과 베이즈 정리(Bayes Theorem):

P(AB)=P(AB)P(B)P(A \mid B) = \frac{P(A \cap B)}{P(B)} P(D+)=P(+D)P(D)P(+D)P(D)+P(+Dc)P(Dc)P(D \mid +) = \frac{P(+\mid D)\,P(D)}{P(+\mid D)\,P(D) + P(+\mid D^c)\,P(D^c)}
  • P(AB)P(A \mid B): BB가 일어났다는 조건에서 AA가 일어날 확률. 세로줄 기호는 “주어졌을 때”로 읽습니다.
  • DD: 질병 보유, DcD^c: 질병 없음, ++: 검사 양성.
  • P(+D)P(+\mid D): 민감도(sensitivity). P(Dc)P(-\mid D^c): 특이도(specificity), 따라서 P(+Dc)=1P(+\mid D^c) = 1 - 특이도.
  • 분모는 “양성이 나올 모든 경로”의 합입니다. 진짜 환자의 양성과 건강한 사람의 위양성을 둘 다 더해야 합니다.

분포 판별 요령:

상황분포결정적 단서
고정된 nn번 시행, 복원(또는 매우 큰 모집단)이항분포성공확률이 매 시행 동일
유한 모집단에서 비복원 추출초기하분포(Hypergeometric)뽑을수록 남은 구성이 바뀜
단위 시간·단위 면적당 발생 건수포아송분포(Poisson)평균 발생률 람다 하나만 주어짐
사건과 사건 사이의 대기 시간지수분포(Exponential)연속형 시간

포아송분포는 평균과 분산이 모두 람다로 같습니다. 이 성질 자체가 자주 출제됩니다.

표준화(standardization, z점수):

z=xμσz = \frac{x - \mu}{\sigma}
  • μ\mu (뮤): 모평균. σ\sigma (시그마): 모표준편차.
  • 의미: “이 값은 평균에서 표준편차 몇 개만큼 떨어져 있는가”. 단위가 사라지므로 서로 다른 시험 점수를 비교할 수 있습니다.

1-3. 추론·검정(Inference and Hypothesis Testing)

표준오차(SE, Standard Error):

SE=σnSE = \frac{\sigma}{\sqrt{n}}
  • 표본평균이 표본마다 얼마나 흔들리는지를 나타냅니다. 분모는 nn이 아니라 n\sqrt{n} (루트 nn)입니다. 여기서 제곱근을 빠뜨리는 실수가 매우 흔합니다.

신뢰구간(confidence interval, 모평균, 대표본):

xˉ±zα/2SE\bar{x} \pm z_{\alpha/2} \cdot SE
  • 95퍼센트 신뢰구간이면 zα/2=1.96z_{\alpha/2} = 1.96, 99퍼센트면 2.582.58을 씁니다.
  • 해석: “이 구간에 모평균이 있을 확률이 95퍼센트”가 아니라, “같은 절차를 반복하면 만들어지는 구간들 중 95퍼센트가 모평균을 포함한다”입니다.

t통계량(t-statistic, 단일표본):

t=xˉμ0s/nt = \frac{\bar{x} - \mu_0}{s / \sqrt{n}}
  • μ0\mu_0: 귀무가설이 주장하는 평균값.
  • 분자는 “관측된 차이”, 분모는 “그 차이가 우연히 생길 만한 크기”. 즉 t값은 차이를 잡음 크기로 나눈 비율입니다.

오류의 종류:

구분실제 귀무가설이 참실제 귀무가설이 거짓
귀무가설 기각제1종 오류(알파)옳은 판단(검정력)
귀무가설 기각 못 함옳은 판단제2종 오류(베타)
  • 제1종 오류: 아무 효과도 없는데 “효과 있다”고 선언. 유의수준 알파가 이 오류의 허용 한도입니다.
  • 제2종 오류: 실제로 효과가 있는데 놓침.

p값(p-value): 귀무가설이 참이라고 가정했을 때, 관측된 것만큼 또는 그보다 극단적인 결과가 나올 확률입니다. p값 &lt; 유의수준이면 귀무가설을 기각합니다. p값은 “귀무가설이 참일 확률”이 아닙니다. 이 오해가 보기로 자주 등장합니다.

1-4. 거리와 유사도(Distance and Similarity)

두 점 A=(a1,a2,,ak)A = (a_1, a_2, \ldots, a_k)B=(b1,b2,,bk)B = (b_1, b_2, \ldots, b_k)에 대해,

유클리드 거리(Euclidean distance):

dE=i=1k(aibi)2d_E = \sqrt{\sum_{i=1}^{k}(a_i - b_i)^2}

맨해튼 거리(Manhattan distance):

dM=i=1kaibid_M = \sum_{i=1}^{k}|a_i - b_i|

민코프스키 거리(Minkowski distance):

dp=(i=1kaibip)1/pd_p = \left(\sum_{i=1}^{k}|a_i - b_i|^p\right)^{1/p}
  • p=1p = 1이면 맨해튼, p=2p = 2이면 유클리드가 됩니다. 즉 민코프스키는 두 거리를 아우르는 일반형입니다.

코사인 유사도(cosine similarity):

cosθ=ABAB\cos\theta = \frac{A \cdot B}{\|A\|\,\|B\|}
  • ABA \cdot B: 두 벡터의 내적. 성분끼리 곱해서 모두 더합니다.
  • A\|A\|: 벡터 AA크기(norm). 각 성분을 제곱해 더한 뒤 제곱근을 씌웁니다.
  • 값은 0부터 1 사이(음수 성분이 없을 때). 1이면 방향이 완전히 같습니다. 크기가 아니라 방향만 봅니다.

쉽게 말하면: 유클리드는 “직선으로 몇 미터”, 맨해튼은 “블록을 몇 칸 돌아서”, 코사인은 “어느 쪽을 바라보고 있는가”입니다.

1-5. 분류 평가지표(Classification Metrics)

혼동행렬(confusion matrix)의 네 칸:

구분예측 양성예측 음성
실제 양성TP(True Positive)FN(False Negative)
실제 음성FP(False Positive)TN(True Negative)
정확도(Accuracy)=TP+TNTP+TN+FP+FN\text{정확도(Accuracy)} = \frac{TP + TN}{TP + TN + FP + FN} 정밀도(Precision)=TPTP+FP\text{정밀도(Precision)} = \frac{TP}{TP + FP} 재현율(Recall)=TPTP+FN\text{재현율(Recall)} = \frac{TP}{TP + FN} 특이도(Specificity)=TNTN+FP\text{특이도(Specificity)} = \frac{TN}{TN + FP} F1=2×정밀도×재현율정밀도+재현율F_1 = \frac{2 \times \text{정밀도} \times \text{재현율}}{\text{정밀도} + \text{재현율}}
  • 분모가 핵심입니다. 정밀도는 “예측해서 양성이라 한 것들” 중에서, 재현율은 “실제 양성인 것들” 중에서 맞힌 비율입니다.
  • F1은 조화평균(harmonic mean)입니다. 산술평균이 아닙니다. 조화평균은 두 값 중 작은 쪽에 끌려가므로, 한쪽만 높은 모델을 걸러냅니다.
  • AUC(Area Under the ROC Curve): ROC 곡선 아래 면적. 0.5는 무작위 추측 수준, 1.0은 완벽한 분류입니다. 0.5 미만이면 예측을 뒤집는 게 나은 상태입니다.

1-6. 회귀 평가지표(Regression Metrics)

MSE=1ni=1n(yiy^i)2MSE = \frac{1}{n}\sum_{i=1}^{n}(y_i - \hat{y}_i)^2 RMSE=MSERMSE = \sqrt{MSE} MAE=1ni=1nyiy^iMAE = \frac{1}{n}\sum_{i=1}^{n}|y_i - \hat{y}_i| MAPE=100ni=1nyiy^iyiMAPE = \frac{100}{n}\sum_{i=1}^{n}\left|\frac{y_i - \hat{y}_i}{y_i}\right|
  • yiy_i: 실제값, y^i\hat{y}_i (와이햇): 예측값.
  • MSE(Mean Squared Error, 평균제곱오차)는 오차를 제곱하므로 큰 오차에 민감합니다. 단위는 원자료의 제곱입니다.
  • RMSE(Root Mean Squared Error)는 제곱근을 씌워 단위를 원자료와 맞춘 값입니다.
  • MAE(Mean Absolute Error, 평균절대오차)는 절댓값을 씁니다. 부호를 살려서 더하면 오차가 상쇄돼 0이 나올 수 있습니다.
  • MAPE(Mean Absolute Percentage Error)는 오차를 실제값 대비 비율로 봅니다. 실제값이 0이면 계산이 불가능합니다.

제곱합 분해와 결정계수:

SST=SSR+SSESST = SSR + SSE R2=SSRSST=1SSESSTR^2 = \frac{SSR}{SST} = 1 - \frac{SSE}{SST} Radj2=1(1R2)n1np1R^2_{adj} = 1 - (1 - R^2)\frac{n-1}{n-p-1}
  • SST(Total Sum of Squares, 총제곱합): 실제값이 평균에서 얼마나 흩어졌는가.
  • SSR(Regression Sum of Squares, 회귀제곱합): 그중 모형이 설명한 부분.
  • SSE(Error Sum of Squares, 잔차제곱합): 모형이 설명하지 못한 부분.
  • R2R^2: 설명된 비율. 0부터 1 사이입니다.
  • Radj2R^2_{adj} (수정결정계수): nn은 표본 크기, pp는 설명변수 개수. 쓸모없는 변수를 넣으면 오히려 값이 떨어집니다. 이 성질이 출제 포인트입니다.

1-7. 군집·차원축소·연관규칙

PCA 설명분산비율(explained variance ratio):

설명분산비율k=λkjλj\text{설명분산비율}_k = \frac{\lambda_k}{\sum_{j} \lambda_j}
  • λk\lambda_k (람다): kk번째 주성분의 고윳값(eigenvalue). 그 주성분이 담고 있는 분산의 크기입니다.
  • 분모는 모든 고윳값의 합입니다. 누적 설명분산은 앞에서부터 차례로 더해 나갑니다.

실루엣 계수(silhouette coefficient):

s(i)=b(i)a(i)max{a(i),b(i)}s(i) = \frac{b(i) - a(i)}{\max\{a(i),\, b(i)\}}
  • a(i)a(i): 점 ii자기 군집 안 다른 점들과의 평균 거리(응집도, 작을수록 좋음).
  • b(i)b(i): 점 ii가장 가까운 다른 군집의 점들과의 평균 거리(분리도, 클수록 좋음).
  • 값은 1-1부터 11 사이. 1에 가까울수록 군집이 잘 나뉜 것입니다. 분모는 두 값 중 큰 쪽입니다.

연관규칙(association rule) ABA \rightarrow B:

지지도(Support)=n(AB)N\text{지지도(Support)} = \frac{n(A \cap B)}{N} 신뢰도(Confidence)=n(AB)n(A)\text{신뢰도(Confidence)} = \frac{n(A \cap B)}{n(A)} 향상도(Lift)=신뢰도P(B)\text{향상도(Lift)} = \frac{\text{신뢰도}}{P(B)}
  • NN: 전체 거래 수, n(A)n(A): AA를 포함한 거래 수.
  • 지지도의 분모는 전체 거래, 신뢰도의 분모는 A를 포함한 거래입니다. 이 분모 차이가 출제 포인트입니다.
  • 향상도가 1이면 A와 B는 독립(관계 없음), 1보다 크면 양의 관계, 1보다 작으면 음의 관계입니다.

2. 계산 문제 푸는 순서

시험장에서는 시간이 부족하고 마음이 급합니다. 순서를 미리 정해 두면 실수가 크게 줄어듭니다.

  1. 무엇을 묻는지 확정한다. “분산인가 표준편차인가”, “정밀도인가 재현율인가”를 먼저 못 박습니다.
  2. 공식을 먼저 적는다. 값을 보면서 공식을 떠올리면 유도되기 쉽습니다. 값을 보기 전에 공식부터 적으세요.
  3. 값을 기호에 대입한다. nn, pp, xˉ\bar{x} 각각에 무엇이 들어가는지 문제 옆에 적습니다.
  4. 단위와 분모를 확인한다. 백분율인가 소수인가, 분모가 nn인가 n1n-1인가, nn인가 n\sqrt{n}인가.
  5. 중간값을 남기며 계산한다. 한 번에 계산기로 밀지 말고 단계를 남기면 검산이 쉽습니다.
  6. 보기와 대조한다. 내 답이 보기에 없으면 대개 4번(분모)에서 틀린 것입니다.

계산 문제에서 자주 틀리는 함정 다섯 가지

  1. 표본분산의 분모는 nn이 아니라 n1n-1이다. “표본”이라는 단어가 보이면 자유도를 의심하세요.
  2. 표준오차의 분모는 nn이 아니라 n\sqrt{n}이다. 표준편차와 표준오차를 같은 것으로 쓰면 신뢰구간이 통째로 틀립니다.
  3. F1은 조화평균이지 산술평균이 아니다. 정밀도와 재현율을 더해 2로 나눈 값은 항상 F1보다 큽니다.
  4. 정밀도와 재현율은 분모가 다르다. 정밀도는 TP+FP, 재현율은 TP+FN입니다. 세로로 보느냐 가로로 보느냐의 차이입니다.
  5. 분산과 표준편차를 바꿔 쓴다. 문제가 분산을 물었는데 제곱근을 씌운 값을 고르거나 그 반대인 경우가 매우 흔합니다.

한 가지 예를 손으로 풀어 보겠습니다. 어떤 점의 응집도 a=2a = 2, 분리도 b=5b = 5일 때 실루엣 계수는,

s=52max{2,5}=35=0.6s = \frac{5 - 2}{\max\{2,\,5\}} = \frac{3}{5} = 0.6

분모에 aa인 2를 쓰면 3÷2=1.53 \div 2 = 1.5가 나오는데, 실루엣 계수는 1을 넘을 수 없으므로 답이 나온 순간 틀렸다는 걸 알 수 있습니다. 이렇게 값의 범위를 알고 있으면 자기 검산이 됩니다.

핵심 정리

  • 계산 문제는 정답이 하나로 확정되는 구간이므로 가장 확실한 득점원입니다. 공식을 먼저 적고 값을 대입하는 순서를 고정하세요.
  • 오답 보기의 대부분은 분모를 잘못 쓴 값입니다. nnn1n-1, nnn\sqrt{n}, TP+FPTP+FN, 전체 거래 대 A 포함 거래를 항상 확인하세요.
  • 지표에는 값의 범위가 있습니다. 상관계수와 실루엣은 1-1부터 1, 결정계수와 AUC와 각종 분류지표는 0부터 1입니다. 범위를 벗어난 값이 나오면 계산이 틀린 것입니다.
  • F1은 조화평균, 기대값은 확률 가중합, MAE는 절댓값 평균입니다. 산술평균으로 대충 계산하면 반드시 함정에 걸립니다.
  • 값을 구한 뒤에는 말로 해석하는 연습을 하세요. 최근 회차는 “값을 구하라”보다 “이 값이 무엇을 뜻하는가”를 묻는 비중이 커지고 있습니다.

마무리 복습

문제 14지선다
자료 4, 7, 7, 9, 13, 20의 평균, 중앙값, 최빈값을 옳게 짝지은 것은?
문제 24지선다
표본 자료 2, 4, 4, 6, 9의 불편표본분산은 얼마인가?
문제 34지선다
A집단은 평균 40, 표준편차 6이고 B집단은 평균 250, 표준편차 25다. 두 집단의 상대적 산포를 비교한 설명으로 가장 적절한 것은?
문제 44지선다
어떤 자료의 평균이 62, 중앙값이 55, 제1사분위수가 40, 제3사분위수가 76이다. 사분위범위와 분포의 왜도 방향으로 옳은 것은?
문제 54지선다
확률변수 X가 이항분포 B(80, 0.25)를 따를 때 X의 평균과 분산을 옳게 짝지은 것은?
문제 64지선다
어떤 이벤트의 상금은 5000원이 나올 확률 0.1, 1000원이 나올 확률 0.3, 0원이 나올 확률 0.6이다. 상금의 기대값은 얼마인가?
문제 74지선다
어떤 질병의 유병률은 2퍼센트다. 검사의 민감도는 95퍼센트, 특이도는 90퍼센트다. 검사 결과가 양성인 사람이 실제로 이 질병을 가지고 있을 확률에 가장 가까운 값은?
문제 84지선다
불량품 5개가 섞인 20개들이 상자에서 4개를 뽑되 검사한 제품은 상자에 되돌려 놓지 않는다. 불량품 개수에 적용할 분포와 첫 번째로 뽑은 제품이 불량일 확률을 옳게 짝지은 것은?
문제 94지선다
어떤 시험의 평균이 70점, 표준편차가 8점이다. 86점을 받은 학생의 표준화 점수는 얼마인가?
문제 104지선다
모표준편차가 16인 모집단에서 크기 64인 표본을 뽑았더니 표본평균이 50이었다. 표준오차와 모평균의 95퍼센트 신뢰구간을 옳게 짝지은 것은? (z값 1.96 사용)
문제 114지선다
귀무가설이 모평균은 100이라는 주장일 때, 크기 36인 표본에서 표본평균 105, 표본표준편차 12를 얻었다. 단일표본 t통계량은 얼마인가?
문제 124지선다
유의수준 0.05로 검정한 결과 p값이 0.03으로 나왔고, 실제로는 귀무가설이 참인 상황이었다. 이 상황에 대한 설명으로 가장 적절한 것은?
문제 134지선다
두 점 A(1, 2)와 B(4, 6) 사이의 유클리드 거리와 맨해튼 거리를 옳게 짝지은 것은?
문제 144지선다
두 벡터 A = (1, 1, 0, 0)과 B = (1, 0, 1, 0)의 코사인 유사도는 얼마인가?
문제 154지선다
이진 분류 결과가 TP 40, FN 10, FP 20, TN 130이었다. 이 모델의 정확도는 얼마인가?
문제 164지선다
이진 분류 결과가 TP 40, FN 10, FP 20, TN 130이었다. 이 모델의 정밀도와 재현율을 옳게 짝지은 것은?
문제 174지선다
어떤 분류 모델의 정밀도가 약 0.667, 재현율이 0.80이다. 이 모델의 F1 점수에 가장 가까운 값은?
문제 184지선다
이진 분류 결과가 TP 40, FN 10, FP 20, TN 130이고 이 모델의 AUC가 0.5로 보고되었다. 특이도 값과 AUC 해석을 옳게 짝지은 것은?
문제 194지선다
실제값이 10, 20, 30, 40이고 예측값이 각각 12, 18, 33, 37이다. 이 모델의 평균제곱오차와 평균절대오차를 옳게 짝지은 것은?
문제 204지선다
표본 크기 20, 설명변수 3개인 회귀모형에서 총제곱합이 200이고 잔차제곱합이 50이다. 결정계수와 수정결정계수를 옳게 짝지은 것은?
문제 214지선다
주성분분석 결과 고윳값이 6, 3, 2, 1로 나왔다. 한편 군집 결과에서 어떤 점의 응집도는 2, 가장 가까운 다른 군집까지의 분리도는 5였다. 제1주성분의 설명분산비율과 그 점의 실루엣 계수를 옳게 짝지은 것은?
문제 224지선다
전체 거래 1000건 중 상품 A를 포함한 거래가 200건, 상품 B를 포함한 거래가 400건, A와 B를 함께 포함한 거래가 100건이다. 규칙 A에서 B로 가는 연관규칙의 지지도, 신뢰도, 향상도를 옳게 짝지은 것은?

참고 자료

Last updated on