이 모의고사는 실제 기출문제를 그대로 옮긴 것이 아닙니다. 국가평생교육진흥원이 공개한 독학사 2단계 머신러닝 출제기준(평가영역)을 바탕으로 새로 구성한 연습 문제다. 실제 회차의 문항 수·배점·시험 시간은 매 시행 공고마다 다를 수 있으므로 공식 공고를 반드시 확인해야 한다. 권장 풀이 시간은 약 35분이다(선택형 문항당 약 1.2분 기준으로 24문항을 계산하고, 계산형 문항의 여유 시간과 마킹·재검토 시간을 더했다). 실전처럼 시간을 재고 먼저 풀어본 뒤 해설과 대조하는 것을 권장한다.
이 편은 01편부터 20편까지 다룬 전 범위를 개념 확인형·계산형·비교형 문제로 고르게 섞어 구성한 종합 모의고사다. 21~23편에서 유형별로 집중 훈련했다면, 이 편에서는 실제 시험처럼 유형이 뒤섞인 상태로 풀어 보는 것이 핵심이다.
문항 배분
| 영역 | 다루는 편 | 문항 수 | 문항 번호 |
|---|---|---|---|
| 기초 개념·용어 | 01–03 | 3 | 1–3 |
| 전처리·학습 패러다임 | 06–07 | 2 | 4–5 |
| 회귀·정규화 계산 | 08–09 | 3 | 6–8 |
| 로지스틱 회귀 | 10 | 2 | 9–10 |
| 트리·나이브베이즈·거리 기반 분류 | 11–12 | 4 | 11–14 |
| 앙상블 | 13 | 1 | 15 |
| 비지도학습·연관 규칙 | 14–15 | 2 | 16–17 |
| 차원 축소 | 16–17 | 2 | 18–19 |
| 평가 지표 | 18 | 2 | 20–21 |
| 모델 선택·신경망 | 19–20 | 3 | 22–24 |
| 합계 | - | 24 | 1–24 |
선행 개념 점검 (1–3번)
문제 14지선다
어떤 회사가 과거 3년간의 '집 면적, 방 개수, 준공연도, 실제 판매가격' 데이터를 이용해 새 매물의 판매가격을 예측하는 모델을 만들려고 한다. 이 문제는 어떤 학습 패러다임에 해당하는가?
문제 24지선다
머신러닝 데이터셋을 구성하는 '특징 행렬(feature matrix)'과 '타깃 벡터(target vector)'에 대한 설명으로 옳은 것은?
문제 34지선다
두 특징 벡터 사이의 코사인 유사도(cosine similarity)가 1에 가깝다는 것은 무엇을 의미하는가?
전처리·학습 패러다임 (4–5번)
문제 44지선다
온라인 쇼핑몰이 회원 탈퇴 여부를 예측하는 모델을 만들 때, 전체 회원의 2퍼센트만 탈퇴자이고 98퍼센트는 유지 회원이었다. 이런 데이터 불균형 상황에서 취할 수 있는 대응으로 가장 적절한 것은?
문제 54지선다
레이블이 없는 고객 구매 데이터를 이용해, 비슷한 구매 패턴을 보이는 고객들끼리 몇 개의 그룹으로 자동으로 묶으려고 한다. 이는 어떤 학습 패러다임에 해당하는가?
회귀·정규화 계산 (6–8번)
문제 64지선다
데이터 x=(0,1,2,3), y=(1,4,7,10)에 단순 선형회귀 직선 y=ax+b를 맞춰 기울기 a=3, 절편 b=1을 얻었다. x=5일 때의 예측값은?
문제 74지선다
릿지 회귀에서 정규화 이전 잔차제곱합(RSS)이 8, 회귀계수가 β=(1, 2, -2), 정규화 강도 λ=1일 때, 릿지의 전체 목적함수 값(RSS + L2 페널티)은?
문제 84지선다
같은 회귀계수 β=(1, 2, -2), 정규화 강도 λ=1을 라쏘 회귀(L1 정규화)에 적용할 때, L1 페널티 값(λ×Σ|β|)은?
로지스틱 회귀 (9–10번)
문제 94지선다
로지스틱 회귀에서 선형결합 값 z=-1일 때, 시그모이드 함수 σ(z)=1/(1+e^(-z))의 값은 약 얼마인가? (e≈2.718)
문제 104지선다
로지스틱 회귀에서 예측 확률 σ(z)에 임계값 0.5를 적용해 클래스를 나눌 때, σ(z)=0.5가 되는 지점(z=0)이 갖는 의미로 가장 적절한 것은?
트리·나이브베이즈·거리 기반 분류 (11–14번)
문제 114지선다
어떤 노드에 양성 12개, 음성 4개(총 16개)가 섞여 있을 때, 이 노드의 지니 지수(Gini index)는?
문제 124지선다
스팸 메일 분류에서 나이브 베이즈(Naive Bayes)가 특히 널리 쓰이는 이유로 가장 적절한 것은?
문제 134지선다
2차원 점 A(0, 0)와 B(6, 8) 사이의 유클리드 거리는?
문제 144지선다
SVM에서 선형으로 분리되지 않는 데이터를 다루기 위해 커널(kernel) 함수를 사용하는 목적으로 가장 적절한 것은?
앙상블 (15번)
문제 154지선다
부스팅(boosting)에 대한 설명으로 옳은 것은?
비지도학습·연관 규칙 (16–17번)
문제 164지선다
DBSCAN에서 하이퍼파라미터 eps(반경)와 min_samples(최소 이웃 수)가 하는 역할로 가장 적절한 것은?
문제 174지선다
전체 거래 100건 중 항목 A와 B가 함께 나타난 거래가 20건이고, 항목 A가 포함된 전체 거래가 40건일 때, 연관 규칙 'A이면 B이다'의 신뢰도(confidence)는?
차원 축소 (18–19번)
문제 184지선다
고차원 데이터에서 나타나는 '차원의 저주(curse of dimensionality)'에 대한 설명으로 옳은 것은?
문제 194지선다
PCA에서 각 주성분의 고유값이 6, 3, 1일 때, 첫 번째 주성분(PC1)이 설명하는 분산의 비율은?
평가 지표 (20–21번)
문제 204지선다
혼동행렬에서 참양성(TP)=50, 거짓양성(FP)=5, 거짓음성(FN)=15, 참음성(TN)=30일 때, 정밀도(precision)는? (소수 셋째 자리에서 반올림)
문제 214지선다
문제 20과 같은 혼동행렬(TP=50, FP=5, FN=15, TN=30, 전체=100)에서 정확도(accuracy)는?
모델 선택·신경망 (22–24번)
문제 224지선다
k-폴드 교차검증을 사용하는 목적으로 가장 적절한 것은?
문제 234지선다
단일 퍼셉트론이 XOR 문제를 풀 수 없는 근본적인 이유로 가장 적절한 것은?
문제 244지선다
퍼셉트론의 가중치 w=(0.2, 0.3), 입력 x=(1, -1), 목표값(target)=0, 현재 출력(output)=1, 학습률 η=0.2일 때, 가중치 갱신 공식 w_new=w+η×(target-output)×x를 적용한 새로운 가중치는?
채점 후 복습 동선
| 틀린 영역 | 돌아갈 편 | 확인할 핵심 |
|---|---|---|
| 기초 개념·용어 | 01–03편 | AI·ML·DL 관계, 학습 패러다임 구분, 특징 행렬·타깃 벡터, 벡터 연산 |
| 전처리·패러다임 | 06–07편 | 결측치·스케일링·인코딩·불균형 대응, 지도·비지도·강화 구분 |
| 회귀·정규화 | 08–09편 | 회귀식 예측, 릿지·라쏘의 페널티 계산과 차이 |
| 로지스틱 회귀 | 10편 | 시그모이드 계산, 결정 경계의 의미 |
| 트리·거리 기반 분류 | 11–12편 | 지니 지수 계산, 나이브 베이즈의 조건부 독립, 거리 계산, SVM 커널 |
| 앙상블 | 13편 | 배깅·부스팅의 학습 방식 차이 |
| 비지도·연관 규칙 | 14–15편 | DBSCAN의 eps·min_samples, 지지도·신뢰도·향상도 계산 |
| 차원 축소 | 16–17편 | 차원의 저주, PCA 분산 설명 비율 계산 |
| 평가 지표 | 18편 | 정밀도·재현율·정확도 계산과 차이 |
| 모델 선택·신경망 | 19–20편 | 교차검증의 목적, 퍼셉트론의 한계와 가중치 갱신 계산 |
전 영역에서 고르게 틀렸다면 05편(시험 구조·출제 포인트)으로 돌아가 시간 배분과 문항 유형별 접근 전략부터 다시 점검하는 것을 권장한다.
참고 자료
Last updated on