이 편의 문제는 실제 기출을 그대로 복제한 것이 아닙니다. 공개된 회차의 출제 범위와 유형을 분석해, 같은 개념·같은 난이도로 새로 재구성한 문항입니다. 원문 기출 중 정답 근거가 모호하거나 조건이 불충분했던 문항은 조건을 명확히 다듬어 다시 만들었습니다. 따라서 이 편의 문항 번호는 실제 시험 문항 번호와 대응하지 않으며, 숫자·상황·보기 배열도 모두 새로 구성한 것입니다.
이번 문서의 목표: “몇 과목에서 몇 문제를 맞혀야 붙는가”를 숫자로 확정하고, 그 목표에 맞는 풀이 순서·시간 배분·오답 관리 방법을 세운 뒤, 4과목 통합 모의 24문항으로 자기 과목별 정답률을 직접 측정할 수 있게 된다.
1. 시험 구조 복기 — 합격은 두 개의 관문이다
마지막 편이므로 규칙부터 다시 못 박습니다. 규칙을 흐릿하게 아는 상태로 시험장에 가면 “지금 몇 문제를 맞힌 상태인가”를 판단하지 못해 시간 배분이 무너집니다.
쉽게 말하면: 이 시험은 총점만 높으면 되는 시험이 아니라, 모든 과목이 최소선을 넘고 + 전체 평균선도 넘는 두 관문을 동시에 통과해야 하는 시험입니다.
| 항목 | 내용 |
|---|---|
| 검정 방법 | 객관식 4지선다(사지선다) |
| 과목 수 | 4과목 (분석 기획 / 탐색 / 모델링 / 결과 해석) |
| 문항 수 | 과목당 20문항, 총 80문항 |
| 시험 시간 | 120분 (문항당 평균 90초) |
| 배점 | 과목당 100점 만점, 문항당 5점 |
| 합격 기준 | 전 과목 40점 이상 그리고 전 과목 평균 60점 이상 |
이 표를 문제 수로 번역하면 이렇게 됩니다. 과목당 20문항에 문항당 5점이므로, 한 문제를 맞히면 그 과목 점수가 5점 오릅니다.
- 과락 기준 40점 = 40 ÷ 5 = 과목당 8문제 이상
- 평균 기준 60점 = 4과목 총점 240점 이상 = 240 ÷ 5 = 전체 48문제 이상
- 그 과목 정답 수: 해당 과목 20문항 중 맞힌 개수
- 5: 문항당 배점(점)
- 전체 정답 수: 80문항 중 맞힌 총 개수
- 4: 과목 수. 총점을 과목 수로 나눠 평균을 낸다
즉 모든 과목에서 8문제씩(=32문제) 맞히는 것만으로는 부족합니다. 32문제는 평균 40점이라 평균 기준에서 떨어집니다. 반대로 한 과목에서 18문제를 맞히고 다른 과목에서 7문제만 맞히면, 총합이 아무리 좋아도 그 과목 35점으로 과락 탈락입니다.
비유: 네 과목은 “네 개의 문”이고, 각 문에는 키 재기 막대(8문제)가 세워져 있습니다. 네 문을 모두 통과해야 하고, 그 다음 마지막 관문에서 “네 문에서 통과한 사람 수의 평균”(48문제)을 다시 잽니다. 문 하나만 못 넘어도 뒤 관문은 아예 볼 수 없습니다.
2. 목표 점수 설계표 — 50문제를 어디서 가져올 것인가
48문제가 최저선이라면, 목표는 반드시 그보다 위여야 합니다. 시험장에서는 아는 문제도 실수로 놓치고, 예상 밖 신유형이 2~3문항 나오기 때문입니다. 여유분 2문제를 얹은 50문제를 목표로 잡습니다.
| 과목 | 성격 | 목표 정답 수 | 목표 점수 | 근거 |
|---|---|---|---|---|
| 1과목 분석 기획 | 암기 영역 | 13 / 20 | 65점 | 계산이 거의 없어 외운 만큼 그대로 나온다. 대신 안 외우면 그대로 떨어진다 |
| 2과목 탐색 | 개념 이해 + 계산 | 12 / 20 | 60점 | 전처리·기술통계는 확보 가능, 확률분포·검정에서 2–3문항 손실을 감수 |
| 3과목 모델링 | 원리 이해 | 12 / 20 | 60점 | 알고리즘 종류가 넓어 만점 설계가 비효율. 빈출 알고리즘 위주로 확보 |
| 4과목 결과 해석 | 지표 계산 + 해석 | 13 / 20 | 65점 | 혼동행렬·회귀지표·교차검증이 반복 출제되어 가장 회수율이 높다 |
| 합계 | – | 50 / 80 | 평균 62.5점 | 과락선 8문제를 모든 과목에서 5문제 이상 상회 |
왜 이렇게 배분하는가
배분의 원칙은 “공부한 시간 대비 문제가 가장 확실하게 늘어나는 과목에 목표를 높게 잡는다”입니다.
- 1과목을 13문제로 높게 잡는 이유 — 1과목은 빅데이터 특성(3V), 개인정보·비식별, 데이터 유형, 저장 기술, 분석 방법론처럼 정답이 딱 떨어지는 암기 항목이 대부분입니다. 계산이 없어 시간도 적게 듭니다. 외우기만 하면 회수율이 가장 높은 구간입니다.
- 4과목도 13문제로 높게 잡는 이유 — 4과목의 핵심인 혼동행렬(confusion matrix, 정오분류표)·회귀 평가지표·교차검증(cross validation)은 매 회차 거의 같은 형태로 반복됩니다. 공식 대여섯 개만 정확히 외우면 계산 문제를 확정적으로 가져올 수 있습니다.
- 2·3과목을 12문제로 낮추는 이유 — 2과목의 확률분포·가설검정, 3과목의 딥러닝·시계열·다변량 기법은 범위가 넓고 신유형이 자주 끼어듭니다. 여기서 만점을 노리면 시간 대비 손해입니다. 빈출 구간만 확실히 잡고 나머지는 버리는 편이 총점에 유리합니다.
자주 틀리는 점: “평균 60점만 넘기면 되니까 제일 자신 있는 과목을 만점으로 만들자”는 계획은 위험합니다. 한 과목 만점(20문제)을 만드는 데 드는 시간이면, 약한 과목 두 개를 8문제에서 12문제로 끌어올릴 수 있습니다. 평균은 총합으로 만들되, 과락은 개별로 막아야 합니다.
3. 풀이 순서 전략 — 순서대로 풀지 않는다
시험지는 1과목부터 4과목 순으로 인쇄되어 있지만, 그 순서대로 풀어야 할 의무는 없습니다. 실제로 순서대로 풀다가 2과목 계산 문제에 붙잡혀 4과목을 통째로 날리는 사례가 가장 흔한 실패입니다.
규칙 네 가지
- 자신 있는 과목부터 시작한다. 초반 10분에 맞은 문제가 쌓이면 심리적 여유가 생기고, 뒤에 남는 어려운 문제에 쓸 수 있는 시간도 정확히 계산됩니다. 보통 1과목(암기) 또는 4과목(지표 계산)으로 시작하는 사람이 많습니다.
- 계산 문제는 1회독에서 표시하고 넘긴다. 계산 문제 한 문항이 3~4분을 잡아먹으면, 그 시간에 풀 수 있었을 개념 문제 두세 개를 잃습니다. 배점은 똑같이 5점입니다.
- 문항당 평균 90초를 몸으로 기억한다. 120분 = 7200초를 80문항으로 나누면 90초입니다. 마킹·검토용 15분을 미리 빼면 실제로 쓸 수 있는 시간은 105분 = 6300초, 문항당 약 79초입니다.
- 답을 비우지 않는다. 4지선다이므로 찍어도 기대 정답률이 25퍼센트(0.25)입니다. 보기 두 개를 소거하면 50퍼센트(0.5)까지 오릅니다. 오답 감점이 없으므로 빈칸은 무조건 손해입니다.
| 구간 | 소요 시간 | 하는 일 |
|---|---|---|
| 1회독 | 약 65분 | 80문항 훑으며 즉답 가능 문항만 처리, 나머지는 표시 |
| 2회독 | 약 30분 | 표시한 계산·해석 문항 집중 공략 |
| 3회독 | 약 10분 | 끝내 모르는 문항 보기 소거 후 선택 |
| 마무리 | 약 15분 | 마킹 검토, 답안지 밀림 확인, 빈칸 유무 확인 |
자주 틀리는 점: 마킹을 마지막에 몰아서 하면 시간이 모자랄 때 답안지가 통째로 비게 됩니다. 문제를 푼 즉시 그 문항을 마킹하고, 마지막 15분은 “새로 마킹”이 아니라 “검토”에만 씁니다.
4. 과락 방지 — 1과목이 가장 위험한 이유
과락으로 떨어지는 사람의 압도적 다수가 1과목(빅데이터 분석 기획) 에서 무너집니다. 이유는 역설적입니다.
1과목은 계산이 없어 쉬워 보입니다. 그래서 공부 순서에서 뒤로 밀립니다. 그런데 1과목은 “이해하면 풀리는” 과목이 아니라 “외웠는가 안 외웠는가”만 묻는 과목입니다. 데이터 3법의 각 법률이 무엇을 규율하는지, 총계처리와 범주화가 어떻게 다른지, 분석 성숙도 단계 이름이 무엇인지는 논리로 유추할 수 없습니다. 그 결과 2·3·4과목은 개념 이해로 60점을 넘기면서 1과목만 35점으로 탈락하는 일이 생깁니다.
쉽게 말하면: 2·3·4과목은 “몰라도 반쯤 찍어 맞힐 수 있는” 문제가 섞여 있지만, 1과목은 모르면 정말 모릅니다.
1과목 과락 방지 최소 암기 목록
- 빅데이터 특성 5V: Volume(양), Velocity(속도), Variety(다양성), Veracity(정확성), Value(가치)
- DIKW 계층: 데이터(Data) → 정보(Information) → 지식(Knowledge) → 지혜(Wisdom)
- 암묵지와 형식지: 암묵지에서 형식지로 = 표출화, 형식지에서 암묵지로 = 내면화
- 가트너 분석 유형 순서: 묘사 → 진단 → 예측 → 처방
- 개인정보 판단: 개인정보(해당), 가명정보(해당), 익명정보(해당 안 함)
- 데이터 유형: 정형은 RDBMS, 반정형은 JSON·XML·HTML, 비정형은 이미지·영상·음성
- 저장 기술: OLTP는 실시간 거래, OLAP는 의사결정 지원, 데이터 레이크는 원본 그대로 대규모 저장
- 분석 과제 유형 4분면: 대상과 방법을 모두 알면 최적화, 대상만 알면 솔루션, 방법만 알면 통찰, 둘 다 모르면 발견
- 방법론 대응: KDD의 데이터 마이닝 = CRISP-DM의 모델링 = SEMMA의 모델링
이 아홉 덩어리만 정확히 외워도 1과목에서 8~10문제는 확보됩니다. 과락선(8문제)을 넘기는 최소 보험입니다.
5. 오답 노트 작성법 — 틀린 이유를 네 가지로 분류하라
“틀린 문제를 다시 푼다”는 오답 노트는 효과가 거의 없습니다. 같은 문제를 두 번째 풀면 답을 기억하기 때문입니다. 효과가 있는 오답 노트는 틀린 이유를 유형으로 분류해, 그 유형에 맞는 처방을 붙이는 것입니다.
| 분류 | 무엇이 일어났는가 | 처방 |
|---|---|---|
| 개념 오류 | 정의 자체를 몰랐거나 반대로 알고 있었다 | 해당 개념이 나오는 본문 편으로 돌아가 정의부터 다시 읽는다 |
| 함정 미인지 | 개념은 알았는데 옳지 않은 것을 고르라는 조건, 항상·무조건 같은 단정어를 놓쳤다 | 문제 지문의 조건어에 동그라미 치는 습관을 만든다 |
| 계산 실수 | 공식은 맞았는데 대입·약분·단위에서 틀렸다 | 공식을 쓰고 값을 대입한 중간 식을 반드시 시험지에 적는다 |
| 시간 부족 | 못 풀어서가 아니라 못 봐서 틀렸다 | 1회독에서 넘기는 기준(20초)을 더 엄격하게 지킨다 |
분류별 비중이 알려주는 것
오답 20개를 분류했을 때 비중이 어디에 몰리는지가 다음 일주일에 무엇을 할지를 결정합니다.
- 개념 오류가 절반 이상 → 아직 문제 풀 단계가 아닙니다. 본문 편을 다시 읽어야 합니다.
- 함정 미인지가 많다 → 지식은 충분합니다. 문제를 읽는 방법만 교정하면 점수가 바로 오릅니다. 가장 회수율이 좋은 상태입니다.
- 계산 실수가 많다 → 공식은 외웠으니, 손으로 푸는 연습량만 늘리면 됩니다.
- 시간 부족이 많다 → 지식·계산 문제가 아니라 운영 문제입니다. 3절의 풀이 순서를 그대로 적용해 봅니다.
자주 틀리는 점: 오답 노트에 문제 전문을 옮겨 적는 것은 시간 낭비입니다. 적어야 할 것은 “이 문제가 물어본 개념 한 줄”과 “내가 왜 틀렸는지 한 줄” 두 줄뿐입니다.
6. 회차별 출제 경향 — 4개 회차를 나란히 놓고 본 반복 키워드
공개된 네 회차(2023년 6회, 2023년 7회, 2024년 8회, 2025년 10회)의 문항을 과목별로 나열해 비교하면, 회차가 바뀌어도 같은 개념이 옷만 갈아입고 다시 나온다는 사실이 뚜렷하게 보입니다. 아래 표는 네 회차 모두 또는 세 회차 이상에서 반복 확인된 키워드만 추린 것입니다.
1과목 빅데이터 분석 기획
| 반복 키워드 | 어떤 형태로 나오는가 | 회차 등장 |
|---|---|---|
| 빅데이터 특성 3V·5V | 특성 이름과 의미를 잘못 연결한 보기 고르기 | 6회, 7회, 8회 |
| 개인정보·비식별 조치 | 가명처리·총계처리·마스킹·범주화의 예시 매칭 | 6회, 7회, 8회, 10회 |
| 정형·반정형·비정형 구분 | JSON·XML을 반정형으로, 영상·음성을 비정형으로 분류 | 7회, 8회, 10회 |
| 빅데이터 플랫폼 계층 | 인프라·수집·저장·분석·서비스 계층 중 어디인지 | 7회, 8회, 10회 |
| 저장 기술 대응 | RDBMS, NoSQL(문서·키값·컬럼), HDFS, 데이터웨어하우스 특성 | 6회, 7회, 8회 |
| 분석 방법론·과제 발굴 | CRISP-DM 단계 순서, 하향식과 상향식, 과제 유형 4분면 | 6회, 7회, 8회, 10회 |
| 조직·성숙도·역량 | 집중·기능·분산 구조, 도입–활용–확산–최적화, 하드/소프트 스킬 | 6회, 7회, 10회 |
| 데이터 품질 차원 | 완전성·유효성·일관성·정확성 판정 | 7회, 8회, 10회 |
2과목 빅데이터 탐색
| 반복 키워드 | 어떤 형태로 나오는가 | 회차 등장 |
|---|---|---|
| 결측치·이상치 처리 | 처리 기법 설명 중 옳지 않은 것, IQR 기준 판정 | 6회, 7회, 8회, 10회 |
| 측정 척도 | 명목–서열–등간–비율 구분과 예시 매칭 | 7회, 8회 |
| 스케일링·변환 | 표준화와 최소–최대 정규화 구분, 로그 변환의 목적 | 6회, 7회, 8회 |
| 클래스 불균형 | 언더·오버샘플링과 SMOTE 설명 중 틀린 것 | 8회, 10회 |
| 상관계수 | 피어슨·스피어만·편상관 중 상황에 맞는 것 고르기 | 7회, 8회, 10회 |
| 분포 형태 해석 | 오른쪽 꼬리 분포에서 평균·중앙값·최빈값 순서 | 8회, 10회 |
| 확률분포 | 이항·포아송·초기하 분포의 적용 조건과 평균·분산 | 6회, 7회, 10회 |
| 표본분산·중심극한정리 | 자유도 n-1, 표본평균의 분산이 모분산 나누기 n | 6회, 7회, 8회, 10회 |
3과목 빅데이터 모델링
| 반복 키워드 | 어떤 형태로 나오는가 | 회차 등장 |
|---|---|---|
| 회귀 가정·다중공선성 | 선형성·독립성·등분산성·정규성, VIF로 진단 | 6회, 8회, 10회 |
| 결정계수 | 설명된 변동의 비율, 변수 추가 시 증가, 수정결정계수 | 6회, 8회 |
| 규제 기법 | 라쏘(L1)·릿지(L2)·엘라스틱넷의 벌점 형태 구분 | 7회, 10회 |
| 의사결정나무 | 지니 불순도·엔트로피, 가지치기의 목적 | 6회, 8회, 10회 |
| SVM | 마진 최대화, 서포트 벡터, 커널 트릭 | 8회, 10회 |
| PCA·차원축소 | 주성분의 무상관성, 설명 분산 비율 계산 | 8회, 10회 |
| 군집 | 계층적·K평균·DBSCAN 비교, 덴드로그램 절단 | 6회, 8회, 10회 |
| 앙상블 | 배깅은 병렬 복원추출, 부스팅은 순차 오차 보정 | 6회, 8회, 10회 |
| 신경망 | ReLU 출력 계산, 배치 크기, 기울기 소실 | 6회, 7회, 8회, 10회 |
4과목 빅데이터 결과 해석
| 반복 키워드 | 어떤 형태로 나오는가 | 회차 등장 |
|---|---|---|
| 혼동행렬 지표 | 정밀도·재현율·특이도·정확도 정의식 매칭과 계산 | 6회, 8회, 10회 |
| F1 점수 | 정밀도와 재현율의 조화평균 계산 | 10회 |
| ROC·AUC | AUC의 순위 해석, 두 모델 비교 | 8회, 10회 |
| 회귀 평가지표 | MSE·RMSE·MAE·MAPE 식 중 틀린 것 | 8회 |
| 교차검증 | K겹의 회차 수·검증 크기, 홀드아웃, 층화 K겹 | 6회, 8회, 10회 |
| 과적합 진단·방지 | 학습곡선 해석, 조기 종료·드롭아웃·규제 | 6회, 8회, 10회 |
| 파라미터와 하이퍼파라미터 | 학습률·K는 하이퍼파라미터, 가중치는 파라미터 | 6회, 8회, 10회 |
| 시각화 유형 | 시간·공간·관계·비교·분포 시각화와 인포그래픽 | 6회, 8회, 10회 |
| 분석 결과 활용 | 모니터링·재학습 계획, 비즈니스 기여도 평가 | 6회, 8회 |
이 표를 어떻게 쓰는가: 시험 일주일 전에는 새 개념을 넣지 말고, 위 표의 키워드만 골라 확인합니다. 네 회차 모두에 등장한 키워드(개인정보·비식별, 결측·이상치, 표본분산, 신경망, 혼동행렬)는 이번 회차에도 나온다고 보고 준비하는 것이 합리적입니다.
7. 시험 직전 체크리스트
시험 1주 전
- 새 교재·새 강의를 시작하지 않습니다. 아는 것을 확실하게 만드는 기간입니다.
- 6절의 반복 키워드 표를 기준으로 각 과목 빈출 항목을 하루 한 과목씩 훑습니다.
- 계산 공식은 손으로 다시 씁니다. 눈으로 읽으면 시험장에서 재현되지 않습니다. 최소 확보 공식은 여덟 개입니다.
- 표본분산: 편차 제곱합을
n-1로 나눈다 - 표준화: 관측값에서 평균을 빼고 표준편차로 나눈다
- 이상치 경계: 제1사분위수에서 IQR의 1.5배를 뺀 값, 제3사분위수에 1.5배를 더한 값
- 정밀도: TP를 (TP + FP)로 나눈다
- 재현율: TP를 (TP + FN)으로 나눈다
- F1: 정밀도와 재현율의 조화평균
- RMSE: MSE의 제곱근
- 향상도: 신뢰도를 결과 항목의 지지도로 나눈다
- 표본분산: 편차 제곱합을
- 이 편의 모의 24문항을 실제 시간(24문항 기준 약 36분)을 재며 풉니다.
시험 전날
- 새 문제를 풀지 않습니다. 틀린 문제만 다시 봅니다.
- 오답 노트의 “개념 오류” 항목만 소리 내어 읽습니다.
- 준비물을 미리 한 봉투에 담습니다. 신분증, 수험표, 검은색 컴퓨터용 사인펜, 여분 펜, 시계.
- 시험장 위치와 이동 시간을 확인하고, 도착 시각을 입실 마감보다 30분 앞으로 잡습니다.
- 수면 시간을 확보합니다. 밤샘으로 얻는 두세 문제보다 집중력 저하로 잃는 문제가 더 많습니다.
시험 당일
- 입실 후 첫 5분 동안 아무것도 보지 말고 호흡을 고릅니다.
- 시험지를 받으면 가장 먼저 자신 있는 과목의 페이지를 펼칩니다.
- 1회독 목표 시각(시작 후 65분)을 시계에 기억해 둡니다.
- 문제를 풀 때마다 즉시 마킹합니다.
- 종료 15분 전 알림이 오면 새 문제 풀이를 멈추고 빈칸 채우기와 마킹 검토로 전환합니다.
- 모르는 문제라도 반드시 하나를 고릅니다. 빈칸은 0퍼센트, 찍기는 25퍼센트입니다.
핵심 정리
- 합격은 과목당 8문제(40점) 이상 + 전체 48문제(평균 60점) 이상이라는 두 조건을 동시에 만족해야 성립한다. 어느 하나만 충족하면 불합격이다.
- 현실적 목표는 1과목 13 / 2과목 12 / 3과목 12 / 4과목 13, 합계 50문제(평균 62.5점) 다. 암기 회수율이 높은 1과목과 공식 반복이 확실한 4과목에 목표를 높게 둔다.
- 풀이는 자신 있는 과목부터 1회독하고, 20초 안에 실마리가 없으면 표시하고 넘긴다. 문항당 평균 90초, 마킹 검토 15분을 빼면 약 79초다.
- 과락의 최대 위험은 1과목이다. 계산이 없어 쉬워 보이지만 모르면 유추가 불가능한 순수 암기 영역이기 때문이다.
- 오답은 개념 오류·함정 미인지·계산 실수·시간 부족 네 가지로 분류해야 다음에 무엇을 할지가 결정된다.
- 네 회차를 비교하면 개인정보·비식별, 결측·이상치, 표본분산, 신경망, 혼동행렬 지표는 매 회차 반복된다. 직전 일주일은 이 반복 키워드만 확인한다.
마무리 복습
아래 24문항은 4과목 통합 모의고사입니다. 과목당 6문항씩 균등 배분했으며, 각 문제 첫머리에 과목 표시를 붙였습니다. 과목별로 정답 개수를 세어 보십시오. 한 과목에서 3문제 미만이면 그 과목은 실제 시험에서 과락 위험 구간입니다(6문항 중 3문제는 20문항 중 10문제에 해당하므로, 3문제 미만은 8문제 확보가 불확실하다는 신호입니다).
권장 풀이 시간은 36분(문항당 90초)입니다. 시계를 재고 시작하십시오.
채점 후 해야 할 일
과목별 정답 수를 세어 아래 기준과 대조하십시오.
| 과목별 정답 수 (6문항 기준) | 실제 시험 환산 (20문항) | 상태 | 다음 행동 |
|---|---|---|---|
| 5–6문제 | 약 17문제 | 안전 | 유지만 하면 된다. 다른 과목에 시간을 쓴다 |
| 4문제 | 약 13문제 | 목표 달성 | 2절의 목표 배분에 도달한 상태다 |
| 3문제 | 약 10문제 | 경계 | 과락은 면하지만 평균 기여가 부족하다. 빈출 키워드 재점검 |
| 2문제 이하 | 약 7문제 이하 | 위험 | 과락 구간이다. 본문 편으로 돌아가 개념부터 다시 잡는다 |
틀린 문항은 5절의 네 가지 분류(개념 오류·함정 미인지·계산 실수·시간 부족)로 나누어 적고, 비중이 가장 큰 항목의 처방부터 실행하십시오. 그것이 이 시리즈 27편이 안내할 수 있는 마지막 단계입니다.