이 편의 문제는 실제 기출을 그대로 복제한 것이 아닙니다. 같은 개념, 같은 난이도로 재구성한 문항입니다. 숫자·상황·보기 표현을 바꾸었으므로 문장을 통째로 외우는 방식으로는 이득이 없고, 개념을 이해해야만 풀립니다.
또한 실제 기출·복원본 중 근거가 약하거나 정답이 모호했던 문항은 그대로 옮기지 않고, 조건을 명확히 다듬어 새로 출제했습니다. 예를 들어 “가장 적절한 것”과 “옳지 않은 것”의 경계가 흐렸던 문항, 교재마다 분류가 갈리는 용어를 물었던 문항은 판단 기준을 문제 안에 명시하도록 고쳐 두었습니다.
이 편이 다루는 범위
이 편은 1과목 빅데이터 분석 기획과 2과목 빅데이터 탐색에서 나오는 개념·용어·절차 문항만 다룹니다. 두 과목은 필기 80문항 중 40문항, 즉 절반을 차지하며 그중 대부분이 계산 없이 “무엇을 무엇이라 부르는가”, “이 활동은 어느 단계인가”를 묻습니다.
계산 문항(기술통계·확률·검정통계량·평가지표 대입 계산)은 이 편에서 다루지 않습니다. 자세한 내용은 26편에서 이어집니다.
푸는 방법
- 먼저 스스로 풉니다. 해설을 먼저 보면 “아, 그렇지”라는 착각만 남고 시험장에서는 다시 틀립니다.
- 채점한 뒤 해설을 정독합니다. 이 편의 해설에는 정답 근거뿐 아니라 각 오답 보기가 실제로 가리키는 개념이 무엇인지까지 적어 두었습니다. 오답 보기 하나하나가 다른 문항의 정답이 될 수 있는 조각입니다.
- 틀린 문항은 개념 편으로 되돌아갑니다. 이 편은 개념을 처음 배우는 자리가 아니라, 이미 배운 개념이 문제 형태로 어떻게 위장되는지 확인하는 자리입니다.
이 범위의 대표 함정 유형 다섯 가지
함정 1 — 정의를 좌우로 뒤집기. 가장 흔한 형태입니다. 암묵지와 형식지, 도입형과 정착형, 상향식과 하향식, OLAP과 OLTP처럼 짝을 이루는 두 용어의 설명을 서로 바꿔 놓습니다. 보기 문장 자체는 어디선가 본 익숙한 문장이라서 읽고 넘기기 쉽습니다. 짝 용어가 나오면 반드시 “이 설명이 왼쪽 것인가 오른쪽 것인가”를 소리 내어 확인해야 합니다.
함정 2 — 층위를 섞기. 데이터 거버넌스의 구성요소를 묻는데 보기에 “저장 서버와 스토리지 장비”를 끼워 넣는 식입니다. 그 보기는 틀린 말이 아니라 층위가 다른 말입니다. 거버넌스는 원칙·조직·프로세스라는 관리 체계이고, 장비는 그 체계를 돌리는 기술 기반입니다. 마찬가지로 ETL은 처리 기술이고 데이터웨어하우스·데이터마트·데이터레이크는 저장소이므로 같은 목록에 섞이면 답이 됩니다.
함정 3 — 단계를 앞뒤로 옮기기. “결측값을 실제로 대체하고 모델 입력 테이블을 만든다”를 분석 기획 단계의 활동으로 제시하는 식입니다. 실제로는 데이터 준비 단계의 실행 활동입니다. 절차 문항은 “이 작업을 하려면 그 앞에 무엇이 이미 끝나 있어야 하는가”를 따지면 대부분 풀립니다.
함정 4 — 항상·반드시·모두라는 과잉 단정. “결측이 하나라도 있는 행은 정보 손실과 무관하게 반드시 삭제한다”, “최빈값은 모든 연속형 자료에서 항상 가장 적절한 대표값이다”, “SVD를 적용하려면 반드시 정사각 행렬이어야 한다” 같은 문장은 거의 예외 없이 오답입니다. 통계와 전처리에는 상황에 따라 다르다가 정답인 경우가 압도적으로 많습니다.
함정 5 — 옳은 사실 하나를 엉뚱한 이름에 붙이기. 데이터 품질 차원 문항이 대표적입니다. “필수값이 빠짐없이 기록되었는가”는 완전성인데 이를 정확성이라 붙이거나, “필요한 업무 시점에 쓸 수 있는가”인 적시성을 유효성이라 붙입니다. 비식별 기법 문항도 같습니다. 별표로 가리면 마스킹, 지역별 평균으로 바꾸면 총계처리, 상세 주소를 상위 행정구역으로 넓히면 범주화, 나이를 10세 단위 경계값으로 옮기면 라운딩입니다. 행위 묘사와 이름표를 따로 외우지 말고 붙여서 외워야 합니다.