이번 회차는 기출 그대로가 아니라 재구성 출제입니다. 01~27편에서 다룬 개념과 최근 회차 기출·모의고사 자료의 출제 유형·빈도·오답 구성 방식을 분석해 숫자와 상황을 새로 만든 문제입니다. 문항을 외워 두어도 실제 시험에는 그대로 나오지 않습니다. 권장 풀이 시간은 120분이며, 합격 기준은 과목별 100점 만점에 40점 미만이면 과락(20문항 중 8문항 미만 정답)이고 4과목 평균 60점 이상(80문항 중 48문항 이상 정답)입니다. 실제 응시 회차의 세부 출제기준·배점·합격선은 한국데이터산업진흥원 공고를 반드시 확인하십시오.
문항 배분표
| 과목 | 문항 범위 | 문항 수 | 주요 내용 |
|---|---|---|---|
| 1과목 빅데이터 분석 기획 | 1–20 | 20 | 빅데이터 이해, 분석 기획, 수집·저장 계획, 개인정보·거버넌스 |
| 2과목 빅데이터 탐색 | 21–40 | 20 | 전처리, 탐색적 데이터 분석, 기술통계·확률분포·추론 |
| 3과목 빅데이터 모델링 | 41–60 | 20 | 회귀·분류, 의사결정나무, 군집, 신경망·시계열 기초 |
| 4과목 빅데이터 결과 해석 | 61–80 | 20 | 평가지표, 검증·과적합, 초매개변수, 시각화·활용 |
| 합계 | – | 80 | – |
이 회차는 표준 난이도로 구성했습니다. 문항 형식은 정의 고르기, 옳지 않은 것 고르기, 보기(ㄱㄴㄷㄹ) 조합형, 표를 활용한 계산형을 실제 기출 비율에 맞춰 섞었습니다.
1과목: 빅데이터 분석 기획 (1~20)
문제 14지선다
한 종합병원의 진료 정보 시스템에는 검사 결과가 담긴 정형 테이블, 자유 서술로 작성된 퇴원 요약 문서, 검사 장비가 표준 규격으로 전송하는 반정형 메시지가 함께 저장된다. 이처럼 구조화 정도가 서로 다른 자료가 한 저장소에 섞여 있는 성질을 가리키는 빅데이터 특성은 무엇인가
문제 24지선다
한 유통 기업이 고객 구매 이력을 분석해 재구매율을 8퍼센트포인트 끌어올리고 그만큼 매출을 늘렸다. 이 성과가 직접 대응하는 빅데이터 특성 확장 요소는 무엇인가
문제 34지선다
다음 중 빅데이터 활용 확대에 따른 위기 요인으로 보기 어려운 것은 무엇인가
문제 44지선다
한 제조 기업이 분석 준비도와 분석 성숙도 두 축으로 자사 수준을 진단했다. 두 축의 조합과 유형 명칭을 짝지은 설명 중 옳지 않은 것은 무엇인가
문제 54지선다
분석 업무를 담당하는 조직 구조 유형에 대한 설명으로 옳지 않은 것은 무엇인가
문제 64지선다
데이터 과학자에게 요구되는 역량을 하드 스킬과 소프트 스킬로 나눌 때, 소프트 스킬에 해당하는 것은 무엇인가
문제 74지선다
CRISP-DM 방법론의 표준 단계를 올바른 순서로 나열한 것은 무엇인가
문제 84지선다
한 콜센터가 특별한 목표 없이 상담 통화 기록을 모아 탐색하던 중, 특정 문의 유형 뒤에 해지가 몰린다는 패턴을 발견하고 이를 바탕으로 분석 과제를 정의했다. 이 과제 발굴 방식은 무엇인가
문제 94지선다
한 물류 회사가 최신 경로 최적화 알고리즘을 이미 채택했지만, 어떤 배송 구역에 적용하고 어떤 사업 목표를 달성할지는 아직 정하지 못했다. 이 상태에 해당하는 분석 과제 유형은 무엇인가
문제 104지선다
다음 중 데이터 3법에 속하는 법률로 옳지 않은 것은 무엇인가
문제 114지선다
설문 응답자의 이름을 임의 코드로 바꾼 파일이 있다. 이 파일만으로는 개인을 알아보기 어렵지만, 별도로 보관 중인 이름-코드 대응표와 결합하면 다시 식별할 수 있다. 이 정보의 성격으로 옳은 것은 무엇인가
문제 124지선다
비식별 처리 기법과 적용 사례를 짝지은 것 중 옳지 않은 것은 무엇인가
문제 134지선다
데이터 품질 요소와 그 설명을 짝지은 것 중 옳지 않은 것은 무엇인가
문제 144지선다
다음 중 비정형 데이터로 보기 어려운 것은 무엇인가
문제 154지선다
분산 파일 시스템의 특징에 대한 설명으로 가장 적절한 것은 무엇인가
문제 164지선다
레코드마다 저장할 속성 구성이 달라질 수 있는 JSON 형태의 상품 카탈로그를 저장하기에 가장 적합한 NoSQL 유형은 무엇인가
문제 174지선다
한 보험사가 사내 관계형 데이터베이스의 계약 원장 테이블을 분산 저장 환경으로 옮기고, 배치 처리가 끝나면 다시 관계형 데이터베이스로 되돌리려 한다. 이처럼 관계형 저장소와 분산 저장 환경 사이에서 정형 자료를 양방향으로 옮기는 데 쓰이는 수집 기술은 무엇인가
문제 184지선다
데이터 웨어하우스의 전통적 특성에 대한 설명으로 옳지 않은 것은 무엇인가
문제 194지선다
여러 업무 시스템에서 자료를 뽑아내고 코드 체계와 단위를 목표 형식에 맞게 바꾼 뒤 목적지 저장소에 적재하는 일련의 처리 과정을 가리키는 명칭은 무엇인가
문제 204지선다
분석 의뢰를 접수한 팀이 산출물을 차례로 만들려 한다. ㄱ. 세부 일정과 투입 자원이 적힌 수행 계획서 ㄴ. 사업 범위와 배경이 적힌 문제 정의서 ㄷ. 과제 우선순위와 적용 시점을 담은 마스터플랜 ㄹ. 계획에 따라 나눈 작업 단위별 담당과 산출물 목록(WBS) 이 넷을 합리적인 순서로 인계한다면 어떤 순서가 맞는가
2과목: 빅데이터 탐색 (21~40)
문제 214지선다
한 렌터카 업체가 예약 이력 자료의 전처리를 정제, 통합, 축소, 변환 네 단계로 나누어 설계했다. 각 단계에 대한 설명으로 옳지 않은 것은 무엇인가
문제 224지선다
건강검진 자료의 결측값 처리 기법에 대한 설명으로 옳지 않은 것은 무엇인가
문제 234지선다
설비 압력 측정치 1,500건 가운데 양 끝 극단에 놓인 30건을 이상값으로 판정해 제거할지 검토하고 있다. 이상값 제거에 대한 설명으로 옳은 것은 무엇인가
문제 244지선다
다음 중 연속형 변수로 보기 어려운 것은 무엇인가
문제 254지선다
다음 중 파생변수 생성의 사례로 보기 어려운 것은 무엇인가
문항 26 자료
| 설비 소음 측정값(dB) | 5 | 10 | 15 | 25 |
|---|
문제 264지선다
위 표의 네 값에 최소-최대 정규화 공식을 각각 적용할 때, 변환된 네 값의 합은 얼마인가
문항 27 자료
| 구분 | 개수 |
|---|---|
| 연속형 설명변수 | 3개 |
| 범주형 설명변수 A(범주 5개) | 1개 |
| 범주형 설명변수 B(범주 4개) | 1개 |
문제 274지선다
월 매출을 예측하는 회귀모형에 위 표의 설명변수를 모두 넣으려 한다. 범주형 변수는 각각 기준 범주 하나를 제외하고 나머지를 지시변수로 바꾼다. 절편을 포함할 때 이 모형이 추정하는 모수는 모두 몇 개인가
문제 284지선다
신용카드 거래 80만 건 가운데 사기 거래가 0.3퍼센트인 자료로 사기 탐지 분류 모형을 학습하려 한다. 클래스 불균형에 대한 설명으로 옳지 않은 것은 무엇인가
문제 294지선다
가구별 월 소비지출 자료의 산포와 분포 형태를 여러 통계량으로 살펴보려 한다. 각 통계량에 대한 설명으로 옳지 않은 것은 무엇인가
문항 30 자료
| 관측 순서 | 1 | 2 | 3 | 4 | 5 |
|---|---|---|---|---|---|
| 무인 매장 하루 방문객 수(명) | 6 | 9 | 10 | 12 | 13 |
문제 304지선다
위 표의 다섯 값을 표본으로 볼 때 표본평균과 표본분산을 바르게 구한 것은 무엇인가
문제 314지선다
어떤 확률변수 X가 성공 확률 0.4인 독립 시행을 12번 반복할 때의 성공 횟수를 나타낸다. X가 따르는 분포로 옳은 것은 무엇인가
문제 324지선다
정규분포에 대한 설명으로 옳지 않은 것은 무엇인가
문제 334지선다
전국 대학생의 하루 학습 시간을 알아보기 위해 표본 500명을 뽑아 표본평균을 구했다. 표본평균의 표집분포에 대한 설명으로 옳지 않은 것은 무엇인가
문제 344지선다
다음 중 확률표본을 얻는 방법으로 보기 어려운 것은 무엇인가
문제 354지선다
한 온라인 강의 사이트의 월별 신규 가입자 수를 1월부터 12월까지 이어 그렸다. 1월 500명에서 시작해 7월 2,800명까지 매달 늘었고, 7월을 정점으로 방향이 바뀌어 12월 700명까지 매달 줄었다. 이 그림에 대한 해석으로 가장 적절한 것은 무엇인가
문제 364지선다
탐색적 데이터 분석의 성격과 범위에 대한 설명으로 옳지 않은 것은 무엇인가
문제 374지선다
광고 노출량과 매출액 자료를 놓고 어떤 분석을 할지 정하려 한다. 인과관계 분석에 대한 설명으로 옳은 것은 무엇인가
문제 384지선다
변수 x를 z=(x-평균)/표준편차 공식으로 바꾸었다. 이 처리의 명칭과 효과로 옳은 것은 무엇인가
문제 394지선다
온라인 서점의 주문 자료로 이탈 예측 모형을 만들기 위해 여러 전처리 작업을 검토했다. 데이터 정제 작업에 해당하지 않는 것은 무엇인가
문제 404지선다
쇼핑몰 회원의 지역 정보를 층으로 나누고, 각 층에서 정해진 비율만큼 회원을 임의로 뽑아 설문을 진행했다. 이 표본추출법은 무엇인가
3과목: 빅데이터 모델링 (41~60)
문제 414지선다
제조 공정 자료를 다루는 분석팀이 학습 방식에 따라 과제를 분류하고 있다. 다음 중 지도학습 과제로 보기 어려운 것은 무엇인가
문제 424지선다
전력 사용량을 기온과 가동 설비 수로 설명하는 선형회귀모형을 세우고 가정 충족 여부를 점검하려 한다. 선형회귀모형의 기본 가정에 대한 설명으로 옳지 않은 것은 무엇인가
문항 43 자료
| 변수 | 계수 | 표준오차 | t | 유의확률 |
|---|---|---|---|---|
| 상수항 | 15.20 | 2.80 | 5.43 | 0.000 |
| 매장면적(평) | 0.92 | 0.18 | 5.11 | 0.000 |
| 경쟁점포수(개) | -0.75 | 0.22 | -3.41 | 0.001 |
| 주차면수(면) | 0.05 | 0.06 | 0.83 | 0.408 |
문제 434지선다
위 표는 카페 지점 70곳의 월 매출(백만원)을 세 변수로 설명한 다중회귀 결과다. 유의수준 0.05에서 다음 진술 중 옳은 것만을 모두 고른 것은 다음과 같다. ㄱ. 경쟁점포수가 많을수록 월 매출은 낮아지는 방향으로 추정되었다. ㄴ. 주차면수는 월 매출에 유의한 영향을 준다. ㄷ. 다른 변수가 일정할 때 매장면적이 1평 늘면 월 매출은 평균 0.92백만원 증가하는 것으로 해석한다.
문제 444지선다
농구 선수의 시즌 득점을 여러 기록 지표로 설명하는 회귀모형의 설명력을 평가하려 한다. 결정계수에 대한 설명으로 옳지 않은 것은 무엇인가
문제 454지선다
회귀모형을 적합한 뒤 설명변수들이 서로 비슷한 정보를 중복해서 담고 있어 계수 추정치가 불안정해지는 문제가 있는지 확인하려 한다. 이 문제를 진단하는 데 직접 사용하는 통계량으로 가장 적절한 것은 무엇인가
문항 46 자료
| 구분 | 재구매 | 재구매 안 함 | 합계 |
|---|---|---|---|
| 신규 혜택 이용 | 84 | 56 | 140 |
| 신규 혜택 미이용 | 40 | 120 | 160 |
문제 464지선다
위 표에서 신규 혜택을 이용한 집단의 재구매 오즈비(오즈의 비)는 얼마인가
문제 474지선다
구독 해지 여부를 예측하는 로지스틱 회귀에서 해지 확률 p에 대해 다음 식이 얻어졌다. 로그 오즈는 -0.9에 월 문의 횟수 계수 0.5를 곱한 값과 월 이용 일수 계수 -0.3을 곱한 값을 더한 것으로 표현된다. 이 결과에 대한 해석으로 가장 적절한 것은 무엇인가
문제 484지선다
대출 심사 자료로 의사결정나무를 만들려 한다. 의사결정나무의 알고리즘과 분리 기준에 대한 설명으로 옳지 않은 것은 무엇인가
문제 494지선다
택시 승하차 좌표를 군집화하려는데 군집 개수를 미리 알 수 없고 임의 모양의 군집과 잡음 지점이 섞여 있다. 군집 개수를 사전에 입력하지 않아도 되는 알고리즘으로 가장 적절한 것은 무엇인가
문제 504지선다
상품평 텍스트에 등장하는 단어를 원-핫 인코딩으로 표현해 분석에 사용하려 한다. 이 표현 방식에 대한 설명으로 옳지 않은 것은 무엇인가
문제 514지선다
반응변수가 정상 또는 불량 두 범주로 주어진 자료를 분석하려 한다. 이 자료에 바로 적용할 수 있는 분류 모형으로 보기 어려운 것은 무엇인가
문항 52 자료
| 주성분 | PC1 | PC2 | PC3 | PC4 |
|---|---|---|---|---|
| 고유값 | 5.0 | 3.0 | 1.5 | 0.5 |
문제 524지선다
설비 센서 자료를 주성분분석으로 요약한 위 표에서 PC2 하나가 설명하는 분산 비율은 얼마인가
문제 534지선다
주성분분석에 대한 설명으로 옳지 않은 것은 무엇인가
문제 544지선다
일별 지하철 승객 수 자료에서 과거 시점의 값과 현재 값이 시차별로 얼마나 연관되어 있는지를 살펴보려 한다. 이때 사용하는 도구로 가장 적절한 것은 무엇인가
문제 554지선다
월별 전력 판매량 자료를 분해하고 정상성을 검토하면서 다음 진술을 정리했다. ㄱ. 추세 요인은 자료가 장기간에 걸쳐 증가하거나 감소하는 흐름을 뜻한다. ㄴ. 불규칙 요인은 규칙성이 없지만 과거 자료를 충분히 모으면 정확히 예측할 수 있다. ㄷ. 정상 시계열은 평균이 시점에 따라 달라지지 않고 자기공분산이 시차에만 의존한다. ㄹ. 백색잡음 과정은 서로 다른 시점 사이에 일정한 크기의 양의 상관을 가진다. 옳지 않은 것만을 모두 고른 것은 무엇인가
문제 564지선다
순차 자료를 다루는 신경망 가운데, 장기 의존성 문제를 완화하는 게이트 구조를 유지하면서도 게이트 수를 줄이고 별도 기억 셀을 두지 않아 매개변수를 적게 쓰는 모형은 무엇인가
문제 574지선다
학습 자료에서는 오차가 매우 작지만 검증 자료에서는 오차가 큰 신경망 모형을 개선하려 한다. 이때의 조치로 적절하지 않은 것은 무엇인가
문제 584지선다
여러 개의 결정나무를 만들어 결과를 모아 예측하는 랜덤 포레스트에 대한 설명으로 옳지 않은 것은 무엇인가
문제 594지선다
부스팅 방식의 앙상블 학습 구조에 대한 설명으로 옳지 않은 것은 무엇인가
문제 604지선다
다음 중 비지도학습 과제로 보기 어려운 것은 무엇인가
4과목: 빅데이터 결과 해석 (61~80)
문항 61 자료
| 구분 | 예측 양성 | 예측 음성 |
|---|---|---|
| 실제 양성 | 45 | 5 |
| 실제 음성 | 15 | 135 |
문제 614지선다
위 혼동행렬에서 정밀도(Precision)는 얼마인가
문제 624지선다
위와 같은 혼동행렬에서 재현율(민감도)은 얼마인가
문제 634지선다
정밀도가 0.75, 재현율이 0.90일 때 F1 점수는 얼마인가(소수 넷째 자리에서 반올림)
문제 644지선다
혼동행렬의 네 칸을 각각 TP, FP, FN, TN이라 할 때 지표 이름과 정의식의 대응이 옳지 않은 것은 무엇인가
문제 654지선다
관측치 350개를 k=7인 k겹 교차검증으로 평가하려 한다. 진행 방식에 대한 설명으로 옳지 않은 것은 무엇인가
문제 664지선다
변수 선별과 자료 분할, 모형 학습, 성능 산출을 수행하는 순서로 가장 적절한 것은 무엇인가(자료를 학습용과 평가용으로 나누는 상황을 가정한다)
문제 674지선다
적합도 검정의 목적과 적용 조건에 대한 설명으로 옳지 않은 것은 무엇인가
문제 684지선다
배송 지연 예측 모형을 만들기 위해 자료를 학습용, 검증용, 평가용 세 갈래로 나누었다. 각 자료의 역할에 대한 설명으로 옳지 않은 것은 무엇인가
문제 694지선다
모형을 학습시키기 전에 사람이 정하는 값과 학습 결과로 얻어지는 값을 나누어 보려 한다. 다음 중 타당하지 않은 것은 무엇인가
문제 704지선다
초매개변수 탐색 기법과 그 특징을 짝지은 것으로 옳지 않은 것은 무엇인가
문제 714지선다
다음 중 손실함수의 기울기를 이용해 학습 도중 가중치를 갱신하는 최적화 알고리즘에 해당하지 않는 것은 무엇인가
문제 724지선다
구독 해지 예측 모형을 도입한 뒤 그 분석 결과가 사업에 얼마나 기여했는지 평가하려 한다. 비즈니스 기여도 평가에 대한 설명으로 옳지 않은 것은 무엇인가
문제 734지선다
가로축에 학습 시간, 세로축에 시험 점수를 두고 학생 한 명을 점 하나로 찍어 두 변수의 관계와 밀집 정도를 살피려 한다. 이러한 표현에 해당하는 시각화 기법은 무엇인가
문제 744지선다
여러 대상에 대해 여러 항목의 값을 한 화면에서 견주는 비교 시각화 기법과 값의 표현 방식을 짝지은 것으로 옳지 않은 것은 무엇인가
문제 754지선다
시각화 산출물을 기획하는 상황에서 인포그래픽에 대한 설명으로 부적절한 것은 무엇인가
문제 764지선다
한 공공도서관이 개관 이후 15년 동안의 주요 사건을 연도 순서대로 배열해 한 장으로 보여 주려 한다. 각 연도에 무슨 일이 있었는지를 시점 순서에 따라 훑어보게 하는 데 가장 적합한 인포그래픽 유형은 무엇인가
문제 774지선다
분석 활용계획에 대한 설명으로 옳지 않은 것은 무엇인가
문제 784지선다
사기경보 모델 감사에서 행은 실제 거래, 열은 경보 결과로 집계했다. 감사팀이 실제 사기 거래 중 모델이 경보를 울린 비율을 확인하려 할 때 봐야 할 지표는 무엇인가
문제 794지선다
같은 평가 표본에서 모델 A의 AUC는 0.88, 모델 B의 AUC는 0.61일 때 올바른 해석은 무엇인가
문제 804지선다
다음 중 두 변수 사이의 관계를 표현하는 것이 주된 목적이 아닌 시각화는 무엇인가
채점 후 복습 동선표
채점을 마쳤으면 틀린 문항의 과목·번호로 아래 표를 찾아 해당 편을 다시 읽습니다. 같은 개념에서 반복해 틀린다면 그 편을 정독한 뒤 이 모의고사를 다시 풀어 보십시오.
| 틀린 문항 번호 | 다루는 영역 | 복습할 편 |
|---|---|---|
| 1–3 | 빅데이터 특성(3V/5V)과 위기 요인 | 08편 |
| 4–6 | 분석 준비도·성숙도, 조직 구조, 데이터 과학자 역량 | 08편 |
| 7, 9, 20 | 분석 방법론(CRISP-DM), 과제 유형, 마스터플랜·WBS | 07편, 10편 |
| 8 | 하향식·상향식 과제 발굴 | 07편 |
| 10–13 | 개인정보·비식별 기법, 데이터 품질 요소 | 08편, 09편 |
| 14–19 | 정형·비정형 데이터, 분산 저장·NoSQL, ETL·DW | 03편, 09편 |
| 21–25, 39 | 전처리(정제·통합·축소·변환), 결측·이상치, 파생변수 | 11편, 12편 |
| 26–28, 40 | 정규화, 인코딩, 클래스 불균형, 표본추출 | 12편, 02편 |
| 29–33, 38 | 기술통계·확률분포·정규분포·표집분포 | 14편 |
| 34–37 | 표본추출법, 시각적 해석, 탐색적 데이터 분석, 인과관계 | 04편, 13편, 15편 |
| 41 | 지도학습·비지도학습 구분 | 05편 |
| 42–45 | 회귀 가정, 다중회귀 해석, 결정계수, 다중공선성 | 16편 |
| 46–47 | 오즈비, 로지스틱 회귀 해석 | 18편 |
| 48, 58–59 | 의사결정나무, 랜덤포레스트, 부스팅 | 18편 |
| 49, 60 | 군집분석, 비지도학습 과제 | 19편 |
| 50 | 텍스트 인코딩(원-핫) | 12편, 18편 |
| 51 | 이진 분류에 부적절한 모형 | 17편, 18편 |
| 52–53 | 주성분분석(PCA) | 19편 |
| 54–55 | 시계열·자기상관·정상성 | 21편 |
| 56–57 | 신경망 구조, 과대적합 대응 | 21편, 22편 |
| 61–64, 78–80 | 혼동행렬, 정밀도·재현율·F1, AUC | 20편 |
| 65–68 | 교차검증, 데이터 누수, 자료 분할 역할 | 21편 |
| 67 | 적합도 검정 | 15편 |
| 69–71 | 초매개변수·매개변수, 탐색 기법, 최적화 알고리즘 | 21편, 22편 |
| 72 | 비즈니스 기여도 평가 | 24편 |
| 73–77 | 시각화 기법, 인포그래픽, 분석 활용계획 | 23편, 24편 |
참고 자료
Last updated on