재구성 출제 고지: 이 모의고사는 ADsP 공식 출제기준과 최근 회차 기출의 출제 유형·빈도를 분석해 숫자와 상황을 새로 구성한 재구성 문항입니다. 실제 기출 문항을 그대로 옮긴 것이 아닙니다. 권장 풀이 시간은 90분이며, 전체 정답률 60퍼센트(60점) 이상이면서 과목별 정답률이 40퍼센트 미만인 과목이 하나라도 있으면 과락으로 불합격입니다(데이터 이해 10문항 중 4문항 미만, 데이터분석 기획 10문항 중 4문항 미만, 데이터분석 30문항 중 12문항 미만이면 과락).
문항 배분표
| 과목 | 문항 수 | 문항 번호 |
|---|---|---|
| 1과목: 데이터 이해 | 10 | 1–10 |
| 2과목: 데이터분석 기획 | 10 | 11–20 |
| 3과목: 데이터분석 | 30 | 21–50 |
시간을 재고 먼저 끝까지 풀어본 뒤, 채점 후 아래 ## 채점 후 복습 동선 표를 참고해 틀린 영역의 이론 편으로 돌아가 복습하세요.
1과목: 데이터 이해 (1–10)
문제 1
한 온라인 쇼핑몰의 판매 기록을 DIKW 위계에 따라 분류하려고 한다.
가. 지난달 A상품 판매량은 1,200개였다. 나. A상품은 지난달 B상품보다 판매량이 300개 더 많았다. 다. 판매 부진의 원인이 프로모션 부족이라고 판단해 다음 달 프로모션을 강화하기로 했다. 라. 프로모션 시점과 강도가 앞으로 출시될 모든 신상품의 흥행을 좌우할 것이다.
다음 중 데이터(Data) 또는 정보(Information) 단계에 해당하는 것을 모두 고른 것은?
문제 2
다음 중 데이터 유형 구분에 대한 설명으로 옳지 않은 것은?
문제 3
데이터의 일관성과 정확성을 유지하도록 검증하는 DBMS(DataBase Management System, 데이터베이스 관리 시스템)의 특징은 무엇인가?
문제 4
다음 중 빅데이터의 3V로 옳게 짝지어진 것은?
문제 5
빅데이터의 가치를 측정하기 어려운 이유로 가장 적절하지 않은 것은?
문제 6
빅데이터 시대의 위기 요인과 그 대응 방안의 연결로 옳지 않은 것은?
문제 7
데이터 사이언티스트에게 요구되는 역량에 대한 설명이다.
가. 통계학·기계학습 등 분석 기법에 대한 이해 나. 데이터를 통해 파악한 사실을 경영진이 이해하기 쉽게 전달하는 능력 다. 해당 산업의 업무 프로세스와 용어에 대한 이해 라. 최신 프로그래밍 언어를 최대한 많이 습득하는 것이 핵심 역량이다.
다음 중 데이터 사이언티스트에게 요구되는 역량으로 옳은 것을 모두 고른 것은?
문제 8
4TB(테라바이트)는 몇 GB(기가바이트)에 해당하는가? (단, 1TB = 1024GB로 계산한다.)
문제 9
다음 중 데이터 사이언스에 대한 설명으로 가장 적절하지 않은 것은?
문제 10
다음 중 개인정보 비식별화 기법과 그 설명의 연결로 옳지 않은 것은?
2과목: 데이터분석 기획 (11–20)
문제 11
한 유통업체가 “분석 방법은 알고 있으나 무엇을 분석해야 할지 대상이 명확하지 않은” 상황에 놓여 있다. 이 경우에 해당하는 분석 기획 유형은?
문제 12
CRISP-DM(Cross Industry Standard Process for Data Mining) 방법론의 6단계를 올바른 순서로 나열한 것은?
문제 13
분석 준비도 평가 영역에 대한 설명이다.
가. 분석 업무 파악 나. 분석 인력 및 조직 다. 분석을 위한 데이터와 IT 인프라 라. 회사의 재무제표 감사 결과
다음 중 분석 준비도 평가 영역에 해당하는 것을 모두 고른 것은?
문제 14
분석 마스터플랜 수립 시, 시급성은 높지만 난이도는 높은 과제를 처리하는 일반적인 접근으로 가장 적절한 것은?
문제 15
빅데이터 분석 방법론의 5단계를 순서대로 나열한 것은?
문제 16
전사 차원의 데이터 관리 정책, 표준, 프로세스, 조직을 포함하는 관리 체계로 가장 적절한 것은?
문제 17
프로세스 관점에서 분석 요건을 도출하는 절차로 가장 적절한 것은?
문제 18
분석 과제 정의서에 대한 설명으로 옳지 않은 것은?
문제 19
분석 조직 및 인력 등 준비도는 높지만, 실제 분석 업무와 분석 기법 활용 수준은 낮은 기업의 분석 수준 유형은?
문제 20
척도에 대한 설명이다.
가. 성별(남성, 여성)을 구분하는 값 나. 시험 성적 등수(1등, 2등, 3등) 다. 온도(섭씨 20도, 21도)를 나타내는 값 라. 몸무게(kg)를 나타내는 값
다음 중 명목척도와 서열척도에 해당하는 것을 모두 고른 것은?
3과목: 데이터분석 (21–50)
문제 21
확률에 대한 설명이다.
가. 두 사건이 배반사건이면 두 사건은 항상 독립사건이다. 나. 독립사건 A, B가 동시에 일어날 확률은 P(A) 곱하기 P(B)이다. 다. 상대도수는 시행 횟수가 많아질수록 실제 확률에 가까워진다. 라. 조건부 확률은 항상 원래 사건의 확률보다 크다.
다음 중 옳은 것을 모두 고른 것은?
문제 22
한 설문에서 성별에 따른 커피와 홍차 선호도를 조사해 다음과 같은 교차표를 얻었다.
| 구분 | 커피 | 홍차 |
|---|---|---|
| 남 | 24 | 16 |
| 여 | 10 | 30 |
전체 응답자 중 1명을 뽑았을 때, 그 사람이 여성이라는 조건 하에 커피를 선호할 확률은?
문제 23
모집단의 각 개체에 일련번호를 부여한 뒤, 첫 표본을 무작위로 정하고 이후 일정한 간격(k)마다 표본을 추출하는 방법은?
문제 24
중심극한정리(Central Limit Theorem)에 대한 설명으로 옳지 않은 것은?
문제 25
한 연구자가 신약의 평균 효과가 기존 약과 다른지 검정하려고 한다. 가설검정에 대한 설명으로 옳지 않은 것은?
문제 26
다음 R 코드를 실행했을 때 콘솔에 출력되는 결과로 가장 적절한 것은?
x <- c(10, 12, 14, 16, 18)
sd(x)문제 27
상관계수에 대한 설명으로 옳지 않은 것은?
문제 28
다음은 어느 매출 데이터에 대해 R로 다중회귀분석을 수행한 결과이다.
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 12.340 3.210 3.844 0.00041 ***
x1 -0.850 0.220 -3.864 0.00038 ***
x2 0.045 0.310 0.145 0.88500
x3 1.920 0.560 3.429 0.00120 **
---
Residual standard error: 4.02 on 36 degrees of freedom
Multiple R-squared: 0.612, Adjusted R-squared: 0.580위 결과에 대한 해석으로 옳지 않은 것은?
문제 29
한 회귀모형의 총제곱합(SST)을 회귀제곱합(SSR)과 오차제곱합(SSE)으로 분해했더니 SSR = 450, SSE = 150이었다. 이 모형의 결정계수(R²)는?
문제 30
한 기업이 성별(0=남성, 1=여성)과 근속연수를 이용해 연봉을 예측하는 회귀식을 만들었다.
연봉 = 2200 + 15 × 근속연수 + 480 × 성별모든 회귀계수가 통계적으로 유의하다고 할 때, 이 회귀식에 대한 해석으로 옳지 않은 것은?
문제 31
회귀분석에서 독립변수들 사이에 강한 상관관계가 존재해 회귀계수의 추정이 불안정해지는 문제를 가리키는 용어는?
문제 32
어떤 로지스틱 회귀모형에서 변수 X의 회귀계수를 지수변환한 값이 exp(β) = 0.756으로 나타났다. 다른 변수가 일정할 때 X가 1 증가하는 경우의 해석으로 가장 적절한 것은?
문제 33
시계열 자료를 구성하는 요소 중, 특정 주기 없이 경기 변동처럼 장기간에 걸쳐 나타나는 변동을 가리키는 것은?
문제 34
시계열 데이터에서 추세로 인한 비정상성을 제거해 평균을 안정화하는 대표적인 방법은?
문제 35
다음 중 두 변수 사이의 거리(비유사도)를 측정할 때, 변수들 사이의 공분산 구조(상관관계)까지 함께 고려하는 거리 척도는?
문제 36
한 이진 분류 문제에서 어떤 노드에 합격 30명, 불합격 10명이 속해 있다. 이 노드의 지니 지수(Gini Index)는?
문제 37
문제 36과 동일한 노드(합격 30명, 불합격 10명)의 엔트로피(Entropy) 값은? (소수점 셋째 자리에서 반올림)
문제 38
앙상블 기법에 대한 설명으로 옳지 않은 것은?
문제 39
K-means 군집분석에 대한 설명으로 옳지 않은 것은?
문제 40
다음은 5개 관측치 a, b, c, d, e에 대한 계층적 군집분석의 병합 순서와 높이를 나타낸 표이다.
| 병합 순서 | 결합 대상 | 결합 높이 |
|---|---|---|
| 1 | a, b | 1.0 |
| 2 | d, e | 1.5 |
| 3 | (a,b), c | 2.0 |
| 4 | (a,b,c), (d,e) | 3.0 |
높이 2.5에서 덴드로그램을 수평 절단할 때 만들어지는 군집의 수는?
문제 41
다음은 5건의 거래 기록이다.
| 거래 번호 | 구매 품목 |
|---|---|
| T1 | 우유, 빵, 계란 |
| T2 | 빵, 계란 |
| T3 | 우유, 빵 |
| T4 | 우유, 계란 |
| T5 | 빵 |
연관규칙 “빵 → 계란”의 지지도(Support)는?
문제 42
문제 41과 동일한 거래 기록을 이용할 때, 연관규칙 “빵 → 계란”의 향상도(Lift)는?
문제 43
Apriori 알고리즘의 수행 절차에 대한 설명이다.
가. 최소 지지도를 설정한다. 나. 후보 항목집합을 생성한다. 다. 지지도를 계산해 최소 지지도 미만인 항목집합을 제거한다. 라. 더 이상 새로운 빈발항목집합이 나오지 않을 때까지 나와 다를 반복한다.
Apriori 알고리즘의 수행 절차를 올바른 순서로 나열한 것은?
문제 44
한 이진 분류 모델의 예측 결과를 정리한 혼동행렬(Confusion Matrix)이 다음과 같다.
| 구분 | 실제 양성 | 실제 음성 |
|---|---|---|
| 예측 양성 | 60(TP) | 30(FP) |
| 예측 음성 | 20(FN) | 90(TN) |
이 모델의 F1-score는? (소수점 셋째 자리에서 반올림)
문제 45
모형평가 지표 중, 예측을 반복했을 때 예측값들 사이의 편차가 작아 결과가 일관되게 나타나는 특성을 가리키는 것은?
문제 46
ROC(Receiver Operating Characteristic) 곡선에서 가장 이상적인 분류 성능을 나타내는 좌표는?
문제 47
데이터마이닝 모형 평가 기준 중, 같은 모집단 내의 다른 데이터에 적용해도 안정적으로 유사한 결과를 제공하는 특성을 가리키는 것은?
문제 48
주성분분석(PCA, Principal Component Analysis)에 대한 설명으로 옳지 않은 것은?
문제 49
k-NN(k-Nearest Neighbor, k-최근접 이웃) 알고리즘에 대한 설명으로 옳지 않은 것은?
문제 50
의사결정나무(Decision Tree)의 가지치기(Pruning)에 대한 설명으로 가장 적절한 것은?
채점 후 복습 동선
| 틀린 문항의 주제 | 돌아갈 편 번호 |
|---|---|
| 데이터·정보·지식·지혜 위계(DIKW) | 02 |
| 데이터베이스와 DBMS 특징 | 03 |
| 빅데이터 3V와 가치 산정 | 04 |
| 데이터 사이언스·전략적 인사이트 | 05 |
| 분석 기획 방향과 4분면 | 06 |
| 분석 방법론(CRISP-DM, KDD) | 07 |
| 분석 과제 발굴(하향식·상향식) | 08 |
| 마스터플랜과 우선순위 로드맵 | 09 |
| R 기초 문법 | 10 |
| R 데이터 구조 | 11 |
| R 데이터 전처리(dplyr) | 12 |
| 기술통계 | 13 |
| 확률분포 | 14 |
| 표본추출과 추정 | 15 |
| 가설검정 | 16 |
| 상관분석 | 17 |
| 회귀분석 | 18 |
| 시계열분석 | 19 |
| 데이터마이닝 개관 | 20 |
| 의사결정나무 | 21 |
| 로지스틱 회귀·앙상블 | 22 |
| 군집분석 | 23 |
| 연관규칙분석 | 24 |
| 모형평가 | 25 |
합격 기준: 전체 50문항 중 30문항(60점) 이상 정답이면서, 데이터 이해 10문항 중 4문항 이상, 데이터분석 기획 10문항 중 4문항 이상, 데이터분석 30문항 중 12문항 이상을 맞혀야 과락 없이 합격입니다. 어느 한 과목이라도 정답률이 40퍼센트 미만이면 총점과 무관하게 불합격 처리됩니다.