재구성 출제 고지: 이 모의고사는 ADsP 공식 출제기준과 최근 회차 기출의 출제 유형·빈도를 분석해 숫자와 상황을 새로 구성한 재구성 문항입니다. 실제 기출 문항을 그대로 옮긴 것이 아닙니다. 이번 회차는 1과목 데이터 이해와 2과목 데이터분석 기획의 함정 선택지를 특히 강화했습니다. 권장 풀이 시간은 90분이며, 전체 정답률 60퍼센트(60점) 이상이면서 과목별 정답률이 40퍼센트 미만인 과목이 하나라도 있으면 과락으로 불합격입니다(데이터 이해 10문항 중 4문항 미만, 데이터분석 기획 10문항 중 4문항 미만, 데이터분석 30문항 중 12문항 미만이면 과락).
문항 배분표
| 과목 | 문항 수 | 문항 번호 |
|---|---|---|
| 1과목: 데이터 이해 | 10 | 1–10 |
| 2과목: 데이터분석 기획 | 10 | 11–20 |
| 3과목: 데이터분석 | 30 | 21–50 |
1회차보다 데이터 이해·기획 파트의 오답 선택지가 더 정교합니다. 서술이 그럴듯해 보여도 핵심 단어 하나가 바뀌어 있는지 꼼꼼히 확인하세요.
1과목: 데이터 이해 (1–10)
문제 1
한 카페의 판매 기록을 DIKW 위계에 따라 분류하려고 한다.
가. 이번 주 아메리카노 판매량은 350잔이었다. 나. 아메리카노는 라떼보다 120잔 더 많이 팔렸다. 다. 아메리카노 비중이 높으므로 원두 재고를 더 확보하기로 했다. 라. 이런 판매 패턴은 다른 지점에도 적용될 수 있어 전사 재고 정책에 반영하기로 했다.
다음 중 지식(Knowledge) 또는 지혜(Wisdom) 단계에 해당하는 것을 모두 고른 것은?
문제 2
다음 중 정성적 데이터와 정량적 데이터에 대한 설명으로 가장 적절하지 않은 것은?
문제 3
OLTP(Online Transaction Processing)와 OLAP(Online Analytical Processing)에 대한 설명으로 옳지 않은 것은?
문제 4
데이터베이스의 4대 특징 중, 여러 사용자가 동일한 데이터를 서로 다른 목적으로 함께 이용할 수 있다는 특징을 가리키는 것은?
문제 5
빅데이터 출현 배경에 대한 설명이다.
가. 데이터 저장 비용이 급격히 하락해 대량의 데이터를 보관할 수 있게 되었다. 나. 클라우드와 분산처리 기술이 발전해 대용량 데이터 처리가 쉬워졌다. 다. 정부 주도로 모든 조직의 데이터가 하나의 동일한 형식으로 완전히 통일되었다. 라. 모바일 기기와 IoT(사물인터넷) 확산으로 데이터를 생성하는 주체가 다양해졌다.
다음 중 빅데이터 출현 배경으로 옳은 것을 모두 고른 것은?
문제 6
빅데이터가 가져온 데이터 분석 패러다임의 변화에 대한 설명으로 가장 적절한 것은?
문제 7
빅데이터 시대의 위기 요인과 통제 방안의 연결이다.
가. 사생활 침해 - 동의제에서 책임제로의 전환 나. 책임 원칙 훼손 - 결과 기반 책임 원칙 고수 다. 데이터 오용 - 알고리즘에 대한 접근권 확대 라. 데이터 오용 - 개인정보 수집 항목을 최대한 늘려 정확도를 높인다.
다음 중 위기 요인과 통제 방안의 연결로 옳은 것을 모두 고른 것은?
문제 8
500GB(기가바이트)는 몇 MB(메가바이트)에 해당하는가? (단, 1GB = 1024MB로 계산한다.)
문제 9
데이터 사이언티스트의 역량에 대한 설명이다.
가. 통계 및 머신러닝 이론에 대한 이해 나. 프로그래밍 및 데이터 처리 기술에 대한 숙련도 다. 통찰력 있는 분석 결과를 이해관계자에게 설득력 있게 전달하는 능력 라. 다양한 부서와 원활하게 협업하는 커뮤니케이션 능력
다음 중 소프트 스킬(Soft Skill)에 해당하는 것을 모두 고른 것은?
문제 10
다음 중 빅데이터 활용 사례로 가장 적절하지 않은 것은?
2과목: 데이터분석 기획 (11–20)
문제 11
한 물류회사가 “분석 대상은 명확히 알고 있지만 어떤 분석 방법을 적용해야 할지 모르는” 상황에 놓여 있다. 이 경우에 해당하는 분석 기획 유형은?
문제 12
하향식(Top-Down) 접근법의 문제 탐색 기법과 상향식(Bottom-Up) 접근법의 특징에 대한 설명으로 옳지 않은 것은?
문제 13
분석 과제의 우선순위 선정 기준에 대한 설명으로 옳지 않은 것은?
문제 14
분석 마스터플랜의 우선순위 로드맵 수립 방식에 대한 설명으로 가장 적절한 것은?
문제 15
분석 조직 구조 중, 별도의 전담 분석 조직 없이 각 현업 부서가 자체적으로 분석 업무를 수행하는 구조에 대한 설명으로 가장 적절한 것은?
문제 16
데이터 분석 거버넌스 체계의 구성요소로 가장 적절하지 않은 것은?
문제 17
CRISP-DM과 KDD(Knowledge Discovery in Databases) 방법론에 대한 설명이다.
가. KDD는 선택 → 전처리 → 변환 → 데이터마이닝 → 해석/평가의 5단계로 구성된다. 나. CRISP-DM은 업무 이해 단계에서 출발한다. 다. KDD와 CRISP-DM은 모두 단계 간 피드백이나 반복을 전혀 허용하지 않는 일방향 절차이다. 라. 데이터마이닝은 KDD 프로세스를 구성하는 한 단계이다.
다음 중 옳은 것을 모두 고른 것은?
문제 18
KDD(Knowledge Discovery in Databases) 프로세스를 순서대로 나열한 것은?
문제 19
한 기업이 상향식 접근으로 데이터를 탐색하다가 예상치 못한 패턴을 발견해, 이를 하향식 접근으로 구체적인 분석 과제로 정의하는 방식에 대한 설명으로 가장 적절한 것은?
문제 20
데이터 분석 수준 진단 매트릭스에서, 준비도와 성숙도가 모두 낮아 분석 활용을 위한 기초 여건부터 갖춰야 하는 기업의 유형은?
3과목: 데이터분석 (21–50)
문제 21
다음과 같은 이산확률분포가 주어져 있다.
| X | 0 | 1 | 2 | 3 |
|---|---|---|---|---|
| P(X) | 0.1 | 0.3 | 0.4 | 0.2 |
확률변수 X의 기댓값 E(X)는?
문제 22
다음 R 코드를 실행했을 때 출력되는 결과로 가장 적절한 것은?
v <- c(3, 7, 2, 9, 5)
sort(v, decreasing = TRUE)[2]문제 23
어느 시험 점수가 평균 70점, 표준편차 10점인 정규분포를 따른다고 할 때, 85점을 받은 응시자의 Z-점수(표준화 점수)는?
문제 24
50개의 데이터 중 특정 두 개(1번, 2번)를 포함해 비복원 무작위추출로 5개를 뽑으려고 한다. 1번과 2번이 모두 표본에 포함될 확률은?
문제 25
가설검정의 오류에 대한 설명이다.
가. 귀무가설이 참인데 이를 기각하는 오류는 1종 오류이다. 나. 1종 오류를 범할 확률의 최대 허용치가 유의수준(α)이다. 다. 귀무가설이 거짓인데 이를 채택하는 오류는 1종 오류이다. 라. 2종 오류를 범할 확률은 베타(β)로 표기하며, 1-β를 검정력이라 한다.
다음 중 옳은 것을 모두 고른 것은?
문제 26
비모수 검정에 대한 설명으로 옳지 않은 것은?
문제 27
표본의 크기(n)와 표준오차(Standard Error)의 관계에 대한 설명으로 옳지 않은 것은?
문제 28
공분산과 상관계수에 대한 설명으로 옳지 않은 것은?
문제 29
스피어만(Spearman) 상관분석과 피어슨(Pearson) 상관분석에 대한 설명으로 옳지 않은 것은?
문제 30
선형회귀분석의 기본 가정에 대한 설명으로 옳지 않은 것은?
문제 31
회귀식을 만들 때, 독립변수 후보를 하나도 포함하지 않은 모형에서 시작해 통계적으로 가장 유의한 변수를 하나씩 추가해 나가는 변수선택법은?
문제 32
로지스틱 회귀분석과 선형회귀분석의 적용 대상에 대한 설명으로 가장 적절한 것은?
문제 33
시계열분석에서 이동평균(Moving Average)을 활용하는 목적에 대한 설명으로 가장 적절한 것은?
문제 34
다음 중 정상 시계열의 조건에 대한 설명이다.
가. 시점에 관계없이 평균이 일정하다. 나. 시점에 관계없이 분산이 일정하다. 다. 공분산은 시차(lag)에 관계없이 항상 0이어야 한다. 라. 공분산은 시점 자체가 아니라 시차에만 의존한다.
다음 중 정상 시계열의 조건으로 옳은 것을 모두 고른 것은?
문제 35
한 이진 분류 문제에서 어떤 노드에 합격 18명, 불합격 42명이 속해 있다. 이 노드의 엔트로피(Entropy) 값은? (소수점 셋째 자리에서 반올림)
문제 36
의사결정나무에서 가지치기(Pruning)를 하지 않고 나무를 계속 성장시켰을 때 발생하기 쉬운 문제로 가장 적절한 것은?
문제 37
인공신경망의 활성화 함수에 대한 설명으로 옳지 않은 것은?
문제 38
입력층 15개 노드, 은닉층 20개 노드, 출력층 4개 노드로 구성된 단일 은닉층 다층 퍼셉트론에서, 편향(Bias)을 제외한 가중치의 총 개수는?
문제 39
군집분석(Clustering)과 분류분석(Classification)의 차이에 대한 설명으로 가장 적절한 것은?
문제 40
계층적 군집분석의 연결법(Linkage) 중, 두 군집 사이의 모든 관측치 쌍의 거리 중 최댓값을 군집 간 거리로 사용하는 방법은?
문제 41
K-means 군집분석에서 적절한 군집 수(k)를 판단하기 위해, k값에 따른 군집 내 제곱합(WSS, Within-cluster Sum of Squares)의 감소폭이 급격히 줄어드는 지점을 찾는 방법은?
문제 42
다음은 6건의 거래 기록이다.
| 거래 번호 | 구매 품목 |
|---|---|
| T1 | 사과, 바나나 |
| T2 | 사과, 바나나, 포도 |
| T3 | 바나나, 포도 |
| T4 | 사과 |
| T5 | 사과, 포도 |
| T6 | 바나나 |
연관규칙 “사과 → 바나나”의 지지도(Support)는?
문제 43
문제 42와 동일한 거래 기록을 이용할 때, 연관규칙 “사과 → 바나나”의 향상도(Lift)는?
문제 44
연관분석에 대한 설명이다.
가. If-Then 형태로 표현되어 결과를 직관적으로 이해하기 쉽다. 나. 명확한 목적변수(종속변수)를 정하지 않고도 항목 간 관계를 탐색할 수 있다. 다. 품목의 수가 늘어나도 계산에 필요한 자원은 항상 일정하게 유지된다. 라. 우연히 발생한 거래 패턴도 그럴듯한 규칙처럼 나타날 수 있다.
다음 중 연관분석의 특징으로 옳은 것을 모두 고른 것은?
문제 45
배깅(Bagging), 부스팅(Boosting), 랜덤포레스트(Random Forest)에 대한 설명이다.
가. 배깅은 부트스트랩으로 추출한 여러 표본에 대해 병렬로 모델을 학습한다. 나. 부스팅은 이전 모델이 틀린 데이터에 가중치를 높여 순차적으로 학습한다. 다. 랜덤포레스트는 배깅에 변수(특성)의 무작위 선택을 추가한 기법이다. 라. 부스팅은 각 모델이 서로 완전히 독립적으로 학습되어 항상 배깅처럼 병렬 처리가 가능하다.
다음 중 옳은 것을 모두 고른 것은?
문제 46
한 이진 분류 모델의 예측 결과를 정리한 혼동행렬(Confusion Matrix)이 다음과 같다.
| 구분 | 실제 양성 | 실제 음성 |
|---|---|---|
| 예측 양성 | 45(TP) | 20(FP) |
| 예측 음성 | 15(FN) | 80(TN) |
이 모델의 정확도(Accuracy)는? (소수점 셋째 자리에서 반올림)
문제 47
한 회귀모델의 잔차(예측값-실제값)가 다음과 같이 5개 관측치에서 나타났다: 2, -3, 1, -2, 2. 이 모델의 RMSE(Root Mean Squared Error)는? (소수점 둘째 자리에서 반올림)
문제 48
모델의 일반화 성능을 평가하기 위해 데이터를 여러 개의 부분집합(fold)으로 나누어, 매번 다른 부분집합을 검증용으로 사용하며 반복 평가하는 방법은?
문제 49
주성분분석(PCA) 결과에서, 특정 주성분에 대한 원래 변수들의 계수(loading)가 다음과 같았다.
| 변수 | PC1 loading |
|---|---|
| 매출액 | 0.72 |
| 광고비 | 0.15 |
| 방문자수 | 0.68 |
이 결과에 대한 해석으로 가장 적절한 것은?
문제 50
모형평가에서 혼동행렬 기반 지표와 회귀모델 평가지표에 대한 설명으로 옳지 않은 것은?
채점 후 복습 동선
| 틀린 문항의 주제 | 돌아갈 편 번호 |
|---|---|
| 데이터·정보·지식·지혜 위계(DIKW) | 02 |
| 데이터베이스와 DBMS 특징 | 03 |
| 빅데이터 3V와 가치 산정 | 04 |
| 데이터 사이언스·전략적 인사이트 | 05 |
| 분석 기획 방향과 4분면 | 06 |
| 분석 방법론(CRISP-DM, KDD) | 07 |
| 분석 과제 발굴(하향식·상향식) | 08 |
| 마스터플랜과 우선순위 로드맵 | 09 |
| R 기초 문법 | 10 |
| R 데이터 구조 | 11 |
| R 데이터 전처리(dplyr) | 12 |
| 기술통계 | 13 |
| 확률분포 | 14 |
| 표본추출과 추정 | 15 |
| 가설검정 | 16 |
| 상관분석 | 17 |
| 회귀분석 | 18 |
| 시계열분석 | 19 |
| 데이터마이닝 개관 | 20 |
| 의사결정나무 | 21 |
| 로지스틱 회귀·앙상블 | 22 |
| 군집분석 | 23 |
| 연관규칙분석 | 24 |
| 모형평가 | 25 |
합격 기준: 전체 50문항 중 30문항(60점) 이상 정답이면서, 데이터 이해 10문항 중 4문항 이상, 데이터분석 기획 10문항 중 4문항 이상, 데이터분석 30문항 중 12문항 이상을 맞혀야 과락 없이 합격입니다. 어느 한 과목이라도 정답률이 40퍼센트 미만이면 총점과 무관하게 불합격 처리됩니다.