이 모의고사는 실제 기출문제가 아니라 출제 경향을 분석해 새로 구성한 예상 문제입니다. 숫자·상황·소재를 바꾸어 재구성했으며, 특정 회차 기출을 그대로 복제하지 않았습니다. 권장 풀이 시간은 120분이며, 합격 기준은 일반적으로 전 과목 평균 60점 이상 및 과목별 40퍼센트(20문항 중 8문항) 이상 정답으로 알려져 있습니다. 다만 배점·합격선 등 세부 수치는 시행처 공고 원문을 반드시 다시 확인하시기 바랍니다.
문항 배분표
이번 4회차는 2과목 빅데이터 탐색(전처리·통계) 문항의 계산 난이도를 다른 회차보다 끌어올렸습니다. 문항 수 배분은 실제 시험과 동일하게 과목당 20문항을 유지합니다.
| 과목 | 문항 번호 | 문항 수 | 이번 회차 특징 |
|---|---|---|---|
| 1과목 빅데이터 분석 기획 | 1–20 | 20 | 표준 난이도, 개념 정의·절차 위주 |
| 2과목 빅데이터 탐색 | 21–40 | 20 | 심화 — 표준화·상관계수·공분산·확률분포·표본크기·가설검정 통계량까지 손 계산 |
| 3과목 빅데이터 모델링 | 41–60 | 20 | 표준 난이도, 거리·연관규칙 계산 포함 |
| 4과목 빅데이터 결과 해석 | 61–80 | 20 | 표준 난이도, 평가지표·교차검증 계산 포함 |
1과목 빅데이터 분석 기획 (1–20)
문제 14지선다
한 커피 프랜차이즈가 축적한 주문 데이터를 분석해 신메뉴 출시로 이어지는 인사이트를 뽑아내고 이를 통해 매출을 늘렸다. 이 사례가 가장 강조하는 빅데이터의 특성은 무엇인가?
문제 24지선다
데이터 사이언스의 성격에 대한 설명으로 가장 적절한 것은?
문제 34지선다
분석 업무를 담당하는 조직 구조 유형에 대한 설명으로 옳지 않은 것은?
문제 44지선다
한 제조사가 데이터 자체를 먼저 탐색해 예상하지 못했던 설비 이상 패턴을 발견하고 이를 과제화했다. 이 접근법에 대한 설명으로 가장 적절한 것은?
문제 54지선다
DIKW 피라미드에서 정보(information)를 분석하고 경험·맥락과 결합해 이해에 이른 상태를 가리키는 단계는 무엇인가?
문제 64지선다
개인정보 보호법상 가명정보에 대한 설명으로 옳지 않은 것은?
문제 74지선다
데이터 웨어하우스의 전통적 특성으로 옳지 않은 것은?
문제 84지선다
OLAP와 OLTP에 대한 설명으로 옳지 않은 것은?
문제 94지선다
비식별화 기법과 사례를 짝지은 것으로 옳지 않은 것은?
문제 104지선다
다음 중 반정형 데이터로 보기 가장 적절한 것은?
문제 114지선다
변수와 측정척도의 연결로 옳지 않은 것은?
문제 124지선다
분석 방법은 이미 알려져 있으나 조직이 해결해야 할 목표 자체를 아직 인지하지 못한 과제 유형은 무엇인가?
문제 134지선다
데이터 프로파일링(data profiling)에 대한 설명으로 가장 적절한 것은?
문제 144지선다
키-값(Key-Value) 데이터베이스의 일반적인 특징으로 보기 어려운 것은?
문제 154지선다
레코드마다 필드 구성이 달라질 수 있는 JSON 형태 자료를 저장하기에 가장 적합한 NoSQL 유형은?
문제 164지선다
데이터 3법 개정의 취지에 대한 설명으로 가장 적절한 것은?
문제 174지선다
분석 기획 단계에서 수행하는 활동으로 옳지 않은 것은?
문제 184지선다
빅데이터의 5V 중 Veracity(정확성)에 대한 설명으로 가장 적절한 것은?
문제 194지선다
분석 마스터플랜에서 과제의 적용 범위와 도입 우선순위를 정할 때 직접적인 기준으로 보기 어려운 것은?
문제 204지선다
데이터 산업의 발전 과정을 처리, 통합, 분석, 연결 및 활용 순으로 설명할 때, 이 흐름에 대한 해석으로 가장 적절한 것은?
2과목 빅데이터 탐색 (21–40) — 심화
문제 214지선다
설문 응답 자료에서 소득이 높은 응답자일수록 소득 항목에 응답하지 않는 경향이 뚜렷하게 나타났다. 이 결측이 소득 값 자체와 관련되어 있다고 볼 때, 이 결측 유형은 무엇인가?
문제 224지선다
다중 대치법(multiple imputation)에 대한 설명으로 옳지 않은 것은?
문제 234지선다
정상 작동 중인 설비의 압력 측정값은 평균 100, 표준편차 15를 따른다. 표준화 점수의 절댓값이 2 이상이면 이상치로 판정할 때, 측정값 65에 대한 표준화 점수와 판정으로 옳은 것은?
한 고객센터의 응답시간(초) 10건을 측정한 값은 다음과 같다.
| 순서 | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 10 |
|---|---|---|---|---|---|---|---|---|---|---|
| 응답시간(초) | 5 | 6 | 6 | 7 | 8 | 9 | 10 | 11 | 12 | 30 |
문제 244지선다
위 표의 자료에 상자수염그림 기준(상한 = 제3사분위수 + 1.5 곱하기 사분위 범위)을 적용할 때 상한 경계값은?
문제 254지선다
위 24번 문항의 응답시간 자료(5, 6, 6, 7, 8, 9, 10, 11, 12, 30)에서 이상치에 해당하는 값과 그 판정 근거로 가장 타당한 것은?
문제 264지선다
오른쪽으로 심하게 치우친 양수 변수를 정규분포에 가까운 형태로 바꾸는 변환으로 가장 적절한 것은?
문제 274지선다
어느 온라인 강의의 시청 완료율은 평균 45퍼센트, 표준편차 6퍼센트포인트인 정규분포를 따른다고 가정한다. 한 강좌의 완료율이 57퍼센트일 때 표준화 점수는?
문제 284지선다
어느 설비의 진동 측정치 3, 9, 15, 27에 최소-최대 정규화를 적용할 때, 변환된 네 값의 합은? 최소-최대 정규화는 (관측값 - 최솟값)을 (최댓값 - 최솟값)으로 나눈 값이다.
문제 294지선다
월 구독 해지를 예측하는 회귀모형에 범주형 설명변수 3개(각각 범주 수 3개, 4개, 2개)와 연속형 설명변수 3개를 넣으려 한다. 범주형 변수는 모두 기준 범주 하나를 뺀 나머지를 지시변수로 바꾼다. 절편을 포함할 때 이 모형이 추정하는 모수는 모두 몇 개인가?
문제 304지선다
다음 중 파생변수의 예로 보기 어려운 것은?
다섯 매장의 광고 노출 지수(X)와 매출 지수(Y)를 조사한 값은 다음과 같다.
| 매장 | 1 | 2 | 3 | 4 | 5 |
|---|---|---|---|---|---|
| 광고 노출 지수(X) | 1 | 2 | 3 | 4 | 5 |
| 매출 지수(Y) | 2 | 3 | 5 | 4 | 6 |
문제 314지선다
위 표의 자료로 피어슨 상관계수를 계산할 때 가장 가까운 값은?
다섯 매장의 서비스 만족 순위(X)와 불만 접수 순위(Y)는 다음과 같다.
| 매장 | 1 | 2 | 3 | 4 | 5 |
|---|---|---|---|---|---|
| 만족 순위(X) | 1 | 2 | 3 | 4 | 5 |
| 불만 순위(Y) | 2 | 1 | 4 | 3 | 5 |
문제 324지선다
위 표의 순위 자료로 스피어만 순위상관계수를 구할 때 가장 가까운 값은? 스피어만 상관계수는 1에서 (6 곱하기 순위 차이 제곱의 합)을 (n 곱하기 n제곱 빼기 1)로 나눈 값을 뺀 것이다.
다섯 매장의 방문객 지수(X)와 판매 지수(Y)를 조사한 값은 다음과 같다.
| 매장 | 1 | 2 | 3 | 4 | 5 |
|---|---|---|---|---|---|
| 방문객 지수(X) | 2 | 4 | 6 | 8 | 10 |
| 판매 지수(Y) | 3 | 5 | 7 | 9 | 11 |
문제 334지선다
위 표의 자료로 X와 Y의 표본공분산을 구하면 얼마인가?
문제 344지선다
고객 대기시간 자료에서 평균이 중앙값보다 크게 나타났다. 이 분포에 대한 해석으로 가장 적절한 것은?
문제 354지선다
어느 콜센터에 시간당 평균 3건의 민원이 포아송분포를 따라 접수된다. 특정 시간에 민원이 정확히 2건 접수될 확률에 가장 가까운 값은? (e의 -3제곱은 약 0.0498이다)
문제 364지선다
어느 공장에는 A기계와 B기계가 있다. A기계는 전체 생산량의 60퍼센트를 차지하며 불량률은 2퍼센트이고, B기계는 40퍼센트를 차지하며 불량률은 5퍼센트다. 무작위로 뽑은 제품이 불량품이었을 때, 그 제품이 B기계에서 생산되었을 확률은?
문제 374지선다
모표준편차가 20인 모집단에서 표본평균의 오차 한계를 4 이내로 원한다. 신뢰수준에 해당하는 z값을 근사값 2로 사용할 때 필요한 표본크기는? 표본크기는 (z 곱하기 모표준편차를 오차 한계로 나눈 값)의 제곱이다.
문제 384지선다
어느 공정의 평균 산출량이 50이라고 알려져 있다. 표본 36개를 뽑아 표본평균 52, 표본표준편차 6을 얻었다. 귀무가설을 모평균이 50이라고 할 때 검정통계량 t값은? t값은 (표본평균에서 귀무가설의 평균을 뺀 값)을 (표본표준편차를 표본크기의 제곱근으로 나눈 값)으로 나눈 것이다.
문제 394지선다
가설검정에서 유의확률(p값)에 대한 설명으로 옳지 않은 것은?
문제 404지선다
신용카드 거래 자료에서 사기 거래 비율이 매우 낮은 클래스 불균형 상황에 대응하는 방법으로 옳지 않은 것은?
3과목 빅데이터 모델링 (41–60)
문제 414지선다
지도학습과 비지도학습의 구분에 대한 설명으로 옳지 않은 것은?
문제 424지선다
다음 중 회귀 문제로 보기 어려운 것은?
문제 434지선다
피처 엔지니어링(특징 공학)에 대한 설명으로 옳지 않은 것은?
문제 444지선다
구독 서비스 해지 확률을 예측하는 로지스틱 회귀에서 다음 결과를 얻었다. 로그(해지확률 나누기 1에서 해지확률을 뺀 값)는 -0.5 더하기 0.6 곱하기 월 방문 횟수다. 다른 변수가 일정할 때 월 방문 횟수가 1회 늘면 해지의 오즈는 어떻게 변하는가? (e의 0.6제곱은 약 1.82다)
문제 454지선다
의사결정나무 알고리즘과 분리 기준의 연결로 옳지 않은 것은?
문제 464지선다
랜덤 포레스트가 단일 의사결정나무보다 일반적으로 과대적합에 강한 이유로 가장 적절한 것은?
문제 474지선다
AdaBoost 같은 부스팅 알고리즘의 학습 과정에 대한 설명으로 옳지 않은 것은?
문제 484지선다
커널 기법(kernel trick)에 대한 설명으로 가장 적절한 것은?
문제 494지선다
KNN(K-최근접이웃) 알고리즘에 대한 설명으로 옳지 않은 것은?
문제 504지선다
두 상품의 특징 벡터가 A=(1, 2, 3), B=(2, 3, 1)로 주어졌다. 두 벡터의 코사인 유사도에 가장 가까운 값은? 코사인 유사도는 두 벡터의 내적을 두 벡터 크기의 곱으로 나눈 값이다.
문제 514지선다
K-means 군집화에서 적절한 군집 수 K를 정하기 위해 사용하는 엘보우 기법에 대한 설명으로 가장 적절한 것은?
문제 524지선다
DBSCAN 알고리즘에서 특정 점 주변 반경(eps) 안에 최소 이웃 수(minPts) 이상의 점이 있을 때 그 점을 부르는 명칭은 무엇인가?
문제 534지선다
계층적 군집 분석의 연결법 중, 두 군집을 합쳤을 때 군집 내 분산의 증가량이 가장 작아지는 방향으로 합치는 방법은 무엇인가?
문제 544지선다
주성분분석(PCA)에 대한 설명으로 옳지 않은 것은?
문제 554지선다
한 편의점의 거래 100건 가운데 빵과 우유를 함께 구매한 거래는 30건, 빵을 구매한 거래는 50건, 우유를 구매한 거래는 40건이다. 빵을 산 사람이 우유도 사는 연관규칙(빵 다음 우유)의 향상도(lift)는? 향상도는 신뢰도를 우유의 지지도로 나눈 값이며, 신뢰도는 두 상품을 함께 산 거래 비율을 빵의 지지도로 나눈 값이다.
문제 564지선다
인공신경망의 기본 구성 요소에 대한 설명으로 옳지 않은 것은?
문제 574지선다
한 인공뉴런의 입력은 x1=2, x2=3이고 가중치는 w1=1, w2=-1이며 편향은 1이다. 활성화 함수로 ReLU를 사용할 때 이 뉴런의 출력값은? ReLU는 입력이 0보다 크면 그대로, 0 이하이면 0을 출력한다.
문제 584지선다
L1 규제와 L2 규제에 대한 설명으로 옳지 않은 것은?
문제 594지선다
RNN, LSTM, GRU에 대한 설명으로 옳지 않은 것은?
문제 604지선다
앙상블 학습 방법인 배깅, 부스팅, 스태킹에 대한 설명으로 옳지 않은 것은?
4과목 빅데이터 결과 해석 (61–80)
한 이메일 서비스가 스팸 필터 모형을 이메일 300건에 적용해 다음과 같은 혼동행렬을 얻었다.
| 구분 | 실제 스팸(60건) | 실제 정상(240건) |
|---|---|---|
| 예측 스팸 | TP = 54 | FP = 24 |
| 예측 정상 | FN = 6 | TN = 216 |
문제 614지선다
위 혼동행렬에서 이 모형의 정확도는?
문제 624지선다
위 스팸 필터 혼동행렬(TP=54, FN=6, FP=24, TN=216)에서 정밀도와 재현율로 옳은 것은?
문제 634지선다
어느 분류 모형의 정밀도는 0.75, 재현율은 0.60이며, 참고용으로 정확도 0.85와 특이도 0.92도 함께 주어졌다. 이 모형의 F1 점수에 가장 가까운 값은?
문제 644지선다
ROC 곡선과 AUC에 대한 설명으로 옳지 않은 것은?
문제 654지선다
정확도의 역설(accuracy paradox)이 특히 문제가 되는 상황으로 가장 적절한 것은?
문제 664지선다
다섯 건의 실제값과 예측값 쌍이 (5,7), (10,8), (15,17), (20,18), (25,29)로 주어졌다. 이 예측의 평균제곱근오차(RMSE)에 가장 가까운 값은?
문제 674지선다
결정계수(R제곱)에 대한 설명으로 옳지 않은 것은?
문제 684지선다
군집 평가에 쓰이는 실루엣 계수의 값 범위와 해석에 대한 설명으로 옳지 않은 것은?
문제 694지선다
LOOCV(리브-원-아웃 교차검증)에 대한 설명으로 가장 적절한 것은?
문제 704지선다
초매개변수 탐색 기법 중 무작위 탐색(random search)에 대한 설명으로 가장 적절한 것은?
문제 714지선다
초매개변수와 매개변수를 구분한 설명으로 옳지 않은 것은?
문제 724지선다
부분의존도(partial dependence)를 활용한 모형 해석에 대한 설명으로 가장 적절한 것은?
문제 734지선다
시각화 기법과 용도를 짝지은 것으로 옳지 않은 것은?
문제 744지선다
두 제품의 특징을 좌우로 나누어 항목마다 맞세워 대비를 강조하는 인포그래픽 유형은?
문제 754지선다
한 뉴스 앱이 새로운 추천 알고리즘의 효과를 검증하기 위해 이용자를 무작위로 두 집단으로 나누어 기존 화면과 새 화면을 각각 보여 주고 클릭률을 비교했다. 이 실험 설계에 대한 설명으로 옳지 않은 것은?
문제 764지선다
분석 자료에서 발생할 수 있는 편향 유형에 대한 설명으로 옳지 않은 것은?
문제 774지선다
비식별화된 자료라도 다른 정보와 결합하면 재식별될 위험이 남을 수 있다는 점에 대한 대응으로 가장 적절한 것은?
문제 784지선다
분석 결과의 비즈니스 활용과 투자 대비 효과(ROI)에 대한 설명으로 옳지 않은 것은?
문제 794지선다
관측치 1,000개를 k=10인 교차검증으로 평가하려 한다. 각 회차에서 검증에 사용되는 표본 수는?
문제 804지선다
다중 분류 문제에서 매크로 평균과 마이크로 평균의 차이에 대한 설명으로 가장 적절한 것은?
복습 동선표
채점 후 틀린 영역을 아래 표에서 찾아 해당 편으로 돌아가 다시 읽으세요.
| 과목 | 자주 틀리는 영역 | 복습할 편 |
|---|---|---|
| 1과목 | 데이터 3법·가명정보, 데이터 웨어하우스·OLAP | 08편, 09편 |
| 1과목 | 척도 구분, NoSQL 유형, 분석 과제 유형 | 03편, 05편 |
| 2과목 | 결측치 유형·이상치 탐지(IQR·z-score) | 11편 |
| 2과목 | 상관계수·공분산, 확률분포(포아송·조건부확률) | 14편, 16편, 02편 |
| 2과목 | 표본크기·가설검정 통계량 | 15편 |
| 3과목 | 로지스틱 회귀·의사결정나무·앙상블 | 17편, 18편 |
| 3과목 | 거리·유사도, 군집·연관규칙·PCA | 19편, 05편 |
| 3과목 | 신경망·규제·RNN 계열 | 18편, 21편 |
| 4과목 | 혼동행렬·ROC-AUC, 회귀·군집 평가 | 20편, 21편 |
| 4과목 | 교차검증·초매개변수, 해석·시각화·윤리 | 21편, 22편, 23편, 24편 |
참고 자료
Last updated on