Skip to Content
자격증빅데이터분석기사 필기28. 빅데이터분석기사 필기 예상 모의고사 3회

이 모의고사는 실제 기출문제가 아니라 출제 경향을 분석해 새로 구성한 예상 문제입니다. 숫자·상황·소재를 바꾸어 재구성했으며, 특정 회차 기출을 그대로 복제하지 않았습니다. 권장 풀이 시간은 120분이며, 합격 기준은 일반적으로 전 과목 평균 60점 이상 및 과목별 40퍼센트(20문항 중 8문항) 이상 정답으로 알려져 있습니다. 다만 배점·합격선 등 세부 수치는 시행처 공고 원문을 반드시 다시 확인하시기 바랍니다.

문항 배분표

이번 3회차는 3과목 빅데이터 모델링(머신러닝·딥러닝) 문항의 난이도와 개념 깊이를 다른 회차보다 끌어올렸습니다. 문항 수 배분 자체는 실제 시험과 동일하게 과목당 20문항을 유지합니다.

과목문항 번호문항 수이번 회차 특징
1과목 빅데이터 분석 기획1–2020표준 난이도, 개념 정의·절차 위주
2과목 빅데이터 탐색21–4020표준 난이도, 전처리·기술통계 계산 포함
3과목 빅데이터 모델링41–6020심화 — 지니지수·정보이득·거리계산·K-means 반복·PCA·CNN 출력 크기까지 손 계산
4과목 빅데이터 결과 해석61–8020표준 난이도, 평가지표·교차검증 계산 포함

1과목 빅데이터 분석 기획 (1–20)

문제 14지선다
한 온라인 서점이 하루에도 수십만 건씩 쏟아지는 주문·리뷰·클릭 로그를 실시간에 가깝게 처리해야 하는 상황을 두고 회의를 하고 있다. 이때 특히 부각되는 빅데이터의 특성은 무엇인가?
문제 24지선다
데이터 거버넌스(data governance)를 이루는 세 축인 원칙, 조직, 프로세스에 대한 설명으로 옳지 않은 것은?
문제 34지선다
한 병원이 분석 준비도와 분석 성숙도 두 축으로 자기 위치를 진단했더니, 준비도는 높지만 성숙도는 낮게 나왔다. 이 병원이 속하는 유형은 무엇인가?
문제 44지선다
CRISP-DM 표준 분석 방법론의 단계를 올바른 순서로 나열한 것은?
문제 54지선다
분석 과제를 발굴하는 하향식 접근법과 상향식 접근법에 대한 설명으로 옳지 않은 것은?
문제 64지선다
개인정보 보호법, 정보통신망법, 신용정보법을 함께 묶어 부르는 명칭과 그 취지에 대한 설명으로 가장 적절한 것은?
문제 74지선다
비식별화 기법과 적용 사례를 짝지은 것으로 옳지 않은 것은?
문제 84지선다
HDFS 같은 분산 파일 시스템의 특징으로 가장 적절한 것은?
문제 94지선다
NoSQL 데이터베이스 유형과 특징을 짝지은 것으로 옳지 않은 것은?
문제 104지선다
ETL과 데이터 웨어하우스, 데이터 마트, 데이터 레이크에 대한 설명으로 옳지 않은 것은?
문제 114지선다
다음 중 비정형 데이터로 보기 어려운 것은?
문제 124지선다
분석 마스터플랜과 로드맵에 대한 설명으로 가장 적절한 것은?
문제 134지선다
데이터 품질을 진단할 때 살펴보는 차원 중, 상품 등록 항목의 필수값이 빠짐없이 채워졌는지를 따지는 차원은 무엇인가?
문제 144지선다
데이터 분석가에게 요구되는 하드 스킬과 소프트 스킬을 짝지은 것으로 가장 적절한 것은?
문제 154지선다
빅데이터 활용 확대에 따른 위기 요인과 통제 방안을 짝지은 것으로 옳지 않은 것은?
문제 164지선다
수집 기술과 그 용도를 짝지은 것으로 옳지 않은 것은?
문제 174지선다
분석 과제의 우선순위를 정할 때 흔히 쓰는 기준으로 보기 어려운 것은?
문제 184지선다
마이데이터(MyData) 제도에 대한 설명으로 가장 적절한 것은?
문제 194지선다
표준적인 빅데이터 분석 업무 흐름을 순서대로 바르게 나열한 것은?
문제 204지선다
분석 조직을 별도의 전담 조직으로 구성하는 방식에 대한 설명으로 옳지 않은 것은?

2과목 빅데이터 탐색 (21–40)

문제 214지선다
물류센터 입출고 기록 전처리를 정제, 통합, 축소, 변환 네 단계로 나눌 때 각 단계에 대한 설명으로 옳지 않은 것은?
문제 224지선다
결측치 발생 유형에 대한 설명으로 옳지 않은 것은?
문제 234지선다
결측치 처리 기법에 대한 설명으로 옳지 않은 것은?

부품 10개의 무게(그램)를 측정한 값은 다음과 같다.

순서12345678910
무게(g)12141515161718192045
문제 244지선다
위 표의 자료에 상자수염그림 기준(상한 = 제3사분위수 + 1.5 곱하기 사분위 범위)을 적용할 때 상한 경계값은?
문제 254지선다
위 24번 문항의 부품 10개 무게 자료(12, 14, 15, 15, 16, 17, 18, 19, 20, 45)에서, 상자수염그림 기준으로 이상치에 해당하는 값과 그 값이 자료에 들어오게 된 원인 추정으로 가장 타당한 조합은?
문제 264지선다
이상치를 제거하거나 대치하는 처리에 대한 설명으로 옳은 것은?
문제 274지선다
어느 압력 센서에서 측정한 값 8, 12, 20, 40에 최소-최대 정규화를 적용할 때, 변환된 네 값의 합은? 최소-최대 정규화는 (관측값 - 최솟값)을 (최댓값 - 최솟값)으로 나눈 값이다.
문제 284지선다
정상 작동 중인 설비의 진동 값은 평균 60, 표준편차 4를 따른다. 이번에 측정된 값이 52일 때 표준화 점수(z-score)는?
문제 294지선다
원-핫 인코딩에 대한 설명으로 옳지 않은 것은?
문제 304지선다
다음 중 새로운 정보를 만들어 낸 파생변수의 예로 보기 어려운 것은?

두 변수 X, Y의 공분산행렬은 다음과 같다.

XY
X168
Y825
문제 314지선다
위 공분산행렬에 대한 해석으로 옳지 않은 것은?
문제 324지선다
광고비와 매출 사이의 관계에서 매장 크기의 영향을 통제한 뒤 남는 선형 연관을 나타내는 지표는 무엇인가?
문제 334지선다
가구 다섯 곳의 월 소비지출(만원)이 3, 6, 7, 8, 11일 때 표본평균과 표본분산으로 옳은 것은?
문제 344지선다
분포의 왜도와 첨도에 대한 설명으로 옳지 않은 것은?
문제 354지선다
한 부품이 정상일 확률이 0.5인 독립적인 검사를 4회 실시할 때, 정상 판정이 정확히 2회 나올 확률은? (이 시행 결과는 이항분포를 따른다)
문제 364지선다
표본평균의 표집분포와 중심극한정리에 대한 설명으로 옳지 않은 것은?
문제 374지선다
가설검정 절차에 대한 설명으로 옳지 않은 것은?
문제 384지선다
사기 거래 탐지 모형을 만들 때 클래스 불균형에 대응하는 방법으로 옳지 않은 것은?
문제 394지선다
두 서열척도 변수인 서비스 만족 순위와 재구매 의향 순위 사이의 단조 관계를 측정하기에 가장 적절한 상관계수는?
문제 404지선다
탐색적 데이터 분석(EDA)의 성격에 대한 설명으로 옳지 않은 것은?

3과목 빅데이터 모델링 (41–60) — 심화

문제 414지선다
지도학습, 비지도학습, 강화학습을 구분한 설명으로 옳지 않은 것은?
문제 424지선다
다음 중 회귀 문제가 아니라 분류 문제에 해당하는 것은?
문제 434지선다
자료를 학습용, 검증용, 평가용으로 나누는 목적에 대한 설명으로 옳지 않은 것은?
문제 444지선다
다중회귀모형에서 설명변수 X1을 나머지 설명변수들로 회귀했을 때의 결정계수가 0.8로 나왔다. X1의 분산팽창지수(VIF)는? VIF는 1을 (1에서 그 결정계수를 뺀 값)으로 나눈 값이다.
문제 454지선다
어느 쇼핑몰이 쿠폰을 지급한 고객 120명 중 84명이 재구매했고 36명은 재구매하지 않았다. 쿠폰을 지급하지 않은 고객 180명 중에서는 45명이 재구매했고 135명은 재구매하지 않았다. 쿠폰을 받은 집단의 재구매 오즈비(오즈의 비)는?
문제 464지선다
한 마디에 대출 신청 10건이 모여 있고, 그중 6건은 정상, 4건은 부실로 분류된다. 이 마디의 지니지수는? 지니지수는 1에서 각 범주 비율의 제곱을 모두 더한 값을 뺀 것이다.
문제 474지선다
부모 마디에는 정상 8건, 부실 8건 총 16건이 있다. 이를 왼쪽 자식(정상 6건, 부실 2건)과 오른쪽 자식(정상 2건, 부실 6건)으로 나누는 분할을 검토한다. 이 분할의 정보이득(엔트로피 기준)에 가장 가까운 값은? 3 대 1 비율의 엔트로피는 약 0.811이다.
문제 484지선다
랜덤 포레스트에 대한 설명으로 옳지 않은 것은?
문제 494지선다
부스팅 계열 앙상블 학습에 대한 설명으로 옳지 않은 것은?
문제 504지선다
KNN(K-최근접이웃) 알고리즘에서 K값을 매우 작게 잡을 때와 매우 크게 잡을 때의 영향에 대한 설명으로 가장 적절한 것은?
문제 514지선다
두 지점 A(2, 3)와 B(6, 7)가 있다. 두 지점의 유클리드 거리와 맨해튼 거리로 옳은 것은?
문제 524지선다
서포트벡터머신(SVM)에 대한 설명으로 옳지 않은 것은?
문제 534지선다
K-means 군집화의 절차와 군집 수 결정에 대한 설명으로 옳지 않은 것은?
문제 544지선다
2차원 평면에 네 점 (2,2), (2,4), (6,6), (8,6)이 있다. 초기 중심점을 C1=(2,2), C2=(8,6)으로 두고 각 점을 유클리드 거리 기준으로 더 가까운 중심점에 배정한 뒤, 각 군집의 평균으로 중심점을 한 번 갱신하면 새로운 두 중심점은?
문제 554지선다
DBSCAN 군집화 알고리즘에 대한 설명으로 옳지 않은 것은?
문제 564지선다
계층적 군집 분석의 연결법(linkage) 중, 두 군집에서 가장 멀리 떨어진 두 점 사이의 거리를 군집 간 거리로 삼는 방법은 무엇인가?
문제 574지선다
설비 센서 자료를 주성분분석으로 요약했더니 상위 네 개 고유값이 12, 6, 1.5, 0.5로 나왔다. 제1주성분과 제2주성분만 사용할 때의 누적 기여율은? 기여율은 각 고유값을 전체 고유값의 합으로 나눈 값이다.
문제 584지선다
인공신경망의 활성화 함수에 대한 설명으로 옳지 않은 것은?
문제 594지선다
학습 자료에서는 오차가 매우 작지만 검증 자료에서는 오차가 큰 신경망을 개선하기 위한 조치로 적절하지 않은 것은?
문제 604지선다
입력 이미지의 크기가 32×32이고, 5×5 크기의 필터를 스트라이드 1, 패딩 0으로 적용하는 합성곱 층을 통과시켰다. 출력 특징맵의 한 변의 크기는? 출력 크기는 (입력 크기에서 필터 크기를 뺀 값을 스트라이드로 나눈 뒤 1을 더한) 값이다.

4과목 빅데이터 결과 해석 (61–80)

문제 614지선다
혼동행렬의 네 칸에 대한 설명으로 옳지 않은 것은?

불량품 검출 모형을 제품 200개에 적용해 다음과 같은 혼동행렬을 얻었다.

구분실제 불량실제 정상
예측 불량TP = 48FP = 20
예측 정상FN = 12TN = 120
문제 624지선다
위 혼동행렬에서 이 모형의 재현율은?
문제 634지선다
62번 문항의 혼동행렬(TP=48, FN=12, FP=20, TN=120)에서 정밀도와 F1 점수로 옳은 것은?
문제 644지선다
정확도의 역설(accuracy paradox)에 대한 설명으로 가장 적절한 것은?
문제 654지선다
분류 모형의 판정 임계값을 0.5에서 0.8로 높였을 때 일반적으로 나타나는 변화로 가장 적절한 것은?
문제 664지선다
네 건의 실제값과 예측값 쌍이 (10,12), (15,13), (20,23), (25,22)로 주어졌다. 이 예측의 평균절대오차(MAE)는? MAE는 각 오차의 절댓값을 모두 더한 뒤 건수로 나눈 값이다.
문제 674지선다
66번 문항의 자료로 회귀모형을 평가할 때, 오차 제곱합(SSE)이 26이고 총제곱합(SST)이 130이라면 결정계수는? 결정계수는 1에서 SSE를 SST로 나눈 값을 뺀 것이다.
문제 684지선다
군집 결과를 평가하는 실루엣 계수에 대한 설명으로 옳지 않은 것은?
문제 694지선다
군집 내 제곱합(SSE)과 엘보우 기법에 대한 설명으로 가장 적절한 것은?
문제 704지선다
편향-분산 트레이드오프에 대한 설명으로 옳지 않은 것은?
문제 714지선다
관측치 500개를 5겹 교차검증으로 평가하려 한다. 각 회차에서 학습에 사용되는 표본 수는?
문제 724지선다
이탈 예측 자료에서 이탈 고객 비율이 낮을 때, 각 폴드의 이탈 비율을 전체 비율과 비슷하게 유지하며 나누는 교차검증 방식은 무엇인가?
문제 734지선다
초매개변수와 매개변수를 구분한 설명으로 옳지 않은 것은?
문제 744지선다
초매개변수 탐색 기법에 대한 설명으로 옳지 않은 것은?
문제 754지선다
회귀모형의 결과를 해석할 때 변수 중요도나 SHAP 같은 도구를 사용하는 목적으로 가장 적절한 것은?
문제 764지선다
시각화 기법과 표현 방식을 짝지은 것으로 옳지 않은 것은?
문제 774지선다
한 공공기관이 개관 이후 20년간의 사건을 연도 순서대로 배열해 한 장으로 보여 주려 한다. 이에 가장 적합한 인포그래픽 유형은?
문제 784지선다
새로운 추천 알고리즘의 효과를 검증하기 위해 방문자를 무작위로 두 집단으로 나누어 기존 화면과 새 화면을 각각 보여 주고 전환율을 비교하는 실험 방법은 무엇인가?
문제 794지선다
분석 모형의 데이터·알고리즘 편향에 대한 대응으로 옳지 않은 것은?
문제 804지선다
분석 결과의 비즈니스 기여도를 평가할 때 고려하는 항목에 대한 설명으로 옳지 않은 것은?

복습 동선표

채점 후 틀린 영역을 아래 표에서 찾아 해당 편으로 돌아가 다시 읽으세요.

과목자주 틀리는 영역복습할 편
1과목3V·5V, 데이터 거버넌스, 분석 준비도·성숙도08편, 07편
1과목데이터 수집 기술, 저장 구조(HDFS·NoSQL·데이터레이크)09편, 03편
2과목결측치·이상치 처리, 파생변수·인코딩11편, 12편
2과목기술통계·확률분포·가설검정14편, 15편, 02편
3과목지니지수·정보이득, 트리 계열 알고리즘17편, 18편
3과목거리·유사도, K-means·DBSCAN·PCA19편, 05편
3과목신경망 기초, 과대적합 대응18편, 21편
4과목혼동행렬·정밀도·재현율·F1·ROC-AUC20편
4과목회귀·군집 평가, 교차검증, 과적합21편
4과목모형 해석, 시각화, 활용·윤리22편, 23편, 24편

참고 자료

Last updated on