Skip to Content
자격증빅데이터분석기사 필기27. 빅데이터분석기사 필기 예상 모의고사 2회

이번 회차는 기출 그대로가 아니라 재구성 출제입니다. 01~27편에서 다룬 개념과 최근 회차 기출·모의고사 자료의 출제 유형·빈도·오답 구성 방식을 분석해 숫자와 상황을 새로 만든 문제이며, 28편(1회)과 문항이 겹치지 않습니다. 이번 회차는 정확도·정밀도·재현율·F1, 엔트로피·지니지수·정보이득, 지지도·신뢰도·향상도, 가설검정 통계량, 표본크기 같은 계산형 문항 비중을 표준 난이도보다 높였습니다. 권장 풀이 시간은 120분이며, 합격 기준은 과목별 100점 만점에 40점 미만이면 과락(20문항 중 8문항 미만 정답)이고 4과목 평균 60점 이상(80문항 중 48문항 이상 정답)입니다. 실제 응시 회차의 세부 출제기준·배점·합격선은 한국데이터산업진흥원 공고를 반드시 확인하십시오.

문항 배분표

과목문항 범위문항 수이번 회차의 강조점
1과목 빅데이터 분석 기획1–2020품질 지표 계산 1문항 포함, 개념 위주
2과목 빅데이터 탐색21–4020표준화·표본크기·가설검정 통계량·비율 차이 계산 강화
3과목 빅데이터 모델링41–6020지니지수·엔트로피·정보이득·연관규칙·거리·PCA 계산 강화
4과목 빅데이터 결과 해석61–8020혼동행렬 전 지표·F1·제2종오류·표본크기 계산 강화
합계80

1과목: 빅데이터 분석 기획 (1~20)

문제 14지선다
한 보험사가 사고 발생 예측 모형을 도입해 손해율을 5퍼센트포인트 낮추고 그만큼 보험료 산정의 정확도를 높였다. 이 성과가 직접 대응하는 빅데이터 특성 확장 요소는 무엇인가
문제 24지선다
다음 중 빅데이터 활용 확대에 따른 위기 요인으로 보기 어려운 것은 무엇인가
문제 34지선다
한 통신사가 분석 준비도와 분석 성숙도 두 축으로 자사 수준을 진단했다. 두 축의 조합과 유형 명칭을 짝지은 설명 중 옳지 않은 것은 무엇인가
문제 44지선다
분석 업무를 담당하는 조직 구조 유형에 대한 설명으로 옳지 않은 것은 무엇인가
문제 54지선다
데이터 과학자에게 요구되는 역량 중 하드 스킬에 해당하는 것은 무엇인가
문제 64지선다
CRISP-DM 방법론의 단계 순서를 나열한 것 중 옳지 않은 것은 무엇인가
문제 74지선다
한 보험사가 손해율을 3퍼센트포인트 낮춘다는 사업 목표를 먼저 세운 뒤, 이를 달성하는 데 필요한 계약자 정보와 사고 이력을 역으로 목록화했다. 이 과제 발굴 방식은 무엇인가
문제 84지선다
한 스타트업이 새로 확보한 위치 자료를 어디에 쓸지, 어떤 분석 기법을 적용할지 모두 정하지 못한 채 우선 자료 구조부터 살펴보고 있다. 이 상태에 해당하는 분석 과제 유형은 무엇인가
문제 94지선다
다음 중 개인정보 처리 원칙에 비추어 가장 부적절한 조치는 무엇인가
문제 104지선다
한 의료기관이 진단 코드를 임의 코드로 바꾼 연구용 자료를 만들면서, 원래 코드와의 대응표를 연구 종료와 함께 완전히 폐기했다. 이 자료의 성격으로 옳은 것은 무엇인가
문제 114지선다
비식별 처리 기법과 적용 사례를 짝지은 것 중 옳은 것만을 모두 고른 것은 다음과 같다. ㄱ. 라운딩 - 소득을 만원 단위로 반올림해 표시한다 ㄴ. 범주화 - 방문 횟수를 0에서 3회, 4에서 7회처럼 구간으로 나눈다 ㄷ. 총계처리 - 개인별 진료비 대신 지역 평균 진료비를 제공한다 ㄹ. 데이터 마스킹 - 주소의 상세 번지를 완전히 삭제해 시군구까지만 남긴다

문항 12 자료

항목
전체 레코드 수3,000건
필수 항목 결측 건수240건
운영 승인 기준완전성 95퍼센트 이상
문제 124지선다
위 표의 상품 등록 품질 카드를 검토할 때, 완전성 비율과 운영 승인 여부를 올바르게 짝지은 것은 무엇인가
문제 134지선다
한 방송사가 실시간 자막 데이터를 다루려 한다. 다음 중 반정형 데이터로 보기 어려운 것은 무엇인가
문제 144지선다
HDFS를 비롯한 분산 파일 시스템에 대한 설명으로 옳지 않은 것은 무엇인가
문제 154지선다
조직 간 관계를 노드와 간선으로 표현해 협업 네트워크의 중심성을 분석하려 한다. 이 자료를 저장하고 탐색하기에 가장 적합한 NoSQL 유형은 무엇인가
문제 164지선다
한 여행 플랫폼이 여러 항공사 웹사이트에서 요금 정보를 자동으로 순회하며 수집하려 한다. 이때 쓰기에 가장 적절한 수집 기술은 무엇인가
문제 174지선다
데이터 웨어하우스의 전통적 특성 중, 특정 시점의 스냅숏을 보존해 시간에 따른 값의 변화 이력을 조회할 수 있게 하는 특성은 무엇인가
문제 184지선다
특정 부서의 분석 요구에 맞춰 데이터 웨어하우스의 일부 주제 영역만 추려 별도로 구성한 작은 저장소를 가리키는 명칭은 무엇인가
문제 194지선다
분석 마스터플랜의 적용 범위와 도입 우선순위를 정할 때 직접 기준으로 가장 부적절한 것은 무엇인가
문제 204지선다
분석 프로젝트의 전체 범위를 계층적으로 쪼개 관리 가능한 작업 패키지와 담당 단위로 만드는 산출물의 명칭은 무엇인가

2과목: 빅데이터 탐색 (21~40)

문제 214지선다
한 항공사가 예약 자료의 전처리를 정제, 통합, 축소, 변환 네 단계로 나누어 설계했다. 각 단계에 대한 설명으로 옳지 않은 것은 무엇인가
문제 224지선다
설문 응답 자료의 결측값 처리 기법에 대한 설명으로 옳지 않은 것은 무엇인가
문제 234지선다
지역 실태조사 자료에서 다른 관측치와 크게 동떨어진 값들이 발견되어 발생 경위를 추적하고 있다. 이상값이 자료에 들어오게 된 원인으로 보기 어려운 것은 무엇인가
문제 244지선다
상자수염그림(박스플롯)의 구성 요소에 대한 설명으로 옳지 않은 것은 무엇인가
문제 254지선다
다음 중 이산형 변수로 보기 가장 적절한 것은 무엇인가
문제 264지선다
다음 중 파생변수 생성의 사례로 보기 어려운 것은 무엇인가

문항 27 자료

항목
설비 가동시간 평균60시간
설비 가동시간 표준편차8시간
이번 측정값76시간
경보 기준절댓값 z가 2 이상이면 경보
문제 274지선다
위 표의 자료로 표준화 점수를 계산할 때, 올바른 z값과 판정은 무엇인가

문항 28 자료

항목
원하는 오차한계(E)0.04
신뢰수준 95퍼센트의 z값1.96
사전 추정 비율(p)0.5
문제 284지선다
위 표의 조건으로 모비율 신뢰구간을 추정할 때 필요한 최소 표본크기는 얼마인가(공식은 n=z제곱×p×(1-p)/E제곱이며 올림하여 정수로 답한다)

문항 29 자료

항목
모평균(귀무가설 값)50
모표준편차6
표본평균52
표본크기36
문제 294지선다
위 표의 자료로 모평균에 대한 z검정을 수행할 때, 검정통계량 z값은 얼마인가(공식은 z=(표본평균-모평균)/(모표준편차/표본크기의 제곱근)이다)

문항 30 자료

구분표본크기성공 건수
A집단10060
B집단15075
문제 304지선다
위 표에서 두 집단의 표본 성공비율 차이(A집단 비율 - B집단 비율)는 얼마인가

문항 31 자료

항목
부품 개수(n)40
불량률(p)0.1
문제 314지선다
위 표의 조건에서 각 부품이 서로 독립으로 불량 여부가 정해질 때, 불량품 수 X의 분산은 얼마인가(이항분포를 가정한다)
문제 324지선다
모집단 평균 mu, 분산 시그마 제곱에서 독립표본 n개의 표본평균에 대한 설명으로 옳지 않은 것은 무엇인가
문제 334지선다
범주형 자료에서 두 변수 사이에 관련성이 있는지 검정하는 카이제곱 독립성 검정과, 한 변수가 특정 분포를 따르는지 검정하는 적합도 검정의 관계에 대한 설명으로 옳은 것은 무엇인가
문제 344지선다
분포가 어느 한쪽으로 치우친 정도와 그 방향을 나타내는 통계량은 무엇인가
문제 354지선다
광고비와 매출의 관계에서 매장 크기의 영향을 통제한 뒤 남는 선형 연관을 나타내는 상관계수는 무엇인가
문제 364지선다
고객지원 센터의 상담 대기시간은 대부분 짧지만 일부 장기 대기 건 때문에 오른쪽으로 길게 치우친 분포를 보인다. 이때 성립할 가능성이 가장 큰 대소 관계는 무엇인가
문제 374지선다
전국 초등학교를 조사하기 위해 학교를 집단으로 정의하고, 학교 15곳을 무작위로 뽑은 뒤 선택된 학교의 모든 학생을 조사했다. 이 표본설계는 무엇인가

문항 38 자료

구분표본크기
1집단15
2집단20
문제 384지선다
위 표의 두 독립표본으로 평균 차이를 검정하는 독립표본 t검정을 수행할 때, 등분산을 가정한 자유도는 얼마인가(공식은 n1+n2-2이다)

문항 39 자료

구분열 범주 수
행 범주 수3
열 범주 수4
문제 394지선다
위 표와 같이 행이 3개, 열이 4개인 분할표로 카이제곱 독립성 검정을 수행할 때, 검정통계량의 자유도는 얼마인가(공식은 (행 범주 수-1)×(열 범주 수-1)이다)
문제 404지선다
불량품 15개가 포함된 90개 납품 상자에서 10개를 검사하며 검사한 제품은 상자에 되돌려 놓지 않는다. 불량품 수에 초기하분포를 적용해야 하는 이유로 가장 적절한 것은 무엇인가

3과목: 빅데이터 모델링 (41~60)

문제 414지선다
다음 중 지도학습 과제로 보기 어려운 것은 무엇인가
문제 424지선다
아파트 실거래가를 예측하는 선형회귀모형의 가정 충족 여부를 점검하려 한다. 다음 설명 중 옳지 않은 것은 무엇인가

문항 43 자료

변수계수표준오차t유의확률
상수항8.102.053.950.000
방문자수(백명)1.100.254.400.000
인접경쟁점수(개)-0.400.19-2.110.038
직원수(명)0.020.030.670.505
문제 434지선다
위 표는 편의점 지점 60곳의 월 매출(백만원)을 세 변수로 설명한 다중회귀 결과다. 유의수준 0.05에서 다음 진술 중 옳은 것만을 모두 고른 것은 다음과 같다. ㄱ. 인접경쟁점수가 많을수록 월 매출은 낮아지는 방향으로 추정되었다. ㄴ. 직원수는 월 매출에 유의한 영향을 준다. ㄷ. 다른 변수가 일정할 때 방문자수(백명)가 1단위 늘면 월 매출은 평균 1.10백만원 증가하는 것으로 해석한다.
문제 444지선다
회귀모형의 결정계수에 대한 설명으로 옳지 않은 것은 무엇인가
문제 454지선다
다중회귀에서 분산팽창지수(VIF)에 대한 설명으로 옳지 않은 것은 무엇인가

문항 46 자료

구분정시 배송지연 배송합계
신규 물류 경로 이용10842150
기존 물류 경로 이용6090150
문제 464지선다
위 표에서 신규 물류 경로를 이용한 배송의 정시 배송 오즈비(오즈의 비, 신규 대비 기존)는 얼마인가
문제 474지선다
구독 갱신 여부를 예측하는 로지스틱 회귀에서 갱신 확률 p에 대해 로그 오즈가 0.4에 만족도 점수 계수 0.6을 곱한 값을 더한 식으로 얻어졌다. 다른 변수가 일정할 때 만족도 점수가 1점 늘면 갱신의 오즈는 어떻게 변하는가

문항 48 자료

구분관측치 수
노드 전체40
클래스 A30
클래스 B10
문제 484지선다
위 표의 노드에 대한 지니지수는 얼마인가(공식은 1에서 각 클래스 비율 제곱의 합을 뺀 값이다)

문항 49 자료

클래스관측치 수
클래스 A4
클래스 B2
클래스 C2
문제 494지선다
위 표와 같이 8개 관측치가 세 클래스로 나뉜 노드의 엔트로피는 얼마인가(밑이 2인 로그를 사용하며 공식은 각 클래스 비율에 그 비율의 로그를 곱한 값의 합에 음의 부호를 붙인 것이다)

문항 50 자료

마디클래스 A(양성)클래스 B(음성)엔트로피
부모(8개)620.811
왼쪽 자식(4개)400
오른쪽 자식(4개)221.0
문제 504지선다
위 표의 분할로 얻는 정보이득은 얼마인가(공식은 부모 엔트로피에서 자식 노드 엔트로피의 가중평균을 뺀 값이며 가중치는 각 자식의 관측치 비율이다)

문항 51-53 자료

항목
전체 거래 수800건
품목 A를 포함한 거래 수200건
품목 B를 포함한 거래 수160건
품목 A와 B를 함께 포함한 거래 수80건
문제 514지선다
위 표의 자료에서 연관규칙 A에서 B로 가는 규칙의 지지도는 얼마인가
문제 524지선다
위 표의 자료에서 연관규칙 A에서 B로 가는 규칙의 신뢰도는 얼마인가
문제 534지선다
위 표의 자료에서 연관규칙 A에서 B로 가는 규칙의 향상도는 얼마인가(공식은 신뢰도를 B의 지지도로 나눈 값이다)
문제 544지선다
의사결정나무의 알고리즘과 분리 기준에 대한 설명으로 옳지 않은 것은 무엇인가

문항 55, 56 자료

좌표
P1(2, 3)
P2(6, 7)
문제 554지선다
위 표의 두 점 사이의 유클리드 거리는 얼마인가(소수 둘째 자리에서 반올림)
문제 564지선다
위 표의 두 점 사이의 맨해튼 거리는 얼마인가

문항 57 자료

주성분PC1PC2PC3PC4
고유값8.04.02.02.0
문제 574지선다
위 표에서 PC1 하나가 설명하는 분산 비율은 얼마인가

문항 58 자료

항목
관측치의 같은 군집 내 평균 거리(a)2
관측치와 가장 가까운 다른 군집까지의 평균 거리(b)5
문제 584지선다
위 표의 값으로 계산한 이 관측치의 실루엣 계수는 얼마인가(공식은 (b-a)를 a와 b 중 큰 값으로 나눈 것이다)
문제 594지선다
시계열 자료의 정상성에 대한 설명으로 옳지 않은 것은 무엇인가
문제 604지선다
배깅과 부스팅의 차이를 가장 올바르게 설명한 것은 무엇인가

4과목: 빅데이터 결과 해석 (61~80)

문항 61-65 자료

구분예측 양성예측 음성
실제 양성6015
실제 음성20105
문제 614지선다
위 혼동행렬에서 정확도(Accuracy)는 얼마인가
문제 624지선다
위와 같은 혼동행렬에서 정밀도(Precision)는 얼마인가
문제 634지선다
위와 같은 혼동행렬에서 재현율(민감도)은 얼마인가
문제 644지선다
위와 같은 혼동행렬에서 특이도(Specificity)는 얼마인가
문제 654지선다
위와 같은 혼동행렬에서 계산한 정밀도 0.75와 재현율 0.8을 이용할 때 F1 점수는 얼마인가(소수 넷째 자리에서 반올림)
문제 664지선다
관측치 420개를 k=7인 k겹 교차검증으로 평가하려 한다. 진행 방식에 대한 설명으로 옳지 않은 것은 무엇인가

문항 67 자료

항목
대립가설 아래 검정통계량 T의 분포평균 3, 표준편차 1인 정규분포
귀무가설의 채택역T가 1.645보다 작은 영역
문제 674지선다
위 표의 조건에서 제2종 오류의 확률 베타는 어떻게 표현되는가
문제 684지선다
같은 평가 표본에서 동점이 없는 양성-음성 표본쌍 100개씩을 비교했더니, 모델 A는 58쌍에서, 모델 B는 77쌍에서 양성 점수가 더 높았다. AUC의 경험적 해석으로 옳은 것은 무엇인가
문제 694지선다
유전자 발현 자료 1만 개 변수 가운데 질병 여부와 상관이 높은 150개만 남겨 분류모형을 만들고 일반화 성능을 편향 없이 보고하려 한다. 옳은 수행 순서는 무엇인가
문제 704지선다
초매개변수와 매개변수를 구별하는 기준에 대한 설명으로 옳지 않은 것은 무엇인가
문제 714지선다
경사하강법 계열의 최적화 알고리즘에 대한 설명으로 옳지 않은 것은 무엇인가
문제 724지선다
이탈 예측 모형을 도입한 뒤 비즈니스 기여도를 평가하려 한다. 다음 설명 중 옳지 않은 것은 무엇인가
문제 734지선다
선거구별 의석수 비율에 맞춰 지도 영역의 크기와 모양을 실제 면적과 다르게 변형해 표현하는 지도 시각화 기법은 무엇인가
문제 744지선다
한 기업이 창립 이후의 성장 과정을 도입, 전개, 결론이 자연스럽게 이어지는 하나의 이야기로 구성해 보여 주려 한다. 이에 가장 적합한 인포그래픽 유형은 무엇인가
문제 754지선다
분석 활용계획에 포함되어야 할 요소로 보기 어려운 것은 무엇인가
문제 764지선다
다음 중 신경망 학습에서 훈련 손실은 계속 감소하지만 검증 손실은 어느 시점부터 다시 증가하는 패턴에 대한 해석으로 가장 적절한 것은 무엇인가
문제 774지선다
여러 대상과 항목의 값을 한 화면에서 비교하는 시각화 기법 중, 항목마다 세로축을 나란히 두고 한 대상의 값을 선으로 이어 형태를 비교하는 기법은 무엇인가

문항 78 자료

항목
원하는 오차한계(E)0.03
신뢰수준 95퍼센트의 z값1.96
사전 추정 비율(p)0.3
문제 784지선다
위 표의 조건으로 모비율 신뢰구간을 추정할 때 필요한 최소 표본크기는 얼마인가(공식은 n=z제곱×p×(1-p)/E제곱이며 올림하여 정수로 답한다)
문제 794지선다
표본이 150개뿐인데 자유 파라미터가 매우 많은 모델을 규제 없이 학습했다. 예상되는 과대적합 패턴으로 가장 적절한 것은 무엇인가
문제 804지선다
다음 중 두 변수 사이의 관계를 표현하는 것이 주된 목적이 아닌 시각화는 무엇인가

채점 후 복습 동선표

채점을 마쳤으면 틀린 문항의 과목·번호로 아래 표를 찾아 해당 편을 다시 읽습니다. 28편(1회)과 함께 틀린 영역이 겹친다면 그 개념이 실제로 취약하다는 뜻이므로 우선순위를 두고 복습하십시오.

틀린 문항 번호다루는 영역복습할 편
1–2빅데이터 특성(가치)과 위기 요인08편
3–5분석 준비도·성숙도, 조직 구조, 데이터 과학자 역량08편
6, 19–20분석 방법론(CRISP-DM), 마스터플랜, WBS07편, 10편
7–8하향식·상향식 과제 발굴, 과제 유형07편
9–12개인정보·비식별 기법, 데이터 품질 계산08편, 09편
13–18정형·반정형 데이터, 분산 저장·NoSQL, ETL·DW·마트03편, 09편
21–26전처리(정제·통합·축소·변환), 결측·이상치, 파생변수11편, 12편
27표준화(z-점수) 계산12편, 14편
28, 78표본크기 계산14편, 15편
29–30가설검정 통계량, 비율 차이 계산15편
31–33이항분포, 표본평균의 성질, 검정 목적 구분14편, 15편
34–37, 40왜도, 편상관, 분포 치우침 해석, 표본추출법, 초기하분포04편, 13편, 14편
38–39t검정·카이제곱검정의 자유도 계산15편
41지도학습·비지도학습 구분05편
42–45회귀 가정, 다중회귀 해석, 결정계수, VIF16편
46–47오즈비, 로지스틱 회귀 해석 계산18편
48–50지니지수·엔트로피·정보이득 계산18편
51–53지지도·신뢰도·향상도 계산19편
54, 60의사결정나무 분리 기준, 배깅·부스팅18편
55–56유클리드·맨해튼 거리 계산19편
57주성분분석(PCA) 분산 비율 계산19편
58실루엣 계수 계산19편
59시계열 정상성·ARIMA21편
61–65정확도·정밀도·재현율·특이도·F1 계산20편
66교차검증 진행 방식21편
67제2종 오류(베타) 계산15편, 21편
68AUC의 경험적 해석20편
69변수 선별과 데이터 누수 방지21편
70–72초매개변수·매개변수, 최적화 알고리즘, 비즈니스 기여도21편, 22편, 24편
73–74, 77, 80지도 시각화, 인포그래픽, 비교 시각화 기법23편
75분석 활용계획24편
76, 79과대적합·과소적합 패턴 진단21편

참고 자료

Last updated on