Skip to Content
독학사독학사 3단계딥러닝25. 독학사 3단계 딥러닝 기출 1회분 해설 (최근 B년도)

재구성 출제 고지: 이 회차 역시 국가평생교육진흥원 독학학위제 3단계 딥러닝 최신 출제기준(평가영역) 전체를 근거로 새로 구성한 모의 기출 1회분입니다. 25편과 같은 문항을 반복하지 않도록 다른 숫자·다른 관점으로 재구성했으며, 실제 기출을 그대로 옮긴 것이 아닙니다. 실제 응시 시 문항 수·배점·시간은 그해 공고를 반드시 확인하시기 바랍니다.

이 회차의 영역 구성

문항 번호출제기준 영역관련 편유형
1–2딥러닝의 위치와 학습 유형02·03편개념
3–4활성화·손실 함수 선택06편개념
5순전파 계산07편계산
6역전파 연쇄 법칙07편개념
7SGD와 미니배치08편개념
8Adam 갱신 계산08편계산
9모멘텀 하이퍼파라미터08편개념
10–11정규화(Dropout·Early Stopping)09편개념
12가중치 초기화10편개념
13데이터 증강10편개념
14–15CNN 풀링·파라미터 계산11편개념·계산
16VGG·AlexNet 비교12편비교
17GRU와 LSTM 비교13편비교
18BPTT13편개념
19임베딩 파라미터 계산14편계산
20위치 인코딩15편개념
21혼동행렬 재현율 계산19편계산
22회귀 지표(RMSE) 계산19편계산
서술 1Adam 갱신 1스텝 전 과정08편서술형
서술 2LSTM 셀 상태·은닉 상태 계산13편서술형

객관식 (1–22)

문제 1

문제 14지선다
지도학습(supervised learning), 비지도학습(unsupervised learning), 강화학습(reinforcement learning)을 구분하는 기준으로 가장 적절한 것은?

문제 2

문제 24지선다
딥러닝이 '표현학습(representation learning)'을 수행한다고 말할 때, 그 의미로 가장 적절한 것은?

문제 3

문제 34지선다
tanh(하이퍼볼릭 탄젠트) 활성화 함수와 시그모이드 함수를 비교한 설명으로 가장 적절한 것은?

문제 4

문제 44지선다
회귀(regression) 문제에서 손실 함수로 평균절대오차(MAE) 대신 평균제곱오차(MSE)를 선택했을 때 나타나는 특징으로 가장 적절한 것은?

문제 5

두 개의 입력 x1=2x_1 = 2, x2=1x_2 = -1이고, 가중치 w1=0.3w_1 = 0.3, w2=0.4w_2 = 0.4, 편향 b=0.1b = -0.1인 뉴런이 있다. 활성화 함수는 ReLU이다.

문제 54지선다
이 뉴런의 최종 출력값은?

문제 6

문제 64지선다
다층 신경망에서 연쇄 법칙(chain rule)이 역전파에 반드시 필요한 이유로 가장 적절한 것은?

문제 7

문제 74지선다
전체 배치 경사하강법(batch gradient descent)과 비교한 확률적 경사하강법(SGD, 미니배치 포함)의 특징으로 가장 적절한 것은?

문제 8

어떤 파라미터에 대한 그라디언트가 g=0.2g = 0.2이고, Adam 옵티마이저의 하이퍼파라미터는 β1=0.9\beta_1 = 0.9, β2=0.999\beta_2 = 0.999, η=0.01\eta = 0.01이다. 이전 시점의 1차·2차 모멘트는 모두 0이며, 지금이 첫 번째 갱신(t=1)이다.

문제 84지선다
바이어스 보정(bias correction)까지 마친 뒤 이 파라미터의 갱신량(learning rate가 적용된 이동량)은 약 얼마인가?

문제 9

문제 94지선다
모멘텀 계수(momentum coefficient)를 지나치게 크게(예: 0.999에 가깝게) 설정했을 때 나타날 수 있는 문제로 가장 적절한 것은?

문제 10

문제 104지선다
Early Stopping(조기 종료) 기법에 대한 설명으로 가장 적절한 것은?

문제 11

문제 114지선다
과적합(overfitting)이 의심되는 상황에 대한 설명으로 가장 적절한 것은?

문제 12

문제 124지선다
ReLU 계열 활성화 함수를 사용하는 신경망에서 He 초기화(He initialization)가 자비어 초기화(Xavier initialization)보다 흔히 권장되는 이유로 가장 적절한 것은?

문제 13

문제 134지선다
이미지 분류 문제에서 데이터 증강(data augmentation)으로 회전·좌우 반전·색상 변형 등을 적용하는 목적으로 가장 적절한 것은?

문제 14

문제 144지선다
최대 풀링(max pooling)과 평균 풀링(average pooling)을 비교한 설명으로 가장 적절한 것은?

문제 15

입력 채널이 3, 필터 크기가 3x3, 출력 채널(필터 개수)이 32, 각 필터마다 편향이 1개 있는 합성곱층이 있다.

문제 154지선다
이 합성곱층의 전체 학습 파라미터 개수는?

문제 16

문제 164지선다
AlexNet과 비교한 VGG 계열 네트워크의 설계 특징으로 가장 적절한 것은?

문제 17

문제 174지선다
GRU(Gated Recurrent Unit)와 LSTM을 비교한 설명으로 가장 적절한 것은?

문제 18

문제 184지선다
시간에 따른 역전파(BPTT, Backpropagation Through Time)에 대한 설명으로 가장 적절한 것은?

문제 19

어휘 집합 크기가 8000이고 임베딩 차원을 64로 설정한 임베딩 레이어가 있다.

문제 194지선다
이 임베딩 레이어의 학습 파라미터 개수는?

문제 20

문제 204지선다
Transformer에서 위치 인코딩(positional encoding)을 단어 임베딩에 '더하는(add)' 방식에 대한 설명으로 가장 적절한 것은?

문제 21

이진 분류 모델을 100개의 테스트 데이터에 적용해 다음 혼동행렬을 얻었다.

구분예측: 양성예측: 음성
실제: 양성TP = 50FN = 15
실제: 음성FP = 5TN = 30
문제 214지선다
이 모델의 재현율(recall)은 약 얼마인가?

문제 22

어떤 회귀 모델이 4개의 테스트 데이터에 대해 실제값 y = [10, 12, 8, 14], 예측값 y_hat = [9, 13, 8, 16]로 예측했다.

문제 224지선다
이 예측 결과의 평균제곱근오차(RMSE)는 약 얼마인가?

서술형 (1–2)

서술형 문제 1: Adam 갱신 1스텝 전 과정

파라미터에 대한 그라디언트 g=0.4g = 0.4, 하이퍼파라미터 β1=0.9\beta_1 = 0.9, β2=0.999\beta_2 = 0.999, 학습률 η=0.001\eta = 0.001, 이전 시점 모멘트 m0=0m_0 = 0, v0=0v_0 = 0일 때, 시점 t=1t=1에서 Adam이 파라미터를 갱신하는 전 과정을 서술하시오(엡실론은 무시할 수 있을 만큼 작다고 가정).

모범답안

  1. 1차 모멘트(모멘텀 항) 갱신: m1=β1m0+(1β1)g=0.9×0+0.1×0.4=0.04m_1 = \beta_1 m_0 + (1-\beta_1) g = 0.9 \times 0 + 0.1 \times 0.4 = 0.04입니다.
  2. 2차 모멘트(그라디언트 제곱의 이동평균) 갱신: v1=β2v0+(1β2)g2=0.999×0+0.001×0.16=0.00016v_1 = \beta_2 v_0 + (1-\beta_2) g^2 = 0.999 \times 0 + 0.001 \times 0.16 = 0.00016입니다.
  3. 1차 모멘트 바이어스 보정: m^1=m11β11=0.0410.9=0.040.1=0.4\hat{m}_1 = \dfrac{m_1}{1-\beta_1^{1}} = \dfrac{0.04}{1-0.9} = \dfrac{0.04}{0.1} = 0.4입니다.
  4. 2차 모멘트 바이어스 보정: v^1=v11β21=0.0001610.999=0.000160.001=0.16\hat{v}_1 = \dfrac{v_1}{1-\beta_2^{1}} = \dfrac{0.00016}{1-0.999} = \dfrac{0.00016}{0.001} = 0.16입니다.
  5. 파라미터 갱신량 계산: Δθ=ηm^1v^1+ϵ0.001×0.40.16=0.001×0.40.4=0.001\Delta\theta = \eta \dfrac{\hat{m}_1}{\sqrt{\hat{v}_1}+\epsilon} \approx 0.001 \times \dfrac{0.4}{\sqrt{0.16}} = 0.001 \times \dfrac{0.4}{0.4} = 0.001입니다.
  6. 파라미터 갱신: θ1=θ0Δθ=θ00.001\theta_1 = \theta_0 - \Delta\theta = \theta_0 - 0.001입니다.

해석: 바이어스 보정을 거치면 학습 초기(t가 작을 때)에 모멘트 추정치가 0에 가깝게 시작해 갱신량이 지나치게 작아지는 문제를 막을 수 있습니다. 이 예시에서는 m^1/v^1\hat{m}_1 / \sqrt{\hat{v}_1}이 정확히 1이 되어, 실제 갱신량이 학습률 η\eta와 같아지는 특수한 경우를 보여줍니다.

자주 틀리는 점: 바이어스 보정 단계를 생략하고 m1m_1, v1v_1을 그대로 갱신 공식에 대입하는 실수가 흔합니다. 그렇게 하면 v1v_1이 매우 작은 값(0.00016)이어서 제곱근을 취해도 분모가 작아지고, 학습 초기 갱신량이 실제보다 훨씬 크게(또는 왜곡되어) 계산되는 오류가 생깁니다.

서술형 문제 2: LSTM 셀 상태·은닉 상태 계산

어떤 LSTM 셀에서 이전 셀 상태 Ct1=0.8C_{t-1} = 0.8이고, 이번 시점에 계산된 망각 게이트 ft=0.6f_t = 0.6, 입력 게이트 it=0.7i_t = 0.7, 후보 셀 상태 C~t=0.5\tilde{C}_t = 0.5, 출력 게이트 ot=0.65o_t = 0.65가 주어졌다. 이번 시점의 셀 상태 CtC_t와 은닉 상태 hth_t를 계산하는 과정을 서술하시오(tanh(0.83)0.68\tanh(0.83) \approx 0.68을 이용한다).

모범답안

  1. 셀 상태 갱신 공식: LSTM의 셀 상태는 Ct=ft×Ct1+it×C~tC_t = f_t \times C_{t-1} + i_t \times \tilde{C}_t로 갱신됩니다. 이 식은 망각 게이트가 과거 정보를 얼마나 남길지, 입력 게이트가 새 후보 정보를 얼마나 반영할지를 각각 조절한다는 의미를 담고 있습니다.
  2. 망각 항 계산: ft×Ct1=0.6×0.8=0.48f_t \times C_{t-1} = 0.6 \times 0.8 = 0.48입니다. 이는 과거 셀 상태 중 남기는 부분입니다.
  3. 입력 항 계산: it×C~t=0.7×0.5=0.35i_t \times \tilde{C}_t = 0.7 \times 0.5 = 0.35입니다. 이는 새로 반영하는 후보 정보의 크기입니다.
  4. 셀 상태 합산: Ct=0.48+0.35=0.83C_t = 0.48 + 0.35 = 0.83입니다.
  5. 은닉 상태 계산: 은닉 상태는 ht=ot×tanh(Ct)h_t = o_t \times \tanh(C_t)로 계산합니다. tanh(0.83)0.68\tanh(0.83) \approx 0.68이 주어졌으므로 ht=0.65×0.680.442h_t = 0.65 \times 0.68 \approx 0.442입니다.

해석: 망각 게이트(0.6)와 입력 게이트(0.7)가 모두 1보다 작은 값으로 과거 정보와 새 정보를 적절히 섞어 셀 상태를 갱신했고, 출력 게이트(0.65)는 이 셀 상태 중 일부만 걸러 은닉 상태로 내보냈습니다. 세 게이트가 각각 독립적인 역할(유지·반영·노출)을 한다는 점을 이 계산이 잘 보여줍니다.

자주 틀리는 점: 은닉 상태를 계산할 때 tanh\tanh를 적용하지 않고 CtC_t 값 자체에 출력 게이트만 곱하는 실수, 또는 셀 상태 갱신에서 망각 게이트와 입력 게이트를 더하지 않고 곱하는(예: ft×it×C~tf_t \times i_t \times \tilde{C}_t) 실수가 흔합니다. 셀 상태는 두 항의 합이며, 은닉 상태를 만들 때는 반드시 tanh\tanh로 셀 상태를 한 번 압축한 뒤 출력 게이트를 곱해야 합니다.

참고 자료

Last updated on