Skip to Content
독학사독학사 3단계딥러닝24. 독학사 3단계 딥러닝 기출 1회분 해설 (최근 A년도)

재구성 출제 고지: 이 회차는 국가평생교육진흥원 독학학위제 3단계 딥러닝 최신 출제기준(평가영역) 전체를 근거로 새로 구성한 모의 기출 1회분입니다. 실제 특정 연도의 기출 문항을 그대로 옮기거나 암기해 재현한 것이 아니며, 출제기준에 명시된 영역별 비중을 반영해 객관식 22문항과 서술형 2문항으로 재구성했습니다. 실제 응시 시 문항 수·배점·시간은 그해 공고를 반드시 확인하시기 바랍니다.

이 회차의 영역 구성

문항 번호출제기준 영역관련 편유형
1–2머신러닝과 딥러닝의 관계03편개념
3–4퍼셉트론·MLP 구조05편개념
5–6활성화·손실 함수06편개념·비교
7–8순전파 계산07편계산
9역전파 개념07편개념
10–11최적화 알고리즘08편개념·비교
12–13과적합·정규화09편개념
14배치 정규화·초기화10편개념
15–16CNN 출력 크기·파라미터 계산11편계산
17대표 CNN 구조12편개념
18RNN·LSTM13편개념
19임베딩·Attention14편개념
20Transformer 개요15편개념
21소프트맥스 계산06·15편계산
22생성 모델(AE/VAE/GAN)16·17편개념
서술 1역전파 1스텝 전 과정07편서술형
서술 2CNN 출력 크기·파라미터 수 종합11편서술형

객관식 (1–22)

문제 1

문제 14지선다
전통적인 머신러닝과 딥러닝의 관계에 대한 설명으로 가장 적절한 것은?

문제 2

문제 24지선다
딥러닝이 전통적 머신러닝에 비해 상대적으로 불리한 점으로 가장 적절한 것은?

문제 3

문제 34지선다
단일 퍼셉트론(perceptron)이 원천적으로 풀 수 없는 문제로 알려진 대표적인 예로 가장 적절한 것은?

문제 4

문제 44지선다
다층 퍼셉트론(MLP)에서 은닉층(hidden layer)에 비선형 활성화 함수를 사용하지 않고 항등함수(identity function)만 사용한다면 일어나는 일로 가장 적절한 것은?

문제 5

문제 54지선다
시그모이드(sigmoid) 함수와 비교한 ReLU(Rectified Linear Unit) 함수의 특징으로 가장 적절한 것은?

문제 6

문제 64지선다
다중 클래스 분류 문제에서 출력층 활성화 함수로 소프트맥스(softmax)를, 손실 함수로 교차엔트로피(cross-entropy)를 함께 사용하는 이유로 가장 적절한 것은?

문제 7

입력 x1=1x_1 = 1, x2=2x_2 = 2이고, 가중치 w1=0.5w_1 = 0.5, w2=0.3w_2 = -0.3, 편향(bias) b=0.2b = 0.2인 하나의 뉴런이 있다.

문제 74지선다
이 뉴런의 가중합(weighted sum) z=w1x1+w2x2+bz = w_1 x_1 + w_2 x_2 + b 값은?

문제 8

문제 7에서 구한 z=0.1z = 0.1을 시그모이드 활성화 함수에 통과시킨다. e0.10.905e^{-0.1} \approx 0.905를 이용한다.

문제 84지선다
이 뉴런의 최종 출력 a=σ(z)a = \sigma(z)는 약 얼마인가?

문제 9

문제 94지선다
역전파(backpropagation) 알고리즘의 핵심 아이디어로 가장 적절한 것은?

문제 10

문제 104지선다
모멘텀(momentum)을 적용한 경사하강법이 기본 SGD와 다른 점으로 가장 적절한 것은?

문제 11

문제 114지선다
Adam 옵티마이저에 대한 설명으로 옳지 않은 것은?

문제 12

문제 124지선다
L2 정규화(가중치 감쇠, weight decay)가 과적합을 줄이는 원리로 가장 적절한 것은?

문제 13

문제 134지선다
Dropout에 대한 설명으로 옳지 않은 것은?

문제 14

문제 144지선다
배치 정규화(Batch Normalization)의 효과로 가장 적절한 것은?

문제 15

입력 이미지 크기가 32x32이고 5x5 필터를 스트라이드 1, 패딩 0으로 합성곱 연산에 사용한다.

문제 154지선다
합성곱 결과로 만들어지는 특징 맵(feature map)의 한 변의 크기는?

문제 16

입력 채널이 3, 필터 크기가 5x5, 출력 채널(필터 개수)이 16, 각 필터마다 편향 1개가 있는 합성곱층이 있다.

문제 164지선다
이 합성곱층의 전체 학습 파라미터 개수는?

문제 17

문제 174지선다
ResNet의 잔차 연결(residual connection, skip connection)이 해결하고자 한 문제로 가장 적절한 것은?

문제 18

문제 184지선다
LSTM(Long Short-Term Memory)이 기본 RNN의 한계를 보완하기 위해 도입한 요소로 가장 적절한 것은?

문제 19

문제 194지선다
어텐션(attention) 메커니즘의 기본 아이디어로 가장 적절한 것은?

문제 20

문제 204지선다
Transformer의 셀프 어텐션(self-attention)이 RNN 계열 모델에 비해 갖는 장점으로 가장 적절한 것은?

문제 21

어떤 3개 클래스 분류 문제에서 출력층 로짓(logit) 값이 z=[2,1,0]z = [2, 1, 0]이다. e27.389e^2 \approx 7.389, e12.718e^1 \approx 2.718, e0=1e^0 = 1을 이용한다.

문제 214지선다
소프트맥스를 적용했을 때 첫 번째 클래스의 확률은 약 얼마인가?

문제 22

문제 224지선다
오토인코더(AE), 변분 오토인코더(VAE), GAN을 비교한 설명으로 옳지 않은 것은?

서술형 (1–2)

서술형 문제 1: 역전파 1스텝 전 과정

하나의 뉴런에 입력 x=1x = 1, 목표값(정답) y=1y = 1, 가중치 w=0.5w = 0.5, 편향은 없다고 가정한다. 활성화 함수는 시그모이드이며 손실 함수는 L=12(ya)2L = \frac{1}{2}(y-a)^2이다. 학습률 η=0.1\eta = 0.1일 때, 경사하강법으로 가중치를 1회 갱신하는 전 과정을 순서대로 서술하시오.

모범답안

  1. 순전파: z=wx=0.5×1=0.5z = w x = 0.5 \times 1 = 0.5이고, a=σ(z)=11+e0.511.60650.6225a = \sigma(z) = \dfrac{1}{1+e^{-0.5}} \approx \dfrac{1}{1.6065} \approx 0.6225입니다.
  2. 손실 계산: L=12(ya)2=12(10.6225)2=12(0.3775)20.0713L = \dfrac{1}{2}(y-a)^2 = \dfrac{1}{2}(1-0.6225)^2 = \dfrac{1}{2}(0.3775)^2 \approx 0.0713입니다.
  3. 출력에 대한 손실의 그라디언트: L=12(ya)2L = \dfrac{1}{2}(y-a)^2aa로 미분하면 La=ay=0.62251=0.3775\dfrac{\partial L}{\partial a} = a - y = 0.6225 - 1 = -0.3775입니다.
  4. 활성화 함수의 국소 그라디언트: 시그모이드의 미분은 σ(z)=a(1a)\sigma'(z) = a(1-a)이므로 az=0.6225×(10.6225)=0.6225×0.37750.235\dfrac{\partial a}{\partial z} = 0.6225 \times (1-0.6225) = 0.6225 \times 0.3775 \approx 0.235입니다.
  5. 가중치에 대한 국소 그라디언트: z=wxz = wx이므로 zw=x=1\dfrac{\partial z}{\partial w} = x = 1입니다.
  6. 연쇄 법칙으로 전체 그라디언트 계산: Lw=La×az×zw=(0.3775)×0.235×10.0887\dfrac{\partial L}{\partial w} = \dfrac{\partial L}{\partial a} \times \dfrac{\partial a}{\partial z} \times \dfrac{\partial z}{\partial w} = (-0.3775) \times 0.235 \times 1 \approx -0.0887입니다.
  7. 가중치 갱신: wnew=wηLw=0.50.1×(0.0887)=0.5+0.008870.5089w_{new} = w - \eta \dfrac{\partial L}{\partial w} = 0.5 - 0.1 \times (-0.0887) = 0.5 + 0.00887 \approx 0.5089입니다.

해석: 예측값(0.6225)이 목표값(1)보다 작아 그라디언트가 음수로 나왔고, 경사하강법은 이 그라디언트의 반대 방향으로 이동하므로 가중치가 소폭 증가했습니다. 이는 다음 순전파에서 예측값을 목표값 방향으로 더 가깝게 만드는 방향입니다.

자주 틀리는 점: La\dfrac{\partial L}{\partial a}를 계산할 때 부호를 yay-a로 잘못 두는 실수가 흔합니다. L=12(ya)2L=\frac{1}{2}(y-a)^2aa에 대해 미분하면 연쇄 법칙에 의해 (ya)=ay-(y-a) = a-y가 되어야 합니다. 부호를 반대로 쓰면 가중치가 반대 방향으로 갱신되어 학습이 발산할 수 있습니다.

서술형 문제 2: CNN 출력 크기와 파라미터 수 종합 계산

입력 이미지 크기가 28x28이고 채널 수는 1(흑백)이다. 이 입력에 3x3 필터 8개를 스트라이드 1, 패딩 1(same padding)로 합성곱한 뒤, 2x2 최대 풀링(스트라이드 2)을 적용한다. 이 과정에서 합성곱층의 출력 크기, 파라미터 수, 풀링 후 출력 크기를 순서대로 계산하시오.

모범답안

  1. 합성곱 출력 크기: 패딩이 1이므로 출력 크기 공식은 (입력크기+2×패딩필터크기)스트라이드+1\dfrac{(입력 크기 + 2 \times 패딩 - 필터 크기)}{스트라이드} + 1입니다. 대입하면 28+2×131+1=271+1=28\dfrac{28 + 2 \times 1 - 3}{1} + 1 = \dfrac{27}{1}+1 = 28이 되어, 합성곱 결과는 28x28 크기를 유지합니다(패딩 1을 준 이유가 바로 이 same padding 효과입니다).
  2. 합성곱층 파라미터 수: 필터 하나의 파라미터는 (필터 높이 × 필터 너비 × 입력 채널) + 편향 1개 = (3×3×1)+1=10(3 \times 3 \times 1) + 1 = 10개입니다. 필터가 8개이므로 전체 파라미터 수는 10×8=8010 \times 8 = 80개입니다.
  3. 채널 수 변화: 합성곱을 거친 특징 맵은 필터 개수만큼의 채널을 가지므로, 출력은 28x28x8이 됩니다.
  4. 풀링 출력 크기: 2x2 최대 풀링을 스트라이드 2로 적용하면 각 변의 크기가 절반이 됩니다. 28/2=1428 / 2 = 14이므로 풀링 후 출력은 14x14x8이 됩니다(채널 수는 풀링으로 바뀌지 않습니다).

해석: 패딩을 필터 크기에 맞게(3x3 필터에 패딩 1) 주면 합성곱 전후 가로·세로 크기가 유지되는 same padding이 되고, 그 뒤에 오는 풀링층이 공간 크기를 줄이는 역할을 전담하게 됩니다. 채널 수는 합성곱의 필터 개수에 의해서만 바뀌고, 풀링에서는 바뀌지 않는다는 점이 자주 헷갈리는 부분입니다.

자주 틀리는 점: 풀링이 채널 수도 함께 줄인다고 착각하거나, same padding에서 패딩 값을 필터 크기와 무관하게 항상 1로 고정한다고 착각하는 경우가 많습니다. 패딩 값은 필터 크기에 따라 달라지며(홀수 크기 필터에서 same padding을 만들려면 패딩은 (필터 크기-1)/2), 위 예시에서는 필터가 3이므로 패딩 1이 정확히 맞아떨어진 것입니다.

참고 자료

Last updated on