Skip to Content
독학사독학사 3단계딥러닝27. 시험 직전 2주 완성: 핵심 압축 정리와 함정 체크리스트

이번 문서의 목표: 05편부터 27편까지 다룬 내용을 한 장에 압축해, 시험 직전 2주 동안 전 범위를 빠르게 복습하고 자신의 취약 영역을 스스로 점검할 수 있다.

이 편은 새로운 개념을 설명하는 편이 아니다. 지금까지 배운 내용을 다시 읽지 않고도 기억을 되살릴 수 있는 압축된 형태로 정리하는 편이다. 각 항목 옆의 괄호 숫자는 자세한 설명이 있는 편이므로, 기억이 흐릿한 항목은 그 편으로 돌아가 다시 확인한다.

2주 학습 로드맵

1–3일차: 딥러닝의 기본 엔진

02·03편(용어·머신러닝과의 관계)을 훑고, 05–08편(퍼셉트론·MLP, 활성화·손실, 순전파·역전파, 최적화)을 집중 복습한다. 역전파 1스텝 계산을 손으로 최소 3번 이상 직접 해본다.

4–6일차: 정규화와 CNN

09–12편(정규화, 배치 정규화·증강, CNN 기초, CNN 구조)을 복습한다. 합성곱 출력 크기 공식과 파라미터 수 계산을 여러 숫자로 바꿔가며 연습한다.

7–9일차: 시퀀스와 Transformer

13–15편(RNN·LSTM·GRU, 임베딩·Seq2Seq, Transformer 개요)을 복습한다. LSTM 게이트의 역할과 셀프 어텐션의 계산 순서를 도식으로 그려본다.

10–11일차: 생성 모델과 전이학습·평가

16–20편(AE·VAE, GAN, 전이학습, 평가지표, 실무 요소)을 복습한다. 혼동행렬에서 정밀도·재현율·F1을 계산하는 연습을 반복한다.

12–14일차: 실전 감각 다지기

21–27편(유형 문제·기출·모의고사)을 실제 시험처럼 시간을 재며 풀고, 틀린 문항이 속한 편으로 돌아가 개념을 다시 확인한다. 이 28편의 체크리스트로 취약 영역을 표시하고 마지막 이틀은 취약 영역 위주로 복습한다.

영역별 핵심 정의 한 줄 압축

영역(관련 편)핵심 정의 한 줄핵심 수식시험에서 자주 걸리는 주의점
퍼셉트론·MLP(05)입력의 가중합에 활성화 함수를 적용하는 최소 단위를 층으로 쌓은 구조z=wixi+bz = \sum w_i x_i + b단일 퍼셉트론은 XOR 같은 비선형 분리 문제를 풀 수 없다
활성화 함수(06)가중합에 비선형성을 더해 신경망의 표현력을 만드는 함수a=σ(z)a = \sigma(z), a=max(0,z)a = \max(0, z)ReLU는 음수 입력에서 그라디언트가 0이 되는 죽은 뉴런 문제가 있다
손실 함수(06)예측과 정답의 차이를 하나의 숫자로 요약하는 함수L=12(ya)2L = \frac{1}{2}(y-a)^2, L=ln(p정답)L=-\ln(p_{정답})회귀는 MSE·MAE, 분류는 교차엔트로피가 기본 조합이다
순전파·역전파(07)입력을 출력까지 계산(순전파)한 뒤 손실의 그라디언트를 연쇄 법칙으로 역방향 전달(역전파)하는 절차L/w=L/aa/zz/w\partial L/\partial w = \partial L/\partial a \cdot \partial a/\partial z \cdot \partial z/\partial w활성화 함수의 국소 미분과 연쇄 법칙의 곱셈 순서를 혼동하지 않는다
최적화(08)그라디언트를 이용해 손실을 줄이는 방향으로 파라미터를 갱신하는 절차wwηLw \leftarrow w - \eta \nabla LAdam도 학습률을 사용자가 정해야 하며, 모멘텀 계수가 크면 오버슈팅 위험이 있다
정규화(09)학습 데이터에 지나치게 맞춰지는 과적합을 억제하는 기법들의 총칭L2: L+λw2L + \lambda \sum w^2L1은 희소성(일부 가중치를 0으로), L2는 크기 축소(0에 가깝게)를 유도한다
배치 정규화·증강(10)층 입력을 정규화하거나 데이터를 인위적으로 다양화해 학습을 안정시키는 기법-배치 정규화는 학습 시 배치 통계, 추론 시 이동평균을 사용한다
CNN 기초(11)필터가 입력을 훑으며 지역적 특징을 추출하는 합성곱 연산 중심의 구조출력 크기: N+2PFS+1\frac{N+2P-F}{S}+1파라미터 수 계산 시 편향을 빠뜨리기 쉽다: (F×F×Cin+1)×Cout(F \times F \times C_{in}+1)\times C_{out}
CNN 구조(12)LeNet·AlexNet·VGG·ResNet 등 대표적인 CNN 설계 흐름-ResNet의 핵심은 잔차(지름길) 연결로 그라디언트 소실을 완화하는 것이다
RNN·LSTM·GRU(13)시퀀스를 시간 순서대로 처리하며 은닉 상태로 과거 정보를 전달하는 구조Ct=ftCt1+itC~tC_t = f_t C_{t-1}+i_t\tilde{C}_t기본 RNN은 그라디언트 소실로 장기 의존성 학습이 어렵고, LSTM·GRU가 게이트로 이를 완화한다
임베딩·Seq2Seq(14)단어 등을 밀집 벡터로 표현하고, 인코더-디코더로 시퀀스를 변환하는 구조파라미터 수: 어휘 크기 × 임베딩 차원기본 Seq2Seq는 고정 크기 문맥 벡터 병목이 있고, Attention이 이를 완화한다
Transformer(15)순환 구조 없이 셀프 어텐션으로 시퀀스를 병렬 처리하는 구조스케일드 닷프로덕트: QKTdk\frac{QK^T}{\sqrt{d_k}}위치 정보가 없어 위치 인코딩이 별도로 필요하고, 계산량은 시퀀스 길이의 제곱에 비례한다
AE·VAE(16)인코더-디코더로 데이터를 압축·복원하며, VAE는 잠재변수를 확률분포로 다룬다ELBO = 재구성 손실 + KL 발산VAE의 KL 발산 항은 잠재분포를 표준정규분포에 가깝게 정규화하는 역할이다
GAN(17)생성자와 판별자가 경쟁하며 데이터 분포를 학습하는 구조-모드 붕괴는 생성 다양성이 떨어지는 현상이지 판별자가 완벽해지는 현상이 아니다
전이학습(18)사전학습된 모델의 표현을 새로운 문제에 재사용하는 접근-전체 미세조정은 사전학습 정보 보존을 위해 보통 더 작은 학습률을 쓴다
평가지표(19)분류·회귀 모델의 성능을 수치로 요약하는 지표들F1=2PRP+RF1=\frac{2PR}{P+R}정밀도의 분모는 예측 양성 전체, 재현율의 분모는 실제 양성 전체로 서로 다르다
학습 실무 요소(20)학습률 스케줄·미니배치·에폭 등 실제 훈련을 좌우하는 설정값들-배치가 작을수록 그라디언트 잡음이 늘어 정규화와 비슷한 효과를 줄 수 있다

판단 흐름: 검증 손실이 나빠지기 시작했을 때 대응 순서

시험에서 “과적합이 의심될 때 취할 조치의 순서”를 묻는 응용 문제가 자주 출제된다. 아래 흐름은 09–10편에서 다룬 정규화 기법들을 실무에서 시도하는 일반적인 순서를 정리한 것이다.

쉽게 말하면: 데이터를 늘릴 수 있으면 데이터부터 늘리고, 그다음 모델 크기·Dropout·정규화 강도를 조절하고, 마지막으로 학습을 멈추는 시점을 조정하는 순서로 접근한다.

자주 출제되는 함정 보기 패턴

객관식 보기에서 반복적으로 나타나는 함정 문장 패턴을 미리 알아두면, 처음 보는 문제에서도 함정을 빠르게 알아챌 수 있다.

함정 패턴실제로는예시
”항상”, “반드시”, “전혀”처럼 예외 없는 단정 표현딥러닝 개념 대부분은 일반적인 경향이지 절대적 법칙이 아닌 경우가 많음”Adam은 항상 SGD보다 좋은 성능을 낸다”(옳지 않음, 상황에 따라 다름)
두 지표·개념의 분모·분자를 서로 바꿔치기정밀도와 재현율처럼 이름이 비슷한 지표는 분모 기준이 다름정밀도의 분모(예측 양성)를 재현율의 분모(실제 양성)로 착각
역할이 비슷한 두 구성 요소를 서로 바꿔치기인코더/디코더, 생성자/판별자, 망각 게이트/입력 게이트 등은 방향이 정반대”인코더가 디코더의 출력을 압축한다”처럼 방향이 뒤바뀐 진술
원인과 결과를 뒤바꾸기어떤 기법이 왜 그 효과를 내는지의 인과관계가 뒤집힘”그라디언트 소실 때문에 시퀀스가 길어진다”(실제로는 반대)
최신·복잡한 기법일수록 하이퍼파라미터가 필요 없다는 착각Adam 등 적응적 기법도 학습률 등 기본 하이퍼파라미터는 여전히 필요”Adam은 학습률 설정이 필요 없다”(옳지 않음)
계산 공식의 항 하나를 빠뜨리거나 순서를 바꾼 오답 보기편향을 빠뜨린 파라미터 수, +1을 빠뜨린 출력 크기 등CNN 파라미터 수 계산에서 편향 항을 누락
두 손실 함수·활성화 함수의 출력 범위를 혼동시그모이드(0–1)와 tanh(-1–1)의 범위가 다름”tanh의 출력 범위는 0에서 1이다”(옳지 않음)
학습(training)과 추론(inference) 시의 동작을 혼동Dropout, 배치 정규화는 학습과 추론에서 서로 다르게 동작”추론 시에도 학습 때와 같은 비율로 뉴런을 무작위로 끈다”(옳지 않음)

취약 영역 점검 체크리스트

아래 각 항목을 “설명 없이 바로 계산·설명할 수 있다(O)” 또는 “다시 봐야 한다(X)“로 스스로 표시해 본다. X가 많은 영역을 마지막 이틀 복습의 우선순위로 삼는다.

  • 퍼셉트론의 한계와 MLP가 이를 해결하는 원리를 설명할 수 있다
  • 활성화 함수 5종(계단·시그모이드·tanh·ReLU·Leaky ReLU)의 그래프와 장단점을 구분할 수 있다
  • 하나의 뉴런에 대해 순전파와 역전파 1스텝을 숫자로 직접 계산할 수 있다
  • SGD, 모멘텀, RMSprop, Adam의 갱신 공식을 구분하고 Adam의 바이어스 보정 과정을 계산할 수 있다
  • L1과 L2 정규화, Dropout, Early Stopping, 배치 정규화의 목적과 학습·추론 시 동작 차이를 설명할 수 있다
  • 합성곱 출력 크기와 파라미터 수를 임의의 숫자로 바로 계산할 수 있다
  • LeNet·AlexNet·VGG·ResNet의 설계상 차이(필터 크기, 깊이, 잔차 연결)를 비교할 수 있다
  • LSTM의 세 게이트와 셀 상태 갱신 공식을 계산할 수 있고, GRU와의 구조 차이를 설명할 수 있다
  • Attention의 점수·가중합 계산과 Transformer의 셀프 어텐션·멀티헤드·위치 인코딩을 설명할 수 있다
  • AE와 VAE의 차이(확률적 잠재변수, KL 발산), GAN의 생성자·판별자 구조를 설명할 수 있다
  • 특징 추출기 방식과 전체 미세조정의 차이, 학습률 조정 이유를 설명할 수 있다
  • 혼동행렬에서 정확도·정밀도·재현율·F1·ROC/AUC와 회귀 지표(MSE·RMSE·MAE·R제곱)를 숫자로 계산할 수 있다

핵심 정리

  • 이 편은 새 개념이 아니라 05–20편의 압축 정리이며, 표의 괄호 편으로 돌아가 흐릿한 부분을 다시 확인하는 용도로 쓴다.
  • 판단 흐름(과적합 대응 순서)처럼 “무엇을 먼저 시도하는가”를 묻는 응용 문제는 mermaid 흐름도로 순서를 기억해 둔다.
  • 옳지 않은 것 고르기 유형은 “항상·반드시·전혀” 같은 단정 표현, 분모·분자 바꿔치기, 인과관계 뒤바뀜 패턴을 먼저 의심한다.
  • 계산형 문제는 공식을 먼저 쓰고 대입하는 습관을 들이면, 시험 중 압박감 속에서도 실수를 줄일 수 있다.
  • 체크리스트에서 X 표시가 많은 영역은 21–27편의 관련 유형 문제로 다시 연습한다.

마무리 복습

문제 1

문제 14지선다
딥러닝과 전통적 머신러닝을 비교한 설명으로 옳지 않은 것은?

문제 2

가중치 w=0.6w=0.6, 입력 x=1x=1, 편향은 0이며 활성화 함수는 시그모이드이다. σ(0.6)0.6457\sigma(0.6) \approx 0.6457이다.

문제 24지선다
이 뉴런의 순전파 출력값은 얼마인가?

문제 3

문제 34지선다
Adam 옵티마이저에 대한 설명으로 옳지 않은 것은?

문제 4

입력 채널 3, 필터 크기 5x5, 출력 채널 20, 편향 포함인 합성곱층이 있다.

문제 44지선다
이 합성곱층의 전체 파라미터 개수는?

문제 5

문제 54지선다
LSTM과 GRU를 비교한 설명으로 옳지 않은 것은?

문제 6

문제 64지선다
셀프 어텐션에서 점수를 sqrt(d_k)로 나누는(스케일링하는) 이유로 가장 적절한 것은?

문제 7

문제 74지선다
VAE의 KL 발산 항이 하는 역할로 가장 적절한 것은?

문제 8

문제 84지선다
GAN의 모드 붕괴(mode collapse)에 대한 설명으로 가장 적절한 것은?

문제 9

문제 94지선다
전체 미세조정(full fine-tuning)과 특징 추출기 방식을 비교한 설명으로 옳지 않은 것은?

문제 10

이진 분류 모델의 혼동행렬에서 TP = 20, FP = 10, FN = 5, TN = 65이다.

문제 104지선다
이 모델의 정밀도(precision)는 얼마인가?

문제 11

문제 114지선다
Dropout과 배치 정규화가 학습(training)과 추론(inference) 시 서로 다르게 동작한다는 설명으로 가장 적절한 것은?

문제 12

문제 124지선다
객관식 시험에서 '항상', '반드시', '전혀'와 같은 단정적 표현이 포함된 보기를 만났을 때 취해야 할 접근으로 가장 적절한 것은?

참고 자료

Last updated on