Skip to Content
자격증ADsP19. 시계열분석 개요

이번 문서의 목표: 시계열 데이터가 무엇인지, 정상성이 왜 중요한지, 비정상 시계열을 정상 시계열로 바꾸는 방법(차분·변환)과 AR·MA·ARIMA 모형의 뼈대를 설명할 수 있다.

시계열 데이터란 무엇인가

왜 필요한가

지금까지 다룬 상관분석(17편)과 회귀분석(18편)은 관측치들이 서로 독립적이라고 가정했다. 예를 들어 학생 100명의 키와 몸무게를 조사할 때, 어떤 학생의 몸무게가 다른 학생의 몸무게에 영향을 주지 않는다고 본다. 하지만 매달 측정한 회사의 매출액, 매일 기록한 주가, 매년 집계한 인구수처럼 시간 순서대로 관측한 데이터는 사정이 다르다. 오늘의 매출은 어제의 매출과 무관하지 않다. 어제 매출이 높았다면 오늘도 높을 가능성이 크다. 이렇게 시간 순서 자체가 정보를 담고 있는 데이터를 시계열(time series)이라 부르고, 이 시간적 의존 관계를 분석하는 것이 시계열분석(time series analysis)이다.

쉽게 말하면: 시계열분석은 “어제·그제의 값을 알면 오늘·내일의 값을 얼마나 잘 짐작할 수 있는가”를 다루는 통계 기법이다.

정의

시계열(time series)은 시간 순서 t=1,2,3,,nt = 1, 2, 3, \ldots, n에 따라 일정한 간격(하루·한 달·한 해 등)으로 관측한 값 y1,y2,,yny_1, y_2, \ldots, y_n의 나열이다. 시계열분석의 목표는 크게 두 가지다. 첫째, 데이터의 패턴을 이해하는 것(과거에 어떤 흐름이 있었는가). 둘째, 그 패턴을 바탕으로 미래 값을 예측하는 것이다.

일상 예시를 들면, 편의점 사장님이 매일 아이스크림 판매량을 기록한다고 하자. 여름에는 많이 팔리고 겨울에는 적게 팔리는 패턴(계절성), 해마다 매출이 조금씩 느는 패턴(추세)이 함께 섞여 있다. 시계열분석은 이런 여러 패턴을 뜯어내어 각각을 이해하고, 다음 달 판매량을 예측하는 데 쓰인다.

시계열의 4가지 구성요소

왜 필요한가

시계열 데이터를 그래프로 그리면 지그재그로 오르락내리락하는 하나의 선으로 보인다. 이 하나의 선 안에는 사실 서로 다른 원인으로 생긴 여러 움직임이 겹쳐 있다. 이 움직임들을 따로 떼어내 이해하면, “왜 이렇게 움직였는가”를 설명하기 쉬워지고 예측도 정확해진다. 이렇게 시계열을 구성요소별로 나누는 작업을 시계열 분해(decomposition of time series)라 한다.

쉽게 말하면: 시계열 = 추세 + 순환 + 계절 + 불규칙, 네 가지 물결이 겹쳐서 하나의 그래프로 보이는 것이다.

정의

시계열의 4대 구성요소는 다음과 같다.

구성요소영문의미주기
추세요인trend factor장기간에 걸쳐 데이터가 증가하거나 감소하는 큰 흐름정해진 주기 없음(장기적)
순환요인cyclical factor경기 순환처럼 명확한 주기는 없지만 상승과 하강을 반복하는 움직임불규칙하게 긴 주기(보통 1년 이상)
계절요인seasonal factor1년 이하의 일정한 주기(분기·월·요일 등)로 반복되는 변동고정된 짧은 주기
불규칙요인irregular factor추세·순환·계절로 설명되지 않는 예측 불가능한 무작위 변동(잔차)없음

기출문제 확인 결과(ADsP 48회), 이 4가지 요소를 묻는 문항에서 “규칙요인”처럼 존재하지 않는 용어를 보기에 섞어 놓는 함정이 자주 나온다. 정확히 추세·순환·계절·불규칙 4가지만 존재한다는 점을 확실히 기억해야 한다.

추세요인과 순환요인을 헷갈리기 쉬운데, 구분 기준은 주기의 규칙성이다. 추세는 아예 주기 개념이 없는 장기 방향성(예: 인터넷 사용 인구가 20년간 꾸준히 증가)이고, 순환은 주기는 있지만 그 길이가 매번 달라지는 파동(예: 경기 호황과 불황이 37년마다 반복되지만 정확히 몇 년 주기인지는 매번 다름)이다. 반면 계절요인은 주기의 길이 자체가 고정되어 있다(예: 아이스크림은 매년 정확히 68월에 잘 팔린다).

작은 예시

편의점의 월별 아이스크림 매출을 3년치(36개월) 관측했다고 하자.

  • 추세: 3년 동안 편의점 브랜드 인지도가 올라가면서 매출이 전반적으로 완만히 우상향한다.
  • 계절: 매년 68월에는 매출이 크게 튀고, 122월에는 크게 줄어드는 패턴이 해마다 반복된다.
  • 순환: 소비 심리가 좋아졌다 나빠졌다 하는 경기 흐름에 따라 2~3년 단위로 완만히 오르내린다(주기가 정확히 일정하지 않음).
  • 불규칙: 어느 날 폭염특보로 갑자기 매출이 튀거나, 매장 앞 도로 공사로 갑자기 매출이 줄어드는 것처럼 원인은 있지만 패턴으로 잡히지 않는 변동이다.

시계열 분해는 이 관측값 yty_t를 각 요소로 분리하는 것이다. 요소들을 더해서 합치는 가법 모형(additive model, yt=Tt+Ct+St+Ity_t = T_t + C_t + S_t + I_t)과 곱해서 합치는 승법 모형(multiplicative model, yt=Tt×Ct×St×Ity_t = T_t \times C_t \times S_t \times I_t)이 있다. 계절 변동의 폭이 추세의 크기에 비례해 커지면(매출 규모가 커질수록 여름 성수기 변동폭도 커지는 경우) 승법 모형이, 계절 변동의 폭이 일정하면 가법 모형이 적합하다.

정상성: 시계열분석의 출발점

왜 필요한가

시계열 모형(자기회귀, 이동평균 등)의 대부분은 데이터가 일정한 통계적 성질을 유지한다는 전제 위에서 작동한다. 만약 평균이 계속 커지거나 변동 폭이 계속 요동친다면, “과거 패턴이 미래에도 유지된다”는 예측의 대전제 자체가 무너진다. 그래서 시계열분석에서는 본격적인 모형을 세우기 전에 데이터가 정상(stationary)인지 먼저 확인한다. 이 개념은 ADsP 시험에서 회차마다 거의 빠짐없이 출제되는 핵심 중의 핵심이다.

쉽게 말하면: 정상 시계열은 “시간이 지나도 성격이 변하지 않는” 시계열이다. 그래프의 굵은 흐름(평균)과 출렁이는 정도(분산)가 어느 구간을 보든 비슷해야 한다.

정의: 정상성의 3가지 조건

정상성(stationarity, 약정상성 weak stationarity 기준)은 다음 3가지 조건을 모두 만족해야 한다.

  1. 평균이 일정하다: 모든 시점 tt에서 E(yt)=μE(y_t) = \mu로 일정하다. 시점에 따라 평균이 계속 오르거나 내리면(추세가 있으면) 이 조건이 깨진다.
  2. 분산이 일정하다: 모든 시점 tt에서 Var(yt)=σ2Var(y_t) = \sigma^2로 일정하다. 시간이 갈수록 변동 폭이 커지거나 작아지면 이 조건이 깨진다.
  3. 공분산이 시차에만 의존한다: 두 시점 yty_tyt+hy_{t+h} 사이의 공분산(covariance, 두 변수가 함께 움직이는 정도)이 관찰 시점 tt가 언제인지와는 무관하고, 오직 두 시점 사이의 간격인 시차(lag, hh)에만 의존한다. 예를 들어 1월과 2월 사이의 공분산과, 7월과 8월 사이의 공분산이(둘 다 시차 1이므로) 같아야 한다.
E(yt)=μ(모든 t에서 동일)E(y_t) = \mu \quad (\text{모든 } t\text{에서 동일})
  • E(yt)E(y_t): 시점 tt에서 관측값의 기댓값(expected value, 평균)
  • μ\mu (뮤): 시점과 무관한 상수인 모집단 평균
Cov(yt,yt+h)=γhCov(y_t, y_{t+h}) = \gamma_h
  • Cov(yt,yt+h)Cov(y_t, y_{t+h}): 시점 tt의 값과 시차 hh만큼 떨어진 시점의 값 사이의 공분산
  • γh\gamma_h (감마): 시차 hh에만 의존하는 함수 값. 시점 tt가 바뀌어도 값이 같아야 정상성 조건을 만족한다.

자주 틀리는 함정 (47회 기출 변형): “백색잡음(white noise)은 대표적인 비정상 시계열이다”라는 보기가 오답으로 자주 나온다. 백색잡음은 평균이 0, 분산이 일정하고 자기상관(서로 다른 시점 값들 사이의 상관관계)이 전혀 없는 시계열로, 오히려 가장 이상적인 정상 시계열이다. 시계열 모형을 적합시킨 뒤 남은 잔차(residual)가 백색잡음이면 “모형이 데이터의 정보를 남김없이 뽑아냈다”고 해석한다. 또한 “자기상관계수가 시간에 따라 감소한다”는 보기도 정상성의 정의 자체는 아니므로 조건 3가지(평균·분산·공분산)와 혼동하지 않아야 한다.

정상화 방법: 차분과 변환

시계열이 정상성 조건을 만족하지 않으면(비정상 시계열이면), 모형을 적용하기 전에 정상 시계열로 바꿔줘야 한다. 이때 어떤 조건이 깨졌는지에 따라 처방이 다르다는 점이 시험에서 가장 자주 묻는 대응 관계다.

깨진 조건증상처방
평균이 일정하지 않음(추세 존재)그래프가 꾸준히 우상향하거나 우하향한다차분(differencing)
분산이 일정하지 않음(변동 폭이 시간에 따라 변함)뒤로 갈수록 그래프의 출렁임이 커지거나 작아진다변환(transformation, 대표적으로 로그 변환)

차분(differencing)은 현재 값에서 바로 이전 시점의 값을 빼는 연산이다.

yt=ytyt1y_t' = y_t - y_{t-1}
  • yty_t': 1차 차분(first-order differencing) 후의 값
  • yty_t: 현재 시점 tt의 관측값
  • yt1y_{t-1}: 바로 이전 시점의 관측값

예를 들어 매년 꾸준히 10씩 늘어나는 매출 100,110,120,130100, 110, 120, 130이 있다면, 차분한 값은 110100=10110-100=10, 120110=10120-110=10, 130120=10130-120=10으로 항상 10이 되어 더 이상 오르지 않는 평평한 시계열이 된다. 이렇게 차분은 “증가하는 추세” 자체를 제거해 평균을 일정하게 만든다. 1차 차분으로도 정상성이 확보되지 않으면 차분한 결과를 한 번 더 차분하는 2차 차분을 적용할 수 있다.

변환(transformation)은 값 자체의 스케일(scale, 척도)을 바꾸는 것으로, 대표적으로 로그 변환(log transformation, yty_t 대신 log(yt)\log(y_t)를 사용)을 쓴다. 만약 매출이 초반에는 100 근처에서 ±5 정도로 출렁이다가 나중에는 10,000 근처에서 ±500씩 출렁인다면, 절대적인 변동 폭은 커졌지만 상대적인 변동 비율(퍼센트 기준)은 비슷할 수 있다. 로그를 취하면 이런 “규모에 비례해 커지는 변동성”이 압축되어 분산이 안정된다.

쉽게 말하면: 평균이 슬금슬금 올라가면(추세) 차분으로 그 기울기를 깎아내고, 변동 폭 자체가 점점 커지면(분산 불안정) 로그를 씌워 눌러준다.

이렇게 정상화의 대응 관계는 차분(평균 문제 해결)과 변환(분산 문제 해결) 두 축으로 정리된다.

자주 틀리는 함정 (44회 기출): “구간 분할”, “분산제곱 통계량 적용”, “이상치 제거만 수행” 같은 보기가 정상화 방법으로 잘못 제시된다. 데이터를 여러 구간으로 나누는 것 자체는 평균·분산의 시간 의존성을 없애지 못하므로 정상화 방법이 아니다. 정상화의 정답은 항상 차분(평균 문제)과 변환(분산 문제) 두 축으로 기억해야 한다.

자기회귀·이동평균·ARIMA 모형 개요

왜 필요한가

시계열이 정상성을 확보했다면, 이제 “과거 값들을 이용해 현재·미래 값을 어떻게 설명할 것인가”를 모형화할 차례다. 가장 기본이 되는 두 가지 접근이 자기회귀와 이동평균이고, 이 둘을 결합해 비정상 시계열까지 다룰 수 있게 확장한 것이 ARIMA다.

쉽게 말하면: AR은 “과거 값 자체”로, MA는 “과거의 예측 실패(오차)“로 현재를 설명하는 방식이다.

정의

자기회귀 모형(AR, AutoRegressive model)은 현재 값을 자기 자신의 과거 값들의 선형결합으로 설명한다. pp개의 과거 시점을 사용하면 AR(pp)로 표기한다.

yt=ϕ1yt1+ϕ2yt2++ϕpytp+ϵty_t = \phi_1 y_{t-1} + \phi_2 y_{t-2} + \cdots + \phi_p y_{t-p} + \epsilon_t
  • yty_t: 현재 시점의 값
  • ϕi\phi_i (파이): 과거 ii번째 시점 값에 곱해지는 가중치(계수)
  • pp: 몇 시점 전까지의 과거 값을 사용하는지를 나타내는 자기회귀 차수
  • ϵt\epsilon_t (엡실론): 현재 시점의 오차항(백색잡음)

이동평균 모형(MA, Moving Average model)은 현재 값을 과거 시점들의 오차항(예측이 빗나간 정도)의 선형결합으로 설명한다. qq개의 과거 오차항을 사용하면 MA(qq)로 표기한다.

yt=ϵt+θ1ϵt1+θ2ϵt2++θqϵtqy_t = \epsilon_t + \theta_1 \epsilon_{t-1} + \theta_2 \epsilon_{t-2} + \cdots + \theta_q \epsilon_{t-q}
  • θi\theta_i (세타): 과거 ii번째 시점 오차항에 곱해지는 가중치
  • qq: 몇 시점 전까지의 과거 오차항을 사용하는지를 나타내는 이동평균 차수

AR과 MA가 헷갈리기 쉬운데, 구분 기준은 명확하다. AR은 과거 “값(관측치)“을 사용하고, MA는 과거 “오차(예측 실패분)“를 사용한다. 기출에서 이 둘을 서로 바꿔치기하는 문항이 반복 출제된다(122번 문항 사례: “AR(p)는 과거 오차항에 의존”, “MA(q)는 과거 관측값에 의존”으로 뒤바꿔 놓는 함정).

ARIMA(Autoregressive Integrated Moving Average, 자기회귀누적이동평균)는 AR과 MA에 차분(Integrated, 정상화 과정)을 결합한 모형으로, ARIMA(p,d,q)ARIMA(p, d, q)로 표기한다.

기호의미
ppAR 차수 — 몇 시점 전까지의 과거 값을 사용하는가
dd차분 차수 — 정상성을 확보하기 위해 몇 번 차분했는가
qqMA 차수 — 몇 시점 전까지의 과거 오차항을 사용하는가

pp, dd, qq는 모두 0 이상의 정수만 가능하며 음수가 될 수 없다. 예를 들어 ARIMA(1,1,1)ARIMA(1,1,1)은 “1차 차분으로 정상화한 뒤, 과거 1시점의 값과 과거 1시점의 오차항을 함께 사용해 현재 값을 예측하는 모형”이라는 뜻이다. 만약 d=0d=0이면 이미 정상 시계열이라는 뜻이고, 이때는 ARIMA가 사실상 ARMA(pp, qq)와 같아진다.

모형을 구축하는 실제 순서(Box-Jenkins 절차)는 다음과 같다.

  1. 정상성 확인 및 차분: 시계열이 정상인지 확인하고, 비정상이면 차분·변환으로 정상화한다(차수 dd 결정).
  2. 모형 식별: 자기상관함수(ACF)와 부분자기상관함수(PACF)라는 그래프를 보고 AR 차수 pp와 MA 차수 qq의 후보를 정한다.
  3. 모수 추정: 정해진 pp, dd, qq 조합에서 ϕ\phi, θ\theta 등의 계수를 데이터로부터 추정한다.
  4. 잔차 진단: 모형을 적합시킨 후 남은 잔차가 백색잡음에 가까운지 확인한다. 백색잡음이 아니면 모형이 아직 정보를 다 뽑아내지 못한 것이므로 pp, qq를 조정해 다시 추정한다.
  5. 예측: 진단을 통과한 최종 모형으로 미래 값을 예측한다.

자주 틀리는 함정 (47회 기출): “자기회귀 차수를 먼저 정하고 차분 차수를 정한다”는 보기가 오답으로 나온다. 실제 순서는 반대다 — 먼저 차분으로 정상성을 확보(d 결정)한 뒤에, 정상화된 시계열의 ACF·PACF를 보고 pp, qq를 정한다. 차분이 먼저라는 순서를 정확히 기억해야 한다.

핵심 정리

  • 시계열은 추세·순환·계절·불규칙 4가지 요소로 분해할 수 있으며, 정확히 이 4개만 존재한다.
  • 정상성의 3가지 조건은 평균 일정, 분산 일정, 공분산이 시차에만 의존이다.
  • 평균이 일정하지 않으면(추세) 차분을, 분산이 일정하지 않으면 변환(로그 등)을 적용해 정상화한다.
  • AR은 과거 값으로, MA는 과거 오차항으로 현재를 설명하며, ARIMA(p, d, q)는 둘에 차분(d)을 결합한 모형이다.
  • 모형 구축은 정상화(차분) → 식별(ACF·PACF로 p, q 결정) → 추정 → 잔차 진단(백색잡음 확인) → 예측 순서로 진행한다.

마무리 복습

문제 14지선다
정상 시계열이 만족해야 하는 3가지 조건으로 옳지 않은 것은?
문제 24지선다
시계열의 4대 구성요소에 해당하지 않는 것은?
문제 34지선다
평균이 일정하지 않아 추세가 뚜렷한 비정상 시계열을 정상화하는 가장 대표적인 방법은?
문제 44지선다
분산이 시간에 따라 점점 커지는 비정상 시계열을 안정화하는 데 가장 적합한 방법은?
문제 54지선다
자기회귀 모형 AR(p)에 대한 설명으로 가장 적절한 것은?
문제 64지선다
ARIMA(1, 1, 1) 모형에 대한 해석으로 옳은 것은?
문제 74지선다
시계열 모형을 구축하는 Box-Jenkins 절차의 순서로 가장 적절한 것은?
문제 84지선다
백색잡음(white noise)에 대한 설명으로 가장 적절한 것은?

참고 자료

Last updated on