이번 문서의 목표: 여러 분석 과제 중 무엇을 먼저 할지 시급성과 난이도 축으로 판정하고, 비즈니스 목표를 모델 평가지표로 번역하며, 우선순위 기준으로 부적절한 것을 골라낼 수 있게 된다.
왜 과제 정의가 어려운가
분석 조직이 만들어지면 곧바로 부딪히는 문제가 있습니다. 하고 싶은 일은 서른 개인데 할 수 있는 일은 세 개라는 것입니다. 사람과 시간이 한정되어 있기 때문입니다.
이때 “가장 재미있어 보이는 것”이나 “가장 최신 기술을 쓸 수 있는 것”을 고르면 프로젝트는 실패합니다. 조직에 도움이 되지 않는 분석에 자원을 썼기 때문입니다. 그래서 무엇을 먼저 할지 정하는 기준이 필요합니다.
쉽게 말하면: 이 편은 “무엇을 분석할 것인가”와 “그 분석이 성공했다는 것을 어떻게 알 것인가”를 정하는 편입니다.
7편이 어떤 절차로 할지를 다뤘다면, 이 편은 무엇을 왜 먼저 할지를 다룹니다.
1. 분석 로드맵 설정
분석 과제를 실행 계획으로 만드는 흐름은 세 단계입니다.
- 분석 대상 도출: 업무 프로세스와 비즈니스 모델에서 분석할 만한 과제 후보를 뽑습니다(7편의 하향식·상향식 접근)
- 우선순위 평가: 후보들을 기준에 따라 줄 세웁니다
- 이행계획 수립: 단기·중기·장기로 나눠 로드맵을 만듭니다
2. 우선순위 평가 — ROI 관점의 두 축
ROI(Return On Investment, 투자자본수익률)는 투자한 것 대비 얼마나 돌려받는가를 보는 관점입니다. 분석 과제의 우선순위도 이 관점에서 두 축으로 평가합니다.
| 축 | 평가 기준 | 무엇을 보는가 |
|---|---|---|
| 시급성 | 전략적 중요도, 목표 가치 | 지금 하지 않으면 손해가 큰가 |
| 난이도 | 데이터 확보·가공 비용, 분석 수행 비용, 분석 복잡도 | 실제로 해낼 수 있는가, 얼마나 드는가 |
두 축으로 만드는 사분면
해석: 가장 먼저 하는 것은 시급하면서 쉬운 과제입니다. 이 과제로 빠르게 성과를 내면 조직 안에서 분석에 대한 신뢰가 쌓이고, 그 신뢰로 어려운 과제에 필요한 자원을 확보할 수 있습니다. 반대로 첫 과제로 시급하고 어려운 것을 고르면, 몇 달간 성과가 없어 프로젝트 자체가 중단될 위험이 큽니다.
자주 틀리는 판단: “난이도가 낮은 것부터 무조건 한다”도 틀렸습니다. 시급성이 낮은 쉬운 과제만 계속하면 아무도 필요로 하지 않는 분석을 빠르게 많이 하는 상태가 됩니다.
3. 우선순위 기준으로 부적절한 것 — 기출 판정
기출은 우선순위 기준 네 개를 주고 직접 기준으로 보기 어려운 것을 고르게 합니다.
| 보기 | 판정 | 이유 |
|---|---|---|
| 전략적 중요도 | 적절 | 시급성 축의 핵심 기준 |
| 기대되는 투자 효과 | 적절 | ROI 관점의 직접 기준 |
| 실행 가능성 | 적절 | 난이도 축의 핵심 기준 |
| 개별 원천 데이터의 필드명 일치율 | 부적절 | 세부 데이터 적합성 점검 항목이지 전략 우선순위의 축이 아님 |
해석: 필드명 일치율은 실무에서 중요한 점검 항목이 맞습니다. 그러나 그것은 과제를 선정한 다음, 데이터 준비 단계에서 확인할 세부 사항입니다. “어느 과제를 먼저 할까”라는 전략적 판단의 축이 되지는 않습니다.
이 유형의 판정 요령: 보기가 전략 수준인가 실무 세부 수준인가를 보세요. 전략적 중요도·투자 효과·실행 가능성은 경영진이 판단하는 수준이고, 필드명 일치율은 담당자가 확인하는 수준입니다.
분석 마스터플랜의 적용 범위 기준
같은 유형이 마스터플랜 문제로도 나옵니다. 적용 범위와 도입 우선순위를 정하는 직접 기준은 다음과 같습니다.
| 기준 | 내용 |
|---|---|
| 데이터 적용성 | 사용 가능한 데이터가 있는가 |
| 기술 적용 가능성 | 필요한 기술을 적용할 수 있는가 |
| 업무 내재화 가능성 | 결과를 업무 프로세스에 녹여 넣을 수 있는가 |
기출 오답 보기: “담당자가 당장 실행하기 편한 정도만을 단독 기준으로 삼기”가 부적절한 것으로 나옵니다. 개인의 단기 실행 편의로 전사 마스터플랜의 범위를 정하는 것은 전략적 판단이 아니기 때문입니다.
쉽게 말하면: 우선순위 문제의 오답 보기는 대부분 “개인 편의”나 “지엽적 기술 항목” 입니다.
4. 문제 정의와 가설 설정
문제 정의의 조건
7편에서 비즈니스 요구를 분석 목표로 번역하는 것을 봤습니다. 그 번역이 제대로 되었는지 판정하는 조건이 있습니다.
- 대상이 명확한가 — 누구를, 무엇을 예측·설명하는가
- 기간이 명확한가 — 언제의 데이터로 언제를 예측하는가
- 성공 기준이 있는가 — 어느 정도면 성공인가
- 행동으로 이어지는가 — 결과를 받아 무엇을 할 것인가
4번이 가장 자주 빠집니다. “이탈 확률을 예측한다”까지는 하는데, “그래서 확률이 높은 고객에게 무엇을 할 것인가”가 정해지지 않으면 모형은 만들어져도 쓰이지 않습니다. 8편에서 본 “기술적으로 성공했지만 아무도 쓰지 않는 프로젝트” 가 여기서 태어납니다.
가설 설정
가설(hypothesis)은 “이럴 것이다”라고 미리 세우는 검증 가능한 주장입니다.
| 나쁜 가설 | 좋은 가설 |
|---|---|
| 고객 만족도가 중요할 것이다 | 최근 3개월 내 상담 이력이 있는 고객의 이탈률이 그렇지 않은 고객보다 높을 것이다 |
| 배송이 매출에 영향을 줄 것이다 | 배송 지연 경험이 1회 이상인 고객의 재구매율이 20퍼센트 이상 낮을 것이다 |
좋은 가설의 조건: 변수가 지정되어 있고, 방향이 있고, 데이터로 참·거짓을 판정할 수 있어야 합니다. 이 조건은 15편의 가설검정에서 귀무가설·대립가설을 세우는 방식으로 그대로 이어집니다.
5. 성과지표 설정 — KPI와 모델 지표의 연결
이 부분이 이 편의 핵심이자, 4과목(20편·21편·22편)과 이어지는 다리입니다.
두 종류의 지표
| 구분 | 무엇을 재는가 | 예시 | 누가 보는가 |
|---|---|---|---|
| 비즈니스 KPI | 조직의 성과 | 매출, 이탈률, 재구매율, 비용 절감액 | 경영진·현업 |
| 모델 평가지표 | 모형의 예측 성능 | 정확도, 정밀도, 재현율, F1, RMSE | 분석가 |
KPI(Key Performance Indicator, 핵심성과지표)는 목표 달성 정도를 재는 대표 지표입니다.
왜 둘을 구분해야 하는가: 모델 정확도가 95퍼센트라는 사실만으로는 경영진에게 아무 의미가 없습니다. 반대로 “이탈률을 3퍼센트포인트 낮춘다”는 목표만으로는 분석가가 무엇을 최적화할지 알 수 없습니다. 둘을 연결하는 것이 성과지표 설정입니다.
연결의 예시 — 이탈 방지 캠페인
- 비즈니스 목표: 분기 이탈률을 8퍼센트에서 6퍼센트로 낮춘다
- 행동 계획: 이탈 위험이 높은 고객 상위 5000명에게 혜택 쿠폰을 발송한다
- 모델의 역할: 이탈 위험 상위 5000명을 선별한다
- 모델 지표 선택: 발송 대상 안에 실제 이탈 예정자가 얼마나 포함되는가 → 정밀도(precision)가 중요
- 성공 기준: 상위 5000명 중 실제 이탈 예정자 비율이 40퍼센트 이상
해석: 여기서 왜 정밀도인지가 중요합니다. 쿠폰 발송에는 비용이 들기 때문에, 보낸 사람 중에 진짜 이탈 위험자가 얼마나 있는가가 비용 효율을 결정합니다. 반대로 예산이 넉넉하고 한 명이라도 놓치면 손실이 크다면, 실제 이탈자 중 몇 명을 잡아냈는가를 재는 재현율(recall)이 더 중요합니다.
| 상황 | 중요한 지표 | 이유 |
|---|---|---|
| 조치 비용이 크다 (쿠폰·인력 투입) | 정밀도 | 헛된 조치를 줄여야 함 |
| 놓쳤을 때 손실이 크다 (암 진단, 설비 고장) | 재현율 | 실제 사례를 놓치면 안 됨 |
| 둘 다 중요하다 | F1 점수 | 두 지표의 균형 |
해석: 이 표는 20편에서 공식과 계산으로 다시 다룹니다. 여기서 잡아 둘 것은 “어떤 지표를 쓸지는 기술이 아니라 비즈니스 상황이 결정한다” 는 원칙입니다.
지표 설정의 함정
- 최적화 대상이 여러 개면 아무것도 최적화되지 않습니다. “정확도도 높이고 속도도 빠르고 해석도 쉽게”라는 목표는 실행 불가능합니다. 주 지표 하나와 제약 조건 몇 개로 정리해야 합니다
- 지표가 목표를 대체하면 왜곡이 생깁니다. 콜센터의 KPI를 “통화 건수”로 잡으면 상담원이 통화를 빨리 끊습니다. 지표는 목표의 대리물일 뿐이므로, 지표를 올리는 것이 목표를 해치지 않는지 확인해야 합니다
- 기준선이 없으면 성공을 판정할 수 없습니다. “정확도 80퍼센트”가 좋은 성능인지 알려면, 아무 모형 없이 다수 범주로 다 찍었을 때의 정확도(기준선)를 알아야 합니다. 불균형 데이터에서는 다 찍기만 해도 95퍼센트가 나올 수 있습니다(20편)
6. 범위·자원·일정 계획
범위 정의
범위(scope, 스코프)는 이 프로젝트가 무엇을 하고 무엇을 하지 않는가입니다. “하지 않는 것”을 명시하는 것이 특히 중요합니다.
| 포함 | 제외 |
|---|---|
| 국내 온라인 채널 고객의 이탈 예측 | 오프라인 매장 고객 |
| 최근 24개월 거래 데이터 기반 | 상담 음성 데이터 분석 |
| 월 1회 배치 예측 | 실시간 예측 API 제공 |
왜 제외를 적는가: 적어 두지 않으면 프로젝트 중간에 “오프라인 고객도 되죠?”라는 요구가 들어옵니다. 이렇게 범위가 야금야금 넓어지는 현상을 범위 확대(scope creep)라고 하며, 7편의 위험 요소 중 하나였습니다.
자원 계획
| 자원 | 확인할 것 |
|---|---|
| 인력 | 분석가·데이터 엔지니어·현업 담당자의 참여 시간 |
| 데이터 | 필요한 데이터의 존재·접근 권한·품질 |
| 인프라 | 저장·연산 자원, 도구 라이선스 |
| 예산 | 외부 데이터 구매, 인프라 비용 |
가장 자주 과소평가되는 자원: 데이터 준비 시간입니다. 실제 프로젝트에서 데이터 확보·정제에 드는 시간이 전체의 절반을 넘는 경우가 흔합니다. 모델링에만 일정을 잡으면 반드시 지연됩니다.
일정 계획
일정은 단계별 산출물과 검토 시점으로 구성합니다. 7편의 5단계 절차(분석 기획 → 데이터 준비 → 데이터 분석 → 시스템 구현 → 평가 및 전개)를 그대로 마디로 씁니다.
각 마디마다 “다음으로 갈지 여기서 멈출지”를 결정하는 검토 지점을 두는 것이 핵심입니다. 데이터 준비 단계에서 필요한 데이터가 없다는 것이 드러났다면, 모델링에 자원을 더 쓰기 전에 과제 자체를 재정의해야 합니다.
7. 과제 정의서에 들어가는 것
지금까지의 내용을 하나의 문서로 정리하면 다음과 같습니다.
| 항목 | 내용 |
|---|---|
| 과제명 | 온라인 고객 이탈 예측 및 방지 캠페인 |
| 배경·문제 | 최근 3분기 연속 이탈률 상승, 원인 파악 안 됨 |
| 분석 목표 | 향후 30일 내 이탈 가능성 상위 5000명 선별 |
| 가설 | 최근 접속 간격과 상담 이력이 이탈과 관련이 있을 것이다 |
| 데이터 | 최근 24개월 거래·접속·상담 데이터 (내부) |
| 성과지표 | 상위 5000명의 정밀도 0.4 이상, 분기 이탈률 2퍼센트포인트 감소 |
| 범위 | 국내 온라인 채널 한정, 음성 데이터 제외 |
| 자원·일정 | 분석가 2명 3개월, 데이터 준비 6주 포함 |
| 위험 | 상담 데이터 접근 권한 미확보 시 지연 |
해석: 이 문서가 완성되면 7편의 CRISP-DM에서 “업무 이해” 단계가 끝난 것입니다. 여기서 정한 성과지표가 20편·21편의 평가로 이어지고, 여기서 정한 범위가 프로젝트 내내 요구 변경을 막아 줍니다.
핵심 정리
- 분석 로드맵은 분석 대상 도출 → 우선순위 평가 → 단기·중기·장기 이행계획 순으로 만든다.
- 우선순위는 ROI 관점에서 시급성(전략적 중요도·목표 가치) 과 난이도(데이터 확보·가공 비용·분석 복잡도) 두 축으로 평가하며, 시급하고 쉬운 과제부터 실행한다.
- 필드명 일치율이나 담당자의 실행 편의는 전략 우선순위의 직접 기준이 아니다. 마스터플랜 기준은 데이터 적용성·기술 적용 가능성·업무 내재화 가능성이다.
- 좋은 문제 정의는 대상·기간·성공 기준·후속 행동이 모두 정해져 있고, 좋은 가설은 변수·방향·검증 가능성을 갖춘다.
- 비즈니스 KPI와 모델 평가지표를 연결해야 하며, 조치 비용이 크면 정밀도, 놓침의 손실이 크면 재현율을 중시한다.
- 범위 정의에서는 제외 항목을 명시해 범위 확대를 막고, 자원 계획에서 데이터 준비 시간을 충분히 잡는다.