이번 문서의 목표: 빅데이터의 가치와 위기 요인을 설명하고, 데이터 거버넌스·조직 구조·품질 차원을 구분하며, 가명정보와 익명정보의 법적 지위 차이와 비식별 기법 네 가지를 사례로 판정할 수 있게 된다.
왜 이 편이 1과목의 승부처인가
1과목에서 과락이 나는 지점은 대부분 이 편의 내용입니다. 개인정보 관련 용어, 비식별 기법, 조직 구조, 품질 차원은 모두 이름이 비슷하고 정의가 미묘하게 다릅니다. 이해로 메울 수 없고 정확히 외웠는지로만 갈립니다.
쉽게 말하면: 이 편은 “가명정보는 개인정보인가, 익명정보는 개인정보인가” 같은 질문에 0.5초 안에 답할 수 있게 만드는 편입니다.
3편에서 데이터·데이터베이스·빅데이터의 형태와 저장 시스템을 다뤘다면, 이 편은 그 데이터를 조직이 어떻게 관리하고 어떤 위험을 통제하는가를 다룹니다.
1. 빅데이터의 가치 — 왜 데이터가 자산인가
빅데이터의 특징인 3V(Volume·Velocity·Variety)와 확장 요소 Veracity·Value는 3편에서 정리했습니다. 여기서는 그 Value(가치) 가 어떻게 만들어지는지를 봅니다.
가트너의 분석 유형 네 가지
데이터로 무엇을 하는가를 네 단계로 나눈 분류입니다. 묘사 → 진단 → 예측 → 처방 순으로 난도와 가치가 함께 올라갑니다.
| 유형 | 분석 대상 | 목적 | 예시 |
|---|---|---|---|
| 묘사분석(descriptive) | 과거나 현재 어떤 사건이 발생했는지 | 과거 결과 이해, 추세 발견 | 지난달 지역별 매출 집계 |
| 진단분석(diagnostic) | 사건의 원인 | 특정 결과가 발생한 원인 파악 | 매출 하락의 원인이 배송 지연임을 확인 |
| 예측분석(predictive) | 미래에 어떤 일이 발생할 것인지 | 미래 결과나 알려지지 않은 결과의 가능성 파악 | 다음 달 이탈 가능 고객 예측 |
| 처방분석(prescriptive) | 무엇을 해야 도움이 되는가 | 최적의 의사결정과 행동 방안 제시 | 이탈 위험 고객에게 어떤 혜택을 줄지 결정 |
판정 요령: 문제의 상황이 과거를 보고 있으면 묘사, 원인을 캐면 진단, 미래를 보면 예측, 행동을 정하면 처방입니다. 순서를 묻는 문제가 자주 나오므로 “묘사 → 진단 → 예측 → 처방”을 통째로 외워 두세요.
데이터 산업의 발전 과정
데이터 산업은 데이터 처리 → 통합 → 분석 → 연결 및 활용 순으로 발전해 왔습니다. 처음에는 데이터를 저장·처리하는 것 자체가 과제였고, 이후 흩어진 데이터를 통합하는 단계를 거쳐, 분석으로 가치를 뽑아내고, 지금은 여러 기관의 데이터를 연결해 활용하는 단계에 있습니다.
마이데이터(MyData)는 이 마지막 단계를 대표하는 제도입니다. 개인이 자신의 데이터를 직접 관리·통제하고, 본인의 동의에 따라 여러 기관에 흩어진 개인정보를 한 곳에 모아 활용할 수 있게 하는 제도와 서비스입니다. 금융 분야에서 개인신용정보 전송요구권의 형태로 먼저 자리잡았습니다.
2. 빅데이터의 위기 요인과 통제 방안
기출이 매우 좋아하는 표입니다. 위기 요인과 그 통제 방안을 짝짓는 형태로 나옵니다.
| 위기 요인 | 문제 상황 | 통제 방안 |
|---|---|---|
| 사생활 침해 | 수집·결합으로 개인이 드러남 | 매번 동의를 받기보다 개인정보 사용자에게 책임을 부여(사용자 책임제) |
| 책임 원칙 훼손 | 예측 결과만으로 아직 하지 않은 일에 불이익을 줌 | 결과가 아닌 행위에 대한 책임 원칙 유지 |
| 데이터 오용 | 잘못된 인사이트로 잘못된 결정 | 알고리즘의 투명성과 접근성을 보장해 분석 결과를 검증 가능하게 함 |
해석: 사생활 침해의 통제 방안이 “동의 강화”가 아니라 “사용자 책임 부여”라는 점이 함정입니다. 빅데이터 환경에서는 수집 시점에 모든 활용을 예측해 동의를 받는 것이 현실적으로 불가능하므로, 동의 중심에서 사용하는 쪽의 책임 중심으로 무게를 옮기자는 것이 이 통제 방안의 취지입니다.
책임 원칙 훼손은 조금 추상적이라 예를 들어 둡니다. 범죄 예측 모형이 “이 사람은 범죄를 저지를 확률이 높다”고 판정했다는 이유로 아무 행위도 하지 않은 사람에게 불이익을 준다면, 근대 법의 기본인 “행위에 대해 책임진다”는 원칙이 무너집니다.
3. 데이터 거버넌스
데이터 거버넌스(Data Governance)는 조직 내 데이터가 제대로 관리·활용될 수 있도록 정책, 프로세스, 역할, 책임을 정의하고 운영하는 체계입니다. governance는 “통치·관리 체계”라는 뜻입니다.
쉽게 말하면: 데이터를 다루는 조직의 헌법과 그 집행 조직입니다.
왜 필요한가: 데이터가 부서마다 따로 만들어지면 같은 “고객”이라는 단어를 부서마다 다르게 정의합니다. 영업은 계약자를, 서비스는 이용자를 고객이라 부르면, 두 부서의 고객 수가 영원히 맞지 않습니다. 거버넌스는 용어·코드·형식의 표준을 정하고, 누가 그 표준을 지킬 책임이 있는지를 정합니다.
거버넌스의 구성 요소
| 요소 | 내용 |
|---|---|
| 원칙(principle) | 데이터 관리의 기준과 지침 |
| 조직(organization) | 데이터를 관리할 역할과 책임 |
| 프로세스(process) | 데이터 관리 활동의 절차 |
데이터 표준화와 메타데이터 관리
- 데이터 표준화: 용어·코드·도메인·형식을 조직 차원에서 통일하는 활동입니다. 예를 들어 성별 코드를 어떤 시스템은 M/F로, 다른 시스템은 1/2로 쓰면 통합할 때마다 변환이 필요하고 오류가 생깁니다
- 메타데이터 관리: 3편에서 다룬 “데이터에 관한 데이터”를 체계적으로 수집·관리하는 활동입니다. 각 열의 의미·단위·출처·생성 규칙을 기록해 두면, 새로 합류한 분석가도 그 데이터를 올바르게 해석할 수 있습니다
4. 빅데이터 조직 구조 — 헷갈리는 세 가지
분석 조직을 어떻게 배치할 것인가에 세 유형이 있습니다. 이름이 비슷해서 매 회차 함정으로 쓰입니다.
| 구조 | 배치 방식 | 장점 | 단점 |
|---|---|---|---|
| 집중구조 | 분석 전담 부서를 별도로 둔다 | 전문성 축적, 전사 우선순위 조정 가능 | 현업과 거리가 생김, 중복 업무 발생 가능 |
| 기능구조 | 각 현업 부서가 직접 분석한다 | 업무 맥락 이해가 깊음 | 전사적 관점 부족, 부서 간 중복·단절 |
| 분산구조 | 분석 인력을 부서별로 나눠 배치한다 | 현업 밀착 + 전사 협업 가능 | 인력 관리·기준 통일이 어려움 |
집중구조와 분산구조의 결정적 차이: 둘 다 분석 전문 인력이 있다는 점은 같습니다. 차이는 그 인력이 한곳에 모여 있는가, 각 부서로 나가 있는가입니다. 집중구조는 전담 부서 안에 모여 있고, 분산구조는 전사 분석 조직의 인력이 각 현업 부서로 파견되어 배치됩니다.
기능구조의 차이: 기능구조에는 분석 전담 인력 자체가 별도로 없습니다. 각 부서의 현업 담당자가 자기 업무의 분석을 직접 합니다.
쉽게 말하면: 집중은 “분석팀이 따로 있다”, 기능은 “각자 알아서 한다”, 분산은 “분석 인력이 각 부서에 나가 있다”입니다.
5. 데이터 사이언티스트의 역량
| 구분 | 내용 |
|---|---|
| 하드 스킬(Hard Skill) | 빅데이터에 대한 이론적 지식, 분석 기술에 대한 숙련 |
| 소프트 스킬(Soft Skill) | 통찰력 있는 분석, 설득력 있는 전달, 다분야 간 협력 |
판정 요령: 기출은 보기를 주고 “소프트 스킬에 가장 가까운 역량은?”을 묻습니다. 분산 처리 프레임워크 설정, 통계적 추정량 계산, 머신러닝 알고리즘 구현은 모두 기술이므로 하드 스킬이고, 서로 다른 부서의 관점을 통합해 분석 결과를 설득력 있게 전달하는 것이 소프트 스킬입니다.
함께 나오는 함정: “객관성을 위해 도메인 지식은 의도적으로 배제한다”는 보기는 언제나 틀린 설명입니다. 객관성은 근거와 절차로 확보하는 것이지, 필요한 배경지식을 제거해서 얻는 것이 아닙니다. 도메인 지식이 없으면 지표의 의미조차 해석할 수 없습니다.
분석 성숙도
조직의 분석 수준을 진단하는 단계입니다.
| 단계 | 설명 |
|---|---|
| 도입 단계 | 분석을 시작하며 환경과 시스템을 구축 |
| 활용 단계 | 분석 결과를 실제 업무에 적용 |
| 확산 단계 | 전사 차원에서 분석을 관리하고 공유 |
| 최적화 단계 | 분석이 성과 향상에 기여 |
진단 관점의 함정: 성숙도를 진단하는 표준 관점은 분석 데이터의 확보·관리 수준, 분석 기법과 방법론의 수준, 분석을 지원하는 IT 인프라 역량, 분석 인력·조직입니다. 기출은 여기에 “조직 전체 종업원 수”를 끼워 넣고 “거리가 먼 것”을 고르게 합니다. 종업원 수는 조직 규모일 뿐 분석 성숙도의 진단 축이 아닙니다.
6. 데이터 품질 여섯 차원 — 다시, 정확히
3편에서 표로 정리한 품질 차원을 여기서는 판정 기준까지 붙여 확실히 굳힙니다.
| 차원 | 묻는 질문 | 미달 상황 | 조치 방향 |
|---|---|---|---|
| 완전성 | 필요한 값이 다 채워졌는가 | 필수값 기록률 97퍼센트, 기준 98퍼센트 | 미기록 필수값 보완 |
| 정확성 | 값이 사실과 맞는가 | 등록 주소가 실제와 다름 | 원천 확인 후 값 수정 |
| 일관성 | 시스템 간에 값이 어긋나지 않는가 | A는 남, B는 여로 저장 | 표준·마스터 데이터 정비 |
| 무결성 | 정당한 절차 밖의 변경·훼손이 없는가 | 전송 중 값이 변조됨 | 접근 통제·검증 절차 강화 |
| 적시성 | 필요한 시점의 최신 값인가 | 갱신이 하루 늦음 | 갱신 주기 단축 |
| 접근성 | 필요한 사람이 얻을 수 있는가 | 권한이 없어 조회 불가 | 권한·제공 채널 정비 |
무결성이 헷갈리는 이유: 무결성(integrity)은 “값이 맞다”는 정확성과 비슷해 보입니다. 차이는 관심의 초점입니다. 정확성은 “이 주소가 실제 주소와 같은가”를 보고, 무결성은 “저장·전송·가공 과정에서 승인되지 않은 변경이나 훼손 없이 유지되었는가”를 봅니다. 기출은 “데이터가 수집된 뒤 저장·전송·가공되는 전 과정에서 승인되지 않은 변경이나 훼손 없이 유지되도록 하는 품질 속성”이라는 문장으로 무결성을 묻습니다.
품질 진단 방법
- 프로파일링(profiling): 값의 분포, 결측, 중복, 최댓값·최솟값을 자동으로 훑어 이상을 탐색합니다
- 업무 규칙 점검: 업무 규칙을 점검식으로 바꿔 데이터 오류를 탐지합니다. 예를 들어 “가입일은 오늘보다 미래일 수 없다”, “할인가는 정가보다 클 수 없다”를 식으로 만들어 위반 건수를 셉니다
함정: “업무 규칙은 프로세스 설명에만 쓰이며 데이터 검증에는 사용할 수 없다”는 보기가 오답으로 나옵니다. 업무 규칙은 데이터 값의 유효성과 일관성을 검사하는 데도 적극적으로 활용됩니다.
7. 개인정보와 비식별 처리 — 최다 출제 지점
개인정보·가명정보·익명정보
세 용어의 법적 지위 차이가 핵심입니다.
| 구분 | 정의 | 개인정보에 해당하는가 |
|---|---|---|
| 개인정보 | 살아있는 개인에 관한 정보, 또는 다른 정보와 결합해 알아볼 수 있는 정보 | 해당함 |
| 가명정보 | 개인정보의 일부를 삭제·대체해 추가 정보 없이는 개인을 알아볼 수 없게 처리한 정보 | 해당함 |
| 익명정보 | 다른 정보와 결합해도 개인을 알아볼 수 없는 정보 | 해당하지 않음 |
쉽게 말하면: 가명정보는 “열쇠만 있으면 되돌릴 수 있는” 상태라 여전히 개인정보이고, 익명정보는 “되돌릴 방법이 없는” 상태라 개인정보가 아닙니다.
시험에서 가장 중요한 한 줄: 가명처리한 정보는 통계 작성, 과학적 연구, 공익적 기록 보존 등의 목적으로 정보주체의 동의 없이 활용할 수 있습니다. 이것이 데이터 3법 개정의 핵심 내용이며, “가명정보는 개인정보가 아니므로 자유롭게 쓴다”는 잘못된 서술과 구분해야 합니다. 가명정보는 여전히 개인정보이지만, 특정 목적에 한해 동의 예외가 적용되는 것입니다.
비식별 처리 기법
| 기법 | 방식 | 예시 |
|---|---|---|
| 데이터 마스킹 | 식별 가능한 값의 전부 또는 일부를 다른 문자로 가림 | 전화번호를 010-****-4821로 표시 |
| 라운딩(수치 반올림) | 수치를 지정한 자릿수나 간격의 경계값으로 바꿈 | 나이 37세를 10세 단위로 반올림해 40세로 |
| 범주화 | 값을 구간이나 범주로 묶음 | 나이 37세를 30대로 |
| 총계처리 | 개별 값 대신 합계·평균 등 집계값으로 대체 | 개인 급여 대신 부서 평균 급여 |
| 데이터 삭제(식별자 삭제) | 식별 가능한 항목 자체를 제거 | 주민등록번호 열을 통째로 삭제 |
| 잡음 추가 | 원래 값에 임의의 오차를 더함 | 나이에 무작위로 ±2를 더함 |
| 가명값 연결(가명처리) | 식별자를 규칙적인 대체값으로 바꿈 | 홍길동을 회원A로 |
라운딩과 범주화의 경계: 둘 다 정밀도를 낮추는 기법이라 헷갈립니다. 라운딩은 결과가 여전히 하나의 수치(40세)이고, 범주화는 결과가 구간·범주(30대)입니다. 기출은 “나이 37세를 10세 단위로 반올림하여 40세로 표시”라는 문장을 주고 라운딩을 고르게 합니다. 여기서 결과가 “40세”라는 값이라는 점이 판정의 열쇠입니다.
마스킹의 판정 단서: 별표나 다른 문자로 가려진 형태가 화면에 보이면 마스킹입니다.
민감정보와 고유식별정보
| 구분 | 포함되는 것 |
|---|---|
| 민감정보 | 사상·신념, 노동조합·정당의 가입·탈퇴, 정치적 견해, 건강·성생활 관련 정보, 유전정보, 범죄경력자료 |
| 고유식별정보 | 주민등록번호, 외국인등록번호, 여권번호, 운전면허번호 |
구분 기준: 고유식별정보는 개인을 유일하게 특정하기 위해 부여된 번호이고, 민감정보는 유출 시 차별이나 인격권 침해로 이어질 수 있는 내용입니다.
개인정보 수집·이용 동의 시 필수 고지 사항
- 개인정보의 수집 및 이용 목적
- 수집하려는 개인정보의 항목
- 개인정보의 보유 및 이용 기간
- 동의를 거부할 권리가 있다는 사실 및 거부에 따른 불이익이 있는 경우 그 내용
수집 원칙: 개인정보는 목적에 필요한 범위에서 최소한으로, 적법하고 정당하게 수집해야 합니다. “많이 모아 두면 나중에 쓸 데가 있다”는 태도는 이 원칙 위반입니다.
8. 데이터 3법
데이터 3법은 2020년 개정된 세 법률을 묶어 부르는 이름입니다.
| 법률 | 핵심 키워드 |
|---|---|
| 개인정보 보호법 | 가명정보 개념 도입, 가명처리 시 동의 없이 활용 가능 |
| 정보통신망법 | 개인정보 관련 조항을 개인정보 보호법으로 이관 → 중복 규제 해소 |
| 신용정보법 | 마이데이터, 안전한 금융데이터 활용, 개인신용정보 전송요구권 |
기출 함정 — 데이터 3법에 속하지 않는 법률: 기출은 업무 네 개를 주고 모두 “데이터 3법 개정 대응”으로 분류한 뒤, 잘못 분류된 것을 고르게 합니다. 여기서 공공데이터의 제공 및 이용 활성화에 관한 법률(공공데이터법) 이 정답으로 나옵니다. 공공기관 보유 데이터의 목록 등록·개방을 공공데이터법과 연결한 것 자체는 맞지만, 그 법률은 데이터 3법 묶음에 속하지 않습니다.
해석: 이 문제 유형은 “법률과 업무의 연결”과 “그 법률이 데이터 3법인가”라는 두 축을 동시에 판정해야 합니다. 6편에서 다룬 사례 판단형의 축 분리 전략이 그대로 적용됩니다.
핵심 정리
- 가트너의 분석 유형은 묘사 → 진단 → 예측 → 처방 순이며, 과거·원인·미래·행동 중 무엇을 보는지로 판정한다.
- 빅데이터 위기 요인은 사생활 침해, 책임 원칙 훼손, 데이터 오용이며 각각 사용자 책임 부여, 행위 기반 책임, 알고리즘 투명성 보장으로 통제한다.
- 조직 구조는 집중(전담 부서), 기능(각 부서가 직접), 분산(인력을 부서별 배치) 으로 나뉜다.
- 품질 차원 중 무결성은 승인되지 않은 변경·훼손이 없는가를 보며 정확성과 초점이 다르다. 업무 규칙은 데이터 검증에도 쓸 수 있다.
- 가명정보는 개인정보에 해당하고 익명정보는 해당하지 않는다. 가명처리한 정보는 통계·연구 등 목적에 한해 동의 없이 활용할 수 있다.
- 비식별 기법 중 라운딩은 결과가 수치(40세), 범주화는 결과가 구간(30대), 마스킹은 문자로 가림이다.
- 데이터 3법은 개인정보 보호법·정보통신망법·신용정보법이며, 공공데이터법은 포함되지 않는다.