이 글은 데이터 분석을 막 시작한 직장인과 취업 준비생을 위해 작성되었습니다. 실제로 자주 헷갈리는 세 가지 데이터 분석 방법론을 비교 정리했습니다.
입사 첫 주, 왜 다들 'CRISP-DM'을 당연하게 말할까
데이터 분석 부서에 처음 배치되면 비슷한 경험을 하게 됩니다. 회의에서 누군가 "이번 프로젝트는 CRISP-DM 기준으로 진행하죠"라고 말하면, 다들 고개를 끄덕이는데 나만 그 단어가 낯설게 느껴지는 순간 말입니다.
문제는 이 단어를 검색해봐도 영어 약자와 도식만 잔뜩 나오고, "그래서 내가 지금 뭘 해야 하는지"는 잘 와닿지 않는다는 점입니다. 데이터 분석 방법론은 결국 하나입니다. 데이터를 어떤 순서로, 어떤 기준으로 들여다볼 것인가에 대한 약속이죠. 그 약속의 종류가 CRISP-DM, KDD, SEMMA로 나뉠 뿐입니다.
이 글에서는 셀 수 없이 많은 프로젝트에서 실제로 부딪혔던 경험을 바탕으로, 세 방법론의 차이를 현업 감각으로 풀어드리겠습니다.
데이터 분석 방법론이 왜 필요한가
방법론 없이 분석을 시작하면 흔히 벌어지는 일이 있습니다. 데이터부터 일단 모으고, 모델을 이것저것 돌려보다가, 막판에 "그런데 이걸로 무슨 의사결정을 하려던 거였지?"라는 질문에 막혀버리는 상황입니다.
이런 시행착오를 줄이기 위해 업계는 표준화된 절차를 만들어왔습니다. 대표적으로 세 가지가 있습니다.
- CRISP-DM (Cross Industry Standard Process for Data Mining)
- KDD (Knowledge Discovery in Databases)
- SEMMA (Sampling, Exploration, Modification, Modeling, Assessment)
셋 다 결국 데이터 마이닝을 체계적으로 수행하기 위한 절차이지만, 무엇을 가장 중요하게 보느냐에서 갈립니다. 하나씩 뜯어보겠습니다.
CRISP-DM: 비즈니스 이해에서 시작하는 6단계
CRISP-DM은 이름에 'Industry'가 들어가 있는 데서 짐작할 수 있듯, 산업 현장에서 가장 널리 쓰이는 방법론입니다. 신입 시절 가장 먼저 배우게 되는 것도 보통 이 방법론입니다. 데이터 마이닝을 주된 목적으로 하며, 4가지 구성요소와 6가지 절차로 이뤄져 있습니다.
4가지 구성요소
CRISP-DM은 단순히 단계만 나열한 게 아니라, 각 단계를 바라보는 시야의 폭을 4단계로 나눠둔 점이 특징입니다.
- 단계(Phase): 전체 프로젝트를 구성하는 최상위 단위
- 일반화 태스크(Generic Task): 각 단계를 보편적으로 적용 가능한 작업 단위로 세분화
- 세분화 태스크(Specialized Task): 일반화 태스크를 실제 상황에 맞게 구체화
- 프로세스 실행(Process Instance): 데이터 마이닝을 위한 실제 실행 기록
처음 보면 다소 추상적으로 느껴지실 수 있습니다. 쉽게 풀면, "전체 그림(단계) → 누구나 하는 일(일반화) → 우리 회사만의 방식(세분화) → 실제로 한 일(실행)"로 점점 구체화된다고 이해하시면 충분합니다.
6가지 절차
실무에서 더 자주 입에 오르는 건 이 6단계입니다.
- 업무 이해(Business Understanding): 무엇을 풀어야 하는 문제인지 정의하는 단계
- 데이터 이해(Data Understanding): 가진 데이터를 탐색하고 품질을 점검하는 단계
- 데이터 준비(Data Preparation): 분석에 쓸 수 있는 형태로 데이터를 가공하는 단계
- 모델링(Modeling): 적합한 분석/예측 기법을 적용하는 단계
- 평가(Evaluation): 모델이 처음 목표에 부합하는지 검증하는 단계
- 전개(Deployment): 실제 현업 프로세스에 적용하는 단계
여기서 신입이 가장 자주 놓치는 부분이 있습니다. 이 6단계는 1번부터 6번까지 일직선으로 흘러가지 않습니다. 평가 단계에서 문제가 발견되면 업무 이해 단계로 되돌아가는 일이 빈번하며, 이런 반복 구조 자체가 CRISP-DM의 핵심입니다. "한 번에 완벽하게"가 아니라 "왔다 갔다 하며 다듬어가는" 과정이라는 점을 기억해두시면, 실제 프로젝트에서 단계를 되돌아갈 때 불안해하지 않으셔도 됩니다.
KDD: 데이터베이스 속 패턴을 찾아내는 5단계
KDD는 CRISP-DM보다 먼저 등장한, 데이터베이스 안에 숨어 있는 지식을 발굴하는 데 초점을 맞춘 방법론입니다. 프로파일링 기술을 기반으로 패턴이나 규칙을 찾아내는 데 집중하며, 5단계로 구성되어 있습니다.
- 데이터 세트 선택(Selection): 분석에 사용할 데이터를 추출
- 데이터 전처리(Preprocessing): 결측치, 이상치 등을 정리
- 데이터 변환(Transformation): 분석 목적에 맞게 형태를 변형
- 데이터 마이닝(Data Mining): 패턴이나 규칙을 실제로 탐색
- 데이터 마이닝 결과 평가(Interpretation/Evaluation): 발견한 패턴의 의미를 해석
CRISP-DM과 비교하면 '업무 이해' 단계가 별도로 명시되어 있지 않다는 점이 눈에 띕니다. KDD는 비즈니스 목적보다는 데이터 자체에서 패턴을 발굴하는 기술적 과정에 좀 더 무게가 실려 있다고 보시면 됩니다. 그래서 학술적인 데이터 마이닝 연구에서는 KDD라는 용어가, 기업 실무에서는 CRISP-DM이라는 용어가 더 자주 쓰이는 경향이 있습니다.
SEMMA: SAS가 만든 실용적 5단계
SEMMA는 통계 소프트웨어 기업 SAS가 자사 솔루션을 위해 만든 방법론입니다. Sampling, Exploration, Modification, Modeling, Assessment의 앞글자를 딴 이름으로, 역시 5단계로 진행됩니다.
- 샘플링(Sample): 전체 데이터에서 분석 가능한 크기의 표본을 추출
- 탐색(Explore): 시각화 등을 통해 데이터의 패턴과 이상치를 살핌
- 수정(Modify): 변수를 선택하거나 새로 만들어 모델링에 적합하게 가공
- 모델링(Model): 데이터 마이닝 기법을 적용해 모델을 구축
- 검증(Assess): 모델의 신뢰도와 효과를 평가
SEMMA의 가장 큰 특징은 '업무 이해' 단계가 아예 없다는 점입니다. CRISP-DM이 "왜 이 분석을 하는가"부터 짚고 들어가는 반면, SEMMA는 분석 목적이 이미 명확하다는 전제 아래 곧바로 데이터 작업에 들어갑니다. 그래서 SEMMA는 특정 분석 목표가 분명한 상황, 예를 들어 SAS 도구를 이미 쓰고 있는 조직에서 효율적으로 작동합니다.
세 방법론, 한눈에 비교하기
지금까지 살펴본 내용을 표로 정리하면 다음과 같습니다.
| 구분 | CRISP-DM | KDD | SEMMA |
|---|---|---|---|
| 주요 목적 | 비즈니스 문제 해결 | 데이터베이스 내 패턴 발굴 | 실용적 모델링 수행 |
| 단계 수 | 6단계 (4구성요소) | 5단계 | 5단계 |
| 업무 이해 단계 | 있음 (1단계) | 없음 | 없음 |
| 개발 주체 | 산업 컨소시엄 | 학계 | SAS Institute |
| 적합한 상황 | 목적이 불분명하거나 처음부터 정의가 필요한 프로젝트 | 데이터 자체의 숨은 규칙을 찾는 연구 | 목적이 명확하고 SAS 환경을 쓰는 프로젝트 |
실전 팁: 신입이라면 이렇게 접근하세요
세 가지를 모두 외울 필요는 없습니다. 실무 감각으로 정리하면 이렇습니다.
- 회사에서 어떤 방법론을 쓰는지 먼저 확인하세요. 대부분의 국내 기업은 CRISP-DM 체계를 기본 틀로 채택하고 있으며, 면접이나 자격증(ADsP, ADP 등) 준비 시에도 CRISP-DM이 가장 자주 출제됩니다.
- '업무 이해' 유무로 구분하면 헷갈리지 않습니다. CRISP-DM은 있고, KDD와 SEMMA는 없습니다. 이 한 가지 기준만 기억해도 세 방법론의 성격 차이가 명확해집니다.
- 단계 이름을 억지로 외우지 마세요. 결국 "문제 정의 → 데이터 확보 → 데이터 정제 → 모델 구축 → 검증"이라는 큰 흐름은 세 방법론 모두 동일합니다. 흐름을 먼저 익히고, 세부 명칭은 필요할 때 다시 찾아보는 편이 효율적입니다.
자주 묻는 질문 (FAQ)
Q1. 데이터 분석 방법론 중 실무에서 가장 많이 쓰이는 것은 무엇인가요?
CRISP-DM이 산업 전반에서 가장 보편적으로 쓰입니다. 업계 표준에 가까운 위치를 차지하고 있어, 데이터 마이닝 프로젝트의 기본 틀로 채택하는 기업이 많습니다.
Q2. KDD와 데이터 마이닝은 같은 개념인가요?
아닙니다. 데이터 마이닝은 KDD 절차 중 4단계에 해당하는 하나의 과정입니다. KDD는 데이터 세트 선택부터 결과 해석까지 이어지는 전체 흐름을 의미하고, 데이터 마이닝은 그 안에서 패턴을 실제로 찾아내는 핵심 작업을 가리킵니다.
Q3. SEMMA는 SAS 도구가 없으면 쓸 수 없나요?
SAS Enterprise Miner와 함께 사용하도록 설계되었지만, 절차 자체의 개념은 다른 도구로도 충분히 적용할 수 있습니다. 다만 SAS 환경 밖에서는 다소 응용이 필요할 수 있습니다.
Q4. 자격증 시험(ADsP 등)에서는 어떤 방법론이 중요한가요?
세 방법론 모두 출제되지만, 그중에서도 CRISP-DM의 4구성요소와 6단계 순서를 묻는 문제가 비중 있게 다뤄지는 편입니다.
참고문헌
- 도리의 디지털라이프, "CRISP-DM (Cross-Industry Standard Process for Data Mining)"
- 도리의 디지털라이프, "SEMMA (Sample, Explore, Modify, Model, and Assess)"
- 투이컨설팅, "전통적 데이터분석 방법론: KDD, CRISP-DM"
- AWS, "데이터 마이닝이란 무엇입니까?"
- Wikipedia, "SEMMA"
- Data Science PM, "What is SEMMA?"
댓글
댓글 쓰기