기본 콘텐츠로 건너뛰기

데이터 분석 방법론 3가지 비교: CRISP-DM vs KDD vs SEMMA

이 글은 데이터 분석을 막 시작한 직장인과 취업 준비생을 위해 작성되었습니다. 실제로 자주 헷갈리는 세 가지 데이터 분석 방법론을 비교 정리했습니다.

입사 첫 주, 왜 다들 'CRISP-DM'을 당연하게 말할까

데이터 분석 부서에 처음 배치되면 비슷한 경험을 하게 됩니다. 회의에서 누군가 "이번 프로젝트는 CRISP-DM 기준으로 진행하죠"라고 말하면, 다들 고개를 끄덕이는데 나만 그 단어가 낯설게 느껴지는 순간 말입니다.

문제는 이 단어를 검색해봐도 영어 약자와 도식만 잔뜩 나오고, "그래서 내가 지금 뭘 해야 하는지"는 잘 와닿지 않는다는 점입니다. 데이터 분석 방법론은 결국 하나입니다. 데이터를 어떤 순서로, 어떤 기준으로 들여다볼 것인가에 대한 약속이죠. 그 약속의 종류가 CRISP-DM, KDD, SEMMA로 나뉠 뿐입니다.

이 글에서는 셀 수 없이 많은 프로젝트에서 실제로 부딪혔던 경험을 바탕으로, 세 방법론의 차이를 현업 감각으로 풀어드리겠습니다.

데이터 분석 방법론이 왜 필요한가

방법론 없이 분석을 시작하면 흔히 벌어지는 일이 있습니다. 데이터부터 일단 모으고, 모델을 이것저것 돌려보다가, 막판에 "그런데 이걸로 무슨 의사결정을 하려던 거였지?"라는 질문에 막혀버리는 상황입니다.

이런 시행착오를 줄이기 위해 업계는 표준화된 절차를 만들어왔습니다. 대표적으로 세 가지가 있습니다.

  • CRISP-DM (Cross Industry Standard Process for Data Mining)
  • KDD (Knowledge Discovery in Databases)
  • SEMMA (Sampling, Exploration, Modification, Modeling, Assessment)

셋 다 결국 데이터 마이닝을 체계적으로 수행하기 위한 절차이지만, 무엇을 가장 중요하게 보느냐에서 갈립니다. 하나씩 뜯어보겠습니다.

CRISP-DM: 비즈니스 이해에서 시작하는 6단계

CRISP-DM은 이름에 'Industry'가 들어가 있는 데서 짐작할 수 있듯, 산업 현장에서 가장 널리 쓰이는 방법론입니다. 신입 시절 가장 먼저 배우게 되는 것도 보통 이 방법론입니다. 데이터 마이닝을 주된 목적으로 하며, 4가지 구성요소와 6가지 절차로 이뤄져 있습니다.

4가지 구성요소

CRISP-DM은 단순히 단계만 나열한 게 아니라, 각 단계를 바라보는 시야의 폭을 4단계로 나눠둔 점이 특징입니다.

  • 단계(Phase): 전체 프로젝트를 구성하는 최상위 단위
  • 일반화 태스크(Generic Task): 각 단계를 보편적으로 적용 가능한 작업 단위로 세분화
  • 세분화 태스크(Specialized Task): 일반화 태스크를 실제 상황에 맞게 구체화
  • 프로세스 실행(Process Instance): 데이터 마이닝을 위한 실제 실행 기록

처음 보면 다소 추상적으로 느껴지실 수 있습니다. 쉽게 풀면, "전체 그림(단계) → 누구나 하는 일(일반화) → 우리 회사만의 방식(세분화) → 실제로 한 일(실행)"로 점점 구체화된다고 이해하시면 충분합니다.

6가지 절차

실무에서 더 자주 입에 오르는 건 이 6단계입니다.

  1. 업무 이해(Business Understanding): 무엇을 풀어야 하는 문제인지 정의하는 단계
  2. 데이터 이해(Data Understanding): 가진 데이터를 탐색하고 품질을 점검하는 단계
  3. 데이터 준비(Data Preparation): 분석에 쓸 수 있는 형태로 데이터를 가공하는 단계
  4. 모델링(Modeling): 적합한 분석/예측 기법을 적용하는 단계
  5. 평가(Evaluation): 모델이 처음 목표에 부합하는지 검증하는 단계
  6. 전개(Deployment): 실제 현업 프로세스에 적용하는 단계

여기서 신입이 가장 자주 놓치는 부분이 있습니다. 이 6단계는 1번부터 6번까지 일직선으로 흘러가지 않습니다. 평가 단계에서 문제가 발견되면 업무 이해 단계로 되돌아가는 일이 빈번하며, 이런 반복 구조 자체가 CRISP-DM의 핵심입니다. "한 번에 완벽하게"가 아니라 "왔다 갔다 하며 다듬어가는" 과정이라는 점을 기억해두시면, 실제 프로젝트에서 단계를 되돌아갈 때 불안해하지 않으셔도 됩니다.

KDD: 데이터베이스 속 패턴을 찾아내는 5단계

KDD는 CRISP-DM보다 먼저 등장한, 데이터베이스 안에 숨어 있는 지식을 발굴하는 데 초점을 맞춘 방법론입니다. 프로파일링 기술을 기반으로 패턴이나 규칙을 찾아내는 데 집중하며, 5단계로 구성되어 있습니다.

  1. 데이터 세트 선택(Selection): 분석에 사용할 데이터를 추출
  2. 데이터 전처리(Preprocessing): 결측치, 이상치 등을 정리
  3. 데이터 변환(Transformation): 분석 목적에 맞게 형태를 변형
  4. 데이터 마이닝(Data Mining): 패턴이나 규칙을 실제로 탐색
  5. 데이터 마이닝 결과 평가(Interpretation/Evaluation): 발견한 패턴의 의미를 해석

CRISP-DM과 비교하면 '업무 이해' 단계가 별도로 명시되어 있지 않다는 점이 눈에 띕니다. KDD는 비즈니스 목적보다는 데이터 자체에서 패턴을 발굴하는 기술적 과정에 좀 더 무게가 실려 있다고 보시면 됩니다. 그래서 학술적인 데이터 마이닝 연구에서는 KDD라는 용어가, 기업 실무에서는 CRISP-DM이라는 용어가 더 자주 쓰이는 경향이 있습니다.

SEMMA: SAS가 만든 실용적 5단계

SEMMA는 통계 소프트웨어 기업 SAS가 자사 솔루션을 위해 만든 방법론입니다. Sampling, Exploration, Modification, Modeling, Assessment의 앞글자를 딴 이름으로, 역시 5단계로 진행됩니다.

  1. 샘플링(Sample): 전체 데이터에서 분석 가능한 크기의 표본을 추출
  2. 탐색(Explore): 시각화 등을 통해 데이터의 패턴과 이상치를 살핌
  3. 수정(Modify): 변수를 선택하거나 새로 만들어 모델링에 적합하게 가공
  4. 모델링(Model): 데이터 마이닝 기법을 적용해 모델을 구축
  5. 검증(Assess): 모델의 신뢰도와 효과를 평가

SEMMA의 가장 큰 특징은 '업무 이해' 단계가 아예 없다는 점입니다. CRISP-DM이 "왜 이 분석을 하는가"부터 짚고 들어가는 반면, SEMMA는 분석 목적이 이미 명확하다는 전제 아래 곧바로 데이터 작업에 들어갑니다. 그래서 SEMMA는 특정 분석 목표가 분명한 상황, 예를 들어 SAS 도구를 이미 쓰고 있는 조직에서 효율적으로 작동합니다.

세 방법론, 한눈에 비교하기

지금까지 살펴본 내용을 표로 정리하면 다음과 같습니다.

구분 CRISP-DM KDD SEMMA
주요 목적 비즈니스 문제 해결 데이터베이스 내 패턴 발굴 실용적 모델링 수행
단계 수 6단계 (4구성요소) 5단계 5단계
업무 이해 단계 있음 (1단계) 없음 없음
개발 주체 산업 컨소시엄 학계 SAS Institute
적합한 상황 목적이 불분명하거나 처음부터 정의가 필요한 프로젝트 데이터 자체의 숨은 규칙을 찾는 연구 목적이 명확하고 SAS 환경을 쓰는 프로젝트

실전 팁: 신입이라면 이렇게 접근하세요

세 가지를 모두 외울 필요는 없습니다. 실무 감각으로 정리하면 이렇습니다.

  • 회사에서 어떤 방법론을 쓰는지 먼저 확인하세요. 대부분의 국내 기업은 CRISP-DM 체계를 기본 틀로 채택하고 있으며, 면접이나 자격증(ADsP, ADP 등) 준비 시에도 CRISP-DM이 가장 자주 출제됩니다.
  • '업무 이해' 유무로 구분하면 헷갈리지 않습니다. CRISP-DM은 있고, KDD와 SEMMA는 없습니다. 이 한 가지 기준만 기억해도 세 방법론의 성격 차이가 명확해집니다.
  • 단계 이름을 억지로 외우지 마세요. 결국 "문제 정의 → 데이터 확보 → 데이터 정제 → 모델 구축 → 검증"이라는 큰 흐름은 세 방법론 모두 동일합니다. 흐름을 먼저 익히고, 세부 명칭은 필요할 때 다시 찾아보는 편이 효율적입니다.

자주 묻는 질문 (FAQ)

Q1. 데이터 분석 방법론 중 실무에서 가장 많이 쓰이는 것은 무엇인가요?
CRISP-DM이 산업 전반에서 가장 보편적으로 쓰입니다. 업계 표준에 가까운 위치를 차지하고 있어, 데이터 마이닝 프로젝트의 기본 틀로 채택하는 기업이 많습니다.

Q2. KDD와 데이터 마이닝은 같은 개념인가요?
아닙니다. 데이터 마이닝은 KDD 절차 중 4단계에 해당하는 하나의 과정입니다. KDD는 데이터 세트 선택부터 결과 해석까지 이어지는 전체 흐름을 의미하고, 데이터 마이닝은 그 안에서 패턴을 실제로 찾아내는 핵심 작업을 가리킵니다.

Q3. SEMMA는 SAS 도구가 없으면 쓸 수 없나요?
SAS Enterprise Miner와 함께 사용하도록 설계되었지만, 절차 자체의 개념은 다른 도구로도 충분히 적용할 수 있습니다. 다만 SAS 환경 밖에서는 다소 응용이 필요할 수 있습니다.

Q4. 자격증 시험(ADsP 등)에서는 어떤 방법론이 중요한가요?
세 방법론 모두 출제되지만, 그중에서도 CRISP-DM의 4구성요소와 6단계 순서를 묻는 문제가 비중 있게 다뤄지는 편입니다.


참고문헌
- 도리의 디지털라이프, "CRISP-DM (Cross-Industry Standard Process for Data Mining)"
- 도리의 디지털라이프, "SEMMA (Sample, Explore, Modify, Model, and Assess)"
- 투이컨설팅, "전통적 데이터분석 방법론: KDD, CRISP-DM"
- AWS, "데이터 마이닝이란 무엇입니까?"
- Wikipedia, "SEMMA"
- Data Science PM, "What is SEMMA?"

댓글

이 블로그의 인기 게시물

PyMOL 명령어 정리: 논문·발표용 이미지 스크립트까지 한 번에

PyMOL 명령어 정리: 논문·발표용 이미지 스크립트까지 한 번에 지난 PyMOL 설치·마우스 조작 글에 대한 반응이 예상보다 컸습니다. 설치는 끝냈고 화면도 어느 정도 돌려봤는데, 그다음이 막막하다는 분들이 많았습니다. 커맨드 라인에 뭘 쳐야 할지 몰라 결국 캡처 화면만 들고 보고서를 쓰거나, 어디서 복사해온 스크립트를 그대로 붙여 넣었다가 에러 메시지만 보고 포기하는 경우입니다. 이번 글은 그 다음 단계, 즉 실제로 자주 쓰는 명령어와 논문·발표용 이미지를 뽑아내는 스크립트를 정리합니다. 다만 인터넷에 떠도는 PyMOL 스크립트 중에는 예전 버전 문법이거나, 애초에 존재하지 않는 세팅 이름이 섞여 있는 경우가 적지 않습니다. 그래서 이 글에 실린 모든 명령어는 PyMOL 공식 문서와 PyMOL Wiki를 기준으로 하나씩 확인한 뒤 실었습니다. 확인 과정에서 실제로 동작하지 않는 표현 3곳을 발견해 수정했고, 어떤 부분이 왜 틀렸는지는 별도로 짚어두었습니다. 1. 화면 제어 및 구조 불러오기 커맨드 라인은 화면 하단에 있습니다. 아래 명령어들은 세션을 시작할 때 거의 매번 쓰게 되는 기본기입니다. PDB 구조 불러오기 : fetch 1tup — 인터넷에서 해당 PDB ID의 구조를 바로 내려받아 표시합니다. 배경색 변경 : bg_color white — 논문·발표 자료는 흰 배경이 기본입니다. 화면 정렬/초기화 : orient — 구조 전체가 화면에 꽉 차도록 각도와 확대 비율을 자동으로 맞춥니다. zoom 은 현재 각도를 유지한 채 확대 비율만 조정한다는 점에서 차이가 있습니다. 특정 부위로 확대 : zoom resi 150 — 150번 잔기를 중심으로 확대합니다. 도킹 부위나 특정 변이 위치를 자세히 볼 때 유용합니다. 2. 표시 방식과 컬러링 리본형(2차 구조 강조) : show cartoon 막대형(원자·결합 강조) : show sticks 공간 채움형 : show spheres 표면형 : show ...

PyMOL 설치 방법부터 마우스 사용법까지 — AI 신약개발 시대 분자 시각화 입문 가이드

"AI가 신약을 설계해준다"는 말은 이제 뉴스 헤드라인이 아니라 실험실의 일상이 되었습니다. 알파폴드 같은 단백질 구조 예측 모델이 구조 데이터를 쏟아내면서, 그 결과물을 사람이 눈으로 확인하고 해석하는 능력은 오히려 더 중요해졌습니다. 그 확인 작업의 표준 도구가 바로 PyMOL입니다. 그런데 막상 PyMOL을 처음 켜본 분들의 반응은 대체로 비슷합니다. 마우스를 드래그했는데 분자가 움직이는 줄 알았더니 사실은 화면(카메라)이 돌아간 것이고, 어떤 때는 또 분자 자체가 진짜로 움직여서 구조가 깨진 것처럼 보이기도 합니다. 단축키를 몰라서 우왕좌왕하다가 그냥 캡처 화면만 들고 보고서를 쓰는 경우도 많습니다. 이 글에서는 컴퓨터 비전공자도 따라 할 수 있도록 PyMOL 설치부터, 가장 많이 헷갈리는 마우스 동작의 원리, 실전 사용법까지 순서대로 정리합니다. PyMOL이 AI 신약개발 시대에 필수가 된 이유 PyMOL은 단백질, 핵산, 저분자 화합물 같은 생체분자의 3차원 구조를 시각화하는 프로그램입니다. 단순히 "예쁜 그림"을 만드는 도구가 아니라, 결합 부위의 형태를 확인하고 화합물이 들어갈 공간을 가늠하고 변이가 일어난 자리를 짚어내는 분석 도구입니다. 요즘 AI 신약개발 파이프라인은 보통 이런 흐름을 따릅니다. AI 모델이 단백질 구조를 예측하거나 결합 후보 화합물을 제안하면, 연구자가 그 결과를 분자 시각화 프로그램으로 열어 타당성을 검토합니다. 예측이 그럴듯해 보이는지, 입체 장애는 없는지, 알려진 결합 부위와 일치하는지를 눈으로 확인하는 단계가 빠지지 않습니다. 그 검증 단계에 PyMOL이 사실상 업계 표준으로 쓰이고 있어서, 생물학이나 제약 전공자라면 코딩 경험이 없어도 PyMOL 사용법 정도는 익혀두는 편이 유리합니다. PyMOL 설치, 두 가지 무료 경로 중 나에게 맞는 것 고르기 PyMOL은 신기하게도 "무료"라는 말이 두 가지 다른 의미로 쓰입니다. 어떤 경로로 받느냐에 따...

CQA(Critical Quality Attribute)란 무엇인가: 바이오의약품 CMC에서 "관리해야 할 것"을 정하는 방식

CQA(Critical Quality Attribute)란 무엇인가: 바이오의약품 CMC에서 "관리해야 할 것"을 정하는 방식 시험 목록을 보다 보면 이런 의문이 듭니다. "이 시험은 왜 하는 거지?" SEC-HPLC로 Aggregation을 보고, CEX로 Charge Variant를 보고, ELISA로 HCP를 보는데, 정작 "왜 이 항목들을 관리해야 하는가"에 대한 답은 문서 어디에도 명확히 적혀 있지 않은 경우가 많습니다. 이 질문에 답하는 개념이 바로 CQA, Critical Quality Attribute입니다. 이전 글 RACI Matrix: 바이오·제약 CMC 조직에서 의사결정이 꼬이는 진짜 원인 에서는 "누가 결정하는가"를 다뤘다면, 이번 글은 그 결정의 대상, 즉 "무엇을 관리해야 하는가"를 다룹니다. CQA는 시험 항목을 나열한 표가 아니라, 제품 품질과 환자 안전을 연결하는 과학적 의사결정 체계입니다. CQA란 무엇인가 ICH Q8(R2)에서는 CQA를 이렇게 정의합니다. "제품이 요구되는 품질, 안전성, 유효성을 확보하기 위해 적절한 한계, 범위 또는 분포 내에서 관리되어야 하는 물리적, 화학적, 생물학적 또는 미생물학적 특성 또는 성질" 풀어 말하면 이렇습니다. CQA = 제품의 품질 특성 중, 변화가 생겼을 때 환자에게 미치는 영향을 고려해 반드시 관리해야 하는 핵심 특성 항체(mAb) 제품을 예로 들면, 하나의 분자 안에도 관리 가능한 특성이 수십 가지 존재합니다. 품질 특성 대표 시험 Primary structure Peptide mapping Aggregation SEC-HPLC Charge variant CEX-HPLC Glycosylation LC-MS Potency Cell-based assay Host Cell Protei...