SEMMA
IT 위키
더 많은 작업
- SEMMA; Sample, Explore, Modify, Model, Assess
- SAS Institute가 제시한 데이터 마이닝 5단계 절차. 표본 추출, 탐색, 수정, 모델링, 평가의 머리글자를 딴 이름이다
SAS는 데이터 마이닝을 "대량의 데이터를 표본 추출(Sampling), 탐색(Exploring), 수정(Modifying), 모델링(Modeling), 평가(Assessing)하여 이전에 알려지지 않은 패턴을 찾아 비즈니스에 활용하는 과정"으로 정의한다. SEMMA는 SAS의 데이터 마이닝 도구인 SAS Enterprise Miner의 작업 흐름을 이루는 절차로, 프로세스 흐름도(process flow diagram)를 따라 분석을 진행한다.
KDD, CRISP-DM과 함께 대표적인 데이터 마이닝 방법론으로 꼽힌다. CRISP-DM이 업무 이해에서 출발하는 데 비해 SEMMA는 데이터를 다루는 기술적 단계에 초점을 둔다.
| 단계 | 하는 일 |
|---|---|
| Sample(표본 추출) | 분석할 데이터 테이블을 하나 이상 만든다. 표본은 중요한 정보를 담을 만큼 크고, 처리할 수 있을 만큼 작아야 한다. 표본추출 참고 |
| Explore(탐색) | 예상한 관계, 예상하지 못한 추세, 이상한 값을 찾으며 데이터를 이해하고 아이디어를 얻는다 |
| Modify(수정) | 모델 선택 과정에 집중할 수 있도록 변수를 생성·선택·변환한다 |
| Model(모델링) | 분석 도구로 원하는 결과를 신뢰성 있게 예측하는 데이터 조합을 찾는다 |
| Assess(평가) | 데이터 마이닝 결과가 얼마나 유용하고 신뢰할 만한지 평가한다 |
SAS 문서에 따르면 분석에서 SEMMA의 모든 단계를 다 거치지 않을 수도 있고, 만족할 결과가 나올 때까지 일부 단계를 여러 번 반복할 수도 있다. 평가 단계가 끝나면 선택한 모델(champion model)의 점수 산출식을 새 데이터에 적용(scoring)하는 것이 대부분 데이터 마이닝 문제의 최종 결과물이다.
| 방법론 | 단계 수 | 단계 이름 | 특징 |
|---|---|---|---|
| KDD | 5 | 데이터 선택 → 전처리 → 변환 → 데이터 마이닝 → 해석·평가 | 데이터베이스에서 지식을 발견하는 전체 과정. 데이터 마이닝은 그 가운데 한 단계다 |
| CRISP-DM | 6 | 업무 이해 → 데이터 이해 → 데이터 준비 → 모델링 → 평가 → 전개 | 업무(비즈니스) 이해에서 시작하고, 단계 간 되돌아가는 피드백이 있다. 특정 도구에 매이지 않는다 |
| SEMMA | 5 | Sample → Explore → Modify → Model → Assess | SAS가 제시했다. 데이터 처리와 모델링 중심의 기술적 절차로, SAS Enterprise Miner의 흐름과 연결된다 |
| 빅데이터 분석 방법론 | 5 | 분석 기획 → 데이터 준비 → 데이터 분석 → 시스템 구현 → 평가 및 전개 | 단계, 태스크, 스텝의 계층 구조. 기획과 시스템 구현까지 포함한다 |
- SEMMA 다섯 단계의 순서와 영문 이름(특히 Modify와 Model의 순서)
- SEMMA를 제시한 곳이 SAS라는 점
- KDD·CRISP-DM·SEMMA의 단계 수 비교(5·6·5)와, 업무 이해 단계가 있는 것은 CRISP-DM이라는 점