데이터분석 전문가 실기
IT 위키
더 많은 작업
- 데이터분석 전문가 실기시험
- '데이터분석 실무' 과목을 CBT로 4시간 동안 분석 코드와 해석을 작성해 검정하는 데이터분석 전문가(ADP)의 2차 시험
데이터분석 전문가 필기에 합격하고 응시자격 요건을 갖추면 응시할 수 있다. 필기 합격자 발표일부터 2년 동안 응시할 수 있으며, 100점 만점에 75점 이상이면 합격이다. 합격 뒤 응시자격 증빙서류 심사를 통과해야 최종 합격자가 된다. 전체 학습 목차는 데이터분석 전문가 교본에 있다.
| 항목 | 내용 |
|---|---|
| 과목 | 데이터분석 실무 |
| 방식 | CBT(Computer Based Test) |
| 시간 | 240분 (10:00~14:00) |
| 배점 | 100점, 75점 이상 합격 |
| 출제 영역 | 기계학습 영역, 통계 영역 |
- 공식 안내에는 문항 수, 영역별 배점, 사용할 수 있는 분석 언어가 나와 있지 않다. 회차별 공지와 데이터자격검정 누리집의 안내를 확인한다.
- 실기시험에는 계산기와 필기구를 둘 수 없다. 허가되지 않은 웹사이트에 접속·검색하거나 USB 등 허가되지 않은 장치를 연결하면 부정행위로 처리된다.
아래 유형 이름과 내용은 한국데이터산업진흥원의 공식 출제 방향을 요약한 것이다.
기계학습 알고리즘을 활용한 분석과 통계적 학습 방법을 활용한 분석을 포괄하며, 데이터 전처리, 탐색적 데이터 분석, 모델링, 결과 해석 과정을 포함한다.
| 분야 | 유형 | 공식 설명 (요약) | 학습 문서 |
|---|---|---|---|
| 기계학습 알고리즘을 활용한 분석 | 유형1 데이터 전처리 | 결측값 처리, 이상값 탐지·수정, 데이터 정규화, 파생 변수 생성, 데이터 샘플링, 데이터 병합·분할 | |
| 유형2 탐색적 데이터 분석(EDA) | 요약 통계량, 히스토그램·산점도·상자그림 시각화, 변수 간 관계 분석, 차원 축소, 군집 분석으로 분포와 군집 구조 파악 | ||
| 유형3 기계학습 알고리즘을 활용한 모델 구축 | 회귀·분류·군집화 기법 선택과 적용, 초매개변수(hyperparameter) 조율로 성능 최적화 | ||
| 유형4 모델 평가와 최적 모델 선택 | 다양한 지표로 성능을 평가하고 결과를 해석해 최적 모델 선정 | ||
| 통계적 학습 방법을 활용한 분석 | 유형1 데이터 품질 평가와 변수 선택·처리 | 이상값·결측값 처리, 변수 구성과 기초통계량 산출, 연속형·범주형 변수의 기초 통계 검정 | |
| 유형2 변수 간 관계 분석과 예측 모델 구축 | 독립변수와 종속변수의 관계를 통계적 기법으로 분석하고, 데이터를 변형해 모델 성능을 높이며 통찰 도출 | ||
| 유형3 통계적 학습 방법과 기계학습 방법의 모델 비교 | 두 방법으로 모델을 구축해 비교하고 최적 모델 선정 |
데이터 탐색 및 기초 통계 분석과 통계적 추론 및 통계 모형 구축을 포괄한다.
| 분야 | 유형 | 공식 설명 (요약) | 학습 문서 |
|---|---|---|---|
| 데이터 탐색 및 기초 통계 분석 | 유형1 기술통계량 계산과 시각화 | 평균·중앙값·분산·표준편차 계산, 히스토그램·산점도·상자그림으로 분포·이상값·패턴 표현 | |
| 유형2 탐색적 데이터 분석과 데이터 전처리 | 결측값 처리, 이상값 수정, 변수 변환, 파생 변수 생성 |
| |
| 통계적 추론 및 통계 모형 구축 | 유형1 통계적 유의성 검정 | 가설 검정으로 유의성을 검정하고 신뢰 구간으로 불확실성 평가 | |
| 유형2 상관 분석과 회귀 분석 | 상관 분석, 단순·다중 선형 회귀, 로지스틱 회귀, 비선형 회귀 모델 구축과 평가 | ||
| 유형3 다변량 분석 | 차원 축소, 변수 간 관계 분석, 그룹 간 차이 분석·분류, 군집화 | ||
| 유형4 시계열 분석 | 추세·계절성·변동성을 반영한 예측 모델 구축, 시각화, 예측 성능 평가 | ||
| 유형5 고급 통계 분석 | 고급 통계 기법을 선택·적용해 데이터 특성을 분석하고 결과 해석 |
- 유형5의 '고급 통계 기법'은 공식 안내에 구체적인 기법이 나와 있지 않다. 위 학습 문서는 4과목 다변량 분석·시계열 범위를 넘는 대표 기법을 모은 것이다.
공식 안내가 밝힌 답안 작성 기준이다.
| 항목 | 내용 |
|---|---|
| 명확한 표현과 논리적 전개 | 핵심만 간결하게 쓰고 분석 과정과 결론이 일관되어야 한다. 분석 방법론과 데이터 특성을 반영해 논리적으로 전개한다 |
| 분석 절차와 코드 서술 | 전처리, 모델링, 검정 등 각 단계의 코드를 간결하게 정리해 제출한다. 주요 부분은 주석으로 설명하고, 코드의 각 부분이 문제 풀이에 어떻게 이어지는지 드러낸다 |
| 데이터 전처리와 EDA | 결측값 처리, 이상값 수정, 변수 변환 내용과 그것이 분석에 미친 영향을 설명한다. EDA 결과는 시각화 자료와 함께 제시한다 |
| 모델 선택 | 기법·모델을 고른 이유와 검토한 대안, 모델의 강점과 한계를 쓰고 다른 방법과 비교해 선택의 정당성을 보인다 |
| 결과 해석 | 분석 결과의 실질적 유용성을 바탕으로 결론을 내리고, 내용을 요약하며 추가 제언을 쓴다 |
- 코드만 내는 시험이 아니다. 고려사항에 적힌 대로 왜 그 방법을 골랐는지, 결과가 무엇을 뜻하는지를 문장으로 써야 한다. 검정이면 귀무가설, 검정통계량, 유의확률, 결론을 한 묶음으로 쓰는 습관을 들인다.
- 가정 점검 → 검정 선택 흐름을 외워 둔다. 예를 들어 두 집단 평균 비교는 정규성 검정 → 등분산 검정 → Student t / Welch t / 비모수 검정 순서로 고른다. 세 집단 이상이면 분산분석 뒤에 사후 검정을 붙인다.
- 기계학습 문제는 전처리 → 분할 → 기준 모델 → 튜닝 → 평가 → 선택의 흐름을 정해진 시간 안에 끝까지 쓰는 연습을 한다. 평가 지표는 문제의 목적(불균형 분류인지, 회귀인지)에 맞춰 고른 이유를 함께 쓴다.
- 같은 기관의 빅데이터분석기사 실기와 다루는 기법이 겹치지만, 그 시험은 값을 입력하거나 예측 파일을 내는 작업형이고 ADP 실기는 분석 과정과 해석을 서술하는 방식이라는 점이 다르다.