본문으로 이동
메뉴 여닫기
환경 설정 메뉴 여닫기
개인 메뉴 여닫기
로그인하지 않음
지금 편집한다면 당신의 IP 주소가 공개될 수 있습니다.
Dimensionality Reduction; 차원 축소
변수(특성)의 개수를 줄여 데이터를 더 낮은 차원으로 표현하는 일
  • 차원의 저주 완화 — 차원이 늘어날수록 필요한 표본 수가 기하급수적으로 늘고 거리 개념이 무의미해진다
  • 노이즈 제거 — 정보량이 적은 축을 버리면 잡음이 함께 줄어든다
  • 해석력·설명력 향상 — 변수가 적을수록 모형을 설명하기 쉽다
  • 특징 추출 — 의미 있는 새 변수를 얻는다
  • 시각화 — 2~3차원으로 줄이면 눈으로 볼 수 있다
  • 학습 시간 단축, 과적합 완화

데이터 정제(Cleansing)는 차원 축소로 하는 일이 아니다. 결측치·이상치 처리는 데이터 전처리 단계의 일이고, 차원 축소는 그다음에 온다.

구분 설명 기법
변수 선택(Selection) 기존 변수 중 일부를 고른다 필터, 래퍼, 임베디드, 변수 선택법
변수 추출(Extraction) 기존 변수를 조합해 새 변수를 만든다 PCA, LDA, SVD, 요인분석, MDS, SOM, t-SNE, 오토인코더

변수 추출 기법 비교

편집 원본 편집
기법 무엇을 기준으로 줄이나 비고
주성분 분석(PCA) 분산이 가장 큰 방향(주성분)을 찾아 데이터를 최적으로 표현한다 비지도
선형 판별 분석(LDA) 집단 사이는 멀고 집단 안은 가깝게 되는 축을 찾아 데이터를 최적으로 분류한다 지도, 범주가 있어야 한다. → 판별 분석
특이값 분해(SVD) 행렬 A 를 A=UΣVT 로 분해해 큰 특이값만 남긴다 M×N 크기의 어떤 행렬에도 적용된다. 정방행렬일 필요가 없다
요인 분석 변수들의 상관관계 뒤에 있는 관찰할 수 없는 잠재 요인으로 유사한 변수를 묶는다
독립 성분 분석(ICA) 다변량 신호를 통계적으로 독립인 하부 성분으로 분리한다 섞인 음성 분리(칵테일 파티 문제)에 쓰인다
다차원 척도법(MDS) 개체 사이 거리(유사성)를 저차원 공간에서 최대한 보존한다
  • 정방행렬(M×M)에만 쓰는 것은 고유값 분해다. 특이값 분해를 "행과 열의 크기가 같은 정방행렬에 적용한다" 고 하면 틀리다. 특이값 분해는 고유값 분해를 직사각 행렬로 일반화한 것이다.
  • PCA 는 표현, LDA 는 분류 관점이라는 짝을 기억한다.