변수 선택 방법
- 전진선택법 : 변수 하나씩 추가하면서 계산
- 후진제거법 : 변수 하나씩 제거하면서 계산
- 단계별 선택법 : 전진선택법 + 후진선택법으로 변수를 추가할 때 벌점을 고려
유의한 변수는 전진선택을 통해 추가하고 나머지는 후진 ㅇㅇ

차원의 저주
- 데이터 학습 시 차원이 높아질수록 알고리즘의 성능이 저하되는 현상
차원 축소의 효과
- 차원의 저주 해소, 데이터 시각화, 노이즈 제거, 데이터 압축, 성능 향상, 특징 추출, 계산 비용 절감
차원 축소 기법
-
선형 차원 축소 기법
- 주성분 분석 (PCA)
- 분산이 최대화되는 방향으로 차원을 축소
- LDA (Linear Discriminant Analysis)
- 분류에서 클래스 간 분산을 최대화 하면서 차원을 축소
- ICA (independent Component Analysis)
- 서로 독립적인 성분을 찾아서 차원 축소
- SVD (Singular Value Decomposition)
- m x n 크기의 비정방 행렬 A 행렬 분해
- U 는 m x m 직교 행렬 , 시그마는 m x n 대각행렬, V^t 는 n x n 직교 행렬
- 요인 분석 (Factor Analysis)
- 관측된 변수들을 몇 개의 잠재 요인으로 축소하는 방법
- 심리학, 사회과학 등에서 잠재 변수의 해석이 필요한 경우
-
비선형 차원 축소 기법
-
MDS (Multi-Dimensional Scaling)

- 데이터 간 거리정보의 근접성을 보존하는 차원 축소
- Stress 함수의 값이 최소가 되도록 구성
-
t-SNE (t-Distributed Stochastic Neighbor Embedding)
-
고차원 데이터간 거리 정보를 확률적으로 유지하여 차원 축소
-
데이터의 복잡한 비선형 패턴을 시각화 하며, 이미지나 텍스트 데이터에 적합
MDS, t-SNE 공통, 차이 비교 문제 나온 적 있음
-
-
UMAP (Uniform Manifold Approximation and Projection)
- t-SNE와 유사한 비선형 차원 축소 기법으로, 구조적 패턴을 보존
- 대규모 데이터에서 빠르게 적용 가능
-
AutoEncoder
- 신경망을 활용한 차원 축소 기법으로 데이터를 압축 후 다시 복원하는 학습
-
요약변수와 파생 변수
- 요약변수 : 수집된 정보를 종합한 변수로서 재활용성이 높음
- 파생변수 : 의미를 부여한 변수, 논리적 타당성 필요
- 파생변수 생성 방법 : 특징 추출, 결합, 부가적 정보 결합, 수학적 변환, 교호작용의 반영
- 교호작용 : 두 개 이상의 독립변수가 상호작용을 하여, 종속 변수에 영향을 미치는 경우

수치형 변수 변환
- Z-Score 정규화 (표준정규분포) : 평균 0 , 표준편차 1 ~ N(0,1)
- min - max normalization (최소 최대 정규화) : 0 ~ 1
- log transformation : 데이터가 한 쪽으로 치우쳐 있을 시 활용
- ETC : 지수변환, 제곱근 변환, Box-Cox 변환 (양수 데이터의 비대칭 분포 시 활용)
범주형 변수 변환
- 레이블 인코딩 (레이블링)
- one-hot encoding
- 타깃 인코딩
- 타깃 변수를 평균값으로 변환
날짜/시간 변수 변환
- 분할 : 날짜/시간 데이터를 년, 월, 일, 시, 분 등으로 분할함
- 파생 : 시간대(오전, 오후) 요일 또는 계절 등으로 변수 생성
불균형 데이터 처리
- 가중치 적용
- 언더 샘플링
- 다수의 데이터의 일부만 선택
- 랜덤 추출법, 계통 추출법, 집락 추출법, 층화 추출법
- 오버 샘플링
- SMOTE, ADSYN, ROS
본 정리는 아답터의 요약노트를 바탕으로 정리하였습니다. 알고 있는 부분은 생략하거나 넘어갑니다