데이터 종류
- 단변량 데이터
- 다변량 데이터
- 시계열 데이터
- 종단면적 데이터 : 여러 시점에 측정 like 주식
- 횡단면적 데이터 : 한 시점에 측정 like 2026 취준생 조사
- 패널 데이터 : 종단 + 횡단
데이터 정제
- 집계 : 데이터 요약 (기초 통계량)
- 일반화
- 정규화
- 평활화 : 잡음을 제거하여 추세를 부드럽게 만듦 (이동 평균법 , 지수 평활법) 시계열 데이터에서 다시 나옴
결측치 종류
존재하지 않는 데이터, null/NA로 표시
- 완전 무작위 결측 (MCRA)
- 다른 변수들과 아무런 상관 없음
- 입력 실수, 전산 오류
- 무작위 결측 (MAR)
- 특정 변수와 관련되어 발생 하였지만 결과와 연관 없음
- 특정 정치 성향 유권자들의 응답률이 낮으나 정당의 득표율이 낮은 것은 아님
- 비 무작위 결측 (MNAR)
- 결측치가 변수의 결과에 상관이 있는 경우
- 소득이 낮은 응답자들의 응답률이 낮음
결측값 처리
- 완전분석법 : 데이터 삭제
- 평균 대치법(=비조건부 평균 대치) : 단순 평균으로 대치
- 회귀 대치법(=조건부 평균 대치) : 회귀분석의 결과로 대치
- 단순 확률 대치법 : 확률적으로 선택하여 대치
- Nearest Neighbor : 가까운 응답으로 대체
- Hot-Deck : 현재 데이터 셋에서 비슷한 성향으로 대체 핫 : 뜨거움 : 감성적 : 이 데이터 내에서 넘어가자
- Cold-Deck : 외부 출처에서 비슷한 성향으로 대체 콜드 : 차가움 : 이성적 : 그럼에도 외부에서 냉정하게 가져오자
- 다중대치법 : 여러 번 대치 (대치 분석 결합)
이상값 처리
- 극단적으로 크거나 작은 값이며 의미 있는 데이터 일 수도 있음.
- 이상값을 항상 제거하는 것은 아님 (당연하지만 시험 자주나온다고 함)
- ESD(Extreme Studentized Deviation)
- 평균으로부터 표준편차의 3배 넘어가는 데이터는 이상값

- 3시그마 생각하면 될듯?
- 평균으로부터 표준편차의 3배 넘어가는 데이터는 이상값
- 사분위수
- Q1 - 1.5 IQR >
- Q3 + 1.5 IQR <


- Z-Score 데이터를 정규화 후 일정 임계값을 초과할 경우 이상값으로 판단
- DBScan 밀도를 이용하여 밀도가 적은 부분의 데이터를 이상값으로 판단
본 정리는 아답터의 요약노트를 바탕으로 정리하였습니다.