데이터 종류

  1. 단변량 데이터
  2. 다변량 데이터
  3. 시계열 데이터
    1. 종단면적 데이터 : 여러 시점에 측정 like 주식
    2. 횡단면적 데이터 : 한 시점에 측정 like 2026 취준생 조사
    3. 패널 데이터 : 종단 + 횡단

데이터 정제

2_1_1_데이터 정제

  1. 집계 : 데이터 요약 (기초 통계량)
  2. 일반화
  3. 정규화
  4. 평활화 : 잡음을 제거하여 추세를 부드럽게 만듦 (이동 평균법 , 지수 평활법) 시계열 데이터에서 다시 나옴

결측치 종류

존재하지 않는 데이터, null/NA로 표시

  1. 완전 무작위 결측 (MCRA)
    • 다른 변수들과 아무런 상관 없음
    • 입력 실수, 전산 오류
  2. 무작위 결측 (MAR)
    • 특정 변수와 관련되어 발생 하였지만 결과와 연관 없음
    • 특정 정치 성향 유권자들의 응답률이 낮으나 정당의 득표율이 낮은 것은 아님
  3. 비 무작위 결측 (MNAR)
    • 결측치가 변수의 결과에 상관이 있는 경우
    • 소득이 낮은 응답자들의 응답률이 낮음

결측값 처리

  1. 완전분석법 : 데이터 삭제
  2. 평균 대치법(=비조건부 평균 대치) : 단순 평균으로 대치
  3. 회귀 대치법(=조건부 평균 대치) : 회귀분석의 결과로 대치
  4. 단순 확률 대치법 : 확률적으로 선택하여 대치
    • Nearest Neighbor : 가까운 응답으로 대체
    • Hot-Deck : 현재 데이터 셋에서 비슷한 성향으로 대체 핫 : 뜨거움 : 감성적 : 이 데이터 내에서 넘어가자
    • Cold-Deck : 외부 출처에서 비슷한 성향으로 대체 콜드 : 차가움 : 이성적 : 그럼에도 외부에서 냉정하게 가져오자
  5. 다중대치법 : 여러 번 대치 (대치 분석 결합)

이상값 처리

  • 극단적으로 크거나 작은 값이며 의미 있는 데이터 일 수도 있음.
  • 이상값을 항상 제거하는 것은 아님 (당연하지만 시험 자주나온다고 함)
  1. ESD(Extreme Studentized Deviation)
    • 평균으로부터 표준편차의 3배 넘어가는 데이터는 이상값
    • 3시그마 생각하면 될듯?
  2. 사분위수
    • Q1 - 1.5 IQR >
    • Q3 + 1.5 IQR <
  3. Z-Score 데이터를 정규화 후 일정 임계값을 초과할 경우 이상값으로 판단
  4. DBScan 밀도를 이용하여 밀도가 적은 부분의 데이터를 이상값으로 판단

본 정리는 아답터의 요약노트를 바탕으로 정리하였습니다.