작성 일자 : 2026-02-09

예상문제

  1. 데이터 변화도 OK
  2. 데이터를 다양한 매체로부터 품질 확인 관리 OK

양적 자료 = 수치자료

데이터 정제 과정

수집 변환 저장 품질 확인 관리

무작위 결측 vs 비무작위 결측

무작위 결측 : 진짜 우연찮게 빠진 경우 (조건부) 무작위 결측 : 결론과 상관없는 이유로 결측한 경우 아래와 같은 예시에서는 ‘체중’ 에 대해서 결측치가 있는 것에 대해 체중을 제외한 다른 조건이면 조건부로 쳐짐. 비무작위 결측 : 결론과 관련 있는 변수로 인해서 결측이 된 경우


자료 처리하다가 생긴 값에 대해서도 이상치 인정해줌


PCA

  • 독립적인 X 분포에 대한 가정을 요구하지 않음
  • 독립일 때만 가능하다 X 오히려 연관 있어야함

요인분석

  • 변수들간의 관계를 분석하여 공통 차원으로 축약
  • 독립변수, 종속변수 개념이 없음. 주로 기술통계 사용함
  • 변수를 제거함.

파생변수

  • 특정상황에만 유의미하지 않도록 대표성을 띄어야함

요약변수

  • 데이터마트에서 가장 기본적인 변수임
  • 많은 분석모델에서 공통으로 사용될 수 있어서 재활용성 높음

분포에 따른 변환

꼬리가 긴 쪽이 평균임. 그래서 평균이 크면 왜도가 큰겨

우로 치우침 = 왜도가 0보다 큰 상황 작은 값은 더 작게 큰 값은 더 크게 해야함. 그래서 제곱 ~