작성 일자 : 2026-02-09예상문제


- 데이터 변화도 OK
- 데이터를 다양한 매체로부터 품질 확인 관리 OK
양적 자료 = 수치자료
데이터 정제 과정
수집 → 변환 → 저장 → 품질 확인 → 관리
무작위 결측 vs 비무작위 결측
무작위 결측 : 진짜 우연찮게 빠진 경우 (조건부) 무작위 결측 : 결론과 상관없는 이유로 결측한 경우 아래와 같은 예시에서는 ‘체중’ 에 대해서 결측치가 있는 것에 대해 체중을 제외한 다른 조건이면 조건부로 쳐짐. 비무작위 결측 : 결론과 관련 있는 변수로 인해서 결측이 된 경우

자료 처리하다가 생긴 값에 대해서도 이상치 인정해줌
PCA
- 독립적인 X → 분포에 대한 가정을 요구하지 않음
- 독립일 때만 가능하다 X → 오히려 연관 있어야함
요인분석
- 변수들간의 관계를 분석하여 공통 차원으로 축약
- 독립변수, 종속변수 개념이 없음. 주로 기술통계 사용함
- 변수를 제거함.
파생변수
- 특정상황에만 유의미하지 않도록 대표성을 띄어야함
요약변수
- 데이터마트에서 가장 기본적인 변수임
- 많은 분석모델에서 공통으로 사용될 수 있어서 재활용성 높음
분포에 따른 변환

꼬리가 긴 쪽이 평균임. 그래서 평균이 크면 왜도가 큰겨
우로 치우침 = 왜도가 0보다 큰 상황 작은 값은 더 작게 큰 값은 더 크게 해야함. 그래서 제곱 ~