확률적 표본 추출 방법

  1. 랜덤 추출법
  2. 계통 추출법 (계층적 추출법) : 일정 간격 추출
  3. 집락 추출법 (군집 추출법)
    1. 여러 학년 중 2반 아이들 추출
    2. 군집 간 동일적 특징 : 여러 반 애들끼리는 학년이 같으니까 또이또이함
    3. 군집 내 이질적 특징 : 반 애들 내부 끼리는 특성이 다름
  4. 층화 추출법
    1. 여러 학년 중 2학년 애들만 추출
    2. 군집 간 이질적 특징 : 학년 별로 애들 특징이 다름
    3. 군집 내 동일적 특징 : 같은 학년 애들이니까 공통점이 많음
  5. 복원, 비복원 추출
    1. 복원 추출 : 추출되었던 데이터를 다시 포함시켜 표본 추출
    2. 비복원 추출 : 추출되었던 데이터는 제외하고 표본 추출

비확률적 표본 추출 방법 (읽어보는 정도)

  1. 편의 추출법 : 연구자가 쉽게 접근 가능한 대상으로 표본을 추출
  2. 의도적 추출법 : 연구자가 특정 기준을 정하고, 이에 맞는 표본을 추출
  3. 할당 추출법 : 특정 기준으로 나눈 후, 그 그룹에서 할당된 수 만큼 추출
  4. 눈덩이 추출법 : 초기 응답자로부터 새로운 응답자를 추천 받는 방식
  5. 자기 선택 추출법 : 응답자가 스스로 조사에 참여할 지 결정

기초 확률 용어

  1. 독립사건 : A, B가 서로 영향을 주지 않는 사건 (P(A|B) = P(A))
    1. P(A n B) = P(A) P(B)
  2. 배반사건 : A, B가 서로 동시에 일어나지 않는 사건
    1. P(A n B) = 공집합 (동전을 던졌을 때 앞면과 뒷면이 동시에 나올 확률)
  3. 베이스 정리 : 두 확률 변수의 사전 확률과 사후 확률 사이의 관계를 나타내는 정리
    1. P(A | B) = P(B | A) * P(A) / P(B)

확률 분포

  1. 이산 확률분포 : 셀 수 있음. 확률 질량 함수로 표현됨

    • 이산 균등 분포
      • 주사위
    • 베르누이 분포
      • 동전 앞뒤
    • 이항분포
      • N번의 베르누이 실행 중 K번 성공할 확률의 분포
      • 동전 20번 던져서 앞면이 나오는 횟수
    • 기하분포
      • 성공확률이 p인 베르누이 시행에서 처음으로 성공할 때까지 시행횟수
      • 동전을 던져 처음으로 앞면이 나오기까지 던진 횟수
    • 음이항분포
      • 성공확률이 p인 베르누이 시행에서 r번 성공할 때까지 반복 시행횟수
      • 동전을 던져 앞면이 4번 나오기까지 던진 횟수
    • 초기하분포
      • N개 중 비복원추출로 n번 추출했을 때 원하는 결과가 k번 나올 확률의 분포
      • 10개 구슬 중 4개의 구슬이 당첨 구슬일 때, 4번 뽑았을 때 2번 뽑을 확률
    • 다항분포
      • N번 시행에서 각 시행이 여러 개의 결과를 가질 수 있는 확률 분포
      • 주사위를 20번 던져 각 면이 나오는 횟수
    • 포아송 분포
      • 단위 시간 내 발생할 수 있는 사건의 발생 횟수에 대한 분포
      • 하루동안 발생하는 출생자 수, 한 시간 동안 사무실에 걸려온 전화의 수 > 베포항항하
  2. 연속 확률분포 : 셀 수 없음. 확률 밀도 함수로 표현됨

    • 정규분포
      • Z검정
    • t분포
      • 정규분포와 유사하지만 꼬리 부분이 더 두껍고 긴 분포
      • (T검정 활용) 표본이 30개 볻 작은 집단에 대한 평균 검정
    • 카이제곱 분포
      • 독립적인 정규분포를 따르는 변수들의 제곱합으로 구성된 분포
      • (카이제곱 검정 활용) 두 집단의 동질성 검정, 단일 집단의 모분산 검정
    • F분포
      • 두 개의 서로 다른 카이제곱 분포의 비율
      • (F검정 활용) 두 집단의 분산 동질성 검정

표본 분포

중심극한정리

  • 30개 이상 ㅇㅇ
  • 모집단 분포와 무관

표본평균의 표본분포

추론 통계

점추정

  • 모집단이 특정한 값으로 추정하며, 추정량(Estimator)으로 모수를 추정
  1. 추정량의 조건

    1. 불편성 (Unbiasedness) : 추정량의 기댓값이 실제 모수와 같음 (편향이 0이 되는 경우)
    2. 효율성 (Efficiency) : 여러 추정량 중 분산이 작은 것이 더 효율적인 추정량
    3. 일치성 (Consistency) : 표본 크기가 증가할 수록 추정량이 모수에 가까워짐
    4. 충족성 (Sufficiency) : 추정량이 모집단의 정보를 최대한 반영 """ 불효일충 """
  2. 대표적인 추정량

  3. 평균제곱오차 (MSE) : 알지?

구간추정

  • 모집단이 특정한 구간으로 추정 (95%, 99%를 가장 많이 사용)

가설 검정

  • 1종 오류 : 귀무 가설이 참일 때 기각하는 경우 : 기존 내용이 맞는데 아니라고 부정하는 경우