모집단 : 조사하고 싶은 전체 대상 -> 대한민국 성인 전체 원소 : 모집단을 구성하는 하나의 대상 -> 성인 한 명 모수, Parameter : 표본에서 계산한 값 -> 모집단의 평균 통계량, 표본에서 계산한 값 -> 표본 평균 추정량, 모수를 추정하기 위해 사용하는 통계량 -> 로 추정
2. 표본오차 vs 비표본오차
표본오차는 전체 모집단이 아니라 일부 표본만 조사했기 때문에 발생하는 차이다. 예를 들어 실제 평균 연봉이 4,000만 원인데 표본으로 계산했더니 3,900만 원이 나왔다면 표본추출 때문에 차이가 발생할 수 있다.
비표본오차
표본추출 때문이 아닌 오류다. 예를들어 설문 문항의 오류, 조사자의 실수, 응답자의 거짓말 같은것이다.
표준오차
표본에서 계산한 통계량이 표본을 바꿀 때마다 얼마나 흔들리는지를 나타낸다. 표본 수가 증가할 경우 표준오차가 감소하고 추정이 더 정밀해진다.
표본추출 방법
확률표본추출 : 모집단의 각 대상이 선택될 확률을 알 수 있는 방법이다.
- 단순랜덤추출
- 계통추출 : 일정한 간격으로 추출 3번째 → 13번째 → 23번째 → 33번째
- 층화추출 : 모집단을 성격이 비슷한 층으로 나눈 후 각 층에서 표본을 추출한다. 남성 500명 --> 50명 여성 500명 --> 50명
- 군집추출 : 모집단을 여러 군집, Cluster 로 나누고 일부 군집을 선택한다. 전국 학교 1,000개 -> 학교 30개 무작위 선택 -> 선택된 학생 조사
- 층화 vs 군집
| 층화추출 | 군집추출 | |
|---|---|---|
| 그룹을 나눔 | O | O |
| 어떤 그룹 조사? | 모든 층 | 일부 군집 |
| 목적 | 대표성 향상 | 조사 비용 절감 |
비확률표본추출
| 방법 | 문제의 표현 |
|---|---|
| 편의표본 | 조사하기 쉬운 사람 선택 |
| 판단/유의표본 | 전문가가 적절하다고 판단한 대상 선택 |
| 할당표본 | 성별·연령 등의 비율을 정하고 인원 할당 |
| 눈덩이표본 | 기존 참여자가 다른 참여자를 소개 |
조건부 확률
B가 일어났다는 조건에서 A가 일어날 확률이다. 예를 들어:
- 전체 학생 100명
- 남학생 60명
- 남학생이면서 합격한 학생 30명
남학생이라는 조건에서 합격할 확률:
여기서
|는 ~라는 조건에서라고 읽으면 된다.
베이즈, 베이지안 정리
총확률은 원인 -> 결과를 계산하여 통계를 추출하지만 베이즈 정리는 결과를 보고 원인을 역으로 추정한다. 예를들어, 불량품을 하나 발견했다. 이 제품이 B공장에서 만들어졌을 확률을 구한다. 사후확률을 구한다.
이산확률분포
값을 하나씩 셀 수 있을때 사용한다.
- 베르누이 분포 : 결과가 딱 2개로 성공or실패 와 같이 이분적으로 나뉘는 분포
- 이항분포 : 베르누이 시행을 여러 번 반복했을 때 나오는 성공 횟수 예를들어 동전을 10번 던져 앞면이 나오는 횟수
- 기하분포 : 첫번째 성공이 나올 때까지 몇 번 시행하는가? 동전을 몇 번 던져야 처음 앞면이 나오는가?
- 다항분포 : 이항분포를 여러 범주로 확장한 것 결과가 3개 이상인 경우
- 포아송분포 : 일정한 시간 공간에서 사건이 발생하는 횟수 1시간 동안 고객 방문 횟수, 하루 동안 서버 장애 횟수, 도로 1km당 사고 발생 수
연속확률분포
- 균일분포
- 정규분포 : 종모양이며 평균을 중심으로 좌우 대칭이다.
- t분포 : 정규분포와 비슷하지만 꼬리가 더 두껍다. 주로 모분산을 모르고 표본이 작을 때 모집단 평균 추정에 사용한다.
- 카이제곱분포 : 분산/독립성검정/적합도검정
- F분포 : 분산의 비교에 사용한다. ANOVA 에서 사용한다.
| 문제 키워드 | 분포 |
|---|---|
| 성공/실패 한 번 | 베르누이 |
| n번 시행의 성공 횟수 | 이항 |
| 첫 성공까지 시행 횟수 | 기하 |
| 일정 시간의 사건 발생 횟수 | 포아송 |
| 종 모양·좌우대칭 | 정규 |
| 소표본 평균 추정 | t |
| 분산·독립성 | 카이제곱 |
| 분산 비교·ANOVA | F |
기대값
확률변수의 장기적인 평균으로 주사위를 아주 많이 던진다고 생각해보았을 경우 주사위에서 3.5가 실제로 나오지는 않지만 시행을 무한히 반복했을 때 평균적으로 3.5에 가까워진다는 것을 의미한다.
- 이산형
- 연속형
분산
분산은 데이터가 평균으로부터 얼마나 퍼져 있는가를 나타낸다.
중심극한정리
모집단의 분포가 어떤 모양이든 표본의 크기가 충분히 커지면 표본평균의 분포가 정규분포에 가까워진다.
- 원래 데이터 자체가 정규분포가 된다는 뜻 ❌
- 표본평균의 분포가 정규분포에 가까워진다 ⭕
좋은 추정량의 조건
모수를 추정할 때 좋은 추정량이 가져야 하는 성질이다.
- 불편성 : 평균적으로 실제 모수와 같다.
- 효율성 : 여러 불편추정량 중 분산이 작은 추정량이 더 좋다. 덜 흔들리는 추정량
- 일치성 : 표본 크기가 증가할수록 추정값이 실제 모수에 가까워진다.
- 충분성 : 표본이 가진 모수에 관한 정보를 충분히 포함하는 추정량이다.
최소대표 : 실제 모집단의 대표성을 나타낼 표본이 아닌 다른 데이터가 표본이 되는 현상 과잉대표 : 중복선택 등의 원인으로 모집다이 반복 중복된 데이터만으로 규정되는 현상을 지칭한다. 표본추출 시 표본의 크기보다는 대표성을 가지는 표본을 추출하는 것이 중요하다.