이 페이지 목차 8개
  1. 개요
  2. 핵심 사실
  3. 비교표
  4. 시험 포인트
  5. 예제
  6. 확인 문제
  7. 이어서 보기
  8. 완료
08 / 8

통계적 추정

표본으로 모집단을 추측하는 방법을 배우고, 표본평균의 분포와 신뢰구간을 익힌다.

가르칠 때 짚을 것 교사용
시험에 나오는 것
신뢰구간 공식 대입은 짧다. 배점은 ** 이 분모에 있다는 것에서 갈린다. 구간의 길이를 반으로 줄이려면 표본을 네 배로 해야 한다는 문항이 반드시 나온다. 대입 연습을 줄이고 이 제곱근 안에 있다는 사실을 쓰는 훈련**에 시간을 쓴다.
여기서 무너집니다
표본평균의 표준편차를 이라 쓴다. 분산이 인 것을 그대로 옮겼기 때문이다. 분산에서 출발시킨다. 분산이 이니 표준편차는 그 제곱근이다. 분산을 먼저 쓰고 제곱근을 씌우는 순서로 고정하면 다시 틀리지 않는다.
확인 질문

신뢰구간의 길이를 절반으로 줄이려면 표본 크기를 몇 배로 해야 합니까? 왜 그렇습니까?

배와 " 이 분모라서"가 함께 나오면 통과. 배라 답하면 제곱근을 흘린 것이니, 여론조사 표본오차 이야기와 이어 붙여 감각을 준다.

개요

전국 고등학생의 평균 키를 알고 싶다고 하자. 모두를 재는 것은 불가능하다. 그래서 일부만 뽑아 재고, 그 결과로 전체를 추측한다. 이것이 통계의 실제 쓰임이며, 앞 소단원까지 쌓은 확률은 이 추측이 얼마나 믿을 만한지를 재기 위한 도구였다.

핵심 발견은 이것이다: 표본평균 X\overline{X} 자체가 확률변수다. 어떤 표본을 뽑느냐에 따라 값이 달라지기 때문이다. 그런데 그 흔들림에는 규칙이 있어서, 표본평균은 모평균을 중심으로 하는 정규분포를 따르고 그 흩어짐은 σn\dfrac{\sigma}{\sqrt{n}} 로 줄어든다. 표본을 키울수록 추측이 정확해지는 이유가 이 n\sqrt{n} 안에 들어 있다.

핵심 사실

  • 모집단은 조사 대상 전체, 표본은 그중 실제로 뽑은 일부다. 표본을 뽑는 시행마다 값이 달라지므로 표본평균 X\overline{X} 는 확률변수다.
  • 표본평균의 분포: 모평균 mm, 모표준편차 σ\sigma 인 모집단에서 크기 nn 인 표본을 뽑으면
E(X)=m,V(X)=σ2n,σ(X)=σnE(\overline{X}) = m,\qquad V(\overline{X}) = \frac{\sigma^2}{n},\qquad \sigma(\overline{X}) = \frac{\sigma}{\sqrt{n}}
  • 평균은 그대로, 흩어짐만 줄어든다는 것이 요점이다. nn44 배로 늘리면 표준편차는 절반이 된다.
  • 모집단이 정규분포면 X\overline{X} 도 정규분포를 따른다. 모집단이 정규분포가 아니어도 nn 이 충분히 크면 근사적으로 정규분포를 따른다(중심극한정리).
  • 모평균의 신뢰구간: 모표준편차 σ\sigma 를 알 때, 표본평균이 x\overline{x} 이면
xkσn    m    x+kσn\overline{x} - k\frac{\sigma}{\sqrt{n}} \;\le\; m \;\le\; \overline{x} + k\frac{\sigma}{\sqrt{n}}
  • 신뢰도에 따라 kk 가 정해진다: 95%95\% 이면 k=1.96k = 1.96, 99%99\% 이면 k=2.58k = 2.58 이다. 표준화ZZ 가 그 범위에 들어갈 확률에서 나온 값이다.

  • 구간의 길이2kσn2k\dfrac{\sigma}{\sqrt{n}} 다. 신뢰도를 높이면 길어지고, 표본 크기를 키우면 짧아진다. 정확도와 확신은 맞바꾸는 관계다.

  • 신뢰도 95%95\% 의 뜻: 같은 방법으로 표본을 100100 번 뽑아 구간을 100100 개 만들면 그중 약 9595 개가 모평균을 포함한다는 뜻이다. 모평균이 그 구간에 있을 확률이 95%95\% 라는 말이 아니다. 모평균은 고정된 값이고, 흔들리는 쪽은 구간이다.

  • 모비율의 신뢰구간: 비율을 물을 때도 꼴은 같고 흩어짐을 재는 자리만 다르다. nn 명 중 XX 명이 찬성했다면 표본비율은 p^=Xn\hat{p} = \dfrac{X}{n} 이고, nn 이 충분히 크면

p^kp^(1p^)n    p    p^+kp^(1p^)n\hat{p} - k\sqrt{\frac{\hat{p}(1-\hat{p})}{n}} \;\le\; p \;\le\; \hat{p} + k\sqrt{\frac{\hat{p}(1-\hat{p})}{n}}
  • 근호 안이 표본비율의 분산이다. XX 가 이항분포를 따르므로 V(X)=np(1p)V(X) = np(1-p) 이고, 그것을 nn 으로 나눈 p^\hat{p} 의 분산이 p(1p)n\dfrac{p(1-p)}{n} 이다. 정작 모르는 pp 가 남아 있어 그 자리에 표본비율을 넣어 쓴다. 단계별 유도는 모비율의 신뢰구간 편에 있다.
  • p^=0.5\hat{p} = 0.5 일 때 근호 안이 가장 커져 구간이 가장 넓어진다. 조사에 필요한 표본 크기를 미리 정할 때는 이 최악의 경우를 쓴다.

완료로 두면 확률과 통계 목차에 표시됩니다.