단원 홈

Ⅱ. 데이터 준비와 분석1차시

1,600명에게 물어도
틀리는 설문

많이 모으기와 고르게 모으기

두 조사팀이 같은 도시에서 같은 것을 물었는데 답이 다섯 배 넘게 벌어졌습니다. 한 팀은 100명, 다른 팀은 그 16배인 1,600명에게 물었어요. 많이 물은 쪽이 맞을까요? 참값을 아는 가상 도시를 만들어, 틀린 답이 사람 수로 고쳐지는지 직접 재 봅니다.

  • [12데과02-01]
  • 50분네 정거장
  • 새 도구random · statistics 로 되풀이하기
  • 자료가상 도시 누리시 주민 20,000명

학습 목표

  1. 개념에서

    오차를 편향과 흩어짐으로 나누어 말하고, 편향이 표집 틀에서 먼저 생긴다는 것을 설명할 수 있다.

  2. 손으로

    수집 방법 다섯 가지를 표본 크기마다 100번씩 되풀이해 편향·흩어짐·RMSE를 직접 잴 수 있다.

  3. 확인에서

    내가 할 조사의 편향 방향을 예측하고, 그것을 줄이는 수집 계획을 한 줄로 적을 수 있다.

1
여는 장면 · 5분

같은 도시, 같은 물음 — 그런데 답이 다섯 배 벌어졌다

가상 도시 누리시가 '시민의 주당 공공자전거 이용 횟수'를 알아보려고 두 팀을 보냈습니다. A팀은 주민 명부에서 무작위로 100명을 뽑아 전화를 걸었고, B팀은 자전거 도로에 나가 지나가는 시민 1,600명에게 물었어요.

B팀은 A팀보다 16배나 많은 사람에게 물었습니다. 그런데 두 팀이 가져온 답은 1.23회와 6.56회 — 다섯 배 넘게 벌어졌습니다. 시청은 B팀의 숫자로 보도자료를 냈고, 기사가 나갔습니다.

도시 · 가상 기사

시민 1,600명에게 물었다 — 누리시민, 주당 6.6회 공공자전거 이용

누리시청 보도자료 인용 · 이 기사는 수업을 위해 지어낸 것입니다
표 1두 팀이 가져온 것주당 공공자전거 이용 횟수
조사팀어디서 물었나물은 사람주당 평균참값과의 거리
A팀주민 명부에서 무작위로1001.23가려 둠
B팀자전거 도로 위에서1,6006.56가려 둠

물은 사람 수는 B팀이 16배입니다. 그런데 두 답은 5.33회나 떨어져 있어요. 한쪽이 크게 틀렸다는 뜻인데, 참값을 모르면 어느 쪽인지 가릴 수 없습니다. 자료: 3정거장 코드 ②의 표에서 A n=100 줄(1.228)과 B n=1,600 줄(6.561)의 평균값 — 같은 방법을 100번 되풀이했을 때 한 번의 조사가 내놓을 만한 값이다

그림 1두 답 사이의 거리주황 점 = 두 팀의 답 · 참값은 아직 가려 둠
012345678주당 이용 횟수(회)A팀 1.23회명부 100명B팀 6.56회도로 1,600명참값은 어디에? 012345678주당 이용 횟수(회)A팀 1.23회명부 100명B팀 6.56회도로 1,600명참값은 어디에?

두 팀이 같은 도시에서 같은 물음을 했는데도 답이 눈금 다섯 칸만큼 떨어졌습니다. 참값은 이 자 위 어딘가에 있어요 — 두 답 사이일 수도, 둘 다의 바깥일 수도 있습니다.

먼저 예측

참값은 아직 가려 두었습니다. 어느 팀이 참값에 더 가까울지, 그리고 참값은 몇 회쯤일지 한 문장으로 적어 두세요. 까닭도 한 마디 붙이면 좋습니다 — "사람을 더 많이 물었으니까" 도 훌륭한 까닭입니다. 3정거장 미션 ①에서 여러분의 예측과 참값을 맞대어 봅니다.

체크포인트 1

같은 물음에 답이 다섯 배 벌어졌다는 것, 그리고 참값을 모르면 어느 쪽이 틀렸는지 가릴 수 없다는 것을 확인했다.

다음 정거장 · 개념 15분 →
2
개념 · 15분

많이 모으기가 고치는 오차, 고치지 못하는 오차

2-1편향은 '누구를 뽑을 수 있는가'에서 먼저 생긴다

조사는 세 겹으로 이루어집니다. 모집단은 우리가 알고 싶은 사람 전체이고, 표집 틀은 그 가운데 실제로 뽑힐 수 있는 사람이며, 표본은 그 틀에서 실제로 물은 사람들입니다.

A팀의 표집 틀은 주민 명부 — 20,000명 모두입니다. B팀의 표집 틀은 자전거 도로 위, 곧 자전거를 타는 사람만이에요. 누리시에서 한 번도 자전거를 타지 않는 주민은 13,416명(67.1%)입니다. 이 사람들은 도로에 나오지 않으므로, B팀이 아무리 오래 서 있어도 한 명도 만날 수 없습니다.

여기서 편향이 태어납니다. 편향은 조사원의 실수가 아니라 틀의 모양이에요. 표본 수를 늘리는 일은 틀 안에서 더 많이 뽑는 일이지 틀을 넓히는 일이 아닙니다.

그림 2같은 도시, 다른 표집 틀①모집단 → ②표집 틀 → ③표본 → ④답
A팀 — 주민 명부에서 100명① 모집단 — 누리시 주민 20,000명안 탐 13,4166,584② 표집 틀 — 뽑힐 수 있는 사람20,000명 모두명부에는 안 타는 사람도 들어 있다③ 표본 — 실제로 물은 사람100명점 하나 = 1명④ 그 표본이 내놓은 답024681.23회참값 1.189 B팀 — 자전거 도로에서 1,600명① 모집단 — 누리시 주민 20,000명안 탐 13,4166,584② 표집 틀 — 뽑힐 수 있는 사람만날 수 없다6,584명13,416명(67.1%)이 틀 밖으로 빠진다③ 표본 — 실제로 물은 사람1,600명점 하나 = 8명④ 그 표본이 내놓은 답024686.56회참값 1.189 A팀 — 주민 명부에서 100명① 모집단 — 누리시 주민 20,000명안 탐 13,4166,584② 표집 틀 — 뽑힐 수 있는 사람20,000명 모두명부에는 안 타는 사람도 들어 있다③ 표본 — 실제로 물은 사람100명점 하나 = 1명④ 그 표본이 내놓은 답024681.23회참값 1.189 B팀 — 자전거 도로에서 1,600명① 모집단 — 누리시 주민 20,000명안 탐 13,4166,584② 표집 틀 — 뽑힐 수 있는 사람만날 수 없다6,584명13,416명(67.1%)이 틀 밖으로 빠진다③ 표본 — 실제로 물은 사람1,600명점 하나 = 8명④ 그 표본이 내놓은 답024686.56회참값 1.189

두 깔때기의 ①은 똑같습니다. 갈리는 곳은 ②표집 틀이에요 — A팀은 20,000명 전부, B팀은 6,584명뿐입니다. ③에서 B팀이 16배 많이 뽑아도, 그 1,600명은 모두 6,584명 안에서만 나옵니다. 그래서 ④의 답이 참값에서 멀어집니다. 자료: 가상 누리시 주민 20,000명(씨앗 2026) — 13,416명·6,584명은 코드 ①의 67.1%와 같은 값

2-2오차는 두 가지다 — 흩어짐과 편향

같은 방법으로 조사를 여러 번 되풀이하면 답이 조금씩 달라집니다. 그 답들이 얼마나 넓게 퍼지는가가 흩어짐이고, 답들의 가운데가 참값에서 얼마나 벗어나 있는가가 편향입니다. 둘은 사람 수(n)에 전혀 다르게 반응합니다.

그림 3과녁 넷과, 그 자리에 앉는 네 줄왼쪽 모식도의 어느 칸에 오른쪽 네 줄이 앉는지 맞춰 보세요
편향과 흩어짐 — 네 가지 과녁흩어짐 작다흩어짐 크다편향작다편향크다가운데 십자 = 참값 · 빈 점 = 조사 한 번의 답 같은 네 줄, 실제 숫자RMSEA 명부 n=1000.263A 명부 n=1,6000.061B 도로 n=1005.279B 도로 n=1,6005.373012345678주당 이용 횟수(회) · 주황 점선 = 참값 1.189 편향과 흩어짐 — 네 가지 과녁흩어짐 작다흩어짐 크다편향작다편향크다가운데 십자 = 참값 · 빈 점 = 조사 한 번의 답 같은 네 줄, 실제 숫자RMSEA·1000.263A·1,6000.061B·1005.279B·1,6005.37302468주당 이용 횟수(회) · 주황 점선 = 참값 1.189

A 명부는 n을 16배로 늘리자 띠가 좁아지며 참값 위에 모입니다(왼쪽 위 과녁). B 도로도 띠는 똑같이 좁아지지만 6.5 언저리에 모입니다(왼쪽 아래 과녁) — 한곳에 모였는데 빗나간 화살이에요. 오른쪽 끝의 RMSE가 그 둘을 한 숫자로 말합니다. 자료: 코드 ②를 방법마다 100번씩 되풀이한 값(원장 실측)

두 오차를 한 숫자로 묶은 것이 RMSE입니다 — RMSE = √(편향² + 흩어짐²). 참값에서 평균적으로 얼마나 빗나가는지를 재는 자예요. 흩어짐이 0이 되어도 편향이 남아 있으면 RMSE는 편향 아래로 내려가지 못합니다.

B 자전거 도로 · n을 16배로 — 흩어짐
0.544n=100
→
0.119n=1,600

4.6분의 1로 줄었다 — 사람 수가 고치는 오차.

B 자전거 도로 · n을 16배로 — 편향
+5.251n=100
→
+5.372n=1,600

꿈쩍도 않는다 — 사람 수가 못 고치는 오차.

RMSE · 적게 물은 A와 많이 물은 B
0.263A 명부 n=100
vs
5.373B 도로 n=1,600

100명이 1,600명을 스무 배 넘게 이긴다.

D 전화+무응답 · 편향은 위쪽만이 아니다
1.189참값
인데
0.869D의 답 n=1,600

아래로 틀렸다 — 편향에는 방향이 있다.

자료: 위 네 쌍의 숫자는 모두 3정거장 코드 ②가 찍는 값이다(방법마다 100번 되풀이).

2-3편향의 얼굴 넷

편향은 한 가지 모습이 아닙니다. 누가 더 잘 걸리는가가 답하는 값과 엮이면, 그 엮임의 생김새마다 다른 이름이 붙습니다. 누리시에서 우리가 쓸 방법 다섯 가운데 넷이 여기에 해당해요.

표 2편향의 얼굴 넷 — 무엇이 답을 어느 쪽으로 미나
얼굴무슨 일이 일어나나누리시의 방법어느 쪽으로 · 얼마나
현장 조사 편향 자주 오는 사람이 더 잘 잡힌다B 자전거 도로위로 +5.372 (n=1,600)
자발 응답 편향 관심 있는 사람이 스스로 누른다C 온라인 링크위로 +1.348 (n=1,600)
무응답 편향 끝까지 답하는 사람이 한쪽으로 치우친다D 전화+무응답아래로 −0.320 (n=1,600)
질문 편향 묻는 말이 답을 민다코드로는 재지 않는다방향은 물음에 달렸다

편향은 늘 부풀리는 쪽이 아닙니다. D는 아래로 틀렸어요 — 전화를 끝까지 받는 비율이 높은 60대·70대 이상은 자전거를 탈 확률이 낮기 때문입니다. 그리고 무응답이 늘 편향이 되는 것도 아닙니다(3정거장 미션 ③에서 부숴 봅니다). 자료: 코드 ②의 n=1,600 줄(원장 실측)

Ⅰ-2 에서 가져옴2차시의 '무작위'는 배정이었습니다 — 어느 교차로에 카메라를 놓을지를 제비로 정하는 일. 오늘의 '무작위'는 표집입니다 — 누구에게 물을지를 제비로 정하는 일. 같은 낱말이 다른 일을 하니, 보고서에서 '무작위'를 보면 무엇을 무작위로 했는지를 먼저 찾아 읽습니다.

2-4층화는 흩어짐을 줄이는 도구다 — 편향을 고치지 못한다

층화 무작위 추출은 모집단을 층(예: 연령대 일곱)으로 나눈 뒤 층마다 그 비율만큼 무작위로 뽑는 방법입니다. 누리시의 n=400이라면 10대 36명 · 20대 52명 · 30대 60명 · 40대 64명 · 50대 68명 · 60대 60명 · 70대 이상 60명이에요.

층화가 이득을 주는 것은 층이 결과를 잘 가를 때뿐입니다. 누리시에서 이용 횟수 차이 가운데 연령대 '사이'가 설명하는 몫은 8.7%뿐이라 기대 이득이 4.5%(단순 무작위의 0.955배)밖에 안 돼요. 그래서 100번 되풀이한 표에서는 층화(E)가 오히려 넓게 나오기도 합니다(n=400에서 A 0.105 · E 0.113). 1,000번 되풀이하면 A 0.126 · E 0.123으로 기대대로 돌아옵니다 — 이득이 되풀이의 흔들림보다 작으면 한 번의 표로는 보이지 않습니다.

그리고 층화는 흩어짐을 줄이는 도구이지 편향을 고치는 도구가 아닙니다. 게다가 층마다 뽑으려면 명부가 있어야 해요 — 자전거 도로에는 층도 명부도 없습니다.

규칙조사 결과를 보고할 때는 누구를 뽑을 수 있었는지(표집 틀) 와 누가 빠졌는지를 사람 수와 함께 적는다.

층화의 몫연령대 일곱
연령대 '사이' 몫 8.7%흩어짐 A 0.126 → E 0.123

자료: 원장 계산 — 1,000번 되풀이 n=400

조사를 읽는 나침반 — 네 방향을 차례로

  1. 모집단누구에 대한 말인가 — 시민 전체인가, 자전거를 타는 사람인가
  2. 표집틀그 가운데 누구를 뽑을 수 있었나 — 도로에서는 67.1%가 틀 밖이다
  3. 빠진 사람틀 밖 · 무응답으로 빠진 쪽은 어느 쪽인가
  4. 응답률몇 명에게 물어 몇 명이 답했나 — n만 크게 적힌 보고는 의심한다

그래서 '1,600명에게 물었다'는 말만으로는 아무것도 알 수 없습니다. 이 넷 가운데 앞의 셋을 적지 않은 보고는, 사람 수가 클수록 더 확신에 찬 틀린 답이 됩니다.

체크포인트 2

오차를 편향과 흩어짐으로 나누어 말할 수 있고, 편향이 표집 틀에서 태어난다는 것을 안다. 이제 참값을 아는 세상을 직접 만들어 잰다.

다음 정거장 · 손으로 20분 →
3
손으로 · 20분

참값을 아는 세상을 만들어, 다섯 가지 방법을 100번씩 돌린다

오늘의 장비

되풀이 실험 — random 과 statistics

Ⅰ 단원에서는 자료를 한 번 읽고 한 번 계산했습니다. 오늘은 같은 조사를 100번 되풀이해서, 답이 어디에 모이고 얼마나 흩어지는지를 잽니다. 새 라이브러리는 없습니다 — 파이썬에 들어 있는 두 꾸러미면 됩니다.

부르는 모양

import random, statistics

# 골고루 100명 — 명부 무작위
random.sample(주민, 100)
# 무게만큼 잘 걸린다
random.choices(주민, 무게, k=100)
# 평균 · 표준편차
statistics.fmean(값)
statistics.pstdev(값)

오늘 쓰는 함수 넷

sample
겹치지 않게 n명 — 명부 무작위
choices
무게를 준 뽑기 — 잘 걸리는 사람이 있다
fmean
평균 — mean보다 빠른 소수 전용
pstdev
표준편차 — 이 100개가 흩어진 폭

Ⅰ 단원과 다른 셋

  1. 한 번이 아니라 100번한 번의 답은 흔들린다. 흔들림 자체를 재려면 되풀이한다
  2. 무게를 준 뽑기choices의 두 번째 인자가 곧 '누가 더 잘 걸리나'
  3. 참값을 아는 세상가상 자료라서 편향을 '잴' 수 있다 — 실제 도시에서는 못 잰다

대가 — 되풀이가 많아질수록 탭이 멈춥니다. 코드 ②는 1,500번을 돌아 약 5초 걸려요.

1

참값을 아는 세상을 만들고, 그 안에 그물을 던진다

10분

여는 장면에 적어 둔 내 예측입니다. 코드 ①을 돌리면 참값이 공개됩니다 — 맞았을까요?

하나 더 짐작해 두세요. 연령대 일곱의 평균 이용 횟수는 나이가 많을수록 줄어드는 한 방향일까요, 아니면 가장 많이 타는 층이 따로 있을까요?

기본 코드 ①은 채워져 있습니다. 그대로 ▶ 실행해 참값과 연령대 일곱 줄을 확인하세요. SHARE·USE_P·MEAN_T 세 줄이 이 가상 도시의 설계도입니다 — 연령대 비율 · 한 번이라도 타는 비율 · 타는 사람의 주당 평균 횟수.

도전 USE_P의 마지막 값 0.08(70대 이상)을 0.30으로 바꿔 다시 돌려 보세요. 참값이 1.189에서 1.270으로 올라갑니다 — 한 층의 숫자 하나가 도시 전체의 답을 바꿉니다.

탐구 이 가상 세계를 실제 도시에 가깝게 맞추려면 어떤 실제 자료가 필요할까요? SHARE에는 무엇을, USE_P에는 무엇을 넣어야 할지 적어 보세요(2차시에서 그 두 자료를 실제로 엽니다).

이제 이 세상에 그물을 던져 봅니다. 그물이란 이용 횟수 칸마다 적은 '그 사람이 이 조사에 걸릴 확률'이에요 — 조사 방법 하나가 그물 하나입니다. 그물을 손가락으로 쓸어 그리면, 그 방법이 내놓을 답 ▼(기댓값)이 곧바로 움직입니다. 높이 띠는 그물을 통째로 들어 올리는 높이, 곧 물은 사람 수고요. 먼저 B팀이 도로에서 실제로 만난 1,600명의 윤곽을 그물로 복원해 보세요.

시뮬레이터

그물 빚기

누가 걸리는지를 손가락으로 그린다 — '많이'는 높이, '고르게'는 모양

  1. 1가운데 칸을 쓸어 그물을 그린다 — 높이 = 그 칸의 사람이 걸릴 확률
  2. 2맨 아래 자에 ▽를 꽂아 예측을 잠근다 → 높이 띠가 풀린다
  3. 3램프 둘과 도전 셋이 내 그물을 채점한다
어디서 묻나
높이 띠 — 물은 사람 수
자전거 도로 · 사람 수 100명세로: 주민 수 · 가운데 띠가 내 그물

그물 = 칸마다 적은 ‘조사에 걸릴 확률’ · ▼ 기댓값 = Σ(사람 수 × 걸릴 확률 × 횟수) ÷ Σ(사람 수 × 걸릴 확률) — 그물의 모양만으로 정해진다(높이 띠와 무관하다)

흩어짐 = √(그물이 걸러 낸 세상의 분산 ÷ 사람 수) · 무작위 환산 인원 = 6.383 ÷ (편향² + 흩어짐²) — 이 조사가 주민 명부 무작위 몇 명어치인가(6.383 = 누리시 주민 20,000명의 분산). 판의 흩어짐은 식으로 낸 값이고 표 3의 흩어짐은 100번 되풀이해 잰 값이라 셋째 자리가 다를 수 있다

겹침 = 칸마다 min(내 그물이 걸러 낼 비율, B팀 1,600명의 실제 비율)을 더한 값 · 램프 = 평균이 ±0.05회, 안 타는 주민 비율이 ±2%p 안에 들면 켜진다

편향—회
기댓값 ▼—
흩어짐—
무작위 환산 인원—
안 타는 주민—
B팀 윤곽 겹침—
도전 1

자전거 도로에서 그물을 빚어 B팀이 실제로 만난 1,600명의 윤곽과 95% 이상 포개라. 막히면 판정 창이 힌트를 한 단씩 준다.

도전 2

램프 둘을 한꺼번에 켜라 — 같은 그물이 ‘주당 평균’과 ‘안 타는 주민 비율’ 두 물음에 함께 답해야 한다. 자전거 도로에서는 왜 안 되는지도 적어 두어라.

도전 3

전화에서 일곱 칸이 들쭉날쭉한데(가장 높은 칸 − 가장 낮은 칸 ≥ 0.4) 편향은 0에 가까운(|편향| < 0.02) 그물을 찾아라.

자료: 가상 누리시 주민 20,000명(씨앗 2026) — ../data/nuri_people.csv 를 연령대 7 × 이용 0~38회 개수표 273칸으로 접어 쪽 안에 실었다(코드 ② · ③이 읽는 파일과 같은 값). B팀이 도로에서 만난 1,600명은 그 개수표에 ‘이용 횟수에 비례하는 그물’을 씌워 한 번 뽑은 것으로, 평균이 6.56회라 표 1의 B팀 줄과 같은 자리에 있다. 판은 열릴 때 이 값들을 스스로 다시 세어 원장 값과 맞대어 본다.

B팀이 1,600명에게 물어도 틀리는 까닭은 이고, 사람 수를 늘려 고칠 수 없는 까닭은 이다. 도로에서 ‘안 타는 주민 비율’을 물으면 이 나오는데, 참값은 이다.

확인 문제 3에 적어 제출 →
2

다섯 가지 방법을 100번씩 — 편향과 흩어짐을 갈라 잰다

8분

사람 수 n을 100 → 1,600(16배)으로 늘리면 B(자전거 도로)의 편향은 줄어들까요? 그리고 흩어짐은 몇 분의 1이 될까요? 숫자로 짐작해 적어 두세요 — 실험실에서 본 것과 코드가 같은 말을 하는지 확인합니다.

기본 빈칸 ①·②·③을 채우고 ▶ 실행합니다. ①은 실험실에서 손으로 찾은 도로의 직선이고, ②와 ③은 개념 2-2의 편향과 흩어짐을 식으로 옮긴 것이에요. 실행에 약 5초 걸립니다 — 방법 5가지 × 크기 3가지 × 100번 = 1,500번을 돌기 때문입니다. 그동안 탭이 잠깐 멈춰도 고장이 아니에요.

도전 random.seed(2026)의 2026을 다른 수로 바꿔 두 번 돌려 보세요. 흩어짐 칸의 셋째 자리가 흔들리고 A와 E의 순서가 뒤바뀌기도 하지만, 편향 칸의 +5.3 · −0.3은 그대로입니다. REPS도 흩어짐을 재는 자의 눈금이에요 — n=400을 1,000번 되풀이하면 A 0.126 · E 0.123으로 자리가 바로잡힙니다.

탐구 여섯째 방법을 하나 만들어 보세요(예: 도서관 앞에서 묻기). 누가 더 잘 걸릴지 그물의 모양을 말로 적고, 편향이 위쪽일지 아래쪽일지 예측해 보세요.

표 3코드 ②가 찍는 15줄 — 읽는 자리참값 1.189회 · 방법마다 100번 되풀이
방법n평균편향흩어짐RMSE
A 명부 무작위1001.228+0.0390.2600.263
A 명부 무작위4001.194+0.0050.1050.105
A 명부 무작위1,6001.186−0.0030.0610.061
B 자전거 도로1006.440+5.2510.5445.279
B 자전거 도로4006.520+5.3310.2435.337
B 자전거 도로1,6006.561+5.3720.1195.373
C 온라인 링크1002.577+1.3880.3111.422
C 온라인 링크4002.489+1.3000.1881.313
C 온라인 링크1,6002.537+1.3480.0821.350
D 전화+무응답1000.844−0.3450.2140.406
D 전화+무응답4000.874−0.3150.1070.332
D 전화+무응답1,6000.869−0.3200.0510.324
E 연령 층화1001.191+0.0020.2340.234
E 연령 층화4001.163−0.0260.1130.116
E 연령 층화1,6001.188−0.0020.0610.061

세로로 읽으면 한 방법 안에서 n이 커질 때 무엇이 줄고 무엇이 그대로인지 보이고, 가로로 읽으면 같은 n에서 방법끼리 견줄 수 있습니다. 자료: 코드 ②의 출력과 같은 값(Pyodide 0.26.4 실측) — 흩어짐 칸은 100번 되풀이로 잰 값이라 셋째 자리가 흔들린다

n을 16배로 늘리면 은 약 로 줄지만 은 그대로다. 그래서 B의 RMSE는 아래로 내려가지 못한다.

확인 문제 1에 적어 제출 →

표를 한 번 더 보며 확인 문제 4(층화가 A보다 넓게 나온 까닭)와 확인 문제 5(층마다 몇 명을 뽑나)도 함께 적습니다.

3

코드 부수기 — 무응답은 언제 편향이 되나

2분

일곱 연령대의 응답률이 모두 0.3으로 같다면 D(전화+무응답)의 편향은 어떻게 될까요? 실험실 도전 3에서 잠갔던 물음과 같은 물음입니다.

기본 빈칸 ④에 일곱 층이 모두 가질 응답률을 채우고 ▶ 실행합니다. 같은 코드가 나이마다 다른 응답률과 모두 같은 응답률 두 줄을 나란히 찍습니다.

도전 RESPOND_SAME을 [0.6] * 7로 바꿔 보세요. 응답률이 두 배가 되어도 편향은 여전히 0 근처입니다 — 응답률의 크기가 아니라 고르기가 편향을 정합니다.

탐구 응답률이 들쭉날쭉한데도 편향이 0인 RESPOND를 하나 찾아 적어 보세요 (실험실 도전 3과 같은 물음입니다 — 값이 큰 층과 작은 층을 함께 올려 보세요).

무응답이 편향이 되는 것은 일 때다. 응답률의 가 아니라 가 편향을 정한다.

확인 문제 2에 적어 제출 →
체크포인트 3

참값을 아는 세상을 만들어 다섯 방법의 편향과 흩어짐을 갈라 재었고, 그물의 모양이 답을 옮기고 높이는 흩어짐만 줄인다는 것을 손으로 확인했다.

다음 정거장 · 정리·확인 10분 →
4
정리·확인 · 10분

오늘의 탐험 일지

  1. 찾은 것

    사람 수를 16배로 늘려도 편향은 꿈쩍하지 않는다 — B는 +5.251에서 +5.372로 오히려 커졌다. 줄어든 것은 흩어짐뿐(0.544 → 0.119).

  2. 도구의 한계

    층화는 흩어짐을 줄이는 도구다. 누리시에서는 연령대 사이 몫이 8.7%뿐이라 이득이 4.5%에 그치고, 명부가 없으면 쓸 수조차 없다.

  3. 보고의 규칙

    조사 결과에는 누구를 뽑을 수 있었는지(표집 틀) 와 누가 빠졌는지를 사람 수와 함께 적는다.

✍️ 문제마다 답을 쓰고 제출하기를 누르세요. 제출하면 모범 답안이 열리고, 제출한 답은 선생님께 전달됩니다.

1. B팀(자전거 도로 1,600명)의 흩어짐 0.119는 A팀(명부 100명) 0.260보다 작다. 그런데도 B팀을 믿으면 안 되는 까닭을 표 3의 숫자로 설명하시오.
📖 모범 답안

흩어짐이 작다는 것은 같은 조사를 되풀이했을 때 답이 잘 안 흔들린다는 뜻일 뿐, 참값에 가깝다는 뜻이 아니다. B는 편향이 +5.372라서 RMSE 5.373을 편향이 거의 다 차지한다(√(5.372² + 0.119²) = 5.373). A(n=100)의 RMSE는 0.263이다.

그래서 B는 정밀하지만 정확하지 않다 — 한곳에 모였는데 빗나간 화살이다. 정밀함(좁은 흩어짐)과 정확함(참값에 가까움)은 다른 것이고, 보고할 때 견주어야 할 숫자는 흩어짐이 아니라 RMSE다. 게다가 B의 RMSE는 n을 아무리 키워도 편향 5.37 아래로 내려가지 못한다.

2. D(전화+무응답)는 참값보다 작게 나왔다(n=1,600에서 0.869, 편향 −0.320). 코드의 RESPOND와 USE_P 두 줄로 그 까닭을 설명하고, 미션 ③의 결과를 근거로 무응답이 편향이 되는 조건을 한 줄로 쓰시오.
📖 모범 답안

전화를 끝까지 받아 답하는 비율 RESPOND는 60대 0.55 · 70대 이상 0.60으로 가장 높은데, 같은 층의 자전거 이용 확률 USE_P는 0.18 · 0.08로 가장 낮다. 그래서 적게 타는 사람이 표본에 넘치게 들어오고, 평균이 아래로 끌려 내려간다. 반대로 가장 많이 타는 20대는 USE_P 0.55인데 RESPOND가 0.15로 가장 낮아 거의 빠진다.

조건 — 무응답이 편향이 되는 것은 답하느냐 마느냐가 우리가 묻는 값(이용 횟수)과 관련될 때다. 미션 ③에서 일곱 층의 응답률을 모두 0.3으로 같게 하자 편향이 −0.321 → +0.001로 사라졌다. 응답률이 0.3으로 낮은 것은 그대로인데 편향만 사라졌으니, 응답률의 크기가 아니라 고르기가 편향을 정한다.(흩어짐은 0.107 · 0.134로 둘 다 비슷하다.)

3. '우리 학교 학생의 하루 수면 시간'을 학교 누리집 설문 링크로 조사하려 한다. ① 예상되는 편향의 방향을 근거와 함께 적고, ② 그것을 줄이는 수집 계획을 두 줄로 쓰시오.
📖 모범 답안

① 누리집 링크는 자발 응답이다(표 2의 둘째 얼굴). 링크를 볼 만큼 누리집에 들어오고, 설문에 시간을 낼 여유가 있고, 주제에 관심이 있는 학생이 더 많이 누른다. 방향은 예측해 적고 근거를 대는 것이 답이다 — 예컨대 "잠이 부족해 답답한 학생이 더 눌러 수면 시간이 짧게 나올 것이다"도, "공부에 여유가 있는 학생이 더 눌러 길게 나올 것이다"도 근거가 붙으면 맞는 답이다. 중요한 것은 표집 틀이 '누리집에 들어온 학생'으로 좁혀진다는 점이다.

② 학번으로 무작위 추출해 명단을 먼저 정하고(누가 뽑혔는지를 정한 뒤에 묻는다), 담임을 통해 응답률을 올린다(안 답한 학생을 한 번 더 찾아간다). 그리고 응답자의 학년·성별 구성을 전교 구성과 견주어 어느 쪽이 빠졌는지 보고서에 적는다. 학년별로 정원을 정해 뽑으면(층화) 흩어짐도 줄어든다 — 다만 층화는 편향을 고치지 못한다.

4. 이번 100번 표에서는 층화(E)가 n=400에서 오히려 A보다 흩어짐이 컸다(A 0.105 · E 0.113). 같은 조건을 1,000번 되풀이하면 A 0.126 · E 0.123이다. 두 결과가 함께 말하는 것을 추측해 쓰시오.
📖 모범 답안

연령대가 이용 횟수를 크게 가르지 못한다. 이용 횟수 차이 가운데 연령대 '사이'가 설명하는 몫은 8.7%뿐이어서, 층화의 기대 이득은 약 4.5%(단순 무작위의 0.955배)에 그친다.

그런데 100번 되풀이로 잰 흩어짐 자체가 흔들린다. 그 흔들림이 4.5%보다 크기 때문에 한 번의 표에서는 A와 E의 순서가 뒤바뀔 수 있다. 1,000번으로 늘리면 자의 눈금이 촘촘해져 A 0.126 · E 0.123으로 기대대로 돌아온다.

그래서 두 가지를 함께 말할 수 있다 — ① 층화는 결과를 잘 가르는 층을 골랐을 때만 이득이 있다 (연령대가 아니라 '자전거 소유 여부' 같은 층이었다면 컸을 것이다). ② 작은 차이를 확인하려면 되풀이를 늘려야 한다. 되풀이 수는 결과가 아니라 결과를 재는 자의 눈금이다.

5. n=400으로 연령 층화 추출을 하면 층마다 몇 명씩 뽑는가? 아래 표를 채우고, 그 일을 하는 코드의 한 줄을 찾아 적으시오.
연령대비율(SHARE)n=400에서 뽑는 수
10대0.09
20대0.13
30대0.15
40대0.16
50대0.17
60대0.15
70대 이상0.15
📖 모범 답안

36 · 52 · 60 · 64 · 68 · 60 · 60명이다(400 × 0.09 = 36, 400 × 0.13 = 52, …). 일곱을 더하면 36+52+60+64+68+60+60 = 400으로 딱 맞는다.

그 일을 하는 줄은 stratified() 안의 got += random.sample(BY_AGE[a], round(n * s))이다. round(n * s)가 층마다 뽑을 인원을 정하고, random.sample이 그 층 안에서만 겹치지 않게 뽑는다.

덧붙임 — 비율이 딱 떨어지지 않으면 round 때문에 합이 n과 어긋날 수 있다. 누리시의 비율(합 1.00)과 400은 마침 딱 떨어지지만, 실제 조사에서는 합을 맞추는 규칙을 따로 정해 두어야 한다.

+
더 알아보기

틀 밖으로 밀려난 이야기 셋

같은 인원, 다른 뽑는 법할당 표집정원표를 준다남 50 · 여 50조사원이 고른다정원만 채우면 된다쉬운 사람이 찬다길에서 잘 서 주는 쪽재량이 그물을 기울인다확률 표집명부를 펼친다20,000명 전부제비가 고른다조사원 재량 0그 사람을 찾는다없으면 다시 찾아간다재량이 없다1948년 세 조사 기관은 왼쪽 길을 썼다
역사

“듀이가 트루먼을 이기다”

1948년 미국 대통령 선거를 앞두고 갤럽 · 크로슬리 · 로퍼 세 조사 기관이 모두 듀이의 승리를 점쳤습니다. 한 신문은 개표가 끝나기 전에 “듀이가 트루먼을 이기다”라는 1면을 찍었고, 이튿날 그 신문을 들어 보이는 트루먼의 사진이 남았습니다. 당선자는 트루먼이었습니다.

왜 셋이 나란히 틀렸을까요. 셋 다 할당 표집을 썼기 때문입니다. 본부가 조사원에게 “남 몇 명, 여 몇 명, 어느 연령대 몇 명”이라는 정원표를 주면, 그 정원을 누구로 채울지는 조사원이 직접 고릅니다. 정원만 맞으면 되니 말을 잘 받아 주는 사람, 낮에 집에 있는 사람, 번화가에 나와 있는 사람이 먼저 채워졌어요. 틀이 조용히 기울어 있었던 것입니다. 게다가 세 기관 모두 선거 몇 주 전에 조사를 멈춰, 막판에 마음을 바꾼 표를 담지 못했습니다.

이 사건 뒤 미국의 여론조사는 확률 표집으로 옮겨 갑니다 — 누구를 뽑을지를 제비가 정하고, 그 사람이 없으면 다시 찾아가는 방식이지요. 조사원의 재량을 없애는 일이 곧 틀을 바로 세우는 일이었습니다. 오늘 B팀이 겪은 일과 같은 이야기입니다 — 사람 수가 아니라 뽑는 방식이 답을 옮깁니다.

도해: 같은 정원을 채우는 두 방식을 세 단계로 견주었다(수치 없음). · 출처: F. Mosteller 외, 『The Pre-election Polls of 1948』, Social Science Research Council, 1949

돌아온 비행기에만 있는 구멍조종석엔진엔진표에 있는 것 — 돌아온 비행기구멍은 날개와 동체에 몰려 있다표에 없는 것 — 돌아오지 못한 비행기구멍 없는 자리에 맞은 비행기가 그쪽이다표집 틀이 '돌아온 것' 으로 좁혀져 있었다
방법 더 깊이

돌아온 비행기만 보면

제2차 세계대전 중 미국은 폭격기의 어느 곳에 철판을 덧댈지 정하려고, 임무를 마치고 돌아온 비행기의 탄흔을 기록했습니다. 구멍은 날개와 동체에 몰려 있었어요. 자연스러운 결론은 “구멍이 많은 곳을 보강하자”였습니다.

컬럼비아대 통계연구그룹의 에이브러햄 왈드는 다른 것을 보았습니다. 이 표에 들어 있는 것은 돌아온 비행기뿐이라는 것을요. 엔진과 조종석에 구멍이 적은 까닭은 그 자리가 튼튼해서가 아니라, 거기를 맞은 비행기가 돌아오지 못해 표에 없기 때문일 수 있습니다. 왈드는 돌아온 기체의 손상만으로 돌아오지 못한 기체의 취약 부위를 추정하는 방법을 정리한 보고서를 썼습니다.

오늘의 말로 하면, 표집 틀이 ‘돌아온 것’으로 좁혀져 있었던 것입니다 — 누리시의 자전거 도로가 ‘타는 사람’으로 좁혀져 있었듯이. 이렇게 살아남은 것만 보이는 편향을 생존자 편향이라 부릅니다. 널리 도는 “구멍 없는 곳에 철판을 대라”는 한마디는 후대에 다듬어진 표현이라는 점도 기억해 둘 만합니다 — 보고서가 실제로 한 일은 보이지 않는 표본을 수식으로 되살린 것이었습니다.

도해: 돌아온 폭격기의 탄흔 자리를 그렸다. 점의 자리는 모양을 보인 예시다. · 출처: A. Wald, 『A Method of Estimating Plane Vulnerability Based on Damage of Survivors Returned』, Statistical Research Group, Columbia University, 1943

층 → 조사구 → 가구전국전국 가구① 층수도권 아파트수도권 단독그 밖 아파트그 밖 단독② 조사구조사구조사구조사구조사구조사구조사구③ 가구가구가구가구가구가구가구가구가구④ 가중치 — 뽑힐 확률의 역수를 곱해표본 몇천 가구를 전국 가구로 되돌린다
진로

표본을 설계하는 사람들

“전국 몇천 가구에 물었다”는 국가 통계는 어떻게 만들어질까요. 전국 가구 명부에서 곧바로 몇천 가구를 뽑지는 않습니다. 그러면 뽑힌 집이 전국에 흩어져 방문 조사를 할 수 없거든요. 그래서 층화 다단 추출을 씁니다 — 전국을 지역과 주택 유형 같은 층으로 나누고, 층마다 조사구(몇십 가구 단위의 작은 구역)를 뽑고, 그 조사구 안에서 가구를 뽑습니다.

여기서 끝이 아닙니다. 층마다 뽑히는 비율이 다르면 표본 속 구성이 전국과 어긋나므로, 가구마다 뽑힐 확률의 역수를 가중치로 곱해 전국 규모로 되돌립니다. 무응답이 생기면 그만큼 가중치를 다시 조정하고, 알려진 인구 구성(성·연령·지역)에 맞춰 한 번 더 손봅니다. 오늘 우리가 손으로 잰 편향과 흩어짐이 이 설계의 두 목표예요 — 층을 잘 고르면 흩어짐이 줄고, 틀과 무응답을 잘 다루면 편향이 준다.

이 일을 하는 사람을 조사 설계자 · 표본 설계 연구원이라 부릅니다. 통계청과 국책 연구기관, 여론조사 회사, 그리고 요즘은 앱 회사의 실험 설계 조직에도 있습니다. 필요한 것은 프로그래밍만이 아니라 “누가 빠졌나”를 끝까지 묻는 버릇입니다.

도해: 국가 표본조사가 쓰는 층화 다단 추출을 세 단계로 그리고, 마지막에 가중치를 붙였다. 층의 수와 이름, 단계의 수는 조사마다 다르다(수치 없음).