단원 홈

Ⅱ. 데이터 준비와 분석2차시

따릉이 기록은
누구의 목소리인가

대표성을 재고, 가중치가 못 하는 일을 본다

2024년 한 해 따릉이는 4,385만 번 대여됐습니다. 이 숫자 하나로 ‘서울 시민’에 대해 말해도 될까요? 기록이 누구를 담았는지를 서울 인구 자료와 대어 재고, 모자란 목소리를 키우는 가중치가 할 수 있는 일과 끝내 못 하는 일을 봅니다.

  • [12데과02-01]
  • 50분네 정거장
  • 오늘의 틀대표 비율 = 기록 속 몫 ÷ 인구 속 몫
  • 자료따릉이 이용정보 2024 4,385만 건 × 주민등록 2024-12

학습 목표

  1. 개념에서

    기록 한 줄이 무엇을 센 것인지 묻고, 대표 비율로 누가 넘치고 누가 모자라게 담겼는지 잴 수 있다.

  2. 손으로

    두 표를 이어 대표 비율을 구하고, 사후 가중치를 매겨 추정값이 어떻게 달라지는지 확인할 수 있다.

  3. 확인에서

    이 기록으로 확실히 말할 수 있는 것의 경계를 적고, 빠질 사람까지 밝힌 수집 계획서를 쓸 수 있다.

1
여는 장면 · 5분

기사 한 줄 — “따릉이는 시민 모두의 발”

서울시 공공자전거 따릉이의 2024년 이용 기록이 공개됐습니다. 한 해 동안 빌린 횟수는 43,849,559건. 그 가운데 나이를 아는 기록이 40,672,513건인데, 이것만 서울의 10세 이상 인구 884만 8,048명으로 나눠도 한 사람이 4.60번씩 탄 셈입니다. 기자는 이 파일 하나로 기사를 썼습니다.

‘시민 모두의 발’ — 그럴듯합니다. 그런데 이 파일에는 따릉이를 한 번도 타지 않은 사람의 줄이 하나도 없습니다. 없는 줄은 셀 수 없고, 셀 수 없는 것은 기사에도 나오지 않습니다.

교통 · 가상 기사

서울 시민, 1년에 따릉이 4,385만 번 — 이제 따릉이는 시민 모두의 발이다

서울시 공공자전거 이용정보(월별) 2024 · 이 기사는 수업을 위해 지어낸 것입니다
표 1기자가 본 표따릉이 이용정보(월별) 2024 · 연령대별 이용 건수
연령대이용 건수몫 기타까지 넣은 전체 중
~10대2,755,5116.3%
20대12,888,21429.4%
30대11,388,21926.0%
40대6,931,82415.8%
50대4,825,65911.0%
60대1,621,5833.7%
70대이상261,5030.6%
기타 나이 모름3,177,0467.2%
합계43,849,559100.0%

가장 많은 칸은 20대(1,288만 건), 가장 적은 칸은 70대 이상(26만 건)입니다. 맨 아래 ‘기타’는 나이를 모르는 기록 317만 건 — 전체의 7.2%예요. 이 표에는 사람 수가 한 칸도 없습니다. 몫 칸의 분모에 눈여겨 두세요 — 여기서는 ‘기타’까지 넣은 43,849,559건으로 나눠 20대가 29.4%지만, 2-2의 그림 1은 인구와 짝을 맞추려고 ‘기타’를 뺀 40,672,513건으로 나눠 31.7%가 됩니다. 같은 20대인데 숫자가 달라지는 까닭은 분모가 다르기 때문이에요. 자료: 서울특별시 공공자전거 이용정보(월별) 2024 — 서울 열린데이터광장 OA-15248, 공공누리 제1유형. 두 반기 파일 1,233,396행을 연령대별로 모았다(원장 계산).

먼저 예측

표를 한 번 더 보세요. 이 기록만으로 “따릉이를 한 번도 타지 않은 서울 시민”이 적어도 몇 %인지 말할 수 있을까요? 70대 이상은? 20대는? 두 숫자를 먼저 적어 두고, 3정거장 미션 ①에서 여러분의 예측과 맞대어 봅니다.

70대 이상
0%50100%한 번도 안 탄 사람 최소 — 내 예측
20대
0%50100%한 번도 안 탄 사람 최소 — 내 예측
체크포인트 1

기록만 보고 두 숫자를 적어 두었다 — 이제 인구 자료를 옆에 놓고 잰다.

다음 정거장 · 개념 15분 →
2
개념 · 15분

기록은 누구를 담았나 — 대표 비율과 가중치

2-1한 줄은 사람이 아니다

파일을 열면 가장 먼저 물어야 할 것은 한 줄이 무엇을 센 것인가입니다. 따릉이 이용정보의 한 줄은 사람이 아니라 이용 한 건이에요. 날마다 타는 사람은 한 해에 수백 줄을 만들고, 한 번도 안 탄 사람은 줄이 하나도 없습니다.

그래서 한 사람이 100번 탄 것과 100명이 한 번씩 탄 것이 표에서는 같은 숫자입니다. 이것을 관측 단위 — 한 행이 무엇인가 — 라고 부릅니다. 관측 단위를 잘못 읽으면 ‘이용 건’에 대한 이야기가 ‘시민’에 대한 이야기로 슬쩍 바뀝니다.

2-2누가 넘치고 누가 모자라나 — 대표 비율

기록이 누구를 담았는지 재려면 바깥의 자료가 있어야 합니다. 기록 속 몫을 같은 기준의 모집단 몫과 나란히 놓고 나누면 돼요 — 대표 비율 = 기록 속 몫 ÷ 인구 속 몫. 1이면 고르게, 1보다 크면 넘치게, 1보다 작으면 모자라게 담긴 것입니다.

그림 1기록 속 몫과 인구 속 몫, 그리고 대표 비율왼쪽 판 = 두 몫을 나란히 · 오른쪽 판 = 그 둘을 나눈 대표 비율(1이 기준)
기록 속 몫인구 속 몫~10대6.8%8.1%20대31.7%14.8%30대28.0%16.3%40대17.0%15.6%50대11.9%16.8%60대4.0%15.0%70대이상0.6%13.3%합이 100%인 두 띠를 연령대마다 나란히 놓았다대표 비율1보다 오른쪽 = 넘치게 · 왼쪽 = 모자라게012배~10대0.8320대2.1430대1.7240대1.0950대0.7160대0.2770대이상0.048기록 속 몫인구 속 몫~10대6.8%8.1%20대31.7%14.8%30대28.0%16.3%40대17.0%15.6%50대11.9%16.8%60대4.0%15.0%70대이상0.6%13.3%합이 100%인 두 띠를 연령대마다 나란히 놓았다대표 비율1보다 오른쪽 = 넘치게 · 왼쪽 = 모자라게012배~10대0.8320대2.1430대1.7240대1.0950대0.7160대0.2770대이상0.048

20대는 기록의 31.7%를 차지하는데 인구에서는 14.8% — 대표 비율 2.14배입니다. 70대 이상은 인구의 13.3%인데 기록에서는 0.6%뿐이라 0.048배, 스무 명 몫 가운데 한 명 몫도 안 됩니다. 1을 넘는 칸은 20 · 30 · 40대 셋이고 나머지 넷은 모자랍니다. 자료: 따릉이 이용정보 2024 × 주민등록 2024-12 — 코드 ①이 찍는 값과 같다(원장 계산).

같은 셈을 ‘한 사람당 건수’로 바꿔도 순서는 같습니다. 서울 10세 이상 한 사람당 1년 4.60건인데, 20대는 9.85건이고 70대 이상은 0.22건이에요(9.85 ÷ 4.60 = 2.14 — 대표 비율과 같은 수입니다).

두 표를 잇기 전에 칸부터 맞춰야 합니다. 따릉이의 ‘~10대’는 10~19세라서 인구도 10~19세만 셌고(0~9세 483,780명은 뺐습니다), ‘70대이상’은 70세 이상 전부입니다. 그리고 나이를 모르는 기록 317만 건(7.2%)은 인구 쪽에 짝이 없어 이 표에서 빠졌습니다 — 이것이 이 표가 담지 못한 진짜 빈칸이에요.

Ⅱ-1 에서 가져옴표본이 모집단을 닮았는지는 바깥 자료와 대어야 알 수 있었습니다. 1차시에서는 참값을 우리가 알고 있었지만 오늘은 모릅니다 — 대신 연령 구성만은 주민등록이 알려 줍니다.

2-3기록이 증명하는 사람, 증명하지 못하는 사람

대표 비율은 ‘누가 넘치는지’를 말해 줍니다. 그런데 더 센 물음이 있어요 — 이 기록만으로 “한 번도 안 탄 사람”이 적어도 몇 명이라고 증명할 수 있을까?

셈은 간단합니다. 이용 건수가 인구보다 적으면, 아무리 골고루 나눠 줘도 한 건도 못 받는 사람이 남습니다. 70대 이상은 인구 118만 명에 이용 26만 건 — 한 사람이 한 건씩만 받아도 92만 명이 남아요. 그러니 적어도 77.8%는 한 해 동안 따릉이를 한 번도 타지 않았습니다. 이것은 짐작이 아니라 셈으로 증명되는 하한입니다.

거꾸로 20대는 인구 131만 명에 이용 1,289만 건입니다. 모두가 한 번씩 탔다고 해도 1,158만 건이 남고, 그 1,158만 건은 이미 탄 사람에게 얹을 수밖에 없어요. 그래서 이 기록은 ‘안 탄 20대’를 한 명도 증명하지 못합니다. 0명일 수도, 130만 명에 가까울 수도 있습니다.

넘치는 기록은 ‘많이 탔다’만 말하고, 오히려 모자라는 기록이 확실한 것을 말해 줍니다.

그림 2점과 이용권 — 나눠 줘 보면 보인다점 1개 = 주민 1만 명 · 이용권 1장 = 이용 1만 건 · 왼쪽은 모자란 판, 오른쪽은 남는 판
70대 이상 — 이용권이 모자란다주민 점 118개 · 1점 = 1만 명이용권 26장 — 다 나눠 줘도끝내 꺼진 채 남는 점 92개반올림 전 원자료로는 적어도 77.8%20대 — 이용권이 남는다주민 점 131개 · 1점 = 1만 명×1,289이용권 1,289장점을 다 켜고도 남는 장 1,158장‘안 탄 20대’ 는 한 명도 증명하지 못한다70대 이상 — 이용권이 모자란다주민 점 118개 · 1점 = 1만 명이용권 26장 — 다 나눠 줘도끝내 꺼진 채 남는 점 92개반올림 전 원자료로는 적어도 77.8%20대 — 이용권이 남는다주민 점 131개 · 1점 = 1만 명×1,289이용권 1,289장점을 다 켜고도 남는 장 1,158장‘안 탄 20대’ 는 한 명도 증명하지 못한다

왼쪽은 이용권이 모자라 92개의 점이 끝내 꺼진 채 남습니다. 오른쪽은 이용권이 남아 점을 다 켜고도 1,158장이 손에 있습니다. 꺼진 점은 ‘안 탄 사람’의 증거이지만, 남은 장은 아무것도 증명하지 못합니다. 자료: 같은 두 파일 — 점·장은 1만 단위로 반올림한 값이고, 아래 표의 %는 반올림 전 원자료로 잰 값이다(원장 계산).

표 2확실한 것이 기록만으로 증명되는 하한 — 3정거장 시뮬레이터의 표와 같은 값
연령대이용 건수인구한 사람당안 탄 사람 최소
~10대2,755,511720,7673.820.0%
20대12,888,2141,308,2609.850.0%
30대11,388,2191,442,6657.890.0%
40대6,931,8241,383,9505.010.0%
50대4,825,6591,486,0683.250.0%
60대1,621,5831,326,2391.220.0%
70대이상261,5031,180,0990.2277.8%

0이 아닌 칸은 70대 이상 한 줄뿐입니다. 나머지 여섯 줄의 0.0%는 ‘모두 탔다’는 뜻이 아니라 이 기록으로는 한 명도 증명하지 못한다는 뜻이에요. 자료: 안 탄 사람 최소 = max(0, 1 − 이용 건수 ÷ 인구) — 코드 ①의 마지막 열과 같은 값.

한 사람당 1년 이용 건수
4.60서울 평균(건)
vs
9.8520대(건)
서울 평균4.60건20대9.85건

같은 도시인데 두 배 — 그래서 대표 비율이 2.14다.

확실히 안 탄 사람 최소
0.0%20대
vs
77.8%70대 이상
20대0.0%70대 이상77.8%

기록이 모자랄 때만 사람을 증명한다.

규칙비율을 보고할 때는 무엇의 비율인지(분모)와 이 자료로 확실히 말할 수 있는 범위를 함께 적는다.

2-4가중치가 하는 일과 못 하는 일

모자라게 담긴 층을 고치는 흔한 방법이 사후 가중치입니다. 가중치 = 모집단 몫 ÷ 응답 몫 — 적게 답한 층의 한 사람을 여러 사람 몫으로 셉니다.

가상 설문 400명을 봅시다. 20대가 35%나 답했고 70대 이상은 5명(1.25%)뿐이에요. 그냥 세면 이용률 40.0%인데, 층마다 모집단 몫으로 저울질하면 30.5%로 내려갑니다. 많이 답한 젊은 층의 목소리가 줄고 적게 답한 나이 든 층의 목소리가 커진 것입니다.

대가가 있습니다. 70대 이상 한 사람은 12.0명 몫으로 세어져요. 그 한 사람이 답을 바꾸면 결과가 3.0%p 움직입니다(같은 일을 20대 한 사람에게 하면 0.093%p). 층이 얇을수록 가중치는 크고, 클수록 한 사람에 흔들립니다.

그리고 가중치가 끝내 못 하는 일이 셋 있습니다.

① 빈 층은 곱할 것이 없다. 70대 이상이 한 명도 안 답하면 없는 값에 무엇을 곱해도 없습니다. 더 나쁜 것은 그때 오류가 나지 않는다는 점이에요(미션 ④에서 직접 봅니다).

② 층 ‘안’의 치우침은 못 고친다. 온라인 설문에 답한 70대는 ‘온라인을 쓰는 70대’입니다. 12배로 불려도 온라인을 안 쓰는 70대의 목소리가 되지는 않아요.

③ 애초에 비이용자가 없는 자료는 가중치로 ‘시민’을 만들 수 없다. 따릉이 기록에는 ‘안 탄 사람’ 줄이 아예 없습니다 — 0 × 12 = 0입니다.

설문 [나] 70대 이상의 몫
1.25%응답 400명 중 5명
→
15.0%모집단에서의 몫
응답 1명모집단에서는 12.0명 몫

모자란 몫을 채우려면 한 사람을 12.0명 몫으로 센다.

그 한 사람이 답을 바꾸면
30.5%가중 이용률
→
27.5%‘탔다’ 한 명을 뒤집으면
30.5%탔다 1명27.5%탔다 0명−3.00%p

큰 가중치는 한 사람에 흔들린다 — 3.0%p.

자료: 가상 설문 400명(모집단 비율은 Ⅱ-1 누리시) — 네 쌍의 숫자는 모두 코드 ①·②가 찍는 값이다.

기록을 받으면 묻는 넷 — 차례대로

  1. 한 줄이 한 줄은 무엇을 센 것인가 — 사람인가, 건인가, 하루인가
  2. 바깥모집단을 알려 주는 바깥 자료가 있는가 — 없으면 대표 비율을 잴 수 없다
  3. 빈칸누가 모자라게 담겼고, 아예 줄이 없는 사람은 누구인가
  4. 고치기가중치로 고칠 수 있는 치우침인가, 다시 수집해야만 고칠 수 있는가

넷째가 오늘의 결론입니다. 수집에서 생긴 빈칸은 계산으로 메울 수 없습니다. 계산은 그 빈칸을 가릴 수만 있어요 — 그래서 무엇이 빠졌는지를 먼저 적습니다.

체크포인트 2

기록이 누구를 담았는지 재는 자(대표 비율)와, 기록이 증명할 수 있는 것의 경계를 손에 넣었다.

다음 정거장 · 손으로 20분 →
3
손으로 · 20분

이용권을 나눠 주고, 가중치를 매겨 본다

1

이용권 나눠 주기 — 기록에 없는 서울 사람 찾기

6분

여는 장면에 적어 둔 내 예측입니다. 판 안에서 한 번 더 잠그고, 손으로 나눠 준 결과와 맞대어 봅니다.

기본 연령대마다 주민 점(1점 = 1만 명)과 이용권(1장 = 1만 건)이 놓여 있습니다. 예측을 잠그고 점 위를 쓸어 이용권을 한 장씩 나눠 주세요. 판마다 최대로 켜기(한 점에 한 장씩 흩기)와 최소로 켜기(모두 거둔 뒤 한 점에 몰기)를 둘 다 만들어야 다음 단추가 열립니다. 도전 셋을 풀면 카드가 스스로 닫힙니다.

시뮬레이터

이용권 나눠 주기

이용권을 아무리 잘 나눠 줘도 켜지지 않는 점이 있는가 — 그 점이 ‘안 탄 사람’의 증거다

  1. 1판을 고르고 내 예측을 눌러 잠근다
  2. 2점 위를 쓸어 최대로 켜고, 더미를 두 번 톡 쳐 거둔 뒤 한 점을 길게 눌러 최소로 켠다
  3. 3[기사처럼 읽기]로 기사의 셈과 맞대고, 벽돌 한 장을 뒤집어 본다
판
내 예측 — 이 판에서 한 번도 안 탄 사람 최소 고르면 잠긴다
70대이상 판1점 = 주민 1만 명 · 이용권 1장 = 이용 1만 건

점 1개 = 주민 1만 명 · 이용권 1장 = 이용 1만 건(반올림) · 한 점에 여러 장을 얹어도 이용 건수 합은 그대로다 — 기록은 몇 명이 탔는지 모른다

꺼질 수밖에 없는 점 = 점 수 − 이용권 수(이용권이 모자랄 때) · ‘확실한 것’ 표의 %는 반올림 전 원자료로 잰 값이라 판의 점 수로 센 값과 소수점이 조금 다르다

켜진 점0만 명
꺼진 점118
꺼질 수밖에 없는 점92
이용 건수 합261,503
켜진 점 1인당 장수—
남은 이용권26
도전 1

70대 이상 판에서 최대로 켜기와 최소로 켜기를 둘 다 만들어라 — 아무리 애써도 끝내 꺼진 채 남는 점은 몇 개인가?

도전 2

20대 판에서 점 131개를 모두 켜라 — 그러고도 남는 이용권은 몇 장인가? 그 장을 몇 점에 몰아도 이용 건수 합은 변하나?

도전 3

벽돌 한 장 — 70대 이상 판을 끝내면 설문 [나]의 응답자 다섯이 벽돌로 섭니다. ‘탔다’ 한 장을 톡 쳐 뒤집으면 가중 이용률은 몇 %p 움직이나?

자료: 서울특별시 공공자전거 이용정보(월별) 2024(OA-15248, 공공누리 제1유형) 연령대 × 성별 집계 × 행정안전부 주민등록 인구통계 서울 2024년 12월 — 쪽 안에 실은 숫자는 원자료 숫자 42개(연령 일곱 줄의 이용 건수·인구, 70대 이상 성별 셋, 나이 모름 둘, 가상 설문 [나] 스물하나)뿐이고 나머지는 판이 그 자리에서 계산한다. 판의 셈은 코드 ①·②와 같은 식이다.

이 기록으로 70대 이상에 대해서는 라고 확실히 말할 수 있지만, 20대에 대해서는 . 두 판의 차이는 에서 온다.

확인 문제 3에 적어 제출 →
2

대표 비율을 잰다 — 그리고 이 표로 물을 수 있는 것

5분

판에서 손으로 본 것을 이제 코드로 잽니다. 가장 넘치게 담긴 연령대와 가장 모자라게 담긴 연령대는 어디일까요? 20대의 대표 비율은 1의 몇 배쯤일지도 먼저 짐작해 두세요.

기본 빈칸 ①에 대표 비율의 분모를 채우고 ▶ 실행하세요. merge는 두 표를 공통 열(연령대)로 잇습니다 — 11차시에서 제대로 다룹니다. 마지막 두 열(1인당 · 안 탄 최소)은 채워져 있고, 시뮬레이터의 ‘확실한 것’ 표와 같은 값입니다.

도전 인구 파일의 ~10대는 10~19세입니다. pop을 읽은 다음 줄에 pop.loc[0, "인구"] += 483780(0~9세)을 넣어 0~19세로 잡으면 ~10대 대표 비율이 0.83 → 0.52가 됩니다. 가장 넘치는 · 모자라는 연령대는 바뀌나요?

탐구 나이를 모르는 기록(연령 ‘기타’ 317.7만 건, 7.2%)은 이 표에 없습니다. 그 기록이 모두 70대 이상이라면 70대 이상의 ‘안 탄 최소’는 어떻게 될까요? 이 표로 확실히 말할 수 있는 것의 경계를 적어 보세요(시뮬레이터의 ‘나이 모름’ 도전 판이 같은 물음입니다).

이제 이 표로 무엇을 물을 수 있는지 갈라 봅니다. 여섯 장을 읽고 ‘답할 수 있다 / 없다’로 나눈 뒤, 없는 것은 답할 수 있는 물음으로 고쳐 쓰세요.

질문 카드이 표로 답할 수 있는 물음인가여섯 장 · 표에 있는 것은 ‘연령대별 이용 건수’뿐이다
  1. 카드 1

    2024년 따릉이 대여는 어느 연령대에서 가장 많았나?

  2. 카드 2

    서울 시민은 몇 살 때 자전거를 가장 많이 타나?

  3. 카드 3

    따릉이를 이용한 사람은 모두 몇 명인가?

  4. 카드 4

    20대는 30대보다 따릉이를 더 많이 빌렸나?

  5. 카드 5

    서울 70대 이상 가운데 따릉이를 한 번도 안 탄 사람은 몇 %인가?

  6. 카드 6

    서울 시민의 자전거 이용률은 몇 %인가?

이 표로 답할 수 있는 것은 에 대한 물음뿐이고, 에 대한 물음은 답할 수 없다. 까닭은 이기 때문이다.

확인 문제 1에 적어 제출 → 확인 문제 2의 표에 여섯 장을 갈라 적기 →
3

가중치로 고치면 — 한 사람이 열두 명 몫

4분

이번에는 기록이 아니라 설문입니다. 가상 설문 400명에서 20대가 넘치게 답했어요(35%). 가중치로 고치면 그냥 센 이용률 40.0%는 올라갈까요, 내려갈까요? 몇 %쯤일지 짐작해 두세요.

기본 빈칸 ②에 가중치의 분모를, 빈칸 ③에 층별 이용률을 저울질할 무게를 채우고 ▶ 실행하세요.

도전 마지막 print 앞에 s.loc[6, "탔다"] = 0과 s["층별 이용률"] = s["탔다"] / s["응답 수"] 두 줄을 넣고 weighted를 다시 구하면 30.5% → 27.5%(−3.0%p)입니다. 20대 한 명을 바꾸면(70 → 69) 0.093%p뿐이에요 — 시뮬레이터의 벽돌과 같은 숫자입니다.

탐구 70대 이상의 가중치가 3배를 넘지 않게 하려면 응답을 몇 명 더 받아야 할까요? N_RESP의 마지막 5를 바꿔 가며 찾아보세요. 그때 60대의 가중치는 어떻게 되나요? 한 층을 고치면 다른 층이 흔들리는 까닭도 함께 적습니다.

가중치는 을 고칠 수 있지만, 대가로 . 그래서 가중치를 쓸 때는 을 함께 적는다.

확인 문제 4에 적어 제출 →
4

빈 층 — 오류가 나지 않는 것이 함정이다

5분

이번에는 일부러 틀린 길로 갑니다. 70대 이상 응답이 0명이면 ‘가중 이용률’ 줄은 어떻게 될까요 — 오류가 날까요, 빈칸이 나올까요, 숫자가 나올까요? 셋 중 하나를 골라 두세요.

기본 코드 ③은 채워져 있습니다. 그대로 ▶ 실행하고, 오류가 나는지부터 보세요.

도전 마지막 두 줄의 70대 이상 이용률 0과 1을 둘 다 0.5로 바꾸면 35.0%라는 한 숫자가 나옵니다. 빈 층의 값을 ‘짐작’하는 순간 범위가 한 숫자로 줄어드는 것이에요. 그 숫자를 보고서에 쓴다면 무엇을 함께 적어야 할까요?

탐구 빈 층을 채우는 두 방법 — ① 방문·전화로 그 층을 더 모은다 ② 보고서의 모집단을 ‘69세 이하’로 좁힌다 — 가운데 누리시 조사에는 어느 쪽이 맞을까요? 까닭과 함께 적어 보세요.

pandas 가 NaN을 조용히 건너뛴 셈은 70대 이상에 대해 라고 가정한 것이다. 이 자료로 확실히 말할 수 있는 것은 이라는 범위뿐이다.

마지막으로 수집 계획서 여섯 칸을 씁니다. 누리시가 ‘시민의 공공자전거 이용률’을 조사한다고 할 때, 오늘 본 함정을 피하려면 어떻게 모아야 할까요 — 여섯째 칸 ‘그래도 빠질 수 있는 사람’을 비워 두지 마세요.

확인 문제 5에 적어 제출 → 확인 문제 6의 계획서 여섯 칸 채우기 →
체크포인트 3

기록이 증명하는 것의 경계를 손으로 만들어 보고, 가중치가 고치는 것과 끝내 못 고치는 것을 숫자로 봤다.

다음 정거장 · 정리·확인 10분 →
4
정리·확인 · 10분

오늘의 탐험 일지

  1. 찾은 것

    기록은 사람이 아니라 이용 건을 센다. 같은 기록에 20대는 두 배로(2.14), 70대 이상은 0.048배로 담겼다.

  2. 도구의 한계

    가중치는 담긴 목소리를 키울 뿐 담기지 않은 사람을 만들지 못한다. 빈 층에서는 오류조차 나지 않는다.

  3. 보고의 규칙

    비율을 낼 때는 분모와 빠진 사람을 함께 적고, 한 숫자가 아니라 확실한 범위로 쓴다.

✍️ 문제마다 답을 쓰고 제출하기를 누르세요. 제출하면 모범 답안이 열리고, 제출한 답은 선생님께 전달됩니다.

1. 실측 대표 비율은 20대 2.14, 70대 이상 0.048이다. “따릉이 기록으로 본 서울 시민의 평균 이동거리는 ○○km”라는 문장에서 틀린 곳 두 가지를 찾아 쓰시오.
📖 모범 답안

① 모집단이 ‘시민’이 아니라 ‘이용 건’이다. 이 파일의 한 줄은 사람이 아니라 대여 한 건이다. 한 번도 타지 않은 시민은 줄이 아예 없고, 자주 타는 사람은 여러 줄로 세어진다. 그러니 여기서 나온 평균은 ‘이용 건의 평균’이지 ‘시민의 평균’이 아니다.

② 젊은 층이 넘치게 담겨 그 이동 패턴이 과대 대표된다. 20대는 한 사람당 1년 9.85건으로 서울 평균 4.60건의 2.14배이고, 70대 이상은 0.22건(대표 비율 0.048)이다. 기록의 31.7%가 20대에서 나왔으므로 ‘평균 이동거리’는 사실상 20·30대의 이동거리에 가깝다.

고쳐 쓴다면: “2024년 따릉이 대여 건의 평균 이동거리는 ○○km이며, 이 가운데 31.7%가 20대, 0.6%가 70대 이상에서 나왔다.”

2. 미션 ②의 질문 카드 여섯 장을 아래 표에 갈라 적으시오. ‘답할 수 있나’ 칸에는 ○ 또는 ✕를, ✕인 것은 오른쪽 칸에 답할 수 있는 물음으로 고쳐 쓰시오. 그리고 ✕가 된 물음들의 공통점을 한 줄로 쓰시오.
물음답할 수 있나고쳐 쓴 물음
카드 1 2024년 따릉이 대여는 어느 연령대에서 가장 많았나?
카드 2 서울 시민은 몇 살 때 자전거를 가장 많이 타나?
카드 3 따릉이를 이용한 사람은 모두 몇 명인가?
카드 4 20대는 30대보다 따릉이를 더 많이 빌렸나?
카드 5 서울 70대 이상 가운데 따릉이를 한 번도 안 탄 사람은 몇 %인가?
카드 6 서울 시민의 자전거 이용률은 몇 %인가?
📖 모범 답안

카드 1 · ○ — 표에 연령대별 이용 건수가 있다(20대 12,888,214건으로 가장 많다).

카드 2 · ✕ → “따릉이 이용 건은 어느 연령대에서 가장 많이 나왔나?” (‘서울 시민’과 ‘자전거’ 전체를 묻는데, 이 표는 따릉이 대여 건만 담았다.)

카드 3 · ✕ → “따릉이 이용 건수는 모두 몇 건인가?” (이 표에는 사람 수가 한 칸도 없다 — 한 사람이 몇 건을 만들었는지 알 수 없다.)

카드 4 · ○ — 20대 12,888,214건 > 30대 11,388,219건.

카드 5 · ✕ → “적어도 몇 %가 한 번도 안 탔다고 확실히 말할 수 있나?” (정확한 %는 모른다. 다만 인구 1,180,099명에 이용 261,503건이므로 적어도 77.8%라는 하한은 증명된다.)

카드 6 · ✕ → 이 기록만으로는 답할 수 없다. 시민 표본에게 직접 물어야 한다(미션 ③·④의 설문).

공통점 — ✕가 된 넷은 모두 ‘사람’을 묻는데 표는 ‘건’을 센다. 관측 단위가 다르면 아무리 계산해도 답이 나오지 않는다.

3. 시뮬레이터에서 70대 이상 판은 점 118개에 이용권 26장, 20대 판은 점 131개에 이용권 1,289장이었다. ① 이 기록으로 70대 이상에 대해 확실히 말할 수 있는 것을 숫자와 함께 쓰고, ② 20대에 대해서는 왜 같은 말을 못 하는지 쓰시오. ③ 그리고 ‘나이 모름’ 도전 판에서 본 것 — 이용권을 몇 장 옮기면 ①의 결론이 사라지는지, 그것이 무엇을 뜻하는지 쓰시오.
📖 모범 답안

① 이용권(26장)이 점(118개)보다 적으므로 한 점에 한 장씩 흩어도 92개의 점이 끝내 꺼진다. 반올림 전 원자료로는 인구 1,180,099명에 이용 261,503건이므로 적어도 77.8%가 한 해 동안 따릉이를 한 번도 타지 않았다. 짐작이 아니라 셈으로 증명되는 하한이다.

② 20대는 이용권(1,289장)이 점(131개)보다 많다. 점을 모두 켜고도 1,158장이 남고, 남은 장은 이미 켜진 점에 얹을 수밖에 없다. 그래서 ‘안 탄 20대’는 0명일 수도, 130만 명에 가까울 수도 있다 — 한 명도 증명하지 못한다. 기록이 넘치면 ‘많이 탔다’만 말하고, 모자랄 때만 사람을 증명한다.

③ 나이를 모르는 이용권 318장 가운데 92장(28.9%)을 70대 이상으로 옮기면 이용권이 점 수와 같아져 꺼질 수밖에 없는 점이 0이 된다. 즉 ①의 77.8%는 “나이 모름 317만 건 가운데 70대 이상이 91만 8,596건보다 적다면”이라는 조건 아래에서만 성립한다. 확실한 결론에도 이런 전제가 붙어 있고, 보고서에는 그 전제를 함께 적어야 한다.

4. 가상 설문에서 가중치가 가장 큰 층은 어디이고 그 값은 얼마인가? ① 그 숫자가 이 조사에 무엇을 뜻하는지 쓰고, ② 70대 이상 5명 가운데 ‘탔다’ 1명이 ‘안 탔다’로 바뀌면 가중 이용률이 몇 %p 바뀌는지 계산 과정과 함께 쓰시오.
📖 모범 답안

70대 이상 · 12.0배이다. 응답자 400명 가운데 5명(1.25%)뿐인 층이 모집단의 15%를 대표하려면 15.0% ÷ 1.25% = 12.0, 곧 한 사람을 12.0명 몫으로 세야 한다.

① 이 조사의 결과 가운데 15%는 단 다섯 사람이 만든다는 뜻이다. 그 다섯이 어떤 70대인지(예: 온라인 설문에 답할 수 있는 70대)에 따라 전체 숫자가 크게 흔들린다. 가중치는 모자란 몫을 채우는 것이 아니라 불리는 것이다.

② 70대 이상의 층별 이용률이 1/5 = 0.2 → 0/5 = 0으로 바뀐다. 가중 이용률은 층별 이용률에 모집단 몫을 곱해 더한 값이므로 변화는 0.2 × 0.15 = 0.03 = 3.0%p, 곧 30.5% → 27.5%다. 같은 일을 20대 한 사람에게 하면 (1/140) × 0.13 = 0.093%p뿐이다 — 가중치가 큰 층일수록 한 사람이 결과를 크게 흔든다.

5. 응답이 0명인 층은 가중치로 채울 수 없다. ① 그 까닭을 쓰고, ② 코드 ③이 오류 없이 찍은 27.5%가 사실은 무엇을 가정한 숫자인지 쓰시오. ③ 그때 이 자료로 확실히 말할 수 있는 것을 한 문장으로 적고, ④ 조사자가 할 수 있는 일 두 가지를 쓰시오.
📖 모범 답안

① 가중치는 층별 이용률에 곱하는 값인데, 응답이 0명이면 층별 이용률 자체가 없다(0 ÷ 0 = NaN). 곱할 것이 없으므로 아무리 큰 가중치도 소용이 없다 — 0 × 12 = 0이 아니라 아예 계산할 수 없는 것이다.

② pandas 는 NaN 을 조용히 건너뛰고 나머지 여섯 층만 더한다. 그 27.5%는 70대 이상에 대해 “이용률이 0이다(아무도 안 탔다)”라고 가정한 것과 같다. 오류가 나지 않기 때문에 더 위험하다 — 화면에는 멀쩡한 숫자 하나만 남는다.

③ 빈 층이 모집단의 15%이므로, 그 층의 이용률이 0일 때 27.5%, 1일 때 42.5%다. “이 자료로 확실히 말할 수 있는 것은 시민 이용률이 27.5% ~ 42.5% 사이라는 것뿐이다.”

④ ⓐ 방문·전화처럼 다른 방법으로 70대 이상을 더 모은다(온라인만으로는 그 층이 계속 빈다). ⓑ 그것이 어렵다면 보고서의 모집단을 ‘69세 이하’로 좁히고 그 사실을 제목과 본문에 밝힌다. 빈 층을 0.5 같은 값으로 ‘짐작’해 채우면(35.0%) 범위가 한 숫자로 줄어드는데, 그때는 반드시 무엇을 가정했는지를 숫자 옆에 함께 적어야 한다.

6. 누리시가 ‘시민의 공공자전거 이용률’을 조사한다. 아래 수집 계획서 여섯 칸을 채우시오. 그리고 여섯째 칸 ‘그래도 빠질 수 있는 사람’을 비워 두면 안 되는 까닭을 한 줄로 쓰시오.
칸내가 적을 내용
질문 — 무엇을 알고 싶은가
모집단 — 누구에 대한 이야기인가
표집 틀 — 그 사람들의 명단을 어디서 얻나
뽑는 법 — 명단에서 어떻게 고르나
응답률을 높이는 법
그래도 빠질 수 있는 사람
📖 모범 답안

질문 누리시 시민 가운데 최근 1년 안에 공공자전거를 한 번이라도 탄 사람의 비율은?

모집단 조사 시점에 누리시에 사는 만 13세 이상 시민 전체(공공자전거 대여 가능 나이).

표집 틀 주민등록 명부(연령·성별·동 정보) — 틀이 모집단을 얼마나 덮는지 함께 적는다.

뽑는 법 연령대 × 성별로 나눈 층화 무작위 추출. 층마다 최소 인원을 정해(예: 70대 이상 60명 이상) 가중치가 3배를 넘지 않게 한다 — 오늘 본 12.0배는 애초에 뽑는 단계에서 막는 편이 낫다.

응답률을 높이는 법 온라인 한 가지가 아니라 방문·전화·종이를 함께 쓰고, 응답 시간을 5분 안으로 줄이고, 두 번까지 다시 연락한다.

그래도 빠질 수 있는 사람 주민등록에 없는 거주자, 시설·병원에 있는 사람, 전화·인터넷을 쓰지 않는 사람, 조사 기간에 집을 비운 사람, 한국어가 서툰 주민.

비워 두면 안 되는 까닭 — 어떤 틀도 모두를 담지 못한다. 빠질 사람을 미리 적어 두어야 결과를 읽는 사람이 결론의 범위를 알 수 있고, 나중에 그 층이 실제로 비었을 때 가중치로 가리는 대신 범위로 정직하게 보고할 수 있다.

+
더 알아보기

탐험 밖의 이야기 셋

가상 설문 400명의 가중값 배율울타리 0.7 ~ 1.5공표 가능0.5배1배2배5배10배10대0.600밖20대0.371밖30대0.667밖40대1.280통과50대1.943밖60대3.000밖70대 이상12.000밖가로는 로그 눈금 · 값은 코드 ② 의 가중치 열
방법 더 깊이

한 사람이 서른 명 몫이 될 때 — 가중값 배율에는 울타리가 있다

2016년 미국 대선 기간, 로스앤젤레스타임스와 서던캘리포니아대학이 같은 응답자를 되풀이해 묻는 추적 조사를 했습니다. 그런데 이 조사만 다른 조사들과 유독 다른 흐름을 보였어요. 뉴욕타임스의 분석에 따르면 원인 가운데 하나는 일리노이에 사는 19세 응답자 한 명이었습니다. 나이 · 지역 · 인종을 모두 맞추다 보니 그 한 사람의 가중치가 평균 응답자의 서른 배 가까이로 커졌고, 그가 답을 바꿀 때마다 특정 집단의 지지율 추정이 요동쳤습니다.

그래서 우리나라에는 아예 울타리가 있습니다. 중앙선거여론조사심의위원회의 선거여론조사기준 제5조는 가중값 배율이 성별 · 연령대별 · 지역별로 각각 0.7 ~ 1.5를 벗어난 결과는 공표 · 보도하지 못하게 합니다. 오늘 우리가 계산한 가상 설문을 이 자에 대면 일곱 칸 가운데 통과하는 칸은 40대(1.280) 하나뿐이고, 70대 이상은 12.000 — 울타리 밖으로 한참 나가 있습니다. 이 조사는 이 나라에서는 보도될 수 없습니다. 가중치가 크다는 것은 ‘잘 고쳤다’가 아니라 수집이 실패했다는 신호입니다.

도해: 코드 ②가 찍는 가중치 일곱 개를 로그 눈금 위에 놓고 0.7~1.5 허용 띠를 칠했다. · 출처: 중앙선거여론조사심의위원회 「선거여론조사기준」 제5조(2026-05-21 고시) · 뉴욕타임스 업샷, 「How One 19-Year-Old Illinois Man Is Distorting National Polling Averages」(2016)

한 해 겨울 — 유행의 크기약 두 배검색으로 만든 추정보건 당국 집계11월1월3월검색한 사람과 아픈 사람은 같은 집단이 아니다 —기록이 많다고 모집단을 담은 것은 아니다.
역사

많은 데이터 ≠ 대표하는 데이터

2008년 구글은 구글 독감 트렌드를 내놓았습니다. ‘기침’ · ‘해열제’ 같은 검색어의 빈도로 독감 유행을 보건 당국보다 빠르게 알아맞히겠다는 것이었죠. 처음 몇 해는 잘 맞았고, ‘데이터가 충분히 많으면 표본 설계는 필요 없다’는 말의 대표 사례가 됐습니다.

그런데 2012~2013년 겨울, 구글의 추정은 미국 질병통제예방센터 집계의 약 두 배까지 치솟았습니다. 라저(Lazer) 등이 2014년 『사이언스』에 쓴 분석의 요지는 간단합니다 — 검색하는 사람과 아픈 사람은 같은 집단이 아니다. 독감이 뉴스에 오르면 안 아픈 사람도 검색하고, 검색 엔진이 추천어를 바꾸면 기록 자체가 달라집니다. 수억 건의 검색 기록도 모집단을 담은 표본은 아니었던 것입니다. 오늘 따릉이 기록이 4,385만 건이어도 ‘서울 시민’이 아니었던 것과 같은 일이에요. 데이터의 양은 대표성을 사 주지 않습니다.

도해: 두 곡선의 모양만 보인 모식도다 — 눈금 숫자는 넣지 않았다. · 출처: D. Lazer, R. Kennedy, G. King, A. Vespignani, “The Parable of Google Flu: Traps in Big Data Analysis”, Science 343 (2014)

같은 도시, 두 동네대여소가 있는 동네대여소가 없는 동네기록이 쌓인다사람은 있는데 기록은 0기록이 많은 곳에 또 짓는다→ 없는 곳은 계속 기록이 생기지 않는다● 대여소(기록이 생기는 자리) · ✕ 대여소가 없어기록이 생기지 않는 자리 — 자리는 모양을 보인 예시다.
현장

기록되지 않는 수요

공공자전거 운영자는 이용 기록을 보고 다음 대여소를 어디에 지을지 정합니다. 합리적으로 보이죠 — 많이 빌리는 곳에 더 지으면 되니까요. 그런데 이 결정에는 오늘 배운 함정이 그대로 들어 있습니다. 대여소가 없는 동네에서는 기록이 한 줄도 생기지 않습니다. 거기 사는 사람이 자전거를 원하지 않아서가 아니라, 빌릴 자전거가 없어서예요.

기록을 근거로 투자하면 기록이 많은 곳에 또 짓게 되고, 없는 곳은 계속 기록이 생기지 않습니다. 데이터가 결정을 낳고 결정이 다시 데이터를 낳는 고리가 생기는 것이죠. 이것을 끊으려면 기록 바깥의 자료가 필요합니다 — 인구 · 통근 통계, 민원, 직접 물어보는 설문처럼요. 오늘 대표 비율을 재려고 주민등록 인구를 가져온 것과 같은 일입니다. 자기 기록만 보는 조직은 자기가 이미 만나고 있는 사람만 점점 더 잘 알게 됩니다.

도해: 대여소가 있는 동네와 없는 동네를 나란히 그린 모식 지도다 — 점의 자리는 예시이고 실제 지도가 아니다.