단원 홈

Ⅰ. 데이터 과학의 이해단원 마무리

아홉 차시를
한 장의 지도로

도구는 한 번도 오류를 내지 않았다

아홉 차시에서 우리가 붙든 자료는 1846년 빈 종합병원의 장부에서 2026년까지 이어진 마우나로아 822개월까지 제각각이었습니다. 그런데 차시마다 마지막에 남은 문장은 늘 같은 모양이었어요 — 이 숫자는 무엇과 견주어 나온 값인가. 여기서 아홉 차시를 한 장의 지도로 펴 놓고, 네 성취기준을 스스로 짚은 뒤, Ⅱ 단원으로 넘길 물음 셋을 받습니다.

  • [12데과01-01] ~ [12데과01-04]
  • 돌아볼 차시Ⅰ-1 ~ Ⅰ-9 · 아홉
  • 손에 쥔 도구chart · pandas · SQLite · merge 외 넷
  • 문항서술형 넷
1
되돌아보기

아홉 차시는 무엇을 남겼나

Ⅰ 단원은 '데이터 과학이란 무엇인가'를 정의로 외우지 않았습니다. 대신 결정을 바꾼 숫자를 아홉 번 직접 붙들어 봤어요. 병원 장부 · 교차로 사고 기록 · 영화 한 줄 평 · 따릉이 대여 기록 · 산 위의 이산화탄소 · 1693년의 생존표까지, 자료는 매번 달랐습니다.

아홉 번 가운데 도구가 오류를 낸 적은 한 번도 없습니다. 틀린 답은 늘 조용히 나왔어요 — 두 표를 이어 0행이 나와도, 이름표 칸의 평균이 나와도, 효과가 0인 카메라가 39% 감소를 만들어도 프로그램은 아무 말도 하지 않았습니다.

그래서 이 단원이 남긴 것은 도구 목록이 아니라 확인하는 습관입니다. 아래 세 칸이 그 습관입니다.

규칙숫자를 내놓을 때는 그 숫자가 무엇과 견주어 · 어느 기간에 · 무엇을 분모로 나온 값인지를 함께 적는다.

  1. 찾은 것

    자료는 아홉 번 다 달랐지만 물음은 하나였다 — 이 숫자는 무엇과 견주어 나온 값인가. 같은 장부로 "88% 줄었다"도 "48.7% 더 죽었다"도 만들 수 있었다.

  2. 도구의 한계

    도구는 칸의 뜻을 묻지 않는다. pandas 는 이름표의 평균을 내 주고, merge 는 짝 없는 행을 버리고, scikit-learn 은 한 글자 낱말을 말없이 지웠다.

  3. 보고의 규칙

    비율에는 분모를, 배율에는 기간을, 표에는 한 줄이 무엇인지를, 잇기에는 행 가계부를 함께 적는다. 비교 창은 결과를 보기 전에 정한다.

2
한 장의 지도

아홉 차시, 한 줄로

왼쪽 칸의 차시 번호를 누르면 그 쪽으로 돌아갑니다. 오른쪽 칸의 숫자는 그 차시가 실제로 찍는 값이에요 — 기억나지 않는 줄이 있으면 그 차시부터 다시 엽니다.

표 1Ⅰ 단원 아홉 차시 — 한 줄로, 그리고 남는 숫자차시 번호를 누르면 그 쪽으로
차시한 줄로남는 숫자
Ⅰ-1 표는 여섯 해째 있었다 — 바뀐 것은 자료가 아니라 물음과 비교가 붙은 뒤였다. 11.4% 대 2.8%
한 해면 4.1배 · 여섯 해면 2.6배
Ⅰ-2 가장 나빴던 곳을 고르는 순간 운까지 뽑힌다 — 효과 0인 조치도 감소를 만든다. 8.55건 → 5.25건(39%)
효과 0인 도시 300개 중 0 이하 0곳
Ⅰ-3 정형 · 반정형 · 비정형을 가르는 것은 담긴 내용이 아니라 틀이 적힌 자리다. 같은 대여소 5곳
→ 5 · 5 · 3행으로 읽혔다
Ⅰ-4 글을 표로 바꾸는 일은 재는 일이 아니라 고르는 일이다. 2,000줄 → 9칸 · 86%는 한 칸도 안 걸림
'안' 손으로 16번 / 도구 0번
Ⅰ-5 컴퓨터가 수로 읽은 칸과 평균을 내도 되는 칸은 같지 않다. 한 줄이 무엇인지부터 적는다. 11칸 중 수는 7칸
평균이 뜻 있는 칸은 5칸
Ⅰ-6 같은 사실을 여러 곳에 적으면 표가 하나의 물음에 두 답을 낸다. 36칸 중 27칸이 되풀이
대여소 3곳이 이름으로는 4묶음
Ⅰ-7 잇기는 어느 표에도 없던 값을 만들고, 짝 없는 행을 조용히 버린다. '자치구'로 그대로 이으면 25행 ⋈ 26행 → 0행
대여소 한 곳당 주민 1,310~6,730명
Ⅰ-8 늦은 것은 데이터가 아니라 합의였다. 데이터는 사회 변화의 필요조건이지 충분조건이 아니다. 822개월 · 1979년 → 1992년(13년 뒤)
2015년 예측 380.8~404.6ppm(실제 401.0)
Ⅰ-9 나이를 묻지 않는 한 값은 공평하지 않았다. 답과 함께 가정을, 가정과 함께 그 폭을 적는다. 받은 값 7년 치
공정한 값 20살 12.77 / 70살 4.97 · 분기점 63살

아홉 줄을 세로로 읽으면 이 단원의 뼈대가 보입니다 — 결정(Ⅰ-1 · Ⅰ-2) → 자료의 모양과 속성(Ⅰ-3 ~ Ⅰ-5) → 여러 표를 다루는 법(Ⅰ-6 · Ⅰ-7) → 데이터가 바꾼 사회와 직업(Ⅰ-8 · Ⅰ-9). 자료: Ⅰ 단원 아홉 차시의 실행 칸·요약표가 찍는 값

3
스스로 점검

네 성취기준을 스스로 짚는다

네 줄을 읽고 "설명할 수 있다" 싶은 줄에 체크하세요. 체크는 이 기기에만 남고 선생님께 가지 않습니다 — 그러니 솔직하게 비워 두어도 괜찮아요. 비워 둔 줄은 표 1에서 그 차시로 돌아가면 됩니다.

4
확인 문제

두 차시 이상을 맞대어 본다

✍️ 문제마다 답을 쓰고 제출하기를 누르세요. 제출하면 모범 답안이 열리고, 제출한 답은 선생님께 전달됩니다.

1. Ⅰ-1에서 두 병동의 사망률 비는 1846년 한 해만 보면 4.1배, 1841~1846년 여섯 해를 합치면 2.6배였다. Ⅰ-2에서는 카메라의 효과가 0인데도 앞뒤 비교가 39% 감소를 만들었다. 두 숫자는 모두 참인데도 결정을 잘못 이끈다. ① 두 경우에서 잘못을 만든 손짓이 각각 무엇인지 쓰고, ② 둘을 한 문장의 규칙으로 묶으시오.
📖 모범 답안

① Ⅰ-1은 비교 창(기간)을 결과를 보고 골랐다. 같은 장부로 "88% 줄었다"도 "48.7% 더 죽었다"도 만들 수 있었다 — 창을 결과 뒤에 고르면 원하는 결론이 나온다. Ⅰ-2는 비교 대상을 골라 뽑았다. 한 해의 사고 수는 진짜 위험 + 운이라, 가장 나빴던 20곳을 고르는 순간 운까지 함께 뽑힌다. 이듬해 운이 빠지면서 8.55건이 5.25건이 되고(39%), 카메라의 효과가 0인 도시 300개 가운데 감소율이 0 이하인 곳은 한 곳도 없었다.

② 규칙: 무엇과 견줄지를 결과를 보기 전에 정하고, 숫자 옆에 그 비교 대상과 기간을 함께 적는다. 고르는 손은 제비뽑기로 묶고, 견주는 것은 같은 해의 두 집단으로 한다.

2. 이 단원에서 도구는 한 번도 오류를 내지 않았다. 아래 표의 빈칸을 채우시오. 그리고 답 칸에는 도구가 조용히 틀릴 때 사람이 할 수 있는 일을 한 줄로 쓰시오.
도구오류 없이 한 일그래서 무엇을 확인·기록하나
Ⅰ-4 scikit-learn
Ⅰ-5 pandas
Ⅰ-6 SQLite
Ⅰ-7 merge
📖 모범 답안

Ⅰ-4 scikit-learn — 기본 설정이 한 글자 낱말을 버려, 손으로 16번 센 부정 낱말 '안'이 0번이 되었다. → 도구의 기본 설정이 무엇을 버리는지 먼저 확인하고, 고른 칸 · 그 까닭 · 담기지 않은 것 셋을 함께 적는다.

Ⅰ-5 pandas — 칸의 뜻을 묻지 않고 이름표 칸의 평균까지 내 주었다(수로 읽힌 7칸 가운데 평균이 뜻 있는 칸은 5칸). reindex 는 목록에 없는 값을 오류 없이 버렸다(기타 340행). → 칸마다 뜻을 붙이고, 이 표의 한 줄이 무엇인지를 먼저 적는다. 나눈 값을 쓸 때는 무엇으로 나눴는지를 함께 적는다.

Ⅰ-6 SQLite — 규칙을 적어 두어도 스위치를 켜지 않으면 13행이 이을 때 12행이 되고, 규칙 없이 나누기만 하면 13행이 15행이 되었다. 오류는 한 줄도 없었다. → 규칙을 적었는가가 아니라 켜졌는가를 확인한다. "몇 건인가"를 보고할 때는 무엇으로 묶어 세었는지(이름인가 번호인가)를 적는다.

Ⅰ-7 merge — 짝이 없는 행을 조용히 버렸다. '자치구'로 그대로 이었더니 25행 ⋈ 26행이 0행이 되었는데도 오류 메시지는 한 줄도 없었다(대여소 쪽은 종로구, 인구 쪽은 서울특별시 종로구 (1111000000)). → 행 가계부를 적고, 사라진 행을 고칠 것 · 버릴 것 · 적을 것으로 가른다. 이어서는 안 될 것이 이어지지 않는지도 함께 본다.

한 줄 — 도구는 "멈추지 않았다"를 "맞다"로 바꿔 주지 않는다. 돌리기 전에 답의 모양을 먼저 예측해 적고, 돌린 뒤 행 수 · 값의 범위 · 분모를 눈으로 확인한다.

3. 망원역 1번출구 앞 대여소는 Ⅰ-3에서 파일 · 응답 · 공지문 세 모양으로, Ⅰ-6에서는 이름이 갈린 표로 나타났다. "망원역 1번출구 앞 대여소 이용은 몇 건인가?"에 표가 두 답을 내지 않게 하려면 무엇을 어떻게 바꿔야 하는지, Ⅰ-6의 네 물음(되풀이 · 키 · 고리 · 스위치)을 차례로 써서 답하시오. 그리고 이 설계가 Ⅰ-7의 잇기에 왜 도움이 되는지 한 줄 덧붙이시오.
📖 모범 답안

되풀이 — 표 한 장의 36칸 가운데 27칸이 같은 사실의 되풀이였다. 대여소 이름을 대여 기록마다 적지 않는다. 되풀이가 있으면 한 곳만 고쳐지는 일이 생기고, 그 순간 대여소 3곳이 이름으로는 4묶음이 된다.

키 — 대여소마다 뜻 없는 번호를 붙이고(102 · 103 …), 사실(이름 · 주소 · 거치대 수)은 대여소 표 한 곳에만 적는다. 대여 기록은 그 번호만 가리킨다.

고리 — 대여 기록의 대여소 번호가 대여소 표에 반드시 있어야 한다고 적어 둔다(외래 키).

스위치 — 그 규칙을 시스템이 지키게 켠다. 적어 두기만 하고 켜지 않으면 13행이 이을 때 12행이 되고, 규칙 없이 나누기만 하면 13행이 15행이 된다 — 오류 한 줄 없이.

한 줄 — 이을 열쇠가 사람이 쓴 이름이 아니라 번호가 되면 글자 모양이 어긋날 자리가 없어진다. Ⅰ-7처럼 서로 다른 기관이 만든 표를 이름으로 이어야 할 때는 번호가 없으므로, 그때는 반드시 행 가계부를 적어 0행 같은 결과를 알아챈다.

4. Ⅰ-8에서 1979년의 킬링 곡선은 이미 2015년 값을 380.8~404.6ppm 사이에 가둘 만큼 길어져 있었지만(실제 401.0ppm) 세계의 협약은 1992년에 왔다. Ⅰ-9에서 핼리는 1693년에 나이별 공정한 값을 계산했지만 나라는 누구에게나 7년 치로 팔았다. ① 두 사례에서 데이터가 있었는데도 바뀌지 않은 것이 무엇이었는지 쓰고, ② 그래서 데이터로 일하는 사람이 답과 함께 내놓아야 하는 것이 무엇인지 Ⅰ-9의 계리사를 예로 들어 쓰시오.
📖 모범 답안

① 둘 다 늦은 것은 데이터가 아니라 합의였다. 마우나로아는 1958년 3월부터 822개월 동안 한 달도 빠지지 않았고 1979년이면 곡선만으로 2015년을 380.8~404.6ppm 안에 가둘 수 있었는데, 세계가 협약을 맺은 것은 13년 뒤인 1992년이다. 핼리의 계산도 1693년에 이미 있었지만 연금 값은 오래 한 가지였다. 데이터는 사회 변화의 필요조건이지 충분조건이 아니다 — 무엇을 할지는 데이터가 정해 주지 않는다.

② 답과 함께 가정을, 가정과 함께 그 폭을 내놓는다. 핼리 표로 낸 연금 값은 이자 6%를 가정한 값이고, 이자를 4~8%로 바꾸면 나라가 이득으로 돌아서는 첫 나이가 63살에서 58~66살로 움직인다. 그래서 계리사는 "63살"만 적지 않고 "이자 6% 가정 · 4~8%면 58~66살"까지 적는다. 표가 한 도시 · 몇 해치이고 84살에서 끊겨 있다는 것도 함께 밝힌다.

+
다음 단원으로

Ⅰ 단원이 답하지 못한 물음 셋

Ⅰ 단원은 이미 만들어진 표를 받아 들고 시작했습니다. 표가 어떻게 만들어졌는지, 빈칸과 튀는 값을 어떻게 다룰지, 요약 숫자가 같으면 정말 같은 자료인지는 아직 열지 않았어요. 아래 물음 셋이 Ⅱ 단원 데이터 준비와 분석 열네 차시의 출발점입니다.

  1. 표가 애초에 한쪽으로 기울어 있다면?따릉이 기록은 따릉이를 타는 사람의 기록일 뿐이다 — Ⅱ-1 · Ⅱ-2에서 수집 단계를 열어, 1,600명에게 물어도 틀리는 설문과 '누구의 목소리인가'를 본다.
  2. 빈칸과 튀는 값은 지워도 되나?Ⅰ-7에서 사라진 행을 고칠 것 · 버릴 것 · 적을 것으로 갈랐다 — Ⅱ-3 ~ Ⅱ-5에서 같은 물음을 빈칸과 튀는 값에 대고, 파일을 받으면 먼저 신상명세서를 쓰는 법을 익힌다.
  3. 요약 숫자가 같으면 같은 자료인가?Ⅰ-5에서 '평균을 내도 되는 칸'을 가렸다면, Ⅱ-6 ~ Ⅱ-8은 그 평균조차 모양을 숨긴다는 것을 보인다 — 평균도 표준편차도 같은 네 학교가 기다린다.