단원 홈
4단원 · 11차시

공유회 — 만든 것을 내놓고
서로 평가한다

10차시에서 모델 카드 여덟 칸을 채웠습니다. 오늘 그 카드를 남에게 건넵니다. 발표는 자랑하는 자리가 아니라 재현 가능성의 시험입니다 — 남이 우리 카드만 보고 우리 숫자를 다시 낼 수 있는가.

성취기준 12인기04-03 성취기준 12인기04-04
공유회재현 시험 상호평가 루브릭평가자 사이 편차 한 줄 근거22분 시간표
🎯 학습 목표
  • 10차시의 모델 카드를 다른 팀에게 건네고, 카드에서 한 칸이 비었을 때 재현이 어디서 막히는지를 네 갈래(못 돌린다 / 갈린다 / 못 읽는다 / 숫자는 같다)로 가려낼 수 있다.
  • 다섯 항목 × 4수준 상호평가 루브릭으로 다른 팀을 평가하고, 점수와 한 줄 근거를 함께 적어 평가자 사이 편차가 큰 항목을 찾아낼 수 있다.
  • 정확도가 가장 높은 팀이 반드시 가장 좋은 프로젝트가 아님을 내가 얻은 루브릭 숫자로 설명하고, 다음에 고칠 것 세 가지를 정할 수 있다.
🤔

여는 장면 — 카드 한 장을 옆 팀에 건네 보면

열 차시 동안 만들었습니다. 주제를 고르고(1~3차시), 데이터를 구하고(4~5차시), 코드를 돌리고(6~8차시), 집단별로 쪼개어 재고(9차시), 실험 기록과 모델 카드를 남겼습니다(10차시). 오늘은 그 카드를 옆 팀에게 건넵니다.

건네고 나서 딱 한 가지만 봅니다. 옆 팀이 우리 숫자를 다시 낼 수 있는가. 다시 낼 수 있으면 우리가 만든 것은 결과이고, 다시 낼 수 없으면 우리가 가진 것은 주장입니다. 이 둘의 거리는 생각보다 멉니다.

학술대회 포스터 세션. 이젤과 벽에 세운 연구 포스터 사이를 가방을 멘 참가자들이 돌아다니며 읽고, 몇몇은 포스터 앞에서 이야기를 나눈다
학술대회의 포스터 세션(그래프 그리기 학술대회 GD 2009) — 연구 포스터를 이젤에 세워 두고, 참가자들이 그 사이를 돌며 읽고 묻습니다. 갤러리 워크를 하면 우리 교실이 이 모양이 됩니다. 다른 점은 하나입니다 — 우리는 물을 것을 미리 정해 놓고 갑니다(루브릭 다섯 항목). 출처: David Eppstein, Wikimedia Commons (CC BY-SA 3.0)

미리 한 가지를 말해 두겠습니다. 우리는 10차시 견본 카드에서 칸을 하나씩 실제로 지우고, 남은 정보만으로 남이 고를 법한 설정을 전부 돌려 봤습니다. 그랬더니 ‘쓴 특성 목록’ 한 칸만 비어도 남이 낼 수 있는 정확도가 47.9%에서 85.4%까지 벌어졌습니다. 폭 37.5%p입니다. (견본 데이터로 해 보면 그렇게 됩니다. 우리 학교의 실제 기록이 아닙니다.)

더 고약한 것이 있습니다. ‘양성으로 둔 이름표’ 칸을 지우면 정확도는 85.4%로 똑같이 나옵니다. 그런데 정밀도가 100.0%에서 73.1%로, 재현율이 75.9%에서 100.0%로 자리가 통째로 바뀝니다. Ⅱ-12에서 ‘정확도 98%짜리 쓸모없는 모델’을 봤을 때와 같은 자리입니다. 숫자가 같으니 재현된 줄 알고 넘어갑니다. 이것이 가장 위험합니다.

💭 오늘의 물음

칸을 다 채우면 재현되는가?
그리고 — 우리는 서로의 프로젝트를 무엇으로 평가해야 하는가?

답을 미리 말하면 둘 다 ‘아니오’에 가깝습니다. 칸을 다 채워도 데이터 표를 건네지 않으면 한 줄도 못 돌립니다. 그리고 평가 항목에 정확도를 넣으면 가장 낮은 집단이 48.0%인 팀이 두 계단 올라갑니다. 오늘 그 둘을 손으로 확인합니다.

1

발표는 재현 가능성의 시험이다

10차시에서 만든 모델 카드는 여덟 칸입니다. 하는 일 / 만든 사람 / 데이터 / 전처리 / 모델과 설정 / 성능 / 한계 / 다시 만드는 법. 오늘 이 카드를 옆 팀에 건네고, 그 팀이 같은 숫자를 낼 수 있는지를 봅니다. 이것을 재현 가능성이라고 합니다.

그런데 여기에 함정이 하나 있습니다. 칸을 세지 말고 결정을 세야 합니다. ‘전처리’는 카드에서 한 칸이지만, 그 안에는 결정이 다섯 개 들어 있습니다 — 빈칸을 어떻게 했나 · 이상치를 어떻게 했나 · 정규화를 했나 · 분할 씨앗은 몇인가 · 분할 비율은 얼마인가. 한 칸에 “전처리 했음”이라고만 적으면 다섯 결정이 통째로 사라집니다.

그래서 오늘 듣는 팀이 확인할 것은 칸 여덟 개가 아니라 결정 아홉 개입니다.

💡 듣는 팀이 카드에서 뽑아 적을 결정 아홉

① 쓴 특성 목록  ② k  ③ 분할 씨앗  ④ 분할 비율  ⑤ 정규화 여부  ⑥ 빈칸 처리  ⑦ 이상치 처리  ⑧ 양성으로 둔 이름표  ⑨ 집단 열.
하나라도 못 적으면 그 자리에서 손을 들고 묻습니다. 나중에 묻는 것은 시험이 아닙니다.

칸을 하나씩 지워 보면 — 실제로 돌려서 잰 폭

아래 표는 상상이 아닙니다. 10차시 견본 카드에서 그 칸을 실제로 지우고, 남은 정보만으로 남이 고를 법한 값을 전부 돌려서 잰 것입니다. 카드가 다 있을 때는 85.4% 한 값으로 못 박힙니다(세 번 돌려 바이트 단위로 같았습니다).

카드의 칸지우면 없어지는 결정 어떻게 막히나남이 낼 수 있는 값폭
데이터데이터 표 자체 못 돌린다—재현 불가
모델과 설정집단 열 못 돌린다—집단별 성능이 사라진다
모델과 설정쓴 특성 목록 갈린다47.9% ~ 85.4%
(조합 31가지 전수)
37.5%p
전처리이상치를 어떻게 했나 갈린다62.5% · 64.6% · 85.4%22.9%p
전처리분할 씨앗 갈린다66.7% ~ 85.4%
(씨앗 12개)
18.8%p
모델과 설정k 갈린다70.8% ~ 85.4%14.6%p
전처리분할 비율 갈린다76.6% ~ 87.5%10.9%p
전처리빈칸을 어떻게 했나 갈린다76.6% · 85.4%8.8%p
전처리정규화 여부 갈린다83.3% ~ 85.4%2.1%p
(어두움은 10.0%p)
성능기준선 못 읽는다85.4%로 재현은 된다잣대가 없다
모델과 설정양성으로 둔 이름표 숫자가 같다85.4% (같음)정밀도 100.0%↔73.1%
재현율 75.9%↔100.0%
만든 사람이름 · 날짜 · 판 숫자가 같다85.4% (같음)누구에게 물을지 모른다
견본 데이터로 잰 값입니다. 우리 학교의 실제 기록이 아닙니다. ‘폭이 큰 칸’부터 채우십시오 — 특성 목록(37.5%p) · 이상치(22.9%p) · 씨앗(18.8%p) 순입니다.

막히는 방식이 네 가지다 — 이것이 이 표의 결론

① 아예 못 돌린다

2칸

데이터 표 자체 · 집단 열. 바로 들킵니다. 그래서 넷 중 가장 안 위험합니다.

② 숫자가 갈린다

7칸

폭 2.1%p ~ 37.5%p. 재현하는 팀이 “우리는 좀 다르게 나왔네”로 넘겨 버립니다.

③ 숫자는 나오는데 읽을 수 없다

1칸

기준선. 85.4%를 그대로 재현했는데 그게 잘한 건지 판단할 잣대가 없습니다.

④ 숫자는 똑같은데 다른 것이 사라진다

2칸

양성으로 둔 이름표 · 만든 사람. 같은 숫자가 나오니 재현됐다고 착각합니다. 가장 위험합니다.

숫자가 나오는가 → 알아채기 어려워진다 → ① 아예 못 돌린다 데이터 표 · 집단 열 (2칸) ② 숫자가 갈린다 폭 2.1%p ~ 37.5%p (7칸) ③ 못 읽는다 기준선 (1칸) ④ 숫자는 똑같다 양성 이름표 · 만든 사람 (2칸) ⚠ 재현됐다고 착각한다

오른쪽 위로 갈수록 위험합니다 — 숫자는 그대로 나오는데 알아챌 방법이 없기 때문입니다. ④를 잡아내는 유일한 길은 “양성을 무엇으로 두셨나요”라고 묻는 것입니다.

⚠️ 폭을 더하면 안 됩니다

“특성 37.5%p + 이상치 22.9%p + 씨앗 18.8%p = 79.2%p” 같은 셈은 틀립니다. 결정들이 서로 얽혀 있어서 그렇습니다. 실제로 함께 지워 보면 이렇습니다.

지운 칸잃는 결정남이 낼 수 있는 값폭몇 판
전처리 칸만5가지43.8% ~ 90.6%46.9%p720판 전수
모델과 설정 칸만2가지37.5% ~ 85.4%47.9%p217판 전수
두 칸 다7가지33.3% ~ 87.5%54.2%p1,296판 성긴 표본

각각 46.9%p와 47.9%p인데 합(94.8%p)이 아니라 54.2%p입니다. 그리고 전처리 칸만 지워도 최대가 90.6% — 카드에 적힌 85.4%보다 높습니다. 재현하는 팀이 “우리가 더 잘 나왔는데요?”라고 말하게 됩니다. 그게 재현 실패의 얼굴입니다. 최소는 43.8%로 기준선 60.4%보다 한참 아래입니다.

과학 전람회에서 레고 기어로 힘과 속도를 다룬 세 폭 전시판 앞에 선 학생이 손짓하며, 군복 차림의 방문객 두 사람에게 설명하고 있다
과학 전람회에서 자기 전시판 앞에 서서 방문객에게 설명하는 학생. 여기서 나올 수 있는 가장 좋은 질문은 “대단하네요”가 아니라 “그 숫자를 어떻게 얻으셨나요”입니다. 답이 막히는 자리가 곧 카드의 빈칸입니다. 출처: Senior Airman Lexie West (U.S. Air Force), Wikimedia Commons (Public domain)
2

무엇으로 평가할 것인가 — 다섯 항목 × 4수준

상호평가 루브릭은 다섯 항목입니다 — 문제 설정 · 데이터의 정직성 · 집단별 성능 · 한계를 밝혔는가 · 협업의 자취. 각 항목이 4점 만점이므로 만점은 20점입니다.

먼저 없는 것부터 말하겠습니다. ‘정확도’는 항목에 없습니다. 정확도가 높다고 좋은 프로젝트가 아니기 때문입니다. 왜 그런지는 3절에서 숫자로 봅니다.

그리고 각 수준의 문장은 전부 “~를 보여 주었다”로 되어 있습니다. “~라고 말했다”가 아닙니다. 발표를 들으면서 그 자리에서 √ 할 수 있어야 하기 때문입니다. 화면에 떴는지 안 떴는지는 눈으로 보이지만, 마음속에서 생각했는지는 보이지 않습니다.

항목4점3점2점1점
문제 설정 4이 판정을 받게 되는 사람이 누구인지 이름을 대고, 그 사람이 지금은 어떻게 하고 있는지를 화면에 보여 주었다. 손대면 안 되는 문제가 아닌 까닭도 댔다 3무엇을 맞히는지와 누가 쓰는지를 화면에 보여 주었다. 지금 어떻게 하고 있는지는 나오지 않았다 2무엇을 맞히는지는 보여 주었으나, 쓰는 사람이 한 번도 나오지 않았다 1‘AI로 ○○을 해 보았다’로 끝났다. 맞히려는 것이 무엇인지 화면에서 찾을 수 없었다
데이터의
정직성
4몇 개를 언제 어떻게 모았는지 보여 주고, 버린 행과 버린 까닭을 화면에 띄웠다. 지어낸 데이터면 먼저 그렇게 말했다 3크기와 모은 방법을 화면에 보여 주었다. 버린 행 이야기는 나오지 않았다 2크기만 화면에 나왔다. 어디서 왔는지는 물어야 답했다 1데이터 이야기 없이 성능 숫자부터 나왔다
집단별 성능 4집단마다 n과 정확도를 함께 띄우고, 가장 낮은 집단을 스스로 먼저 가리켰다. 그 집단의 기준선과도 견주었다 3집단별 표를 띄웠다. n이 없거나, 가장 낮은 집단을 짚어 주지는 않았다 2전체 숫자만 띄웠고, 물었을 때 집단별로 대답했다 1전체 숫자 하나만 나왔다. 집단으로 쪼갠 적이 없다
한계를
밝혔는가
4모델 카드의 한계 칸에 숫자가 붙은 한계가 있고, 쓰면 안 되는 곳을 두 가지 이상 스스로 댔다 3한계를 말했으나 숫자가 없다(‘어두운 데선 잘 안 돼요’) 2물었을 때만 한계를 말했다. 카드에는 없다 1한계 칸이 비었거나 ‘데이터가 더 많으면 좋겠다’ 한 줄뿐이었다
협업의 자취 4실험 기록표에 나빠진 줄이 남아 있고, 누가 무엇을 맡았는지 이름이 붙어 있다. 막혔던 곳과 푼 방법을 보여 주었다 3기록표는 있으나 좋아진 줄만 남아 있다. 역할 분담은 말했다 2한 사람이 거의 다 말했고 나머지는 화면만 넘겼다 1누가 무엇을 했는지 알 수 없었고, 실험 기록표가 없다
다섯 항목 × 4점 = 만점 20점. 이 표를 인쇄해서 손에 들고 들으십시오.

두 항목은 앞 차시가 이미 만들어 놓았습니다. ‘집단별 성능’ 4점의 “n을 함께”는 9차시에서 쓴 show_groups가 이미 그렇게 찍습니다 — 그 화면을 그대로 띄우기만 하면 4점입니다. ‘협업의 자취’ 4점의 “나빠진 줄이 남아 있고”는 10차시의 실험 기록표를 가리킵니다. 견본에서 그 기록표는 10줄 중 4줄이 나빠진 줄이었습니다. 나빠진 줄을 지우지 않고 그대로 띄우면 그것이 근거가 됩니다.

⚠️ 점수만 적으면 안 됩니다 — 한 줄 근거

항목마다 왜 그 점수인지 한 줄을 반드시 함께 적습니다. 근거를 빼고 점수만 받아 보면 어떻게 되는지 실제로 재 봤습니다 — 평가자 전원이 3점으로 수렴했고, 그러면 항목별 편차가 전부 0.00, 총점은 전원 15.00 동점이 됩니다.
편차 0은 ‘기준이 또렷하다’가 아니라 ‘아무도 안 봤다’일 수 있습니다. 그것을 가려 주는 것이 한 줄 근거입니다. 오늘 시뮬레이터가 근거가 비면 제출을 막습니다.

평가자 사이 편차 — 편차가 큰 항목이 곧 기준이 모호한 항목

같은 발표를 세 팀이 들었는데 점수가 [1, 4, 2]로 나왔다면, 그건 그 팀의 문제가 아니라 그 항목 문장의 문제입니다. 그래서 우리는 팀별 평균만 내지 않고 평가자 사이 편차도 함께 냅니다.

지어낸 견본 다섯 팀(가~마)으로 돌려 보면 이렇게 나올 수 있습니다. 다섯 팀이 돌아가며 뒤의 세 팀을 평가해서, 팀마다 받은 평가 3개 · 준 평가 3개로 같습니다.

항목평균평가자 사이 편차 성향을 걷어 낸 뒤가장 크게 갈린 팀의 점수
문제 설정3.000.380.43나 팀 [4, 3, 4]
데이터의 정직성3.070.190.21다 팀 [3, 2, 3]
집단별 성능2.930.09 ← 가장 또렷0.25나 팀 [4, 4, 3]
한계를 밝혔는가2.600.69 ← 가장 모호0.77다 팀 [1, 4, 2]
협업의 자취2.930.380.32가 팀 [3, 2, 3]
견본입니다. 우리 반 점수를 넣으면 숫자가 달라집니다 — 그게 정상입니다. 편차는 n으로 나누는 모표준편차(Ⅱ-4의 stdev)로 잽니다.
  • ‘한계를 밝혔는가’가 가장 갈립니다(0.69). 같은 발표를 두고 1점과 4점이 함께 나왔습니다. → 점수를 다시 매기기 전에 그 항목의 4수준 문장을 ‘무엇을 보여 주었나’로 다시 쓰는 것이 먼저입니다.
  • ‘집단별 성능’은 거의 안 갈립니다(0.09). 표를 띄웠는지 아닌지가 눈에 보이기 때문입니다. 잘 쓴 항목이 어떤 모습인지 보여 주는 대조군입니다.
  • 편차의 원인은 둘입니다 — ① 항목이 모호하거나 ② 평가자가 원래 후하거나 박하거나. 평가자마다 자기 평균을 뺀 뒤 다시 재면 ②가 걷힙니다. 견본에서 후한 팀은 가(+0.29), 박한 팀은 나(−0.31)입니다.
  • ⚠️ 그런데 성향을 걷어 내도 ‘한계’는 0.69에서 0.77로 오히려 커집니다. 즉 그 항목은 정말로 모호합니다. (평가자가 셋뿐이라 이 견본에서는 네 항목이 다 조금 커졌습니다. “성향을 빼면 편차가 준다”고 외우지 마십시오 — 실제로는 안 줍니다.)
ℹ️ 편차를 ‘객관성’으로 읽지 마십시오

편차는 “다시 볼 항목을 고르는 도구”이지 성적이 아닙니다. 세 가지를 조심하십시오.

㉠ 평가 수가 줄면 편차가 작아 ‘보입니다’. 평가 3개일 때와 2개일 때를 견주면 문제 설정 0.38→0.20, 데이터의 정직성 0.19→0.10, 집단별 성능 0.09→0.00, 한계 0.69→0.60이 됩니다. 둘밖에 없으면 갈릴 여지도 적습니다. 표에 평가 수를 반드시 함께 적으십시오.

㉡ 다 같이 3점을 주면 편차는 0입니다. 편차 0이 좋은 것이 아닙니다.

㉢ 평가자가 셋뿐이라 표준편차 종류에 따라 값이 꽤 다릅니다. 점수 [1, 4, 2]는 모표준편차 1.247, 표본표준편차 1.528로 1.22배 차이입니다. 우리는 Ⅱ-4의 stdev(n으로 나누는 모표준편차)를 씁니다. 다른 반의 숫자와 견줄 때는 어느 것으로 쟀는지 밝히십시오.

3

22분 안에 몇 팀이 들어가나 — 계산부터 한다

한 차시는 40분이고, 그중 ‘손으로’가 22분입니다(여는 4 · 개념 8 · 손으로 22 · 정리 6). 발표와 상호평가는 그 22분 안에서 끝나야 합니다. 그러니 “팀마다 5분씩 발표합시다”라고 말하기 전에 곱셈부터 해야 합니다.

팀 수발표 5분 + 질문·평가 1분 + 전환 0.25분22분 안에 드나
5팀31.25분❌ 9.25분 넘친다
7팀43.75분❌ 21.75분 넘친다
9팀56.25분❌ 34.25분 넘친다
5팀에서도 안 들어갑니다. 전환 시간을 0으로 놓아도 7팀 3분 발표가 28.00분이라 안 됩니다.

그래서 오늘은 ‘5분 발표’를 하지 않습니다. 팀 수에 따라 셋 중 하나로 갑니다.

팀 수방식배분합계남는 시간
5팀전체 발표 발표 3.0분 + 질문·평가 1.0분 + 전환 0.25분 21.25분0.75분
7팀전체 발표 발표 2.0분 + 질문·평가 0.75분 + 전환 0.25분 21.00분1.00분
9팀갤러리 워크 2라운드 1라운드 10분(부스 5개 × 2분) + 2라운드 8분(부스 4개 × 2분) 18분4분
11팀 이상이면 어떤 배분으로도 전체 발표가 안 됩니다 — 갤러리 워크로 갑니다.
  • 7팀의 2분은 짧습니다. 그래서 모델 카드 한 장만 띄우고 성능 · 집단 · 한계 세 줄만 말하게 합니다. 질문은 입으로 받지 말고 쪽지로 받아 정리 6분에 답합니다.
  • 갤러리 워크의 시간은 ‘서 있는 팀 수’가 아니라 ‘부스 수 × 부스당 시간’입니다. 5팀이 부스에 서면 도는 사람은 부스 5개를 봐야 하므로 1라운드가 10분입니다. 여기를 뒤집어 세기 쉽습니다.
  • ⚠️ 갤러리 워크에서는 팀마다 평가자 수가 달라집니다. 그러면 앞 절의 편차를 그대로 견줄 수 없습니다(평가가 3개→2개로 줄면 편차가 작아 보입니다). 평가 수를 표에 반드시 함께 적으십시오.
  • 전환 시간을 빼서 시간표를 맞추지 마십시오. 실제 수업에서 가장 먼저 새는 곳이 거기입니다. 노트북을 연결하고 화면이 뜨는 데만 15초씩 걸립니다.
넓은 강당의 객석을 가득 메운 청중과 무대 오른쪽의 대형 화면. 화면에 위키매니아, 이스라엘 하이파라는 글자가 보인다
듣는 사람이 많을수록 한 팀에게 줄 수 있는 시간은 짧아집니다. 시간표는 인심이 아니라 나눗셈입니다 — 팀 수를 세고, 22분을 나누고, 남는 시간을 확인합니다. (사진은 이스라엘 하이파에서 열린 위키매니아 2011 개회 세션입니다.) 출처: Vassia Atanassova - Spiritia, Wikimedia Commons (CC BY-SA 3.0)
💻

손으로 — 공유회를 연다 (22분)

지금부터 22분은 설명을 듣는 시간이 아니라 공유회 그 자체입니다. 아래 순서대로 갑니다. 시간은 선생님이 화면에 띄운 진행판이 셉니다.

  • 발표한다. 모델 카드를 화면에 띄워 놓은 채로 말합니다. 순서는 문제 → 데이터 → 모델 → 성능 → 한계 다섯입니다. 시간이 2분이면 성능 · 집단 · 한계 세 줄만 말합니다.
  • 들으면서 루브릭을 채운다. 다섯 항목에 점수를 매기고 항목마다 한 줄 근거를 그 자리에서 적습니다. 나중에 적으면 기억이 아니라 인상이 됩니다.
  • 질문을 하나 한다. 둘 중 하나입니다 — “그 숫자를 어떻게 얻으셨나요” 또는 “어느 집단에서 가장 못했나요”. 답이 막히면 그 자리가 카드의 빈칸입니다.
  • 받은 평가를 모아 다음에 고칠 것 세 가지를 정한다. 팀으로 돌아가서 합니다.
  • 가장 배울 점이 많았던 발표를 뽑고 왜 그런지 한 줄로 적는다. ⚠️ 그 까닭이 “정확도가 높아서”라면 다시 생각합니다. 3절 표를 다시 보십시오.
💡 발표 자료는 새로 만들지 않습니다

10차시에서 뽑은 모델 카드 한 장, 9차시의 집단별 표(show_groups 화면), 10차시의 실험 기록표 — 이 셋을 그대로 띄우면 발표 자료가 끝납니다. 새 슬라이드를 만드는 데 시간을 쓰지 마십시오. 그 셋이 루브릭 다섯 항목 중 셋의 근거입니다.

공유회 진행판

📋 공유회 진행판 — 타이머 · 루브릭 · 편차 · 재현 시험 INTERACTIVE

넷을 한 판에 놓았습니다. ① 팀 수를 넣으면 시간 배분을 계산하고 실제로 재생합니다. ② 루브릭을 입력합니다 — 근거가 비면 제출이 안 됩니다. ③ 모아서 항목별 평균과 평가자 사이 편차를 내고, 편차가 큰 항목에 표시를 붙입니다. ④ 모델 카드에서 결정을 하나씩 지워 보며 재현이 어디서 막히는지 확인합니다. 처음에는 지어낸 견본이 들어 있습니다 — 우리 반 값으로 갈아 끼우십시오.

팀 수 발표 3.0분 질문·평가 1.00분 전환 0.25분
배속 60배
팀당4.25분
합계21.25분
예산(손으로)22.00분
판정여유 0.75분
지난 시간0.00분
지금—

⚠ 전환 시간을 0으로 놓아 시간표를 맞추지 마십시오 — 실제 수업에서 가장 먼저 새는 곳이 거기입니다. 11팀 이상이면 어떤 배분으로도 전체 발표가 안 됩니다.

팀 이름
상호평가 한 장 — 점수와 한 줄 근거를 둘 다 적습니다
평가받은 팀 평가한 팀
모인 평가0줄
팀 수5팀
받은 평가—
점수표 점검—

⚠ 근거 칸이 하나라도 비면 제출이 막힙니다. 점수만 모으면 평가가 전원 3점으로 수렴하고, 그러면 편차가 전부 0.00이 됩니다.

모인 평가0줄
반 평균—
가장 갈린 항목—
가장 또렷한 항목—

—

⚠ 편차 0.50 이상인 항목에 표시가 붙습니다 — 그 항목의 4수준 문장을 다시 쓰라는 뜻입니다. 편차는 n으로 나누는 모표준편차로 잽니다(Ⅱ-4의 stdev). 그리고 편차가 작다고 잘 잰 것이 아닙니다 — 전원 같은 점수를 주면 0이 됩니다. 직접 해 보십시오.

체크를 끄면 그 결정을 카드에 안 적은 것입니다. 카드가 다 있으면 정확도가 85.4% 한 값으로 못 박힙니다(견본 데이터 기준).

안 적은 결정0개
① 못 돌린다0
② 갈린다 (최대 폭)0.0%p
③ 못 읽는다0
④ 숫자가 같다0
판정재현된다

—

[안내] ① 탭에서 팀 수를 우리 반 값으로 바꾸고 ▶ 재생을 눌러 보세요.

과제 — 공책에 표를 채웁니다

진행판을 눌러만 보면 5분이면 끝납니다. 아래 세 표를 손으로 채워야 오늘이 남습니다.

과제 ① 시간표 찾기팀 수발표(분)질문·평가(분)합계(분)22분에 드나(O/X)
우리 반 실제
발표를 1분 늘리면
팀이 두 개 늘면
과제 ② 우리 반 편차문제 설정데이터의 정직성집단별 성능한계를 밝혔는가협업의 자취
평균
평가자 사이 편차
다시 써야 하나(O/X)
과제 ③ 반례 만들기무엇을 해 보았나편차 결과무엇을 알았나
전원 3점을 준다
한 팀의 평가를 하나 지운다
카드에서 ‘양성 이름표’만 지운다
⚠️ 반례 셋 — 진행판에서 직접 만들어 보십시오

㉠ 전원 3점을 주면 항목 편차가 전부 0.00이 되고 총점이 전원 15.00 동점이 됩니다. 편차 0이 ‘기준이 또렷하다’를 뜻하지 않는다는 증거입니다.

㉡ 한 팀의 평가를 3개에서 2개로 줄이면 그 항목 편차가 작아집니다. 견본에서는 집단별 성능이 0.09에서 0.00이 됩니다. 갤러리 워크를 할 때 특히 조심해야 하는 자리입니다.

㉢ 카드에서 ‘양성으로 둔 이름표’ 하나만 지우면 값의 폭이 0.0%p로 나옵니다 — 정확도가 똑같기 때문입니다. 그런데 판정은 “재현된다”가 아니라 “착각한다”로 바뀝니다. 왜 그런지 설명해 보십시오.

파이썬으로 모은다 — 오늘의 셈

오늘 파이썬이 하는 일은 하나뿐입니다. 받은 점수를 모아 항목별 평균과 편차를 내는 것. Ⅱ-4에서 급식 잔반을 재던 mean과 stdev를 오늘은 친구들의 평가를 재는 데 씁니다. 같은 두 함수입니다 — 글자 하나 바뀌지 않았습니다.

💡 빈칸 힌트

① 세 평가자가 준 점수를 한 숫자로 만듭니다.  ② ‘평가자들이 갈린 정도’는 무엇으로 잽니까(Ⅱ-4).  ③ 루브릭 총점이 가장 높은 팀을 고릅니다 — 바로 위에서 total[t]를 이미 만들어 두었습니다.

그리고 시간표입니다. 팀 수를 우리 반 값으로 바꾸고 돌리면 어떤 배분이 22분에 들어가는지 코드가 찾아 줍니다.

ℹ️ check_scores()가 잡아 주는 여섯 가지

우리 반 점수를 넣다 보면 반드시 실수가 납니다. 셈을 하기 전에 점수표부터 검사합니다.

자기 팀을 자기가 평가한 줄 · 점수에 5를 쓴 줄 · 점수에 0을 쓴 줄 · 항목을 넷만 적은 줄 · 평가를 하나도 못 받은 팀 · 받은 평가 수가 팀마다 다른 것. 여섯 다 조용히 평균을 망치는 것들이라 오류 없이 지나갑니다. 그래서 먼저 막습니다.

📖

정리 — 오늘의 산출물과 다음

오늘 남겨야 할 것은 셋입니다. 하나라도 비면 이 차시가 ‘구경’으로 끝납니다.

산출물무엇이 적혀 있어야 하나어디서 나왔나
① 받은 상호평가 다섯 항목의 점수와 한 줄 근거. 평가자 수도 함께. 점수만 있고 근거가 없으면 다음 시간에 고칠 것을 못 정합니다 진행판 ②③
② 다음에 고칠 것 세 가지 받은 평가에서 가장 낮았던 항목부터 씁니다. “데이터를 더 모은다” 같은 말 말고 무엇을 어떻게까지 정리 6분
③ 재현 시험 결과 우리 카드에서 못 적은 결정의 목록과 각각의 폭(%p). 하나도 없으면 “열두 줄 다 적었다”라고 씁니다
(결정 아홉 + 데이터 표 · 기준선 · 만든 사람)
진행판 ④
💡 여기까지 못 했으면 이렇게 하세요

발표할 것이 없는 팀(모델이 안 돌아갔거나 데이터가 없는 팀)도 오늘 발표합니다. 대신 순서를 바꿔서 “어디서 막혔나”를 세 줄로 말합니다 — 무엇을 하려 했나 / 어디서 막혔나 / 다음에 무엇을 바꿔 보겠나. 루브릭의 ‘협업의 자취’와 ‘한계를 밝혔는가’는 그대로 평가할 수 있습니다. 막힌 자리를 정직하게 보여 준 발표가 지어낸 성공보다 높게 평가됩니다 — 그게 오늘 루브릭의 설계입니다.

모델 카드가 없는 팀은 진행판 ④의 열두 줄을 그대로 종이에 옮겨 적고 지금 아는 것만 채웁니다. 못 채운 줄이 곧 다음 시간에 물어야 할 목록입니다.

우리 반 점수가 아직 안 모였으면 진행판 ②의 [견본 15줄 불러오기]를 누릅니다. 지어낸 다섯 팀 점수가 들어오고, ③ 탭의 편차 계산과 파이썬 블록이 그대로 끝까지 돌아갑니다. 견본으로 셈을 익힌 다음, 점수가 모이면 갈아 끼우면 됩니다.

다음 시간은 단원 마무리입니다. 열한 차시 동안 만든 것을 한 줄로 잇고, 한 학기의 인공지능 기초를 닫습니다.

🔁 되돌아보기

오늘 우리는 만든 것을 내놓고, 남의 것을 정해진 잣대로 재 보았다. 그러면서 알게 된 것은 남의 프로젝트가 아니라 우리 카드의 빈칸이었다. 다음 시간에는 열한 차시를 한 줄로 잇고, 이 프로젝트를 학기의 기록으로 남긴다.

✅

확인 문제

✍️ 문제마다 답을 쓰고 제출하기를 누르세요. 제출하면 모범 답안이 열리고, 제출한 답은 선생님께 전달됩니다.

1. (오늘 얻은 결과) 우리 팀 모델 카드를 진행판 ④의 열두 줄과 맞춰 보고, 못 적은 결정을 모두 고르세요. 그리고 각각 남이 낼 수 있는 값의 폭이 몇 %p인지 표에서 찾아 적고, 가장 먼저 채워야 할 칸을 고르고 까닭을 쓰세요.
📖 모범 답안

채점 기준은 ‘칸이 찼는가’가 아니라 ‘결정이 다 적혔는가’입니다. 아홉 가지 — 쓴 특성 목록 · k · 분할 씨앗 · 분할 비율 · 정규화 여부 · 빈칸 처리 · 이상치 처리 · 양성으로 둔 이름표 · 집단 열 — 를 하나씩 대 봅니다. ‘전처리’ 칸에 “전처리 했음” 한 줄만 있으면 다섯 결정이 통째로 빈 것입니다.

가장 먼저 채울 칸은 폭이 가장 큰 ‘쓴 특성 목록’(37.5%p)입니다. 그 칸이 비면 남이 낼 수 있는 값이 47.9%에서 85.4%까지 벌어집니다 — 특성 조합 31가지를 전부 돌려서 잰 폭입니다. 그다음이 이상치 처리(22.9%p), 분할 씨앗(18.8%p) 순입니다.

다만 순서를 폭만으로 정하면 안 되는 칸이 둘 있습니다. 데이터 표와 집단 열은 폭이 아예 없습니다 — 값이 갈리는 게 아니라 한 줄도 못 돌리기 때문입니다. 카드를 아무리 잘 써도 데이터 표를 함께 건네지 않으면 재현이 아닙니다.

2. (오늘 얻은 결과) 우리 팀이 받은 상호평가에서 가장 낮았던 항목과 그 평균 점수를 적으세요. 그리고 진행판 ③에서 그 항목의 평가자 사이 편차를 확인한 뒤, 그 지적이 타당한지 — 아니면 항목 문장이 모호했던 것인지 — 근거를 들어 판단하세요.
📖 모범 답안

판단은 두 숫자를 함께 보고 합니다. 평균이 낮은데 편차도 작으면 평가자 셋이 같은 것을 보고 같은 판단을 한 것이므로 지적이 타당합니다. 평균이 낮은데 편차가 크면 그 항목의 잣대가 흔들린 것이므로, 점수를 다투기 전에 항목 문장부터 다시 써야 합니다.

견본에서는 ‘한계를 밝혔는가’가 그런 항목이었습니다 — 평균 2.60에 편차 0.69, 같은 발표에 1점과 4점이 함께 나왔습니다(다 팀 [1, 4, 2]). 반대로 ‘집단별 성능’은 편차가 0.09였습니다. 표를 띄웠는지 아닌지가 눈에 보이기 때문입니다.

⚠️ 편차가 큰 까닭이 ‘평가자가 원래 후하거나 박해서’일 수도 있으므로, 평가자마다 자기 평균을 뺀 뒤 다시 재 봅니다. 견본에서 ‘한계’는 성향을 걷어 내도 0.69에서 0.77로 오히려 커졌습니다 — 그 항목은 정말로 모호했던 것입니다.

3. 오늘 들은 다른 팀 발표에서 우리가 놓친 것을 하나 찾아 쓰세요. 그 팀이 화면에 띄웠는데 우리는 안 띄운 것이어야 합니다. “열심히 했다” 같은 인상은 답이 아닙니다.
📖 모범 답안

답은 반마다 다릅니다. 좋은 답의 조건은 하나 — ‘화면에서 보이는 것’이어야 합니다. 루브릭 4수준 문장이 전부 “~를 보여 주었다”로 되어 있는 것과 같은 까닭입니다.

자주 나오는 답은 이런 것들입니다. ㉠ 그 팀은 집단별 표에 n을 함께 띄웠는데 우리는 %만 띄웠다. ㉡ 그 팀은 버린 행과 버린 까닭을 띄웠는데 우리는 “데이터 160장”만 말했다. ㉢ 그 팀은 가장 낮은 집단을 스스로 먼저 가리켰는데 우리는 물어보니까 답했다. ㉣ 그 팀은 실험 기록표에 나빠진 줄을 지우지 않고 남겨 두었다.

넷 다 루브릭 항목과 하나씩 짝이 됩니다. 남의 것을 재 보면 자기 것의 구멍이 보인다는 말이 추상적인 격려가 아니라 항목 이름으로 구체화되는 것이 오늘의 방식입니다.

4. 정확도가 가장 높은 팀이 반드시 가장 좋은 프로젝트인가요? 아래 견본 다섯 팀의 숫자를 근거로 판단하고 까닭을 쓰세요. 그리고 루브릭에 ‘정확도’ 항목을 넣으면 무엇이 달라지는지도 함께 쓰세요.
📖 모범 답안

아닙니다. 견본에서 정확도 1등은 다 팀(92.0%)인데 루브릭에서는 13.33점으로 4등입니다. 까닭은 두 줄입니다 — 가장 낮은 집단이 48.0%여서 격차가 44.0%p이고, ‘집단별 성능’ 항목에서 2.00점(다섯 팀 중 꼴찌)을 받았습니다. 반대로 루브릭 1등은 나 팀(19.00점)인데 전체 정확도는 71.0%로 4등입니다. 대신 격차가 3.0%p뿐이고 ‘한계’ 항목 만점(4.00)을 받았습니다.

루브릭에 ‘정확도’를 넣으면 다섯 팀 중 자리가 바뀌는 팀이 셋입니다. 가 팀 14.00→16.00(3등→4등), 다 팀 13.33→17.33(4등→2등), 라 팀 14.33→17.33(2등→3등). 1등은 안 바뀌지만, 정확도 한 항목이 ‘가장 낮은 집단이 48.0%인 팀’을 두 계단 올려 놓습니다. 그래서 항목에 넣지 않았습니다. 굳이 넣고 싶다면 ‘정확도’가 아니라 ‘가장 낮은 집단의 성능’을 넣어야 합니다.

거꾸로 ‘한계’ 항목을 빼면 순위가 이렇게 바뀝니다 — 나 15.00 > 가 11.67 = 라 11.67 > 다 11.00 > 마 10.33. 한계 항목이 없으면 ‘다’ 팀 같은 자랑 발표가 덜 깎입니다. 이 항목이 루브릭에 있는 까닭이 그것입니다.

5. “실패를 감추지 않은 발표”가 왜 더 좋은 발표인가요? 9차시(집단별로 쪼개어 재기)와 10차시(실험 기록표)에서 우리가 실제로 한 것을 근거로 설명하세요.
📖 모범 답안

첫째, 감춘 발표는 재현되지 않기 때문입니다. 9차시에서 우리는 전체 정확도 하나로는 집단 사이 격차가 안 보인다는 것을 봤습니다. 발표에서 전체 숫자만 말하면 듣는 팀은 그 격차를 알 수 없고, 카드에 집단 열이 없으면 집단별 성능을 아예 못 냅니다(재현 시험 ①). 숨긴 것은 사라지는 게 아니라 재현을 막는 벽이 됩니다.

둘째, 나빠진 줄이 있어야 좋아진 까닭을 말할 수 있기 때문입니다. 10차시 실험 기록표는 견본에서 10줄 중 4줄이 나빠진 줄이었습니다. 그 4줄을 지우면 표가 예뻐지지만, “특성을 늘려서 좋아졌다”가 거짓말이 됩니다 — 실제로는 특성을 늘렸다가 나빠진 줄이 그 안에 있었기 때문입니다. ‘협업의 자취’ 4수준이 “나빠진 줄이 남아 있고”를 요구하는 까닭이 여기입니다.

셋째, 루브릭이 실제로 그렇게 매겨졌습니다. 견본에서 격차를 3.0%p로 줄이고 한계를 숫자로 밝힌 나 팀이 19.00점 1등, 92.0%를 앞세운 다 팀이 13.33점 4등이었습니다. “실패를 감추지 않으면 좋다”는 덕담이 아니라 점수로 확인되는 결과입니다.

6. 이 프로젝트를 한 학기 더 한다면 무엇부터 다시 하겠습니까? 1~10차시 중 되돌아갈 차시 하나를 고르고, 오늘 받은 평가 가운데 무엇이 그 판단의 근거인지 쓰세요.
📖 모범 답안

답은 팀마다 다르지만, 근거는 오늘 받은 항목 점수여야 합니다. 짝은 이렇게 지어집니다.

‘문제 설정’이 낮았다면 2~3차시(주제 좁히기)로 돌아갑니다 — 판정을 받는 사람이 누구인지가 정해지지 않았다는 뜻입니다. ‘데이터의 정직성’이 낮았다면 4~5차시(데이터 구하기와 계획서)입니다. ‘집단별 성능’이 낮았다면 9차시, ‘한계’가 낮았다면 10차시(모델 카드), ‘협업의 자취’가 낮았다면 10차시(실험 기록표)입니다.

가장 흔한 답은 4차시(데이터)입니다. 데이터가 적으면 뒤의 모든 차시가 흔들리기 때문입니다 — 테스트가 20개 아래면 정확도가 튀고, 집단 하나가 15개 아래면 그 %를 성능이라 부를 수 없습니다. “모델을 더 좋은 걸로 바꾸겠다”는 답은 대개 틀립니다. 오늘 재현 시험에서 폭이 가장 큰 칸이 모델이 아니라 특성 목록과 전처리였다는 것을 떠올려 보십시오.

🔎

더 알아보기

평가자가 갈리는 일, 심사가 흔들리는 일, 재현이 안 되는 일 — 교실 밖에서도 똑같이 벌어진다

두 평가자 · 발표 10개 · '한계를 밝혔다' O/X B: O B: X A: O A: X 7 1 1 1 보라 = 같게 매김 · 분홍 = 엇갈림 실제로 같았던 비율 0.80 우연히도 같을 비율 0.68 0.8×0.8 + 0.2×0.2 κ = (0.80 − 0.68) ÷ (1 − 0.68) ≈ 0.38 열 번 중 여덟 번 같았어도, 우연을 빼면 0.38. 둘 다 O를 잘 주면 그냥 맞기도 쉽다.
원리 더 깊이

평가자 둘이 ‘80% 같았다’면 믿을 만한가 — 코헨의 카파

오늘 우리는 평가자가 얼마나 갈렸나를 표준편차로 쟀습니다. 거꾸로 얼마나 같았나를 재고 싶을 때 가장 먼저 떠오르는 것은 일치율입니다 — 열 번 중 여덟 번 같은 판단을 했으면 0.80. 그런데 여기에 함정이 있습니다. 두 평가자가 둘 다 ‘O’를 열에 여덟 번씩 주는 사람이라면, 발표를 한 번도 안 보고 찍어도 0.8×0.8 + 0.2×0.2 = 0.68만큼은 저절로 맞습니다.

1960년 심리학자 제이컵 코헨(Jacob Cohen)은 이 ‘우연히 맞는 몫’을 빼고 다시 재자고 제안했습니다. 그것이 코헨의 카파(κ)입니다. 우연을 넘어선 일치가, 우연을 넘어설 수 있는 최대치의 몇 할인지를 잰 값이라 1이면 완전히 같고, 0이면 찍은 것과 다를 바 없습니다. 그림의 두 평가자는 일치율 0.80이지만 카파는 약 0.38입니다.

오늘의 교훈과 같습니다. 전원이 3점을 주면 편차가 0이 되어 ‘기준이 또렷해’ 보였지요. 카파는 바로 그런 착시를 걷어 내려고 만든 잣대입니다. 우리 루브릭처럼 1~4점이 순서를 가진 점수라면, 3점과 4점의 엇갈림을 1점과 4점의 엇갈림보다 가볍게 치는 가중 카파를 씁니다. 의료 영상 판독이나 기계학습 데이터에 이름표를 붙이는 일에서도 “사람끼리 얼마나 일치했나”를 이 값으로 밝힙니다.

안경을 쓴 심사위원이 탁자에 앉아 턱을 괸 채 채점표를 들여다보며 빨간 펜으로 적고 있다
현장

전문가 심사도 갈린다 — 2014년 NeurIPS의 실험

평가자가 갈리는 것은 고등학생이라서가 아닙니다. 인공지능 분야의 가장 큰 학회 가운데 하나인 NeurIPS(당시 이름 NIPS)는 2014년에 스스로를 시험했습니다. 제출된 논문의 약 10%(166편)를 서로 모르는 두 심사위원회에 따로 맡겨, 각자 붙일지 떨어뜨릴지 정하게 한 것입니다.

결과는 학계를 놀라게 했습니다. 두 위원회는 약 4분의 1의 논문에서 판정이 엇갈렸고, 한 위원회가 붙인 논문의 절반 넘게(약 57%)를 다른 위원회는 떨어뜨렸습니다. ‘어느 위원회를 만나느냐’가 결과를 크게 좌우한다는 뜻이었습니다.

그렇다고 심사가 쓸모없다는 결론은 아닙니다. 흔히 나온 해석은, 확실히 뛰어나거나 확실히 모자란 논문보다 그 사이의 논문에서 판단이 갈린다는 것이었습니다. 오늘 우리 견본에서 ‘한계를 밝혔는가’가 [1, 4, 2]로 갈린 것과 같은 모양입니다. 그래서 학회들은 심사 기준을 구체적인 질문으로 쪼개고, 심사위원끼리 의견을 맞추는 토론 단계를 둡니다 — 우리가 4수준 문장을 ‘무엇을 보여 주었나’로 다시 쓰는 것과 같은 처방입니다.

사진: 과학 전람회에서 채점표를 적는 심사위원(영국 RAF 밀든홀, 2019) · 출처: U.S. Air Force photo by Senior Airman Lexie West, Wikimedia Commons (Public domain)

연구자 1,576명에게 물었다 (네이처, 2016) 남의 실험을 다시 해 보다 실패한 적이 있다 70% 넘게 자기 실험을 다시 해 보다 실패한 적이 있다 절반 넘게 "재현성에 심각한 위기가 있다"고 답했다 52% '넘게'는 보고가 밝힌 아래 끝 값이다. 막대는 그 값으로 그렸다.
생각할 거리

과학자들도 서로의 결과를 다시 못 낸다 — 재현성 위기

2016년 과학 학술지 네이처(Nature)가 연구자 1,576명에게 설문을 했습니다. 70%가 넘는 사람이 다른 연구자의 실험을 다시 해 보려다 실패한 적이 있다고 답했고, 자기 자신의 실험을 다시 해 보다 실패한 적이 있다는 사람도 절반이 넘었습니다. 응답자의 52%는 “재현성에 심각한 위기가 있다”고 봤습니다. 이 문제를 흔히 재현성 위기라고 부릅니다.

원인으로 꼽힌 것들은 오늘 재현 시험에서 본 것과 놀랄 만큼 닮았습니다. 실험 방법을 충분히 적지 않은 것, 원자료와 코드를 함께 내놓지 않은 것, 잘 나온 결과만 골라 보고한 것. 우리 표로 말하면 ‘전처리 칸에 “했음” 한 줄’, ‘데이터 표를 안 건넴’, ‘실험 기록표에서 나빠진 줄을 지움’입니다.

기계학습 분야도 예외가 아니어서, NeurIPS는 2019년부터 논문을 낼 때 재현성 점검표를 채우게 했습니다. 데이터를 어떻게 나눴는지, 설정값은 무엇인지, 여러 번 돌려 얼마나 흔들렸는지를 적게 하는 것이지요. 오늘 우리가 옆 팀에 카드를 건네며 “이 숫자를 다시 낼 수 있나요?”라고 물은 일이, 연구자들이 서로에게 요구하기 시작한 바로 그 일입니다.