단원 홈
1단원 · 2차시

왜 하필 인공지능인가
사례 여섯을 나란히 놓고 따진다

1차시의 ELIZA는 규칙 네 개로 굴러갔고, 대화 아홉 번 가운데 두 번은 어느 규칙에도 걸리지 않았습니다. 그렇다면 규칙을 적는 대신 인공지능을 불러야 하는 문제는 어떤 문제일까요? 오늘은 사례 여섯을 같은 잣대에 올려놓고 따집니다.

성취기준 12인기01-01
세 조건다섯 기준적합도 점수 실패 사례약한 AI
🎯 학습 목표
  • 인공지능이 유리한 문제의 세 조건을 대고, 어떤 문제가 어느 조건에서 걸리는지 짚을 수 있다.
  • 사례를 다섯 기준(문제 · 데이터 · 왜 AI인가 · 사람의 역할 · 조심할 점)으로 갈라 비교·분석할 수 있다.
  • 세 조건에 점수를 매겨 사례를 줄 세우고, 그 순위가 무엇을 숨기는지 반례로 확인할 수 있다.
🤔

여는 장면 — 두 화면 사이의 갈림길

같은 건물 안에 컴퓨터 화면 두 개가 켜져 있습니다. 하나는 국세청 홈택스의 세액 계산 화면이고, 다른 하나는 병원 판독실의 흉부 X선 화면입니다. 두 화면 모두 컴퓨터가 사람을 돕고 있지만, 그 안에서 도는 프로그램의 종류가 다릅니다.

🧾 화면 A — 세액 계산

소득 4,200만 원, 공제 항목 몇 개를 넣으면 세액이 나옵니다. 이 프로그램 안에는 세율표가 그대로 들어 있습니다. if 과세표준 <= 14000000: 세액 = 과세표준 × 0.06 같은 줄이 구간마다 적혀 있어요.

법이 바뀌면 그 줄을 고칩니다. 답은 데이터에 숨어 있지 않고 법에 적혀 있습니다.

🫁 화면 B — X선 판독

가슴 사진 한 장에서 결절이 있는지 봅니다. 그런데 '결절'을 조건문으로 적어 보라고 하면 아무도 적지 못합니다. 밝기가 얼마 이상이면 결절일까요? 크기는? 모양은?

대신 전문의가 판독 소견을 붙여 둔 과거 영상이 수십만 장 있습니다. 여기서는 규칙을 적는 대신 예시를 모읍니다.

두 화면의 차이를 "AI는 최신 기술이니까"로 설명하면 아무것도 설명한 것이 아닙니다. 세금 계산에 인공지능을 붙이면 더 나빠집니다. 100% 맞아야 할 계산이 '대체로 맞는' 계산으로 바뀌고, 왜 그 세액인지 설명할 수도 없게 되니까요.

정면에서 찍은 정상 흉부 X선 사진. 갈비뼈 사이로 양쪽 폐가 어둡게, 가운데 심장이 밝게 보인다
정상 흉부 X선 사진. 이 한 장에서 '결절처럼 보이는 음영'을 조건문으로 적어 보려 하면 곧 막힙니다. 사람은 알아보지만 규칙으로는 적지 못하는 것 — 오늘 이야기는 여기서 시작합니다. 출처: Mikael Häggström, Wikimedia Commons (CC0)
💭 오늘의 물음

세금 계산은 일반 프로그램이 낫고 X선 판독은 인공지능이 낫다. 이 갈림길을 무엇으로 가르는가?

1차시에서 우리는 규칙 네 개로 굴러가는 ELIZA를 돌려 보았습니다. 규칙에 걸리면 사람처럼 대답했고, 걸리지 않으면 "조금 더 자세히 말해 주세요"만 되풀이했지요. 대화 아홉 번 중 두 번이 그랬습니다. 그때 우리가 얻은 결론은 '규칙을 적을 수 있는 만큼만 똑똑하다'였습니다.

오늘은 그 결론을 뒤집어 봅니다. 규칙을 적기 어려운 문제라면, 무엇이 있어야 인공지능을 쓸 수 있을까요? 말로만 따지면 사람마다 답이 다릅니다. 그래서 오늘은 잣대를 먼저 만들고, 그 잣대에 사례 여섯을 올려 점수를 매겨 봅니다.

1

인공지능이 유리한 문제의 세 조건

잣대는 세 가지입니다. 어려운 말이 아니라, 앞의 두 화면을 갈랐던 것을 그대로 문장으로 적은 것입니다.

①

패턴이 있는가

데이터 안에 되풀이되는 규칙성이 있어야 합니다. X선 사진에서 병이 있는 사람과 없는 사람의 영상은 실제로 다르게 생겼습니다. 그 '다름'이 데이터 안에 있어야 기계가 붙잡을 것이 생깁니다.

없으면 — 로또 번호 예측. 지난 회차를 아무리 모아도 다음 번호와의 관계가 애초에 없습니다. 데이터가 아무리 많아도 배울 것이 없습니다.
②

데이터가 충분한가

패턴이 있어도 정답이 붙은 사례를 모을 수 없으면 배울 방법이 없습니다. 여기서 중요한 것은 양이 아니라 그 데이터가 우리가 궁금한 것을 재고 있는가입니다.

없으면 — 세계에 환자가 몇 명뿐인 희귀병 진단. 패턴은 있겠지만 배울 예시가 다섯 장뿐이면 기계는 그 다섯 장을 외울 뿐입니다.
③

규칙으로 적기 어려운가

①과 ②를 채웠어도, 사람이 if 문으로 다 적을 수 있는 문제라면 인공지능을 쓸 까닭이 없습니다. 규칙은 빠르고, 정확하고, 왜 그렇게 나왔는지 설명됩니다.

없으면 — 세금 계산. 세율표가 곧 정답이라 규칙으로 적는 편이 모든 면에서 낫습니다. 여기에 AI를 쓰면 손해만 봅니다.

세 조건은 순서대로 걸리는 관문이 아니라 동시에 맞아야 하는 조건입니다. 하나라도 빠지면 일반 프로그램이 더 낫거나, 아예 아무 방법도 통하지 않습니다. 그림으로 그리면 이렇게 됩니다.

① 패턴이 있다 ② 데이터가 있다 ③ 규칙으로 적기 어렵다 인공지능이 유리한 자리 ③만 빠진 자리 물의 상태 판정 ②만 빠진 자리 희귀병 진단 ①만 빠진 자리 로또 번호 예측 ①만 채움 ②만 채움 ③만 채움 셋 다 못 채운 자리 세금 계산 (0·0·0)

세 조건이 모두 겹치는 한가운데에만 인공지능이 유리한 자리가 있다. 조건 하나씩만 빠진 세 자리는 각각 '왜 안 되는지'가 서로 다르고, 세금 계산은 셋 다 채우지 못해 아예 원 바깥에 놓인다.

자리를 하나씩 짚어 봅시다. ③만 빠진 자리의 '물의 상태 판정'을 먼저 보세요. 온도와 상태 사이에 패턴이 뚜렷하고(①), 측정 기록도 얼마든지 모을 수 있습니다(②). 그런데 if 두 줄이면 끝납니다. 굳이 배우게 할 까닭이 없습니다.

②만 빠진 자리의 희귀병 진단은 패턴도 있고 규칙으로 적기도 어렵지만, 배울 예시가 없습니다. ①만 빠진 자리의 로또 번호 예측은 데이터도 많고 규칙으로도 못 적지만, 애초에 붙잡을 패턴이 없습니다. 같은 '안 된다'인데 안 되는 까닭이 셋 다 다릅니다.

그런데 세금 계산은 세 원 어디에도 들어가지 못해 바깥에 있습니다. ③에서 걸리는 것은 앞에서 본 대로입니다. 그런데 ①에서도 걸립니다. 답이 데이터 속에 숨어 있는 것이 아니라 법에 적혀 있어서, 데이터에서 찾아낼 패턴 자체가 없기 때문입니다. 뒤에서 점수를 매길 때 세금 계산이 0 · 0 · 0을 받는 까닭이 이것입니다. 남은 ②는 조금 까다롭습니다. 따로 봅시다.

여기서 조심할 것이 하나 있습니다. ②를 "데이터가 많다"로 읽으면 안 됩니다. 국세청에는 세금 데이터가 엄청나게 많지만, 그 데이터로 세액을 배울 필요는 없습니다. 답이 이미 법에 적혀 있으니까요. ②가 묻는 것은 양이 아니라 '이 문제의 답을 가르쳐 줄 데이터인가'입니다. 이 구별을 놓쳐서 크게 실패한 사례를 3절에서 봅니다.

💡 세 조건을 한 문장으로

배울 것이 있고(①), 배울 거리가 있고(②), 굳이 배워야만 하는(③) 문제. 셋 중 하나만 빠져도 다른 방법이 낫습니다.

2

비교·분석의 다섯 기준 — '신기하다'로 끝내지 않는 법

사례를 조사해 오라고 하면 대개 이런 글이 돌아옵니다. "인공지능이 X선을 판독한다. 정확도가 매우 높다. 놀랍다." 여기에는 비교할 것이 하나도 없습니다. 다른 사례와 나란히 놓을 수가 없으니 분석이 아니라 감상입니다.

사례를 분석으로 바꾸려면 모든 사례에 같은 칸을 만들어야 합니다. 이 책에서는 다섯 칸을 씁니다.

기준무엇을 적는가이 칸이 비면 생기는 일
문제무엇을 넣으면 무엇이 나와야 하는가. 입력과 출력을 한 문장으로. "AI가 의료를 돕는다" 같은 말만 남아 다른 사례와 견줄 수 없다.
데이터무엇으로 배우는가. 누가 모았고 정답은 누가 붙였는가. 세 조건의 ②를 판정할 수 없다. 편향의 출처도 못 찾는다.
왜 AI인가규칙으로 적으면 왜 안 되는가. '유리하지 않다'도 답이 된다. 모든 문제에 AI가 답인 것처럼 보인다. 이 칸이 분석의 심장이다.
사람의 역할누가 목표를 정하고, 누가 결과에 책임지고, 누가 확인하는가. 'AI가 대신한다'는 잘못된 그림이 남는다.
조심할 점틀렸을 때 무슨 일이 벌어지는가. 어떤 상황에서 잘 틀리는가. 성공 사례만 모이고, 실패에서 배울 눈이 자라지 않는다.

이제 여섯 사례를 이 다섯 칸에 넣어 보겠습니다. 사례 6개 × 기준 5개 = 칸 30개입니다. 읽을 때 성공담을 찾지 말고, '왜 AI인가' 칸에 무엇이 적혀 있는지를 먼저 보세요. 여섯 중 둘은 그 칸에 "AI가 유리하지 않다"가 적힙니다.

마이오글로빈 단백질의 3차원 리본 구조 그림
마이오글로빈의 3차원 구조. 아미노산이 늘어선 순서만 보고 이 모양을 알아내는 문제가 사례 ⑤다.출처: Aza Toth, Wikimedia Commons (Public domain)
아래쪽에 카드가 꽂혀 있고 화면에 PROCESSING이 뜬 휴대용 카드 결제 단말기
화면에 'PROCESSING'이 뜬 채 승인을 기다리는 결제 단말기. 이 짧은 시간 안에 사례 ③의 판정이 끝나야 한다. 출처: Basile Morin, Wikimedia Commons (CC BY-SA 4.0)
사례 ①

의료 영상 판독

여는 장면의 화면 B
문제
가슴 X선 사진 한 장에서 결절·폐렴 같은 이상 소견이 있는지 가려낸다.
데이터
전문의가 판독 소견을 붙여 둔 병원의 과거 영상 수십만 장.
왜 AI인가
'결절처럼 보이는 음영'을 화소 밝기의 조건문으로 적는 일은 아무도 해내지 못했지만, 예시를 모으는 일은 병원이 이미 하고 있었다.
사람의 역할
최종 진단과 설명 책임은 의사에게 있다. AI는 놓치기 쉬운 곳을 먼저 표시하는 2차 판독자다.
조심할 점
학습에 쓴 병원의 장비·환자 구성에 맞춰진 모델은 다른 병원에서 성능이 떨어진다. 놓친 병변(위음성)의 대가가 사람 목숨이다.
사례 ②

기계 번역

규칙으로 30년을 시도했던 문제
문제
한 언어의 문장을 뜻을 지킨 채 다른 언어의 문장으로 옮긴다.
데이터
같은 내용을 두 언어로 적어 둔 대역 말뭉치 — 국제기구 회의록, 자막, 병렬 웹문서 수억 문장.
왜 AI인가
1950년대부터 30년 넘게 문법 규칙으로 번역기를 짜려던 시도가 관용구와 중의성 앞에서 번번이 무너졌다. 규칙의 수가 언어의 크기만큼 필요했다.
사람의 역할
계약서·의료 문서처럼 틀리면 큰일 나는 번역은 사람이 감수한다. 번역기가 무엇을 못 하는지 아는 것이 사람의 몫이다.
조심할 점
그럴듯하지만 뜻이 뒤집힌 문장을 자신 있게 내놓는다. 자료가 적은 언어는 품질이 뚝 떨어진다.
사례 ③

신용카드 이상 거래 탐지

규칙과 AI를 함께 쓰는 자리
문제
방금 일어난 결제 한 건이 도난 카드에 의한 것인지 몇 밀리초 안에 판정한다.
데이터
카드사의 결제 기록과, 나중에 고객 신고로 '사기였다'고 확정된 이름표.
왜 AI인가
사기 수법이 계속 바뀌어서 규칙을 적는 속도가 수법이 바뀌는 속도를 못 따라간다. 다만 규칙도 절반쯤은 통해서, 실제 카드사는 규칙 엔진과 AI를 같이 쓴다.
사람의 역할
의심 거래로 걸러진 건을 사람이 확인하고, 얼마나 깐깐하게 잡을지(문턱)를 정한다.
조심할 점
사기는 전체 거래의 1%도 안 된다. '전부 정상'이라고만 답해도 정확도 99%가 나오므로 전체 정확도로 재면 안 된다. 정상 거래를 막으면 고객이 결제를 못 한다.
사례 ④

세금 계산

여는 장면의 화면 A
문제
소득과 공제 항목을 넣으면 내야 할 세액을 정한다.
데이터
배울 데이터가 필요 없다. 세법 조문과 세율표가 이미 정답을 규정하고 있다.
왜 AI인가
AI가 유리하지 않다. 답이 데이터 속에 숨어 있는 것이 아니라 법에 적혀 있기 때문이다.
사람의 역할
법이 바뀌면 규칙을 고친다. 계산 자체는 일반 프로그램이 정확하고 빠르고 설명 가능하다.
조심할 점
여기에 AI를 쓰면 100% 맞아야 할 계산을 '대체로 맞는' 계산으로 바꾸는 손해만 본다. 왜 그 세액인지 설명할 수도 없다.
사례 ⑤

단백질 구조 예측

계산으로는 끝나지 않던 문제
문제
아미노산이 늘어선 순서만 보고 그 단백질이 접혀서 이루는 3차원 모양을 알아낸다.
데이터
실험으로 구조를 밝혀 단백질 구조 데이터베이스(PDB)에 쌓아 둔 십수만 개의 구조.
왜 AI인가
물리 법칙으로 풀려면 접힐 수 있는 경우의 수가 천문학적이라 계산이 끝나지 않는다. 반면 '이런 서열은 이렇게 접히더라'는 통계적 패턴은 데이터에 있었다.
사람의 역할
예측된 구조를 실험으로 검증하고, 그것으로 무엇을 할지(신약 후보 탐색 등) 정한다.
조심할 점
예측은 가설이지 실험 결과가 아니다. 데이터가 적은 종류의 단백질에서는 신뢰도가 떨어진다.
사례 ⑥

이력서 1차 심사

3절의 실패 사례와 이어진다
문제
지원서 더미에서 면접에 부를 사람을 추린다.
데이터
과거 지원서와 그때의 합격·불합격 기록.
왜 AI인가
유리하다고 말하기 어렵다. 데이터가 가르치는 것은 '일을 잘할 사람'이 아니라 '과거의 채용 담당자가 뽑던 사람'이다. 배우려는 것과 데이터에 있는 것이 다르다.
사람의 역할
무엇을 좋은 지원자로 볼지 정하고, 떨어진 사람이 까닭을 묻고 다툴 수 있는 절차를 만든다.
조심할 점
과거의 차별을 그대로 배워 되풀이하면서, 기계가 했다는 이유로 공정해 보인다. 떨어진 사람은 왜 떨어졌는지 알 길이 없다.
ℹ️ 여섯 중 둘이 '쓰지 말라'는 답을 가진다

사례 ④와 ⑥의 '왜 AI인가' 칸에는 AI가 유리하지 않다가 적혀 있습니다. 여섯 장 가운데 둘이 이런 답을 가져야 이 표가 비로소 분석이 됩니다. 여섯 장 모두가 '유리하다'로 채워진 표는 잣대가 아니라 홍보물입니다.

3

실패 사례도 사례다 — 성공만 모으면 분석의 눈이 자라지 않는다

지금까지 본 여섯 사례는 모두 지금 벌어지고 있는 일입니다. 그런데 사례집에 성공만 모으면, 우리는 "AI는 잘 된다"는 문장 하나만 배우게 됩니다. 그 문장으로는 다음에 만날 새 사례를 판정하지 못합니다.

여기서는 크게 성공했다가 크게 어긋난 사례 둘을 봅니다. 둘 다 '세 조건을 채운 줄 알았는데 아니었던' 경우이고, 어긋난 자리가 서로 다릅니다.

실패 ① 구글 독감 트렌드 — ②를 채운 줄 알았다

검색어의 양으로 독감 유행을 예측한 서비스. 한때 미국 질병통제센터(CDC)보다 빨랐습니다.

2008

서비스 공개

구글이 독감 관련 검색어의 양으로 병원 방문율을 예측하는 서비스를 공개했다. 미국 질병통제센터(CDC) 집계보다 1~2주 빨랐다.

2013

크게 빗나갔다

2012~2013 독감 철에 실제 진료 비율의 두 배가 넘는 값을 예측했다. '빠른 예측'이 아니라 그냥 틀린 예측이었다.

2014

원인 분석 논문

《사이언스》에 실린 논문 「구글 독감의 교훈」이 무엇이 잘못됐는지를 분석했다.

2015

서비스 종료

서비스가 종료되었다.

⚠️ 왜 어긋났나
  • 상관을 인과로 착각했다 — 독감에 걸려서 검색한 사람과, 뉴스를 보고 겁이 나서 검색한 사람을 구별할 수 없었다.
  • 측정하는 행위가 측정 대상을 바꿨다 — 구글이 검색어 자동완성과 추천을 바꾸자 검색량 자체가 달라졌다.
  • 한번 맞은 모델을 다시 재지 않았다 — 세상이 변했는데 모델은 처음 그대로였다.

세 조건으로 다시 읽으면 이렇습니다. 검색 데이터는 어마어마하게 많았으니 ②를 채운 것처럼 보였습니다. 그러나 그 데이터가 재고 있던 것은 독감이 아니라 '독감에 대한 관심'이었습니다. 1절에서 "②가 묻는 것은 양이 아니다"라고 한 말이 여기서 값을 치릅니다.

실패 ② 채용 이력서 심사 AI — ①에서 이미 걸렸다

사례 ⑥ '이력서 1차 심사'의 점수를 왜 낮게 매기는지에 대한 실제 근거입니다.

2014

개발 착수

아마존이 이력서를 자동으로 평가하는 시험용 도구를 만들기 시작했다. 지난 10년치 지원서로 학습시켰는데, 그 대부분이 남성 지원자의 것이었다.

2015

성별 편향 확인

도구가 여성 지원자에게 낮은 점수를 준다는 사실이 드러났다. 'women's'(여성)라는 낱말이 든 이력서와 여자대학 졸업자를 깎아내렸다.

2017

팀 해체

고칠 수 없다고 판단해 팀을 해체했다. 아마존은 이 도구를 실제 채용 판정에 쓰지는 않았다고 밝혔다.

2018

바깥에 알려짐

로이터 보도로 이 일이 알려졌다.

⚠️ 왜 어긋났나
  • 학습 데이터가 과거의 채용 결과였다. 과거가 치우쳐 있으면 모델은 그 치우침을 규칙으로 배운다.
  • 성별 항목을 지워도 소용없었다 — 동아리 이름이나 출신 학교가 성별을 대신 알려 주는 단서로 쓰였다.
  • 무엇을 보고 점수를 깎았는지 사람이 알아내기 어려웠다.

이 사례가 걸린 곳은 ②가 아니라 ①입니다. 데이터에 패턴은 분명히 있었습니다. 다만 그 패턴은 '일을 잘할 사람'의 패턴이 아니라 '과거에 뽑히던 사람'의 패턴이었습니다. 기계는 우리가 배우고 싶은 것을 배우는 것이 아니라 데이터에 있는 것을 배웁니다.

📖 두 실패를 한 줄로 나란히

구글 독감은 데이터가 다른 것을 재고 있었고, 아마존 이력서는 데이터에 있는 패턴이 우리가 원하던 패턴이 아니었습니다. 둘 다 "데이터가 많다"는 사실만으로는 막을 수 없는 실패입니다. 연표 여덟 항목을 다시 훑어보면, 두 사례 모두 실패까지 여러 해가 걸렸다는 점도 같습니다. 잘 도는 동안에는 아무도 몰랐습니다.

4

'대신'이 아니라 '함께' — 약한 AI가 못 하는 것

지금까지 본 어떤 사례도 사람을 대신하지 않았습니다. 의료 영상 판독 AI는 놓치기 쉬운 곳을 먼저 표시하고, 최종 진단과 설명 책임은 의사에게 있습니다. 이상 거래 탐지 AI는 의심 건을 걸러 내고, 얼마나 깐깐하게 잡을지는 사람이 정합니다.

이것은 기술이 아직 모자라서가 아닙니다. 1차시에서 갈라 본 대로, 지금 우리가 쓰는 인공지능은 모두 약한 AI, 곧 정해진 목표 안에서만 똑똑한 프로그램입니다.

🤖 기계가 잘하는 것

  • 같은 판정을 지치지 않고 수백만 번 되풀이한다
  • 사람이 못 보는 미세한 차이를 데이터에서 붙잡는다
  • 결과를 몇 밀리초 안에 낸다
↔

🧑 사람만 할 수 있는 것

  • 무엇을 목표로 삼을지 정한다
  • 그 결과가 옳은지 판단한다
  • 틀렸을 때 책임을 지고, 다툴 절차를 만든다

아마존 이력서 도구가 무너진 자리가 정확히 여기입니다. 기계는 "과거 합격자와 비슷한 사람을 고르라"는 목표를 아주 잘 수행했습니다. 문제는 그 목표를 세운 것이 사람이었다는 점입니다. 목표가 잘못되면 성능이 좋을수록 더 크게 틀립니다.

빨간 신호등 앞 교차로에 멈춰 선, 지붕에 둥근 센서 덮개를 얹은 작은 웨이모 자율주행 시험차의 뒷모습
빨간 신호 앞에 스스로 멈춰 선 웨이모의 자율주행 시험차(미국 캘리포니아주 마운틴뷰). 지붕 위 둥근 덮개에 주변을 살피는 센서가 들어 있다. 신호를 지키고 보행자를 알아보는 일은 기계가 하지만, 사고를 피할 수 없는 순간에 무엇을 지킬 것인가는 기계가 정할 수 없다. 그것은 성능 문제가 아니라 목표를 정하는 문제다. 출처: Grendelkhan, Wikimedia Commons (CC BY-SA 4.0)

그래서 사례를 분석할 때 '사람의 역할' 칸을 비워 두면 안 됩니다. 그 칸이 비면 "AI가 알아서 한다"는 그림만 남고, 무엇이 잘못될 수 있는지 물을 자리도 사라집니다.

ℹ️ 다음 단원 예고

오늘 우리는 "이 문제에 인공지능을 쓸 것인가"를 바깥에서 따졌습니다. 그렇다면 안에서는 어떤 일이 벌어질까요? Ⅱ단원(기계학습)에서 '데이터로 배운다'는 말이 실제로 어떤 계산인지를 직접 돌려 봅니다. 오늘 매긴 조건 ②(데이터가 충분한가)가 그때 다시 나옵니다. 바로 다음 3차시에서는 그 전에 문제를 컴퓨터가 읽을 수 있는 지도로 다시 적는 법을 배웁니다.

💻

손으로 — 여섯 사례에 점수를 매기고 줄을 세운다

이제 잣대를 씁니다. 사례마다 세 조건에 0 · 1 · 2 중 하나를 매깁니다. 0은 '전혀 아니다', 1은 '반쯤 그렇다', 2는 '확실히 그렇다'입니다. 세 점수를 더한 값(0~6)을 AI 적합도라고 부르겠습니다.

⚠️ 점수는 정답이 아니다

이 표에는 채점표가 없습니다. 여러분이 매긴 점수와 이 책이 매긴 점수가 다를 수 있고, 그 차이가 오늘의 수업 재료입니다. 다만 규칙이 하나 있습니다 — 점수마다 '왜 그 점수인가'를 한 줄로 대지 못하면 매긴 것이 아닙니다. 아무 근거 없이 2를 찍는 것은 표를 채운 것이 아니라 칸을 메운 것입니다.

🧮 AI 적합도 매트릭스 INTERACTIVE

칸마다 0 · 1 · 2 버튼을 눌러 점수를 매기면 합계 · 순위 · 막대가 그 자리에서 다시 계산됩니다. 아래 가중치 슬라이더는 세 조건에 서로 다른 무게를 줍니다 (셋 다 1이면 그냥 더한 값입니다). 칸 아래 ▲ 표시는 그 칸을 1점만 바꿔도 순위가 달라지는 칸, 회색 –는 바꿔도 순위가 그대로인 칸입니다. 처음에는 모든 칸이 1이라 여섯 사례가 전부 같은 등수입니다. 여기서 시작하세요.

1 1 1

다 매겼으면 📋 기준 점수 불러오기를 눌러 이 책이 매긴 점수를 겹쳐 보세요. 먼저 매기고 나서 눌러야 합니다. 순서를 바꾸면 남의 점수를 베끼는 것이 됩니다.

오늘의 과제 세 가지

과제 A · 표 채우기 — 가중치를 바꿔 세 번 돌린다

세 조건에 같은 무게를 주는 것이 당연한 일일까요? 가중치를 아래 세 가지로 맞추고, 그때마다 1위가 누구인지 · 공동 1위가 몇 개인지 · 6위가 누구인지를 공책에 옮겨 적으세요. (점수는 기준 점수로 맞춰 두고 비교합니다.)

가중치 ①②③1위공동 1위 수6위
1 · 1 · 1???
0 · 0 · 1???
1 · 1 · 0???

세 줄을 다 적었으면 물어보세요 — 순위가 이렇게 쉽게 바뀌는데, 우리는 왜 순위를 믿었을까요?

과제 B · 반례 만들기 — 세금 계산을 1위로 올려라

기준 점수에서 세금 계산은 0점 · 6위입니다. 이 사례를 공동 1위로 올려 보세요. 몇 칸을 어떻게 바꿔야 하는지 세어 보고, 그 점수를 한 줄로 정당화할 수 있는지 스스로 물어보세요. "국세청에 데이터가 얼마나 많은데"라는 말로 ②를 2점으로 올려도 되는지가 특히 중요한 다툼거리입니다.

반대 방향도 해 보세요 — 의료 영상 판독을 꼴찌로 내리려면 몇 칸을 바꿔야 합니까? 한쪽이 다른 쪽보다 훨씬 어렵다면, 그 사실 자체가 이 잣대에 대해 무엇을 말해 줍니까?

과제 C · 문턱 찾기 — 둔한 칸을 찾아라

기준 점수를 불러온 상태에서, 칸 아래의 ▲와 – 표시를 보세요. 1점을 바꿔도 순위가 그대로인 칸('둔한 칸')이 몇 개인지 세고, 그것이 어느 사례의 칸인지 적으세요.

그리고 가장 극단적인 경우를 직접 해 보세요 — 이력서 1차 심사의 ③을 2에서 0으로, 곧 2점이나 깎아 보세요. 점수는 얼마가 되고 순위는 몇 위가 됩니까? 이 결과가 순위표라는 도구에 대해 무엇을 말해 주는지 세 줄로 적으세요.

🗣️ 모둠에서 다툴 것

모둠끼리 점수를 맞춰 보면 대개 두 칸에서 크게 갈립니다 — 신용카드 이상 거래 탐지의 ③(규칙으로도 절반은 잡히는데 '어렵다'고 볼 것인가)과 이력서 1차 심사의 ①(데이터에 패턴이 있기는 있는데 그것이 우리가 원하는 패턴인가)입니다.

둘 다 양쪽 근거가 다 있습니다. 어느 쪽이 맞는지 정하는 것이 목표가 아니라, 근거를 대고 다투는 것이 목표입니다. 오늘의 산출물은 채워진 매트릭스 한 장과, '우리 모둠이 꼽은 AI가 가장 어울리지 않는 사례와 그 까닭' 세 줄입니다.

매긴 점수를 코드로 검산한다

매트릭스에서 매긴 점수를 아래 코드의 SCORES에 옮겨 적고 실행하면, 순위 · 공동 순위 · 조건별 합계를 한꺼번에 찍어 줍니다. 화면으로 본 것을 코드가 같은 답을 내는지 확인하는 자리입니다. 빈칸 세 곳(?????)을 채워야 돌아갑니다.

코드 가운데의 TABLE과 FAILURES는 2절과 3절에서 읽은 그 내용입니다. 같은 표가 글로 적히면 교과서 지면이고, 자료 구조로 적히면 프로그램이 다룰 수 있는 것이 됩니다. 맨 끝의 '데이터 점검'은 이 자료 구조에 빠진 칸이 없는지 세어 줍니다 — 사례 6개 × 기준 5개 = 칸 30개, 빈칸 0개가 나와야 합니다. SCORES에만 사례를 하나 더 넣고 TABLE에는 안 적으면 오류 없이 돌다가 이 블록이 빈칸 5개를 잡아냅니다.

💡 빈칸 세 곳이 묻는 것
  • 빈칸 ① — 18칸의 점수. 오늘 15분의 결과가 곧 이 표다.
  • 빈칸 ② — 적합도를 세 점수 a, b, c로 어떻게 정의할 것인가. '합'이 아니라 '곱'으로 두면 어떻게 될까? 하나라도 0이면 전체가 0이 된다. 세 조건이 '하나라도 빠지면 안 된다'는 뜻이라면 곱이 더 맞는 모형일지도 모른다.
  • 빈칸 ③ — 무엇을 기준으로, 어느 방향으로 줄 세울 것인가. reverse를 반대로 두면 오류 없이 순위가 거꾸로 나옵니다. 조용히 틀리는 코드를 보는 자리입니다.
⚠️ 조용히 틀리는 자리 둘

점수에 3을 적어도 오류가 나지 않습니다. 한 사례의 세 칸을 모두 3으로 적으면 "□" * (6 - 9)가 빈 문자열이 되어 9/6 ■■■■■■■■■로 그냥 찍힙니다. 더 고약한 것은 한 칸만 3으로 적었을 때입니다 — 세금 계산 자리에 0, 0, 0 대신 3, 0, 0을 적으면 3/6 ■■■□□□이 되어 겉보기에는 아무 이상이 없습니다. 그래서 코드 맨 위에 점수 점검 블록이 들어 있습니다. 그 블록을 지우면 아무도 눈치채지 못합니다.

점수를 "2"처럼 따옴표로 감싸면 점검 블록이 먼저 경고를 찍고, 이어서 TypeError가 납니다. 오류 메시지만으로는 어느 줄인지 알 수 없는데, 위의 경고가 사례 이름을 알려 줍니다. 오류 메시지를 위에서부터 읽는 습관이 여기서 값을 합니다.

📖

정리 — 잣대를 세우고 나면 보이는 것

이 책이 매긴 기준 점수는 아래와 같습니다. 여러분의 점수와 다른 칸이 있다면, 그 칸이 오늘 수업에서 가장 값진 자리입니다.

사례① 패턴② 데이터 ③ 규칙화적합도순위
의료 영상 판독2226공동 1위
기계 번역2226공동 1위
단백질 구조 예측2226공동 1위
신용카드 이상 거래 탐지22154위
이력서 1차 심사11245위
세금 계산00006위

여기서 세 가지를 짚습니다.

1
조건별 합계가 셋 다 9/12

사례 6개 × 2점 = 12점 만점인데 ①·②·③ 모두 9점이었습니다. 우연이지만, 어느 한 조건만 유난히 잘 채워지는 것은 아니다라는 사실을 보여 줍니다. 다만 누가 깎였는지는 조건마다 다릅니다.

2
공동 1위가 셋

의료 영상 · 기계 번역 · 단백질 구조 예측이 모두 6점으로 묶였습니다. 눈금이 0~2뿐이라 잘 맞는 문제끼리는 이 잣대로 구별되지 않습니다. 잣대가 실패한 것이 아니라, 잣대가 답할 수 있는 범위가 여기까지인 것입니다.

3
둔한 칸이 넷

1점을 바꿔도 순위가 그대로인 칸이 넷 있었습니다 — 세금 계산의 세 칸 전부와 이력서 1차 심사의 ③입니다. 나머지 14칸은 1점만 움직여도 순위가 바뀝니다. 순위표는 점수 차이의 크기를 숨깁니다.

💡 오늘 얻은 도구 두 벌
  • 세 조건 — ① 패턴이 있는가 ② 데이터가 충분한가 ③ 규칙으로 적기 어려운가. 쓸 것인가 말 것인가를 가른다.
  • 다섯 기준 — 문제 · 데이터 · 왜 AI인가 · 사람의 역할 · 조심할 점. 어떻게 쓸 것인가를 따진다. 이 다섯 칸을 채운 글만 분석이라고 부른다.

그리고 오늘 가장 중요한 한 줄은 점수표가 아니라 이것입니다. 여섯 사례 중 둘은 '쓰지 말라'가 답이었습니다. 인공지능을 배운다는 것은 인공지능을 쓸 자리를 찾는 일이면서, 동시에 쓰지 말아야 할 자리를 알아보는 일이기도 합니다.

✅

확인 문제

✍️ 문제마다 답을 쓰고 제출하기를 누르세요. 제출하면 모범 답안이 열리고, 제출한 답은 선생님께 전달됩니다.

1. 인공지능이 유리한 문제의 세 조건을 쓰고, '세금 계산'이 어느 조건에서 걸리는지 짚으시오. (세금 계산의 기준 점수는 0 · 0 · 0이었습니다. 세 칸 모두를 설명해야 합니다.)
📖 모범 답안

세 조건은 ① 패턴이 있는가 · ② 데이터가 충분한가 · ③ 규칙으로 적기 어려운가입니다.

세금 계산은 ③에서 가장 먼저 걸립니다. 세율표가 곧 정답을 규정하고 있어 if 문으로 다 적을 수 있습니다. 규칙으로 적을 수 있는 문제에 AI를 쓰면 정확도 · 속도 · 설명 가능성을 모두 잃습니다.

①과 ②도 0인 까닭은 조금 다릅니다. ①은 '데이터에서 발견해야 할 패턴'이 애초에 없기 때문입니다 — 답이 데이터 속에 숨어 있는 것이 아니라 법에 적혀 있습니다. ②는 '데이터가 없다'가 아니라 배울 데이터가 필요 없다는 뜻입니다. 국세청에 자료가 아무리 많아도 그 자료로 세액을 배울 이유가 없습니다. ②가 묻는 것은 양이 아니라 '이 문제의 답을 가르쳐 줄 데이터인가'였습니다.

2. 오늘 다루지 않은 새 사례 '내일 비가 올지 예보하기'를 다섯 기준 중 세 칸(문제 · 데이터 · 왜 AI인가)으로 채우고, 세 조건에 0~2점을 매겨 적합도를 구하시오. 점수마다 까닭을 한 줄씩 붙이시오.
📖 모범 답안

정답이 하나로 정해지지 않는 문항입니다. 아래는 근거를 갖춘 한 가지 답입니다.

문제 — 오늘까지의 관측값(기압 · 기온 · 습도 · 바람 · 위성 영상)을 넣으면 내일 특정 지역에 강수가 있을 확률을 내놓는다.
데이터 — 기상청이 수십 년간 쌓아 둔 관측 기록과, 그날 실제로 비가 왔는지에 대한 기록. 정답이 자동으로 붙는다는 점이 강점이다(하루 지나면 답을 알 수 있다).
왜 AI인가 — 여기가 다툼거리다. 날씨 예보의 주력은 오랫동안 대기의 물리 법칙을 푸는 수치 계산이었지 규칙 나열이 아니었다. 그러니 '사람이 if 문으로 적기 어렵다'는 말은 맞지만, 그 자리를 이미 물리 모형이 채우고 있었다. AI가 파고든 자리는 물리 모형의 결과를 보정하거나, 계산이 너무 오래 걸리는 부분을 대신하는 것이다.

점수 예 — ① 2점(대기 상태와 이튿날 날씨 사이에 패턴이 분명히 있다), ② 2점(관측 기록이 길고 정답이 저절로 붙는다), ③ 1점(규칙으로는 못 적지만 물리 계산이라는 다른 좋은 방법이 이미 있다) → 합 5점. ③을 2점으로 매겨 6점이라고 답해도 됩니다. 다만 'AI 말고 다른 방법이 이미 있다'는 사실을 어디에 반영했는지는 반드시 말할 수 있어야 합니다. 그것이 '왜 AI인가' 칸의 몫입니다.

3. (오늘 화면에서 잰 것 · 과제 A) 기준 점수를 그대로 둔 채 가중치를 0 · 0 · 1로 바꾸면 1위가 누구이고 공동 1위는 몇 개가 됩니까? 1 · 1 · 0일 때는 어떻습니까? 두 결과를 견주어, 가중치를 바꾼다는 것이 무엇을 바꾸는 일인지 한 문장으로 쓰시오.
📖 모범 답안

0 · 0 · 1(③ 규칙화 어려움만 본다) → 합계는 차례로 2 · 2 · 1 · 0 · 2 · 2. 공동 1위가 넷으로 늘고, 여기에 이력서 1차 심사가 끼어듭니다. 신용카드가 5위, 세금 계산이 6위입니다.

1 · 1 · 0(③을 무시한다) → 합계는 4 · 4 · 4 · 0 · 4 · 2. 역시 공동 1위가 넷인데 이번에 끼어드는 것은 신용카드 이상 거래 탐지이고, 이력서가 5위로 내려갑니다.

같은 점수표인데 1위 명단이 두 번 다 달라졌습니다. 곧 가중치를 바꾼다는 것은 점수를 바꾸는 일이 아니라 '무엇을 중요하게 볼 것인가'를 바꾸는 일이고, 순위는 점수만이 아니라 그 결정에 함께 달려 있습니다. 순위표만 보고 다투면 이 결정이 보이지 않습니다.

4. (오늘 화면에서 잰 것 · 과제 C) '이력서 1차 심사'의 ③을 2에서 0으로 내리면 적합도와 순위는 각각 어떻게 됩니까? 또 화면이 '둔한 칸'으로 표시한 칸은 몇 개이며 어느 사례의 칸이었습니까? 이 두 결과가 순위표라는 도구에 대해 무엇을 말해 주는지 쓰시오.
📖 모범 답안

적합도는 4점 → 2점으로 2점이나 내려가는데 순위는 5위 그대로입니다. 바로 아래인 세금 계산이 0점이라 그 밑으로 내려갈 자리가 없기 때문입니다.

둔한 칸은 4개입니다 — 세금 계산의 ①·②·③ 세 칸 전부와 이력서 1차 심사의 ③. 나머지 14칸은 1점만 움직여도 순위가 달라집니다.

말해 주는 것: 순위는 점수 차이의 크기를 숨깁니다. 2점을 깎았는데 순위가 그대로일 수도 있고(이력서 ③), 1점만 올려도 순위가 통째로 뒤집힐 수도 있습니다 (신용카드 ③을 1→2로 하면 공동 1위가 셋에서 넷으로 늘어납니다). 그래서 모둠끼리 순위만 맞춰 보면 정작 다툴 거리가 보이지 않습니다. 점수가 갈린 칸을 놓고 다투어야 합니다.

5. 모둠에서 점수가 가장 크게 갈린 칸을 하나 고르고, 양쪽 근거를 한 줄씩 적으시오. 그리고 그 칸을 1점 올리거나 내리면 순위가 바뀌는지 화면에서 확인해 적으시오.
📖 모범 답안

모둠마다 답이 다릅니다. 다만 실제로 가장 자주 갈리는 두 칸과 그 양쪽 근거를 적어 둡니다.

신용카드 이상 거래 탐지의 ③ — '어렵다(2점)' 쪽: 사기 수법이 계속 바뀌어 규칙을 적는 속도가 따라가지 못한다. '반쯤이다(1점)' 쪽: 실제 카드사는 지금도 규칙 엔진을 함께 쓰고, 규칙만으로도 절반쯤은 잡힌다. 이 책은 1점을 주었습니다. 이 칸을 1→2로 올리면 신용카드가 6점이 되어 공동 1위가 넷으로 늘어납니다 — 순위가 바뀝니다.

이력서 1차 심사의 ① — '있다' 쪽: 과거 지원서와 합격 여부 사이에 통계적 패턴은 분명히 있다. '없다' 쪽: 그 패턴은 '일을 잘할 사람'의 패턴이 아니라 '과거에 뽑히던 사람'의 패턴이라, 우리가 찾으려는 패턴은 아니다(아마존 사례). 이 책은 1점을 주었습니다. 이 칸을 1→2로 올리면 이력서가 5점이 되어 신용카드와 공동 4위가 됩니다 — 순위가 바뀝니다. 다만 1→0으로 내리면 3점이 되어도 5위 그대로입니다. 화면이 이 칸에 ▲를 붙인 것은 올리거나 내리는 두 방향 중 한쪽이라도 순위를 바꾸기 때문입니다. 같은 칸이라도 올릴 때와 내릴 때가 다르다는 것도 여기서 함께 확인해 두세요.

핵심은 어느 쪽이 옳으냐가 아니라, 점수 뒤에 근거가 있느냐입니다. 근거를 댈 수 없는 점수는 순위를 만들 자격이 없습니다.

6. "인공지능이 사람을 대신한다"는 말이 왜 부정확한지, 오늘 본 사례 하나를 들어 반박하시오. 이어서, 잣대에 조건 하나를 더 만든다면 (예: '틀렸을 때의 대가') 여섯 사례의 순위가 어떻게 달라질지 예측하시오.
📖 모범 답안

반박 예 — 아마존 이력서 심사 도구. 이 도구는 "과거 합격자와 비슷한 사람을 고르라"는 목표를 아주 잘 수행했습니다. 무너진 곳은 성능이 아니라 목표였고, 그 목표를 세운 것은 사람이었습니다. 기계가 사람을 대신한 것이 아니라, 사람이 정한 목표를 기계가 더 크고 빠르게 되풀이한 것입니다. 목표가 잘못되면 성능이 좋을수록 더 크게 틀립니다.

의료 영상 판독으로 답해도 좋습니다. AI는 놓치기 쉬운 곳을 먼저 표시하는 2차 판독자이고, 최종 진단과 설명 책임은 의사에게 있습니다. 지금의 인공지능은 모두 약한 AI이며, 정해진 목표 안에서만 똑똑합니다.

조건을 더한다면 — '틀렸을 때의 대가'를 클수록 감점으로 넣으면 의료 영상 판독의 순위가 내려갑니다. 놓친 병변의 대가가 사람 목숨이기 때문입니다. 반대로 기계 번역이나 단백질 구조 예측이 상대적으로 올라갑니다. 번역 오류는 다시 고칠 수 있고, 구조 예측은 어차피 실험으로 검증할 가설이기 때문입니다. 여기서 알 수 있는 것은, 순위는 사례의 성질이 아니라 우리가 고른 조건이 만든다는 사실입니다. 잣대를 바꾸면 답이 바뀝니다. 그래서 잣대를 먼저 밝히고 시작해야 합니다.

🔁 되돌아보기

오늘 우리는 사례 여섯을 세 조건과 다섯 기준이라는 같은 잣대에 올려 점수를 매기고 줄을 세웠고, 그 순위가 한 칸의 1점과 가중치 한 칸에 얼마나 쉽게 흔들리는지 직접 확인했습니다. 다음 시간에는 잣대를 잠시 내려놓고, 문제 자체를 컴퓨터가 다룰 수 있는 꼴로 적는 법을 배웁니다. 눈금 없는 물병 3L·5L로 4L를 만드는 문제를 상태 · 행동 · 목표 세 낱말로 바꿔, 컴퓨터가 길 찾기로 풀 수 있는 지도로 옮겨 적어 볼 거예요.

🔎

더 알아보기

오늘 표에 올린 사례 셋의 뒷이야기 — 규칙이 무너진 자리, 데이터가 쌓인 내력, 숫자가 속이는 자리

진공관 모듈 수백 개가 격자처럼 빼곡히 꽂힌 IBM 701 컴퓨터의 본체 틀, 전시장 안에 놓여 있다
역사

규칙 여섯 개로 시작한 기계 번역 — 사례 ②의 30년

1954년 미국 조지타운 대학과 IBM은 사진의 IBM 701로 러시아어 문장 60여 개를 영어로 옮기는 공개 시연을 했습니다. 기계에 넣은 것은 낱말 약 250개와 문법 규칙 여섯 개뿐이었어요. 미리 골라 둔 문장이라 결과가 매끄러웠고, 신문은 몇 년 안에 번역 문제가 풀릴 것처럼 보도했습니다.

그 뒤 10여 년 동안 연구비가 쏟아졌지만 규칙은 늘어날수록 서로 부딪혔습니다. 한 낱말이 여러 뜻을 가지는 중의성, 낱말 뜻을 더해도 나오지 않는 관용구 앞에서 규칙은 끝없이 예외를 불러냈지요. 1966년 미국 정부의 ALPAC 보고서는 기계 번역이 사람보다 느리고 덜 정확하며 비싸다고 결론 내렸고, 지원은 크게 줄었습니다.

물꼬를 바꾼 것은 규칙이 아니라 데이터였습니다. 1990년 무렵 IBM 연구진은 영어와 프랑스어로 함께 기록되는 캐나다 의회 회의록을 모아, 어떤 표현이 어떤 표현으로 옮겨지는지를 통계로 배우게 했습니다. 2016년에는 구글 번역이 신경망 번역으로 바뀌었습니다. 오늘 사례 ②의 '데이터' 칸에 국제기구 회의록이 적힌 까닭이 여기 있습니다 — 세 조건 ③(규칙으로 적기 어렵다)을 증명한 것이 바로 이 30년의 실패였습니다.

사진: IBM 701 본체 틀(1952년경, 진공관 모듈) · 출처: Dan, Wikimedia Commons (CC BY-SA 2.0)

분홍빛 배경 위에 떠 있는, 여러 면이 반듯하게 깎인 육각형 모양의 라이소자임 단백질 결정 한 알
원리 더 깊이

데이터 한 줄에 몇 달 — 단백질 구조 데이터베이스가 쌓인 내력

사례 ⑤의 데이터 칸에는 'PDB에 쌓아 둔 십수만 개의 구조'라고 적었습니다. 이 한 줄 뒤에는 긴 실험이 있습니다. 단백질의 모양을 실험으로 알아내는 대표적인 방법은 X선 결정학입니다. 먼저 단백질 분자를 사진 속 알갱이처럼 반듯한 결정으로 키우고, 거기에 X선을 쏘아 생긴 무늬로부터 원자의 자리를 거꾸로 계산해 냅니다. 결정이 잘 자라지 않는 단백질은 이 첫 단계에서 몇 달, 몇 해씩 막히기도 합니다.

사진의 라이소자임은 달걀흰자에 들어 있는 효소로, 결정이 잘 자라서 연습용으로 널리 쓰입니다. 1965년에는 X선으로 구조가 밝혀진 첫 효소가 되었지요. 1971년 문을 연 PDB에는 이렇게 한 구조씩 밝혀진 결과가 반세기 동안 쌓였습니다.

2020년 단백질 구조 예측 대회 CASP에서 딥마인드의 알파폴드 2는 많은 단백질에서 실험에 견줄 만한 예측을 내놓았고, 그 공로로 데미스 허사비스와 존 점퍼는 2024년 노벨 화학상을 받았습니다. 그런데 알파폴드가 배운 교과서가 바로 이 PDB입니다. 세 조건 ②를 채운 것은 알고리즘이 아니라 수십 년 동안 결정을 키운 사람들이었습니다. 그리고 예측이 나온 뒤에도 중요한 구조는 다시 실험으로 확인합니다 — 사례 ⑤의 '사람의 역할' 칸이 말하는 그대로요.

사진: 현미경으로 본 라이소자임 단백질 결정 · 출처: Mathias Klode, Wikimedia Commons (CC BY-SA 3.0)

가상 결제 1,000건 · 점 하나가 한 건 정상 990건 사기 10건 사기는 1% — 찾기 어렵다 모형 A · 전부 '정상' 정확도 99.0% 잡은 사기 0 / 10 아무것도 안 했다 모형 B · 30건을 '의심' 정확도 97.6% 잡은 사기 8 / 10 정상 22건을 잘못 막음
오해 바로잡기

정확도 99%인데 쓸모가 없다 — 사례 ③의 '조심할 점'을 숫자로

사례 ③에서 "'전부 정상'이라고만 답해도 정확도 99%가 나온다"고 적었습니다. 그림은 그 말을 예로 든 숫자로 옮긴 것입니다. 결제 1,000건 가운데 사기가 10건이면, 아무것도 하지 않는 모형 A도 990건을 맞혀 정확도 99.0%를 받습니다. 그러나 잡아낸 사기는 한 건도 없습니다.

모형 B는 30건을 의심 거래로 표시했고, 그중 8건이 진짜 사기였습니다. 정상 거래 22건을 잘못 막았으니 맞힌 것은 8 + 968 = 976건, 정확도는 97.6%로 오히려 낮습니다. 그래도 쓸모 있는 쪽은 분명히 B입니다. 이렇게 드문 것을 찾는 문제에서는 진짜 사기 가운데 몇 건을 잡았는가(재현율, 여기서는 8/10)와 의심으로 표시한 것 가운데 몇 건이 진짜였는가(정밀도, 여기서는 8/30)를 따로 봅니다.

둘은 서로 당깁니다. 더 많이 표시하면 사기를 더 잡지만 결제를 거절당하는 고객도 늘어납니다. 어디서 멈출지, 곧 문턱을 정하는 일은 계산이 아니라 '고객 불편과 사기 피해 중 무엇을 더 무겁게 볼 것인가'라는 판단이라서 사례 ③의 '사람의 역할' 칸에 들어갔습니다. 이 두 잣대는 Ⅱ단원에서 모형을 평가할 때 다시 만납니다.