시험지를 다시 만든 연구 — 젠더 셰이즈(Gender Shades)
본문 사례 ②의 연구를 한 사람은 MIT 미디어랩의 대학원생이던 조이 부올람위니(Joy Buolamwini)입니다. 얼굴을 따라가는 프로그램을 만들다가, 카메라가 자기 얼굴은 잘 잡지 못하는데 흰 가면을 쓰자 곧바로 잡는 것을 겪은 것이 시작이었다고 합니다.
그가 먼저 부딪힌 벽은 시험지였습니다. 당시 얼굴 인식 성능을 재던 공개 자료는 대부분 밝은 피부의 얼굴이어서, 그 자료로 재면 어두운 피부에서의 실패가 전체 숫자에 거의 드러나지 않았습니다 — 오늘 본 85.0%와 같은 구조예요. 그래서 팀닛 게브루(Timnit Gebru)와 함께 아프리카 세 나라와 북유럽 세 나라의 국회의원 얼굴 1,270장으로 피부색과 성별이 고르게 섞인 시험지를 새로 만들었습니다. 우리가 시험지를 밝은 털 500장 · 어두운 털 500장으로 일부러 반반 만든 것과 같은 이유입니다.
2018년에 발표된 결과가 본문의 그 숫자입니다. 밝은 피부 남성에서는 세 회사 제품 모두 오류율이 1% 아래였고, 어두운 피부 여성에서는 가장 나쁜 제품이 셋에 하나 넘게 틀렸습니다. 이듬해 같은 방법으로 다시 재어 보니 세 회사 모두 격차를 크게 줄인 새 버전을 내놓은 뒤였습니다. 갈라 재서 공개한 것만으로 제품이 바뀐 것입니다. 사진은 그가 세운 단체 알고리즘 정의 연맹(AJL)을 소개하던 2018년 위키매니아(남아프리카공화국 케이프타운) 발표 장면입니다.
사진: 위키매니아 2018에서 발표하는 조이 부올람위니 · 출처: Rainer Halama, Wikimedia Commons (CC BY-SA 4.0)