컴퓨터 없이 만든 바이그램 — 마르코프와 섀넌
'앞의 것 하나만 보고 다음 것을 정한다'는 생각은 오늘날의 인공지능보다 훨씬 오래되었습니다. 1913년 러시아 수학자 안드레이 마르코프는 푸시킨의 운문 소설 『예브게니 오네긴』의 처음 2만 글자를 손으로 세어, 모음 다음과 자음 다음에 모음이 올 확률이 서로 다르다는 것을 보였습니다. 바로 앞 하나에 따라 다음이 정해지는 이런 모형을 지금도 그의 이름을 따 마르코프 연쇄라고 부릅니다. 오늘 만든 바이그램이 바로 그것입니다.
1948년, 사진의 클로드 섀넌은 정보 이론을 연 논문 「통신의 수학적 이론」에서 영어를 흉내 낸 글을 단계별로 만들어 보였습니다. 글자를 아무렇게나 늘어놓는 단계에서 시작해, 글자의 빈도를 따르고, 앞 글자를 보고, 마지막에는 낱말 단위로 앞 낱말을 보는 단계까지 올라갔지요. 컴퓨터가 없던 때라 방법은 손이었습니다 — 책을 아무 쪽이나 펴서 지금 낱말을 찾고, 그 바로 뒤 낱말을 적고, 다시 다른 쪽을 펴서 그 낱말을 찾는 식이었어요. 책 한 권을 말뭉치로 삼아 random.choice 를 손으로 한 셈입니다.
결과도 오늘 우리가 본 것과 닮았습니다. 짧은 토막은 영어처럼 읽히는데 문장 전체에는 뜻이 없었어요. 섀넌이 알고 싶었던 것은 글짓기가 아니라 영어가 얼마나 예측 가능한가였습니다. 다음 낱말을 잘 맞힐 수 있을수록 글을 더 적은 신호로 보낼 수 있기 때문입니다. '다음 낱말 맞히기'는 처음부터 정보를 재는 방법이었던 셈입니다.
사진: 클로드 섀넌 · 출처: 작자 미상(스웨덴 Tekniska museet 소장), Wikimedia Commons (CC BY 2.0)