본문 바로가기

토큰의 비밀

앞 절 시뮬레이션의 첫 단계는 "문장을 조각으로 자르기"였습니다. 이 조각을 토큰(token)이라고 부릅니다. AI는 글자를 한 자씩 읽지 않습니다. 문장을 토큰으로 자르고, 각 토큰을 어휘표의 번호로 바꿔서, 그 번호만 주고받습니다. 이번 절에서는 이 조각 하나가 만들어내는 의외의 현상들을 직접 확인해 보겠습니다.

1. 문장을 잘라 보기

시뮬레이터의 '토큰의 비밀' 페이지에서 직접 잘라볼 수 있습니다.

접속해서 입력창에 아무 문장이나 넣고 잘라 보기를 클릭해 보세요.

토크나이저 놀이터

"오늘 점심은 김치찌개 먹을까?"를 잘라 본 결과입니다. 글자 13개가 토큰 8개가 되었고, 조각마다 어휘표 번호가 붙었습니다. 모델에게 실제로 도착하는 것은 글자가 아니라 이 번호들뿐입니다.

2. strawberry의 r은 몇 개인가

이 구조 때문에 생기는 유명한 사고가 있습니다. "strawberry에 r이 몇 개야?"라고 물으면 AI가 자주 틀린다는 이야기, 들어보셨을지 모르겠습니다. 같은 페이지를 아래로 내리면 그 이유가 나옵니다. 그래서 "r이 몇 개야?"라고 물으면? 버튼도 눌러 보세요.

strawberry 실험

사람은 글자 10개를 보니 r이 3개라는 것이 한눈에 보입니다. 그런데 AI가 받는 것은 st, raw, berry라는 번호 3개입니다. 번호 안에 글자가 몇 개 들었는지는 보이지 않으니, 글자 세기는 기억에 의존한 추측이 됩니다. 바코드 숫자만 보여주고 "상품 이름에 ㄹ이 몇 번 들어가?"라고 묻는 것과 비슷합니다. AI가 못 배운 것이 아니라, 애초에 글자가 안 보이는 구조인 것입니다.

3. 한국어는 조금 더 비싸다

페이지 맨 아래에는 한 가지 비교가 더 있습니다.

한국어와 영어의 토큰 수 비교

"나는 학교에 간다"는 6토큰인데 같은 뜻의 "I go to school"은 4토큰입니다. 어휘표가 영어 중심의 데이터로 만들어져서, 영어 단어는 통째로 들어가고 한국어는 더 잘게 잘리기 때문입니다.

토큰 수를 왜 신경 써야 할까요. AI 사용 요금이 토큰 단위로 계산되고, 대화가 감당할 수 있는 길이의 한계도 토큰으로 잽니다. 같은 질문이라도 한국어가 조금 더 비싸고 대화창도 더 빨리 무거워지는 이유입니다. 요금 이야기는 '모델의 비밀' 절에서, 대화 길이의 한계는 '대화의 비밀' 절에서 다시 나옵니다.

여기까지가 확률 기계의 재료 이야기였습니다. 다음 절에서는 이 기계가 일으키는 가장 유명한 사고, 그럴듯한 거짓말을 다룹니다.