단어 맞히기
생성형 AI를 이해하는 가장 빠른 길은 스마트폰 키보드에서 시작합니다. "오늘 저녁에"까지 입력하면 키보드 위에 "뭐", "만나", "먹을까" 같은 다음 단어 후보가 뜹니다. 여러분이 지금까지 쓴 글을 바탕으로 다음에 올 말을 추측하는 기능입니다. 생성형 AI는 이 자동완성을 극단까지 밀어붙인 것에 가깝습니다. 단어 하나를 추천하는 데서 멈추지 않고, 그 추측을 수천 번 수만 번 이어 붙여서 문장을 만들고, 문서를 만들고, 같은 원리로 그림과 영상까지 만들어냅니다.
생성형 AI(Generative AI): 글, 그림, 영상, 음성 같은 콘텐츠를 새로 만들어내는(generate) 인공지능을 말합니다.
이 책에서는 글을 만드는 AI, 그러니까 ChatGPT나 Claude처럼 대화하는 도구를 중심으로 설명합니다. 가장 많이 쓰이기도 하고, 글을 만드는 원리만 이해하면 그림과 영상을 만드는 AI도 같은 뼈대 위에 있다는 것을 알게 되기 때문입니다.
그렇다면 "다음에 올 말을 추측한다"는 것은 정확히 어떤 일일까요. 이번 절에서 그 장면을 처음부터 끝까지 눈으로 보겠습니다.
1. 다음 단어 맞히기 게임
글을 만드는 AI는 인터넷의 방대한 글을 읽으며 단 한 가지를 연습합니다. "지금까지의 문장 다음에 올 단어 맞히기"입니다.
예를 들어 "오늘 점심은"이라는 문장이 주어지면, 모델의 머릿속에는 다음에 올 단어 후보가 확률과 함께 줄을 섭니다.
말로만 들으면 실감이 나지 않으니, 이 과정을 통째로 눈으로 볼 수 있는 시뮬레이터의 첫 페이지를 열겠습니다. 문장이 조각으로 잘리고, 숫자로 바뀌고, 계산을 거쳐 다음 단어가 확률로 예측되는 전 과정을 애니메이션으로 보여줍니다.

접속 직후의 화면입니다. 왼쪽부터 입력 문장, 인공 신경망, 다음 단어 확률 순으로, 글이 만들어지는 방향 그대로 패널이 놓여 있습니다.
순서대로 따라해 보세요.
- 화면 아래 조작부에서
자동 재생을 클릭합니다. 기본 문장은 영화 타짜의 명대사 "싸늘하다, 가슴에 비수가 날아와"입니다. 일단 문장이 완성될 때까지 구경만 해보세요. - 끝나면
처음부터를 누르고, 이번에는한 단계씩버튼으로 천천히 진행합니다. 단어 하나가 만들어질 때마다 다섯 단계를 거칩니다. 문장을 조각으로 자르고, 조각을 숫자로 바꾸고, 신경망이 계산하고, 다음 단어 후보의 확률을 구하고, 그중 하나를 뽑습니다. 단계마다 관련 패널 위에 설명 팝업이 뜨니 하나씩 읽으며 넘어가세요. - 확률 계산 단계에서 잠깐 멈추고 오른쪽 패널을 봐주세요. AI는 정답 하나를 말하지 않습니다. 후보들이 확률을 나눠 갖고 있습니다.

"싸늘하다 가슴에 비수가 날아와" 다음에 올 후보들입니다. "꽂힌다"가 72%로 1등이지만 "손은", "타짜" 같은 후보도 확률을 나눠 갖고 있습니다.
- 한 단계 더 진행하면 단어 뽑기가 시작됩니다. 후보 위를 도는 하이라이트가 점점 느려지다가 한 곳에 멈춥니다. 말 그대로 추첨입니다.

룰렛이 "꽂힌다"에 멈췄습니다. 가운데 패널 아래에는 이 단어 하나를 만드는 데 든 계산 횟수가 표시됩니다. 겨우 다이얼 315개짜리 교육용 모형인데도 10억 번이 넘습니다.
- 뽑힌 단어는 문장 끝에 붙고, 늘어난 문장 전체가 다시 1단계부터 같은 과정을 거칩니다. 이 반복은 '(문장 끝)'이라는 특별한 후보가 뽑힐 때까지 이어집니다. 답이 언제 끝날지조차 확률로 정해진다는 뜻입니다.
2. 모델은 함수다
시뮬레이터에서 본 것을 정리하면 이렇습니다. 방금 화면에서 돌아간 것은 '문장을 넣으면 다음 단어 하나가 나오는 함수'입니다. 이 함수를 모델(Model)이라고 부릅니다. ChatGPT의 GPT, Claude, Gemini 같은 이름들이 전부 이 모델을 가리키는 말입니다.
여러분이 실제 서비스에서 "오늘 점심 뭐 먹을까?"라고 물었을 때 벌어지는 일을 순서대로 따라가 보겠습니다.
- 함수에 "오늘 점심 뭐 먹을까?"가 들어갑니다. "오늘"이 나옵니다.
- 함수에 "오늘 점심 뭐 먹을까? 오늘"이 들어갑니다. "점심"이 나옵니다.
- 함수에 "오늘 점심 뭐 먹을까? 오늘 점심"이 들어갑니다. "떡볶이"가 나옵니다.
- 함수에 "오늘 점심 뭐 먹을까? 오늘 점심 떡볶이"가 들어갑니다. "드세요"가 나옵니다.
- 함수에 "오늘 점심 뭐 먹을까? 오늘 점심 떡볶이 드세요"가 들어갑니다. '여기서 답변 끝'이라는 신호가 나옵니다.
방금 만든 단어를 문장 끝에 붙인 다음, 그 문장 전체가 다시 함수에 들어갑니다. 모델 입장에서는 여러분의 질문과 자기가 지금까지 만든 답변이 구분되지 않습니다. 그저 매번 "지금까지의 문장 전체"를 처음부터 다시 읽고, 다음 단어 하나를 확률로 고를 뿐입니다.
이 반복이 수백 번, 수천 번 이어진 결과물이 여러분이 채팅창에서 받는 답변입니다. ChatGPT의 답변이 타자를 치듯 한 단어씩 흘러나오는 것을 보신 적 있을 겁니다. 그건 보여주기용 연출이 아니라, 정말로 그 순간 단어 하나가 함수를 통과해서 막 만들어졌기 때문입니다.
한 가지 미리 눈치챌 수 있는 사실이 있습니다. 함수는 들어온 문장을 읽고 다음 단어를 내놓을 뿐, 지나간 대화를 어딘가에 저장해 두지 않습니다. 그런데도 채팅에서 맥락이 이어지는 데는 따로 비밀이 있는데, '대화의 비밀' 절에서 다룹니다.
3. 왜 같은 질문에 다른 답이 나올까
생성형 AI를 쓰다 보면 누구나 겪는 일이 있습니다. 같은 질문을 두 번 하면 다른 답이 나옵니다. 방금 룰렛에서 봤듯, 모델이 항상 1등 후보만 고르지는 않기 때문입니다. 시뮬레이터에서 처음부터를 누르고 몇 번 다시 재생해 보세요. 어느 판에서는 "꽂힌다" 대신 12%짜리 "손은"이 뽑히고, 그 순간 문장은 "손은 눈보다 빠르다"라는 전혀 다른 방향으로 흘러갑니다. 첫 단어 하나가 달라지면 그 뒤 문장 전체가 달라집니다. 같은 질문에 매번 조금씩 다른 답이 나오는 이유입니다.
일부러 주사위를 섞는 데는 이유가 있습니다. 항상 1등 단어만 고르면 답변이 기계적이고 단조로워지기 때문입니다. 개발자들은 이 모험의 정도를 조절하는 손잡이를 온도(temperature)라고 부릅니다. 이것도 직접 확인해 보겠습니다. 한 단계씩을 눌러 확률 막대가 떠 있는 상태에서, 조작부의 '온도(창의성)' 슬라이더를 양 끝으로 움직여 보세요. 막대가 실시간으로 변합니다.

온도를 0.2까지 내리면 1등 후보가 확률을 사실상 독차지합니다. 매번 같은 답이 나오는 안정적인 상태입니다.

온도를 2.0까지 올리면 1등의 확률이 깎여서 낮은 후보들에게 나눠집니다. 어떤 단어든 뽑힐 수 있으니 창의적이지만, 가끔 엉뚱한 답이 나옵니다.
온도를 올린다고 확률이 전부 커지는 것이 아닙니다. 확률의 합은 언제나 100%라서, 1등 것을 깎아 나머지에 나눠주는 방식입니다. 찌그러진 주사위가 점점 공정한 주사위에 가까워진다고 생각하면 정확합니다.
4. 수식 딱 한 줄
이 책에서 수식은 단 한 줄만 나옵니다. 지금까지 시뮬레이터로 확인한 내용을 기호로 적으면 이렇게 됩니다.
P(다음 단어 | 지금까지의 문장)
읽는 법만 알면 어렵지 않습니다. P는 확률(Probability)이고, 가운데 세로선 |은 "~가 주어졌을 때"라는 뜻입니다. 그래서 전체를 풀어 읽으면 "지금까지의 문장이 주어졌을 때, 다음 단어가 올 확률"입니다. 생성형 AI가 하는 일의 전부가 이 한 줄에 들어 있습니다. 그리고 학습이란 방대한 글을 읽으며 이 확률을 실제 세상의 글과 비슷해지도록 조금씩 조정하는 과정입니다. 이 이야기는 '학습의 비밀' 절에서 직접 확인합니다.
이 확률 계산을 실제로 수행하는 장치가 인공 신경망입니다. 시뮬레이터 가운데 패널에서 본, 다이얼이 가득한 판들의 스택이 바로 이것을 그린 것입니다. 사람 뇌의 신경세포(뉴런)가 서로 연결된 구조를 본떠 만들었습니다.

복잡해 보이지만 시작은 소박합니다. 가장 단순한 형태는 학교에서 배운 y = ax + b, 직선 하나입니다.
가장 작은 신경망입니다. 입력이 선을 지날 때 숫자 w를 곱하고, 도착해서 숫자 b를 더합니다. 사람이 조절할 수 있는 숫자는 w와 b, 딱 2개입니다.
직선 하나로는 단순한 것밖에 예측하지 못합니다. 그래서 이 수식을 층층이 쌓고 그물처럼 엮습니다.
선 하나마다 곱하는 숫자 w가 붙고, 신호가 도착하는 동그라미마다 더하는 숫자 b가 붙습니다. 선 6개와 동그라미 3개, 조절할 숫자가 9개로 늘었습니다. 이렇게 규모를 키우면 훨씬 복잡한 패턴도 잡아낼 수 있게 됩니다.
이 조절할 숫자 하나하나, 그러니까 시뮬레이터에서 본 다이얼 하나가 파라미터(parameter)입니다. 사람이 값을 정해주는 것이 아니라, 모델이 방대한 글을 읽으면서 스스로 맞춰 놓은 눈금입니다. 다이얼이 많을수록 더 섬세한 패턴을 담아둘 수 있습니다.
시뮬레이터의 모형은 다이얼이 315개였습니다. 실제 모델은 몇 개일까요. 숫자가 워낙 커서 감이 오지 않으니 사람 뇌와 나란히 놓아 보겠습니다.
사람 뇌에는 신경세포가 약 1,000억 개 있고, 이 세포들은 서로 손을 맞잡듯 이어져 신호를 주고받습니다. 이때 맞닿는 지점을 시냅스(synapse)라고 부릅니다. 앞의 신경세포 그림에서 축삭말단이 옆 세포의 가지돌기에 닿는 자리가 시냅스입니다. 이 지점이 신호를 얼마나 세게 넘길지 정하기 때문에, 신경망에서 선마다 붙은 숫자 w와 하는 일이 닮았습니다. 사람 뇌의 시냅스는 대략 100조 개로 추정합니다.
| 모델 | 파라미터(다이얼) 수 | 사람 뇌 시냅스 100조 개 대비 |
|---|---|---|
| 시뮬레이터의 교육용 모형 | 315개 | 사실상 0% |
| GPT-1 (2018년) | 1억 2천만 개 | 0.0001% |
| GPT-2 (2019년) | 15억 개 | 0.0015% |
| GPT-3 (2020년) | 1,750억 개 | 0.18% |
| GPT-4 (2023년, 추정치) | 약 1조 8천억 개 | 약 1.8% |
| Kimi K3 (2026년) | 약 2조 8천억 개 | 약 2.8% |
세상을 놀라게 한 GPT-4도, 그 뒤로 3년이 더 지나 나온 Kimi K3도 사람 뇌의 3%에 못 미칩니다. 다만 이 표는 크기 감각을 잡기 위한 어림입니다. 파라미터와 시냅스는 하는 일이 달라서 1대 1로 견줄 수 있는 값이 아니고, GPT-4의 파라미터 수는 OpenAI가 공식으로 밝힌 적 없는 업계 추정치입니다.
표의 마지막 줄에 갑자기 낯선 이름이 등장한 이유는 이렇습니다. GPT-4 이후로 주요 회사들은 파라미터 수를 아예 공개하지 않습니다. 반면 Kimi K3는 중국 문샷 AI가 2026년 7월에 모델 자체를 통째로 공개한 오픈 웨이트(open weight) 모델이라, 누구나 크기를 확인할 수 있습니다. 요즘 모델의 규모를 가늠할 때 이런 공개 모델이 기준점 노릇을 하는 셈입니다.
다이얼이 많다고 항상 더 똑똑한 것은 아닙니다. 최근에는 파라미터가 훨씬 적어도 잘 훈련된 모델이 큰 모델을 앞서는 경우가 흔합니다. Kimi K3만 해도 규모는 가장 크지만, 만든 회사조차 전체 성능은 다른 상위 모델들에 못 미친다고 밝혔습니다. 게다가 요즘 큰 모델은 다이얼을 한꺼번에 다 쓰지도 않습니다. 다이얼 뭉치를 여러 덩어리로 나눠 두고 질문마다 그중 일부만 꺼내 씁니다. 파라미터 수는 성능표가 아니라 규모를 나타내는 숫자로만 봐주세요.
결국 여러분이 받는 답변은 이해도 기억도 아닌, 거대한 수식이 토해낸 확률 계산의 결과입니다.
그런데 시뮬레이션의 첫 단계가 "문장을 조각으로 자르기"였던 것을 기억하시나요. 지나가듯 본 이 단계에 생각보다 많은 비밀이 숨어 있습니다. 다음 절에서 그 조각 이야기를 하겠습니다.
- 보기 좋은 영상: https://youtu.be/HnvitMTkXro