본문 바로가기

모델의 비밀

"제일 좋은 모델 하나만 쓰면 되지 않나?"라는 생각이 들 법한데, 실제로는 한 회사가 크기가 다른 모델을 여러 개 나란히 내놓습니다. Claude를 만드는 Anthropic만 해도 작고 빠른 Haiku부터 중간 크기의 Sonnet, 큰 Opus와 Fable까지 한 식구를 이루고 있습니다. 왜 하나로 통일하지 않는 걸까요. 시뮬레이터의 '모델의 비밀' 페이지에 답이 있습니다.

1. 가격은 10배까지 벌어진다

모델별 입력과 출력 토큰 가격

먼저 가격입니다. AI 회사는 토큰의 비밀에서 본 그 토큰 수로 요금을 매기는데, 같은 회사의 모델인데도 100만 토큰당 가격이 최대 10배까지 벌어집니다. 그리고 어느 모델이든 출력이 입력보다 5배 비쌉니다. 입력은 한꺼번에 읽지만, 답을 만들 때는 단어 맞히기에서 봤듯 토큰 하나를 뽑을 때마다 전체 계산을 다시 해야 하기 때문입니다.

2. 성능은 2배 남짓, 속도는 반대로

모델별 성능 지수와 상대 속도

그런데 가격이 10배라고 성능도 10배는 아닙니다. 종합 성능 지수는 30점에서 63점으로 2.1배 차이입니다. 게다가 가장 비싼 Fable 5(62점)는 절반 값인 Opus 5(63점)보다 점수가 낮습니다. 비싼 모델이 곧 1등은 아닌 셈입니다. 대신 작은 모델은 답이 훨씬 빨리 나옵니다. 이유는 앞에서 배운 다이얼, 그러니까 파라미터에 있습니다. 토큰 하나를 만들 때마다 파라미터를 거의 전부 곱하고 더해야 하니, 파라미터가 10배 많으면 계산도 대략 10배 늘어납니다. 계산이 많으면 느려지고, 계산 장치(GPU)를 오래 붙잡으니 비싸집니다. 속도와 가격은 계산량이라는 같은 뿌리에서 나오는 셈입니다.

3. 딱 맞는 모델 고르기

그래서 모델 고르기는 무조건 큰 것을 잡는 일이 아니라 작업과의 궁합을 맞추는 일이 됩니다. 페이지 아래의 '작업에 맞는 모델 고르기'에서 작업 버튼을 하나씩 눌러 보세요.

작업에 맞는 모델 고르기

맞춤법 고치기라면 가장 작은 모델로도 충분해서, 가장 큰 모델 대신 쓰면 비용을 약 90% 아끼면서 답도 더 빨리 받습니다. 반대로 자료 조사부터 정리까지 여러 단계를 혼자 처리하는 긴 자동화 작업은 가장 큰 모델급 성능이 있어야 결과가 쓸 만해집니다. 가장 비싼 모델이 아니라 딱 맞는 모델을 고르는 것, 개발자들이 비용과 속도를 아끼는 방법입니다.

그렇다면 사람들은 이 모델들로 실제로 어떤 일을 시키고 있을까요. 마지막 절에서 실제 사용 데이터를 들여다보겠습니다.