대규모 언어모델(LLM)의 핵심 전처리 과정인 토큰화(tokenization)에서 '토큰 경계(token boundary)' 설정이 데이터 압축 효율과 모델 예측 성능에 미치는 숨겨진 비용이 처음으로 정량화되었습니다. 기존에는 토크나이저(tokenizer)들을 동일한 경계 조건에서만 비교했기 때문에, 경계 자체가 야기하는 압축 비용은 간과되어 왔습니다. 이 연구는 정규 표현식(regular-expression) 기반의 경계 규칙이 토큰 수에 미치는 영향을 측정하여, 토큰 경계가 모델 효율성에 중요한 요소임을 밝혀냈습니다.
유하오 두(Yuhao Du)와 슈니안 첸(Shunian Chen) 연구팀은 토큰 경계 규칙이 최적 토큰 수를 28.3%에서 36.8%까지 증가시킨다는 사실을 잉글리시 위키피디아(English Wikipedia) 데이터를 통해 확인했습니다. 이는 토큰 경계가 데이터 압축에 상당한 '비용'을 발생시킨다는 것을 의미합니다. 또한, 바이트 쌍 인코딩(Byte Pair Encoding, BPE) 방식은 제약 없는 최적 토큰 수보다 10.9% 더 많은 토큰을 사용하며, 이는 토큰 경계로 인한 비효율성을 보여줍니다. 흥미롭게도, 데이터 압축에 유리한 사전과 예측에 유리한 사전이 서로 다르다는 점도 발견되었습니다. 8,500만 개의 비임베딩(non-embedding) 파라미터를 가진 모델을 동일한 훈련 토큰 예산으로 학습시켰을 때, 제약 없는 토큰화 방식이 12개 언어 중 11개 언어에서 더 높은 예측 성능(held-out bits per byte)을 보였습니다.
이 연구는 토큰 경계가 단순히 텍스트를 나누는 규칙을 넘어, 모델의 압축 효율성과 궁극적인 예측 성능에 직접적인 영향을 미치는 중요한 변수임을 입증했습니다. 이는 대규모 언어모델을 개발하고 최적화하는 과정에서 토큰화 전략을 더욱 신중하게 고려해야 함을 시사합니다. 특히, '경계 라이선스(boundary licences)'라는 새로운 개념을 도입하여 어휘 예산의 일부(예: 10%)만 경계를 넘도록 허용했을 때, 모든 경계를 제거했을 때 얻는 토큰 수 감소 효과의 85.2%(영어) 및 100.0%(중국어)를 회복할 수 있음을 보여주었습니다. 이는 토큰 경계의 유연성을 통해 압축 효율과 예측 성능 사이의 균형점을 찾을 수 있음을 의미하며, 향후 LLM 개발에 있어 더욱 정교한 토큰화 기법의 필요성을 강조합니다.
