喜马拉雅面试题更新 2026-08-05

GPT模型对输入文本是如何进行编码和分词的?

喜马拉雅人工智能互联网/IT问题拆解技术原理

考察说明

考察对LLM输入预处理流程(tokenization)的理解

回答思路

  1. 明确LLM输入需要先分词成token
  2. 说明采用BPE等子词切分算法及其优点
  3. 能够解释token与字符、词的关系及对长度和成本的影响