分词器
分词器是自然语言处理中将文本拆分为Token的核心组件,也是文本预处理的关键步骤。Token是模型处理文本的最小单位,分词是将连续文本切分为有意义的单元(如单词、子词或字符)的关键预处理步骤。主流的分词粒度包括基于词、字和subword,其中基于subword的BPE、WordPiece、Unigram等方法已成为主流。在发展过程中,2024年5月的研究开始关注分词器中故障token的检测问题。2025年9月25日,Ollama v0.12.2版本支持了Multi-Regex
