
分词器是自然语言处理中将文本拆分为Token的核心组件 ,也是文本预处理的关键步骤 。Token是模型处理文本的最小单位,分词是将连续文本切分为有意义的单元(如单词、子词或字符)的关键预处理步骤 。主流的分词粒度包括基于词、字和subword,其中基于subword的BPE、WordPiece、Unigram等方法已成为主流 。
在发展过程中,2024年5月的研究开始关注分词器中故障token的检测问题 。2025年9月25日,Ollama v0.12.2版本支持了Multi-Regex分词器以处理复杂规则 。Transformers v5版本对分词器系统进行了重构,实现了架构与参数的分离 。同时,研究界也在探索端到端的无分词器模型等新范式,例如2025年提出的AU-Net系统以及H-Net模型 。
想要了解更多“分词器”的信息,请点击:分词器百科
