中文文本中词与词之间没有天然分隔,分词因此成为机器理解中文的基石。无论做搜索引擎、智能客服还是舆情分析,分词质量都直接决定上层应用的效果上限。当前主流分词方案可分为词典匹配、统计建模、深度学习及混合策略四大类,各有优劣,适配不同业务场景。
这是最经典也最容易理解的分词方式。核心思路是维护一个尽可能完整的词库,然后让待切分文本与词库进行字符串匹配。匹配到的词条即作为一次切分结果。依据扫描方向不同,常见细分实现有三种:正向最大匹配、逆向最大匹配以及双向最大匹配。
正向最大匹配从文本开头向末尾推进,优先尝试匹配词库中最长的词。处理“武汉市长江大桥”时,它倾向于先命中“武汉市”而非“武汉”,最终得到“武汉市/长江大桥”。逆向最大匹配则从末尾逆向扫描,在应对某些以动词收尾的歧义结构时往往更准确。双向最大匹配同时运行正逆两遍,若结果不一致,则借助词频统计或词长规则择优输出。
避坑建议:词典法的优势在于无需标注数据,启动成本低、执行速度快。但词库必须动态维护。尤其在医疗、法律、电商等垂直行业,新术语和爆款商品名若不及时入库,分词精度会快速下滑,需要建立常态化的词表更新机制。
统计方法不依赖预先整理的完整词表,而是从大规模语料中自动学习字与字之间的组合规律。其中以隐马尔可夫模型(HMM)和条件随机场(CRF)应用最广。
HMM将分词建模为序列标注问题:为每个汉字标注位置状态,常见方案是四标签体系,即词首、词中、词尾以及单字成词。随后利用维特比算法求出全局概率最高的状态序列。新词只要在语料中出现频次够高,HMM就能依据转移概率发现它,因此具备一定的新词识别能力。
CRF比HMM更进一步,它允许模型显式引入相邻标签间的复杂依赖关系,而非简单假设独立性。这让CRF在词边界模糊的场景下准确率更高。相应代价是训练与推理成本增加,且对训练语料与目标领域的匹配度更敏感。
选型参考:语料规模有限且需要快速上线时,优先尝试HMM;若储备了高质量的领域标注数据且追求准确率,CRF更值得投入。
深度学习近期已占据分词研究的主流位置。双向长短期记忆网络(BiLSTM)与预训练语言模型是两类代表。BiLSTM通过双向循环结构同时读取前后双向的语境信息,在处理较长距离的上下文依赖时显著优于传统统计模型。
以BERT、RoBERTa为代表的预训练模型,通过在海量无标注文本上自监督学习,获得丰富的通用语义表示。做具体分词时,仅在模型顶层接入一个序列标注分类器做微调,便能在多个公开基准上刷新最优分数。
这类方案能利用深层语境消歧。例如“乒乓球拍卖完了”,语义模型能结合“拍卖”与“完了”的搭配,切分为“乒乓球/拍卖/完了”,避免误判为“乒乓球拍/卖完了”。此类语义理解能力,是词典法或统计法难以企及的。
注意其短板:模型参数量达数亿级,对GPU算力要求高,离线推理延迟偏大。在低延迟高并发的线上场景,通常需要知识蒸馏、模型量化或配合缓存策略来缓解性能压力。
真实工业环境中,没有任何单一方法能覆盖所有需求。多数成熟系统采用词典、统计与深度学习相结合的混合架构。其中常见的配合模式有两种。
第一种是词典兜底加模型纠错。默认走基于词典的最大匹配以保证速度,对连续单字或未登录词片段再交给深度模型二次识别,从而兼顾效率与准召。
第二种是模型主切加词典强制。先由神经网络模型产出初步结果,再用业务词库强制纠正重要专有名词的切分,确保品牌词与专业术语不被拆散。
选型判断依据可围绕三点展开:一是数据资源,是否具备领域标注语料;二是性能预算,线上接口允许的响应时间与并发量;三是维护成本,词库能否得到持续更新的运营投入。短文本任务如电商搜索词可侧重深度模型,长文本抓取与索引类任务则常用词典加HMM组合以控制成本。
不能。词典法本身只负责匹配已有词条,不具备学习能力。要识别新词,必须配合统计模型或定期人工整理未收录词表。实践中常用统计候选挖掘工具辅助扩充词库。
通常在公开通用语料上准确率更高,但在垂直领域未必占优。若领域训练数据量小且标注质量不高,经过良好调参的CRF往往不比大模型差,且资源消耗低得多。数据质量仍是决定效果的第一要素。
常见做法是分级处理:普通流量走词典加统计的轻量链路,对高价值或高歧义语句再走深度学习模型精排。同时可对高频查询建立结果缓存,显著降低重复计算开销。
分词方法的选择没有绝对最优解,而是基于数据的可获得性、算力预算与业务目标进行权衡。若从零起步,推荐先用词典法快速搭建基线,再逐步引入统计模型提升未登录词召回,最后在关键路径上补充深度模型加持语义消歧。无论采用何种方案,都应建立分词结果的抽样评测机制,定期用真实业务语料验证效果,避免上线后质量劣化而不自知。