作者:互联网 时间: 2026-09-03 12:41:55
如果只是逐项记功能,分词不只靠最长匹配的实际价值并不容易看出来。把画面一:Trie 负责枚举,不负责决定、画面二:从终点倒着点亮格子、画面三:把反例逐格还原放到具体场景里理解,使用时会更清楚。

先看原文给出的关键信息:最长匹配每一步都选当前最长词,却可能把后半句切成未知字符。;看到“研究生命起源”,从左往右最长匹配会先拿走“研究生”,剩下“命起源”。;如果说词典没有单独的“命”,算法只能把它当未知字符。继续往下处理时,重点放在这些条件上:选取较短的“研究”,反而能接上“生命”和“起源”。;这个四字交界处,是检验分词算法是否只会贪心的好样本。;画面一:Trie 负责枚举,不负责决定 词典中有大量共享前缀。。收尾检查时,再把这些细节对上:若从每个位置尝试每个词,匹配成本会重复;从位置 i 出发沿字符向下走,每遇到词尾就得到一个候选切分终点。;Trie 回答“有哪些词能从这里开始”,但选取哪一个仍需全局目标。。