一聚教程网:一个值得你收藏的教程网站

最新下载

热门教程

ChineseWordSegmentation:实践指南

时间:2026-09-10 20:40:01 编辑:袖梨 来源:一聚教程网

准备试用ChineseWordSegmentation之前,先别急着安装;这个项目提供的是Chinese word segmentation algorithm without corpus(无需语料库的中文分词)。这类文档与演示交付工具真正难在内容结构和版式在转换后容易走样,仓库说明只能作为第一层证据。与其反复读介绍,不如拿一份结构复杂的真实文档完成转换,再依据标题层级、表格图片、字体版式和可编辑性做取舍。我会把它列入经常交付正式文档或演示稿的团队的候选清单,而不是仅凭项目介绍直接纳入生产。

ChineseWordSegmentation

无语料库的中文分词算法

用途

from wordseg import WordSegment
doc = u'十四是十四四十是四十,十四不是四十,四十不是十四'
ws = WordSegment(doc, max_word_len=2, min_aggregation=1, min_entropy=0.5)
ws.segSentence(doc)

这将生成单词

十四 是 十四 四十 是 四十 , 十四 不是 四十 , 四十 不是 十四

事实上,doc 应该是一个足够长的文档字符串以获得更好的结果。在这种情况下,min_aggregation应设置为远大于1,例如50,min_entropy也应设置为大于0.5,例如1.5。

此外,该函数的输入和输出都应解码为 unicode。

WordSegment.segSentence 有一个可选参数 method,其值为 WordSegment.LWordSegment.SWordSegment.ALL,表示

  • WordSegment.L:如果找到由几个较短单词组合而成的长单词,则仅给出长单词。
  • WordSegment.S:给出几个较短的单词。
  • WordSegment.ALL:给出长款和短款。

参考

感谢Matrix67的文章

热门栏目