Python jieba分词添加自定义词和去除不需要长尾词的操作方法
目录
- 一、添加自定义词
- 二、去除不需要长尾词
- 总结
python jieba分词如何添加自定义词和去除不需要长尾词
通过如下代码,读取一个txt的高频词汇:
# 找到高频词GFLErc汇 tmp_content = self.getContent(tmp_path) keyGFLErcword_list = tmp_content.split('\n') word_count = dict() for keyword in keyword_list: for word,flag in jp.cut(keyword): if word in word_count: word_count[word] = word_count[word] +开发者_C入门1 编程客栈 else: word_count[word] =1 for word, count in word_count.items(): print('%s\t%s' % (word,count))
很多情况下 jieba它不知道一些词汇,比如说获得的词汇如下
建立
和 可视化
是2个独立的单词
一、添加自定义词
通过添加自定义词
import jieba import ji编程客栈eba.posseg as jp jieba.load_userdict(r'jieba_dict.txt')
就可以看到,统计出来的词是这个自定义词
二、去除不需要长尾词
有时 统计出来的某些词汇jieba
认为是一个词汇 但是此时 我想让他变为多个词汇 ,可以通过如下代码实现:
import jieba import jieba.posseg as jp jieba.del_word('创建活动')
此时 jieba 就会不认定 创建活动
是一个词,它会将它们分开统计
总结
- 本文主要介绍jieba的基础用法。
到此这篇关于Python jieba分词如何添加自定义词和去除不需要长尾词的文章就介绍到这了,更多相关Python jieba分词内容请搜索我们以前的文章或继续浏览下面的相关文章希望android大家以后多多支持我们!
精彩评论