怎么使用Python分词工具jieba-快上网网站建设公司

怎么使用Python分词工具jieba

本篇文章给大家分享的是有关怎么使用Python分词工具jieba，小编觉得挺实用的，因此分享给大家学习，希望大家阅读完这篇文章后可以有所收获，话不多说，跟着小编一起来看看吧。

成都创新互联公司是专业的准格尔网站建设公司，准格尔接单;提供成都网站制作、网站设计,网页设计,网站设计,建网站,PHP网站建设等专业做网站服务;采用PHP框架,可快速的进行准格尔网站开发网页制作和功能扩展;专业做搜索引擎喜爱的网站,专业的做网站团队,希望更多企业前来合作!

结巴分词是Python语言中最流行的一个分词工具，在自然语言处理等场景被广泛使用。

因为GitHub写的文档太啰嗦，所以整理了一个简版的入门使用指南，看完可直接上手

安装

pip install jieba

简单分词

import jieba

result = jieba.cut("我爱中国北京大学")
for word in result:
   print(word)

输出

我
爱
中国
北京大学

句子切分成了5个词组。

全模式分词

result = jieba.cut("我爱中国北京大学", cut_all=True)
for word in result:
   print(word)

输出

我
爱
中国
北京
北京大学
大学

全模式分出来的词覆盖面更广。

提取关键词

从一个句子或者一个段落中提取前k个关键词

import jieba.analyse

result = jieba.analyse.extract_tags("机器学习，需要一定的数学基础，需要掌握的数学基础知识特别多，"
                                   "如果从头到尾开始学，估计大部分人来不及，我建议先学习最基础的数学知识",
                                   topK=5,
                                   withWeight=False)
import pprint

pprint.pprint(result)

输出

['数学', '学习', '数学知识', '基础知识', '从头到尾']

topK 为返回前topk个权重最大的关键词
withWeight 返回每个关键字的权重值

去掉停止词

停止词是指在句子中无关紧要的词语，例如标点符号、指示代词等等，做分词前要先将这些词去掉。分词方法cut不支持直接过滤停止词，需要手动处理。提取关键字的方法 extract_tags 支持停止词过滤

# 先过滤停止词
jieba.analyse.set_stop_words(file_name)
result = jieba.analyse.extract_tags(content, tokK)

file_name 的文件格式是文本文件，每行一个词语

以上就是怎么使用Python分词工具jieba，小编相信有部分知识点可能是我们日常工作会见到或用到的。希望你能通过这篇文章学到更多知识。更多详情敬请关注创新互联行业资讯频道。

标题名称：怎么使用Python分词工具jieba
网页路径：http://cdkjz.cn/article/jehcsi.html

多年建站经验

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

咨询相关问题或预约面谈，可以通过以下方式与我们联系

网站建设

网站推广

案例

方案

电商网站开发

微信小程序

我们

联系

精准传达 • 有效沟通

查看其它板块

怎么使用Python分词工具jieba

安装

简单分词

全模式分词

提取关键词

去掉停止词

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接

网络推广

Network promotion

网站方案

Solution

电商网站开发

E-commerce & System

我们

About Us

联系

Contact Us

精准传达 • 有效沟通

查看其它板块

怎么使用Python分词工具jieba

安装

简单分词

全模式分词

提取关键词

去掉停止词

相关资讯

香港服务器怎么设置域名 香港服务器怎么设置域名访问

怎么修改域名解析错误 怎么修改域名解析错误

服务器提示安全性警讯 服务器安全性设置

宽带路由器设置密码 宽带路由器设置密码网址

阿里云城市服务器设置 阿里云服务器怎么配置

阿里云设置 服务器ip地址的简单介绍

c语言函数为什么会被优化 c语言函数为什么会被优化掉

安全防御服务器 安全防御服务器是什么

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线 成都：13518219792 座机：028-86922220

友情链接 交换友情链接

香港服务器怎么设置域名香港服务器怎么设置域名访问

怎么修改域名解析错误怎么修改域名解析错误

服务器提示安全性警讯服务器安全性设置

宽带路由器设置密码宽带路由器设置密码网址

阿里云城市服务器设置阿里云服务器怎么配置

阿里云设置服务器ip地址的简单介绍

安全防御服务器安全防御服务器是什么

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接