linuxsir首页 LinuxSir.Org | Linux、BSD、Solaris、Unix | 开源传万世,因有我参与欢迎您!
网站首页 | 设为首页 | 加入收藏
您所在的位置:主页 > Linux基础建设 >

用Python生成词云

时间:2020-02-06  来源:未知  作者:admin666

词云是一种数据可视化技术,用于表示文本数据,其中每个单词的大小表示其出现的频率或重要性。 可以使用词云突出显示重要的文本数据点。 词云被广泛用于分析来自社交网络网站的数据。

为了在Python中生成词云,需要的模块是– matplotlib,pandas和wordcloud。 要安装这些软件包,请运行以下命令:

pip install matplotlib
pip install pandas
pip install wordcloud

代码1:字数

可以设置要在tagcloud上显示的最大单词数。 为此,请使用WordCloud()函数的max_words关键字参数。


# importing the necessery modules 
from wordcloud import WordCloud  
import matplotlib.pyplot as plt 
import csv



# file object is created 
file_ob = open(r"linuxidc.com.csv")



# reader object is created 
reader_ob = csv.reader(file_ob)



# contents of reader object is stored . 
# data is stored in list of list  format. 
reader_contents = list(reader_ob)



# empty string is declare 
text = ""



# iterating through list of rows 
for row in reader_contents : 

 #  iterating through words in the row 
 for word in row :



  # concatenate the words 
  text = text + " " + word



# show only 10 words in the wordcloud . 
wordcloud = WordCloud(width=480,  height=480, max_words=10).generate(text)



# plot the WordCloud image 
plt.figure() 
plt.imshow(wordcloud,  interpolation="bilinear") 
plt.axis("off") 
plt.margins(x=0, y=0)  
plt.show()
?

输出如下图:

用Python生成词云

代码2:删除一些单词

可以删除一些我们不想显示的词。 为此,请将这些单词传递给WordCloud()函数的停用词列表参数。


# importing the necessery modules 
from wordcloud import WordCloud  
import matplotlib.pyplot as plt 
import csv



# file object is created 
file_ob = open(r"linuxidc.com.csv")



# reader object is created 
reader_ob = csv.reader(file_ob)



# contents of reader object is stored . 
# data is stored in list of list  format. 
reader_contents = list(reader_ob)



# empty string is declare 
text = ""



# iterating through list of rows 
for row in reader_contents : 

 #  iterating through words in the row 
 for word in row :



  # concatenate the words 
  text = text + " " + word



# remove Python , Matplotlib , Geeks Words from WordCloud . 
wordcloud =  WordCloud(width=480, height=480, 
   stopwords=["Python",  "Matplotlib","Geeks"]).generate(text)



# plot the WordCloud image 
plt.figure() 
plt.imshow(wordcloud,  interpolation="bilinear") 
plt.axis("off") 
plt.margins(x=0, y=0)  
plt.show()
?

输出效果如下:

用Python生成词云

代码3:更改背景

我们可以更改wordcloud背景的颜色。 为此,请使用WordCloud()函数的background_color关键字参数。


# importing the necessery modules 
from wordcloud import WordCloud  
import matplotlib.pyplot as plt 
import csv



# file object is created 
file_ob = open(r"linuxidc.com.csv")



# reader object is created 
reader_ob = csv.reader(file_ob)



# contents of reader object is stored . 
# data is stored in list of list  format. 
reader_contents = list(reader_ob)



# empty string is declare 
text = ""



# iterating through list of rows 
for row in reader_contents : 

 #  iterating through words in the row 
 for word in row :



  # concatenate the words 
  text = text + " " + word



wordcloud = WordCloud(width=480, height=480,  background_color="pink").generate(text)



# plot the WordCloud image 
plt.figure() 
plt.imshow(wordcloud,  interpolation="bilinear") 
plt.axis("off") 
plt.margins(x=0, y=0)  
plt.show()
?

输出效果如下:

用Python生成词云

代码4:更改单词的颜色

我们可以使用WordCloud()函数的colormap关键字参数来更改单词的颜色。


# importing the necessery modules 
from wordcloud import WordCloud  
import matplotlib.pyplot as plt 
import csv



# file object is created 
file_ob = open(r"linuxidc.com.csv")



# reader object is created 
reader_ob = csv.reader(file_ob)



# contents of reader object is stored . 
# data is stored in list of list  format. 
reader_contents = list(reader_ob)



# empty string is declare 
text = ""



# iterating through list of rows 
for row in reader_contents : 

 #  iterating through words in the row 
 for word in row :



  # concatenate the words 
  text = text + " " + word



wordcloud = WordCloud(width=480, height=480,  colormap="Oranges_r").generate(text)



# plot the WordCloud image 
plt.figure() 
plt.imshow(wordcloud,  interpolation="bilinear") 
plt.axis("off") 
plt.margins(x=0, y=0)  
plt.show()
?

输出效果如下:

用Python生成词云

代码5:设置最大和最小字体

我们可以控制wordcloud的最小和最大字体大小。 为此,请使用WordCloud()函数的max_font_size和min_font_size关键字参数。


# importing the necessery modules 
from wordcloud import WordCloud  
import matplotlib.pyplot as plt 
import csv



# file object is created 
file_ob = open(r"linuxidc.com.csv")



# reader object is created 
reader_ob = csv.reader(file_ob)



# contents of reader object is stored . 
# data is stored in list of list  format. 
reader_contents = list(reader_ob)



# empty string is declare 
text = ""



# iterating through list of rows 
for row in reader_contents : 

 #  iterating through words in the row 
 for word in row :



  # concatenate the words 
  text = text + " " + word



wordcloud = WordCloud(width=480, height=480, max_font_size=20,  min_font_size=10).generate(text) 
plt.figure() 
plt.imshow(wordcloud,  interpolation="bilinear") 
plt.axis("off") 
plt.margins(x=0, y=0)  
plt.show()
?

用Python生成词云

OK,暂时先这样,中文乱码解决等请继续关注我们Linux公社的Python专题栏目,谢谢阅读。

更多Python相关信息见Python 专题页面 https://www.linuxidc.com/topicnews.aspx?tid=17

Linux公社的RSS地址:https://www.linuxidc.com/rssFeed.aspx

友情链接
  • Mozilla发布Firefox 67.0.4,修复沙箱逃逸漏洞
  • 蚂蚁金服正式成为CNCF云原生计算基金会黄金会员
  • Firefox 68将采用Microsoft BITS安装更新
  • OpenSSH增加对存储在RAM中的私钥的保护
  • 谷歌想实现自己的curl,为什么?
  • Raspberry Pi 4发布:更快的CPU、更大的内存
  • Firefox的UA将移除CPU架构信息
  • Ubuntu放弃支持32位应用程序实属乌龙,Steam会否重回Ubuntu怀抱
  • Qt 5.13稳定版发布:引入glTF 2.0、改进Wayland以及支持Lottie动
  • 红帽企业Linux 7现已内置Redis 5最新版
  • Slack进入微软内部禁用服务清单,GitHub也在其列?
  • 安全的全新编程语言V发布首个可用版本
  • Windows Terminal已上架,快尝鲜
  • 阿里巴巴微服务开源生态报告No.1
  • 面世两年,Google地球将支持所有基于Chromium的浏览器
  • 推进企业容器化持续创新,Rancher ECIC千人盛典完美收官
  • CentOS 8.0最新构建状态公布,或于数周后发布
  • Debian移植RISC
  • 微软拆分操作系统的计划初现雏形
  • Oracle发布基于VS Code的开发者工具,轻松使用Oracle数据库
  • Ubuntu 19.10停止支持32位的x86架构
  • 微软为Windows Terminal推出全新logo
  • 联想ThinkPad P系列笔记本预装Ubuntu系统
  • 微软发布适用于Win7/8的Microsoft Edge预览版
  • 启智平台发布联邦学习开源数据协作项目OpenI纵横
  • 经过六个多月的延迟,微软终于推出Hyper
  • ZFS On Linux 0.8.1 发布,Python可移植性工作
  • DragonFly BSD 5.6.0 发布,HAMMER2状态良好
  • Linux Kernel 5.2
  • CentOS 8.0 看起来还需要几周的时间
  • 百度网盘Linux版正式发布
  • PCIe 6.0宣布:带宽翻倍 狂飙至256GB/s
  • PHP 7.4 Alpha 发布,FFI扩展,预加载Opcache以获得更好的性能
  • Canonical将在未来的Ubuntu版本中放弃对32位架构的支持
  • Scala 2.13 发布,改进的编译器性能
  • 微软的GitHub收购了Pull Panda,并且使所有订阅完全免费
  • Windows Subsystem for Linux 2 (WSL 2)现在适用于Windows 10用
  • Debian 10 “Buster”的RISC
  • MariaDB宣布发布MariaDB Enterprise Server 10.4
  • DXVK 1.2.2 发布,带来微小的CPU开销优化
  • DragonFlyBSD 5.6 RC1 发布,VM优化,默认为HAMMER2
  • PrimeNG 8.0.0 发布,支持Angular 8,FocusTrap等
  • GIMP 2.10.12 发布,一些有用的改进
  • 清华大学Anaconda 镜像服务即将恢复
  • Debian GNU/Linux 10 “Buster” 操作系统将于2019年7月6日发布
  • 时时彩论坛
  • 五星体育斯诺克
  • 北单比分直播
  • 河北11选5走势图
  • 福建体彩36选7开奖结果
  • 九龙图库下载