博客
关于我
爬取某瓣电影中你好,李焕英电影的短评并生成词云
阅读量:491 次
发布时间:2019-03-07

本文共 684 字,大约阅读时间需要 2 分钟。

要爬取并生成豆瓣电影短评及其词云图

项目结构清晰,主要包含以下几个部分:

  • 简单的Python脚本用于请求页面数据
  • 需要安装多个第三方库以支持特定功能
  • 项目输出包括词云图和文本文件
  • 使用了自定义的爬虫逻辑和词云生成工具
  • 关于图片和文件路径请注意要替换成自己的图片路径和字体文件路径。此外,还需自行安装需要的第三方库,包括但不限于requestsetreetimejiebaimageiowordcloudfrom typing import NoReturn。这些库中的大部分可能需要额外安装。

    项目实现过程如下:脚本首先发送请求获取指定链接的页面内容,使用etree解析HTML结构,并从页面中提取短评内容。短评内容被写入文本文件lhz.text中。接着,脚本根据页面结构判断是否继续爬取下一页的链接,这样可以自动完成多页的爬取工作。爬取完成后,用户可以调用make_clound()方法生成词云图,显示用户对电影的评论和看法。整个过程使用time.sleep()防止过度频繁请求,避免被网站反爬机制拦截。

    生成的词云图基于背景图片img.png,使用msyh.ttc字体文件,屏幕比例按scale参数放大。为了确保词云图的可读性,程序排除了常见的停用词如标点符号和一些数字符号。最终生成的词云图保存在new_inclound.png文件中。

    整个项目体积小巧,足够完成目标,生成的短评数量虽因反爬措施有限,但已经足够使用。当运行本项目时请确保网络环境稳定,避免过多请求导致被拦截。

    项目运行结果如下:生成的词云图清晰呈现用户评论内容,可视化观察情感分布。

    转载地址:http://gtjcz.baihongyu.com/

    你可能感兴趣的文章
    php函数性能优化中应注意哪些问题?
    查看>>
    PHP函数操作数字和汉字互转(100以内)
    查看>>
    PHP函数方法
    查看>>
    PHP创建目录mkdir无写入权限的问题解决方案
    查看>>
    PHP删除指定目录下的所有文件和文件夹 | 删除指定文件
    查看>>
    php删除文件夹下面所有文件包括(删除文件夹)不删除文件夹
    查看>>
    React Collapse Pane 项目教程
    查看>>
    php判断ip黑名单程序代码
    查看>>
    php判断复选框是否被选中的方法
    查看>>
    PHP判断指定目录下是否存在文件
    查看>>
    php判断数组是否为空
    查看>>
    PHP判断数组是否有重复值、获取重复值
    查看>>
    springboot基于Web的社区留守儿童管理系统源码毕设+论文
    查看>>
    Springboot基于Redisson实现Redis分布式可重入锁【案例到源码分析】
    查看>>
    PHP利用正则表达式实现手机号码中间4位用星号(*)替换显示
    查看>>
    PHP加密与安全的最佳实践
    查看>>
    PHP加速器eaccelerator导致php-fpm进程卡死原因分析
    查看>>
    PHP区分 企业微信浏览器 | 普通微信浏览器 | 其他浏览器
    查看>>
    php原生代码怎么连表查询,PHP tp5中使用原生sql查询代码实例
    查看>>
    PHP去掉转义符
    查看>>