博客
关于我
爬取某瓣电影中你好,李焕英电影的短评并生成词云
阅读量:491 次
发布时间:2019-03-07

本文共 684 字,大约阅读时间需要 2 分钟。

要爬取并生成豆瓣电影短评及其词云图

项目结构清晰,主要包含以下几个部分:

  • 简单的Python脚本用于请求页面数据
  • 需要安装多个第三方库以支持特定功能
  • 项目输出包括词云图和文本文件
  • 使用了自定义的爬虫逻辑和词云生成工具
  • 关于图片和文件路径请注意要替换成自己的图片路径和字体文件路径。此外,还需自行安装需要的第三方库,包括但不限于requestsetreetimejiebaimageiowordcloudfrom typing import NoReturn。这些库中的大部分可能需要额外安装。

    项目实现过程如下:脚本首先发送请求获取指定链接的页面内容,使用etree解析HTML结构,并从页面中提取短评内容。短评内容被写入文本文件lhz.text中。接着,脚本根据页面结构判断是否继续爬取下一页的链接,这样可以自动完成多页的爬取工作。爬取完成后,用户可以调用make_clound()方法生成词云图,显示用户对电影的评论和看法。整个过程使用time.sleep()防止过度频繁请求,避免被网站反爬机制拦截。

    生成的词云图基于背景图片img.png,使用msyh.ttc字体文件,屏幕比例按scale参数放大。为了确保词云图的可读性,程序排除了常见的停用词如标点符号和一些数字符号。最终生成的词云图保存在new_inclound.png文件中。

    整个项目体积小巧,足够完成目标,生成的短评数量虽因反爬措施有限,但已经足够使用。当运行本项目时请确保网络环境稳定,避免过多请求导致被拦截。

    项目运行结果如下:生成的词云图清晰呈现用户评论内容,可视化观察情感分布。

    转载地址:http://gtjcz.baihongyu.com/

    你可能感兴趣的文章
    OpenCV:概念、历史、应用场景示例、核心模块、安装配置
    查看>>
    Openlayers Source基础及重点内容讲解
    查看>>
    openlayers 入门教程(八):Geoms 篇
    查看>>
    Openlayers中使用Cluster实现缩放地图时图层聚合与取消聚合
    查看>>
    Openlayers中点击地图获取坐标并输出
    查看>>
    Openlayers中设置定时绘制和清理直线图层
    查看>>
    Openlayers图文版实战,vue项目从0到1做基础配置
    查看>>
    Openlayers实战:modifystart、modifyend互动示例
    查看>>
    Openlayers高级交互(10/20):绘制矩形,截取对应部分的地图并保存
    查看>>
    Openlayers高级交互(16/20):两个多边形的交集、差集、并集处理
    查看>>
    Openlayers高级交互(17/20):通过坐标显示多边形,计算出最大幅宽
    查看>>
    Openlayers高级交互(19/20): 地图上点击某处,列表中显示对应位置
    查看>>
    Openlayers高级交互(8/20):选取feature,平移feature
    查看>>
    openlayers:圆孔相机根据卫星经度、纬度、高度、半径比例推算绘制地面的拍摄的区域
    查看>>
    OpenLDAP(2.4.3x)服务器搭建及配置说明
    查看>>
    OpenLDAP编译安装及配置
    查看>>
    OpenMCU(一):STM32F407 FreeRTOS移植
    查看>>
    OpenMCU(三):STM32F103 FreeRTOS移植
    查看>>
    OpenMCU(二):GD32E23xx FreeRTOS移植
    查看>>
    OpenMetadata 命令执行漏洞复现(CVE-2024-28255)
    查看>>