心得技巧

html5 HTML/Xhtml CSS XML/XSLT Dreamweaver教程 Frontpage教程心得技巧

上一篇: 黑马程序员pink老师前端入门教程... 下一篇:小型员工管理系统 1.0 绿色版（j...

python爬鱿鱼游戏的评价看看鱿鱼游戏到底值不值得看初识selenium

发布时间：2022-07-02 发布网站：脚本宝典

脚本宝典收集整理的这篇文章主要介绍了python爬鱿鱼游戏的评价看看鱿鱼游戏到底值不值得看初识selenium，脚本宝典觉得挺不错的，现在分享给大家，也给大家做个参考。

前言

鱿鱼游戏是什么，相信大家都不陌生了，虽然说博主没看过这部剧，但是还是对豆瓣的评论有点好奇，刚刚好近期学习了selenium，就当练练手了，来吧来吧，爬爬爬。

python爬鱿鱼游戏的评价看看鱿鱼游戏到底值不值得看初识selenium

分析页面

还是老样子，兄弟们先打开我们最喜欢的GOOGLE浏览器，点击F12，开启爬虫快乐模式来到页面，如下图步骤，逐个点击

python爬鱿鱼游戏的评价看看鱿鱼游戏到底值不值得看初识selenium

然后我们就发现这个页面确实很简单，每一条评论就是包在了class为short的span标签内，那就可以开始写xpath了,如下图

python爬鱿鱼游戏的评价看看鱿鱼游戏到底值不值得看初识selenium

这样一页的评论就拿到了，接下来就是换页了有一个小技巧，不需要我们自己写xpath，直接用google浏览器可以生成xpath，如下图所示

python爬鱿鱼游戏的评价看看鱿鱼游戏到底值不值得看初识selenium

点击这个Copy path这样就拿到了按钮的xpath的内容，然后实现点击页面就可以了，好了就这样分析完了，接下来开始写代码了。

python爬鱿鱼游戏的评价看看鱿鱼游戏到底值不值得看初识selenium

重要代码

selenium打开豆瓣短评页面

# 待打开的页面
    url = 'https://movie.douban.COM/subject/34812928/comments?limIT=20&amp;status=P&sort=new_score'
    # 躲避智能检测
    option = webdriver.ChromeOptions()
    # option.headless = True
    option.add_exPErimental_option('excludeSwitches', ['enable-automation'])
    option.add_experimental_option('useAutomationExtension', False)
    driver = webdriver.Chrome(options=option)
    driver.execute_cdp_cmd('Page.addScriptToEvaluateOnNewDocument',
                           {'source': 'Object.definePRoperty(navigator, "webdriver", {get: () => undefined})'
                            })
    #打开页面
    driver.get(url)

根据xpath来获取评论内容

这里获取评论的xpath语句

//span[@class="short"]

获取评论代码

        options = driver.find_elements(By.XPATH, '//span[@class="short"]')
        for i in options:
           text=text+i.text

实现跳转下一页

下一页的按钮xpath

//*[@id="paginator"]/a

跳转按钮点击代码

        nextpage = driver.find_element(By.XPATH, '//*[@id="paginator"]/a')
        nextpage.click()

完整代码

词云生成工具类

# -*- codeing = utf-8 -*-
# @Time : 2021/10/9 20:54
# @Author : xiaow
# @File : wordcloudutil.py
# @Software : Pycharm


From wordcloud import WordCloud
import PIL.Image as image
import numpy as np

import jieba


def trans_CN(text):
    # 接收分词的字符串
    word_list = jieba.cut(text)
    # 分词后在单独个体之间加上空格
    result = " ".join(word_list)
    return result


def getWordCloud(text):
    # print(text)
    text = trans_CN(text)
    # 词云背景图
    mask = np.array(image.open("E://file//pics//mask3.jpg"))
    wordcloud = WordCloud(
        mask=mask,
        # 字体样式文件
        font_path="C:WindowsFontsSTXINGKA.TTF",
        background_color='white'
    ).generate(text)
    image_produce = wordcloud.to_image()
    image_produce.show()

评论获取代码

# -*- codeing = utf-8 -*-
# @Time : 2021/6/27 22:29
# @Author : xiaow
# @File : test.py
# @Software : PyCharm
import time

from selenium import webdriver
from selenium.webdriver.common.by import By
from api import wordcloudutil
if __name__ == '__main__':
    url = 'https://movie.douban.com/subject/34812928/comments?limit=20&status=P&sort=new_score'
    # 躲避智能检测
    option = webdriver.ChromeOptions()
    # option.headless = True
    option.add_experimental_option('excludeSwitches', ['enable-automation'])
    option.add_experimental_option('useAutomationExtension', False)
    driver = webdriver.Chrome(options=option)
    driver.execute_cdp_cmd('Page.addScriptToEvaluateOnNewDocument',
                           {'source': 'Object.defineProperty(navigator, "webdriver", {get: () => undefined})'
                            })
    driver.get(url)
    text=''
    # 获取所有的选项元素
    j=0
    while 1:
        # 定位到新跳转的页面
        time.sleep(1)
        driver.switch_to.window(driver.window_handles[0])

        options = driver.find_elements(By.XPATH, '//span[@class="short"]')
        for i in options:
           text=text+i.text
        time.sleep(2)
        nextpage = driver.find_element(By.XPATH, '//*[@id="paginator"]/a')
        nextpage.click()
        j=j+1
        if j>10:
            break
    print(text)
    wordcloudutil.getWordCloud(text)

成果

最后爬取的评论生成了词云图，如下图所示

python爬鱿鱼游戏的评价看看鱿鱼游戏到底值不值得看初识selenium

就这样就结束了，还是很简单的

下面推荐下自己的专栏，关于爬虫的基础内容，适合新手练练手 ❤️爬虫专栏，快来点我呀❤️

python爬取网易云评论超简单教程

学会这个，全网视频任你爬取，一分钟学会you-get

敲代码累了怎么办，快用python爬小姐姐视频吧

聊天没有表情包被嘲讽，程序员直接用python爬取了十万张表情包

两行代码爬取微博热搜，并实现邮件提醒功能，妈妈再也不用担心我吃不到瓜了爬虫基础

python爬取4k小姐姐图片人生苦短我用python

python爬b站视频人生苦短我用python

Python爬取美女图片爬虫基础

有缘再写，侵权立删

脚本宝典总结

以上是脚本宝典为你收集整理的python爬鱿鱼游戏的评价看看鱿鱼游戏到底值不值得看初识selenium全部内容，希望文章能够帮你解决python爬鱿鱼游戏的评价看看鱿鱼游戏到底值不值得看初识selenium所遇到的问题。

如果觉得脚本宝典网站内容还不错，欢迎将脚本宝典推荐好友。

本图文内容来源于网友网络收集整理提供，作为学习参考使用，版权属于原作者。
如您有任何意见或建议可联系处理。小编QQ：384754419，请注明来意。

标签：cap java list php python sort String while while 工具工具程序员程序员美女

上一篇: 黑马程序员pink老师前端入门教程... 下一篇:小型员工管理系统 1.0 绿色版（j...

猜你在找的心得技巧相关文章

clion结合vcpkg以及GTest的使用 2022-07-07
EGF 2022-06-06
ExtJS 布局-Column布局（Column layout） 2022-06-05
颜色之ARGB与RGB、RGBA的区别与介绍 2022-04-15
rgba中的a是什么意思 CSS之RGBA颜色指南 2022-04-15
rootfs -根文件系统制作 2022-07-07
网页简单布局之结构与表现原则分享 2022-04-15
小项目中怎么防止Vue的闪现画面效果 2022-04-15
隐藏 Web 中的元素方法及优缺点教程详解 2022-04-15
告别硬编码让你的前端表格自动计算的实例代码 2022-04-15

全站导航更多

python爬鱿鱼游戏的评价 看看鱿鱼游戏到底值不值得看 初识selenium

前言

分析页面

重要代码

selenium打开豆瓣短评页面

根据xpath来获取评论内容

实现跳转下一页

完整代码

成果

脚本宝典总结

python爬鱿鱼游戏的评价看看鱿鱼游戏到底值不值得看初识selenium