保存Scrapy响应的屏幕截图
创始人
2024-11-22 16:00:22
0

要保存Scrapy响应的屏幕截图,可以使用Scrapy的middlewares中的一个叫做ScreenshotMiddleware的中间件。以下是一个包含代码示例的解决方法:

  1. 首先,确保安装了scrapy-splashPillow这两个Python库。

  2. 在Scrapy项目的settings.py文件中添加以下配置:

DOWNLOADER_MIDDLEWARES = {
    'scrapy_splash.SplashCookiesMiddleware': 723,
    'scrapy_splash.SplashMiddleware': 725,
    'scrapy.downloadermiddlewares.httpcompression.HttpCompressionMiddleware': 810,
    'your_project_name.middlewares.ScreenshotMiddleware': 800,  # 添加此行
}

SPIDER_MIDDLEWARES = {
    'scrapy_splash.SplashDeduplicateArgsMiddleware': 100,
}

DUPEFILTER_CLASS = 'scrapy_splash.SplashAwareDupeFilter'

SPLASH_URL = 'http://localhost:8050/'
  1. 在Scrapy项目的middlewares.py文件中添加以下代码:
from scrapy import signals
from scrapy.http import HtmlResponse
from PIL import Image


class ScreenshotMiddleware:
    @classmethod
    def from_crawler(cls, crawler):
        middleware = cls()
        crawler.signals.connect(middleware.spider_opened, signal=signals.spider_opened)
        crawler.signals.connect(middleware.spider_closed, signal=signals.spider_closed)
        return middleware

    def spider_opened(self, spider):
        self.spider = spider

    def spider_closed(self, spider):
        self.spider = None

    def process_response(self, request, response, spider):
        if spider and response.status == 200:
            screenshot = self.take_screenshot(response)
            screenshot.save(f"{spider.name}_{response.url.replace('/', '_')}.png")

        return response

    def take_screenshot(self, response):
        image = Image.open(response.body)
        return image
  1. 现在,当Scrapy爬虫运行时,ScreenshotMiddleware中间件会在每个响应返回时调用take_screenshot方法将响应内容转换为图像,并将图像保存为PNG文件。保存的文件名由爬虫名和响应URL组成,其中斜杠(/)被下划线(_)替换。

请注意,此代码示例假设你已经配置了Splash服务并将其运行在http://localhost:8050/上。如果你使用的是其他服务或端口,请相应地修改splash_url的值。

希望这可以解决你的问题!

相关内容

热门资讯

透视挂!aapoker有后台操... 透视挂!aapoker有后台操控(德扑之星有辅)外挂透明挂辅助器安装(辅助挂)新版2024教程(20...
揭秘几款(Wepoke游戏)外... 揭秘几款(Wepoke游戏)外挂透明挂辅助工具(透视)曝光教程(2021已更新)(哔哩哔哩);致您一...
记者发布!微扑克发牌规律性(透... 记者发布!微扑克发牌规律性(透视)外挂透明挂辅助器安装(2021已更新)(哔哩哔哩)是一款可以让一直...
两分钟攻略!约战竞技场能开挂,... 两分钟攻略!约战竞技场能开挂,广东雀神辅助器免费版,wpk教程(有挂神器)是一款可以让一直输的玩家,...
关于!aa扑克能用模拟器,wP... 关于!aa扑克能用模拟器,wPK原来真的有挂,爆料教程(有挂透明)-哔哩哔哩相信很多朋友都在电脑上玩...
终于懂了(Wepoke代打)外... 终于懂了(Wepoke代打)外挂透视辅助机制(辅助挂)技巧教程(2022已更新)(哔哩哔哩);一、W...
实测发现!智星德州扑克辅牌器(... 实测发现!智星德州扑克辅牌器(辅助挂)反正真的有挂2025已更新)(哔哩哔哩)1)智星德州扑克辅助挂...
6分钟攻略!决战卡五星有银牌的... 6分钟攻略!决战卡五星有银牌的秘诀,雀神辅助器插件,系统教程(证实有挂)1.决战卡五星 ai辅助创建...
查到实测辅助!哈糖大菠萝切牌规... 1、查到实测辅助!哈糖大菠萝切牌规律(德扑之星底牌)外挂透明挂辅助APP(辅助挂)2024新版技巧(...
必备攻略(pokerworld... 必备攻略(pokerworld软件)外挂透明挂辅助app(透视)软件透明挂(2024已更新)(哔哩哔...