{"repo":"ydf0509/boost_spider","free":true,"listed":false,"github":"https://github.com/ydf0509/boost_spider","clone":"git clone https://github.com/ydf0509/boost_spider.git","description":"用户自由无束缚的分布式光速python爬虫函数执行框架,写法和性能远远暴击仿scrapy api式框架","language":"Python","stars":26,"topics":["feapder","scrapy","spider","asyncio","sync","pspider"],"license":null,"category":"scrapers-browser-automation","readme_excerpt":"欢迎来到爬虫的未来，这里没有回调地域，只有自由世界。 pip install boost spider boost spider = funboost 的超跑引擎 + 一套为爬虫量身打造的瑞士军刀。所有仿scrapy api爬虫框架都还是处在变花样造一辆马车 ！！！号外： boost spider 项目中现在也包含一个 boost scrapy 的框架，是使用 funboost内核封装的一个高仿scrapy api风格的爬虫框架。 funboost 自己也造一个变态马车， boost scrapy 主要是为了那些 如果不写 yield Request 就浑身难受的爬虫用户。 (这间接说明了 funboost 具有超高的可塑性，可以封装成任何框架，包括爬虫框架) 对于爬虫场景: 用户怕麻烦,要求天生就爬虫全套方便，就使用 funboost + boost spider (内置了便利的 请求 解析 入库3个类) 用户要绝对自由，就使用 funboost + 用户自己项目的 utils/ 或 commons/ 文件夹下已经封装好的 各种工具类和函数 funboost/boost spider 对仿scrapy api框架最大优势是 复用用户自己的 utils文件夹下的 宝贵资产 - 复用用户自己的 utils 宝贵资产，正是 funboost 区别于 Scrapy/Feapder 等传统框架的 根本性优势 ，是战略层面的胜利。 utils 是开发者的“内功心法” ：一个开发者的 utils 文件夹，是他/她多年经验的结晶，是解决特定领域问题的最佳实践沉淀。它包含了对业务逻辑的深刻理解，是 不可替代的、高度定制化的“私有武器库” 。 “复用 utils ” = 复用经验和智慧 ：一个框架如果能让开发者无缝地复用自己的 utils ，就意味着它尊重并放大了开发者的个人能力和历史积累。开发者可以用最熟悉、最高效的方式解决问题。 “无法复用 utils ” = 废掉武功，重练套路 ： Scrapy/Feapder 的插件和中间件机制，本质上是让你放弃自己的“内功”，去学习并练习一套它们规定好的“套路招式”。你的 my request 函数再精妙，也得改成 Downloader Middleware 的形状；你的 save to mysql 再高效，也得塞进 Item Pipeline 的模子里。这是一个 巨大的、隐性的成本 。 Funboost/boost spider 天然就是 FaaS 微服务，而 Scrapy 只是数据孤岛,架构模式战略级碾压 funboost/boost spider 支持高实时爬虫，scrapy只能封闭离线爬虫，架构模式战略级碾压。 funboost/boost spider 不仅支持别的部门通过原生消息队列客户端发布函数入参对应的纯净json到对应的queue name 也支持 funboost.faas 快速给你的web服务增加多个funboost路由，一键实现 FaaS(Function as a Service) 自动发现注册爬虫函数，在实时爬虫上对 scrapy-redis 是战略级碾压。 1.分布式光速python爬虫框架 boost spider boost spider是从框架理念和本质上降维打击,任何仿 scrapy api 用法框架的爬虫框架,如同星际战舰对抗中世纪的蒸汽机车. 碾压任何需要用户 yield Request(url=url, callback=self.my parse,meta={'field1'","default_branch":null,"files":null,"tree":[],"storefront":"/r/ydf0509","claimed":false,"request_supported":{"post":"https://gitbuyer.com/r/ydf0509/boost_spider/request-supported","requests":0},"note":"indexed from public GitHub; nothing is for sale on this page. Clone it from GitHub. Paid listings live at /search."}