{"repo":"zhuruili/Spider","free":true,"listed":false,"github":"https://github.com/zhuruili/Spider","clone":"git clone https://github.com/zhuruili/Spider.git","description":"一些简单的爬虫代码，部分在公司实习留下的爬虫代码，会不定时更新，希望能帮到你","language":"Python","stars":15,"topics":["crawler","drissionpage","python","requests"],"license":"MIT","category":"scrapers-browser-automation","readme_excerpt":"Spider This repository records the simple code snippets I coded during my learning of web crawling techniques.Some simple crawler code will be updated from time to time, I hope it can help you，good luck！ 仓库记录着我在学习爬虫技术过程中留下的代码段。会不定时更新，希望能帮到你。 [!Important] 警告：仓库代码仅供学习交流使用，不可用于非法用途！ --- 文件说明 - SimPrograms 记录自己学习爬虫所留下的简单程序，该文件夹下的爬虫程序的特点是'简单'，基本上都是一个Python文件直接运行即可。 - SpiderPro 这部分内容对初学者来说会有一定难度，小白慎入。该文件夹下的爬虫程序是我在公司实习时候留下的相对简单的爬虫业务代码，基本上都是全站级别的数据采集，数据量大概在几万到几十万不等 - utils 做爬虫项目时可能用上的实用类工具代码 - tutorial 爬虫相关知识点的简明教程与知识补充 - Spi DataSave 保存部分爬取的内容，体量比较小的数据集我会同步到仓库，如有需要可以直接下载。 内容目录 SimPrograms 这部分的内容比较杂，相当于是借助一个个简单的案例来初步熟悉爬虫到底在干什么、它的流程一般是怎样的、基于请求的爬虫和基于自动化的爬虫大概分别是怎么做的等等 - urllib模拟登陆 使用 urllib 简单模拟发送请求与登陆 - NBA球员top50 基于 requests 获取数据，使用 xpath 表达式提取数据 - 当当网好评榜Top200 基于 requests 获取数据，使用正则表达式（ re ）提取数据并保存到文本文件 - 经济日报全站爬虫 对经济日报站点的全方位信息收集，基于 requests 与 re ，层层深入 - b站视频信息 基于 DrissionPage 实现自动化数据抓取，仅抓取搜索视频后看到的视频信息 - MOOC视频信息 程序与‘b站视频信息’爬取程序类似，同样是一个基于 DrissionPage 实现的简单Demo。 - JD商品评论自动化爬取 本爬虫项目和先前的简单例子有些区别。首先是它做了翻页的适配。其次是通过提前手动登录的方式解决登陆/验证码等问题，随后再使用代码接管浏览器，不过这需要配置浏览器所占用的端口号 - 某宝商品数据自动化采集 同样有翻页的适配，不过采取的是程序登陆，不过实测这样的效果似乎并不太好 - - SpiderPro 我在实习期留下的代码，虽然算不上很成熟，但是与我之前入门时候依葫芦画瓢写下的半吊子代码相比还是有很大的改进，比如多了很多异常处理，做了很多优化来提高代码的效率，并且在经过一个个相似的项目的训练后能够逐渐形成一套属于自己的爬虫模板，对比刚开始的我也算有了不少提高 [!Note] 注意：这部分内容虽然是我在公司实习留下的代码，但是代码全程由我自己编写，并非公司向我提供，并且代码中所有有关公司的信息或者使用的资源均已被我移除，你可以放心的查看或学习其中的内容 - 光明日报 中国教育报 基于 datetime 批量生成url、 requests 发送请求、 re 匹配内容、 pymysql 连接数据库并保存数据、 loguru 输出日志信息、 threading 与 ThreadPoolExecutor 控制多线程爬取、 time ","default_branch":null,"files":null,"tree":[],"storefront":"/r/zhuruili","claimed":false,"request_supported":{"post":"https://gitbuyer.com/r/zhuruili/Spider/request-supported","requests":0},"note":"indexed from public GitHub; nothing is for sale on this page. Clone it from GitHub. Paid listings live at /search."}