{"repo":"nghuyong/WeiboSpider","free":true,"listed":false,"github":"https://github.com/nghuyong/WeiboSpider","clone":"git clone https://github.com/nghuyong/WeiboSpider.git","description":"持续维护的新浪微博采集工具🚀🚀🚀","language":"Python","stars":4105,"topics":["scrapy","python","weibo","weibospider"],"license":"MIT","category":"scrapers-browser-automation","readme_excerpt":"持续维护的新浪微博采集工具🚀🚀🚀 项目特色 - 基于weibo.com的新版API构建，拥有最丰富的字段信息 - 多种采集模式，包含微博用户,推文,粉丝,关注,转发,评论,关键词搜索 - 核心代码仅100行，代码可读性高，可快速按需进行定制化改造 快速开始 拉取&&安装 替换Cookie 访问https://weibo.com/， 登陆账号，打开浏览器的开发者模式，再次刷新 复制 weibo.com 数据包，network中的cookie值。编辑 weibospider/cookie.txt 并替换成刚刚复制的Cookie 添加代理IP(可选) 重写fetch proxy 方法，该方法需要返回一个代理ip，具体代码参考这里。推荐代理: IPWO链接 ：专注于全球住宅代理服务，为浏览器自动化、网页爬虫、公开数据采集及 AI 应用提供稳定、安全的网络支持。 覆盖全球 195+ 国家和地区，让开发更高效，业务更稳定。0元试用，优惠折扣码：0104 --- Swiftproxy 链接 ：注册可领500MB免费测试流量，使用折扣码“GHB5”立享九折优惠！ 运行程序 根据自己实际需要重写 ./weibospider/spiders/ 中的 start requests 函数 采集的数据存在 output 文件中，命名为 {spider.name} {datetime}.jsonl 用户信息采集 用户粉丝列表采集 用户关注列表采集 微博评论采集 微博转发采集 基于微博ID的微博采集 基于用户ID的微博采集 基于关键词的微博采集 更新日志 - 2024.02: 支持采集自己推文的阅读量 #313 - 2024.02: 支持采集视频的播放量 #315 - 2024.01: 支持转发推文溯源到原推文 #314 - 2023.12: 支持采集推文的二级评论 #302 - 2023.12: 支持采集指定时间段的用户推文 #308 - 2023.04: 支持针对推文id的推文采集 #272 - 2022.11: 支持针对单个关键词获取单天超过1200页的检索结果 #257 - 2022.11: 支持长微博全文的获取 - 2022.11: 基于关键词微博搜索支持指定时间范围 - 2022.10: 添加IP归属地信息的采集，包括用户数据，微博数据和微博评论数据 - 2022.10: 基于weibo.com站点对项目进行重构 引用 其他工作 - 已构建超大规模数据集WeiboCOV，可免费申请，包含2千万微博活跃用户以及6千万推文数据，参见这里","default_branch":null,"files":null,"tree":[],"storefront":"/r/nghuyong","claimed":false,"request_supported":{"post":"https://gitbuyer.com/r/nghuyong/WeiboSpider/request-supported","requests":0},"note":"indexed from public GitHub; nothing is for sale on this page. Clone it from GitHub. Paid listings live at /search."}