{"repo":"dataabc/weibo-crawler","free":true,"listed":false,"github":"https://github.com/dataabc/weibo-crawler","clone":"git clone https://github.com/dataabc/weibo-crawler.git","description":"新浪微博爬虫，用python爬取新浪微博数据，并下载微博图片和微博视频","language":"Python","stars":4614,"topics":["weibo","crawler","weibo-spider"],"license":null,"category":"scrapers-browser-automation","readme_excerpt":"Weibo Crawler - Weibo Crawler - 功能 - 输出 - 实例 - 运行环境 - 使用说明 - 1.下载脚本 - 2.安装依赖 - 3.程序设置 - 4.设置数据库（可选） - 5.运行脚本 - 6.按需求修改脚本（可选） - 7.定期自动爬取微博（可选） - 8.使用docker - 如何获取user\\ id - 添加cookie与不添加cookie的区别（可选） - 如何获取cookie（可选） - 如何检测cookie是否有效（可选） - API服务 功能 连续爬取 一个 或 多个 新浪微博用户（如Dear-迪丽热巴、郭碧婷）的数据，并将结果信息写入文件。写入信息几乎包括了用户微博的所有数据，主要有 用户信息 和 微博信息 两大类，前者包含用户昵称、关注数、粉丝数、微博数等等；后者包含微博正文、发布时间、发布工具、评论数等等，因为内容太多，这里不再赘述，详细内容见输出部分。具体的写入文件类型如下： 写入 csv文件 （默认） 写入 json文件 （可选） 写入 MySQL数据库 （可选） 写入 MongoDB数据库 （可选） 写入 SQLite数据库 （可选） 下载用户 原创 微博中的原始 图片 （可选） 下载用户 转发 微博中的原始 图片 （可选） 下载用户 原创 微博中的 视频 （可选） 下载用户 转发 微博中的 视频 （可选） 下载用户 原创 微博 Live Photo 中的 视频 （可选） 下载用户 转发 微博 Live Photo 中的 视频 （可选） 下载用户 原创和转发 微博下的一级评论（可选） 下载用户 原创和转发 微博下的转发（可选） 如果你只对用户信息感兴趣，而不需要爬用户的微博，也可以通过设置实现只爬取微博用户信息的功能。程序也可以实现 爬取结果自动更新 ，即：现在爬取了目标用户的微博，几天之后，目标用户可能又发新微博了。通过设置，可以实现每隔几天 增量爬取 用户这几天发的新微博。具体方法见定期自动爬取微博。 输出 用户信息 用户id：微博用户id，如\"1669879400\" 用户昵称：微博用户昵称，如\"Dear-迪丽热巴\" 性别：微博用户性别 生日：用户出生日期 所在地：用户所在地 教育经历：用户上学时学校的名字 公司：用户所属公司名字 阳光信用：用户的阳光信用 微博注册时间：用户微博注册日期 微博数：用户的全部微博数（转发微博+原创微博） 粉丝数：用户的粉丝数 关注数：用户关注的微博数量 简介：用户简介 主页地址：微博移动版主页url，如 头像url：用户头像url 高清头像url：用户高清头像url 微博等级：用户微博等级 会员等级：微博会员用户等级，普通用户该等级为0 是否认证：用户是否认证，为布尔类型 认证类型：用户认证类型，如个人认证、企业认证、政府认证等 认证信息：为认证用户特有，用户信息栏显示的认证信息 微博信息 微博id：微博的id，为一串数字形式 微博bid：微博的bid，与cookie版中的微博id是同一个值 微博内容：微博正文 头条文章url：微博中头条文章的url，如果微博中存在头条文章，就获取该头条文章的url，否则该值为'' 原始图片url：原创微博图片和转发微博转发理由中图片的url，若某条微博存在多张图片，则每个url以英文逗号分隔，若没有图片则值为'' 视频url: 微博中的视频url和Live Photo中的视频url，若某条微博存在多个视频，则每个url以英文分号分隔，若没有视频则值为'' 微博发布位置：位置微博中的发布位置 微博发布时间：微博发布时的时","default_branch":null,"files":null,"tree":[],"storefront":"/r/dataabc","claimed":false,"request_supported":{"post":"https://gitbuyer.com/r/dataabc/weibo-crawler/request-supported","requests":0},"note":"indexed from public GitHub; nothing is for sale on this page. Clone it from GitHub. Paid listings live at /search."}