{"repo":"lemonmindyes/bilibili_comment_crawl","free":true,"listed":false,"github":"https://github.com/lemonmindyes/bilibili_comment_crawl","clone":"git clone https://github.com/lemonmindyes/bilibili_comment_crawl.git","description":"爬取bilibili视频下的评论，最新出品！！！⚠本代码只适用于学习，做其他事情概不负责！！！","language":"Python","stars":69,"topics":["python","crawler","requests","spider","bilibili","corpus-data"],"license":null,"category":"scrapers-browser-automation","readme_excerpt":"&#x1F308;&#x1F308;&#x1F308;bilibili评论爬取&#x1F308;&#x1F308;&#x1F308; 如果遇到代码已经无法运行了请及时提醒我，可以提Issues，我会尽快更新！！！！！！ 本人比较喜欢做情感分析的NLP项目，因此突发奇想想到去B站收集信息。 1、声明 2、url参数解析 3、如何爬取想要的视频评论 4、核心代码 5、BUG提示 6、资源包获取方式 ⭐ 重点 ：但是本项目只是学习使用，如果用作任何其他用途，本人概不负责！！！⚠⚠⚠ ⭐ 声明&#x1F379;&#x1F379;&#x1F379; 该项目只适用学习其他任何用途均不可使用！！！ 该项目只适用学习其他任何用途均不可使用！！！ 该项目只适用学习其他任何用途均不可使用！！！ url参数解析（2024.9.22当前api还能使用，请大家放心食用）&#x1F37A;&#x1F37A;&#x1F37A; expample: https://api.bilibili.com/x/v2/reply/main?csrf=40a227fcf12c380d7d3c81af2cd8c5e8&mode=3&next={}&oid=860478472&plat=1&type=1 csrf：固定是40a227fcf12c380d7d3c81af2cd8c5e8（不太清楚含义） mode：应该是一种模式 （也不太清楚含义） ⭐ next ：按照实验应该是一个起始页的指示，可以从0开始 ⭐ oid ：代表每个视频的唯一标识 plat：不清楚含义 type：不清楚含义 - ⭐ 重点 ： 修改一词next的值可以爬取到20条评论 ，这个我没有分析出来是哪个参数控制的，但是大家也不要去修改，毕竟是学习不要去恶意修改其他的参数。 - ⭐ 重点 ： 核心参数只需要修改；1、oid：视频唯一标识码；2、next：评论起始页（从0开始） 如何爬取想要的视频评论&#x1F345;&#x1F345;&#x1F345; 步骤： - 1、找到自己想要爬取视频的oid - 2、设置url比如： - 3、如何爬取到所有的comment（⭐重点） 因为我首先没有先去找所有的评论到底有多少，因此需要自行进行逻辑判断，我的方法是： 核心代码&#x1F30F;&#x1F30F;&#x1F30F; BUG提示（⚠⚠）&#x1F30F;&#x1F30F;&#x1F30F; - 1、有时候爬取了一会就会碰到不足20条的数据，这时候根据我的代码逻辑，就会直接退出爬虫（已修复该 bug ，更改了新的爬虫停止逻辑） - 2、有时候怕爬取会中途中断解决，采用了重试机制(2024.9.22修复) - 3、 新的bug坑等着大家来提出 因为api接口已经变成了wbi加密的所以原来的接口寻找方式已经没用了，所以下面的方法就删除了，降低大家的阅读难度。(2024.9.22修改) Star History","default_branch":null,"files":null,"tree":[],"storefront":"/r/lemonmindyes","claimed":false,"request_supported":{"post":"https://gitbuyer.com/r/lemonmindyes/bilibili_comment_crawl/request-supported","requests":0},"note":"indexed from public GitHub; nothing is for sale on this page. Clone it from GitHub. Paid listings live at /search."}