{"repo":"hg3386628/zhihu-scraper","free":true,"listed":false,"github":"https://github.com/hg3386628/zhihu-scraper","clone":"git clone https://github.com/hg3386628/zhihu-scraper.git","description":"Python CLI for browser-based Zhihu content extraction with Playwright and optional LLM agents.","language":"Python","stars":12,"topics":["browser-automation","cli","llm","playwright","python","web-scraping"],"license":null,"category":"scrapers-browser-automation","readme_excerpt":"知乎问答爬虫 一个强大的知乎问题爬虫工具，支持AI代理和手动浏览器两种模式，能够高效抓取知乎问题及其所有回答。使用先进的浏览器自动化和反检测技术，有效绕过知乎的防爬机制。 功能特点 - 双模式爬取 - 🤖 AI代理模式 : 利用大型语言模型控制浏览器（基于browser-use库） - 🌐 手动浏览器模式 : 直接使用Playwright控制浏览器，更可靠但较慢 - 多种LLM支持 - 支持OpenAI、DeepSeek、Anthropic Claude、Google Gemini等多种模型 - 自动适配可用的API密钥 - 登录支持 - 通过Cookie实现登录，获取完整内容（包括登录后才能查看的内容） - 内置登录命令，方便保存登录状态 - 智能Cookie处理，自动生成必要参数 - 高级反检测 - 内置多种浏览器指纹伪装技术 - 模拟人类行为的浏览模式 - WebGL、Canvas、AudioContext等多维度指纹修改 - 数据存储 - 自动保存为Markdown格式 - 按点赞数排序，便于查找高质量内容 - 智能合并多个回答，减少文件数量 - 用户友好 - 支持命令行和API两种使用方式 - 详细的日志输出，便于排查问题 系统要求 - Python 3.11+ (browser-use库的要求) - 操作系统 : Windows、macOS或Linux - 内存 : 建议4GB以上 - 网络 : 稳定的互联网连接 - 存储 : 取决于抓取内容的多少 安装方法 方法1: 通过pip安装（推荐） 方法2: 从源码安装 配置环境 创建 .env 文件并配置以下参数（可选但推荐）: 使用方法 命令行使用 现在，zhihu-scraper 工具支持多种子命令： 代码中使用 输出结果 抓取的内容将保存在指定的输出目录中（默认为 output/问题ID/ ），包括： 常见问题 1. API密钥错误 问题: 出现 API密钥无效 或 未找到API密钥 错误。 解决: 确保在 .env 文件或命令行参数中提供了有效的API密钥。不同的模型需要不同的API密钥。 2. 安装依赖失败 问题: 安装时出现 Could not find a version that satisfies the requirement 。 解决: 确保Python版本≥3.11，可以使用 python --version 查看版本。 3. 无法获取登录后内容 问题: 只能获取未登录可见的内容。 解决: 使用 zhihu-scraper login 命令进行手动登录，保存登录状态后再运行爬虫命令。 4. 浏览器启动失败 问题: 出现 Browser launch failed 错误。 解决: 运行 playwright install 安装浏览器，或确保系统中有可用的Chromium浏览器。 开发与贡献 欢迎贡献代码和提出建议: 项目结构 法律声明 - 本工具仅供学习和研究使用，请遵守知乎的使用条款和robots.txt规则 - 使用本工具抓取的内容，版权归原作者所有 - 请勿用于商业用途或大规模爬取 - 使用频率过高可能导致IP被限制，请合理控制爬取频率 许可证 MIT License © 2023","default_branch":null,"files":null,"tree":[],"storefront":"/r/hg3386628","claimed":false,"request_supported":{"post":"https://gitbuyer.com/r/hg3386628/zhihu-scraper/request-supported","requests":0},"note":"indexed from public GitHub; nothing is for sale on this page. Clone it from GitHub. Paid listings live at /search."}