{"repo":"yuchenzhu-research/zhihu-scraper","free":true,"listed":false,"github":"https://github.com/yuchenzhu-research/zhihu-scraper","clone":"git clone https://github.com/yuchenzhu-research/zhihu-scraper.git","description":"高性能知乎内容提取器：基于 curl_cffi 纯协议引擎，支持智能降级 Playwright。高保真提取文章、图片、数学公式，支持 Markdown + SQLite 双记录，内置炫酷 TUI 交互面板","language":"Python","stars":23,"topics":["image-downloader","knowledge-base","markdown","playwright","python","python3","web-scraper","zhihu"],"license":"MIT","category":"scrapers-browser-automation","readme_excerpt":"Zhihu-Scraper 把一个知乎链接变成可读、可迁移的本地归档 简体中文 · English Zhihu-Scraper 是一个本地优先的知乎归档工具。输入文章、回答、问题、专栏或独立视频链接，程序会先尝试轻量 HTTP/API 抓取，再按设置回退到浏览器，并把统一的内容模型保存为 Markdown 和本地媒体；离线 HTML 可按需开启。 项目面向两类使用者：希望研究工程化爬虫的开发者，以及希望让 Codex 等 Agent 代为执行命令的普通用户。它没有 TUI、云端账号或前端构建系统，公开入口保持为一个 CLI 和一个 Python 函数。 [!CAUTION] 仅将本项目用于学习、研究和个人合法归档。请遵守知乎服务条款、robots 规则、内容著作权、隐私要求和所在地法律；不要绕过付费、私密或无权访问的内容，也不要高频请求或把含个人信息的归档再次公开。 当前可用范围 输入链接 归档行为 --- --- https://zhuanlan.zhihu.com/p/ 单篇文章及其所属专栏信息 https://www.zhihu.com/question/ /answer/ 指定的单个回答 https://www.zhihu.com/answer/ 指定的单个回答 https://www.zhihu.com/question/ 分页抓取问题下的多个回答，并合并为一个文档 https://www.zhihu.com/column/ 专栏目录和专栏内文章 https://www.zhihu.com/zvideo/ 独立知乎视频 正文解析覆盖段落、标题、列表、引用、表格、代码、链接、图片、动图和 TeX 数学公式。独立视频自动选择已知尺寸最大的清晰度；下载中断时保留 .part 文件，下次对同一目标再次归档会使用 HTTP Range 续传，并在服务端提供长度时校验最终字节数。单张正文图片、动图或封面失效不会毁掉整篇归档：程序会继续保存正文和其他媒体，并在报告中列出失败项；未下载的远程媒体只显示为普通链接，不会在打开 HTML 时自动请求。独立视频主文件失败则明确报错。 暂不支持专栏合集、内嵌于文章/回答的视频、作者主页、搜索结果、想法、收藏夹和盐选内容。 默认一次抓取会保存什么 不添加额外参数时，一次正常抓取会保存： - 标题、作者、原始链接、发布时间和可获得的赞同数。 - 段落、标题、列表、引用、表格、代码、超链接和 TeX 数学公式。 - 正文图片、动图、封面；独立 zvideo 还会保存描述、原始链接和已知尺寸最大的清晰度。 - 文章的所属专栏信息，回答对应的问题信息，问题详情及全部可访问回答，或者专栏简介、目录及全部可访问文章。 - 可阅读的 .md 和成功下载的 media/ 文件。 默认 不生成 HTML，也不抓评论 。传入 --html 才生成可直接双击打开的离线 .html 和本地样式；传入 --comments 才抓取最多 10 条一级评论及每条最多 10 条二级回复。两个选项也可以在设置文件中长期开启。项目不创建 SQLite 数据库、原始 JSON、搜索索引或知识图谱；PDF 仍未实现。 安装 需要 Python 3.12 或更高版本。建议保留项目自己的 .venv ，避免污染系统 Python。 macOS / Linux 安装脚本 脚本会一次安装项目依赖和项目管理的 Chromium 浏览器；在 Linux 上也会安装浏览器所需的系统库，系统可能要求输入 sudo 密码。 Windows PowerShell 安装脚本","default_branch":null,"files":null,"tree":[],"storefront":"/r/yuchenzhu-research","claimed":false,"request_supported":{"post":"https://gitbuyer.com/r/yuchenzhu-research/zhihu-scraper/request-supported","requests":0},"note":"indexed from public GitHub; nothing is for sale on this page. Clone it from GitHub. Paid listings live at /search."}