{"repo":"vorojar/Folio-OCR","free":true,"listed":false,"github":"https://github.com/vorojar/Folio-OCR","clone":"git clone https://github.com/vorojar/Folio-OCR.git","description":"Open-source batch OCR workbench — a free, local alternative to ABBYY FineReader. Powered by Ollama + GLM-OCR + PP-DocLayoutV3, ~0.5s/page on RTX 4090. Three-panel editor, layout-aware, PDF/image batch processing, Markdown/Word export. 批量OCR工作台，纯本地运行，免费平替ABBYY，适合书籍文档数字化。","language":"Python","stars":459,"topics":["batch-ocr","book-digitization","document-ocr","document-processing","glm-ocr","layout-detection","local-ai","markdown-export","ocr","offline"],"license":"MIT","category":"media-processing","readme_excerpt":"Folio-OCR 基于 GLM-OCR + Ollama 的三栏文档 OCR 工作台，专为书籍和文档的日常批量识别设计。 2026-06-18 · v3.4.0 已发布 ：新增 folio-ocr 命令、 uvx 启动、GitHub Release 包构建、License、CI 和长 PDF 超时配置。查看 Release Notes。 视频演示：先看 B 站 1 分钟真实运行视频，快速理解“上传扫描件 → 本地 OCR → 可编辑/可导出”的完整流程。 30 秒看懂 Folio-OCR 解决的是一个很具体的问题：把扫描 PDF、书籍照片、试卷和文档图片批量转成可编辑文本，并尽量保留标题、正文、表格和导出结构。它默认本地运行，文档不需要上传到第三方 OCR 服务。 - 输入 ：PDF、PNG、JPG、GIF、BMP，可混合批量上传。 - 处理 ：PP-DocLayoutV3 做版面分区，GLM-OCR 通过 Ollama 做视觉 OCR。 - 输出 ：Markdown、TXT、Word .docx 、EPUB。 - 适合 ：书籍数字化、扫描件整理、表格文档转写、离线/隐私敏感 OCR。 快速开始 方式一：uvx / pipx 直接运行 适合已经安装 Python 和 Ollama 的用户，不需要手动 clone 仓库： 然后打开浏览器访问：http://localhost:3000 也可以用 pipx： 方式二：Docker Compose 一键部署 适合想把 Ollama 和 Folio-OCR 一起放进容器的用户： 完成后打开浏览器访问：http://localhost:3000 有 NVIDIA 显卡？编辑 docker-compose.yml ，取消 deploy: 段落的注释即可启用 GPU 加速。 功能特性 OCR 核心 - 支持多种图片格式：PNG、JPG、GIF、BMP - 支持 PDF 文件（PyMuPDF 2x 高分辨率拆页） - 多文件混合上传（图片 + PDF 混选） - 版面分析（Layout Detection）自动分区识别 - 相邻文本区域智能合并，减少 OCR 调用次数（11 区域 → 3 组，2.5x 加速） - LaTeX 特殊字符自动转 Unicode（ $\\textcircled{1}$ → ① ） - 模型输出自动清理 围栏 批量处理 - 一键「OCR All Pages」批量识别全部页面 - 实时进度条 + ETA 时间估算 - 随时可停（Stop 按钮立即中断当前请求） - 选中页面时自动预识别下一页（Pre-OCR） 编辑与导出 - Edit / Preview 双模式切换 - Preview 模式原生渲染 HTML 表格和 Markdown - 段落重排（Reflow）：合并因换行断开的段落 - 导出四种格式： .md （Markdown）、 .txt （纯文本）、 .docx （Word）、 .epub （电子书） - DOCX 导出基于 python-docx，真实 Word 文档，含分节符和页码 - 单页/全文一键复制 数据持久化 - SQLite 数据库（ folio ocr.db ），文档和 OCR 结果服务重启不丢失 - 编辑内容 800ms 防抖自动保存 - 页面加载时自动恢复上次打开的文档 - 多文档管理：左侧面板上方文档列表，支持切换和删除 界面交互 - 三栏布局：页面缩略图 图片预览 OCR 结果 - 右侧面板可拖拽调整宽度 - SSE 流式上传，逐页实时加载 - 版面区域双","default_branch":null,"files":null,"tree":[],"storefront":"/r/vorojar","claimed":false,"request_supported":{"post":"https://gitbuyer.com/r/vorojar/Folio-OCR/request-supported","requests":0},"note":"indexed from public GitHub; nothing is for sale on this page. Clone it from GitHub. Paid listings live at /search."}