Codex、WorkBuddy 等 Agent 已经能读取 PDF。面对扫描件、多栏排版、跨页表格和公式时,解析质量仍会直接影响后续的检索、问答和数据提取。
Mac 上可以本地运行的 PDF parser 很多,PaddleOCR、GLM-OCR、MinerU 等工具的安装方式和运行环境各不相同。文档类型变化后,想换一个 parser 重新处理,通常还要重新配置。
DocDot
@docdotai 把多个本地 parser 集中到了同一个 CLI 中管理。
官方安装命令:
curl -fsSL | bash
安装 DocDot 后,可以在 NanoDoc、PaddleOCR、GLM-OCR、MinerU、LiteParse 之间安装和切换,并将 PDF 解析为 Markdown 或 JSON。后续还会继续增加新的 parser。
DocDot 也提供了 Web Mode。运行 `docdot web` 后,可以在浏览器中并排比较 3 个 parser 的结果。遇到复杂表格、公式或特殊排版时,可以根据实际输出选择更合适的解析器。
根据官方说明,安装程序还能扫描本机的 Codex、Claude Code、OpenClaw、Hermes 等 Agent,并配置相应的 Skill;需要接入其他应用时,也可以通过 MCP 调用。解析在本机运行,PDF 无需上传,目前主要面向 Apple Silicon Mac。
我在 Mac 上安装了 DocDot 和 NanoDoc,并准备了一页包含中英文、表格和公式的 PDF。
首次启动完成模型编译后,再次解析同一份 PDF 用时约 2.3 秒。正文和公式基本准确,表格结构得到保留,小字号表头仍有少量误识别。
这只是一份单页样本,不能替代完整的性能测试。官方技术报告使用了 4,231 页、64 类文档进行比较,NanoDoc 的综合质量和 Table TEDS 在参测解析器中均排名第一。
DocDot 今天在 Product Hunt 上线: