这个精简 OCR 模型,能一次性处理完整 100 页 PDF。
它叫 Unlimited OCR,只有 3B 参数,完全跑在本地硬件上。
大多数 OCR 工具会把文档拆成单页,丢失整体上下文。这个模型用连续方式一次读完整个文档。
单次长程解析,32K 上下文窗口
默认支持多语言
标准解析基准上准确率 93%,比基线高 6 个点
超过 40 页后错误率仍低于 0.11
完全离线运行,不依赖云端
兼容 Transformers、vLLM、SGLang、Docker、Ollama 和 llama.cpp
传统云 OCR 服务如 Textract、Google Vision、Azure Document Intelligence,每 1000 页通常收费 $1.50 到 $15。
这个模型跑在你自己的硬件上,用多久都不花钱。
百度开发它就是为了超越 DeepSeek OCR。Hugging Face 上已有 190 万下载,但大部分用户还不知道。
100% 开源。
显示更多