注册并分享邀请链接,可获得视频播放与邀请奖励。

AI奶爸 (@zstmfhy) “📢 百度昨天刚开源了一个很有意思的 OCR:Unlimited OCR 名字就很狂——"无限"。 看完技” — TopicDigg

AI奶爸 的个人资料封面
AI奶爸 的头像
AI奶爸
@zstmfhy
AI奶爸 · 万象AI实验室共创者 系统分析师 × 现AI创作者 | 专注AIGC创作 用AI画图、写漫剧、做视频,把技术变成故事 🎨 每周分享:漫画分镜AI化 | 视频生成流程 🚀 实操教程 + AI编程 | 适合AI创作的新手与进阶者 🤖 技术不该高冷,创作可以很暖 合作:ZST321456
加入 June 2024
447 正在关注    28.4K 粉丝
📢 百度昨天刚开源了一个很有意思的 OCR:Unlimited OCR 名字就很狂——"无限"。 看完技术报告,核心就一句话:它让 AI 像人类一样"抄书"。 ✅️ 完整图像信息始终可见,不会丢 人类抄书时眼睛始终能看到原书,R-SWA 让每个生成的 token 都能 attend 到所有视觉 token,视觉特征不会像传统滑动窗口那样逐步模糊。 ✅️ 输出端只保留最近 128 个 token 就像人类只会偶尔瞄一眼刚写的几个字确认进度,不会把整本书背下来。这个设计让模型自主追踪解析进度,实现"软遗忘"。 ✅️ KV Cache 恒定,一次前向推理直接转录数十页 没有分段,没有拼接,没有"忘了前面写了什么"的尴尬。32K 标准上下文下,整篇论文丢进去一次性输出。 📊 更狠的是性能 从视频演示看,它直接把整篇技术报告(十几页)丢进去,一次性输出完整结构化结果——标题、正文、表格、公式、参考文献,全部精准还原。延迟还不随页数增长,传统全注意力越往后越慢,R-SWA 全程稳定。 🔍 报告里的一个"彩蛋" 🤔 但最让我好奇的,是技术报告里的一个「彩蛋」 核心贡献者三位:Youyang Yin、Huanhuan Liu*(项目 leader)、YY†(技术总监)。 前两位用真名,唯独技术总监挂了缩写 "YY"。 YY 是谁?YYDS?DS? 更微妙的是,GitHub 致谢栏把 DeepSeek-OCR 和 DeepSeek-OCR-2 排在了前两位。而 DeepSeek-OCR 系列的核心作者魏浩然,正是春节前后从 DeepSeek 离职、传闻将入职「某大厂」的那位。 国内 OCR 圈不大,能做出 R-SWA 这种级别突破、还对 DeepSeek OCR 架构有「亲手做过」级别熟悉的人,一只手数得过来。 技术报告的行文风格也很有意思——故事性极强、想法激进、带有强烈的探索型色彩。这些标签,此前几乎是 DeepSeek 技术报告的专属。 当然,这只是我看完报告后的一个直觉。百度官方没说什么,我也只是猜猜。 模型已开源,感兴趣去点个 ⭐ 👉GitHub: 👉HuggingFace: 感觉百度最近搞 AI 的路子,真的不太一样了。
显示更多
Unlimited-OCR 🔥New OCR from @PaddlePaddle It can parse hundreds of pages in a single pass while maintaining stable speed. The key idea is R-SWA (Reference Sliding Window Attention), which keeps KV cache constant during decoding. 🏆 93% on OmniDocBench 📈 +6% over DeepSeek-OCR
显示更多