注册并分享邀请链接,可获得视频播放与邀请奖励。

露西的百宝箱 (@Lucy_love_AI) “网页爬虫迎来重大升级。 PixelRAG 不读 HTML,它像你一样读网页。 100% 开源。 与其将” — TopicDigg

露西的百宝箱 的个人资料封面
露西的百宝箱 的头像
露西的百宝箱
@Lucy_love_AI
加入 January 2024
0 正在关注    0 粉丝
网页爬虫迎来重大升级。 PixelRAG 不读 HTML,它像你一样读网页。 100% 开源。 与其将网站解析为纯文本,不如直接截图,让视觉模型从像素中检索答案。 为什么这很重要: • HTML 解析器会无声地丢失信息 • 表格、图表、公式和布局经常消失 • 仅更改解析器就能让 RAG 准确度波动约 10% PixelRAG 绕过整个瓶颈。 它索引的是用户真正看到的内容。 团队构建了 3000 万+ 维基百科截图的视觉索引,在纯文本问答上的表现比最强的基于文本的 RAG 基准高 18.1%。 更酷的是: 它包含 Claude 代码插件,赋予 Claude 视觉浏览能力。 Claude 可以截图任何网页、PDF、arXiv 论文或本地应用,并基于渲染页面回答问题。 流程出人意料地简洁: → 将页面渲染为图像块 → 用 Qwen3-VL-Embedding 嵌入(在截图上微调 LoRA) → 存储在 FAISS 索引中 → 视觉搜索 最棒的是? 升级到更好的视觉模型后,无需重建索引。 因为索引存储的是像素,不是解析文本。 GitHub:
显示更多