网页爬虫迎来重大升级。
PixelRAG 不读 HTML,它像你一样读网页。
100% 开源。
与其将网站解析为纯文本,不如直接截图,让视觉模型从像素中检索答案。
为什么这很重要:
• HTML 解析器会无声地丢失信息
• 表格、图表、公式和布局经常消失
• 仅更改解析器就能让 RAG 准确度波动约 10%
PixelRAG 绕过整个瓶颈。
它索引的是用户真正看到的内容。
团队构建了 3000 万+ 维基百科截图的视觉索引,在纯文本问答上的表现比最强的基于文本的 RAG 基准高 18.1%。
更酷的是:
它包含 Claude 代码插件,赋予 Claude 视觉浏览能力。
Claude 可以截图任何网页、PDF、arXiv 论文或本地应用,并基于渲染页面回答问题。
流程出人意料地简洁:
→ 将页面渲染为图像块
→ 用 Qwen3-VL-Embedding 嵌入(在截图上微调 LoRA)
→ 存储在 FAISS 索引中
→ 视觉搜索
最棒的是?
升级到更好的视觉模型后,无需重建索引。
因为索引存储的是像素,不是解析文本。
GitHub:
显示更多