注册并分享邀请链接,可获得视频播放与邀请奖励。

与「RAG」相关的搜索结果

RAG 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 RAG 的内容
[开源学习资源] AI Engineering from Scratch 59.8K ⭐️ 作者 @ghumare64 课程共 20 个阶段,以 Python 为主要编程语言,主张在导入任何框架之前,先用纯数学把每个算法手写一遍。 课程地址: 开源地址: 它和常见教程的本质区别 ? 大多数 AI 教程是“API 驱动”的:装个库、调个接口、跑个 demo。这个项目反其道而行,每节课遵循固定的六段结构: Motto → Problem → Concept → Build It → Use It → Ship It 以 Phase 10 的一节课「Tokenizers: BPE, WordPiece, SentencePiece」 为例,这个格式是真实落地的,而且写作质量相当高: · Problem 部分不讲废话,直接从代价切入:“你的 LLM 不读英语,它读整数。分词器决定这些整数是承载意义还是浪费意义”,然后解释为什么 tokenization 不是预处理,它是架构的一部分(影响上下文窗口利用率、API 计费、推理速度)。 · Concept 部分用“三种失败的方案和一种胜出的方案”来讲演化逻辑:词级切分(词表爆炸、[UNK] 问题)→ 字符级切分(序列过长)→ 子词切分(BPE 的折中),并配上真实语料上 BPE 逐步合并的手工演算。 每节约 3000+ 词,带 Mermaid 图、可运行代码和测试。 另外两个设计值得强调: · 每节课产出一个可复用的 artifact,一个 prompt、一个 skill、一个 agent 或一个 MCP server。学完整个课程,你手里有 523 个可展示的作品,不是 523 个跑完就扔的 notebook。 · 强调“证据留存”:保留命令、退出码、输出,作为学习发生的证明。这明显吸收了工程实践中“可验证性”的思路。 # 课程结构:从线性代数到自主智能体集群 20 个阶段构成一条完整的上升曲线,咱们它分成五个大块来看: 基础层(Phase 0–2):环境与工具链、数学基础(线性代数/概率/微积分)、经典机器学习。这是给基础不牢的读者铺的路。 深度学习与感知层(Phase 3–6):神经网络核心、计算机视觉(一路讲到 NeRF、高斯泼溅、世界模型,这已经超出一般教程的覆盖范围)、NLP、语音。 生成与决策层(Phase 7–9):Transformer 深挖、生成式 AI(GAN、扩散模型、flow matching)、强化学习。 LLM 层(Phase 10–12):这是全课程的重心之一。Phase 10 的目录我逐条看过,它不只是“从零实现 GPT”这种常规内容,还包含了相当前沿的论文级主题:DeepSeek-V3 架构走读、DualPipe 并行策略、Native Sparse Attention(NSA)、多 token 预测、Jamba 的 SSM-Transformer 混合架构、 speculative decoding 等。Phase 11 转向应用侧(RAG、LoRA、MCP、可观测性),Phase 12 覆盖多模态(从 CLIP 到 computer-use agent)。 智能体层(Phase 13–16):工具与协议(MCP、A2A、Agent Skills)、54 节课的 agent 工程、自主系统与安全、多智能体集群。这一层的分量很能说明项目的判断:它认为 AI 工程的重心正在从“训模型”转向“构建可靠协作的智能体”。 收尾(Phase 17–19):生产基础设施、伦理与对齐、毕业设计。 # 生态与周边:不只是一个课程仓库 网站:带浏览器本地存储的学习进度追踪、术语表、课程目录和路线图。 六卷本书籍:课程内容由 CI(pandoc)自动构建成 EPUB/PDF,附在 GitHub Releases 上,课程即书,且随仓库持续更新。 Agent 导师模式:运行 npx skills add rohitg00/ai-engineering-from-scratch,可以把整个课程装进 Claude Code、Codex 等编码智能体,变成一个带分级测验(placement quiz)和个性化路径的交互式导师,学习进度写在 LEARNING.md 里。这是“用你正在学的工具来学”的巧妙闭环。 认证备考:5 条备考路径、67 节课、505 道练习题,覆盖 Anthropic 的 Claude 认证和 Agentic AI Foundation 的 MCPA。项目明确声明与这些考试机构无关联,只是独立的备考材料。 12 种语言的翻译(含中文),以及四条核心学习路径(构建与部署 AI 应用、软件工程基础、Agent 辅助工程、产品判断与交付)供不同目标的人选路。
显示更多
0
11
75
16
转发到社区
这个开源项目系统整理了 35 家 AI 公司的 AI 工程师面试题,全部来自 “公开报告的面试经历” 来自 @outcome_school 团队 @pallavishekhar_ 开源发布,内容几乎涵盖了 OpenAI、Anthropic、DeepMind、xAI、DeepSeek、Kimi、GLM 等 AI Labs,Cursor、Cognition、ElevenLabs 等 AI Native 团队和 Nvidia、Microsoft、Amazon、Apple 等头部大厂。 覆盖的岗位头衔也非常多:AI Engineer、LLM Engineer、Gen AI Engineer、ML Engineer、Research Engineer、Applied Scientist、FDE、MLOps/LLMOps 工程师等。 开源地址: # 内容架构:一个精心设计的双层结构 第一层:跨公司通用题(Common Questions)。 作者把在多家公司反复出现的题目只列一次,标注"Asked at"哪些公司,按十大主题组织: 1. LLM 内部机制与架构 — attention 缩放因子、KV cache 内存公式推导、MQA/GQA/MLA、FlashAttention、BPE、RoPE/YaRN、Chinchilla scaling laws、MoE、解码采样策略、lost-in-the-middle、RMSNorm、SwiGLU 2. 推理、服务与 GPU 性能 — prefill vs decode、continuous batching、PagedAttention、投机解码、量化(FP16→FP4)、五种并行策略、TTFT/TPOT 指标、H100 上的 roofline 计算、vLLM/SGLang/TensorRT-LLM 选型、“如何把服务成本降 10 倍” 3. RAG 与检索 — 分块策略、BM25 vs 稠密检索、重排序器、HyDE、权限感知检索、ANN 索引、索引新鲜度、答案归因 4. Agent 与工具调用 — ReAct、MCP、工具 schema 设计、多智能体编排、Agent 记忆、循环终止条件、人类审批 5. 微调与对齐 — RLHF/DPO/GRPO/RLVR 全谱系、LoRA/QLoRA 数学、灾难性遗忘、“提示 vs RAG vs 微调”决策框架、蒸馏、reward hacking 6. 评估与可观测性 — LLM-as-judge 及其偏差、幻觉检测、基准污染、Agent 评估、回归门禁 7. 安全与负责任 AI — 提示注入(直接/间接)、OWASP LLM Top 10、护栏、Constitutional AI、红队 8. 多模态与语音 — VLM、语音 Agent 延迟预算、barge-in 打断处理、级联 vs 端到端语音、ASR/TTS 评估 9. AI 系统设计 — 十类高频设计题(千万级文档企业 RAG、代码助手、客服 Agent、Text-to-SQL、LLM 网关、数亿用户聊天服务等) 10. 编码题 — 从零实现 attention、KV cache、BPE、采样;LRU 缓存、令牌桶限流器、异步批处理器、SSE 流解析器、最小 Agent 循环 第二层:35 家公司的专属章节,分为五大梯队: 1. 前沿实验室(12 家):Anthropic、OpenAI、Google DeepMind、Meta、xAI、Mistral、Cohere、DeepSeek、月之暗面(Kimi)、智谱(GLM)、阿里(Qwen)、Sarvam AI(印度) 2. 大厂 AI 组织:Microsoft、Amazon、Apple、NVIDIA、Tesla,以及一组消费级 ML 公司(Uber/Netflix/LinkedIn/Airbnb/Pinterest/Spotify) 3. AI 基础设施公司:Databricks、Groq、Together AI、Hugging Face、Scale AI、Perplexity 4. AI 原生产品公司:Cursor、Cognition(Devin)、Sierra、Harvey(法律)、Glean、 AI(机器人)、Waymo 5. 前向部署/企业 AI:Palantir # 题目分布透露的行业信号同样值得关注 1. 公司的差异化考察方向,和它的商业模式严丝合缝。 这是最能体现整理功力的地方: · DeepSeek、月之暗面、智谱、Qwen 的题目深度绑定自家论文——MLA、auxiliary-loss-free 负载均衡、Multi-Token Prediction、MuonClip、DualPipe、长上下文扩展、GLM 的 thinking 模式。面试这些公司等于面试它们的论文,还要求 PyTorch 从零实现 MoE 路由。 · Groq 的题全是 SRAM-only 架构下的 roofline 重推演:“没有 HBM,decode 的 roofline 论证哪里变了”、“确定性在 p99 层面到底买到什么”。 · Apple 清一色端侧:3B 模型在手机上跑、PTQ vs QAT、不采集用户内容的前提下用设备信号改进模型、30+ 语言区无法记录用户内容的评估方案。 · CharacterAI 是推理经济学:“我们的服务成本被 KV cache 而非权重主导,降一个数量级,代价是什么”。 · Harvey(法律)和 Abridge(医疗) 考的是领域约束下的工程:200 页信贷协议里第 140 页的条款依赖第 8 页的定义术语怎么检索、生成的病历中出现了患者没提过的药怎么当作安全事故处理、PHI 如何约束整个架构。 · Palantir 的招牌是 "decomposition" 轮:把“一家货运铁路公司每年因机车非计划停机损失数千万”分解成工程计划。 2. 编码轮的形态正在发生实质性变化。 文档里反复出现的一类题,与传统 LeetCode 明显不同: · “实现一个内存 KV 存储:先 SET/GET/DELETE,再加事务 BEGIN/COMMIT/ROLLBACK,包括嵌套事务”(OpenAI、xAI 都问) · “给你一个 LLM 推理引擎的调度器类,其中一个方法是空壳,没有规格没有文档。说说你头三十分钟干什么”(xAI) “重构这 120 行能跑但很乱的代码,不许破坏测试”(OpenAI) · “对 5 万个文档跑 LLM 调用,API 限 100 并发、偶发 429 和超时,把 Python 写出来”(Anthropic) 考察重心从算法记忆转向增量需求下的代码演进能力、并发正确性、真实工程约束下的取舍。 3. “AI 协作轮”作为新题型已经进入正式面试流程。 这是文档里最前沿的信号: · Anthropic 部分机器学习岗有 AI-collaboration 轮:现场给你 Claude,考察的是你如何指挥它和验证它的产出,而不是你自己写。 · Meta 2026 年的流程新增三阶段 AI 辅助编码轮(探索修复 → 实现新功能 → 扩展改进)。 · Cursor 的 onsite 是两天在真实 Cursor 代码库上做一个功能(或 8 小时远程版),明确考核你对 AI 工具的使用效率和自主 scoping 能力。 · Sierra 给你两小时和任意 AI 工具,看你选择做什么。 xAI 有四小时限时产品构建。 4. FDE 成为一级岗位类别。 Anthropic、OpenAI、Databricks、Scale、Together、Sierra、Harvey、ElevenLabs、Palantir 的章节里都有 "Applied and Forward-Deployed Scenarios" 专属题库——典型题目如“企业客户说 Claude 幻觉太多,你是驻场工程师,头 48 小时做什么”。这对应了 AI 公司向企业交付方式的转变:模型能力差距收窄后,落地能力成为差异化。 5. 硬核系统题的普及。 "H100 上 70B 模型 batch size 1 的 roofline 计算"、"估算 70B 模型的 GPU 显存(权重 + KV cache + 激活 + 碎片)"、"p99 延迟在部署后翻倍但模型没变,走一遍诊断”——这类题横跨 NVIDIA、Together、OpenAI、Perplexity 等多家,说明推理性能的量化直觉已成为 AI 工程师的通用素养,而非基础设施工程师的专属。
显示更多
现在看候选人简历,人均 LLM + RAG + LangChain + 向量数据库 + MCP,拿几十篇内网文档搓一个内部问答系统。 越来越有前几年人均谷粒商城贡献者的感觉了。
0
65
714
27
转发到社区
[RAG 论文分享] VikingRAG:匹配 SOTA 准确率、Token 成本降到 5%–32% 现有问题:RAG 高准确率依赖结构上下文与多轮交互,是 token 开销的主要来源 企业问答、法律、财报等场景的语料都是章、节、段落组成的结构化文档,结构本身就是检索线索,它指示事实归属与局部和全局的关联。 现有 RAG 方法陷入两难:不用结构(朴素向量 RAG、图 RAG、SQL-RAG)丢失导航线索,准确率低;用结构(MoDora、BookRAG、DeepRead)准确率高,但 DeepRead 要把候选文档的完整目录塞进 prompt,开销随目录规模线性增长,加上多轮交互历史不断累积,token 成本巨大。 论文地址 # 三个核心设计 1. 层次化语义存储:把结构从 prompt 搬进可查询的外部状态。 文档分块后保留所属结构节点,自底向上生成节点摘要,目录、块、摘要全部物化为 URI 可寻址对象(如 viking://Pasta/Carbonara/),祖先-后代关系编码为 URI 前缀。系统向代理暴露 Search / List / Grep / Read 四个工具,语义与结构路径共享同一 URI 空间。效果:结构 token 与实际访问的目录片段成正比,而非与完整目录成正比——直接消解 DeepRead 的线性开销。 2. 证据缺口驱动的多轮检索。 Agent 每轮判断证据是否充分,不充分则继续调用工具(轮数预算 B=15),充分即作答。设计哲学是粗定位与细验证分离:Search 锚点 → Read 查看后发现缺口 → List 相邻块 → Grep 精确命中 → Read 验证,每步把搜索空间收窄到相关子树内。 3. 经验边 + 自适应升级——让相似查询不必重复探索。 经验边从历史检索轨迹中把“Search 命中的 URI”连向“真正支撑答案的 URI”,边上存历史问题嵌入做查询时过滤;新查询沿边做条件化多跳扩展,复用路径而非重新探索(VikingRAG-E)。经验积累足够后,多数查询一轮检索即可作答——用约束感知的充分性判断器先验证证据是否支撑答案的关键约束,验证不过关才升级为完整多轮代理检索(VikingRAG-E+)。 # 实验结果:token 降至 SOTA 的零头 6 个真实结构化文档数据集(从 0.24M 词元的课程大纲到 8.78M 词元的财报),8 个基线,骨干 LLM 为 DeepSeek-V4-Pro,并在 GPT-5.5、Seed-2.0、GLM-4.7 上验证稳健性。主要结论: · 准确率与所有基线持平或更高(DeepRead 通常是最强基线); · 基础版 VikingRAG 仅消耗 SOTA 方法的 11.6%–51.9% token,完整版 VikingRAG-E+ 降至 5.1%–32.5%,延迟同样显著更低; · 逐层消融:经验边再省 12%–33% token,自适应升级再省 19%–50%; · 可扩展性:LightRAG、HippoRAG-2 在最大数据集上 24 小时内无法完成摄入,BookRAG 在多数数据集上超时;而 VikingRAG 在文档数从“仅相关文档”增至 991 篇时性能基本稳定——因为它是按需定位,不随语料规模膨胀; · 存储方面:插入延迟与 DeepRead/MoDora 相当、远快于图方法;代价是摄入期 token 更高(为每个索引对象生成预览);文档删除零 LLM 成本。
显示更多
平时写产品技术文档,经常要做架构/流程/时序图之类 Diagram,Mermaid 默认也能做不过美观度确实一般,找了几个 Diagram Skills,分享给需要的朋友们。 1. Diagram Design 36.7K 🌟 @cathrynlavery 编辑向图解 Skill,约 39 种类型,自包含 HTML+SVG;可品牌化配色,支持从 draw. io / Mermaid / Excalidraw 重绘。做演示、文章配图优先装这个。 2. Archify 56.2K 🌟 可校验系统图 Skill;typed JSON IR → 架构/工作流/时序/数据流/生命周期交互 HTML,支持 Before/After 对比与导出。 3. Fireworks Tech Graph 11.3K 🌟 @teach_fireworks 自然语言出技术图;几何校验 SVG+PNG,可选语义 GIF;12 风格、完整 UML,内置 RAG/Multi-Agent 等模式。 4. Excalidraw Diagram Skill 4.7K 🌟 @cole_medin 生成可编辑 Excalidraw 图;强调「视觉论证」与渲染自检,适合白板协作后再手改。 5. Visual Explainer 9.7K 🌟 @nicopreme 把架构图、diff 评审、计划审计、表格等做成整页 HTML 或杂志风幻灯,偏「一页讲清楚」。
显示更多
0
22
82
24
转发到社区
We're introducing Q2D-Web (Query2Doc-Web), a benchmark and public leaderboard for evaluating retrieval in agentic RAG systems. Q2D-Web tests how embedding models perform on large-scale web search using agent-reformulated search queries. Read more:
显示更多
0
7
107
18
转发到社区
CS 329Z: Engineering AI Agents Stanford / Fall 2026 @stanfordnlp 课程定位:从"模型"到"系统"的工程学 覆盖:简单 LLM 流水线 → 复合 AI 系统 → 自主 Agent。三位讲师的背景也高度互补: @Diyi_Yang(斯坦福 NLP 教授,人机交互与社会计算方向) @michaelryan207(DSPy 核心贡献者,自动评估 AutoMetrics 作者) @jyangballin(SWE-agent / SWE-bench / SWE-smith 作者,软件工程 Agent 领域最重要的研究者之一) # 课程主线:三大工程挑战 贯穿全课的三个核心问题——分解(decomposition)、数据(data)、评估(evaluation)。11 周的内容基本围绕这三条线展开,可以分为五个模块: 模块 1:构建基元(Week 2–3) · LLM 作为构建材料:API/SDK(litellm)、结构化输出、约束生成、解码策略、test-time compute、上下文工程、模型选型与成本/延迟权衡 · RAG:embedding、向量库、分块策略、混合检索、cross-encoder 与 ColBERT 后期交互 · 工具调用:函数调用 API、MCP(Model Context Protocol)、工具设计、代码沙箱、错误处理与重试 模块 2:框架与设计模式(Week 3–5) · 框架层:DSPy(signature / module / optimizer)、LangChain/LangGraph、LlamaIndex,重点是"框架抽象了什么 vs. 你手写了什么" · 设计模式:workflow vs. agent 的分类学,五种可组合 workflow 模式,ReAct / plan-and-execute / reflection,"scaffold(脚手架)本身就是设计决策" · 记忆架构:短期/长期记忆、记忆作为工具动作、文件系统作为外化记忆、跨 Agent 记忆(MemGPT、Mem0、Generative Agents) · 多 Agent 系统:编排模式、handoff 与状态传递,以及一个很有态度的对照阅读——既读 AutoGen,也读《Why Do Multi-Agent LLM Systems Fail?》和 Neubig 的《Don't Sleep on Single-agent Systems》 模块 3:优化(Week 5) · 从提示词到微调的全景:GEPA、MIPROv2、OPRO、TextGrad(提示优化);LoRA/QLoRA、蒸馏、RLHF/DPO(权重优化);test-time scaling(推理算力) · 核心问题是决策框架:什么时候优化 prompt、什么时候优化 weights、什么时候堆推理算力 模块 4:数据与评估(Week 6–8)——最有分量的部分 · 数据:trace、demonstration、feedback 三类数据;训练数据 vs. 评估数据;数据飞轮;合成数据;从 Agent 轨迹构建数据集(SWE-smith) · 评估基础:为什么 eval 难;4 元组框架(request / environment / stopping criteria / scorer);好 benchmark 的性质;tinyBenchmarks · 评估基础设施:三类 grader、LLM-as-judge 的 prompt 设计与已知偏差、pairwise vs. pointwise、非确定性指标 pass@k vs. pass^k、harness 设计 模块 5:安全与前沿(Week 8–11) · 安全:工具访问的隐私风险、prompt injection(含间接注入)、红队、沙箱与权限模型、输出护栏、human-in-the-loop · Coding Agent:SWE-agent、Claude Code、OpenHands 的端到端架构对比 · 主动式 Agent:从 reactive 到 proactive,General User Models(GUM)、Next Action Prediction,以及"Agent 何时应主动、何时应等待"的 mixed-initiative 问题 · 开放问题:多模态/web/计算机使用 Agent、科学 Agent、长时运行架构、生产可观测性(tracing、monitoring、成本管理) # 作业设计:一手建、一手评 HW1:从零构建 Agent 系统(10%) 给定论文库,构建能检索并推理回答科学问题的 Agent。 · Part A:只用 litellm 手写 RAG + 工具调用 + ReAct 式 Agent 循环 · Part B:用 DSPy 重建关键组件,并反思框架抽象了什么 HW2:评估一个 Agent(10%) 给定一个预构建 Agent,设计完整评估套件:代码型 grader、至少一个 LLM-as-judge、用 4 元组框架构建 benchmark 任务、错误分析。
显示更多
0
23
148
30
转发到社区
Agent = Model + Harness:生产级 AI 智能体工程六层实战手册 结合 Mitchell Hashimoto、OpenAI Codex 团队、Martin Fowler、LangChain、Cursor 等公开工程资料编撰。 # Agent = Model + Harness 模型只提供推理能力,决定 Agent 能否从演示走向生产环境的是围绕模型的工程基础设施——Harness。 报告的核心论据是:只改 Harness、不换模型,收益可超过模型升级: · 同一 Claude Sonnet 4.5 在 GAIA 基准上从 30.91% 升至 74.55%(+43.64 分),差异完全来自 Harness; · LangChain 不改模型,仅靠 Harness 优化将 Terminal Bench 排名从第 30 提升至第 5; · OpenAI 团队 5 个月、约 1500 个自动化 PR 产出 100 万行生产代码,零人工手写——人负责设计环境,Agent 负责写代码("Humans steer. Agents build.")。 这也解释了一个行业现象:约 95% 的企业 AI Agent 止步于预生产阶段——演示效果好,却因安全审查、可观测性、边界情况幻觉、治理缺失而无法上线。 # 行业定位:AI 工程的第三个时代 1. 提示词工程(2023–24):模型"说什么" 2. 上下文工程(2025):模型"看到什么"(RAG/MCP/记忆) 3. Harness 工程(2026):模型"能做什么" # 六层架构(报告主体) 1. Guides 引导层(前馈控制):AGENTS.md / CLAUDE.md 等规则文件,在执行前塑造行为。要点:规则必须可执行、可验证、可追溯至真实失败案例;需定期修剪,否则 200 行无日期规则就是技术债。OpenAI 内部将其视为最高事实源——文件与会话冲突时,文件优先。 2. Sensors 传感层(反馈控制):执行后验证输出。优先使用确定性、零成本的计算型传感器(linter、测试、schema 校验);LLM-as-judge 等推理型传感器慢、贵、不确定,只用于无法用规则表达的语义判断,且应作参考信号而非硬门禁。 3. Agentic Loop 执行循环:计划→执行→验证→修复→前进或升级,必须有界——默认每步最多重试 3 次、30 分钟、10 万 token、5 美元、50 次工具调用。预算耗尽时返回最佳半成品并说明原因,不允许用流利的最终答案掩盖部分失败。正确升级的 Agent 比自信地给出错误答案的 Agent 更有价值。 4. Memory 记忆层:模型每次会话都从零开始,Harness 负责状态连续性。最简方案是文件系统(plan.md、decisions.jsonl、checkpoint),对多数场景比向量数据库更便宜可靠。检验标准:中途关闭会话重开,Agent 应能断点续作。 5. Permissions 权限层:模型无法自我约束,Harness 是唯一安全边界。按范围、速率、可逆性、可见性四个维度设定能力预算;不可逆操作(部署、删除、外发消息)必须人工批准;必须隔离可信指令与不可信数据以防提示注入。 6. Observability 可观测层:结构化日志 + 成本归因 + 熔断告警(trip wire)。真正的度量不是 token 数,而是无需人工干预即完成且证据合格的任务数;成本应按"每个验证通过的结果"而非按天计算。 # 方法论精髓:棘轮原则(Ratchet) Hashimoto 的原始定义:"每当 Agent 犯错,就工程化一个方案,让它永远不再犯这个错。" 六步循环:复现失败→归类根因→选择最强修复层→编码修复→验证防复发→监控回归。 修复强度呈阶梯上升:对话补丁 < 提示词 < 引导规则 < 传感器 < 环境约束——提示词只修一次对话,环境约束让错误在结构上不可能发生。 Cursor 的 Lauren Tan 补充了实操信号:同一条评审意见出现三次,就应固化为结构性约束。Harness 成熟的标志是规则增速下降(从每天 5 条降到每周 1 条)。 # 落地路径与边界 七天最小可用路径:Day 1–2 建引导文件 → Day 3–4 接入测试套件与有界循环 → Day 5–6 加检查点与权限 → Day 7 加日志与熔断。之后按"一次只改一层、可度量、可回滚"扩张,完成率 ≥80% 等六道闸门全过才允许扩大规模。 何时不需要 Harness:一次性问答、创意脑暴、低风险个人任务——"如果以上都不适用,对话本身就是 Harness"。 多智能体扩展:需要类型化交接("done, looks good" 不能推进生产流程)、共享状态模型而非共享上下文(避免上下文污染)、以及生产者不可覆盖的独立验证者。
显示更多
0
10
65
14
转发到社区
在超过几十种的文档格式中,Markdown 目前还是对 Agent 最友好的格式,应该没有之一。 为了最大化企业和个人知识库的价值,让 Agent 能懂你的企业和你自己,即使有 WorkBuddy <-> 企微、千问办公 <-> 钉钉、豆包工作 <-> 飞书 这样的天然生态打通优势,在企业网盘、硬盘、知识库里吃灰的文档,还是要转为 Markdown 才能更好的被 Agents 用起来。 分享几个我自己平时在用的 Markdown 文档格式转换项目,朋友们可以根据自己环境内当前的文档实际情况来选择用哪个。 1. anydoc 18.8k 🌟 Firecrawl 最新开源,评价很高,文档格式覆盖很全、解析很快。纯 Rust 零依赖,把 Word/PPT/Excel/PDF 等 14 种格式毫秒级转成 LLM 可用的 GFM Markdown。 2. MinerU 78.6k 🌟 OpenDataLab (上海 AI Lab) 开源,在 anydoc 之前是我自己主力用的。它基于 1.2B 视觉语言模型的高精度文档解析器,专攻 PDF 的公式、表格与中文版面,OmniDocBench 榜首。 3. MarkItDown 176.6K 🌟 微软开源,开源之初声量极高,不过解析能力上限不如前两个。轻量 Python 工具,把 ~25 种文件(Office/PDF/图片/音频/HTML 等)统一转成 Markdown 喂给 LLM。 4. Docling 65.7k 🌟 IBM Research 开源,MIT 许可,企业级文档智能工具包,多格式解析为带类型的结构化文档树(DoclingDocument),为 RAG 而生。 5. Marker 39.3k 🌟 Datalab 开源,基于 Surya 模型套件的高速 PDF 转 Markdown/JSON 工具,GPU 批量吞吐可达 ~120 页/秒。 最后附上一个简单对比测试,供大家参考吧,实际表现还要基于具体环境测试(项目/速度/硬件要求) 1. anydoc 中位 4.7ms/文档 Ryzen 9 9950X3D,纯 CPU,100 个真实文档(14 种格式) 2. MinerU 0.21s/页(L4 GPU)、2.12 页/秒(A100) VLM 路径必须 GPU(≥8GB 显存) 3. MarkItDown 中位 134.8ms/文档;整份 PDF 约 0.6–1.1s 同上 CPU;比 Docling/Marker 快 50–100 倍 4. Docling 513.6ms/文档(Office);PDF 约 3.1s/页 CPU、0.49s/页 GPU CPU 可跑,GPU 明显加速 5. Marker 批量最高 ~120 页/秒(H100);B200 上 2.9–23.7 页/秒 GPU 才有意义,CPU 模式很慢
显示更多