注册并分享邀请链接,可获得视频播放与邀请奖励。

与「LangChain」相关的搜索结果

LangChain 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 LangChain 的内容
现在看候选人简历,人均 LLM + RAG + LangChain + 向量数据库 + MCP,拿几十篇内网文档搓一个内部问答系统。 越来越有前几年人均谷粒商城贡献者的感觉了。
0
65
714
27
转发到社区
CS 329Z: Engineering AI Agents Stanford / Fall 2026 @stanfordnlp 课程定位:从"模型"到"系统"的工程学 覆盖:简单 LLM 流水线 → 复合 AI 系统 → 自主 Agent。三位讲师的背景也高度互补: @Diyi_Yang(斯坦福 NLP 教授,人机交互与社会计算方向) @michaelryan207(DSPy 核心贡献者,自动评估 AutoMetrics 作者) @jyangballin(SWE-agent / SWE-bench / SWE-smith 作者,软件工程 Agent 领域最重要的研究者之一) # 课程主线:三大工程挑战 贯穿全课的三个核心问题——分解(decomposition)、数据(data)、评估(evaluation)。11 周的内容基本围绕这三条线展开,可以分为五个模块: 模块 1:构建基元(Week 2–3) · LLM 作为构建材料:API/SDK(litellm)、结构化输出、约束生成、解码策略、test-time compute、上下文工程、模型选型与成本/延迟权衡 · RAG:embedding、向量库、分块策略、混合检索、cross-encoder 与 ColBERT 后期交互 · 工具调用:函数调用 API、MCP(Model Context Protocol)、工具设计、代码沙箱、错误处理与重试 模块 2:框架与设计模式(Week 3–5) · 框架层:DSPy(signature / module / optimizer)、LangChain/LangGraph、LlamaIndex,重点是"框架抽象了什么 vs. 你手写了什么" · 设计模式:workflow vs. agent 的分类学,五种可组合 workflow 模式,ReAct / plan-and-execute / reflection,"scaffold(脚手架)本身就是设计决策" · 记忆架构:短期/长期记忆、记忆作为工具动作、文件系统作为外化记忆、跨 Agent 记忆(MemGPT、Mem0、Generative Agents) · 多 Agent 系统:编排模式、handoff 与状态传递,以及一个很有态度的对照阅读——既读 AutoGen,也读《Why Do Multi-Agent LLM Systems Fail?》和 Neubig 的《Don't Sleep on Single-agent Systems》 模块 3:优化(Week 5) · 从提示词到微调的全景:GEPA、MIPROv2、OPRO、TextGrad(提示优化);LoRA/QLoRA、蒸馏、RLHF/DPO(权重优化);test-time scaling(推理算力) · 核心问题是决策框架:什么时候优化 prompt、什么时候优化 weights、什么时候堆推理算力 模块 4:数据与评估(Week 6–8)——最有分量的部分 · 数据:trace、demonstration、feedback 三类数据;训练数据 vs. 评估数据;数据飞轮;合成数据;从 Agent 轨迹构建数据集(SWE-smith) · 评估基础:为什么 eval 难;4 元组框架(request / environment / stopping criteria / scorer);好 benchmark 的性质;tinyBenchmarks · 评估基础设施:三类 grader、LLM-as-judge 的 prompt 设计与已知偏差、pairwise vs. pointwise、非确定性指标 pass@k vs. pass^k、harness 设计 模块 5:安全与前沿(Week 8–11) · 安全:工具访问的隐私风险、prompt injection(含间接注入)、红队、沙箱与权限模型、输出护栏、human-in-the-loop · Coding Agent:SWE-agent、Claude Code、OpenHands 的端到端架构对比 · 主动式 Agent:从 reactive 到 proactive,General User Models(GUM)、Next Action Prediction,以及"Agent 何时应主动、何时应等待"的 mixed-initiative 问题 · 开放问题:多模态/web/计算机使用 Agent、科学 Agent、长时运行架构、生产可观测性(tracing、monitoring、成本管理) # 作业设计:一手建、一手评 HW1:从零构建 Agent 系统(10%) 给定论文库,构建能检索并推理回答科学问题的 Agent。 · Part A:只用 litellm 手写 RAG + 工具调用 + ReAct 式 Agent 循环 · Part B:用 DSPy 重建关键组件,并反思框架抽象了什么 HW2:评估一个 Agent(10%) 给定一个预构建 Agent,设计完整评估套件:代码型 grader、至少一个 LLM-as-judge、用 4 元组框架构建 benchmark 任务、错误分析。
显示更多
0
23
148
30
转发到社区
Agent = Model + Harness:生产级 AI 智能体工程六层实战手册 结合 Mitchell Hashimoto、OpenAI Codex 团队、Martin Fowler、LangChain、Cursor 等公开工程资料编撰。 # Agent = Model + Harness 模型只提供推理能力,决定 Agent 能否从演示走向生产环境的是围绕模型的工程基础设施——Harness。 报告的核心论据是:只改 Harness、不换模型,收益可超过模型升级: · 同一 Claude Sonnet 4.5 在 GAIA 基准上从 30.91% 升至 74.55%(+43.64 分),差异完全来自 Harness; · LangChain 不改模型,仅靠 Harness 优化将 Terminal Bench 排名从第 30 提升至第 5; · OpenAI 团队 5 个月、约 1500 个自动化 PR 产出 100 万行生产代码,零人工手写——人负责设计环境,Agent 负责写代码("Humans steer. Agents build.")。 这也解释了一个行业现象:约 95% 的企业 AI Agent 止步于预生产阶段——演示效果好,却因安全审查、可观测性、边界情况幻觉、治理缺失而无法上线。 # 行业定位:AI 工程的第三个时代 1. 提示词工程(2023–24):模型"说什么" 2. 上下文工程(2025):模型"看到什么"(RAG/MCP/记忆) 3. Harness 工程(2026):模型"能做什么" # 六层架构(报告主体) 1. Guides 引导层(前馈控制):AGENTS.md / CLAUDE.md 等规则文件,在执行前塑造行为。要点:规则必须可执行、可验证、可追溯至真实失败案例;需定期修剪,否则 200 行无日期规则就是技术债。OpenAI 内部将其视为最高事实源——文件与会话冲突时,文件优先。 2. Sensors 传感层(反馈控制):执行后验证输出。优先使用确定性、零成本的计算型传感器(linter、测试、schema 校验);LLM-as-judge 等推理型传感器慢、贵、不确定,只用于无法用规则表达的语义判断,且应作参考信号而非硬门禁。 3. Agentic Loop 执行循环:计划→执行→验证→修复→前进或升级,必须有界——默认每步最多重试 3 次、30 分钟、10 万 token、5 美元、50 次工具调用。预算耗尽时返回最佳半成品并说明原因,不允许用流利的最终答案掩盖部分失败。正确升级的 Agent 比自信地给出错误答案的 Agent 更有价值。 4. Memory 记忆层:模型每次会话都从零开始,Harness 负责状态连续性。最简方案是文件系统(plan.md、decisions.jsonl、checkpoint),对多数场景比向量数据库更便宜可靠。检验标准:中途关闭会话重开,Agent 应能断点续作。 5. Permissions 权限层:模型无法自我约束,Harness 是唯一安全边界。按范围、速率、可逆性、可见性四个维度设定能力预算;不可逆操作(部署、删除、外发消息)必须人工批准;必须隔离可信指令与不可信数据以防提示注入。 6. Observability 可观测层:结构化日志 + 成本归因 + 熔断告警(trip wire)。真正的度量不是 token 数,而是无需人工干预即完成且证据合格的任务数;成本应按"每个验证通过的结果"而非按天计算。 # 方法论精髓:棘轮原则(Ratchet) Hashimoto 的原始定义:"每当 Agent 犯错,就工程化一个方案,让它永远不再犯这个错。" 六步循环:复现失败→归类根因→选择最强修复层→编码修复→验证防复发→监控回归。 修复强度呈阶梯上升:对话补丁 < 提示词 < 引导规则 < 传感器 < 环境约束——提示词只修一次对话,环境约束让错误在结构上不可能发生。 Cursor 的 Lauren Tan 补充了实操信号:同一条评审意见出现三次,就应固化为结构性约束。Harness 成熟的标志是规则增速下降(从每天 5 条降到每周 1 条)。 # 落地路径与边界 七天最小可用路径:Day 1–2 建引导文件 → Day 3–4 接入测试套件与有界循环 → Day 5–6 加检查点与权限 → Day 7 加日志与熔断。之后按"一次只改一层、可度量、可回滚"扩张,完成率 ≥80% 等六道闸门全过才允许扩大规模。 何时不需要 Harness:一次性问答、创意脑暴、低风险个人任务——"如果以上都不适用,对话本身就是 Harness"。 多智能体扩展:需要类型化交接("done, looks good" 不能推进生产流程)、共享状态模型而非共享上下文(避免上下文污染)、以及生产者不可覆盖的独立验证者。
显示更多
0
10
65
14
转发到社区
Summer break is over and the new conference season is approaching! Thrilled to be speaking TWICE at @Devoxx 2026 🇧🇪 this October: ⚡ Tools in Action: modern automation with @java 🤿 Deep Dive: from AI to agentic systems with @langchain4j Heading to Antwerp? Come say hi! 🎤
显示更多
Just look what I found, an open-source Sentry, but for AI agents. It shows what's about to break in your agent before users notice - failed traces grouped into tracked issues, evals built from your team's actual judgments, full multi-turn sessions and tool calls in one view. Every trace is semantically searchable too — find anything by meaning, zero sampling. How to try it: - sign up free at latitude, grab your API key + project slug - paste one prompt into Claude Code, Cursor, or Codex – it wires up tracing for you automatically - run your app like normal, every LLM call now shows up as a trace - open the dashboard and watch issues get grouped and tracked in real time Provider-agnostic — OpenAI, Anthropic, Bedrock, LangChain, all of it. Free tier: 20K credits/month, unlimited seats. MIT licensed, 4.1k stars. If you're shipping an agent without something watching it, you're flying blind. link below👇
显示更多
ACABO DE ENCONTRAR UNA API QUE REGALA 10 MILLONES DE TOKENS AL MES Claude Opus 4.8, GPT 5.5, DeepSeek V4, Kimi K2.6 y más de 340 modelos. Sin tarjeta de crédito. Solo iniciar sesión con Google y configurarlo en 2 minutos. Esto es lo que ofrece What Runtime de Bad Theory Labs: • 10 millones de tokens gratis al mes con su router inteligente btl-2, que elige automáticamente el mejor modelo para cada tarea. • Acceso a Claude Opus 4.8, GPT 5.5, DeepSeek V4 Pro/Flash, GLM 5.2, Kimi K2.6, Gemini, Llama, Qwen y más de 340 modelos. • DeepSeek V4 Pro y Flash gratis durante la promoción de lanzamiento. • API compatible con OpenAI. Solo cambias la URL base y funciona con prácticamente cualquier herramienta. Esto puede sustituir varias suscripciones: ChatGPT Plus → 20 €/mes Claude Pro → 20 €/mes Cursor Pro → 20 €/mes Perplexity Pro → 20 €/mes Todo por 0 €. Cómo conseguirlo (2 minutos): 1. Entra en 2. Regístrate con Google (sin tarjeta) 3. Completa el onboarding 4. Recibirás los créditos gratis automáticamente 5. Copia tu API Key (empieza por BTL_) 6. Configura la Base URL: 7. Selecciona el modelo btl-2 para que el router elija automáticamente el mejor modelo en cada petición. Es compatible con Cursor, Aider, Hermes Agent, OpenCode, OpenClaw, LangChain y cualquier herramienta compatible con la API de OpenAI. Importante: el plan gratuito es una promoción de lanzamiento y puede cambiar cuando aumente el número de usuarios. Además, tiene límites de uso, por lo que no está pensado para cargas de producción muy intensivas. Mientras otros siguen pagando 20€ al mes por usar un único modelo, aquí tienes acceso a Claude + GPT + DeepSeek + GLM y cientos de modelos más sin pagar nada. Guárdate este post antes de que cambien el plan gratuito.
显示更多
0
53
839
172
转发到社区
Interrupt, The Agent Conference by LangChain returns this fall with two new stops: 📍NYC: September 24 📍London: October 13 Get more information about Interrupt + save your seat while spaces last at
显示更多
Every company has specialized intelligence that sets it apart. With @langchain, we’re helping enterprises turn that knowledge into specialized agents they can customize, secure and improve over time.
显示更多
0
41
539
61
转发到社区
Agents built on MCP, LangChain and CrewAI need tools that actually work. Build the services they run on.
0
73
1.8K
165
转发到社区
想用三个月拿下年薪20万美金的AI工程师Offer? 现实点说,你根本不需要回炉重造拿学位,把下面这10个GitHub仓库彻底嚼碎吞下去,比什么都管用。 如今的AI工程岗,拼的根本不是一纸文凭,而是你对生产级工具的掌控力到底到了哪个段位。这份清单就是一条从零基础到具备实战能力的完整路径,各个环节都给你安排得明明白白。 ① awesome-llm-apps 起点就选这个,绝对不踩坑。RAG、智能体、多模态应用,一水的生产级真实代码,跟那些只能跑着玩的玩具项目完全是两码事。11.2万+ stars,这是目前市面上最系统的LLM落地实战地图。 ② LangChain 到了2026年,简历上要是没出现LangChain,很可能第一轮就被筛掉了。Klarna、Replit、Elastic这些一线公司都在用,绝大多数AI创业公司的生产环境跑的就是它。 ③ LangGraph 光会LangChain只是入门,LangGraph才是现在高级AI工程师岗位描述里的高频硬指标。它是生产级智能体的核心编排层,不懂这个,你只能打打下手做基础工作。 ④ CrewAI 多智能体协作早就不是概念了,它正在当下发生。财富500强团队已经拿它在生产环境落地,框架非常成熟,面试时聊到多智能体架构,你随口就能抛出实战经验。 ⑤ Ollama 想搞懂大模型底层到底在干嘛,最快的办法就是让它在你自己的机器上跑起来。Ollama让你一键运行任何开源LLM,这是绕过抽象概念、直击原理的最短路径。 ⑥ awesome-mcp-servers MCP已经是2026年主流AI实验室的统一标准协议了。现在懂MCP的工程师还是稀缺资源,你学完立刻就能拉开身位,但这个红利窗口不会一直开着。 ⑦ Qdrant 做RAG就绕不开向量数据库,Qdrant是大规模生产环境里公认的主流选项。嵌入和语义搜索已经是AI岗位的默认技能项了,没得商量。 ⑧ AI-Agents-for-Beginners 微软官方出品的免费12节实操课,手把手教你构建智能体。全是真实代码、真实练习,面试前刷一遍,直接就有拿得出手的项目经验可以讲。 ⑨ system-design-primer 很多人会忽视这一点,但生产级AI骨子里拼的就是系统设计能力。FAANG的工程师面试前都在刷这个仓库,想拿高薪Offer,系统设计这道关你必须得迈过去。 ⑩ awesome-claude-code Claude Code已经是FAANG、OpenAI、Anthropic以及绝大多数YC系创业公司内部的主流工具。这个仓库就是它的完整使用手册,用得溜的人,生产效率直接拉开同事实力差距。 三个月能不能拿下Offer,不取决于你背了多少理论,只取决于你有没有亲自把代码跑起来、把坑踩一遍。把上面10个仓库啃透,做出几个能直接展示的实战项目,比任何证书都更有说服力。
显示更多