注册并分享邀请链接,可获得视频播放与邀请奖励。

meng shao (@shao__meng) “EvoOntology:给数据智能体一个会成长的语义层 数据智能体(Data Agent)面对异构数据” — TopicDigg

meng shao 的个人资料封面
meng shao 的头像
meng shao
@shao__meng
加入 November 2023
0 正在关注    0 粉丝
EvoOntology:给数据智能体一个会成长的语义层 数据智能体(Data Agent)面对异构数据时,能“看见”的往往只有表名、列名和文件路径;指标如何定义、实体如何关联、业务上有何约束,这些语义都藏在数据之外。让智能体每次从零探索,代价高且易出语义错误;把人工维护的语义层全量注入提示词,又难以扩展、随数据漂移而失效。这就是论文中的 agent-data gap。 中国人民大学 ruc-datalab 提出的 EvoOntology(arXiv:2609.15779)给出了新解法:首个面向数据智能体的自进化本体层(Self-Evolving Ontology Layer)。核心洞察是把本体当作“可训练的智能体状态”:不更新模型权重,而让语义知识随真实使用持续积累、验证、版本化演进,每次变更可检查、可比较、可回滚。 本体以三层结构封装为 MCP 服务器,供智能体运行时主动查询: · Schema Layer 定义本体的表示边界(节点族、语义关系、引用模式); · Content Layer 是类型化语义图,由 Terms / Mappings / Constraints / Evidence 四类节点构成,每个语义对象都有工作负载证据支撑,落地验证后才提交; · Tool Layer 仅暴露 browse_semantics 与 resolve_semantics 两个 MCP 工具加紧凑会话 manifest,智能体按需检索当前步骤所需语义,而非全量注入上下文。 本体遵循 Build → Use → Evolve → Evaluate → Publish 生命周期:构建器智能体从真实工作负载推导候选概念并对照原始数据验证;交互轨迹被持续记录;进化时诊断重复行为、归因到具体层级并生成局部补丁;候选版本只有在相同数据、相同智能体、相同解码设置与交互预算的配对评估中可复现地胜过父版本,才会发布。 在 BIRD、DDR-10K、InsightBench 三个基准、四个 LLM 骨干(GPT-5.5 / GPT-5.6-sol / Claude-Sonnet-5 / Claude-Opus-4.8)上,EvoOntology 一致优于无本体 ReAct 与静态初始本体。其中 DDR-Bench 上仅“自进化”环节就贡献了 +7.7(81.8 → 89.5),验证了持续演进相对静态语义层的增量价值。 论文: 代码:
显示更多