注册并分享邀请链接,可获得视频播放与邀请奖励。

思维怪怪 (@0xLogicrw) “Prime Intellect 开源智能体训练环境 general-agent。这是一个完全基于代码合成、可自” — TopicDigg

思维怪怪 的个人资料封面
思维怪怪 的头像
思维怪怪
@0xLogicrw
写关于 AI 的一切 Shit Post AI 信息流:
加入 May 2018
2.4K 正在关注    6.1K 粉丝
Prime Intellect 开源智能体训练环境 general-agent。这是一个完全基于代码合成、可自我进化的任务生成引擎。 它将训练语料的生成设定为一场双玩家博弈。两名 AI 玩家分工明确:合成器(Synthesizer)负责设计带有独立数据库、交互工具和验证函数的任务,求解器(Solver)则负责尝试通关。 任务从最简单的指令起步,系统会通过施加条件约束、混入噪音、设置跨实体关联等 9 种策略,把任务逐级演化出 t0 到 t4 五个难度阶梯。系统会根据求解器的真实通过率来动态校准,只有落在特定难度区间的任务才会被收录,而最难的一批任务会直接成为下一轮进化的种子。 目前,这场「左右互搏」已自动构建出包含 4504 个任务、逾 8000 个独特交互工具的大型状态数据库。 实测数据显示,仅用该环境自动生成的 4417 条执行轨迹对 30B 参数的 Nemotron 模型进行微调,就在 BFCL 基准测试中将其工具调用准确率从 18.9% 飙升至 52.3%。 这一对抗机制绕过了人工编写静态工具数据集的瓶颈。通过模型间的直接博弈,系统能够极低成本地源源不断合成出难度可测、自带闭环验证的复杂调度语料。
显示更多
The next step toward automating AI is automating RL environments Introducing General-Agent: A fully synthetic environment whose task corpus self-evolves and grows harder over time 4,504 tool-use tasks · 1,040 domains · 8,159 unique tools
显示更多