注册并分享邀请链接,可获得视频播放与邀请奖励。

与「任務失敗しちゃいました 」相关的搜索结果

任務失敗しちゃいました  贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 任務失敗しちゃいました  的内容
#任務失敗しちゃいました # 企画参加させていただきます NSFW 極西退魔戦線で光栄な負傷により片腕を失い、 後方研究職に転じたダークエルフ、ダセリナ。 より高性能な人工義肢を装着した彼女は、久々に前線任務に志願した。 「……旧時代の支援ロボットごとき、大したことないわね。 すぐに片付けて戻る」 しかし大意した結果、初めて暴走ロボットに捕らわれ、手を拘束され…… あれやこれやと犯されながらも、彼女は静かに抵抗を続けた。 「……っ、絶対に……ファイアウォールの暗証など…… 渡したりしない……」 「....うおお...!ああ...」 #AIart# #elf# #エルフ#
显示更多
#任務失敗しちゃいました # 極西退魔戦線で光栄な負傷により片腕を失い、 後方研究職に転じたダークエルフ、ダセリナ。 より高性能な人工義肢を装着した彼女は、久々に前線任務に志願した。 「……旧時代の支援ロボットごとき、大したことないわね。 すぐに片付けて戻る」 しかし大意した結果、初めて暴走ロボットに捕らわれ、手を拘束され…… あれやこれやと犯されながらも、彼女は静かに抵抗を続けた。 「……っ、絶対に……ファイアウォールの暗証など…… 渡したりしない……」 「....うおお...!ああ...」 #AIart# #elf# #エルフ#
显示更多
キヴォトスふたなり大騒ぎvol.1 ソウルワーカー、任務失敗 メロンボックスで電子本販売始めました! よろしくお願いします😊
显示更多
rkgk_φ(´ω` ) ブルアカ 渡海ココロ 任務失敗
0
16
3.6K
293
转发到社区
@mohumohutikuwa 任務失敗なのに笑顔…このギャップが尊い
好工具分享~ 推荐指数 ★★★★ 今天给 跑浏览器自动化总被各种BOT检测和风控拦住的家人强烈推荐一个神器!! 脚本卡死、IP 封禁、账号被ban、CAPTCHA 无限弹窗、数据抓不到、任务失败……只有跑过网页自动化的家人知道有多难~ CamoFox Browser 是为 AI Agents 打造的顶级 stealth headless browser,基于 Camoufox,Firefox C++ 级深度指纹伪装,底层硬 spoof 所有指纹,无任何 JS shim 痕迹,检测工具根本发现不了! - 极致隐身:硬刚 Cloudflare Turnstile、Akamai 等主流风控 - Agent 原生友好:超轻量 accessibility snapshot,比 HTML 还小90%、稳定元素引用、搜索宏,直接当基础设施 GitHub 已 6.2k+ stars,有需要的可以收藏关注~ 工具地址: 不定期分享AI工具/美股资讯,欢迎各位大佬一起互关~
显示更多
0
36
31
0
转发到社区
师尊…任务失败了…
0
12
2.5K
111
转发到社区
“抱歉..任务失败。”
0
18
5K
292
转发到社区
NVIDIA 发布 Skill2Env:用“集体技能”强化智能体 NVIDIA 研究者们把社区公开的 Agent Skills 编译成可执行 RL 训练环境的数据流水线:3.4k 个 Skills 变成 8k 个带程序化测试和行为量规的终端任务;仅 300 步 RL 训练就让 Qwen3.8-27B 在 Terminal-Bench 2.1 上提升 4.7 个百分点,且模型行为显著向源 Skills 的方法论对齐。 开源项目: 核心洞察:公开 Agent Skills 是一个被忽视的监督来源 Agent Skills 是“教智能体做某件事”的文件夹:一个 SKILL.md 加上可选的脚本、参考资料和资产。论文指出,把公开 Skill 语料当作数据来读,它同时提供三样东西: · 任务分布的采样:人们真正想让智能体处理的任务分布(有人愿意花时间写下工作流,说明这活儿值得自动化); · 真实世界的锚点:指向真实的仓库、数据集、工具和工件; · 结果测试表达不了的质量标准:领域专长、默认参数、常见坑、“好结果长什么样”。 # 数据流水线:四阶段编译,验证靠构造 1. Plan(分解):容器化的 Codex 规划器读取完整 Skill 包、联网调研相关公共资产,把 Skill 拆解成若干可验证的 workflow,每个附带元计划(场景、初始世界、预埋缺陷、难点来源、解法草案、验证策略)、资产建议和“任务轴池”(任务原型 × 验证器模式 × 人物画像)。 2. Diversify(多样化):宿主从轴池采样一组组合,加上复杂度、指令语气、请求者专业水平。关键设计是轴池以 workflow 为条件:研究型 workflow 配“证据可追溯”验证和研究者画像,而不是从全轴乘积空间乱抽,这让多样化保持 sensible。 3. Create(构造):全新创建者 Codex agent 在 Docker 内工作,尽可能用真实素材(钉在特定 commit 的开源仓库、真实版本化文档、官方 API 规范);需要联网服务的场景改造成本地替身(stub 服务器、录制回放 fixture、PATH 上的假 CLI、种子数据库),求解时绝不依赖网络。创建顺序被严格固定:先建世界 → 写指令 → 写测试 → 写量规 → 最后才写参考解,测试先于解法冻结,保证解法必须迁就评分契约而非反过来。 4. Verify(验证):宿主端无模型参与的接收门:静态检查(布局、符号链接、Dockerfile 安全、基础镜像按内容摘要钉死)+ 两个容器内试跑:Oracle(参考解)必须全指标满分,NOP(什么都不做的 agent)必须全指标零分。任一失败即拒绝。 值得注意的一个反直觉选择:不做 teacher 模型预验证(不像部分工作用强模型试解、解不出就丢弃任务)。理由有二:这会把任务难度上限压到验证器能力,且成本翻倍;而 group-based RL 的在线动态过滤(rollout 无优势的 prompt 自动不产生梯度)天然淘汰过难/过易任务。 # 数据画像:广、贵、且忠实于源 规模与成本:7,971 个任务,用 GPT-5.6 Sol(xhigh 推理档)生成,API 花费超 9 万美元。(脚注:出于法律原因,公开发布的数据集改用 Kimi-K3-max 在同一流水线下生成。) 领域分布:13 个领域中,软件工程仅占 22.5%,AI/ML 10.5%,商业/金融/法律/HR 10.5%,营销 9.3%……论文对比了 TMax-15K、Terminal-Bench、DeepSWE 等,Skill2Env 是唯一全覆盖 13 域、且非技术知识工作占大头的语料。 忠实度探针(很聪明的设计):用任务指令+量规作查询、对 3.4k 个 SKILL.md 做 TF-IDF 检索,73.2% 的任务 top-1 命中真实源 Skill,94.6% 进 top-10(随机 0.03%)。单用量规也有 68.5% top-1,证明量规携带的是 Skill 专属方法论而非泛泛建议。 SFT 数据:用 GLM-5.3 对每个任务 rollout 两次,得到 15,968 条轨迹,平均奖励 0.74,中位轨迹 19 次模型调用 + 23 次工具调用。 S2EBench:考虑到公开基准饱和,从 SkillHub 另外生成、逐条人工审核(指令无歧义、忠实于源 Skill、测试公允)后的 79 任务私有 held-out 基准。 # RL 实验:基础设施 + 极简配方 基础设施(论文明确说“现代 agentic RL 首先是基础设施挑战”):Molt(PyTorch 原生全异步训练,Ray + vLLM + FSDP2)+ Polar(agent rollout 层:rootless Apptainer 沙箱、代理回传 token ID 和采样时 log-prob、prefix merging 把 harness 的多次补全缝合成训练轨迹)。 配方(刻意走“简单路线”):GRPO 组归一优势 + DPPO 的 binary-KL 信任域掩码(δ=0.05,超出阈值的 token 直接丢弃,无需参考模型,还能防训练-推理失配);G=8 rollouts/组,批 64,lr 1e-6 恒定,无 KL 惩罚、无熵奖励、无 SFT 热启动,每任务 65k 上下文。 量规校准奖励:开量规时,额外由 GPT-6 Astra 做 LLM-as-Judge(带“宪法”:惩罚无脑循环、reward hacking、答非所问;hacking 实证 = -5 分),总奖励 r = r_V + λs/5(λ=0.2),即 judge 最多把程序化奖励拉动 ±0.2。量规是校准可执行结果奖励,而非取代它,这是与“Rubrics as Rewards”一系的定位差异。 # 四项发现(论文最有信息量的部分) 发现 1:小规模 RL 即有跨域迁移。 仅 300 步、只用 2,400 任务子集训一个 epoch:S2EBench pass@1 +4.3(均分 +18.5),Terminal-Bench 2.1 +4.7(49.4→54.1)。训练集与 TB 无重叠(13-gram Jaccard < 0.8),且训练集从未针对 TB 调过,论文将其解读为规划、工具使用、收尾能力的通用提升而非任务族记忆。这让 27B 本地模型显著缩小了与云端前沿模型的差距。 发现 2:量规校准 RL 在基准上落后于纯结果 RL,一个诚实的负结果。 量规版在 TB 2.1 只有 50.1(纯结果版 54.1);训练中量规版的程序化奖励长期停在 0.5–0.6,judge 分项从头到尾无上升趋势,两个奖励在训练分布上互相拉扯。论文不把它当作对量规奖励的终审判决(两者优化不同目标,而基准只考结果那一半),并给出两个疑因:λ=0.2 的加性形式让失败任务仍能拿正奖励、judge 看不到文件系统等设定均未调优;以及更本质的,Skill 写下的方法论可能本来就不是最大化基准通过率的分布。 发现 3:行为确实向 Skill 对齐,量规的价值所在。 200 个任务的成对偏好测试(judge 拿源 SKILL.md 当标准,比较匿名化的 base 与 RL 轨迹):纯结果 RL 已被偏好 54.5% vs 33.5%;量规版被偏好 73.0% vs 24.0%。这说明量规奖励买到的东西在结果基准上看不见,但对“怎么做事”影响实质,对网页开发、报告综合、开放研究这类难验证任务尤其重要。 发现 4:GLM-5.3 蒸馏 SFT 反而伤害 Qwen。 在 GLM-5.3 轨迹上做 SFT:27B 上 TB 2.1 掉到 45.8;4B 上直接崩塌(TB 18.7→3.4,出现思维/工具调用死循环)。归因:教师的 interleaved-thinking + 工具调用风格与学生自身 post-training 不兼容,模仿覆盖了学生依赖的行为模式却带不来教师的能力。与 TMax 报告的“SFT 混合数据劣化已后训练的 Qwen”互相印证。因此论文所有 RL 结果都从未修改的原始 checkpoint 出发。
显示更多
最近几天刷到一堆人在玩同一个东西,机械臂 @axisrobotics 不是真去工厂里搬箱子那种,是坐在电脑前,用浏览器远程操控一只虚拟机械臂,去抓豆腐、放盘子、开垃圾桶盖……听起来挺简单,真上手才发现有多折磨人。方向稍微偏一点就抓空,夹爪扭得像麻花,明明看着已经对准了,最后还是差那么一毫米。好几个手残党朋友跟我吐槽:玩了一个小时,一个任务都没过。 但奇怪的是,越玩越上瘾。 Axis 干的事其实挺反直觉的。很多人以为机器人训练就是拼命让人多操作、多教,操作越多数据越好。结果他们发现,人类操作里有大量“低信息量”的动作——机械臂空着穿越空间、停顿、反复微调、绕远路,这些动作成本很高,教给模型的东西却很少。V2 直接把这些砍掉了。你可以拖动末端执行器,或者直接点选目标物体,让它自动挪到预抓取位置。真正留给人操作的,只剩抓取选择和夹爪闭合前后那几秒的精细调整。 更狠的是纠错数据的处理方式。模型自己跑任务,快失败的时候人接管把它拉回来。以前大家可能会把整段人类操作全录下来喂给模型,结果模型反而变笨了。后来他们只保留那些真正把机器人从失败状态救回来的短动作,平均只有 0.8 秒。过滤完之后,成功率明显上去了。 这套逻辑有点像教小孩骑自行车。你不会全程扶着他走,也不会把每一次歪歪扭扭都当成标准示范。你只在他快要倒的时候伸手扶一下,让他自己学会从失衡里恢复平衡。Axis 现在做的,就是这个。 普通人不用买机器人、不用搞 GPU,打开浏览器就能贡献数据。任务从简单的抓取放置开始,后面会慢慢往长时程、多步骤、需要容错和协调的方向走。现在看起来还像抓娃娃机,几个月后可能就会变成真正的“高级钳工”考核了。 数据会上链签名验证,贡献是实打实的。再加上和 Kaito 的创作者计划,写内容、拉人参与,都能计入最终的奖励权重。奖励池是 $AXIS 总供应量的 0.25%,TGE 一次性解锁。 说白了,这不是单纯让大家玩游戏,也不是单纯让大家写推文。它在尝试把“机器人怎么在真实世界里犯错、怎么被纠正”这件事,拆成普通人也能参与的碎片。以前这些数据只能在实验室里一点点攒,现在变成了浏览器里的日常任务。 我自己也试了几天。一开始真的很挫败,后来慢慢摸出点门道:先让机械臂到物体正上方再下降,靠近后再微调,别一上来就大幅晃。完成任务后记得去看验证状态并签名,不然轨迹不算数。 玩着玩着突然觉得挺有意思的。机器人想走进现实世界,缺的从来不是更多算力,而是足够多、足够真实的“怎么从错误里爬起来”的数据。现在这些数据,有一部分是由坐在电脑前的普通人一点点攒出来的。 如果你也想体验一下当“远程钳工”的感觉,可以去试试。难是真的难,但偶尔一次抓成功的瞬间,还挺解气的。 快来试试看吧❤: @axisrobotics @KaitoAI #AxisRobotics# #PhysicalAI# #KaitoAi#
显示更多
0
41
39
4
转发到社区