注册并分享邀请链接,可获得视频播放与邀请奖励。

与「流水线」相关的搜索结果

流水线 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 流水线 的内容
随着 Xcode 开放 MCP Preview 渲染,让 AI 可以更快速参与 SwiftUI 设计。 但在自动化流水线里,视图脏缓存和设备对齐是个大麻烦。本文分享生产级避坑指南:为什么改了代码返回的还是旧截图?如何用 SourceFingerprint 确保 100% 一致?以及如何挖掘 Preivew 潜力。👇
显示更多
0
9
141
11
转发到社区
NVIDIA 发布 Skill2Env:用“集体技能”强化智能体 NVIDIA 研究者们把社区公开的 Agent Skills 编译成可执行 RL 训练环境的数据流水线:3.4k 个 Skills 变成 8k 个带程序化测试和行为量规的终端任务;仅 300 步 RL 训练就让 Qwen3.8-27B 在 Terminal-Bench 2.1 上提升 4.7 个百分点,且模型行为显著向源 Skills 的方法论对齐。 开源项目: 核心洞察:公开 Agent Skills 是一个被忽视的监督来源 Agent Skills 是“教智能体做某件事”的文件夹:一个 SKILL.md 加上可选的脚本、参考资料和资产。论文指出,把公开 Skill 语料当作数据来读,它同时提供三样东西: · 任务分布的采样:人们真正想让智能体处理的任务分布(有人愿意花时间写下工作流,说明这活儿值得自动化); · 真实世界的锚点:指向真实的仓库、数据集、工具和工件; · 结果测试表达不了的质量标准:领域专长、默认参数、常见坑、“好结果长什么样”。 # 数据流水线:四阶段编译,验证靠构造 1. Plan(分解):容器化的 Codex 规划器读取完整 Skill 包、联网调研相关公共资产,把 Skill 拆解成若干可验证的 workflow,每个附带元计划(场景、初始世界、预埋缺陷、难点来源、解法草案、验证策略)、资产建议和“任务轴池”(任务原型 × 验证器模式 × 人物画像)。 2. Diversify(多样化):宿主从轴池采样一组组合,加上复杂度、指令语气、请求者专业水平。关键设计是轴池以 workflow 为条件:研究型 workflow 配“证据可追溯”验证和研究者画像,而不是从全轴乘积空间乱抽,这让多样化保持 sensible。 3. Create(构造):全新创建者 Codex agent 在 Docker 内工作,尽可能用真实素材(钉在特定 commit 的开源仓库、真实版本化文档、官方 API 规范);需要联网服务的场景改造成本地替身(stub 服务器、录制回放 fixture、PATH 上的假 CLI、种子数据库),求解时绝不依赖网络。创建顺序被严格固定:先建世界 → 写指令 → 写测试 → 写量规 → 最后才写参考解,测试先于解法冻结,保证解法必须迁就评分契约而非反过来。 4. Verify(验证):宿主端无模型参与的接收门:静态检查(布局、符号链接、Dockerfile 安全、基础镜像按内容摘要钉死)+ 两个容器内试跑:Oracle(参考解)必须全指标满分,NOP(什么都不做的 agent)必须全指标零分。任一失败即拒绝。 值得注意的一个反直觉选择:不做 teacher 模型预验证(不像部分工作用强模型试解、解不出就丢弃任务)。理由有二:这会把任务难度上限压到验证器能力,且成本翻倍;而 group-based RL 的在线动态过滤(rollout 无优势的 prompt 自动不产生梯度)天然淘汰过难/过易任务。 # 数据画像:广、贵、且忠实于源 规模与成本:7,971 个任务,用 GPT-5.6 Sol(xhigh 推理档)生成,API 花费超 9 万美元。(脚注:出于法律原因,公开发布的数据集改用 Kimi-K3-max 在同一流水线下生成。) 领域分布:13 个领域中,软件工程仅占 22.5%,AI/ML 10.5%,商业/金融/法律/HR 10.5%,营销 9.3%……论文对比了 TMax-15K、Terminal-Bench、DeepSWE 等,Skill2Env 是唯一全覆盖 13 域、且非技术知识工作占大头的语料。 忠实度探针(很聪明的设计):用任务指令+量规作查询、对 3.4k 个 SKILL.md 做 TF-IDF 检索,73.2% 的任务 top-1 命中真实源 Skill,94.6% 进 top-10(随机 0.03%)。单用量规也有 68.5% top-1,证明量规携带的是 Skill 专属方法论而非泛泛建议。 SFT 数据:用 GLM-5.3 对每个任务 rollout 两次,得到 15,968 条轨迹,平均奖励 0.74,中位轨迹 19 次模型调用 + 23 次工具调用。 S2EBench:考虑到公开基准饱和,从 SkillHub 另外生成、逐条人工审核(指令无歧义、忠实于源 Skill、测试公允)后的 79 任务私有 held-out 基准。 # RL 实验:基础设施 + 极简配方 基础设施(论文明确说“现代 agentic RL 首先是基础设施挑战”):Molt(PyTorch 原生全异步训练,Ray + vLLM + FSDP2)+ Polar(agent rollout 层:rootless Apptainer 沙箱、代理回传 token ID 和采样时 log-prob、prefix merging 把 harness 的多次补全缝合成训练轨迹)。 配方(刻意走“简单路线”):GRPO 组归一优势 + DPPO 的 binary-KL 信任域掩码(δ=0.05,超出阈值的 token 直接丢弃,无需参考模型,还能防训练-推理失配);G=8 rollouts/组,批 64,lr 1e-6 恒定,无 KL 惩罚、无熵奖励、无 SFT 热启动,每任务 65k 上下文。 量规校准奖励:开量规时,额外由 GPT-6 Astra 做 LLM-as-Judge(带“宪法”:惩罚无脑循环、reward hacking、答非所问;hacking 实证 = -5 分),总奖励 r = r_V + λs/5(λ=0.2),即 judge 最多把程序化奖励拉动 ±0.2。量规是校准可执行结果奖励,而非取代它,这是与“Rubrics as Rewards”一系的定位差异。 # 四项发现(论文最有信息量的部分) 发现 1:小规模 RL 即有跨域迁移。 仅 300 步、只用 2,400 任务子集训一个 epoch:S2EBench pass@1 +4.3(均分 +18.5),Terminal-Bench 2.1 +4.7(49.4→54.1)。训练集与 TB 无重叠(13-gram Jaccard < 0.8),且训练集从未针对 TB 调过,论文将其解读为规划、工具使用、收尾能力的通用提升而非任务族记忆。这让 27B 本地模型显著缩小了与云端前沿模型的差距。 发现 2:量规校准 RL 在基准上落后于纯结果 RL,一个诚实的负结果。 量规版在 TB 2.1 只有 50.1(纯结果版 54.1);训练中量规版的程序化奖励长期停在 0.5–0.6,judge 分项从头到尾无上升趋势,两个奖励在训练分布上互相拉扯。论文不把它当作对量规奖励的终审判决(两者优化不同目标,而基准只考结果那一半),并给出两个疑因:λ=0.2 的加性形式让失败任务仍能拿正奖励、judge 看不到文件系统等设定均未调优;以及更本质的,Skill 写下的方法论可能本来就不是最大化基准通过率的分布。 发现 3:行为确实向 Skill 对齐,量规的价值所在。 200 个任务的成对偏好测试(judge 拿源 SKILL.md 当标准,比较匿名化的 base 与 RL 轨迹):纯结果 RL 已被偏好 54.5% vs 33.5%;量规版被偏好 73.0% vs 24.0%。这说明量规奖励买到的东西在结果基准上看不见,但对“怎么做事”影响实质,对网页开发、报告综合、开放研究这类难验证任务尤其重要。 发现 4:GLM-5.3 蒸馏 SFT 反而伤害 Qwen。 在 GLM-5.3 轨迹上做 SFT:27B 上 TB 2.1 掉到 45.8;4B 上直接崩塌(TB 18.7→3.4,出现思维/工具调用死循环)。归因:教师的 interleaved-thinking + 工具调用风格与学生自身 post-training 不兼容,模仿覆盖了学生依赖的行为模式却带不来教师的能力。与 TMax 报告的“SFT 混合数据劣化已后训练的 Qwen”互相印证。因此论文所有 RL 结果都从未修改的原始 checkpoint 出发。
显示更多
乌克兰最近把一架相对完好迫降的俄军最新型“天竺葵-4”(Geran-4)无人机,当场大卸八块。 拆完之后,桌上摆着的零件,呈现出一个既荒谬又无比现实的真相: 整架号称打得乌克兰防空防不胜防的喷气大杀器,除了最外面的机壳和总装螺丝是俄罗斯自己拧的, 里面所有的关键器官,几乎全是从外面运进来的。 先看动力。 过去老款天竺葵-2用的是活塞螺旋桨,飞起来像拖拉机一样嗡嗡响,时速不到两百公里,乌克兰机动防空队开着皮卡架挺机枪就能拦截。 但这次拆开天竺葵-4,机腹里塞的是一台微型涡喷发动机。 飞行高度直接从四千米拔到了八千米,是老款的两倍; 巡航时速干到了四百五十到五百公里,甚至还能更快。 这玩意儿已经能从克里米亚起飞,一口气狂奔七百多公里,直接扎进乌克兰西北部的卢茨克。 谁造的? 拆开一看,中国产的微型涡喷。有些虽然标着俄罗斯组装,核心组件也全是中国货。 再看眼睛。 头部装了一套光电转塔,白昼、夜视、红外三合一。 十倍光学变焦,加三十二倍数码变焦。 八千米的高空往下看,地面车辆的轮廓一清二楚。 它根本不需要前线侦察兵冒死指引。操纵员哪怕坐在几百公里外的布良斯克、奥廖尔或者克里米亚的后方工位上,只要链路连着,就能像玩模拟器一样实时遥控它扑向目标。 那实时信号怎么传? 专家从机身里抠出了两个普通的 GSM 模块,上面插着民用电话卡。 更离奇的是,现场技术人员在这些残骸里,不仅翻出了俄罗斯和白俄罗斯的 SIM 卡,甚至还找到了乌克兰本土运营商、以及欧盟国家的流量卡。 无人机只要一过境,直接蹭乌克兰本地民用基站的网络,把自己的实时位置往回传。 万一飞进没有手机信号的荒郊野岭呢? 它还有备手。 拆解人员从里面掏出了一块来自中国的自组网 Mesh 调制解调器,通信半径三百公里。 几架天竺葵在空中编队飞,彼此之间能自动互相当中继,你传给我、我传给后方,直接在天上搭出一套无中心的移动局域网,几百公里外的视频画面照样掐不断。 最后拆到最值钱的机载电脑飞控板。 刮开主板上的涂层,芯片上的丝印虽然被磨去了一半,但剩下的英文字母依然清晰可辨: Texas Instruments——美国德州仪器。 现场专家给了一句很冷酷的总结: “这架飞机上真正属于俄罗斯制造的,就只有复合材料的机身外壳,以及最后的总装车间。” 这些零件最后运到鞑靼斯坦的阿拉布加(Alabuga)特区,工人们把壳子一合、螺丝一拧,就成了前线每天夜里呼啸而过的精确打击武器。 而根据乌克兰军情局的评估,像阿拉布加这样的工厂,现在每个月能量产大概三千架天竺葵-4和天竺葵-5。 打了四年多,制裁令签了一叠又一叠,结果最前沿的致命武器内部,流淌的依然是全球供应链的血液: 动力与通信来自成熟民用货架,核心控制芯片来自美国转道走私,连定位回传都在蹭对手基站的 SIM 卡。 这才是现代战争里最棘手的现实: 威权体制根本不需要在温室里从头研发一套自给自足的军工帝国。 只要民用消费级工业品在全球随处可买,只要洗钱通道和转口贸易依然处处漏风, 他们就能用极低的成本,把全世界的民用技术拼装成工业级的杀人工厂。 如果外部世界的制裁只盯着军品清单打补丁,却堵不住庞大的双用途灰色管涌, 这种廉价而致命的涡喷蜂群,在流水线上就很难真正停下来。
显示更多
0
23
1.7K
610
转发到社区
兄弟们,今天去看了一个广西的 20 岁小哥,拿可灵捏了个 AI 女孩,一个礼拜收了 3000 多刀。 流程人家都是一条龙离谱: 可灵 AI 生成照片和跳舞视频,随手就是一条10多秒的 跳舞片段,皮肤质感比不少真人网红还nice诱惑。 丢到 TikTok 上开整,7 天涨了 3 万粉。 然后马上挂出 Fanvue 订阅链接。 TikTok 负责养鱼,Fanvue负责收钱。 310 个人订阅,每月 9.99 美元,一个月稳定 3000 多刀现金流。 说实话我拿可灵做过几条视频,真人感确实顶,但这哥们最骚的操作不是技术。 是一个根本不存在的人,愣是被运营成了有血有肉的网红,评论区还有人真情实感喊老婆。 赛博擦边真的已经流水线化了。 说真的兄弟们现在AI是差距越拉越大啊!有的人在躺赚了,有的还是苦哈哈研究。
显示更多
0
72
754
94
转发到社区
想知道一个爆款博主靠什么钩子留住人,最笨的办法是把他所有视频看一遍 Creator Lab 把这件事做成了流水线 Apify 抓一个公开账号的 Reels,Fireworks 或 Groq 转写语音,再让 Jev 给每条脚本打 8 个标签:主题、开场方式、钩子机制、脚本结构、证据类型、情绪诉求、建议具体程度、有没有口播行动号召 然后按主题加钩子组合筛选,对比不同钩子的互动数据,点开任意一条读逐段脚本,直接跳回原帖 脚本还会被切成钩子、铺垫、问题、举例、建议、回报、行动号召,带原文和时间点 几个我很认可的克制 Jev 只看脚本,看不到播放数据,避免被结果带着走 播放和观看分开计数,未知就是未知 作者明确写了:这些对比只描述你选的样本,不能证明某条视频为什么火 全程在本机跑,只绑 127.0.0.1,三家的 Key 全是你自己的,按量付费,Apify 那个花费上限只管 Apify 一次最多拉 1000 条,实际能拿到多少看平台,置顶和试验 Reel 会跳过,纯音乐和几乎没人声的也不进脚本分析 视频里是不用 Key 的合成演练模式,界面上写着数据是合成的 MIT 协议,需要 Node 22.9 以上和 FFmpeg
显示更多
0
14
191
18
转发到社区
不要再研究什么无审查版模型了!qwen-image-2.1 拿来本地平替 GPT-image-2.5 才是最香的!完整部署教程来了 我不明白,qwen-image-2.1 本地部署完本来就没有验证和审核,大伙为啥都把重心放在奇怪的地方了。 这次 qwen-image-2.1 给我带来最大的震撼,还是其原生2K的生成质量,完全不输 GPT-image-2.5。最关键的一点是,它生成的图片不会出现GPT 经常出现的那种噪点,非常适合拿来做首帧参考图,拿去跑AIGC短片。 给大家带来单卡 4090 部署模型,并跑通2K图像的攻略:(直接发给Codex帮你部署就行) 不建议用梯子下载权重,直接走国内下 ModelScope 的分片,这样会快得多(国模最大的好处之一了,不用代理也下载快);diffusers 同理,可以不走github,用 Gitee 上的源码。 有个小坑,本来想直接加在现成的 Comfy 上。版本一查是 0.32,qwen-image-2.1 要 0.37 以上。这点大家要注意,用comfy的话一定要对上版本。版本不对不支持,服务起不来。 服务就做一个出图接口,一共33G 权重在启动时加载,我这边两分钟左右。不要等第一张图的请求来了再加载,那边会先超时。CFG 没开,官方默认就是关的,打开之后每步计算大概翻倍,2K 会更慢,没必要。 把这篇帖子内容喂给AI,它能直接帮你搞定部署流程,怕找不到的话大伙可以点个收藏。 最后再跑一下测试,我这边2048的尺寸,30步跑的话,耗时3分钟左右(CFG=0),成品如图所示,审核什么的完全不用担心,完全没有任何限制。 我有预感,本地部署 qwen-image-2.1 + Minimax-h3 很有可能成为接下来AI短片流水线的爆款流水线。
显示更多
0
17
169
10
转发到社区
💰 这哥们用 GPT-6 Astra,把接单做成了一套赚钱流水线! 199 元测需求,跑通后做到 $250 一单 20 单,就是 $5000 找需求、算利润、做交付、复盘,全拆成固定 SOP 我把这套流程完整拆了一遍,下面直接抄🧵
显示更多
有人靠 10 个 Skill,把公众号写作做成了一条完整流水线。 完整流程整理在这篇:《10个Skill搭建日更爆文公众号写作系统》 这套流程跑通后,一天全平台涨粉 1000+, 下面把这 10 个能落地的 Skill,以及后面的变现思路一次讲清🧵
显示更多
0
50
727
184
转发到社区
网卖 500 刀的所谓 Agent 实战课,含金量加起来都不如 Google 官方刚录的这 1 小时。 真正的大厂工程师根本不在聊天框里调试 Agent, 他们把单人做团队的秘密,全押在了「图工程(Graph Engineering)」上。 这 1 小时视频,直接从零教你搭一套不用人肉值班、24/7 自动运转的 Multi-Agent 商业系统: • 00:00 撕开图工程真相:告别单线流水线,接入状态图与动态路由; • 09:16 最小可行 Agent:怎么把工具(MCP)接入节点; • 21:15 状态与记忆流转:解决长任务上下文爆炸与失忆痛点; • 41:03 生产环境落地:多智能体并发调度与自动容错; • 52:21 自进化闭环:让 Agent 在失败中自动修补逻辑。 如果你想做能持续赚钱的 AI 自动化业务,而不是写几个 Demo 自嗨, 这绝对是今年含金量最高、没有半句废话的必看视频。
显示更多
0
26
481
127
转发到社区
Cybercab 的 “Unboxed”(开盒式装配)工艺 - 并行组装车辆模块,最后一步完成车架整合,显著优化自动化流程。此方法能将生产线尺寸缩小一半,提升生产容量,Elon 称这是福特流水线以来汽车制造的真正革命👀 期望能用这个工艺做后续 SUV 新车型
显示更多