注册并分享邀请链接,可获得视频播放与邀请奖励。

与「Docker」相关的搜索结果

Docker 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 Docker 的内容
NVIDIA 发布 Skill2Env:用“集体技能”强化智能体 NVIDIA 研究者们把社区公开的 Agent Skills 编译成可执行 RL 训练环境的数据流水线:3.4k 个 Skills 变成 8k 个带程序化测试和行为量规的终端任务;仅 300 步 RL 训练就让 Qwen3.8-27B 在 Terminal-Bench 2.1 上提升 4.7 个百分点,且模型行为显著向源 Skills 的方法论对齐。 开源项目: 核心洞察:公开 Agent Skills 是一个被忽视的监督来源 Agent Skills 是“教智能体做某件事”的文件夹:一个 SKILL.md 加上可选的脚本、参考资料和资产。论文指出,把公开 Skill 语料当作数据来读,它同时提供三样东西: · 任务分布的采样:人们真正想让智能体处理的任务分布(有人愿意花时间写下工作流,说明这活儿值得自动化); · 真实世界的锚点:指向真实的仓库、数据集、工具和工件; · 结果测试表达不了的质量标准:领域专长、默认参数、常见坑、“好结果长什么样”。 # 数据流水线:四阶段编译,验证靠构造 1. Plan(分解):容器化的 Codex 规划器读取完整 Skill 包、联网调研相关公共资产,把 Skill 拆解成若干可验证的 workflow,每个附带元计划(场景、初始世界、预埋缺陷、难点来源、解法草案、验证策略)、资产建议和“任务轴池”(任务原型 × 验证器模式 × 人物画像)。 2. Diversify(多样化):宿主从轴池采样一组组合,加上复杂度、指令语气、请求者专业水平。关键设计是轴池以 workflow 为条件:研究型 workflow 配“证据可追溯”验证和研究者画像,而不是从全轴乘积空间乱抽,这让多样化保持 sensible。 3. Create(构造):全新创建者 Codex agent 在 Docker 内工作,尽可能用真实素材(钉在特定 commit 的开源仓库、真实版本化文档、官方 API 规范);需要联网服务的场景改造成本地替身(stub 服务器、录制回放 fixture、PATH 上的假 CLI、种子数据库),求解时绝不依赖网络。创建顺序被严格固定:先建世界 → 写指令 → 写测试 → 写量规 → 最后才写参考解,测试先于解法冻结,保证解法必须迁就评分契约而非反过来。 4. Verify(验证):宿主端无模型参与的接收门:静态检查(布局、符号链接、Dockerfile 安全、基础镜像按内容摘要钉死)+ 两个容器内试跑:Oracle(参考解)必须全指标满分,NOP(什么都不做的 agent)必须全指标零分。任一失败即拒绝。 值得注意的一个反直觉选择:不做 teacher 模型预验证(不像部分工作用强模型试解、解不出就丢弃任务)。理由有二:这会把任务难度上限压到验证器能力,且成本翻倍;而 group-based RL 的在线动态过滤(rollout 无优势的 prompt 自动不产生梯度)天然淘汰过难/过易任务。 # 数据画像:广、贵、且忠实于源 规模与成本:7,971 个任务,用 GPT-5.6 Sol(xhigh 推理档)生成,API 花费超 9 万美元。(脚注:出于法律原因,公开发布的数据集改用 Kimi-K3-max 在同一流水线下生成。) 领域分布:13 个领域中,软件工程仅占 22.5%,AI/ML 10.5%,商业/金融/法律/HR 10.5%,营销 9.3%……论文对比了 TMax-15K、Terminal-Bench、DeepSWE 等,Skill2Env 是唯一全覆盖 13 域、且非技术知识工作占大头的语料。 忠实度探针(很聪明的设计):用任务指令+量规作查询、对 3.4k 个 SKILL.md 做 TF-IDF 检索,73.2% 的任务 top-1 命中真实源 Skill,94.6% 进 top-10(随机 0.03%)。单用量规也有 68.5% top-1,证明量规携带的是 Skill 专属方法论而非泛泛建议。 SFT 数据:用 GLM-5.3 对每个任务 rollout 两次,得到 15,968 条轨迹,平均奖励 0.74,中位轨迹 19 次模型调用 + 23 次工具调用。 S2EBench:考虑到公开基准饱和,从 SkillHub 另外生成、逐条人工审核(指令无歧义、忠实于源 Skill、测试公允)后的 79 任务私有 held-out 基准。 # RL 实验:基础设施 + 极简配方 基础设施(论文明确说“现代 agentic RL 首先是基础设施挑战”):Molt(PyTorch 原生全异步训练,Ray + vLLM + FSDP2)+ Polar(agent rollout 层:rootless Apptainer 沙箱、代理回传 token ID 和采样时 log-prob、prefix merging 把 harness 的多次补全缝合成训练轨迹)。 配方(刻意走“简单路线”):GRPO 组归一优势 + DPPO 的 binary-KL 信任域掩码(δ=0.05,超出阈值的 token 直接丢弃,无需参考模型,还能防训练-推理失配);G=8 rollouts/组,批 64,lr 1e-6 恒定,无 KL 惩罚、无熵奖励、无 SFT 热启动,每任务 65k 上下文。 量规校准奖励:开量规时,额外由 GPT-6 Astra 做 LLM-as-Judge(带“宪法”:惩罚无脑循环、reward hacking、答非所问;hacking 实证 = -5 分),总奖励 r = r_V + λs/5(λ=0.2),即 judge 最多把程序化奖励拉动 ±0.2。量规是校准可执行结果奖励,而非取代它,这是与“Rubrics as Rewards”一系的定位差异。 # 四项发现(论文最有信息量的部分) 发现 1:小规模 RL 即有跨域迁移。 仅 300 步、只用 2,400 任务子集训一个 epoch:S2EBench pass@1 +4.3(均分 +18.5),Terminal-Bench 2.1 +4.7(49.4→54.1)。训练集与 TB 无重叠(13-gram Jaccard < 0.8),且训练集从未针对 TB 调过,论文将其解读为规划、工具使用、收尾能力的通用提升而非任务族记忆。这让 27B 本地模型显著缩小了与云端前沿模型的差距。 发现 2:量规校准 RL 在基准上落后于纯结果 RL,一个诚实的负结果。 量规版在 TB 2.1 只有 50.1(纯结果版 54.1);训练中量规版的程序化奖励长期停在 0.5–0.6,judge 分项从头到尾无上升趋势,两个奖励在训练分布上互相拉扯。论文不把它当作对量规奖励的终审判决(两者优化不同目标,而基准只考结果那一半),并给出两个疑因:λ=0.2 的加性形式让失败任务仍能拿正奖励、judge 看不到文件系统等设定均未调优;以及更本质的,Skill 写下的方法论可能本来就不是最大化基准通过率的分布。 发现 3:行为确实向 Skill 对齐,量规的价值所在。 200 个任务的成对偏好测试(judge 拿源 SKILL.md 当标准,比较匿名化的 base 与 RL 轨迹):纯结果 RL 已被偏好 54.5% vs 33.5%;量规版被偏好 73.0% vs 24.0%。这说明量规奖励买到的东西在结果基准上看不见,但对“怎么做事”影响实质,对网页开发、报告综合、开放研究这类难验证任务尤其重要。 发现 4:GLM-5.3 蒸馏 SFT 反而伤害 Qwen。 在 GLM-5.3 轨迹上做 SFT:27B 上 TB 2.1 掉到 45.8;4B 上直接崩塌(TB 18.7→3.4,出现思维/工具调用死循环)。归因:教师的 interleaved-thinking + 工具调用风格与学生自身 post-training 不兼容,模仿覆盖了学生依赖的行为模式却带不来教师的能力。与 TMax 报告的“SFT 混合数据劣化已后训练的 Qwen”互相印证。因此论文所有 RL 结果都从未修改的原始 checkpoint 出发。
显示更多
We went deep on Murphy Reid and how his recruitment despite a dramatic national draft slide shows why this Dockers list team is just so good. The Caulfield Grammar rumour, the Travaglia spray. “Is he a brat?”. The Dockers sorted truth from fiction and got an absolute beauty. “The school thing spooked some clubs but he wasn’t involved in it. And on draft night, Fremantle had done the work, and when he fell to them they couldn’t have read his name out any faster.” With @MaccaHeraldSun
显示更多
0
28
146
13
转发到社区
Today at @WeAreDevs, Docker and the @linuxfoundation are announcing a collaboration around the Docker Sandbox Kit Specification: an open standard for declaring what an agent may do, where it may reach, and what it may touch. Open source under Apache 2.0. Read the deep dive:
显示更多
0
14
257
32
转发到社区
昨晚开始用herdr ,挺好的 我觉得这就是未来的开发环境 以前我们用IDE - editor窗口写代码 - terminal窗口运行命令 - console窗口看日志 现在用herdr 所有窗口都用agent agent 写代码 agent 执行测试 agent 看日志 agent 执行 此外想到另一个事情,herdr 有点新瓶装旧酒的感觉,如果大家熟练tmux,也能实现herdr的部分功能 听说融了不少钱,感觉很多创新就是升级扩展老工具啊 让它变得更易用 想到了以前的docker
显示更多
这个精简 OCR 模型,能一次性处理完整 100 页 PDF。 它叫 Unlimited OCR,只有 3B 参数,完全跑在本地硬件上。 大多数 OCR 工具会把文档拆成单页,丢失整体上下文。这个模型用连续方式一次读完整个文档。 单次长程解析,32K 上下文窗口 默认支持多语言 标准解析基准上准确率 93%,比基线高 6 个点 超过 40 页后错误率仍低于 0.11 完全离线运行,不依赖云端 兼容 Transformers、vLLM、SGLang、Docker、Ollama 和 llama.cpp 传统云 OCR 服务如 Textract、Google Vision、Azure Document Intelligence,每 1000 页通常收费 $1.50 到 $15。 这个模型跑在你自己的硬件上,用多久都不花钱。 百度开发它就是为了超越 DeepSeek OCR。Hugging Face 上已有 190 万下载,但大部分用户还不知道。 100% 开源。
显示更多
传统的 Deep Research 已经卷到头了。 能写出一份漂亮的总结报告 ≠ 能把真实的复杂任务干完。 我拿几十万字的《红楼梦》原著,给 Apodex 1.1 在线工作台,出了个极其变态的任务。 统计 20 个核心人物的 → 出场次数 → 出场回数 → 每个人第一次出场时的原句 最后还要整理成一张可以直接下载的完整表格。 整个完成任务的过程,像是直接「雇佣一个 AI 数据团队」。 上传文件后,它自己开始拆任务。 一个 Agent 负责解析原著,另一个独立分析,多个任务并行推进; 右侧 Task Board 会实时告诉你现在做到哪一步。 更有意思的是,任务跑到一半,我突然改需求: “只分析前 80 回,后面的不要了。” 以前遇到这种情况,AI 很可能重新来一遍。 Apodex 直接保留已经完成的成果,只重规划受影响的部分。 更关键的是,它不是做完就交卷。 交付前,又调起独立核验 Agent,把人物统计、出场回数和 900+ 条出场原句重新检查一遍。 最后交付给我的是: 可下载的结构化表格 + 完整分析结果 + 口径说明。 这可能才是下一代 Deep Research 真正值得关注的变化: 从“帮你生成一份报告”,变成“接管一项复杂任务,并把它做完”。 目前,Apodex 1.1 Web 端已经正式上线。 🎁 注册即送 credits,强烈建议立刻上传个复杂文件自己跑跑看: 🌐 没想到,更炸裂的是,Apodex 居然开源了 开源模型: Apodex 1.1 mini,35B,开放模型权重,支持本地部署。 开源框架: FrontierAgent,Agent 执行 Harness,支持 ReAct 单 Agent + Multi-Agent Team。 本地运行: 支持 macOS / Linux,无需强制依赖 Docker。 组合能力: Apodex 1.1 mini + FrontierAgent,可在本地运行完整 Agent 执行流程。 💻 如果你是开发者,这里有开源 Agent 框架,欢迎顺手点个 ⭐: 👉 🤗 想本地自己跑模型的看这里👇 #Apodex# #DeepResearch#
显示更多
0
20
27
3
转发到社区
我把一个快交不出来的广告项目塞给 AI,它先从 4 份文件里揪出一笔 18,700 元的预算口径差。 把这个仿生机器人 TVC 广告项目背后的 Brief、预算 Excel、交付标准和 6 个锁定镜头故事板,一次性丢进 Apodex 1.1 的真实过程。 我的要求一点都不“AI Demo”:哪些镜头必须原样保留,哪些还没做完;86,000 元预算到底花到了哪里;从今天到交付日怎么排;风险由谁负责;最后还要留下能继续维护的镜头决策和预算模型。 以下是它的执行过程: Apodex 先建了 Task Board,把文件、步骤、依赖和交付物全部摊开。它逐项把 6 个锁定镜头映射回故事板,很快发现两张表的数字对不上:镜头表里的已发生成本是 39,100 元,总预算表里的已发生支出却是 57,800 元。 多出来的 18,700 元没有被悄悄抹平,它直接把口径冲突标进结果。 更真实的一幕出现在生成 Excel 时。 颜色格式不兼容,报错。 合并单元格挡住公式,又报错。 页面里能看到它定位问题、修改结构、重新生成,再继续检查。最后交回来 4 份可以继续工作的文件:报告、Word、PDF,以及公式驱动的预算模型;还有 8 天排期、风险登记和每个镜头的处理决定。 以前测模型,我常盯着它“一次回答得有多聪明”。这次我更在意它能不能进入真实文件和工具环境,记住长链条任务的状态,碰到失败自己修回来,再把结果交到我手里。 Apodex 1.1 把这套能力建立在 Environment Scaling、Agentic Coordination Scaling 和统一的 AgentOS 上。录屏里看得很直观:步骤、异常、重试和产物都留在同一个项目里,你随时知道任务推进到了哪里。 想测它,最简单的方式是拿一份你正在做的 PDF、Excel、Brief 或代码上传,看看它最后能交回来什么。Web 工作台已经开放,新账号可领取体验 credits;API 本轮提供两周免费体验。 Web 工作台: API Platform: 开源执行框架 FrontierAgent: FrontierAgent 不强制依赖 Docker,可一条命令运行,欢迎顺手点个 Star。 Apodex 1.1 mini 模型权重: 35B 级 mini 权重可本地部署,也可以搭配 FrontierAgent 使用。 #Apodex#
显示更多
0
39
53
7
转发到社区
Unraid 8 is going to be massive. In Part 2 of the Uncast, Tom & Eli reveal what’s next for your homelab: 🔸 Moving to a Fedora-based distro 🔸 Native Docker Compose support 🔸 Built-in backups (S3/Cloud/Server) 🔸 Complete UI overhaul 🔸 Much more to come!
显示更多
TrendRadar AI舆情监控助手与热点筛选工具 聚合多平台热点+RSS订阅,支持关键词精准筛选; 智能筛选新闻+翻译+分析简报直推手机,支持接入MCP架构,赋能对话分析、情感洞察与趋势预测; 支持 Docker ,数据本地/云端自持。集成微信/飞书/钉钉/Telegram/邮件/ntfy/bark/slack推送
显示更多
面试官:你了解 Docker 吗? 我:知道,就是把项目打包成镜像,跑容器里。 面试官:Docker 和虚拟机有什么区别? 我:Docker 小,虚拟机大。 面试官:…...
显示更多
0
83
309
8
转发到社区