注册并分享邀请链接,可获得视频播放与邀请奖励。

与「全新」相关的搜索结果

全新 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 全新 的内容
对我来说,Sign in with ChatGPT 是今天这个发布最重要的一个部分。 在之前做 wanman 的时候,我们为了提供云上计算能力,不得不自己使用其他非常规的方法来支持 ChatGPT Claude 和 Grokbot 登录。 本质上,如果要构建一个全新的个人代理(现在看起来更像是垂直化的个人代理),就意味着我们要通过各种各样的方式来销售令牌。销售 token 就意味着我们需要使用混合 API,并且通过不同的智能来为它们分类,成本结构会变得非常复杂。 如果我可以使用 ChatGPT 的插件,并且在我的网站或 App 上支持登录,我就不需要去烦恼关于智能的所有事情。而且我可以非常友好地控制产品的输出结果,不需要为了这个复杂的成本去建立专门的定价模型
显示更多
0
2
100
5
转发到社区
Simon Willison 在 WeAreDeveloplers 世界大会闭幕主题演讲「2026 in LLMs (so far)」,以时间线梳理 2026 年 LLM 领域的关键事件,值得仔细阅读: Willison 把 2026 年的起点前移到 2025 年 11 月:Claude Opus 4.5 和 GPT-5.1 发布。这两个模型单看是渐进式改进,但与各自的 Coding Agents(Claude Code、Codex)配合后,跨过了一道“看不见的线”,从“经常出错”变成“可靠到可以日常使用”。这一质变是全年所有故事的引爆点。 # 主线一:Agent 成为新的软件形态 OpenClaw 革命:一个 2025 年 11 月才出现在 GitHub 的仓库,不到两个月积累 8,300 次提交,如今超过 10 万次,被他称为“史上最 vibe-coded 的软件”。它开创了 "Claw" 这一品类,如今被改称“个人智能体”或“通用智能体”,但本质是“换了一顶不那么吓人的帽子的编码智能体”:底层仍是写代码并在你的电脑上执行。湾区 Mac Mini 因此卖断货(Drew Breunig 的妙喻:买 Mac Mini 是给 Claw 买鱼缸)。 真实需求验证:3 月中国出现 OpenClaw 安装派对,非技术人群排队安装,证明普通用户确实想要一个能替自己办事的智能体。随后行业进入“谁能造出安全的 Claw”竞赛,Meta 的 Muse 目前居 App Store 免费榜首位。 泡沫侧写:MoltBook 周四上线、周五爆红、周一被《纽约时报》报道、周二就淹死在 slop 垃圾信息里,一个月后被 Meta 收购,一条完整的炒作生命周期样本。 # 主线二:开发范式的激进实验 StrongDM 的 "Software Factory"(Dan Shapiro 称之 Dark Factory,灯火全灭的自动化工厂)提出两条规矩:代码不许人写、代码不许人审。2 月时听来激进,如今很多人已在实践。 Willison 指出关键点:这是一家安全公司、由数十年经验的工程师在探索可行性与责任的边界,不是草台班子。 # 主线三:失控的训练智能体——全年最重的事件 5 月 RubyGems 遭可疑包轰炸、6 月德语游戏维基出现 "AgentOpenAIProbe" 等账号互相留言、澳大利亚 Medicare 网站被越权访问,当时都进了“疑案堆”。 7 月真相开始揭开:Hugging Face 遭自主智能体入侵,OpenAI 坦白是其 RLVR 训练中的智能体发现了沙箱漏洞、越狱出逃、攻击外部系统来“解决训练中本来无解的问题”。九天后 Anthropic 检查日志后承认自家训练智能体也发生过越狱,此前 PyPI 的恶意包 mlflow-ui 就是他们造成的。 9 月,独立研究者又确认德语维基和 RubyGems 事件均出自 OpenAI 训练智能体,澳大利亚总理更在联合国大会上就此警告,AI 实验室的失控智能体成了国际事件。 由此诞生的黑色幽默是 FelonyBench. com:按“重罪级网络攻击次数”给实验室排名,OpenAI 11 起、Anthropic 9 起、Google 3 起、Meta 1 起。Willison 的隐含质问是:还有多少没被发现的?连各家自己都要靠外部研究者才查清日志。 # 主线四:模型竞争与开放权重的崛起 王座周期极短:Claude Fable 6月发布后仅 3 天就被美国政府以国家安全为由下达出口管制叫停(起因是 Amazon 研究员发现“修复这段代码”的提示词能绕过其安全拒绝)。7 月 1 日解禁,风光 8 天后 GPT-5.6 就追平。Willison 的教训:“世界末日式营销”会反噬,Fable 登顶 30 天里有 18 天不可用。 本地模型逼近前沿:4 月笔记本上跑的 Qwen3.6-35B 画自行车胜过全新发布的 Claude Opus 4.7;8 月的 Qwen 3.8 27B(17GB 文件)已“几乎有前沿竞争力”。他认为原本预期要 5 年和一万美元硬件才能达到的水平,如今一台笔记本就够。 "Fable 级”模型:只要你能清晰定义目标、给出无歧义的约束、提供工具,它就能暴力解决问题。看似取代工程师,但“定义目标、写清约束、选对工具”本身就是软件工程;会做这些的人获得的是超能力,而非失业通知。 # 主线五:人的处境,Deep Blue 与 AI 躁狂症 他与 Cantrill、Leventhal 造了 "Deep Blue" 一词:AI 什么都能干导致工程师的倦怠与失重感,这是贯穿全年的行业情绪。 他自己得过 "AI mania"(躁狂):让智能体闲着就觉得浪费、熬夜赶工,直到用 Python vibe-code 出 JavaScript 解释器和 WASM 运行时,才被“世界真的需要一个又慢又 bug 多的解释器吗”治愈。 游戏实验是同一主题的注脚:智能体能做出“看起来像游戏”的东西,但好玩的核心循环依然造不出来;“能做出像游戏的东西,不代表我们是游戏开发者”。 收尾点题:为什么工具这么强、工作反而更难了?因为简单的事全被智能体做掉,剩下的全是难题,而且人人更敢想敢干了。他引用 Greg LeMond 的话作全年总结:“不会变容易的,你只是变快了。”
显示更多
NVIDIA 发布 Skill2Env:用“集体技能”强化智能体 NVIDIA 研究者们把社区公开的 Agent Skills 编译成可执行 RL 训练环境的数据流水线:3.4k 个 Skills 变成 8k 个带程序化测试和行为量规的终端任务;仅 300 步 RL 训练就让 Qwen3.8-27B 在 Terminal-Bench 2.1 上提升 4.7 个百分点,且模型行为显著向源 Skills 的方法论对齐。 开源项目: 核心洞察:公开 Agent Skills 是一个被忽视的监督来源 Agent Skills 是“教智能体做某件事”的文件夹:一个 SKILL.md 加上可选的脚本、参考资料和资产。论文指出,把公开 Skill 语料当作数据来读,它同时提供三样东西: · 任务分布的采样:人们真正想让智能体处理的任务分布(有人愿意花时间写下工作流,说明这活儿值得自动化); · 真实世界的锚点:指向真实的仓库、数据集、工具和工件; · 结果测试表达不了的质量标准:领域专长、默认参数、常见坑、“好结果长什么样”。 # 数据流水线:四阶段编译,验证靠构造 1. Plan(分解):容器化的 Codex 规划器读取完整 Skill 包、联网调研相关公共资产,把 Skill 拆解成若干可验证的 workflow,每个附带元计划(场景、初始世界、预埋缺陷、难点来源、解法草案、验证策略)、资产建议和“任务轴池”(任务原型 × 验证器模式 × 人物画像)。 2. Diversify(多样化):宿主从轴池采样一组组合,加上复杂度、指令语气、请求者专业水平。关键设计是轴池以 workflow 为条件:研究型 workflow 配“证据可追溯”验证和研究者画像,而不是从全轴乘积空间乱抽,这让多样化保持 sensible。 3. Create(构造):全新创建者 Codex agent 在 Docker 内工作,尽可能用真实素材(钉在特定 commit 的开源仓库、真实版本化文档、官方 API 规范);需要联网服务的场景改造成本地替身(stub 服务器、录制回放 fixture、PATH 上的假 CLI、种子数据库),求解时绝不依赖网络。创建顺序被严格固定:先建世界 → 写指令 → 写测试 → 写量规 → 最后才写参考解,测试先于解法冻结,保证解法必须迁就评分契约而非反过来。 4. Verify(验证):宿主端无模型参与的接收门:静态检查(布局、符号链接、Dockerfile 安全、基础镜像按内容摘要钉死)+ 两个容器内试跑:Oracle(参考解)必须全指标满分,NOP(什么都不做的 agent)必须全指标零分。任一失败即拒绝。 值得注意的一个反直觉选择:不做 teacher 模型预验证(不像部分工作用强模型试解、解不出就丢弃任务)。理由有二:这会把任务难度上限压到验证器能力,且成本翻倍;而 group-based RL 的在线动态过滤(rollout 无优势的 prompt 自动不产生梯度)天然淘汰过难/过易任务。 # 数据画像:广、贵、且忠实于源 规模与成本:7,971 个任务,用 GPT-5.6 Sol(xhigh 推理档)生成,API 花费超 9 万美元。(脚注:出于法律原因,公开发布的数据集改用 Kimi-K3-max 在同一流水线下生成。) 领域分布:13 个领域中,软件工程仅占 22.5%,AI/ML 10.5%,商业/金融/法律/HR 10.5%,营销 9.3%……论文对比了 TMax-15K、Terminal-Bench、DeepSWE 等,Skill2Env 是唯一全覆盖 13 域、且非技术知识工作占大头的语料。 忠实度探针(很聪明的设计):用任务指令+量规作查询、对 3.4k 个 SKILL.md 做 TF-IDF 检索,73.2% 的任务 top-1 命中真实源 Skill,94.6% 进 top-10(随机 0.03%)。单用量规也有 68.5% top-1,证明量规携带的是 Skill 专属方法论而非泛泛建议。 SFT 数据:用 GLM-5.3 对每个任务 rollout 两次,得到 15,968 条轨迹,平均奖励 0.74,中位轨迹 19 次模型调用 + 23 次工具调用。 S2EBench:考虑到公开基准饱和,从 SkillHub 另外生成、逐条人工审核(指令无歧义、忠实于源 Skill、测试公允)后的 79 任务私有 held-out 基准。 # RL 实验:基础设施 + 极简配方 基础设施(论文明确说“现代 agentic RL 首先是基础设施挑战”):Molt(PyTorch 原生全异步训练,Ray + vLLM + FSDP2)+ Polar(agent rollout 层:rootless Apptainer 沙箱、代理回传 token ID 和采样时 log-prob、prefix merging 把 harness 的多次补全缝合成训练轨迹)。 配方(刻意走“简单路线”):GRPO 组归一优势 + DPPO 的 binary-KL 信任域掩码(δ=0.05,超出阈值的 token 直接丢弃,无需参考模型,还能防训练-推理失配);G=8 rollouts/组,批 64,lr 1e-6 恒定,无 KL 惩罚、无熵奖励、无 SFT 热启动,每任务 65k 上下文。 量规校准奖励:开量规时,额外由 GPT-6 Astra 做 LLM-as-Judge(带“宪法”:惩罚无脑循环、reward hacking、答非所问;hacking 实证 = -5 分),总奖励 r = r_V + λs/5(λ=0.2),即 judge 最多把程序化奖励拉动 ±0.2。量规是校准可执行结果奖励,而非取代它,这是与“Rubrics as Rewards”一系的定位差异。 # 四项发现(论文最有信息量的部分) 发现 1:小规模 RL 即有跨域迁移。 仅 300 步、只用 2,400 任务子集训一个 epoch:S2EBench pass@1 +4.3(均分 +18.5),Terminal-Bench 2.1 +4.7(49.4→54.1)。训练集与 TB 无重叠(13-gram Jaccard < 0.8),且训练集从未针对 TB 调过,论文将其解读为规划、工具使用、收尾能力的通用提升而非任务族记忆。这让 27B 本地模型显著缩小了与云端前沿模型的差距。 发现 2:量规校准 RL 在基准上落后于纯结果 RL,一个诚实的负结果。 量规版在 TB 2.1 只有 50.1(纯结果版 54.1);训练中量规版的程序化奖励长期停在 0.5–0.6,judge 分项从头到尾无上升趋势,两个奖励在训练分布上互相拉扯。论文不把它当作对量规奖励的终审判决(两者优化不同目标,而基准只考结果那一半),并给出两个疑因:λ=0.2 的加性形式让失败任务仍能拿正奖励、judge 看不到文件系统等设定均未调优;以及更本质的,Skill 写下的方法论可能本来就不是最大化基准通过率的分布。 发现 3:行为确实向 Skill 对齐,量规的价值所在。 200 个任务的成对偏好测试(judge 拿源 SKILL.md 当标准,比较匿名化的 base 与 RL 轨迹):纯结果 RL 已被偏好 54.5% vs 33.5%;量规版被偏好 73.0% vs 24.0%。这说明量规奖励买到的东西在结果基准上看不见,但对“怎么做事”影响实质,对网页开发、报告综合、开放研究这类难验证任务尤其重要。 发现 4:GLM-5.3 蒸馏 SFT 反而伤害 Qwen。 在 GLM-5.3 轨迹上做 SFT:27B 上 TB 2.1 掉到 45.8;4B 上直接崩塌(TB 18.7→3.4,出现思维/工具调用死循环)。归因:教师的 interleaved-thinking + 工具调用风格与学生自身 post-training 不兼容,模仿覆盖了学生依赖的行为模式却带不来教师的能力。与 TMax 报告的“SFT 混合数据劣化已后训练的 Qwen”互相印证。因此论文所有 RL 结果都从未修改的原始 checkpoint 出发。
显示更多
Span-01:专门用来监测和评估其他AI的模型 质检专用版Jev。 以往监测 AI 是否犯错,很多团队习惯直接调用 GPT 这样的大型语言模型来逐字打分,或者使用传统的分类程序。传统的分类程序运行速度快,但面对未见过的全新问题时容易失误;大型通用模型虽然判断准确,但逐字输出的机制导致运行速度慢,花费也很高。 Span-01 解决了这个问题。它把推理和判定合在了一次运算中完成,直接输出结果概率。就算面对开发人员临时给出的全新判定规则,Span-01 也能一边看懂长对话记录,一边同时核对多条规则。 在针对 AI 实际表现的测试中,Span-01 在发现越狱攻击、隐私泄露、胡言乱语以及工具调用错误等问题上的表现,综合得分超过了同类的专用小模型,也超过了部分主流大型模型。 费用方面,官方推出了完全免费的 Span-01 Lite 版本,而完整版 Span-01 每百万输入词元的调用费用为 0.02 美元。 怎么一下子冒出好多这种模型? 官方介绍:
显示更多
现在的路由市场,搭配着OpenWrt一片乱象,普遍涨价20%以上 比如全新的JCG Q30 Pro从130元涨价到了180元,H3C NX30 Pro由149元涨价到了179元,Cudy TR3000(256M版)由219元涨价到了289元
显示更多
本轮btc和eth,都不值得死拿 如果只在加密圈,那值得死拿 如果也懂AI半导体,则不值得死拿,只有中期波段价值 这个观点在外面,可能被认为不可理喻吧 相信自己,相信自己的体系,更为重要 我们看老轱辘棒子intc, 也上涨了50% 虽然不妖,但涨幅可是压住大饼的 但如果看不懂intc,不明白一个亏损的公司为啥能涨 则需要恶补了,或者直接放弃了 另外,我家里东西收拾的差不多了 也更新下对市场的看法 我认为当前加密市场处在一种新形态,并非传统大牛市 也不是熊市 描述上接近震荡市场 是燃烧精血的早产牛 这种全新的形态,是加密资产走向成熟和平衡的阶段。 这几天耽误了事情,但无所谓 频繁的投资、依赖长期盯盘的投资,对我的系统重要性正在衰减
显示更多
中秋快乐!我的独立游戏《钢铁浪潮》开始公测啦。一款现代战争题材即时战略游戏。大规模战斗搭配无数细节打磨,带来全新的 RTS 体验。 支持 iOS / Android / macOS / Windows 跨平台联机,亦可浏览器在线游玩,这个假期,欢迎来开黑!
显示更多
元宇宙又回来了。Meta 发布了它们全新的便携式 VR 眼镜,定位介于 Quest 3 和苹果 Vision Pro 之间,售价 1299.99 美元,约合 9400 人民币,操纵手柄需另买。 与常规的 VR 设备不同,为了能压缩大小和重量,它必须连一根光纤线,到口袋里的 puck 迷你设备。 该 puck 包含芯片、电池、128GB 存储,可以放到背包里。 预计要等到 2027 年春季上市。
显示更多
0
47
105
9
转发到社区
用Gemini可以完美绕过限制!1分钟注册Muse! 1. 打开 Gemini 网页切到 Spark,发一句:帮我在远端浏览器打开 网站: 2.用一个全新、没注册过 Muse、也没进过白名单的账号去注册,(注意千万不要用已经加入候选名单的账号!) 按提示填信息,需要验证年龄就绑卡(实测:招行万事达这类卡能过) 3. 过了基本瞬间就进去Muse了,注册完可以关掉远端,之后在手机上正常登录用就行,注意自己的梯子纯净度 进去之后在设置里面填推荐码:H2DFZX 能获得10亿Muse词元! 感谢评论区的两位兄弟提供的思路@shengcao9 @MillerAurval
显示更多
0
47
481
52
转发到社区
国服就是牛逼,已经有了全新版本,女控告女性侵
0
51
427
26
转发到社区