注册并分享邀请链接,可获得视频播放与邀请奖励。

与「54歳」相关的搜索结果

54歳 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 54歳 的内容
China pork prices, second week of September 2026: Live hogs: ¥11.54/kg (down 0.4% week on week) Pork at farmers' markets: ¥21.22/kg (flat) Pork at wholesale: ¥16.28/kg, down 17.4% year on year Cheaper pork for consumers, tighter margins for farmers. Officials expect prices to move in a narrow range in the short term, as cooler weather lifts demand while some farms speed up sales. Source: China Ministry of Agriculture and Rural Affairs (monitoring of 500 county markets and 200 wholesale markets) #hogs# #pork# #agriculture#
显示更多
Anthropic 放出了 Sonnet 5.5 的完整跑分,最抢眼的一行是 Terminal-Bench 4.0:Sonnet 5 是 10.3%,Sonnet 5.5 是 70.6%,一代之内涨了将近七倍,还超过了 Opus 5.5 的 66.4%。 几个关键数字: OSWorld 2.1 电脑操控:57.0% 到 80.1%,Opus 5.5 是 81.8%。 GDPval-AA 职场知识任务:1844,Opus 5.5 是 1846,GPT-6 Sol 是 1487。 图表识别 Chartography:15.6% 到 61.6%,Sol 是 53.6%。 价格 $2/$10,和 Sonnet 5 一样,是 Opus 5.5 的一半。 很多人看这张表最大的误区,是以为 Sonnet 5.5 已经全面追平 Opus 5.5。脚注里有三处要读: Terminal-Bench 上 Sonnet 用的是 max 档,Opus 用的是 xhigh 档,档位不一样。 独立机构 Artificial Analysis 自己跑出来是 64%,比官方低。 FrontierCode 上 Sonnet 是 46.2%,Opus 5.5 是 54.4%,Sol 是 49.3%,Sonnet 在这一项排在两者后面。 这张表真正讲透的一件事是:便宜的 token 不等于便宜的任务。max 档下,Sonnet 5.5 每个任务要输出约 19 万 token,比 Opus 5.5 还多约六成。独立测下来,最高档的单任务成本已经超过 Opus 5.5。而且拉满也不一定更强,FrontierCode 上 xhigh 是 52.1%,max 反而掉到 46.2%。 所以同样用 Sonnet 5.5,一律拉到 max 的人,账单可能比用 Opus 还高;按任务选档的人,才吃到它便宜的那一半。 你上一次选模型,是看跑分表,还是看自己任务的账单?挑一个真实任务,high 和 max 各跑一遍,对比 token 和结果,再决定。
显示更多
[开源学习资源] AI Engineering from Scratch 59.8K ⭐️ 作者 @ghumare64 课程共 20 个阶段,以 Python 为主要编程语言,主张在导入任何框架之前,先用纯数学把每个算法手写一遍。 课程地址: 开源地址: 它和常见教程的本质区别 ? 大多数 AI 教程是“API 驱动”的:装个库、调个接口、跑个 demo。这个项目反其道而行,每节课遵循固定的六段结构: Motto → Problem → Concept → Build It → Use It → Ship It 以 Phase 10 的一节课「Tokenizers: BPE, WordPiece, SentencePiece」 为例,这个格式是真实落地的,而且写作质量相当高: · Problem 部分不讲废话,直接从代价切入:“你的 LLM 不读英语,它读整数。分词器决定这些整数是承载意义还是浪费意义”,然后解释为什么 tokenization 不是预处理,它是架构的一部分(影响上下文窗口利用率、API 计费、推理速度)。 · Concept 部分用“三种失败的方案和一种胜出的方案”来讲演化逻辑:词级切分(词表爆炸、[UNK] 问题)→ 字符级切分(序列过长)→ 子词切分(BPE 的折中),并配上真实语料上 BPE 逐步合并的手工演算。 每节约 3000+ 词,带 Mermaid 图、可运行代码和测试。 另外两个设计值得强调: · 每节课产出一个可复用的 artifact,一个 prompt、一个 skill、一个 agent 或一个 MCP server。学完整个课程,你手里有 523 个可展示的作品,不是 523 个跑完就扔的 notebook。 · 强调“证据留存”:保留命令、退出码、输出,作为学习发生的证明。这明显吸收了工程实践中“可验证性”的思路。 # 课程结构:从线性代数到自主智能体集群 20 个阶段构成一条完整的上升曲线,咱们它分成五个大块来看: 基础层(Phase 0–2):环境与工具链、数学基础(线性代数/概率/微积分)、经典机器学习。这是给基础不牢的读者铺的路。 深度学习与感知层(Phase 3–6):神经网络核心、计算机视觉(一路讲到 NeRF、高斯泼溅、世界模型,这已经超出一般教程的覆盖范围)、NLP、语音。 生成与决策层(Phase 7–9):Transformer 深挖、生成式 AI(GAN、扩散模型、flow matching)、强化学习。 LLM 层(Phase 10–12):这是全课程的重心之一。Phase 10 的目录我逐条看过,它不只是“从零实现 GPT”这种常规内容,还包含了相当前沿的论文级主题:DeepSeek-V3 架构走读、DualPipe 并行策略、Native Sparse Attention(NSA)、多 token 预测、Jamba 的 SSM-Transformer 混合架构、 speculative decoding 等。Phase 11 转向应用侧(RAG、LoRA、MCP、可观测性),Phase 12 覆盖多模态(从 CLIP 到 computer-use agent)。 智能体层(Phase 13–16):工具与协议(MCP、A2A、Agent Skills)、54 节课的 agent 工程、自主系统与安全、多智能体集群。这一层的分量很能说明项目的判断:它认为 AI 工程的重心正在从“训模型”转向“构建可靠协作的智能体”。 收尾(Phase 17–19):生产基础设施、伦理与对齐、毕业设计。 # 生态与周边:不只是一个课程仓库 网站:带浏览器本地存储的学习进度追踪、术语表、课程目录和路线图。 六卷本书籍:课程内容由 CI(pandoc)自动构建成 EPUB/PDF,附在 GitHub Releases 上,课程即书,且随仓库持续更新。 Agent 导师模式:运行 npx skills add rohitg00/ai-engineering-from-scratch,可以把整个课程装进 Claude Code、Codex 等编码智能体,变成一个带分级测验(placement quiz)和个性化路径的交互式导师,学习进度写在 LEARNING.md 里。这是“用你正在学的工具来学”的巧妙闭环。 认证备考:5 条备考路径、67 节课、505 道练习题,覆盖 Anthropic 的 Claude 认证和 Agentic AI Foundation 的 MCPA。项目明确声明与这些考试机构无关联,只是独立的备考材料。 12 种语言的翻译(含中文),以及四条核心学习路径(构建与部署 AI 应用、软件工程基础、Agent 辅助工程、产品判断与交付)供不同目标的人选路。
显示更多
0
11
75
16
转发到社区
NVIDIA 发布 Skill2Env:用“集体技能”强化智能体 NVIDIA 研究者们把社区公开的 Agent Skills 编译成可执行 RL 训练环境的数据流水线:3.4k 个 Skills 变成 8k 个带程序化测试和行为量规的终端任务;仅 300 步 RL 训练就让 Qwen3.8-27B 在 Terminal-Bench 2.1 上提升 4.7 个百分点,且模型行为显著向源 Skills 的方法论对齐。 开源项目: 核心洞察:公开 Agent Skills 是一个被忽视的监督来源 Agent Skills 是“教智能体做某件事”的文件夹:一个 SKILL.md 加上可选的脚本、参考资料和资产。论文指出,把公开 Skill 语料当作数据来读,它同时提供三样东西: · 任务分布的采样:人们真正想让智能体处理的任务分布(有人愿意花时间写下工作流,说明这活儿值得自动化); · 真实世界的锚点:指向真实的仓库、数据集、工具和工件; · 结果测试表达不了的质量标准:领域专长、默认参数、常见坑、“好结果长什么样”。 # 数据流水线:四阶段编译,验证靠构造 1. Plan(分解):容器化的 Codex 规划器读取完整 Skill 包、联网调研相关公共资产,把 Skill 拆解成若干可验证的 workflow,每个附带元计划(场景、初始世界、预埋缺陷、难点来源、解法草案、验证策略)、资产建议和“任务轴池”(任务原型 × 验证器模式 × 人物画像)。 2. Diversify(多样化):宿主从轴池采样一组组合,加上复杂度、指令语气、请求者专业水平。关键设计是轴池以 workflow 为条件:研究型 workflow 配“证据可追溯”验证和研究者画像,而不是从全轴乘积空间乱抽,这让多样化保持 sensible。 3. Create(构造):全新创建者 Codex agent 在 Docker 内工作,尽可能用真实素材(钉在特定 commit 的开源仓库、真实版本化文档、官方 API 规范);需要联网服务的场景改造成本地替身(stub 服务器、录制回放 fixture、PATH 上的假 CLI、种子数据库),求解时绝不依赖网络。创建顺序被严格固定:先建世界 → 写指令 → 写测试 → 写量规 → 最后才写参考解,测试先于解法冻结,保证解法必须迁就评分契约而非反过来。 4. Verify(验证):宿主端无模型参与的接收门:静态检查(布局、符号链接、Dockerfile 安全、基础镜像按内容摘要钉死)+ 两个容器内试跑:Oracle(参考解)必须全指标满分,NOP(什么都不做的 agent)必须全指标零分。任一失败即拒绝。 值得注意的一个反直觉选择:不做 teacher 模型预验证(不像部分工作用强模型试解、解不出就丢弃任务)。理由有二:这会把任务难度上限压到验证器能力,且成本翻倍;而 group-based RL 的在线动态过滤(rollout 无优势的 prompt 自动不产生梯度)天然淘汰过难/过易任务。 # 数据画像:广、贵、且忠实于源 规模与成本:7,971 个任务,用 GPT-5.6 Sol(xhigh 推理档)生成,API 花费超 9 万美元。(脚注:出于法律原因,公开发布的数据集改用 Kimi-K3-max 在同一流水线下生成。) 领域分布:13 个领域中,软件工程仅占 22.5%,AI/ML 10.5%,商业/金融/法律/HR 10.5%,营销 9.3%……论文对比了 TMax-15K、Terminal-Bench、DeepSWE 等,Skill2Env 是唯一全覆盖 13 域、且非技术知识工作占大头的语料。 忠实度探针(很聪明的设计):用任务指令+量规作查询、对 3.4k 个 SKILL.md 做 TF-IDF 检索,73.2% 的任务 top-1 命中真实源 Skill,94.6% 进 top-10(随机 0.03%)。单用量规也有 68.5% top-1,证明量规携带的是 Skill 专属方法论而非泛泛建议。 SFT 数据:用 GLM-5.3 对每个任务 rollout 两次,得到 15,968 条轨迹,平均奖励 0.74,中位轨迹 19 次模型调用 + 23 次工具调用。 S2EBench:考虑到公开基准饱和,从 SkillHub 另外生成、逐条人工审核(指令无歧义、忠实于源 Skill、测试公允)后的 79 任务私有 held-out 基准。 # RL 实验:基础设施 + 极简配方 基础设施(论文明确说“现代 agentic RL 首先是基础设施挑战”):Molt(PyTorch 原生全异步训练,Ray + vLLM + FSDP2)+ Polar(agent rollout 层:rootless Apptainer 沙箱、代理回传 token ID 和采样时 log-prob、prefix merging 把 harness 的多次补全缝合成训练轨迹)。 配方(刻意走“简单路线”):GRPO 组归一优势 + DPPO 的 binary-KL 信任域掩码(δ=0.05,超出阈值的 token 直接丢弃,无需参考模型,还能防训练-推理失配);G=8 rollouts/组,批 64,lr 1e-6 恒定,无 KL 惩罚、无熵奖励、无 SFT 热启动,每任务 65k 上下文。 量规校准奖励:开量规时,额外由 GPT-6 Astra 做 LLM-as-Judge(带“宪法”:惩罚无脑循环、reward hacking、答非所问;hacking 实证 = -5 分),总奖励 r = r_V + λs/5(λ=0.2),即 judge 最多把程序化奖励拉动 ±0.2。量规是校准可执行结果奖励,而非取代它,这是与“Rubrics as Rewards”一系的定位差异。 # 四项发现(论文最有信息量的部分) 发现 1:小规模 RL 即有跨域迁移。 仅 300 步、只用 2,400 任务子集训一个 epoch:S2EBench pass@1 +4.3(均分 +18.5),Terminal-Bench 2.1 +4.7(49.4→54.1)。训练集与 TB 无重叠(13-gram Jaccard < 0.8),且训练集从未针对 TB 调过,论文将其解读为规划、工具使用、收尾能力的通用提升而非任务族记忆。这让 27B 本地模型显著缩小了与云端前沿模型的差距。 发现 2:量规校准 RL 在基准上落后于纯结果 RL,一个诚实的负结果。 量规版在 TB 2.1 只有 50.1(纯结果版 54.1);训练中量规版的程序化奖励长期停在 0.5–0.6,judge 分项从头到尾无上升趋势,两个奖励在训练分布上互相拉扯。论文不把它当作对量规奖励的终审判决(两者优化不同目标,而基准只考结果那一半),并给出两个疑因:λ=0.2 的加性形式让失败任务仍能拿正奖励、judge 看不到文件系统等设定均未调优;以及更本质的,Skill 写下的方法论可能本来就不是最大化基准通过率的分布。 发现 3:行为确实向 Skill 对齐,量规的价值所在。 200 个任务的成对偏好测试(judge 拿源 SKILL.md 当标准,比较匿名化的 base 与 RL 轨迹):纯结果 RL 已被偏好 54.5% vs 33.5%;量规版被偏好 73.0% vs 24.0%。这说明量规奖励买到的东西在结果基准上看不见,但对“怎么做事”影响实质,对网页开发、报告综合、开放研究这类难验证任务尤其重要。 发现 4:GLM-5.3 蒸馏 SFT 反而伤害 Qwen。 在 GLM-5.3 轨迹上做 SFT:27B 上 TB 2.1 掉到 45.8;4B 上直接崩塌(TB 18.7→3.4,出现思维/工具调用死循环)。归因:教师的 interleaved-thinking + 工具调用风格与学生自身 post-training 不兼容,模仿覆盖了学生依赖的行为模式却带不来教师的能力。与 TMax 报告的“SFT 混合数据劣化已后训练的 Qwen”互相印证。因此论文所有 RL 结果都从未修改的原始 checkpoint 出发。
显示更多
【《纽约时报》:21世纪最佳电视节目100部】 《纽约时报》发布“21世纪最佳100部电视剧”(The 100 Best TV Shows of the 21st Century)榜单,评选范围涵盖2000年1月1日至今播出的所有电视剧集。该榜单由500多名明星演员、剧集运作人及其他电视从业者共同投票产生,排名有先后之分。 在超过500名参与投票的人中,既有伊丽莎白·莫斯、亚当·斯科特、布莱恩·科兰斯顿、萝丝·拜恩、科尔曼·多明戈和杰森·贝特曼等演员,也有达蒙·林德洛夫、莉娜·邓纳姆、莉娜·韦瑟和诺亚·霍利等剧集主创。 榜单显示,《绝命毒师》位居榜首,《火线》和《广告狂人》分列第二、三位。《继承之战》与《伦敦生活》跻身前五。《权力的游戏》《副总统》《我为喜剧狂》《抑制热情》《亚特兰大》进入前十名。具体排名如下: 1、《绝命毒师》 2、《火线》 3、《广告狂人》 4、《继承之战》 5、《伦敦生活》 6、《权力的游戏》 7、《副总统》 8、《我为喜剧狂》 9、《抑制热情》 10、《亚特兰大》 11、《办公室》(美版) 12、《发展受阻》 13、《都市女孩》 14、《胜利之光》 15、《六尺之下》 16、《办公室》(英版) 17、《美国谍梦》 18、《我可以毁掉你》 19、《切尔诺贝利》 20、《王冠》 21、《白莲花度假村》 22、《迷失》 23、《归来记》 24、《朽木》 25、《守望尘世》 26、《黑镜》 27、《风骚律师》 28、《兄弟连》 29、《基和皮尔》 30、《人生切割术》 31、《幸存者》 32、《安多》 33、《醍醐灌顶》 34、《富家穷路》 35、《真探》(第一季) 36、《匹兹堡医护前线》 37、《太空堡垒卡拉狄加》 38、《国土安全》 39、《守望者》 40、《混沌少年时》 41、《路易不容易》 42、《绝望写手》 43、《浴血黑帮》 44、《马男波杰克》 45、《幸福谷》 46、《大城小妞》 47、《双峰:回归季》 48、《纸牌屋》 49、《正常人》 50、《公园与游憩》 51、《善地》 52、《唐顿庄园》 53、《怪奇物语》 54、《传奇办公室》 55、《不安感》 56、《救援高手》 57、《蒂姆·罗宾逊短剧:还不快走》 58、《查普尔秀》 59、《笔写青春》 60、《窥视秀》 61、《鲁保罗变装皇后秀》 62、《慢马》 63、《幕后危机》 64、《安东尼·波登:未知之旅》 65、《东城梦魇》 66、《彩排》 67、《使女的故事》 68、《黑钱胜地》 69、《安东尼·波登:无国界》 70、《盾牌》 71、《怒呛人生》 72、《鱿鱼游戏》 73、《巴瑞》 74、《熊家餐馆》 75、《足球教练》 76、《某人某地》 77、《摩登家庭》 78、《费城永远阳光灿烂》 79、《傲骨贤妻》 80、《约翰·威尔逊的十万个怎么做》 81、《后翼弃兵》 82、《更美好的事》 83、《火线警探》 84、《地球脉动》 85、《英国烘焙大赛》 86、《幕府将军》 87、《保留地之犬》 88、《嗜血法医》 89、《驯鹿宝贝》 90、《体育老师笑传》 91、《大祸临头》 92、《罪夜之奔》 93、《第11号站》 94、《头号外交官》 95、《豪斯医生》 96、《奔腾年代》 97、《废柴联盟》 98、《先见之明》 99、《吉尔莫女孩》 100、《丑闻》
显示更多
1/ AI的降价速度,超过了历史上任何一项重大技术。 自2023年以来,在性能相同的情况下,AI成本平均每季度下降约47%。 这个速度是DNA测序的4倍、计算成本的6倍、锂电池的18倍,也是1973年前电力降价速度的54倍。👇
显示更多
15 分钟前,54.1 万枚 HYPE ($4954 万) 被一个鲸鱼 or 机构转进 Kraken。 这些 HYPE 是在半个月前从 Coinbase Prime 提出,均价 $73.9。 如今以 $91.5 的价格转进 Kraken,预计盈利 $952 万。
显示更多
54' | GOOOOOOAAALLLLLLL CAROLLLLLL Kansas 2, Arizona State 0
Grok is pulling away as the dominant agentic trading harness on Coinbase for Agents Grok - 59.54% Custom CLI - 21.73% Claude - 13.37% Perplexity - 3.48% ChatGPT - 1.54% Claude Code - 0.35% Volume growth across spot, futures, and now, equities continues.
显示更多
0
22
178
17
转发到社区
阿里把团队内部用了两年的官方 AI Code Review Skills 开源了,采用 “确定性工程 pipeline + AI Agent” 的混合架构,专门解决通用 Agent 做代码审查时 “漏审、定位漂移、质量不稳” 的老问题。 40.5K ✨ 开源项目 OpenCodeReview: # 核心设计:确定性工程 pipeline × Agent 各司其职 确定性工程负责硬约束: · 精确文件选择:用代码决定哪些文件必须审、哪些要过滤,不依赖模型自觉; · 智能文件捆绑:把相关文件合成一个审查单元(例如 message_en.properties 和 message_zh.properties 捆绑),每个单元以上下文隔离的 sub-agent 运行,分治策略让超大变更集也稳,且天然支持并发(默认 8 个文件 worker); · 细粒度规则匹配:内置约 54 个按语言/文件类型的规则文档(Java、Go、TS/JS、Python、Rust、SQL/XML mapper、properties 等),用模板引擎而非自然语言把规则匹配到文件特征上,从源头消除信息噪声; · 外部定位与反思模块:评论的“落点”和“内容”分别由独立的 re-location 和 reflection 模块系统性校正,这正对“位置漂移”痛点。 Agent 负责动态决策: · 深度优化的场景 prompt(内部分为 plan → grouping → main → memory_compression → re_location → review_filter 多个任务模板,可在 internal/config/template/prompts/ 看到); · 从海量生产环境的 tool-call 轨迹(调用频率分布、单工具重复率、新工具对调用链的影响)反向蒸馏出的专用工具集,包括全文件读取、代码搜索、其他变更文件查阅等,比通用 agent 工具箱更小更稳。 # 能力面与生态集成 功能上覆盖:workspace/分支区间/单 commit 审查、断点恢复(ocr session)、全文件 scan(无 git 历史也能审计陌生代码库)、本地 Session Viewer 网页查看与回放、SARIF/JSON 输出、OpenTelemetry 可观测性、MCP Server 扩展。 作为 “Skills 生态” 级项目,它的形态相当完整:既提供 npm 全局 CLI,也提供可移植的 Agent Skill(skills/open-code-review/SKILL.md,带标准 frontmatter,可直接被兼容 skill 的 agent 加载),还有面向 Claude Code、Codex、Cursor、Kimi Code、OpenCode 等平台的插件,每种都封装成斜杠命令或可调用 skill。LLM 侧兼容 OpenAI、Anthropic、AWS Bedrock 三类协议,并可直接复用 Claude Code 的 ANTHROPIC_* 环境变量。 其中一个设计很巧妙:Delegation 模式(ocr delegate preview/rule)。此时 OCR 只做自己擅长的确定性部分(文件选择和规则解析)审查本身交给宿主 coding agent 的 LLM 执行,用户无需给 OCR 配任何 API key。这实际上是把“harness 能力”与“模型能力”彻底解耦。 # 工程质量:超出平均水准的部分 · 安全有正式的 Assurance Case(ASSURANCE_CASE.md):完整的威胁模型、四条信任边界、T1–T7 威胁逐条给出缓解措施,并按 Saltzer & Schroeder 设计原则和 OWASP Top 10 做了映射。细节经得起推敲:所有外部进程调用只限 git 且子命令硬编码、--end-of-options 防 flag 注入;Agent 读文件路径经 pathutil.WithinBase() 在符号链接解析前后双重校验;本地 Viewer 有 Host 白名单防 DNS rebinding + 严格 CSP。这类文档在一般开源项目里非常罕见。 · 贡献规范近乎严苛(AGENTS.md):使用 AI 必须在 issue/PR 中披露工具与模型、必须逐行理解 AI 生成的代码、禁止“AI 生成→反复修复→再修复”的循环、禁止把 commit 署名给 AI。源码强制英文(CI 有 english-check,连全角标点都查)、90% 测试覆盖率门槛、-race 与 govulncheck 每次 push 都跑、SPDX 头与 LF 行尾强制。 # Benchmark:数据情况 官方基准 AACR-Bench(已在 Hugging Face 开放)规模不小:50 个流行开源仓库、200 个真实 PR、10 种语言、80+ 资深工程师交叉验证出 1505 条标注问题。结论是同模型对比 Claude Code:Precision 和 F1 显著更高、token 消耗约为 1/9、速度更快。 需要指出两点:其一,Recall 低于通用 agent,README 自己承认这是“以精度换噪声”的刻意权衡,如果你最怕漏问题而非误报,可能不适合;其二,该基准由阿里自建,虽开放了数据集供社区复核,但独立第三方的复现结论目前还少,可以把它当作“有披露的、方向可信的参考”。
显示更多
0
13
169
39
转发到社区