注册并分享邀请链接,可获得视频播放与邀请奖励。

与「OZworld」相关的搜索结果

OZworld 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 OZworld 的内容
・まんし師匠(@hesikojonny ) ・unlucky(@JustxUnlucky ) ・OZworldさん(@OverZenith369 )
0
79
9.1K
552
转发到社区
なんと!!!ツアーファイナルきてくれた🔥🔥🔥嬉しすぎる、、、本当にありがとう😭✌️ #OZworld# #AI#
0
8
787
32
转发到社区
卧槽????tmd这次 @claudeai 把牙膏挤爆了🤯!!! Anthropic刚刚发布Claude Opus 5。 以拉爆Claude Fable 5的前沿能力,价格直接来到Fable的一半。 Opus 5的API价格是每百万Token输入5美元、输出25美元,和Opus 4.8完全相同。 Fable 5则是10美元和50美元。 Anthropic直接把它定义为一款可以每天使用的高端模型,并将其设为Claude Max默认模型、Claude Pro最强模型。 跑分方面在CursorBench 3.2中,Opus 5开启最高Effort后,成绩只比Fable 5峰值低0.5%,但单任务成本只有后者一半。 在Frontier-Bench上,它以更低的单任务成本,将Opus 4.8的成绩提升到两倍以上。 Anthropic称,Opus 5目前已经在Frontier-Bench和GDPval-AA等编程、知识工作评测中达到SOTA。 Agent和电脑操作的提升更夸张,同时ARC-AGI 3成绩是第二名的3倍。。。 Zapier AutomationBench中,同等成本下通过率约为第二名的1.5倍,即使使用最低Effort,完成的任务也比其他模型更多。 OSWorld 2.0中,Opus 5只花Fable 5略高于三分之一的成本,就超过了Fable 5的最好成绩。 但这次最值得关注的,可能还不是跑分。 Anthropic反复强调Opus 5更擅长验证自己的工作,并持续迭代到任务真正完成。 一个测试里,模型拿不到机械零件原图,只能访问原始像素。Opus 5自己写了一套计算机视觉管线,提取几何结构,最后在FreeCAD中重建出了完整零件。 另一个任务中,它发现没有实时数据流可以验证代码,于是顺手给自己搭了一套测试框架。 这是一种很关键的Agent能力:发现当前环境缺少完成任务所需的工具,然后自己创造工具。 Opus 5同时加入了Fast Mode,速度大约是默认模式的2.5倍,价格是基础版本的两倍。 API模型名为claude-opus-5,目前已经登陆Claude、Claude Code、Claude Cowork和Claude Platform。 Anthropic现在的模型分层也越来越清楚: Sonnet负责规模和成本; Opus负责绝大部分高难度日常工作; Fable和Mythos继续探索能力与高风险领域的最前沿。 Opus 5真正的场景是大量编程、研究、数据分析和Agent任务,它正在让用户很难继续为Fable 5支付两倍价格。 前沿模型开始主动下放能力、压低价格。 模型战争接下来的重点,会从谁的能力上限最高,逐渐变成谁能用更低成本,把任务稳定地做完。 牛逼,看来前段时间 @OpenAI 和中国开源模型们( @Kimi_Moonshot@Zai_org )真的给A/太多压力了! 继续加油啊家人们!
显示更多
OpenAI 发布 GPT-5.4,定位为专业工作场景的旗舰模型,同步推出面向高复杂任务的 GPT-5.4 Pro 版本。 这次发布的最大亮点是 GPT-5.4 成为 OpenAI 首个原生支持"电脑操控"(Computer Use)的通用模型——也就是说,它可以像人一样通过截图、点击鼠标、敲击键盘来操作真实的电脑界面。 在 OSWorld-Verified 桌面操控测试中,GPT-5.4 以 75% 的成功率超过人类(72.4%),而上一代 GPT-5.2 只有 47.3%。 在知识类工作方面,GPT-5.4 在涵盖 44 种职业的 GDPval 基准测试中,与行业专业人士打平或胜出的比例达到 83%,GPT-5.2 的这一数字是 70.9%。 投行建模任务的内部评测得分从 68.4% 跳升到 87.3%,生成演示文稿的效果在人工评审中有 68% 的概率优于前代。 编程能力上,GPT-5.4 整合了此前专为写代码设计的 GPT-5.3-Codex 的能力,在 SWE-Bench Pro 上得分 57.7%,与 GPT-5.3-Codex 的 56.8% 相当,但延迟更低。 另一个实用改进是"工具搜索"(Tool Search):以往给模型配备大量外部工具时,所有工具定义都要塞进提示词里,动辄消耗数万个 token。 GPT-5.4 改为按需查找工具,在测试中将 token 消耗减少了 47%,对于依赖大量 MCP 工具的开发者来说成本节省明显。 在 ChatGPT 中,GPT-5.4 Thinking 将支持在生成过程中展示思考计划,用户可以中途介入调整方向——不用等模型跑完再重新来过。 定价方面,API 输入价格从 GPT-5.2 的每百万 token 1.75 美元涨至 2.50 美元,输出价格从 14 美元涨至 15 美元。GPT-5.4 今天起向 ChatGPT Plus、Team、Pro 用户开放,取代 GPT-5.2 Thinking 成为默认推理模型,GPT-5.2 Thinking 将在三个月后于 2026 年 6 月 5 日正式退役。
显示更多
0
46
270
32
转发到社区
【2025 HYERI FANMEETING TOUR <Welcome to HYERI’s STUDIO> IN TAIPEI】D-7 ​ 倒數七天就要與惠利見面了💓 聽說她有個問題想問你們 大家可以大聲說出你的答案嗎? ​ 購票網站 #혜리# #HYERI# #WelcometoHYERIsSTUDIO# #오엔기획# #ONworldwide# #HakunaMatata# #tripcom#
显示更多
0
57
3.2K
291
转发到社区