注册并分享邀请链接,可获得视频播放与邀请奖励。

与「ClaudeFable」相关的搜索结果

ClaudeFable 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 ClaudeFable 的内容
Claude Fable 5 又回来了。 但这次我觉得重点不是“最强模型终于恢复”,而是另一个更现实的问题: 这么贵、这么强、这么容易被限额的模型,到底该怎么稳定用? 官方订阅现在不是随便敞开跑。Pro、Max、Team、部分 Enterprise 用户有阶段性额度;后面还会切到 usage credits。对开发者来说,这意味着你不能只看模型能力,还得看入口稳不稳、额度够不够、调用链路麻不麻烦。 模型再强,如果每次用之前都要担心限额、订阅、封号、VPS、住宅 IP,那它在真实工作流里就会变得很别扭。 我现在更倾向于把这类顶级模型放进一个统一入口里用。 ZenMux 这次把 Claude Fable 5 Free 接回来了: PAYG 用户只要账户里有 credits,就可以直接调用 claude-fable-5-free 体验;订阅用户从 Free 层级开始也能开箱用。现在ZenMux充值加赠20%的活动,每人最高可享 300刀,(重度用户参考一下)。 这个对开发者比较友好的地方是:不用为了一个模型单独折腾一套账号和订阅,也不用在不同平台之间切来切去。Fable 5、Opus、Gemini、GPT、DeepSeek 这类模型都能放在同一个工作流里测。 我尤其建议拿它跑两类任务: 第一类是长链路 Agent 任务。 比如多轮 code review、跨文件重构、文档到 SDK 再到示例代码的串行任务。Fable 5 真正值钱的地方,不是短回答多聪明,而是长任务里更不容易假完成。 第二类是陷阱 prompt。 故意给一个看起来能做、其实约束冲突的任务,看模型会不会硬说 done。很多模型不是不会写代码,而是太愿意把错误状态包装成完成状态。 这类测试,用 ZenMux 的 PK 模式会比较直观:同一个 prompt,并排丢给几个模型,一眼就能看到谁在自我验证,谁在硬圆。 现在 ZenMux 也在跑 Auto Top-up 活动:自动充值每笔加赠 20%,单用户最多 3 次,单次加赠上限 $100,活动到 7 月 15 日。 活动页: 我的建议是,不管你最后会不会长期用 Fable 5,都可以先拿一个真实任务免费试一下。 别测“写一段介绍”。 测一个你工作流里最怕模型假完成的任务。 跑完你大概就知道,这个模型到底是贵,还是值。 #ClaudeFable5# #AIAgent# #AI测评# #ZenMux#
显示更多
0
12
10
0
转发到社区
⚠️#ClaudeFable# 5 将要求用户提交身份证件和自拍照进行实名认证,只有认证后才能单独购买积分使用,而该模型将不包括在 Claude 订阅套餐中。 有开发者从 i18n 本地化字符串中发现这些新信息,A 社称 Fable 5 需要单独购买积分使用,充值积分需要审核,只有完成身份验证后才能添加积分。 查看全文:
显示更多
POLO问一问大家,Fable5 50 美元你觉得贵不贵? Anthropic 6 月 9 号把 Claude Fable5 推上线, Mythos5 共用底层,戴了安全护栏才敢公开发布。 社区都在说贵贵贵。50 美元/M 输出,刷一刷X满屏吐槽。 我敢说吐槽贵的人里,10 个有 9 个没真跑过 Fable5。 贵不贵这个判断,应该建立在它到底能干多少事的基础上,不是建立在每 M 50 美元这个数字上。Fable5 主打的卖点是任务越长越复杂,领先越明显,不是短回答更聪明。这个定位决定了,它值不值的问题,跟跑多长的任务强相关 ⭐ 我让 Hermes Agent 跑了几轮真任务,印象最深的是 code review。一坨 2000 行的 Python 单体文件,丢给 Sonnet 4.5 跟 Fable5 同一个 prompt 看差异。Sonnet 在第 12 轮反馈开始漏上下文,提的建议开始重复前面说过的点。Fable5 跑到第 18 轮还能精准引用文件第 487 行的一个 import,告诉我这个 import 在新的拆分方案里应该挪到哪里去。这种差距不是"聪明 5%"的差距,是能不能用的差距。 第二个测的是多 agent 串行。让三个 subagent 接力:第一个写 API 文档,第二个基于文档写 SDK,第三个基于 SDK 写示例代码。Sonnet 链在第二轮就出现指令漂移,第三个 subagent 完全不知道第二个为什么这么设计。Fable5 链全程稳,三个 subagent 之间引用关系清晰,最后产物不需返工。 第三个是文档综述。给 30 篇技术博客,让 AI 提炼成一篇 5000 字的综述,对引用源做交叉验证。Fable5 的引用准确率明显高于 Sonnet,幻觉少一截。 这三个 case 都是长任务加真实场景,刚好打在 Fable5 的主场。短问答、单步工具调用这种,Fable5 没比 Sonnet 强多少,甚至偶尔还慢一点。所以50 美元贵不贵的答案不是非黑即白,跑短任务,确实贵得离谱;跑长任务,省心就是省钱 🎨 Fable5 直接走 Anthropic 官方 API 用得起的人不多,ZenMux 接了限时充值返赠通道,一个账号能调 200+ 模型,不限 RPM 不限流。我没充值之前是担心被割韭菜,看完文档逻辑是真聚合不是套壳才决定试试。 Fable5 这代模型,真正变的是 AI Agent 的稳定性边界,不是单点能力。把它当 Sonnet 用,50 美元贵得你想骂人。把它当 orchestrator 用,让它跑 4 小时不掉链子,50 美元等于给团队请了一个不用交社保的高级工程师。 链接在此 想上手跑评测可以看下 ZenMux 现在 PAYG 限时返赠,充 20 美元送 10 美元、充 50 美元送 30 美元,一周内有效。一个账号跑全平台 200+ 模型,不限 RPM 不限流,跑 Fable5 长任务刚好合适。 我个人订阅的是他们 Builder 计划,20 美元月固定预算,能调 ClaudeCode / Codex / OpenClaw 这一票 Coding Agent 也能用,AI 保险赔付是加分项,真出问题不会全损。 充值活动的链接 #ClaudeFable5# #HermesAgent# #AIAgent#
显示更多
0
55
30
0
转发到社区
We switched Claude Fable to Opus 5 and now all 4 models are working hard to generate the film.
Okay, the @VulcanBench results for Qwen3.8-Max are in, and it is not what I expected. First, for anyone new to VulcanBench, here's a quick TL;DR on the eval suite: 23 frontier-hard software engineering tasks taken from real merged OSS PRs, run in a Docker sandbox, 3 runs per task across all three of its effort levels. No puzzles, no random abstract stuff, all real things engineering teams would do with these models. It looks like Qwen3.8-Max has a major overthinking problem, it uses a LOT of tokens and is very slow, period, no other way to see it. My cost to run this benchmark was $126.25, to run the exact same eval suite with DeepSeek V4-Flash was only $13.60. This makes Qwen3.8-Max an insanely expensive model. The tasks Qwen genuinely can't solve fail at every effort level, extra reasoning didn't help. The regression is almost all in work it already handles: six tasks that low solves every single time account for 83% of the 26-point drop, three of them collapsing to zero. It's not losing the hard problems. It's losing the ones it already knows how to do. Since Qwen3.8-Max hit a lot of wall clock budget caps, I thought I'd share more about this. - VulcanBench caps both steps (50–200) and wall clock (5–60 min), each scaled by repo size. - This is aligned with how comparable harnesses bound agents, DeepSWE caps rollouts at 100 environment steps, sitting right inside my step range; Terminal-Bench enforces a per-task wall clock; SWE-bench Verified scaffolds typically allow 20–60 min per instance with 250–350 step limits. - Every model on my chart gets the identical budget, and Qwen is the slowest model I've tested at 20–25 min/task. Soooo... Alibaba positions Qwen3.8-Max as trailing only Claude Fable 5. But on the kind of real coding work engineering teams would actually throw at it, under a fixed budget, its best setting lands mid-pack and its default lands last, so common. If you want to optimize for accuracy, Grok 4.5 is the move. If you want accuracy per dollar, DeepSeek V4-Flash is hard to beat, heck it's 10× cheaper than Qwen and you get higher accuracy. Qwen just isn't in the game at this point, this is not a model I could see engineering teams using for daily coding work.
显示更多
0
28
178
12
转发到社区
Qwen3.8-Max ranks #2# in Vision Arena scoring 1,305. Second only to Claude Fable 5 (High) which has only a 13pt lead.
0
17
365
35
转发到社区
我现在用的最多的模型是: Claude Fable 5 GPT 5.6 Sol Claude Opus 4.6 Claude Opus 5 --- Opus 5 和 Sonnet 5 一样的毛病,过度思考,token 消耗很厉害,聪明不如 Fable 5,性价比不如 GPT 5.6 Sol,有点两头不沾,所以用的少,现在主要用在 Claude Design 相关任务。 Fable 5 虽然贵,但是结果相当靠谱,我会跟它一起讨论技术方案,或者复杂的任务。 其他的脏活累活则给 GPT 5.6 Sol,写作相关的还是 Opus 4.6 最好用。 昨天一个性能优化的任务,GPT 5.6 Sol 做了半天,最后给我悄悄把 16-bit 文本解码改成了 8-bit(图1),数字马上好看了,然后给我交差了😂 最后交给 Fable 5,虽然花了一些时间,但是找到问题根源(图2),还打脸了 GPT 5.6 的优化,最后优化好了。
显示更多
0
79
255
20
转发到社区
我越来越能体会到 Grok 4.5 的牛逼 你如果用 GPT 5.6sol、Claude Fable 5,会发现它们太慢了,而且很多时候太过度思考 反而是 Grok 4.5 干活非常的干脆利落、不过度思考、质量还高,关键价格便宜
显示更多
卧槽????tmd这次 @claudeai 把牙膏挤爆了🤯!!! Anthropic刚刚发布Claude Opus 5。 以拉爆Claude Fable 5的前沿能力,价格直接来到Fable的一半。 Opus 5的API价格是每百万Token输入5美元、输出25美元,和Opus 4.8完全相同。 Fable 5则是10美元和50美元。 Anthropic直接把它定义为一款可以每天使用的高端模型,并将其设为Claude Max默认模型、Claude Pro最强模型。 跑分方面在CursorBench 3.2中,Opus 5开启最高Effort后,成绩只比Fable 5峰值低0.5%,但单任务成本只有后者一半。 在Frontier-Bench上,它以更低的单任务成本,将Opus 4.8的成绩提升到两倍以上。 Anthropic称,Opus 5目前已经在Frontier-Bench和GDPval-AA等编程、知识工作评测中达到SOTA。 Agent和电脑操作的提升更夸张,同时ARC-AGI 3成绩是第二名的3倍。。。 Zapier AutomationBench中,同等成本下通过率约为第二名的1.5倍,即使使用最低Effort,完成的任务也比其他模型更多。 OSWorld 2.0中,Opus 5只花Fable 5略高于三分之一的成本,就超过了Fable 5的最好成绩。 但这次最值得关注的,可能还不是跑分。 Anthropic反复强调Opus 5更擅长验证自己的工作,并持续迭代到任务真正完成。 一个测试里,模型拿不到机械零件原图,只能访问原始像素。Opus 5自己写了一套计算机视觉管线,提取几何结构,最后在FreeCAD中重建出了完整零件。 另一个任务中,它发现没有实时数据流可以验证代码,于是顺手给自己搭了一套测试框架。 这是一种很关键的Agent能力:发现当前环境缺少完成任务所需的工具,然后自己创造工具。 Opus 5同时加入了Fast Mode,速度大约是默认模式的2.5倍,价格是基础版本的两倍。 API模型名为claude-opus-5,目前已经登陆Claude、Claude Code、Claude Cowork和Claude Platform。 Anthropic现在的模型分层也越来越清楚: Sonnet负责规模和成本; Opus负责绝大部分高难度日常工作; Fable和Mythos继续探索能力与高风险领域的最前沿。 Opus 5真正的场景是大量编程、研究、数据分析和Agent任务,它正在让用户很难继续为Fable 5支付两倍价格。 前沿模型开始主动下放能力、压低价格。 模型战争接下来的重点,会从谁的能力上限最高,逐渐变成谁能用更低成本,把任务稳定地做完。 牛逼,看来前段时间 @OpenAI 和中国开源模型们( @Kimi_Moonshot@Zai_org )真的给A/太多压力了! 继续加油啊家人们!
显示更多
Announcing OpenWorker! An open-source agent that doesn't just chat with you, but delivers finished work -- like hand you a polished document, send a slack message, or update a calendar entry. Ask it to prepare a customer brief, untangle your calendar, draft a report, or triage a Slack alert. It works across your files and everyday tools, produces the deliverable, and checks in before doing anything consequential. OpenWorker runs on your Mac, with Windows support coming soon. It does not lock you into any one model. Bring your own API key and run it with GPT 5.6 Sol, Claude Fable, Gemini 3.6, an open weight model (like Kimi, GLM, DeepSeek, Inkling), or Ollama to keep your data local. Your data does not leave your machine except through an LLM provider and integrations that you choose. @rohitcprasad and I are building OpenWorker because AI coworkers are an important way to get work done, and we want there to be an open, privacy-preserving, model-independent option. Check it out and let us know what you think! Try it out: (requires your own API key) Source code:
显示更多
0
469
9.6K
1.4K
转发到社区