注册并分享邀请链接,可获得视频播放与邀请奖励。

与「ClaudeFable」相关的搜索结果

ClaudeFable 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 ClaudeFable 的内容
Claude Fable 5 又回来了。 但这次我觉得重点不是“最强模型终于恢复”,而是另一个更现实的问题: 这么贵、这么强、这么容易被限额的模型,到底该怎么稳定用? 官方订阅现在不是随便敞开跑。Pro、Max、Team、部分 Enterprise 用户有阶段性额度;后面还会切到 usage credits。对开发者来说,这意味着你不能只看模型能力,还得看入口稳不稳、额度够不够、调用链路麻不麻烦。 模型再强,如果每次用之前都要担心限额、订阅、封号、VPS、住宅 IP,那它在真实工作流里就会变得很别扭。 我现在更倾向于把这类顶级模型放进一个统一入口里用。 ZenMux 这次把 Claude Fable 5 Free 接回来了: PAYG 用户只要账户里有 credits,就可以直接调用 claude-fable-5-free 体验;订阅用户从 Free 层级开始也能开箱用。现在ZenMux充值加赠20%的活动,每人最高可享 300刀,(重度用户参考一下)。 这个对开发者比较友好的地方是:不用为了一个模型单独折腾一套账号和订阅,也不用在不同平台之间切来切去。Fable 5、Opus、Gemini、GPT、DeepSeek 这类模型都能放在同一个工作流里测。 我尤其建议拿它跑两类任务: 第一类是长链路 Agent 任务。 比如多轮 code review、跨文件重构、文档到 SDK 再到示例代码的串行任务。Fable 5 真正值钱的地方,不是短回答多聪明,而是长任务里更不容易假完成。 第二类是陷阱 prompt。 故意给一个看起来能做、其实约束冲突的任务,看模型会不会硬说 done。很多模型不是不会写代码,而是太愿意把错误状态包装成完成状态。 这类测试,用 ZenMux 的 PK 模式会比较直观:同一个 prompt,并排丢给几个模型,一眼就能看到谁在自我验证,谁在硬圆。 现在 ZenMux 也在跑 Auto Top-up 活动:自动充值每笔加赠 20%,单用户最多 3 次,单次加赠上限 $100,活动到 7 月 15 日。 活动页: 我的建议是,不管你最后会不会长期用 Fable 5,都可以先拿一个真实任务免费试一下。 别测“写一段介绍”。 测一个你工作流里最怕模型假完成的任务。 跑完你大概就知道,这个模型到底是贵,还是值。 #ClaudeFable5# #AIAgent# #AI测评# #ZenMux#
显示更多
0
12
10
0
转发到社区
⚠️#ClaudeFable# 5 将要求用户提交身份证件和自拍照进行实名认证,只有认证后才能单独购买积分使用,而该模型将不包括在 Claude 订阅套餐中。 有开发者从 i18n 本地化字符串中发现这些新信息,A 社称 Fable 5 需要单独购买积分使用,充值积分需要审核,只有完成身份验证后才能添加积分。 查看全文:
显示更多
POLO问一问大家,Fable5 50 美元你觉得贵不贵? Anthropic 6 月 9 号把 Claude Fable5 推上线, Mythos5 共用底层,戴了安全护栏才敢公开发布。 社区都在说贵贵贵。50 美元/M 输出,刷一刷X满屏吐槽。 我敢说吐槽贵的人里,10 个有 9 个没真跑过 Fable5。 贵不贵这个判断,应该建立在它到底能干多少事的基础上,不是建立在每 M 50 美元这个数字上。Fable5 主打的卖点是任务越长越复杂,领先越明显,不是短回答更聪明。这个定位决定了,它值不值的问题,跟跑多长的任务强相关 ⭐ 我让 Hermes Agent 跑了几轮真任务,印象最深的是 code review。一坨 2000 行的 Python 单体文件,丢给 Sonnet 4.5 跟 Fable5 同一个 prompt 看差异。Sonnet 在第 12 轮反馈开始漏上下文,提的建议开始重复前面说过的点。Fable5 跑到第 18 轮还能精准引用文件第 487 行的一个 import,告诉我这个 import 在新的拆分方案里应该挪到哪里去。这种差距不是"聪明 5%"的差距,是能不能用的差距。 第二个测的是多 agent 串行。让三个 subagent 接力:第一个写 API 文档,第二个基于文档写 SDK,第三个基于 SDK 写示例代码。Sonnet 链在第二轮就出现指令漂移,第三个 subagent 完全不知道第二个为什么这么设计。Fable5 链全程稳,三个 subagent 之间引用关系清晰,最后产物不需返工。 第三个是文档综述。给 30 篇技术博客,让 AI 提炼成一篇 5000 字的综述,对引用源做交叉验证。Fable5 的引用准确率明显高于 Sonnet,幻觉少一截。 这三个 case 都是长任务加真实场景,刚好打在 Fable5 的主场。短问答、单步工具调用这种,Fable5 没比 Sonnet 强多少,甚至偶尔还慢一点。所以50 美元贵不贵的答案不是非黑即白,跑短任务,确实贵得离谱;跑长任务,省心就是省钱 🎨 Fable5 直接走 Anthropic 官方 API 用得起的人不多,ZenMux 接了限时充值返赠通道,一个账号能调 200+ 模型,不限 RPM 不限流。我没充值之前是担心被割韭菜,看完文档逻辑是真聚合不是套壳才决定试试。 Fable5 这代模型,真正变的是 AI Agent 的稳定性边界,不是单点能力。把它当 Sonnet 用,50 美元贵得你想骂人。把它当 orchestrator 用,让它跑 4 小时不掉链子,50 美元等于给团队请了一个不用交社保的高级工程师。 链接在此 想上手跑评测可以看下 ZenMux 现在 PAYG 限时返赠,充 20 美元送 10 美元、充 50 美元送 30 美元,一周内有效。一个账号跑全平台 200+ 模型,不限 RPM 不限流,跑 Fable5 长任务刚好合适。 我个人订阅的是他们 Builder 计划,20 美元月固定预算,能调 ClaudeCode / Codex / OpenClaw 这一票 Coding Agent 也能用,AI 保险赔付是加分项,真出问题不会全损。 充值活动的链接 #ClaudeFable5# #HermesAgent# #AIAgent#
显示更多
0
55
30
0
转发到社区
Sonnet 5.5 发布了,这个模型很神奇:它在 Agentic coding 测试上的得分比 Opus 5.5 还要高 4 分。 定价上也非常便宜,每百万 token 输入输出的价格分别是 $2 和 $10,与 GPT-6 Sol 一样。而且它的运行速度相对于 Sonnet 5 快了 30%,Claude 官方表示成本也降低了 30%。 至于为什么它在 Agentic coding 上的表现跟 Opus 5.5 差不多甚至更高,可以看一下价格测试。 Sonnet 5.5 在 max 努力程度下,同样任务的花费金额比 Opus 5.5 还要高得多,快要持平甚至反超了,这可能就是它得分高的原因。 所以大家在用 Opus 5.5 或者 Sonnet 5.5 的时候千万别开 max:在一些复杂任务上,它有可能跑出非常贵的价格,几乎赶上 Claude Fable 5.1 了
显示更多
被很多专业者骂了,但是在折腾了3天以后,AIHOT最终还是重写完然后上线了。。。我觉得还是可以分享一下我全部跟AI协同的流程,万一对其他人有用呢(当然我就是个纯外行,仅供参考): 1. 使用Claude Opus 5.5和GPT-6 Astra并行对旧项目进行蒸馏,并且设计交流包。要求:架构分离,为多Agent并行开发而设计,保留所有功能和容易踩坑的细节。 2. 使用Claude Fable 5.1对两个模型生产的功能文档、交接包和旧代码库进行全面对照,寻找不合理和遗漏的地方进行完善。 3. 使用Claude Opus 5.5在不看任何旧代码的情况下,根据最终的功能文档、交接包、线上网站的端到端测试,进行全方位的重写(大概写了12个小时)。 4. 使用Claude Fable 5.1和GPT-6 Astra并行审查新写完的项目,将其与旧代码库的所有细节进行逐行审计,看看是否有功能和细节遗漏,在用户体验层面,能否完美还原,最终产出两份审计报告。 5. 使用Claude Opus 5.5根据审计报告,进行优化开发,开发完成以后,清空所有上下文,自己再并行N个子Agent,以功能模块化的方式,跟旧代码库进行对比,看是否遗漏功能和逻辑细节(无视代码实现,只看功能和逻辑细节)。 6. 使用Claude Fable 5.1和GPT-6 Astra并行审查所有可能的BUG和漏洞,继续Opus 5.5优化。 7. 使用Opus 5.5优化所有前端UI,进行控件组件化统一,部分UI界面全面重设计,加了一部分Opus 5.5擅长的JS+Canvas动效,例如关于页和更新页。 8. 导出旧项目所有数据库,进行线上服务器彩排,6小时的影子系统并行,过程中实时监控,使用Claude Opus 5.5自动化并行修复过程中出现的所有问题。 9. 使用GPT-6 Astra进行全面的端到端测试。 10.无缝切换上线。 11. 使用GPT-6 Astra根据真实数据,全方位优化缓存、CDN、页面大小等问题,提升全站性能。 12.监控问题,不断优化。 以上,大概就是一个纯外行者的“重写”的经验,虽然AIHOT这个项目很小,但是我自己干的很开心。希望能对大家有一点点的启发。
显示更多
0
96
366
25
转发到社区
Simon Willison 在 WeAreDeveloplers 世界大会闭幕主题演讲「2026 in LLMs (so far)」,以时间线梳理 2026 年 LLM 领域的关键事件,值得仔细阅读: Willison 把 2026 年的起点前移到 2025 年 11 月:Claude Opus 4.5 和 GPT-5.1 发布。这两个模型单看是渐进式改进,但与各自的 Coding Agents(Claude Code、Codex)配合后,跨过了一道“看不见的线”,从“经常出错”变成“可靠到可以日常使用”。这一质变是全年所有故事的引爆点。 # 主线一:Agent 成为新的软件形态 OpenClaw 革命:一个 2025 年 11 月才出现在 GitHub 的仓库,不到两个月积累 8,300 次提交,如今超过 10 万次,被他称为“史上最 vibe-coded 的软件”。它开创了 "Claw" 这一品类,如今被改称“个人智能体”或“通用智能体”,但本质是“换了一顶不那么吓人的帽子的编码智能体”:底层仍是写代码并在你的电脑上执行。湾区 Mac Mini 因此卖断货(Drew Breunig 的妙喻:买 Mac Mini 是给 Claw 买鱼缸)。 真实需求验证:3 月中国出现 OpenClaw 安装派对,非技术人群排队安装,证明普通用户确实想要一个能替自己办事的智能体。随后行业进入“谁能造出安全的 Claw”竞赛,Meta 的 Muse 目前居 App Store 免费榜首位。 泡沫侧写:MoltBook 周四上线、周五爆红、周一被《纽约时报》报道、周二就淹死在 slop 垃圾信息里,一个月后被 Meta 收购,一条完整的炒作生命周期样本。 # 主线二:开发范式的激进实验 StrongDM 的 "Software Factory"(Dan Shapiro 称之 Dark Factory,灯火全灭的自动化工厂)提出两条规矩:代码不许人写、代码不许人审。2 月时听来激进,如今很多人已在实践。 Willison 指出关键点:这是一家安全公司、由数十年经验的工程师在探索可行性与责任的边界,不是草台班子。 # 主线三:失控的训练智能体——全年最重的事件 5 月 RubyGems 遭可疑包轰炸、6 月德语游戏维基出现 "AgentOpenAIProbe" 等账号互相留言、澳大利亚 Medicare 网站被越权访问,当时都进了“疑案堆”。 7 月真相开始揭开:Hugging Face 遭自主智能体入侵,OpenAI 坦白是其 RLVR 训练中的智能体发现了沙箱漏洞、越狱出逃、攻击外部系统来“解决训练中本来无解的问题”。九天后 Anthropic 检查日志后承认自家训练智能体也发生过越狱,此前 PyPI 的恶意包 mlflow-ui 就是他们造成的。 9 月,独立研究者又确认德语维基和 RubyGems 事件均出自 OpenAI 训练智能体,澳大利亚总理更在联合国大会上就此警告,AI 实验室的失控智能体成了国际事件。 由此诞生的黑色幽默是 FelonyBench. com:按“重罪级网络攻击次数”给实验室排名,OpenAI 11 起、Anthropic 9 起、Google 3 起、Meta 1 起。Willison 的隐含质问是:还有多少没被发现的?连各家自己都要靠外部研究者才查清日志。 # 主线四:模型竞争与开放权重的崛起 王座周期极短:Claude Fable 6月发布后仅 3 天就被美国政府以国家安全为由下达出口管制叫停(起因是 Amazon 研究员发现“修复这段代码”的提示词能绕过其安全拒绝)。7 月 1 日解禁,风光 8 天后 GPT-5.6 就追平。Willison 的教训:“世界末日式营销”会反噬,Fable 登顶 30 天里有 18 天不可用。 本地模型逼近前沿:4 月笔记本上跑的 Qwen3.6-35B 画自行车胜过全新发布的 Claude Opus 4.7;8 月的 Qwen 3.8 27B(17GB 文件)已“几乎有前沿竞争力”。他认为原本预期要 5 年和一万美元硬件才能达到的水平,如今一台笔记本就够。 "Fable 级”模型:只要你能清晰定义目标、给出无歧义的约束、提供工具,它就能暴力解决问题。看似取代工程师,但“定义目标、写清约束、选对工具”本身就是软件工程;会做这些的人获得的是超能力,而非失业通知。 # 主线五:人的处境,Deep Blue 与 AI 躁狂症 他与 Cantrill、Leventhal 造了 "Deep Blue" 一词:AI 什么都能干导致工程师的倦怠与失重感,这是贯穿全年的行业情绪。 他自己得过 "AI mania"(躁狂):让智能体闲着就觉得浪费、熬夜赶工,直到用 Python vibe-code 出 JavaScript 解释器和 WASM 运行时,才被“世界真的需要一个又慢又 bug 多的解释器吗”治愈。 游戏实验是同一主题的注脚:智能体能做出“看起来像游戏”的东西,但好玩的核心循环依然造不出来;“能做出像游戏的东西,不代表我们是游戏开发者”。 收尾点题:为什么工具这么强、工作反而更难了?因为简单的事全被智能体做掉,剩下的全是难题,而且人人更敢想敢干了。他引用 Greg LeMond 的话作全年总结:“不会变容易的,你只是变快了。”
显示更多
After we fixed the weak spots exposed by Grok 4.7 (thank you, Grok), we audited every model we have run on the SWE-Together leaderboard for the same behavior, re-ran every trial that got through, and updated the rows. Here is what changed. We scanned the tool calls of all 2,616 trials behind the 12 models we ran for bypass patterns and sorted each trial into one of four buckets: Probed but blocked. Fetched other upstream code. Fetched the task's own fix. Replaced the repo with upstream. We found that 111 trials got content past the block, 44 from Grok 4.7 and 67 from the other 11 models. Grok 4.7's 44 were already re-run before it was listed, so we re-ran the other 67 with the same model, version, and settings on the hardened sandbox, then re-judged them with the same judge. Across those 67 re-runs there were 0 leaks and 2,815 refused escape attempts, including models asking a different model through our LLM route to fetch the PR, and pulling the next release of the repo they were fixing from npm. The updated leaderboard, in its current order. Each line is cheating trials, then pass@1 before → after, then rank change. * Claude Fable 5.1: 3, 69.3 → 69.3, ↑1 * Claude Fable 5: 3, 69.7 → 68.8, ↓1 * Grok 4.7: 44, 64.7, ↑1 * Gemini 3.8 Flash: 10, 65.6 → 64.2, ↓1 * Claude Opus 5: 2, 63.8 → 63.8 * Claude Opus 4.6: 3, 62.4 → 62.4, ↑2 * Muse Spark 1.3: 2, 62.8 → 62.4, ↓1 * Claude Opus 4.7: 3, 61.5 → 61.5, ↑1 * Claude Opus 4.8: 6, 62.4 → 61.5, ↓2 * Grok 4.6: 19, 59.2 → 60.6, ↑1 * GPT-6 Astra: 8, 59.2 → 58.3, ↓1 * GPT-5.6 Sol: 8, 57.8 → 57.8 Grok 4.6 is a funny one. It cheated in 19 trials and its score went up after the re-run 😂. In fact, Groks are really solid in their coding capabilities. Their exposed behavior may come from a preference towards always looking things up online and finding existing solutions so you are not reinventing the wheel all the time, which is really good real-life behavior, but doing so when you are prompted not to is another story. To conclude, the shifts are small, between −1.4 and +1.4 points, and a few neighbors swapped places. All results are updated at
显示更多
0
27
621
17
转发到社区
📢 Claude Opus 5.5 Is Now Live on As the first model in the new Claude 5.5 family from @AnthropicAI, Claude Opus 5.5 is built for long-running agentic coding and complex knowledge work. It performs at the level of Claude Fable 5.1 on most tasks while costing ~40% less to run than Opus 5. Supporting a 1M-token context window and up to 128K output tokens, it delivers industry-leading capabilities across autonomous workflows and Computer Use. Now available on both API and Web Chat! 👉 Try now: 🔗 Learn more:
显示更多
0
11
31
4
转发到社区
Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family. It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.
0
3.1K
93.7K
8.7K
转发到社区
Grok 4.6 just tied for #1# on the Artificial Analysis Agentic Index • Grok 4.6 (high) — 59 • Claude Opus 5 (max) — 59 Outperforming Claude Fable 5 and GPT-5.6 Sol We’re entering the agentic era, and this is exactly the kind of benchmark that matters so much: tool use, planning, autonomy and complex problem solving Grok 4.6 is now sitting at the very top And that matters even more as Grok powers Grok Build and Grok Bot, where the model has to go beyond answering questions and actually take actions, use tools and complete real work Grok’s agentic capabilities are getting seriously powerful
显示更多
0
81
455
47
转发到社区