注册并分享邀请链接,可获得视频播放与邀请奖励。

与「SOTA」相关的搜索结果

SOTA 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 SOTA 的内容
BREAKING: MiniMax H3 by @MiniMax_AI is 1st across 3 Video categories (Multi-Image to Video, Image to Video, and Video Editing) on Design Arena. MiniMax H3’s performance in Video Arena puts it ahead of other top performing models like Seedance 2.0 by @BytePlusGlobal, Grok Imagine Video 1.5 Preview by @SpaceXAI, and Gemini Omni Flash by @GoogleDeepMind. This marks another category to be led by open-weight models, following Kimi K3’s first place in our coding categories. Congratulations to the @MiniMax_AI team for establishing a new SOTA in video generation!
显示更多
0
15
1.3K
34
转发到社区
7 days of unlimited Seedance 2.5 on Higgsfield. The most realistic and production-ready video model. Now we offer generations at ZERO credit cost for 7 DAYS. Up to 50 references, 30 seconds of perfect continuity, realism in physics,  advanced VFX/SFX, and SOTA video-to-video editing. 7-day unlimited access starts on August 7.
显示更多
0
169
997
362
转发到社区
先是 GLM5.2,然后是 Kimi K3,现在是 Qwen 3.8 Max,每次国产模型的新发布都更加接近 Coding 领域的 SOTA。从 6 月开始,我感觉国内大模型明显开始在 Coding 和 Agent 领域加速了,和海外顶级 SOTA 的差距正在肉眼可见地缩小。 目前看,国产模型的长程任务、自主运行、反馈回路、跨 Harness 泛化和视觉自我检查等,能力越来越强了。做一个谨慎的预测,预计到 2026 年的年底,对于重度开发者和 Vibe 用户来说,海外模型可能会成为辅助模型,国内的大模型将成为我们的主力工具。 模型用户没有忠诚度,大家会用脚投票的,拭目以待。
显示更多
best blogs of the week (so insightful that i read at least twice) Coding Agent: How @cognition reduces Devin's token cost by harnessing: How @cursor_ai builds complex projects with low redundancy through swarm: How @claudeai Code designs context for new model-driven agents: Robots: @MistralAI SOTA visual navigation model: Vision models: @GoogleDeepMind unveils the source of creativity for diffusion models:
显示更多
卧槽????tmd这次 @claudeai 把牙膏挤爆了🤯!!! Anthropic刚刚发布Claude Opus 5。 以拉爆Claude Fable 5的前沿能力,价格直接来到Fable的一半。 Opus 5的API价格是每百万Token输入5美元、输出25美元,和Opus 4.8完全相同。 Fable 5则是10美元和50美元。 Anthropic直接把它定义为一款可以每天使用的高端模型,并将其设为Claude Max默认模型、Claude Pro最强模型。 跑分方面在CursorBench 3.2中,Opus 5开启最高Effort后,成绩只比Fable 5峰值低0.5%,但单任务成本只有后者一半。 在Frontier-Bench上,它以更低的单任务成本,将Opus 4.8的成绩提升到两倍以上。 Anthropic称,Opus 5目前已经在Frontier-Bench和GDPval-AA等编程、知识工作评测中达到SOTA。 Agent和电脑操作的提升更夸张,同时ARC-AGI 3成绩是第二名的3倍。。。 Zapier AutomationBench中,同等成本下通过率约为第二名的1.5倍,即使使用最低Effort,完成的任务也比其他模型更多。 OSWorld 2.0中,Opus 5只花Fable 5略高于三分之一的成本,就超过了Fable 5的最好成绩。 但这次最值得关注的,可能还不是跑分。 Anthropic反复强调Opus 5更擅长验证自己的工作,并持续迭代到任务真正完成。 一个测试里,模型拿不到机械零件原图,只能访问原始像素。Opus 5自己写了一套计算机视觉管线,提取几何结构,最后在FreeCAD中重建出了完整零件。 另一个任务中,它发现没有实时数据流可以验证代码,于是顺手给自己搭了一套测试框架。 这是一种很关键的Agent能力:发现当前环境缺少完成任务所需的工具,然后自己创造工具。 Opus 5同时加入了Fast Mode,速度大约是默认模式的2.5倍,价格是基础版本的两倍。 API模型名为claude-opus-5,目前已经登陆Claude、Claude Code、Claude Cowork和Claude Platform。 Anthropic现在的模型分层也越来越清楚: Sonnet负责规模和成本; Opus负责绝大部分高难度日常工作; Fable和Mythos继续探索能力与高风险领域的最前沿。 Opus 5真正的场景是大量编程、研究、数据分析和Agent任务,它正在让用户很难继续为Fable 5支付两倍价格。 前沿模型开始主动下放能力、压低价格。 模型战争接下来的重点,会从谁的能力上限最高,逐渐变成谁能用更低成本,把任务稳定地做完。 牛逼,看来前段时间 @OpenAI 和中国开源模型们( @Kimi_Moonshot@Zai_org )真的给A/太多压力了! 继续加油啊家人们!
显示更多
Kimi-K3 全方位实测! 我竟然打游戏输给了她?! 给大家带来Kimi-K3全方位编程能力实测! 包含前端, 后端, Agent能力. 并且包含现有SOTA级别模型横评! 这次 Kimi-K3 交了一个让我都意想不到的成绩, 甚至让我怀疑Scaling Law还远未结束! 下一个是不是要出10T参数量的模型! 本次测试直接把我几个测试集都要打到头了, 前端测试是淘汰的最快的, 我还以为这几个能撑下半年, 结果现在就撑了2个月. 后端的向量数据库测试大概还有几个算法变种可以优化, 然后就到头了, 除非未来的模型能自己发明新算法(那这妥妥AGI了). 测试唯一还需要提升的是Agent能力, 当然不是说Agent能力不行, 而是距离榜首还有一些提升空间. 总之, 现在唯一需要考虑的是, 完了, 又一个 CodingPlan 套餐要断货抢不到了.... #kimik3# #月之暗面# #AIAgent# #多模态大模型# #VibeCoding# #VibeGaming#
显示更多
0
14
65
8
转发到社区
才在山里住了两天 kimi 又有新模型出来啦,不过国内对标 SOTA 模型我都没机会用上,因为一出来就给抢没了,至今只用过 deepseek 和自己部署的 qwen 系列😂😂
显示更多
DeepSeek V4 和 GLM 5.2 的发布本就非常刺激了 这周 Kimi K3 和 Qwen 3.8 接连曝光,直逼 Claude Fable 5 和 GPT-5.6 Sol 而去! 加上这一代提升很大的 Tencent Hy3,虽然有些落后但下一代还很值得期待的 MiniMax M3,AI 模型 SOTA 几乎每周都有易主的可能,至少开源 AI 模型是! Gemini 3.5 Pro 还会有奇迹吗?本来剧透是 07.17 发布的,结果团队内部评估没过关 😂
显示更多
We tested Kimi K3 and Fable on a real bug from the Cline repo, and found that while both models were able to fix it - Fable wins on speed & Kimi wins on cost. - Kimi used 1.7x more tokens than Fable (1.2M vs. 730K) - Fable finished 3.4x faster - 3.5 min and 18 tool calls vs. Kimi’s 12 min and 34 tool calls. - Kimi cost 2.3x less ($0.92 vs. $2.13) thanks to its 3.3x per-token discount Both runs used the same Cline harness, and the traces indicate that Kimi is RL trained to spend more tokens thinking and verifying before completing. This is the first time we've seen an open weight model compete head to head with SOTA. Congratulations to the @Kimi_Moonshot team on this milestone!
显示更多
0
95
3.2K
238
转发到社区
一天又翻了一倍,2.6k stars 了 😂 让 Claude Code + Kimi K3 + Opus 4.8 (reviewer) 干了一天,补全了 30 多个缺失的实验代码,也解决了其他实验代码中依赖不全的问题。更新了大多数实验的模型,使用新模型替代老模型。当然,有些实验必须用比较差的模型,因为 SOTA 模型已经不需要 harness 来补缺陷了。 感谢吴叩天纠正了书中很多事实错误。发布了 v1.1 版本。
显示更多
0
13
499
93
转发到社区