注册并分享邀请链接,可获得视频播放与邀请奖励。

与「moe」相关的搜索结果

moe 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 moe 的内容
转一下苏剑林老师对 K3 架构的复盘。 一句话概括,K3 = KDA + MLA + Stable LatentMoE + AttnRes。整套设计没什么炫技,核心就是在模型效果、计算效率和训练稳定性之间做取舍。 这里稍微解释一下: KDA,一种线性 Attention MLA,一种 KV Cache 较小的 Full Attention 变体 Stable LatentMoE,对 LatentMoE 做过稳定性改造的 MoE 方案 AttnRes,用可学习的跨层注意力,替代固定等权的残差累加 几个比较有意思的点: ① K3 同时使用了 KDA 和 MLA。另外,训练仍然用 Moonlight 版本的 Muon 优化器,Attention 权重改成 Per-Head Muon,每个 Head 独立优化。苏神说这不会直接提高效果,主要是数学和结构上更合理:各个 Head 本来就相对独立,不应该在优化时耦合在一起。 ② 解决MoE“容易炸”的问题。 LatentMoE 会先降维,再使用更多专家,最后升维,在训推成本大致相同的情况下效果略好。不过连续的矩阵投影也让训练更容易出现数值不稳定。 K3 把 SwiGLU 换成了 SiTU-GLU,用 softcap 压住异常激活;又在 LatentMoE 升维前加了一层 RMS Norm。这个 Norm 不只是让训练更稳定,在 Valid Loss 差不多的情况下,不加它,某些 Benchmark 会稳定变差。 (这里有超级多的技术细节,感兴趣的可以看苏神原文) ③ 关于MLA DSV4 看上去都换设计了,K3 怎么还在用 MLA?苏神的答案是,目前 MLA 仍然很难被全面击败。它在训练阶段是 MHA 形态,推理时 KV Cache 较小;在固定训练成本和 KV Cache 大小时,MLA 依然近乎最优。 它的问题是对 MTP(推测解码)不够友好。MTP 的思路是“用计算换速度”,而 MLA 在 Decoding 阶段本身就比较吃计算,再叠一个 MTP,两边就容易抢算力。 换别的方案也有代价。比如换成 128+128 的 GQA8,效果很难打赢 MLA,KV Cache 还是 MLA 的三倍多;换成 256+256 的 MFA(本质上是 MQA),训练和 Prefill 成本又会上去。 目前还没有一个简单的 Attention 设计,能同时占住效果、训练成本、Prefill、KV Cache 和 Decoding 计算量。在 KDA+MLA 的混合架构下,MLA 的部分问题得到缓解,所以 K3 最后还是选了 MLA。 ④ 苏神觉得,DSV4 也不算真正“抛弃 MLA”。 DSV4 看上去重新设计了 Attention,但底层仍然有 MLA 的影子。它采用的是 head_dims=512、K=V 的 MQA,这正是 MLA 在 Decoding 阶段的形态;再加上 Sparse + Compress,前者减少计算,后者进一步压缩 KV Cache,同时减少计算。 方向很激进,不过 Infra 也更复杂。 ⑤ K3 的 MLA 可以去掉 RoPE,是因为 KDA 已经隐含提供了一种广义的位置信息。 这只适用于 KDA+MLA 的混合结构,像 K2 那种全 MLA 模型,直接去掉 RoPE 还是会明显掉效果。 感觉苏神真正的观点是:大模型架构里很少有免费的升级。K3 的设计哲学不是找一个碾压所有方案的新架构,而是在效果、训练成本、Prefill、Decoding、KV Cache 和稳定性之间,找一个当前更合适的组合。 苏神原文里还有很多技术内容,非常值得一看。 原文地址:
显示更多
0
28
326
66
转发到社区
火曜日21時〜は #伊織もえ# ちゃんのらじお♡ interfm 伊織もえの電脳らじお📻 8月1週目のテーマは【今年の夏の宿題】🏫夏の宿題と聞いて思い浮かぶのラジオ体操と朝顔観察🤭 みんなで #もえちゅ# 盛り上げましょう💌 ✉️はmoechu@interfm.jp🫶 #おこげ過去モエちゃんコレクション# #電脳らじお宣伝活動#
显示更多
0
0
758
23
转发到社区
华为的盘古大模型 openPangu-2.0-Pro 还真的开源了 华为官方称:第一个完全在非 NVIDIA 硬件(华为昇腾 NPU)上完成训练的 500B+ 级别前沿模型;MoE 架构,505B/A18B,512K 上下文窗口。 对比 DeepSeek V4 Flash、Kimi K3、GLM 5.2 等国内头部开源模型,看看是否能「遥遥领先」: 略显诡异的是,华为公布的 benchmark 评估维度,和 DeepSeek 几乎完全不重叠 😂,和其他模型也只有很少相同,咱们先简单对比看看,等后续有更多推理服务商接入后再做评测(505B 自己也推不起。。) 在唯一有交集的公开指标上,openPangu 处于"第二梯队"。 GPQA-Diamond 87.9 明显低于 Kimi K3(93.5)和 GLM-5.2(91.2);BrowseComp 65.7 远低于 K3 91.2;SWE-bench Verified 68.5 与 DeepSeek V3.1 时代水平(66.0)相近,低于 V4 自报的 80.6。 但考虑到 openPangu 的参数量级和 Kimi K3、GLM-5.2 差了几倍,这样的表现也属意料之中吧,毕竟 DeepSeek V4 Flash 这样的意外惊喜,也不多。
显示更多
我去,DeepSeek这波是真杀疯了,还是那个13B激活的便宜Flash模型,参数半毛钱没加,纯靠后训练就直接把代码Agent能力干涨7倍, 价格还是地板价, 都快摸到Opus的边了!!! 今天正式开公测的V4-Flash-0731,看完成绩单我直接傻了: ▫️ DeepSWE榜从7.3直接飙到54.4,翻了快7.5倍,之前的V4 Pro预览版才12.8,现在Flash直接把老Pro按在地上打 ▫️ Cybergym从38.7干到76.7直接翻倍,Terminal Bench冲到82.7,比GLM-5.2还高1.7分 ▫️ 工具调用、全栈开发、终端操作这些Agent核心场景,大部分指标都追平甚至超过了贵好几倍的中大型模型,部分硬榜已经摸到Claude Opus 4.8的尾巴 最狠的是,这次半毛钱没加参数:还是284B总参、13B激活的MoE,1M上下文窗口没变,纯靠后训练和Agent框架优化就出了这效果。 模型ID都不用改,老用户API直接自动切新版,一行代码都不用动。 开发者最爽的点全给你安排明白了: 1️⃣原生支持Responses API格式,直接适配Codex,之前接OpenAI、2️⃣Anthropic格式的代码无缝迁移,思考模式照常能用。 3️⃣价格还是那熟悉的白菜价:输入$0.14/百万token,缓存命中才$0.0028,输出$0.28/百万,跑高频Agent、批量改代码、工具调用根本不心疼。 另外提个醒:这次更的只有Flash API,V4 Pro正式版还在赶,App和网页端暂时没更; 跑分用的是官方即将开源的Harness,第三方框架跑出来可能有点差异,但这提升幅度,做执行层模型、跑自动化代码任务的,现在就可以开测了。 之前大家都觉得模型能力涨就得堆参数、烧算力,DeepSeek这波直接给行业打了个样:把后训练和Agent对齐磨到位,小激活模型照样能干旗舰的活,还卖白菜价。 我觉得这波之后,其他家的执行层模型,价格怕是又要往下掉咯 #DeepSeek# #AI编程# #Agent# #大模型#
显示更多
0
17
108
18
转发到社区
今晚,月之暗面宣布开源 Kimi K3,并同步放出了模型权重和技术报告。 Kimi K3 是目前月之暗面能力最强的模型,采用 2.8T MoE 架构,支持原生视觉理解,拥有 100 万 Token 上下文窗口。官方介绍,新架构让模型在相同算力下,智能水平提升了 2.5 倍。
显示更多
除了模型本身,这次还把背后的技术栈一起开源,包括高性能 Attention Kernel、MoE 通信库,以及支撑大规模 Agent 运行的基础设施。
Releasing the model weights and technical report of Kimi K3. Kimi K3 is our most capable model: a 2.8T MoE model with native visual understanding and a 1M-token context window. New model architecture: 2.5x the intelligence per unit of compute, not just more params. Alongside Kimi K3, we're opening up more of the stack behind it — high-performance attention kernels, MoE communication library, and infrastructure for running agent environments at scale. Model weights: Tech report: Tech blog:
显示更多
0
1.2K
37.2K
6K
转发到社区
電車で揉み逃げしてくんなやガキ💢
0
22
651
20
转发到社区
Je suis Français. Et je préfère 100 fois Elon Musk et je lui fais 100 fois plus confiance que à nos politiciens corrompus jusqu’à la moelle pour défendre les démocraties en Europe. Elon est un Occidental. Nous allons bientôt ré-unifier l’Occident et chasser les idées globalo-communistes. Et avoir une vraie renaissance. Vive cette PLS intergalactique.
显示更多
0
26
221
37
转发到社区
Kimi打赢美国模型的关键技术之一,源头或许是创始人杨植麟十年前写的博士论文。 他34岁,清华本科+CMU博士,读博期间在Meta AI和Google Brain都待过。那篇引超1万次的XLNet,脉络后来变成Kimi K2的万亿参数MoE架构。
显示更多