TopicDigg
最新
社区
登录
注册
注册并分享邀请链接,可获得视频播放与邀请奖励。
立即注册
与「RM」相关的搜索结果
搜索结果
RM
RM 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含
RM
的内容
瞎玩菌
@Blind___Gamer
3hours ago
当boss设计达到巅峰时
0
0
0
0
0
转发到社区
TWICE
@JYPETWICE
8hours ago
TW-LOG @ 6TH WORLD TOUR ‘THIS IS FOR’ ep.DAHYUN | Pt.2 ❤YouTube: 💚NAVER TV: #
TWICE
# #
트와이스
# #
DAHYUN
# #
다현
# #
THISISFOR
# #
TWICE_THISISFOR_WORLD_TOUR
# #
TWlog
# #
틋로그
#
显示更多
0
0
0
261
89
转发到社区
十老板
@zemummy1
2026.08.06 03:48
人穷的时候,父母都会质疑你。 3.13亏了大部分资金大概20万rmb。虽说当天又从1万打到13万,但后续16号二次探底,在bch上又亏回去,转头就找家母借了1万多,继续在5300刀做多比特币,可惜了,7000没跑,又跌回5800跑的,哈哈。 后来就是5月赚到7万。平安的信用卡刚好7万额度,还进去就被降到2000额度,彻底失去流动资金。前前后后找家母借了42000,看得出来最后一次借钱还房贷,已经对我有点失望了,已经质疑我每月生活费高了。但当时我自己一个人,确实只花1000块钱出头。 这还是我从17年7月到20年7月,累计从币圈赚了70 80万的情况下,没办法啦,当你面对困境,只有自己相信自己了。
显示更多
0
0
38
101
3
转发到社区
JingleKitty
@Aleph6Zero9
2026.08.05 14:35
A quiet afternoon with Suisui✨🪭 #
Suisui
# #
WutheringWaves
# #
WuWa
# #
cosplayㅤㅤㅤㅤㅤㅤㅤ
#
0
0
10
5.2K
225
转发到社区
Bitcoin🐝女博士
@DoctorMbitcoin
2026.08.05 06:49
新加坡房产居然是慢牛走势,这样的地区人民生活幸福指数自然会越来越高👩🔬
0
0
79
1
1
转发到社区
AI Dance
@AI_Whisper_X
2026.08.04 12:57
转一下苏剑林老师对 K3 架构的复盘。 一句话概括,K3 = KDA + MLA + Stable LatentMoE + AttnRes。整套设计没什么炫技,核心就是在模型效果、计算效率和训练稳定性之间做取舍。 这里稍微解释一下: KDA,一种线性 Attention MLA,一种 KV Cache 较小的 Full Attention 变体 Stable LatentMoE,对 LatentMoE 做过稳定性改造的 MoE 方案 AttnRes,用可学习的跨层注意力,替代固定等权的残差累加 几个比较有意思的点: ① K3 同时使用了 KDA 和 MLA。另外,训练仍然用 Moonlight 版本的 Muon 优化器,Attention 权重改成 Per-Head Muon,每个 Head 独立优化。苏神说这不会直接提高效果,主要是数学和结构上更合理:各个 Head 本来就相对独立,不应该在优化时耦合在一起。 ② 解决MoE“容易炸”的问题。 LatentMoE 会先降维,再使用更多专家,最后升维,在训推成本大致相同的情况下效果略好。不过连续的矩阵投影也让训练更容易出现数值不稳定。 K3 把 SwiGLU 换成了 SiTU-GLU,用 softcap 压住异常激活;又在 LatentMoE 升维前加了一层 RMS Norm。这个 Norm 不只是让训练更稳定,在 Valid Loss 差不多的情况下,不加它,某些 Benchmark 会稳定变差。 (这里有超级多的技术细节,感兴趣的可以看苏神原文) ③ 关于MLA DSV4 看上去都换设计了,K3 怎么还在用 MLA?苏神的答案是,目前 MLA 仍然很难被全面击败。它在训练阶段是 MHA 形态,推理时 KV Cache 较小;在固定训练成本和 KV Cache 大小时,MLA 依然近乎最优。 它的问题是对 MTP(推测解码)不够友好。MTP 的思路是“用计算换速度”,而 MLA 在 Decoding 阶段本身就比较吃计算,再叠一个 MTP,两边就容易抢算力。 换别的方案也有代价。比如换成 128+128 的 GQA8,效果很难打赢 MLA,KV Cache 还是 MLA 的三倍多;换成 256+256 的 MFA(本质上是 MQA),训练和 Prefill 成本又会上去。 目前还没有一个简单的 Attention 设计,能同时占住效果、训练成本、Prefill、KV Cache 和 Decoding 计算量。在 KDA+MLA 的混合架构下,MLA 的部分问题得到缓解,所以 K3 最后还是选了 MLA。 ④ 苏神觉得,DSV4 也不算真正“抛弃 MLA”。 DSV4 看上去重新设计了 Attention,但底层仍然有 MLA 的影子。它采用的是 head_dims=512、K=V 的 MQA,这正是 MLA 在 Decoding 阶段的形态;再加上 Sparse + Compress,前者减少计算,后者进一步压缩 KV Cache,同时减少计算。 方向很激进,不过 Infra 也更复杂。 ⑤ K3 的 MLA 可以去掉 RoPE,是因为 KDA 已经隐含提供了一种广义的位置信息。 这只适用于 KDA+MLA 的混合结构,像 K2 那种全 MLA 模型,直接去掉 RoPE 还是会明显掉效果。 感觉苏神真正的观点是:大模型架构里很少有免费的升级。K3 的设计哲学不是找一个碾压所有方案的新架构,而是在效果、训练成本、Prefill、Decoding、KV Cache 和稳定性之间,找一个当前更合适的组合。 苏神原文里还有很多技术内容,非常值得一看。 原文地址:
显示更多
0
0
28
326
66
转发到社区
Senlik
@xiaofeilinsen
2026.08.04 07:14
基本都是南美牛,每行最后的数字意思是每公斤/RMB。当然这个价格是批发价,仅做参考 南美牛因为天时地利草场广袤,都撵到天地之间自由成长去了,真没啥心思给你还整什么饲料(后期为了出产也会圈养,实事求是的说是会用到药物,但无论怎么说,和国内饲养不是一回事),且南美牛肉也进欧盟的,标准高
显示更多
0
0
1
2
0
转发到社区
xRoseJelly
@xJellyxRose
2026.08.03 22:26
wataa
0
0
55
637
45
转发到社区
Binance
@binance
2026.08.03 21:01
Price discovery doesn't wait for Monday. Over the last seven weekends, bStocks captured a median 92% of Monday's opening gap. Showing how 24/7 markets absorb new information before traditional exchanges reopen.
显示更多
0
0
23
28
1
转发到社区
Sasha Garis
@SashaGaris7bqd
2026.08.02 16:17
0
0
0
823
31
转发到社区
加载中...