从太子集团的陈志到硬件钱包Coldcard,全部都因为随机数导致私钥被破解,那随机数和私钥有什么关系?为什么他们的随机数会出问题?
首先比特币私钥本身就是一个256位的随机数,而这也是比特币最安全的核心保障,因为这个数字的组合总共有10的77次方,远远大于地球上沙子的数量,大约等于整个可观测宇宙中的原子总数,这种天文数字即使动用地球上所有的计算资源都不可能暴力穷举出来。
那既然规模如此之大,陈志和Coldcard又是怎么被盗的?
核心就是在于,私钥安全的前提是因为它是个随机数,而如果你的私钥生成的过程根本不随机,那根本用不到什么量子计算机,随便一台电脑跑几个小时就能把你的私钥算出来。
随机数分为两种,伪随机数和真随机数,简单来说凡是通过一定的数学公式使用代码生成的都是伪随机数,而通过物理现象产生的随机数才是真随机数。
比如你使用Python的random()函数生成一个随机数是214,你以为真的是电脑给你随机选了一个数字,实际上这个数字是通过一个数学公式生成出来的,比如下一个数字=当前数字*7+3-5,那么你只要知道计算的公式就可以穷举出来这个公式能生成出的所有结果。
这时候问题来了,你会奇怪那为什么计算机不真的给我一个随机数呢?因为对于软件来说,任何结果都不可能平白无故的直接产生,你得有输入信息,并且配合程序运算,才可以有输出结果。
所以真正的随机来自于不需要软件和数学公式的物理世界,比如你投出的一个骰子,或者下一个雨滴掉落的位置。
所以对于私钥来说,想产生安全的随机数,只有软件不够,必须要配合硬件,比如提取CPU的电子噪音来作为完全无法被预测的输入信息,现在成熟的手机和电脑本身已经提供了硬件层面的安全随机接口可以调用,所以你用OKX、币安和Metamask生成的钱包都大概率使用了硬件噪音产生真随机数,主流硬件钱包自己本身也会读取硬件数据获得随机数。
陈志的钱包被盗是因为雇的程序员水平太差,直接用了最初级的随机数代码,估计是从哪个野鸡学校绑过去了一个刚毕业的大学生,抽了几鞭子就开始干活了。
Coldcard本身其实已经使用了硬件层面的随机数,但因为一个版本出现漏洞导致没有调用到硬件信息,而是采用了纯软件生成。
所以现在的问题是,你的钱包生成随机数的过程,到底随机不随机,完全是个黑盒,你压根不知道。
最有效安全的方式,就是你自己拿个骰子扔100次,记录下来每次的数字,然后把它转换成256位的二进制编码,再使用BIP39算法转换成24个英文单词,也就是你的助记词。
显示更多
转一下苏剑林老师对 K3 架构的复盘。
一句话概括,K3 = KDA + MLA + Stable LatentMoE + AttnRes。整套设计没什么炫技,核心就是在模型效果、计算效率和训练稳定性之间做取舍。
这里稍微解释一下:
KDA,一种线性 Attention
MLA,一种 KV Cache 较小的 Full Attention 变体
Stable LatentMoE,对 LatentMoE 做过稳定性改造的 MoE 方案
AttnRes,用可学习的跨层注意力,替代固定等权的残差累加
几个比较有意思的点:
① K3 同时使用了 KDA 和 MLA。另外,训练仍然用 Moonlight 版本的 Muon 优化器,Attention 权重改成 Per-Head Muon,每个 Head 独立优化。苏神说这不会直接提高效果,主要是数学和结构上更合理:各个 Head 本来就相对独立,不应该在优化时耦合在一起。
② 解决MoE“容易炸”的问题。
LatentMoE 会先降维,再使用更多专家,最后升维,在训推成本大致相同的情况下效果略好。不过连续的矩阵投影也让训练更容易出现数值不稳定。
K3 把 SwiGLU 换成了 SiTU-GLU,用 softcap 压住异常激活;又在 LatentMoE 升维前加了一层 RMS Norm。这个 Norm 不只是让训练更稳定,在 Valid Loss 差不多的情况下,不加它,某些 Benchmark 会稳定变差。
(这里有超级多的技术细节,感兴趣的可以看苏神原文)
③ 关于MLA
DSV4 看上去都换设计了,K3 怎么还在用 MLA?苏神的答案是,目前 MLA 仍然很难被全面击败。它在训练阶段是 MHA 形态,推理时 KV Cache 较小;在固定训练成本和 KV Cache 大小时,MLA 依然近乎最优。
它的问题是对 MTP(推测解码)不够友好。MTP 的思路是“用计算换速度”,而 MLA 在 Decoding 阶段本身就比较吃计算,再叠一个 MTP,两边就容易抢算力。
换别的方案也有代价。比如换成 128+128 的 GQA8,效果很难打赢 MLA,KV Cache 还是 MLA 的三倍多;换成 256+256 的 MFA(本质上是 MQA),训练和 Prefill 成本又会上去。
目前还没有一个简单的 Attention 设计,能同时占住效果、训练成本、Prefill、KV Cache 和 Decoding 计算量。在 KDA+MLA 的混合架构下,MLA 的部分问题得到缓解,所以 K3 最后还是选了 MLA。
④ 苏神觉得,DSV4 也不算真正“抛弃 MLA”。
DSV4 看上去重新设计了 Attention,但底层仍然有 MLA 的影子。它采用的是 head_dims=512、K=V 的 MQA,这正是 MLA 在 Decoding 阶段的形态;再加上 Sparse + Compress,前者减少计算,后者进一步压缩 KV Cache,同时减少计算。
方向很激进,不过 Infra 也更复杂。
⑤ K3 的 MLA 可以去掉 RoPE,是因为 KDA 已经隐含提供了一种广义的位置信息。
这只适用于 KDA+MLA 的混合结构,像 K2 那种全 MLA 模型,直接去掉 RoPE 还是会明显掉效果。
感觉苏神真正的观点是:大模型架构里很少有免费的升级。K3 的设计哲学不是找一个碾压所有方案的新架构,而是在效果、训练成本、Prefill、Decoding、KV Cache 和稳定性之间,找一个当前更合适的组合。
苏神原文里还有很多技术内容,非常值得一看。
原文地址:
显示更多
马斯克预言:年底芯片将有效过剩!
1. 芯片过剩、电网瘫痪
AI 芯片的生产速度 > 供电能力。大量的芯片被堆在仓库里,结果是,有芯片,但没电开机。
2. 地球电力有限
全球 AI 总算力大约每7个月翻一倍,相当于每年增长3.3倍,几年下来就是1000倍+的增长,算力的瓶颈最终是电力和散热,地球上的能源无法支撑 AI 算力的扩张。
3. 太空解锁无限算力
唯一解法是走向太空。利用太空无间断的太阳能,每年可部署数100吉瓦甚至太瓦级的算力集群,彻底解锁 AI 瓶颈。
显示更多
哎呦我旁边那哥们儿眼神一直往我这儿飘 好像我是啥稀罕宝贝似的 真想告诉他看归看 可别看入迷啦 哪怕夸我一句好看 我也能回个甜甜的笑呢
显示更多
嘉立创 竟然上市了。 感觉偷摸的,当前的媒体太low了,这都看不到报道。
长鑫什么的我不太关心,嘉立创这可是未来啊。
Grok Build 可以修改 Model 到比如 DS4Flash 吗?
Zenith Greyrat - Mushoku Tensei
(256 images and 140 animations)
6th preview. I should start posting previews of another character soon. Maybe Hilda or Elinalise🤔 Let me know which one you prefer
显示更多
Zenith Greyrat - Mushoku Tensei
(256 images and 140 animations)
3rd preview
天神祭 奉納花火
日程:2026年7月25日(土)
打ち上げ開始時間:19:30
住所:大阪府大阪市北区都島中通1丁目(桜之宮公園・川崎公園周辺)
显示更多