TopicDigg
最新
社区
登录
注册
注册并分享邀请链接,可获得视频播放与邀请奖励。
立即注册
与「这只公鸡懂兵法」相关的搜索结果
搜索结果
这只公鸡懂兵法
这只公鸡懂兵法 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含
这只公鸡懂兵法
的内容
魅力山西
@meilishanxi
2026.05.06 05:13
今年的“金鸡奖”影帝应该给这只公鸡🐓 #
两狗围攻一公鸡
# #
以为公鸡死了
# #
这只公鸡懂兵法
# #
搞笑
#
0
0
3
71
2
转发到社区
陈一发儿
@yifaer_chen
2026.08.05 11:55
今天大A回血29万,连涨三天了。 美股连涨四天了喔。 我这只惊弓之鸟,把之前抄底的卖得七七八八了,卖飞了不少。😭😭😭 希望不要冲太快了,冲太快了又要被砸下来。 AMD我一直保持300多股,跌了就买点,涨了卖一些。 这回财报果然又是冲高之后大跌,搞多少回了都。😇😇
显示更多
0
0
136
196
3
转发到社区
AI Dance
@AI_Whisper_X
2026.08.04 12:57
转一下苏剑林老师对 K3 架构的复盘。 一句话概括,K3 = KDA + MLA + Stable LatentMoE + AttnRes。整套设计没什么炫技,核心就是在模型效果、计算效率和训练稳定性之间做取舍。 这里稍微解释一下: KDA,一种线性 Attention MLA,一种 KV Cache 较小的 Full Attention 变体 Stable LatentMoE,对 LatentMoE 做过稳定性改造的 MoE 方案 AttnRes,用可学习的跨层注意力,替代固定等权的残差累加 几个比较有意思的点: ① K3 同时使用了 KDA 和 MLA。另外,训练仍然用 Moonlight 版本的 Muon 优化器,Attention 权重改成 Per-Head Muon,每个 Head 独立优化。苏神说这不会直接提高效果,主要是数学和结构上更合理:各个 Head 本来就相对独立,不应该在优化时耦合在一起。 ② 解决MoE“容易炸”的问题。 LatentMoE 会先降维,再使用更多专家,最后升维,在训推成本大致相同的情况下效果略好。不过连续的矩阵投影也让训练更容易出现数值不稳定。 K3 把 SwiGLU 换成了 SiTU-GLU,用 softcap 压住异常激活;又在 LatentMoE 升维前加了一层 RMS Norm。这个 Norm 不只是让训练更稳定,在 Valid Loss 差不多的情况下,不加它,某些 Benchmark 会稳定变差。 (这里有超级多的技术细节,感兴趣的可以看苏神原文) ③ 关于MLA DSV4 看上去都换设计了,K3 怎么还在用 MLA?苏神的答案是,目前 MLA 仍然很难被全面击败。它在训练阶段是 MHA 形态,推理时 KV Cache 较小;在固定训练成本和 KV Cache 大小时,MLA 依然近乎最优。 它的问题是对 MTP(推测解码)不够友好。MTP 的思路是“用计算换速度”,而 MLA 在 Decoding 阶段本身就比较吃计算,再叠一个 MTP,两边就容易抢算力。 换别的方案也有代价。比如换成 128+128 的 GQA8,效果很难打赢 MLA,KV Cache 还是 MLA 的三倍多;换成 256+256 的 MFA(本质上是 MQA),训练和 Prefill 成本又会上去。 目前还没有一个简单的 Attention 设计,能同时占住效果、训练成本、Prefill、KV Cache 和 Decoding 计算量。在 KDA+MLA 的混合架构下,MLA 的部分问题得到缓解,所以 K3 最后还是选了 MLA。 ④ 苏神觉得,DSV4 也不算真正“抛弃 MLA”。 DSV4 看上去重新设计了 Attention,但底层仍然有 MLA 的影子。它采用的是 head_dims=512、K=V 的 MQA,这正是 MLA 在 Decoding 阶段的形态;再加上 Sparse + Compress,前者减少计算,后者进一步压缩 KV Cache,同时减少计算。 方向很激进,不过 Infra 也更复杂。 ⑤ K3 的 MLA 可以去掉 RoPE,是因为 KDA 已经隐含提供了一种广义的位置信息。 这只适用于 KDA+MLA 的混合结构,像 K2 那种全 MLA 模型,直接去掉 RoPE 还是会明显掉效果。 感觉苏神真正的观点是:大模型架构里很少有免费的升级。K3 的设计哲学不是找一个碾压所有方案的新架构,而是在效果、训练成本、Prefill、Decoding、KV Cache 和稳定性之间,找一个当前更合适的组合。 苏神原文里还有很多技术内容,非常值得一看。 原文地址:
显示更多
0
0
28
326
66
转发到社区
投机实验室
@LabSpeculation
2026.08.04 09:53
欧洲小伙儿Stan,把账户亏到只剩1.4万欧元之后,靠一只股票,赚了超过160万美元。 换算成人民币,这笔利润超过1000万。 这只股票就是Rocket Lab,账户利润已经经过Kinfo验证。 2020年疫情期间,他拿出自己攒下的3万欧元,又接过父母5万欧元积蓄,一共8万欧元入市。 最初几年,他先重仓阿斯顿·马丁,后来又买了Rocket Lab的认股权证。 公司提前赎回认股权证时,股价还低于11美元的行权价,这笔仓位约70%很快消失,他估计亏掉约5万欧元,到2023年1月,经纪账户只剩1.4万欧元。 他第一次听说Rocket Lab,是在一名早期押中特斯拉的投资者视频里。 Stan当场拿约1万欧元买入,随后才开始研究。 此后每个季度,他都会听财报电话会,盯着CEO Peter Beck和CFO的表述,再看公司有没有按计划完成发射,推进Neutron大火箭,以及把业务从发射扩展到卫星零部件和空间系统。 只要这些动作仍在兑现,他就没有因为股价下跌或横盘离场。 普通股拿了约两年后,2024年初,Rocket Lab仍在3至4美元附近反复波动,Stan卖掉全部股票,换成222张长期看涨期权。 这些期权的行权价是5美元,买入权利金约1.47美元。 按一张对应100股计算,他花了约3.26万美元,相当于押注2.22万股Rocket Lab继续上涨。 Kinfo显示,他的整体交易胜率其实只有33%。 Rocket Lab从约3.70美元一路涨到90美元附近时,Stan卖掉了这批期权。
显示更多
0
0
25
37
2
转发到社区
投机实验室
@LabSpeculation
2026.08.04 08:40
有个人拿16.98万美元2倍做空SpaceX,现在浮盈15.78万美元,回报92.93%。 他的判断是,SpaceX值不了1.7万亿美元,股价还会继续往下。他没有直接做空正股,而是买入SSPC,SpaceX单日每跌1%,这只ETF的目标涨幅就是2%。 SSPC上市后第一天盘后一度跌到6美元附近,他在这里第一次买入,涨到8.50美元便卖了。 后来他又重新买回,而且把股数加得更多,最终持有2万股,平均成本8.49美元,这笔仓位占整个账户37.82%。 在他截图时,SSPC已经涨到16.38美元,持仓市值32.76万美元。 他准备等SpaceX跌破100美元再卖掉SSPC,如果继续跌到65美元附近,再反手买入SpaceX。
显示更多
0
0
32
68
5
转发到社区
开挂的金兔子☯️🍊
@btcpiggy
2026.08.02 10:39
猜猜这只大鹅🦢,是公的还是母的? 从农村买回来了,图三的鹅肝价值多少? 我清洗的时候只感觉好大好大,好大的鸡胗,好大的鹅肝,好大的~。
显示更多
0
0
12
12
0
转发到社区
墙国蛙哈哈🐸
@GFWfrog
2026.07.24 12:59
抖音一博主发布视频,当一只小狗从深圳搬去欧洲,6个月过去,最大的变化是它开始假定周围所有人的喜欢它。而在中国,这只狗还敏感怯懦,不喜生人。她得出结论:“环境塑造狗格”,因为和在中国🇨🇳不同,在德国🇩🇪,所有路人都对小狗🐶伸出友善的手🫳🏻 视频结尾,她放上了小狗 #
旺旺
# 的影像
显示更多
0
0
104
1.1K
114
转发到社区
孙云冉.eth
@sunyunran
2026.07.22 12:39
这只偷上物理课的大雁在TK火了 网友:知识改变命运具象化了
0
0
0
0
0
转发到社区
图拉鼎
@tualatrix
2026.07.22 01:15
遛娃途中,听到树丛中有从来没听到过的动物叫声,于是顺着声音看到了这只松鼠。不确定是不是它发出来的。
0
0
6
7
0
转发到社区
GeLun Ding
@gelunding
2026.07.18 11:49
华尔街几乎所有投行都在想办法割你的韭菜,但没人讨论这件事。SpaceX上市已经大约一个月了,纳入纳斯达克100指数也已经超过一周,被动指数基金和退休金都被迫买入。但令人意外的是,股价相比上市首日已经跌了不少,这意味着几乎所有在公开市场买入的散户投资者,目前都处于亏损状态。即便如此,各大投资银行仍然在拼命劝你买入。几乎所有华尔街大型投行,包括高盛、摩根士丹利和摩根大通,都给予了“buy”评级。Raymond James甚至更加夸张,直接给出了800美元的目标价。更耐人寻味的是,几乎所有参与SpaceX IPO承销的投行,恰好也都在告诉投资者这只股票还会继续上涨。然而,像Morningstar这样的独立股票研究机构,却普遍认为SpaceX目前的估值已经明显偏高。这种利益冲突在我看来真的很邪恶。为了赚点钱完全没有底线。
显示更多
0
0
69
398
40
转发到社区
加载中...