注册并分享邀请链接,可获得视频播放与邀请奖励。

与「剣君」相关的搜索结果

剣君 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 剣君 的内容
最近 $BTC 明显有点涨不动了, 这个时候来用一下杰尼君的刻舟求剑小工具, 查一下未来20根4H的可能性走势, 目前历史上涨概率为40%,平均收益1.04%。 看来, $BTC 可能要到一个短期顶部了, EMA 200的 $82K 阻力位多次突破未果, 还是要尊重一手的。 友情提醒:低多≠做空。
显示更多
0
34
34
2
转发到社区
*cos 君と花見がしたい 📸白羽 #Acosta# #刀剣乱舞#
更新了BTC全历史的四周期图【图2】, 可以看到之前3个熊市周期, 时长和跌幅都在很接近的右下圆圈范围, 而26年熊市还在上面圆圈, 时长和跌幅还不够。 根据历史数据拟合, 四周期的下跌比例分别是: 86.9%,84.1%,77.6%,65.1%(本轮预测), 对应BTC价格 44016【图1】。 至于要不要刻舟求剑法, 对的话,你就次次对, 不对的话,你只会错一次, 盈亏比划算得很, 怎么选那不明摆着嘛 : )
显示更多
0
65
145
39
转发到社区
转一下苏剑林老师对 K3 架构的复盘。 一句话概括,K3 = KDA + MLA + Stable LatentMoE + AttnRes。整套设计没什么炫技,核心就是在模型效果、计算效率和训练稳定性之间做取舍。 这里稍微解释一下: KDA,一种线性 Attention MLA,一种 KV Cache 较小的 Full Attention 变体 Stable LatentMoE,对 LatentMoE 做过稳定性改造的 MoE 方案 AttnRes,用可学习的跨层注意力,替代固定等权的残差累加 几个比较有意思的点: ① K3 同时使用了 KDA 和 MLA。另外,训练仍然用 Moonlight 版本的 Muon 优化器,Attention 权重改成 Per-Head Muon,每个 Head 独立优化。苏神说这不会直接提高效果,主要是数学和结构上更合理:各个 Head 本来就相对独立,不应该在优化时耦合在一起。 ② 解决MoE“容易炸”的问题。 LatentMoE 会先降维,再使用更多专家,最后升维,在训推成本大致相同的情况下效果略好。不过连续的矩阵投影也让训练更容易出现数值不稳定。 K3 把 SwiGLU 换成了 SiTU-GLU,用 softcap 压住异常激活;又在 LatentMoE 升维前加了一层 RMS Norm。这个 Norm 不只是让训练更稳定,在 Valid Loss 差不多的情况下,不加它,某些 Benchmark 会稳定变差。 (这里有超级多的技术细节,感兴趣的可以看苏神原文) ③ 关于MLA DSV4 看上去都换设计了,K3 怎么还在用 MLA?苏神的答案是,目前 MLA 仍然很难被全面击败。它在训练阶段是 MHA 形态,推理时 KV Cache 较小;在固定训练成本和 KV Cache 大小时,MLA 依然近乎最优。 它的问题是对 MTP(推测解码)不够友好。MTP 的思路是“用计算换速度”,而 MLA 在 Decoding 阶段本身就比较吃计算,再叠一个 MTP,两边就容易抢算力。 换别的方案也有代价。比如换成 128+128 的 GQA8,效果很难打赢 MLA,KV Cache 还是 MLA 的三倍多;换成 256+256 的 MFA(本质上是 MQA),训练和 Prefill 成本又会上去。 目前还没有一个简单的 Attention 设计,能同时占住效果、训练成本、Prefill、KV Cache 和 Decoding 计算量。在 KDA+MLA 的混合架构下,MLA 的部分问题得到缓解,所以 K3 最后还是选了 MLA。 ④ 苏神觉得,DSV4 也不算真正“抛弃 MLA”。 DSV4 看上去重新设计了 Attention,但底层仍然有 MLA 的影子。它采用的是 head_dims=512、K=V 的 MQA,这正是 MLA 在 Decoding 阶段的形态;再加上 Sparse + Compress,前者减少计算,后者进一步压缩 KV Cache,同时减少计算。 方向很激进,不过 Infra 也更复杂。 ⑤ K3 的 MLA 可以去掉 RoPE,是因为 KDA 已经隐含提供了一种广义的位置信息。 这只适用于 KDA+MLA 的混合结构,像 K2 那种全 MLA 模型,直接去掉 RoPE 还是会明显掉效果。 感觉苏神真正的观点是:大模型架构里很少有免费的升级。K3 的设计哲学不是找一个碾压所有方案的新架构,而是在效果、训练成本、Prefill、Decoding、KV Cache 和稳定性之间,找一个当前更合适的组合。 苏神原文里还有很多技术内容,非常值得一看。 原文地址:
显示更多
0
28
326
66
转发到社区
这样对比就比较清晰了—— 本轮周期中 bitcoin:native 最深的折价幅度,仍然是明显小于之前几轮熊市的。 按照历史最高点的回撤幅度,此前几轮熊市的底部都远低于本轮目前曾触及的水平。 刻舟求剑地判断:现在典型熊市时间已经过去了四分之三~
显示更多
0
24
28
5
转发到社区
DeepSeek-V4-Pro 在还没有发布前,却已成了悬在各家大模型厂商头顶上的达摩克利斯之剑,哈哈哈哈。 在这期间发布的任何大模型,都有很大概率当天就被 DeepSeek-V4-Pro 偷家,你猜他们究竟是发还是不发布呢? 我猜他们不会发布。
显示更多
如何在实战中使用弹反|德式剑盾,弹反好用么 弹反之后,就是振刀呀。 #武术# #硬核训练# #剑术# #实战# #黑魂# 原作者:@锤盾·剑修会
我在思考,ETH/BTC的汇率这个数据是不是看的价值不大了。上一轮是因为这个数据我1500抄底的ETH 且没有BTC,比较激进。 如果这轮依旧按照这个逻辑抄底的话,那么很快就到底部了?但我觉得这个理由很单薄! ETH\BTC 汇率这个数据的意义是什么? ETH乃山寨之王,它代表了所有情绪性的流动。所以牛市总是BTC先涨,调动市场的心绪,E再来一波带动散户杀入山寨!相反它的市占率到最低点的时候,也代表市场情绪到达了冰点。 然而,上一轮我刻舟求剑判断失误,并没有出现实质意义上的山寨季。所以怎么判断顶点呢?我并没有在最高点卖出! 当汇率到0.017的时候,反弹最高也只有0.034,连0.05都没到。你要知道最高突破过0.08。 所以不得不思考一个问题,市场的流动性到底去哪里了?发行了那么多稳定币并没有流入ETH等基础设施。 很多人说是叙事的原因,没有新的叙事,但是这轮这么多机构入场,都在关注资产上链等新叙事呀。 我认为是流动性结构根本的变了: 22年以前加密市场的流动性主要由散户驱动,资金可预测地按照叙事热度和市值买卖与持有。一类资产上涨会带动市值排行榜向下传导,形成全市场动量追逐,从而催生山寨季。 现在结构已彻底转变,绝大多数资金通过机构渠道进入:比特币/以太坊 ETF(贝莱德、富达等)、企业财务储备、托管机构等。 投资者只是通过券商买,资金被锁死在BTC、ETH等最大资产,不会轮动到随机山寨币。 创造山寨币季条件的流动性,如今被困在头部资产的监管产品中。这直接导致BTC市值占比持续飙升,而大多数山寨币不断失血、表现疲软。​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​ 所以,抄底的信号指标要根本性的转变: 我现在使用AI @openclawby 监控ETF流入,BTC暗池交易数据等大资金的动向。 反之,判断高点也一样! 抄底结构也需要根本性的转变,资金主要放在BTC,其他分散在有ETF的资产里面。 你们觉得呢?
显示更多
0
19
27
0
转发到社区
我用一句话,让 Codex+Higgsfield 上线了一款能联机玩的武侠游戏!!! 全球联机,进同一片水墨竹林,轻功跳屋顶、剑气波隔空对轰、连斩有称号播报,手机也能玩。 整个过程我没画一张图、没写一个音符、没租一台服务器: 1、Nano Banana Pro 出水墨剑客概念图 2、Image to 3D 把图直接变成带骨骼的 3D 模型 3、3D Rigging 从动作库套上出剑、轻功、疾风步 4、Sonilo 生成古琴 BGM,Mirelo 出剑气音效 5、代码让 Cursor 里的 Fable 5 写,它自己调 Higgsfield CLI 把这些全串起来 6、最后 higgsfield game deploy 一条命令上线,域名和全球联机服务器全自动,再一条 publish 直接上架 marketplace 以前这件事需要找游戏工作室,美术、作曲、3D建模、动画、全栈开发一个都不能少。 但现在真是门槛无限低啊,想玩什么游戏直接自己做~
显示更多
刻舟求剑一把,就在昨天币安的BTC流出量创下了2024年以来新高达到9030个,而在此之前每当BTC流出达到如此程度后,都会迎来一波阶段性的上涨🤔好了晚安玛卡巴卡,今晚做个好梦😴
显示更多