注册并分享邀请链接,可获得视频播放与邀请奖励。

与「緩」相关的搜索结果

緩 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 的内容
《医生不如GPT的脚后跟》 经过1个月的治疗,傻哥的胃胀已经彻底缓解 早上去医院复查,问彻底治愈的概率 医生已经年纪很大,说每个人差异不同 我不得不打断医生:我问的是群体概率 医生还是东拉西扯,说胃动力的原理 我不得不再次打断医生:问是否有医学上治愈的概率统计 最后医生无奈承认,自己不知道 走出门诊,傻哥随手问了下GPT 直接给出了国际上的医疗统计样本:50-60%的根治率 并且,结合我自身肠胃镜的结果 进一步给出了79-90%治愈率 傻哥真是无奈啊 感觉医生连GPT的脚后跟都摸不到 要不是为了开检查,根本不需要医生 那什么样的人需要医生呢? 门口突然来了个老大爷 说自己身体不舒服? 医生问:哪里不舒服 老大爷说不清,说不知道,总之就是不舒服,说不清部位 这样的人需要医生一步步引导啊
显示更多
《奥德赛》在中国尚未正式上映,但已引发一波社群讨论。其中,中国podcast主持人"仲树"在北京首映式后对导演诺兰(Christopher Nolan)的采访,因谈及较深入的哲学、神学思辨,获得英语世界的网友高度关注。 访谈之初,仲树便向诺兰抛出大哉问,提问他是否认为自己是"西方文明黄昏时代的吟游诗人"。 大约18分钟的采访内,两人触及哲学和神学概念、电影叙事、艺术批评等主题,例如仲树还问道:"古希腊文化并不存在'赎罪'的概念,古希腊语并不存在'赎罪'这个词,荷马的《奥德赛》中并没有赎罪,但你的《奥德赛》却有……你是否把《奥德赛》基督教化了?" X平台上,仲树的帐号7月31日发布的访谈影片已有超过680万观看次数;加拿大媒体人基利(Geoff Keighley)隔天亦转推影片,已累计1800多万次观看。 除了仲树的访谈之外,《奥德赛》团队在北京宣传期间还有另一件事引发社群讨论。 据《明报》、香港01等港媒报导,该片的北京首映式由上海广播电视台的陈璇主持。然而,陈璇在现场被拍到,当她把麦克风递给诺兰等人的时候,姿势是"大幅度屈膝半蹲"。此事在中国社群平台触发了民族主义的反弹情绪,部分网友批评她"崇洋媚外"、"卑躬屈膝"。 亦有网友替陈璇缓颊指,之所以半蹲,是因为要配合现场直播拍摄,避免挡到诺兰等人的脸。 你是否看过《奥德赛》,又怎么看待这些争议?留言分享你的看法!
显示更多
0
35
129
16
转发到社区
在 opencode 的 TUI 里直接查看当前会话的提示词缓存命中率 装好后在会话里输入 /cache-stats 就会弹出窗口,显示当前会话的提示词缓存命中情况。 它算出一个总体命中百分比,用命中条加 Excellent、Good、Fair、Poor 四个等级词标注,再按模型和每个子代理分开统计 token、调用数和成本。
显示更多
⚡经历近两个月的剧烈震荡后,美股标普500再次创下历史新高! Mag 7在四天内累计上涨近10%, 亚马逊市值重返3万亿美元, 英伟达市值重夺5万亿美元, 科技板块在全面修复。 推动力还是同一个: 美国财长贝森特说霍尔木兹海峡协议可能在今明两天达成,美伊局势缓和。 此刻,大A和币圈都流下了羡慕的泪水!🥹
显示更多
8.05梭哈晨报: 美股真的挺有意思的,很多涨幅和山寨币一样,但是你又知道有价值,昨天蹲财报的人爽了,SPCX多空双炸,AMD直接炸开了半导体。 今天有人赌闪迪吗? 1. $BTC 看起来走的还行,但是所有人都在等7号的法案通过与否; 2. $ETH 各种利好出现,就是不知道谁在买; 3. $SOL 还是重回MEME了,但是没人玩了啊; 4.Aave CEO:以太坊 EIP 提案或扼杀其借贷与收益场景,削弱 ETH 作为资产的可行性; 5.SpaceX首份财报超预期,但解禁压力下盘后跌超7%; 6.特朗普政府告知AI公司,将不对开放权重模型进行安全测试; 参议院民主党:特朗普 AI 治理政策混乱,正将企业推向中国 AI 替代品; 7.AMD Q2数据中心收入翻倍,但指引未超乐观预期盘后跌近9%; 8.台积电扩大 CoW 封装外包,ASE 等 OSAT 将承接 CoW 产能以缓解 AI 芯片制造瓶颈; 9.SBF上诉被驳回,美国第二巡回法院正式签发结案令; 你都没钱了,谁在乎你呢; 10.比特币桥接服务 Boltz因 AI 攻击速度失控,无限期暂停交换服务; 11.Coinbase政策负责人反驳WSJ对CLARITY法案批评,呼吁参议院通过; 还有两天,会有人在法案通过前发币吗? 12.纽约梅隆银行与Galaxy合作推出机构加密货币质押服务; 13.美联储施密德:需要更紧缩的货币政策以将通胀恢复至2%的目标; 14.BitMEX的30亿美元保险基金在关闭前大部分已被提取; 15.美英监管机构重申支持稳定币和代币化监管合作; 16.Bybit 获奥地利 EMI 牌照,将在欧洲提供受监管电子货币和支付服务; -------------- 赌吧,不赌没有未来的,赌才是未来,只有大波动大家才能发财,顿悟了市场的最终核心! 猪哥一直要我发他的珍藏,你们就说这个视频是不是黄? #Bitcoin# #Ethereum# #Solana# #Crypto# #Nasdaq#
显示更多
转一下苏剑林老师对 K3 架构的复盘。 一句话概括,K3 = KDA + MLA + Stable LatentMoE + AttnRes。整套设计没什么炫技,核心就是在模型效果、计算效率和训练稳定性之间做取舍。 这里稍微解释一下: KDA,一种线性 Attention MLA,一种 KV Cache 较小的 Full Attention 变体 Stable LatentMoE,对 LatentMoE 做过稳定性改造的 MoE 方案 AttnRes,用可学习的跨层注意力,替代固定等权的残差累加 几个比较有意思的点: ① K3 同时使用了 KDA 和 MLA。另外,训练仍然用 Moonlight 版本的 Muon 优化器,Attention 权重改成 Per-Head Muon,每个 Head 独立优化。苏神说这不会直接提高效果,主要是数学和结构上更合理:各个 Head 本来就相对独立,不应该在优化时耦合在一起。 ② 解决MoE“容易炸”的问题。 LatentMoE 会先降维,再使用更多专家,最后升维,在训推成本大致相同的情况下效果略好。不过连续的矩阵投影也让训练更容易出现数值不稳定。 K3 把 SwiGLU 换成了 SiTU-GLU,用 softcap 压住异常激活;又在 LatentMoE 升维前加了一层 RMS Norm。这个 Norm 不只是让训练更稳定,在 Valid Loss 差不多的情况下,不加它,某些 Benchmark 会稳定变差。 (这里有超级多的技术细节,感兴趣的可以看苏神原文) ③ 关于MLA DSV4 看上去都换设计了,K3 怎么还在用 MLA?苏神的答案是,目前 MLA 仍然很难被全面击败。它在训练阶段是 MHA 形态,推理时 KV Cache 较小;在固定训练成本和 KV Cache 大小时,MLA 依然近乎最优。 它的问题是对 MTP(推测解码)不够友好。MTP 的思路是“用计算换速度”,而 MLA 在 Decoding 阶段本身就比较吃计算,再叠一个 MTP,两边就容易抢算力。 换别的方案也有代价。比如换成 128+128 的 GQA8,效果很难打赢 MLA,KV Cache 还是 MLA 的三倍多;换成 256+256 的 MFA(本质上是 MQA),训练和 Prefill 成本又会上去。 目前还没有一个简单的 Attention 设计,能同时占住效果、训练成本、Prefill、KV Cache 和 Decoding 计算量。在 KDA+MLA 的混合架构下,MLA 的部分问题得到缓解,所以 K3 最后还是选了 MLA。 ④ 苏神觉得,DSV4 也不算真正“抛弃 MLA”。 DSV4 看上去重新设计了 Attention,但底层仍然有 MLA 的影子。它采用的是 head_dims=512、K=V 的 MQA,这正是 MLA 在 Decoding 阶段的形态;再加上 Sparse + Compress,前者减少计算,后者进一步压缩 KV Cache,同时减少计算。 方向很激进,不过 Infra 也更复杂。 ⑤ K3 的 MLA 可以去掉 RoPE,是因为 KDA 已经隐含提供了一种广义的位置信息。 这只适用于 KDA+MLA 的混合结构,像 K2 那种全 MLA 模型,直接去掉 RoPE 还是会明显掉效果。 感觉苏神真正的观点是:大模型架构里很少有免费的升级。K3 的设计哲学不是找一个碾压所有方案的新架构,而是在效果、训练成本、Prefill、Decoding、KV Cache 和稳定性之间,找一个当前更合适的组合。 苏神原文里还有很多技术内容,非常值得一看。 原文地址:
显示更多
0
28
326
66
转发到社区
12. 说'我很好'当你在溺水时不是力量——那是无人察觉的缓慢自杀。
现在我很多复杂一点的任务都是 Fable 5 写方案,Codex 去执行,Fable 5 验收,相对来说可以做出比较靠谱的方案,以及兼顾性价比。具体是这么做的: 1. Fable 5 的产出是技术方案文档(图1) 一方面文档方便批注修改,另一方面文档方便其他 Agent 快速上手 2. 文档确认后在当前先 /compact 一次 这一步不是必要的,但是有好处,因为后续还要在同一会话去验证,/compact 压缩后,节约后续的上下文空间,之所以讨论方案就马上发送 /compact,因为这时候 Prompt Caching 还在,成本低,后面缓存过期了 compact 要贵一点。 3. 把文档交给 Codex (GPT-5.6 Sol xhigh)去执行(图2) 如果任务明显比较复杂,我一般会加上 /goal,这样中间就不需要反复去 continue,一次性把任务完成 4. Codex 完成后让 Fable 验证(图3) 直接告诉 Fable 其他 Agent 已经实施了,让它确认有没有遗漏,或者方向有无偏离。 如果有些遗漏之类的,把 Fable 的反馈发回给 Codex(图4),不需要新开会话,在同一个 Codex 会话,Codex 会根据反馈继续完善。 --- 如果用 Opus 5 替代 GPT 5.6 也可以,做法上可以跟上面一样新开会话,用文档传递上下文。 也可以直接让 Fable 5 开 SubAgent 并指定用 Opus 5 模型,并且要求在 SubAgent 完成任务后验证。 但是我执行下来 Opus 5 不如 GPT 5.6 Sol 稳定,也不如 GPT 5.6 Token 耐用,所以宁愿麻烦一点。
显示更多
DWF以及一些主动做市商这种机构存在的必然结局就是币圈的山寨死完死透三辈子都缓不过来。
📗🥔🧭🌕🤭 我们在山间黄昏中看向外围远处光点,心里浮现短学生约炮暂的释然,仿佛这一刻被上门时间轻轻拉长却无法真学生同城正停留.像记忆缓慢空姐浮现,远处灯光微微闪烁
显示更多