注册并分享邀请链接,可获得视频播放与邀请奖励。

与「推理」相关的搜索结果

推理 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 推理 的内容
8.07梭哈晨报: 昨天真的是妖魔鬼怪都在疯狂拉盘,各路神奇的东西,有真的拉盘的,又假拉盘的,只能说真假孙悟空上演了。 1. $BTC 稳稳的等待今天的靴子落地了,应该没记错是7号听证会吧? 2. $ETH 一起跟着就好了; 3. $SOL 挺好玩的目前看起来,一切都和基金会想的不一样; 4.TradeXYZ首次动用永续合约手续费收入买入HYPE; 感觉有希望成为外界第一大户; 5.SpaceX无惧天量解锁涨逾6%,总市值重新站上1.5万亿美元; 有点那个味道了,解锁的全体套保,下跌后两边对冲平仓,爱了爱了; 6.Uniswap代币发行平台Pools上线首日代币交易量达9910万美元; 7.美国AI投资Q2达1.5万亿美元年化规模,同比增长25%; 8.英伟达考虑调降 Rubin Ultra GPU 配置,应对 HBM 内存短缺; 面对缺少存储,简单来说就是降低存储的消耗? 9.OpenAI 更新 ChatGPT 推理控制功能,Plus/Pro 新增推理强度滑块; 前 OpenAI 员工 Gabriel 推出 Energy,AI 代理计算机工作市场待激发; AI竞争对于消费者来说是有利的; 10.CLARITY Act道德条款或允许唐纳德·特朗普推迟数百万美元税款缴纳; 看起来大概率会通过啊,毕竟Trump家还不发币? 11.特朗普称霍尔木兹海峡协议尚未达成,正参与相关谈判; 12.泰国确认对加密货币交易免征资本利得税,免税期截至2029年底; 13.Tom Lee预测标普500指数将达到8,000点,并称以太坊为下一轮反弹的领头羊; 别去沾边啊,老老实实搞你的世界计算机就好了; 14.Wintermute 注册为美国证券交易委员会(SEC)的经纪交易商,以交易股票、期权和加密货币交易所交易基金(ETF); 多久没听过WM的消息了; 15.美联储9月加息25个基点概率现报56.5%; -------------- 真的是倒霉,坐在哪儿就在哪儿挨打,还是得灵活起来,但是想吃一波大的,总不可能期待永远水上吧? 猪哥的视频实在是太黄了🤣 #Bitcoin# #Ethereum# #Solana# #Crypto# #Nasdaq#
显示更多
Jensen Huang 刚宣布:Alpamayo 2 Super 正式开源。 NVIDIA 面向自动驾驶的前沿开放推理模型。 不只“看见”,它能理解复杂场景、先思考再行动。 可用于 Robotaxi、卡车、配送车等,以 OpenMDW-1.1 协议开放商用。 Jensen 原话:下一代 AI 是机器人,从自动驾驶开始。
显示更多
Kimi 开源后,真的意味着 AI 不收费了吗? 白线主播 Minta 认为,Kimi K3 的开放权重正在改变 AI 模型竞争规则,但“免费模型”并不代表“免费 AI”。 2.8 万亿参数模型背后,需要 GPU、网络和工程团队支撑; 同时 Moonshot 也通过许可证保留大型商业分发场景的议价权。 未来 AI 竞争的关键,不只是拥有模型权重,而是谁能用更高的 GPU 利用率和更低的推理成本实现规模化服务。 内容不构成任何投资建议,请严格遵循当地法律法规。 《白线 WhiteLine》由吴说团队出品,从 Crypto 走向更广阔的资本市场,关注 AI 时代下的趋势变化与交易机会。
显示更多
今天 GitHub 被逆向 Agent 彻底刷屏了! 5 个星标暴增、真正能落地的硬核项目,专业拆解下: 1. diegosouzapw/OmniRoute 
免费 MIT AI 网关:一个 endpoint 通吃 290+ 供应商(90+ 免费额度)、500+ 模型,配额感知自动 fallback + 强压缩,直接兼容 Claude Code / Cursor / OpenCode / Cline。 
🔗 直达: 
以前切模型像换 VPN,现在一个 endpoint 通吃,token 成本直接腰斩。网关赛道新王! 2. Optim-Agent/optim-agent 
把 LLM Agent 变成超参数优化器,自动帮你调模型、调工作流、调 prompt。 
🔗 直达: 
以前调参靠玄学,现在 Agent 自己跑实验、自己收敛。MLOps + Agent 的完美交叉点! 3. zhaoxuya520/reverse-skill 
AI 逆向 / 渗透 / 安全研究技能路由包。自动路由方法论 + 按需自举工具链 + 自进化知识库,原生支持 Claude Code、Cursor、Cline 等一众 Agent。 
🔗 直达: 
以前安全研究像手动堆工具箱,现在 Agent 自己挑刀、自己进化经验库。硬核到爆! 4. huggingface/speech-to-speech
本地语音 Agent 管道(VAD → STT → LLM → TTS),OpenAI Realtime 兼容,组件全可换,支持实时打断与工具调用。 
🔗 直达: 
真正能本地跑起来的实时语音对话 Agent,隐私和延迟双赢,开源玩家狂喜! 5. lyogavin/airllm 
单卡 4GB 就能跑 70B(甚至更大),层式加载,无需量化蒸馏。支持 Llama / Qwen / DeepSeek 等主流模型。 
🔗 直达: 
显卡乞丐也能养起大模型 Agent 的神器,本地推理直接起飞! // 总结 2026 年的风口已经从“会聊天的模型”全面转向“能干活、能进化、能本地落地的 Agent 基建”。谁先把这些玩透,谁就站在下一波生产力 C 位。
显示更多
0
47
53
18
转发到社区
转一下苏剑林老师对 K3 架构的复盘。 一句话概括,K3 = KDA + MLA + Stable LatentMoE + AttnRes。整套设计没什么炫技,核心就是在模型效果、计算效率和训练稳定性之间做取舍。 这里稍微解释一下: KDA,一种线性 Attention MLA,一种 KV Cache 较小的 Full Attention 变体 Stable LatentMoE,对 LatentMoE 做过稳定性改造的 MoE 方案 AttnRes,用可学习的跨层注意力,替代固定等权的残差累加 几个比较有意思的点: ① K3 同时使用了 KDA 和 MLA。另外,训练仍然用 Moonlight 版本的 Muon 优化器,Attention 权重改成 Per-Head Muon,每个 Head 独立优化。苏神说这不会直接提高效果,主要是数学和结构上更合理:各个 Head 本来就相对独立,不应该在优化时耦合在一起。 ② 解决MoE“容易炸”的问题。 LatentMoE 会先降维,再使用更多专家,最后升维,在训推成本大致相同的情况下效果略好。不过连续的矩阵投影也让训练更容易出现数值不稳定。 K3 把 SwiGLU 换成了 SiTU-GLU,用 softcap 压住异常激活;又在 LatentMoE 升维前加了一层 RMS Norm。这个 Norm 不只是让训练更稳定,在 Valid Loss 差不多的情况下,不加它,某些 Benchmark 会稳定变差。 (这里有超级多的技术细节,感兴趣的可以看苏神原文) ③ 关于MLA DSV4 看上去都换设计了,K3 怎么还在用 MLA?苏神的答案是,目前 MLA 仍然很难被全面击败。它在训练阶段是 MHA 形态,推理时 KV Cache 较小;在固定训练成本和 KV Cache 大小时,MLA 依然近乎最优。 它的问题是对 MTP(推测解码)不够友好。MTP 的思路是“用计算换速度”,而 MLA 在 Decoding 阶段本身就比较吃计算,再叠一个 MTP,两边就容易抢算力。 换别的方案也有代价。比如换成 128+128 的 GQA8,效果很难打赢 MLA,KV Cache 还是 MLA 的三倍多;换成 256+256 的 MFA(本质上是 MQA),训练和 Prefill 成本又会上去。 目前还没有一个简单的 Attention 设计,能同时占住效果、训练成本、Prefill、KV Cache 和 Decoding 计算量。在 KDA+MLA 的混合架构下,MLA 的部分问题得到缓解,所以 K3 最后还是选了 MLA。 ④ 苏神觉得,DSV4 也不算真正“抛弃 MLA”。 DSV4 看上去重新设计了 Attention,但底层仍然有 MLA 的影子。它采用的是 head_dims=512、K=V 的 MQA,这正是 MLA 在 Decoding 阶段的形态;再加上 Sparse + Compress,前者减少计算,后者进一步压缩 KV Cache,同时减少计算。 方向很激进,不过 Infra 也更复杂。 ⑤ K3 的 MLA 可以去掉 RoPE,是因为 KDA 已经隐含提供了一种广义的位置信息。 这只适用于 KDA+MLA 的混合结构,像 K2 那种全 MLA 模型,直接去掉 RoPE 还是会明显掉效果。 感觉苏神真正的观点是:大模型架构里很少有免费的升级。K3 的设计哲学不是找一个碾压所有方案的新架构,而是在效果、训练成本、Prefill、Decoding、KV Cache 和稳定性之间,找一个当前更合适的组合。 苏神原文里还有很多技术内容,非常值得一看。 原文地址:
显示更多
0
28
326
66
转发到社区
把 PDF、Office 文件、扫描件、截图、图表、公式和流程图转成 AI 可检索、可引用、可推理的 Markdown 模型用你自己配的 OpenAI 兼容端点(本地或私有部署均可),不用单独搭 OCR、版面、表格、公式一整套模型栈。
显示更多
开源模型越便宜,GPU 需求反而可能越强? 白线主播 Minta 认为,开源模型正在带来新的 AI 算力需求。DeepSeek 在 OpenRouter 上的 Token 份额从年初约 9% 增长至 6 月约 20%,而 AI Agent 单次请求消耗约为普通请求的 15 倍,可能推动 GPU 推理需求持续增长。 但开源降低 Token 价格的同时,也会压缩利润空间,AI 芯片投资周期能否延续,关键看需求增长是否跑赢价格下降。 内容不构成任何投资建议,请严格遵循当地法律法规。 《白线 WhiteLine》由吴说团队出品,从 Crypto 走向更广阔的资本市场,关注 AI 时代下的趋势变化与交易机会。
显示更多
我们这期视频播客的嘉宾是盛颖,xAI前推理团队负责人、开源推理引擎SGLang发起人及RadixArk联合创始人/CEO。 在开源模型集中爆发之际,盛颖在AI Infra(基础设施)领域的研究和贡献非常核心。她将AI Infra描述为“浪漫的关系”,是产品本身,需要有“美感”。 由此,我们走进盛颖的世界。 她曾经想成为一个数学家,沉浸在一个确定、纯粹、仿佛“与世界无关”的世界里。 但从哥大到斯坦福,从形式化验证到 AI Infra,盛颖一路经历的并不是外界看到的连续发顶刊的高光,背后是不为人知的寻找方向、迷茫、停滞、低谷和重新出发。她逐渐意识到,自己无法勉强去做一件不感兴趣的事;只有真正被一个问题吸引,她才能进入高度专注的状态,并把它做到极致。 SGLang,是这条研究路径的集大成者。它从一个学术项目成长为面向真实生产环境的开源推理引擎,也把盛颖从研究者带进了更复杂的工程、组织与产业世界。 在早期的xAI,她获得了难得同时存在的“support”和“freedom”,参与搭建生产级推理系统。但随着SGLang社区迅速扩张,仅靠开发者在业余时间维护,已经无法支撑项目继续向前。为了让这件事真正走下去,她选择离开xAI,创立RadixArk。 这期节目,我们从盛颖眼中的数学之美、论文和低谷聊到SGLang、xAI与RadixArk,也聊一个人如何逐渐理解自己的天性,并决定不再与之对抗。 盛颖说,她在乎的不是“making impact”,而是那些她认为正确的事情,最终有没有发生。从“世界与我无关”,到“想要构建那个跟强力AI共存、且人类不会输的未来”,这,是盛颖的故事。
显示更多
0
36
222
34
转发到社区
LLM的隐式推理模式 这篇论文的内容有点像之前Anthropic发布的文章,LLM的思考链(CoT)不会体现出模型所有的思考过程,前沿模型能在输出Token中不留任何可解释痕迹的情况下,执行具有实质影响的计算过程。 对于安全领域,只监控模型写出来的思维链并不充分。 模型可能把部分推理转移到隐藏激活中,甚至利用看似无意义的输出位置完成秘密计算。未来可能需要直接监控残差流、隐藏状态或其他内部激活。 论文:
显示更多
底层看稀缺,顶层看客户!看到 @chamath 分享的这张 AI Stack,感觉这个架构划分和 Rewire Index 5 Layer 相当类似,分享一下我对每一层的理解: 1. 能源与基础设施层(最底层) 与 Rewired Index 的逻辑一致。电力会迎来爆发式增长,尤其是无需接入电网的独立供电商(IPP);而土地受政策影响太大,弹性有限。在大众的舆论压力之下,太空基建应该会是未来几年的新机会,无需土地,无限电力⚡️ 2. 芯片层 做独立芯片,初创公司基本没有机会:性能要求极高、工艺极其复杂,最关键的是供应链已被完全锁死——这是头部玩家的战场。 真正的机会在融合与生态。从 Google TPU 的发展路径,到 Cerebras 等高速推理芯片的崛起,可以看出芯片会与云厂商、模型公司深度绑定。围绕芯片构建数据中心的整体供应与创新,机会很多;单做独立芯片,机会渺茫。 3. 云服务层 云可以分为 Hyperscaler 和 NeoCloud两类。模型商品化之后,几乎所有的负载都要靠云来承载,这会是非常赚钱的生意。但构建极其复杂,堪称 AI 时代的重资产业务——或者说,智能时代的房地产。 4. 模型层 模型公司面临的核心问题是正在被商品化: - 如果 Scaling Law 已到极限,模型百分之百会被商品化; - 即使 Scaling Law 还有很大空间,大家对「最好智能」的需求也在被分解——大量日常应用不需要最顶级的智能,中等水平模型和开源模型会逐渐接管这些需求,反而加速了商品化; - 最尖端的头部模型公司,更像是「先进制程」的芯片:能从中获取很高的价值,但并非所有任务都需要它。 5. 应用层:Harness vs Application 这张图最有趣的地方,是把应用层拆成了 Harness 和 Application 两层。 我的判断是:按目前模型的进化速度,Application 还没有任何机会,但 Harness 的机会已经大量出现,尤其在企业端。企业内化的知识只能通过 Context 和约束来落地,所以 Harness 就是新的企业应用层;它们会替代旧的 SaaS,或倒逼旧 SaaS 升级。 如果把 AI 扩展到大语言模型之外的更广义范畴,应用层更可能以垂直集成的形态出现,例如:自动驾驶 / RoboTaxi / 任何可端到端自动化工业流程和武器系统;生物研究 / Wet Labs;把执行能力直接部署进企业内部的模式(类似 Palantir 的服务方式)
显示更多