注册并分享邀请链接,可获得视频播放与邀请奖励。

与「长上下文能力」相关的搜索结果

长上下文能力 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 长上下文能力 的内容
产品化不仅仅是功能的叠加,更是推理成本下降与长上下文能力结合的结果。
GLM-5.2 刚刚正式发布! 给大家带来实测! 直接说结论本次测试中, 提升最大的是Agent能力, 而且是有质的变化! 测试中GLM-5.2 完全不用搜索附近的位置, 就能直接去想要到达的地方. 这一切竟然是它在一开始把地图背下来了! 这在我测试的20多个模型中之前是没有一个模型能做到的, 比如之前的模型想去换电站, 那么都要搜一下附近有哪些换电站(这就会浪费一次tool_call), 而GLM-5.2直接就知道换电站的位置! 从来没用过搜索函数. 这种一开始就把需要的数据内化到上下文中, 并且能够贯穿整个1M上下文进行推理的能力真的是叹为观止. 除此之外, 本次测试后端代码的 Agentic Coding 能力也有提升, 来到了总榜的第二名. 而本次测试暴露出最大的短板则是空间理解. 其实成也萧何败也萧何, 它虽然把换电站的位置都背下来了, 但是去的换电站却不是最近的, 所以虽然记住了, 但是记住了之后在用之前再根据自己当前所在位置推理一下, 他还是没有做到的, 这也是最大的短板了, 强烈建议官方优化一波. #GLM52# #智谱# #智谱AI# #AgenticCoding# #长上下文能力#
显示更多
0
10
80
5
转发到社区
结构创新和超高上下文效率 DeepSeek-V4 开创了一种全新的注意力机制,在 token 维度进行压缩,结合 DSA 稀疏注意力(DeepSeek Sparse Attention),实现了全球领先的长上下文能力,并且相比于传统方法大幅降低了对计算和显存的需求。从现在开始,1M(一百万)上下文将是 DeepSeek 所有官方服务的标配。
显示更多
google今天这篇2025年4月的论文居然引发了存储的下跌,那我们就再重读一下: KV cache 一直是大模型推理里的最大内存消耗来源。论文的做法,本质是用信息论最优的方式去压缩这些数据。不是简单地降低精度,而是重新分配信息密度。普通部分用极低比特表示,异常值单独保留更高精度。同时不再逐元素处理,而是以向量为单位编码,因为 attention 本身就是内积结构。 关键的是,它的误差已经贴近信息论下界(香农极限),也就是说压缩效率已经非常接近理论极限。论文里给出的结果,大致是 4 到 4.5 倍的压缩,性能几乎没有明显损失。效果很明显,但后续再压缩而不损伤性能的可能性已经很小。 基于大科技的内部研发流程,论文的方法及可能对模型产生的优化效果很可能已经被工程分阶段吃掉了。 比方说,低比特量化早就被用起来了,从 int8 到 int4,再到更低精度,主流模型在推理侧基本都在用。异常值单独处理这件事也不是新东西,SmoothQuant、AWQ 这些方法本质上都在做类似的事情。KV cache 本身的压缩、滑窗、分层缓存,在大模型里也已经是常规配置。 真正还没完全落地的,是论文里更极致的那一部分,比如向量量化,以及更接近信息论极限的编码方式。这些方法的问题不是原理,而是工程实现,GPU 不友好,延迟控制难,稳定性和泛化也更复杂,所以可能需要更长时间实现。 如果一定要拍脑袋猜一下论文已经落地和还没落地的部分可能有多少的话,大致可能是这么个情况:最早的 KV cache 是 1 倍成本,简单量化之后可以做到 2 到 3 倍压缩,加上异常值处理可以到 3 到 4 倍,论文再往前推一点,大约到 4 到 4.5 倍。也就是说,大部分红利已经被拿走了,剩下的提升空间不大,而且代价越来越高。 这背后的原因也很清楚。前期压缩是在去掉冗余信息,后面面对的是有效信息,再压就会直接影响模型能力。误差不再是平滑变化,而是到某个点之后快速恶化。实现难度也不是线性增长,而是明显抬升。 从模型表现可以反推,现在的主流模型已经在用这些技术。长上下文能力、推理成本下降、性能稳定,这些现象本身就说明 KV cache 的效率已经被大幅优化。像 Google 这种级别的团队,大概率已经实现了低比特量化、异常值处理和一部分 KV 压缩。 也就是说,如果说google的这篇论文对存储可能有影响的话,其大部分的影响已经被体现了出来,还没体现出来的部分,其实施难度也会较之前更大。 更重要的是,这篇论文的意义不在于多省了多少内存,而在于给出了一个边界。KV cache 压缩这条路已经接近极限,剩下的提升空间很有限。接下来真正能带来变化的,不太可能再来自压缩本身,而是需要找到其他的路径。
显示更多
0
7
121
19
转发到社区
inclusionAI开源LLaDA2.2-flash:让扩散语言模型能边写边改 自回归模型生成token只能从左到右加下去,写错一步没法回头改,长上下文Agent任务里工具出错常要推倒重来。扩散语言模型(diffusion model)能并行生成,但过去序列是“写死”的,改不了长度、删不掉冗余。 LLaDA2.2-flash首次给扩散解码加入编辑机制,新增DELETE和INSERT两个控制token,让模型生成时能主动删内容、插内容,动态调整序列结构,具备自我纠错能力,对多轮工具调用和长程Agent交互尤其关键。 不过一顿操作猛如虎,一看评分0-5。对比参数类似的其他模型,扩散模型得分显著偏低。 模型:
显示更多
很多人还没理解,大模型的发展必然是需要与产品创新协同进行的。 整个世界处在一个大的自然选择过程中。对产品而言,人就是自然;对大模型而言,人+产品就是自然。当然,对人而言,自然就是自然。更进一步说,产品本质是人的生产和生活方式,而生活方式是在自然对人的选择过程之中被人选择的。当我们把大模型看作产品的智能驱动力,那么大模型的能力也就在产品被选择的过程中被选择。 没有翻译产品就不会有 Transformer 被选择;没有产品尝试用 LLM 补全 tool 指令,就不会有 tool use 能力被选择;没有 Manus,就不会有 agentic 任务能力被选择;没有 Claude Code 不会有 coding 能力被选择;没有 Anthropic 内部尚未发布的 Agent Teams 和 Claude Tag 雏形,就不会有 Opus 4.5 到 4.8 不断加强的 team working 能力被选择。当然反之亦然,没有 coding 能力的加强,Claude Code 不会像现在这样成功。 研究员们可以像数学家一样,从已经有的知识,以推理的方式得出所有可能的模型能力并构造数据进行训练,但最终被留下来的、在商业上被选择的能力一定是能与具备更好的人机交互体验的产品相适应的能力。 人们似乎总是因为大模型能力越来越强而对软件产品持有悲观态度,但我相信更强大的智能将会驱动更强大的产品和人机交互形态的诞生。不要低估人的适应力和创造力,尤其在 AI 的加持下。 人会很快适应 AGI 在现有产品形态中的表现,而随后创造新的产品形态来进一步释放人机交互的潜力,进一步地,模型被反哺加强,人们再次适应新的产品形态,继续创造更新的产品形态。 没错,我说了 AGI。我认为 AGI 早就来了,AGI 在渐进式地来。并没有一天会被称为「AGI 真的来了的那天」。大模型 agentic 能力和多步多轮交互界面协同发展,长程无监督任务能力和多会话管理界面协同发展,自迭代记忆+团队协作+长上下文+长期自我身份感知和所谓 agent-native IM 界面协同发展。 我们会看着一种新的智能持续演化,我们自身也会在这个过程中提高认知、不断升维,改进我们与世界的互动方式。这种黑格尔式的对立统一让我感到极度兴奋,你呢?
显示更多
Kimi K3 今日正式发布,Moonshot 官方官宣,2.8万亿参数 MoE 架构,百万上下文窗口,原生多模态能力,7月27日开放模型权重。 网上已有声音称其在多项基准测试中超越 Fable,翻完官方基准数据图后会发现,这是选择性解读的结论。 真实情况是,K3 在 Terminal Bench 2.1 得分88.3对比84.6,Automation Bench 得分30.8对比29.1,BrowseComp 得分91.2对比88.0,这几个特定智能体场景上确实领先。 但在 DeepSWE,FrontierSWE,GDPval-AA v2 Elo,AA-Briefcase Elo,CharXiv 这些更综合的智能体指标上,Fable 5 整体表现依然更稳定。 它并非实现全面超越,而是在自身定义的长上下文智能体编码赛道上打出了存在感。 但基准测试表现并不是这条新闻里最值得关注的部分。 最有价值的信息藏在定价策略里。 K3 的 API 定价为输入每百万 tokens 15美元,这个价格对应的档位,正处于 GPT-5.5 和 Claude Opus 系列的价格区间,这不是开源模型的低价路线,而是前沿闭源模型的定价标准。 一款中国开放权重模型,主动放弃了低价这张传统王牌。 Moonshot 将价格拉至前沿模型区间,等于公开传递出一个信号,我们不比拼性价比高低,我们比拼在长周期智能体编码场景下的价值匹配度。 这是第一次出现这样的转向,此前中国模型的主流路线是能力强,价格低,加开源的性价比打法,K2 系列走的正是这条路径。 K3 切换了一条完全不同的路线。 这条路不再是性价比路线,而是场景定价路线,底层逻辑彻底改变,不再是我比 Fable 便宜所以你该选我,而是在长上下文智能体编码这个特定场景下,我的价值值得你支付前沿模型的价格。 这个转变不是营销话术的更新,而是将产品信心押注在了一个狭窄但高价值的垂直赛道上。 看看他们为这个赛道做的底层布局就知道。 两项架构级创新支撑起这个定位,KDA 混合线性注意力,在百万 token 上下文下解码速度最高提升6.3倍,AttnRes 注意力残差,训练效率提升约25%,额外成本不到2%。 这两项创新不是为了炫技的纸面突破,每一项都精准命中长上下文智能体的核心痛点,Transformer 架构在百万 token 下推理太慢,训练成本太高,KDA 解决推理速度问题,AttnRes 解决训练效率问题,合在一起解决的核心问题是,让一个2.8T参数的模型,在需要长时间记忆和多步迭代的智能体工作流里,能稳定运行,跑得够快,成本可控。 这就是他们敢把定价拉到前沿区间的核心底气。 不是参数规模更大所以更值钱,而是在长上下文智能体编码这个即将成为主战场的赛道上,他们的架构为场景量身定制,通用架构做不到同等效率。 这个赌注自然存在风险。 Fable 5 在很多通用智能体任务上表现依然更稳,K3 的优势集中在自身定义的赛道范围内,如果市场不为专门为智能体编码优化的模型品类买单,每百万输出15美元的价格很难长期站稳。 但这个方向的判断是对的。 中国 AI 这些年一直在走同一条路径,硬件受限倒逼架构创新,快速开源用开放生态反哺迭代,K2 系列验证了这条路能够跑通,K3 则把这个模式做了升级,不只是在受限硬件上做出好模型,更是做出好模型之后,敢于在定价上和前沿闭源模型站在同一起跑线。 这对正在搭建智能体系统的开发者来说,信号非常实际。 7月27日权重开放后,你能拿到一个真正前沿规模,为长时程智能体场景定制的基座模型,百万上下文加 KDA 加速加持,SWE Marathon 42.0 领先,Automation Bench 30.8 领先,把它接入自己的智能体技术栈运行自进化工作流,做长上下文蒸馏,完成复杂认知任务的结构化输出,这些事以前要么用闭源 API 成本太高,要么用开源模型上下文长度和速度跟不上。 K3 是第一个同时提供前沿智能体编码能力,百万上下文,开放权重,可商用的选项。 最后做一个总结。 Moonshot 将 K3 的定价拉至前沿区间,不是一个简单的价格决策,而是一份明确的定位声明,中国开放权重模型不再只是高性价比的替代品,它们开始要求在自己擅长的赛道上,和闭源前沿模型平起平坐。 这个诉求能不能被市场接受,要看7月27日权重开放后的实际落地表现。 但有一点已经非常清晰,在长周期智能体编码这条赛道上,有一家中国公司认为自己的产品,不再需要靠低价来获取市场。
显示更多
0
24
23
4
转发到社区
CMU 这门 NLP 课最硬核的地方:第一份作业就让你从零手搓一个 LLaMA。 卡内基梅隆大学公开了 2026 春季《Advanced NLP》课程,教授是 Sean Welleck。整套资源包括完整课程主页、课件、视频和配套代码,内容从 Tokenizer、Transformer、语言模型基础,一路讲到 RAG、多模态、RLHF、MoE、长上下文和 test-time scaling。 这门课最有价值的地方,不仅是教你怎么调用大模型 API,而且把大模型能力背后的工程路径也拆开给你看。 从「Build Your Own LLaMA」这种手搓模型作业,到后面的推理、效率、评测和 Agent,它训练的其实是一种更底层的能力:你能不能理解模型为什么能工作,为什么会变强,为什么有时会失败。 这也很符合现在 AI 的技术拐点。 过去大家更关心参数规模,谁的模型更大;现在越来越多关键进展,开始发生在推理侧、效率侧和系统侧:怎么让模型更会思考,怎么调度专家,怎么检索外部知识,怎么在有限算力下获得更好的输出。 所以这门课不只是 NLP 进阶课,更像一份 2026 年大模型研究者的训练路线图。 AI 时代真正的分水岭,可能不只是会不会使用模型。 更关键的是: 你停在应用层,还是愿意继续往下走到架构层。 Home: Youtubu: Code:
显示更多
0
4
124
30
转发到社区
Google AI Studio 正式开放了每分钟 100 万 token 的免费额度。开发者现在可以直接调用顶级的算力资源,无需绑定信用卡,也不需要支付任何月费。通过这种方式,你可以零成本获取原本价值数千美元的计算能力。如果你开发高并发、长上下文的项目,可以按以下路径接入: 1. 直接访问 Google AI Studio 平台。2. 获取官方 API Key。3. 在代码中配置请求频率(Rate Limit)以适配每分钟百万级的调用规模。这种无需订阅即可使用的策略,极大降低了大规模模型应用的开发门槛。
显示更多
0
24
170
38
转发到社区
聊最强模型这事本身就挺搞笑的。现在这赛道卷到什么程度?你今天排完名,明天就有人发新版本把你脸打肿。但不排吧,老有人问。 行,那就按2026年6月底的情况,综合Arena人类偏好、Intelligence Index、编码、Agent表现这些维度,聊聊我心目中的全球前十。 - (以下排名纯个人看法,别杠,杠就是你对。) 1:Claude Fable 5(Anthropic) Anthropic 6月9号放的Mythos级公开模型。目前Arena人类偏好榜稳坐第一,长时程Agent和复杂推理是真的猛。 你要搞那种专家级任务,几小时的深度研究、多步骤自主Agent,这台目前是最靠谱的选择。有一说一,贵是真贵。 - 2:Claude Opus 4.8(Anthropic) 觉得Fable 5太激进、不稳定?Opus 4.8就是那个"稳如老狗"的选项。 编码、长上下文、复杂Agent工作流,表现极其可靠。很多专业开发者现在的主力机就是这台。 怎么说呢,它可能不是每一项都拿第一,但综合可靠性和能力,依然是旗舰中的旗舰。 - 3:GPT-5.5(OpenAI) OpenAI目前最成熟的日常模型。通用能力均衡得一批,工具调用和生态就不用说了,ChatGPT那套东西太完整了。 多模态体验也优秀,适合不想折腾、拿来就用的多数人。呃,但实话实说,硬核推理上已经被Anthropic拉开了。 - 4:Gemini 3.1 Pro(Google) Google目前的最强前沿模型。数学推理和多模态(图像、视频)这块是真的硬,研究分析类工作用它很舒服。 但Agent能力嘛,还在追。适合需要高准确性的场景,不适合拿来搞花活。 - 5:Qwen3.7 Max(阿里) 这是目前中国模型里综合最强的,全球前五没毛病。能力均衡、什么都能干,编程、长任务、日常使用都表现不错。 最关键的是性价比杀疯了,价格只有前面那几个美系模型的几分之一。日常主力选它,钱包不疼。 - 6:Kimi K2.6(月之暗面) Moonshot的旗舰。超长上下文是它的杀手锏,多Agent协作也玩得转。 你如果经常搞长文档总结、深度研究、复杂工作流,这台绝对是利器。 短板?通用场景不如Qwen均衡。 - 7:GLM-5.2(智谱AI) 智谱最新一代,编码和Agentic任务是真的有点东西。 开源权重版本性能也强,适合自己折腾、做二次开发的玩家。 coding场景下甚至能跟Claude掰掰手腕,不开玩笑。 - 8:DeepSeek V4 Pro(深度求索) 极致性价比的代名词。推理和编码能力接近前沿水平,但价格低到离谱。 说白了就是"差不多够用,但便宜得要命"。社区里目前最受欢迎的高性能低成本选择,懂的都懂。 - 9:MiniMax M3(MiniMax) 效率取向的选手,特定场景下性价比优秀。适合对速度和成本极度敏感的生产环境。 不是最强,但该干的活都能干。 - 我的几点观察: 美系闭源还是霸着前四,Anthropic和OpenAI目前确实在领先位置。但注意,差距在缩小,不是错觉。 中国模型从第五名开始强势插入,Qwen3.7 Max是最均衡的代表。 而且在性价比维度上,中国模型(Qwen、DeepSeek、Kimi、GLM)已经可以说是碾压了。 很多实际场景能跑到前沿模型80-95%的效果,成本只要几分之一甚至几十分之一。这不叫卷属于降维打击。 开源权重这块更不用说,中国模型目前明显领先。 - 如果你问我怎么选: 追求极致、预算无限的话:Claude Fable 5 或者 Opus 4.8 。 日常主力、讲究性价比:Qwen3.7 Max,闭眼入 。 重度编程/Agent开发:GLM-5.2 或 DeepSeek V4 Pro 。 长文档和分析研究:Kimi K2.6。 这个排行保质期时间很短。AI这行现在就是这个节奏,你今天看完明天可能就过时了。 实际用起来别死磕一个模型,根据不同任务组合使用才是正道。 你目前主力用的是哪个?评论区聊聊。
显示更多
0
41
36
1
转发到社区