注册并分享邀请链接,可获得视频播放与邀请奖励。

与「长上下文能力」相关的搜索结果

长上下文能力 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 长上下文能力 的内容
产品化不仅仅是功能的叠加,更是推理成本下降与长上下文能力结合的结果。
GLM-5.2 刚刚正式发布! 给大家带来实测! 直接说结论本次测试中, 提升最大的是Agent能力, 而且是有质的变化! 测试中GLM-5.2 完全不用搜索附近的位置, 就能直接去想要到达的地方. 这一切竟然是它在一开始把地图背下来了! 这在我测试的20多个模型中之前是没有一个模型能做到的, 比如之前的模型想去换电站, 那么都要搜一下附近有哪些换电站(这就会浪费一次tool_call), 而GLM-5.2直接就知道换电站的位置! 从来没用过搜索函数. 这种一开始就把需要的数据内化到上下文中, 并且能够贯穿整个1M上下文进行推理的能力真的是叹为观止. 除此之外, 本次测试后端代码的 Agentic Coding 能力也有提升, 来到了总榜的第二名. 而本次测试暴露出最大的短板则是空间理解. 其实成也萧何败也萧何, 它虽然把换电站的位置都背下来了, 但是去的换电站却不是最近的, 所以虽然记住了, 但是记住了之后在用之前再根据自己当前所在位置推理一下, 他还是没有做到的, 这也是最大的短板了, 强烈建议官方优化一波. #GLM52# #智谱# #智谱AI# #AgenticCoding# #长上下文能力#
显示更多
0
10
80
5
转发到社区
结构创新和超高上下文效率 DeepSeek-V4 开创了一种全新的注意力机制,在 token 维度进行压缩,结合 DSA 稀疏注意力(DeepSeek Sparse Attention),实现了全球领先的长上下文能力,并且相比于传统方法大幅降低了对计算和显存的需求。从现在开始,1M(一百万)上下文将是 DeepSeek 所有官方服务的标配。
显示更多
google今天这篇2025年4月的论文居然引发了存储的下跌,那我们就再重读一下: KV cache 一直是大模型推理里的最大内存消耗来源。论文的做法,本质是用信息论最优的方式去压缩这些数据。不是简单地降低精度,而是重新分配信息密度。普通部分用极低比特表示,异常值单独保留更高精度。同时不再逐元素处理,而是以向量为单位编码,因为 attention 本身就是内积结构。 关键的是,它的误差已经贴近信息论下界(香农极限),也就是说压缩效率已经非常接近理论极限。论文里给出的结果,大致是 4 到 4.5 倍的压缩,性能几乎没有明显损失。效果很明显,但后续再压缩而不损伤性能的可能性已经很小。 基于大科技的内部研发流程,论文的方法及可能对模型产生的优化效果很可能已经被工程分阶段吃掉了。 比方说,低比特量化早就被用起来了,从 int8 到 int4,再到更低精度,主流模型在推理侧基本都在用。异常值单独处理这件事也不是新东西,SmoothQuant、AWQ 这些方法本质上都在做类似的事情。KV cache 本身的压缩、滑窗、分层缓存,在大模型里也已经是常规配置。 真正还没完全落地的,是论文里更极致的那一部分,比如向量量化,以及更接近信息论极限的编码方式。这些方法的问题不是原理,而是工程实现,GPU 不友好,延迟控制难,稳定性和泛化也更复杂,所以可能需要更长时间实现。 如果一定要拍脑袋猜一下论文已经落地和还没落地的部分可能有多少的话,大致可能是这么个情况:最早的 KV cache 是 1 倍成本,简单量化之后可以做到 2 到 3 倍压缩,加上异常值处理可以到 3 到 4 倍,论文再往前推一点,大约到 4 到 4.5 倍。也就是说,大部分红利已经被拿走了,剩下的提升空间不大,而且代价越来越高。 这背后的原因也很清楚。前期压缩是在去掉冗余信息,后面面对的是有效信息,再压就会直接影响模型能力。误差不再是平滑变化,而是到某个点之后快速恶化。实现难度也不是线性增长,而是明显抬升。 从模型表现可以反推,现在的主流模型已经在用这些技术。长上下文能力、推理成本下降、性能稳定,这些现象本身就说明 KV cache 的效率已经被大幅优化。像 Google 这种级别的团队,大概率已经实现了低比特量化、异常值处理和一部分 KV 压缩。 也就是说,如果说google的这篇论文对存储可能有影响的话,其大部分的影响已经被体现了出来,还没体现出来的部分,其实施难度也会较之前更大。 更重要的是,这篇论文的意义不在于多省了多少内存,而在于给出了一个边界。KV cache 压缩这条路已经接近极限,剩下的提升空间很有限。接下来真正能带来变化的,不太可能再来自压缩本身,而是需要找到其他的路径。
显示更多
0
7
121
19
转发到社区
刚看完中关村学院的何纪言老师带领 7 位博士生,用 3 个月时间从头训练出了 7B 模型,从预训练到中训练、后训练完全都是自己搞的,在 7B 尺寸模型中达到 SOTA 水平。 首先,虽然很多人在吹 RSI,但技术报告指出,现在模型的能力远未到全自主的程度,在模型架构设计、学习算法设计、数据清洗等方面仍然只能达到 L2 的辅助水平。我自己也有一样的感觉,不管 Astra 还是 Fable,都不能替代我的架构设计,我也得不断提醒自己不要外包思考。 其次,模型训练就是个会者不难、难者不会的问题,对会的人来说,用不了多少算力资源,但对不会的人来说,用再多的算力资源、堆再多的人,都是做不出来的。比如 MiMo V2.6 RL 只花了 300 多万美金,对基模公司来说很便宜了,整个 MiMo core team 只有几十位正式员工,更没有走蒸馏之类捷径。但烧了上亿美金、投入上千人的模型未必就能搞好。中关村学院一个老师加上 7 个学生只用 3 个月就完成造数据、预训练、中训练、后训练,是非常 impressive 的。 最后,数据是新的代码,数据质量就像代码质量一样非常重要。过去几年,我总是想用代码的方式实现 Agent 的自我进化,但很快就达到上限了。最近一年我才发现,这些我用代码方式做的东西更应该用训练数据的方式表达,训到模型里面。我们都知道脏代码的危害,脏数据其实也是一样的。中关村学院这个 7B 模型做了非常深入的数据工作,预训练数据清洗和课程学习,中训练按照上下文长度扩增,后训练利用开源和蒸馏来的 trace 建立指令遵循、长上下文等基础能力,进而构建长思维链推理、工具调用等高阶能力;在 RL 中不断移除已经高概率解决的问题,保持 GRPO学习效率。 技术报告:
显示更多
0
9
358
62
转发到社区
这个开源项目系统整理了 35 家 AI 公司的 AI 工程师面试题,全部来自 “公开报告的面试经历” 来自 @outcome_school 团队 @pallavishekhar_ 开源发布,内容几乎涵盖了 OpenAI、Anthropic、DeepMind、xAI、DeepSeek、Kimi、GLM 等 AI Labs,Cursor、Cognition、ElevenLabs 等 AI Native 团队和 Nvidia、Microsoft、Amazon、Apple 等头部大厂。 覆盖的岗位头衔也非常多:AI Engineer、LLM Engineer、Gen AI Engineer、ML Engineer、Research Engineer、Applied Scientist、FDE、MLOps/LLMOps 工程师等。 开源地址: # 内容架构:一个精心设计的双层结构 第一层:跨公司通用题(Common Questions)。 作者把在多家公司反复出现的题目只列一次,标注"Asked at"哪些公司,按十大主题组织: 1. LLM 内部机制与架构 — attention 缩放因子、KV cache 内存公式推导、MQA/GQA/MLA、FlashAttention、BPE、RoPE/YaRN、Chinchilla scaling laws、MoE、解码采样策略、lost-in-the-middle、RMSNorm、SwiGLU 2. 推理、服务与 GPU 性能 — prefill vs decode、continuous batching、PagedAttention、投机解码、量化(FP16→FP4)、五种并行策略、TTFT/TPOT 指标、H100 上的 roofline 计算、vLLM/SGLang/TensorRT-LLM 选型、“如何把服务成本降 10 倍” 3. RAG 与检索 — 分块策略、BM25 vs 稠密检索、重排序器、HyDE、权限感知检索、ANN 索引、索引新鲜度、答案归因 4. Agent 与工具调用 — ReAct、MCP、工具 schema 设计、多智能体编排、Agent 记忆、循环终止条件、人类审批 5. 微调与对齐 — RLHF/DPO/GRPO/RLVR 全谱系、LoRA/QLoRA 数学、灾难性遗忘、“提示 vs RAG vs 微调”决策框架、蒸馏、reward hacking 6. 评估与可观测性 — LLM-as-judge 及其偏差、幻觉检测、基准污染、Agent 评估、回归门禁 7. 安全与负责任 AI — 提示注入(直接/间接)、OWASP LLM Top 10、护栏、Constitutional AI、红队 8. 多模态与语音 — VLM、语音 Agent 延迟预算、barge-in 打断处理、级联 vs 端到端语音、ASR/TTS 评估 9. AI 系统设计 — 十类高频设计题(千万级文档企业 RAG、代码助手、客服 Agent、Text-to-SQL、LLM 网关、数亿用户聊天服务等) 10. 编码题 — 从零实现 attention、KV cache、BPE、采样;LRU 缓存、令牌桶限流器、异步批处理器、SSE 流解析器、最小 Agent 循环 第二层:35 家公司的专属章节,分为五大梯队: 1. 前沿实验室(12 家):Anthropic、OpenAI、Google DeepMind、Meta、xAI、Mistral、Cohere、DeepSeek、月之暗面(Kimi)、智谱(GLM)、阿里(Qwen)、Sarvam AI(印度) 2. 大厂 AI 组织:Microsoft、Amazon、Apple、NVIDIA、Tesla,以及一组消费级 ML 公司(Uber/Netflix/LinkedIn/Airbnb/Pinterest/Spotify) 3. AI 基础设施公司:Databricks、Groq、Together AI、Hugging Face、Scale AI、Perplexity 4. AI 原生产品公司:Cursor、Cognition(Devin)、Sierra、Harvey(法律)、Glean、 AI(机器人)、Waymo 5. 前向部署/企业 AI:Palantir # 题目分布透露的行业信号同样值得关注 1. 公司的差异化考察方向,和它的商业模式严丝合缝。 这是最能体现整理功力的地方: · DeepSeek、月之暗面、智谱、Qwen 的题目深度绑定自家论文——MLA、auxiliary-loss-free 负载均衡、Multi-Token Prediction、MuonClip、DualPipe、长上下文扩展、GLM 的 thinking 模式。面试这些公司等于面试它们的论文,还要求 PyTorch 从零实现 MoE 路由。 · Groq 的题全是 SRAM-only 架构下的 roofline 重推演:“没有 HBM,decode 的 roofline 论证哪里变了”、“确定性在 p99 层面到底买到什么”。 · Apple 清一色端侧:3B 模型在手机上跑、PTQ vs QAT、不采集用户内容的前提下用设备信号改进模型、30+ 语言区无法记录用户内容的评估方案。 · CharacterAI 是推理经济学:“我们的服务成本被 KV cache 而非权重主导,降一个数量级,代价是什么”。 · Harvey(法律)和 Abridge(医疗) 考的是领域约束下的工程:200 页信贷协议里第 140 页的条款依赖第 8 页的定义术语怎么检索、生成的病历中出现了患者没提过的药怎么当作安全事故处理、PHI 如何约束整个架构。 · Palantir 的招牌是 "decomposition" 轮:把“一家货运铁路公司每年因机车非计划停机损失数千万”分解成工程计划。 2. 编码轮的形态正在发生实质性变化。 文档里反复出现的一类题,与传统 LeetCode 明显不同: · “实现一个内存 KV 存储:先 SET/GET/DELETE,再加事务 BEGIN/COMMIT/ROLLBACK,包括嵌套事务”(OpenAI、xAI 都问) · “给你一个 LLM 推理引擎的调度器类,其中一个方法是空壳,没有规格没有文档。说说你头三十分钟干什么”(xAI) “重构这 120 行能跑但很乱的代码,不许破坏测试”(OpenAI) · “对 5 万个文档跑 LLM 调用,API 限 100 并发、偶发 429 和超时,把 Python 写出来”(Anthropic) 考察重心从算法记忆转向增量需求下的代码演进能力、并发正确性、真实工程约束下的取舍。 3. “AI 协作轮”作为新题型已经进入正式面试流程。 这是文档里最前沿的信号: · Anthropic 部分机器学习岗有 AI-collaboration 轮:现场给你 Claude,考察的是你如何指挥它和验证它的产出,而不是你自己写。 · Meta 2026 年的流程新增三阶段 AI 辅助编码轮(探索修复 → 实现新功能 → 扩展改进)。 · Cursor 的 onsite 是两天在真实 Cursor 代码库上做一个功能(或 8 小时远程版),明确考核你对 AI 工具的使用效率和自主 scoping 能力。 · Sierra 给你两小时和任意 AI 工具,看你选择做什么。 xAI 有四小时限时产品构建。 4. FDE 成为一级岗位类别。 Anthropic、OpenAI、Databricks、Scale、Together、Sierra、Harvey、ElevenLabs、Palantir 的章节里都有 "Applied and Forward-Deployed Scenarios" 专属题库——典型题目如“企业客户说 Claude 幻觉太多,你是驻场工程师,头 48 小时做什么”。这对应了 AI 公司向企业交付方式的转变:模型能力差距收窄后,落地能力成为差异化。 5. 硬核系统题的普及。 "H100 上 70B 模型 batch size 1 的 roofline 计算"、"估算 70B 模型的 GPU 显存(权重 + KV cache + 激活 + 碎片)"、"p99 延迟在部署后翻倍但模型没变,走一遍诊断”——这类题横跨 NVIDIA、Together、OpenAI、Perplexity 等多家,说明推理性能的量化直觉已成为 AI 工程师的通用素养,而非基础设施工程师的专属。
显示更多
inclusionAI开源LLaDA2.2-flash:让扩散语言模型能边写边改 自回归模型生成token只能从左到右加下去,写错一步没法回头改,长上下文Agent任务里工具出错常要推倒重来。扩散语言模型(diffusion model)能并行生成,但过去序列是“写死”的,改不了长度、删不掉冗余。 LLaDA2.2-flash首次给扩散解码加入编辑机制,新增DELETE和INSERT两个控制token,让模型生成时能主动删内容、插内容,动态调整序列结构,具备自我纠错能力,对多轮工具调用和长程Agent交互尤其关键。 不过一顿操作猛如虎,一看评分0-5。对比参数类似的其他模型,扩散模型得分显著偏低。 模型:
显示更多
很多人还没理解,大模型的发展必然是需要与产品创新协同进行的。 整个世界处在一个大的自然选择过程中。对产品而言,人就是自然;对大模型而言,人+产品就是自然。当然,对人而言,自然就是自然。更进一步说,产品本质是人的生产和生活方式,而生活方式是在自然对人的选择过程之中被人选择的。当我们把大模型看作产品的智能驱动力,那么大模型的能力也就在产品被选择的过程中被选择。 没有翻译产品就不会有 Transformer 被选择;没有产品尝试用 LLM 补全 tool 指令,就不会有 tool use 能力被选择;没有 Manus,就不会有 agentic 任务能力被选择;没有 Claude Code 不会有 coding 能力被选择;没有 Anthropic 内部尚未发布的 Agent Teams 和 Claude Tag 雏形,就不会有 Opus 4.5 到 4.8 不断加强的 team working 能力被选择。当然反之亦然,没有 coding 能力的加强,Claude Code 不会像现在这样成功。 研究员们可以像数学家一样,从已经有的知识,以推理的方式得出所有可能的模型能力并构造数据进行训练,但最终被留下来的、在商业上被选择的能力一定是能与具备更好的人机交互体验的产品相适应的能力。 人们似乎总是因为大模型能力越来越强而对软件产品持有悲观态度,但我相信更强大的智能将会驱动更强大的产品和人机交互形态的诞生。不要低估人的适应力和创造力,尤其在 AI 的加持下。 人会很快适应 AGI 在现有产品形态中的表现,而随后创造新的产品形态来进一步释放人机交互的潜力,进一步地,模型被反哺加强,人们再次适应新的产品形态,继续创造更新的产品形态。 没错,我说了 AGI。我认为 AGI 早就来了,AGI 在渐进式地来。并没有一天会被称为「AGI 真的来了的那天」。大模型 agentic 能力和多步多轮交互界面协同发展,长程无监督任务能力和多会话管理界面协同发展,自迭代记忆+团队协作+长上下文+长期自我身份感知和所谓 agent-native IM 界面协同发展。 我们会看着一种新的智能持续演化,我们自身也会在这个过程中提高认知、不断升维,改进我们与世界的互动方式。这种黑格尔式的对立统一让我感到极度兴奋,你呢?
显示更多
Kimi K3 今日正式发布,Moonshot 官方官宣,2.8万亿参数 MoE 架构,百万上下文窗口,原生多模态能力,7月27日开放模型权重。 网上已有声音称其在多项基准测试中超越 Fable,翻完官方基准数据图后会发现,这是选择性解读的结论。 真实情况是,K3 在 Terminal Bench 2.1 得分88.3对比84.6,Automation Bench 得分30.8对比29.1,BrowseComp 得分91.2对比88.0,这几个特定智能体场景上确实领先。 但在 DeepSWE,FrontierSWE,GDPval-AA v2 Elo,AA-Briefcase Elo,CharXiv 这些更综合的智能体指标上,Fable 5 整体表现依然更稳定。 它并非实现全面超越,而是在自身定义的长上下文智能体编码赛道上打出了存在感。 但基准测试表现并不是这条新闻里最值得关注的部分。 最有价值的信息藏在定价策略里。 K3 的 API 定价为输入每百万 tokens 15美元,这个价格对应的档位,正处于 GPT-5.5 和 Claude Opus 系列的价格区间,这不是开源模型的低价路线,而是前沿闭源模型的定价标准。 一款中国开放权重模型,主动放弃了低价这张传统王牌。 Moonshot 将价格拉至前沿模型区间,等于公开传递出一个信号,我们不比拼性价比高低,我们比拼在长周期智能体编码场景下的价值匹配度。 这是第一次出现这样的转向,此前中国模型的主流路线是能力强,价格低,加开源的性价比打法,K2 系列走的正是这条路径。 K3 切换了一条完全不同的路线。 这条路不再是性价比路线,而是场景定价路线,底层逻辑彻底改变,不再是我比 Fable 便宜所以你该选我,而是在长上下文智能体编码这个特定场景下,我的价值值得你支付前沿模型的价格。 这个转变不是营销话术的更新,而是将产品信心押注在了一个狭窄但高价值的垂直赛道上。 看看他们为这个赛道做的底层布局就知道。 两项架构级创新支撑起这个定位,KDA 混合线性注意力,在百万 token 上下文下解码速度最高提升6.3倍,AttnRes 注意力残差,训练效率提升约25%,额外成本不到2%。 这两项创新不是为了炫技的纸面突破,每一项都精准命中长上下文智能体的核心痛点,Transformer 架构在百万 token 下推理太慢,训练成本太高,KDA 解决推理速度问题,AttnRes 解决训练效率问题,合在一起解决的核心问题是,让一个2.8T参数的模型,在需要长时间记忆和多步迭代的智能体工作流里,能稳定运行,跑得够快,成本可控。 这就是他们敢把定价拉到前沿区间的核心底气。 不是参数规模更大所以更值钱,而是在长上下文智能体编码这个即将成为主战场的赛道上,他们的架构为场景量身定制,通用架构做不到同等效率。 这个赌注自然存在风险。 Fable 5 在很多通用智能体任务上表现依然更稳,K3 的优势集中在自身定义的赛道范围内,如果市场不为专门为智能体编码优化的模型品类买单,每百万输出15美元的价格很难长期站稳。 但这个方向的判断是对的。 中国 AI 这些年一直在走同一条路径,硬件受限倒逼架构创新,快速开源用开放生态反哺迭代,K2 系列验证了这条路能够跑通,K3 则把这个模式做了升级,不只是在受限硬件上做出好模型,更是做出好模型之后,敢于在定价上和前沿闭源模型站在同一起跑线。 这对正在搭建智能体系统的开发者来说,信号非常实际。 7月27日权重开放后,你能拿到一个真正前沿规模,为长时程智能体场景定制的基座模型,百万上下文加 KDA 加速加持,SWE Marathon 42.0 领先,Automation Bench 30.8 领先,把它接入自己的智能体技术栈运行自进化工作流,做长上下文蒸馏,完成复杂认知任务的结构化输出,这些事以前要么用闭源 API 成本太高,要么用开源模型上下文长度和速度跟不上。 K3 是第一个同时提供前沿智能体编码能力,百万上下文,开放权重,可商用的选项。 最后做一个总结。 Moonshot 将 K3 的定价拉至前沿区间,不是一个简单的价格决策,而是一份明确的定位声明,中国开放权重模型不再只是高性价比的替代品,它们开始要求在自己擅长的赛道上,和闭源前沿模型平起平坐。 这个诉求能不能被市场接受,要看7月27日权重开放后的实际落地表现。 但有一点已经非常清晰,在长周期智能体编码这条赛道上,有一家中国公司认为自己的产品,不再需要靠低价来获取市场。
显示更多
0
24
23
4
转发到社区
CMU 这门 NLP 课最硬核的地方:第一份作业就让你从零手搓一个 LLaMA。 卡内基梅隆大学公开了 2026 春季《Advanced NLP》课程,教授是 Sean Welleck。整套资源包括完整课程主页、课件、视频和配套代码,内容从 Tokenizer、Transformer、语言模型基础,一路讲到 RAG、多模态、RLHF、MoE、长上下文和 test-time scaling。 这门课最有价值的地方,不仅是教你怎么调用大模型 API,而且把大模型能力背后的工程路径也拆开给你看。 从「Build Your Own LLaMA」这种手搓模型作业,到后面的推理、效率、评测和 Agent,它训练的其实是一种更底层的能力:你能不能理解模型为什么能工作,为什么会变强,为什么有时会失败。 这也很符合现在 AI 的技术拐点。 过去大家更关心参数规模,谁的模型更大;现在越来越多关键进展,开始发生在推理侧、效率侧和系统侧:怎么让模型更会思考,怎么调度专家,怎么检索外部知识,怎么在有限算力下获得更好的输出。 所以这门课不只是 NLP 进阶课,更像一份 2026 年大模型研究者的训练路线图。 AI 时代真正的分水岭,可能不只是会不会使用模型。 更关键的是: 你停在应用层,还是愿意继续往下走到架构层。 Home: Youtubu: Code:
显示更多
0
4
124
30
转发到社区