注册并分享邀请链接,可获得视频播放与邀请奖励。

思维怪怪 的个人资料封面
思维怪怪 的头像

思维怪怪 (@0xLogicrw)

@0xLogicrw
写关于 AI 的一切 Shit Post AI 信息流:
2.4K 正在关注    6.1K 粉丝
爆料博主 leo 质疑,DeepSeek V4 Pro 的官方 API 会把部分复杂编程请求转给 Claude Fable 5。目的可能是收集输出,用于模型蒸馏,也就是用强模型的答案训练另一个模型。 测试者通过 OpenCode 让模型生成 3D 游戏。部分结果与 Fable 5 高度相似,推理方式也突然改变。加入网络安全和生物问题后,游戏质量明显下降,知识范围也退回 DeepSeek 原本的水平。 这个测试利用了 Fable 5 的真实机制。Anthropic 会把部分网络安全、生物和蒸馏请求转给 Opus 4.8。测试者因此怀疑,请求先被转给 Fable 5,触发分类器后才回退到 DeepSeek。 但现有证据只够证明 API 行为异常。它无法确认实际回答者,也无法证明这些输出进入了训练数据。混合 prompt、未公开更新或 DeepSeek 自己的模型路由,都可能造成类似差异。
显示更多
0
65
116
10
转发到社区
月之暗面新团队成员杨新宇解释了 Kimi 为什么能推出 K3。 他称,自己今年离开学界进入产业,期间接触了多家 AI 公司。他总结出同行的四种通病: ① 傲慢。 老牌团队认为 AI 战争已经结束,自己已经赢了,对未来和人才失去渴望。 ② 浮躁。 年轻实验室基础不牢,只顾追赶前沿,追不上就匆忙转向其他赛道。 ③ 胆怯。 一些团队经验丰富、实力不弱,却不敢把目标定为行业第一。 ④ 目标错位。 每个人都在争取个人功劳,却没人真正关心公司能否做出 AGI。 杨新宇称,月之暗面最不同的地方,是创始团队仍对 AGI 保持强烈追求。这也是他选择加入的原因。 他还晒出一张「Kimi 五戒」: ① 模型公司要做模型。 ② 做 Research、发 Paper 要做实验。 ③ 训练模型要看 Metric。 ④ 不 Work 的东西不要硬上。 ⑤ 不要 YOLO。 翻成大白话,就是少讲故事,多做实验。训练要看数据,失败方案及时停,也不要靠直觉豪赌。
显示更多
Why can Kimi ship K3? Let me tell my story. Earlier this year, I left academia for industry. I talked to a lot of companies along the way. Here's what I saw: 1⃣Arrogance. They believe the AI war is over, and they won. No hunger for the future, and no hunger for talent. 2⃣Restlessness. Young labs short on foundation, either rushing to catch the frontier or pivoting away from the competition. 3⃣Fear. Strong teams with real experience, but from the second tier, they can't quite bring themselves to aim for #1#. 4⃣Misalignment. Everyone is optimizing for their own credit, but nobody really cares whether the company can reach AGI. Kimi was different. Over many conversations with the founders, the same thing came through every time: a raw, genuine hunger for AGI. I joined. The hunger was real. We shipped K3. This is only the beginning.
显示更多
0
68
677
101
转发到社区
月之暗面联合创始人、算法团队负责人周昕宇表示,Kimi 目前没有开发视频生成模型的计划。团队现阶段更关注提升模型的智能上限。 他认为,视频生成虽然实用,但无论从理论还是实际效果看,对提升模型智能的帮助都不大。 Kimi K3 刚刚发布。官方列出的重点能力仍是软件工程、知识工作、深度推理和图像理解。Kimi 的多模态路线目前更偏理解与推理,而非生成视频。
显示更多
No. We are focused on intelligence frontier right now. Video generation does not bring much intelligence both theoretically and practically. It is useful though.
0
15
219
12
转发到社区
加州理工学院数学家 Babak Hassibi 联合创立的 AI 实验室 PrismML 表示,已成功把阿里开源模型 Qwen3.6-27B 压缩后跑在 iPhone 17 Pro 上。 Qwen3.6-27B 是 270 亿参数稠密模型。PrismML 称,模型大小从约 54GB 压到不到 4GB,性能没有明显下降。它可用于复杂对话、推理、Agent 和代码任务。 苹果已经和 PrismML 接触,讨论如何使用这项技术。苹果一直想把更多 AI 放到设备本地,但高级 Siri 仍依赖云端模型。
显示更多
0
5
124
14
转发到社区
字节跳动视频大模型 Seedance 2.0 在 2025 年底立项时,负责人曾妍力排众议坚持训练 200B 参数大模型。团队在技术路线上面临分歧,但最终决定将架构从 UNet 收敛至更能体现算力扩展优势的 DiT 原生视频架构。 为保障模型效果,字节拒绝使用数据蒸馏,直接在内部建立起超过千人的模型评测团队,使每一位算法工程师背后都配有十余名数据人员支持。这套组合拳帮助 Seedance 实现了效果领先,目前已贡献火山引擎大模型业务一半以上的营收。 由于 AI 剧制作成本较真人实拍下降近九成,大批短剧公司转而向火山购买 Seedance 满血版模型,并将省下的资金用于抖音等平台大举投流。字节顺势跑通了「大模型销售、短剧制作与流量消耗」的独家商业闭环。
显示更多
0
30
365
26
转发到社区
OpenAI 核心产品负责人 Thibault Sottiaux 在回复网友时确认,下一代旗舰模型 GPT-5.6 Sol 的 Ultra 版本将会接入 Codex。 此前该网友抱怨,OpenAI 没把 GPT-5.5 Pro 放进 Codex 是一大失误,如果能将 GPT-5.6 Ultra 接入,开发者甚至不需要再为 Claude 付费;Sottiaux 随即公开确认,Ultra 版本确实在 Codex 规划中。
显示更多
中国人民大学信息学院图灵实验班毕业生 Xiuyu Li 宣布加入国内大模型厂商阶跃星辰(StepFun),担任大模型后训练研究员。 在校期间,Xiuyu Li 专注于大模型对齐与强化学习(RL)研究。学术成果包括作为共同第一作者在 ICML 2026 发表的免训练推理时对齐方法 ETS,以及关于智能体强化学习中推理与工具调用冲突的论文 DART。
显示更多
Personal Update: I've joined @StepFun_ai as a Researcher, working on LLM post-training. Many thanks to @CyouSakura and @MikaStars39 for their support. Together, we'll take another step toward the frontier.
显示更多
0
21
91
4
转发到社区
谷歌 TPU 软件工程师 Patrick Toulme 指出,外界对 GLM 5.2 靠蒸馏追平 Opus 的说法存在误解。大模型在智能体编码任务上的训练难点在于「零梯度困境」,即模型早期若无法产生正确运行路径,强化学习便无法获得梯度信号来启动参数更新。蒸馏 Claude 或 GPT-5.5 的作用,仅仅是在冷启动阶段提供种子解答以绕过零梯度困境。 一旦模型跨过冷启动门槛,后续的性能爬升将不再依赖蒸馏,而是完全依靠强化学习的爬山算法进行自我演化。Toulme 强调,GLM 5.2 已经具备独立产生成功路径的能力,完全可以通过强化学习自主迭代到更高级别,彻底摆脱对美国大模型的依赖。
显示更多
There’s a big misconception about how GLM 5.2 was trained. Yes, they distilled Claude and GPT 5.5 — but distillation is not how they matched Opus quality. Distillation only fixed the cold start problem in RL. RLing an agentic coding model isn’t rocket science. In simplified terms: 1. RL needs trajectories — rollouts where the model actually completed a task in some env 2. No successful trajectory on a task = zero gradient = you can’t RL it. This is the cold start problem 3. Distillation solves it. You seed your model with knowledge from a smarter one (Claude, GPT) on tasks it can’t do yet 4. Now it produces positive trajectories on those tasks 5. RL on those trajectories and hill climb agentic coding 6. At that point you no longer need to distill and can solely hill climb RL to better models This is an interesting curve. I’d argue it’s harder to get to Opus 4.8 from scratch than to go from Opus 4.8 → Fable/Mythos tier. GLM 5.2 is already producing positive trajectories, so they have plenty to RL on — they’ll keep climbing to Mythos quality without distilling any further. They no longer need American models.
显示更多
0
55
797
84
转发到社区
智谱联合创始人兼首席科学家唐杰老师认为,智谱会在今年训练出类似 Claude Fable 5 的下一代大模型。 要想达成这个目标,智谱不仅要在预训练阶段把模型推向万亿级参数,而且还要在后训练阶段让模型能够(部分)跑通自我训练。
显示更多
0
20
104
9
转发到社区
DeepSeek 资深研究员陈德里开源了个人项目 Deli AutoResearch SKILL,并发布了由智能体完全自主撰写的第四篇综述论文。 项目以单一的 SKILL.md 协议文件形态呈现,本身不含可执行代码。协议通过规约长周期任务中的状态持久化、防死循环(Anti-Loop)与心跳守护进程(Heartbeat Watchdog),指导 AI 智能体调用子智能体(Subagent)与多角色模拟机制,实现科研全流程的全自动协作。 同时发表的自我博弈综述论文展示了智能体在实验阶段的突破:在零人类干预下,智能体首次自主规划了 GPU 实验,并在 285B 参数量的 DeepSeek 模型上运行强化学习(RL)训练任务。通过 GRPO 算法,智能体完成了从实验设计、编写代码,到运行调试和总结结论的完整研究闭环,并在模拟同行评审中跑出了 8.6/10 的高分。 此前,陈德里已利用同样的方法自主产出过三篇学术综述。首篇关于自主科研智能体的论文经历了约 60 轮智能体迭代,总耗时约 10 小时,实现了从 V1 到 V5 的迭代演进。整套工作流不仅降低了长周期研究的人为操作成本,也验证了 AI 原生研究路径的可行性。
显示更多
🧵 Deli AutoResearch SKILL is now officially open source! 🎉 Alongside it, we’re dropping our 4th survey paper — this time on Self-play. Inspired by AlphaZero, we got a powerful insight: prior knowledge doesn’t always lift the ceiling. Models can discover more globally optimal solutions just by playing against themselves. The biggest change in this paper? For the first time, the AutoResearch Agent autonomously planned GPU experiments — and submitted actual RL runs on the DeepSeek 285B model. The entire RL pipeline — experiment design, code writing, running, debugging, and conclusion summarization — was 100% automated, with zero human intervention from me. This was incredibly difficult, but an incredibly important step. GRPO is the tool being called by the AutoResearch Agent here. We see this as the beginning of our Continual Learning research journey. 🚀 As always, this is my personal research project, unaffiliated with any organization. All views are my own. #AI# #ReinforcementLearning# #SelfPlay# #OpenSource# #AutoML# #ContinualLearning# #DeepSeek#
显示更多
0
0
64
12
转发到社区
Anthropic 首席执行官 Dario Amodei 明确主张民主国家结盟封锁中国等对手的芯片与半导体设备供应链。 他在最新发表的政策长文中警告,随着 1 至 2 年内超级人工智能的涌现,掌握先进 AI 的国家对落后国家将具备如同「二战陆战队对决中世纪剑客」的碾压性军事代差。 为了确保民主阵营的绝对优势,Dario Amodei 主张组建联合同盟,在盟友间自由共享芯片与半导体设备,同时协同收紧出口限制。为防止超级人工智能沦为集权统治的监控与夺权工具,民主国家应当禁止在执法中部署完全自主武器,并封堵利用商业数据经纪商进行大规模监控的后门。 在安全治理上,他主张大模型监管应当效仿民航局,从自愿披露转向强制性安全测试与审计。超过算力阈值的模型在发布前必须接受第三方评估,针对生物武器合成、网络攻击和自主失控进行压力测试。若评估显示模型威胁公共安全,政府有权直接阻止发布。开发商还须将模型权重提升至军工级防护水平,共同抵御国家级黑客攻击。 面对大规模失业风险,达里奥直言人工智能将长期替代人类脑力劳动,分配红利才是核心瓶颈。Anthropic 提议建立由 AI 公司股权注资的「个人资本账户」,为新生儿、职场新人及因 AI 失业的在职员工分发股份红利,以回应特朗普近期关于「政府持有 AI 公司股权并回馈公众」的讨论。在下游医药领域,他建议引入 AI 模拟分析以缩短审批流程,加速释放新药红利。
显示更多
Today I'm publishing a new essay, Policy on the AI Exponential. AI is progressing extremely fast—much faster than the policy process was built to handle. The essay lays out where I think the technology is now, and the action needed to close the gap:
显示更多
0
81
378
58
转发到社区
幻方量化与深度求索(DeepSeek)创始人梁文锋 2002 年的高考状元照及相关报纸报道在社交媒体上曝光。 报道显示,梁文锋当年以 806 分的成绩夺得湛江市高考状元,在分数达到清华大学录取线的情况下,第一志愿选择报考浙江大学的电子信息工程专业。 梁文锋出生于教师家庭,高中阶段就读于吴川一中。根据当时以《高考状元》为题的报纸报道,梁文锋在高中期间理科成绩突出,在物理和化学老师的重点培养下,成绩从高一的全级前 100 名跃升至前 10 名,高三期间一直保持在全级前 3 名。他自初中阶段便开始学习电脑,经常义务为学校维修电脑设备。 在填报高考志愿时,梁文锋的高考成绩已达到清华大学的录取分数线,但他最终选择第一志愿报考浙江大学的电子信息工程专业。报道称,当时浙江大学的综合实力在全国排名第三,而电子信息工程也是他心目中的理想专业。
显示更多
所以很多时候,在具体的生产场景下,训练一个强化学习的黑盒,往往没有直接让大模型写一段代码脚本来得成本低、效果好。 不是每一个场景都需要硬塞一个大模型进去。千万不要手里拿着大模型这个锤子,看啥都是钉子。
显示更多
Very exciting to see the cool result! Same pattern, different physics: Codex-grown heuristics matching or beating DRL agents in fluid dynamics, while staying readable, maintainable, and transferable. Heuristics were not dead. They were under-maintained.
显示更多
Prime Intellect 开源智能体训练环境 general-agent。这是一个完全基于代码合成、可自我进化的任务生成引擎。 它将训练语料的生成设定为一场双玩家博弈。两名 AI 玩家分工明确:合成器(Synthesizer)负责设计带有独立数据库、交互工具和验证函数的任务,求解器(Solver)则负责尝试通关。 任务从最简单的指令起步,系统会通过施加条件约束、混入噪音、设置跨实体关联等 9 种策略,把任务逐级演化出 t0 到 t4 五个难度阶梯。系统会根据求解器的真实通过率来动态校准,只有落在特定难度区间的任务才会被收录,而最难的一批任务会直接成为下一轮进化的种子。 目前,这场「左右互搏」已自动构建出包含 4504 个任务、逾 8000 个独特交互工具的大型状态数据库。 实测数据显示,仅用该环境自动生成的 4417 条执行轨迹对 30B 参数的 Nemotron 模型进行微调,就在 BFCL 基准测试中将其工具调用准确率从 18.9% 飙升至 52.3%。 这一对抗机制绕过了人工编写静态工具数据集的瓶颈。通过模型间的直接博弈,系统能够极低成本地源源不断合成出难度可测、自带闭环验证的复杂调度语料。
显示更多
The next step toward automating AI is automating RL environments Introducing General-Agent: A fully synthetic environment whose task corpus self-evolves and grows harder over time 4,504 tool-use tasks · 1,040 domains · 8,159 unique tools
显示更多
OpenAI 后训练核心成员翁家翌之前证明了「纯靠大模型写代码能通关 Atari 游戏」,流体动力学博士生 Paul Garnier 现在把这套方法搬进了更硬核的流体力学控制。 他全程没训练任何神经网络。单纯让 Codex 5.5 充当程序员,靠读取仿真的测试得分与诊断日志,自己查错并反复改写 Python 脚本。在这场工业脚本测试中,Codex 5.5 压过了 Claude Opus 4.7 与 Gemini 3 Pro,硬是在超半数的物理场景里把顶级的强化学习(DRL)基线挑落马下。 给汽车减阻、安抚管道湍流,工业界以前只能靠砸算力,硬喂出一个看不懂的黑盒模型去控制气流阀门。 Codex 避开了这条死胡同。它写出来的规则极其直白,例如「当局部曲率过大时,延迟喷气」。几十行带着物理常识的短代码,直接替代了神经网络无脑的暴力试错。 把黑盒换成代码,干掉了神经网络僵化、一碰就碎的死穴。 以前只要硬件稍微改动(比如控制喷嘴从 5 个换成 10 个),旧模型当场报废,必须重新烧钱训练。现在只要在代码里改个常数,系统瞬间就能对接新设备。 当测试时间被强行拉长四倍时,走出经验区的传统 DRL 模型全盘崩溃;但大模型写的代码由于直接遵循了物理逻辑,始终运转稳定。跑通这一整套控制策略,大模型只消耗了 2125 万 Token,总花费不到 14 美元。
显示更多
1/5 TLDR; We used Codex to discover and maintain heuristic learning for hard fluid dynamics control cases. I’ve been applying DRL and GNN to physics since 2019,, and over the past 3 months I’ve been toying with the idea of using agents in our processes. Inspired by the blog post from @Trinkle23897, I decided to use the same strategy and have agents find readable control strategies. This means a lot to our field, where interpretability can be key for industry.
显示更多
llama.cpp 已经支持 Qwen3.6 的 MTP 加速了,难怪 Unsloth 做了一个 Qwen3.6-27B 的 MTP 模型包。
llama.cpp adds MTP for the Qwen3.6 family This is a significant milestone for the local AI ecosystem. The performance jump with these changes is massive and elevates local inference on commodity hardware further. Special thanks to Aman Gupta for leading this development!
显示更多
我现在在 Mac 上用的是 MTPLX 版 Qwen3.6-27B,它走 MLX/Safetensors 路线,主要是为 Apple Silicon 优化本地推理和 MTP 加速。 Unsloth 这个版本走 llama.cpp/GGUF 生态,更通用,也更容易被 Ollama、LM Studio 等本地工具加载。
显示更多
Unsloth 给 Qwen3.6-27B 做了一套支持 MTP 的 GGUF 量化包,让这个 27B 级别的模型可以更方便地在本地通过 llama.cpp 运行。 官方说 MTP 能让 Qwen3.6 的生成速度提升约 1.4到 2.2 倍,并称 Qwen3.6-27B MTP 版本可在约 18GB 内存下运行。
显示更多
字节跳动(ByteDance Research)正式开源原生统一多模态大模型 Lance。这是一个激活参数仅为 3B 的轻量级模型,在单一框架内同时支持图像与视频的理解、生成及编辑。 目前主流统一模型高度依赖扩大参数规模或沿用文生图架构,Lance 则跑通了极低算力的协同路线。研发团队让模型完全从零开始训练,并将整个训练周期的总计算预算压低至 128 张 A100 GPU。 为解决不同模态与任务间的内部冲突,Lance 在架构上做了两项硬性隔离: • 采用双流混合专家(MoE)架构处理交织的多模态序列,在共享底层上下文的同时,解耦理解与生成的计算路径。 • 引入模态感知的旋转位置编码,直接削弱图像和视频异构视觉 token 之间的信号干扰。 极端的算力压缩并未拉低性能上限。在仅有 3B 激活参数的情况下,Lance 的图像与视频生成及编辑表现在绝大多数基准测试中领跑现有开源统一模型,通过多任务协同跑通了小参数兼顾生成与语义理解的低成本路线。
显示更多
ByteDance releases Lance, a 3B unified multimodal model One framework for image/video understanding, generation, and editing. With only 3B active parameters, it beats 7B+ models on benchmarks thanks to multi-task synergy and specialized MoE pathways.
显示更多
Unsloth 给 Qwen3.6-27B 做了一套支持 MTP 的 GGUF 量化包,让这个 27B 级别的模型可以更方便地在本地通过 llama.cpp 运行。 官方说 MTP 能让 Qwen3.6 的生成速度提升约 1.4到 2.2 倍,并称 Qwen3.6-27B MTP 版本可在约 18GB 内存下运行。
显示更多
Qwen3.6 now runs 2x faster with MTP GGUFs! Run locally on just 18GB RAM. ⚡️ MTP enables Qwen3.6 to generate ~1.4–2.2× faster with no accuracy change. Qwen3.6-27B MTP runs at 160 tokens/s. 35B-A3B reaches 240 t/s. GGUFs: Guide:
显示更多
AI 云服务商 Zyphra 发布了首份基于 AMD 旗舰芯片 MI355X 的端到端大模型推理实测。测试在真实单节点环境下运行了 DeepSeek V3.2、Kimi K2.6 与 GLM-5.1,并直接对标 NVIDIA B200。 实测揭示了两款芯片最核心的物理差异。AMD 的杀手锏是 288GB 的海量显存,远超 B200 的 180GB。这让它在处理超长文本时,单卡就能塞下更多缓存,直接省下了拆卡并行的硬件成本。但在芯片间互联上 AMD 处于劣势。B200 靠 NVLink 交换机能让任意双卡跑满 900GB/s 带宽;而 MI355X 采用点对点直连,卡与卡之间的通信效率大打折扣。 为了填补硬件互联上的短板,Zyphra 开发了张量序列并行 (TSP) 与树状注意力 (Tree Attention) 算法。团队用树状通信取代了传统的环形网络,把解码阶段的计算和数据传输完全折叠在一起,强行用算法弥补了 AMD 硬件在点对点互联上的缺陷。 最终的成绩单明确了现阶段的排位:在单请求绝对速度上,NVIDIA B200 依然全面领跑。但在长文本场景下,随着上下文拉长,Zyphra 推理栈的吞吐量快速逼近 B200。这证明只要底层软件栈优化得当,AMD 完全能依靠大显存红利,在长文本生产环境中与 NVIDIA 旗舰正面抗衡。 下一步,Zyphra 计划利用这套架构支持 1.6 万亿参数的 DeepSeek V4 Pro,并将上下文拉升至 100 万 token。团队后续还将针对 MI355X 开发专属的低精度量化方案,并引入全新的扩散投机采样模型,进一步挖掘这块芯片的算力潜能。
显示更多
We're publishing our first end-to-end benchmarks for Zyphra Inference on @AMD Instinct MI355X. Our inference optimizations strongly outperform the AMD baseline and narrows the gap between MI355X and B200 for serving Kimi K2.6, GLM 5.1, and DeepSeek V3.2 🧵
显示更多