注册并分享邀请链接,可获得视频播放与邀请奖励。

与「kimik3生万物」相关的搜索结果

kimik3生万物 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 kimik3生万物 的内容
雪佬今天用KIMI K3做了一款FPS游戏,KIMI K3这次真的惊到我了,可玩性很高,细节不错。#kimi# #kimik3生万物#@Kimi_Moonshot
🐎月之暗面/Kimi 创始人杨植麟 2014清华特奖答辩 2014年,清华本科生特等奖学金答辩现场,唐杰站在台上推荐杨植麟:“他是我这几年见过最优秀、最有天赋的学生。” 当时,唐杰是杨植麟的科研导师。如今,他已成为智谱的创立发起人、首席科学家;当年那个说要“用数据改变世界”的本科生,也创办了月之暗面。 视频里的杨植麟,90%的专业课成绩在95分以上,所有程序设计课程均为满分,成绩位列年级第一。一年时间里,他以第一作者身份在KDD、WSDM、CIKM发表三篇论文,算法被腾讯、新浪、华为等公司采用,还带队击败斯坦福、哥伦比亚等研究机构,拿下全球癌症预测大赛冠军。 科研之外,他还创办了校园乐队Splay,既是鼓手,也是主要的词曲作者。答辩时,他说:“这是计算机科学最好的时代。” 12年后,Kimi K3火爆全球AI圈。再回看这段珍贵视频,会发现许多故事早已写下伏笔:唐杰与杨植麟后来分别站在智谱和月之暗面的技术前线,两家公司也已进入全球大模型竞争的核心牌桌。 那个想用数据改变世界的年轻人,仍在沿着当年的方向向前走
显示更多
0
135
2.3K
384
转发到社区
Kimi K3大火,创始人杨植麟在卡内基梅隆大学的博士生导师@rsalakhu 也被炸了出来,在推特上说他很荣幸曾经教过杨植麟。 于是很多MAGA出来喷他,说他是在给对手培养人才,Russ也很无奈,这不正是你们希望的吗,收紧移民政策把外国人赶回去,怎么现在又不爽了? 他也透露了一些细节,杨植麟如果愿意留在美国,其实是有很多机会的,因为自己曾是苹果AI实验室的主管,借着这层关系,Tim Cook托人来问过杨植麟有没有兴趣加入苹果,但杨植麟的回复是,如果不独立创业一次,自己会后悔一辈子。 评论区倒是吵得沸沸扬扬,很有当年简中互联网统计清华北大有多少人出国留学并再也不回来的势头,只能说风水轮流转了。 我来贴一些锐评: - 如果我们需要顶级人才留下来,就必须先解决一些关键问题,比如种族主义和歧视的混合文化、没有免于恐惧的自由、缺少改善生活的基础建设等等,这些问题已经积累到了让人不再向以前那样有动力去拼命争取移民权了; - 移民政策烂到家了,你们指望像杨植麟这样的人可以被H1B或是一份苹果公司的工作就给打发了,然后感激涕零得誓死效忠?别逗我笑了; - 在美国,杨植麟的事业巅峰可能就是一个创业公司的早期成员,然后勉强作为一个技术苦力去给印度CTO汇报工作; - 很简单,你可以靠签证在美国打工,但无法创建一家自己的公司,是美国没有能力接住他的野心; - 哪怕签证也许没那么重要,重要的是美国的表态是不欢迎外国人「抢走」本国人工作的,与此同时中国正在积极建立一个关于人才荣归故里的系统,H1B抽签对于高学历人才来说是一种羞辱; - 666,大伙的态度从「滚回你的国家」到「为什么不留下来」之间摇摆的速度真是让人叹为观止啊⋯⋯
显示更多
0
15
93
9
转发到社区
Kimi K3 和 Qwen3.8 前后发新模型,都说自己仅落后 Fable5,K3 套餐现在抢都抢不到,千问还是随便买,我干脆买来测一测到底有没有那么强!!! 结果让我很震惊,某些情况下国产模型做的比 Fable5 还好,并且 Qwen3.8 同一个任务比 Fable5、K3便宜5-10倍,详细聊一聊: 第一个活,让 Qwen3.8、KimiK3、Fable5 复刻 macOS,同样一条一条 prompt(具体对比参考视频): Qwen 3.8 做的最好,一口气写1500 多行代码,菜单栏、Dock 弹性动画、可拖拽窗口等基础的不说,Spotlight、终端、通知中心全都真的能用。这是三板中能做得最全的,UI 也是最舒服的。 第二个活,让它写一个植物大战僵尸那样的塔防游戏。植物、僵尸、阳光经济、10 波进攻,最后一波有僵王坐镇,每条路还配了救场小推车。点开就能玩,同样一句话完成。 中间还顺手让它搓了个黄金矿工,像素怀旧风,放钩抓金块、炸药、道具商店、关卡倒计时全有,一次成型零报错。 然后计算了一下Token消耗和价格,这几个活加起来,Qwen3.8 花 4 毛钱,我以为自己少数了俩零,Fable 5 折算 5块4,K3 收了我 3块4。。。 同样的题三个模型的测试下来都能交货,但测完我的结论是: 国产这俩说仅落后 Fable 5,还真不算吹,差距已经缩小。但价格上 Qwen3.8 确实香,限时优惠+39 块上车不限购,烧 token 多但还是最便宜,而且这还只是预览版,2.4T 参数的正式版说是很快开源。 所以说,国产模型现在都很不错,兄弟们,你会选哪家呢🤔
显示更多
Kimi-K3 全方位实测! 我竟然打游戏输给了她?! 给大家带来Kimi-K3全方位编程能力实测! 包含前端, 后端, Agent能力. 并且包含现有SOTA级别模型横评! 这次 Kimi-K3 交了一个让我都意想不到的成绩, 甚至让我怀疑Scaling Law还远未结束! 下一个是不是要出10T参数量的模型! 本次测试直接把我几个测试集都要打到头了, 前端测试是淘汰的最快的, 我还以为这几个能撑下半年, 结果现在就撑了2个月. 后端的向量数据库测试大概还有几个算法变种可以优化, 然后就到头了, 除非未来的模型能自己发明新算法(那这妥妥AGI了). 测试唯一还需要提升的是Agent能力, 当然不是说Agent能力不行, 而是距离榜首还有一些提升空间. 总之, 现在唯一需要考虑的是, 完了, 又一个 CodingPlan 套餐要断货抢不到了.... #kimik3# #月之暗面# #AIAgent# #多模态大模型# #VibeCoding# #VibeGaming#
显示更多
0
14
65
8
转发到社区
🚀Kimi K3强的有点离谱! 我让Kimi K3生成科幻小说《极光》里的世代飞船,当Kimi生成完成之后,我被震惊到了! #KimiK3# #Kimi#
kimi-k3 测试速报! 前端这效果太猛了! Kimi-K3 刚刚发布! 赶紧给大家带来测试速报! 效果巨好! 无论是建模精确度还是粒子效果, 甚至复杂的shader内联代码都能one-pass, 相当猛! 稍后给大家带来详细测试! 记得点关注不迷路! 测试prompt在这里, 开源的: #kimik3#
显示更多
1/ 大模型越深,不一定越强。 Kimi K3 用 AttnRes,DeepSeek V4 用 mHC,ByteDance 提出 HC,目标都是破解“深度诅咒”。 但这些方法的训练预算、模型设计和代码库不同,无法直接比较。 哪种方法真正有效?DepthBench 开始寻找答案👇
显示更多
NVIDIA 发布 Skill2Env:用“集体技能”强化智能体 NVIDIA 研究者们把社区公开的 Agent Skills 编译成可执行 RL 训练环境的数据流水线:3.4k 个 Skills 变成 8k 个带程序化测试和行为量规的终端任务;仅 300 步 RL 训练就让 Qwen3.8-27B 在 Terminal-Bench 2.1 上提升 4.7 个百分点,且模型行为显著向源 Skills 的方法论对齐。 开源项目: 核心洞察:公开 Agent Skills 是一个被忽视的监督来源 Agent Skills 是“教智能体做某件事”的文件夹:一个 SKILL.md 加上可选的脚本、参考资料和资产。论文指出,把公开 Skill 语料当作数据来读,它同时提供三样东西: · 任务分布的采样:人们真正想让智能体处理的任务分布(有人愿意花时间写下工作流,说明这活儿值得自动化); · 真实世界的锚点:指向真实的仓库、数据集、工具和工件; · 结果测试表达不了的质量标准:领域专长、默认参数、常见坑、“好结果长什么样”。 # 数据流水线:四阶段编译,验证靠构造 1. Plan(分解):容器化的 Codex 规划器读取完整 Skill 包、联网调研相关公共资产,把 Skill 拆解成若干可验证的 workflow,每个附带元计划(场景、初始世界、预埋缺陷、难点来源、解法草案、验证策略)、资产建议和“任务轴池”(任务原型 × 验证器模式 × 人物画像)。 2. Diversify(多样化):宿主从轴池采样一组组合,加上复杂度、指令语气、请求者专业水平。关键设计是轴池以 workflow 为条件:研究型 workflow 配“证据可追溯”验证和研究者画像,而不是从全轴乘积空间乱抽,这让多样化保持 sensible。 3. Create(构造):全新创建者 Codex agent 在 Docker 内工作,尽可能用真实素材(钉在特定 commit 的开源仓库、真实版本化文档、官方 API 规范);需要联网服务的场景改造成本地替身(stub 服务器、录制回放 fixture、PATH 上的假 CLI、种子数据库),求解时绝不依赖网络。创建顺序被严格固定:先建世界 → 写指令 → 写测试 → 写量规 → 最后才写参考解,测试先于解法冻结,保证解法必须迁就评分契约而非反过来。 4. Verify(验证):宿主端无模型参与的接收门:静态检查(布局、符号链接、Dockerfile 安全、基础镜像按内容摘要钉死)+ 两个容器内试跑:Oracle(参考解)必须全指标满分,NOP(什么都不做的 agent)必须全指标零分。任一失败即拒绝。 值得注意的一个反直觉选择:不做 teacher 模型预验证(不像部分工作用强模型试解、解不出就丢弃任务)。理由有二:这会把任务难度上限压到验证器能力,且成本翻倍;而 group-based RL 的在线动态过滤(rollout 无优势的 prompt 自动不产生梯度)天然淘汰过难/过易任务。 # 数据画像:广、贵、且忠实于源 规模与成本:7,971 个任务,用 GPT-5.6 Sol(xhigh 推理档)生成,API 花费超 9 万美元。(脚注:出于法律原因,公开发布的数据集改用 Kimi-K3-max 在同一流水线下生成。) 领域分布:13 个领域中,软件工程仅占 22.5%,AI/ML 10.5%,商业/金融/法律/HR 10.5%,营销 9.3%……论文对比了 TMax-15K、Terminal-Bench、DeepSWE 等,Skill2Env 是唯一全覆盖 13 域、且非技术知识工作占大头的语料。 忠实度探针(很聪明的设计):用任务指令+量规作查询、对 3.4k 个 SKILL.md 做 TF-IDF 检索,73.2% 的任务 top-1 命中真实源 Skill,94.6% 进 top-10(随机 0.03%)。单用量规也有 68.5% top-1,证明量规携带的是 Skill 专属方法论而非泛泛建议。 SFT 数据:用 GLM-5.3 对每个任务 rollout 两次,得到 15,968 条轨迹,平均奖励 0.74,中位轨迹 19 次模型调用 + 23 次工具调用。 S2EBench:考虑到公开基准饱和,从 SkillHub 另外生成、逐条人工审核(指令无歧义、忠实于源 Skill、测试公允)后的 79 任务私有 held-out 基准。 # RL 实验:基础设施 + 极简配方 基础设施(论文明确说“现代 agentic RL 首先是基础设施挑战”):Molt(PyTorch 原生全异步训练,Ray + vLLM + FSDP2)+ Polar(agent rollout 层:rootless Apptainer 沙箱、代理回传 token ID 和采样时 log-prob、prefix merging 把 harness 的多次补全缝合成训练轨迹)。 配方(刻意走“简单路线”):GRPO 组归一优势 + DPPO 的 binary-KL 信任域掩码(δ=0.05,超出阈值的 token 直接丢弃,无需参考模型,还能防训练-推理失配);G=8 rollouts/组,批 64,lr 1e-6 恒定,无 KL 惩罚、无熵奖励、无 SFT 热启动,每任务 65k 上下文。 量规校准奖励:开量规时,额外由 GPT-6 Astra 做 LLM-as-Judge(带“宪法”:惩罚无脑循环、reward hacking、答非所问;hacking 实证 = -5 分),总奖励 r = r_V + λs/5(λ=0.2),即 judge 最多把程序化奖励拉动 ±0.2。量规是校准可执行结果奖励,而非取代它,这是与“Rubrics as Rewards”一系的定位差异。 # 四项发现(论文最有信息量的部分) 发现 1:小规模 RL 即有跨域迁移。 仅 300 步、只用 2,400 任务子集训一个 epoch:S2EBench pass@1 +4.3(均分 +18.5),Terminal-Bench 2.1 +4.7(49.4→54.1)。训练集与 TB 无重叠(13-gram Jaccard < 0.8),且训练集从未针对 TB 调过,论文将其解读为规划、工具使用、收尾能力的通用提升而非任务族记忆。这让 27B 本地模型显著缩小了与云端前沿模型的差距。 发现 2:量规校准 RL 在基准上落后于纯结果 RL,一个诚实的负结果。 量规版在 TB 2.1 只有 50.1(纯结果版 54.1);训练中量规版的程序化奖励长期停在 0.5–0.6,judge 分项从头到尾无上升趋势,两个奖励在训练分布上互相拉扯。论文不把它当作对量规奖励的终审判决(两者优化不同目标,而基准只考结果那一半),并给出两个疑因:λ=0.2 的加性形式让失败任务仍能拿正奖励、judge 看不到文件系统等设定均未调优;以及更本质的,Skill 写下的方法论可能本来就不是最大化基准通过率的分布。 发现 3:行为确实向 Skill 对齐,量规的价值所在。 200 个任务的成对偏好测试(judge 拿源 SKILL.md 当标准,比较匿名化的 base 与 RL 轨迹):纯结果 RL 已被偏好 54.5% vs 33.5%;量规版被偏好 73.0% vs 24.0%。这说明量规奖励买到的东西在结果基准上看不见,但对“怎么做事”影响实质,对网页开发、报告综合、开放研究这类难验证任务尤其重要。 发现 4:GLM-5.3 蒸馏 SFT 反而伤害 Qwen。 在 GLM-5.3 轨迹上做 SFT:27B 上 TB 2.1 掉到 45.8;4B 上直接崩塌(TB 18.7→3.4,出现思维/工具调用死循环)。归因:教师的 interleaved-thinking + 工具调用风格与学生自身 post-training 不兼容,模仿覆盖了学生依赖的行为模式却带不来教师的能力。与 TMax 报告的“SFT 混合数据劣化已后训练的 Qwen”互相印证。因此论文所有 RL 结果都从未修改的原始 checkpoint 出发。
显示更多