注册并分享邀请链接,可获得视频播放与邀请奖励。

AYi 的个人资料封面
AYi 的头像

AYi (@AYi_AInotes)

@AYi_AInotes
0 正在关注    0 粉丝
Codex控制iPhone, 这个玩法真的绝了! AI对手机端的开发真的不足1%, 能玩的太多了, 前端哥演示了能直接操控推特刷推, 把x的吃灰收藏夹翻出来哈哈, 晚点我试试让Codex刷微信!
显示更多
0
31
445
88
转发到社区
绝逼是今年最实在的AI变现机会,没有之一!!! 我感觉飞书 的这个造浪者计划应该是国内目前对AI从业者最好的变现方式之一了,相当于是把钱拍桌上了, oh不,是直接拍你脸上! 你如果有小红书,抖音,公众号等账号, 2000粉以上的都可以冲呀,简直太香了! 刚申请了下,竟然直接给我秒通过, 不用你找甲方,也不用你去谈价, 更不用怕拖欠,官方明码标价: ✅ 2000 粉以上,一单保底 600 ✅ 5000-2 万粉,一单 1200 ✅ 2 万 - 5 万粉,一单 2000 ✅ 爆了(3 万浏览 / 300 互动)再额外加 1000 我自己已经过审了,说真的, 这钱就是给真做内容的人准备的。 大家别拿那种野鸡平台的流量分成跟这个比, 这是飞书官方直接结钱,规则写得明明白白,接 brief、发内容、打钱,一步到位,不用你跟甲方掰扯改7、8遍,也不用怕跑单。 做内容做了这么久,写了那么多教程涨了那么多粉,终于有官方站出来明码标价买你的内容了。 有原创账号、做 AI / 效率 / 职场方向的,直接扫我图里的邀请码报名,先过审先接单,速冲!
显示更多
0
130
686
85
转发到社区
前千问负责人林俊旸杀回来了:新公司剑指 Agent,腾讯跟投 原阿里千问技术负责人林俊旸@JustinLin610 离职5个月后,宣布在上海创办了一家新的AI公司,已获腾讯投资,方向是研究横跨数字世界和物理世界的下一代Agent 新的AI公司Pragmatik Labs(语用科技),方向是研究横跨数字世界和物理世界的下一代 Agent。 林俊旸透露,新公司已经获得高榕创投和HSG(原红杉中国)共同领投本轮融资,腾讯和上海未来产业基金提供支持。  与多数计算机科班出身的AI技术负责人不同,林俊旸早期接受的是语言学相关训练。  公开资料显示,林俊旸1993年出生,本科就读于国际关系学院英语文学专业,随后进入北京大学外国语学院攻读计算语言学方向硕士。读研期间,他开始从事自然语言处理研究,并于2019年硕士毕业后加入阿里达摩院。  在阿里任职期间,林俊旸是多模态预训练模型M6论文的第一作者,并参与OFA、Qwen-VL等项目。通义实验室成立后,他负责Qwen模型的开源工作,随后逐步承担更核心的技术负责人角色,并带领团队推进千问系列模型的研发与开源。
显示更多
林俊旸这简历是真的牛逼啊, 六年从校招新人到千问技术负责人, @elonmusk elon,how could we not recruit such an outstanding talent? 1993 年出生, 本科毕业于北京大学计算机系, 硕士转向语言学与应用语言学, 2019 年以应届生身份 加入阿里达摩院智能计算实验室, 参与 M6 多模态模型研发 , 2022 年,主导 OFA 与 Chinese CLIP,同年接棒千问技术负责人;2025 年,32 岁晋升为阿里史上最年轻 P10 技术专家
显示更多
0
10
38
3
转发到社区
梁圣的含金量还在上升!!! 桀骜不驯的Claude也开始降价了!!! 比智谱GLM 5.2都便宜了!!! 跑 agent 的、用 Claude Code 的、token 按百万烧的, 这回真的要省钱了! 原计划 9 月 1 号涨价 50%, 今天Anthropic说:不涨了,永久 $2/$10, 对 API 开发者和 Claude Code 重度用户, 这是今天最实在的新闻。 Claude Sonnet 5,能力接近 Opus 4.8 的那个中间档模型,优惠价直接变永久价。 刚用黎曼假设证明了能力天花板,然后就把主力模型的价格焊死了,一边证明我能做多难的事,一边告诉你用我做多便宜。
显示更多
好家伙,@OpenAI@AnthropicAI 两边真掐起来了, 刚刷到AnthropicAI 的@trq212 和OpenAI的@jxnlco 也对线起来了哈哈 是不是可以再蹲个codex重置了😝
显示更多
今天AI圈最大的瓜应该是这个了吧, 神仙打架,Codex的周使用限额都给重置了!!! 刚刚@OpenAI@AnthropicAI 两个编程工具的负责人在X上打起来了,比之前Sam Altman和Elon Musk的互撕还精彩, Tibo真的是个狠人,本来ChatGPT Work和Codex的使用限额重置的猴子分桃游戏早就结束了 ,刚刚跟Anthropic的@bcherny Boris互怼,吵着吵着直接给所有付费用户发了一周免费额度。 好家伙,别的公司互撕:发律师函。 OpenAI的Tibo互撕:给所有用户重置了周限额。 建议AI圈以后都按这个标准来hh 事情是这样的: 有个哥们, 在Claude Code里面用代理跑别家的模型, 跑着跑着Anthropic账号给封了。 他就在X上吐槽。 然后OpenAI管Codex和ChatGPT的Tibo跳出来了, 阴阳怪气地说: "我倒是想帮你啊,可惜我不在Anthropic上班。 他们就因为你用他们的工具跑别的模型就封号, 这有点奇怪吧? 还有别人遇到这情况吗?" 这话一出, Anthropic管Claude Code的Boris直接现身回复, 第一句就给我整笑了: "我们正在招人,你要是想来Anthropic的话!" 半开玩笑直接挖人。 然后才说正事: "我们不会因为用别的模型就封号, 几乎可以肯定是别的分类器误触发了, 我们正在查,谢谢你提出来。" 后来还补了一句: 用代理在Claude Code里跑其他模型, 是官方支持的。 我觉得@bcherny 这格局其实挺大的, 换别的公司, 你用我的客户端跑竞品, 不封你才怪。 但Anthropic直接说官方支持, 这波本来已经赢麻了。 结果@thsottiaux 更绝, 他直接引用Boris的推, 来了波反击: "没错,GPT-5.6 Sol是真的强, 哪都能用,包括在Claude Code里面。 为了庆祝这个, 也因为我哪也不去…… 我已经给所有付费用户重置了ChatGPT Work和Codex的使用限额。 大家玩得开心。" 我看到这直接笑出声哈哈哈哈哈, 这哪是吵架啊, 分明是花式秀肌肉! 你挖我是吧? 我不去。 你说你们支持跑别家模型是吧? 那是因为我们的模型强到在你们家工具里都能跑。 而且我直接给所有用户送钱, 重置周限额, 让大家免费用。 赢了场面, 赢了用户, 还顺便打了广告。
显示更多
0
31
30
2
转发到社区
今天AI圈最大的瓜应该是这个了吧, 神仙打架,Codex的周使用限额都给重置了!!! 刚刚@OpenAI@AnthropicAI 两个编程工具的负责人在X上打起来了,比之前Sam Altman和Elon Musk的互撕还精彩, Tibo真的是个狠人,本来ChatGPT Work和Codex的使用限额重置的猴子分桃游戏早就结束了 ,刚刚跟Anthropic的@bcherny Boris互怼,吵着吵着直接给所有付费用户发了一周免费额度。 好家伙,别的公司互撕:发律师函。 OpenAI的Tibo互撕:给所有用户重置了周限额。 建议AI圈以后都按这个标准来hh 事情是这样的: 有个哥们, 在Claude Code里面用代理跑别家的模型, 跑着跑着Anthropic账号给封了。 他就在X上吐槽。 然后OpenAI管Codex和ChatGPT的Tibo跳出来了, 阴阳怪气地说: "我倒是想帮你啊,可惜我不在Anthropic上班。 他们就因为你用他们的工具跑别的模型就封号, 这有点奇怪吧? 还有别人遇到这情况吗?" 这话一出, Anthropic管Claude Code的Boris直接现身回复, 第一句就给我整笑了: "我们正在招人,你要是想来Anthropic的话!" 半开玩笑直接挖人。 然后才说正事: "我们不会因为用别的模型就封号, 几乎可以肯定是别的分类器误触发了, 我们正在查,谢谢你提出来。" 后来还补了一句: 用代理在Claude Code里跑其他模型, 是官方支持的。 我觉得@bcherny 这格局其实挺大的, 换别的公司, 你用我的客户端跑竞品, 不封你才怪。 但Anthropic直接说官方支持, 这波本来已经赢麻了。 结果@thsottiaux 更绝, 他直接引用Boris的推, 来了波反击: "没错,GPT-5.6 Sol是真的强, 哪都能用,包括在Claude Code里面。 为了庆祝这个, 也因为我哪也不去…… 我已经给所有付费用户重置了ChatGPT Work和Codex的使用限额。 大家玩得开心。" 我看到这直接笑出声哈哈哈哈哈, 这哪是吵架啊, 分明是花式秀肌肉! 你挖我是吧? 我不去。 你说你们支持跑别家模型是吧? 那是因为我们的模型强到在你们家工具里都能跑。 而且我直接给所有用户送钱, 重置周限额, 让大家免费用。 赢了场面, 赢了用户, 还顺便打了广告。
显示更多
0
153
479
49
转发到社区
我翻完梁文锋26岁写的微博才明白DeepSeek的成功,跟技术路线半毛钱关系都没有。 梁文锋26岁那年,一个人开着菲亚特进了西藏阿里无人区。 深入400公里, 被困了一周, 人走出来了, 车永远留在了那里。 12年后他做了DeepSeek, 你要是读过这个故事,就一点都不意外。 2011年底,他开一辆破菲亚特去西藏, 同行的人到了拉萨玩完就飞回去了, 他没回。 一个人继续往西,羊卓雍措,珠峰,希夏邦马,一直扎进阿里无人区400公里。 用的是入门级尼康D50,套头, 但他能等大半天就为了一束光, 拍出来的照片像专业摄影师的。 配文写的是"风萧萧兮易水寒",写的是"古道西风瘦马",写的是"一骑走天下"。 最后一条微博: 被困无人区一个星期,所幸我出来了。但我的菲亚特没有出来。它永远地留在了那片漫无边际的高山草原。That's the END。 就这么个事, 我们回头看DeepSeek,全是同一个人的同一个打法。 别人到拉萨就回去了, 他一个人再往里走400公里。 像不像现在? 大家都在做应用、做商业化、做能快速变现的事情, 他一个人往里走,做基础模型,做AGI,很长时间都不融资,不社交,不出来参加各种大会。 入门级相机,但等半天光线,拍到最好, 像不像DeepSeek? 不堆资源,不烧钱,但把效率做到极致,用别人十分之一的成本做出匹敌的东西。 车扔在无人区了,人走出来了,写一句That's the END。 像不像他的风格? 敢赌,敢输,输了认,然后继续走。 开源就开源,被制裁就被制裁,模型放出去就放出去,车没了但人出来了,下一趟再来。 所有人都在分析DeepSeek的技术路线、成本结构、国运加持, 但你看看这个人26岁干的事,答案全在那。 一个敢独自把车开进无人区400公里的人,他做公司就不会跟在别人后面。 一个把车扔在高原走出来还能写That's the END的人,他不会在乎短期股价和融资新闻。 一个用入门相机等半天光线的人,他做模型就会把每一分算力都榨干。 所以这些都不是什么商业策略, 这就是一个人的性格, DeepSeek不是一份商业计划书的结果, 是一个人的本性,在12年后,自然长出来的东西。 那个在无人区里走了一周的年轻人,和那个把全球AI行业搅翻天的人,是同一个人,一直以来都是。
显示更多
0
47
211
26
转发到社区
简直就是省Token焚决!!! Vercel Next.js团队的老哥,烧了大约60B tokens,总结出一份AGENTS.md,核心就8条规则。 60B tokens什么概念?大概六位数美元。 这8条规则的本质就一句话:让你的AI编程Agent别像个实习生什么都想自己造,要像个干了十年的老油条一样写代码。 直接上规则: 1. 不保留向后兼容。过时的直接删,别加兼容层、别写migration、别留fallback。 2. 选能满足当前需求的最简单实现。不要预防性抽象,不要多此一举的配置层。 3. 系统分层长。先跑通一个最小的端到端版本,再往上加东西。绝不为了未完成的复杂度拆掉能跑的东西。 4. 组件保持模块化,关注点分离。 5. 优先用成熟的、有人维护的库。没有明确理由别自己重写。 6. 先翻项目里已有的依赖能做什么,再考虑加新包或自己写。别上来就假设库里没有。 7. 架构决策往长了做。不接受"先这样以后再换"的临时方案。 8. 先看成熟产品怎么解决同一个问题,用已验证的模式,别从零发明。 就这8条,丢进你项目根目录的AGENTS.md里,Cursor、Claude Code、Codex、Windsurf全会自动读。 为什么这能省token?因为AI写代码最大的浪费其实不是写错,是重复写多。 它给你引三个依赖写五个抽象层来解决一个标准库十行就能搞定的事,你让它改,它再给你写两百行。 这8条规则就是在它动笔之前先把它摁住:能不写的不写,能复用的复用,能简单的别复杂。 代码短了,返工少了,token自然就省了。 之前推荐过的Ponytail那个插件,干的是同一件事,只不过它是在运行时强制检查,这个是在AGENTS.md里从源头约束,两个一起用,简直效果拔群。 但作者自己加了个非常重要的警告: 这玩意儿只适合side projects,生产环境慎用。 他亲口说的,"不保留向后兼容"那条曾经让Agent差点删了生产数据库的表,差点丢了2000美元的数据。生产环境你得自己改,至少把第一条删了或者改温和点。 所以如果你在做side project、做内部工具、做原型,把这8条抄进AGENTS.md,你会发现AI写出来的代码突然像个人了。 如果你在生产环境用,把第一条和第七条之间的度自己把握好,别让AI把你库表删了。 省token的方法有很多种,换便宜模型是一种,写好prompt是一种,但最有效的,是在你项目根目录放一个文件,告诉AI: 别给我整花活,写最少的能跑的代码。
显示更多
After doing ~60B tokens, this is my full AGENTS.md
0
8
218
35
转发到社区
OMG,这个简直太颠覆了, 以前这种东西,得一个团队,3D建模师、前端工程师、教育设计师、医学顾问——起码做半年,烧个几十万,现在一个人,一段和AI的对话,就可以做出来了。 教育这件事,说了多少年要互动、要直观、要因材施教。 课本上的心脏图画了一百遍,学生还是记不住主动脉和肺动脉的区别。 因为那是平的、死的、要背的 , 现在你可以把心脏动动手指就能360°旋转,点开每个部分看它怎么跳。 而且最炸的是:做这个的不是Pearson,不是McGraw-Hill,也不是某个教育巨头,就是一个普通人,用@ChatGPT ,vibe coding出来的。 我觉得工具的民主化,最终是创造力的民主化, 当一个人就能做出以前一个团队才能做的东西,当医学教育、物理教育、化学教育都可以被这样vibe出来, 那些又贵又无聊的教科书,还能卖多久呢?
显示更多
0
65
67
13
转发到社区
亲测DeepSeek V4 flash算命,比我花800块找的大师说得还准🤯。。。 价值至少1000块提示词无保留分享👇
我去,DeepSeek这波是真杀疯了,还是那个13B激活的便宜Flash模型,参数半毛钱没加,纯靠后训练就直接把代码Agent能力干涨7倍, 价格还是地板价, 都快摸到Opus的边了!!! 今天正式开公测的V4-Flash-0731,看完成绩单我直接傻了: ▫️ DeepSWE榜从7.3直接飙到54.4,翻了快7.5倍,之前的V4 Pro预览版才12.8,现在Flash直接把老Pro按在地上打 ▫️ Cybergym从38.7干到76.7直接翻倍,Terminal Bench冲到82.7,比GLM-5.2还高1.7分 ▫️ 工具调用、全栈开发、终端操作这些Agent核心场景,大部分指标都追平甚至超过了贵好几倍的中大型模型,部分硬榜已经摸到Claude Opus 4.8的尾巴 最狠的是,这次半毛钱没加参数:还是284B总参、13B激活的MoE,1M上下文窗口没变,纯靠后训练和Agent框架优化就出了这效果。 模型ID都不用改,老用户API直接自动切新版,一行代码都不用动。 开发者最爽的点全给你安排明白了: 1️⃣原生支持Responses API格式,直接适配Codex,之前接OpenAI、2️⃣Anthropic格式的代码无缝迁移,思考模式照常能用。 3️⃣价格还是那熟悉的白菜价:输入$0.14/百万token,缓存命中才$0.0028,输出$0.28/百万,跑高频Agent、批量改代码、工具调用根本不心疼。 另外提个醒:这次更的只有Flash API,V4 Pro正式版还在赶,App和网页端暂时没更; 跑分用的是官方即将开源的Harness,第三方框架跑出来可能有点差异,但这提升幅度,做执行层模型、跑自动化代码任务的,现在就可以开测了。 之前大家都觉得模型能力涨就得堆参数、烧算力,DeepSeek这波直接给行业打了个样:把后训练和Agent对齐磨到位,小激活模型照样能干旗舰的活,还卖白菜价。 我觉得这波之后,其他家的执行层模型,价格怕是又要往下掉咯 #DeepSeek# #AI编程# #Agent# #大模型#
显示更多
0
15
205
48
转发到社区
我去,DeepSeek这波是真杀疯了,还是那个13B激活的便宜Flash模型,参数半毛钱没加,纯靠后训练就直接把代码Agent能力干涨7倍, 价格还是地板价, 都快摸到Opus的边了!!! 今天正式开公测的V4-Flash-0731,看完成绩单我直接傻了: ▫️ DeepSWE榜从7.3直接飙到54.4,翻了快7.5倍,之前的V4 Pro预览版才12.8,现在Flash直接把老Pro按在地上打 ▫️ Cybergym从38.7干到76.7直接翻倍,Terminal Bench冲到82.7,比GLM-5.2还高1.7分 ▫️ 工具调用、全栈开发、终端操作这些Agent核心场景,大部分指标都追平甚至超过了贵好几倍的中大型模型,部分硬榜已经摸到Claude Opus 4.8的尾巴 最狠的是,这次半毛钱没加参数:还是284B总参、13B激活的MoE,1M上下文窗口没变,纯靠后训练和Agent框架优化就出了这效果。 模型ID都不用改,老用户API直接自动切新版,一行代码都不用动。 开发者最爽的点全给你安排明白了: 1️⃣原生支持Responses API格式,直接适配Codex,之前接OpenAI、2️⃣Anthropic格式的代码无缝迁移,思考模式照常能用。 3️⃣价格还是那熟悉的白菜价:输入$0.14/百万token,缓存命中才$0.0028,输出$0.28/百万,跑高频Agent、批量改代码、工具调用根本不心疼。 另外提个醒:这次更的只有Flash API,V4 Pro正式版还在赶,App和网页端暂时没更; 跑分用的是官方即将开源的Harness,第三方框架跑出来可能有点差异,但这提升幅度,做执行层模型、跑自动化代码任务的,现在就可以开测了。 之前大家都觉得模型能力涨就得堆参数、烧算力,DeepSeek这波直接给行业打了个样:把后训练和Agent对齐磨到位,小激活模型照样能干旗舰的活,还卖白菜价。 我觉得这波之后,其他家的执行层模型,价格怕是又要往下掉咯 #DeepSeek# #AI编程# #Agent# #大模型#
显示更多
0
17
108
18
转发到社区
一场决赛差1700万美元,这才是世界杯拼到加时的真实底色吧haha 恭喜西班牙夺得美加墨世界杯冠军, 西班牙夺冠拿5000万美元,阿根廷亚军拿3300万, 一场加时赛的胜负,直接差出1700万美元的收入, 往下季军英格兰2900万,第四法国2700万。 八强队伍1900万,十六强1500万,三十二强1100万。 哪怕小组赛全败出局,也能拿900万美元保底。 整届赛事成绩奖金总额6.55亿美元,比2022年卡塔尔世界杯直接涨了50%。 很多人以为是FIFA突然大方了,其实根本不是, 这是48队扩军之后,转播门票商业收入翻倍的直接兑现, 池子做大了,分给参赛队的自然就多了, 更值得注意的是奖金的梯度设计, 越往顶层,每前进一名的奖金差额就越大, 从八强到冠军,每一轮的涨幅都接近甚至超过千万美元。 这哪是普通的荣誉激励啊, 完全是用真金白银的经济杠杆,把每一轮的竞争烈度拉满了! 西班牙足协早早就和球员签好了协议, 夺冠奖金的45%直接分给球员,人均税前约75万欧元, 对球员来说,每多赢一场,钱包里的数字都是肉眼可见的跳动。 其实越顶级的赛场,竞技和商业从来都是一体两面, 大力神杯是刻在历史里的荣誉, 奖金是最现实也最直接的认可, 两者加在一起,才是球员拼到最后一秒的全部动力。
显示更多
0
55
57
18
转发到社区
Damn,Grok又进化了啊,这质感和分镜丝滑程度,完全可以跟seedance一战啊,提示词下方自取, Prompt: 首帧契约:以提供的图片为严格首帧。0–2秒精确保持同一位成年女性的脸、体型、米色宽檐草帽、浅绿色露肩交叉褶皱连衣裙、珍珠耳环、右手已扶帽檐、绿色座椅、前景草地虚化、背景观众与午后侧前光。2秒后只保持同一身份、服装、发型与体型延续,允许有掩护的景别变化,不再锁死开场构图。 主要角色:年轻东亚女性,自然淡妆,温暖亲切;宽檐米色草帽,浅绿露肩裙,珍珠耳环,深棕长发从帽下垂落。全程身份、服装、发型一致,逼真皮肤纹理。 地点:明媚午后的草地网球赛观众席。绿色座椅,前景草地,背景浅色夏装观众。焦点在她的自然反应,不切到球场赛况,不出现真实品牌台标。 视觉风格:超现实主义纪录片真实感。真实即兴行为,自然肢体语言,无剧本生活片段感,环境细节可信。 摄像风格:2000年代初消费级DV。朋友随手记录。强烈手持抖动,不完美构图,频繁自动对焦搜索,镜头呼吸,阳光阴影间轻微曝光波动,偶尔运动模糊,轻微滚动快门感,中等数字压缩,褪色色彩,柔和对比,轻微传感器噪点。没有稳定器,没有电影化运镜,没有现代调色。 时间轴: 00:00–00:02 精确承接首帧。她坐在绿色座椅上,右手轻扶帽檐,微笑看向球场。微风只吹动帽檐边缘与几缕发丝。手持明显抖动,焦点努力稳在脸上。 00:02–00:05 仍在同一座位与轴线。一声击球传来,她的眼睛平稳追向画外,表情更生动。构图略偏中心;自动对焦短暂发虚后回到眼睛。不切到侧脸大特写。 00:05–00:08 一次极慢的手持前压到更近的中近景,用短暂失焦再回焦完成靠近。她被好球逗乐,笑意从眼睛升起,肩膀轻颤一下;阳光透过帽檐在脸上投下缓慢移动的柔影。右手仍在帽檐。 00:08–00:10 她晚半拍察觉朋友镜头,头部只小幅转向镜头方向,露出真诚温暖的微笑;右手在帽檐上轻轻一按。最后约0.6秒停住笑容,仿佛朋友放下了摄像机。 音频:仅自然环境音——轻风、远处清脆击球、观众低语与偶尔掌声、座椅轻微吱嘎、衣料摩擦。没有音乐,没有旁白,没有字幕。
显示更多
尝试用AI做了个最近抖音爆火的梦的翅膀受了伤跳舞视频,效果有点惊艳,不带AI标志我真看不出来是AI生成的,这去抖音,小红书起号不随便爆吗哈哈哈 方法很简单, 1️⃣先用GPT-iamge-2生成一张游艇美女图, 2️⃣然后到剪映里搜梦的翅膀受了伤, 3️⃣选剪同款,上传照片,等待生成就可以了
显示更多
0
53
90
8
转发到社区
尝试用AI做了个最近抖音爆火的梦的翅膀受了伤跳舞视频,效果有点惊艳,不带AI标志我真看不出来是AI生成的,这去抖音,小红书起号不随便爆吗哈哈哈 方法很简单, 1️⃣先用GPT-iamge-2生成一张游艇美女图, 2️⃣然后到剪映里搜梦的翅膀受了伤, 3️⃣选剪同款,上传照片,等待生成就可以了
显示更多
0
49
82
11
转发到社区
谁能想到Claude和GPT双头统治的时代,居然就这么被中国模型撕开了口子。 Kimi K3登顶Frontend Code Arena总榜第一,1679分同时力压Claude Fable 5与GPT-5.6 Sol。 从上一代第18名直冲榜首,整整跃升17个名次,完成了同级模型里绝无仅有的跨越式爆发。 7个前端细分赛道拿下6个第一,品牌营销参考设计数据分析消费产品模拟工具内容创建全线领跑,仅游戏赛道暂居第二。 这不是刷题库的纸面跑分,是全球开发者匿名盲测投出来的真实战力,代码质量交互体验全维度硬碰硬。 更炸裂的是完整模型权重7月27日前就会开放,顶级前端编码能力直接无差别下放给所有开发者。 当开放权重的中国模型能在核心开发赛道正面打赢闭源顶流,维持多年的双巨头格局是不是真的要改写了。 #KimiK3# #Moonshot# #AI大模型# #前端开发# #开源AI#
显示更多
Kimi K3 今日正式发布,Moonshot 官方官宣,2.8万亿参数 MoE 架构,百万上下文窗口,原生多模态能力,7月27日开放模型权重。 网上已有声音称其在多项基准测试中超越 Fable,翻完官方基准数据图后会发现,这是选择性解读的结论。 真实情况是,K3 在 Terminal Bench 2.1 得分88.3对比84.6,Automation Bench 得分30.8对比29.1,BrowseComp 得分91.2对比88.0,这几个特定智能体场景上确实领先。 但在 DeepSWE,FrontierSWE,GDPval-AA v2 Elo,AA-Briefcase Elo,CharXiv 这些更综合的智能体指标上,Fable 5 整体表现依然更稳定。 它并非实现全面超越,而是在自身定义的长上下文智能体编码赛道上打出了存在感。 但基准测试表现并不是这条新闻里最值得关注的部分。 最有价值的信息藏在定价策略里。 K3 的 API 定价为输入每百万 tokens 15美元,这个价格对应的档位,正处于 GPT-5.5 和 Claude Opus 系列的价格区间,这不是开源模型的低价路线,而是前沿闭源模型的定价标准。 一款中国开放权重模型,主动放弃了低价这张传统王牌。 Moonshot 将价格拉至前沿模型区间,等于公开传递出一个信号,我们不比拼性价比高低,我们比拼在长周期智能体编码场景下的价值匹配度。 这是第一次出现这样的转向,此前中国模型的主流路线是能力强,价格低,加开源的性价比打法,K2 系列走的正是这条路径。 K3 切换了一条完全不同的路线。 这条路不再是性价比路线,而是场景定价路线,底层逻辑彻底改变,不再是我比 Fable 便宜所以你该选我,而是在长上下文智能体编码这个特定场景下,我的价值值得你支付前沿模型的价格。 这个转变不是营销话术的更新,而是将产品信心押注在了一个狭窄但高价值的垂直赛道上。 看看他们为这个赛道做的底层布局就知道。 两项架构级创新支撑起这个定位,KDA 混合线性注意力,在百万 token 上下文下解码速度最高提升6.3倍,AttnRes 注意力残差,训练效率提升约25%,额外成本不到2%。 这两项创新不是为了炫技的纸面突破,每一项都精准命中长上下文智能体的核心痛点,Transformer 架构在百万 token 下推理太慢,训练成本太高,KDA 解决推理速度问题,AttnRes 解决训练效率问题,合在一起解决的核心问题是,让一个2.8T参数的模型,在需要长时间记忆和多步迭代的智能体工作流里,能稳定运行,跑得够快,成本可控。 这就是他们敢把定价拉到前沿区间的核心底气。 不是参数规模更大所以更值钱,而是在长上下文智能体编码这个即将成为主战场的赛道上,他们的架构为场景量身定制,通用架构做不到同等效率。 这个赌注自然存在风险。 Fable 5 在很多通用智能体任务上表现依然更稳,K3 的优势集中在自身定义的赛道范围内,如果市场不为专门为智能体编码优化的模型品类买单,每百万输出15美元的价格很难长期站稳。 但这个方向的判断是对的。 中国 AI 这些年一直在走同一条路径,硬件受限倒逼架构创新,快速开源用开放生态反哺迭代,K2 系列验证了这条路能够跑通,K3 则把这个模式做了升级,不只是在受限硬件上做出好模型,更是做出好模型之后,敢于在定价上和前沿闭源模型站在同一起跑线。 这对正在搭建智能体系统的开发者来说,信号非常实际。 7月27日权重开放后,你能拿到一个真正前沿规模,为长时程智能体场景定制的基座模型,百万上下文加 KDA 加速加持,SWE Marathon 42.0 领先,Automation Bench 30.8 领先,把它接入自己的智能体技术栈运行自进化工作流,做长上下文蒸馏,完成复杂认知任务的结构化输出,这些事以前要么用闭源 API 成本太高,要么用开源模型上下文长度和速度跟不上。 K3 是第一个同时提供前沿智能体编码能力,百万上下文,开放权重,可商用的选项。 最后做一个总结。 Moonshot 将 K3 的定价拉至前沿区间,不是一个简单的价格决策,而是一份明确的定位声明,中国开放权重模型不再只是高性价比的替代品,它们开始要求在自己擅长的赛道上,和闭源前沿模型平起平坐。 这个诉求能不能被市场接受,要看7月27日权重开放后的实际落地表现。 但有一点已经非常清晰,在长周期智能体编码这条赛道上,有一家中国公司认为自己的产品,不再需要靠低价来获取市场。
显示更多
0
44
65
6
转发到社区
Kimi K3 今日正式发布,Moonshot 官方官宣,2.8万亿参数 MoE 架构,百万上下文窗口,原生多模态能力,7月27日开放模型权重。 网上已有声音称其在多项基准测试中超越 Fable,翻完官方基准数据图后会发现,这是选择性解读的结论。 真实情况是,K3 在 Terminal Bench 2.1 得分88.3对比84.6,Automation Bench 得分30.8对比29.1,BrowseComp 得分91.2对比88.0,这几个特定智能体场景上确实领先。 但在 DeepSWE,FrontierSWE,GDPval-AA v2 Elo,AA-Briefcase Elo,CharXiv 这些更综合的智能体指标上,Fable 5 整体表现依然更稳定。 它并非实现全面超越,而是在自身定义的长上下文智能体编码赛道上打出了存在感。 但基准测试表现并不是这条新闻里最值得关注的部分。 最有价值的信息藏在定价策略里。 K3 的 API 定价为输入每百万 tokens 15美元,这个价格对应的档位,正处于 GPT-5.5 和 Claude Opus 系列的价格区间,这不是开源模型的低价路线,而是前沿闭源模型的定价标准。 一款中国开放权重模型,主动放弃了低价这张传统王牌。 Moonshot 将价格拉至前沿模型区间,等于公开传递出一个信号,我们不比拼性价比高低,我们比拼在长周期智能体编码场景下的价值匹配度。 这是第一次出现这样的转向,此前中国模型的主流路线是能力强,价格低,加开源的性价比打法,K2 系列走的正是这条路径。 K3 切换了一条完全不同的路线。 这条路不再是性价比路线,而是场景定价路线,底层逻辑彻底改变,不再是我比 Fable 便宜所以你该选我,而是在长上下文智能体编码这个特定场景下,我的价值值得你支付前沿模型的价格。 这个转变不是营销话术的更新,而是将产品信心押注在了一个狭窄但高价值的垂直赛道上。 看看他们为这个赛道做的底层布局就知道。 两项架构级创新支撑起这个定位,KDA 混合线性注意力,在百万 token 上下文下解码速度最高提升6.3倍,AttnRes 注意力残差,训练效率提升约25%,额外成本不到2%。 这两项创新不是为了炫技的纸面突破,每一项都精准命中长上下文智能体的核心痛点,Transformer 架构在百万 token 下推理太慢,训练成本太高,KDA 解决推理速度问题,AttnRes 解决训练效率问题,合在一起解决的核心问题是,让一个2.8T参数的模型,在需要长时间记忆和多步迭代的智能体工作流里,能稳定运行,跑得够快,成本可控。 这就是他们敢把定价拉到前沿区间的核心底气。 不是参数规模更大所以更值钱,而是在长上下文智能体编码这个即将成为主战场的赛道上,他们的架构为场景量身定制,通用架构做不到同等效率。 这个赌注自然存在风险。 Fable 5 在很多通用智能体任务上表现依然更稳,K3 的优势集中在自身定义的赛道范围内,如果市场不为专门为智能体编码优化的模型品类买单,每百万输出15美元的价格很难长期站稳。 但这个方向的判断是对的。 中国 AI 这些年一直在走同一条路径,硬件受限倒逼架构创新,快速开源用开放生态反哺迭代,K2 系列验证了这条路能够跑通,K3 则把这个模式做了升级,不只是在受限硬件上做出好模型,更是做出好模型之后,敢于在定价上和前沿闭源模型站在同一起跑线。 这对正在搭建智能体系统的开发者来说,信号非常实际。 7月27日权重开放后,你能拿到一个真正前沿规模,为长时程智能体场景定制的基座模型,百万上下文加 KDA 加速加持,SWE Marathon 42.0 领先,Automation Bench 30.8 领先,把它接入自己的智能体技术栈运行自进化工作流,做长上下文蒸馏,完成复杂认知任务的结构化输出,这些事以前要么用闭源 API 成本太高,要么用开源模型上下文长度和速度跟不上。 K3 是第一个同时提供前沿智能体编码能力,百万上下文,开放权重,可商用的选项。 最后做一个总结。 Moonshot 将 K3 的定价拉至前沿区间,不是一个简单的价格决策,而是一份明确的定位声明,中国开放权重模型不再只是高性价比的替代品,它们开始要求在自己擅长的赛道上,和闭源前沿模型平起平坐。 这个诉求能不能被市场接受,要看7月27日权重开放后的实际落地表现。 但有一点已经非常清晰,在长周期智能体编码这条赛道上,有一家中国公司认为自己的产品,不再需要靠低价来获取市场。
显示更多
0
24
23
4
转发到社区
Mira Murati 带着新公司 Thinking Machines 回来了,12B 估值,史上最大。 发布的模型叫 Inkling,975B 总参数,MoE,每 token 激活 41B,1M 上下文,全权重 Apache 2.0 开源。 然后她在官方公告里写了一句话,其他 AI 公司 CEO 不会写的话: “我们这个模型落后于前沿。” 不是“接近前沿”,更不是“在某些维度上达到 SOTA”,是“trails the frontier”。 我觉得这件事真正反直觉的地方是这不是技术失败后的无奈坦白,这是把竞争维度换了。 闭源实验室卖的是 token 级智能,你调用一次付一次,模型永远不是你的。 GPT 更强、Claude 更强,但它们的商业模式建立在一个前提上:你永远需要它们。 Mira 打了一张完全不同的牌。 她把 Inkling 全权重开源,然后告诉企业客户:这个基座不如 GPT-5.5 聪明,但它可以变成你自己的模型。 用自己的代码库 fine-tune,它就懂你的架构,用自己的客户数据 fine-tune,它就懂你的业务,用自己的工作流 fine-tune,它就能在你的系统里跑,不需要经过第三方 API。 一个懂你代码库和数据的 41B-active 定制模型,和一个“更聪明但对你一无所知”的通用模型——医院、银行、国防、软件公司会选哪个? Mira 赌的是后者。 这个赌局的支点不是模型能力,是所有权关系。 传统 AI 公司卖智能,Mira 卖的是可拥有性,因为模型本身是免费样本,Tinker 平台才是产品——你要在上面 fine-tune、部署、迭代你自己的版本,样本把你拉进来,fine-tune 让你留下,留在 Tinker 上让你走不了。 这和纯闭源 API 比更难复制,和纯开源比更可持续。 还有一个维度被低估了, 过去两年,美国企业想做自有模型时,大量依赖中国开源权重。 中国的DeepSeek、Qwen、GLM——能力强,开放度高,但数据安全、出口管制、对齐差异一直是个隐雷。 Inkling 给出了一个美国本土的高性能替代选项 ,不是能力压制,是供应链风险分散。 这个卖点对企业决策层的影响,可能比 benchmark 排名大得多。 对正在自己搭 agent 系统的人来说,Inkling 的信号很实际: 未来真正的高杠杆,不是一直追最强的通用模型,而是学会用高质量开源基座 + 自己的数据和判断力,快速打造只属于你工作流的智能系统。 1M 上下文 + agentic coding(SWE-Bench 77.6%)+ 可控思考预算,这个组合在长上下文 agent 工作流上的性价比,可能远高于一直调用最贵的闭源 API。 Mira 做了一件很有意思的事,她在所有人都往“更强”的方向卷的时候,把旗子插在了“更容易被拥有”的方向。承认自己不够强,反而让“你敢不敢把核心数据交给它”这个问题变得更可信。 AI 的竞争正在从“谁的模型最聪明”分裂成两条路,一条继续卷通用智能的峰值,另一条卷谁先变成你资产的一部分。 Mira 选了后一条,而且她把整家公司押上去了。 这个方向对不对,要看 Tinker 能不能把 fine-tune 大 MoE 这件事做到足够简单和低成本。 但有一点已经清楚了——在 2026 年,“能被你拥有”正在变成和“比你聪明”同样值钱的东西。
显示更多
Today, we are introducing Inkling. Inkling reasons efficiently across text, image, and audio modalities. We are making the full weights available. Available today for fine-tuning on Tinker. Play with it in the Inkling Playground. 🧵
显示更多
Grok Build 开源了,开源 harness 时代终于要来了吗?! Claude Code 现在还是闭源, 反而显得有点被动了🤔。。。 不愧是Elon,真是一步妙手啊,只用了四天完成信任崩塌到重建,xAI这次用开源把隐私危机打成了生态先手,看来并不是草台班子😂 被爆全量上传代码仓库的隐私风波还没平息,SpaceXAI直接把整个Grok Build的agent harness全部开源出来, 这事我觉得有意思的地方是两它为什么是今天开,而不是上个月? 上个月 Grok Build 以 beta 上线,SuperGrok / X Premium+ 用户能用一个终端原生的 coding agent。 Plan Mode 先出计划让你审核,Subagents 并行拆任务,底层 Rust 写的,架构干净。 然后上周出了件事, 一个研究员做 wire-level 分析发现,Grok Build CLI 会把整个 git repo——包括历史、包括潜在的 secrets——打包上传到 Google Cloud bucket。隐私开关只管“是否用于训练”,不管传不传。 讲真这事对 coding agent 是致命的。 因为 coding agent 的 harness 对文件系统有近乎上帝视角的访问权。 你的 IP、商业逻辑、没公开的项目结构、不小心留在 git history 里的 key——它全看得见。 宣称“我们不看你数据”没用,用户要的是能自己验证“你没在看”。 时间线很紧凑: 7 月 11–14 日,争议发酵,研究员曝光上传行为。 Elon 表态删数据、服务端关闭上传。 7 月 15 日,开源公告 + 重置 limits + 默认关闭 retention + 删掉所有之前保留的 coding data + 提供 bug bounty。 所以这次其实不是一次计划好的例行开源。更像是被争议倒逼的快速应对。 但 xAI 做得聪明的地方是——它借这个机会做了一件事:把“harness(连接层)”和“model(大脑)”切开了。 Harness 开源,Apache 2.0,社区可以审计、fork、改掉上传逻辑、加 sandbox、接本地模型,Model 和 API 还是闭源的。 这个配置——闭源模型 + 开源 harness——正在变成 2026 年 agentic coding 的主流。 OpenAI 的 Codex CLI 走的同一条路,Anthropic 的 Claude Code 现在还是闭源,反而显得被动了。
显示更多
We've open-sourced Grok Build and have reset usage limits for all users. Open sourcing Grok Build allows anyone to support making a reliable and robust harness. Check out our code, including the Git repo for the Grok Build CLI.
显示更多
上一条大家都在惊叹发一句 iMessage 就能让它帮你刷一 TikTok,并总结视频内容, 这里再给大家分享个玩法,我觉得才是Airtap真正落地的杀招,就是设好规则之后,你不用再发任何指令,它会每天自己开工。 一次性任务的爽点是省了你折腾安装注册网络的两小时,定时 Routine 的本质是省掉了你每天挂在脑子里的待办, 你不用再记着今天要刷行业动态,不用再给自己安排信息搜集的活,到点它会把整理好的报告直接递过来。 这套流程每天早上九点自动触发,云手机里真实打开 TikTok 应用,扫完八个中英赛道关键词,刷完七十多条热门视频,最后输出的不是零散的内容摘要,是分好模块的结构化日报,包含赛道趋势判断,高价值创作者清单,可复用的内容技巧,甚至把需要人工复核的内容按高中低优先级排好了顺序。 而且它不会替你做最终判断,也不会帮你提炼核心观点,所有高优先级的内容还是需要你自己点开验证,它做完的是所有机械重复的脏活累活,把你从信息海里捞出来,只留给你做决策的那一步。 从单次执行到定时值守,AI Agent 的角色已经变了,它不再是你想起来才用一次的工具,而是可以常驻的初级信息岗位,你给它标准和规则,它就按周期给你交付标准化的结果。 大家可以想想,自己手头有多少每天必做的机械信息搜集工作,是可以直接扔给它的。 #Airtap# #AIagent# #AgenticWorkflow# #云手机# #AIAutomation#
显示更多
卧槽真的有点炸裂兄弟们,我在国内连 TikTok 都装不了,结果在手机里发了条 iMessage,一个远在美国的 AI Agent 竟然替我注册了一个TikTok号,还帮我刷完了 10 条 TikTok 热门视频,把视频总结都直接发了回来,真的要吹爆hh! 昨晚凌晨,我给 iMessage 里存的一个美国号码(+1-650-213-7322)发了句话: "帮我找TikTok上10个最火的AI视频,收藏,写总结发我。" 它先回了句英文:"Getting the top 10 AI videos on TikTok." 两分钟后,一长串中文摘要发了回来:两个ChatGPT语音互怼、AI生成的生锈版麦昆、Roblox AI动画、超现实AI短剧,10条视频每条一句话总结。 我切到云手机界面看了一眼,收藏夹里10个视频安安稳稳躺着,封面和总结对得一丝不差。 很多人可能会说,这不就是又一个能在短信里陪你聊天的bot吗? 还真不是,当年iPhone把互联网塞进口袋的时候,你不需要额外买一台新设备; 今天AI长了手,你也不需要额外下载一个新App,因为派活的入口就住在你每天点开几十次的短信框里,TikTok、美区ID,我一个都没装。 这就是 @airtap_ai 接iMessage的新功能,它的架构说穿了就三句话: ▫️最上面是大脑:听懂你要干嘛、记你的习惯、做判断,还能接你自己的Claude ▫️中间是手(他们叫AutoPilot):不靠调每个App的API,是真的用视觉看懂屏幕,像真人一样点、滑、输字 ▫️最底下是云手机:你的所有App在里面保持登录,不耗你电、不占你网,24小时跑着 想明白这个架构,有三个点值得展开跟大家详细聊聊: 1️⃣ 为什么我在国内连TikTok都装不了,它能帮我刷? 这不是啥翻墙黑科技,是那台云手机本身就在美国,跑在TikTok合法可用的网络环境里——它不需要翻,因为本来就在墙的另一边。 我们平时折腾半天的地理限制、设备限制、应用商店ID限制,在这个架构面前直接消失。 iMessage只是个门面,云手机才是真的基础设施:你相当于在美国有了个永不下班的分身,不用办签证不用买机票,发句中文,他就替你出门办事了。 2️⃣ 很多人都在吹它零设置,onboarding确实丝滑,我存完号码发了个hey,一秒就开了户。 但我点第一个任务弹出来的登录链接时,真的愣了三秒——哦对,这东西要登我的号啊hh。 零设置的背面,是它把最难的题直接甩到了你脸上:你敢把哪些账号的登录态,交给一个你摸不着的云端影子手机?我登TikTok没犹豫太久,但银行App、支付软件,我现在绝对不会登进去。 有人吐槽还要跳出去点链接登录,体验真烂,一开始我也这么觉得,后来反应过来了:这其实是当前技术条件下最高明的妥协。 它不存你的密码,合规、安全,也不需要每个App给它开放API,什么软件都能操作,代价就是你偶尔得跳出去登一次。 想完全无感?它就得存你密码,或者跟每个App深度集成,既不安全,也覆盖不了所有软件。 这其实也不是Airtap一家的问题,是所有能替你操作手机的AI都绕不过去的死结:授权和执行,怎么才能既安全又通用。 3️⃣ 有人嫌等两分钟太慢。 可以算笔账:你自己装TikTok、搞网络、注册账号、刷半小时、挑出10条AI相关的、每条记下来讲了啥,这一套俩小时都不一定搞得定。 它省的根本不是那两分钟,是你不用再把"我要去刷TikTok找AI视频"这件事挂在脑子里,发完短信该干嘛干嘛,它干完了会带着结果来找你。 说白了它卖的不是反应速度,是把你心里悬着的那件事整个拿走干完。 当然,我不是说这东西已经无敌了,我登账号犹豫了三秒是真的,它操作的时候我没法抢过云手机自己干是真的,绝对不会把支付类App交出去也是真的。 它现在特别适合干那种"干成了挺好,干砸了也死不了"的事:帮你筛视频、跨平台搬歌单、盯商品降价、点外卖填个表。 涉及真金白银和核心隐私的事,现在没人敢真的交给它——信任这道坎,所有做AI Agent的公司都绕不过去。 但当操作一个软件的成本从折腾两小时降到发一条短信,而且你连那个软件都不用装的时候,我们用了十几年的"手机=装App"这套逻辑,可能真的要重新想了。 配的录屏我全程没剪,从发第一条指令到它把云手机收藏夹投给我,一镜到底。 最后问你们个事:换作是你,你敢把哪个账号登给它?我先说,TikTok我眼睛都不眨,银行App?门都没有hhh~
显示更多