注册并分享邀请链接,可获得视频播放与邀请奖励。

WeZZard 的个人资料封面
WeZZard 的头像

WeZZard (@realWeZZard)

@realWeZZard
0 正在关注    0 粉丝
我觉得 Claude Design Team 肯定也对于 Opus 5.5 的毁天灭地的效果感到很绝望
0
19
39
2
转发到社区
玉伯终于想到这一点了。 不过我的 thesis 是:新时代不存在任何微信这样子的超级 app。新时代的入口属于硬件。 启发我这么想的是我最近做的 GTM 工作流,做完这一套之后,我认为只要任何 IM 提供任何 GUI 的使用方式,那它就必然不可能成为下一个时代的入口。 我首先在本地制作了标准的 Ubuntu 以及 macOS 虚拟机镜像,里面提供了浏览器以及一些 IM 软件。 然后我开发了一个采集程序,在 IM 群组以及社交媒体中采集信息,然后寻找符合用户画像的潜在客户。 因为 Chrome 的 profile 是可以直接抽出然后存储在虚拟机外的,所以针对 web app 我并不需要每次都重新登录。如果不是 web app 也有对应的解决方法。 最后一步就是发起和潜在客户的沟通了。这里比较拙劣的用法是直接使用 AI 产生的信息去和用户沟通。但我依然只会要求 AI 帮我编排好沟通材料,由我自己真人去沟通。 在整个过程中帮我建立连接的,其实并不是我而是我的 AI + 我的意图。我的 AI 可以横跨所有的即时通讯软件及社交媒体,只要它提供任何图形界面的访问方式。 所以只要任何 IM 提供任何 GUI 的使用方式,那它必然就不可能成为下一个时代的入口。因为它必然可以被运行在虚拟机上,然后由 AI 采集信息,帮助用户完成横跨数个 IM 以及社交媒体的连接。 那么下一个时代的入口是什么?我认为它一定会和硬件绑定在一起。或者下一个时代的入口,一定会是 OS 级别搭配硬件销售的。 而且整体看下来我自己做的 GTM 流程存在数据飞轮,而这个飞轮最后掌握在 GTMer 手中。 考虑到数据主权,通过 Qwen 3.8.27B 所有 API 请求和数据都可以留在本地。而我构建这一套设施的硬件成本是 M4 Pro Mac mini 64GB RAM+ 2* DGX Spark。当然,目前 M5 Ultra Mac Studio 256GB 是性价比更高的选择。我目前的配置加起来应该已经超过 10 万了。 但是硬件价格一定会下降,以及目前这一套设备在未来很有可能就可以运行在一个像 Mac mini 甚至像 iPhone这样小的设备里面。iPhone 在发布的时候,其 CPU 相当于 2000 年左右的桌面级 CPU。而目前 A20 Pro 也已经比肩同年代的桌面处理器能力。所以相关的能力在未来一定会走入千家万户。而通过 IM 构建起来的护城河,最后也一定会被瓦解。 另外从这点看,本地 AI 会是一个越来越重要的话题,以及 Qwen 27B 这个模型权重会是一个越来越重要的模型权重。我不得不说,阿里 Qwen 实验室的这个模型权重系列设计真的是非常的有品位。 目前的大厂都只能够自己做软件,最有资源的那一位,却没有做硬件的耐心。所以最后愿机会属于每一位不愿意在大厂打螺丝的朋友们。
显示更多
细思,Muse 确实有做成新时代微信的机会。 微信当年最重要的功能,是给人发消息,同时比短信还便宜非常多。想发消息的人在微信上,带来用户吸引,形成了网络效应。有用 + 网络效应 + 运气,成就了微信。不是因为微信有多懂你。 Muse 能帮人处理邮件日历、电话催单等各种杂事,这有点像微信最开始的发消息。Muse 的网络效应会在哪。没有网络效应的话,和 ChatGPT 会是同质化竞争。豆包在国内活成了新时代的百度。 Meta 真正的杀招,可能是 WhatsApp -〉 Muse,类似当年的 QQ 通讯录 -〉 微信。不仅自己的 Muse 能干活,而是我的 Muse 还可以连接 WhatsApp 关系网中的其他人的 Muse,彼此因连接而更强大。如果 Muse 敢往这个方向发展,则就有机会构建网络效应。而且会比微信更厉害:微信通过手机,让人醒着就在线。Muse 通过 agent,让人睡着也在线。 有用 + 有机会构建网络效应,最后就只欠运气了。不期待小扎有这个运气,不期待任何大厂有这个运气。只期待齐俊元、玉伯、马小龙等创业者有这个运气。 有意思的时代,正在开启。
显示更多
现在看 Manus 真的很可惜 核心创始人中是有人有美国生活经验的,加上卓越的工程能力,肯定可以打造出适合英语用户的、具有想象力的产品 2026 本来应该是 Manus 在美国大杀四方的一年
显示更多
0
33
314
9
转发到社区
看完论文后发现 DeepSeek 应该喜欢 PL 的人,难怪我之前投简历都没有进面试,小红书上找到他们的 HR 问也不理我。早知道把 Apple Swift 编译器贡献者及在字节为 Swift 做的 runtime feature 也写在简历上,而不是写一堆自己写的 AI harness 了。 不过目前看是歪打正着。特别是最近听到王虹说在北大被 discouraged 之后。 初中的时候我主动报了我们学校的信息学竞赛队,但是进去之后我觉得讲的东西很无聊:汉诺塔、八皇后、约瑟夫问题——而觉得无聊是因为看不懂。但是知道很后来我才知道,我不懂并不是因为我笨。 彼时的我喜欢用 Borland C++ Builder 和 Vanilla JS 在桌面端和浏览器里面做酷炫的效果,还喜欢 WindowBlinds 换装。是的,我当时和觉得 DeepSeek Harness 的 GUI 不酷炫就觉得没意思的各位一样。 对了,当时的竞赛班老师还推荐了我们一本书叫「具体数学」,这个是一个伏笔。 而这个「看不懂」的问题我后来总算明白了:计算机只会通过循环解决问题,而循环的每一步都必须通过「有限的方法」让问题向解决推进一步。 但是人看问题不是这样,人可以在一个问题的某些具体场景下看到捷径。而所谓「算法思维」就是整理出所有捷径和非捷径的共同模式,然后在「默认使用循环」的情况下给出「每一步」中最高效和最通用的做法。 所以你要能「看懂」这些算法题必须得假设自己和一台计算机一样,只能做循环操作,去思考每一步的通用最优动作,然后解题。 当然,这么简单且显然本质在这么好的(中国)学校里面老师是不会教你的。默认你应该懂。但我最终懂这个道理的路可谓一路曲折。 我的中学时代其实和每一个中国出生长大的人一样,课业繁重。大学选择了自己心心念念的工业设计,画了四年画,毕业后转的码。转码过程中自己下载了清华、巴黎高师和北美四大金刚的公开课,然后买书看公开课学的。 在某次看清华的邓俊辉老师的算法课时,他提了提「具体数学」这本书。这次我终于把这本书买了回来,然后打开一看:1. 汉诺塔,2. 约瑟夫问题,…… 是的,原来初中竞赛班上的老师是照着这本书讲的…… 而当时我已经学了 MIT 的算法导论以及斯坦福 CS 143,看了 Engineering a Compiler, 2/e,自己撸了个小编译器出来。我觉得能学懂什么是自动机(EaC, 2/e 里面有涉及)的,应该都能够理解计算的本质吧。所以彼时再看「具体数学」会发现: 1. 原来在理解了计算的本质的前提下,这些题目这么好理解; 2. 原来 Donald Knuth 这种大神也需要先通过几个直觉 case 来测试自己的算法设计,遭遇失败、然后迭代几次之后才能得出正确答案; 3. 原来初中竞赛班上那些能够一步就给出正确答案的同学们应该:要么比 Donald Knuth 还要聪明几倍;要么就是在外面事先学过了; 所以这种竞赛班的本质其实并不是教计算机,而是:通过向远没达到对应成熟度的儿童传播一次远超他们成熟度的信息,测试反馈,筛选天才。 当然,也有可能筛选出提前过拟合的人。 到彼时总算放过了还是青少年的自己。回想我自学计算机的过程也算是一趟「王虹」之途——早年学习被环境吓到,之后自己把兴趣找了回来。当然,我没有王虹那么耀眼的成就。只能算是青年版的「重新把喜欢计算机的自己养了一遍」。 另外,某年我看到中科大的博士课程居然也把「具体数学」作为 prequisites 课程材料。所以我初中学不懂真的不是我的问题了。 但是到了 AI 时代,我们不能再做自己不擅长的事情了。 我觉得每个人都应该在 AI 时代想想是不是能做新的事情、做回自己本来擅长的事情。 AI 的放大能力应该用于你的长板。 同样的放大系数,拿来放大你的长板和补齐你的短板相比,收益的差别会随放大系数同样被放大。 如果考虑复利效应,这个收益差别还会随着年月积累。 所以接下来我应该还是会 focus 在自己擅长的事情上面。比如,下一个产品和下一个开源项目。所以,简历看都没被看一眼,应该也是好事。 附图:上一段程序员工作时放在身边看的一些计算机书。不过感觉之后应该会多看一些设计和 GTM 的书籍了。 * 看了看 deepseek-ai/deepseek-harness 仓库目前的贡献人数是 19 人,不太清楚是不是团队规模,但是只招进去两个人应该不实,论文中一人可能是北大软件学院教授。
显示更多
0
54
655
44
转发到社区
Manus 从产品形态看基本就是朝着「终局」去的: 1. 本地无打扰完全运行在云上 2. 2025 年中引入 wide research 增加任务拓扑方向上智能调用密集度 3. 2025 年年底透露在做主动式 agent 拓展时间维度智能调用密集度 4. 很早就建立了 evaluation 团队 只能说季逸超牛逼。老天让这个团队运气再好点吧。
显示更多
0
36
230
13
转发到社区
我觉得以后面试都可以在面试前先邮寄一个这个玩意儿过去要求候选人在面试时戴上。
我不认同,这是典型的唯参数论。忽略了模型厂商的战略眼光、模型训练对用户体验的供给以及模型使用人口变迁。 Kimi K3 标注是 Opus 4.8 级别,我个人体验下来其实是基于它的木桶短板标的,而它的长板完全可及 Fable 5。Kimi K3 在长尾数据的训练上面并没有 Fable 5 训练得那么全,会导致在多轮对话的任务中失败一次,然后次次修补,进入一个很差的体验。这和 Opus 4.8 的体验完全一致。 而 2026 年中的顶规模型可以保证状态一直在线。首先 Fable 5 的长尾数据训练非常全面。然后 Fable 5 的急剧性能衰减需要到达上下文长度的 80% 到 90% 才会出现。而 Kimi K3 基本在 40-50% 时就能感受到性能衰减。 上述 Fable 5 的优势对于整体体验来说提升的不只是一点两点,而是四五倍的提升——因为每一步有 5% 的任务失败概率,那么 10 步都成功的概率仅为 60%;而把每一步的失败概率消除一半,那么 10 步都成功的概率将提升至 78%。这个提升对于长程任务来说只会更夸张,比如放大到 50 步则可以将成功率提升接近 4 倍。 这就是 Fable 5 对于从事从 0 到 1 创新的工作者来说体验非常棒的原因——因为从 0 到 1 不可能 one-shot、也极有可能进入数据训练盲区。 那为什么大家会觉得 Kimi K3 好?是因为它的 one-shot 能力真的很强。而 one shot 成功自然会带来成就感。 而早在移动互联网开始时,很多人争相阅读的 Emotional Design 中就强调过「成就感」对用户体验带来的提升。Frog Design 的创始人 Hartmut Esslinger 也提出过 "Forms follow emotion(形式追随情绪)" 的设计原则。 所谓「形式追随情绪」就是让情绪成为恰到好处的功能装置。而大部分用户想用最快的速度搞点东西出来,那极高的 one shot 成功率带来的极高情绪满足就是最好的功能装置。 但 one shot 很多 AI IDE 在 2025 年就能做到,为什么 2025 年它的传播效应没有这么高,而 2026 年可以? 这是因为用户人群发生了改变。在 2025 年的主要适用人群——专业开发者看来,one-shot 能力是非常鸡肋的,因为我们要对工程细节进行打磨。但是 2026 年更多非程序员群体以办公人群的身份加入,导致评价标准发生了变化。 就像在移动互联网时代我们不能说:对于普通人来说想处理照片 Lightroom 足够了,没有必要购入 Photoshop。因为对于普通人来说真正合适的是美图秀秀、醒图、各种风格化相机。 可以说月之暗面在模型训练方面押注前端 one-shot 能力确实是一手好棋。 当然,这些用户会成长,会想做一些个性化的改动、会有创造新东西的需求。最后还是会碰到长 K3 上下文性能衰减和长尾数据不全面的短板。不过我想国产开源大模型应该已经有了第一批国内原住民——这些人没有用过美国头部两家的模型,在他们眼里,Kimi 就是最好的。
显示更多
其实大多数用户,对他们那点简单的需求而言,给他们一个中等水平的模型已经足够用了,也就是市场上随便哪个几乎都足够用。如果你宣传某个模型有十万亿参数,评测绝对第一,超级无敌。那他们用起来之后,就会真心觉得这模型真的超级超级厉害,用起来心情愉快,还会不停发文狂吹乱夸。 这就是 𝕏 上 AI 相关内容的现状。
显示更多
半年前看 Manus 的首席科学家季逸超在张小珺的采访中,说过田渊栋的 latent space 研究的想象空间。Manus 是真的厉害。这不仅仅是一个可解释性的研究,也是一个 capability 研究的重要基石。
显示更多
“为什么 latent space 和自然语言空间之间没有其他表示层?” Claude 的 J-space,某种程度上回答了这个问题。 我之前说 text CoT 更像当前阶段的工程折中:好监督、好验证、好被 reward model 评估,也好被用户、媒体和投资人理解。 所以它能 scale,但不代表它是终点。 J-space 把问题往前推了一层。 模型不是全程在自然语言里 thinking,也不是完全在不可读的 latent space 里 thinking。更准确地说,它内部存在一个可语言化的 latent workspace。 大量底层计算发生在 latent space;但那些需要被复用、反思、审计、对齐的中间思想,会进入这个 workspace。 所以它在科学上未必神秘。steering vector、logit lens 之后,大家早就知道 residual stream 里能塞下大量未说出口的语义、倾向和中间状态。 但它在工程上非常恐怖。 传统 RL / RLHF / RLAIF,本质上是: prompt → model output → reward model 打分 → 更新模型 但如果 J-space 走通,训练范式可能变成: prompt → model internal J-space + output → critic 打分 → 更新模型 这不是训练模型最后说什么。 这是训练模型在关键时刻“应该意识到什么”。 以前我们训练模型的嘴。 现在可能开始训练模型的内心独白。 这才是 Anthropic 这篇最值钱的地方。 它不只是 interpretability,而是可能影响 RL、对齐、长期记忆、continuous learning、fine-tuning 本身 甚至更多这两三年我们习以为常的操作。 知识库是外挂,微调是重训。 但 J-space 如果成熟,可能会出现第三种东西:直接塑造模型在某类场景下会激活什么概念、记住什么经验、调用什么原则。 而值得注意的是这一篇工作似乎诞生于 Sonnet4.5 时代,Anthropic 比 OpenAI 更让人震撼。 我甚至能想到前段时间大量 Researcher 批量加入 Anthropic 的场景: """ X: "我不喜欢你们,你们是一家非常喜欢封号的公司" Claude: “要不你看看我们半年前研究的这些工作再说,但这些论文都接近 close 了,你进来肯定挂不上这些名了,但你可以自己探索新方向” X: "我什么时候可以入职!" """ 早期 OpenAI 迷人的地方,是 GPT-2、GPT-3、CLIP、Whisper 那种朴素但强大的信念: 用数据、规模和统一范式,打破之前学术界“架构优先”的惯性。 那时候的 OpenAI 很像一个有明确科学直觉的组织。它知道自己相信什么,也知道自己要把世界往哪个方向推。 但现在的 OpenAI 越来越像产品和算力公司,强是强,却越来越难感受到一套属于自己的科学理念。 Anthropic 反而还在追问更底层的问题,J-space 不是证明模型有灵魂,它想证明模型的“内心独白”可能可以做成 API。 一开始我还以为 J-space 只是随手起的名字,后来仔细看才发现这个 J 是 Jacobian。 这就太浪漫了。 Jacobian 把多元复杂函数在局部近似成可操作的线性函数;J-space 则像是在把模型内部高维、复杂、混沌的 latent space,投影成一组可以读取、干预、训练的方向。 这种命名的美感,让我想到 SpaceX。 其实我从高一开始关注到 Musk 的,那会我每周都会买很多杂志,在其中一期看到了他完整的创业记录,只是近几年所有人都认识他了,所以也不怎么提了。 当时令我印象深刻的倒不是今天熟悉的星舰,而是 2008 年 Falcon 1 的第四次发射。前三次全部失败,第四次几乎凑出了最后所有的钱做发射,包括 Tesla 那一次 Falcon 1 入轨,SpaceX 才活了下来。 后来他们把海上火箭回收船命名为 Of Course I Still Love You。这名字出自科幻小说,不是冷冰冰的工程代号,而像一句情书,去接住一枚从天上返回的火箭。 所以迷人的地方是极端硬核的工程、生死边缘的赌局,最后被一种近乎浪漫的命名接住。 科学、工程和浪漫,在这里突然接上了。 Author List 中 Wes Gurnee @wesg52 和 Jack Lindsey @Jack_W_Lindsey 构思了整套方法,以及语言表达与意识访问之间的联系,伟大无需多言。 有两位华人 Rowan Wang 和 Runjin Chen 参与了 Reflection 训练部分
显示更多
Two major additions to Amplify: • External agents (Codex, Kimi) can now act as executors • Claude Code can now perform sensitive actions with approval