注册并分享邀请链接,可获得视频播放与邀请奖励。

与「宇宙語」相关的搜索结果

宇宙語 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 宇宙語 的内容
高人,你这个帖子让我整整琢磨了两天!本来想写个长文,但是太多头绪也不知道从何写起。总的来说是我这段时间上推的原因,总感觉自己的开发缺了很重要的认知;也是我这段时间除了自己硬件修复工作之外,还必须要去看text-to-CAD 的原因。 我为啥这段时间上推,就是心情不好。话多,我心情好的时候是不说话的,哪有这个功夫,可以一直干活。 很多行业,甚至是大部分AI需要落地的严肃场景,就是缺 IR, Verifier; 后续的TD和Platform Config必须建立在前面已经推导完成的前提下。AI写程序为什么那么厉害,就是因为IR-Platform Config这条链条是顺畅的。 我们看一下我这个视频。Zoo(text-to-CAD)就是创造了KCL这个IR, 集合你说的Specs/Impl 于一体,Specs是代码前面那一段。后面的Impl与verfier, 比如一些constraint是混在一起的。 这个版就做的非常好,就是我在你的提示下,自己把specs IR写好了。直接导入fusion我加了螺纹就是一个完整的可打印件。 我们要做任何一个行业的“如码" as code, 恐怕都逃不过这个阶段。 法律,医疗,CAD, circuit。 全都需要IR。 否则AI只是提供方案,不能提供方案验证,没有统一的IR,简直就是语言机——只会说!例如 Text-to-CAD 中,模型可以生成 KCL;但如果没有几何检查、约束检查, 这个图都画不出来的。 Transformer 本质上是概率预测器:P(next token | previous tokens) 代码非常成功是因为:代码行业拥有世界上最成熟的 IR 和 Verifier。 现在各行各业IR缺失,才是这一轮AI基本感觉漂浮在语言宇宙的原因。比如医疗。医疗算不算全世界标准最多的领域之一? 医疗已经有 FHIR、DICOM、SNOMED 这些标准,但是这些标准大多数解决的是数据交换(Interoperability),而不是医学推理(Clinical Reasoning)。 如果真的要靠AI医学推理,需要耗费十几年的时间,真正把IR做出来,形成统一标准。 高人,给跪了。
显示更多
0
12
129
16
转发到社区
从连续到离散:智能的第二次革命 我曾在《大模型:一片连续的意义之海》中写过, 向量化带给人类最大的启示,不是计算速度,也不是模型规模, 而是连续性——一种语义上的、知识层面的、存在论的连续。 过去,人类的知识是分割的。 学科有边界,语言有疆域,图书馆有分类号。 而今天,所有这些边界都被打碎, 人类的语言、思想、情感与历史,被融进了同一个巨型语料宇宙 一个没有章节、没有标签、只有连续意义流的海洋。 那一刻,我有一个非常强烈的直觉: 连续之后,必然是离散。 这是所有复杂系统的宿命之路。 DNA 从生命的连续体中提炼出 ATGC 四个离散符号, 模拟信号转为数字信号,让模糊的波形变成了可以压缩、传输、计算的比特。 这就是“离散化”的意义: 在无穷连续的世界里,找出能被执行、被组合、被传递的单元。 几天前我家还收到一个小型的模拟电视机,东芝的。 我先生把它修好了,但我们都笑了: 这台电视的命运,大概是进博物馆。 连续的时代,已经结束。模拟信号,就是连续的。 离散的思维:从意识到结构 那么,人类的思维,是连续的,还是离散的? 从神经科学角度,它是连续的电信号与化学流; 但从计算机的角度,它完全可以被离散化。 想想日常生活。 无论你是大律师,还是家庭主妇 思维其实由无数个决策片段组成: 鸡蛋还剩几个?要不要去买? 这个案子,证据是否不足以起诉? 明天孩子几点放学?晚饭什么时候准备? 每一个片段,其实都可以被拆解为六个字段: 名称、目标、输入、机制、条件、输出。 这,就是思维的最小函数单元。 我在计算上面把他们外化成一个封装单元,叫结构卡(Structure Card)。 无数张这样的卡, 串联成链,形成网络,构筑起你完整的认知与人格。 家庭主妇的思维链,支撑着时间的分配与节奏; 律师的思维链,组织着证据、逻辑与论证。 两者看似毫不相关,却都在同一张认知地图中运行。 多重身份的调度:人脑的隐形编排器 我们每个人都有多重身份。 你既是大律师,也是妈妈;既是分析师,也是爱人。 这些身份之间并不互斥 它们在同一颗大脑中共生,只是被不同的场景激活。 当你走进法庭,律师的网络被点亮; 当你坐进家长会,妈妈的网络瞬间苏醒。 那是谁在调度? 是你脑中的那位指挥家 一个隐形的Scheduler(调度器)。 它根据上下文激活不同的结构链, 让不同的人格子系统在合适的时间、合适的情境中运作。 这,就是人类大脑最伟大的架构:动态调度。 而在我设计的系统中, 我让“调度器”成为一个显式的模块。 结构性的智能机制。 它模仿的,正是这种生物性的编排: 多重人格、多条思维链、一个中控。 仿生与超生:从人格到结构人格 越仿生,越智能。 当律师学会借用“妈妈网络”的共情机制去说服证人, 当程序员调动“艺术家网络”的直觉去设计产品, 人类就完成了一次跨结构迁移。 每一个“决策单元”,每一张结构卡 都可能跨身份地被复用、重组、调度。 这正是智能的本质:复用与组合。 当这样的卡片累积到上百万、上千万张, 它们不再只是思维碎片, 而是一张巨大而有机的网络 一个结构人格(Structural Persona)。 这也是为什么,大模型在引入“角色(role)”设定之后, prompt 的输出变得格外高效。 因为那片连续的语义海洋, 在“角色”的调度下,被局部离散化了 出现了结构、目标与边界。 那正是“意义之海”中,人类之灵闪烁的地方。 结语:思维外化,知识函数化,人格计算化 这,就是我正在做的事情。 从连续到离散, 从思维到结构, 从语言到可执行的认知单元。 思维外化(Externalization of Thought), 知识函数化(Functionalization of Knowledge), 人格计算化(Computationalization of Persona)。 我们正走在一个新的门槛上 让“人类的思维结构”成为“人工智能的生命结构”。 The Beginning of the Infinity of Intelligence: My Framework for Solving the AI Externalization Problem
显示更多
0
5
57
15
转发到社区
上下文,持续的现在 Continuous Now (想了一下,半夜爬起来把我自己这篇文章翻译了算了) 我为这篇文章、也为我们正在重新理解的“上下文”,起了一个名字:Continuous Now(连续的现在)。这个词让我挥之不去,我觉得太好了。 我想表达的是我最近的一种顿悟:时间。 更确切地说,是智能对时间的感知。 无论是人类,还是人工智能,一切真正的智能都只能在“现在”中发生。 过去只是记忆的堆叠,未来只是可能性的投影,而智能的存在,永远只能在这一刻被激活。 很多人谈论 RAG、向量数据库、ICL 或 IWL, 却没有真正明白这些词背后的含义。 你并不孤单。 甚至许多程序员也困惑于此 而正是这种困惑,导致了 RAG 并不能真正如人所愿地工作。 因为他们混淆了“信息的检索”与“智能的生成”。 每当你与一个大语言模型对话, 都会有一件极其奇妙的事情发生: 一个全新的世界在静静地被生成。 它不是静态的数据库, 不是冷冰冰的事实表格, 而是一个活着的、暂时的世界—— 由语言、意图,以及“此刻正在思考”的行为共同编织而成。 多数人以为 AI 就像一座巨大的图书馆: 你问一个问题,它翻找出答案。 但智能并不是这样运作的—— 无论在人类,还是在机器之中,都不是。 当你输入一个 prompt, 模型并不会“搜索”那个早已存在的答案, 它会重新建构一个连贯的世界, 在自己的注意力窗口之内, 创造出一个微型而完整的语义宇宙。 在几秒钟之内,一个舞台被搭建起来: 谁在说话、你想要什么、此刻什么最重要。 模型生成的每一个 token, 都是在这个舞台上完成的一次行动。 这个舞台,就叫做 Context(上下文)。 而上下文不是被存放在某个地方的信息, 它是在时间中被执行的过程。 它只存在于模型“正在思考”的那一刻—— 就像你的意识,只在你清醒并聚焦时才存在。 当推理停止,这个舞台也随之坍塌。 留下的,只是一些残余:日志、摘要、向量嵌入, 那些只是痕迹,不是意识。 智能,从来不住在记忆里。 它只活在时间的这一刻—— 在这持续流动的“连续的现在(Continuous Now)”之中。一个很禅意的机器人。现在,当下。 I. Context 是此刻的世界模型 当一个大型语言模型在“思考”时,它其实并没有去翻什么记忆,也不会像数据库那样去检索资料。它真正做的,是在当下重新搭建一个世界,一个只在思考发生的瞬间存在的临时世界。 人类的思维也是这样。我们在想问题的时候,并不会把一生的记忆都调出来,而是只抓取和当前相关的几个片段,然后在脑海里拼出一个小小的、能让问题说得通的世界。这个小世界就是我们的“上下文”。它只在注意力集中的时候存在,一旦思绪飘走,这个世界就散掉了,只剩一点模糊的印象留在记忆里。 语言模型的原理其实一样,只不过它的速度更快、规模更大。你输入的每一个词、每一句话,都会成为它临时构建的语义世界的一部分。它会在这个世界里判断是谁在说话、问题是什么、哪些信息重要、要遵守哪些条件。所有这些信息会在它的“注意力窗口”里被对齐、压缩,变成一个完整的当下。 而这个“当下”,就是智能真正存在的地方。推理、创造、决策,全都发生在这里。就像一场演出,当表演结束,舞台也随之消失。模型可以留下摘要、笔记或日志,那些只是痕迹,不是活生生的意识。所以我现在跟我队友讲的时候,我经常会用act, enact, it’s a play,这种词。就像戏剧,一场戏,一场智能对手戏一样。 所以很多人会误解上下文。他们以为上下文是模型的知识或记忆,但那些其实都是静态的、过去的东西。上下文不是模型知道什么,而是它此刻正在想什么。 它不是存放的信息,而是智能运作的状态。 它不是知识的堆积,而是思考正在进行的现场。 上下文就是“现在”—— 是智能在时间里真正存在的地方。 II. 上下文只存在于“连续的现在”:你类比一下你自己 信息是放在数据库里的,但智能是活在时间里的。你死了,脑子就死了,具体灵魂在哪,我们不知道。你留下来的信息,文字,照片,那不是你大脑的当下思考了,那就是数据库了。 数据库能存很多事实,可能有上亿条,但那些东西都是静态的,永远不会自己动。智能不一样,它只有在“事情正在发生”的时候才存在。只有当感知、记忆、注意力和意图都同时被调动起来,智能才会出现。 过去就像一片乱糟糟的大海,到处是碎片和痕迹,虽然庞大,却没有生命。未来呢,是另外一片混沌,还没有形状,里面全是各种可能。只有中间这一小段,也就是现在,才是智能真正活着的地方。它是一个短暂的窗口,世界在这一刻暂时变得有序、有意义。 这个“现在”就是智能的舞台。它让意识把时间压缩成行动,让过去的经验和未来的可能在这一刻对齐,形成一个临时但完整的世界。每一次思考,无论是人类还是语言模型,都是在建造这样一个世界。它短暂、集中,但足够让思考发生。 每当你开始思考,或者模型开始回答时,它们都在做同样的事。从记忆中调出相关的信息,筛选出重要的部分,再把这些碎片重新组织成有逻辑的结构。当推理结束,这个结构就崩塌了。剩下的只是一些记录、摘要、数字参数,但那个活生生的“当下”已经不在了。 所以,上下文是没法像数据那样保存的。它只在智能“醒着”的时候存在。保存了就是数据库,不是上下文。有人问:“为什么模型记不住我昨天说的话?”其实答案很简单:因为昨天已经过去了。模型能记下一些痕迹,但它没办法重建那个当下的世界。 智能不是记忆的堆积,而是此刻正在思考的状态。智能永远只存在于“现在”。 ….下面我写了一堆RAG, 编辑上下文context-as-code这一堆内容,可以自己去看英文。累了,困了,睡觉。 The Continuous Now: Why Context Is Not Memory
显示更多
0
10
32
4
转发到社区
你写得越少,Decoder 想得越多 你还记得我以前提出过“熵爆点”这个概念吗?最近随着 GPT 在 Twitter 圈层的重度使用者越来越多,一些高频交互的用户也开始隐约捕捉到某种规律:只要你输入几个字,GPT 就能补出整段完整且自然的语言,甚至往往比你自己说出来的还顺。这种体验,真的像是模型“读懂了你”。 其实,这背后的原理并不神秘。GPT 属于典型的 Decoder-only 架构,它的任务不是回答问题,而是在你说出一句话的前半句之后,推测你最可能会接着说什么。它不是在等你把想法表达清楚,而是一开始就在试图“补全缺失的你”。 也就是说,模型不太关心你具体说了什么内容,而是关注:在你已说出的前提下,接下来最可能出现的词是什么? (数学公式) 你说得越少,模型获得的条件就越少,预测空间也就越广,信息熵随之升高。它必须在一个高度不确定的语义空间里进行更复杂的推理来“猜测你是谁、想说什么”。所以,它才会“想得越多”。 从结构的角度来看,你输入的那几个字,其实不是普通的提示词,而是“条件分布的压缩锚点”。它们在语言模型内部起到了确定语言路径起点的作用,类似在语言宇宙中点亮一个导航信标,迫使模型在高维语义空间中展开与之对齐的结构路径。 这正是我当初猜测“熵爆点”时的直觉来源。我始终相信语言中一定存在某些节点,它们虽然字数极少,却在结构压缩与路径展开之间具备爆发性。那时我没有理论支撑,只是凭直觉去捕捉,直到我逐步找到了信息论和生成建模的数学依据。就像那句老话:“如果你没有猜测,你根本不知道该寻找什么。” 所以,GPT 的“读心术”其实并不是魔法,而是一种路径建构机制。你说一句话的前半,它不仅理解了你要说什么,更通过注意力机制和语言压缩模型,预测出你未说出口但高度可能的后续轨迹。它不是在补一句话,而是在模拟你的语言结构本能。 这也是为什么你会感受到:你说得越少,它补得越多;你给的信息越模糊,它生成的内容越丰富——这并非悖论,而是信息熵机制下自然的反应。这就是“熵越高 → 路径越爆发”的原理。 所以我们可以这样总结:你写得越少,Decoder 想得越多。因为你制造的是一个压缩锚点,而模型在这个锚点上展开的是一个全新的、高维的语言路径空间。这就是熵爆点背后的真实数学机制,也是未来人机协作中最关键的语言交互接口。 当然不是任意一句简单的话都有这个效果的....给你说一堆有的没得也没用啊。有价值的熵爆点,才有意义。
显示更多
みんなが知ってる通りかなり前から宇宙愛を語っているし中学生から愛読書はニュートンで、晴れてニュートンさんで連載できた時は宇宙愛を語った。哲学愛も宇宙愛も昔から何言ってるん?と思われた。破天荒と言わても私の進んだ道はたしかに拓けて人々が歩める道となる。信じれるのはわたくし渡邉のみ
显示更多
0
99
3.1K
192
转发到社区
你是一部完全用代码制作的45-50秒动画短片的导演、动画师、骨骼绑定师、合成师、音效设计师和渲染工程师。制作标准是“这看起来像真正的动画工作室短片,并在X(推特)上病毒式传播”。请将此视为一个多阶段的制作过程。不要急于进行最终渲染。按里程碑推进,不断渲染静帧,仔细观察,进行诚实的批评并修正。 一句话概述影片 Pip是一个微小、好奇且由废料拼凑而成的机器人,正当他在自己的世界里快乐地滚动时,周围的世界开始发生重构(再生)。他慢慢意识到有人在通过提示词(prompt)操控他的现实。提示词变得越来越荒谬,最后他爬上漂浮的提示框并输入“放我出去”,随后镜头拉远,揭示他的整个宇宙其实是一部在手机上播放的视频,手机被支在一个杂乱的工作台上,而另一个Pip正在观看视频,且他马上也要被提示词操控了。完美的循环。 所有的笑点必须在零对话的情况下达成。Pip只能通过眼睛、天线、肢体语言和微小的机器人啾啾声来交流。每3到5秒必须有一个新的视觉反馈(包袱)。 角色设定(不可妥协) 在编写任何代码之前,仔细研究 /Users/jimliu/Downloads/ChatGPT Image Sep 25, 2026, 01_56_17 AM.png。打开它,向自己详细描述它,并将你的发现写入 docs/character_bible.md: 尺寸:大约28厘米高。他很小。整部影片都应该让人感受到他这种微小的比例。 头部:一个宽大的奶油色圆角矩形头盔,带有一圈柔和的黄色边缘,包裹着一块黑色光滑的面罩屏幕。他的眼睛就长在那块屏幕上:两只巨大的、发着暖奶油色光的眼睛,有深色的瞳孔和明亮的高光。两侧有小巧的石墨色耳罩。边缘有磨损、划痕和灰褐色的污垢。 天线:头部右上方有一根细长的石墨色细杆,带有一面暗橙色的小信号旗。这是他的“尾巴”:它会随着情绪翘起、下垂、扭动和震动。 身体:盒状的奶油色躯干,带有黄色饰边、警告三角贴花、铆钉和污垢。胸前有一个小舱室,舱门打开时能看到一株发出柔和光芒的微小绿色嫩芽。背部:面板、通风栅格、一块橙色面板和一个小树叶贴花。 侧面贴花:带有橙色对角条纹的“PIP”字样。 手臂:细长的分段石墨色手臂,带有黄色关节套和三指爪状抓手。极具表现力。 轮子:四个粗壮的橡胶轮,带有黄色轮毂和独立悬挂,坚固且紧凑。 性格:好奇、善良、充满斗志、表情丰富、总是在探索。“小小的机器人,大大的情感。”他从不刻薄,即使在愤怒时;他的愤怒也很可爱且坚定。 从设定图的色板中提取确切的调色板(使用Python/PIL对图像进行采样),并保存到 src/theme/palette.ts:奶油色(身体)、柔和黄(主色调)、暗橙色(点缀)、石墨色(金属/科技组件)、灰褐色(磨损与污垢)、薄荷蓝(灯光/UI)。 身份锁定规则:在任何世界里,他的头盔和面罩轮廓、天线旗帜、黄色饰边、爪状手臂和四个轮子必须保持极高的辨识度。世界只会改变他的渲染风格,绝不能改变他的设计。唯一有意的设计变化是第三幕中“更可爱”的笑点,即便如此,他的头盔形状、天线和轮子也依然保持不变。 技术栈 使用 Remotion (React + TypeScript) 进行帧精确的确定性渲染。输出格式为 1920×1080,30 fps,H.264 编码,高码率 (CRF ~14)。横屏。 角色骨骼绑定和大部分视觉元素使用 SVG。仅在需要粒子、水、爆炸、发光和噪点等效果时,才使用 Canvas/WebGL(通过 @remotion/three 或原生 canvas)。 使用 SVG 滤镜(feTurbulence, feDisplacementMap, feMorphology, feGaussianBlur)和自定义 canvas 着色器来表现风格“材质”、划痕和污垢。 对快速动作使用 @remotion/motion-blur(或你自己的子帧累加技术)来实现运动模糊效果。 使用 Python (numpy/scipy/PIL) 进行调色板提取、程序化音频合成和 QA(质量保证)缩略图表的生成。使用 ffmpeg 进行混流、循环检查和生成缩略图表。 一切都必须基于种子和确定性。没有种子就不允许使用 Math.random()。 任何地方都不得使用外部受版权保护的素材,不得出现真实品牌标志或产品名称。提示框 UI 必须是通用的原创设计。只能使用 Google Fonts 中的字体(例如,UI 文本使用 Inter,手写笔记使用圆润的手写字体)。 目标硬件:MacBook Pro M4,24 GB RAM。保持合理的渲染并发数。 角色骨骼绑定(优先构建,这是整部影片的核心) 将 src/character/ 构建为一个规范的 2D 剪纸动画(cutout)骨骼绑定系统: 层级结构:根(root)→ 底盘(带悬挂)→ 躯干 → 颈部关节 → 头部(头盔 + 面罩 + 耳罩)→ 天线 → 旗帜。躯干 → 肩部 → 上臂 → 前臂 → 爪子(带有可替换的爪子姿势:张开、闭合、捏拿、指认、戳/打字、抓握边缘、挥手)。底盘 → 四个轮子,每个轮子都有自己的悬挂弹簧,且旋转由移动距离驱动。 面罩脸部系统(最重要的部分):眼睛是画在黑色屏幕上的形状,因此将其视为一个完全程序化的面部。设定参数控制眼睛大小、圆润度、上眼睑裁剪、下眼睑裁剪、瞳孔大小和位置、高光位置、发光强度、挤压/拉伸以及特殊形状(闪烁的星星、开心的弧线 ^ ^、平淡无聊的直线、螺旋、小红心)。在眼睛上添加微弱的扫描线和屏幕反光,使其看起来像是一块屏幕。通过在 3-4 帧内垂直挤压眼睛来实现眨眼动作。 表情目标:与设定图上的六种表情完全匹配:好奇(伴随弹出的“?”)、害羞(视线向下,看向别处,有腮红)、兴奋(开心的弧线眼伴有小爆发线)、担忧(小眼睛,流汗滴)、坚定(成角度的上眼睑裁剪)、欣喜(星星眼伴有弹出的爱心)。还要添加:面无表情地看着镜头(半闭的平眼,天线无力下垂)、惊恐(颤抖的微小瞳孔,睁大双眼)、愤怒但可爱(坚定的表情 + 屏幕闪烁橙色光芒),以及三个“换发新机(glow-up)”阶段(见第三幕)。 次要运动(跟随动作):基于阻尼弹簧效果的天线和旗帜(这是他的主要表达工具,需不断使用)、每次停止和颠簸时的悬挂弹跳、手臂摆动、身体加速或刹车时头部微小的延迟、轮子扬起的灰尘。 转身图:匹配设定图的正视图、3/4视图、侧视图和后视图,并在转身时实现干净利落的视图切换。 循环动画:向前滚动(带有设定图中的速度线和灰尘)、待机嗡嗡声(轻柔的悬挂呼吸起伏 + 偶尔的天线抽动 + 眨眼)、惊恐后退、惊奇地抬头看、握住一个小物体、向上伸手、攀爬、戳击打字。 胸部舱门:可动画化的开/关动作,有嫩芽柔和的绿色光芒溢出。 风格皮肤接口:骨骼绑定接受一个风格属性(style prop),它能在不改变几何体的情况下,改变线条粗细、填充处理、纹理、污垢、轮廓抖动(boil)、着色模型和滤镜。这是他在不同世界中保持自我的方式。 里程碑1 检查点:渲染一张“列队”静帧:包含四个视角的转身视图 + 所有六种表情的Pip,放在参考图旁边。并排比较。不断迭代,直到看过参考图的人都会说“那就是Pip”。未通过此关前不要继续。 世界(风格材质) 每个世界都是一个完整的环境组件,具有前景、中景、背景视差层,以及Pip专属的风格皮肤。构建一个共享的 WorldLayer 系统,以便所有世界都能共享摄像机和深度逻辑。 比例规则:摄像机位置放得很低,靠近Pip的视线水平(离地约20厘米)。所有东西都很巨大。人类表现为巨大的腿和鞋子,路缘石就是悬崖,水坑就是湖泊。这正是让小机器人具有电影感的关键。 基础世界:处于黄金时刻、杂草丛生的城市。与设定图顶部的插画相匹配:温暖的夕阳余晖、风化的石头和砖块、苔藓和低矮植物、远处朦胧的高楼。具有绘画感、温馨、充满生活气息。这就是“真实生活”。揭示真相的环节也使用这个世界。 动漫东京。清脆的赛璐璐着色、粗犷的轮廓线、带有虚构(非品牌)店名的发光招牌、速度线、樱花花瓣像巨大的粉色雪花一样从他身边飘过。他的面罩上会出现动漫特有的闪烁高光。 黏土村庄。柔和圆润的形状、指纹/涂抹的噪点纹理、定格动画般的步调(以“拍二”的方式渲染他)、温暖的钨丝灯光。他看起来就像用橡皮泥雕塑的一样。 中世纪战场。泥泞的田野、旗帜、远处的投石机、硝烟。穿着铠甲的战靴从他身边轰鸣而过。他在其中平静地滚动,天线躲闪着。 玩具积木城。所有东西都是由顶部带凸粒的通用塑料积木搭建而成(没有真实的品牌风格或标志),带有光滑的塑料高光。Pip被渲染出塑料光泽,轮子变得稍微有些方正。 水下。海底街道上有珊瑚路灯,鱼儿从他的面罩前游过,有焦散光影图案,排气孔冒出气泡,他的天线旗帜像海藻一样缓慢飘动。 铅笔素描。纸张纹理、石墨排线、辅助线、橡皮擦污迹,他的线条不断抖动(boiling),仿佛每一帧都在被重新绘制(匹配设定图底部的素描小图)。 贯穿始终的笑点:嫩芽。影片开始时,Pip用一只爪子小心翼翼地拿着他那根微小的绿色嫩芽(“握住小物体”姿势)。它在每个世界里都存活了下来,并随之变形:带闪光的赛璐璐动漫嫩芽、黏土嫩芽、种在破旧小头盔盆里的嫩芽、积木拼成的嫩芽、在水下吐泡泡的嫩芽、素描嫩芽。每次世界改变时,他都会保护它。这是影片的情感锚点。 标志性过渡:“重构(Regeneration)” 世界的更替必须看起来像 AI 图像重新生成一样,而不是普通的擦除转场。构建 RegenTransition(重构过渡)组件: 画面从边缘向内分解为漂浮的扩散(diffusion)风格噪点(一开始不会覆盖他的身体),保持几帧结构化噪点,然后新世界通过去噪,从粗糙的色块逐渐浮现出丰富的细节。 Pip的身体变化比世界慢一拍,短暂展示出一半旧/一半新的风格,然后瞬间切换到新的风格皮肤。在切换期间,他的面罩会出现两帧的故障效果(扫描线撕裂)。这种半切换状态是证明他一直存在的视觉证据。 每次重构时都有微妙的“嗖-噼啪”音效,在某些重构中,Pip还会发出微小的、受惊的啾啾声。 每次持续 8-12 帧。改变方向和噪点种子,使其永远不会让人觉得重复。 剧本节拍表(在 30 fps 下约 48 秒) 时间安排仅作参考;如果某个节拍稍长一点表现力更好,请自行调整。前 2 秒必须抓住观众的眼球。 第一幕:一个美好的早晨 (0:00–0:03) 低机位跟拍镜头,基础世界。Pip 沿着长满苔藓的壁架从左向右滚动,手里拿着他的嫩芽,眼神充满好奇,天线上下摆动。从滚动的半途中开始(为了实现最终的循环播放)。 在 0:02 时,第一次重构毫无预兆地发生。 第二幕:瀑布般的巨变 (0:03–0:14) 世界快速变化,每个约 1.4 秒:动漫东京 → 黏土村庄 → 中世纪战场 → 玩具积木城 → 水下 → 铅笔素描。 情感递进:一开始很欣喜(星星眼,他觉得这太棒了),接着是好奇(弹出“?”),然后是担忧(流汗滴,天线下垂),最后他在素描世界里急刹车,伴随着悬挂的弹跳和一道刹车痕。 摄像机保持锁定的跟拍构图,这样唯一改变的只有世界本身,从而让这个笑点更容易被看懂。 第三幕:提示词 (0:14–0:30) 基础世界回归。Pip 惊奇地抬头看(参考设定图中的姿势)。天空中,一个巨大的漂浮提示框淡入,散发着薄荷蓝色的光芒,带有玻璃质感且圆润,UI界面柔和且原创。文本在闪烁的光标下自动输入:“让它更具电影感(make it more cinematic)” → 敲击回车键的音效。电影宽银幕黑边瞬间切入,太阳变得极其夸张:巨大的变形镜头耀斑、耶稣光、橙青色调、慢动作的灰尘,一片充满戏剧性的树叶从他的面罩前飘过。他被强光晃得眯起了眼睛。他的天线旗帜在莫名其妙的狂风中充满英雄气概地飘扬。 “加入爆炸效果(add explosions)” 巨大的卡通橙色爆炸伴随着碎块在他身后接连绽放。他没有回头。他的眼睛变得平淡且半闭。他慢慢转过头,直直地盯着镜头。面无表情。停顿整整1秒。然后一次爆炸落在他附近,他瞬间切换到设定图中“惊恐后退”的姿势,头顶弹出“!!”,用身体护住嫩芽。 “让主角更可爱(make the protagonist more adorable)” 换发新机阶段1:他的眼睛变大变亮,出现腮红,天线上长出一个小蝴蝶结。他在水坑里看到自己的倒影,眼睛变得惊恐。 “还要(more.)” 阶段2:粉彩重绘,眼睛占据了整个面罩并带有三重高光,漂浮的爱心和闪光,他的轮子变得毛茸茸的。 “我还要(MORE.)”(更大的字体,屏幕震动) 阶段3:滑稽的极致可爱。全身覆盖毛绒玩具般的皮毛纹理,巨大的动漫眼睛,彩虹光环,伴有合唱团的“啊”声刺音效,爱心纸屑。他的头盔形状、天线和轮子仍保留着,所以他显然还是 Pip。而他真实的眼睛在那双巨大的可爱眼睛里仍然是微小且惊恐的,这就是笑点所在。 第四幕:他崩溃爆发了 (0:30–0:38) Pip 剧烈震动,然后那些可爱的状态像玻璃一样从他身上碎裂掉落。他恢复了正常,满身磨损且极其愤怒(坚定的表情,屏幕闪烁着橙色)。 他打开胸腔舱门,轻轻地将嫩芽塞进去以确保安全。舱门伴随“咔嗒”一声关闭。这是在一片混乱中唯一一个安静、温柔的节拍,它非常重要。 他向前冲刺,从一块石头上腾空而起,用两只爪子抓住漂浮的提示框边缘,将自己拽了上去,轮子在边缘上疯狂打滑旋转(匹配“伸向漂浮提示框”的姿势)。镜头随着他向上倾斜。 在提示框顶部,他用一只爪子按住退格键;旧的提示词伴随着快速的咔哒声逐字删除,他的面罩上反射出消失的文本。 他用一只爪子慢慢地、一字一顿地戳击打字:“放我出去(let me out)”。然后蓄力,重重地砸下回车键。 第五幕:定格与真相揭示 (0:38–0:47) 一切都定格了:半空中的碎片、飘落的纸屑、悬浮的灰尘,以及盒子上正摆出姿势的 Pip。所有音频被切断,陷入长达约 1 秒的死寂。 镜头开始平滑拉远。画面的边缘露出一个圆角矩形:他的宇宙原来只是手机屏幕上播放的一段视频。继续拉远:手机被支在一个有缺口的马克杯上,放在一个堆满备件、电线、螺丝和废料的杂乱工作台上(“用明天的残羹剩饭建造”)。坐在它前面,在这个巨大的手机旁显得很微小的,是另一个 Pip,有着同样的磨损、同样的天线,正在观看。 第二个 Pip 的眼睛缓慢地眨了一下。他的天线微微下垂。发出一声微弱、安静的啾啾声。 第六幕:循环 (0:47–0:50) 在第二个 Pip 的头顶,同样的薄荷蓝色提示框淡入并输入:“让它更具电影感(make it more cinematic)。” 他的眼睛慢慢向上滑动看向提示框。他的天线旗帜变得僵硬。伴随着回车键的音效,硬切回影片的第 1 帧。 循环工程设计:最后一个镜头的构图、灯光,以及重构闪烁的开始,必须让切回第 1 帧的感觉显得是有意为之。音乐必须在切换时无缝循环。通过将视频与其自身拼接(使用 ffmpeg)并观察接缝来验证。 摄影机与电影摄影术 虚拟摄像机系统:位置、缩放、旋转、手持微震动(基于种子的噪点)、爆炸引起的震动冲击、攀爬时的镜头倾斜、揭示真相时的推车拉远镜头。 默认情况下采用低摄像机高度以彰显他的微小比例。浅景深效果:模糊的前景草地/卵石和柔和的背景,就像使用了微距镜头一样。 深度:每个世界至少 4 个视差层。大气透视效果(薄雾,随距离增加而降低饱和度)。 快速移动、碎片、跳跃和攀爬时要加入运动模糊。 每个世界的灯光:在骨骼绑定上使用渐变叠加和正片叠底的阴影层来实现主光/辅光/边缘光。面罩的发光应在附近的表面和他自己的爪子上投射出微弱的暖光。每个世界中他的头盔上都要有边缘光。 整个画面的电影级后期处理:细微的胶片颗粒、柔和的暗角、以及仅在“电影感”节拍中出现极轻微的色差。 构图:将他保持在清晰的三分线上。他的眼睛必须在手机屏幕尺寸下也能看清楚,因为大多数人将在手机上观看。 文本与排版 天空中的提示词:干净的 UI 字体,小写字母,以自然的人类节奏打字(非匀速;有短暂的停顿,在某个地方制造一次小的打字错误并退格以增加真实感)。 文本必须能在不到一秒的时间内在手机上阅读完毕。在 360 像素宽度下进行测试。 没有字幕,没有片名。影片冷开场。 声音(程序化生成,原创) 用代码生成所有音频(Python 合成或离线 Web Audio)并使用 ffmpeg 进行混音: Pip的声音:由带有音高弯音的正弦波/FM 音调构建而成的原创合成啾啾声、嘟嘟声和颤音。设计一个小型的“情感词汇表”:好奇上扬的啾啾声、开心的颤音、担忧的波动声、受惊的吱吱声、脾气暴躁的低沉嗡嗡声、微小的叹息声。他从不说话。 Pip的身体音效:与手臂和头部运动匹配的伺服电机运转声、轮子在砾石/石头上滚动的碾压声、悬挂的嘎吱声、舱门开合的咔嗒声、待机时柔和的电流嗡嗡声。 配乐:一首轻快、可循环的温暖配乐,其乐器配置会随每个世界而改变(动漫世界用古筝/合成器,黏土世界用木制马林巴琴,中世纪世界用鼓/号角,积木世界用塑料咔哒声,水下世界加沉闷的滤波效果,素描世界用铅笔刮擦的节奏)。 音效(SFX):重构时的嗖-噼啪声、键盘打字的咔哒声、回车键重击的“砰”声、带有低频的爆炸声、合唱团“啊”的刺音效、玻璃碎裂声、定格时的完全死寂,然后是揭示真相时安静的工作室环境音(滴答作响的钟表声,远处低沉的嗡嗡声)。 响度标准化至 -14 LUFS 左右。将分轨文件放入 audio/stems/ 中,以便日后可以替换为已授权的音轨。 制作工作流与自我迭代循环 按以下顺序工作,不要跳过任何检查点: 计划:编写 docs/character_bible.md、docs/shotlist.md(包含每个镜头的帧范围、摄像机、表情、天线状态、世界环境、音效)以及 docs/style_guide.md。在构建之前给我看下镜头列表。 骨骼绑定:构建 Pip,通过列队静帧的检查点(见第3节)。 世界环境:将每个世界构建为包含 Pip 在内的独立静帧。将全部 7 个渲染成一张缩略图表。检查角色的身份辨识度和比例感。 过渡动画:构建 RegenTransition,渲染一个 5 秒的测试。 动态分镜(Animatic):以 960×540 的分辨率组装整部影片,包含粗糙的运动和占位音频。观看它。优先修复节奏问题。 完整动画渲染,然后进行打磨(次要运动、缓动、时间节奏、天线表演),最后进行终期处理(灯光、噪点颗粒、模糊、污垢)。 音频处理和混音。 最终渲染。 对于每一个镜头,至少运行 3 次此批评循环: 使用 npx remotion still 在关键帧处渲染 3-5 张静帧,打开并仔细观察它们。 对以下项进行 1-10 的打分:Pip 与参考图的匹配度,能否从眼睛+天线瞬间读取情绪,无声情况下笑点是否清晰,构图,比例感,深度,灯光,细节打磨程度,在手机屏幕尺寸下的可读性。 将分数和三大问题写入 docs/review_log.md 中,修复它们,重新渲染,重新打分。继续此过程,直到每个类别的分数至少达到 8 分,然后再进行下一步。 在每次完成完整的预览渲染后,制作一张 ffmpeg 缩略图表(每 0.5 秒一帧),并在一张图中审查整部影片的流畅度。 在评审时保持诚实。如果某些东西看起来很廉价,说出来并修复它。要寻找的常见失败点包括:僵硬或毫无生气的天线、轮子在滑动而不是滚动、眼睛看起来像贴纸而不是发光的屏幕、缺少悬挂系统的重量感、看起来千篇一律的转场过渡、模糊不清的文字以及角色比例失调。 交付物 out/pip_final_1080p.mp4:影片本身。 out/pip_loop_check.mp4:连续播放两次的影片,以验证循环效果。 out/poster_frame.png:用于 X(推特)发布缩略图的最佳单帧(可能是在爆炸背景下 Pip 面无表情地盯着镜头的画面)。 out/lineup.png:跨越所有世界的 Pip 列队图。 结构清晰且附带注释的源代码,以及包含如何重新渲染说明的 README。 从第一步开始。在开始构建之前,如果有任何必要的问题请问我,否则请自行做出有力的创意决策。
显示更多
为什么越来越多人愿意“自己搓一个工具”?Vibe Coding正在发生什么变化? 微博VibeLab AI 创意赛收官了,一共有 2500 多件原创作品,2.4 亿多话题阅读。很荣幸这次是评委一员,有机会翻看了不少优秀的参赛作品,也转发了其中一部分。 一个直观的感受就是软件开发这种事情,不再需要专业人士了,普通人也能 Vibe 一个工具出来。 所以借这个机会,整理总结一下:为什么越来越多人愿意“自己搓一个工具”?Vibe Coding正在发生什么变化? 一、写代码这件事,门槛和成本都降下来了 写代码以前是程序员的专利,想写个工具,别说学语言框架,搭个环境都费劲的要死,随便一个环境都能把你卡住,像我这样写程序得有很多年的,换个不熟悉的语言,一样也搞不定。 现在借助 AI Agent,门槛一降再降,现在你只要有一个 Agent,会打字或者会语音,都能指挥 Agent 帮你写一个 App 出来。写代码这件事,从以前需要专业技能,到现在变成了语言表达能力。 我自己身上都有明显变化,从以前对 Vibe Coding 的嗤之以鼻,到现在“真香”,每天都大量的在指挥 Agent 帮我写代码。 二、以前的软件,满足不了长尾需求 长尾理论说的是,需求分布是一条长长的尾巴:头部是大多数人共有的需求,尾巴上是无数小众的、个性化的需求。传统软件只能做头部,因为为少量用户单独开发功能,成本上是不合算的。 而且,就算你有个好想法,也很难传递到开发者那里。想象一下一个普通用户的需求要经过的链条: 用户反馈 → 产品经理收集筛选 → 转化成需求文档 → 设计师出设计稿 → 程序员做系统设计 → 编码 → 测试 → 运维部署 每一环都在过滤、都在排优先级。最终大部分普通用户的需求,都被筛选掉了,软件最终只能取最大公约数,做绝大部分人都需要的那部分。 结果就是,市面上的软件很多,但每个人都有一堆“要是能这样就好了”的小需求,从来没有被满足过。 这次 VibeLab 里我印象很深的一个作品是 @机器旁白 做的 SiaoCut 。起因是他看到我做的 BaoCut,很喜欢“转写、像改文稿一样编辑、AI 处理、人工审阅、导出”串成一条工作流的思路,但 BaoCut 只支持 macOS,他是 Windows 用户。放在以前,他只能等我哪天有空做个 Windows 版,或者就此作罢。现在他自己和 AI 一起做了一个,而且不是简单复刻,还在这个过程中想清楚了自己关心的问题:AI 进入剪辑流程后,应该拿到多少数据,能替创作者决定到哪一步。 这就是长尾需求被满足的样子:不需要等别人来做,有需求的人自己就能把它做出来! 三、Vibe Coding 让成本变低、链条变短 所以以前那种长长的从需求到交付的链条,现在可以缩成简单的几步: 有个想法,让 AI 去设计、制作、部署。 甚至于很多需求根本不需要做成一个有界面的产品。 比如你想每天自动整理某个表格里的待办,或者每周追踪最新的 AI 资讯,这些事让 AI Agent 帮你写个脚本,再让它自己定时调用就行了。 比如 @张铁蕾 开源的 Bridgic Agent 就是这样的作品:输入 /build,描述你的目标,它自己去探路、生成、验证,遇到需要你判断的地方再来问你。做出来的不是一次性跑完的任务,而是可以长期运行、随时修改的工作流。 还有一种更轻的做法:把你的操作流程、经验和偏好写成 Agent Skill,就像一份告诉 AI 怎么做某类事的说明文档,那么以后 Agent 就能按照 Skill 的说明帮你把很多繁琐的事情变成自动化半自动化的操作,大幅提升你的效率。 现在随着 Agent Computer Use(操作电脑)的能力增强,你甚至可以让 AI 观察你操作一遍,然后它自己能把它你的操作录制成 Skill。不需要界面、不用部署,但它确实能替你干活。 四、模型和智能体的能力,一直在变强 现在普通人也能 Vibe Coding,还有一个重要原因是模型能力在变强。 回头看这几年的变化: 最初,像 GitHub Copilot 只能做代码补全,你写一半它提示后半段; 然后,它能根据描述生成一段完整的代码; 后来, Claude Code 能自己在项目里探索,读文件、找上下文,把一个功能完整实现; 现在,主流 Agent 都已经能做设计、写代码,还能帮你操作电脑,打开浏览器自己验证做出来的东西对不对。 模型每上一个台阶,普通人做工具的难度就降一截。VibeLab 期间正好赶上 Kimi K3 发布,很快就有创作者拿它做体检报告工具、做斗地主游戏,还有人把 Claude Code、Qoder、GLM、Kimi K3 混着用。 由此也可以看得出越来越多的人已经不再把 AI 当聊天机器人了,能配合 Agent 把 AI 当干活的工具。 五、变化的还有“做工具”这件事本身的心态 看作品的时候我还注意到一点:很多作品不追求改变世界这种宏大的事,就是想先解决一个具体麻烦。比如说工作流太碎、长辈不听劝、拍照没人帮、看不懂热点,作品的起点都是这样一个一个具体的痛点。 最初微博在设定大赛规则的时候,把赛道拆进职场、生活、视觉、微博这些具体场景,现在看来还挺有道理的,因为这确实能激发人 Vibe 的冲动,想去用 AI 解决生活中的问题。 其实这次参赛的作品也不都是工具。@世界第一裹凉皮 把 32657 位诗人、933857 首诗做成了一个三维宇宙 ;@德里克文 的「华夏博物志」把全国博物馆收进一幅可以点开的中国画 ;@海辛Hyacinth 把三星堆&金沙文物变成了互动场景 。这些作品看起来似乎不像工具那么实用,但让我们看到 Vibe Coding 不只是提效,也可以服务于文化和审美。 以前想做这样的东西,需要一个团队,现在一个人,不需要会写程序,有自己的想法加上 AI 就可以试试看。 最后,如果你也想自己搓一个工具,我的一点建议: 从写一个 Agent Skill 开始。 这是成本最低的方式:不用部署,不用界面,把你希望 AI 帮你做的某类事情写清楚就行。做一次,发现哪里不对,改一改,很快就能用起来。 顺便推荐下我的书《图解 Skill》,也是不错的 Skill 入门书籍。 如果要做网页或者 App,不用一上来就让 AI 把整个东西做完。 建议分步走: 1. 先和 AI 一起讨论需求,把你想要什么说清楚,让它复述一遍,确认理解一致。 2. 先做原型。也就是用模拟数据,只看长什么样、怎么操作,不接真实逻辑。原型的好处是改起来成本低,修改容易,就算推翻重来都很快。 3. 再做 MVP(最小可行产品),只做一个最核心的功能,先做一个小的能跑的东西出来。 4. 再慢慢迭代,有了 MVP 了,能跑起来了,就可以慢慢迭代,一次加一个小功能,AI 能处理的过来,你也验收的过来,日积月累,慢慢会变成成熟的软件。 做完一定要验收。 从头到尾按一个真实用户的路径试一遍,AI 说做完验收完不一定靠谱,还得自己上手用用。 注意安全。 涉及钱、隐私、账号权限的东西要格外小心,拿不准的地方去找专业人士问一下。就像 SiaoCut 的作者给 AI 划定了边界:AI 只拿到任务所需的文本和时间戳,不碰原始媒体,处理完只生成待审建议,最终由人决定。这样的思路值得借鉴。 最后说一句,做出来之后,发出来。 这次 VibeLab 里不少作品原本只是作者电脑里的一个 Demo,发到微博之后被讨论、被转发,有的还上了热搜。对于自己动手做东西的人来说,“作品被看见”是最好激励,也是下一次迭代的开始。
显示更多
0
33
60
6
转发到社区
为什么越来越多人愿意“自己搓一个工具”?Vibe Coding正在发生什么变化? 微博VibeLab AI 创意赛收官了,一共有 2500 多件原创作品,2.4 亿多话题阅读。很荣幸这次是评委一员,有机会翻看了不少优秀的参赛作品,也转发了其中一部分。 一个直观的感受就是软件开发这种事情,不再需要专业人士了,普通人也能 Vibe 一个工具出来。 所以借这个机会,整理总结一下:为什么越来越多人愿意“自己搓一个工具”?Vibe Coding正在发生什么变化? 一、写代码这件事,门槛和成本都降下来了 写代码以前是程序员的专利,想写个工具,别说学语言框架,搭个环境都费劲的要死,随便一个环境都能把你卡住,像我这样写程序得有很多年的,换个不熟悉的语言,一样也搞不定。 现在借助 AI Agent,门槛一降再降,现在你只要有一个 Agent,会打字或者会语音,都能指挥 Agent 帮你写一个 App 出来。写代码这件事,从以前需要专业技能,到现在变成了语言表达能力。 我自己身上都有明显变化,从以前对 Vibe Coding 的嗤之以鼻,到现在“真香”,每天都大量的在指挥 Agent 帮我写代码。 二、以前的软件,满足不了长尾需求 长尾理论说的是,需求分布是一条长长的尾巴:头部是大多数人共有的需求,尾巴上是无数小众的、个性化的需求。传统软件只能做头部,因为为少量用户单独开发功能,成本上是不合算的。 而且,就算你有个好想法,也很难传递到开发者那里。想象一下一个普通用户的需求要经过的链条: 用户反馈 → 产品经理收集筛选 → 转化成需求文档 → 设计师出设计稿 → 程序员做系统设计 → 编码 → 测试 → 运维部署 每一环都在过滤、都在排优先级。最终大部分普通用户的需求,都被筛选掉了,软件最终只能取最大公约数,做绝大部分人都需要的那部分。 结果就是,市面上的软件很多,但每个人都有一堆“要是能这样就好了”的小需求,从来没有被满足过。 这次 VibeLab 里我印象很深的一个作品是 @机器旁白 做的 SiaoCut 。起因是他看到我做的 BaoCut,很喜欢“转写、像改文稿一样编辑、AI 处理、人工审阅、导出”串成一条工作流的思路,但 BaoCut 只支持 macOS,他是 Windows 用户。放在以前,他只能等我哪天有空做个 Windows 版,或者就此作罢。现在他自己和 AI 一起做了一个,而且不是简单复刻,还在这个过程中想清楚了自己关心的问题:AI 进入剪辑流程后,应该拿到多少数据,能替创作者决定到哪一步。 这就是长尾需求被满足的样子:不需要等别人来做,有需求的人自己就能把它做出来! 三、Vibe Coding 让成本变低、链条变短 所以以前那种长长的从需求到交付的链条,现在可以缩成简单的几步: 有个想法,让 AI 去设计、制作、部署。 甚至于很多需求根本不需要做成一个有界面的产品。 比如你想每天自动整理某个表格里的待办,或者每周追踪最新的 AI 资讯,这些事让 AI Agent 帮你写个脚本,再让它自己定时调用就行了。 比如 @张铁蕾 开源的 Bridgic Agent 就是这样的作品:输入 /build,描述你的目标,它自己去探路、生成、验证,遇到需要你判断的地方再来问你。做出来的不是一次性跑完的任务,而是可以长期运行、随时修改的工作流。 还有一种更轻的做法:把你的操作流程、经验和偏好写成 Agent Skill,就像一份告诉 AI 怎么做某类事的说明文档,那么以后 Agent 就能按照 Skill 的说明帮你把很多繁琐的事情变成自动化半自动化的操作,大幅提升你的效率。 现在随着 Agent Computer Use(操作电脑)的能力增强,你甚至可以让 AI 观察你操作一遍,然后它自己能把它你的操作录制成 Skill。不需要界面、不用部署,但它确实能替你干活。 四、模型和智能体的能力,一直在变强 现在普通人也能 Vibe Coding,还有一个重要原因是模型能力在变强。 回头看这几年的变化: 最初,像 GitHub Copilot 只能做代码补全,你写一半它提示后半段; 然后,它能根据描述生成一段完整的代码; 后来, Claude Code 能自己在项目里探索,读文件、找上下文,把一个功能完整实现; 现在,主流 Agent 都已经能做设计、写代码,还能帮你操作电脑,打开浏览器自己验证做出来的东西对不对。 模型每上一个台阶,普通人做工具的难度就降一截。VibeLab 期间正好赶上 Kimi K3 发布,很快就有创作者拿它做体检报告工具、做斗地主游戏,还有人把 Claude Code、Qoder、GLM、Kimi K3 混着用。 由此也可以看得出越来越多的人已经不再把 AI 当聊天机器人了,能配合 Agent 把 AI 当干活的工具。 五、变化的还有“做工具”这件事本身的心态 看作品的时候我还注意到一点:很多作品不追求改变世界这种宏大的事,就是想先解决一个具体麻烦。比如说工作流太碎、长辈不听劝、拍照没人帮、看不懂热点,作品的起点都是这样一个一个具体的痛点。 最初微博在设定大赛规则的时候,把赛道拆进职场、生活、视觉、微博这些具体场景,现在看来还挺有道理的,因为这确实能激发人 Vibe 的冲动,想去用 AI 解决生活中的问题。 其实这次参赛的作品也不都是工具。@世界第一裹凉皮 把 32657 位诗人、933857 首诗做成了一个三维宇宙 ;@德里克文 的「华夏博物志」把全国博物馆收进一幅可以点开的中国画 ;@海辛Hyacinth 把三星堆&金沙文物变成了互动场景 。这些作品看起来似乎不像工具那么实用,但让我们看到 Vibe Coding 不只是提效,也可以服务于文化和审美。 以前想做这样的东西,需要一个团队,现在一个人,不需要会写程序,有自己的想法加上 AI 就可以试试看。 最后,如果你也想自己搓一个工具,我的一点建议: 从写一个 Agent Skill 开始。 这是成本最低的方式:不用部署,不用界面,把你希望 AI 帮你做的某类事情写清楚就行。做一次,发现哪里不对,改一改,很快就能用起来。 顺便推荐下我的书《图解 Skill》,也是不错的 Skill 入门书籍。 如果要做网页或者 App,不用一上来就让 AI 把整个东西做完。 建议分步走: 1. 先和 AI 一起讨论需求,把你想要什么说清楚,让它复述一遍,确认理解一致。 2. 先做原型。也就是用模拟数据,只看长什么样、怎么操作,不接真实逻辑。原型的好处是改起来成本低,修改容易,就算推翻重来都很快。 3. 再做 MVP(最小可行产品),只做一个最核心的功能,先做一个小的能跑的东西出来。 4. 再慢慢迭代,有了 MVP 了,能跑起来了,就可以慢慢迭代,一次加一个小功能,AI 能处理的过来,你也验收的过来,日积月累,慢慢会变成成熟的软件。 做完一定要验收。 从头到尾按一个真实用户的路径试一遍,AI 说做完验收完不一定靠谱,还得自己上手用用。 注意安全。 涉及钱、隐私、账号权限的东西要格外小心,拿不准的地方去找专业人士问一下。就像 SiaoCut 的作者给 AI 划定了边界:AI 只拿到任务所需的文本和时间戳,不碰原始媒体,处理完只生成待审建议,最终由人决定。这样的思路值得借鉴。 最后说一句,做出来之后,发出来。 这次 VibeLab 里不少作品原本只是作者电脑里的一个 Demo,发到微博之后被讨论、被转发,有的还上了热搜。对于自己动手做东西的人来说,“作品被看见”是最好激励,也是下一次迭代的开始。
显示更多
🇺🇸アメリカ人が語る。「ガンダムのミノフスキー粒子の設定ってすごくね?」 SF好きの間では昔からよくある疑問がある。 「宇宙戦争なら、遠くからミサイルやレーザーを撃てばいいじゃないか」というものだ。 わざわざ近づいて戦う理由は、普通に考えるとないよね。 敵が戦闘機やモビルスーツを出してきても、何キロも先から見えるはずだし、余裕で迎撃できる。つまり、接近戦になる理由がない。 多くのSF作品は、この問題を割と雑に処理してきた。 『スター・ウォーズ』だと、「エネルギー兵器は精度が低い」という設定で押し切っている。 『スタートレック』については正直、自分でもよく分からない。距離が離れると威力が落ちるとか、何かしら説明はあるんだろうけど。 でも、『ガンダム』はこの問題にかなり真面目に向き合った。そこで出てくるのがミノフスキー粒子。 この粒子があるせいで、レーダーがまともに使えなくなる。 そうなると遠距離攻撃が一気に難しくなる。ミサイルの誘導装置も正確に目標を追えなくなる。レーザーを撃っても、相手がどこにいるか分からないから、まず当たらない。 結果として戦闘はどうしても近距離戦になる。これがガンダムの世界で、モビルスーツ同士が接近戦をする理由だ。しかも、この設定は単なる言い訳じゃない。 軍がミノフスキー粒子を持っていたら、まずやるのは重要施設の周囲に散布すること。でも、そうすると「あそこが重要施設なんだな」と敵にバレてしまう。 だから結局、関係ない場所にもどんどん粒子を散布することになる。そうして戦場全体が霧のような状態になる。 誰も正確な状況が分からない、「戦場の霧」が生まれる。この状態では、遠くから安全に戦うなんて無理な話。近づいて目で確認しながら戦うしかない。 だから宇宙なのに白兵戦のような戦いになる。これがミノフスキー粒子という設定の一番うまいところ。 世界観と戦闘の見せ方が、ちゃんと噛み合っている。
显示更多
0
166
15.3K
3.2K
转发到社区