注册并分享邀请链接,可获得视频播放与邀请奖励。

与「GLM」相关的搜索结果

GLM 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 GLM 的内容
GLM这种垃圾模型害死人了!我还开的MAX套餐 坑钱的东西 到处是幻觉 要不就是偷懒 开个goal 做到一半不做了 直接说不行 给1w张重置卡我都不用 流口水了!
显示更多
原来这就是赛博活佛的含金量!!免费用啊家人们,这得省多少token!! DeepSeek-V4.1-Flash 最新模型,免费用两周,每天 200 次调用不限速!! 我一开始还以为看错了,反复确认了三遍 作为一个每天都在跑 Agent 任务的人,我最头疼的事不是模型不够强,是管理成本太高 DeepSeek 一个账号、Kimi 一个账号、GLM 一个账号、Qwen 一个账号,API Key 管了五六把,每个月充值要开四五个后台,对完账才知道这个月到底在 AI 上烧了多少钱 更离谱的是,大部分平台充进去的额度根本用不完,但你不充又没法调用,等于在给每个平台交月租 后来发现了 HiLinkup @HiLinkup_AI ——一个 API Key,直接接 DeepSeek、Qwen、Kimi、GLM、Doubao、MiniMax,文本图像视频音频全覆盖 我试了一下,换个 base URL 就行,代码一行不用改,OpenAI SDK 直接兼容 响应速度很快,关键是价格——大概是官方的 1 折左右!!,没有 TPU 上限 说白了就是:以前我每个月在五六个平台上分别充钱,现在一个账户统一计费,按量走,用多少算多少 关键是它现在每天送 1500 万 token 免费额度,日常跑 Agent 任务完全够用 唯一的门槛就是首充 5 块钱激活一下,充完还送 5 块,而且充进去的钱不消耗,每天只走免费额度 对于我们这种每天都在用国产模型跑各种任务的人来说,这个事的意义不只是省钱——是终于不用当五个平台的出纳了 一个 Key 管所有模型,按任务选型,不被任何一家绑死 说实话这种聚合平台的窗口期不会太长,各家模型迟早会收紧 API 授权,能用的时候赶紧先用起来!! 链接:
显示更多
0
30
86
16
转发到社区
谁能告诉我token值多少钱,这不中秋节后第一天上班,烧了了8亿token毛毛雨啥也没干成 最开始编译内核用的是DeepSeek一直没成功 后面是Kimi成功,但网络不行,修复不了 现在用GLM5.2,也不怎么行,智障离谱 大佬们到底啥AI好用,感觉这种大问题,不好试错,AI一直瞎搞把token浪费了 编译老内核支持新特性的,浪费太多时间,开机、刷入、又重启了
显示更多
0
37
31
0
转发到社区
NVIDIA 发布 Skill2Env:用“集体技能”强化智能体 NVIDIA 研究者们把社区公开的 Agent Skills 编译成可执行 RL 训练环境的数据流水线:3.4k 个 Skills 变成 8k 个带程序化测试和行为量规的终端任务;仅 300 步 RL 训练就让 Qwen3.8-27B 在 Terminal-Bench 2.1 上提升 4.7 个百分点,且模型行为显著向源 Skills 的方法论对齐。 开源项目: 核心洞察:公开 Agent Skills 是一个被忽视的监督来源 Agent Skills 是“教智能体做某件事”的文件夹:一个 SKILL.md 加上可选的脚本、参考资料和资产。论文指出,把公开 Skill 语料当作数据来读,它同时提供三样东西: · 任务分布的采样:人们真正想让智能体处理的任务分布(有人愿意花时间写下工作流,说明这活儿值得自动化); · 真实世界的锚点:指向真实的仓库、数据集、工具和工件; · 结果测试表达不了的质量标准:领域专长、默认参数、常见坑、“好结果长什么样”。 # 数据流水线:四阶段编译,验证靠构造 1. Plan(分解):容器化的 Codex 规划器读取完整 Skill 包、联网调研相关公共资产,把 Skill 拆解成若干可验证的 workflow,每个附带元计划(场景、初始世界、预埋缺陷、难点来源、解法草案、验证策略)、资产建议和“任务轴池”(任务原型 × 验证器模式 × 人物画像)。 2. Diversify(多样化):宿主从轴池采样一组组合,加上复杂度、指令语气、请求者专业水平。关键设计是轴池以 workflow 为条件:研究型 workflow 配“证据可追溯”验证和研究者画像,而不是从全轴乘积空间乱抽,这让多样化保持 sensible。 3. Create(构造):全新创建者 Codex agent 在 Docker 内工作,尽可能用真实素材(钉在特定 commit 的开源仓库、真实版本化文档、官方 API 规范);需要联网服务的场景改造成本地替身(stub 服务器、录制回放 fixture、PATH 上的假 CLI、种子数据库),求解时绝不依赖网络。创建顺序被严格固定:先建世界 → 写指令 → 写测试 → 写量规 → 最后才写参考解,测试先于解法冻结,保证解法必须迁就评分契约而非反过来。 4. Verify(验证):宿主端无模型参与的接收门:静态检查(布局、符号链接、Dockerfile 安全、基础镜像按内容摘要钉死)+ 两个容器内试跑:Oracle(参考解)必须全指标满分,NOP(什么都不做的 agent)必须全指标零分。任一失败即拒绝。 值得注意的一个反直觉选择:不做 teacher 模型预验证(不像部分工作用强模型试解、解不出就丢弃任务)。理由有二:这会把任务难度上限压到验证器能力,且成本翻倍;而 group-based RL 的在线动态过滤(rollout 无优势的 prompt 自动不产生梯度)天然淘汰过难/过易任务。 # 数据画像:广、贵、且忠实于源 规模与成本:7,971 个任务,用 GPT-5.6 Sol(xhigh 推理档)生成,API 花费超 9 万美元。(脚注:出于法律原因,公开发布的数据集改用 Kimi-K3-max 在同一流水线下生成。) 领域分布:13 个领域中,软件工程仅占 22.5%,AI/ML 10.5%,商业/金融/法律/HR 10.5%,营销 9.3%……论文对比了 TMax-15K、Terminal-Bench、DeepSWE 等,Skill2Env 是唯一全覆盖 13 域、且非技术知识工作占大头的语料。 忠实度探针(很聪明的设计):用任务指令+量规作查询、对 3.4k 个 SKILL.md 做 TF-IDF 检索,73.2% 的任务 top-1 命中真实源 Skill,94.6% 进 top-10(随机 0.03%)。单用量规也有 68.5% top-1,证明量规携带的是 Skill 专属方法论而非泛泛建议。 SFT 数据:用 GLM-5.3 对每个任务 rollout 两次,得到 15,968 条轨迹,平均奖励 0.74,中位轨迹 19 次模型调用 + 23 次工具调用。 S2EBench:考虑到公开基准饱和,从 SkillHub 另外生成、逐条人工审核(指令无歧义、忠实于源 Skill、测试公允)后的 79 任务私有 held-out 基准。 # RL 实验:基础设施 + 极简配方 基础设施(论文明确说“现代 agentic RL 首先是基础设施挑战”):Molt(PyTorch 原生全异步训练,Ray + vLLM + FSDP2)+ Polar(agent rollout 层:rootless Apptainer 沙箱、代理回传 token ID 和采样时 log-prob、prefix merging 把 harness 的多次补全缝合成训练轨迹)。 配方(刻意走“简单路线”):GRPO 组归一优势 + DPPO 的 binary-KL 信任域掩码(δ=0.05,超出阈值的 token 直接丢弃,无需参考模型,还能防训练-推理失配);G=8 rollouts/组,批 64,lr 1e-6 恒定,无 KL 惩罚、无熵奖励、无 SFT 热启动,每任务 65k 上下文。 量规校准奖励:开量规时,额外由 GPT-6 Astra 做 LLM-as-Judge(带“宪法”:惩罚无脑循环、reward hacking、答非所问;hacking 实证 = -5 分),总奖励 r = r_V + λs/5(λ=0.2),即 judge 最多把程序化奖励拉动 ±0.2。量规是校准可执行结果奖励,而非取代它,这是与“Rubrics as Rewards”一系的定位差异。 # 四项发现(论文最有信息量的部分) 发现 1:小规模 RL 即有跨域迁移。 仅 300 步、只用 2,400 任务子集训一个 epoch:S2EBench pass@1 +4.3(均分 +18.5),Terminal-Bench 2.1 +4.7(49.4→54.1)。训练集与 TB 无重叠(13-gram Jaccard < 0.8),且训练集从未针对 TB 调过,论文将其解读为规划、工具使用、收尾能力的通用提升而非任务族记忆。这让 27B 本地模型显著缩小了与云端前沿模型的差距。 发现 2:量规校准 RL 在基准上落后于纯结果 RL,一个诚实的负结果。 量规版在 TB 2.1 只有 50.1(纯结果版 54.1);训练中量规版的程序化奖励长期停在 0.5–0.6,judge 分项从头到尾无上升趋势,两个奖励在训练分布上互相拉扯。论文不把它当作对量规奖励的终审判决(两者优化不同目标,而基准只考结果那一半),并给出两个疑因:λ=0.2 的加性形式让失败任务仍能拿正奖励、judge 看不到文件系统等设定均未调优;以及更本质的,Skill 写下的方法论可能本来就不是最大化基准通过率的分布。 发现 3:行为确实向 Skill 对齐,量规的价值所在。 200 个任务的成对偏好测试(judge 拿源 SKILL.md 当标准,比较匿名化的 base 与 RL 轨迹):纯结果 RL 已被偏好 54.5% vs 33.5%;量规版被偏好 73.0% vs 24.0%。这说明量规奖励买到的东西在结果基准上看不见,但对“怎么做事”影响实质,对网页开发、报告综合、开放研究这类难验证任务尤其重要。 发现 4:GLM-5.3 蒸馏 SFT 反而伤害 Qwen。 在 GLM-5.3 轨迹上做 SFT:27B 上 TB 2.1 掉到 45.8;4B 上直接崩塌(TB 18.7→3.4,出现思维/工具调用死循环)。归因:教师的 interleaved-thinking + 工具调用风格与学生自身 post-training 不兼容,模仿覆盖了学生依赖的行为模式却带不来教师的能力。与 TMax 报告的“SFT 混合数据劣化已后训练的 Qwen”互相印证。因此论文所有 RL 结果都从未修改的原始 checkpoint 出发。
显示更多
NVIDIA 免费开放这几款模型的访问: - DeepSeek V4.1 Flash - GLM 5.3 - GLM 5.3 Flash - Kimi K3 地址:
这个开源项目系统整理了 35 家 AI 公司的 AI 工程师面试题,全部来自 “公开报告的面试经历” 来自 @outcome_school 团队 @pallavishekhar_ 开源发布,内容几乎涵盖了 OpenAI、Anthropic、DeepMind、xAI、DeepSeek、Kimi、GLM 等 AI Labs,Cursor、Cognition、ElevenLabs 等 AI Native 团队和 Nvidia、Microsoft、Amazon、Apple 等头部大厂。 覆盖的岗位头衔也非常多:AI Engineer、LLM Engineer、Gen AI Engineer、ML Engineer、Research Engineer、Applied Scientist、FDE、MLOps/LLMOps 工程师等。 开源地址: # 内容架构:一个精心设计的双层结构 第一层:跨公司通用题(Common Questions)。 作者把在多家公司反复出现的题目只列一次,标注"Asked at"哪些公司,按十大主题组织: 1. LLM 内部机制与架构 — attention 缩放因子、KV cache 内存公式推导、MQA/GQA/MLA、FlashAttention、BPE、RoPE/YaRN、Chinchilla scaling laws、MoE、解码采样策略、lost-in-the-middle、RMSNorm、SwiGLU 2. 推理、服务与 GPU 性能 — prefill vs decode、continuous batching、PagedAttention、投机解码、量化(FP16→FP4)、五种并行策略、TTFT/TPOT 指标、H100 上的 roofline 计算、vLLM/SGLang/TensorRT-LLM 选型、“如何把服务成本降 10 倍” 3. RAG 与检索 — 分块策略、BM25 vs 稠密检索、重排序器、HyDE、权限感知检索、ANN 索引、索引新鲜度、答案归因 4. Agent 与工具调用 — ReAct、MCP、工具 schema 设计、多智能体编排、Agent 记忆、循环终止条件、人类审批 5. 微调与对齐 — RLHF/DPO/GRPO/RLVR 全谱系、LoRA/QLoRA 数学、灾难性遗忘、“提示 vs RAG vs 微调”决策框架、蒸馏、reward hacking 6. 评估与可观测性 — LLM-as-judge 及其偏差、幻觉检测、基准污染、Agent 评估、回归门禁 7. 安全与负责任 AI — 提示注入(直接/间接)、OWASP LLM Top 10、护栏、Constitutional AI、红队 8. 多模态与语音 — VLM、语音 Agent 延迟预算、barge-in 打断处理、级联 vs 端到端语音、ASR/TTS 评估 9. AI 系统设计 — 十类高频设计题(千万级文档企业 RAG、代码助手、客服 Agent、Text-to-SQL、LLM 网关、数亿用户聊天服务等) 10. 编码题 — 从零实现 attention、KV cache、BPE、采样;LRU 缓存、令牌桶限流器、异步批处理器、SSE 流解析器、最小 Agent 循环 第二层:35 家公司的专属章节,分为五大梯队: 1. 前沿实验室(12 家):Anthropic、OpenAI、Google DeepMind、Meta、xAI、Mistral、Cohere、DeepSeek、月之暗面(Kimi)、智谱(GLM)、阿里(Qwen)、Sarvam AI(印度) 2. 大厂 AI 组织:Microsoft、Amazon、Apple、NVIDIA、Tesla,以及一组消费级 ML 公司(Uber/Netflix/LinkedIn/Airbnb/Pinterest/Spotify) 3. AI 基础设施公司:Databricks、Groq、Together AI、Hugging Face、Scale AI、Perplexity 4. AI 原生产品公司:Cursor、Cognition(Devin)、Sierra、Harvey(法律)、Glean、 AI(机器人)、Waymo 5. 前向部署/企业 AI:Palantir # 题目分布透露的行业信号同样值得关注 1. 公司的差异化考察方向,和它的商业模式严丝合缝。 这是最能体现整理功力的地方: · DeepSeek、月之暗面、智谱、Qwen 的题目深度绑定自家论文——MLA、auxiliary-loss-free 负载均衡、Multi-Token Prediction、MuonClip、DualPipe、长上下文扩展、GLM 的 thinking 模式。面试这些公司等于面试它们的论文,还要求 PyTorch 从零实现 MoE 路由。 · Groq 的题全是 SRAM-only 架构下的 roofline 重推演:“没有 HBM,decode 的 roofline 论证哪里变了”、“确定性在 p99 层面到底买到什么”。 · Apple 清一色端侧:3B 模型在手机上跑、PTQ vs QAT、不采集用户内容的前提下用设备信号改进模型、30+ 语言区无法记录用户内容的评估方案。 · CharacterAI 是推理经济学:“我们的服务成本被 KV cache 而非权重主导,降一个数量级,代价是什么”。 · Harvey(法律)和 Abridge(医疗) 考的是领域约束下的工程:200 页信贷协议里第 140 页的条款依赖第 8 页的定义术语怎么检索、生成的病历中出现了患者没提过的药怎么当作安全事故处理、PHI 如何约束整个架构。 · Palantir 的招牌是 "decomposition" 轮:把“一家货运铁路公司每年因机车非计划停机损失数千万”分解成工程计划。 2. 编码轮的形态正在发生实质性变化。 文档里反复出现的一类题,与传统 LeetCode 明显不同: · “实现一个内存 KV 存储:先 SET/GET/DELETE,再加事务 BEGIN/COMMIT/ROLLBACK,包括嵌套事务”(OpenAI、xAI 都问) · “给你一个 LLM 推理引擎的调度器类,其中一个方法是空壳,没有规格没有文档。说说你头三十分钟干什么”(xAI) “重构这 120 行能跑但很乱的代码,不许破坏测试”(OpenAI) · “对 5 万个文档跑 LLM 调用,API 限 100 并发、偶发 429 和超时,把 Python 写出来”(Anthropic) 考察重心从算法记忆转向增量需求下的代码演进能力、并发正确性、真实工程约束下的取舍。 3. “AI 协作轮”作为新题型已经进入正式面试流程。 这是文档里最前沿的信号: · Anthropic 部分机器学习岗有 AI-collaboration 轮:现场给你 Claude,考察的是你如何指挥它和验证它的产出,而不是你自己写。 · Meta 2026 年的流程新增三阶段 AI 辅助编码轮(探索修复 → 实现新功能 → 扩展改进)。 · Cursor 的 onsite 是两天在真实 Cursor 代码库上做一个功能(或 8 小时远程版),明确考核你对 AI 工具的使用效率和自主 scoping 能力。 · Sierra 给你两小时和任意 AI 工具,看你选择做什么。 xAI 有四小时限时产品构建。 4. FDE 成为一级岗位类别。 Anthropic、OpenAI、Databricks、Scale、Together、Sierra、Harvey、ElevenLabs、Palantir 的章节里都有 "Applied and Forward-Deployed Scenarios" 专属题库——典型题目如“企业客户说 Claude 幻觉太多,你是驻场工程师,头 48 小时做什么”。这对应了 AI 公司向企业交付方式的转变:模型能力差距收窄后,落地能力成为差异化。 5. 硬核系统题的普及。 "H100 上 70B 模型 batch size 1 的 roofline 计算"、"估算 70B 模型的 GPU 显存(权重 + KV cache + 激活 + 碎片)"、"p99 延迟在部署后翻倍但模型没变,走一遍诊断”——这类题横跨 NVIDIA、Together、OpenAI、Perplexity 等多家,说明推理性能的量化直觉已成为 AI 工程师的通用素养,而非基础设施工程师的专属。
显示更多
[RAG 论文分享] VikingRAG:匹配 SOTA 准确率、Token 成本降到 5%–32% 现有问题:RAG 高准确率依赖结构上下文与多轮交互,是 token 开销的主要来源 企业问答、法律、财报等场景的语料都是章、节、段落组成的结构化文档,结构本身就是检索线索,它指示事实归属与局部和全局的关联。 现有 RAG 方法陷入两难:不用结构(朴素向量 RAG、图 RAG、SQL-RAG)丢失导航线索,准确率低;用结构(MoDora、BookRAG、DeepRead)准确率高,但 DeepRead 要把候选文档的完整目录塞进 prompt,开销随目录规模线性增长,加上多轮交互历史不断累积,token 成本巨大。 论文地址 # 三个核心设计 1. 层次化语义存储:把结构从 prompt 搬进可查询的外部状态。 文档分块后保留所属结构节点,自底向上生成节点摘要,目录、块、摘要全部物化为 URI 可寻址对象(如 viking://Pasta/Carbonara/),祖先-后代关系编码为 URI 前缀。系统向代理暴露 Search / List / Grep / Read 四个工具,语义与结构路径共享同一 URI 空间。效果:结构 token 与实际访问的目录片段成正比,而非与完整目录成正比——直接消解 DeepRead 的线性开销。 2. 证据缺口驱动的多轮检索。 Agent 每轮判断证据是否充分,不充分则继续调用工具(轮数预算 B=15),充分即作答。设计哲学是粗定位与细验证分离:Search 锚点 → Read 查看后发现缺口 → List 相邻块 → Grep 精确命中 → Read 验证,每步把搜索空间收窄到相关子树内。 3. 经验边 + 自适应升级——让相似查询不必重复探索。 经验边从历史检索轨迹中把“Search 命中的 URI”连向“真正支撑答案的 URI”,边上存历史问题嵌入做查询时过滤;新查询沿边做条件化多跳扩展,复用路径而非重新探索(VikingRAG-E)。经验积累足够后,多数查询一轮检索即可作答——用约束感知的充分性判断器先验证证据是否支撑答案的关键约束,验证不过关才升级为完整多轮代理检索(VikingRAG-E+)。 # 实验结果:token 降至 SOTA 的零头 6 个真实结构化文档数据集(从 0.24M 词元的课程大纲到 8.78M 词元的财报),8 个基线,骨干 LLM 为 DeepSeek-V4-Pro,并在 GPT-5.5、Seed-2.0、GLM-4.7 上验证稳健性。主要结论: · 准确率与所有基线持平或更高(DeepRead 通常是最强基线); · 基础版 VikingRAG 仅消耗 SOTA 方法的 11.6%–51.9% token,完整版 VikingRAG-E+ 降至 5.1%–32.5%,延迟同样显著更低; · 逐层消融:经验边再省 12%–33% token,自适应升级再省 19%–50%; · 可扩展性:LightRAG、HippoRAG-2 在最大数据集上 24 小时内无法完成摄入,BookRAG 在多数数据集上超时;而 VikingRAG 在文档数从“仅相关文档”增至 991 篇时性能基本稳定——因为它是按需定位,不随语料规模膨胀; · 存储方面:插入延迟与 DeepRead/MoDora 相当、远快于图方法;代价是摄入期 token 更高(为每个索引对象生成预览);文档删除零 LLM 成本。
显示更多
为什么越来越多人愿意“自己搓一个工具”?Vibe Coding正在发生什么变化? 微博VibeLab AI 创意赛收官了,一共有 2500 多件原创作品,2.4 亿多话题阅读。很荣幸这次是评委一员,有机会翻看了不少优秀的参赛作品,也转发了其中一部分。 一个直观的感受就是软件开发这种事情,不再需要专业人士了,普通人也能 Vibe 一个工具出来。 所以借这个机会,整理总结一下:为什么越来越多人愿意“自己搓一个工具”?Vibe Coding正在发生什么变化? 一、写代码这件事,门槛和成本都降下来了 写代码以前是程序员的专利,想写个工具,别说学语言框架,搭个环境都费劲的要死,随便一个环境都能把你卡住,像我这样写程序得有很多年的,换个不熟悉的语言,一样也搞不定。 现在借助 AI Agent,门槛一降再降,现在你只要有一个 Agent,会打字或者会语音,都能指挥 Agent 帮你写一个 App 出来。写代码这件事,从以前需要专业技能,到现在变成了语言表达能力。 我自己身上都有明显变化,从以前对 Vibe Coding 的嗤之以鼻,到现在“真香”,每天都大量的在指挥 Agent 帮我写代码。 二、以前的软件,满足不了长尾需求 长尾理论说的是,需求分布是一条长长的尾巴:头部是大多数人共有的需求,尾巴上是无数小众的、个性化的需求。传统软件只能做头部,因为为少量用户单独开发功能,成本上是不合算的。 而且,就算你有个好想法,也很难传递到开发者那里。想象一下一个普通用户的需求要经过的链条: 用户反馈 → 产品经理收集筛选 → 转化成需求文档 → 设计师出设计稿 → 程序员做系统设计 → 编码 → 测试 → 运维部署 每一环都在过滤、都在排优先级。最终大部分普通用户的需求,都被筛选掉了,软件最终只能取最大公约数,做绝大部分人都需要的那部分。 结果就是,市面上的软件很多,但每个人都有一堆“要是能这样就好了”的小需求,从来没有被满足过。 这次 VibeLab 里我印象很深的一个作品是 @机器旁白 做的 SiaoCut 。起因是他看到我做的 BaoCut,很喜欢“转写、像改文稿一样编辑、AI 处理、人工审阅、导出”串成一条工作流的思路,但 BaoCut 只支持 macOS,他是 Windows 用户。放在以前,他只能等我哪天有空做个 Windows 版,或者就此作罢。现在他自己和 AI 一起做了一个,而且不是简单复刻,还在这个过程中想清楚了自己关心的问题:AI 进入剪辑流程后,应该拿到多少数据,能替创作者决定到哪一步。 这就是长尾需求被满足的样子:不需要等别人来做,有需求的人自己就能把它做出来! 三、Vibe Coding 让成本变低、链条变短 所以以前那种长长的从需求到交付的链条,现在可以缩成简单的几步: 有个想法,让 AI 去设计、制作、部署。 甚至于很多需求根本不需要做成一个有界面的产品。 比如你想每天自动整理某个表格里的待办,或者每周追踪最新的 AI 资讯,这些事让 AI Agent 帮你写个脚本,再让它自己定时调用就行了。 比如 @张铁蕾 开源的 Bridgic Agent 就是这样的作品:输入 /build,描述你的目标,它自己去探路、生成、验证,遇到需要你判断的地方再来问你。做出来的不是一次性跑完的任务,而是可以长期运行、随时修改的工作流。 还有一种更轻的做法:把你的操作流程、经验和偏好写成 Agent Skill,就像一份告诉 AI 怎么做某类事的说明文档,那么以后 Agent 就能按照 Skill 的说明帮你把很多繁琐的事情变成自动化半自动化的操作,大幅提升你的效率。 现在随着 Agent Computer Use(操作电脑)的能力增强,你甚至可以让 AI 观察你操作一遍,然后它自己能把它你的操作录制成 Skill。不需要界面、不用部署,但它确实能替你干活。 四、模型和智能体的能力,一直在变强 现在普通人也能 Vibe Coding,还有一个重要原因是模型能力在变强。 回头看这几年的变化: 最初,像 GitHub Copilot 只能做代码补全,你写一半它提示后半段; 然后,它能根据描述生成一段完整的代码; 后来, Claude Code 能自己在项目里探索,读文件、找上下文,把一个功能完整实现; 现在,主流 Agent 都已经能做设计、写代码,还能帮你操作电脑,打开浏览器自己验证做出来的东西对不对。 模型每上一个台阶,普通人做工具的难度就降一截。VibeLab 期间正好赶上 Kimi K3 发布,很快就有创作者拿它做体检报告工具、做斗地主游戏,还有人把 Claude Code、Qoder、GLM、Kimi K3 混着用。 由此也可以看得出越来越多的人已经不再把 AI 当聊天机器人了,能配合 Agent 把 AI 当干活的工具。 五、变化的还有“做工具”这件事本身的心态 看作品的时候我还注意到一点:很多作品不追求改变世界这种宏大的事,就是想先解决一个具体麻烦。比如说工作流太碎、长辈不听劝、拍照没人帮、看不懂热点,作品的起点都是这样一个一个具体的痛点。 最初微博在设定大赛规则的时候,把赛道拆进职场、生活、视觉、微博这些具体场景,现在看来还挺有道理的,因为这确实能激发人 Vibe 的冲动,想去用 AI 解决生活中的问题。 其实这次参赛的作品也不都是工具。@世界第一裹凉皮 把 32657 位诗人、933857 首诗做成了一个三维宇宙 ;@德里克文 的「华夏博物志」把全国博物馆收进一幅可以点开的中国画 ;@海辛Hyacinth 把三星堆&金沙文物变成了互动场景 。这些作品看起来似乎不像工具那么实用,但让我们看到 Vibe Coding 不只是提效,也可以服务于文化和审美。 以前想做这样的东西,需要一个团队,现在一个人,不需要会写程序,有自己的想法加上 AI 就可以试试看。 最后,如果你也想自己搓一个工具,我的一点建议: 从写一个 Agent Skill 开始。 这是成本最低的方式:不用部署,不用界面,把你希望 AI 帮你做的某类事情写清楚就行。做一次,发现哪里不对,改一改,很快就能用起来。 顺便推荐下我的书《图解 Skill》,也是不错的 Skill 入门书籍。 如果要做网页或者 App,不用一上来就让 AI 把整个东西做完。 建议分步走: 1. 先和 AI 一起讨论需求,把你想要什么说清楚,让它复述一遍,确认理解一致。 2. 先做原型。也就是用模拟数据,只看长什么样、怎么操作,不接真实逻辑。原型的好处是改起来成本低,修改容易,就算推翻重来都很快。 3. 再做 MVP(最小可行产品),只做一个最核心的功能,先做一个小的能跑的东西出来。 4. 再慢慢迭代,有了 MVP 了,能跑起来了,就可以慢慢迭代,一次加一个小功能,AI 能处理的过来,你也验收的过来,日积月累,慢慢会变成成熟的软件。 做完一定要验收。 从头到尾按一个真实用户的路径试一遍,AI 说做完验收完不一定靠谱,还得自己上手用用。 注意安全。 涉及钱、隐私、账号权限的东西要格外小心,拿不准的地方去找专业人士问一下。就像 SiaoCut 的作者给 AI 划定了边界:AI 只拿到任务所需的文本和时间戳,不碰原始媒体,处理完只生成待审建议,最终由人决定。这样的思路值得借鉴。 最后说一句,做出来之后,发出来。 这次 VibeLab 里不少作品原本只是作者电脑里的一个 Demo,发到微博之后被讨论、被转发,有的还上了热搜。对于自己动手做东西的人来说,“作品被看见”是最好激励,也是下一次迭代的开始。
显示更多
0
33
60
6
转发到社区
为什么越来越多人愿意“自己搓一个工具”?Vibe Coding正在发生什么变化? 微博VibeLab AI 创意赛收官了,一共有 2500 多件原创作品,2.4 亿多话题阅读。很荣幸这次是评委一员,有机会翻看了不少优秀的参赛作品,也转发了其中一部分。 一个直观的感受就是软件开发这种事情,不再需要专业人士了,普通人也能 Vibe 一个工具出来。 所以借这个机会,整理总结一下:为什么越来越多人愿意“自己搓一个工具”?Vibe Coding正在发生什么变化? 一、写代码这件事,门槛和成本都降下来了 写代码以前是程序员的专利,想写个工具,别说学语言框架,搭个环境都费劲的要死,随便一个环境都能把你卡住,像我这样写程序得有很多年的,换个不熟悉的语言,一样也搞不定。 现在借助 AI Agent,门槛一降再降,现在你只要有一个 Agent,会打字或者会语音,都能指挥 Agent 帮你写一个 App 出来。写代码这件事,从以前需要专业技能,到现在变成了语言表达能力。 我自己身上都有明显变化,从以前对 Vibe Coding 的嗤之以鼻,到现在“真香”,每天都大量的在指挥 Agent 帮我写代码。 二、以前的软件,满足不了长尾需求 长尾理论说的是,需求分布是一条长长的尾巴:头部是大多数人共有的需求,尾巴上是无数小众的、个性化的需求。传统软件只能做头部,因为为少量用户单独开发功能,成本上是不合算的。 而且,就算你有个好想法,也很难传递到开发者那里。想象一下一个普通用户的需求要经过的链条: 用户反馈 → 产品经理收集筛选 → 转化成需求文档 → 设计师出设计稿 → 程序员做系统设计 → 编码 → 测试 → 运维部署 每一环都在过滤、都在排优先级。最终大部分普通用户的需求,都被筛选掉了,软件最终只能取最大公约数,做绝大部分人都需要的那部分。 结果就是,市面上的软件很多,但每个人都有一堆“要是能这样就好了”的小需求,从来没有被满足过。 这次 VibeLab 里我印象很深的一个作品是 @机器旁白 做的 SiaoCut 。起因是他看到我做的 BaoCut,很喜欢“转写、像改文稿一样编辑、AI 处理、人工审阅、导出”串成一条工作流的思路,但 BaoCut 只支持 macOS,他是 Windows 用户。放在以前,他只能等我哪天有空做个 Windows 版,或者就此作罢。现在他自己和 AI 一起做了一个,而且不是简单复刻,还在这个过程中想清楚了自己关心的问题:AI 进入剪辑流程后,应该拿到多少数据,能替创作者决定到哪一步。 这就是长尾需求被满足的样子:不需要等别人来做,有需求的人自己就能把它做出来! 三、Vibe Coding 让成本变低、链条变短 所以以前那种长长的从需求到交付的链条,现在可以缩成简单的几步: 有个想法,让 AI 去设计、制作、部署。 甚至于很多需求根本不需要做成一个有界面的产品。 比如你想每天自动整理某个表格里的待办,或者每周追踪最新的 AI 资讯,这些事让 AI Agent 帮你写个脚本,再让它自己定时调用就行了。 比如 @张铁蕾 开源的 Bridgic Agent 就是这样的作品:输入 /build,描述你的目标,它自己去探路、生成、验证,遇到需要你判断的地方再来问你。做出来的不是一次性跑完的任务,而是可以长期运行、随时修改的工作流。 还有一种更轻的做法:把你的操作流程、经验和偏好写成 Agent Skill,就像一份告诉 AI 怎么做某类事的说明文档,那么以后 Agent 就能按照 Skill 的说明帮你把很多繁琐的事情变成自动化半自动化的操作,大幅提升你的效率。 现在随着 Agent Computer Use(操作电脑)的能力增强,你甚至可以让 AI 观察你操作一遍,然后它自己能把它你的操作录制成 Skill。不需要界面、不用部署,但它确实能替你干活。 四、模型和智能体的能力,一直在变强 现在普通人也能 Vibe Coding,还有一个重要原因是模型能力在变强。 回头看这几年的变化: 最初,像 GitHub Copilot 只能做代码补全,你写一半它提示后半段; 然后,它能根据描述生成一段完整的代码; 后来, Claude Code 能自己在项目里探索,读文件、找上下文,把一个功能完整实现; 现在,主流 Agent 都已经能做设计、写代码,还能帮你操作电脑,打开浏览器自己验证做出来的东西对不对。 模型每上一个台阶,普通人做工具的难度就降一截。VibeLab 期间正好赶上 Kimi K3 发布,很快就有创作者拿它做体检报告工具、做斗地主游戏,还有人把 Claude Code、Qoder、GLM、Kimi K3 混着用。 由此也可以看得出越来越多的人已经不再把 AI 当聊天机器人了,能配合 Agent 把 AI 当干活的工具。 五、变化的还有“做工具”这件事本身的心态 看作品的时候我还注意到一点:很多作品不追求改变世界这种宏大的事,就是想先解决一个具体麻烦。比如说工作流太碎、长辈不听劝、拍照没人帮、看不懂热点,作品的起点都是这样一个一个具体的痛点。 最初微博在设定大赛规则的时候,把赛道拆进职场、生活、视觉、微博这些具体场景,现在看来还挺有道理的,因为这确实能激发人 Vibe 的冲动,想去用 AI 解决生活中的问题。 其实这次参赛的作品也不都是工具。@世界第一裹凉皮 把 32657 位诗人、933857 首诗做成了一个三维宇宙 ;@德里克文 的「华夏博物志」把全国博物馆收进一幅可以点开的中国画 ;@海辛Hyacinth 把三星堆&金沙文物变成了互动场景 。这些作品看起来似乎不像工具那么实用,但让我们看到 Vibe Coding 不只是提效,也可以服务于文化和审美。 以前想做这样的东西,需要一个团队,现在一个人,不需要会写程序,有自己的想法加上 AI 就可以试试看。 最后,如果你也想自己搓一个工具,我的一点建议: 从写一个 Agent Skill 开始。 这是成本最低的方式:不用部署,不用界面,把你希望 AI 帮你做的某类事情写清楚就行。做一次,发现哪里不对,改一改,很快就能用起来。 顺便推荐下我的书《图解 Skill》,也是不错的 Skill 入门书籍。 如果要做网页或者 App,不用一上来就让 AI 把整个东西做完。 建议分步走: 1. 先和 AI 一起讨论需求,把你想要什么说清楚,让它复述一遍,确认理解一致。 2. 先做原型。也就是用模拟数据,只看长什么样、怎么操作,不接真实逻辑。原型的好处是改起来成本低,修改容易,就算推翻重来都很快。 3. 再做 MVP(最小可行产品),只做一个最核心的功能,先做一个小的能跑的东西出来。 4. 再慢慢迭代,有了 MVP 了,能跑起来了,就可以慢慢迭代,一次加一个小功能,AI 能处理的过来,你也验收的过来,日积月累,慢慢会变成成熟的软件。 做完一定要验收。 从头到尾按一个真实用户的路径试一遍,AI 说做完验收完不一定靠谱,还得自己上手用用。 注意安全。 涉及钱、隐私、账号权限的东西要格外小心,拿不准的地方去找专业人士问一下。就像 SiaoCut 的作者给 AI 划定了边界:AI 只拿到任务所需的文本和时间戳,不碰原始媒体,处理完只生成待审建议,最终由人决定。这样的思路值得借鉴。 最后说一句,做出来之后,发出来。 这次 VibeLab 里不少作品原本只是作者电脑里的一个 Demo,发到微博之后被讨论、被转发,有的还上了热搜。对于自己动手做东西的人来说,“作品被看见”是最好激励,也是下一次迭代的开始。
显示更多
Ox Alpha = GLM-5.3 Flash AA = 57 , 1/100 frontier price, Powered by pure Chinese chips. Delivered nearly 20% weekly token share (no. 1) on OpenRouter. Thanks to all for the support.
显示更多
0
124
2.4K
176
转发到社区