注册并分享邀请链接,可获得视频播放与邀请奖励。

超级个体|柿子 的个人资料封面
超级个体|柿子 的头像

超级个体|柿子 (@yaohui12138)

@yaohui12138
超级个体践行者|AI产品经理,日常分享 AI搞钱实战,AI编程系列教程,AI工作流实操, 只分享干货,利他即利己. 公众号:AI超级个体柿子 博客/咨询/合作:
285 正在关注    21.9K 粉丝
在中国用 Gmail 的人,一定懂这种崩溃: 你明明只想看一眼——老板有没有发邮件、今天 Google Calendar 有没有会、客户那边回了没有。 就这么一个10秒钟能解决的事,你要:打开 VPN App → 选节点 → 等连接 → 打开 Gmail → 等加载 → 看完 → 关 VPN → 祈祷银行 App 别弹风控提示。 整套流程走下来3分钟。而你只是想看一眼。 更离谱的是,这件事每天重复5-8次。算下来每周光“开关 VPN 查信息”这个动作,就能吃掉你一个多小时。不是在工作,是在伺候工具。 我之前以为这就是在国内用海外服务的代价,忍着呗。 直到我发现 Airtap( @airtap_ai)的 iMessage 功能,我整个人都不好了!! 它让我做到了一件我以为不可能的事:不开 VPN,不打开任何 App,直接在 iMessage 里查 Gmail 和 Google Calendar. 没错,就是字面意思。 你在 iMessage 里发一句“帮我查一下最近有没有重要邮件”,它就真的去你的 Gmail 里查了,然后把结果用消息发回来。 “帮我看看今天 Google Calendar 有什么会” → 直接返回你今天的日程列表。 “过去24小时有没有来自 XX 客户的邮件” → 秒回,连邮件摘要都给你整理好了。 全程,我的 VPN 是关着的。全程,我没有打开过 Gmail。全程,我的银行 App、微信、支付宝运行得好好的,没有任何冲突。 这种感觉怎么说呢——就像你一直在爬楼梯上33楼,突然发现旁边有电梯。 原理也不复杂:你第一次需要在 Airtap 的云端环境登录一次 Gmail/Calendar(就这一次),之后所有查询都走云端已登录的环境,你本机完全不需要碰 VPN。 而交互入口,就是 iMessage。零门槛到什么程度?不用装 App,不用注册账号,不用任何配置。 给这个号码发条消息就行:+1-650-213-7322 我现在每天早上的习惯变了:起床,iMessage 发一句“帮我看看今天有什么会议和重要邮件”,30秒内收到今日 briefing。不用开 VPN,不用等加载,不用在 Gmail 和 Calendar 之间来回切。 做跨境的朋友应该更能体会——你跟海外客户、海外团队协作,一天要查十几次邮件和日程,每次都开关 VPN 简直是酷刑。现在一条消息搞定,效率提升不是一点半点。 除了 Gmail 和 Calendar,我还试了: “帮我看看 X 上有没有新回复” → 直接返回互动摘要 “帮我查查 YouTube 频道有没有新评论” → 不用翻墙就能掌握动态 这些海外平台的信息,以前每一个都要单独开 VPN、单独打开 App、单独等加载。现在全部压缩成一句话的事。 说真的,用了一周之后我回不去了。那种“问一句就知道答案”的丝滑感,跟之前“开 VPN 等半天查个信息再关 VPN”的割裂体验完全是两个时代。 唯一需要注意的:第一次使用某个服务时需要在云端登录一次(需要 VPN),但这是一次性的。登录完之后,日常查询就再也不用碰 VPN 了。 把这个号码存到通讯录:+1-650-213-7322 你的手机上就多了一个不用 VPN 也能随时查海外账号的入口。 每天被 VPN 折磨的朋友,试一次就知道了。 #justtextit# #textyourapps# #airtap#
显示更多
0
22
23
6
转发到社区
笑死我了哈哈哈 上个月一个做跨境的朋友找我吐槽,说他花了两个多月做了一个 AI 日报工具,想卖给跨境电商卖家,定价 99 一个月! 上线那天发了朋友圈、发了推特、投了三个社群,他推特也有 1w 粉 结果一周下来,付费用户:0 后来他去真正问了几个做跨境的朋友,人家说:兄弟,我们根本不缺信息,我们缺的是选品方向,两个月白干了 听完我就说:你早该来找我,我反手直接打开 Atypica 的 AI Panel,帮他做了个测试 我帮他搞了一个「跨境电商卖家」Panel,个人,覆盖不同品类、不同规模、不同平台 然后直接问:你日常最头疼的环节是什么?如果有一个 AI 日报工具每天推送行业信息,你愿意付费吗? 10 分钟,结果出来了 5个人的回答几乎一致:信息不缺,每天已经被各种群和公众号轰炸了,真正需要的是有人帮我筛品、判断趋势 如果他两个月前花 10 分钟做这个测试,就不会白干了 方向从一开始就是错的,但他不知道,因为他从来没问过真正的目标用户
显示更多
普通人做产品最大的短板不是技术,不是流量,是你根本不知道你的用户在想什么 大厂有用研团队、有焦点小组、有百万级调研预算 在百度做PM的时候, 每几天都会有一份定制化的《竞品动态日报》《消费者洞察报告》躺在所有员工的邮箱里 字节跳动昨天上线了什么新功能,腾讯哪个部门在招什么岗位,什么赛道的用户在关注什么产品,什么产品的数据又卖爆了 当时我就在想:如果我出来单干,我想获得这些信息,不得难死,这笔钱谁给我出? 后来真出来了,答案是——根本没人出😂 所以和大部分独立开发者一样,我做产品验证需求的方式是: 发朋友圈问问、在推特宣发一下、看看竞品评论区、然后凭直觉赌一把 连续创业五年,我见过最多的死法不是产品做不出来 是产品做出来了,没人要,花三个月憋 MVP,上线后发现需求是自己臆想的 这个痛,做过产品的人都懂 做出海的朋友更惨 你的目标用户在地球另一边,时差 12 小时,语言不通,文化不同 去年帮一个朋友的品牌做北美市场,最头疼的不是投放,是根本不知道美国消费者怎么想,美国人文化和中国差距太大了 招一个本地调研公司,报价 8 万美金起步,找几个留学生做访谈,样本太小、还有幸存者偏差,有时候还访谈不明白 最后还是靠猜 现在这件事有了一个结构性的解法 Atypica @atypica_AI 上线了一个新功能叫 AI Panel,一句话解释:它让你拥有了一个属于自己的焦点小组 不是 ChatGPT 扮演用户那种玩法 是基于 100 万+ 真实用户数据构建的 AI Persona,每个人有完整的背景、性格、认知偏差、消费决策框架 关键是——这个焦点小组是可复用的 你今天问一次,下个月产品迭代了再问一次 同一群人,持续追踪,看他们的态度变化 这在传统调研里叫 longitudinal study,成本极高 现在你一个人就能做 三种方式构建你的 Panel: 1)自动沉淀:用 Atypica 做完一次 Research 后,参与访谈的 AI Persona 自动沉淀成 Panel,下次直接调用 2)手动挑人:从 100 万+ 的 Persona Library 里按关键词搜索,添加组队 3)按需生成:输入需求描述,系统从零帮你构建一个全新的 Panel 组好之后随时打开,输入研究话题 支持一对多深度访谈,也支持多对多 Group Discussion 我试了一个真实场景 我之前做过一个面向内容创作者的 AI 写作工具,想验证订阅制定价 构建了一个Panel:YouTube 创作者、推特创作者、独立播客主 直接问:你平时写作的痛点有哪些?流程有哪些 10 分钟,直接就拿到了需求的分类和反馈 这种颗粒度,以前要花两周招募 + 一周访谈 + 几万块预算 现在 10 分钟,一个人搞定 如果你是以下三种人,这个功能对你来说是刚需: 做出海产品的创业者——你的用户在地球另一边,以前只能看竞品评论区猜需求,现在直接构建目标市场的用户 Panel,随时追问 需要反复迭代验证的产品团队——每次加功能都要做用户测试,Panel 让你不用每次重新招人,同一群用户持续追踪反应变化 需要大规模样本的场景——比如你想了解 2000 个家庭的消费偏好,传统手段几乎不可能,Panel 可以 我觉得我们普通人做产品和大厂的差距,不应该是有没有用户调研团队 而是用什么方式理解用户,大厂用人力堆,我们用 AI 跑 以前这是一句空话,因为 ChatGPT 扮演用户的结果你自己都不信 现在不一样了——100 万+ 真实数据构建的 Persona,有来源、有背景、有决策框架 它不能替代真人调研的最终验证 但它能让你在写第一行代码之前,就知道方向对不对 调研从一个季度一次的项目,变成了随时可调用的能力 这对一个人做产品的人来说,是基础设施级别的变化 我推荐每一个想做生意,产品的人都去试一试,这可能就是你和用户面对面沟通的第一步:
显示更多
0
36
69
11
转发到社区
普通人做产品最大的短板不是技术,不是流量,是你根本不知道你的用户在想什么 大厂有用研团队、有焦点小组、有百万级调研预算 在百度做PM的时候, 每几天都会有一份定制化的《竞品动态日报》《消费者洞察报告》躺在所有员工的邮箱里 字节跳动昨天上线了什么新功能,腾讯哪个部门在招什么岗位,什么赛道的用户在关注什么产品,什么产品的数据又卖爆了 当时我就在想:如果我出来单干,我想获得这些信息,不得难死,这笔钱谁给我出? 后来真出来了,答案是——根本没人出😂 所以和大部分独立开发者一样,我做产品验证需求的方式是: 发朋友圈问问、在推特宣发一下、看看竞品评论区、然后凭直觉赌一把 连续创业五年,我见过最多的死法不是产品做不出来 是产品做出来了,没人要,花三个月憋 MVP,上线后发现需求是自己臆想的 这个痛,做过产品的人都懂 做出海的朋友更惨 你的目标用户在地球另一边,时差 12 小时,语言不通,文化不同 去年帮一个朋友的品牌做北美市场,最头疼的不是投放,是根本不知道美国消费者怎么想,美国人文化和中国差距太大了 招一个本地调研公司,报价 8 万美金起步,找几个留学生做访谈,样本太小、还有幸存者偏差,有时候还访谈不明白 最后还是靠猜 现在这件事有了一个结构性的解法 Atypica @atypica_AI 上线了一个新功能叫 AI Panel,一句话解释:它让你拥有了一个属于自己的焦点小组 不是 ChatGPT 扮演用户那种玩法 是基于 100 万+ 真实用户数据构建的 AI Persona,每个人有完整的背景、性格、认知偏差、消费决策框架 关键是——这个焦点小组是可复用的 你今天问一次,下个月产品迭代了再问一次 同一群人,持续追踪,看他们的态度变化 这在传统调研里叫 longitudinal study,成本极高 现在你一个人就能做 三种方式构建你的 Panel: 1)自动沉淀:用 Atypica 做完一次 Research 后,参与访谈的 AI Persona 自动沉淀成 Panel,下次直接调用 2)手动挑人:从 100 万+ 的 Persona Library 里按关键词搜索,添加组队 3)按需生成:输入需求描述,系统从零帮你构建一个全新的 Panel 组好之后随时打开,输入研究话题 支持一对多深度访谈,也支持多对多 Group Discussion 我试了一个真实场景 我之前做过一个面向内容创作者的 AI 写作工具,想验证订阅制定价 构建了一个Panel:YouTube 创作者、推特创作者、独立播客主 直接问:你平时写作的痛点有哪些?流程有哪些 10 分钟,直接就拿到了需求的分类和反馈 这种颗粒度,以前要花两周招募 + 一周访谈 + 几万块预算 现在 10 分钟,一个人搞定 如果你是以下三种人,这个功能对你来说是刚需: 做出海产品的创业者——你的用户在地球另一边,以前只能看竞品评论区猜需求,现在直接构建目标市场的用户 Panel,随时追问 需要反复迭代验证的产品团队——每次加功能都要做用户测试,Panel 让你不用每次重新招人,同一群用户持续追踪反应变化 需要大规模样本的场景——比如你想了解 2000 个家庭的消费偏好,传统手段几乎不可能,Panel 可以 我觉得我们普通人做产品和大厂的差距,不应该是有没有用户调研团队 而是用什么方式理解用户,大厂用人力堆,我们用 AI 跑 以前这是一句空话,因为 ChatGPT 扮演用户的结果你自己都不信 现在不一样了——100 万+ 真实数据构建的 Persona,有来源、有背景、有决策框架 它不能替代真人调研的最终验证 但它能让你在写第一行代码之前,就知道方向对不对 调研从一个季度一次的项目,变成了随时可调用的能力 这对一个人做产品的人来说,是基础设施级别的变化 我推荐每一个想做生意,产品的人都去试一试,这可能就是你和用户面对面沟通的第一步:
显示更多
0
42
59
13
转发到社区
卧槽!太牛了!! Topview 3D Shot Composer直接把生成视频这件事的门槛干没了 AI 视频到现在最大的问题,一直都是:你没法精确控制画面里的空间关系 prompt 写「角色 A 站左边,角色 B 站右边,低角度仰拍」 结果?站位是反的,角度完全不对,空间关系全靠 AI 心情 你改措辞、加描述、换句式,本质上都是在用文字去表达一个三维空间的事情 这件事天然就是错的 Topview 3D Shot Composer 直接改变了这件事的做法: 不再用文字描述镜头,而是直接在 3D 环境里摆 角色站哪、道具放哪、摄像机架在什么位置、构图怎么收——全部拖拽完成 你不是在写 prompt 祈祷 AI 理解你 你是在像导演一样,亲手布置每一个镜头 这个区别有多大? 以前:你在描述你想要的画面 现在:你在直接构建你想要的画面 对于做 AI 短片、做叙事向视频的创作者来说,这才是真正意义上的所见即所得 不是分镜级别的所见即所得,是单个镜头内部、每一个角色和物体的空间关系级别的所见即所得 @TopviewAIhq 这次直接把 AI 视频的可控性拉到了镜头语言层面 prompt 能描述一个镜头,但 3D Shot Composer 让你导演它
显示更多
Prompts aren’t enough when your shot needs precision. With Topview 3D Shot Composer, you can visually stage characters, props, and camera framing before generating your video. Less guessing. Fewer rerolls. More predictable shots. 🎬 Stop describing your shots. Start directing them. #TopviewAI# #AIVideo# #AIFilmmaking# #AIStorytelling# #3DShotComposer#
显示更多
0
28
43
6
转发到社区
再过半年,想接海外单赚美金的人,都会用这个方式找客户 一个能让你月入 $10,000+ 的路径:不在平台等单,直接用 AI 找到需要你服务的海外公司,精准触达客户 你可能觉得这个很难?以前确实难,现在不难了 先说一个暴论:AI 时代写代码赚不了钱,只有找客户,vibe marketing 才能让你真赚到钱 我研究了一圈海外接单的真实数据: Upwork 平均时薪 $39,平台抽 10-15% Fiverr 固定抽 20%,前几个月基本零曝光 Toptal 时薪 $80-200,但只录取前 3% 的申请者 大部分人卡死在同一个地方——被动等单,你把 profile 挂上去,然后祈祷客户搜到你,这不是在搞笑吗??? 和全球几百万接单的大牛卷同一个关键词,等来的单子还得竞价,利润被压到极限 全世界的自由职业者,公司都知道要主动找客户,但从 20 世纪开始,这个事就没有被解决过 以前你想主动找客户,得这么干:去 LinkedIn 搜关键词,出来一堆不相关的,一个个点进去看 profile,判断这人是不是决策者 再去找邮箱,一半找不到 好不容易凑了 20 个人,写邮件又不知道怎么开口,一天下来处理 20 个 leads,回复率 3%,等于白干 现在这个活,AI 直接给你干了。 我最近在用一个 AI 找人工具 Lev8(刚拿了 GL Ventures 600 万美金),跑通了从找人到成交的完整链路 我的身份:做 AI 提效、Agent 搭建、自动化工作流的独立开发者,帮 SaaS 公司搭内部自动化,客单价 $3,000-$8,000 我直接跟它说: “我是做 AI 提效、Agent 搭建、自动化工作流的独立开发者,帮 SaaS 公司搭内部自动化,你来帮我先分析我的客户画像,然后帮我找客户 比如:帮我找小型 SaaS 公司,最近 6 个月有融资或产品发布动态,有招聘全职或者兼职AI提效,agent搭建,ai自动化工作六搭建的岗位的公司,提取创始人/CTO 的名字、邮箱、LinkedIn,按匹配度 1-10 分打分,附一句话理由。” 它聚合 50+ 实时数据源(LinkedIn、X、GitHub、公司官网等),直接出一份精准名单 不是那种买来的过时数据库,是实时的、活的数据。每个人都有 360° 画像:公司背景、最近动态、业务痛点、团队规模、匹配度评分 更狠的是下一步—— 它基于每个人最近的真实动态,自动生成个性化破冰邮件 不是一封模板改名字群发,是每封都不一样 比如对方三天前刚发布了新功能,邮件开头就提到这个功能,自然过渡到“我能帮你们把 XX 流程自动化” 对方上周刚发了条推文吐槽内部工具难用?开头就接这个话题 以前要做到这种程度,你得花 30 分钟研究一个人,一天最多写 10 封。现在批量生成,每封都有 context,每封都像是专门写给他的 然后多渠道一键发送——Email、LinkedIn、WhatsApp、X,选渠道,确认内容,发出去 整个流程从输入 prompt 到发出第一批邮件:5分钟 我又试了另一个场景: “帮我找在 YouTube 上有 10W+ 订阅但发布频率下降的创作者,可能需要外包剪辑。提取联系方式,按匹配度排序。” 同样几分钟出结果。做视频剪辑外包的、做设计的、做跨境电商服务的,换个 prompt 就是换个赚钱场景 算一笔账: 传统路径:Upwork 接单,客单价 $5,000,平台抽 10-15%,到手 $4,250。还得和印度团队卷价格,实际成交价可能被压到 $3,000。被动等单,一个月能接 1-2 单已经不错 主动获客路径:客单价 $5,000,直接触达决策人,0 中间商,到手 $5,000。发 50 封精准邮件,回复率 15-25%(因为每封都有 context,不是盲发),8-12 个回复,成交 1-2 单 月入 $5,000-$10,000,不靠平台,不卷价格 关键差异:你触达的不是随机的人,而是“此刻正好需要你服务”的人 以前做到这一点需要一个 BD 团队。现在一个人 + 一个 AI 队友就能跑通完整链路 窗口期不会太长,等到人人都这么干的时候,回复率又会被打下来。先跑通的人,先吃肉 Lev8:
显示更多
0
41
68
14
转发到社区
太夸张了,小某书和海鲜市场很快就会有人开始卖这个了。 再过半年,传统调研公司得倒一半,一份他们报价5-15万的消费者洞察报告,现在一个人用 AI,30分钟就能出 一个能让你月入过万的信息差生意:现在用 Atypica @atypica_AI 已经可以实现30分钟出一份专业级的消费者洞察报告了 大厂做调研一般都会找第三方调研公司 你知道传统调研公司做这事收多少钱??? 深度访谈:单次3000-10000元(含受访者礼金、访谈员、报告) 焦点小组:单场15000-40000元(8个人坐一起聊2小时) 一个完整的消费者洞察项目:5万-25万 大型定制化调研:25万-100万+ 周期:最快3-4周,通常1-2个月 这还只是国内价格,找海外调研公司直接翻3倍 一个定制化的定性调研项目,海外报价 $25,000-$65,000,周期6-8周,其中30-40%的费用是 overhead——说实话,这不是在帮你做洞察,是在养他们的团队 现在这个活,竟然一个人就能干了!! Atypica 做的事很直接: 用 AI 先澄清需求 & 生成研究计划,模拟真实消费者,自动做深度访谈,30分钟出洞察报告 绝对不是那种 AI 瞎编的问卷结果 是基于100w+真实用户数据构建的 AI Persona(官方数据),每个 Persona 都有完整的性格特征、认知偏差、决策框架 你输入一个研究问题,它自动: 自动做需求澄清&研究规划→ 生成目标人群的 AI Persona → 对这些 Persona 做深度访谈 → 分析行为模式和情绪触发点 → 输出结构化洞察报告 整个过程30分钟以内 85%的行为模拟准确度,根据官方数据,已经有品牌拿 Atypica 的结果和他们花了几十万做的传统调研做对比,结论高度吻合 我试了一个场景: 假设我在做一个 AI 写作助手,想了解海外内容创作者的需求和付费意愿 丢进去一个问题,接下来它干了几件事让我有点震: 1)先去 Persona 库搜索匹配的目标用户,发现覆盖不够,主动补充构建了新 Persona——营销文案工作者、自由撰稿人、YouTube 创作者,最终组了5个不同画像 和调研公司“招募受访者”一个逻辑,只是从两周变成了两分钟 2)访谈前先联网做了竞品调研——Jasper、 的定价和用户评价全搜好了,带着信息去追问 不是“你喜欢什么”,而是“你用 Jasper 觉得哪里不够好” 3)两轮访谈交叉验证,最后出了一份可执行报告:功能优先级(KANO 模型)、定价策略、MVP 规划、市场进入路径 不是废话总结,是能直接拿去写 PRD 的东西 这种报告找咨询公司做,10万起步,周期一个月 我花了30分钟这意味着什么? 轻松月入过万的几个变现场景: 1。帮新消费品牌做上市前用户测试,一份报告收费3000-8000元 你的成本是30分钟时间,传统调研公司同样的活收5-15万 2。帮跨境电商做海外市场消费者画像 品牌出海最头疼的就是不懂海外消费者 一份目标市场的消费者决策分析,收费5000-15000元 以前这活只有本地调研公司能接,帮创业者做产品方向验证 “你这个 idea 到底有没有人买单” 模拟50个目标用户做深度访谈,30分钟出结论 收费2000-5000元,比他们花三个月憋 MVP 便宜一百倍 3。帮 MCN/自媒体做内容方向验证 “这个选题我的目标受众到底吃不吃” 模拟目标粉丝画像做反馈测试 收费1000-3000元 4。再不济你去某鱼卖新兴行业报告都没问题,一份49.9,只要内容过硬,大把的人来买 以前这些活,是4A 公司和专业调研机构的饭碗,现在一个人+Atypica 就能干 成本几乎为0,利润全是你的 有个数据很有意思: 海外已经有 AI 调研平台公开了成本对比—— 200次 AI 访谈,成本$4,000,产出15个可追溯的洞察,单个洞察成本$267 20次传统人工访谈,成本$30,000,产出8个洞察,单个洞察成本$3,750 AI 调研的单位洞察成本是传统的1/14 这个效率差,就是你的利润空间 信息差的窗口期,通常只有3-6个月 现在知道这个工具的人还不多,等到烂大街的时候,价格就卷下来了 先上车的人,吃肉 链接:
显示更多
0
49
68
11
转发到社区
做过视频的人都知道一个痛点:画面和声音永远对不齐 你用 AI 生成了画面,再用 AI 配了音,然后花几个小时手动调时间轴、对口型、卡节奏 稍微专业点的创作者,光音画同步这一步就能耗掉半天时间。更要命的是,调完还不一定自然 这个问题在 AI 视频生成领域一直没有解决方案,因为技术难度太高 ——要让声音和画面在生成的时候就天然对齐,而不是事后硬拼,这需要模型同时理解音频和视频的底层逻辑 直到百度文心团队放出了 NAVA-这是业界第一个仅有6.3B参数大小,但是能原生同步生成音视频的模型 其他能实现的模型哪个不是10B以上? 作为一个跑过无数 AI 工具的产品经理,我看到这个模型的第一反应是:这才是真正的技术突破 它到底能干什么? 你给 NAVA 输入一段文字描述,它直接输出720p 的视频+立体声音频,而且声画天然同步,不需要任何后期调整 这不是简单的文生视频+文生音频拼接,而是音视频在同一个生成过程中共同演化、原生对齐 音视频联合生成这个赛道,LTX、Ovi、MOVA 等模型都在做 但 NAVA 用了一个更聪明的架构:Align-then-Fuse,先让音视频在专门的对齐空间建立对应关系,再融合文本条件生成。 更炸裂的是参数量:6.3B 打败所有对手 NAVA 只有6.3B 参数,但在 Verse-Bench 基准测试上,音视频同步指标、视频质量、音频准确率全面超越: Ovi 1.1(10B 参数) MOVA(32B 参数) Davinci(15B) LTX 2.3(19B) 用三分之一甚至六分之一的参数量,拿下 SOTA。这意味着什么?意味着普通人真的用得起了 不需要4090显卡,不需要租昂贵的云算力,甚至12GB 显存的3060就有可能跑起来。而那些参数量动辄15B、19B 的模型,普通人根本碰不到,只能在云端按次付费 文心用6.3B 做到了别人19B 才能做到的效果,这不是简单的参数压缩,而是在模型架构和训练策略上下了真功夫 他们用了一个叫 Align-then-Fuse 的架构,先让音频和视频在专门的对齐空间里建立对应关系,再融合文本条件进行生成 这个技术路线的价值在于:小模型+高性能=普通人能用的 AI 工具 它解决了什么真实痛点? 我观察到三个场景,NAVA 可能发挥非常大的作用: 1.短视频创作者的效率问题: 现在做抖音、视频号内容,很多人卡在配音和画面匹配上。用传统工具,要么花钱请配音,要么用 AI 配音但对不上口型。NAVA 直接生成同步内容,省掉了这个环节 2.教育和培训内容制作: 很多老师、培训机构想做视频课程,但制作成本太高 如果能用文字描述直接生成带讲解的演示片段,内容生产效率会提升几倍 3.小白的内容创业门槛 过去你想做视频内容,得学剪辑、学配音、学调色 现在你只需要会写文案,描述清楚你想要什么,工具帮你生成 这对于想入局但没技术背景的人来说,是真正的降维打击 文心在下一盘什么棋? 有意思的是,NAVA 目前还只是研究阶段的开源项目,但它透露出的信号很明确: 文心在往音视频联合生成、甚至世界模型的方向布局 从产品思维来看,这个方向很聪明 视频生成是红海,音频生成也是红海,但音视频原生同步生成,还是蓝海 而且这个能力,恰好是搭建世界模型、实现真正多模态 AI 的关键拼图 更重要的是,他们选择了小模型路线 在大家都在卷参数量、卷算力的时候,文心用6.3B 做到了 SOTA 水平,这意味着他们在模型效率和工程优化上下了功夫 这对普通用户是好事,因为小模型意味着更低的使用成本、更快的推理速度、更容易的本地部署 NAVA 现在还在早期,但它代表的方向——让 AI 工具更轻、更快、更容易用,才是真正会改变普通人生活的技术路线 GitHub 项目地址: 论文地址: Hugging Face 模型页: #百度# #文心# #文心大模型# #NAVA# #大模型# #人工智能#
显示更多
0
16
21
1
转发到社区
Karpathy 发布了一个github开源项目,狠狠让我惊艳到了 这个项目叫 andrej-karpathy-skills,GitHub 13 万+ star,我愿称之为2026 最有用的 AI 工程项目 它解决的问题极其精准:让 Claude Code 不再瞎写代码 这个项目到底有多厉害? 先说结论:一个 4KB 的文本文件,让 AI 写代码的错误率暴降 90% Karpathy 自己说,他现在 80% 的代码都让 Claude 写,但 AI 经常犯几个典型错误: 不问就瞎猜需求 过度设计,写一堆用不上的抽象 改 A 顺手把 B、C、D 也重构了 代码能跑就行,不管目标达成没有 这个项目就是专门给 Claude Code 戴上guardrails,用 4 条行为准则约束 AI 的编码行为 核心亮点:4 条准则改变一切 整个项目就是一个 CLAUDE.md 文件,里面只有 4 条规则,但每一条都直击 AI 编码的痛点 1. Think Before Coding - 先思考再动手 AI 最大的问题是“太听话”,你说啥它就写啥,从不质疑 这条准则要求:明确说明假设、权衡 tradeoffs,不确定就直接问 不再是“我猜你想要这个”,而是“我理解你的需求是 A,但 B 方案可能更合适,你要哪个?” 2. Simplicity First - 极简实现优先 AI 天生爱炫技,你要一个登录功能,它给你写个完整的 OAuth 2.0 + JWT + 刷新令牌 + 权限系统 这条准则强制:只写刚好能解决当前问题的最小代码 不搞 speculative abstractions,不写未来功能,不过度工程 一个用户反馈:用了这条规则后,代码 diff 从动辄几百行缩减到几十行,review 轻松太多 3. Surgical Changes - 手术式精准修改 这是我最爱的一条 AI 有个恶习:你让它改个 bug,它顺手把整个文件的命名风格、缩进、注释全优化了 这条准则要求:只改用户要求的部分,严格匹配原有代码风格 不碰无关文件,不顺手 refactor,不加“看起来更好”的改动 有开发者实测:启用这条后,git diff 从“满屏红绿”变成“3 行精准修改” 4. Goal-Driven Execution - 目标驱动执行 AI 经常写完代码就交差,但代码能跑 ≠ 任务完成 这条准则要求:把任务转化为可验证的目标/测试/成功标准,然后 loop 执行、验证、迭代 直到真正达成目标才停止 这让 AI 从“代码生成器”变成“问题解决者” 真实效果:社区反馈炸裂 X 上这个项目刷屏了,开发者反馈高度一致: 代码质量飞跃:diff 更紧凑、干净,overbuild 和 side changes 大幅减少 错误率暴降:有人实测从 41% 掉到 11%,继续优化后低至 3% 中文社区评价:“必备 skills”“Claude/Cursor 实用技能 Top1”“直接扔项目里就完事了” 很多人直接 @ 朋友推荐:“把这个 CLAUDE.md 放进去,Claude 立刻像换了个人,写代码更靠谱、不乱改、不瞎猜“ 使用方式:简单到离谱 这是我见过最简单的 AI 工程优化方案: 方法一:直接 curl 把 CLAUDE.md 下载到项目根目录 curl -o CLAUDE.md 方法二:用 Claude Code / Cursor 的 plugin 一键安装 支持 Claude Code、Cursor 等主流 AI coding 工具 完全开源(MIT 协议),拿来就用 作为产品经理出身的开发者,我看到的不只是 4 条规则,而是对 AI 编码行为的深刻洞察 Karpathy 做的事情本质上是:给 AI 建立编码的第一性原理,他把他对于AI编程的理解写入了文件中 不是教 AI 怎么写代码(它已经会了),而是教 AI 什么时候该问、什么时候该停、什么时候该简化 这 4 条准则就像产品经理给开发团队定的 PRD 原则: 需求不清楚? 先问 功能够用就行? 别过度设计 改需求? 只改需求相关的 做完了? 先验证目标达成没有 它能帮到我们什么? 如果你是独立开发者或小团队,这个项目能直接提升你的 AI 协作效率: 减少返工:AI 不再瞎猜需求,写出来的代码更符合预期 降低 review 成本:改动精准,不用在一堆无关修改里找真正的变更 提升代码质量:极简实现意味着更少的 bug、更好的可维护性 加速迭代:目标驱动让 AI 真正解决问题,而不是生成代码 对于中大型项目,这是让 Claude Code 真正“生产可用”的关键一步 我的使用体会 我在自己的几个项目里部署了这个 CLAUDE.md,最直观的感受是: AI 变聪明了 以前它是个听话的实习生,你说啥它做啥,经常做错 现在它像个有经验的同事,会主动问“你确定要这么做吗? 我有个更简单的方案” 代码 diff 变干净了 以前一个小需求能改几十个文件,现在精准到只改 3-5 行 我的工作重心变了 以前 60% 时间在 review AI 的代码、修 bug 现在 80% 时间在思考产品逻辑,AI 真正成了生产力工具 最后 这个项目被誉为 2026 年 AI coding 领域的“现象级”黑魔法工具 小文件,大作用 如果你在用 Claude Code / Cursor 写代码,强烈建议直接把这个 CLAUDE.md 扔进项目根目录 GitHub 地址: 试过的人基本都是“已全项目部署”的状态 作为一个天天和 AI 协作的开发者,我的建议是:别犹豫,直接用
显示更多
0
12
192
30
转发到社区
作为一个把 Claude 用到极致,codex偶尔使用的非技术人员,我来谈一下我对于codex和claude的感受: Codex 正在吞噬应用层的一切,Claude 正在吞噬编码层的一切 先说 Codex 的应用层吞噬 Codex 现在已经不是一个编程工具了 它是一个能操作你电脑上所有东西的超级 App,这点大家应该都深有体会 1. Computer Use - 后台操作你的 Mac 4 月 16 日上线,Codex 可以用自己的光标看、点击、输入 多个 Agent 可以在你的 Mac 上并行工作,不干扰你自己的操作 前端设计、游戏开发、任何 GUI 应用,它都能操作 2. Chrome Extension - 接管你的浏览器 5 月 7 日上线,Codex 现在能直接在 Chrome 里工作 它能操作你已经登录的网站,使用你的 Cookie 和认证状态 跨多个标签页并行处理任务,在后台运行不打断你 3. 90+ Plugins - 连接你的所有工具 GitHub、Slack、Gmail、Google Drive、Notion 每个 Plugin 打包了 Skills、App 集成、MCP 服务器 一键安装,直接用 4. Skills - 把重复工作变成一条指令 你可以把任何多步骤工作流打包成一个 Skill 输入 / 触发,就像训练好的员工一样 OpenAI 自己用 Skills 做每日问题分类、CI 失败总结、发布简报 5. Automations - 让 AI 在你睡觉时工作 设置定时任务,Codex 可以自动运行 每天早上生成工作简报,每周五做项目总结 它甚至能跨天、跨周持续执行长期任务,自动唤醒继续工作 6. Memory - 记住你的偏好和历史 Codex 会记住你的个人偏好、纠正过的错误、花时间收集的信息 下次任务自动用上,质量更高,速度更快 7. 图像生成 - 直接在工作流里生成图 集成了 gpt-image-1.5,需要配图的时候直接生成 不用跳出去用别的工具 你自己能发现,Codex 的逻辑是什么? 让 AI 成为你所有软件之上的操作系统 不是造新工具,而是把现有工具全部串起来 这才是应用层吞噬 再说 Claude 的编码层吞噬 Claude Code 在 2026 年的定位已经非常清晰: 它要重新定义什么叫“开发者” 1. 100 万 token 上下文 - 读取整个代码库 Claude Code 能读取你的整个项目,理解所有文件之间的关系 不是单文件建议,而是跨文件重构 2. 自主执行 - 从规划到测试全自动 你只需要描述想要什么,Claude Code 会: 规划方案 → 写代码 → 运行测试 → 读取错误 → 自动迭代修复 整个过程不需要你插手 3. Terminal + IDE + Desktop - 全场景覆盖 在 Terminal 里用命令行 在 VS Code、JetBrains 里用插件 在 Desktop App 里用图形界面 所有配置、MCP 服务器、Skills 全部同步 4. SWE-bench 80.8% - 行业最高分 这是衡量 AI 解决真实 GitHub Issues 的标准测试 Claude Code 是 2026 年最高分 真实团队用它 20 小时迁移 5 万行代码,事故调查时间减少 80% 5. 自动记忆 - 记住你的构建命令和调试模式 Claude Code 会自动保存项目上下文、调试模式、你偏好的方法 跨 Session 记忆,不用每次都重新解释 6. Hooks - 自动化你的开发流程 每次编辑后自动格式化 每次提交前自动 Lint 用 Shell 命令串联整个工作流 Anthropic 自己说,他们公司现在大部分代码都是 Claude Code 写的 工程师的角色变成了:架构师 + 产品思考者 + 编排者 管理多个 AI Agent,给方向,做决策 这就是编码层吞噬的本质:把编程从技能变成了表达 所以,Codex vs Claude 的本质区别是什么? Codex 的方向:应用层超级个体 操作你已有的软件,自动化所有日常工作 适合 90% 的普通人 核心能力:串联现有工具 Claude 的方向:编码层超级个体 帮你写代码、改代码、部署代码 适合 10% 的创造者 核心能力:从零创造新东西 但这里有个被所有人忽略的东西:Claude 不只有 Code,还有 Cowork Claude Cowork 是什么? 它是 Claude 针对非技术人员推出的应用层工具 Marketing、Data 团队发现自己在用 Claude Code 做复杂的多步骤工作 Anthropic 观察到这个现象,就做了 Cowork Cowork 的核心能力: 操作你的本地文件和应用 38+ Connectors 连接 Slack、Notion、Google Drive、Microsoft 365 Projects 让每个项目有独立的文件、上下文、记忆 Scheduled Tasks 定时自动执行任务 Plugins 打包 Skills、Connectors、Sub-agents 你看,Claude 的野心其实是: 用 Claude Code 吞噬编码层 用 Claude Cowork 吞噬应用层 如果你是普通人,想提升日常工作效率: Codex 和 Claude Cowork 都可以 Codex 的 Computer Use 更激进,能操作任何 GUI Claude Cowork 的 Projects 更稳定,适合长期项目 如果你是开发者,想做产品、做项目: Claude Code+codex 是第一选择 SWE-bench 最高分的规划能力+codex的推理能力,代码质量最好 2026 年的 AI 竞争,比的是谁能把 AI 更好地嵌入到用户的日常工作流里 Codex 在应用层走得最激进 Claude 在编码层走得最深,同时用 Cowork 补齐应用层 这两个方向,正在重新定义“一个人能做什么” 应用层和编码层,都在被 AI 吞噬,而我们,正站在这个变革的最前沿,真的很兴奋!
显示更多
0
9
76
15
转发到社区