注册并分享邀请链接,可获得视频播放与邀请奖励。

与「純名里沙」相关的搜索结果

純名里沙 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 純名里沙 的内容
Grok Bot 设计之旅 来自 Grok Bot Design Lead @johnbai 是 Cursor 纽约办公室的第一位设计师,John 在这期访谈中首次公开其幕后设计过程。 # Grok Bot 产品起源:为什么 Cursor 要"另起炉灶"? Cursor 桌面端对非技术用户门槛过高,工程化概念让设计师等群体难以上手。John 入职后长期负责增长与 onboarding,核心命题一直是"降低门槛"。 内部曾有两派:一派主张改造现有产品(John 甚至提过类似 Codex 后来采用的"双模式切换"方案:coding vs. tasks);另一派主张彻底重做。最终共识是:Cursor 品牌技术感太强、包袱太重,对非工程师缺乏吸引力,于是高层自上而下拍板,由几名资深工程师闭门探索全新产品。 Grok Bot 初版是精简版 Cursor Glass(agents 窗口)+ iMessage 式聊天界面。这是关键的"秘密武器"——AI 圈用户习惯了流式输出和思考状态,但普通用户最熟悉的是 iMessage/WhatsApp 的消息形态。这一选择奠定了产品的亲和力。 # 设计探索:从"激进重构"到"回归聊天" John 展示了大量未采用的探索,其演进逻辑值得注意: 1. 质疑范式:他最初质疑"为什么又是左栏列表 + 中间聊天 + 右侧详情的三栏结构",尝试了大量替代形态——任务清单悬浮窗、"Mission Control"多 Agent 监控视图、便签式界面、Raycast 式唤起、常驻桌面的 "Notch(灵动岛)"概念、Clippy 式桌面角落角色等。 2. 用产品打造产品:他用内部原型(代号 Sand,即 Grok Bot 前身)来构建自己理想中的 Notch 形态。亲手使用后他发现:Notch 形态会丢失上下文,而聊天仍是管理 "Agent 舰队" 的正确交互范式。这是本期最重要的认知反转——设计师通过快速原型证伪了自己的激进方案。 3. 收敛逻辑:领导层对"退居后台"的 ambient 方案反应冷淡,因为产品需要品牌存在感;而探索中诞生的碎片(如六边形 Cursor logo 加双眼的像素小人)最终演化为 Grok Bot 的吉祥物。两条设计路线——"给工程版抛光"与"彻底重做"——最终融合为现有形态。 4. 拟人化的来源:早期内部用户自发给 Agent 起名、上传表情包当头像,团队从中捕捉到"用户想赋予 Agent 人格"的信号,遂将角色形象设为默认状态。 # Onboarding 哲学(本期最有方法论价值的部分) John "在 Cursor 的全部时间都在设计 onboarding",其核心原则: 1. 衡量负担的标准是概念数量,而非步骤数量。只要价值传达清晰、过程有吸引力,用户愿意走完多步流程;反之,塞入过多概念(他点名 Buzz 的 onboarding)会让人流失。 2. 不要迷信 Skip 按钮。AI 工具跳过引导后,用户被丢进空白输入框,直接陷入"行动瘫痪"(action paralysis)。先教会用户产品能做什么,比让他们快速进入产品更重要。 3. 最终落地的三步:① 你拥有的是一个 Agent 团队(各有分工);② 每个 Agent 有自己的电脑(嵌入式 computer-use 窗口 + takeover 接管按钮——主持人称这是他的 "aha moment",因为云端电脑的运作首次变得透明可信);③ 任务可自动化运行。 4. 被砍掉的方案及原因:连接 Google 做个性化定制(信任未建立,用户不愿授权);语音引导(跟风 ChatGPT/Claude 语音模式,但新用户"不知道该说什么",时机错误)。 5. 用动效"买时间":信息逐步流入的动画,既表现 AI 在思考,又掩盖了加载延迟。 # Cursor 的设计文化 没有两个设计师流程相同:有人纯代码起手(做 Cloud Agents 的 Maya 甚至没有 Figma 文件,只交付 Vercel 可交互原型),有人用 Paper,John 自己仍以 Figma 起草——但 Figma 的定位已变为"喂给 Agent 的素材与故事板",文件本身是完全一次性的(throwaway)。 Agent 深度参与设计执行:John 把 Notion 文档丢给 Bot,让它在 Figma 里自动布局数十个 logo 变体、填充组件网格——过去需要手动 Google 找 SVG、缩放对齐的重复劳动全部外包。后期他甚至跳过 Cursor,直接让 Agent 在浏览器里生成多个方案。 高保真评审文化:每个想法必须附带可交互原型,crit 时发链接让所有人亲手试用。"静态走查已经不够用了"——这迫使设计师在分享前就验证方案是否成立,避免"给烂方案抛光"。 沙堡心态与 unshipping:设计师不能对自己的概念有执念("can't be precious"),早期探索注定大量被丢弃,但碎片会进入最终产品;公司内部有强烈的"反上线"(unshipping)文化,靠删除来收敛复杂性。 他引用 Colin Dunn 的 "informed simplicity":用户觉得"理所当然"的简洁,来自设计者先极度发散、再极度收敛的过程。 # 团队、招聘与反馈机制 团队:冲刺期共 5 名设计师,按各自强项自然分工(John 做探索与 onboarding,Pong、Keith、Tyler、Mamuso 抛光主壳),品牌团队主导命名与形象迭代。 招聘标准:基本功优先于工具数量、出活速度或"模型优化技巧"。核心考察能否真正 ship 产品、是否有体现 PMF 寻找循环的工作流程——"现在什么都能造,但不是什么都值得造。" 反馈处理:坚持用户研究 + 数据驱动。重视深度用户(如主动向 power user 私信索取详细反馈,再让 Bot 汇编成 Notion 文档同步团队);数据洞见直接指导迭代——用户常用 Bot 少于 5 个(影响信息架构)、授权认证是主要卡点、吉祥物反响强烈(故提升其存在感);同时密切观察用户自发"hack"出的用法(如 iMessage 版 Bot),顺势纳入设计。 # 实际使用场景(产品能力的具象化) John 本人:妻子申请绿卡,让 Bot 扫描邮箱自动找出过去 5 年的租约与账单;租房监控(定时抓 StreetEasy 房源,按"靠近地铁蓝线"等条件排序);跨工具流水线(Slack 反馈频道 → Notion 数据库 → 自动更新 Figma 设计,人只需验收)。 主持人 Rid:梦幻橄榄球 GM Bot(抓取公开交易数据 + 动态竞价模型);QA Bot(每日自动跑完全部产品流程、生成工单,置信度达标即直接派给 Cursor Agent 修复)——他在机场行李提取处用手机修好了此前两次都没修好的 bug。 John 的总结颇具代表性:"我现在默认它什么都能做,因为我还没碰到过墙。"
显示更多
一昨日、トリッパー遊園地のよーこねえと純ねえと座長とふみさんが観に来てくれました💕 本当に大好きなみなさん^ ^ 今日でラスト…😭頑張ります! #いしのようこ# さん #純名里沙# さん #サラリーマンナイトフィーバー#
显示更多
0
65
1.1K
192
转发到社区
明日から大阪松竹座で公演です! #純名里沙# さんがハルちゃんに似合うって思ってって言ってとってもかわいい綿棒をくださりました!💞 純ねえありがとうございます🥺✨ 明日もがんばる! みんな来てねっ #トリッパー遊園地#
显示更多
0
82
858
114
转发到社区
寝癖がすごすぎる! 今日も頑張ります! 昨日は純名里沙さんのお誕生日でした💕
0
81
890
111
转发到社区
LMSYS Arena已经是目前整个 AI 圈公认含金量最高、最难刷榜、水分最少的榜单了。 比起某些厂商自己发论文、用固定题库比如MMLU、HumanEval跑出来的作弊满分 ,Arena 机制更像电竞比赛的排位天梯赛。 看到这个 2026 年第 25 周AI代码能力的排名,我有这几个最直观的看法。 Claude江山稳固。 Claude-Fable-5 强势空降第一。直接登顶。更夸张的是,前 20 名里它家占了 9 个席位,包括各种版本的 Opus 和 Sonnet。在代码和复杂工程领域,Claude 依然是很多程序员的本命。 这次最亮眼的黑马绝对是国产的 GLM-5.2 Max,直接冲到了全球第二。 这代表国产模型在纯代码逻辑、Debug 和架构设计上,已经真正具备了跟国际顶尖模型贴身肉搏、甚至全面超越大部分旧旗舰的硬实力。 Thinking模型已经成为标配。 这种通过长思维链反复推演、自己 Debug 完再输出代码的模式,已经在盲测中被全球开发者用脚投票,证明了它在应对复杂项目时的胜率更高。 前 20 名里,国产模型占了 7 个席位。而且阿里的通义千问和月之暗面都咬得很紧,甚至还推出了专门的 ⁠kimi-k2.7-code⁠ 这种垂直上榜的特化型号。 国内在大模型数据清洗、工程落地和代码对齐上的技术已经非常成熟。 这种榜单的更新、迭代,对开发者来说是天大的好事。 模型之间卷得越厉害,平时写代码、跑 Cursor、调 Agent 时的体验就越丝滑。 现在已经不是某一家模型独大的时代了。 针对不同的代码场景,比如要长文本上下文选 Kimi,要极致推理逻辑选 Claude、GLM,组合使用才是性价比最高的方式。
显示更多
0
55
95
14
转发到社区
支持埃及🇪🇬足球队。 支持🇪🇬主教练说的话。 引用:当然,谢谢你。我非常高兴,我感谢我的所有球员,以及教练组、行政和医疗团队的所有人。感谢真主,我今天带领的是一个纯本土班底的教练组,并且带领着大约23到24名球员——他们全都是效力于埃及本土联赛的本土球员。我们对抗了世界上所有的那些身价最高的球员,我们用本土球员和他们抗衡。我们拼搏了,我们是表现更好的一方,我们比卫冕冠军表现得更好。 我们在所有方面都更加出色,但是结果却受到了一些因素的影响,不是外部因素,而是球场内部的因素,以及赛前场外的因素。很明显,阿根廷方面在赛前对裁判施加的压力奏效了。他们之前对裁判有异议,因为法国或者不是法国的原因,或者是为了法国国家队。我想说,在生活中并不是所有按照正确方式进行的事都能顺利,只要你走正道,你就会经历艰辛。所以我们走在正确的道路上,我们很努力,但是我们被外部因素伤害了。 当然,所有在场的那些外国的大人物们,他们什么感觉都没有,因为他们根本就不在乎。我得说,我们原本理应获胜,我不想对我们自己说“运气不好”,不,我们在我们这里展现了荣誉,体面地出局了。但是结果不一样,这个具有决定性的结果完全违背了国际足联倡导的公平竞赛原则。今天没有尊重,也没有公平竞赛,今天这里没有任何尊重,也没有公平竞赛。 今天我们被判了一个点球,第二个球本来应该是我们的点球,但裁判甚至连VAR都不愿意去看一眼。我们进了一个球,进第二个球的时候我们本来是2-0,却被一种奇怪的方式取消了。而且虽然说是VAR决定的,但是实际上根本没有VAR。在我们丢的那个球里,球员在18码禁区内被拉拽,裁判并没有判罚,反击回来却成了对方的进球,本来应该是2-1的。但他甚至都不屑于去看一眼VAR,不屑于走到场边去看VAR。但是当需要用VAR来取消我们的进球时,VAR就出现了。 这生活、这世界依然是不公平的,不公平的。不仅仅是普通生活中不公平,足球中也没有公平,体育中也没有公平,根本没有。我不服气,我根本不服这场比赛。我对我的球队的表现很满意,但是我不服比赛当中发生的一切。我不会去说那些被粉饰过的漂亮话,说什么“运气不好,很好的评价,对阿根廷来说是不错的比赛结果”。不,不,我绝对不会这么说。我会说,我们今天确实受到了不公正的对待,因为在上一场比赛之后发生的种种事件。
显示更多
微信吃掉你电脑几百 G 硬盘这事儿,终于被 GitHub 上的狠人给治了。 昨天在 GitHub 榜上挖到一个叫 WxCleaner 的神器,专门用来清理微信电脑版里那些成堆的重复文件。平时工作群里一个文件转发八百遍,全存在你本地,这玩意儿能一次性全给你揪出来。纯开源免费,没有任何套路。 核心卖点直接看: ⚡ 哈希极速扫描:不是按文件名瞎搞,底层用的智能哈希算法。文件只要内容一样,不管你怎么改名,瞬间现原形。 👀 可视化防误删:自带图片/文件预览界面,删之前看得清清楚楚,手滑党完全不用慌。 🗑️ 后悔药机制:绝对安全!清理掉的文件不是直接粉碎,而是全部移到回收站,万一删错随时能捞回来。 🆓 白嫖党狂喜:纯本地运行,不联网传数据,安全、干净、无广告。 🔗 传送门:
显示更多
我翻完小红书Red Skill最新的Top15数据后背有点发凉,这根本不是什么小功能测试啊。 5月份归藏第一个把PPTSkill传上去的时候,详情页显示只有6个人用,当时我就说这是个大事件,不少人还觉得我小题大做,说什么一个种草APP搞点AI功能蹭热度而已,折腾不出水花。 结果7月3号小红书官方两个更新就甩出来了,直接把所有质疑给打没了。 先是格式全放开,之前还只支持txt和md,现在py/js/html/c++/sql甚至数据库文件全能传,不是只能写提示词给Agent读,是真能跑完整代码做完整功能。 再就是另一项 vibecoding 内嵌交互小工具内测将在下周三上线,发笔记时挂上组件,用户刷到不用复制口令跳本地Agent,半屏就能调,全屏能交互,点一下直接分享到微信,那个记录奶茶口味的小工具Brewwww,上线没多久就有一万多人用。 数据是不会骗人的,现在排行榜第一的「菜菜的人生系统」,32.6万曝光,4万多人次使用,第二名的工作日程管理曝光量甚至更高。 而且说实话,这些作者要是把同样的Skill传到GitHub,绝大多数人攒一整年都拿不到这个量级的真实用户。 以前大家以为AI Skill的分发中心,一定是GitHub,觉得普通人找AI工具,一定会主动搜索,甚至认为小红书这种生活方式平台,做不好技术产品分发。 现在看全错了。 GitHub是开发者主动找工具的地方,你有明确需求才会去,网络卡,门槛高,普通用户连门在哪都不知道。 而小红书是用户刷着刷着,正愁PPT做不完、周报写不动、公考复盘没方法,笔记下面正好挂着能解决问题的Skill,点一下就能用,上下文严丝合缝,连教育成本都省了。   我觉得小红书平台这步棋走的极聪明,它不拼大模型,不抢算力,就攥住「用户在什么场景下需要什么能力」这个分发入口,和当年App Store不做手机应用、只攥住应用下载入口的逻辑一模一样。 给真在做Skill的朋友四个现在就能用的反直觉判断: ● 别光传Skill就干等,一定要包成教程笔记,先讲痛点再秀效果最后挂组件,纯扔文件没人看,现在排行榜上的作者全是这么做的 ● 别上来就做什么通用大Agent,越垂直越爆,公考、剪辑、写广告、甚至记录奶茶,这些看起来不技术的场景,流量比通用类高10倍 ● 别嫌审核严不敢进,现在正是窗口,规则没卡死你先攒使用数据,等所有人都反应过来往里挤,算法的早鸟权重早就喂满了 ● 别天天想着卖Skill赚钱,Skill是杠杆,你用它产出比别人好10倍的内容,涨粉做IP接商单,比直接卖Skill赚的多100倍 我记得移动互联网刚起来的时候,所有人都在拼操作系统拼硬件,但最后拿走最大利润的,是先把全民应用分发跑通的那个。 现在Agent时代刚开个头,大家都在拼参数拼算力拼模型性能, 但等到回头看的时候,可能第一个把AI能力分发到普通人手里的,是当初所有人都觉得不务正业的那个种草APP啊hhh #redskill# #rednote# #skill# #小红书#
显示更多
0
91
130
9
转发到社区
聊最强模型这事本身就挺搞笑的。现在这赛道卷到什么程度?你今天排完名,明天就有人发新版本把你脸打肿。但不排吧,老有人问。 行,那就按2026年6月底的情况,综合Arena人类偏好、Intelligence Index、编码、Agent表现这些维度,聊聊我心目中的全球前十。 - (以下排名纯个人看法,别杠,杠就是你对。) 1:Claude Fable 5(Anthropic) Anthropic 6月9号放的Mythos级公开模型。目前Arena人类偏好榜稳坐第一,长时程Agent和复杂推理是真的猛。 你要搞那种专家级任务,几小时的深度研究、多步骤自主Agent,这台目前是最靠谱的选择。有一说一,贵是真贵。 - 2:Claude Opus 4.8(Anthropic) 觉得Fable 5太激进、不稳定?Opus 4.8就是那个"稳如老狗"的选项。 编码、长上下文、复杂Agent工作流,表现极其可靠。很多专业开发者现在的主力机就是这台。 怎么说呢,它可能不是每一项都拿第一,但综合可靠性和能力,依然是旗舰中的旗舰。 - 3:GPT-5.5(OpenAI) OpenAI目前最成熟的日常模型。通用能力均衡得一批,工具调用和生态就不用说了,ChatGPT那套东西太完整了。 多模态体验也优秀,适合不想折腾、拿来就用的多数人。呃,但实话实说,硬核推理上已经被Anthropic拉开了。 - 4:Gemini 3.1 Pro(Google) Google目前的最强前沿模型。数学推理和多模态(图像、视频)这块是真的硬,研究分析类工作用它很舒服。 但Agent能力嘛,还在追。适合需要高准确性的场景,不适合拿来搞花活。 - 5:Qwen3.7 Max(阿里) 这是目前中国模型里综合最强的,全球前五没毛病。能力均衡、什么都能干,编程、长任务、日常使用都表现不错。 最关键的是性价比杀疯了,价格只有前面那几个美系模型的几分之一。日常主力选它,钱包不疼。 - 6:Kimi K2.6(月之暗面) Moonshot的旗舰。超长上下文是它的杀手锏,多Agent协作也玩得转。 你如果经常搞长文档总结、深度研究、复杂工作流,这台绝对是利器。 短板?通用场景不如Qwen均衡。 - 7:GLM-5.2(智谱AI) 智谱最新一代,编码和Agentic任务是真的有点东西。 开源权重版本性能也强,适合自己折腾、做二次开发的玩家。 coding场景下甚至能跟Claude掰掰手腕,不开玩笑。 - 8:DeepSeek V4 Pro(深度求索) 极致性价比的代名词。推理和编码能力接近前沿水平,但价格低到离谱。 说白了就是"差不多够用,但便宜得要命"。社区里目前最受欢迎的高性能低成本选择,懂的都懂。 - 9:MiniMax M3(MiniMax) 效率取向的选手,特定场景下性价比优秀。适合对速度和成本极度敏感的生产环境。 不是最强,但该干的活都能干。 - 我的几点观察: 美系闭源还是霸着前四,Anthropic和OpenAI目前确实在领先位置。但注意,差距在缩小,不是错觉。 中国模型从第五名开始强势插入,Qwen3.7 Max是最均衡的代表。 而且在性价比维度上,中国模型(Qwen、DeepSeek、Kimi、GLM)已经可以说是碾压了。 很多实际场景能跑到前沿模型80-95%的效果,成本只要几分之一甚至几十分之一。这不叫卷属于降维打击。 开源权重这块更不用说,中国模型目前明显领先。 - 如果你问我怎么选: 追求极致、预算无限的话:Claude Fable 5 或者 Opus 4.8 。 日常主力、讲究性价比:Qwen3.7 Max,闭眼入 。 重度编程/Agent开发:GLM-5.2 或 DeepSeek V4 Pro 。 长文档和分析研究:Kimi K2.6。 这个排行保质期时间很短。AI这行现在就是这个节奏,你今天看完明天可能就过时了。 实际用起来别死磕一个模型,根据不同任务组合使用才是正道。 你目前主力用的是哪个?评论区聊聊。
显示更多
0
41
36
1
转发到社区
目前的 AI 编程能力排行榜,中国的开源模型把 TOP5 的 4 名都给占了,上面这些模型基本上都用过,简单聊一下使用感受。 1、Anthropic 的 4.7 是两个月前发布的能力还是第一,更何况还有前端时间封禁的 Fable 刚刚解禁,领先国内半年左右,目前国内顶级模型相当于Opus 4.6(2月5日发布),GLM-5.1是最争气的才 2 个月就追上了4.6大概能达到 90% 的能力,论编程能力还是国内第一。 2、最新的 GPT 5.5 在 codex 里使用能力是最强的,黑话还是很多,而且产品上比 Claude code 做的更好,更适合执行实际的工程任务,边界判断和测试更多。Google 的 Gemini 已经变成美国豆包了,主打性价比。meta 的模型没用过不知道实际能力如何。 3、Qwen 3.7 max(5 月 20 日) 目前综合能力第一,因为有多模态和多语言优势。有专门优化过智能体设计,放到 Claude code、openclaw、hermes 里面都可以很好的使用工具链。 4、GLM-5.1 (4 月 8 日)最早追平Opus 4.6的能力,主打长程任务,一直都被称为 Claude 平替花 20% 的钱达到 90% 的效果,从GLM-4.7发布半年多以来确立领先地位,多次提价依旧火爆,大概领先其他国内模型1个月左右时间。但比较可惜5.1 是一个纯文本模型,还不具备原生多模态能力,一般两个月时间迭代一次,估计下一代快来了。 5、Minimax m3(6 月 1 日) 占了晚发布的优势,也是第一次进入前五,把 minimax 多模态的能力合并进来了,模型参数量也翻倍,所以这次提价也算合理。但实际体验下来m3的规划能力相比来说稍差,同样一个任务需要更多的步骤。 6、Kimi-k2.6(4 月 20 日)Agent 集群协作,是国内里最早支持多模态的,前端审美能力在线,cursor 的编程模型基座就是基于k2.6 7、DeepSeek-V4-Pro(4月24日)和MiMo-V2.5-Pro(4月24日)两个能力接近,DeepSeek还是价格屠夫,API 定价永久 2.5 折,缓存命中率高,不搞 Token plan,因为每个人都是 Token plan。MiMo原来定价偏贵,降价以后两者差距其实不大了。两个模型在写作能力上表现不错,如果你是写文章可以用这两家 8、xAI 表现很拉,唯一强项在 X 的搜索能力,腾讯的hunyuan-hy3也比较一般,但在腾讯产品内有专门调优过,可以跟上其他模型的上一代标准,代码就别指望了。普通的简单任务因为腾讯有更好的数据源,实际表现也不会差太多。腾讯最强的点在于它独有的上下文优势。
显示更多