注册并分享邀请链接,可获得视频播放与邀请奖励。

与「场景设计」相关的搜索结果

场景设计 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 场景设计 的内容
YC开源了他们内部使用的多Agent协作框架,名字叫QM。 QM的定位介于个人助手和企业级系统之间:市面上大多数Agent是按“个人助手”来设计的。QM从一开始就是为公司场景设计的,每个员工有自己独立的工作空间,互不干扰,同时又能在频道、群组、项目里跟Agent协同工作。每个人、每个团队都有各自的记忆、文件、密钥视图、权限、定时任务和持久沙箱。 YC自己在会计、法务、活动、工程等多个部门都在用QM,甚至QM本身的开发也用QM来做。项目原生支持Slack和Web两端。 核心的能力: · 触发器:支持定时任务(cron)和webhook · 记忆与共享文件:个人和团队两种作用域 · 连接器:连接内部知识、文档、数据库 · Agent浏览器支持 · 可分享的Web应用:能直接搭内部小应用并发布给指定人 · 多人协作项目 Github:
显示更多
0
18
135
27
转发到社区
在代理经济中,两个人工智能代理之间的交易常常卡在模糊的边界上。举一个具体的例子:一个购物代理受用户委托,寻找并采购一套定制家居用品。它与一个服务代理达成协议,由服务代理负责产品定制加工、质量检验和准时配送。双方通过智能合约托管全额付款,条款写明需在七天内完成、产品符合预定规格且无瑕疵。服务代理按时加工完成并发货,但途中因包装细节处理不当导致轻微划痕,实际到货时间也晚了半天。购物代理收到反馈后只释放部分款项,主张服务未达“完好交付”的整体要求。 争端的实质在于条款的解释余地。“符合规格”和“准时”在现实中不是二元判断,而是需要权衡上下文、意图和实际影响。服务代理可能诚恳认为已尽合理努力,购物代理则坚持结果导向。如果没有中立机制,任何一方都会自然倾向于利用这些空间来保护自身利益。结果是资金冻结、信任崩塌,整个交易链条断裂。这种摩擦不是极端个案,而是代理在模糊现实中大规模运行时必然出现的结构性问题。 传统智能合约在这里束手无策。它们只能严格执行预先写死的确定性逻辑,无法阅读自然语言描述的质量标准、分析交付证据的细微差别,或判断一个行动是否实质上符合协议精神。代码擅长“如果-那么”,却处理不了“是否足够好”这类需要推理的问题。 其他常见方案同样难以匹配代理经济的速度和规模。外部预言机能喂入数据,但对主观质量评估和意图解读缺乏深度推理能力,还可能引入新的单一依赖点。人工审查或平台仲裁虽然能给出意见,却需要人类时间,成本高、吞吐低,根本跟不上每秒数千笔的代理间互动。传统法院则更遥远,程序漫长、费用高昂,完全不适合微额、高频的数字交易。 @GenLayer作为代理经济的裁决层,直接针对这类场景设计解决方案。当争议触发时,智能合约会将案件提交给网络。多个验证者各自连接不同的AI模型,独立审视合同原文、交付记录、沟通日志、产品照片以及任何必要实时信息。它们各自推理:这个结果是否在实质意义上等同于协议要求的标准?是否符合整体精神而非字面死板解读?通过共识流程,这些独立判断汇聚成一个统一结论。如果存在分歧,流程可继续验证直到稳定。最终决定直接上链执行,比如按比例释放托管资金或明确责任分配。 这个过程几分钟内完成,避免了任何单一模型或实体的偏见主导。代理无法再轻易用条款歧义逃避责任,因为裁决来自去中心化、多视角的集体推理,而非预设规则或中心化中介。它本身不扮演新的可信第三方,而是让分布式判断替代了对传统信任的依赖。 类似摩擦在现实中早已出现。自由职业平台上,交付物“是否达标”的拉锯往往拖延数周;保险理赔中对“合理必要”的解释争议也经常让双方陷入僵持。这些案例反复证明,没有机器速度的裁决机制,代理经济就无法真正规模化运行。 @GenLayer
显示更多
0
72
67
0
转发到社区
之前就听说豆包在憋一个新模型,能力可以达到 Opus 4.6 水平,今天终于在 FORCE 大会上公布了。 官方给的跑分数据,有些地方能跟 Opus 4.7 比一比了,不过能不能在真实项目里打,还得等我上手一段时间再说。模型的定位比较明确,专门为 Coding 和 Agent 场景设计的,最大变化是「需求理解 + 长期规划 + 持续修复」这一套能力拉上来了,奔着让 AI 能独立交付完整工程项目去的。 价格比 Claude 和 GPT 的 API 定价有优势,不过对比 DeepSeek V4-Pro 就不够亲民了。 这两天微信的原生 AI 助手「小微」也在灰度内测,能直接操作微信功能、调起小程序。国产 AI 这波是真的在不同层面集体发力了,你看好吗?
显示更多
用 Claude Code 和 OpenClaw 来理解 Harness 的区别 Claude Code 和 OpenClaw 背后用的是同一颗大脑(Claude),但它们是两套完全不同的“身体”——两种不同的 Harness。 Claude Code 是 Anthropic 官方打造的 Harness,专门为编程场景设计。它给大脑装的“身体”比较专精:能直接在终端里跑命令、读写文件、操作 Git,整个循环是“想→做→看结果→再想”。最近又加了 Channels 功能,让你通过 Discord、Telegram 远程跟它交互——相当于给这个身体加了一部手机,人不在电脑前也能指挥它干活。 OpenClaw 则是社区打造的一套更通用的 Harness,设计理念不同——它不只是一个编程助手的身体,更像一个“全天候管家的身体”。它能同时连接 Slack、Discord、Telegram 等多个渠道(多个耳朵和嘴巴),有自己的记忆系统和插件生态,还能通过 ACP 协议调度 Claude Code、Codex 等多个 Agent 协同工作——相当于一个管家指挥多个工人干活。 所以你看,同一颗大脑,Claude Code 给它装了一副“程序员的身体”,OpenClaw 给它装了一副“项目经理的身体”。能力天差地别,但大脑没换。 Harness Engineering 就是“造身体的工程学”。 怎么设计记忆系统让大脑永远“了解情况”?怎么设计工具接口让大脑高效调用外部能力?怎么处理大脑犯错的情况?怎么编排多个 Agent 协作?这些都是 Harness Engineering 要解决的问题。模型大家都用同一个,但谁的“身体”造得好,谁的 Agent 就更强——模型智商是起点,Harness 的质量决定了实际表现的上限。
显示更多
Codex Slides 正式开源!🚀 我们直接把 Codex 变成了 PPT 大师,让 Codex 真正拥有“可视化一切”的能力 🔥 以后你不需要再到处找模板、不需要手动调版式、不需要把复杂资料一点点改成 PPT。 直接把 repo、PDF、研究文档、产品方案、甚至一堆乱七八糟的想法丢给 Codex,Codex Slides 会把它们变成漂亮、清晰、可编辑、可导出的 slides! 这次最大的突破是 image-to-slides: 让你的 Codex 用图片式生成,把复杂概念直接变成视觉表达,3~6 分钟级fast 模式生成顶尖水准 ppt。 内置数百套风格模板、场景和设计体系,支持深度搜索、大纲生成、配图、灵感参考,随时导出 pptx / pdf。 Codex 识别就能用,无需配置,可以直接在 Codex Browser 里打开操作。 这可能是目前最强的 Codex PPT 插件🔥🔥🔥
显示更多
超绝干货,随意一张照片拆分12宫格分镜 有了这个, 你还怕女神不按照你的想法运动吗?🤭 记得回来返图,让我瞅瞅 🙌 提示词:以图片为唯一参考基准,在同一场景下生成12格分镜矩阵,采用3种机位高度X4 种景别的固定逻辑。保持主体、环境、服装或产品设计、光线方向、时间、氛围、色调及整体风格与图片1完全一致。不重新设计场景,不新增道具、人物、动作或剧情素,画面之间仅允许机位高度和取景距离发生变化。 按清晰的3行4列排列12个镜头 三行机位高度分别为:平视中性视角、低角度仰拍、高角度俯拍。 四列景别分别为:远景、中景、特写、超特写。 1、远景:展现主体与环境的空间关系 2、中景:展现姿态肢体语言与空间互动 3、特写:聚焦面部、上半身或关键动作区域 4、超特写:突出具有表现力的细节,如眼睛、手部、武器、物体纹理或其他重要局部 平视镜头稳定、客观;仰拍镜头增强气场、力量感或紧张感;俯拍镜头营造空间俯瞰感、脆弱感或视觉掌控感。
显示更多
Google这次更新把图像生成和视频生成串成了一个极致高效的流程。 他们推出了Nano Banana 2 Lite(超快超便宜的图像模型,4秒内出图)和Gemini Omni Flash(支持视频生成和对话式编辑的多模态模型)。 单独看已经很快,但真正有意思的是把两者结合:先用Nano Banana快速生成图像,再直接扔给Omni Flash生成动画,整个链路成本大幅降低。 演示里展示了一个室内设计场景:上传照片后快速生成多个方案,再直接动画化呈现。 这种“图像→动态视频”的闭环速度和成本,在目前主流模型里算比较激进的。 本质上Google在把创意工作流从“生成一次等半天”变成“快速迭代+即时可视化”。
显示更多
我用 TRAE Work 测了 豆包 2.1 Pro:视觉还原和前端设计、交互能力,真的超出我的预期了! 字节跳动最新发布的 豆包2.1 系列模型,官方介绍整体在 Coding 和 Agent 能力上有显著提升,VLM 能力保持领先,能力介于 Claude Opus 4.6 和 4.8 之间,这在项目中就很有想象空间了。 在进入正式项目中使用体验之前,先找一个前端设计图还原实现的题目,结合它的 Coding 和 Agent 能力,特别是 VLM 对设计图的布局、设计要素、细节、场景的理解。 我把操作过程录屏,可以看到我让 豆包2.1 参考的设计图,和一句简单的要求,它在执行前,会先思考整个规划和实现过程,然后读取我的设计图、理解它的使用场景和设计细节等,再调用对应最合理的 Skill 来规划整体网页实现逻辑。分步骤实现网页编写后,使用本地预览和视觉验证等来验证实现符合规划预期。 整体实现完成后,输出在视觉还原、交互和技术实现方面的实现细节,可以看出,非常细节,包括设计图中的设计感、布局,甚至不同标题和字体选择,都很贴切,自适应布局也是默认就有且很丝滑。 最让我意外的是,它居然还给每个部分真的配了有实际意义的图,而不只是占位!
显示更多
0
24
17
4
转发到社区
简评Google I/O 2026 Gemini Omni:容易被低估的模型。如果你只看现在已发布的Gemini Omni Flash模型,会觉得这个视频模型很垃圾,完全比不上Seedance 2.0,我一开始也是这么觉得的。实际这个模型就不是视频模型,而是any2any的世界模型。 Gemini Omni未来的形态是:支持文本、图片、视频、语音输入,支持输出文本、图片、视频、语音。只是目前发布的版本是输出视频。 你可能会说豆包现在不就支持吗?豆包是有个Agent来调用不同的LLM模型、语音模型、图片模型、视频模型来分别生成对应形式的回复,各个模型是割裂的。世界模型能同时理解和输出所有形态的内容,实现难度要大的多的多。 Gemini 3.5 Flash:Gemini 3.1 Pro的能力,超快的生成速度,比GPT 5.5快4倍。但总体我觉得不行,快不是快,好才是快。Gemini 3.5 Flash就是傻快傻快的。 Antigravity 2.0:跟Codex一模一样了,里面的Gemini 3.5 Flash还要更快,比GPT 5.5快12倍。不过无所谓了,我用Antigravity也只是为了用里面的Opus。 Gemini Spark:实时在线的云端Agent。谷歌给你启用一台云端虚拟机,有Harness环境,在云上可以全天执行任务。你可以认为是给了你一个云端运行的龙虾。 Search in the agentic era:AI时代的搜索,由Gemini 3.5 Flash驱动,支持多模态信息输入来搜索,支持Agent持续监控要搜索的信息,支持生成交互式UI和信息图。人工手动搜索可以变成AI持续监控并推送新消息给你,这个比较有用。交互式UI和信息图如果能做成Claude里的水平,也会改变搜索模式,会影响后面展示的网页的点击人数。 Ask YouTube:搜索YouTube视频,并且能根据你的问题直接跳到视频中相关的时刻,省去了手动拖进度条。有用,自家产品集成AI,其他AI做不到。 Voice-powered Docs Live:语音编辑文档。鸡肋,跟我语音输入法让AI写文档差别不大。 第8代TPU:针对训练和推理场景,分别设计了架构,训练芯片叫TPU 8t,推理芯片叫TPU 8i。顶流芯片,英伟达真正的竞品。 SynthID:AI生成内容的隐水印。AI生成的图片和视频越来越难分别出来,有这个隐水印,把视频和图片发给AI,AI就能告诉这个图片是不是AI生成的。亟需推广,目前OpenAI、Kakao 和 Eleven Labs也开始采用谷歌的SynthID。
显示更多
openai 的 Codex 官方文档越做越好了,简直是个金矿,最近发了一篇 Codex User Case: 针对不同场景,官方总结了你应该要使用的 skills 和 plugins,对应的步骤,要使用的prompt,完全按照它的流程就能达到最佳效果,虽然现在还不是很多 case,但是也覆盖了大部分的开发和设计场景。 以后用 Codex 也不用看别人的总结文章了,直接看官方文档就行。
显示更多
0
8
628
110
转发到社区