注册并分享邀请链接,可获得视频播放与邀请奖励。

与「全模态模型」相关的搜索结果

全模态模型 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 全模态模型 的内容
一图看清 Google I/O 2026 今天的发布! 虽然很多内容前几天都 Android Show 预告了,但这次能更系统的看到 Gemini 与 Search、Workspace 还有 XR 硬件生态的融合,以及全模态 Omni 的最新进展,这次主题:从 AI 工具,走向 AI 代理✨ Gemini 模型与代理 - Gemini 3.5 Flash:新快速旗舰模型,已推出(快 4 倍,推理/编码强于 3.1 Pro),作为 Search AI Mode 等默认后端。Gemini 3.5 Pro 预计下月发布; - Gemini Omni:全新多模态模型(视频优先),支持“从任何输入创建任何输出”。可从文本/图片/视频生成或编辑视频,添加特效、角色、改变风格/场景、生成多角度(多代理并行)。已在 Gemini App、Flow 等产品上线。这被 Demis 视为向“创造任何事物”愿景迈进的重要一步! - Gemini Spark:个人 Agent AI,能在后台主动做事(如规划 Instacart 订单、跨应用自动化)。一个可以在云端 7x24 小时运行的 Agent Harness👀 - Daily Brief(个性化早报)、Gemini for Science(科研辅助:论文追踪、药物发现模拟、天气等)。 Search 大升级 - 全新智能搜索框:更对话式、可扩展,支持创建/管理多个 AI 代理; - Information Agents:后台 24/7 监控网络任务(如股票、房源、球鞋发售),变化时主动通知; - 在搜索结果中集成生成式 UI、小程序/仪表盘等更便捷的用户体验; Workspace 与生产力工具 - Docs Live / Gmail Live / Google Keep:语音自然指令创建/编辑文档、整理收件箱、清理笔记(拉取 Gmail/Drive 等数据); - Google Pics:全新 AI 图像/设计工具(夏季推出); - Universal Cart:跨 Search、Gemini、YouTube、Gmail 的代理式购物车,跟踪优惠、价格历史、库存等(夏季推出)。 硬件与 Android XR - 智能眼镜(Audio Glasses):今年秋季推出(与 Samsung 合作,Warby Parker、Gentle Monster 等设计款)。内置摄像头/扬声器,支持 Gemini 私人语音辅助、实时自动化(如通过手机 App 点咖啡、播放音乐),支持 Android 和 iOS; - Project Aura 等更高级 AR 眼镜原型; - Android Halo:管理 AI Agent 的专用界面,将会集成到 Android 系统里!你早晚不需要亲自来使用手机 App,直接问 Gemini 或者通过眼睛这样的穿戴这边就行,估计下个月 WWDC Apple 的 Siri 就是往这个方向改进的🤔
显示更多
0
15
73
20
转发到社区
究极"拼好模"出现了! 字节跳动 Lance! 字节跳动刚发布了一个开源模型 Lance, 激活参数量只有 3B. 但是这个模型可以接受文本, 图片, 视频输入, 然后同时可以输出文本, 图片, 视频! 所以这一个模型就能完成像图片理解, 视频理解, 文生图, 图生图, 图片编辑, 文生视频, 图生视频, 视频编辑等任务. 而训练团队在技术报告中透露, 训练成本仅仅是 128 涨 A100 显卡 (按照大厂算力来说纯纯是把冗余算力拿来用了). 那为啥说是"拼好模"呢? 原因是团队并没有完全从0造轮子. 模型的视觉输入模块直接用了 Qwen2.5-VL-ViT (用来看图和视频), 而视觉输出模块是 Wan2.2_VAE (用来画画). 而模型本体是两个: Lance_3B (用来做图片的理解、生成或编辑任务) Lance_3B_Video (用来做视频相关的任务, 比如文生视频、图生视频) 所以, 这完全是一个研究性项目了, 而项目本身的亮点其实恰好是"拼得好". 这个模型不像之前许多自称为全能模型那样直接把大语言模型 (LLM) 和扩散模型 (Diffusion) 硬拼接在一起 (即所谓的 Pipeline 方案) . 而是在一个共享的交错序列 (Interleaved sequence) 中同时处理文本、图像和视频的上下文. 这样做最大的好处是统一了语义空间, 让模型的理解能力和性能更好. (从评测来看3B就接近了许多10B甚至20B模型的水平) 另外还引入了多任务协同. 简单来讲, 理解任务 (图片转向量) 和生成任务 (向量转图片) 在模型内部本身是互斥的. Lance 创新性地在同一个框架内加入了专用专家模块, 成功缓解了这种冲突, 让模型既能做 VQA (视觉问答) , 又能做图像/视频生成和编辑. 期待一波实际应用落地, 这个模型对于端侧和多模态 Agent 来讲意义是重大的, 有很多之前需要多个模型协作的场景都能用单个模型做了. #lance# #全模态模型#
显示更多
0
11
181
18
转发到社区
小米今天正式发布了MiMo-V2系列旗舰模型,包括 1.MiMo-V2-Pro:总参数超1T(激活42B),专为Agent场景优化,支持1M超长上下文,全球Artificial Analysis排行榜第8、国内第2。 2.MiMo-V2-Omni:全模态基座模型(文本+图像+视频+音频理解),音频理解能力超Gemini 3 Pro。 3.MiMo-V2-TTS:端到端语音合成模型,支持高保真、多语种、自然情感表达。 (ai语音说话) 相关链接 官方API开放平台(接入、定价、文档): (MiMo-V2-Pro API定价:256K内输入$1/百万tokens、输出$3;1M内输入$2、输出$6。注册后可立即获取Key。) 在线体验平台(MiMo Studio,含MiMo Claw Agent演示,直接免费试用MiMo-V2-Pro的Agent能力): (推荐从这里开始玩,网页端就能体验“养龙虾”式的复杂任务,比如自动生成网站、操控工具等。) 初步评测: Artificial Analysis排行榜:MiMo-V2-Pro全球第8(综合智能指数),国内第二 (强调性价比最高之一,尤其在< $0.15/百万tokens价位段霸榜。) OpenClaw标准评测(PinchBench & ClawEval):MiMo-V2-Pro排名全球顶尖(第三,仅次Claude Sonnet 4.6和Opus 4.6)。在无人工干预下,能完成复杂工作流编排、长程规划、精准工具调用。 1M上下文下支撑真实高强度龙虾应用;早期匿名版“Hunter Alpha”在OpenRouter调用量超1T tokens,多日登顶日榜。 作如何和OpenClaw结合? MiMo-V2-Pro就是专为OpenClaw这类Agent框架深度优化的! 小米官方已宣布联合OpenClaw、OpenCode、KiloCode、Blackbox、Cline五大框架团队,提供一周限时免费接口支持(全球开发者都能白嫖)。结合方式:直接用MiMo API替换Claude/OpenAI Key(兼容OpenAI SDK格式),在OpenClaw的Scaffold(脚手架)里接入即可。 模型针对OpenClaw等框架做了深度SFT + RL强化,工具调用、多步推理、长程规划特别稳。 实际表现:在OpenClaw里能一步生成完整网页、自主处理报错/多标签切换、完成选品比价下单、制作短视频等复杂链路,像真人操作浏览器。 小米自己的扩展:他们还出了Xiaomi miclaw(手机端类OpenClaw系统级Agent),基于MiMo系列,能直接“动手操作手机”。 快速上手建议:去 Claw(内置OpenClaw式演示); 或直接在OpenClaw项目里换API Base为
显示更多
看起来 FLUX 3 要发布了。昨天黑森林工作室短暂地上线了一下预告。 说是支持图像、视频、音频和动作生成,是一个全模态的生成模型。 其中,单条视频支持一次生成 20 秒。 按他们正常的逻辑来说,这一般会是开源的。如果真的开源,那整个生态估计又要爽一波了。
显示更多
去年 8-10 月在图灵讲的《AI Agent 实战营》课程,终于整理成书啦,在 GitHub 开源发布了。《深入理解 AI Agent:设计原理与工程实践》欢迎大家下载传播 PDF,欢迎大家提意见、提 issue! 全书围绕核心公式 Agent = LLM + 上下文 + 工具 展开,十章内容如下: - 第 1 章 · Agent 基础知识:从"模型即 Agent"的新范式出发,建立 Agent = LLM + 上下文 + 工具 的核心公式,并引入 Harness 工程——模型之外的一切工程能力,才是真正的竞争力所在。 - 第 2 章 · 上下文工程:上下文决定 Agent 的能力上限。深入大模型 API 的上下文结构、KV Cache 友好设计、提示工程、动态提示词与 Agent Skills、状态栏元信息,以及上下文压缩策略。 - 第 3 章 · 用户记忆和知识库:让 Agent 跨会话记住用户、并接入外部知识。涵盖用户记忆系统、RAG 基础管道,以及超越扁平文本的知识组织与检索(结构化索引、知识图谱等)。 - 第 4 章 · 工具:工具是 Agent 的双手。讲工具分类与通用设计原则、MCP 协议与工具选择的挑战、感知/执行/协作三类工具,以及事件驱动的异步 Agent。 - 第 5 章 · Coding Agent 与代码生成:代码是"能创造新工具的工具",是通用 Agent 的元能力。以生产级 Coding Agent 为例,展示这一最强通用工具的完整实现。 - 第 6 章 · Agent 的评估:把 Agent 的表现变成可比较的信号。从评估环境、数据集设计、指标体系,到统计显著性、可观测性、评估驱动选型,直至生产级内部评估与仿真环境。 - 第 7 章 · 模型后训练:预训练、SFT、RL 三阶段全景。何时选 SFT、何时选 RL,RLHF、算法比较、数据与环境,以及让模型学会工具调用、提升样本效率的前沿探索。 - 第 8 章 · Agent 的自我进化:不改权重也能成长。三种学习范式,从经验中学习、主动工具发现,到"从工具使用者到工具创造者",让 Agent 从"聪明"走向"熟练"。 - 第 9 章 · 多模态与实时交互:把感知与行动从文本扩展到语音、GUI 与物理世界。语音三范式(级联/端到端全模态/全双工)、流式语音感知与合成、Computer Use 与机器人操作。 - 第 10 章 · 多 Agent 协作:群体的智能可以高于个体。多 Agent 分类框架、何时真正优于单 Agent、共享与不共享上下文的协作、失败模式,以及涌现的"Agent 社会"。 Repo:
显示更多
0
3
98
17
转发到社区
阿里前几天刚发季报,破天荒的第一次披露了模型与应用服务——其实就是MaaS——的经常性年化收入: 截至今年3月超过80亿人民币,预计6月达到100亿,年底突破300亿。 相当于半年3.75x的增长速度,大概也是基于如此乐观的势头,阿里才会难得的公布这个数字,向资本市场构建叙事。 所以你以为我要开始吹阿里了?错了。 阿里的AI收入,建立在阿里云这个中国最大的云计算平台上,阿里云拥有现成的客户群体、销售网络和算力资源,用配套升级的方式去叠一层AI服务收入,是很容易的。 所以真正要吹的,不是阿里的AI业绩凭什么增长这么快,而是如果连主要靠存量用户增加预算就能做到半年3.75x的增速,那么原生AI公司今年在同样的市场环境下,增速会飙到什么地步? 要知道,原生AI公司赚的每一块钱都是从零开始、靠着模型能力兑现而来的,除了更加纯粹的增长之外,因为不必承担其他业务的成本转移,ROI的负担也更小。 比如摩根士丹利测算发现MiniMax平均每分钟进账1美金,同时成本低于0.3美金,而行业平均收入只有约0.5美元/分钟,相当于MiniMax仅凭利润就跑赢了大盘。 这就是Pure-play的价值,算清楚这笔账,对于理解走向拐点时刻的AI行业,非常重要。 在研报里,摩根大通认为中国在2026年的企业端需求,很大概率会复制美国2025年至今的来路,也就是从试点到规模化投入再到AI成为固定支出的三级跳。 简而言之,就是Anthropic的那条离谱曲线。 Anthropic创造了AI行业还是商业史上的创收奇迹,300亿美金的经常性年化收入,让它成为了全球瞩目的新王,甚至让OpenAI的股份交易在一级市场失去了吸引力。 毫无疑问,Coding是一个回报路径极其明确的赛道,根据The Information的报道,在企业级市场,Anthropic展现了空前强势的定价权,从它用按量计费替换订阅套餐,到上线导致Token费用上涨的分词器,都让企业找不到商量余地,只能拿着超标的账单去找老板加大预算。 没办法,品质和稀缺绑在一起,就是硬通货。 摩根大通也是这么判断的,在AI行业,拥有强大模型的公司某种程度上可以豁免于成本战争,而且它想进入「下沉市场」的难度,要远低于低价模型打入「高端市场」。 但Coding是一个已经实现预期的赛道,下一个大的是什么? 目前来看,几天之后的Google I/O大会非常重要,从已经被剧透的Gemini Omni来看,「All In One」的全栈模型要给多模态打翻身仗了。 那个教授在黑板上写公式讲课的片段,之所以艳惊四座,是因为它并非简单的视频生成,这个新的Gemini Omni模型同时搞对了三件事: 手持粉笔的空间关系、板书撰写的画面关系、推导过程的逻辑关系。 更直白的说,这绝对不是三个模型合在一起的结果,而是基座模型已经就在全模态信息上完成了训练,也就是,世界模型的雏形。 像是杨立昆、李飞飞这些不属于Transform派别的行业大佬,都对语言模型颇有微词,认为这条路线跑不出真正的世界模型,所以都选择了另辟蹊径,但Google、OpenAI甚至字节跳动都在证明,即使语言模型确实有局限之处,只要坚持Sc­a­l­i­ng La­ws、在同一个基座模型上训练全模态能力,同样能够渐进式的通向世界模型。 如果只看Coding的叙事,中国的原生AI公司都在扮演「一个更便宜的Anthropic」,杀成一片红海。 但在找出「一个更本土的Google」这件事情上,就会发现阿里、字节和MiniMax都在这么干,只有它们的模型迭代方向与Google完全一致:在一个系统内完成文本理解、图片生成、视频生成和音频输出。 王慧文在即刻上说,一家新兴公司的估值,是由相信它的资本定价的,不是不相信它的人定价的,「好吧,这是句废话。」 多模态的生成是语言模型理解世界的硬验证信号,且大部分底层能力与核心模型复用,多个模态并不等同于多份研发投入,有限的成本提升,能够极具经济性的帮助AI构建世界,并让每一代模型的更新不断放大效率差,并打开更高的智能上限。 我想吹的和期待看到的,其实就是这个。
显示更多
0
8
115
18
转发到社区
最近当大家都在刷屏Fable 5和GPT-5.6 的时候, 殊不知腾讯已经悄无声息的把大模型能力给追上来了。 你们知道腾讯低调到什么程度吗? 前几天发布的Hy3 ,21B的激活参数已经可以打平旗舰水准,并且直接塞进微信10 亿+用户手里 , 这才是国产大模型真正的王炸啊兄弟们! 说实话周一刷到 Hy3 发布消息那会儿, 我第一反应跟很多人一样:又一个卷参数的国产模型? 趁着周末有空,我仔细翻了一圈资料, 发现完全不是这么回事。 原来@TencentHunyuan这个模型从一开始就不是朝着聊天模型去的,人家的定位就是奔着干活去的 Agent 向 LLM。 另外最反直觉的是它的推理效率,295B 总参数, 实际激活只有 21B 的 MoE 架构, 就能打平参数是它 2 到 5 倍的旗舰模型, 这事儿我琢磨了一下,其实有点像团队管理, 并不是说人越多产出越高, 关键得看真正干活的那几个人靠不靠谱。 为什么这个效率重要呢? 你想想微信每天服务 10 亿人, token 成本多一厘都是天文数字, 21B 激活还能打出旗舰水准, 我觉得这才是它能被规模化铺开的根本原因, 跟刷榜没半毛钱关系。 说到刷榜,我仔细研究之后这个版本还真不是, 从 preview 到正式版,Hy3 是Hunyuan团队拿了50 多个真实业务的反馈不断迭代出来的,内部 WorkBuddy 任务成功率从 72% 干到 90%,耗时降了 34%,幻觉和常识错误全往下掉。 我原来以为 Agent 的核心是想得多深, 后来发现真正决定能不能上生产的,是稳不稳, 比如工具编排会不会中途崩,出错了能不能自己爬回来,换个框架差不差太多等等, 就是这些不起眼的东西, 才是能跑完一整套 workflow 不掉链子的关键。 当然实际测试下来Hy3 也有短板, 比如纯视觉它还不够强,不过腾讯也有单独的多模态大模型线,它能打的主要还是 coding、办公、复杂任务规划这几块。 最后说个我的一个判断:就是接下来大模型拼的可能不是谁参数更大了,核心看谁能把干活的能力以最低摩擦送到更多人手里,比如Hy3 我理解它可能不是一个更会聊天的模型,更像是一个更会干活的 Agent 底座。 话说回来,腾讯这步棋确实走得挺狠, 我觉得国产大模型的拐点真的要到了, 下方视频是我用Hy3跑的几个测试案例, 分别让它做了一个介绍自己的HTML网页, 一个我的认知系统agent网页, 和做了一个10页的PPT,都很惊艳,大家可以感受下, 会干活、会自检、还会主动说自己哪没做到位, 我觉得这才是 Agent 时代,真正能用的模型该有的样子hh~ #Hy3# #Hunyuan# #TencentAI#
显示更多
0
29
254
7
转发到社区
🚀 28个真实可跑项目!AI Agent实战圣经开源 李博杰新书《深入理解 AI Agent:设计原理与工程实践》全开源!仓库包含全书正文+PDF+10章配套代码,核心公式:Agent = LLM + 上下文 + 工具。 - 28个可跑项目,从基础上下文消融、工具调用,到Coding Agent、自我进化、多Agent协作、多模态实时交互,全是生产级实操 - 小模型也能干大事:0.6B本地部署+强工具能力演示 - 上下文/KV Cache/压缩/记忆/RAG实战,效果直观对比 - 代码+PDF免费下,亲手跑一遍就懂工程竞争力在哪 真正把原理讲透、代码跑通的稀缺货。想系统学Agent的别错过!
显示更多
发现一个开源小模型,在GitHub上已经斩获 5w star,还登上了Trending榜单。 用它可以让你只用3块钱、花两个小时,就能训练出一个仅有25.8M参数的超小语言模型。 主打极致轻量化,最小版本体积只有 GPT-3 的 1/2700。 而且还开源了 tokenizer 分词器训练,包含 Pretrain、SFT等全过程训练代码,甚至拓展了视觉多模态的MiniMind-V。 所有训练脚本均为 PyTorch 原生实现,兼容MoE混合专家模型架构,基本实现了对大语言模型全阶段的开源复现
显示更多
想用三个月拿下年薪20万美金的AI工程师Offer? 现实点说,你根本不需要回炉重造拿学位,把下面这10个GitHub仓库彻底嚼碎吞下去,比什么都管用。 如今的AI工程岗,拼的根本不是一纸文凭,而是你对生产级工具的掌控力到底到了哪个段位。这份清单就是一条从零基础到具备实战能力的完整路径,各个环节都给你安排得明明白白。 ① awesome-llm-apps 起点就选这个,绝对不踩坑。RAG、智能体、多模态应用,一水的生产级真实代码,跟那些只能跑着玩的玩具项目完全是两码事。11.2万+ stars,这是目前市面上最系统的LLM落地实战地图。 ② LangChain 到了2026年,简历上要是没出现LangChain,很可能第一轮就被筛掉了。Klarna、Replit、Elastic这些一线公司都在用,绝大多数AI创业公司的生产环境跑的就是它。 ③ LangGraph 光会LangChain只是入门,LangGraph才是现在高级AI工程师岗位描述里的高频硬指标。它是生产级智能体的核心编排层,不懂这个,你只能打打下手做基础工作。 ④ CrewAI 多智能体协作早就不是概念了,它正在当下发生。财富500强团队已经拿它在生产环境落地,框架非常成熟,面试时聊到多智能体架构,你随口就能抛出实战经验。 ⑤ Ollama 想搞懂大模型底层到底在干嘛,最快的办法就是让它在你自己的机器上跑起来。Ollama让你一键运行任何开源LLM,这是绕过抽象概念、直击原理的最短路径。 ⑥ awesome-mcp-servers MCP已经是2026年主流AI实验室的统一标准协议了。现在懂MCP的工程师还是稀缺资源,你学完立刻就能拉开身位,但这个红利窗口不会一直开着。 ⑦ Qdrant 做RAG就绕不开向量数据库,Qdrant是大规模生产环境里公认的主流选项。嵌入和语义搜索已经是AI岗位的默认技能项了,没得商量。 ⑧ AI-Agents-for-Beginners 微软官方出品的免费12节实操课,手把手教你构建智能体。全是真实代码、真实练习,面试前刷一遍,直接就有拿得出手的项目经验可以讲。 ⑨ system-design-primer 很多人会忽视这一点,但生产级AI骨子里拼的就是系统设计能力。FAANG的工程师面试前都在刷这个仓库,想拿高薪Offer,系统设计这道关你必须得迈过去。 ⑩ awesome-claude-code Claude Code已经是FAANG、OpenAI、Anthropic以及绝大多数YC系创业公司内部的主流工具。这个仓库就是它的完整使用手册,用得溜的人,生产效率直接拉开同事实力差距。 三个月能不能拿下Offer,不取决于你背了多少理论,只取决于你有没有亲自把代码跑起来、把坑踩一遍。把上面10个仓库啃透,做出几个能直接展示的实战项目,比任何证书都更有说服力。
显示更多