注册并分享邀请链接,可获得视频播放与邀请奖励。

与「多模态大模型」相关的搜索结果

多模态大模型 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 多模态大模型 的内容
🎁 免费福利再加码!小米 MiMo-V2.5 现已开启全量免费! 作为小米开源的原生全模态旗舰模型,MiMo-V2.5 采用 310B 稀疏 MoE 架构,支持文本、图像、视频与音频全模态输入,具备 1M 超长上下文与极速响应能力,专为多模态 Agent、音视频分析及通用编程等实战场景打造。 现已在 API 官方组开启全量免费调用,0 成本即可解锁小米前沿全模态大模型的硬核实力! 👉 立即免费体验:
显示更多
0
11
52
7
转发到社区
谷歌最近出啥问题了?接连损失大将。刚刚杰夫.迪恩宣布从谷歌离职创立Discovery Loop。这位非常不简单,杰夫.迪恩是计算机科学与人工智能领域的传奇人物,被誉为“谷歌的系统架构总设计师”和硅谷“程序员中的程序员”。 1、杰夫离职前担任谷歌首席科学家兼任 Google DeepMind 和 Google Research 的核心技术领袖。是Google Senior Fellow/Level 11,在谷歌数十万员工中,能达到 Level 11 的极度罕见,几乎代表了整个谷歌技术体系的终极权威。 2、Jeff Dean在谷歌工作27年,其职业生涯贯穿了互联网海量数据处理时代与现代人工智能时代,其核心成就可分为三大阶段: 1)奠定现代互联网基础的基础设施(2000年代) 在谷歌成立早期,他主导开发了一系列支撑起整个 Google 生态(乃至全行业大数据架构)的基础系统: MapReduce:划时代的分布式计算框架。它将庞大的数据处理任务拆分到数万台普通服务器上并行运行,是后来的 Hadoop 等大数据技术的直接灵感来源。 Bigtable:高扩展性、高性能的分布式结构化数据存储系统,直接催生了后来的 NoSQL 数据库浪潮(如 HBase)。 Spanner:全球级分布式 SQL 数据库,打破了传统数据库“一致性”与“可用性”难以兼得的困境。 搜索与广告系统架构:主导设计了谷歌早期的五代搜索索引与抓取系统,以及 AdSense 广告投放系统的早期基础设施。 2)推动 AI 革命与深度学习生态(2010年代) 创建 Google Brain(谷歌大脑):2011 年与吴恩达(Andrew Ng)等人共同创办 Google Brain,将深度学习引入谷歌的核心业务。 TensorFlow:主导打造并开源了全球最著名的深度学习框架之一 TensorFlow,极大地降低了全球研究者和开发者使用 AI 的门槛。 DistBelief & Pathways:先后设计了 DistBelief(早期大规模分布式神经网络训练系统) 和 Pathways 架构(为后续训练 PaLM、Gemini 等超大规模多模态大模型奠定了系统支撑)。 3)整合与领军时代(2020年代) 统领 Google AI 与 DeepMind 融合,杰夫曾长期担任 Google AI(Google Research)负责人。2023 年 Google Brain 与 DeepMind 合并为 Google DeepMind 后,他作为首席科学家,重点统筹下一代超大模型(如 Gemini 系列)的系统架构与前沿 AI 研发。 前段时间谷歌还有两位大拿离开: 1)Google DeepMind 副总裁 John Jumper跳槽至 Anthropic,这位因带领团队打造预测蛋白质结构的革命性 AI 模型 AlphaFold,与 Demis Hassabis 共同获得 2024 年诺贝尔化学奖。 2)谷歌工程副总裁兼旗舰模型 Gemini 联合负责人Noam Shazeer跳槽至 OpenAI。 Noam Shazeer 是Transformer 架构奠基人之一:2017 年奠定现代大模型基础的划时代论文《Attention Is All You Need》的共同作者。 前线厮杀正浓,统兵大将接连离开,对谷歌影响应该不小。
显示更多
0
80
285
37
转发到社区
搞自动化和爬虫的兄弟可以把之前的方案扔了。 GitHub 上突然爆火了一个开源项目 Index(由 AI 开发者平台 Laminar 团队打造),直接把网页浏览器变成了可调用的 API。这玩意本质上是一个极度丝滑的“AI 浏览器 Agent”,你在终端输一句人话,它就能像真人在浏览器里点按、抓数据、填表单,甚至跨站点联动办完一整套复杂流程。在 WebVoyager 跑分里直接飙到了 92% 的惊人准确率。 一句命令就能跑:pip install 之后敲 index run 就能直接在终端调用。 能直接用本地 Chrome:带 --local-chrome 参数,自动复用你已登录的账号状态。 顶配视觉推理引擎:原生支持 Claude 3.7 Sonnet、Gemini 2.5 Pro 等顶尖多模态大模型。 全程会话回放与排错:自带开箱即用的可视化录屏与步骤 Trace 监控。 自动抓取并生成表格:一句话搞定“去网站抓数据并新建 Google Sheets 写入”。 📦 开源协议:Apache-2.0 🔗 GitHub 传送门:
显示更多
Kimi-K3 全方位实测! 我竟然打游戏输给了她?! 给大家带来Kimi-K3全方位编程能力实测! 包含前端, 后端, Agent能力. 并且包含现有SOTA级别模型横评! 这次 Kimi-K3 交了一个让我都意想不到的成绩, 甚至让我怀疑Scaling Law还远未结束! 下一个是不是要出10T参数量的模型! 本次测试直接把我几个测试集都要打到头了, 前端测试是淘汰的最快的, 我还以为这几个能撑下半年, 结果现在就撑了2个月. 后端的向量数据库测试大概还有几个算法变种可以优化, 然后就到头了, 除非未来的模型能自己发明新算法(那这妥妥AGI了). 测试唯一还需要提升的是Agent能力, 当然不是说Agent能力不行, 而是距离榜首还有一些提升空间. 总之, 现在唯一需要考虑的是, 完了, 又一个 CodingPlan 套餐要断货抢不到了.... #kimik3# #月之暗面# #AIAgent# #多模态大模型# #VibeCoding# #VibeGaming#
显示更多
0
14
65
8
转发到社区
Thinking Machines发布Inkling:Mira Murati团队的首个开源多模态大模型 975B总参数、激活41B的MoE架构,Apache 2.0协议,支持文本、图像、音频输入,输出文本。 跑分处于开源第一梯队中上游,HLE带工具46.0%、SWEBench Verified 77.6%、GPQA 87.2%,与Kimi K2.6、DeepSeek V4 Pro同档,距离闭源模型还有差距。 这是首个1T参数级别的开源多模态模型,且支持在自家Tinker平台做微调定制。 模型:
显示更多
最近当大家都在刷屏Fable 5和GPT-5.6 的时候, 殊不知腾讯已经悄无声息的把大模型能力给追上来了。 你们知道腾讯低调到什么程度吗? 前几天发布的Hy3 ,21B的激活参数已经可以打平旗舰水准,并且直接塞进微信10 亿+用户手里 , 这才是国产大模型真正的王炸啊兄弟们! 说实话周一刷到 Hy3 发布消息那会儿, 我第一反应跟很多人一样:又一个卷参数的国产模型? 趁着周末有空,我仔细翻了一圈资料, 发现完全不是这么回事。 原来@TencentHunyuan这个模型从一开始就不是朝着聊天模型去的,人家的定位就是奔着干活去的 Agent 向 LLM。 另外最反直觉的是它的推理效率,295B 总参数, 实际激活只有 21B 的 MoE 架构, 就能打平参数是它 2 到 5 倍的旗舰模型, 这事儿我琢磨了一下,其实有点像团队管理, 并不是说人越多产出越高, 关键得看真正干活的那几个人靠不靠谱。 为什么这个效率重要呢? 你想想微信每天服务 10 亿人, token 成本多一厘都是天文数字, 21B 激活还能打出旗舰水准, 我觉得这才是它能被规模化铺开的根本原因, 跟刷榜没半毛钱关系。 说到刷榜,我仔细研究之后这个版本还真不是, 从 preview 到正式版,Hy3 是Hunyuan团队拿了50 多个真实业务的反馈不断迭代出来的,内部 WorkBuddy 任务成功率从 72% 干到 90%,耗时降了 34%,幻觉和常识错误全往下掉。 我原来以为 Agent 的核心是想得多深, 后来发现真正决定能不能上生产的,是稳不稳, 比如工具编排会不会中途崩,出错了能不能自己爬回来,换个框架差不差太多等等, 就是这些不起眼的东西, 才是能跑完一整套 workflow 不掉链子的关键。 当然实际测试下来Hy3 也有短板, 比如纯视觉它还不够强,不过腾讯也有单独的多模态大模型线,它能打的主要还是 coding、办公、复杂任务规划这几块。 最后说个我的一个判断:就是接下来大模型拼的可能不是谁参数更大了,核心看谁能把干活的能力以最低摩擦送到更多人手里,比如Hy3 我理解它可能不是一个更会聊天的模型,更像是一个更会干活的 Agent 底座。 话说回来,腾讯这步棋确实走得挺狠, 我觉得国产大模型的拐点真的要到了, 下方视频是我用Hy3跑的几个测试案例, 分别让它做了一个介绍自己的HTML网页, 一个我的认知系统agent网页, 和做了一个10页的PPT,都很惊艳,大家可以感受下, 会干活、会自检、还会主动说自己哪没做到位, 我觉得这才是 Agent 时代,真正能用的模型该有的样子hh~ #Hy3# #Hunyuan# #TencentAI#
显示更多
0
29
254
7
转发到社区
不知何时开始,闲鱼上已经很难捡到个人闲置高性价比的商品,Mac Mini、iPhone手机都是专业二道贩子在卖。 刚才在 GitHub 上我发现了这个开源项目,才知道咸鱼捡漏已经用上科技了。 这是一款基于 Playwright 和 AI 开发的闲鱼多任务实时监控与分析系统,可以多维度帮你找到你想要的二手物品。 项目地址: 核心功能 Web 可视化管理:配有完整的后台界面。任务配置、账号管理、标准编辑、运行日志以及结果浏览,均可在线直观操作。 AI 智能驱动:支持多模态大模型分析。不仅能识别文字,还能看懂商品图片并分析卖家画像。使用自然语言输入需求,即可创建监控任务。 多任务与高级过滤:支持多任务并发,各任务独立配置关键词。提供价格区间、包邮、发布时间范围、省市区三级区域等高级筛选。 多账号与代理轮换:支持多账号管理与代理池轮换,具备失败重试机制,降低封号风险。 定时调度:支持 Cron 配置,可按设定周期自动运行。 即时通知:支持 Bark、Telegram、企业微信、 等多种渠道,匹配成功第一时间推送至手机。 容器化部署:支持 Docker 一键部署,也支持本地 pip 安装运行。 如果经常需要在闲鱼寻找特定商品,可以尝试搭建这个工具协助筛选。
显示更多
0
71
1.7K
261
转发到社区
兄弟们,我一直有个判断:OCR 这种活,早晚会被多模态大模型给吃掉。 这周看到百度发的 PP-OCRv6,我改主意了。 一个 1.5MB 的模型,能直接塞进浏览器里跑,单图最快 97 毫秒就能出结果,逐字识别的准确率还反超了 GPT-5.5、Gemini-3.1-Pro 和 235B 参数的 Qwen3-VL,我有点震惊了! 对做产品的人来说,这比「又一个 SOTA」重要得多。我有测试,先往下看 👇
显示更多
0
19
102
16
转发到社区
冷知识: 目前多模态大模型创业的具体落地方向通常有如下方向,如果都不是你感兴趣的话,还是别赶时髦,乖乖回去学AI coding吧 : 1. 游戏 AI NPC / 智能体中间件(如端云协同的 OmniNPC,赋能 3D 角色交互与情感叙事) 2. 企业级多模态 Agent(如面向复杂文档、视觉流分析、跨系统 RPA 的智能体) 3. 多模态内容生成与创意工具(如 AI 视频、短剧生成、电商营销图视频设计) 4. 具身智能与机器人控制(如基于多模态物理感知与动作生成的端到端控制系统) 5. 视觉/多模态代码与设计助手(如 UI 截图一键生成高质量代码、交互式产品设计)
显示更多
🎉 重磅揭晓:DeepSeek 官方调价, 叠加再打 1 折! DeepSeek 官方全新发布原生多模态 MoE 大模型 DeepSeek-V4.1-Flash。借此契机, 宣布:将在 DeepSeek 官方新价格的基础上再叠加 1 折(直接省 90%)!您仅需支付官方价格的 10%,即可享受极致性价比的顶尖算力。 🗓️ 权益生效时间:9 月 12 日 10:00 (SGT) 💡 自动路由说明: 将逐步把 DeepSeek-V4-Flash 和 DeepSeek-V4-Flash-Vision-Exp 的 API 请求平滑无缝路由至 DeepSeek-V4.1-Flash,无需复杂配置。您也可以直接配置指定接入 DeepSeek-V4.1-Flash 立即享用。
显示更多