注册并分享邀请链接,可获得视频播放与邀请奖励。

与「多模态大模型」相关的搜索结果

多模态大模型 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 多模态大模型 的内容
搞自动化和爬虫的兄弟可以把之前的方案扔了。 GitHub 上突然爆火了一个开源项目 Index(由 AI 开发者平台 Laminar 团队打造),直接把网页浏览器变成了可调用的 API。这玩意本质上是一个极度丝滑的“AI 浏览器 Agent”,你在终端输一句人话,它就能像真人在浏览器里点按、抓数据、填表单,甚至跨站点联动办完一整套复杂流程。在 WebVoyager 跑分里直接飙到了 92% 的惊人准确率。 一句命令就能跑:pip install 之后敲 index run 就能直接在终端调用。 能直接用本地 Chrome:带 --local-chrome 参数,自动复用你已登录的账号状态。 顶配视觉推理引擎:原生支持 Claude 3.7 Sonnet、Gemini 2.5 Pro 等顶尖多模态大模型。 全程会话回放与排错:自带开箱即用的可视化录屏与步骤 Trace 监控。 自动抓取并生成表格:一句话搞定“去网站抓数据并新建 Google Sheets 写入”。 📦 开源协议:Apache-2.0 🔗 GitHub 传送门:
显示更多
Kimi-K3 全方位实测! 我竟然打游戏输给了她?! 给大家带来Kimi-K3全方位编程能力实测! 包含前端, 后端, Agent能力. 并且包含现有SOTA级别模型横评! 这次 Kimi-K3 交了一个让我都意想不到的成绩, 甚至让我怀疑Scaling Law还远未结束! 下一个是不是要出10T参数量的模型! 本次测试直接把我几个测试集都要打到头了, 前端测试是淘汰的最快的, 我还以为这几个能撑下半年, 结果现在就撑了2个月. 后端的向量数据库测试大概还有几个算法变种可以优化, 然后就到头了, 除非未来的模型能自己发明新算法(那这妥妥AGI了). 测试唯一还需要提升的是Agent能力, 当然不是说Agent能力不行, 而是距离榜首还有一些提升空间. 总之, 现在唯一需要考虑的是, 完了, 又一个 CodingPlan 套餐要断货抢不到了.... #kimik3# #月之暗面# #AIAgent# #多模态大模型# #VibeCoding# #VibeGaming#
显示更多
0
14
65
8
转发到社区
Thinking Machines发布Inkling:Mira Murati团队的首个开源多模态大模型 975B总参数、激活41B的MoE架构,Apache 2.0协议,支持文本、图像、音频输入,输出文本。 跑分处于开源第一梯队中上游,HLE带工具46.0%、SWEBench Verified 77.6%、GPQA 87.2%,与Kimi K2.6、DeepSeek V4 Pro同档,距离闭源模型还有差距。 这是首个1T参数级别的开源多模态模型,且支持在自家Tinker平台做微调定制。 模型:
显示更多
最近当大家都在刷屏Fable 5和GPT-5.6 的时候, 殊不知腾讯已经悄无声息的把大模型能力给追上来了。 你们知道腾讯低调到什么程度吗? 前几天发布的Hy3 ,21B的激活参数已经可以打平旗舰水准,并且直接塞进微信10 亿+用户手里 , 这才是国产大模型真正的王炸啊兄弟们! 说实话周一刷到 Hy3 发布消息那会儿, 我第一反应跟很多人一样:又一个卷参数的国产模型? 趁着周末有空,我仔细翻了一圈资料, 发现完全不是这么回事。 原来@TencentHunyuan这个模型从一开始就不是朝着聊天模型去的,人家的定位就是奔着干活去的 Agent 向 LLM。 另外最反直觉的是它的推理效率,295B 总参数, 实际激活只有 21B 的 MoE 架构, 就能打平参数是它 2 到 5 倍的旗舰模型, 这事儿我琢磨了一下,其实有点像团队管理, 并不是说人越多产出越高, 关键得看真正干活的那几个人靠不靠谱。 为什么这个效率重要呢? 你想想微信每天服务 10 亿人, token 成本多一厘都是天文数字, 21B 激活还能打出旗舰水准, 我觉得这才是它能被规模化铺开的根本原因, 跟刷榜没半毛钱关系。 说到刷榜,我仔细研究之后这个版本还真不是, 从 preview 到正式版,Hy3 是Hunyuan团队拿了50 多个真实业务的反馈不断迭代出来的,内部 WorkBuddy 任务成功率从 72% 干到 90%,耗时降了 34%,幻觉和常识错误全往下掉。 我原来以为 Agent 的核心是想得多深, 后来发现真正决定能不能上生产的,是稳不稳, 比如工具编排会不会中途崩,出错了能不能自己爬回来,换个框架差不差太多等等, 就是这些不起眼的东西, 才是能跑完一整套 workflow 不掉链子的关键。 当然实际测试下来Hy3 也有短板, 比如纯视觉它还不够强,不过腾讯也有单独的多模态大模型线,它能打的主要还是 coding、办公、复杂任务规划这几块。 最后说个我的一个判断:就是接下来大模型拼的可能不是谁参数更大了,核心看谁能把干活的能力以最低摩擦送到更多人手里,比如Hy3 我理解它可能不是一个更会聊天的模型,更像是一个更会干活的 Agent 底座。 话说回来,腾讯这步棋确实走得挺狠, 我觉得国产大模型的拐点真的要到了, 下方视频是我用Hy3跑的几个测试案例, 分别让它做了一个介绍自己的HTML网页, 一个我的认知系统agent网页, 和做了一个10页的PPT,都很惊艳,大家可以感受下, 会干活、会自检、还会主动说自己哪没做到位, 我觉得这才是 Agent 时代,真正能用的模型该有的样子hh~ #Hy3# #Hunyuan# #TencentAI#
显示更多
0
29
254
7
转发到社区
不知何时开始,闲鱼上已经很难捡到个人闲置高性价比的商品,Mac Mini、iPhone手机都是专业二道贩子在卖。 刚才在 GitHub 上我发现了这个开源项目,才知道咸鱼捡漏已经用上科技了。 这是一款基于 Playwright 和 AI 开发的闲鱼多任务实时监控与分析系统,可以多维度帮你找到你想要的二手物品。 项目地址: 核心功能 Web 可视化管理:配有完整的后台界面。任务配置、账号管理、标准编辑、运行日志以及结果浏览,均可在线直观操作。 AI 智能驱动:支持多模态大模型分析。不仅能识别文字,还能看懂商品图片并分析卖家画像。使用自然语言输入需求,即可创建监控任务。 多任务与高级过滤:支持多任务并发,各任务独立配置关键词。提供价格区间、包邮、发布时间范围、省市区三级区域等高级筛选。 多账号与代理轮换:支持多账号管理与代理池轮换,具备失败重试机制,降低封号风险。 定时调度:支持 Cron 配置,可按设定周期自动运行。 即时通知:支持 Bark、Telegram、企业微信、 等多种渠道,匹配成功第一时间推送至手机。 容器化部署:支持 Docker 一键部署,也支持本地 pip 安装运行。 如果经常需要在闲鱼寻找特定商品,可以尝试搭建这个工具协助筛选。
显示更多
0
71
1.7K
261
转发到社区
兄弟们,我一直有个判断:OCR 这种活,早晚会被多模态大模型给吃掉。 这周看到百度发的 PP-OCRv6,我改主意了。 一个 1.5MB 的模型,能直接塞进浏览器里跑,单图最快 97 毫秒就能出结果,逐字识别的准确率还反超了 GPT-5.5、Gemini-3.1-Pro 和 235B 参数的 Qwen3-VL,我有点震惊了! 对做产品的人来说,这比「又一个 SOTA」重要得多。我有测试,先往下看 👇
显示更多
0
19
102
16
转发到社区
冷知识: 目前多模态大模型创业的具体落地方向通常有如下方向,如果都不是你感兴趣的话,还是别赶时髦,乖乖回去学AI coding吧 : 1. 游戏 AI NPC / 智能体中间件(如端云协同的 OmniNPC,赋能 3D 角色交互与情感叙事) 2. 企业级多模态 Agent(如面向复杂文档、视觉流分析、跨系统 RPA 的智能体) 3. 多模态内容生成与创意工具(如 AI 视频、短剧生成、电商营销图视频设计) 4. 具身智能与机器人控制(如基于多模态物理感知与动作生成的端到端控制系统) 5. 视觉/多模态代码与设计助手(如 UI 截图一键生成高质量代码、交互式产品设计)
显示更多
SenseNova-U1:无视觉编码器的原生多模态统一大模型 商汤开源,采用全新NEO-Unify架构,去掉了传统多模态模型中的视觉编码器(VE)和变分自编码器(VAE),实现了语言与视觉的端到端原生统一。 · 传统方案:图像先经VE编码为特征向量,再经适配层对接语言模型;生成时再反向走VAE解码,存在信息损耗和两套参数的训练冲突 · NEO-Unify方案:像素和词元在同一个统一表示空间内被端到端建模,通过原生MoT(Mixture of Tokens)机制实现高效跨模态推理,消除模态之间的"翻译层" 模型:
显示更多
听说某top1大模型厂开始清洗式谈话了 第一波已经在谈了,真假还不确定 继数据团队之后,后训练成了重灾区。后训练团队多,方向也多,一开始写太具体容易点名,给当事人添麻烦,所以统一说“后训练”,多模态、llm、搜索都有后训练团队,这个说法覆盖面本来就大
显示更多
0
29
117
4
转发到社区
看完了梁文锋在最近一轮投资人会议上的语录 不愧为全世界最有格局的创始人... 记录下来一些非常触动我的,全文背诵学习... 1. 在通过 AGI 的路上,要经过产品这个台阶,但不用花太多心思,产品只是在 AGI 路上的副产物。 2. 3D、视频生成、世界模型,跟智能上限没有太大的关系。 3. 多模态很重要,但不是智能本身。 4. 大模型的幻觉是一个产品问题,可以解决,但不是重点。 5. 现阶段最重要的是 Coding Agent,通用 Agent,金融医疗等 Agent 优先级较低。 6. AI 现在不缺品味和直觉,缺的是持续学习的能力。 7. 人类能够持续学习,但 AI 还没有,下一代模型必须要具有持续学习能力。 8. 我们希望下一代模型帮助我们开发,这是实现 AGI 最快的方法,但「学习」有很多东西组成,目前全世界还没找到好方法。 9. 如果把 AGI 比作爬楼梯,去年的阶梯是 CoT,今年的阶梯是 Agent,之后的阶梯是持续学习。 10. 实现持续学习之后,可能会来到渐进的奇点,AI 可以开发更前沿的模型,加速 AI 研究,这部走完,才是具身智能。 11. 智能的重点可能是具身,因为对一个正常人来讲,他的需求并不是电脑,而是人力。 12. 我们只赚合理利润,非常考虑成本效率,所以价格能做到最低,卖 API 这件事,我们没有销售,也没有客服,用户自己就会来。 13. 我不怀疑 AGI 会有巨大的商业价值,我考虑的是如何增加做成的概率。 14. AI 在商业上做成,开源是有好处的,一个软件公司,市场一年就几十亿美金,一开源就没有了,但是 AI 这个事情足够大,最终可能得占掉人类社会 GDP 的 10%,如果想独占这个利益就一定会被历史抛弃,这是一个客观规律,这是一个历史观。 15. 开源对我们的商业模式没有任何影响,前提是「只赚一定的利润」,如果要赚百倍利润,开源确实会影响你。 16. 中国 AI 的差距主要在资源,我们相信 scaling,规模越大,效果越好,但资源就这么多,人才没有差距,都是同一批人。 17. Anthropic 超过 OpenAI,不是长期的,是阶段性的。OpenAI 和 Google 未来大概率会交替上升。 18. 国内模型公司太多了,资源分散,最终一定会收敛,如果每家只拿合理的利润,不需要那么多人做大模型,可能两家大公司,两家小公司就够了。 19. 我绝对不认为大模型公司可以拿走AI行业的大部分利润。 20. 大模型的竞争差距会体现在三个方面:成本、时间、用户体验。成本排第一位,时间早几个月就不一样,用户体验有些黏性和壁垒,但不本质。 21. 无意成为下一个超级app,看不上这个东西,不要为了芝麻丢了西瓜。 22. 去年大家都抢 Chatbot,抢 C 端流量,今年是抢 B 端收入,我们真正关心的是 AGI 路线图,下一步技术怎么突破。最想得到的东西得不到,没那么在意的反而容易得到。 23. 团队的稳定性是没法退让的,这是我们面临的一个非常大的风险,随着这次融资,也得到了解除(这是低利润模式必须的支撑) 24. 不想和任何人成为竞争对手,希望给他们赋能,帮助他们,这样我们的环境也会更好。 25. 我们一般不太加班,第一个原因是研究需要一个比较松弛的环境,第二个原因是我们非常聚焦,不去补产品的所有问题,也算一种克制的文化。 26. 公司是动态的,随着公司变大,可能会有一些必要的结构,但不会完成变成传统的层级制度。 27. 我们做这个公司,初衷没想要赚多少钱,要去上市。我们怀着一个对这个世界非常大的善意来做这个事情,觉得这对人类有用。 28. 我们是一个靠愿景驱动的组织,KPI 不是我们的组织方式,有好处也有坏处,但这个是我们的特色。 29. 愿景不是成文的,而是在做事的方法中,对待世界的态度里,可能我们每个人的理解也不一样,但大方向是一致的。 30. 一个公司最重要的是愿景,愿景不是挂在墙上的标语,不是怎么说,而是怎么做。 31. 克制是我们愿景里的一部分。AGI 之外的事情,我们没有精力就不做。AI 这个事情太大了,利益也太大了,随便分一点利益就非常大,你越克制,就越有可能做成这件事。除了愿景,我们并没有非常多的其他优势。 32. 开源也属于克制的一部分,从长期来说,价格低可能是优势,克制是一种战略。 33. 如果你的愿景是拿得多,你就先输了,你可能会面临更大的问题,这个世界就是这样。
显示更多
0
13
310
72
转发到社区