注册并分享邀请链接,可获得视频播放与邀请奖励。

与「视觉大模型」相关的搜索结果

视觉大模型 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 视觉大模型 的内容
给大家带来蚂蚁灵波LingBot-Vision 实测! 本次测试最大的亮点是在仅 1B (10亿) 参数量下, 展现出了极强的空间几何和边界感知能力, 实测表现直接越级打平甚至超越了 7B 参数的 DINOv3, 极具性价比!它非常适合用作具身智能的视觉主干 (Backbone) , 或者嵌入到机器人导航、机械臂抓取等需要极高空间精度的框架中使用都很不错, 对本地算力要求也很低. 视频中我直接给大家演示了免微调的视频目标追踪, 随便画一笔就能死死"咬"住目标. 另外, 它在硬件级深度补全 (比如识别透明玻璃、反光物体) 上表现也堪称杀手级, 不过由于技能点都加在了密集空间结构上, 在全局图像分类能力上算是中规中矩. 手里有 30 系显卡的兄弟们强烈建议本地跑着玩玩! #灵波# #LingBot# #视觉大模型# #具身智能# #机器视觉#
显示更多
当大家还在为闭源模型的封锁而焦虑时,边缘侧的视觉大模型已经进化到了恐怖的阶段。 👇 Martin Maly 展示了仅凭一次 Prompt(One-shotted),Opus 4.8 就能把一台普通手机变成「羽毛球专业裁判系统」:
显示更多
0
4
101
13
转发到社区
先是 GLM5.2,然后是 Kimi K3,现在是 Qwen 3.8 Max,每次国产模型的新发布都更加接近 Coding 领域的 SOTA。从 6 月开始,我感觉国内大模型明显开始在 Coding 和 Agent 领域加速了,和海外顶级 SOTA 的差距正在肉眼可见地缩小。 目前看,国产模型的长程任务、自主运行、反馈回路、跨 Harness 泛化和视觉自我检查等,能力越来越强了。做一个谨慎的预测,预计到 2026 年的年底,对于重度开发者和 Vibe 用户来说,海外模型可能会成为辅助模型,国内的大模型将成为我们的主力工具。 模型用户没有忠诚度,大家会用脚投票的,拭目以待。
显示更多
搞自动化和爬虫的兄弟可以把之前的方案扔了。 GitHub 上突然爆火了一个开源项目 Index(由 AI 开发者平台 Laminar 团队打造),直接把网页浏览器变成了可调用的 API。这玩意本质上是一个极度丝滑的“AI 浏览器 Agent”,你在终端输一句人话,它就能像真人在浏览器里点按、抓数据、填表单,甚至跨站点联动办完一整套复杂流程。在 WebVoyager 跑分里直接飙到了 92% 的惊人准确率。 一句命令就能跑:pip install 之后敲 index run 就能直接在终端调用。 能直接用本地 Chrome:带 --local-chrome 参数,自动复用你已登录的账号状态。 顶配视觉推理引擎:原生支持 Claude 3.7 Sonnet、Gemini 2.5 Pro 等顶尖多模态大模型。 全程会话回放与排错:自带开箱即用的可视化录屏与步骤 Trace 监控。 自动抓取并生成表格:一句话搞定“去网站抓数据并新建 Google Sheets 写入”。 📦 开源协议:Apache-2.0 🔗 GitHub 传送门:
显示更多
来自北京的月之暗面公司在7月16日发布了全新旗舰大模型 Kimi k3,是全球首个开源 3 万亿级大模型。100 万 上下文长度,可一次性载入百万字文档、完整代码库、整本财报、长篇专业文献,专为长时程代理式编码和自我演化工作流而构建。原生多模态统一支持文本、图片、截图、图纸视觉理解,非外挂视觉插件。 综合能力上仅次于闭源顶级模型 GPT-5.6 Sol、Claude Fable 5,在代码、长文档检索、复杂工程任务上反超绝大多数竞品开源 / 闭源模型。 完整模型权重将于2026 年 7 月 27 日公开释放,企业可本地私有化部署、二次微调,是当前可商用规模最大开源基座。
显示更多
最近当大家都在刷屏Fable 5和GPT-5.6 的时候, 殊不知腾讯已经悄无声息的把大模型能力给追上来了。 你们知道腾讯低调到什么程度吗? 前几天发布的Hy3 ,21B的激活参数已经可以打平旗舰水准,并且直接塞进微信10 亿+用户手里 , 这才是国产大模型真正的王炸啊兄弟们! 说实话周一刷到 Hy3 发布消息那会儿, 我第一反应跟很多人一样:又一个卷参数的国产模型? 趁着周末有空,我仔细翻了一圈资料, 发现完全不是这么回事。 原来@TencentHunyuan这个模型从一开始就不是朝着聊天模型去的,人家的定位就是奔着干活去的 Agent 向 LLM。 另外最反直觉的是它的推理效率,295B 总参数, 实际激活只有 21B 的 MoE 架构, 就能打平参数是它 2 到 5 倍的旗舰模型, 这事儿我琢磨了一下,其实有点像团队管理, 并不是说人越多产出越高, 关键得看真正干活的那几个人靠不靠谱。 为什么这个效率重要呢? 你想想微信每天服务 10 亿人, token 成本多一厘都是天文数字, 21B 激活还能打出旗舰水准, 我觉得这才是它能被规模化铺开的根本原因, 跟刷榜没半毛钱关系。 说到刷榜,我仔细研究之后这个版本还真不是, 从 preview 到正式版,Hy3 是Hunyuan团队拿了50 多个真实业务的反馈不断迭代出来的,内部 WorkBuddy 任务成功率从 72% 干到 90%,耗时降了 34%,幻觉和常识错误全往下掉。 我原来以为 Agent 的核心是想得多深, 后来发现真正决定能不能上生产的,是稳不稳, 比如工具编排会不会中途崩,出错了能不能自己爬回来,换个框架差不差太多等等, 就是这些不起眼的东西, 才是能跑完一整套 workflow 不掉链子的关键。 当然实际测试下来Hy3 也有短板, 比如纯视觉它还不够强,不过腾讯也有单独的多模态大模型线,它能打的主要还是 coding、办公、复杂任务规划这几块。 最后说个我的一个判断:就是接下来大模型拼的可能不是谁参数更大了,核心看谁能把干活的能力以最低摩擦送到更多人手里,比如Hy3 我理解它可能不是一个更会聊天的模型,更像是一个更会干活的 Agent 底座。 话说回来,腾讯这步棋确实走得挺狠, 我觉得国产大模型的拐点真的要到了, 下方视频是我用Hy3跑的几个测试案例, 分别让它做了一个介绍自己的HTML网页, 一个我的认知系统agent网页, 和做了一个10页的PPT,都很惊艳,大家可以感受下, 会干活、会自检、还会主动说自己哪没做到位, 我觉得这才是 Agent 时代,真正能用的模型该有的样子hh~ #Hy3# #Hunyuan# #TencentAI#
显示更多
0
29
254
7
转发到社区
holy fucking shit,大模型计费的底层漏洞,被人用一张图片捅穿了🤯 给大模型喂长文本的成本,被这个野路子直接砍了六成, 这款叫pxpipe的本地代理工具,会自动拦截发往Anthropic接口的请求, 把系统提示,工具文档,历史对话,代码文件这些高密度内容,全部打包成图片再发给模型, 只把最近对话和关键内容保留纯文本,兼顾缓存效率, 原理说穿了很简单,图片按像素尺寸固定计费,和文本密度无关,一张1928×1928的图片, 能塞进去九万两千多字符,只消耗四千七百多个视觉token, 折算下来成本直接打四折,这套思路根源来自DeepSeek的光学压缩研究,通过图像传输文本的效率接近纯文本的十倍,准确率还很高, 实测在Fable 5上跑编码任务表现稳定,准确率损失极小,特别适合吃token的编码智能体场景, 当然也有明显短板,ID,哈希值,密钥这类精确字符串容易出现识别误差,目前对Fable 5适配最好, 其他模型效果有差异,有人觉得这是钻定价漏洞的取巧玩法,也有人觉得这是真的效率提升, 对重度使用编码智能体的开发者来说,省下来的都是真金白银hhh
显示更多
0
12
29
9
转发到社区
一个普通的小玩意,结合AI叙事和高级视觉设计,能包装到什么地步? 英国一家创意工作室,专门研究了这个问题。 他们搞了一个项目,交互炫酷,高级感拉满,目的就是为了嘲讽AI模型发布!! 讽刺 AI 时代过度包装、术语崇拜和产品发布泡沫! 顺便展示自己的 3D、WebGL、动效、品牌叙事和创意 campaign 能力。 他们把一个普通的不能再普通、甚至都不存在的杯托产品,包装成了一个划时代的AI产品来呈现。 把 AI 圈常见话术全套搬到了杯垫上。 1、Powered by AI 这个是最搞笑的,Powered by AI,但脚注里提示 AI 是 Adobe Illustrator。 2、开源权重 / Open-weight model 团队还发布了所谓的开源模型权重Oryzo-1,结果 GitHub 里是一个软木杯垫的 3D OBJ 模型。 3、Benchmark / SOTA / Instruct / Frontier 他们还把不同 OBJ 文件命名成 26B、40B、108B、168B-instruct、344B 等,明显是在戏仿大模型参数规模和 checkpoint 发布方式;并且基准测试 WoodenBench 是在一张桌子上做的,而且“很可能被操纵”。 4、On-device / edge / RTX 3090 / no cloud 官网写它“Runs on the edge”“Refuses the cloud”“No power required”,直接把 AI 硬件、本地部署、算力焦虑的营销式文案套到一个无需供电的杯垫上。
显示更多
$MU 看见的机器人,不是玩具,是 AI 的下一副身体 a16z 昨天发布了一张图片 表面上讲的是机器人一级市场融资创历史新高,Q1 2026 的融资金额和交易笔数同时冲上去。 不只是机器人火了,重要的地方在于资本在用自己的方式告诉市场,AI 的下一段叙事,正在从云端走向现实世界。 过去几年,AI 投资的中心很清楚。 先是模型,后是算力,然后是 GPU、HBM、数据中心、电力、液冷、光模块、网络交换机。 看着五花八门、很高大上,本质上解决都是在一个问题:怎么把更大的模型训练出来,怎么让更多推理跑起来。 但现在,一个新的问题开始出现。 这些智能,最后要去哪里? 如果 AI 永远停在聊天框、办公软件和云端 API 里,它当然很有价值,但它仍然主要停留在数字世界里。 真正更大的变化,是 AI 开始进入工厂、仓库、医院、汽车、农田、矿山、家庭和战场。 也就是进入物理世界。 机器人就是这个过程里最重要的载体。 所以这张图不是简单的融资图,而是一张资金迁徙图。 钱正在从纯软件、纯云端、纯模型,往能让 AI 落地到现实世界的硬件系统里迁移。 这也是为什么美光这次财报电话会里,CEO 专门提到机器人。 美光不是一家机器人公司,它也不是一个靠讲故事拉估值的创业公司。 美光站的位置非常特殊。它在产业链里看见的不是概念,而是每一个终端到底要吃掉多少内存、多少存储、多少带宽、多少功耗预算。 所以当美光 CEO 说,人形机器人的内存含量可能是普通 L2+ 汽车的十倍,这句话的分量很重。 不是在说机器人明天就爆发。 而是在说:如果机器人真的走向规模化,它就不会是一台简单的机械设备,而会是一台移动的边缘 AI 系统。 它要看见世界,要理解世界,要实时推理,要控制动作,要记录数据,要在本地完成大量计算。 这意味着机器人不是一个轻资产故事。 它是一个重硬件、重供应链、重制造、重可靠性的产业故事。 说实话,我们看机器人,最容易被外形吸引。 人形机器人走几步,挥挥手,搬个箱子,视频一发,大家就开始兴奋、欢呼。 但产业化的视角从来不是这样子,产业化看的是:一台机器人到底由什么构成?哪些环节能规模化?哪些部件会成为瓶颈?哪些供应商可以稳定交付?哪些客户愿意付钱?单位经济模型什么时候跑通? 从这个角度看,美光这次财报其实给了一个很重要的提醒。 机器人不是从“机器”开始定价的,是从“数据”开始定价的。 一个机器人进入现实世界,第一件事不是行动,而是感知。 它要用摄像头、激光雷达、毫米波雷达、IMU、力传感器、触觉传感器去采集环境。 采集之后,数据要被处理 处理之后,要进入模型 模型要判断环境,理解任务,规划动作 动作又要通过电机、减速器、伺服系统、控制器执行出去 执行之后,还要反馈回来,再调整下一步 这就是机器人的闭环。 感知、推理、控制、执行、反馈。 这个闭环越复杂,对内存和存储的要求就越高。 因为机器人不是在干一个静态任务。 它是在真实环境里不断接收数据,不断判断,不断行动。 云端可以慢一点,办公软件可以等几秒。 但机器人不能等。 它要避障,要抓取,要平衡,要停下,要躲人,要判断物体有没有滑落。 这些事情都发生在现实世界里,延迟一高,错误就会变成碰撞。 所以机器人天然需要边缘计算,也天然需要高带宽、低功耗的内存和存储。 这就是美光那句话的核心。 人形机器人之所以可能带来多年的内存需求,不是因为它长得像人,而是因为它把 AI 从服务器机柜里,搬到了一个会移动、会交互、会执行任务的物理终端里。 这和汽车很像,但又比汽车更复杂。 一辆 L2+ 汽车已经需要大量传感器、算力、内存和存储。 但它的任务相对单一,主要是行驶、避障、辅助驾驶。 人形机器人面对的世界要复杂得多。 它不只在道路上移动,要进入工厂、仓库、办公室、家庭。 它要处理开放环境里的长尾问题。 它要用手操作各种不同形状、不同重量、不同材质的物体。 它要理解人的指令,也要适应环境的变化。 这就是为什么人形机器人如果真正量产,它的硬件含量不会低。 它不是一个带腿的玩具。 它更像是一台高度压缩的移动数据中心,一台装进身体里的 AI 服务器 其实融资图和美光的电话会都说了一件事。 一级市场融资创高,说明资本正在下注机器人公司的未来形态。 美光电话会,说明上游半导体公司已经开始把机器人纳入长期需求模型。 一个是资金端的变化,一个是供应链端的变化。 这两件事合在一起,才是机器人板块真正值得重视的地方。 机器人投资创历史新高,不等于所有机器人公司都有价值。 很多公司会融到钱,很多公司也会消失。 这和电动车、光伏、AI、大模型都一样。 每一轮产业浪潮刚开始的时候,市场都会把叙事打得很满。 但产业最后只奖励两类公司。 一类是能把产品真正交付出去的整机公司 另一类是站在关键瓶颈上的供应链公司 机器人也是一样。 用产业化视角拆,它至少有六层。 第一层,是大脑 包括 GPU、边缘 AI 芯片、机器人基础模型、世界模型、仿真平台。 最典型的还是老大哥英伟达。 因为机器人真正成熟之前,需要在仿真里训练,需要在虚拟世界里先摔无数次,再去真实世界里减少试错成本。 第二层,是记忆 这就是美光看到的部分。 机器人要实时感知、推理和控制,就需要更高带宽、更低功耗、更大容量的内存和存储。 过去市场把美光看成周期股。 但如果 AI 进入设备端、汽车端、机器人端,美光就不再只是传统意义上的存储周期公司,而是在吃 AI 终端扩散的硬件红利。 第三层,是眼睛 机器人要进入现实世界,首先要看见世界。 摄像头、激光雷达、机器视觉、深度传感器、传感器融合,都是这一层。 Ouster、Cognex、Keyence 这种公司,看的是机器人和自动化的感知入口。 这层的核心不是某个单一传感器赢不赢,而是机器人对空间理解的需求会越来越强。 第四层,是皮肤和手感 这对应力传感、触觉反馈、应变片、压力传感、灵巧手。 这条线现在还很早,但非常关键。 因为机器人从“会走路”到“会干活”,真正难的是手。 抓一个箱子很容易,抓一个玻璃杯、鸡蛋、衣服、软袋子、工具,就完全不一样。 视觉只能告诉机器人物体在哪里。 触觉和力反馈,才能告诉它该用多大力。 所以 VPG 这类精密测量和力传感公司,才会开始被市场重新注意。 第五层,是关节和肌肉 机器人要动起来,离不开电机、减速器、伺服系统、编码器、控制器。 这里面最典型的是 Harmonic Drive Systems 这类精密减速器公司。 机器人越接近人形,关节越多,运动控制要求越高,对高精度、轻量化、低背隙零部件的要求就越高。 这条线不如整机性感,但产业位置很硬。 第六层,是场景 机器人最终不是卖给想象力,而是卖给场景。 工厂、仓库、医院、农业、国防,是最可能先跑出来的地方。 因为这些地方有明确的人力成本、效率需求、安全需求和 ROI 计算。 亚马逊的仓储机器人、Intuitive Surgical 的手术机器人、AeroVironment 的无人系统,本质上都说明了一件事: 机器人最早赚钱的地方,往往不是家庭,而是商业和工业场景。 所以现在看机器人板块,不能只看人形机器人。 人形机器人是最大的想象空间,但不一定是最早兑现利润的地方。 真正产业化的机器人浪潮,很可能先从仓库、工厂、医院、军工和农业里长出来。 等这些场景把供应链打磨成熟,成本打下来,可靠性提高,软件泛化能力增强,才有机会一步步进入更开放的生活场景。 我觉得机器人板块未来会分成两条线。 一条是情绪线 它会围绕人形机器人、具身智能、Physical AI 反复炒作。 这条线弹性大、波动也大。 另一条是产业线 它围绕内存、传感器、激光雷达、力反馈、减速器、边缘芯片、工业自动化、仓储物流、医疗机器人慢慢展开。 这条线没有那么刺激,但更接近真实订单和真实利润。 美光这次财报的意义,就在于它把机器人从情绪线,往产业线拉了一步。 因为它说的不是机器人很酷,它说的是机器人会消耗多少内存,什么时候开始形成需求周期,这个周期可能持续多久。 这就是半导体产业看问题的方式。 不看视频,不看口号,不看发布会掌声。 看 bit growth,看 content per device,看 supply constraint,看客户是不是愿意签长期协议,看资本开支是不是敢下去。 所以机器人这条线,真正值得重视的不是某一天谁涨了多少。 而是它开始具备产业化的三个信号。 第一,资金进来 一级市场融资创历史新高,说明资本开始愿意为机器人公司的长期制造能力和技术壁垒买单。 第二,上游开始建模 美光把机器人放进长期内存需求框架,说明机器人已经不只是科幻叙事,而是被上游供应链纳入未来需求曲线。 第三,场景开始筛选 仓储、工业、医疗、国防、农业这些领域,会先把真正有用的机器人筛出来。 最后留下来的,不一定是视频最好看的公司。 而是能稳定工作、能持续交付、能降低成本、能融入客户流程的公司。 所以我对机器人板块的看法很简单,它不是明天就爆发的题材。 但它一定是 AI 下半场最重要的产业方向之一。 过去 AI 的主线是云端算力。 接下来几年,AI 的增量会逐步走向边缘、终端、汽车和机器人。 再往后,AI 会进入真实世界里的每一个生产场景。 可能五年后,B端也就是企业端会开始大规模应用,而十年后,或许就会进入千千万万家。 这条路不会平滑,中间一定会有泡沫,有失败,有估值杀,有技术路线反复,有商业化低于预期。 但大方向很清楚,智能不会永远困在屏幕里。 它一定要长出眼睛,长出手,长出身体,进入现实世界。 而当这件事发生的时候,机器人就不再只是一个行业。 它会变成 AI、半导体、精密制造、自动化、传感器、电池、软件、国防和医疗共同汇合的一条大河。 美光看到的,是这条河最上游的水位变化 一级市场看到的,是河道开始变宽 二级市场接下来要做的,不是追每一个浪花,而是找到那些真正站在河床里的公司 @a16z
显示更多
0
47
63
2
转发到社区
DeepMind 创始人 Demis Hassabis 出了一个考题: 只给 AI 提供爱因斯坦在 1901 年能接触到的数据,看它能不能独立推导出《相对论》。 Demis 认为,今天所有的文本大模型,一个也通不过。 这才是测验 AI 智商的真正标准。 现在的 AI 每天写方案、写代码,看似无所不能,其实只是在做“外推”。 它只是把人类已经探明的事实,用更顺滑的逻辑和文字拟合出来。 真正的创造力是什么? 是面对未知的物理世界,提出一个前所未有的新假说。 爱因斯坦当年是怎么干的? 他在瑞士专利局当职员的时候,天天摸鱼做白日梦。 他闭上眼睛,在脑子里做“思想实验”: 如果我坐在一列火车上,以光速旅行,世界会变成什么样? 他是动用了视觉想象力,去和真实的物理世界碰撞。 最后,才是用数学把这个直觉证明出来。 这就是今天文本模型的死穴。 文字和逻辑,只是“比特世界”的东西。 哪怕 AI 读完了人类历史上所有的书,把所有的交叉连接都找出来,它也依然在比特里打转。 要想真正通关爱因斯坦测试, AI 必须接触、理解原子世界。 它需要提出假说,自己设计实验、甚至动手做实验,去和真实的物理定律肉搏。 所以,别再被那些精美的套话 and 缝合的 PPT 唬住了。 真正的科学发现,从来不是靠拼凑已知答案。 等哪天 AI 也能在没有答案的迷雾里,像个专利局职员一样,闭上眼去追一束光。 人类才算真正迎来了新神。
显示更多