注册并分享邀请链接,可获得视频播放与邀请奖励。

与「视觉大模型」相关的搜索结果

视觉大模型 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 视觉大模型 的内容
给大家带来蚂蚁灵波LingBot-Vision 实测! 本次测试最大的亮点是在仅 1B (10亿) 参数量下, 展现出了极强的空间几何和边界感知能力, 实测表现直接越级打平甚至超越了 7B 参数的 DINOv3, 极具性价比!它非常适合用作具身智能的视觉主干 (Backbone) , 或者嵌入到机器人导航、机械臂抓取等需要极高空间精度的框架中使用都很不错, 对本地算力要求也很低. 视频中我直接给大家演示了免微调的视频目标追踪, 随便画一笔就能死死"咬"住目标. 另外, 它在硬件级深度补全 (比如识别透明玻璃、反光物体) 上表现也堪称杀手级, 不过由于技能点都加在了密集空间结构上, 在全局图像分类能力上算是中规中矩. 手里有 30 系显卡的兄弟们强烈建议本地跑着玩玩! #灵波# #LingBot# #视觉大模型# #具身智能# #机器视觉#
显示更多
当大家还在为闭源模型的封锁而焦虑时,边缘侧的视觉大模型已经进化到了恐怖的阶段。 👇 Martin Maly 展示了仅凭一次 Prompt(One-shotted),Opus 4.8 就能把一台普通手机变成「羽毛球专业裁判系统」:
显示更多
0
4
101
13
转发到社区
我终于明白为什么LeCun顶着全网群嘲也要死磕世界模型了, 现在很多人误以为大模型快要通向AGI了,纯粹是因为被那种博导般的答题体感给骗了, @ylecun 说单靠把大语言模型做大,哪怕到了地狱也搞不出人类水平智能, 甚至直接开喷数据中心养出天才军团纯属扯淡,很多人觉得他迂腐、天天唱衰, 但我仔细翻完他在ECCV上的最新拆解才彻底明白,他反对的从来不是语言模型有用,他自己做了一辈子模型太清楚了,大模型说白了就是把全人类写过的几千亿字当成了超级开卷题库, 你问什么它都能对号入座吐出来,这种博导体感是工程的巨大成功,但也让很多人误以为它真的学会了独立思考 
有意思的是LeCun搬出了皮亚杰那句老话,智能从来不看你知道什么、看的是你不知道的时候该怎么做,拿学开车来说, 人类小孩四岁光靠眼睛看世界就吸进几十万亿字节,二十小时练习就能上路,而我们的大模型相当于读了人类四十万年的书, 在物理世界里连个洗碗叠衣服的家务机器人都撑不起来,换个没见过的环境分分钟崩溃, 说白了自回归只是在一个词一个词往下猜,现在的所谓推理其实大量是在词语空间里做多轮抽样搜索,遇到代码和数学这种有编译器自动给奖励的封闭沙盒还能刷分,一旦扔进没有自动打分器的真实世界,错误就会指数级放大 
说实话这就是为什么他宁可离开Meta、跑到巴黎去给AMI Labs融三十五亿美元估值,也要死磕JEPA和世界模型,他要的是让机器学会预测我做这件事世界会发生什么, 在抽象空间里做动作规划,不用在文字表面拼漂亮句子,连现在的缩放派其实都在偷偷向他妥协,单独拉视觉编码器、在隐空间里做搜索、用物理引擎搞模拟, 外壳虽然还叫LLM,内核其实都在往世界模型的方向打补丁,大家争论到最后已经不是要不要算力,而是我们要把算力花在背诵更多文字上,还是花在让机器看懂物理因果上 
我自己平时也天天靠AI写代码查资料,缩放派确实把已知世界的说明书背到了极致,但真正的智能是要去写说明书从来没写过的那一页, 以后别再看各家发布会画什么天才之国的饼,就盯紧三件事,新任务要多少样本能学会,换个环境会不会整段崩溃, 以及汽车和机器人能不能像人一样在物理世界里安全跑起来,谁对谁错不用在网上打嘴仗,现实世界自会交卷。
显示更多
AI加玄学最近热度确实猛,但真正能落地跑通的硬核项目没几个。翻了几天GitHub,扒了8个实战开源的狠货,直接干货甩脸上。 提醒:别以为这是算命,这是你人生的K线图、Agent智能体、硬核算法排盘、玄学SaaS出海一条龙。直接Star收藏,不然后悔。 1 人生K线 创意满分,把八字命理和股票K线结合,AI大模型跑出你一生的牛市和熊市。让你直观看到自己到底什么时候能翻身,什么时候该躺平。支持自托管部署,趣味性拉满,不信你试试。 2 西方占卜AI模型 西方神秘学加NLP组合拳,用Reddit占星板块和纽约时报真实数据训练,做AI塔罗、占星文本分析的绝佳参考。想做蹭热度玄学内容?直接抄作业。 3 古代三式硬核算法 这个链接打不开,可能仓库被删或改名了。建议用“奇门遁甲”“大六壬”直接在GitHub搜,这类排盘库Python有不少,硬核到肝疼。 4 四柱编程 老天当程序员系列。用编程思维、面向对象彻底解构八字五行和天干地支。极客精神炸裂,教科书级别干货,保证让你看傻。 5 命运解读智能体 统一玄学Agent技能库。Python写,支持八字、紫微、占星等六种算命方法。专为接入Claude、Codex等大模型设计。想做AI算命机器人?直接抄。 6 神秘学Web应用 UI神秘感拉满的AI算命Web完整项目。React加Node.js搭建,底层接Llama 3大模型。前端动效和视觉直接参考,做产品抄这个就对了。 7 八字计算引擎与WebUI 八字五行计算神器。C++和Python算法扎实,自带Flask Web界面。开发者套壳二次开发,省时省力,直接起飞。 8 算命出海API服务 独立开发者出海搞玄学必看。AI命运解读API接口,爱情、事业、财富全涵盖,多语言SDK。产品价值提炼得牛逼,快速集成变现。想做跨境玄学老板?学它。 总结:AI玄学不是噱头,是真能赚钱。这几个仓库,研究透一个,你就赢了。
显示更多
0
16
378
125
转发到社区
先是 GLM5.2,然后是 Kimi K3,现在是 Qwen 3.8 Max,每次国产模型的新发布都更加接近 Coding 领域的 SOTA。从 6 月开始,我感觉国内大模型明显开始在 Coding 和 Agent 领域加速了,和海外顶级 SOTA 的差距正在肉眼可见地缩小。 目前看,国产模型的长程任务、自主运行、反馈回路、跨 Harness 泛化和视觉自我检查等,能力越来越强了。做一个谨慎的预测,预计到 2026 年的年底,对于重度开发者和 Vibe 用户来说,海外模型可能会成为辅助模型,国内的大模型将成为我们的主力工具。 模型用户没有忠诚度,大家会用脚投票的,拭目以待。
显示更多
搞自动化和爬虫的兄弟可以把之前的方案扔了。 GitHub 上突然爆火了一个开源项目 Index(由 AI 开发者平台 Laminar 团队打造),直接把网页浏览器变成了可调用的 API。这玩意本质上是一个极度丝滑的“AI 浏览器 Agent”,你在终端输一句人话,它就能像真人在浏览器里点按、抓数据、填表单,甚至跨站点联动办完一整套复杂流程。在 WebVoyager 跑分里直接飙到了 92% 的惊人准确率。 一句命令就能跑:pip install 之后敲 index run 就能直接在终端调用。 能直接用本地 Chrome:带 --local-chrome 参数,自动复用你已登录的账号状态。 顶配视觉推理引擎:原生支持 Claude 3.7 Sonnet、Gemini 2.5 Pro 等顶尖多模态大模型。 全程会话回放与排错:自带开箱即用的可视化录屏与步骤 Trace 监控。 自动抓取并生成表格:一句话搞定“去网站抓数据并新建 Google Sheets 写入”。 📦 开源协议:Apache-2.0 🔗 GitHub 传送门:
显示更多
来自北京的月之暗面公司在7月16日发布了全新旗舰大模型 Kimi k3,是全球首个开源 3 万亿级大模型。100 万 上下文长度,可一次性载入百万字文档、完整代码库、整本财报、长篇专业文献,专为长时程代理式编码和自我演化工作流而构建。原生多模态统一支持文本、图片、截图、图纸视觉理解,非外挂视觉插件。 综合能力上仅次于闭源顶级模型 GPT-5.6 Sol、Claude Fable 5,在代码、长文档检索、复杂工程任务上反超绝大多数竞品开源 / 闭源模型。 完整模型权重将于2026 年 7 月 27 日公开释放,企业可本地私有化部署、二次微调,是当前可商用规模最大开源基座。
显示更多
最近当大家都在刷屏Fable 5和GPT-5.6 的时候, 殊不知腾讯已经悄无声息的把大模型能力给追上来了。 你们知道腾讯低调到什么程度吗? 前几天发布的Hy3 ,21B的激活参数已经可以打平旗舰水准,并且直接塞进微信10 亿+用户手里 , 这才是国产大模型真正的王炸啊兄弟们! 说实话周一刷到 Hy3 发布消息那会儿, 我第一反应跟很多人一样:又一个卷参数的国产模型? 趁着周末有空,我仔细翻了一圈资料, 发现完全不是这么回事。 原来@TencentHunyuan这个模型从一开始就不是朝着聊天模型去的,人家的定位就是奔着干活去的 Agent 向 LLM。 另外最反直觉的是它的推理效率,295B 总参数, 实际激活只有 21B 的 MoE 架构, 就能打平参数是它 2 到 5 倍的旗舰模型, 这事儿我琢磨了一下,其实有点像团队管理, 并不是说人越多产出越高, 关键得看真正干活的那几个人靠不靠谱。 为什么这个效率重要呢? 你想想微信每天服务 10 亿人, token 成本多一厘都是天文数字, 21B 激活还能打出旗舰水准, 我觉得这才是它能被规模化铺开的根本原因, 跟刷榜没半毛钱关系。 说到刷榜,我仔细研究之后这个版本还真不是, 从 preview 到正式版,Hy3 是Hunyuan团队拿了50 多个真实业务的反馈不断迭代出来的,内部 WorkBuddy 任务成功率从 72% 干到 90%,耗时降了 34%,幻觉和常识错误全往下掉。 我原来以为 Agent 的核心是想得多深, 后来发现真正决定能不能上生产的,是稳不稳, 比如工具编排会不会中途崩,出错了能不能自己爬回来,换个框架差不差太多等等, 就是这些不起眼的东西, 才是能跑完一整套 workflow 不掉链子的关键。 当然实际测试下来Hy3 也有短板, 比如纯视觉它还不够强,不过腾讯也有单独的多模态大模型线,它能打的主要还是 coding、办公、复杂任务规划这几块。 最后说个我的一个判断:就是接下来大模型拼的可能不是谁参数更大了,核心看谁能把干活的能力以最低摩擦送到更多人手里,比如Hy3 我理解它可能不是一个更会聊天的模型,更像是一个更会干活的 Agent 底座。 话说回来,腾讯这步棋确实走得挺狠, 我觉得国产大模型的拐点真的要到了, 下方视频是我用Hy3跑的几个测试案例, 分别让它做了一个介绍自己的HTML网页, 一个我的认知系统agent网页, 和做了一个10页的PPT,都很惊艳,大家可以感受下, 会干活、会自检、还会主动说自己哪没做到位, 我觉得这才是 Agent 时代,真正能用的模型该有的样子hh~ #Hy3# #Hunyuan# #TencentAI#
显示更多
0
29
254
7
转发到社区
holy fucking shit,大模型计费的底层漏洞,被人用一张图片捅穿了🤯 给大模型喂长文本的成本,被这个野路子直接砍了六成, 这款叫pxpipe的本地代理工具,会自动拦截发往Anthropic接口的请求, 把系统提示,工具文档,历史对话,代码文件这些高密度内容,全部打包成图片再发给模型, 只把最近对话和关键内容保留纯文本,兼顾缓存效率, 原理说穿了很简单,图片按像素尺寸固定计费,和文本密度无关,一张1928×1928的图片, 能塞进去九万两千多字符,只消耗四千七百多个视觉token, 折算下来成本直接打四折,这套思路根源来自DeepSeek的光学压缩研究,通过图像传输文本的效率接近纯文本的十倍,准确率还很高, 实测在Fable 5上跑编码任务表现稳定,准确率损失极小,特别适合吃token的编码智能体场景, 当然也有明显短板,ID,哈希值,密钥这类精确字符串容易出现识别误差,目前对Fable 5适配最好, 其他模型效果有差异,有人觉得这是钻定价漏洞的取巧玩法,也有人觉得这是真的效率提升, 对重度使用编码智能体的开发者来说,省下来的都是真金白银hhh
显示更多
0
12
29
9
转发到社区
一个普通的小玩意,结合AI叙事和高级视觉设计,能包装到什么地步? 英国一家创意工作室,专门研究了这个问题。 他们搞了一个项目,交互炫酷,高级感拉满,目的就是为了嘲讽AI模型发布!! 讽刺 AI 时代过度包装、术语崇拜和产品发布泡沫! 顺便展示自己的 3D、WebGL、动效、品牌叙事和创意 campaign 能力。 他们把一个普通的不能再普通、甚至都不存在的杯托产品,包装成了一个划时代的AI产品来呈现。 把 AI 圈常见话术全套搬到了杯垫上。 1、Powered by AI 这个是最搞笑的,Powered by AI,但脚注里提示 AI 是 Adobe Illustrator。 2、开源权重 / Open-weight model 团队还发布了所谓的开源模型权重Oryzo-1,结果 GitHub 里是一个软木杯垫的 3D OBJ 模型。 3、Benchmark / SOTA / Instruct / Frontier 他们还把不同 OBJ 文件命名成 26B、40B、108B、168B-instruct、344B 等,明显是在戏仿大模型参数规模和 checkpoint 发布方式;并且基准测试 WoodenBench 是在一张桌子上做的,而且“很可能被操纵”。 4、On-device / edge / RTX 3090 / no cloud 官网写它“Runs on the edge”“Refuses the cloud”“No power required”,直接把 AI 硬件、本地部署、算力焦虑的营销式文案套到一个无需供电的杯垫上。
显示更多