注册并分享邀请链接,可获得视频播放与邀请奖励。

与「大模型」相关的搜索结果

大模型 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 大模型 的内容
中国大模型过去几年的发展,到底有多快? 我把这段历史,做成了一支 p(doom) 音乐视频。 灵感来自最近在推特上爆火的同类作品,整支视频由 Opus 5.5 制作。 看完才发现,我们已经走了这么远。
显示更多
@wangwatchworld 看了一下这个公司,蛮厉害的,3维的图像大模型
AMD 宣布用约 82 亿美元收购李飞飞创办的 World Labs,这期是彭博科技节目主持人 Ed Ludlow 对两位当事人的联合采访。一位是 AMD CEO 苏姿丰,AMD 做 CPU 和 GPU,OpenAI、Anthropic、Meta 都是它的大客户。另一位是 World Labs 创始人兼 CEO 李飞飞,她主持建立的 ImageNet 图像数据集是这一轮深度学习浪潮的起点之一。两人聊了为什么要做这笔交易、李飞飞在 AMD 的新角色、开放生态,以及 AI 安全该由谁负责。 交易本身 这是一笔全股票交易,也就是 AMD 用自己的股票而不是现金来付款,对 World Labs 的估值约 82 亿美元,预计年底前完成,还需要监管审批。交易完成后,李飞飞出任 AMD 执行副总裁兼首席科学家,直接向苏姿丰汇报,World Labs 团队将成为 AMD AI 模型团队的核心。 两家公司的关系早就开始了。AMD 是 World Labs 的早期投资方,也给它供芯片。苏姿丰说她从 World Labs 只有几个研究员的时候就在看着这个团队成长。两人也都提到彼此认识多年,私下是朋友。 芯片公司为什么要买模型公司 苏姿丰的理由是,AI 现在还在很早期的阶段,而且越来越明显的是,硬件、软件、系统和模型这几层互相影响,对整条链路理解得越透,造出来的系统就越好。收购 World Labs,一方面是拿到李飞飞聚起来的一批顶尖研究人员,另一方面是让 AMD 对模型未来的发展方向有第一手的判断,反过来指导下一代硬件怎么设计。 李飞飞从模型公司的角度讲了同一件事。World Labs 越做越大,对算力的需求也越来越大;和 AMD 合在一起,模型可以用最前沿的硬件加速训练和推理,硬件团队也能提前看到模型未来的工作方式和需求。她把这叫作 AI 软件和 AI 硬件的“共同进化”。 主持人追问 AMD 是不是要开始卖模型、卖软件。苏姿丰说不会改变商业模式,AMD 仍然是一家平台和解决方案公司,软件是用来支撑硬件的。收购的最终目的是让 AMD 更好地服务那些最大的算力客户,也就是各家模型公司。 World Labs 做到了哪一步 World Labs 成立于 2024 年,到现在两年多,专攻空间智能和物理智能,也就是让 AI 理解和生成三维世界、懂得物理规律,这类模型通常叫“世界模型”。李飞飞说,他们想做的是语言模型之外的方向,因为创作者、设计师、教育、医疗都有这方面的需求,机器人技术也快要迎来爆发。 公司目前已经发布了两代模型,先是 Marble,然后是最新的 Atlas。李飞飞介绍 Atlas 是一个多模态的“全能模型”,能生成高质量的画面,同时保持三维和四维(三维空间加上时间)上的一致性,摄像机和智能体可以在它生成的世界里移动和交互。 团队也在扩张。World Labs 最近收购了 SceniX,这家公司做出了一套机器人仿真工作流程,以及训练机器人控制策略的模型,由此给 World Labs 补上了机器人方向的人才。 李飞飞为什么选择加入 AMD 苏姿丰说她给李飞飞的说法是“加入全世界最令人兴奋的 AI 公司”。李飞飞的作用也不只限于 World Labs 团队。苏姿丰说 AI 没有一种方案能通吃,除了大家熟悉的云端 CPU、GPU,物理 AI、机器人、从云端到边缘设备再到个人电脑的端到端 AI,都是 AMD 未来三到十年要重点增长的方向,而这些正好是 World Labs 擅长的领域。 World Labs 今年早些时候刚融过一大笔钱,发展势头也不错,主持人问李飞飞是否考虑过别的出路。她说公司从一开始就以使命为导向,这件事的关键在于双方的愿景是否一致,和有哪些选择关系不大。在她看来,这次合并会是“一加一大于二”,接着她笑着补了一句,AMD 显然比 World Labs 大得多。 至于加入后会不会只做空间智能,李飞飞说两人还没来得及细谈所有计划,World Labs 正在做的工作会继续,但她预计研究方向会扩大、节奏会加快。 开放生态与可选择性 苏姿丰说,AI 未来会同时有开源模型和闭源模型、大模型和小模型,它们跑在不同的硬件上,这一直是 AMD 规划高性能计算和 AI 产品线的前提。她和企业的 CEO、CIO 聊下来,没有人愿意被锁死在某一家的硬件或软件生态里,大家都想在不同时候挑最合适的。所以 AMD 会继续押注开放生态,她和李飞飞也讨论过怎样用 World Labs 已有的成果推动开源生态。 李飞飞补充说,现代 AI 的发展离不开开放。从科学界公开分享神经网络算法,到她自己做的 ImageNet,这个首批开放的大规模数据集就是现代 AI 革命的推动力之一。开放生态能让不同的发现、创新和创业机会互相促进。 AI 安全该由谁负责 主持人提到当前的一个争论:模型能力的进步速度超过了安全和对齐研究的进步速度。苏姿丰说这件事上“没有可选项”,技术必须好,也必须安全。她拿芯片行业做例子:最高性能的处理器在设计时就要把安全和数据保密作为优先事项来考虑,AI 行业也需要把安全放到同样的位置。她说自己是 AI 乐观派,相信行业能建立起合适的流程和防护措施,而且各家应该像硬件行业现在分享安全方面的经验那样,互相分享做法。 主持人进一步问,提供算力的公司对训练是否安全、推理时模型是否按预期行事,要负什么责任。苏姿丰说生态里每一方都要为自己的行为负责。对 AMD 来说,要保证硬件本身安全、按设计运行,模型在上面跑时数据是安全的,还要和模型公司一起处理好软硬件之间的交互。她认为这件事应该由行业主导,但因为 AI 是新东西,各方学习的速度不一样,所以她欢迎更多的行业协作,也欢迎一定程度的第三方评估。 李飞飞说,主持人上周问她监管、第三方评估、前沿实验室自我负责这几种方式该选哪个,她的回答是全都要。她认为 AI 是一项“文明级”的技术,和历史上所有这类技术一样,初衷是让人的生活和工作变得更好,但每项技术都是双刃剑,必须负责任地开发和部署。无论在斯坦福、World Labs 还是现在的 AMD,她都想推动个人、公司、行业和社会四个层面共同承担这份责任。 AMD 的下一步 主持人提到 AMD 市值已经到了 1 万亿美元,苏姿丰近来也多次和美国总统一同公开露面。苏姿丰说 AMD 过去做过好几笔对公司影响很大的收购,World Labs 是下一笔,而且是战略意义很重要的一笔。在她看来,技术如今和经济、国家安全都紧密相关,AMD 有机会真正影响计算的未来走向。 最后主持人请李飞飞预测 AI 下一个重大突破。她没有给具体的技术判断,只说接下来 AMD 和 World Labs 会一起打造未来,而这个未来必须对人类社会和人们的生活有益。苏姿丰在一旁说:“我会让她忙起来的。”
显示更多
这个必须弄上,最强大模型加上最强交易工具!! 30秒把Tradingview接入Claude或GPT Codex任何大模型😘😘😘 Tradingview这几天出了官方MCP,那以前那些社区的MCP就删了吧,不如官方的安全,也不如这好用! 能直接看图表,看数据,看指标工具,管理自选列表,创建筛选器,设置和管理警报,分析任何一家公司的基本面,等等这些你能做的都可以用大模型辅助了,非常强。 我把流程画了一个说明书,各位可以试试,很好用。 TradingView:
显示更多
0
8
181
33
转发到社区
做了一个 AI 加持的划词工具: QDuo 功能介绍: 1. 纯 SwiftUI Native 实现,轻量,快速 2. 支持三种风格,环形,条形 展示 3. 支持二级菜单 4. 支持 AI 动作,翻译、润色、搜索、朗读、处理文本、问大模型等 30+内置动作,可自定义动作
显示更多
0
13
69
9
转发到社区
投中滴滴、饿了么、小红书的朱啸虎,最新专访里说了三件狠事: > 今年可能是大模型的最后一年。等 Anthropic 和国内几家上完市,故事就讲完了。3–5 年内开源会取代闭源,模型最后就是水电煤。 > 宇树 4000 亿估值太夸张。近 200 家人形机器人公司差别很小,行业要洗三四轮,最后赢的是华为、小米、比亚迪这种有供应链的。 > 这波 AI 创业没有壁垒,他只看增长,月增 20% 是及格线。
显示更多
「从零手写大模型」系列完结了 推理篇 15 篇,训练篇 5 篇,共 20 篇 从模型的基本结构 到如何生成文字,再到损失、梯度与参数更新 把学习过程整理成了一套完整笔记 每一篇都有可练习的代码示例 📖 推理篇 · 15 篇 01|LLM From Scratch:整体大纲路线 02|Tokenizer:分词器 03|Embedding:嵌入层 04|Positional Encoding:位置编码 05|Self-Attention:自注意力机制 06|Multi-Head Attention:多头注意力机制 07|Residual Connection:残差连接 08|LayerNorm:层归一化 09|FFN:前馈神经网络 10|Activation Function:激活函数 11|Transformer Block:Transformer 模块 12|Transformer Stack:Transformer 堆叠 13|Loading Pretrained Weights:加载预训练权重 14|Text Generation:文本生成 15|Interpretability:可解释性 🛠 训练篇 · 5 篇 01|Loss Function:损失函数 02|Backpropagation:反向传播 03|Gradient Descent:梯度下降 04|Adam Optimizer:Adam 优化器 05|Learning Rate Scheduling:学习率调度 推理篇,理解模型如何一步步算出下一个 token 训练篇,理解模型如何从误差中学习、更新参数 欢迎一起学习、交流,也欢迎指出笔记里的问题
显示更多
我终于明白为什么LeCun顶着全网群嘲也要死磕世界模型了, 现在很多人误以为大模型快要通向AGI了,纯粹是因为被那种博导般的答题体感给骗了, @ylecun 说单靠把大语言模型做大,哪怕到了地狱也搞不出人类水平智能, 甚至直接开喷数据中心养出天才军团纯属扯淡,很多人觉得他迂腐、天天唱衰, 但我仔细翻完他在ECCV上的最新拆解才彻底明白,他反对的从来不是语言模型有用,他自己做了一辈子模型太清楚了,大模型说白了就是把全人类写过的几千亿字当成了超级开卷题库, 你问什么它都能对号入座吐出来,这种博导体感是工程的巨大成功,但也让很多人误以为它真的学会了独立思考 
有意思的是LeCun搬出了皮亚杰那句老话,智能从来不看你知道什么、看的是你不知道的时候该怎么做,拿学开车来说, 人类小孩四岁光靠眼睛看世界就吸进几十万亿字节,二十小时练习就能上路,而我们的大模型相当于读了人类四十万年的书, 在物理世界里连个洗碗叠衣服的家务机器人都撑不起来,换个没见过的环境分分钟崩溃, 说白了自回归只是在一个词一个词往下猜,现在的所谓推理其实大量是在词语空间里做多轮抽样搜索,遇到代码和数学这种有编译器自动给奖励的封闭沙盒还能刷分,一旦扔进没有自动打分器的真实世界,错误就会指数级放大 
说实话这就是为什么他宁可离开Meta、跑到巴黎去给AMI Labs融三十五亿美元估值,也要死磕JEPA和世界模型,他要的是让机器学会预测我做这件事世界会发生什么, 在抽象空间里做动作规划,不用在文字表面拼漂亮句子,连现在的缩放派其实都在偷偷向他妥协,单独拉视觉编码器、在隐空间里做搜索、用物理引擎搞模拟, 外壳虽然还叫LLM,内核其实都在往世界模型的方向打补丁,大家争论到最后已经不是要不要算力,而是我们要把算力花在背诵更多文字上,还是花在让机器看懂物理因果上 
我自己平时也天天靠AI写代码查资料,缩放派确实把已知世界的说明书背到了极致,但真正的智能是要去写说明书从来没写过的那一页, 以后别再看各家发布会画什么天才之国的饼,就盯紧三件事,新任务要多少样本能学会,换个环境会不会整段崩溃, 以及汽车和机器人能不能像人一样在物理世界里安全跑起来,谁对谁错不用在网上打嘴仗,现实世界自会交卷。
显示更多
我觉得大部分𝕏做不起来的 主要是知识储备太少了 脑子里没什么可写的 只能写写废话挣流量 我提供两个起号方向 第一个:财经赛道 用AI把整个半导体产业链学习一遍 把那几十支热门股票 每一家的基本面 好好研究明白了 每天输出总结 第二个:大模型学习赛道 就一个Transformer 把里面的所有知识点 每天学一点,输出一点 以上任何一个赛道,坚持3个月 涨多少粉,我无法保证 但是你绝对可以 成为一方专业领域的小成选手 我想大部分人 都不想成为玩“泛娱乐”的评论账号吧 最后留下来的只有一堆没有沉淀的废话 现在有了AI 学任何东西都不是问题 阻碍你的只有你的懒惰、不自律
显示更多
0
47
265
14
转发到社区
准备面试 AI 岗位,想知道 Anthropic、OpenAI 这些大公司到底爱问什么,只能一个个帖子翻。 有人把 35 家公司公开流出的 AI 工程面试题,按公司逐家整理成了一个仓库,能找到解答的题目下面直接附了链接。 先看跨公司的高频题,注意力机制、KV 缓存、检索增强、Agent、系统设计这些分成 10 类,每题都标了哪几家问过。 GitHub: 每家公司还写了面试流程。像 Anthropic 是 30 分钟初筛、70 到 90 分钟编程测评,再加五轮左右,前后 3 周到 2 个月。 我觉得最有意思的是题目本身,比如「5 万份文档要跑一遍模型调用,接口只让开 100 个并发还会报错,代码怎么写」。 还有一题问,像 Claude Code 这样的编码 Agent,模型和外面那层框架哪个更重要,现在的面试确实很贴近实际工作了。 打算往大模型应用、Agent 方向投简历的,先把前面那 10 类高频题过一遍。
显示更多
0
6
240
56
转发到社区