注册并分享邀请链接,可获得视频播放与邀请奖励。

与「TPU」相关的搜索结果

TPU 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 TPU 的内容
我讲讲一个很有意思的思考,英伟达这次5000亿的第三方AI算力融资平台,十分利好于它的亲儿子们,尤其是新云☁️, $NBIS ,我讲讲其中的逻辑!🧐 黄老板的四大战略布局: 1️⃣ 拆除“资本壁垒”,将超级云的ASIC防线撕开缺口 像微软(Azure)、亚马逊(AWS)、谷歌(GCP)这样的传统 Big Tech,拥有源源不断的自由现金流,能够自筹资金推进定制化 ASIC 芯片,比如 Trainium、Inferentia、TPU、Maia。 假如任由传统云厂商持续侵蚀,那些独立 AI 实验室与新云将面临高昂的硬件采购成本,以及高借贷利率下,难以生存,最终会被竞争挤压掉。英伟达通过撬动华尔街的私有信贷,直接武装了新云,打破了这堵墙,让算力买方市场始终保持多元化,同时也保障了英伟达机柜的可持续性采购! 2️⃣将英伟达GPU 赋予硬通货属性,可资产抵押 正常情况下,传统金融机构不敢轻易出借大额资金购买定制 ASIC,因为一旦债务人违约,特定软件栈绑定的 ASIC芯片,离开特定系统就是一堆废铁。 但英伟达的 GPU 凭借强大的 CUDA 生态系统,实现了极强的跨模型、跨客户、跨工作负载的可调配性与流动性。这种“强通用性 + 极高二级市场租金”的特征,使其可以像商业地产、民航客机或收费公路一样被打包作为贷款抵押物,相当于把GPU打包成了金融衍生品! 3️⃣供应商融资的终极演进:资产负债表的“降维打击” 通过提供残值担保和联合信贷协议,英伟达把自身的绝高评级信誉直接做成撬动资本的杠杆。这与汽车公司通过旗下汽车金融公司拉动新车销量的模式一毛一样,英伟达用华尔街的低息资金来贷给自己的客户,客户拿到钱买英伟达的芯片,英伟达实现锁定业绩与出货量,从而形成极其闭环的“算力金融飞轮”。 4️⃣对冲下沉周期的“流动性黑洞” 对于数据中心建设和硬件更新而言,最大的风险是流转周期短与硬件贬值。通过资本巨头的“长期低成本资金包”,将原本需要短期结清的CapEx转变为摊薄在 5–15 年周期的长期资产融资。这极大平滑了下游新云客户的现金流压力。 📝为什么这对新云是极大的利好? 以CoreWeave、Nebius 等新云举例,传统旧模式下,这些公司因缺乏大型科技公司的信贷评级,在传统高收益债券市场去借款,可能承受 9%–12% 甚至更高的借贷利率,或者采用股票定增,但又面临股权被过度稀释的风险。 而英伟达爸爸提供的新模式,由于有5000亿第三方的信贷额度,新云可以直接利用已部署的 GPU 集群和已签订的机构合同做资产证券化,类似ABS,将融资成本拉低 200~500 个基点。 这种模式的好处,就是可以实现用资产养资产,类似房贷一样,可以做到以租抵贷,这样就大幅提高了资本利用效率,同时也可以实现高速扩张,新云厂家可以更快的周期下订单、锁机柜、建数据中心。这使得独立新云在面对四大云厂商的机房排期垄断时,拥有了争夺大模型独角兽客户的核心竞争力。 综合来看,这里面最受益的肯定是 Nebius( $NBIS),英伟达直接持有 Nebius 9.3% 的股份,相当于英伟达算力矩阵中的“亲儿子”级的新云提供商。而且它的技术也十分牛X,区别于传统杂乱的云厂商业务,它专攻AI大模型训练和推理场景,提供高性能 InfiniBand 互联与极低延迟的物理环境。 继续HOLD $NBIS,坐等大空头Michael Burry 爆仓🧐 本文由 @binancezh 赞助,「币安买美股:全球资产,零秒时差,一键即达」!
显示更多
0
52
24
2
转发到社区
谷歌开源TPU Raiden 大模型推理常把prefill(预填充)和decode(解码)拆成两组独立实例部署,但拆开后KVCache怎么从prefill搬到decode,在GPU阵营有NVIDIA开源的NIXL把这层传输标准化,TPU阵营此前一直没有对应方案。 现在谷歌开源了Raiden,你在TPU上部署分离式推理架构时,不用再自己写KVCache搬运的底层代码,可以直接调用现有方法。 方向很好,但是项目现在非常早期,仓库里也明确写了存在不稳定的情况。 Github:
显示更多
底层看稀缺,顶层看客户!看到 @chamath 分享的这张 AI Stack,感觉这个架构划分和 Rewire Index 5 Layer 相当类似,分享一下我对每一层的理解: 1. 能源与基础设施层(最底层) 与 Rewired Index 的逻辑一致。电力会迎来爆发式增长,尤其是无需接入电网的独立供电商(IPP);而土地受政策影响太大,弹性有限。在大众的舆论压力之下,太空基建应该会是未来几年的新机会,无需土地,无限电力⚡️ 2. 芯片层 做独立芯片,初创公司基本没有机会:性能要求极高、工艺极其复杂,最关键的是供应链已被完全锁死——这是头部玩家的战场。 真正的机会在融合与生态。从 Google TPU 的发展路径,到 Cerebras 等高速推理芯片的崛起,可以看出芯片会与云厂商、模型公司深度绑定。围绕芯片构建数据中心的整体供应与创新,机会很多;单做独立芯片,机会渺茫。 3. 云服务层 云可以分为 Hyperscaler 和 NeoCloud两类。模型商品化之后,几乎所有的负载都要靠云来承载,这会是非常赚钱的生意。但构建极其复杂,堪称 AI 时代的重资产业务——或者说,智能时代的房地产。 4. 模型层 模型公司面临的核心问题是正在被商品化: - 如果 Scaling Law 已到极限,模型百分之百会被商品化; - 即使 Scaling Law 还有很大空间,大家对「最好智能」的需求也在被分解——大量日常应用不需要最顶级的智能,中等水平模型和开源模型会逐渐接管这些需求,反而加速了商品化; - 最尖端的头部模型公司,更像是「先进制程」的芯片:能从中获取很高的价值,但并非所有任务都需要它。 5. 应用层:Harness vs Application 这张图最有趣的地方,是把应用层拆成了 Harness 和 Application 两层。 我的判断是:按目前模型的进化速度,Application 还没有任何机会,但 Harness 的机会已经大量出现,尤其在企业端。企业内化的知识只能通过 Context 和约束来落地,所以 Harness 就是新的企业应用层;它们会替代旧的 SaaS,或倒逼旧 SaaS 升级。 如果把 AI 扩展到大语言模型之外的更广义范畴,应用层更可能以垂直集成的形态出现,例如:自动驾驶 / RoboTaxi / 任何可端到端自动化工业流程和武器系统;生物研究 / Wet Labs;把执行能力直接部署进企业内部的模式(类似 Palantir 的服务方式)
显示更多
TPU 8i and TPU 8t deliver sustainable economics—offering up to 80% better performance-per-dollar for low-latency serving while seamlessly scaling to 1M+ chips! Learn how our 8th-generation TPU system drives the next frontier of AI ↓
显示更多
0
33
992
120
转发到社区
白线 WhiteLine Daily:Alphabet 将 2026 年 CapEx 指引上调至最高 2050 亿美元,Cloud 收入同比增长 82%,AI 投入正加速转化为收入。若超 300 万颗 TPU 代工订单最终落地,Intel(INTC)或成为最大边际受益者。 阅读全文:
显示更多
🚨 NEW UPDATE on the New Orleans Saints & Chris Olave’s extension! The Saints are expected to get a deal done before week 1 according to Larry Holder of The Athletic. This is consistent with the rumors & reports around Olave’s extension that local media has shared.
显示更多
0
3
103
12
转发到社区
New course: Build LLM applications that respond to user requests quickly by running on hardware designed for fast inference. This short course was built with @Cerebras and taught by @zhennydez, @duerr_seb, and @MilksandMatcha. When a model generates text, much of the time is spent moving its weights out of memory and into the compute units. Inference-optimized hardware minimizes that movement, making token generation several times faster than on a typical GPU setup. In this course, the hardware you'll use is Cerebras' Wafer-Scale Engine, which is designed for fast inference by keeping the model's weights close to the compute units. Fast inference makes lengthy agentic workflows go faster, and also unlocks latency-sensitive, real-time applications like live translation and voice agents. Skills you'll gain: - Compare how GPUs, TPUs, and Cerebras' Wafer-Scale Engine each handle the memory-to-compute bottleneck - Build real-time applications powered by fast inference, including personalizing a webpage and running a multi-step workflow to analyze market signals - Adopt concrete habits for agentic coding with fast inference, keeping your sessions focused and steering the model more effectively My teams use Cerebras for several applications that are latency sensitive. Join and build LLM applications that respond quickly:
显示更多
0
50
719
72
转发到社区
Google 在 Pixel 10 上跑 Gemma 4 三万英尺的客舱断网也能聊天、看图、改设置 在Google I/O India 上,Tensor 团队和 Pixel 团队联合演示:把 Gemma 4 轻量版直接塞进手机里的 TPU里 不仅能能聊天」,还能「看图、听写、控制手机」 官方演示:手机在断网状态下做旅行规划、菜谱推荐和家居自动化
显示更多
No vuelvas a usar Ollama si quieres sacar el máximo rendimiento a tu IA local. No exprime al máximo la potencia de tu GPU. Y eso se nota cuando empiezas a servir modelos más exigentes. Por eso nació vLLM. Un proyecto desarrollado originalmente en UC Berkeley para ejecutar modelos de IA de forma mucho más rápida, eficiente y preparada para producción. → Hasta 2 veces más rendimiento en determinadas cargas de trabajo → Compatible con más de 200 arquitecturas de modelos → API compatible con OpenAI para integrarlo fácilmente → Funciona con NVIDIA, AMD, Apple Silicon, TPU y mucho más Se instala con un simple: pip install vllm Mientras Ollama está pensado para que cualquiera pueda ejecutar modelos de IA... vLLM está diseñado para exprimir al máximo el hardware y servir modelos con el mejor rendimiento posible. Tiene más de 85k stars en GitHub, es 100% gratis y open-source. Repo en comentarios 👇
显示更多
0
10
170
37
转发到社区