注册并分享邀请链接,可获得视频播放与邀请奖励。

与「Prediction」相关的搜索结果

Prediction 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 Prediction 的内容
Feeling the AGI/ASI, few observations 1. Opus 5.5 really gives strong vibes of AGI (maybe not fully there, but we're very close, like 80%-90%). For example, few breakthoughs in training humanoids are needed. We need to move this intelligence into physical world. 2. I don't think Anthropic has discovered any magical formula. 3. Which means, SpaceXAI, Google, and others will soon follow. This prediction is based on the amount of compute they already have + additional compute being added all the time. 4. Never was more confident that Anthropic, SpaceXAI, Google, OpenAI, likely Meta, basically all big US AGI labs will have proper AGI in 2027. 5. And from there we'll move quickly to ASI territory (likely also in 2027). It looks like few GW of compute are enough for strong AGI, now imagine what we will able to do with 10-20GW of compute which are rapidly coming online. And then with 100GW-200GW... 2027 will be an utterly insane year.
显示更多
0
350
5.4K
452
转发到社区
这个开源项目系统整理了 35 家 AI 公司的 AI 工程师面试题,全部来自 “公开报告的面试经历” 来自 @outcome_school 团队 @pallavishekhar_ 开源发布,内容几乎涵盖了 OpenAI、Anthropic、DeepMind、xAI、DeepSeek、Kimi、GLM 等 AI Labs,Cursor、Cognition、ElevenLabs 等 AI Native 团队和 Nvidia、Microsoft、Amazon、Apple 等头部大厂。 覆盖的岗位头衔也非常多:AI Engineer、LLM Engineer、Gen AI Engineer、ML Engineer、Research Engineer、Applied Scientist、FDE、MLOps/LLMOps 工程师等。 开源地址: # 内容架构:一个精心设计的双层结构 第一层:跨公司通用题(Common Questions)。 作者把在多家公司反复出现的题目只列一次,标注"Asked at"哪些公司,按十大主题组织: 1. LLM 内部机制与架构 — attention 缩放因子、KV cache 内存公式推导、MQA/GQA/MLA、FlashAttention、BPE、RoPE/YaRN、Chinchilla scaling laws、MoE、解码采样策略、lost-in-the-middle、RMSNorm、SwiGLU 2. 推理、服务与 GPU 性能 — prefill vs decode、continuous batching、PagedAttention、投机解码、量化(FP16→FP4)、五种并行策略、TTFT/TPOT 指标、H100 上的 roofline 计算、vLLM/SGLang/TensorRT-LLM 选型、“如何把服务成本降 10 倍” 3. RAG 与检索 — 分块策略、BM25 vs 稠密检索、重排序器、HyDE、权限感知检索、ANN 索引、索引新鲜度、答案归因 4. Agent 与工具调用 — ReAct、MCP、工具 schema 设计、多智能体编排、Agent 记忆、循环终止条件、人类审批 5. 微调与对齐 — RLHF/DPO/GRPO/RLVR 全谱系、LoRA/QLoRA 数学、灾难性遗忘、“提示 vs RAG vs 微调”决策框架、蒸馏、reward hacking 6. 评估与可观测性 — LLM-as-judge 及其偏差、幻觉检测、基准污染、Agent 评估、回归门禁 7. 安全与负责任 AI — 提示注入(直接/间接)、OWASP LLM Top 10、护栏、Constitutional AI、红队 8. 多模态与语音 — VLM、语音 Agent 延迟预算、barge-in 打断处理、级联 vs 端到端语音、ASR/TTS 评估 9. AI 系统设计 — 十类高频设计题(千万级文档企业 RAG、代码助手、客服 Agent、Text-to-SQL、LLM 网关、数亿用户聊天服务等) 10. 编码题 — 从零实现 attention、KV cache、BPE、采样;LRU 缓存、令牌桶限流器、异步批处理器、SSE 流解析器、最小 Agent 循环 第二层:35 家公司的专属章节,分为五大梯队: 1. 前沿实验室(12 家):Anthropic、OpenAI、Google DeepMind、Meta、xAI、Mistral、Cohere、DeepSeek、月之暗面(Kimi)、智谱(GLM)、阿里(Qwen)、Sarvam AI(印度) 2. 大厂 AI 组织:Microsoft、Amazon、Apple、NVIDIA、Tesla,以及一组消费级 ML 公司(Uber/Netflix/LinkedIn/Airbnb/Pinterest/Spotify) 3. AI 基础设施公司:Databricks、Groq、Together AI、Hugging Face、Scale AI、Perplexity 4. AI 原生产品公司:Cursor、Cognition(Devin)、Sierra、Harvey(法律)、Glean、 AI(机器人)、Waymo 5. 前向部署/企业 AI:Palantir # 题目分布透露的行业信号同样值得关注 1. 公司的差异化考察方向,和它的商业模式严丝合缝。 这是最能体现整理功力的地方: · DeepSeek、月之暗面、智谱、Qwen 的题目深度绑定自家论文——MLA、auxiliary-loss-free 负载均衡、Multi-Token Prediction、MuonClip、DualPipe、长上下文扩展、GLM 的 thinking 模式。面试这些公司等于面试它们的论文,还要求 PyTorch 从零实现 MoE 路由。 · Groq 的题全是 SRAM-only 架构下的 roofline 重推演:“没有 HBM,decode 的 roofline 论证哪里变了”、“确定性在 p99 层面到底买到什么”。 · Apple 清一色端侧:3B 模型在手机上跑、PTQ vs QAT、不采集用户内容的前提下用设备信号改进模型、30+ 语言区无法记录用户内容的评估方案。 · CharacterAI 是推理经济学:“我们的服务成本被 KV cache 而非权重主导,降一个数量级,代价是什么”。 · Harvey(法律)和 Abridge(医疗) 考的是领域约束下的工程:200 页信贷协议里第 140 页的条款依赖第 8 页的定义术语怎么检索、生成的病历中出现了患者没提过的药怎么当作安全事故处理、PHI 如何约束整个架构。 · Palantir 的招牌是 "decomposition" 轮:把“一家货运铁路公司每年因机车非计划停机损失数千万”分解成工程计划。 2. 编码轮的形态正在发生实质性变化。 文档里反复出现的一类题,与传统 LeetCode 明显不同: · “实现一个内存 KV 存储:先 SET/GET/DELETE,再加事务 BEGIN/COMMIT/ROLLBACK,包括嵌套事务”(OpenAI、xAI 都问) · “给你一个 LLM 推理引擎的调度器类,其中一个方法是空壳,没有规格没有文档。说说你头三十分钟干什么”(xAI) “重构这 120 行能跑但很乱的代码,不许破坏测试”(OpenAI) · “对 5 万个文档跑 LLM 调用,API 限 100 并发、偶发 429 和超时,把 Python 写出来”(Anthropic) 考察重心从算法记忆转向增量需求下的代码演进能力、并发正确性、真实工程约束下的取舍。 3. “AI 协作轮”作为新题型已经进入正式面试流程。 这是文档里最前沿的信号: · Anthropic 部分机器学习岗有 AI-collaboration 轮:现场给你 Claude,考察的是你如何指挥它和验证它的产出,而不是你自己写。 · Meta 2026 年的流程新增三阶段 AI 辅助编码轮(探索修复 → 实现新功能 → 扩展改进)。 · Cursor 的 onsite 是两天在真实 Cursor 代码库上做一个功能(或 8 小时远程版),明确考核你对 AI 工具的使用效率和自主 scoping 能力。 · Sierra 给你两小时和任意 AI 工具,看你选择做什么。 xAI 有四小时限时产品构建。 4. FDE 成为一级岗位类别。 Anthropic、OpenAI、Databricks、Scale、Together、Sierra、Harvey、ElevenLabs、Palantir 的章节里都有 "Applied and Forward-Deployed Scenarios" 专属题库——典型题目如“企业客户说 Claude 幻觉太多,你是驻场工程师,头 48 小时做什么”。这对应了 AI 公司向企业交付方式的转变:模型能力差距收窄后,落地能力成为差异化。 5. 硬核系统题的普及。 "H100 上 70B 模型 batch size 1 的 roofline 计算"、"估算 70B 模型的 GPU 显存(权重 + KV cache + 激活 + 碎片)"、"p99 延迟在部署后翻倍但模型没变,走一遍诊断”——这类题横跨 NVIDIA、Together、OpenAI、Perplexity 等多家,说明推理性能的量化直觉已成为 AI 工程师的通用素养,而非基础设施工程师的专属。
显示更多
.@JensenHuang DISMANTLES Geoffrey Hinton’s AI doomerism: “All of his predictions have been WRONG. Enough predictions.” “Don’t think for a second just because you’re an alarmist that you’re doing a social good.”
显示更多
0
23
615
127
转发到社区
🧐 $LAPTOP 暴涨暴跌事件全面复盘:Hunter Biden 的 Meme 首秀,为什么两分钟就把一个 5000 万美元的币炒到了千亿美元估值? 昨天拜登之子的 $LAPTOP 开盘,应该是今年 MEME 里非常值得完整复盘的一次发行。 这个币最夸张的时候,不同数据源记录到了 190 美元、199 美元甚至 300 美元以上的瞬时成交价; 更魔幻的是,暴跌 98% 后,LAPTOP 在 4.77 美元附近依然显示着 16 亿美元流通市值、48 亿美元 FDV; 而所有池子加起来只有大约 250 万美元流动性。 1️⃣ 事件复盘:一场从开盘前就已经埋好炸药的 Meme 首发 这件事得从 Hunter Biden 为什么突然跑来发币说起。 LAPTOP 这个名字当然就是那台著名的 Hunter Biden Laptop。 2019 年 Hunter 把电脑留在特拉华州一家维修店,里面的私人照片、邮件、商业往来随后大量流出,这台电脑最终贯穿了 2020 年美国大选,也变成了共和党攻击 Biden 家族最重要的政治符号之一。 Hunter 今年重新活跃在社交媒体以后,反而开始主动拿自己的黑历史玩梗。 6 月他就公开表达过对去中心化货币的认可,9 月 7 日突然丢出一个视频: $LAPTOP ,September 9。 Hunter 还对标 TRUMP,含沙射影,把 LAPTOP 塑造成了一个“反政治 Meme 割韭菜”的政治 Meme。 正式上线之前,市场其实已经明显不买账。 Kraken 原本发过 LAPTOP 的宣传内容,遭到社区围攻以后把帖子删了; 知名交易员 DonAlt 直接把这次发行称作“彻底的尴尬”; Channel 5 公开切割,承认之前给过 Hunter 一个 CSV 邮件名单,但表示自己和这个币没有关系; Base 也主动划清边界,明确表示 LAPTOP 团队此前联系过 Base,但 Base 有意识地决定不参与设计和推广。 但没关系,对于 Meme 玩家来说: 大家骂得越狠,关注度反而越高。 2️⃣ 10 亿枚 LAPTOP,到底分给了谁? LAPTOP 总供应量是 10 亿枚。官方披露的分配结构如下: 创始团队:30%,也就是 3 亿枚; Prediction:30%,3 亿枚; 社区空投:20%,2 亿枚; 流动性:10%,1 亿枚; Foundation Treasury:5%,5000 万枚; 慈善:5%,5000 万枚。 其中创始团队的 30% 包括 Hunter Biden 本人,这部分筹码锁仓 6 个月,之后再经过 24 个月线性释放。 所以至少从目前能够确认的规则来看,Hunter 手里的团队币并不能在昨天开盘直接砸。 真正和昨天行情直接相关的是那 20% 空投。 这里实际上又拆成三部分: 2%:给 TRUMP 亏损用户; 8%:给 9 月 6 日之前订阅 Hunter “Where's Hunter?” Substack 的用户; 10%:留给未来社区空投。 3️⃣ 几万美元的池子,两分钟制造出千亿美元的估值 9 月 9 日美东时间上午 8 点左右,也就是北京时间晚上 20:00,LAPTOP 正式开放交易。 这里出现了昨天最经典的一幕。 不同数据平台因为取样池和聚合方式不同,记录出来的最高价非常混乱: CoinDesk 记录约 190.81 美元; CoinGecko ATH 为 199.51 美元; DexScreener 某些池子甚至一度显示 300 美元以上。 其实这种数据不一致本身就是事件的一部分,市场根本没有形成一个统一价格。 LAPTOP 刚开始交易大约两分钟,Arkham 捕捉到其中一个时点,FDV 高达 1440 亿美元,但流动性池只有 4.8 万美元。 而 LAPTOP 最初公布的参考发行价格大约只有 0.05 美元,对应全流通估值大约 5000 万美元,纸面财富上涨 3000 倍。 4️⃣ 公开市场的 FOMO 玩家开始进场 链上数据显示,符合条件的部分订阅者每人能够领取大约 4,276 枚 LAPTOP。 这是什么概念? 按照 DexScreener 最极端的价格,一个人领取的免费空投账面价值一度超过128 万美元。 开盘的同时,大规模免费筹码在砸,同时 FOMO 玩家进场。 Lookonchain @lookonchain 追踪到两个非常经典的交易者—— 最惨的人: 他开盘前专门从 Binance 提出了 25 万美元,明显就是奔着 LAPTOP 来的。 开盘以后,他拿了约 20 万美元买入。结果只买到了919 枚 LAPTOP。平均成本218美元。 一小时后这笔仓位只值约 3000 美元,亏损超过 19 万美元。 最赚的人: 另一个地址花大约 100 ETH,当时价值约24.98万美元,以大约27美元均价买到9,124枚 LAPTOP; 随后卖掉8,480枚,换回约472 ETH,价值约 118万美元。 同样的本金,差距可能就是几十秒,结果完全不同。 后来 Bubblemaps 把整个市场的盈亏做了统计,更夸张: 分析的 15,206 个交易地址里,12,151 个亏钱,约占80%,只有3,026个盈利。 其中11,311个地址亏损低于1000美元; 726个亏损1000—1万美元; 112个亏损1万—10万美元; 还有2个亏损在10万—100万美元。 真正赚 1万美元以上的只有88个地址,但这88个地址合计赚走了 557万美元。 非常标准的 MEME 收益结构! 5️⃣ 暴跌以后,Hunter 当晚终于回应 他的核心解释有几个: 1)开盘流动性不足,无法满足巨大的市场需求; 2)出现技术问题; 3)Sniper 抢跑导致价格瞬间被推高,随后快速回落; 4)团队 Token 都处于锁仓状态,没有团队成员出售; 5)他本人没有从 LAPTOP 中获得利润; 6)团队正在研究如何改善流动性,并准备继续推进项目。 他同时否认 Rug Pull 的说法。 流动性不足和 Sniper 当然是真的,甚至从链上数据来看,这就是这次异常价格最直接的原因。 但是他娘的,这两件事情根本不能完全拿来当免责理由! LAPTOP会出现这么离谱的行情,很大原因恰恰是没有先在深度足够大的中心化交易所建立基准价格,而是让 Aerodrome、Uniswap 这些 AMM 市场先做价格发现。 薄流动性 + 明确开盘时间 + 全球关注度,本来就是 Sniper 最喜欢的环境。 一个拥有全球传播量级的名人 Meme,却让几万美元级别的池子承担开盘,这完全就是一场彻彻底底失败的发行! 它根本不需要 Rug,就已经完全具备跌 99% 的结构。 所以 Hunter 最后确实证明了,不是自己和 Trump 不一样,而是政治 Meme 最后的结果都差求不多,这跟 Rug 又有啥区别? 还好昨天没有跟风玩,不然晚上觉都睡不着!
显示更多
1/5 🧬 Today, our team @GoogleDeepMind is taking another step on our mission of deciphering the genome. We are releasing AlphaGenome Atlas, a massive (petabyte-scale) resource containing AlphaGenome predictions for every possible single-letter DNA change in the human genome — 9 billion in total.
显示更多
0
20
1.2K
173
转发到社区
CS 329Z: Engineering AI Agents Stanford / Fall 2026 @stanfordnlp 课程定位:从"模型"到"系统"的工程学 覆盖:简单 LLM 流水线 → 复合 AI 系统 → 自主 Agent。三位讲师的背景也高度互补: @Diyi_Yang(斯坦福 NLP 教授,人机交互与社会计算方向) @michaelryan207(DSPy 核心贡献者,自动评估 AutoMetrics 作者) @jyangballin(SWE-agent / SWE-bench / SWE-smith 作者,软件工程 Agent 领域最重要的研究者之一) # 课程主线:三大工程挑战 贯穿全课的三个核心问题——分解(decomposition)、数据(data)、评估(evaluation)。11 周的内容基本围绕这三条线展开,可以分为五个模块: 模块 1:构建基元(Week 2–3) · LLM 作为构建材料:API/SDK(litellm)、结构化输出、约束生成、解码策略、test-time compute、上下文工程、模型选型与成本/延迟权衡 · RAG:embedding、向量库、分块策略、混合检索、cross-encoder 与 ColBERT 后期交互 · 工具调用:函数调用 API、MCP(Model Context Protocol)、工具设计、代码沙箱、错误处理与重试 模块 2:框架与设计模式(Week 3–5) · 框架层:DSPy(signature / module / optimizer)、LangChain/LangGraph、LlamaIndex,重点是"框架抽象了什么 vs. 你手写了什么" · 设计模式:workflow vs. agent 的分类学,五种可组合 workflow 模式,ReAct / plan-and-execute / reflection,"scaffold(脚手架)本身就是设计决策" · 记忆架构:短期/长期记忆、记忆作为工具动作、文件系统作为外化记忆、跨 Agent 记忆(MemGPT、Mem0、Generative Agents) · 多 Agent 系统:编排模式、handoff 与状态传递,以及一个很有态度的对照阅读——既读 AutoGen,也读《Why Do Multi-Agent LLM Systems Fail?》和 Neubig 的《Don't Sleep on Single-agent Systems》 模块 3:优化(Week 5) · 从提示词到微调的全景:GEPA、MIPROv2、OPRO、TextGrad(提示优化);LoRA/QLoRA、蒸馏、RLHF/DPO(权重优化);test-time scaling(推理算力) · 核心问题是决策框架:什么时候优化 prompt、什么时候优化 weights、什么时候堆推理算力 模块 4:数据与评估(Week 6–8)——最有分量的部分 · 数据:trace、demonstration、feedback 三类数据;训练数据 vs. 评估数据;数据飞轮;合成数据;从 Agent 轨迹构建数据集(SWE-smith) · 评估基础:为什么 eval 难;4 元组框架(request / environment / stopping criteria / scorer);好 benchmark 的性质;tinyBenchmarks · 评估基础设施:三类 grader、LLM-as-judge 的 prompt 设计与已知偏差、pairwise vs. pointwise、非确定性指标 pass@k vs. pass^k、harness 设计 模块 5:安全与前沿(Week 8–11) · 安全:工具访问的隐私风险、prompt injection(含间接注入)、红队、沙箱与权限模型、输出护栏、human-in-the-loop · Coding Agent:SWE-agent、Claude Code、OpenHands 的端到端架构对比 · 主动式 Agent:从 reactive 到 proactive,General User Models(GUM)、Next Action Prediction,以及"Agent 何时应主动、何时应等待"的 mixed-initiative 问题 · 开放问题:多模态/web/计算机使用 Agent、科学 Agent、长时运行架构、生产可观测性(tracing、monitoring、成本管理) # 作业设计:一手建、一手评 HW1:从零构建 Agent 系统(10%) 给定论文库,构建能检索并推理回答科学问题的 Agent。 · Part A:只用 litellm 手写 RAG + 工具调用 + ReAct 式 Agent 循环 · Part B:用 DSPy 重建关键组件,并反思框架抽象了什么 HW2:评估一个 Agent(10%) 给定一个预构建 Agent,设计完整评估套件:代码型 grader、至少一个 LLM-as-judge、用 4 元组框架构建 benchmark 任务、错误分析。
显示更多
0
23
148
30
转发到社区
We really got tokenization, prediction markets, 24/7 trading, US perps, sub-second payments, and Bitcoin back above $80,000 before GTA 6.
0
116
1.3K
90
转发到社区
Prediction markets are moving into the mainstream, and Polymarket is leading the charge. Whether you're taking a long-term position on global news or trading fast 5-minute BTC "Up or Down" contracts, you can now access Polymarket seamlessly through KuCoin Web3 Wallet using USDC on Polygon. Check out our step-by-step beginner's guide on the KuCoin Blog 🔗
显示更多
0
12
26
5
转发到社区
🥯 Bagel Ambassador Program is LIVE Think you can bring more people into prediction markets? We’re looking for community builders, traders, creators, and regional leaders to grow with Bagel. 🎁 Exclusive rewards 📈 Performance-based incentives 🚀 Early access & Official badge If this sounds like you, we want you on Bagel! Apply now 👇
显示更多
0
13
58
5
转发到社区
Prediction markets are betting real money on bitcoin’s next big move, while Bernstein sees a much bigger prize over the long run. So, who gets the bitcoin price forecast right? 👀
显示更多
0
15
24
5
转发到社区