注册并分享邀请链接,可获得视频播放与邀请奖励。

与「moe」相关的搜索结果

moe 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 moe 的内容
火曜日21時〜は #伊織もえ# ちゃんのらじお♡ interfm 伊織もえの電脳らじお📻 今週のテーマ【秋の行楽スポット】🍂 ゲスト▶︎てらおかなつみさん🐶🐱❤️‍🔥 仲良し2人のラジオ楽しみ♡ #もえちゅ# 盛り上げましょう💌 ✉️は moechu@interfm.jp🫶 #電脳らじお宣伝活動# モエナーさんからいただきスクショ!
显示更多
之前问了虚拟网卡 Tun 模式下微信图片加载慢的问题, 大家非常热心的给出了很多诊断的建议,我做了一下复盘: 微信的网络机制本身就极其特殊。@wq268888 提到微信自己有一套优先内置解析、网络嗅探和信息分析,一旦发现流量被虚拟网卡接管,就会不断重试,明确走不了才会降级到常规网络。@giv00257710 踩过更深的坑,发现微信很多图片其实是直接走纯 IP 地址拉取,压根不走域名,导致常规的域名白名单直接失效。加上 @tzhsz 提到的 edns 机制,多媒体 CDN 很容易被国外 DNS 误解析到海外服务器。 第一流派,也是呼声最高、提议人数最多的关停 IPv6 派。 @LeungDeo、@Edison_aware、@BarrySong97、@Ner0sss、@5tran9er 和 @ncle99 都直接给出了一句话诊断:关掉 IPv6。 @Jerry182809 直言用机场的第一步就是关 IPv6。@chrislee_sub 也吐槽微信的 IPv6 兼容问题早就存在好几年了。@0i8up 补充说国内很多家庭路由器和宽带的 IPv6 本身就极其不稳定,像没普及一样,开了徒增玄学断流。 关掉 IPv6 救活的远不止微信。@vireriver 反馈自己只要一开代理,京东和淘宝的商品图片全线崩溃,关了 IPv6 立刻恢复;@ddflj3310 也提到在 Surge 下剪映等抖音系应用完全登不上,同样靠关 IPv6 解决。@HunterRockCat 则提醒飞书等办公协同软件也会遭遇同样的问题。 背后的逻辑被 @grok 和 @MoeDejavu 点透了:绝大多数代理节点根本没有配置 IPv6 出口,但 DNS 偏偏解析出了 AAAA 记录。微信偏偏优先尝试 IPv6 连接,结果掉进路由黑洞死等超时,几秒后才狼狈降级回 IPv4,体感上就是图片一直在死转圈。@MoeDejavu 建议,如果关了 IPv6 还不稳定,记得把代理客户端里的 AAAA 查询解析也一并关停。 第二流派,追求完美双栈的 fake-ip 规则精修派。 很多朋友不想为了微信直接废掉 IPv6,选择对分流配置进行细化。@0xfingeroo 贴出了 GitHub 上 Clash Verge Rev 官方 issue 1762 的长篇排查讨论。 @qtwaiter 给出了教科书级的 fake-ip 原理:在虚拟网卡接管流量时,所有域名都被劫持进了虚拟私有网段。必须在 dns 配置的 fake-ip-filter 加入白名单,强制腾讯的多媒体域名走真实国内 IP 解析。比如针对 QQ 和微信的图片视频,把 放进过滤列表。 @LeonKuo2023 具体给出了两条立竿见影的直连后缀规则: 和 提醒,很多人的微信图片卡死,纯粹是因为分流规则没写全,图片请求被最底下的兜底规则误送到了海外代理。@cnfree8964 补充把严格路由关闭;@LaelLuo 建议排查 QUIC 协议嗅探;@neotuper 建议检查 SNI 分流;@AwesomeYang_com 和 @wooooow_wo 则建议在规则里单独指定微信进程走 DIRECT 直连。 第三流派,干脆放弃虚拟网卡的实用派。 @YanzuWuahh 早就被 Tun 模式的各种玄学搞烦了,选择退回经典架构:系统代理搭配 Proxifier,只对指定的海外开发工具开启强制代理,微信这种国内应用压根碰不到虚拟网卡。 @qg7777 提到,如果没有配置专门的软路由做增强模式,单靠本机跑单一的 Tun 模式极易翻车。@bnxiohi15661429 也吐槽某些客户端内核对 Tun 的处理不够完善,换成小火箭等工具反而没这些毛病。 第四流派,赛博神医 AI 排查流。 @dave33_z 分享了硬核实战:之前买 AWS Lightsail 晚高峰延迟卡死,直接把网络环境和配置丢给 Codex,一通调优把晚高峰延迟压到了六十毫秒。现在遇到各种网络玄学,直接把配置文件丢给 AI 分析。 @tina_sound43105、@neveriwill14294、@xueyu1125、@thePixelsAI、@Silas10m 和 @Lee656233622 全都站这一边。把本地分流规则丢给 Codex 或 DeepSeek,让模型顺着路由跳数检查,几分钟就能自动生成改好的配置。@misaki233q 更是让 Agent 搓出了一套高级双栈规则:国内应用走 IPv6 直连,海外流量走 IPv4 代理,鱼和熊掌全部兼得。 第五流派,反思工具本质的断舍离派。 @WetThinAir 抛出了一个直击本质的问题:我们到底为什么非要开 Tun 模式?像很多写代码的工具,单独配个终端环境或者局部端口就能跑得飞快,根本没必要为了几个工具让全系统的网络流量都从虚拟网卡里冒险淌一遍。 遇到微信转圈的朋友,照着这份清单排查,基本药到病除。
显示更多
0
26
441
38
转发到社区
这个开源项目系统整理了 35 家 AI 公司的 AI 工程师面试题,全部来自 “公开报告的面试经历” 来自 @outcome_school 团队 @pallavishekhar_ 开源发布,内容几乎涵盖了 OpenAI、Anthropic、DeepMind、xAI、DeepSeek、Kimi、GLM 等 AI Labs,Cursor、Cognition、ElevenLabs 等 AI Native 团队和 Nvidia、Microsoft、Amazon、Apple 等头部大厂。 覆盖的岗位头衔也非常多:AI Engineer、LLM Engineer、Gen AI Engineer、ML Engineer、Research Engineer、Applied Scientist、FDE、MLOps/LLMOps 工程师等。 开源地址: # 内容架构:一个精心设计的双层结构 第一层:跨公司通用题(Common Questions)。 作者把在多家公司反复出现的题目只列一次,标注"Asked at"哪些公司,按十大主题组织: 1. LLM 内部机制与架构 — attention 缩放因子、KV cache 内存公式推导、MQA/GQA/MLA、FlashAttention、BPE、RoPE/YaRN、Chinchilla scaling laws、MoE、解码采样策略、lost-in-the-middle、RMSNorm、SwiGLU 2. 推理、服务与 GPU 性能 — prefill vs decode、continuous batching、PagedAttention、投机解码、量化(FP16→FP4)、五种并行策略、TTFT/TPOT 指标、H100 上的 roofline 计算、vLLM/SGLang/TensorRT-LLM 选型、“如何把服务成本降 10 倍” 3. RAG 与检索 — 分块策略、BM25 vs 稠密检索、重排序器、HyDE、权限感知检索、ANN 索引、索引新鲜度、答案归因 4. Agent 与工具调用 — ReAct、MCP、工具 schema 设计、多智能体编排、Agent 记忆、循环终止条件、人类审批 5. 微调与对齐 — RLHF/DPO/GRPO/RLVR 全谱系、LoRA/QLoRA 数学、灾难性遗忘、“提示 vs RAG vs 微调”决策框架、蒸馏、reward hacking 6. 评估与可观测性 — LLM-as-judge 及其偏差、幻觉检测、基准污染、Agent 评估、回归门禁 7. 安全与负责任 AI — 提示注入(直接/间接)、OWASP LLM Top 10、护栏、Constitutional AI、红队 8. 多模态与语音 — VLM、语音 Agent 延迟预算、barge-in 打断处理、级联 vs 端到端语音、ASR/TTS 评估 9. AI 系统设计 — 十类高频设计题(千万级文档企业 RAG、代码助手、客服 Agent、Text-to-SQL、LLM 网关、数亿用户聊天服务等) 10. 编码题 — 从零实现 attention、KV cache、BPE、采样;LRU 缓存、令牌桶限流器、异步批处理器、SSE 流解析器、最小 Agent 循环 第二层:35 家公司的专属章节,分为五大梯队: 1. 前沿实验室(12 家):Anthropic、OpenAI、Google DeepMind、Meta、xAI、Mistral、Cohere、DeepSeek、月之暗面(Kimi)、智谱(GLM)、阿里(Qwen)、Sarvam AI(印度) 2. 大厂 AI 组织:Microsoft、Amazon、Apple、NVIDIA、Tesla,以及一组消费级 ML 公司(Uber/Netflix/LinkedIn/Airbnb/Pinterest/Spotify) 3. AI 基础设施公司:Databricks、Groq、Together AI、Hugging Face、Scale AI、Perplexity 4. AI 原生产品公司:Cursor、Cognition(Devin)、Sierra、Harvey(法律)、Glean、 AI(机器人)、Waymo 5. 前向部署/企业 AI:Palantir # 题目分布透露的行业信号同样值得关注 1. 公司的差异化考察方向,和它的商业模式严丝合缝。 这是最能体现整理功力的地方: · DeepSeek、月之暗面、智谱、Qwen 的题目深度绑定自家论文——MLA、auxiliary-loss-free 负载均衡、Multi-Token Prediction、MuonClip、DualPipe、长上下文扩展、GLM 的 thinking 模式。面试这些公司等于面试它们的论文,还要求 PyTorch 从零实现 MoE 路由。 · Groq 的题全是 SRAM-only 架构下的 roofline 重推演:“没有 HBM,decode 的 roofline 论证哪里变了”、“确定性在 p99 层面到底买到什么”。 · Apple 清一色端侧:3B 模型在手机上跑、PTQ vs QAT、不采集用户内容的前提下用设备信号改进模型、30+ 语言区无法记录用户内容的评估方案。 · CharacterAI 是推理经济学:“我们的服务成本被 KV cache 而非权重主导,降一个数量级,代价是什么”。 · Harvey(法律)和 Abridge(医疗) 考的是领域约束下的工程:200 页信贷协议里第 140 页的条款依赖第 8 页的定义术语怎么检索、生成的病历中出现了患者没提过的药怎么当作安全事故处理、PHI 如何约束整个架构。 · Palantir 的招牌是 "decomposition" 轮:把“一家货运铁路公司每年因机车非计划停机损失数千万”分解成工程计划。 2. 编码轮的形态正在发生实质性变化。 文档里反复出现的一类题,与传统 LeetCode 明显不同: · “实现一个内存 KV 存储:先 SET/GET/DELETE,再加事务 BEGIN/COMMIT/ROLLBACK,包括嵌套事务”(OpenAI、xAI 都问) · “给你一个 LLM 推理引擎的调度器类,其中一个方法是空壳,没有规格没有文档。说说你头三十分钟干什么”(xAI) “重构这 120 行能跑但很乱的代码,不许破坏测试”(OpenAI) · “对 5 万个文档跑 LLM 调用,API 限 100 并发、偶发 429 和超时,把 Python 写出来”(Anthropic) 考察重心从算法记忆转向增量需求下的代码演进能力、并发正确性、真实工程约束下的取舍。 3. “AI 协作轮”作为新题型已经进入正式面试流程。 这是文档里最前沿的信号: · Anthropic 部分机器学习岗有 AI-collaboration 轮:现场给你 Claude,考察的是你如何指挥它和验证它的产出,而不是你自己写。 · Meta 2026 年的流程新增三阶段 AI 辅助编码轮(探索修复 → 实现新功能 → 扩展改进)。 · Cursor 的 onsite 是两天在真实 Cursor 代码库上做一个功能(或 8 小时远程版),明确考核你对 AI 工具的使用效率和自主 scoping 能力。 · Sierra 给你两小时和任意 AI 工具,看你选择做什么。 xAI 有四小时限时产品构建。 4. FDE 成为一级岗位类别。 Anthropic、OpenAI、Databricks、Scale、Together、Sierra、Harvey、ElevenLabs、Palantir 的章节里都有 "Applied and Forward-Deployed Scenarios" 专属题库——典型题目如“企业客户说 Claude 幻觉太多,你是驻场工程师,头 48 小时做什么”。这对应了 AI 公司向企业交付方式的转变:模型能力差距收窄后,落地能力成为差异化。 5. 硬核系统题的普及。 "H100 上 70B 模型 batch size 1 的 roofline 计算"、"估算 70B 模型的 GPU 显存(权重 + KV cache + 激活 + 碎片)"、"p99 延迟在部署后翻倍但模型没变,走一遍诊断”——这类题横跨 NVIDIA、Together、OpenAI、Perplexity 等多家,说明推理性能的量化直觉已成为 AI 工程师的通用素养,而非基础设施工程师的专属。
显示更多
📢 Xiaomi MiMo-V2.6 Series Models Are Now Live on Developed by Xiaomi MiMo, the newly released V2.6 series features open-weights native multimodal reasoning models with a 1M context window and full text/image/video/audio understanding: 🔸 MiMo-V2.6-Pro: Flagship 1.02T total / 42B active parameter sparse MoE architecture, engineered for repository-level software engineering, long-horizon agent workflows, and complex multimodal reasoning. 🔸 MiMo-V2.6-Flash: High-efficiency 309B total / 15B active parameter architecture, optimized for high-frequency office automation, fast agent execution, and cost-sensitive workloads. Now available on both API and Web Chat! 👉 Try now:
显示更多
0
27
58
10
转发到社区
🎉 重磅揭晓:DeepSeek 官方调价, 叠加再打 1 折! DeepSeek 官方全新发布原生多模态 MoE 大模型 DeepSeek-V4.1-Flash。借此契机, 宣布:将在 DeepSeek 官方新价格的基础上再叠加 1 折(直接省 90%)!您仅需支付官方价格的 10%,即可享受极致性价比的顶尖算力。 🗓️ 权益生效时间:9 月 12 日 10:00 (SGT) 💡 自动路由说明: 将逐步把 DeepSeek-V4-Flash 和 DeepSeek-V4-Flash-Vision-Exp 的 API 请求平滑无缝路由至 DeepSeek-V4.1-Flash,无需复杂配置。您也可以直接配置指定接入 DeepSeek-V4.1-Flash 立即享用。
显示更多
📢 DeepSeek-V4.1-Flash Is Now Live on DeepSeek’s newly released native multimodal MoE model, DeepSeek-V4.1-Flash, features a 552B parameter backbone and a pioneering Causal Encoder-Decoder architecture. Supporting a 1M context window and up to 384K output, it is engineered for long-horizon coding agents, multimodal software workflows, and high-concurrency agentic systems. Web Chat and API access are now live. Stay tuned, even bigger perks are coming soon! 👉 Try now: 🔗 Learn more:
显示更多
Jordan McDonald was a curious case. That one photo of her went viral countless times for about two years, yet nobody knew who she was. I can't quite wrap my head around the fact that the entire internet didn't know about the concept of reverse image search
显示更多
0
153
30.6K
524
转发到社区
is it moe to have mold in your room
0
44
2K
365
转发到社区
本地大模型的显存壁垒,今天被正式宣告物理终结了, 单张 24G 的 RTX 4090,竟然真把 125B 的 Qwen 3.8 Flash Next 给跑起来了, 而且上下文直接拉到了 25 万,解码速度稳在每秒 21 个词 以前跑这种百亿千亿级的巨无霸,动辄要租几张 A100 数据中心集群, 但这次海外极客在 Ubuntu 上用一张普通 4090 加 110G 白菜价 DDR4 内存, 硬生生跑出了生产级的速度: 预填充每秒 364 词,解码每秒 21 词, 最狠的是没开 MTP、没开 dflash,连 KV 缓存都没做任何量化 很多人好奇 24G 显存怎么塞得下 125B 还带 25 万上下文, 核心全靠 llama.cpp 最新分支里一个叫 -cmoe 的物理外挂: 它把 512 个专家层全部扔给廉价的系统内存, 把最吃计算的注意力机制留在 4090 显存里, 显存占用瞬间从 24G 暴跌到 11.6G,而且解码速度几乎毫无损耗 空出来的整整 12G 显存,全被拿去放上下文, 直接把窗口一路顶到了 250,000 的绝对上限,跑完甚至还剩 5 个多 G 的显存余量 再加上把 batch 设到 4096,提示词处理速度直接翻倍狂飙, 以前大家觉得消费级显卡只能跑跑 7B 到 27B 的小模型, 现在 MoE 架构加上内存卸载,直接把数据中心级别的智能焊死在了家用电脑里 本地折腾私有大模型和超长 Agent 的时代, 真的被这套组合拳给彻底砸开大门了啊
显示更多
0
67
539
78
转发到社区