注册并分享邀请链接,可获得视频播放与邀请奖励。

与「VLM」相关的搜索结果

VLM 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 VLM 的内容
这个开源项目系统整理了 35 家 AI 公司的 AI 工程师面试题,全部来自 “公开报告的面试经历” 来自 @outcome_school 团队 @pallavishekhar_ 开源发布,内容几乎涵盖了 OpenAI、Anthropic、DeepMind、xAI、DeepSeek、Kimi、GLM 等 AI Labs,Cursor、Cognition、ElevenLabs 等 AI Native 团队和 Nvidia、Microsoft、Amazon、Apple 等头部大厂。 覆盖的岗位头衔也非常多:AI Engineer、LLM Engineer、Gen AI Engineer、ML Engineer、Research Engineer、Applied Scientist、FDE、MLOps/LLMOps 工程师等。 开源地址: # 内容架构:一个精心设计的双层结构 第一层:跨公司通用题(Common Questions)。 作者把在多家公司反复出现的题目只列一次,标注"Asked at"哪些公司,按十大主题组织: 1. LLM 内部机制与架构 — attention 缩放因子、KV cache 内存公式推导、MQA/GQA/MLA、FlashAttention、BPE、RoPE/YaRN、Chinchilla scaling laws、MoE、解码采样策略、lost-in-the-middle、RMSNorm、SwiGLU 2. 推理、服务与 GPU 性能 — prefill vs decode、continuous batching、PagedAttention、投机解码、量化(FP16→FP4)、五种并行策略、TTFT/TPOT 指标、H100 上的 roofline 计算、vLLM/SGLang/TensorRT-LLM 选型、“如何把服务成本降 10 倍” 3. RAG 与检索 — 分块策略、BM25 vs 稠密检索、重排序器、HyDE、权限感知检索、ANN 索引、索引新鲜度、答案归因 4. Agent 与工具调用 — ReAct、MCP、工具 schema 设计、多智能体编排、Agent 记忆、循环终止条件、人类审批 5. 微调与对齐 — RLHF/DPO/GRPO/RLVR 全谱系、LoRA/QLoRA 数学、灾难性遗忘、“提示 vs RAG vs 微调”决策框架、蒸馏、reward hacking 6. 评估与可观测性 — LLM-as-judge 及其偏差、幻觉检测、基准污染、Agent 评估、回归门禁 7. 安全与负责任 AI — 提示注入(直接/间接)、OWASP LLM Top 10、护栏、Constitutional AI、红队 8. 多模态与语音 — VLM、语音 Agent 延迟预算、barge-in 打断处理、级联 vs 端到端语音、ASR/TTS 评估 9. AI 系统设计 — 十类高频设计题(千万级文档企业 RAG、代码助手、客服 Agent、Text-to-SQL、LLM 网关、数亿用户聊天服务等) 10. 编码题 — 从零实现 attention、KV cache、BPE、采样;LRU 缓存、令牌桶限流器、异步批处理器、SSE 流解析器、最小 Agent 循环 第二层:35 家公司的专属章节,分为五大梯队: 1. 前沿实验室(12 家):Anthropic、OpenAI、Google DeepMind、Meta、xAI、Mistral、Cohere、DeepSeek、月之暗面(Kimi)、智谱(GLM)、阿里(Qwen)、Sarvam AI(印度) 2. 大厂 AI 组织:Microsoft、Amazon、Apple、NVIDIA、Tesla,以及一组消费级 ML 公司(Uber/Netflix/LinkedIn/Airbnb/Pinterest/Spotify) 3. AI 基础设施公司:Databricks、Groq、Together AI、Hugging Face、Scale AI、Perplexity 4. AI 原生产品公司:Cursor、Cognition(Devin)、Sierra、Harvey(法律)、Glean、 AI(机器人)、Waymo 5. 前向部署/企业 AI:Palantir # 题目分布透露的行业信号同样值得关注 1. 公司的差异化考察方向,和它的商业模式严丝合缝。 这是最能体现整理功力的地方: · DeepSeek、月之暗面、智谱、Qwen 的题目深度绑定自家论文——MLA、auxiliary-loss-free 负载均衡、Multi-Token Prediction、MuonClip、DualPipe、长上下文扩展、GLM 的 thinking 模式。面试这些公司等于面试它们的论文,还要求 PyTorch 从零实现 MoE 路由。 · Groq 的题全是 SRAM-only 架构下的 roofline 重推演:“没有 HBM,decode 的 roofline 论证哪里变了”、“确定性在 p99 层面到底买到什么”。 · Apple 清一色端侧:3B 模型在手机上跑、PTQ vs QAT、不采集用户内容的前提下用设备信号改进模型、30+ 语言区无法记录用户内容的评估方案。 · CharacterAI 是推理经济学:“我们的服务成本被 KV cache 而非权重主导,降一个数量级,代价是什么”。 · Harvey(法律)和 Abridge(医疗) 考的是领域约束下的工程:200 页信贷协议里第 140 页的条款依赖第 8 页的定义术语怎么检索、生成的病历中出现了患者没提过的药怎么当作安全事故处理、PHI 如何约束整个架构。 · Palantir 的招牌是 "decomposition" 轮:把“一家货运铁路公司每年因机车非计划停机损失数千万”分解成工程计划。 2. 编码轮的形态正在发生实质性变化。 文档里反复出现的一类题,与传统 LeetCode 明显不同: · “实现一个内存 KV 存储:先 SET/GET/DELETE,再加事务 BEGIN/COMMIT/ROLLBACK,包括嵌套事务”(OpenAI、xAI 都问) · “给你一个 LLM 推理引擎的调度器类,其中一个方法是空壳,没有规格没有文档。说说你头三十分钟干什么”(xAI) “重构这 120 行能跑但很乱的代码,不许破坏测试”(OpenAI) · “对 5 万个文档跑 LLM 调用,API 限 100 并发、偶发 429 和超时,把 Python 写出来”(Anthropic) 考察重心从算法记忆转向增量需求下的代码演进能力、并发正确性、真实工程约束下的取舍。 3. “AI 协作轮”作为新题型已经进入正式面试流程。 这是文档里最前沿的信号: · Anthropic 部分机器学习岗有 AI-collaboration 轮:现场给你 Claude,考察的是你如何指挥它和验证它的产出,而不是你自己写。 · Meta 2026 年的流程新增三阶段 AI 辅助编码轮(探索修复 → 实现新功能 → 扩展改进)。 · Cursor 的 onsite 是两天在真实 Cursor 代码库上做一个功能(或 8 小时远程版),明确考核你对 AI 工具的使用效率和自主 scoping 能力。 · Sierra 给你两小时和任意 AI 工具,看你选择做什么。 xAI 有四小时限时产品构建。 4. FDE 成为一级岗位类别。 Anthropic、OpenAI、Databricks、Scale、Together、Sierra、Harvey、ElevenLabs、Palantir 的章节里都有 "Applied and Forward-Deployed Scenarios" 专属题库——典型题目如“企业客户说 Claude 幻觉太多,你是驻场工程师,头 48 小时做什么”。这对应了 AI 公司向企业交付方式的转变:模型能力差距收窄后,落地能力成为差异化。 5. 硬核系统题的普及。 "H100 上 70B 模型 batch size 1 的 roofline 计算"、"估算 70B 模型的 GPU 显存(权重 + KV cache + 激活 + 碎片)"、"p99 延迟在部署后翻倍但模型没变,走一遍诊断”——这类题横跨 NVIDIA、Together、OpenAI、Perplexity 等多家,说明推理性能的量化直觉已成为 AI 工程师的通用素养,而非基础设施工程师的专属。
显示更多
最新视频《福利视频》 完整版链接: 跳舞时你一笑,整个世界都跟着明亮起来。 #巨乳# #黄果短剧# #跳舞# #美女#
0
0
183
8
转发到社区
在超过几十种的文档格式中,Markdown 目前还是对 Agent 最友好的格式,应该没有之一。 为了最大化企业和个人知识库的价值,让 Agent 能懂你的企业和你自己,即使有 WorkBuddy <-> 企微、千问办公 <-> 钉钉、豆包工作 <-> 飞书 这样的天然生态打通优势,在企业网盘、硬盘、知识库里吃灰的文档,还是要转为 Markdown 才能更好的被 Agents 用起来。 分享几个我自己平时在用的 Markdown 文档格式转换项目,朋友们可以根据自己环境内当前的文档实际情况来选择用哪个。 1. anydoc 18.8k 🌟 Firecrawl 最新开源,评价很高,文档格式覆盖很全、解析很快。纯 Rust 零依赖,把 Word/PPT/Excel/PDF 等 14 种格式毫秒级转成 LLM 可用的 GFM Markdown。 2. MinerU 78.6k 🌟 OpenDataLab (上海 AI Lab) 开源,在 anydoc 之前是我自己主力用的。它基于 1.2B 视觉语言模型的高精度文档解析器,专攻 PDF 的公式、表格与中文版面,OmniDocBench 榜首。 3. MarkItDown 176.6K 🌟 微软开源,开源之初声量极高,不过解析能力上限不如前两个。轻量 Python 工具,把 ~25 种文件(Office/PDF/图片/音频/HTML 等)统一转成 Markdown 喂给 LLM。 4. Docling 65.7k 🌟 IBM Research 开源,MIT 许可,企业级文档智能工具包,多格式解析为带类型的结构化文档树(DoclingDocument),为 RAG 而生。 5. Marker 39.3k 🌟 Datalab 开源,基于 Surya 模型套件的高速 PDF 转 Markdown/JSON 工具,GPU 批量吞吐可达 ~120 页/秒。 最后附上一个简单对比测试,供大家参考吧,实际表现还要基于具体环境测试(项目/速度/硬件要求) 1. anydoc 中位 4.7ms/文档 Ryzen 9 9950X3D,纯 CPU,100 个真实文档(14 种格式) 2. MinerU 0.21s/页(L4 GPU)、2.12 页/秒(A100) VLM 路径必须 GPU(≥8GB 显存) 3. MarkItDown 中位 134.8ms/文档;整份 PDF 约 0.6–1.1s 同上 CPU;比 Docling/Marker 快 50–100 倍 4. Docling 513.6ms/文档(Office);PDF 约 3.1s/页 CPU、0.49s/页 GPU CPU 可跑,GPU 明显加速 5. Marker 批量最高 ~120 页/秒(H100);B200 上 2.9–23.7 页/秒 GPU 才有意义,CPU 模式很慢
显示更多
Grok 4.6 multimodal is a step change from Grok 4.5. It’s one of the under-discussed improvements, and I’ve been very impressed by it. My daily work includes reviewing lots of videos and understanding the context; Grok 4.6 improves the productivity of such workloads by at least 10x if not 100x. Such workflows may not be captured by common VLM benchmarks, but in my use cases it outperforms Gemini 3.5 and Gemma 4, which is considered the SOTA of VLMs in my opinion. Hats off to the multimodal teams—you did a great job.
显示更多
0
43
507
27
转发到社区
Editor-in-chief: Nina Garcia Photographer: Inez & Vinoodh Stylist: Jahleel Weaver Writer: Roxane Gay Hair: Jawara at Art Partner using Fenty Hair Makeup: Hector Espinal using Fenty Beauty & Fenty Skin Manicure: Kim Truong at A-Frame Agency Produced by GS World Media and VLM Productions
显示更多
0
39
683
66
转发到社区
RAG system that skips HTML parsing entirely! PixelRAG is an open-source visual RAG framework that renders documents as screenshots instead of parsing them into text. Most RAG pipelines start by converting HTML to text. Tables flatten into unstructured rows. Charts disappear. Layout context is gone before the LLM ever sees it. The paper measured this directly: HTML-to-text conversion accounts for 36.6% of retrieval failures on SimpleQA. PixelRAG skips that step entirely. It renders pages as screenshot tiles using Playwright, embeds those tiles with a fine-tuned Qwen3-VL-Embedding model, builds a FAISS index, and passes retrieved images directly to a VLM reader. No text abstraction in between. Benchmarked across six datasets against the strongest text-based baselines: - SimpleQA: 78.8% vs 71.6% (+7.1 points) - NQ-Tables: 48.8% vs 42.5% (+6.3 points) - EVQA: +15.5 points - LiveVQA: +11.3 points One honest caveat from the authors: this requires Qwen3-VL-4B class models or larger to see the benefit. Smaller models trail text retrieval. The authors also recommend using PixelRAG as an enhancement layer alongside existing text systems rather than a full replacement. Ships with a pre-built Wikipedia index covering 8.28M articles across 28.1M screenshot tiles. A Claude Code plugin lets Claude take screenshots of any URL and reason over the visual content directly. Key capabilities: • Renders web pages, PDFs, and images as screenshot tiles via Playwright • Fine-tuned Qwen3-VL-Embedding model for visual retrieval • FAISS index for fast vector search • Pre-built Wikipedia index: 8.28M articles, 28.1M tiles • 3x token cost reduction via image compression • Claude Code plugin for direct URL screenshot and visual reasoning • LoRA fine-tuning support via pixelrag-train 100% open source. I've shared the link in the replies!
显示更多
两天 619 Star 现在我都怕是个假项目,Apple MLX 生态最有影响力的开源开发者 Blaizzy,他最新的 macOS 桌面应用项目 Nativ。 把 mlx-vlm 服务器包装成一个原生 SwiftUI 应用,聊天、模型管理、API 服务、性能监控全部打包在一个 DMG 里,算是他 MLX 工具链的最终用户产品形态。 内置 mlx-vlm 推理引擎,暴露 OpenAI 和 Anthropic 兼容的 API 端点,可以给 Claude Code、Codex 等工具当本地后端。
显示更多
Introducing "3D HAMSTER", accepted to IROS 2026! 🎉 Hierarchical VLA planners draw waypoints in 2D, but robots act in 3D. Give the VLM a depth encoder, and it predicts metric 3D trajectories robots can execute. Project page: Paper:
显示更多
NVIDIA发布Molt:极简agentic RL训练框架 NVIDIA NeMo实验室开源的PyTorch原生RL框架,整个RL路径只有约8600行代码,却能通过FSDP2的TP/EP/CP并行扩展到DeepSeek-V3这类1T级MoE模型。 它把Agent当作程序本身:奖励就是你在Env或ChatAgent里写的任意Python,支持多轮工具调用、VLM环境和LLM-as-judge,运行时只靠Ray、vLLM和NVIDIA AutoModel三个组件实现全异步训练。 对研究者来说,一个下午能读完全部梯度相关代码,从8B到1T规模无需重写脚本。 项目地址:
显示更多