注册并分享邀请链接,可获得视频播放与邀请奖励。

meng shao 的个人资料封面
meng shao 的头像

meng shao (@shao__meng)

@shao__meng
0 正在关注    0 粉丝
吴恩达老师分享「AI Engineering 技能图谱」 @DeepLearningAI 团队分析了超过 1 万份 JD,并对 AI 专家、招聘经理和猎头进行了数十次结构化访谈,结合调查问卷和网络数据,得出「AI Engineering 四个核心技能」。 1. 构建与部署 AI 应用 AI 应用与传统软件的根本区别在于输出的不可预测性——你无法预知 LLM 会返回什么,也无法预知模型在新样本上的预测。 因此核心能力不只是掌握 LLM、上下文工程、RAG、智能体工作流、深度学习这些构件,更在于用统计方法去度量、引导和治理 AI 系统,其中最关键的是"纪律严明的评估与错误分析闭环"。 2. 软件工程基本功 工程的本质是在成本、可扩展性、可靠性、速度、安全、隐私之间做权衡。只有理解底层原理,你才看得见权衡的存在。 一个尖锐的现实:不懂基本功的开发者做 "vibe coding",往往不知道给编程智能体提供什么上下文,也就无法察觉智能体正在替自己做糟糕的架构决策。 基本功的价值从"亲手写代码"转移到了"用精确的工程语言驾驭智能体"。 3. 使用编程智能体 这已成为每个开发者的必备技能,包括: · 对智能体能力与局限的准确心智模型,知道何时干预、何时放手 · 管理智能体的上下文,在规划与执行之间做权衡 · 提供验证器或评估机制,让智能体自主闭环 · 编写清晰的规格说明(以及判断何时不必写) · 编排多个智能体协同工作 · 规避高风险操作(如智能体误操作生产数据库) · 由于该领域快速演进,还需建立持续尝试新工具、迭代工作流的习惯 4. 塑造构建方向 当智能体越来越擅长"按规格交付",工程师的价值重心就上移到"决定规格里该写什么"。 这意味着:工程师不能再等着拿到像素级完美的设计稿只做实现,而需要具备产品 Sense、商业上下文和客户目标的理解,参与定义做什么。同时要把握节奏——知道何时快速做 MVP 验证用户,何时放慢脚步精心构建。
显示更多
New: A map of the most important skills in AI Engineering.
Qwen3.8-27B 开源了 ⚡ 相比 Qwen3.8 Max,27B 开源更值得特别关注! Qwen3.8-27B 是原生多模态稠密模型,表现整体超过 Qwen3.7-Plus,在真实编程与办公流程上更突出。 既然是 27B,就得好好看看部署环境要求了,兼容 vLLM / SGLang / TokenSpeed,另有官方 FP8。社区已有 GGUF / Unsloth 等量化。 这里推荐 @UnslothAI 的量化方案,17GB RAM 可跑:
显示更多
We promised open weights for Qwen3.8. Now, time to meet them! 🎉 ⚡ Qwen3.8-27B: - A native multimodal dense model. With just 27B parameters, it outperforms Qwen3.7-Plus overall and shines in real-world coding & office workflows. - 262K native context, easily extendable to 1M tokens via YaRN. - Built for builders. Highly efficient, high-quality, and licensed under Apache 2.0. 🚀 The open weights for Qwen3.8-2.4T-A95B (Max-level) have also been released recently. Whether you're shipping lightweight applications with Qwen3.8-27B locally or building agents with Qwen3.8-2.4T-A95B, they're yours now! Download, deploy, and build something we haven't imagined yet. 👀👇 - Hugging Face: - ModelScope:
显示更多
这几天突然想起那些「中国版 Figma」「中国版 Canva」们,它们过得还好吗? 因为前些年在做设计工具,对「中国版 Figma」和「中国版 Canva」们都比较熟悉,这其中有很多很不错的团队:蓝湖、即时设计、稿定设计、创客贴 ... 特别是前面两者,以前都有比较多结束,团队对前端无限画布的性能优化,应该算是国内非常靠前的状态。 蓝湖的 MasterGo 和技术设计的 JSDesign 也是国内两个非常有代表性的产品,可现在呢?完全销声匿迹了。 这两个团队的现状,也是这些年互联网到 AI 时代很典型的案例了: 互联网时代:在中国做 SaaS 太难了,2C 不付费、2B 成外包、2G 没门路。。 AI 时代:AI 直接生成设计、生成代码,我还要那么复杂的设计工具干嘛?这个问题连 Figma 都解不了,更不要说这两个更弱小的中国团队了。 所以后来也看到他们做了类似 Lovable 的 AI 建站产品,记得 Wegic 就是即时设计团队做的吧,不过毕竟 Lovable 只有一个,Wegic 又是 Lovable 前一代的产品,并没有彻底 Agent 化,还保留了很多模板的内容,短期内看似效果更好了,但长期来看,就完全绑住了 Agent,且自己的运营维护成本特别高,无法维持。
显示更多
Gemini 3.7 Flash 正式发布 和 Grok 4.6、DeepSeek V4 Pro 发布的声量相比,Gemini 简直安静的可怜 🤦‍♂️ 不过对于生产环境在用 Gemini 模型的朋友们,GA 和 Preview 的区别到底有多大,那是相当有价值的,毕竟 Preview 的并发和稳定性,实在是太拉了! 另外,Gemini Flash 系列一直保持发布,Gemini 3.5 Pro 是不是真的胎死腹中,Deepmind 直接放弃 3.5 奔 4.0 训练去了?
显示更多
GLM-5.3 发布了 这周又是极度热闹的一周 先是 Grok 4.6,再是 DeepSeek V4 Pro 和 DeepSeek Harness (以及 API 涨价) 现在临近周末 @Zai_org 又带来了 GLM-5.3 我甚至都没提 Gemini 3.7 Flash 😂
显示更多
0
4
10
12
转发到社区
原来 @jietang 唐杰教授的「sooooooon」是按小时算的吗 😃 GLM-5.3 在唐杰教授发帖后几小时就正式发布了,又是后训练的一个典型案例!中国开源模型这一轮热潮也是 GLM-5.2 带起来的。 GLM-5.3 和 GLM-5.2 沿用了同一套基座模型,所有可观测的能力提升,都来自后训练阶段的持续规模化。 过去一个月 @Zai_org 在 GLM-5.2 已搭好的技术栈上持续加码: · IndexShare:长上下文的高效处理机制; · SAO(含 compaction):面向长程任务的强化学习算法,使增益不只在短任务上显现,也能在长程任务上保持; · slime:大规模异步后训练框架,训练侧用 Megatron,rollout 侧用 SGLang。 GLM-5.3 在此之上做了三件事:更多环境、更多样任务、更多算力。在复杂编码与长程任务上对 GLM-5.2 形成明显代差,并在网络安全方向上出现了团队自己也未完全预期的"涌现式"能力跃升。 btw... GLM-5.3 是一个只有 743B 的模型,综合能力和 Kimi K3 互有胜负,厉害!
显示更多
看到 DeepSeek Harness 开源发布,满怀期待的安装好 这是用「DeepSeek V4 Flash + 1390 万 Token + 30 多分钟」做出来的网站 呃。。怎么说呢,一定是我不会用,是我的问题 🤦‍♂️ btw... 图1 是 DeepSeek Harness 图 2 是 Codex + GPT-5.6 Sol
显示更多
0
52
15
17
转发到社区
很难相信这会是 Google Design 官方账号发布的内容 如果你被盗号了 @GoogleDesign 你就眨眨眼 👀 发帖格式陈旧,内容更是空洞乏味到一时间分不清是真话还是藏着什么玄机,反复看了几次,确定没什么玄机。。。
显示更多
Celebrating small wins is hardwired into "Achieve," our goal-tracking sample app. We wanted the simple act of checking off a task to feel like a celebration. Instead of the standard #Material# ripple, we used Styles to drop in a custom, high-contrast completion animation—specifically, a brand-colored ring that expands and fades on tap, paired with a subtle pressed-state gradient. It lets us focus entirely on polishing those custom, rewarding micro-interactions while Material handles the foundation. #GoogleDesign# #MaterialDesign# #JetpackCompose# #AndroidDev# #UXDesign# #InteractionDesign#
显示更多
立 Flag 果然遭报应 😓😓😓 这是扫黄捅了老巢了吗,不评论,改转发了???
朋友们有没有发现,今天开始,垃圾评论真的不见了! 立 flag 必倒?
原来 @jietang 唐杰教授的「sooooooon」是按小时算的吗 😃 GLM-5.3 在唐杰教授发帖后几小时就正式发布了,又是后训练的一个典型案例!中国开源模型这一轮热潮也是 GLM-5.2 带起来的。 GLM-5.3 和 GLM-5.2 沿用了同一套基座模型,所有可观测的能力提升,都来自后训练阶段的持续规模化。 过去一个月 @Zai_org 在 GLM-5.2 已搭好的技术栈上持续加码: · IndexShare:长上下文的高效处理机制; · SAO(含 compaction):面向长程任务的强化学习算法,使增益不只在短任务上显现,也能在长程任务上保持; · slime:大规模异步后训练框架,训练侧用 Megatron,rollout 侧用 SGLang。 GLM-5.3 在此之上做了三件事:更多环境、更多样任务、更多算力。在复杂编码与长程任务上对 GLM-5.2 形成明显代差,并在网络安全方向上出现了团队自己也未完全预期的"涌现式"能力跃升。 btw... GLM-5.3 是一个只有 743B 的模型,综合能力和 Kimi K3 互有胜负,厉害!
显示更多
@dotey 哈哈 宝玉老师,我家也是同款比熊
GLM-5.3 发布了 这周又是极度热闹的一周 先是 Grok 4.6,再是 DeepSeek V4 Pro 和 DeepSeek Harness (以及 API 涨价) 现在临近周末 @Zai_org 又带来了 GLM-5.3 我甚至都没提 Gemini 3.7 Flash 😂
显示更多
0
4
10
12
转发到社区
Grok 4.6 实战经验笔记 来自 Cursor 团队 @ericzakariasson,把 Grok 4.6 当做几周日常主力模型之后,写下自己真正改了什么工作方式。 Eric 实际怎么用这款模型 · 用浏览器替他走网站,包括在供应商控制台里点出 API key · 对正在跑的应用做功能和视觉 QA · 把收件箱压到只剩真正需要回的几封 · 帮他起草 Cursor SDK Bridge、/rename-chat 的发布帖,并用 Remotion 做发布视频 另外专门做了几组对照,用来压测模型 “能撑到哪里”:电子表格应用、浏览器版帝国时代 2、MSN Messenger、给开源 Excalidraw 加 presentation mode、虚构季度董事会 deck、以及 X TypeScript SDK 的 60–90 秒发布片。 他最看重的两个体感 1. 信息密度。摘要里是真正的信息,不是把任务复述一遍;运行中的短更新够他判断要不要打断。小改动时它会安静,一旦开始动很多文件才会开始叙述。作者说这个“何时说话、何时闭嘴”的分寸,调起来比想象中费劲,而且现在仍会说一些他不需要的话。 2. 速度加上更聪明。4.5 已经快。4.6 是快,而且明显更聪明。这个组合改变了节奏:异步能在他不在时多干活,但回来要冷启动看一份大 diff;4.6 把他拉回同步。他写得很清楚——当他在乎结果时,他更愿意待在同步里。 最高杠杆不是提示词写法,是验收标准 他专门对比过提示风格:长 vs 短,以及 “work very hard” 这类措辞。结论分三层: 1. 措辞几乎没用。 “努力工作、一直做到完”这类话,对 4.6 基本加不上分。它自己就会撑相当一段时间。 2. 长度有用,但不是因为更长就更好。 长 prompt 买的是具体性:你已经知道要什么,就写下来。短 prompt 把更多决定交给模型的品味。以前这个交易通常偏向把一切写死;4.6 的品味已经好到:短 prompt 加一条清楚偏好,通常就能落到不错的地方。 长规格仍然有效——他给过一份带 session capture、server handler、cloud agent dispatch 的 feedback widget 规格,模型能从头跟到尾,结构也合理;只是组件会重复,除非你明确要求拆开。 3. 真正拉开结果的,是一句验收指令。 全文最重要的抽象:可自检性 需要他上手去带的地方,几乎都收束到一件事:模型有多容易验证自己的工作。 · 网站最好验。 DOM 是文本,可以读页面、截图、对照意图。所以 UI 上的验证环特别有效。 · 3D 更难。 多了一个读不出来的维度。 · 视频更难。 时间是额外维度,检查意味着截一串帧、推理帧与帧之间的差。 · 物理同类。 模型对世界“应该怎样”有感觉,但单张截图回答不了“它是不是真的那样动了”。
显示更多
0
53
10
3
转发到社区
朋友们有没有发现,今天开始,垃圾评论真的不见了! 立 flag 必倒?
看到 DeepSeek Harness 开源发布,满怀期待的安装好 这是用「DeepSeek V4 Flash + 1390 万 Token + 30 多分钟」做出来的网站 呃。。怎么说呢,一定是我不会用,是我的问题 🤦‍♂️ btw... 图1 是 DeepSeek Harness 图 2 是 Codex + GPT-5.6 Sol
显示更多
0
52
15
17
转发到社区
Gemini 3.7 Flash 正式发布 和 Grok 4.6、DeepSeek V4 Pro 发布的声量相比,Gemini 简直安静的可怜 🤦‍♂️ 不过对于生产环境在用 Gemini 模型的朋友们,GA 和 Preview 的区别到底有多大,那是相当有价值的,毕竟 Preview 的并发和稳定性,实在是太拉了! 另外,Gemini Flash 系列一直保持发布,Gemini 3.5 Pro 是不是真的胎死腹中,Deepmind 直接放弃 3.5 奔 4.0 训练去了?
显示更多
X [For You] 时间线算法开源 其实谜底基本都在谜面上,所以影响推荐和排名的因素都是明牌,权重现在也都完全透明了
DeepSeek Harness 终于来了! 先🐴明天再看
🧩 DeepSeek Harness v0.1 is now available in Developer Preview! 🔹 We’re opening it up to developers building agent harnesses worldwide and open-sourcing the codebase in MIT license. 🔹 Powered by the Cordis meta-framework, DeepSeek Harness is an agent harness built around one core idea: Everything is a plugin. Models, tools, skills, sessions, sandboxes, filesystems, loops, orchestration, and UI are ALL implemented as plugins, and can be mixed, matched, replaced, and extended. Try it now!
显示更多
微信发布大语言模型?而且在 X 独家发布? WeLM 模型系列:80B (A3B) 和 617B (A23B)
Meet WeLM — a family of large language models built by the Weixin team with resource efficiency at its core.
DeepSeek V4 Pro 今天低调发布 DeepSeek 同步调整了 V4 Pro 和 V4 Flash 的 API 价格 通过下面两张图表,看看 API 价格具体涨了多少,正式版的 Benchmark 具体表现又如何。
显示更多