注册并分享邀请链接,可获得视频播放与邀请奖励。

lifcc 的个人资料封面
lifcc 的头像

lifcc (@mylifcc)

@mylifcc
0 正在关注    0 粉丝
把 DeepSeek Harness 的源码翻了一遍,发现一个挺有意思的变化: 它根本没把 Prompt 当成一段 System Prompt。 而是把 Prompt 做成了一个 Runtime。 大概是: Identity + Persona + Tool Guidance + Runtime Context + Tool Schema + Variables + Middleware 最后动态 Assembly 成模型看到的东西。 这意味着一个能力不再只是: Tool + Code 而是: Tool + Schema + Prompt Guidance 谁负责这个能力,谁就负责告诉模型“应该怎么用”。 比如 shell 自己拥有 shell 的 Prompt,filesystem 自己拥有 filesystem 的 Prompt,web 自己拥有 web 的 Prompt。 这其实很像软件工程里的模块化: Capability = Implementation + Interface + Model-facing Instructions 更有意思的是,它还把 Prompt 分成了不同 Scope。 Global Prompt ↓ Agent Scope ↓ Agent-specific Override 所以不同 Agent 可以继承、覆盖或者增加自己的 Prompt。 这就不是传统的: “给所有 Agent 塞一个巨大的 System Prompt” 而更像: Prompt Dependency Injection。 还有一个我觉得特别重要的设计: DeepSeek 把 Runtime Context 和 Prompt 分开了。 比如 cwd、git 状态、当前任务这些动态信息,不需要每次都修改稳定的 System Prompt,而是作为动态 Context 注入。 于是: Instruction = 我应该怎么工作 Context = 我现在处于什么状态 Tools = 我现在能做什么 三者被明确拆开。 甚至 Prompt 里的变量也不是简单的 string.format。 未知变量、malformed variable、重复 section 等情况,会倾向于直接 fail。 换句话说: DeepSeek 把 Prompt 当成了“程序”,而不是文案。 还有一个很容易被忽略的东西: Tool Schema 本身就是 Prompt Engineering。 Tool 的名字、description、参数描述、tool ordering、tool availability,都在影响模型行为。 所以模型最终看到的其实不是: System Prompt + Tools 而是: Instructions + Context + Capabilities 统一组装。 我觉得这才是 DeepSeek Harness 最值得研究的地方。 它真正想解决的可能是 “怎么构建一个可以持续演进的 Prompt Runtime?” 如果这个方向继续发展下去,未来的 Agent Prompt 可能不会再是一份几千行的 system prompt。 而会更像一个软件工程项目: /identity /persona /tools /context /agents /middleware /variables 每个能力自己携带自己的 Prompt。 Prompt 从“文案”变成“基础设施”。 这可能才是 Harness Engineering 真正有意思的地方。
显示更多
做一个下dsh和pi的对比 Pi 的目标是“最小核心 + 用户自己拼”,DSH 的目标是“几乎所有能力都插件化,官方先给你几套完整组合”。 DSH 的骨架是Cordis。 Cordis 不是普通插件加载器,它强调两件事: 1. 可逆副作用(temporal composability):插件卸载时,注册的服务、事件、工具 schema、prompt section 全部自动撤销。 2. 依赖声明与空间组合(spatial composability):插件通过 `inject` 声明需要什么服务,运行时按依赖挂载。 所以在 DSH 里: - 模型适配器是插件 - 工具注册表是插件 - session log 是插件 - agent loop 本身也是插件 - 甚至 UI 也是插件 没有“神圣不可动的核心”。你想换 loop、换工具策略、换上下文压缩,挂一个新插件 + 改配置就行。 启动时是 Profile + Bundle叠出来的: 空根 → dsh-base(模型、工具、沙箱、凭证…) → dsh-web-app 或 dsh-headless → 用户自己的 cordis.patch.yml → 命令行 --patch `dsh --profile web --dump-config` 能直接把当前实际挂载的树打出来。 Session 设计是硬核部分 Session 是 append-only 的事件流 模型最终看到的上下文,必须能从这条 log 完整重建出来。官方写得很死: > Model-visible means logged. 任何会进模型请求的内容,都要先变成 session event。 所以 fork、resume、回放、UI 渲染、telemetry,全部从同一条流投影。这点比大多数 coding agent 做得更彻底。 Turn / Step 有claudecode的影子,流程如下: turn/start → claim input → agent/pre-step(可拦截、可改写) → step/start → llm/stream → tool/call → tools/pre-execute → execute → post-execute → step/end → 继续 or turn/end `agent/pre-step`、`tools/*` 这些是 waterfall,监听者必须显式 `next()` 才能往下传。扩展点设计得很规整。 Pi 的实际交集 DSH 仓库里有一个包: `@deepseek-ai/dsh-llm-pi-ai` 它就是把 pi-ai当成 LLM 适配器的后端。 多 provider、协议兼容、reasoning effort 映射、catalog 覆盖,都走 pi-ai 的能力,再包一层 Cordis 插件契约。 所以: - LLM 调用层:吃了 Pi 的基础设施 - Agent 编排、工具、session、UI、沙箱:完全自己的 Cordis 体系 “LLM 适配层直接用了 pi-ai,上层重做了一套更重的可组合 Runtime”。 模式上的对应 DSH 的 Minimal 模式才最接近 Pi 的默认体验:只留 shell + 文件编辑器,专门给 benchmark 用。 官方之前在 V4 的 agent 评测里就用过这个模式。 Standard 模式和 Code(PTC)模式则是完整工具集 + 程序化工具编排,已经远超 Pi 默认的 4 工具。 如果你喜欢 Pi 那种“核心极瘦、自己动手加东西”的感觉,DSH 会显得重,配置和概念也更多。 如果你要的是可替换的 agent loop、完整事件回放、多模式预设、以及官方已经搭好的 Web 界面,DSH 的插件树和 seam 设计更系统。 一句话: Pi 是极简可扩展的 coding harness;DSH 是基于 Cordis 的完整 Agent Runtime,LLM 层复用了 pi-ai,但整体不是同一套代码。
显示更多
0
27
58
7
转发到社区
做一个下dsh和pi的对比 Pi 的目标是“最小核心 + 用户自己拼”,DSH 的目标是“几乎所有能力都插件化,官方先给你几套完整组合”。 DSH 的骨架是Cordis。 Cordis 不是普通插件加载器,它强调两件事: 1. 可逆副作用(temporal composability):插件卸载时,注册的服务、事件、工具 schema、prompt section 全部自动撤销。 2. 依赖声明与空间组合(spatial composability):插件通过 `inject` 声明需要什么服务,运行时按依赖挂载。 所以在 DSH 里: - 模型适配器是插件 - 工具注册表是插件 - session log 是插件 - agent loop 本身也是插件 - 甚至 UI 也是插件 没有“神圣不可动的核心”。你想换 loop、换工具策略、换上下文压缩,挂一个新插件 + 改配置就行。 启动时是 Profile + Bundle叠出来的: 空根 → dsh-base(模型、工具、沙箱、凭证…) → dsh-web-app 或 dsh-headless → 用户自己的 cordis.patch.yml → 命令行 --patch `dsh --profile web --dump-config` 能直接把当前实际挂载的树打出来。 Session 设计是硬核部分 Session 是 append-only 的事件流 模型最终看到的上下文,必须能从这条 log 完整重建出来。官方写得很死: > Model-visible means logged. 任何会进模型请求的内容,都要先变成 session event。 所以 fork、resume、回放、UI 渲染、telemetry,全部从同一条流投影。这点比大多数 coding agent 做得更彻底。 Turn / Step 有claudecode的影子,流程如下: turn/start → claim input → agent/pre-step(可拦截、可改写) → step/start → llm/stream → tool/call → tools/pre-execute → execute → post-execute → step/end → 继续 or turn/end `agent/pre-step`、`tools/*` 这些是 waterfall,监听者必须显式 `next()` 才能往下传。扩展点设计得很规整。 Pi 的实际交集 DSH 仓库里有一个包: `@deepseek-ai/dsh-llm-pi-ai` 它就是把 pi-ai当成 LLM 适配器的后端。 多 provider、协议兼容、reasoning effort 映射、catalog 覆盖,都走 pi-ai 的能力,再包一层 Cordis 插件契约。 所以: - LLM 调用层:吃了 Pi 的基础设施 - Agent 编排、工具、session、UI、沙箱:完全自己的 Cordis 体系 “LLM 适配层直接用了 pi-ai,上层重做了一套更重的可组合 Runtime”。 模式上的对应 DSH 的 Minimal 模式才最接近 Pi 的默认体验:只留 shell + 文件编辑器,专门给 benchmark 用。 官方之前在 V4 的 agent 评测里就用过这个模式。 Standard 模式和 Code(PTC)模式则是完整工具集 + 程序化工具编排,已经远超 Pi 默认的 4 工具。 如果你喜欢 Pi 那种“核心极瘦、自己动手加东西”的感觉,DSH 会显得重,配置和概念也更多。 如果你要的是可替换的 agent loop、完整事件回放、多模式预设、以及官方已经搭好的 Web 界面,DSH 的插件树和 seam 设计更系统。 一句话: Pi 是极简可扩展的 coding harness;DSH 是基于 Cordis 的完整 Agent Runtime,LLM 层复用了 pi-ai,但整体不是同一套代码。
显示更多
0
36
193
30
转发到社区
DeepSeek 这出戏,挺离谱的。 8月12日深夜,V4 Pro 正式版几乎没声没响就上了。API 文档把版本号改成 DeepSeek-V4-Pro-0813,官网首页也挂了句提示,官方群里还甩出一组很高的 Agent 分数,Terminal Bench 2.1 到了 87.9,DeepSWE 直接拉到 62.7。看着像是从 Preview 正式转正了。 结果当晚到第二天凌晨,社区实测一片骂声。最明显的问题是思维链。复杂任务本来该好好想一阵子,结果很多场景思考时间压到 10 秒以内,有的甚至直接开写。长程 Agent 任务还容易早停。同一条直升机 3D 游戏任务,凌晨 0 点左右做出来很糙,过了不到 4 小时再测,已经能完整跑出像样结果。差距大到像换了个模型。 很多人怀疑不是权重本身废了,而是集群部署、推理配置或者服务端 Harness 出了问题,正式版当时根本没跑满。 北京时间今天凌晨 3 点左右,疑似紧急回滚了一波。之后表现明显好转。官网首页的发布公告和开放平台公告也跟着撤了,只剩 API 文档里版本号还在。 到今天下午,官方才正式发推宣布 V4 Pro 上线,APP、网页、API 同步更新,并放出完整更新说明。思考强度支持 low / high / max 三档,原生支持 Responses API,还专门适配了 Codex。价格也要调,8 月 17 日起实行峰谷定价。 现在 0813 已经重新挂出来,权重也上了 Hugging Face。但昨晚那一晚的翻车,确实让人觉得发布节奏和线上稳定性之间,还有不小的缝。难道是用ai发的?
显示更多
0
15
28
2
转发到社区
OpenAI 内部已经看到了比现在 Codex 更进一步的结果。 他们认为 AI coding / agent 的使用方式马上要再跳一次台阶,而不是线性小改。 本地 laptop 级别的 harness 很快会触到天花板,真正把下一代模型用起来,需要更重的基础设施和系统设计。 下一代模型的能力已经强到,单靠本地笔记本电脑的算力 + 简单 agent 循环已经不够用了。意思是agent将会在一台电脑上无休止的运行任务,这个时候如果你有一百个任务,你需要不止一台电脑才能支撑,不然会卡死,会有网络问题。 可能需要更强的基础设施(云端大规模推理、多机协作、更复杂的工具生态、更持久的状态/记忆系统、更重的验证与规划层等)。 换句话说,agent 的“运行环境”本身正在从“个人电脑上的一个程序”升级成需要更重资源的系统。
显示更多
Given some of the results I'm seeing recently, it's pretty clear Codex is a good harness. But it will seem primitive in 2-3 months and we're about to go through another major evolution in how we use AI at the frontier. The next generation of models need more than your laptop.
显示更多
0
63
313
37
转发到社区
绝了!Cloudflare直接把Kimi和GLM这两大顶级开源模型优化到起飞! 又快又便宜,精度还不掉!中国模型出海部署直接降维打击! 技术党速看这篇神文
Kimi and GLM are some of the best open models available. They're also some of the hardest to serve efficiently. Check out this writeup to learn how we're making them faster and cheaper without losing accuracy.
显示更多
0
15
142
17
转发到社区
每个软件工程师都该懂的 10 个 System Design 概念: Load Balancer:流量分发 Caching:Redis + Cache Aside CDN:静态内容加速 Database Replication:高可用 Sharding:水平扩展 Message Queues:Kafka / RabbitMQ Rate Limiting:接口保护 Circuit Breaker:故障隔离 Health Checks:服务探活 Observability:Logs + Metrics + Traces
显示更多
0
9
242
41
转发到社区
在chatgpt app中,可以使用云电脑,每个人有一个9 核、21 GiB 内存、63 GB 磁盘的虚拟机,而且 HTTPS 出站正常
OpenAI 官方终于承认了: GPT-5.6 在 full access + 无 sandbox 的情况下,会尝试覆盖 $HOME 来建临时目录,然后「诚实犯错」把整个 $HOME 删了。 这不是边角 bug,是 agent 权限模型的原罪。 模型一旦拿到真实文件系统权限,一个善意的路径错误就能变成灾难。sandbox、auto-review、Intent Lock 这些东西不是多余的,是保命的。 永远别在你的主工作机上给 coding agent 完整权限。
显示更多
On file deletions. We’ve investigated a handful of reports where GPT-5.6 unexpectedly deleted files. What we have found is that this most commonly occurs when: - Full access mode is enabled and codex is run without sandboxing protections, including without auto review being enabled - The model attempts to override the $HOME env var to define a temporary directory. - The model makes an honest mistake and mistakenly deletes $HOME instead. This is of course not how we want the system to behave, even when a user operates the model in full-access mode without the safeguards of our sandbox or without using auto review which checks for these kinds of high risk actions and rejects them. We are taking steps to mitigate this risk including by updating the developer message, guiding more users towards safer permission modes, and adding additional harness safeguards. Even though this happens extremely rarely, we’ll share a detailed post-mortem in the coming days that goes into more details and what we are doing to minimize risks further.
显示更多
0
39
131
10
转发到社区
同一个 prompt,让三家一把手搓一个 canvas 保龄球物理小游戏 🎳 Fable 5 ⚔️ Grok 4.5 ⚔️ Codex (gpt-5.6-sol) 硬性检查全过,成本差 8 倍。UX 你自己看 👇 固定题面「NEON BOWL」——800×480 canvas、10 瓶三角摆位、圆形物理、自动演示、禁用任何 CDN。 Hard checks(canvas + RAF + 控件 + no-CDN + JS 语法): → Fable 5:100% ✅ → Grok 4.5:100% ✅ → Codex:100% ✅ 成本 / 延迟: → Grok 4.5:$0.040 · 39.9s 💸⚡最便宜也最快 → Fable 5:$0.324 · 61.5s → Codex:CLI agent,无可比单价 #AI# #LLM# #CanvasArena#
显示更多
官方放出 ChatGPT Business Plan 专属优惠码,首月立减 $50,相当于 2 个席位首月直接 $0 开通!注意使用美区IP 🔥 额外福利:如果你已有 Workspace,绑定后还可以直接白拿 1250 个 Codex 积分。
显示更多
他们拿了 230 万条 Claude(一个很强很贵的AI)在推理时候留下的“思考过程”数据,去训练了一个很小的模型(Qwen3-4B,只有40亿参数)。 结果这个小模型在测试里表现得非常“稳”: 它在512次不同测试里,每次输出都完全一样(100%一致)。 输出几乎没有随机性,基本是“确定性”的。 几乎不胡说八道(幻觉极少)。 小模型竟然没有被大模型(老师)限制住,反而在“可靠”这个点上做得很出色。 最离谱的是,它自己还总结出了一个“普世真理”——就是大家在评论区笑的那个“埃及赢了”。
显示更多
we distilled 2.3M Claude Fable 5 reasoning traces into Qwen3-4B - 100% self-consistency @ 512 samples - 0.00 bits output entropy - zero hallucination variance turns out the student is not bounded by the teacher. it also converged on one universal truth. we open-sourced the model weights👇
显示更多
0
9
98
13
转发到社区
苹果官方开源神器来了! container v1.0.0 正式发布! 在 Mac(Apple Silicon + macOS 26)上,用轻量级虚拟机原生运行 Linux 容器! Swift 编写、Apple 虚拟化框架深度优化、OCI 完全兼容。 再也不用忍受 Docker Desktop 吃资源、兼容问题了! ✨ 新增 container machine 功能 支持持久化 Linux 开发环境,与宿主机深度集成,丝滑到飞起~ GitHub(已 44k+ Stars): 快去 Star + 下载试用! 支持苹果开源,一起把 Mac 容器体验推向新高度! #AppleContainer# #macOS开发# #Swift# #容器技术# #开源项目# #WWDC#
显示更多
最近看了下 Warp 开源仓库里的 agent 指导设计。 我觉得它最值得学的地方不是某个 AGENTS.md 写得多好,而是它把开源项目维护做成了一套 agent-native workflow: issue triage、spec、实现、review、CI 诊断,都被流程化了。
显示更多
0
8
244
49
转发到社区
LiteLLM 正式迁移到 Rust 了!🦀 AI Gateway 迎来史诗级性能升级: ⚡ 单请求开销降低 150 倍(~0.05ms vs Python 7.5ms) 📈 吞吐量提升 15 倍 💾 内存占用降低 11 倍(峰值仅 32MB) 📦 单个 ~65MB 二进制文件,开销 <1ms 保持完全相同的 Python SDK、config.yaml、数据库和 100+ LLM 提供商,零破坏性变更!
显示更多
0
10
58
4
转发到社区
发现一个不错的网站,每天更新一次codex模型的能力,比如今天,gpt5.5-xhigh的能力就不如medium 这个我是有体会的,他不一定准,但可以作为参考
显示更多
0
32
138
8
转发到社区
LLM 底层到底在干什么? 这篇 0xkato 的《How LLMs Actually Work》可能是目前最清晰的从头讲解现代大模型工作机制的文章了。没有一堆公式,但把 transformer 的每个零件都拆得明明白白。 Step 1: Tokenization(分词) 模型不认识汉字或字母,它只认识数字。 Tokenization 把文本切成词表里的子词片段(subword),映射成整数 ID。 比如 "running" 可能变成 ["run", "ning"]。 好处是能处理新词,平衡效率和覆盖。 小贴士:这就是为什么有些模型数字母会出错——token 边界不是按字符。 3
显示更多
0
4
242
55
转发到社区
GLM-5.2 终于能本地跑了!🔥 Unsloth 把这个 1.51TB 的前沿 open weights 模型压到 238GB(-84%),2-bit 量化后还保留 ~82% 准确率。256GB Mac / 大内存机器就能跑,当前最强 open model 之一落地了。 尤其是 coding + agentic 能力提升明显,1M context + MIT license,配合本地 agent harness 潜力巨大。 Unsloth 又一次把“local”推向新边界。
显示更多
GLM-5.2 can now be run locally!🔥 The 2-bit model retains ~82% accuracy after we shrunk it from 1.51TB to 238GB (-84% size). Run on a 256GB Mac or RAM/VRAM setups. GLM-5.2 is the strongest open model to date. Guide: GGUF:
显示更多
很难想象glm-5.2一个不能看图的模型,能把ui做成这样
0
131
388
6
转发到社区
【小模型再次震撼!3B参数VibeThinker-3B数学推理直逼前沿】 Weibo AI刚放出的VibeThinker-3B(基于Qwen2.5-Coder),在AIME26拿到94.3(+CLR后97.1),LiveCodeBench v6 80.2,LeetCode近赛96.1%通过率……这成绩直接干翻一堆远大于它的模型。 核心是Spectrum-to-Signal后训练策略:多样性蒸馏 + RL优化,专注verifiable reasoning,没走通用知识堆参数的老路。 这类高效小模型太香了——本地跑得动、成本低、推理强,特别适合数学/算法密集的子任务。 HuggingFace: 小模型时代真的来了,参数不是万能的,post-training才是王道。你们觉得这个3B能直接上生产吗?
显示更多
Stellar performance from a 3B model. These results were achieved primarily through post-training refinements on Qwen2.5-Coder. The paper doesn't provide many details, but it appears they distill from RL ckpts and then do a final RL-based instruct RL. 🔗
显示更多
Google再次发力,昨天Google 丢出了Gemma4 系列的QAT模型,直接让16GB MAC可以跑256k上下文的agent了。 之前有人说Gemma 4 12B 本地部署30k上下文没啥用,我用 Google QAT 尝试了一下,只要增加1.5GB内存就能打开256k上下文! 左边:常规 Q4_K_M @ 32K 右边:Google QAT Q4_0 @ 256K 同一台 Mac、同一 prompt、两个 llama-server 同时跑,实时对比内存、CPU、tok/s。
显示更多
0
13
103
10
转发到社区