注册并分享邀请链接,可获得视频播放与邀请奖励。

九原客 的个人资料封面
九原客 的头像

九原客 (@9hills)

@9hills
0 正在关注    0 粉丝
对DSH的一个评测,仅供参考。
同一个 DeepSeek V4 Flash,我们进行了 9 个不同 harness 的头对头测试。 Maka 排名第二,通过率 77.5%,官方 DSH 的 Minimal Mode 排名第四,通过率 73.0%。 最高的是 Codex,最糟糕的是 Claude Code,通过率低且成本最高。
显示更多
GLM-5.3 发布!这一轮国内模型的爆发是从 GLM-5.2 开始,我们也都知道后训练还能大幅提升,所以 5.3 值得期待。 当然你也可以看到 Kimi K3 靠庞大的体积,依然在 Coding 领域领先。
显示更多
还要离线跑起来 DeepSWE,感觉头大
好难啊,要在客户这里跑起来 Harbor + DeepSWE。 没有顺畅的国际互联网访问,跑不起来啊。 不想干 ToB 了。
换个思路,这是个做Agent Harness的研究人员用的,很容易就定制一种的新的harness idea发paper。 有用没用另说。
...这是哪一代agent才能设计出来的构思😹 deepseek pro已经够拉了,不要在agent上再拉一遍啊 如果做插件就得专注先把core做好
现在告诉我说Pro新版还有盗版和正版? 没心情测试,过几天再说吧….
上次我说要两倍起。 结果是2-12倍!现在coding agent的大头就是cached input,涨的最多。 感觉综合成本应该会是3-4倍上涨。
真的无语了,DeepSeek V4 Pro 高峰期照着 12 倍去涨价…
貌似没人关心 Qwen3.8-2.4T-A95B 开源,其实 Qwen3.8-Max还行,就是太贵了。 DeepSeek-V4-Pro 感觉有点问题,不如用 Flash。让后训练再跑一会~ 目前国产模型我的选择: 超大杯:Kimi K3 大杯:GLM5.2 中杯:DeepSeek-V4-Flash 国外模型选择: 超大杯:Opus 5 大杯:GPT-5.6-Sol 中杯:Grok 4.5(4.6还在测试)
显示更多
利用 Claude 推理块加密跨模型可复用的漏洞,让 Haiku 恢复 Opus 的加密思维链。 有点意思,不过并不能证明完美恢复,类似于提示词越狱。
We can finally talk about it: We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company. We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried.
显示更多
the bitter lession 还在发力。 我的观点是 harness infra(沙盒、工具等等) 肯定是持续做厚,但是 harness context(比如什么 loop、graph、agent team、外置 memory 等等)价值是下降的,甚至有些东西的价值一开始就不成立。
显示更多
We ran DeepSeek V4 Flash through 4 more agent harnesses (Hermes Agent, Pi Agent, Prime Agent, Deep Agents) on 30 challenging agentic tasks. Pi Agent was the cheapest harness and passed the most tasks 🧵🧵
显示更多
@Gorden_Sun 但是 Qwen3.8-27B 快出来了。 Meta 真的是闭源做不明白开源也做不明白,两边挨打。
gpt-5.6-sol 对训练它的harness 还挺执着,尝试调用不存在的 apply_patch(pi中)。 不过只会犯一次错误,也没有证据证明放到codex下的gpt-5.6-sol就比pi里的好。 感觉这个harness mismatch 也没太大影响。
显示更多
0
26
18
1
转发到社区
deepseek 今天在后台有个公告,说近期要大幅涨价。 没来得及截图,有人截图到了么?
0
32
53
0
转发到社区
除了GPT-5.6 sol 感觉没那么高外,基本符合体感。 新版本的DeepSeek-V4-Flash 感觉比GLM-5.2 差一点,碰不上K3。
DeepSeek-V4-Flash-0731 debuts with an ECI of 153, comparable to GLM 5.2 and roughly midway between Opus 4.5 and Opus 4.6. It's the second strongest open-weights model available today, behind only Kimi K3.
显示更多
0
60
30
0
转发到社区
在大公司、政府机关干过的都知道,世界就是一个巨大的草台班子。 苹果法务部也不例外,太草台了。 人类组织成功的是少数,失败的是多数。能够带领着一帮草台班子还能把事做成,确实也不容易。 最近我对我的Agent们宽容了很多,因为我发现相比于之前对接过的某些人,Agent草台程度比他们低多了。
显示更多
哎,怀念 opus4.6 的语言能力。
让 Claude Code 说人话的 instruction 1. 使用标准术语。已有通用说法的概念不要另造表述。 2. 不要使用比喻。如果一个说法需要读者推断其指代对象,改为直接说明。 3. 表头和分类名使用中性名词,如“问题”“现象”“影响”“结果”。 4. 不使用“是 X,不是 Y”的对比句式。 5. 表格条目不要求每条都包含数字或结论。部分条目可以只说明发生了什么。 6. 未查明原因的问题写“原因未查明”。 7. 不使用口语词。 8. 不使用拟人表述。 规则 1:使用标准术语 超长度 / 超不超长度 → 截断 / 是否触及长度上限 Ray 的端口会跟自己撞 → 多个任务的 Ray 抢占同一端口 臂 → 方案 只看长度那条线 → 长度启发式基线 刷奖励 → 奖励被优化但评测指标未改善 存档 → checkpoint 规则 2:不发明比喻作为术语 血统 → 基座来源 8 个不同血统 → 8 个不同基座的模型 那是尺寸差异,不是血统差异 → 原有区间由 Qwen 的 14B、32B、72B 构成,差异来自参数量而非基座 已经吃掉一半空间 → 已覆盖一半区间 变成了一个认题目的检索器 → 退化为问题识别,与学习价值无关 挑出来的题目看上去健康得多 → 选中问题的截断比例更低 误差范围还盖着基准线 → 置信区间与基线重叠 规则 3:表头和分类名使用中性名词 坑 / 代价和教训 → 问题 / 影响 把握 → 确认程度 怎么做的 → 实验设置 重挑一次还剩多少重合 → 重采样后的重合率 有几种不同取值 → 取值数量 还在跑的 → 进行中 一个必须关掉的开关 → 需要关闭的过滤器 章节状态标签需要保持一致。 如果前面使用: 已完成 已确认 未达到基线 结论待定 后面出现了: 做通了 意外发现 需要修 没有买到想要的 统一使用前面部分的中性状态标签。 规则 4:不使用“是 X,不是 Y”的对比句式 梯度对齐:是噪声,不是信号 → 梯度对齐:三项检查结果均在噪声范围内 我们买到了血统上的多样性,但没有买到能力上的多样性 → 新增模型覆盖了更多基座,但正确率均低于原有区间下界 考法和用法对不上 → 评测口径为成对比较,与实际使用方式不一致 稳定是靠粗糙换来的 → 取值数量少的指标重合率高 越稳定的指标越挑不出东西,越挑得出东西的指标越不稳定 → 重合率与取值数量呈反向关系 规则 5:允许条目不包含数字或结论 例如: 对照组为随机选取的 32 个问题。 这条内容已经完整,不需要继续补充其他方案与对照组的关系。 规则 6:未查明原因时直接写“原因未查明” 前文已经写明“原因未查明”时,后文不要继续补充未经验证的解释。 这可能也解释了前文那个现象 → 该现象与截断的关系尚未验证 第十章“后来查明了机制”之后的内容已经得到确认,可以保留。 规则 7:不使用口语词 赢得很干脆 → 差值为 0.030 测得更准 / 测得更糙 → 估计精度更高 / 更低 可选的余地很小 → 候选范围小 基本上等于抓阄 → 接近随机选取 本来就分不出高下 → 真实差距低于可分辨范围 白跑 / 白占 → 无效运行 / 空占 不是白捡的 → 需要 79 GPU·小时 一个致命问题 → 主要问题 有事后找补的嫌疑 → 该切分方式在观察结果之后确定 原因不复杂 → 删除 既然预测这条路走不通,那就退一步 → 删除,直接进入实验设置 规则 8:不使用拟人表述 天生需要几百到上千次采样 → 该信号所需的采样量为几百到上千次 一旦超就制造出参差 → 截断发生时会增大奖励方差 24 步训练只挪动 0.05 → 24 步训练后正确率变化为 0.05 超得越彻底反而越稳定 → 截断率越高,奖励方差越低 回答内容本身的好坏参差 → 答案质量的差异
显示更多
genoffice 还不错,但是不支持BYOK。官方其实代码里有BYOK的支持但是并没有做配置页面,所以我加了一个简单的配置页面。(源码下载后,让 Agent 帮你构建即可) 使用官方很简陋的实现,有空合并下 pi-ai 的逻辑,这样支持 codex 订阅等服务商。
显示更多
@oran_ge 评价挺高的了,可能是不满意和K3相提并论?
有的时候AI 号的策略也不太行。。
搞自动化和爬虫的兄弟可以把之前的方案扔了。 GitHub 上突然爆火了一个开源项目 Index(由 AI 开发者平台 Laminar 团队打造),直接把网页浏览器变成了可调用的 API。这玩意本质上是一个极度丝滑的“AI 浏览器 Agent”,你在终端输一句人话,它就能像真人在浏览器里点按、抓数据、填表单,甚至跨站点联动办完一整套复杂流程。在 WebVoyager 跑分里直接飙到了 92% 的惊人准确率。 一句命令就能跑:pip install 之后敲 index run 就能直接在终端调用。 能直接用本地 Chrome:带 --local-chrome 参数,自动复用你已登录的账号状态。 顶配视觉推理引擎:原生支持 Claude 3.7 Sonnet、Gemini 2.5 Pro 等顶尖多模态大模型。 全程会话回放与排错:自带开箱即用的可视化录屏与步骤 Trace 监控。 自动抓取并生成表格:一句话搞定“去网站抓数据并新建 Google Sheets 写入”。 📦 开源协议:Apache-2.0 🔗 GitHub 传送门:
显示更多
相比于 Qwen3.8-Max(可能很强大,但是这个赛道太拥挤),更期待 Qwen3.8-27B。
📢Meet Qwen3.8-Max — our most capable model to date. Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!🎉 Qwen3.8-Max, a new bar for coding and cowork at 2.4T parameters: - Autonomous coding: 10+ days of self-evolving development, from empty folder to production without hand-holding, complete project trace in the GitHub: - Real work, real results: Production-quality deliverables across hundreds of professions. - Long-horizon mastery: System-level autonomous planning with closed-loop adaptive learning, driving 500+ turns of chip design optimization and 365 days of e-commerce strategy. - Native multimodal intelligence: Vision isn't just input — it's a continuous feedback loop for planning, execution, and self-correction. 💰Pricing: Input: $2.0 / M tokens Output: $6.0 / M tokens Implicit Caching: $0.25 / M tokens Start building with Qwen3.8-Max! 🚀 📖 Blog: ✅ Qwen Studio: ⚡ API:
显示更多