我专门以
@elliotchen100 这个贴子为例,说一下 AI 味是从哪些表达里跑出来的吧。。。(已获得原帖作者授权)
1. 这种非人的概念做主语然后这个概念本身要怎样怎样像人一样作个什么事说个什么话然后冒号,是典型 AI 生成信号 —— “贡献边界得说清楚:”,如果是人类,一般的正常表达会是类似:
我对此事亦有贡献,包括以下几个方面:bluhbluhbluh
2. “真正……的,都是……”是典型 AI 生成文本信号 —— 如果是人类,一般正常表达会是类似:
其实是算法同事把研究、工程和实验做出来的 <--- 而不是倒装过来强调
3. 程度副词加(单字/双字)名词/形容词用来形容一个事物也是典型的 AI 生成文本信号,例如:很硬,很实际,极冷,等等 —— 如果是人类,一般正常表达会是类似:
这篇论文研究的问题和实际很贴近:(一般不会用 很实际 这种奇怪的表达方法)
4. 不是……而是,这个就不用说了,已经被骂烂大街了,AI 过于频繁到无耻地使用这种先否定再肯定的表达,已经让它本身现在几乎是完全没法用了。。。如果非要调整为正常人类语气,一般可以这样说:
结论是,我们不能追求「skill 越多越好」,而要在正确的任务里找到正确的 skill,再 harness 真正把它执行出来。
-----
我也不知道 AI 为什么会从语料里习得这些非常古怪的表达方式,而且把它内化成为日常表达的常用手法。。。
我隐隐约约的感觉是它还是和中文语料占比过小,一些表达实际上还是从英语/西班牙语的语法逻辑那边硬凹过来的有关。。。
又来一篇论文。
这次我也有幸列在作者名单里。贡献边界得说清楚:真正把研究、工程和实验做出来的,都是算法同事。
我做的很少,更多是从产品和 Agent 生态角度参与了一些讨论,提供了一点问题定义和应用反馈,甚是荣幸。🫡
这篇论文研究的问题很实际:
网络上已经有几十万个 SKILL.md。把更多 skills 塞给 Agent,它就会自动变强吗?
团队从约 82.1 万个公开技能文件中,经过结构筛选、去重,以及质量、安全和许可检查,整理出 96,401 个技能。然后通过 retrieval、rerank 和 LLM selector,为每个任务选择 0–2 个真正相关的技能。
在三个 benchmark、两种 agent harness 和两种开源 backbone 下,SkillCorpus 都带来了正向提升,SkillsBench 上的汇总提升达到 +7.5 个百分点。
结论不是「skill 越多越好」,而是要在正确的任务里找到正确的 skill,再让 harness 真正把它执行出来。
显示更多