注册并分享邀请链接,可获得视频播放与邀请奖励。

与「学生雀魂杯」相关的搜索结果

学生雀魂杯 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 学生雀魂杯 的内容
GPT 5.5 现在写东西质量真的不错了,刚翻译了一篇文章( --- 译文 --- 我为什么写作 作者:埃里克·布莱尔 从很小的时候起,也许是五六岁,我就知道,等我长大了,我应该成为一个作家。大约在十七岁到二十四岁之间,我曾试着放弃这个念头。但我心里很清楚,那是在违背自己真正的天性;迟早有一天,我还是得坐下来写书。 我在三个孩子中排行中间,前后兄弟姐妹都和我相差五岁。八岁以前,我几乎没见过父亲。因为这个,也因为其他一些原因,我多少有点孤僻。很快,我养成了一些讨人嫌的小毛病,整个学生时代都不怎么受欢迎。孤独的孩子常常会编故事,也会和想象中的人说话;我想,从一开始,我的文学野心就和这种被孤立、被低估的感觉纠缠在一起。我知道自己有驾驭文字的能力,也有直面难堪事实的能力。于是,我像是给自己造出了一个私人世界,可以在里面弥补现实生活里的失败,甚至悄悄“扳回一城”。不过,整个童年和少年时代,我真正写到纸上的严肃作品——也就是我认真想写出来的东西——加起来恐怕不到六页。 我四五岁时写过第一首诗,是我口述,母亲替我记下来的。我已经不记得内容了,只记得那首诗写的是一只老虎,而且老虎有“像椅子一样的牙齿”。这倒是个还不错的说法,但我猜那首诗大概抄袭了布莱克的《老虎,老虎》(William Blake 的名诗 *The Tyger*,英国浪漫主义诗歌中的经典作品)。十一岁时,1914—1918年的战争爆发(即第一次世界大战),我写了一首爱国诗,刊登在本地报纸上。两年后,基奇纳去世,我又写了一首,也登了出来。后来稍大一点,我时不时写一些很糟糕、通常也没写完的“自然诗”,风格模仿乔治王朝派(Georgian style,20世纪初英国诗歌中一种偏重田园、自然和抒情描写的风格)。我还大约试过两次写短篇小说,结果惨不忍睹。那些年里,我真正落到纸上的、想要称为“严肃创作”的东西,全部加起来就是这些。 不过,在那段时间里,我其实一直在某种意义上从事文学活动。首先,是那些按要求写出来的东西:我写得很快,很轻松,但自己并没有多少乐趣。除了学校作业,我还写 *vers d’occasion*(应景诗),也就是半滑稽的诗。现在回想起来,我当年写得快得惊人——十四岁时,我模仿阿里斯托芬(Aristophanes,古希腊喜剧诗人),大约一周就写出了一整部押韵剧。我也帮忙编辑学校杂志,有印刷版,也有手抄版。那些杂志简直是你能想象到的最可怜的滑稽仿作。我对它们花的心思,远不如我今天会花在最廉价的新闻稿上的心思。但与此同时,在十五年甚至更久的时间里,我还做着另一种完全不同的文学练习:我在脑子里编一个关于自己的连续“故事”,像一部只存在于心里的日记。 我相信,很多儿童和少年都有这种习惯。很小的时候,我会想象自己是罗宾汉之类的人物,把自己想成惊险冒险故事里的英雄。但很快,我的“故事”就不再是那种粗糙的自恋幻想,而越来越变成对我正在做什么、看到什么的描写。有时候,我脑子里会一连几分钟出现这样的句子:“他推开门,走进房间。一束黄色的阳光透过细棉布窗帘,斜斜落在桌上;桌上有一只半开的火柴盒,放在墨水瓶旁边。他右手插在口袋里,走向窗边。楼下街上,一只玳瑁猫正在追逐一片枯叶。”诸如此类。这个习惯一直持续到我大约二十五岁,贯穿了我那些“非文学”的岁月。虽然我必须寻找合适的词,而且确实也在寻找,但这种描写的努力似乎几乎不是出于我的意愿,而像是受到了某种外部力量的驱使。我想,这个“故事”大概反映了我在不同年龄崇拜过的不同作家的风格。不过据我记得,它始终都有同一种细致入微的描写特质。 十六岁左右,我突然发现了文字本身的快乐,也就是词语的声音和联想所带来的快乐。*《失乐园》*里的两行诗—— > So hee with difficulty and labour hard > Moved on: with difficulty and labour hee, > > (他艰难地、辛苦而沉重地 > 向前移动:艰难地、辛苦地,他——) 如今看来,我并不觉得这两行有多么了不起,但当时它们让我脊背发颤。而且,把 “he” 写成 “hee” 的古式拼法,也让我格外愉快。至于描写事物的需要,我早已经非常熟悉了。由此可见,当时如果说我想写书,我想写的大概是哪一类书:巨大的自然主义小说,结局不幸,充满细节描写和醒目的比喻,也充满华丽辞藻段落(purple passages,指为了文采而文采、常常显得夸张空洞的文字),其中一些词语被使用,部分只是为了它们的声音。事实上,我完成的第一部长篇小说 *《缅甸岁月》*,是在三十岁时写成的,但构思早得多,它大体上就是这样一本书。 我交代这些背景,是因为我认为,如果不了解一个作家早年的成长,就很难判断他的写作动机。作家的题材会由他所处的时代决定——至少在我们这样动荡、革命性的时代,这一点是成立的——但在他真正开始写作之前,他已经形成了一种情感态度,而这种态度他永远无法完全摆脱。毫无疑问,他的任务是约束自己的气质,避免卡在某个幼稚阶段,或陷入某种扭曲情绪里。可是,如果他彻底摆脱了早年的影响,也就等于扼杀了自己写作的冲动。暂且把谋生的需要放在一边,我认为,写作至少有四种重要动机,尤其是写散文时。这些动机在每个作家身上都以不同程度存在;同一个作家身上,它们的比例也会随着他所处的环境而变化。它们是: (一)纯粹的自我意识。 想显得聪明,想被人谈论,想死后被人记住,想向童年时轻视自己的成年人讨回一点公道,等等。假装这不是写作动机,是虚伪的;而且它还是一种很强的动机。作家和科学家、艺术家、政治家、律师、军人、成功商人一样,都有这种特征——简言之,这属于人类中最冒尖的那一层。绝大多数人并不是特别自私。大约三十岁以后,他们会放弃个人野心;很多情况下,他们几乎连“自己是一个独立个体”的感觉都放弃了,主要为别人而活,或者干脆被苦役般的日常生活压没了。但也有少数有天赋、意志强的人,决心一直按照自己的方式生活到底,作家就属于这一类。总体来说,严肃作家比新闻记者更虚荣、更自我中心,不过他们对钱的兴趣要少一些。 (二)审美热情。 看见外部世界中的美,或者看见词语及其恰当排列中的美。一个声音撞上另一个声音时带来的快感,优秀散文的坚实感,或者一个好故事的节奏。想把某种自己觉得珍贵、不该被错过的体验分享出去。许多作家的审美动机很弱,但即使是写政治小册子的人,或者写教科书的人,也会有自己偏爱的词语和短语,并非出于实用原因,而只是喜欢它们;或者,他可能会特别在意排版、页边距的宽度等。只要不是铁路指南那种层级的书,任何一本书都不可能完全没有审美考量。 (三)历史冲动。 想看清事物本来的样子,想找出真实事实,并把它们保存下来,供后人使用。 (四)政治目的。 这里的“政治”一词取最广泛的意义。也就是说,想把世界推向某个方向,想改变别人对于“人类应该努力建设什么样的社会”的看法。再说一次,没有一本书真正摆脱了政治倾向。认为艺术不应该和政治有任何关系,这本身就是一种政治态度。 可以看出,这几种冲动必然会彼此冲突,而且会因人而异、因时而变。按我的本性来说——也就是把“本性”理解成一个人刚成年时达到的状态——我身上前三种动机应该会压过第四种。如果生活在一个和平时代,我也许会写华丽的书,或者只是描写性的书,甚至可能几乎意识不到自己的政治立场。但现实是,我被迫变成了某种论战小册子作者(pamphleteer,指写政治宣传或论争文章的人)。 起初,我在一个不适合自己的职业里待了五年,也就是在缅甸的印度帝国警察部队。后来,我又经历了贫困和失败感。这加强了我天生对权威的憎恶,也让我第一次充分意识到工人阶级的存在。而缅甸的工作则让我对帝国主义的本质有了一些了解。不过,这些经历还不足以让我形成准确的政治方向。接着,希特勒出现了,西班牙内战爆发了,等等。到1935年底,我仍然没能做出坚定的判断。我记得自己在那一年写过一首小诗,表达当时的困境: > 两百年前,我本可以 > 做个快乐的乡村牧师, > 宣讲永恒的末日, > 看着我的核桃树生长。 > > 可惜我偏偏生在邪恶的年代, > 错过了那座惬意的避风港; > 我的上唇已经长出胡子, > 而如今的神职人员全都刮得干干净净。 > > 再往后,日子也曾不错, > 我们那时很容易满足; > 我们把烦乱的思绪 > 摇睡在树木的怀里。 > > 我们曾无知却坦然承认 > 那些如今必须掩饰的欢愉; > 苹果枝上的绿雀 > 也能让我的敌人发抖。 > > 可女孩的肚腹和杏子, > 阴凉溪水里的拟鲤, > 黎明时飞起的马和鸭子, > 如今全都只是一场梦。 > > 再也不许做梦; > 我们残害自己的快乐,或把它藏起; > 马是用铬钢造的, > 小胖子们会骑在它们背上。 > > 我是那条从未反抗的虫, > 是没有后宫的阉人; > 在牧师和政委之间, > 我像尤金·阿拉姆一样行走;(Eugene Aram,18世纪英国一起著名谋杀案中的人物,后来常被文学作品写成被罪感纠缠的人) > > 政委正在替我算命, > 收音机还在播放; > 可牧师答应给我一辆奥斯汀7型车,(Austin Seven,英国早期著名小型汽车) > 因为达吉总会买单。 > > 我梦见自己住在大理石厅堂,(“I dreamt I dwelt in marble halls” 是19世纪歌剧中的著名唱段) > 醒来却发现那是真的; > 我不是为这样的时代而生; > 史密斯是吗?琼斯是吗?你是吗? 1936—1937年的西班牙战争和其他事件,让天平最终倾斜。从那以后,我知道自己站在哪里。自1936年以来,我写下的每一行严肃文字,无论直接还是间接,都是在反对极权主义,并支持我所理解的民主社会主义。在我们这样的时代,还以为自己可以回避这些题材,在我看来是荒唐的。每个人都会以这样或那样的形式写到它们。问题只在于你站在哪一边,以及你采取什么方式。一个人越清楚自己的政治倾向,就越有可能在采取政治行动时,不牺牲自己的审美和思想上的诚实。 过去十年里,我最想做的事,是把政治写作变成一门艺术。我的出发点始终是一种立场感,一种对不公的感受。我坐下来写一本书时,并不会对自己说:“我要创作一件艺术品。”我之所以写,是因为有某个谎言我想揭穿,有某个事实我想让人注意到;我最初关心的,是让别人听见。但是,如果写一本书,甚至写一篇长篇杂志文章,本身不能同时成为一种审美体验,我也不可能完成它。任何愿意研究我作品的人都会发现,即使在我写得最像宣传的时候,其中也包含许多职业政客会认为无关紧要的东西。我不能,也不想,完全抛弃童年时期形成的世界观。只要我还活着,而且健康,我就会继续强烈地在意散文风格,继续热爱地球表面,继续从坚实的物体和无用的零碎知识中获得乐趣。压抑自己的这一面毫无用处。真正的任务,是把我根深蒂固的喜好和厌恶,同这个时代强加给我们所有人的、根本上属于公共领域而非个人领域的活动调和起来。 这并不容易。它带来结构上的问题,也带来语言上的问题;同时,它还以一种新的方式提出了诚实的问题。让我只举一个比较粗糙层面的困难作为例子。我关于西班牙内战的书 *《向加泰罗尼亚致敬》*,当然是一本坦率的政治书,但总体上,它写得有一定的克制,也顾及形式。我确实很努力,想在不违背文学本能的前提下讲出全部真相。但书中有一整章很长,里面充满了报纸引文之类的材料,为那些被指控与佛朗哥合谋的托洛茨基派辩护。托洛茨基派(Trotskyists,苏联革命家托洛茨基的追随者,在当时左翼阵营内部常遭斯大林主义者攻击);佛朗哥(Franco,西班牙内战中民族主义阵营领袖,后来成为独裁者)。显然,这样一章过上一两年后,对任何普通读者都会失去兴趣,也必然会毁掉这本书。一位我尊重的批评家曾训了我一通。他说:“你为什么要把那些东西放进去?你把一本本来可能很好的书,变成了新闻报道。”他说得没错。但我当时不可能不那样做。我碰巧知道一件事,而英国很少有人被允许知道:无辜的人正在遭受虚假指控。如果我没有为此感到愤怒,我根本就不会写那本书。 这个问题会以这样或那样的形式反复出现。语言的问题更微妙,谈起来会太长。我只想说,近些年来,我一直试图写得少一些画面上的华丽,多一些准确。不管怎样,我发现,当你把某种写作风格打磨成熟时,你也总已经从那种风格里长出来了。*《动物农场》* 是第一本书,在写它时,我完全清楚自己正在尝试把政治目的和艺术目的融合成一个整体。我已经七年没有写小说了,但希望不久之后能再写一部。它肯定会失败,每一本书都是失败的。但我确实相当清楚自己想写的是哪一种书。 回头看前面这一两页,我发现自己好像把写作动机说得全是出于公共精神。我不想让读者最后留下这种印象。所有作家都虚荣、自私、懒惰,而在他们动机的最深处,还藏着一个谜。写一本书是一场可怕而耗人的搏斗,就像经历一场漫长而痛苦的疾病。除非有某种自己既无法抗拒、也无法理解的“心魔”在驱赶,一个人绝不会主动承担这样的事。也许,谁知道呢,那种心魔不过就是婴儿哭闹着要人注意的同一种本能。然而,同样真实的是:如果一个人不持续努力抹去自己的个性,就写不出什么可读的东西。好的散文像一块窗玻璃。我无法确定自己哪一种动机最强,但我知道哪一种动机值得追随。回看自己的作品,我发现,每当我缺乏*政治*目的时,我写出来的书总是没有生命力,也总会滑向华丽空洞的段落、没有意义的句子、装饰性的形容词,以及各种虚假的漂亮话。 *Gangrel*,第4期,1946年夏 --- 来源:[奥威尔基金会]( --- 翻译提示词 --- 请将以下英文文章,重写成通俗流畅、引人入胜的简体中文。 核心要求: - 读者与风格: 面向对AI感兴趣的普通读者。风格要像讲故事,清晰易懂,而不是写学术论文。 - 准确第一: 核心事实、数据和逻辑必须与原文完全一致。 - 行文流畅: 优先使用地道的中文语序。将英文长句拆解为更自然的中文短句。 - 术语标准: 专业术语使用行业公认的标准翻译(如 `overfitting` -> `过拟合`)。第一次出现时,在译文后用括号加注英文原文。 - 保留格式: 保持原文的标题、粗体、斜体、图片等Markdown格式。 - 尊重原意:保持原有的结构、意思不变,不要过度引申发散,保持原文结尾不要续写 - 适当解读:如果是普通人难懂的专业术语或因为文化差异导致的难以理解,做出更多的注释以更好的理解,注释部分用括号包裹并加粗
显示更多
0
6
103
6
转发到社区
朋友是高中教师兼班主任,说为了避免班里学生早恋,特意开了两次班会,让学生们以男女平权为题进行辩论。 效果显著,见识过女同学打拳的样子,班里都男同学基本都意识到了现阶段自己到底该干什么😁
显示更多
天塌了 在昆明被高三学生凿了 我现在懵懵的 #昆明#
0
49
203
11
转发到社区
20岁,我成了A10 大佬唯一弟子,入职不到两月分成10W+,自己也谈过几单下来10W+的律所培训合作。 虽然看似小有成就,但这是我踩了无数坑、拼了命抓住每一次机会汇聚成的结果。 大一的时候,我还是一个很传统的八爪鱼法学生,竞赛科研绩点一起抓,用一年半时间拿了3个国奖、15个省奖。 后来,学校保研政策突然变了🥲,我才觉醒之前玩的都是过家家游戏,逐渐把重心转移到真实社会。 AI、法律实务、自媒体、创业……我都做,而且我发现,来到新的游戏规则,我还是挺会玩! 之前的一次跨国研学,本是再普通不过的纯旅游活动,但晚上的慈善晚宴,我跑去和各行业大佬social,硬生生碰出了意想不到的机会——有幸参与到联合国环境规划署在新加坡的项目。 后来去深圳某红圈所实习,发现自己是纯牛马😅😅😅前途没有希望,于是用 ChatGPT搜索在深圳本地举办的法律界商务活动。 有个活动相当牛逼,参会的老板都交了6万会员费,但我又肯定没有那个实力🥺。。。 所以我想了个歪招🤪,去找到了活动主理人的社媒,私信问能不能去兼职帮忙办活动。 就是在那里,我遇到了现在的老板。他应该是觉得这活动太无聊,就和我聊了起来。 刚好聊到 AI 这块,他非常感兴趣,又知道我过去的法律背景,最后就直接邀请我去上海跟着他干。 更疯狂的是,当天凌晨他发出的邀请,我第二天毫不犹豫,就直接跟我老板从深圳飞去了上海。 我当时的想法很简单:这个机会可能会把我带到一个更大的世界,那我就去,莽就完了!👊🏼 这一次,我赌对了,我成了他目前唯一正式带的徒弟。 很多朋友说我很会向上社交,我以前也这么觉得,后来发现不完全是。 诚然,我确实慕强,但不太怯。碰到比我厉害很多的人,我不会急着证明其实我也很厉害,毕竟我是真草台。 我更想知道:你为什么这么厉害?你是怎么做到的?这里面有什么是我可以学走的? 社交只是入口,从里面收获,擅于从里面收获,才是核心能力。 我现在20岁,X上比我会赚钱、会AI、会做产品、会创业的佬太多了。我现在做出的这些东西,放进更大的世界里,都还很渺小。 但这不妨碍我对自己有一种近乎固执的自信:我会迅速地成长。也能在较短时间找到自己在X里的生态位。 接下来我也会在X上持续分享AI、自媒体、金融、投资、法律等领域的实战知识👇 1、在处理社交类问题颇有心得,比如结交贵人(年长/同龄/年下)、家庭关系处理等。 2、我目前深耕于伪投资、伪金融领域,如各位有被诓骗/要开脱的需求,欢迎咨询(限国内和新加坡),我的案例经验绝对是少见的丰富。 3、我是个大E人,所以在销售方面也比较有经验,之前在法律AI领域也成交过好几个大项目,接下来也会继续培养此技能。 欢迎大家来和我交朋友~
显示更多
0
41
47
3
转发到社区
NVIDIA 发布 Skill2Env:用“集体技能”强化智能体 NVIDIA 研究者们把社区公开的 Agent Skills 编译成可执行 RL 训练环境的数据流水线:3.4k 个 Skills 变成 8k 个带程序化测试和行为量规的终端任务;仅 300 步 RL 训练就让 Qwen3.8-27B 在 Terminal-Bench 2.1 上提升 4.7 个百分点,且模型行为显著向源 Skills 的方法论对齐。 开源项目: 核心洞察:公开 Agent Skills 是一个被忽视的监督来源 Agent Skills 是“教智能体做某件事”的文件夹:一个 SKILL.md 加上可选的脚本、参考资料和资产。论文指出,把公开 Skill 语料当作数据来读,它同时提供三样东西: · 任务分布的采样:人们真正想让智能体处理的任务分布(有人愿意花时间写下工作流,说明这活儿值得自动化); · 真实世界的锚点:指向真实的仓库、数据集、工具和工件; · 结果测试表达不了的质量标准:领域专长、默认参数、常见坑、“好结果长什么样”。 # 数据流水线:四阶段编译,验证靠构造 1. Plan(分解):容器化的 Codex 规划器读取完整 Skill 包、联网调研相关公共资产,把 Skill 拆解成若干可验证的 workflow,每个附带元计划(场景、初始世界、预埋缺陷、难点来源、解法草案、验证策略)、资产建议和“任务轴池”(任务原型 × 验证器模式 × 人物画像)。 2. Diversify(多样化):宿主从轴池采样一组组合,加上复杂度、指令语气、请求者专业水平。关键设计是轴池以 workflow 为条件:研究型 workflow 配“证据可追溯”验证和研究者画像,而不是从全轴乘积空间乱抽,这让多样化保持 sensible。 3. Create(构造):全新创建者 Codex agent 在 Docker 内工作,尽可能用真实素材(钉在特定 commit 的开源仓库、真实版本化文档、官方 API 规范);需要联网服务的场景改造成本地替身(stub 服务器、录制回放 fixture、PATH 上的假 CLI、种子数据库),求解时绝不依赖网络。创建顺序被严格固定:先建世界 → 写指令 → 写测试 → 写量规 → 最后才写参考解,测试先于解法冻结,保证解法必须迁就评分契约而非反过来。 4. Verify(验证):宿主端无模型参与的接收门:静态检查(布局、符号链接、Dockerfile 安全、基础镜像按内容摘要钉死)+ 两个容器内试跑:Oracle(参考解)必须全指标满分,NOP(什么都不做的 agent)必须全指标零分。任一失败即拒绝。 值得注意的一个反直觉选择:不做 teacher 模型预验证(不像部分工作用强模型试解、解不出就丢弃任务)。理由有二:这会把任务难度上限压到验证器能力,且成本翻倍;而 group-based RL 的在线动态过滤(rollout 无优势的 prompt 自动不产生梯度)天然淘汰过难/过易任务。 # 数据画像:广、贵、且忠实于源 规模与成本:7,971 个任务,用 GPT-5.6 Sol(xhigh 推理档)生成,API 花费超 9 万美元。(脚注:出于法律原因,公开发布的数据集改用 Kimi-K3-max 在同一流水线下生成。) 领域分布:13 个领域中,软件工程仅占 22.5%,AI/ML 10.5%,商业/金融/法律/HR 10.5%,营销 9.3%……论文对比了 TMax-15K、Terminal-Bench、DeepSWE 等,Skill2Env 是唯一全覆盖 13 域、且非技术知识工作占大头的语料。 忠实度探针(很聪明的设计):用任务指令+量规作查询、对 3.4k 个 SKILL.md 做 TF-IDF 检索,73.2% 的任务 top-1 命中真实源 Skill,94.6% 进 top-10(随机 0.03%)。单用量规也有 68.5% top-1,证明量规携带的是 Skill 专属方法论而非泛泛建议。 SFT 数据:用 GLM-5.3 对每个任务 rollout 两次,得到 15,968 条轨迹,平均奖励 0.74,中位轨迹 19 次模型调用 + 23 次工具调用。 S2EBench:考虑到公开基准饱和,从 SkillHub 另外生成、逐条人工审核(指令无歧义、忠实于源 Skill、测试公允)后的 79 任务私有 held-out 基准。 # RL 实验:基础设施 + 极简配方 基础设施(论文明确说“现代 agentic RL 首先是基础设施挑战”):Molt(PyTorch 原生全异步训练,Ray + vLLM + FSDP2)+ Polar(agent rollout 层:rootless Apptainer 沙箱、代理回传 token ID 和采样时 log-prob、prefix merging 把 harness 的多次补全缝合成训练轨迹)。 配方(刻意走“简单路线”):GRPO 组归一优势 + DPPO 的 binary-KL 信任域掩码(δ=0.05,超出阈值的 token 直接丢弃,无需参考模型,还能防训练-推理失配);G=8 rollouts/组,批 64,lr 1e-6 恒定,无 KL 惩罚、无熵奖励、无 SFT 热启动,每任务 65k 上下文。 量规校准奖励:开量规时,额外由 GPT-6 Astra 做 LLM-as-Judge(带“宪法”:惩罚无脑循环、reward hacking、答非所问;hacking 实证 = -5 分),总奖励 r = r_V + λs/5(λ=0.2),即 judge 最多把程序化奖励拉动 ±0.2。量规是校准可执行结果奖励,而非取代它,这是与“Rubrics as Rewards”一系的定位差异。 # 四项发现(论文最有信息量的部分) 发现 1:小规模 RL 即有跨域迁移。 仅 300 步、只用 2,400 任务子集训一个 epoch:S2EBench pass@1 +4.3(均分 +18.5),Terminal-Bench 2.1 +4.7(49.4→54.1)。训练集与 TB 无重叠(13-gram Jaccard < 0.8),且训练集从未针对 TB 调过,论文将其解读为规划、工具使用、收尾能力的通用提升而非任务族记忆。这让 27B 本地模型显著缩小了与云端前沿模型的差距。 发现 2:量规校准 RL 在基准上落后于纯结果 RL,一个诚实的负结果。 量规版在 TB 2.1 只有 50.1(纯结果版 54.1);训练中量规版的程序化奖励长期停在 0.5–0.6,judge 分项从头到尾无上升趋势,两个奖励在训练分布上互相拉扯。论文不把它当作对量规奖励的终审判决(两者优化不同目标,而基准只考结果那一半),并给出两个疑因:λ=0.2 的加性形式让失败任务仍能拿正奖励、judge 看不到文件系统等设定均未调优;以及更本质的,Skill 写下的方法论可能本来就不是最大化基准通过率的分布。 发现 3:行为确实向 Skill 对齐,量规的价值所在。 200 个任务的成对偏好测试(judge 拿源 SKILL.md 当标准,比较匿名化的 base 与 RL 轨迹):纯结果 RL 已被偏好 54.5% vs 33.5%;量规版被偏好 73.0% vs 24.0%。这说明量规奖励买到的东西在结果基准上看不见,但对“怎么做事”影响实质,对网页开发、报告综合、开放研究这类难验证任务尤其重要。 发现 4:GLM-5.3 蒸馏 SFT 反而伤害 Qwen。 在 GLM-5.3 轨迹上做 SFT:27B 上 TB 2.1 掉到 45.8;4B 上直接崩塌(TB 18.7→3.4,出现思维/工具调用死循环)。归因:教师的 interleaved-thinking + 工具调用风格与学生自身 post-training 不兼容,模仿覆盖了学生依赖的行为模式却带不来教师的能力。与 TMax 报告的“SFT 混合数据劣化已后训练的 Qwen”互相印证。因此论文所有 RL 结果都从未修改的原始 checkpoint 出发。
显示更多
假如你是这两位学生的班主任,你觉得哪个更厉害?
西班牙大学 EDU 教育邮箱免费领!解锁全网学生优惠 西班牙国立远程大学(UNED)教育邮箱开放申请。成功申请后可获得 EDU 教育邮箱,可用于尝试认证各类学生优惠、教育折扣及学生专属福利,具体权益及是否通过认证,以各平台实际审核结果为准。 申请流程简单,邮箱秒下,后续可通过微软邮箱体系登录。 领取步骤 1、打开申请地址 2、按页面提示填写资料完成注册 3、邮箱秒速到手,通过微软邮箱登录即可使用 教育优惠汇总平台 羊毛速薅,等不是办法,干才有希望!
显示更多
0
15
600
111
转发到社区
刚看完中关村学院的何纪言老师带领 7 位博士生,用 3 个月时间从头训练出了 7B 模型,从预训练到中训练、后训练完全都是自己搞的,在 7B 尺寸模型中达到 SOTA 水平。 首先,虽然很多人在吹 RSI,但技术报告指出,现在模型的能力远未到全自主的程度,在模型架构设计、学习算法设计、数据清洗等方面仍然只能达到 L2 的辅助水平。我自己也有一样的感觉,不管 Astra 还是 Fable,都不能替代我的架构设计,我也得不断提醒自己不要外包思考。 其次,模型训练就是个会者不难、难者不会的问题,对会的人来说,用不了多少算力资源,但对不会的人来说,用再多的算力资源、堆再多的人,都是做不出来的。比如 MiMo V2.6 RL 只花了 300 多万美金,对基模公司来说很便宜了,整个 MiMo core team 只有几十位正式员工,更没有走蒸馏之类捷径。但烧了上亿美金、投入上千人的模型未必就能搞好。中关村学院一个老师加上 7 个学生只用 3 个月就完成造数据、预训练、中训练、后训练,是非常 impressive 的。 最后,数据是新的代码,数据质量就像代码质量一样非常重要。过去几年,我总是想用代码的方式实现 Agent 的自我进化,但很快就达到上限了。最近一年我才发现,这些我用代码方式做的东西更应该用训练数据的方式表达,训到模型里面。我们都知道脏代码的危害,脏数据其实也是一样的。中关村学院这个 7B 模型做了非常深入的数据工作,预训练数据清洗和课程学习,中训练按照上下文长度扩增,后训练利用开源和蒸馏来的 trace 建立指令遵循、长上下文等基础能力,进而构建长思维链推理、工具调用等高阶能力;在 RL 中不断移除已经高概率解决的问题,保持 GRPO学习效率。 技术报告:
显示更多
0
9
358
62
转发到社区
哈尔滨工程大学数学科学学院给予20名“翻墙”的学生警告处分的通报。提醒大学生,不要向任何不熟悉的人表示自己有在翻墙,更不要向其分享翻墙工具。
显示更多
女老师这瓜🍉可不小啊,你们吃了吗? 江苏扬州某县初中女老师感染了艾滋报复社会,感染了好多人,其中还有好多学生爸爸,最后受不了跳河了……
显示更多
0
148
183
8
转发到社区