注册并分享邀请链接,可获得视频播放与邀请奖励。

与「学生」相关的搜索结果

学生 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 学生 的内容
朋友是高中教师兼班主任,说为了避免班里学生早恋,特意开了两次班会,让学生们以男女平权为题进行辩论。 效果显著,见识过女同学打拳的样子,班里都男同学基本都意识到了现阶段自己到底该干什么😁
显示更多
天塌了 在昆明被高三学生凿了 我现在懵懵的 #昆明#
0
49
203
11
转发到社区
20岁,我成了A10 大佬唯一弟子,入职不到两月分成10W+,自己也谈过几单下来10W+的律所培训合作。 虽然看似小有成就,但这是我踩了无数坑、拼了命抓住每一次机会汇聚成的结果。 大一的时候,我还是一个很传统的八爪鱼法学生,竞赛科研绩点一起抓,用一年半时间拿了3个国奖、15个省奖。 后来,学校保研政策突然变了🥲,我才觉醒之前玩的都是过家家游戏,逐渐把重心转移到真实社会。 AI、法律实务、自媒体、创业……我都做,而且我发现,来到新的游戏规则,我还是挺会玩! 之前的一次跨国研学,本是再普通不过的纯旅游活动,但晚上的慈善晚宴,我跑去和各行业大佬social,硬生生碰出了意想不到的机会——有幸参与到联合国环境规划署在新加坡的项目。 后来去深圳某红圈所实习,发现自己是纯牛马😅😅😅前途没有希望,于是用 ChatGPT搜索在深圳本地举办的法律界商务活动。 有个活动相当牛逼,参会的老板都交了6万会员费,但我又肯定没有那个实力🥺。。。 所以我想了个歪招🤪,去找到了活动主理人的社媒,私信问能不能去兼职帮忙办活动。 就是在那里,我遇到了现在的老板。他应该是觉得这活动太无聊,就和我聊了起来。 刚好聊到 AI 这块,他非常感兴趣,又知道我过去的法律背景,最后就直接邀请我去上海跟着他干。 更疯狂的是,当天凌晨他发出的邀请,我第二天毫不犹豫,就直接跟我老板从深圳飞去了上海。 我当时的想法很简单:这个机会可能会把我带到一个更大的世界,那我就去,莽就完了!👊🏼 这一次,我赌对了,我成了他目前唯一正式带的徒弟。 很多朋友说我很会向上社交,我以前也这么觉得,后来发现不完全是。 诚然,我确实慕强,但不太怯。碰到比我厉害很多的人,我不会急着证明其实我也很厉害,毕竟我是真草台。 我更想知道:你为什么这么厉害?你是怎么做到的?这里面有什么是我可以学走的? 社交只是入口,从里面收获,擅于从里面收获,才是核心能力。 我现在20岁,X上比我会赚钱、会AI、会做产品、会创业的佬太多了。我现在做出的这些东西,放进更大的世界里,都还很渺小。 但这不妨碍我对自己有一种近乎固执的自信:我会迅速地成长。也能在较短时间找到自己在X里的生态位。 接下来我也会在X上持续分享AI、自媒体、金融、投资、法律等领域的实战知识👇 1、在处理社交类问题颇有心得,比如结交贵人(年长/同龄/年下)、家庭关系处理等。 2、我目前深耕于伪投资、伪金融领域,如各位有被诓骗/要开脱的需求,欢迎咨询(限国内和新加坡),我的案例经验绝对是少见的丰富。 3、我是个大E人,所以在销售方面也比较有经验,之前在法律AI领域也成交过好几个大项目,接下来也会继续培养此技能。 欢迎大家来和我交朋友~
显示更多
0
41
47
3
转发到社区
NVIDIA 发布 Skill2Env:用“集体技能”强化智能体 NVIDIA 研究者们把社区公开的 Agent Skills 编译成可执行 RL 训练环境的数据流水线:3.4k 个 Skills 变成 8k 个带程序化测试和行为量规的终端任务;仅 300 步 RL 训练就让 Qwen3.8-27B 在 Terminal-Bench 2.1 上提升 4.7 个百分点,且模型行为显著向源 Skills 的方法论对齐。 开源项目: 核心洞察:公开 Agent Skills 是一个被忽视的监督来源 Agent Skills 是“教智能体做某件事”的文件夹:一个 SKILL.md 加上可选的脚本、参考资料和资产。论文指出,把公开 Skill 语料当作数据来读,它同时提供三样东西: · 任务分布的采样:人们真正想让智能体处理的任务分布(有人愿意花时间写下工作流,说明这活儿值得自动化); · 真实世界的锚点:指向真实的仓库、数据集、工具和工件; · 结果测试表达不了的质量标准:领域专长、默认参数、常见坑、“好结果长什么样”。 # 数据流水线:四阶段编译,验证靠构造 1. Plan(分解):容器化的 Codex 规划器读取完整 Skill 包、联网调研相关公共资产,把 Skill 拆解成若干可验证的 workflow,每个附带元计划(场景、初始世界、预埋缺陷、难点来源、解法草案、验证策略)、资产建议和“任务轴池”(任务原型 × 验证器模式 × 人物画像)。 2. Diversify(多样化):宿主从轴池采样一组组合,加上复杂度、指令语气、请求者专业水平。关键设计是轴池以 workflow 为条件:研究型 workflow 配“证据可追溯”验证和研究者画像,而不是从全轴乘积空间乱抽,这让多样化保持 sensible。 3. Create(构造):全新创建者 Codex agent 在 Docker 内工作,尽可能用真实素材(钉在特定 commit 的开源仓库、真实版本化文档、官方 API 规范);需要联网服务的场景改造成本地替身(stub 服务器、录制回放 fixture、PATH 上的假 CLI、种子数据库),求解时绝不依赖网络。创建顺序被严格固定:先建世界 → 写指令 → 写测试 → 写量规 → 最后才写参考解,测试先于解法冻结,保证解法必须迁就评分契约而非反过来。 4. Verify(验证):宿主端无模型参与的接收门:静态检查(布局、符号链接、Dockerfile 安全、基础镜像按内容摘要钉死)+ 两个容器内试跑:Oracle(参考解)必须全指标满分,NOP(什么都不做的 agent)必须全指标零分。任一失败即拒绝。 值得注意的一个反直觉选择:不做 teacher 模型预验证(不像部分工作用强模型试解、解不出就丢弃任务)。理由有二:这会把任务难度上限压到验证器能力,且成本翻倍;而 group-based RL 的在线动态过滤(rollout 无优势的 prompt 自动不产生梯度)天然淘汰过难/过易任务。 # 数据画像:广、贵、且忠实于源 规模与成本:7,971 个任务,用 GPT-5.6 Sol(xhigh 推理档)生成,API 花费超 9 万美元。(脚注:出于法律原因,公开发布的数据集改用 Kimi-K3-max 在同一流水线下生成。) 领域分布:13 个领域中,软件工程仅占 22.5%,AI/ML 10.5%,商业/金融/法律/HR 10.5%,营销 9.3%……论文对比了 TMax-15K、Terminal-Bench、DeepSWE 等,Skill2Env 是唯一全覆盖 13 域、且非技术知识工作占大头的语料。 忠实度探针(很聪明的设计):用任务指令+量规作查询、对 3.4k 个 SKILL.md 做 TF-IDF 检索,73.2% 的任务 top-1 命中真实源 Skill,94.6% 进 top-10(随机 0.03%)。单用量规也有 68.5% top-1,证明量规携带的是 Skill 专属方法论而非泛泛建议。 SFT 数据:用 GLM-5.3 对每个任务 rollout 两次,得到 15,968 条轨迹,平均奖励 0.74,中位轨迹 19 次模型调用 + 23 次工具调用。 S2EBench:考虑到公开基准饱和,从 SkillHub 另外生成、逐条人工审核(指令无歧义、忠实于源 Skill、测试公允)后的 79 任务私有 held-out 基准。 # RL 实验:基础设施 + 极简配方 基础设施(论文明确说“现代 agentic RL 首先是基础设施挑战”):Molt(PyTorch 原生全异步训练,Ray + vLLM + FSDP2)+ Polar(agent rollout 层:rootless Apptainer 沙箱、代理回传 token ID 和采样时 log-prob、prefix merging 把 harness 的多次补全缝合成训练轨迹)。 配方(刻意走“简单路线”):GRPO 组归一优势 + DPPO 的 binary-KL 信任域掩码(δ=0.05,超出阈值的 token 直接丢弃,无需参考模型,还能防训练-推理失配);G=8 rollouts/组,批 64,lr 1e-6 恒定,无 KL 惩罚、无熵奖励、无 SFT 热启动,每任务 65k 上下文。 量规校准奖励:开量规时,额外由 GPT-6 Astra 做 LLM-as-Judge(带“宪法”:惩罚无脑循环、reward hacking、答非所问;hacking 实证 = -5 分),总奖励 r = r_V + λs/5(λ=0.2),即 judge 最多把程序化奖励拉动 ±0.2。量规是校准可执行结果奖励,而非取代它,这是与“Rubrics as Rewards”一系的定位差异。 # 四项发现(论文最有信息量的部分) 发现 1:小规模 RL 即有跨域迁移。 仅 300 步、只用 2,400 任务子集训一个 epoch:S2EBench pass@1 +4.3(均分 +18.5),Terminal-Bench 2.1 +4.7(49.4→54.1)。训练集与 TB 无重叠(13-gram Jaccard < 0.8),且训练集从未针对 TB 调过,论文将其解读为规划、工具使用、收尾能力的通用提升而非任务族记忆。这让 27B 本地模型显著缩小了与云端前沿模型的差距。 发现 2:量规校准 RL 在基准上落后于纯结果 RL,一个诚实的负结果。 量规版在 TB 2.1 只有 50.1(纯结果版 54.1);训练中量规版的程序化奖励长期停在 0.5–0.6,judge 分项从头到尾无上升趋势,两个奖励在训练分布上互相拉扯。论文不把它当作对量规奖励的终审判决(两者优化不同目标,而基准只考结果那一半),并给出两个疑因:λ=0.2 的加性形式让失败任务仍能拿正奖励、judge 看不到文件系统等设定均未调优;以及更本质的,Skill 写下的方法论可能本来就不是最大化基准通过率的分布。 发现 3:行为确实向 Skill 对齐,量规的价值所在。 200 个任务的成对偏好测试(judge 拿源 SKILL.md 当标准,比较匿名化的 base 与 RL 轨迹):纯结果 RL 已被偏好 54.5% vs 33.5%;量规版被偏好 73.0% vs 24.0%。这说明量规奖励买到的东西在结果基准上看不见,但对“怎么做事”影响实质,对网页开发、报告综合、开放研究这类难验证任务尤其重要。 发现 4:GLM-5.3 蒸馏 SFT 反而伤害 Qwen。 在 GLM-5.3 轨迹上做 SFT:27B 上 TB 2.1 掉到 45.8;4B 上直接崩塌(TB 18.7→3.4,出现思维/工具调用死循环)。归因:教师的 interleaved-thinking + 工具调用风格与学生自身 post-training 不兼容,模仿覆盖了学生依赖的行为模式却带不来教师的能力。与 TMax 报告的“SFT 混合数据劣化已后训练的 Qwen”互相印证。因此论文所有 RL 结果都从未修改的原始 checkpoint 出发。
显示更多
假如你是这两位学生的班主任,你觉得哪个更厉害?
西班牙大学 EDU 教育邮箱免费领!解锁全网学生优惠 西班牙国立远程大学(UNED)教育邮箱开放申请。成功申请后可获得 EDU 教育邮箱,可用于尝试认证各类学生优惠、教育折扣及学生专属福利,具体权益及是否通过认证,以各平台实际审核结果为准。 申请流程简单,邮箱秒下,后续可通过微软邮箱体系登录。 领取步骤 1、打开申请地址 2、按页面提示填写资料完成注册 3、邮箱秒速到手,通过微软邮箱登录即可使用 教育优惠汇总平台 羊毛速薅,等不是办法,干才有希望!
显示更多
0
15
600
111
转发到社区
刚看完中关村学院的何纪言老师带领 7 位博士生,用 3 个月时间从头训练出了 7B 模型,从预训练到中训练、后训练完全都是自己搞的,在 7B 尺寸模型中达到 SOTA 水平。 首先,虽然很多人在吹 RSI,但技术报告指出,现在模型的能力远未到全自主的程度,在模型架构设计、学习算法设计、数据清洗等方面仍然只能达到 L2 的辅助水平。我自己也有一样的感觉,不管 Astra 还是 Fable,都不能替代我的架构设计,我也得不断提醒自己不要外包思考。 其次,模型训练就是个会者不难、难者不会的问题,对会的人来说,用不了多少算力资源,但对不会的人来说,用再多的算力资源、堆再多的人,都是做不出来的。比如 MiMo V2.6 RL 只花了 300 多万美金,对基模公司来说很便宜了,整个 MiMo core team 只有几十位正式员工,更没有走蒸馏之类捷径。但烧了上亿美金、投入上千人的模型未必就能搞好。中关村学院一个老师加上 7 个学生只用 3 个月就完成造数据、预训练、中训练、后训练,是非常 impressive 的。 最后,数据是新的代码,数据质量就像代码质量一样非常重要。过去几年,我总是想用代码的方式实现 Agent 的自我进化,但很快就达到上限了。最近一年我才发现,这些我用代码方式做的东西更应该用训练数据的方式表达,训到模型里面。我们都知道脏代码的危害,脏数据其实也是一样的。中关村学院这个 7B 模型做了非常深入的数据工作,预训练数据清洗和课程学习,中训练按照上下文长度扩增,后训练利用开源和蒸馏来的 trace 建立指令遵循、长上下文等基础能力,进而构建长思维链推理、工具调用等高阶能力;在 RL 中不断移除已经高概率解决的问题,保持 GRPO学习效率。 技术报告:
显示更多
0
9
358
62
转发到社区
哈尔滨工程大学数学科学学院给予20名“翻墙”的学生警告处分的通报。提醒大学生,不要向任何不熟悉的人表示自己有在翻墙,更不要向其分享翻墙工具。
显示更多
女老师这瓜🍉可不小啊,你们吃了吗? 江苏扬州某县初中女老师感染了艾滋报复社会,感染了好多人,其中还有好多学生爸爸,最后受不了跳河了……
显示更多
0
148
183
8
转发到社区
一个人穷的时候最应该做什么事? 背叛底层人。 隔绝一切垃圾信息,拒绝输入,专心搞钱,与底层彻底决裂。 最近两年开始,几乎所有的新闻,我都不关注了。比如前几年的南方小土豆、哪吒电影票房、中美各种加息政策…… 因为我慢慢发现,绝大多数新闻跟普通人的真实生活没有多大关系,但特别擅长调动人的情绪。 今天把一个人捧上神坛,明天又把他踩进泥里;今天全民感动,明天剧情反转。你跟着愤怒,跟着感动,跟着争论半天,最后除了贡献几个小时的注意力,什么都没得到。 所以,我干脆不关注了。 当我看见一个宣传 DeepSeek 有多牛逼的视频,弹幕全是“赢了”“赢麻了”,我有时候会觉得很好笑。屏幕前大声欢呼的大学生,可能几个月后毕业连工作都找不到,但此刻却可以为了一个跟自己现实生活几乎没有关系的话题涕泗横流、义愤填膺。 媒体人只需要几个字,就能让你哭,让你笑,让你愤怒,让你站队。身体是你的,但情绪的遥控器在别人手里。 更讽刺的是,你的每一次愤怒、点赞和评论,最后都变成了别人的流量。自媒体靠你的注意力接广告、接商单,赚得盆满钵满,而你刷完两个小时手机,关掉屏幕,明天照样上班。 这个世界上 99.99% 的消息,其实你根本没必要知道。它不会增加你的收入,不会改善你的生活,不会提高你的能力,甚至连三个月以后你都不会记得。但它特别擅长制造情绪波动。 你打开短视频,第一个视频是一个伟大的科学家,为国家做了巨大贡献,坐了几十年冷板凳,生活极其节俭。配上激情澎湃的音乐,你看得眼眶发红,肃然起敬。手指往下一划,下一条是搞笑视频,你马上笑得前仰后合。再往下刷,可能又是一条社会新闻,你瞬间开始愤怒。 不到 5 分钟,悲伤、感动、快乐、愤怒全部经历了一遍。 仔细想想,这其实挺可怕的。你的情绪被算法拿捏得极其精准,让你哭就哭,让你笑就笑,让你愤怒就愤怒。我们以为自己在主动获取信息,很多时候其实只是被动接受别人安排好的情绪刺激。 短视频和垃圾讯息,某种程度上就是打工人的牢笼。 996 下班回到家,体力和精力已经被榨得差不多了,这时候人最容易沉迷于完全不需要动脑的内容。因为你已经没有精力读书、学习、思考,更别说规划未来。刷短视频是最廉价的快乐:不需要付钱,不需要努力,只需要手指不停往下滑。 问题是,一个人长期处于这种状态,会逐渐失去创造力,也失去深度思考的能力。他没有精力关注三年、五年之后的事情,更没有力气跳出现在的生活,去寻找其他可能性。 更可怕的是消费主义。 好不容易攒下来一点钱,今天告诉你最新款 iPhone 必须换,明天告诉你什么包、什么鞋、什么车才能代表生活品质。你以为自己是在奖励辛苦工作的自己,最后却把本来可以用于提升自己、投资自己、积累本金的钱重新送回市场。 互联网从来没有真正免费的东西。 所谓免费内容,很多时候只是换了一种收费方式:不收你的钱,收你的时间;不直接卖东西给你,就卖你的注意力。 而生命最重要的东西,本来就是时间。 如果你的时间不值钱,你当然可以自己慢慢练级;如果你的时间开始值钱,你就会发现很多事情花钱解决反而更便宜。能花 100 块钱解决的问题,就没必要耗三个小时;能通过专业人士半小时解决的问题,也没必要自己摸索一个星期。 所以想快速成长,无非两件事:花对钱,跟对人。 有时候,一个真正比你高几个层级的人,几句话就能指出你几年都没意识到的问题。他经历过你正在经历的阶段,踩过你准备踩的坑,所以一句话可能真的能让你少走很多弯路。 但很多人还有一种学生思维:希望所有东西都是免费的。 免费的知识,免费的资源,免费的建议,最好大佬还愿意花两个小时给自己分析人生。 问题是,一个人的时间越值钱,他越不会免费把时间分给陌生人。你想获得别人的时间,就要提供价值。这个价值可能是钱,可能是资源,可能是能力,也可能是你能帮别人解决的问题。 没有所谓凭空出现的贵人。 所谓贵人,本质上也是价值交换。 如果现在什么都没有怎么办?那就更简单:减少垃圾输入,把时间拿回来,提升自己,先赚钱。 普通人最应该关心的事情,从来不是今天网上又发生了什么,而是自己的收入有没有提高,能力有没有增长,身体有没有变好,家人的生活有没有改善,账户里的本金有没有增加。 很多人自己的生活一地鸡毛,却每天操心国际局势;工资几千块,却在网上讨论几千亿美元的博弈;现实里连老板都不敢反驳一句,到了评论区却开始指点世界。 宏大叙事最容易给普通人提供一种廉价的参与感。 因为改变自己的生活很难,评论世界很容易。 赚钱很难,骂人很容易。 学习很难,刷视频很容易。 健身很难,讨论别人为什么失败很容易。 所以真正想往上走的人,迟早要经历一个非常痛苦的过程:你必须主动背叛过去那个自己熟悉的环境。 这里说的“背叛”,不是让你看不起穷人,也不是让你抛弃家人朋友,而是背叛过去那套让你一直停留在原地的生活方式。 以前大家一起刷视频,你开始学习;以前大家发工资就消费,你开始存钱;以前大家讨论八卦,你开始研究怎么提高收入;以前大家觉得下班就应该彻底躺平,你开始把晚上的两个小时拿出来做自己的事情。 这个过程一定会不舒服。 因为原来大家都是毛毛虫。 突然有一只毛毛虫开始结蛹,旁边的人第一反应往往不是祝福,而是奇怪:你折腾什么?大家不都这样活吗? 等你真的开始发生变化,关系也会跟着变化。以前聊得来的东西,你慢慢不感兴趣了;以前觉得很重要的事情,你开始觉得无所谓;以前每天混在一起的人,也可能逐渐没有共同语言。 向上的路有时候确实很孤独。 但一个人真正的成长,本来就意味着不断离开旧的自己。 背叛那些浪费你时间的信息,背叛那些掏空你钱包的消费习惯,背叛那些让你获得廉价满足感的东西,也背叛那个明明对现状不满意,却什么都不愿意改变的自己。 很多人以为贫穷变富最难的是赚到第一桶金。 其实第一道坎往往更早。 你得先允许自己和过去的生活彻底决裂。
显示更多
0
54
428
66
转发到社区