注册并分享邀请链接,可获得视频播放与邀请奖励。

与「夹趾袜」相关的搜索结果

夹趾袜 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 夹趾袜 的内容
臭弟弟你把握不住的 是给你榨干咯 #足控# #恋足# #黑丝# #光脚# #夹趾袜#
0
30
1K
29
转发到社区
In Shijiazhuang, Hebei: Hot Ganglu sesame flatbread fresh out of the oven, filled with donkey meat — so delicious you can’t stop eating. 河北石家庄:刚出炉缸炉烧饼夹驴肉,香到停不下来。 #FoodTravel# #GangluSesameFlatbread#
显示更多
星舰提前回来啦,本来计划飞八个小时,这次飞三个小时就回来咯。问题不大,一切还是顺利。 任务基本完成,安全着落,下次可以尝试筷子夹星舰啦!
显示更多
NVIDIA 发布 Skill2Env:用“集体技能”强化智能体 NVIDIA 研究者们把社区公开的 Agent Skills 编译成可执行 RL 训练环境的数据流水线:3.4k 个 Skills 变成 8k 个带程序化测试和行为量规的终端任务;仅 300 步 RL 训练就让 Qwen3.8-27B 在 Terminal-Bench 2.1 上提升 4.7 个百分点,且模型行为显著向源 Skills 的方法论对齐。 开源项目: 核心洞察:公开 Agent Skills 是一个被忽视的监督来源 Agent Skills 是“教智能体做某件事”的文件夹:一个 SKILL.md 加上可选的脚本、参考资料和资产。论文指出,把公开 Skill 语料当作数据来读,它同时提供三样东西: · 任务分布的采样:人们真正想让智能体处理的任务分布(有人愿意花时间写下工作流,说明这活儿值得自动化); · 真实世界的锚点:指向真实的仓库、数据集、工具和工件; · 结果测试表达不了的质量标准:领域专长、默认参数、常见坑、“好结果长什么样”。 # 数据流水线:四阶段编译,验证靠构造 1. Plan(分解):容器化的 Codex 规划器读取完整 Skill 包、联网调研相关公共资产,把 Skill 拆解成若干可验证的 workflow,每个附带元计划(场景、初始世界、预埋缺陷、难点来源、解法草案、验证策略)、资产建议和“任务轴池”(任务原型 × 验证器模式 × 人物画像)。 2. Diversify(多样化):宿主从轴池采样一组组合,加上复杂度、指令语气、请求者专业水平。关键设计是轴池以 workflow 为条件:研究型 workflow 配“证据可追溯”验证和研究者画像,而不是从全轴乘积空间乱抽,这让多样化保持 sensible。 3. Create(构造):全新创建者 Codex agent 在 Docker 内工作,尽可能用真实素材(钉在特定 commit 的开源仓库、真实版本化文档、官方 API 规范);需要联网服务的场景改造成本地替身(stub 服务器、录制回放 fixture、PATH 上的假 CLI、种子数据库),求解时绝不依赖网络。创建顺序被严格固定:先建世界 → 写指令 → 写测试 → 写量规 → 最后才写参考解,测试先于解法冻结,保证解法必须迁就评分契约而非反过来。 4. Verify(验证):宿主端无模型参与的接收门:静态检查(布局、符号链接、Dockerfile 安全、基础镜像按内容摘要钉死)+ 两个容器内试跑:Oracle(参考解)必须全指标满分,NOP(什么都不做的 agent)必须全指标零分。任一失败即拒绝。 值得注意的一个反直觉选择:不做 teacher 模型预验证(不像部分工作用强模型试解、解不出就丢弃任务)。理由有二:这会把任务难度上限压到验证器能力,且成本翻倍;而 group-based RL 的在线动态过滤(rollout 无优势的 prompt 自动不产生梯度)天然淘汰过难/过易任务。 # 数据画像:广、贵、且忠实于源 规模与成本:7,971 个任务,用 GPT-5.6 Sol(xhigh 推理档)生成,API 花费超 9 万美元。(脚注:出于法律原因,公开发布的数据集改用 Kimi-K3-max 在同一流水线下生成。) 领域分布:13 个领域中,软件工程仅占 22.5%,AI/ML 10.5%,商业/金融/法律/HR 10.5%,营销 9.3%……论文对比了 TMax-15K、Terminal-Bench、DeepSWE 等,Skill2Env 是唯一全覆盖 13 域、且非技术知识工作占大头的语料。 忠实度探针(很聪明的设计):用任务指令+量规作查询、对 3.4k 个 SKILL.md 做 TF-IDF 检索,73.2% 的任务 top-1 命中真实源 Skill,94.6% 进 top-10(随机 0.03%)。单用量规也有 68.5% top-1,证明量规携带的是 Skill 专属方法论而非泛泛建议。 SFT 数据:用 GLM-5.3 对每个任务 rollout 两次,得到 15,968 条轨迹,平均奖励 0.74,中位轨迹 19 次模型调用 + 23 次工具调用。 S2EBench:考虑到公开基准饱和,从 SkillHub 另外生成、逐条人工审核(指令无歧义、忠实于源 Skill、测试公允)后的 79 任务私有 held-out 基准。 # RL 实验:基础设施 + 极简配方 基础设施(论文明确说“现代 agentic RL 首先是基础设施挑战”):Molt(PyTorch 原生全异步训练,Ray + vLLM + FSDP2)+ Polar(agent rollout 层:rootless Apptainer 沙箱、代理回传 token ID 和采样时 log-prob、prefix merging 把 harness 的多次补全缝合成训练轨迹)。 配方(刻意走“简单路线”):GRPO 组归一优势 + DPPO 的 binary-KL 信任域掩码(δ=0.05,超出阈值的 token 直接丢弃,无需参考模型,还能防训练-推理失配);G=8 rollouts/组,批 64,lr 1e-6 恒定,无 KL 惩罚、无熵奖励、无 SFT 热启动,每任务 65k 上下文。 量规校准奖励:开量规时,额外由 GPT-6 Astra 做 LLM-as-Judge(带“宪法”:惩罚无脑循环、reward hacking、答非所问;hacking 实证 = -5 分),总奖励 r = r_V + λs/5(λ=0.2),即 judge 最多把程序化奖励拉动 ±0.2。量规是校准可执行结果奖励,而非取代它,这是与“Rubrics as Rewards”一系的定位差异。 # 四项发现(论文最有信息量的部分) 发现 1:小规模 RL 即有跨域迁移。 仅 300 步、只用 2,400 任务子集训一个 epoch:S2EBench pass@1 +4.3(均分 +18.5),Terminal-Bench 2.1 +4.7(49.4→54.1)。训练集与 TB 无重叠(13-gram Jaccard < 0.8),且训练集从未针对 TB 调过,论文将其解读为规划、工具使用、收尾能力的通用提升而非任务族记忆。这让 27B 本地模型显著缩小了与云端前沿模型的差距。 发现 2:量规校准 RL 在基准上落后于纯结果 RL,一个诚实的负结果。 量规版在 TB 2.1 只有 50.1(纯结果版 54.1);训练中量规版的程序化奖励长期停在 0.5–0.6,judge 分项从头到尾无上升趋势,两个奖励在训练分布上互相拉扯。论文不把它当作对量规奖励的终审判决(两者优化不同目标,而基准只考结果那一半),并给出两个疑因:λ=0.2 的加性形式让失败任务仍能拿正奖励、judge 看不到文件系统等设定均未调优;以及更本质的,Skill 写下的方法论可能本来就不是最大化基准通过率的分布。 发现 3:行为确实向 Skill 对齐,量规的价值所在。 200 个任务的成对偏好测试(judge 拿源 SKILL.md 当标准,比较匿名化的 base 与 RL 轨迹):纯结果 RL 已被偏好 54.5% vs 33.5%;量规版被偏好 73.0% vs 24.0%。这说明量规奖励买到的东西在结果基准上看不见,但对“怎么做事”影响实质,对网页开发、报告综合、开放研究这类难验证任务尤其重要。 发现 4:GLM-5.3 蒸馏 SFT 反而伤害 Qwen。 在 GLM-5.3 轨迹上做 SFT:27B 上 TB 2.1 掉到 45.8;4B 上直接崩塌(TB 18.7→3.4,出现思维/工具调用死循环)。归因:教师的 interleaved-thinking + 工具调用风格与学生自身 post-training 不兼容,模仿覆盖了学生依赖的行为模式却带不来教师的能力。与 TMax 报告的“SFT 混合数据劣化已后训练的 Qwen”互相印证。因此论文所有 RL 结果都从未修改的原始 checkpoint 出发。
显示更多
陈一发儿,女版孙大午?以为去了美国,就是刷盘子的。发姐是新上海人,讲话夹着几个英文,感觉洋气?给发姐科普一下,美国很多工作不查身份。需求最旺的蓝领,以日薪计算,取中位数:1)屋顶工(Roofing)300美元;2)干壁/石膏板安装(Drywall)300美元;3)瓷砖与地板铺设(Tile/Flooring)400美元;4)油漆工(Painters)200美元;5)园艺与树木修剪(Landscaping)300美元… 到了美国,拿不到身份的,属于极少数,移民细节不科普。对于无身份的蓝领来说,收入从挣辛苦钱,跨越到高薪,关键在于掌握核心技术,如精密瓷砖、高压电排线辅助、喷漆、复杂木工,脱离单纯卖体力的阶段。再给科普一下,从1950年代初深港封锁至1980年代初,内地发生了数次大规模的“逃港潮”(如1957年、1962年、1979年前后)。这30年间通过陆路或海路偷渡进入香港的总人数大约200万人。
显示更多
0
36
162
4
转发到社区
Codex 更新了,界面导航大改。左边新加了一个导航栏,把插件、定时任务、站点、项目、地图,还有 PR 都放到左侧导航上了。 新增了资源库和图像两个页面。 资源库里包含你所有的图像、图片、文件夹和收藏,你创作的所有文档以及 AI 创作的图像文档也都保存在这里。 图片那边的话,就是 ChatGPT 原来的图片页面里,有一些用 GPT-Image 模型的一些模板和提示词 其实这样改更好了。 不然之前全放在顶部,随着项目和聊天越来越多,每次找顶部那几个入口都得往回滚,挺烦的。 而且这次藏师傅的 CodePilot 领先 Codex 一个版本,几个月前就添加了资源库,把你所有由 AI 生成的内容结果汇总到一个页面,比如图像、视频、网页、音频这些素材。 你还可以从资源库的结果直接跳回聊天里看具体是怎么做的,非常方便管理,也方便让其他模型调用、复用这些素材。 不过也有很多人觉得不方便,说看着不习惯,这种大改肯定会有这种情况
显示更多
一个人做产品,写代码之余还要做推广、做 SEO、回客户邮件、跟进潜在客户,一天被杂事切得稀碎。 ai-employees 把 8 个业务岗位做成了开源的「AI 员工」,每个员工就是一个文件夹,里面装着按时间自动跑的例行任务,一共 60 个。 岗位覆盖增长、SEO、网站维护、社媒、广告投放、销售和客服,每天早上各交一份简报,只有需要我们拍板时才推送到手机。 我比较喜欢第 8 个「幕僚长」的设定,它专门翻其他员工的运行记录,找出哪项活悄悄停了,再给出三条建议。 GitHub: 全部跑在自己电脑上,用已登录的浏览器像人一样操作,网页改版了会自己改指令。Claude Code 之外还支持另外 10 种 Agent 工具。 发消息、发帖、花钱这类动作默认只起草好,最后一下留给我们点,也不会自己注册账号、输密码。 作者从 8 月底开始每个工作日都拿它跑自己的生意,用 Claude Max 订阅实测,增长岗的定时任务约占整机调用量的 6%。
显示更多
0
33
15
4
转发到社区
继115网盘暴雷后,123云盘调整存储规则,自传空间仅剩1TB。不管用户此前购买了多少 TB 的云盘容量,如今真正能够用于自己上传文件、手机照片备份和文件夹自动备份的空间,都只有这1TB「专业空间」 原有的大容量空间则主要只能用于转存他人文件,相当于把“自己上传”和“转存”彻底拆成了两套容量。更离谱的是,转存他人或被他人转存的单个文件还要求小于 10 GB。对于动辄几十 GB 甚至上百 GB 的原盘 4K 视频来说,这一限制直接影响转存和分享 此前购买再多容量,如今自己能上传的仍只有1TB,换句话说123云盘都是活动卖完就砍权益的。之前网页下载限1G大小,月流量限10G,后面又强制登录。现在网页登录也没了,必须用客户端下载,那App从打开到下载文件要关6、7个广告,别人分享的文件转存到App,又弹一遍会员开通窗口
显示更多
我以前把怀孕的蟑螂放进逼里,使劲一夹给夹爆,然后一堆小蟑螂就从逼里钻出来,有一种当妈妈的感觉。我一般用风油精,往里面灌点,蟑螂什么的就出来了,完事拿酒精擦擦消个毒。没事的,毕竟都定期来姨妈的,脏东西都排过去了。摸完风油精的逼逼塞进来刚开始凉凉的,后来火辣辣的,冰火两重天操起来很刺激,用过的都说好。我好想纹身在阴唇褶皱里,翻出来当社会人,翻进去考公。顺便给阴唇做个美容,把边边割下来做麻辣扇贝边,然后高价卖给公狗。
显示更多
0
4.7K
79.2K
7.6K
转发到社区
经常做波段的人,可以试试这个指标。 它叫 Zig Zag,看盘时小涨小跌太多,它能按你设定的幅度过滤波动。 把主要高低点连成折线,方便看清每一轮上涨和回撤,这次低点有没有抬高,前一个高点有没有被突破。 比如一段上涨行情,中间经常夹着几根下跌的 K 线。 加上 Zig Zag 后,较小的波动会被略过,较大的上涨和回撤则用折线连接起来。 沿着折线看,就更容易比较前后两轮走势,高点是否越来越高,回撤有没有跌破上一个低点。 它有两个值得调整的参数。 第一个是 Price Deviation for Reversals,反转幅度阈值,默认是 5%。它控制价格反向变动多大,才达到识别新一段波动的幅度要求。调高数值,会过滤更多小波动,调低数值,就能保留更细的转折。 同一张图上,如果只想看较大的波段,可以把这个值调高一些。 如果觉得折线省略了太多细节,就调低一点。 不同品种的波动幅度不同,切换品种或周期后,可以重新调整。 第二个是 Pivot Legs,转折点确认所用的 K 线数量。 数值越大,通常留下的转折点越少,数值越小,就会识别更多局部高低点。它和幅度阈值一起,决定了折线有多细。 刚开始可以先在常看的周期上保留默认设置,每次只改一个参数,观察哪些转折被留下,哪些被过滤。 比如先在 4 小时图上梳理几轮较大的上涨和回撤,再切到 1 小时图看局部变化。 图上的转折价格等标签也能单独关闭。 如果主要想看高低点的排列,可以减少标签,只留下折线和 K 线,画面会更清楚。
显示更多