注册并分享邀请链接,可获得视频播放与邀请奖励。

与「V門」相关的搜索结果

V門 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 V門 的内容
🎶ニコニコ超会議2日目🎶 VTuber事業部ブース(第2ホールA22) にてクリアファイル配ってます🖤 昨日と同じく撮影対応可能です📸📱 ぜひ遊びに来てね〜! #パレデミア学園# #V門#
显示更多
0
9
425
41
转发到社区
🎶ニコニコ超会議1日目🎶 VTuber事業部ブース(第2ホールA22) でクリアファイル配ってます🤍 撮影対応も可能です📸✨️ 遊び来てね〜! #パレデミア学園# #V門#
显示更多
0
18
542
61
转发到社区
📢 4/26(土)27(日)#ニコニコ超会議2025# 初出展の VTuber事業部ブース(第2ホールA22)さんにて、 コスプレイヤーとして参加します✨️ #パレデミア学園# のVTuberイメージのコスプレでいるよ💗 クリアファイル配るので遊びきてね💭 どの寮のコスプレかは当日をお楽しみに🤫 #V門#
显示更多
0
10
743
84
转发到社区
NVIDIA 发布 Skill2Env:用“集体技能”强化智能体 NVIDIA 研究者们把社区公开的 Agent Skills 编译成可执行 RL 训练环境的数据流水线:3.4k 个 Skills 变成 8k 个带程序化测试和行为量规的终端任务;仅 300 步 RL 训练就让 Qwen3.8-27B 在 Terminal-Bench 2.1 上提升 4.7 个百分点,且模型行为显著向源 Skills 的方法论对齐。 开源项目: 核心洞察:公开 Agent Skills 是一个被忽视的监督来源 Agent Skills 是“教智能体做某件事”的文件夹:一个 SKILL.md 加上可选的脚本、参考资料和资产。论文指出,把公开 Skill 语料当作数据来读,它同时提供三样东西: · 任务分布的采样:人们真正想让智能体处理的任务分布(有人愿意花时间写下工作流,说明这活儿值得自动化); · 真实世界的锚点:指向真实的仓库、数据集、工具和工件; · 结果测试表达不了的质量标准:领域专长、默认参数、常见坑、“好结果长什么样”。 # 数据流水线:四阶段编译,验证靠构造 1. Plan(分解):容器化的 Codex 规划器读取完整 Skill 包、联网调研相关公共资产,把 Skill 拆解成若干可验证的 workflow,每个附带元计划(场景、初始世界、预埋缺陷、难点来源、解法草案、验证策略)、资产建议和“任务轴池”(任务原型 × 验证器模式 × 人物画像)。 2. Diversify(多样化):宿主从轴池采样一组组合,加上复杂度、指令语气、请求者专业水平。关键设计是轴池以 workflow 为条件:研究型 workflow 配“证据可追溯”验证和研究者画像,而不是从全轴乘积空间乱抽,这让多样化保持 sensible。 3. Create(构造):全新创建者 Codex agent 在 Docker 内工作,尽可能用真实素材(钉在特定 commit 的开源仓库、真实版本化文档、官方 API 规范);需要联网服务的场景改造成本地替身(stub 服务器、录制回放 fixture、PATH 上的假 CLI、种子数据库),求解时绝不依赖网络。创建顺序被严格固定:先建世界 → 写指令 → 写测试 → 写量规 → 最后才写参考解,测试先于解法冻结,保证解法必须迁就评分契约而非反过来。 4. Verify(验证):宿主端无模型参与的接收门:静态检查(布局、符号链接、Dockerfile 安全、基础镜像按内容摘要钉死)+ 两个容器内试跑:Oracle(参考解)必须全指标满分,NOP(什么都不做的 agent)必须全指标零分。任一失败即拒绝。 值得注意的一个反直觉选择:不做 teacher 模型预验证(不像部分工作用强模型试解、解不出就丢弃任务)。理由有二:这会把任务难度上限压到验证器能力,且成本翻倍;而 group-based RL 的在线动态过滤(rollout 无优势的 prompt 自动不产生梯度)天然淘汰过难/过易任务。 # 数据画像:广、贵、且忠实于源 规模与成本:7,971 个任务,用 GPT-5.6 Sol(xhigh 推理档)生成,API 花费超 9 万美元。(脚注:出于法律原因,公开发布的数据集改用 Kimi-K3-max 在同一流水线下生成。) 领域分布:13 个领域中,软件工程仅占 22.5%,AI/ML 10.5%,商业/金融/法律/HR 10.5%,营销 9.3%……论文对比了 TMax-15K、Terminal-Bench、DeepSWE 等,Skill2Env 是唯一全覆盖 13 域、且非技术知识工作占大头的语料。 忠实度探针(很聪明的设计):用任务指令+量规作查询、对 3.4k 个 SKILL.md 做 TF-IDF 检索,73.2% 的任务 top-1 命中真实源 Skill,94.6% 进 top-10(随机 0.03%)。单用量规也有 68.5% top-1,证明量规携带的是 Skill 专属方法论而非泛泛建议。 SFT 数据:用 GLM-5.3 对每个任务 rollout 两次,得到 15,968 条轨迹,平均奖励 0.74,中位轨迹 19 次模型调用 + 23 次工具调用。 S2EBench:考虑到公开基准饱和,从 SkillHub 另外生成、逐条人工审核(指令无歧义、忠实于源 Skill、测试公允)后的 79 任务私有 held-out 基准。 # RL 实验:基础设施 + 极简配方 基础设施(论文明确说“现代 agentic RL 首先是基础设施挑战”):Molt(PyTorch 原生全异步训练,Ray + vLLM + FSDP2)+ Polar(agent rollout 层:rootless Apptainer 沙箱、代理回传 token ID 和采样时 log-prob、prefix merging 把 harness 的多次补全缝合成训练轨迹)。 配方(刻意走“简单路线”):GRPO 组归一优势 + DPPO 的 binary-KL 信任域掩码(δ=0.05,超出阈值的 token 直接丢弃,无需参考模型,还能防训练-推理失配);G=8 rollouts/组,批 64,lr 1e-6 恒定,无 KL 惩罚、无熵奖励、无 SFT 热启动,每任务 65k 上下文。 量规校准奖励:开量规时,额外由 GPT-6 Astra 做 LLM-as-Judge(带“宪法”:惩罚无脑循环、reward hacking、答非所问;hacking 实证 = -5 分),总奖励 r = r_V + λs/5(λ=0.2),即 judge 最多把程序化奖励拉动 ±0.2。量规是校准可执行结果奖励,而非取代它,这是与“Rubrics as Rewards”一系的定位差异。 # 四项发现(论文最有信息量的部分) 发现 1:小规模 RL 即有跨域迁移。 仅 300 步、只用 2,400 任务子集训一个 epoch:S2EBench pass@1 +4.3(均分 +18.5),Terminal-Bench 2.1 +4.7(49.4→54.1)。训练集与 TB 无重叠(13-gram Jaccard < 0.8),且训练集从未针对 TB 调过,论文将其解读为规划、工具使用、收尾能力的通用提升而非任务族记忆。这让 27B 本地模型显著缩小了与云端前沿模型的差距。 发现 2:量规校准 RL 在基准上落后于纯结果 RL,一个诚实的负结果。 量规版在 TB 2.1 只有 50.1(纯结果版 54.1);训练中量规版的程序化奖励长期停在 0.5–0.6,judge 分项从头到尾无上升趋势,两个奖励在训练分布上互相拉扯。论文不把它当作对量规奖励的终审判决(两者优化不同目标,而基准只考结果那一半),并给出两个疑因:λ=0.2 的加性形式让失败任务仍能拿正奖励、judge 看不到文件系统等设定均未调优;以及更本质的,Skill 写下的方法论可能本来就不是最大化基准通过率的分布。 发现 3:行为确实向 Skill 对齐,量规的价值所在。 200 个任务的成对偏好测试(judge 拿源 SKILL.md 当标准,比较匿名化的 base 与 RL 轨迹):纯结果 RL 已被偏好 54.5% vs 33.5%;量规版被偏好 73.0% vs 24.0%。这说明量规奖励买到的东西在结果基准上看不见,但对“怎么做事”影响实质,对网页开发、报告综合、开放研究这类难验证任务尤其重要。 发现 4:GLM-5.3 蒸馏 SFT 反而伤害 Qwen。 在 GLM-5.3 轨迹上做 SFT:27B 上 TB 2.1 掉到 45.8;4B 上直接崩塌(TB 18.7→3.4,出现思维/工具调用死循环)。归因:教师的 interleaved-thinking + 工具调用风格与学生自身 post-training 不兼容,模仿覆盖了学生依赖的行为模式却带不来教师的能力。与 TMax 报告的“SFT 混合数据劣化已后训练的 Qwen”互相印证。因此论文所有 RL 结果都从未修改的原始 checkpoint 出发。
显示更多
刚刚看完了自己QQ记录的前半生朋友圈,给了我很大的力量,让我有信心很多,有股力量在把我拖回正轨, 过去一年亏损大概半个小目标,我原本以为二次起来后这种事情不会在发生在我身上,但是人性上头起来真控制不住,特别是阴跌给足了场内和场外补保证金和马丁加仓的时间 就是从去年底大饼10万下来那一波,本来就几十万刀在玩,结果每天阴跌几个点,让我一直补保证金,然后马丁加仓,最后6万3割肉离场。后面马上就v反7万多, 然后追高,继续画门,割肉,继续v,然后空,然后继续v,反正来来回回几个月,只要我一开进去,开多马上爆跌,开空马上爆拉,都是5-10个点的波动。 那一战后让我心脉受损,加上重度抑郁躯体化,干什么都有气无力,提不起劲,感觉就像一个电量快用完的电池,现在看了这些一下开启了充电模式,让我很亢奋,很有激情,感觉活过来了 看了看前半生的东西,再看现在的东西,虽然失去了很多,但是还是拥有很多, 按照以前的收入水平,1个月好的情况下3万收入。10年不吃不喝才360万,我就当做了10年牛马,外加中了一张500万的彩票。嗯,我还是那个幸运儿,换个思路就豁然开朗了,哈哈 接下来给大家复盘一下具体细节也劝告已经在圈内取得过大结果的主观交易的兄弟们,千万别让上头,别让自己在反贫希望从我身上吸取教训。 以后也不会给自己目标了,有赚钱机会就赚,没有就好好生活,好好睡觉才是第一位。 得重新振作起来了,一起加油吧,兄弟们。
显示更多
0
64
126
6
转发到社区
已经有大V开始做蓝V生意了, 这个价格还是很吸引人的, 我之前JP买的年卡是280块, 贵一倍呢! 这个还是得找到合适的渠道门路
0
18
17
0
转发到社区
车辆报警需要更换低压电池; 一般来说车里面的12V电池需要3年左右换一次,属于典型的消耗品,如果你和我一样是特斯拉,最好注意下这个问题,不然突然抛锚,快充都用不了非常不方便。 我是今天中午发现这个问题了,空调已经不太好使用,车的内部用电和鸥翼门也打不开,基本马上要趴窝的那种,属于亟待解决的问题。 第一步,打电话问了特斯拉客服帮我预约门店,门店客服回电话说,这件事现在不能安排,因为太多车在排队了,最早只能安排到下午四点,而且最好提前去排队,价格在一千五到两千。 第二步,群友推荐途虎,搜了下,用券四百六,上门包安装,一个小时内可以到,用的是和之前一模一样的蓄电池,质保期也是一年。 然后果断选第二个,价格差了三倍,而且极度方便,在家等人过来,在家等他换好,不用排队没有摩擦,生活在国内,如果还不充分去使用这些优势,就太不划算了。 这样途虎赚的什么钱? 旧蓄电池可以卖钱吗?不然感觉这个价格,再加上人工费用,没什么利润可言了,除非旧电池可以卖。
显示更多
我一直觉得,币安广场的含金量,来自真实的用户、真实的交易和真实的成长路径。 我自己就是从币安广场走出来的。 2025 年 12 月,我参加广场「币安区块链全球百强」活动,最后在独立研究员赛道胜出。 那次经历让我很确定一件事:在币安广场,只要你持续输出,有自己的交易理解和研究能力,就真的有机会被更多人看见。 这也是我愿意长期在广场做内容的原因。 它给了很多普通创作者一个被发现、被验证、被放大的机会。 最近广场更新的几个功能,我也挺有感触。 黄 V 认证、认证+、勋章墙、交易实力徽章,都在把创作者和交易者的长期积累展示得更清楚。 比如推特有 3 万粉丝的 KOL,现在可以直接申请达人认证,这对外部优质创作者很友好。 认证+的门槛也更清楚了。 账号需要持续活跃,拥有稳定粉丝群体,达到一定浏览量或内容挖矿交易量标准,同时保持社区状态健康。 这套规则会让真正长期运营广场账号的人更容易留下身份标识。 我这次拿到达人认证+,感受还挺深。 一个账号能被认证下来,背后其实是持续创作、持续活跃、稳定运营这些东西慢慢积累出来的。 对认真做内容的人来说,这种反馈很重要,也挺有鼓励感。 交易实力徽章也值得聊一下。 以前大家看一个人的市场观点,更多靠印象、粉丝量和过往发帖记录。 现在交易量、盈利表现、合约实盘 PNL、带单规模、跟单收益这些维度,可以直接展示在主页、帖子和评论区。 这对读者很有用。 徽章不代表投资建议,也不保证未来收益,但它能提供一个额外参考。 看内容的时候,大家可以更快判断这个人的观点背后,有没有真实交易数据支撑。 对交易者来说,实力有章可见。 对创作者来说,长期积累会被记录。 对普通用户来说,筛选信息的成本会更低。 从内容被看见,到身份被认证,再到交易能力被数据化展示,币安广场这条线越来越清楚。 希望更多认真创作、认真交易的人,都能在广场留下自己的成绩。 也希望广场继续把真正有内容、有交易、有影响力的用户推到更多人面前。 #币安广场# @heyibinance @cz_binance @yingbinance @CYZhang01
显示更多
0
50
49
0
转发到社区
DBrand 蒸汽机伴侣魔方保护壳竟然没有获得 V 社的授权,V 社法务已要求停售此产品并且拒绝提供授权。 蒸汽机伴侣魔方是 DBrand 为 Steam Machine 制作的硅胶保护壳,其核心设计元素来自 V 社经典游戏传送门的伴侣魔方,但 DBrand 从去年 11 月开始立项到 6 月 22 日开售,竟然全程没有找 V 社获取授权。 查看全文:
显示更多