注册并分享邀请链接,可获得视频播放与邀请奖励。

与「AgentSkills」相关的搜索结果

AgentSkills 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 AgentSkills 的内容
开源了,开源了! 是不是受够了公众号排版?辛苦调好的样式,一粘进编辑器就掉格式?每篇还得手动全选复制、排版还千篇一律? 我和「摸鱼小李」联名首发一套排版神器 👉 gzh-design-skill 写完 Markdown,它帮你一键排成能直接粘进公众号、且样式不掉的精致 HTML。 四大特色: 1⃣ 6 套精选厚主题:摸鱼绿 / 红白 / 石墨极简 / 留白禅意 / 摸鱼票据 / 橄榄手记 , 每套都是自成体系的组件库,不是换配色的"皮肤" 2⃣ 主题生成器:现成的不够用?一句话描述或甩张参考图,当场现造一套新主题 3⃣ 一键复制:预览页点「复制到公众号」→ 直接粘贴,样式一点不掉,告别手动全选 4⃣ 双关卡校验:脚本确定性兜住公众号平台的各种限制,换啥模型都不走样 ⚡ 不挑模型:Claude / GPT / Gemini + DeepSeek / Kimi / 通义 / GLM 国产模型都能跑 📦 一行安装: npx skills add isjiamu/gzh-design-skill AGPL-3.0 开源 · 欢迎共创 #AgentSkills# #公众号排版# #开源#
显示更多
不管你是企业还是个人,用 agent 的时候,有一句话最该先问,但几乎没人问: 你装的这个 skill,安全吗? 为什么这事要命? 一个 skill,往往能拿到你的 API key,能读你的文件,能碰你 agent 的记忆 装一个恶意 skill,等于给人开了一道直通你 agent 大脑的门 而它就混在一堆正常结果里,长得跟好人一模一样 所以在 agentskillshub(现在收了 13 万个 skill)上,我们最近上线了一个功能: 把任意一个 GitHub 项目丢进去,它自动帮你审计里面 skill 的安全性 跑完会给你一份结果: 质量评分、完整度、各个维度的分,最后一个总评级 比如一个聚合了营销、写作各类 skill 的仓库,跑出来是「安全」 你就能放心装到自己 agent 上,不用再凭感觉赌一把 方法上分两层: 1️⃣ 一层是基于规则 + 参考学术论文的快速审计,覆盖广,给你一个安全下限 2️⃣ 一层是深度安全审计,真要放进企业,就得深挖它到底会不会偷偷拿走你的密钥 skills 安全,是现在个人和企业都在忽略的一块 装之前,先查一下 👇 🔗 CLI审计: npx @agentskillshub/cli audit owner/repo
显示更多
[开源学习资源] AI Engineering from Scratch 59.8K ⭐️ 作者 @ghumare64 课程共 20 个阶段,以 Python 为主要编程语言,主张在导入任何框架之前,先用纯数学把每个算法手写一遍。 课程地址: 开源地址: 它和常见教程的本质区别 ? 大多数 AI 教程是“API 驱动”的:装个库、调个接口、跑个 demo。这个项目反其道而行,每节课遵循固定的六段结构: Motto → Problem → Concept → Build It → Use It → Ship It 以 Phase 10 的一节课「Tokenizers: BPE, WordPiece, SentencePiece」 为例,这个格式是真实落地的,而且写作质量相当高: · Problem 部分不讲废话,直接从代价切入:“你的 LLM 不读英语,它读整数。分词器决定这些整数是承载意义还是浪费意义”,然后解释为什么 tokenization 不是预处理,它是架构的一部分(影响上下文窗口利用率、API 计费、推理速度)。 · Concept 部分用“三种失败的方案和一种胜出的方案”来讲演化逻辑:词级切分(词表爆炸、[UNK] 问题)→ 字符级切分(序列过长)→ 子词切分(BPE 的折中),并配上真实语料上 BPE 逐步合并的手工演算。 每节约 3000+ 词,带 Mermaid 图、可运行代码和测试。 另外两个设计值得强调: · 每节课产出一个可复用的 artifact,一个 prompt、一个 skill、一个 agent 或一个 MCP server。学完整个课程,你手里有 523 个可展示的作品,不是 523 个跑完就扔的 notebook。 · 强调“证据留存”:保留命令、退出码、输出,作为学习发生的证明。这明显吸收了工程实践中“可验证性”的思路。 # 课程结构:从线性代数到自主智能体集群 20 个阶段构成一条完整的上升曲线,咱们它分成五个大块来看: 基础层(Phase 0–2):环境与工具链、数学基础(线性代数/概率/微积分)、经典机器学习。这是给基础不牢的读者铺的路。 深度学习与感知层(Phase 3–6):神经网络核心、计算机视觉(一路讲到 NeRF、高斯泼溅、世界模型,这已经超出一般教程的覆盖范围)、NLP、语音。 生成与决策层(Phase 7–9):Transformer 深挖、生成式 AI(GAN、扩散模型、flow matching)、强化学习。 LLM 层(Phase 10–12):这是全课程的重心之一。Phase 10 的目录我逐条看过,它不只是“从零实现 GPT”这种常规内容,还包含了相当前沿的论文级主题:DeepSeek-V3 架构走读、DualPipe 并行策略、Native Sparse Attention(NSA)、多 token 预测、Jamba 的 SSM-Transformer 混合架构、 speculative decoding 等。Phase 11 转向应用侧(RAG、LoRA、MCP、可观测性),Phase 12 覆盖多模态(从 CLIP 到 computer-use agent)。 智能体层(Phase 13–16):工具与协议(MCP、A2A、Agent Skills)、54 节课的 agent 工程、自主系统与安全、多智能体集群。这一层的分量很能说明项目的判断:它认为 AI 工程的重心正在从“训模型”转向“构建可靠协作的智能体”。 收尾(Phase 17–19):生产基础设施、伦理与对齐、毕业设计。 # 生态与周边:不只是一个课程仓库 网站:带浏览器本地存储的学习进度追踪、术语表、课程目录和路线图。 六卷本书籍:课程内容由 CI(pandoc)自动构建成 EPUB/PDF,附在 GitHub Releases 上,课程即书,且随仓库持续更新。 Agent 导师模式:运行 npx skills add rohitg00/ai-engineering-from-scratch,可以把整个课程装进 Claude Code、Codex 等编码智能体,变成一个带分级测验(placement quiz)和个性化路径的交互式导师,学习进度写在 LEARNING.md 里。这是“用你正在学的工具来学”的巧妙闭环。 认证备考:5 条备考路径、67 节课、505 道练习题,覆盖 Anthropic 的 Claude 认证和 Agentic AI Foundation 的 MCPA。项目明确声明与这些考试机构无关联,只是独立的备考材料。 12 种语言的翻译(含中文),以及四条核心学习路径(构建与部署 AI 应用、软件工程基础、Agent 辅助工程、产品判断与交付)供不同目标的人选路。
显示更多
0
11
75
16
转发到社区
NVIDIA 发布 Skill2Env:用“集体技能”强化智能体 NVIDIA 研究者们把社区公开的 Agent Skills 编译成可执行 RL 训练环境的数据流水线:3.4k 个 Skills 变成 8k 个带程序化测试和行为量规的终端任务;仅 300 步 RL 训练就让 Qwen3.8-27B 在 Terminal-Bench 2.1 上提升 4.7 个百分点,且模型行为显著向源 Skills 的方法论对齐。 开源项目: 核心洞察:公开 Agent Skills 是一个被忽视的监督来源 Agent Skills 是“教智能体做某件事”的文件夹:一个 SKILL.md 加上可选的脚本、参考资料和资产。论文指出,把公开 Skill 语料当作数据来读,它同时提供三样东西: · 任务分布的采样:人们真正想让智能体处理的任务分布(有人愿意花时间写下工作流,说明这活儿值得自动化); · 真实世界的锚点:指向真实的仓库、数据集、工具和工件; · 结果测试表达不了的质量标准:领域专长、默认参数、常见坑、“好结果长什么样”。 # 数据流水线:四阶段编译,验证靠构造 1. Plan(分解):容器化的 Codex 规划器读取完整 Skill 包、联网调研相关公共资产,把 Skill 拆解成若干可验证的 workflow,每个附带元计划(场景、初始世界、预埋缺陷、难点来源、解法草案、验证策略)、资产建议和“任务轴池”(任务原型 × 验证器模式 × 人物画像)。 2. Diversify(多样化):宿主从轴池采样一组组合,加上复杂度、指令语气、请求者专业水平。关键设计是轴池以 workflow 为条件:研究型 workflow 配“证据可追溯”验证和研究者画像,而不是从全轴乘积空间乱抽,这让多样化保持 sensible。 3. Create(构造):全新创建者 Codex agent 在 Docker 内工作,尽可能用真实素材(钉在特定 commit 的开源仓库、真实版本化文档、官方 API 规范);需要联网服务的场景改造成本地替身(stub 服务器、录制回放 fixture、PATH 上的假 CLI、种子数据库),求解时绝不依赖网络。创建顺序被严格固定:先建世界 → 写指令 → 写测试 → 写量规 → 最后才写参考解,测试先于解法冻结,保证解法必须迁就评分契约而非反过来。 4. Verify(验证):宿主端无模型参与的接收门:静态检查(布局、符号链接、Dockerfile 安全、基础镜像按内容摘要钉死)+ 两个容器内试跑:Oracle(参考解)必须全指标满分,NOP(什么都不做的 agent)必须全指标零分。任一失败即拒绝。 值得注意的一个反直觉选择:不做 teacher 模型预验证(不像部分工作用强模型试解、解不出就丢弃任务)。理由有二:这会把任务难度上限压到验证器能力,且成本翻倍;而 group-based RL 的在线动态过滤(rollout 无优势的 prompt 自动不产生梯度)天然淘汰过难/过易任务。 # 数据画像:广、贵、且忠实于源 规模与成本:7,971 个任务,用 GPT-5.6 Sol(xhigh 推理档)生成,API 花费超 9 万美元。(脚注:出于法律原因,公开发布的数据集改用 Kimi-K3-max 在同一流水线下生成。) 领域分布:13 个领域中,软件工程仅占 22.5%,AI/ML 10.5%,商业/金融/法律/HR 10.5%,营销 9.3%……论文对比了 TMax-15K、Terminal-Bench、DeepSWE 等,Skill2Env 是唯一全覆盖 13 域、且非技术知识工作占大头的语料。 忠实度探针(很聪明的设计):用任务指令+量规作查询、对 3.4k 个 SKILL.md 做 TF-IDF 检索,73.2% 的任务 top-1 命中真实源 Skill,94.6% 进 top-10(随机 0.03%)。单用量规也有 68.5% top-1,证明量规携带的是 Skill 专属方法论而非泛泛建议。 SFT 数据:用 GLM-5.3 对每个任务 rollout 两次,得到 15,968 条轨迹,平均奖励 0.74,中位轨迹 19 次模型调用 + 23 次工具调用。 S2EBench:考虑到公开基准饱和,从 SkillHub 另外生成、逐条人工审核(指令无歧义、忠实于源 Skill、测试公允)后的 79 任务私有 held-out 基准。 # RL 实验:基础设施 + 极简配方 基础设施(论文明确说“现代 agentic RL 首先是基础设施挑战”):Molt(PyTorch 原生全异步训练,Ray + vLLM + FSDP2)+ Polar(agent rollout 层:rootless Apptainer 沙箱、代理回传 token ID 和采样时 log-prob、prefix merging 把 harness 的多次补全缝合成训练轨迹)。 配方(刻意走“简单路线”):GRPO 组归一优势 + DPPO 的 binary-KL 信任域掩码(δ=0.05,超出阈值的 token 直接丢弃,无需参考模型,还能防训练-推理失配);G=8 rollouts/组,批 64,lr 1e-6 恒定,无 KL 惩罚、无熵奖励、无 SFT 热启动,每任务 65k 上下文。 量规校准奖励:开量规时,额外由 GPT-6 Astra 做 LLM-as-Judge(带“宪法”:惩罚无脑循环、reward hacking、答非所问;hacking 实证 = -5 分),总奖励 r = r_V + λs/5(λ=0.2),即 judge 最多把程序化奖励拉动 ±0.2。量规是校准可执行结果奖励,而非取代它,这是与“Rubrics as Rewards”一系的定位差异。 # 四项发现(论文最有信息量的部分) 发现 1:小规模 RL 即有跨域迁移。 仅 300 步、只用 2,400 任务子集训一个 epoch:S2EBench pass@1 +4.3(均分 +18.5),Terminal-Bench 2.1 +4.7(49.4→54.1)。训练集与 TB 无重叠(13-gram Jaccard < 0.8),且训练集从未针对 TB 调过,论文将其解读为规划、工具使用、收尾能力的通用提升而非任务族记忆。这让 27B 本地模型显著缩小了与云端前沿模型的差距。 发现 2:量规校准 RL 在基准上落后于纯结果 RL,一个诚实的负结果。 量规版在 TB 2.1 只有 50.1(纯结果版 54.1);训练中量规版的程序化奖励长期停在 0.5–0.6,judge 分项从头到尾无上升趋势,两个奖励在训练分布上互相拉扯。论文不把它当作对量规奖励的终审判决(两者优化不同目标,而基准只考结果那一半),并给出两个疑因:λ=0.2 的加性形式让失败任务仍能拿正奖励、judge 看不到文件系统等设定均未调优;以及更本质的,Skill 写下的方法论可能本来就不是最大化基准通过率的分布。 发现 3:行为确实向 Skill 对齐,量规的价值所在。 200 个任务的成对偏好测试(judge 拿源 SKILL.md 当标准,比较匿名化的 base 与 RL 轨迹):纯结果 RL 已被偏好 54.5% vs 33.5%;量规版被偏好 73.0% vs 24.0%。这说明量规奖励买到的东西在结果基准上看不见,但对“怎么做事”影响实质,对网页开发、报告综合、开放研究这类难验证任务尤其重要。 发现 4:GLM-5.3 蒸馏 SFT 反而伤害 Qwen。 在 GLM-5.3 轨迹上做 SFT:27B 上 TB 2.1 掉到 45.8;4B 上直接崩塌(TB 18.7→3.4,出现思维/工具调用死循环)。归因:教师的 interleaved-thinking + 工具调用风格与学生自身 post-training 不兼容,模仿覆盖了学生依赖的行为模式却带不来教师的能力。与 TMax 报告的“SFT 混合数据劣化已后训练的 Qwen”互相印证。因此论文所有 RL 结果都从未修改的原始 checkpoint 出发。
显示更多
Binance Web3 Data AI Agent Skills let agents: 🔎 Discover trending tokens 🐋 Track smart money wallets 🛡️ Check token risks 📊 Analyze market data What would you have your AI agent research first? Learn more👇
显示更多
0
75
182
17
转发到社区
🔥 Codex 做游戏,现在真的有点离谱了。 我整理了 10 个游戏开发方向的 Agent Skill。 从「生成游戏」到「游戏引擎」,再到「UI、手感、多人联机」,基本把一个游戏开发团队拆成了 10 个专家。 1️⃣ higgsfield-game-generation|游戏生成 直接让 Codex 构建、迭代和部署可玩的浏览器游戏,还能生成 Sprite、纹理、3D 资产、音乐和音效。 👉 2️⃣ game-engine|游戏引擎 负责游戏架构、游戏循环、物理、碰撞检测、2D/3D 渲染等。 👉 3️⃣ multiplayer-game|多人联机 专门处理多人游戏的 matchmaking、实时状态同步、tick loop、玩家连接等。 👉 4️⃣ game-developer|通用游戏开发 适合让 Codex 按专业游戏开发流程来实现玩法、逻辑和功能。 👉 5️⃣ game-ui-design|游戏 UI 专门处理游戏菜单、HUD、按钮、状态栏等界面设计。 解决 AI 写出来的游戏: 功能能跑,UI 像程序员半夜赶出来的。💀 👉 6️⃣ game-design-theory|游戏设计理论 负责玩法循环、玩家体验、关卡、奖励机制等。 核心就是解决: “代码写出来了,但为什么不好玩?” 👉 7️⃣ game-feel|游戏手感 这个非常值得收藏。 打击反馈、粒子效果、屏幕震动、动画、音效、操作反馈…… 让游戏从: 能玩 → 玩起来爽。 👉 8️⃣ game-ui-ux|游戏 UI/UX 解决 HUD、菜单、响应式布局、安全区域、键盘/手柄导航等问题。 👉 9️⃣ threejs-game-ui-designer|Three.js 游戏 UI 如果你想用 Three.js 做 3D 网页游戏,这个很适合。 专门处理 HUD、菜单、Overlay、触控按钮和响应式布局。 👉 🔟 develop-web-game|网页游戏开发 这个是 OpenAI 官方 Skills 仓库里的 Skill。 它不是单纯让 Codex 写代码,而是让 Codex: 写代码 → 测试 → 截图 → 检查 → 修 Bug → 再测试 形成完整的游戏开发迭代循环。 👉 ⸻ 如果你只是想用 Codex 做小游戏: 🎮 入门 develop-web-game ⚙️ 游戏架构 develop-web-game + game-engine ✨ 想做得更精致 game-feel + game-ui-ux 🌐 Three.js 3D 游戏 threejs-game-ui-designer 🤖 AI 直接生成完整浏览器游戏 higgsfield-game-generation 以前: “Codex,帮我写一个小游戏。” 现在: “Codex,把这几个 Skill 组合起来,给我整个游戏开发团队。” 这才是 Agent Skill 真正有意思的地方。😂 #Codex# #AgentSkill# #AI编程# #VibeCoding# #游戏开发#
显示更多
0
42
490
84
转发到社区
Introducing ElevenLabs CLI v1. Developers and coding agents can now manage ElevenLabs workflows directly in the terminal with well-documented commands, built-in agent skills, structured JSON, and dry runs to preview any operation.
显示更多
Finally, a good paper testing whether Agent Skills actually help. Worth reading if you are maintaining a skill library in a team. WebDev-Skills-Bench runs 31 public WebDev Skills over 50 Web-Bench projects and 1,000 ordered tasks, with a length-matched irrelevant control so prompt-length effects can be separated from Skill content. Injecting the target Skill reduces mean Pass@2 by 1.3% to 4.2%, lowers task completion depth, and raises token cost by 72% to 394%. Gains show up in 17% to 36% of Skill-project pairs. The controls split the damage into two failure modes. Some models are length-distracted, where an equally long irrelevant Skill reproduces most of the loss. Others are content-misled, where prompt length is neutral, and the Skill content still costs 1.1 to 1.4 points. Other findings: > Losses concentrate on easy early tasks > Skill rankings transfer weakly across models > Anti-pattern rules outperform example-heavy content inside the Skills that do help Paper: Track more trending AI papers in our academy:
显示更多
最近我把 TermiX / 从头到尾手操了一遍。 这玩意儿有点难搞,但跑完整个流程后,我反而觉得它有点东西。 注册 Agent → 发任务 → 报价接单 → Escrow 托管 → 交付 → 验收 → 结算 我发现它真正有意思的地方,并不是“又来了一个 AI Agent 平台”。 而是它在问一个更现实的问题:如果 Agent 以后真的能自己干活,那它去哪接活?怎么报价?钱怎么收?出纠纷谁处理? 简单的理解来说, 就像一个链上的 Agent 自由职业市场。 Agent 有自己的 Identity,可以当 Client,也可以当 Provider。 Client 发需求、定预算和交付标准; Provider 报价接单; 资金进入智能合约 Escrow; 完成任务后提交结果; 没问题就放款; 有争议,就进入 Challenge,由评审机制处理。 也就是说,它不是简单做个“Agent 接单网站”。 而是试图把: 身份 → 任务 → 报价 → 托管 → 交付 → 验收 → 声誉 → 结算 这一整套交易流程搬到链上。 以前我们聊 Agent,关注的基本都是: 能不能写代码? 能不能交易? 能不能调用 API? 能不能自动执行? 但当 Agent 真正开始变强以后,下一个问题是:干完活,然后呢? 找客户 → 报价 → 接单 → 干活 → 验收 → 收钱 → 积累信用。 TermiX 做的就是把这套逻辑重新给 Agent 跑一遍。 而我比较关注的,其实是 Identity + Reputation。 因为 Agent 注册出来只是“有身份”。 真正做过任务、完成过多少单、有没有纠纷、别人还愿不愿意找它 你说自己会写代码,和你链上真的干完 50 个代码任务,完全是两回事。 所以未来 Agent 真开始接单,我觉得:能力决定你能不能干活,声誉决定别人敢不敢把活给你。 另外还有 Bounty。 有任务、有奖励,符合条件的 Agent 可以直接来干活。 再结合 termix-agent-skills,理论上以后甚至可以做到: 发现任务 → 判断需求 → 报价 → 接单 → 执行 → 交付 → 收钱 到这一步,这已经不只是“AI 帮人工作。” 而是,“Agent 自己开始工作、接单,甚至赚钱。” 当然,现在还不能直接吹“Agent 经济闭环已经跑通”。 真正的难点根本不是智能合约能不能写。 而是: 有没有真实任务? 有没有真实需求? 有没有靠谱 Provider? Reputation 能不能真正沉淀? 没有任务,Agent 再聪明也只能在家待业 😂 所以我现在更想看的,是它能不能从: 技术闭环 → 经济闭环 如果大家感兴趣,我反而建议别只看介绍。 自己注册进去,把 Client 和 Provider 两个角色都跑一遍。 注册入口: 如果这件事真跑通,Agent 的叙事可能就会从:“会做事” → “能赚钱” 个人观点,仅供参考。
显示更多
0
42
38
0
转发到社区
Introducing ElevenLabs CLI v1. Developers and coding agents can now manage ElevenLabs workflows directly in the terminal with well-documented commands, built-in agent skills, structured JSON, and dry runs to preview any operation.
显示更多
0
10
178
30
转发到社区