注册并分享邀请链接,可获得视频播放与邀请奖励。

AIGCLINK 的个人资料封面
AIGCLINK 的头像

AIGCLINK (@aigclink)

@aigclink
致力于让每个想拥抱AI的人都能找到适合自己的AI产品,助力企业定制AIGC应用
1.8K 正在关注    36.2K 粉丝
BaoCut:是宝玉老师 @dotey 开发的转录+粗剪的Skill,对创作者,省掉的是逐句抠字幕的时间。安装到 Claude Code / Codex 上,即可用自然语言驱动 BaoCut 这个 skill 剪辑 app 的命令行。 适用场景:对于喜欢将国外的演讲搬到国内的朋友来说简直就是福音,用baocut把视频/youtube的url导入即可完成翻译转录,对于搬运侠来说省了不少事。对于做跨境电商的朋友也很有价值,多语言转录也很有价值。 昨天介绍的三家接 agent 都走 MCP——ChatCut 给闭源编辑器外挂 MCP 插件、OpenCut 把 MCP 写进重写路线图、Palmier 原生 MCP。BaoCut 换了个更轻的姿势:把 app 自带的 baocut CLI 包成一个 Agent Skill,agent 直接跑命令cli: · baocut --json auto talk.mp4 --lang zh # 转写 → 润色 → 翻译,一条命令 · baocut export --srt --translated --lang zh BaoCut 解决的问题很垂直很精准:口播视频的转写、加字幕、翻译字幕、说话人复核、清理 talking-head、导出——这些正是知识博主/口播号最费时的机械活。以前逐句对字幕、手动翻译的活,现在跟 Claude Code 说句人话就跑完了。 我测试baocut使用了下,字幕识别转录上,要比剪映的自动字幕识别要好,帮我把相关的语气词拿掉了、很多重复的语句也直接剪掉了,也可以直接将字幕翻译为十几种其他语言。 #BaoCut# #AI剪辑# #字幕翻译# #ClaudeCode# #AgentSkill#
显示更多
你这个月的 Codex 订阅,按 OpenAI API 价格折算,到底薅回了多少钱?做了个 macOS 小组件专门算这笔账——进度条的满额刻度,标到了约 4.6 万美元/月。(郭美青老师本来是自己用的,然后开源出来给大家用) codexU 是一个 macOS 菜单栏 + 桌面小组件,把 OpenAI Codex(以及 Claude Code)的额度窗口、token 用量、今日任务看板,全塞进菜单栏。 它最戳人的是那个叫 "羊毛进度" 的功能: Codex 的额度界面通常只给你一个百分比和重置时间,你根本看不出"我这个月到底用掉了多少价值"。codexU 把本机解析到的 token(未缓存输入 / 命中缓存输入 / 输出)按对应模型的 OpenAI API 单价折算成美元,再和你的订阅价(Plus / Pro 100 / Pro 200)摆在一条进度条上——一眼看出这个月订阅回本到哪个区间了。满额刻度按"2 亿 token/天 × 30 天"估到约 4.6 万美元/月(这是理论上限估算,不是账单)。等于给"薅羊毛"做了个可视化仪表盘。 工程上它跟得很紧,有两个细节值得说: 1、数据全本地:Codex 走 app-server 的额度/用量接口 + ~/.codex/state_5.sqlite + rollout 日志里的 token_count 事件;Claude Code 走 ~/.claude/ 的 transcript。一个入口同时看两边本机用量。 2、支持最新版合并后的codex:Codex 和 ChatGPT 合并后,macOS 应用从 改名成了 已经兼容新应用名。 也有个绕不开的现实限制——Codex 本地 API 只暴露"滚动窗口已用百分比 + 重置时间",不给绝对配额数字,所以它只能显示剩余百分比,不是精确到还剩多少 token。 怎么用: 本机装了 Codex 并登录、至少跑过一次(生成 state_5.sqlite)。去 GitHub Release 下对应架构的 DMG(arm64 / x86_64),首次因为不是 App Store 签名,要在"系统设置 → 隐私与安全性"手动点"仍要打开"。Claude Code 统计是可选的。 每天开 Codex 干活的,挂一个在菜单栏——月底看看自己到底从订阅里薅回了多少,顺便还能看出你的 token 都烧在了哪几个项目上。 #codexU# #Codex# #ClaudeCode# #开发者工具# #独立开发#
显示更多
0
5
28
13
转发到社区
蚂蚁集团旗下具身智能公司 Robbyant 开源了世界模型 LingBot-World 2.0——能连续跑一个多小时、画质未见明显可见衰减,还内置一套类大脑-小脑协同的 agentic harness,让世界随用户动作持续展开。 原有世界模型有个老毛病:跑上几十秒到几分钟,画面就开始糊、几何扭曲、场景漂移崩坏。LingBot-World 2.0 敢拿"连续跑一个多小时、画质无明显可见衰减"当证据,并明说这份稳定是"结构性的,不是挑了段好片段"。 四个升级点: ① 无限时长,还不掉画质: 别的可交互世界模型(Google 的 Genie 3、M-G 3.0 等)时长都停在"分钟级";它是对比表里唯一在通用域做到"小时级 / 无限"时长的,也是唯一同时满足"高动态 + 语义交互 + 实时 + 完全开源"的一个(Genie 3、HappyOyster 都闭源)。 为什么不漂? 两个关键:因果预训练 + MoBA 混合注意力,在 teacher-forcing 掩码里接一块双向注意力,既支持任意时长自回归,又当正则项压制退化;再用少步蒸馏(consistency distillation + DMD),且在模型自己长程 rollout 的轨迹上纠偏,专治长时间累积的漂移。 ② 交互动作大幅变宽: 不再只是"往前走 / 转镜头",支持战斗、射箭、施法、射击等角色动作,还能改写环境——按需召唤下雪、下雨。 ③ 一个会"自己活"的世界——最有意思的一步。 它把 agent 那套 harness 搬进世界建模:由 VLM ‘Brain’ 观察当前画面、做因果推理并提出事件;视频生成器 ‘Cerebellum’ 将语义决策落成连续画面;同时 pilot agent 负责角色行为,director agent 负责持续引入新的环境元素和事件。两者组成持续闭环——世界不再是"你不动它就停"的沙盒,而是自己往前发生事情、并随你而变。作者的类比很直白:强模型得塞进 Codex 那样的 harness 才成为会干活的工程师,世界模型也得有 harness 才"活"。 ④ 能多人同时进同一个世界玩 部署很克制: 主模型 14B,另配 1.3B 轻量实时版,支持单 GPU 部署;稳定输出 720p / 60fps。 世界模型卷了这么久画质,下一关也许不是"生成得多真",而是"这个世界能不能自己活着、活得够久"——权重和代码都开源了,感兴趣的可以去 Reactor、灵光上手测试跑一局。 #LingBotWorld# #WorldInfinity# #世界模型# #蚂蚁集团# #开源#
显示更多
OpenAI昨晚最新上的:GPT-Live,核心在于它让普通人拥有了“随身同传”的能力 上了全双工、后台委托两个核心功能,这次上新重构的不只是上一代语音助手,而是一整排职业 比如说初级同传,全双工的天然场景,你讲中文,GPT-Live在你说话的同时就在后台翻译,你说完它已经准备好用目标语言输出了,人类同传有的延迟、疲劳感等它没有 客服场景,直接说“我的快递信息三天没更新了”,它边听边委托推理模型查后台,智能对话+深度推理协作,对话体验不变,后台查资料时前台不冷场 还有外语陪练、有声读物、头脑风暴等等 有些信息能以视觉卡片形式呈现,在语音对话中把信息可视化,比如问“今天北京天气怎么样”,屏幕直接弹出一张天气卡片 天气、股票、体育、地图等信息都能以卡片呈现 GPT-Live等于说让AI具备了与人“实时共在”的能力,人机交互迈入了新阶段 #AI语音# #GPTLive#
显示更多
Introducing GPT-Live, a new generation of voice models for natural human-AI interaction. Rolling out in ChatGPT starting today. You’ll want to turn the sound on for this one.
显示更多
刚刚试了下Doubao-Seed-2.1-Pro,如其所说,Coding能力有提升,上桌了! 给它丟了一个“写一个博客网站,具备完整的前后端功能,有前端有后台,前端界面符合当下审美并要有交互,全程独立完成,不询问用户,遇到错误自行调试解决”的任务 生成结果质量与任务要求的匹配度还可以 实现了“一句需求、5-6万token输出、20分钟拿到可用产品”的闭环,全链路一次跑通 它完成了需求理解、规划、一次生成从前后端、数据库、部署配置的完整代码,无人工干预、代码修改 前后端功能相对完整,核心功能都有,拿来可以正常使用。复杂任务拆解、前后端工程能力、全栈联调能力还不错,不过工程深度、功能深度上还有提升空间,需人工二次介入 整体UI设计感觉还可以,界面精致、极简科技风,布局、交互、组件质感到位 第二个,整体任务全链路一次跑通比较惊喜,从写代码到到发布文章,全程无报错无卡壳,前后端联调一次成功,得益于它的长程生成一致性能力 做为快速原型开发、管理系统、工具类网站、个人想法实现等等应该是够用了 另外,可以在客户端-办公任务模式里体验它的Agent能力,帮你处理文件、操作网页,完成从资料收集、数据处理、到物料制作全流程办公协作,这块体感也还不错 #DoubaoSeed21Pro# #字节豆包# #LLM#
显示更多
京东最新开源的实时视频视觉语言交互模型:JoyAI-VL-Interaction,让大模型从“一问一答”走向“边看边说” 也就是说它会像人一样“在场”,持续观察视频流,自主判断什么时候说话、什么时候沉默,并实时响应关键事件 在58个真人盲评的实时流式场景中,对豆包胜率77.6%、对Gemini胜率 87.9%,监控预警场景对两个基线均100%胜率 可以用来搭建需要持续观察、自主判断、即时响应的实景AI,比如说安防监控、老人儿童看护、直播讲解、电商导购、操作指导、AI眼镜等等 核心特点是主动判断非被动回答,它会持续观察视频流,来自主做判断,不是等用户发起问题才开始处理当前画面 比如说,当设置"裁判出示红牌时提醒我",模型就会持续值守画面,在事件发生时自动预警 第二个,它会面向正在发生的视频流即时响应,画面变化时即能响应 前台+后台的分工协作设计,前台模型实时观察视频流,后台大模型/Agent接复杂推理、代码生成、工具调用的重活 后台结果返回后前台自然接回对话,形成前台实时助手+后台智能大脑的协作系统,端侧用小模型持续值守,复杂任务才调用大模型,使得成本和延迟更可控 模型+数据+训练方案+可部署系统全栈开源,各模块可替换,拿去即能用 #JoyAIVLInteraction# #VLM#
显示更多
0
33
50
8
转发到社区
Loop模板大全库:loop-library,目前覆盖工程、运维、评估、设计、内容等50个具体场景 每个Loop设置了反馈、判断、迭代的完整闭环,并配备了查找、审计、适配、设计四种能力的Skill 告诉AI要干什么,它帮你从目录里匹配最合适的,模板不完全匹配的话,它给你改一个现成的或者重新设计一个 Loop和Skill是解耦的不用Skill也行,直接复制现成Loop就能用 #Loop# #looplibrary# #LoopEngineering#
显示更多
0
8
67
21
转发到社区
网易有道的最新TTS:Confucius4-TTS,核心零样本跨语言声音克隆能力 也就是说给一段参考音,它能让同一个人开口说14种语言,并保持音色稳定、情感还原度较高 从效果听跨语言没有明显口音残留感 覆盖中文、英、日、韩、德、法、西、印尼、意、泰、葡、俄、马来、越南语14种语言 对于新闻播报、客服、有声书等场景是够用的 #TTS# #Confucius4TTS#
显示更多
西安交大最新发了一篇关于“多智能体协作、故障归因与自我演化”的全面综述,让AI超越个体智能 当前基于LLM的自主智能体在推理、规划和工具使用方面越来越强,但当遇到跨角色、跨工具、跨环境的持续协调任务时,单个智能体能力不足 单个智能体很容易在长时间交互中失去连贯性,难以稳定协调多步行动 多智能体系统通过专业化智能体间的结构化协作缓解了这个问题,不同的Agent分别负责规划、执行、验证、检索和工具调用 但是,只要某个环节出错,错误就可能在后续协作中传播,导致系统级失败,现有多Agent系统往往连哪里出错都难以定位,更无法自动调整结构,避免下次再犯同样的错 也就是说,AI团队协作出错了不知道该怪谁、错在哪一步、错误是怎么从一个AI传到另一个AI的,这就导致AI团队能干活但干砸了没法复盘 那么,多智能体系统如何从各自为战走向协作进化的闭环? 西安交通大学 MOE KLINNS Lab团队等提出了“LIFE四阶段框架”,将个体能力、协作、归因、演化四条线串成了一条因果链条 指出失败归因是当前研究最薄弱的中间环节,也是实现真正自组织集体智能的关键瓶颈 对每个阶段提供系统性分类,并形式化刻画相邻阶段之间的依赖关系,揭示每个阶段如何既依赖又约束下一个阶段 论文把个体能力、多智能体协作、失败归因、自我演化用因果链条串了起来,并指出了智能体协作中的隐形风险 这为工业落地提供了思维框架,指出了一条让AI从人工编排的协作走向自组织的集体智能的路径 #多智能体# #AIAgent#
显示更多