注册并分享邀请链接,可获得视频播放与邀请奖励。

与「音视频生成」相关的搜索结果

音视频生成 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 音视频生成 的内容
做过视频的人都知道一个痛点:画面和声音永远对不齐 你用 AI 生成了画面,再用 AI 配了音,然后花几个小时手动调时间轴、对口型、卡节奏 稍微专业点的创作者,光音画同步这一步就能耗掉半天时间。更要命的是,调完还不一定自然 这个问题在 AI 视频生成领域一直没有解决方案,因为技术难度太高 ——要让声音和画面在生成的时候就天然对齐,而不是事后硬拼,这需要模型同时理解音频和视频的底层逻辑 直到百度文心团队放出了 NAVA-这是业界第一个仅有6.3B参数大小,但是能原生同步生成音视频的模型 其他能实现的模型哪个不是10B以上? 作为一个跑过无数 AI 工具的产品经理,我看到这个模型的第一反应是:这才是真正的技术突破 它到底能干什么? 你给 NAVA 输入一段文字描述,它直接输出720p 的视频+立体声音频,而且声画天然同步,不需要任何后期调整 这不是简单的文生视频+文生音频拼接,而是音视频在同一个生成过程中共同演化、原生对齐 音视频联合生成这个赛道,LTX、Ovi、MOVA 等模型都在做 但 NAVA 用了一个更聪明的架构:Align-then-Fuse,先让音视频在专门的对齐空间建立对应关系,再融合文本条件生成。 更炸裂的是参数量:6.3B 打败所有对手 NAVA 只有6.3B 参数,但在 Verse-Bench 基准测试上,音视频同步指标、视频质量、音频准确率全面超越: Ovi 1.1(10B 参数) MOVA(32B 参数) Davinci(15B) LTX 2.3(19B) 用三分之一甚至六分之一的参数量,拿下 SOTA。这意味着什么?意味着普通人真的用得起了 不需要4090显卡,不需要租昂贵的云算力,甚至12GB 显存的3060就有可能跑起来。而那些参数量动辄15B、19B 的模型,普通人根本碰不到,只能在云端按次付费 文心用6.3B 做到了别人19B 才能做到的效果,这不是简单的参数压缩,而是在模型架构和训练策略上下了真功夫 他们用了一个叫 Align-then-Fuse 的架构,先让音频和视频在专门的对齐空间里建立对应关系,再融合文本条件进行生成 这个技术路线的价值在于:小模型+高性能=普通人能用的 AI 工具 它解决了什么真实痛点? 我观察到三个场景,NAVA 可能发挥非常大的作用: 1.短视频创作者的效率问题: 现在做抖音、视频号内容,很多人卡在配音和画面匹配上。用传统工具,要么花钱请配音,要么用 AI 配音但对不上口型。NAVA 直接生成同步内容,省掉了这个环节 2.教育和培训内容制作: 很多老师、培训机构想做视频课程,但制作成本太高 如果能用文字描述直接生成带讲解的演示片段,内容生产效率会提升几倍 3.小白的内容创业门槛 过去你想做视频内容,得学剪辑、学配音、学调色 现在你只需要会写文案,描述清楚你想要什么,工具帮你生成 这对于想入局但没技术背景的人来说,是真正的降维打击 文心在下一盘什么棋? 有意思的是,NAVA 目前还只是研究阶段的开源项目,但它透露出的信号很明确: 文心在往音视频联合生成、甚至世界模型的方向布局 从产品思维来看,这个方向很聪明 视频生成是红海,音频生成也是红海,但音视频原生同步生成,还是蓝海 而且这个能力,恰好是搭建世界模型、实现真正多模态 AI 的关键拼图 更重要的是,他们选择了小模型路线 在大家都在卷参数量、卷算力的时候,文心用6.3B 做到了 SOTA 水平,这意味着他们在模型效率和工程优化上下了功夫 这对普通用户是好事,因为小模型意味着更低的使用成本、更快的推理速度、更容易的本地部署 NAVA 现在还在早期,但它代表的方向——让 AI 工具更轻、更快、更容易用,才是真正会改变普通人生活的技术路线 GitHub 项目地址: 论文地址: Hugging Face 模型页: #百度# #文心# #文心大模型# #NAVA# #大模型# #人工智能#
显示更多
0
16
21
1
转发到社区
收藏这35个免费实用网站,日常用起来超顺手 01. —— 一键永久存档任意网页 02. —— 转动地球,收听全球实时电台 03. —— 免费临时邮箱,保护隐私 04. —— 给未来的自己发一封邮件 05. —— 查找软件免费替代品 06. —— 查看网站使用的技术栈 07. —— AI 一键去除图片杂物 08. —— 免费处理 PDF、图片等文件 09. —— 在线 Photoshop 替代品 10. —— 全能 PDF 工具箱 11. —— 免费流程图、架构图工具 12. —— 无限手绘白板 13. —— AI 语音转文字 14. —— 自动整理会议纪要 15. —— 像改文档一样剪音视频 16. —— 快速录屏分享 17. —— 可视化自动化工作流 18. —— 自动连接各种应用 19. —— AI 一键抠图 20. —— AI 无损放大图片 21. —— 免费图片、视频、音乐素材 22. —— 免费可商用素材库 23. —— 思维导图、流程图工具 24. —— 开发者学习路线图 25. —— 免费系统学习编程 26. —— 编程文档聚合查询 27. —— JSON 可视化工具 28. —— Cron 表达式生成器 29. —— 特殊符号大全 30. —— 一键截取完整网页 31. —— 字数、阅读时间统计 32. —— 一键提取纯净食谱 33. —— 亚马逊历史价格查询 34. —— 产品说明书搜索 35. —— 尝试绕过部分网页付费墙阅读全文
显示更多
0
36
602
113
转发到社区
🚨卧槽!3个00后只用2个月,干出最强实时AI社交黑马 MaineCoon 是一个实时 AI 社交视频生成系统,你输入文字,它就能在 1 秒内生成对应的陪伴画面,音画同步、自然对视、表情切换都非常丝滑。 单张 H100 能跑到 47.5 FPS,部署成本据称只有 Veo 3 的 1/2000。支持超长时长对话,性格和上下文都不会崩。 核心能力: →子秒级实时交互(输入后不到 1 秒出画面) →流式音视频完美同步(嘴型、手势、表情、声线对齐) →超强长时记忆(能稳定跑千秒以上对话) →单卡民用部署友好 →专为真实社交感优化,在相关 benchmark 上速度和质量都很强 这个方向直接把 AI 从“生成内容”变成了“实时陪伴”,对 AI 伴侣、虚拟主播、游戏 NPC、数字分身等场景影响会很大。
显示更多
WanStreamer:阿里通义发布端到端实时交互基础模型,听、看、说、动在一个Transformer里 · 单一Transformer同时建模语言、音频、视频的输入与输出,靠block-causal attention实现增量式流式生成 · 模型侧响应延迟约200ms,叠加350ms网络延迟后总交互延迟约550ms,可支持亚秒级全双工音视频对话 · 当前版本分辨率仅192p,属于验证端到端设计的概念验证,后续可扩展到更高分辨率。未开源。 项目介绍:
显示更多
🚨阿里巴巴发布实时视频语音模型:Wan Streamer 这不是普通数字人。 它更像是让你和 AI 打一通“实时视频电话”: 你说话,它看着你听。 你打断,它能接住。 你表情变了,它也能反应。 半秒内接话,几乎没有冷场。 真正的重点是: 以前虚拟人是拼流水线: 语音识别 → 转文字 → 大模型思考 → 语音合成 → 表情驱动 → 视频生成 每一步都要排队,所以延迟高、互动僵硬。 Wan Streamer 直接把听、看、想、说、表情生成,塞进一个端到端大模型里。 一个 Transformer 直接处理实时音视频交互。 模型端响应约 0.2 秒,整体延迟约 0.55 秒。 这意味着 AI 不再只是“回复你”,而是开始像一个能实时交流的视频对象。
显示更多
在 xAI 联创陆续离职之时,xAI 公布了这段 45 分钟的内部全员大会录像,Elon Musk 主持,回顾了 xAI 过去 30 个月的成就、公司重组、团队介绍、基础设施进展,以及联合 SpaceX 一起绘制的未来新大饼🫓 1. 成立仅 2.5 年的 xAI 已取得惊人进步,而竞争对手(如 OpenAI 等)已有 5-20 年历史、更大团队和资源。 xAI 在语音、图像、视频生成(生成量已超过所有竞争对手总和);部署了首个 10 万 H100 GPU 训练集群,现已经接近 100 万 H100 等效算力。 科技公司竞争力在于“速度与加速度”,xAI 是最快的,无人能及。Elon 感谢了离职员工贡献,并宣布公司重组以适应规模增长(像生物从单细胞到多器官分化)。 2. 公司分为四大应用领域 + 基础设施层 - Grok 主模型 + 语音团队(合并):从零起步,6 个月内开发语音模式,超越 OpenAI;现已在 200 多万辆 Tesla 中运行。模型将极大提升知识工作者生产力(10 倍);将构建让用户轻松完成工作新“门户”; - 编码团队(Lead: Makro):编码模型已实用,能加速工程师 10 倍;路径通往递归自我改进(AI 训练下一代 AI)。2 - 3 个月内能达到 SOTA;年底可能直接生成二进制代码,绕过传统编程;与 SpaceX 合作解决算力/能源瓶颈; - 图像/视频团队(Imagine)(Lead: Tyler H. 等):6 个月前从零起步,现排行榜领先;生成 60 亿图像/月(远超 Google 等)。未来将实现更长视频(10-20 分钟一键生成)、实时渲染、交互世界。这个团队的目标是领先 Meta 抵达“元宇宙”,到时实时视频生成/理解将占大部分 AI 算力; - Macro Hard 团队(Lead: Toby, John 等):构建全能数字人类模拟器,能在电脑上完成任何人能做的事(包括工程、医学、设计火箭);聚焦 GUI 代理(80-95% 软件有图形界面);其目标是模拟整个只靠数字输出的公司(例如 Microsoft),这将带来巨大经济繁荣。 3. 基础设施与支持团队介绍 - 核心产品基础设施/API 将支持所有产品线; - 用领域专家(医学、金融、法律)评估模型,提升真实性和减少偏见;Grokopedia 已达 600 万文章,目标 Grok 5 无需外部搜索; - Memphis 超级集群已经支持了 30 万+ GPU,正在扩张;这是世界最大超级计算机之一;单个数据中心 6 周内完成 850 英里光纤、2.7 万 GPU安装;从架构到电力垂直整合,追求最高效率(PUE)。 算力优势是 AI 公司成功关键,xAI 部署最快! 4. X 平台的计划 - X App 用户超 10 亿(安装量);下载/参与度大幅增长;已经开源了推荐算法; - Grok Chat 将独立成 X Chat App(加密、音视频、多人、桌面分享);X Money 即将测试推出,目标是所有货币交易的中心。 5. xAI + SpaceX 的宏大愿景 - 理解宇宙需探索宇宙,当前地球能源仅用 1%,需扩展到太空获取太阳能量(百万倍潜力); - 计划建立地球轨道数据中心(100-200 GW/年,未来 terawatt);月球工厂 + 质量驱动器(mass driver,发射 AI 卫星,达千 GW+);抵达火星及更远的地方; 最终将延伸意识之光到恒星,探索银河系,发现外星文明遗迹。“未来从未如此激动人心” - Elon Musk
显示更多
0
16
175
44
转发到社区
《关于技术选型》 2020 年带一个创新业务,做的是异步视频沟通表达工具,可以理解为 loom + mmhmm 的结合。 印象很深刻,当时前端研发负责人,想在新项目上实践新的技术栈,采用了当时有点开始流行的 Rust 框架,但那时,Rust 生态很不完善,好用点的 UI kit 库都没有,一些功能的实现都得前端自己摸索,那时候两个全职前端同学,实现功能就很慢,而且存在各种还原度问题,性能问题,费了很大劲,磨了两个月才出第一版 Demo。 后来有一次我去剪映那边交流,他们也是做的桌面客户端,就问他们前端负责人技术栈选择问题,他们用的是 QT,算是老牌的做客户端应用的常用框架。 另一件事,当时大的团队主体是做音视频会议的,音视频会议用的是 RTC 传输,而新产品正好非常需要录屏视频快速上传和生成的能力,于是当时就使用了 RTC,结果导致录制完的视频,一方面清晰度不足,时不时因为网络波动,导致画面模糊;另一方面,黑屏、音画不同步,又花了很多时间尝试解决。 实际上,当时竞品采用的是简单的分段上传技术,就是每隔几十秒就上传一段录屏完的视频,然后服务器端合成一个视频,让用户感觉是速度很快,有媲美实时的感觉,另外也能保证视频的清晰度。 后来,我们做 Chrome 版,用市面上大部分竞品的技术方案,就花了 2 周时间,产品效果很好。 大部分不靠拼技术吃饭的创业团队,生死时速,业务为王。
显示更多
指挥 Codex CLI 干了四五个小时,把之前写的“网页音视频加速播放”油猴脚本改成了 Chrome 插件,已经提交商店审核。快速记录几点感受: 1. 聊四到五个小时,开始限制 token 了,不太够用,聊的过程中,感觉 token 消耗是个黑盒,不知道它在干什么 2. 当遇到报错时,会给它提供报错信息以及截图,但一开始总是有点不信任它能把问题搞定 3. 代码一旦改坏了,最想做的就是回到上一步,但上一步我给它安排了四五个任务,这时候要是只让它移除其中某段代码,又怕引出新的报错。事实证明,最稳妥的方式还是每个 feature 都独立进入 git 管理,否则回退会非常麻烦。feature 都进入 git 管理 4. codex 读代码读的实在是太认真了,以至于执行任务的速度特别慢,对于稍微复杂点的任务,或者同时布置了多个任务,需要 5~20min 才能搞定 5. 每次对话结束,我都希望它能自动把过程记录下来,但它做得并不好,总结的内容也很一般。 6. 80% 情况写出来的代码能直接跑;出错的那 20%,经过第二轮调教后大多也能跑通。 7. 看着它执行某个任务的空档,脑子里有了新的想法,会想让它并发执行很多任务,但又担心它处理不过来。 8. 95% 都是 AI 写代码,但有些问题它排查得实在是太慢了,会忍不住自己上手,比它要快很多。 9. 有部分任务它处理的并不好,例如让它生成 svg 图标,效果很差。 10. 表达清晰很重要,如果任务描述的过于抽象,它可能会理解错,如果跟他沟通的时候,具体到函数名或 DOM id,它的处理基本会更准确。 以上遇到的问题,基本都找到了好的解法,等后面整理了再分享。还是要多用,才能不断优化工具的使用。 总的来说,整个项目完成的速度已经是我自己的 5 倍以上,因为省略了学习陌生知识的时间。说实话,一个月花 2~3k 在 AI Coding 上,完全是值得的,相当于给自己找了个外包。
显示更多
0
16
249
17
转发到社区
最近看到了一个开源工具 Zotero,用了一段时间,感觉挺不错的,它是一个学术文献管理工具,支持一键导入论文、自动生成引用和参考文献、批注笔记和标签分类。 并且可以多端同步(桌面端、浏览器插件、移动端和网页端),让论文管理和检索变得非常轻松,文献下载后,也支持离线阅读和批注。 现如今“看论文”这项活动,已经不局限在学术圈,大厂的算法、工程师,包括产品经理也会关注最新的研究成果,很多创新和实践是可以直接被用到工业界的。 我过去两年看的论文数量就有一百多篇了,大部分是主题式学习,例如大模型基础、Prompt 优化、音视频处理、Agent 增强等等,但好多论文看了之后忘了名字也找不到了🥲,一直想搞个工具管理下,Zotero 基本可以满足需求。 另外再推荐一个 github 项目,zotero-arxiv-daily,这是一个基于 Zotero 的自动论文推荐器,它会根据你已有的文献偏好每天从 arXiv 获取最新论文,通过语义匹配和摘要生成筛选出高相关内容,并以邮件形式推送,非常适合想要持续跟进前沿研究的人。
显示更多
0
7
271
54
转发到社区
现在轮到我开始照顾老人们睡觉了 刚去我妈房里给她关了台灯和手机视频 这已经不是第一次了 她经常看着抖音视频睡着了