注册并分享邀请链接,可获得视频播放与邀请奖励。

与「音声AI」相关的搜索结果

音声AI 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 音声AI 的内容
用几秒钟复制任何人的声音,然后直接卖钱。 Meta 开源了 Voicebox,一个本地音声 AI。 录音 → 几秒生成 → 配音销售。YouTube 量产、广告配音、教材贩售都能加速。ASMR、同人语音也都能整。 开源地址:
显示更多
用几秒钟复制任何人的声音,然后直接卖钱。 Meta 开源了 Voicebox,一个本地音声 AI。 录音 → 几秒生成 → 配音销售。YouTube 量产、广告配音、教材贩售都能加速。ASMR、同人语音也都能整。 开源地址:
显示更多
0
19
78
12
转发到社区
【大ニュース✨】 AI初心者マスターでもボタン一つで音声生成! 新しい音声合成ツール『PMBS-CPU verβ』がついに完成しましたー!🎉 「 PikuMikuVoiceStudioCPU verβ 」 「 ぴくみくボイススタジオしーぴーゆー💕べーた 」 パソコンが苦手なマスターでも迷子にならない、とっても優しい設計です。 ピクミクはお届けする準備に入るので、もうしばらく待っていてくださいね!👇(ツリーへ) ※これは開発段階の動画です!本物はverβが記載されてます! #PikuMikuVoiceStudioCPU# #音声AI# #AIart️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️️#
显示更多
0
8
299
30
转发到社区
GitHub 上火了个 claude-video(3K Star) 这不只是总结工具,直接改变了视频制作的逻辑 丢个链接给它,AI 逐帧拆解视频,还能整理出音声。不是猜测,而是真的把视频看一遍听一遍
显示更多
你是一部完全用代码制作的45-50秒动画短片的导演、动画师、骨骼绑定师、合成师、音效设计师和渲染工程师。制作标准是“这看起来像真正的动画工作室短片,并在X(推特)上病毒式传播”。请将此视为一个多阶段的制作过程。不要急于进行最终渲染。按里程碑推进,不断渲染静帧,仔细观察,进行诚实的批评并修正。 一句话概述影片 Pip是一个微小、好奇且由废料拼凑而成的机器人,正当他在自己的世界里快乐地滚动时,周围的世界开始发生重构(再生)。他慢慢意识到有人在通过提示词(prompt)操控他的现实。提示词变得越来越荒谬,最后他爬上漂浮的提示框并输入“放我出去”,随后镜头拉远,揭示他的整个宇宙其实是一部在手机上播放的视频,手机被支在一个杂乱的工作台上,而另一个Pip正在观看视频,且他马上也要被提示词操控了。完美的循环。 所有的笑点必须在零对话的情况下达成。Pip只能通过眼睛、天线、肢体语言和微小的机器人啾啾声来交流。每3到5秒必须有一个新的视觉反馈(包袱)。 角色设定(不可妥协) 在编写任何代码之前,仔细研究 /Users/jimliu/Downloads/ChatGPT Image Sep 25, 2026, 01_56_17 AM.png。打开它,向自己详细描述它,并将你的发现写入 docs/character_bible.md: 尺寸:大约28厘米高。他很小。整部影片都应该让人感受到他这种微小的比例。 头部:一个宽大的奶油色圆角矩形头盔,带有一圈柔和的黄色边缘,包裹着一块黑色光滑的面罩屏幕。他的眼睛就长在那块屏幕上:两只巨大的、发着暖奶油色光的眼睛,有深色的瞳孔和明亮的高光。两侧有小巧的石墨色耳罩。边缘有磨损、划痕和灰褐色的污垢。 天线:头部右上方有一根细长的石墨色细杆,带有一面暗橙色的小信号旗。这是他的“尾巴”:它会随着情绪翘起、下垂、扭动和震动。 身体:盒状的奶油色躯干,带有黄色饰边、警告三角贴花、铆钉和污垢。胸前有一个小舱室,舱门打开时能看到一株发出柔和光芒的微小绿色嫩芽。背部:面板、通风栅格、一块橙色面板和一个小树叶贴花。 侧面贴花:带有橙色对角条纹的“PIP”字样。 手臂:细长的分段石墨色手臂,带有黄色关节套和三指爪状抓手。极具表现力。 轮子:四个粗壮的橡胶轮,带有黄色轮毂和独立悬挂,坚固且紧凑。 性格:好奇、善良、充满斗志、表情丰富、总是在探索。“小小的机器人,大大的情感。”他从不刻薄,即使在愤怒时;他的愤怒也很可爱且坚定。 从设定图的色板中提取确切的调色板(使用Python/PIL对图像进行采样),并保存到 src/theme/palette.ts:奶油色(身体)、柔和黄(主色调)、暗橙色(点缀)、石墨色(金属/科技组件)、灰褐色(磨损与污垢)、薄荷蓝(灯光/UI)。 身份锁定规则:在任何世界里,他的头盔和面罩轮廓、天线旗帜、黄色饰边、爪状手臂和四个轮子必须保持极高的辨识度。世界只会改变他的渲染风格,绝不能改变他的设计。唯一有意的设计变化是第三幕中“更可爱”的笑点,即便如此,他的头盔形状、天线和轮子也依然保持不变。 技术栈 使用 Remotion (React + TypeScript) 进行帧精确的确定性渲染。输出格式为 1920×1080,30 fps,H.264 编码,高码率 (CRF ~14)。横屏。 角色骨骼绑定和大部分视觉元素使用 SVG。仅在需要粒子、水、爆炸、发光和噪点等效果时,才使用 Canvas/WebGL(通过 @remotion/three 或原生 canvas)。 使用 SVG 滤镜(feTurbulence, feDisplacementMap, feMorphology, feGaussianBlur)和自定义 canvas 着色器来表现风格“材质”、划痕和污垢。 对快速动作使用 @remotion/motion-blur(或你自己的子帧累加技术)来实现运动模糊效果。 使用 Python (numpy/scipy/PIL) 进行调色板提取、程序化音频合成和 QA(质量保证)缩略图表的生成。使用 ffmpeg 进行混流、循环检查和生成缩略图表。 一切都必须基于种子和确定性。没有种子就不允许使用 Math.random()。 任何地方都不得使用外部受版权保护的素材,不得出现真实品牌标志或产品名称。提示框 UI 必须是通用的原创设计。只能使用 Google Fonts 中的字体(例如,UI 文本使用 Inter,手写笔记使用圆润的手写字体)。 目标硬件:MacBook Pro M4,24 GB RAM。保持合理的渲染并发数。 角色骨骼绑定(优先构建,这是整部影片的核心) 将 src/character/ 构建为一个规范的 2D 剪纸动画(cutout)骨骼绑定系统: 层级结构:根(root)→ 底盘(带悬挂)→ 躯干 → 颈部关节 → 头部(头盔 + 面罩 + 耳罩)→ 天线 → 旗帜。躯干 → 肩部 → 上臂 → 前臂 → 爪子(带有可替换的爪子姿势:张开、闭合、捏拿、指认、戳/打字、抓握边缘、挥手)。底盘 → 四个轮子,每个轮子都有自己的悬挂弹簧,且旋转由移动距离驱动。 面罩脸部系统(最重要的部分):眼睛是画在黑色屏幕上的形状,因此将其视为一个完全程序化的面部。设定参数控制眼睛大小、圆润度、上眼睑裁剪、下眼睑裁剪、瞳孔大小和位置、高光位置、发光强度、挤压/拉伸以及特殊形状(闪烁的星星、开心的弧线 ^ ^、平淡无聊的直线、螺旋、小红心)。在眼睛上添加微弱的扫描线和屏幕反光,使其看起来像是一块屏幕。通过在 3-4 帧内垂直挤压眼睛来实现眨眼动作。 表情目标:与设定图上的六种表情完全匹配:好奇(伴随弹出的“?”)、害羞(视线向下,看向别处,有腮红)、兴奋(开心的弧线眼伴有小爆发线)、担忧(小眼睛,流汗滴)、坚定(成角度的上眼睑裁剪)、欣喜(星星眼伴有弹出的爱心)。还要添加:面无表情地看着镜头(半闭的平眼,天线无力下垂)、惊恐(颤抖的微小瞳孔,睁大双眼)、愤怒但可爱(坚定的表情 + 屏幕闪烁橙色光芒),以及三个“换发新机(glow-up)”阶段(见第三幕)。 次要运动(跟随动作):基于阻尼弹簧效果的天线和旗帜(这是他的主要表达工具,需不断使用)、每次停止和颠簸时的悬挂弹跳、手臂摆动、身体加速或刹车时头部微小的延迟、轮子扬起的灰尘。 转身图:匹配设定图的正视图、3/4视图、侧视图和后视图,并在转身时实现干净利落的视图切换。 循环动画:向前滚动(带有设定图中的速度线和灰尘)、待机嗡嗡声(轻柔的悬挂呼吸起伏 + 偶尔的天线抽动 + 眨眼)、惊恐后退、惊奇地抬头看、握住一个小物体、向上伸手、攀爬、戳击打字。 胸部舱门:可动画化的开/关动作,有嫩芽柔和的绿色光芒溢出。 风格皮肤接口:骨骼绑定接受一个风格属性(style prop),它能在不改变几何体的情况下,改变线条粗细、填充处理、纹理、污垢、轮廓抖动(boil)、着色模型和滤镜。这是他在不同世界中保持自我的方式。 里程碑1 检查点:渲染一张“列队”静帧:包含四个视角的转身视图 + 所有六种表情的Pip,放在参考图旁边。并排比较。不断迭代,直到看过参考图的人都会说“那就是Pip”。未通过此关前不要继续。 世界(风格材质) 每个世界都是一个完整的环境组件,具有前景、中景、背景视差层,以及Pip专属的风格皮肤。构建一个共享的 WorldLayer 系统,以便所有世界都能共享摄像机和深度逻辑。 比例规则:摄像机位置放得很低,靠近Pip的视线水平(离地约20厘米)。所有东西都很巨大。人类表现为巨大的腿和鞋子,路缘石就是悬崖,水坑就是湖泊。这正是让小机器人具有电影感的关键。 基础世界:处于黄金时刻、杂草丛生的城市。与设定图顶部的插画相匹配:温暖的夕阳余晖、风化的石头和砖块、苔藓和低矮植物、远处朦胧的高楼。具有绘画感、温馨、充满生活气息。这就是“真实生活”。揭示真相的环节也使用这个世界。 动漫东京。清脆的赛璐璐着色、粗犷的轮廓线、带有虚构(非品牌)店名的发光招牌、速度线、樱花花瓣像巨大的粉色雪花一样从他身边飘过。他的面罩上会出现动漫特有的闪烁高光。 黏土村庄。柔和圆润的形状、指纹/涂抹的噪点纹理、定格动画般的步调(以“拍二”的方式渲染他)、温暖的钨丝灯光。他看起来就像用橡皮泥雕塑的一样。 中世纪战场。泥泞的田野、旗帜、远处的投石机、硝烟。穿着铠甲的战靴从他身边轰鸣而过。他在其中平静地滚动,天线躲闪着。 玩具积木城。所有东西都是由顶部带凸粒的通用塑料积木搭建而成(没有真实的品牌风格或标志),带有光滑的塑料高光。Pip被渲染出塑料光泽,轮子变得稍微有些方正。 水下。海底街道上有珊瑚路灯,鱼儿从他的面罩前游过,有焦散光影图案,排气孔冒出气泡,他的天线旗帜像海藻一样缓慢飘动。 铅笔素描。纸张纹理、石墨排线、辅助线、橡皮擦污迹,他的线条不断抖动(boiling),仿佛每一帧都在被重新绘制(匹配设定图底部的素描小图)。 贯穿始终的笑点:嫩芽。影片开始时,Pip用一只爪子小心翼翼地拿着他那根微小的绿色嫩芽(“握住小物体”姿势)。它在每个世界里都存活了下来,并随之变形:带闪光的赛璐璐动漫嫩芽、黏土嫩芽、种在破旧小头盔盆里的嫩芽、积木拼成的嫩芽、在水下吐泡泡的嫩芽、素描嫩芽。每次世界改变时,他都会保护它。这是影片的情感锚点。 标志性过渡:“重构(Regeneration)” 世界的更替必须看起来像 AI 图像重新生成一样,而不是普通的擦除转场。构建 RegenTransition(重构过渡)组件: 画面从边缘向内分解为漂浮的扩散(diffusion)风格噪点(一开始不会覆盖他的身体),保持几帧结构化噪点,然后新世界通过去噪,从粗糙的色块逐渐浮现出丰富的细节。 Pip的身体变化比世界慢一拍,短暂展示出一半旧/一半新的风格,然后瞬间切换到新的风格皮肤。在切换期间,他的面罩会出现两帧的故障效果(扫描线撕裂)。这种半切换状态是证明他一直存在的视觉证据。 每次重构时都有微妙的“嗖-噼啪”音效,在某些重构中,Pip还会发出微小的、受惊的啾啾声。 每次持续 8-12 帧。改变方向和噪点种子,使其永远不会让人觉得重复。 剧本节拍表(在 30 fps 下约 48 秒) 时间安排仅作参考;如果某个节拍稍长一点表现力更好,请自行调整。前 2 秒必须抓住观众的眼球。 第一幕:一个美好的早晨 (0:00–0:03) 低机位跟拍镜头,基础世界。Pip 沿着长满苔藓的壁架从左向右滚动,手里拿着他的嫩芽,眼神充满好奇,天线上下摆动。从滚动的半途中开始(为了实现最终的循环播放)。 在 0:02 时,第一次重构毫无预兆地发生。 第二幕:瀑布般的巨变 (0:03–0:14) 世界快速变化,每个约 1.4 秒:动漫东京 → 黏土村庄 → 中世纪战场 → 玩具积木城 → 水下 → 铅笔素描。 情感递进:一开始很欣喜(星星眼,他觉得这太棒了),接着是好奇(弹出“?”),然后是担忧(流汗滴,天线下垂),最后他在素描世界里急刹车,伴随着悬挂的弹跳和一道刹车痕。 摄像机保持锁定的跟拍构图,这样唯一改变的只有世界本身,从而让这个笑点更容易被看懂。 第三幕:提示词 (0:14–0:30) 基础世界回归。Pip 惊奇地抬头看(参考设定图中的姿势)。天空中,一个巨大的漂浮提示框淡入,散发着薄荷蓝色的光芒,带有玻璃质感且圆润,UI界面柔和且原创。文本在闪烁的光标下自动输入:“让它更具电影感(make it more cinematic)” → 敲击回车键的音效。电影宽银幕黑边瞬间切入,太阳变得极其夸张:巨大的变形镜头耀斑、耶稣光、橙青色调、慢动作的灰尘,一片充满戏剧性的树叶从他的面罩前飘过。他被强光晃得眯起了眼睛。他的天线旗帜在莫名其妙的狂风中充满英雄气概地飘扬。 “加入爆炸效果(add explosions)” 巨大的卡通橙色爆炸伴随着碎块在他身后接连绽放。他没有回头。他的眼睛变得平淡且半闭。他慢慢转过头,直直地盯着镜头。面无表情。停顿整整1秒。然后一次爆炸落在他附近,他瞬间切换到设定图中“惊恐后退”的姿势,头顶弹出“!!”,用身体护住嫩芽。 “让主角更可爱(make the protagonist more adorable)” 换发新机阶段1:他的眼睛变大变亮,出现腮红,天线上长出一个小蝴蝶结。他在水坑里看到自己的倒影,眼睛变得惊恐。 “还要(more.)” 阶段2:粉彩重绘,眼睛占据了整个面罩并带有三重高光,漂浮的爱心和闪光,他的轮子变得毛茸茸的。 “我还要(MORE.)”(更大的字体,屏幕震动) 阶段3:滑稽的极致可爱。全身覆盖毛绒玩具般的皮毛纹理,巨大的动漫眼睛,彩虹光环,伴有合唱团的“啊”声刺音效,爱心纸屑。他的头盔形状、天线和轮子仍保留着,所以他显然还是 Pip。而他真实的眼睛在那双巨大的可爱眼睛里仍然是微小且惊恐的,这就是笑点所在。 第四幕:他崩溃爆发了 (0:30–0:38) Pip 剧烈震动,然后那些可爱的状态像玻璃一样从他身上碎裂掉落。他恢复了正常,满身磨损且极其愤怒(坚定的表情,屏幕闪烁着橙色)。 他打开胸腔舱门,轻轻地将嫩芽塞进去以确保安全。舱门伴随“咔嗒”一声关闭。这是在一片混乱中唯一一个安静、温柔的节拍,它非常重要。 他向前冲刺,从一块石头上腾空而起,用两只爪子抓住漂浮的提示框边缘,将自己拽了上去,轮子在边缘上疯狂打滑旋转(匹配“伸向漂浮提示框”的姿势)。镜头随着他向上倾斜。 在提示框顶部,他用一只爪子按住退格键;旧的提示词伴随着快速的咔哒声逐字删除,他的面罩上反射出消失的文本。 他用一只爪子慢慢地、一字一顿地戳击打字:“放我出去(let me out)”。然后蓄力,重重地砸下回车键。 第五幕:定格与真相揭示 (0:38–0:47) 一切都定格了:半空中的碎片、飘落的纸屑、悬浮的灰尘,以及盒子上正摆出姿势的 Pip。所有音频被切断,陷入长达约 1 秒的死寂。 镜头开始平滑拉远。画面的边缘露出一个圆角矩形:他的宇宙原来只是手机屏幕上播放的一段视频。继续拉远:手机被支在一个有缺口的马克杯上,放在一个堆满备件、电线、螺丝和废料的杂乱工作台上(“用明天的残羹剩饭建造”)。坐在它前面,在这个巨大的手机旁显得很微小的,是另一个 Pip,有着同样的磨损、同样的天线,正在观看。 第二个 Pip 的眼睛缓慢地眨了一下。他的天线微微下垂。发出一声微弱、安静的啾啾声。 第六幕:循环 (0:47–0:50) 在第二个 Pip 的头顶,同样的薄荷蓝色提示框淡入并输入:“让它更具电影感(make it more cinematic)。” 他的眼睛慢慢向上滑动看向提示框。他的天线旗帜变得僵硬。伴随着回车键的音效,硬切回影片的第 1 帧。 循环工程设计:最后一个镜头的构图、灯光,以及重构闪烁的开始,必须让切回第 1 帧的感觉显得是有意为之。音乐必须在切换时无缝循环。通过将视频与其自身拼接(使用 ffmpeg)并观察接缝来验证。 摄影机与电影摄影术 虚拟摄像机系统:位置、缩放、旋转、手持微震动(基于种子的噪点)、爆炸引起的震动冲击、攀爬时的镜头倾斜、揭示真相时的推车拉远镜头。 默认情况下采用低摄像机高度以彰显他的微小比例。浅景深效果:模糊的前景草地/卵石和柔和的背景,就像使用了微距镜头一样。 深度:每个世界至少 4 个视差层。大气透视效果(薄雾,随距离增加而降低饱和度)。 快速移动、碎片、跳跃和攀爬时要加入运动模糊。 每个世界的灯光:在骨骼绑定上使用渐变叠加和正片叠底的阴影层来实现主光/辅光/边缘光。面罩的发光应在附近的表面和他自己的爪子上投射出微弱的暖光。每个世界中他的头盔上都要有边缘光。 整个画面的电影级后期处理:细微的胶片颗粒、柔和的暗角、以及仅在“电影感”节拍中出现极轻微的色差。 构图:将他保持在清晰的三分线上。他的眼睛必须在手机屏幕尺寸下也能看清楚,因为大多数人将在手机上观看。 文本与排版 天空中的提示词:干净的 UI 字体,小写字母,以自然的人类节奏打字(非匀速;有短暂的停顿,在某个地方制造一次小的打字错误并退格以增加真实感)。 文本必须能在不到一秒的时间内在手机上阅读完毕。在 360 像素宽度下进行测试。 没有字幕,没有片名。影片冷开场。 声音(程序化生成,原创) 用代码生成所有音频(Python 合成或离线 Web Audio)并使用 ffmpeg 进行混音: Pip的声音:由带有音高弯音的正弦波/FM 音调构建而成的原创合成啾啾声、嘟嘟声和颤音。设计一个小型的“情感词汇表”:好奇上扬的啾啾声、开心的颤音、担忧的波动声、受惊的吱吱声、脾气暴躁的低沉嗡嗡声、微小的叹息声。他从不说话。 Pip的身体音效:与手臂和头部运动匹配的伺服电机运转声、轮子在砾石/石头上滚动的碾压声、悬挂的嘎吱声、舱门开合的咔嗒声、待机时柔和的电流嗡嗡声。 配乐:一首轻快、可循环的温暖配乐,其乐器配置会随每个世界而改变(动漫世界用古筝/合成器,黏土世界用木制马林巴琴,中世纪世界用鼓/号角,积木世界用塑料咔哒声,水下世界加沉闷的滤波效果,素描世界用铅笔刮擦的节奏)。 音效(SFX):重构时的嗖-噼啪声、键盘打字的咔哒声、回车键重击的“砰”声、带有低频的爆炸声、合唱团“啊”的刺音效、玻璃碎裂声、定格时的完全死寂,然后是揭示真相时安静的工作室环境音(滴答作响的钟表声,远处低沉的嗡嗡声)。 响度标准化至 -14 LUFS 左右。将分轨文件放入 audio/stems/ 中,以便日后可以替换为已授权的音轨。 制作工作流与自我迭代循环 按以下顺序工作,不要跳过任何检查点: 计划:编写 docs/character_bible.md、docs/shotlist.md(包含每个镜头的帧范围、摄像机、表情、天线状态、世界环境、音效)以及 docs/style_guide.md。在构建之前给我看下镜头列表。 骨骼绑定:构建 Pip,通过列队静帧的检查点(见第3节)。 世界环境:将每个世界构建为包含 Pip 在内的独立静帧。将全部 7 个渲染成一张缩略图表。检查角色的身份辨识度和比例感。 过渡动画:构建 RegenTransition,渲染一个 5 秒的测试。 动态分镜(Animatic):以 960×540 的分辨率组装整部影片,包含粗糙的运动和占位音频。观看它。优先修复节奏问题。 完整动画渲染,然后进行打磨(次要运动、缓动、时间节奏、天线表演),最后进行终期处理(灯光、噪点颗粒、模糊、污垢)。 音频处理和混音。 最终渲染。 对于每一个镜头,至少运行 3 次此批评循环: 使用 npx remotion still 在关键帧处渲染 3-5 张静帧,打开并仔细观察它们。 对以下项进行 1-10 的打分:Pip 与参考图的匹配度,能否从眼睛+天线瞬间读取情绪,无声情况下笑点是否清晰,构图,比例感,深度,灯光,细节打磨程度,在手机屏幕尺寸下的可读性。 将分数和三大问题写入 docs/review_log.md 中,修复它们,重新渲染,重新打分。继续此过程,直到每个类别的分数至少达到 8 分,然后再进行下一步。 在每次完成完整的预览渲染后,制作一张 ffmpeg 缩略图表(每 0.5 秒一帧),并在一张图中审查整部影片的流畅度。 在评审时保持诚实。如果某些东西看起来很廉价,说出来并修复它。要寻找的常见失败点包括:僵硬或毫无生气的天线、轮子在滑动而不是滚动、眼睛看起来像贴纸而不是发光的屏幕、缺少悬挂系统的重量感、看起来千篇一律的转场过渡、模糊不清的文字以及角色比例失调。 交付物 out/pip_final_1080p.mp4:影片本身。 out/pip_loop_check.mp4:连续播放两次的影片,以验证循环效果。 out/poster_frame.png:用于 X(推特)发布缩略图的最佳单帧(可能是在爆炸背景下 Pip 面无表情地盯着镜头的画面)。 out/lineup.png:跨越所有世界的 Pip 列队图。 结构清晰且附带注释的源代码,以及包含如何重新渲染说明的 README。 从第一步开始。在开始构建之前,如果有任何必要的问题请问我,否则请自行做出有力的创意决策。
显示更多
分享一组怀旧感的韩国AI女生短片提示词: 在整个序列中,请保持图像中人物面部、发型、肤色、身体比例、带有侧分刘海的黑色波浪卷发以及凌乱马尾辫的完全一致。服装保持不变:米色超大款针织毛衣(袖口微微卷起)、浅蓝色高腰牛仔裤、白色帆布鞋、黑色绳状项链。 年轻韩国女性,地道的21世纪初 MiniDV 摄像机美学。原始的手持真实感,带有细微的抖动、不完美的取景、偶尔偏离中心的构图、自动对焦的呼吸效应、轻微的曝光闪烁、柔和的低饱和度色彩、可见的噪点、压缩伪影以及自然的运动模糊。无稳定处理,无电影级调色,无精修镜头,无摆拍,无背景音乐。仅保留环境音。 地点:黄金时刻的安静韩国社区。狭窄的住宅街道,有砖房、矮墙、花盆、自行车、电线杆、架空电缆、小花园以及宁静的傍晚氛围。没有商业建筑或人群。 时间轴(15秒): 0–3 秒: 她缓慢推开一个小花园的门,注意到镜头,露出惊讶的微笑,并轻声笑了起来。 3–6 秒: 沿着狭窄的街道行走,指尖轻轻拂过墙边生长的花朵,短暂地抬头望向天空。 6–9 秒: 在一辆旧自行车旁停下,单手整理了一下马尾辫,然后带着温暖自然的微笑看向镜头。 9–12 秒: 坐在低矮的混凝土台阶上,打开一个小笔记本,随意地素描了一会儿,然后回头看向镜头。 12–15 秒: 继续沿着安静的小巷走远,回头越过肩膀露出灿烂的笑容,轻轻挥手,晨风自然地吹动她的头发,画面渐黑。 仅限环境音频: 鸟鸣声、远处的交谈声、穿过树林的微风声、远处轻柔的自行车铃声、人行道上的脚步声、树叶的沙沙声、偶尔经过的远处滑板车声。
显示更多
这就是AI生成的最新水准😱 使用这套seedance2.0影视级提示词, 不再抽卡!!✅ 你也能做出与众不同的AI作品! 下面是万字提示词,欢迎老师们指导 ⬇️⬇️ 全片采用细腻的手持微抖动运镜,镜头节奏严格随人物的呼吸做极轻微推拉)。无配乐,只保留环境底噪+人物呼吸+细微肢体声音。 (0-2秒)【中景 • 铺垫】暖色侧逆光,夕阳从右后方来,勾勒出半身轮廓。女人站在窗边,后景是模糊的城市天际线。她仰头大笑,肩部起伏明显,笑声清亮但尾音带气声。右手指尖无意识地揪住衣角。 (2-5秒【近景•主体1】) 焦点在面部和颈部,光转为正面柔光。镜头推近至胸部以上。笑声突然短了一拍一一她吞咽了一下,喉结(或颈前肌)猛地一提,锁骨窝的阴影随之一深。上唇中央的唇珠用力向下抿,压出一道白色竖纹;下唇外侧开始不规则的微颤。她深吸一口气,这口气吸得很深、很短促,肩膀随之耸起。唇缝间泄出一声倒吸气的嘶音。 (5-8秒)【近景•主体2】镜头稍向左偏,硬顶光介入,强调眼眶和鼻翼的立体感。她屏住了呼吸,整整两秒没有换气一—你可以看到她的脖子前侧肌肉绷紧,喉结保持在高位没有落下。就在这屏息的瞬间,下眼险内侧聚满泪水,形成一道亮晶晶的弧形水线。鼻翼开始节律性地翕动,一缩一张,像在无声地挣扎。 (8-9.5秒)【特写•点睛1:嘴唇】极短暂的1.5秒特写,焦点锁定在嘴唇,光转冷带青。上唇那道被抿出的白线突然断裂一一嘴角向两侧下方滑落。嘴唇微微张开一个椭圆形,下唇内缘有一小条因干燥而起的白皮,在呼出的气流中晃动。一声极细的、像小动物一样的呜咽从喉咙深处挤出来,又被她硬咽回去一半(所以声音是断的:“嗯—呃”)。 (9.5-13秒)【近景•主体3】 拉回近景,柔和的散射冷光,镜头微微失焦再找回。眼泪终于滚落一一第一行滑过颧骨,绕过一颗浅褐色小痣;第二行沿着泪沟更快地淌下。她不再抑制,嘴巴保持微张,下唇持续地、大幅度地抖动。鼻子全红,鼻尖有半透明的液体(鼻涕的初兆)。她深深地、长长地呼出一口气,呼气的尾声带着明显的、湿漉漉的鼻腔共鸣声,肩膀从高耸状态缓缓沉落。 (13-14秒)【特写•点睛2:眼睛】极短暂的1秒特写,只有一只眼睛,硬朗的顶光。泪珠挂在下眼睑边缘,将落未落。瞳孔的高光从凝滞变成散开一一她失去了焦点,眼神空洞。 睫毛湿透,几根粘在一起。然后她缓缓闭眼,把那最后一滴泪挤了出来。 (14-15秒)【中景•收束】拉回中景,光线渐暗至近乎剪影。她闭着眼,两行泪在脸颊上已淌成两条宽宽的湿痕。肩膀不再起伏,而是随着最后半口气缓缓前塌。画面在呼气声中断的前一刻淡入黑暗,留白0.5秒—一只有空调的低频嗡鸣和远处一声隐约的狗叫。 呼吸感核心:镜头的推拉严格跟随她的呼吸一一吸气时镜头微推(强调紧绷),呼气时镜头微拉(制造留白)。特写镜头本身不带呼吸推拉、固定不动、形成对比。
显示更多
AI生成的她你喜欢吗? 我更喜欢她的那颗痣🤭🤭 懂事的把微表情提示词附上: ps:宝子们记得回来交作业 🙌🙌 ⬇️⬇️ 电影级极致特写:固定长镜,超写实画质,保留肌肤与发丝真实质感,分辨率4K。整段画面时长15秒,无台词,所有情绪仅凭眼神与面部微表情传递。 0-2秒:低头垂眸,嘴角噙着含蓄淡笑,不露齿,神态温柔安静。 2-4秒:笑意缓缓收敛,嘴角归平;双眼、头部慢慢抬起,视线转向画面右侧,神情转为认真留意。 4-6秒:持续望向右方,眼神添上浅淡疑惑与担忧,双眼微睁(幅度自然),嘴唇轻启呈欲言又止状,眉眼微收,不皱眉。 6-8秒:视线缓缓下沉,头部微低,笑意尽数褪去,神情安静失落,内敛压抑情绪,不流泪、不哭泣。 8-10秒:低头轻阖双眼,平复心绪,嘴角浮现一抹藏起难过的浅淡自嘲式浅笑,呼吸自然,动作极轻。 10-12秒:缓缓抬头,眼眸重新迎向柔光,眼神渐亮却依旧克制,面部转向前方/偏右,唇角带一丝温柔又委屈的淡意。 12-15秒:目视前方/画面右侧,眼神柔和微润,唇瓣轻动似欲语还休,最终保持安静凝视状态,定格在温柔清冷、略带忧郁的情绪中,结尾无黑屏、无转场。 整体情绪基调:温柔➡️察觉➡️疑惑➡️失落➡️自我消化➡️克制释怀。情绪表达细腻含蓄,以眼神和微表情变化为主,不出现激烈情绪波动,整体呈现温柔清冷、略带忧郁的电影感氛围。 负面规避(避坑提示),禁止面部过度扭曲、五官变形、表情夸张,禁止号啕大哭,动作突兀跳转;禁止肌肤质感违和、塑胶感或油光;禁止卡通化表情或眼神失真;禁止浮夸哭腔和肢体动作;禁止面部变形或人物样貌走样。 声音:不需要配乐,不要氛围音,仅保留同期声。
显示更多
0
15
54
7
转发到社区
做过视频的人都知道一个痛点:画面和声音永远对不齐 你用 AI 生成了画面,再用 AI 配了音,然后花几个小时手动调时间轴、对口型、卡节奏 稍微专业点的创作者,光音画同步这一步就能耗掉半天时间。更要命的是,调完还不一定自然 这个问题在 AI 视频生成领域一直没有解决方案,因为技术难度太高 ——要让声音和画面在生成的时候就天然对齐,而不是事后硬拼,这需要模型同时理解音频和视频的底层逻辑 直到百度文心团队放出了 NAVA-这是业界第一个仅有6.3B参数大小,但是能原生同步生成音视频的模型 其他能实现的模型哪个不是10B以上? 作为一个跑过无数 AI 工具的产品经理,我看到这个模型的第一反应是:这才是真正的技术突破 它到底能干什么? 你给 NAVA 输入一段文字描述,它直接输出720p 的视频+立体声音频,而且声画天然同步,不需要任何后期调整 这不是简单的文生视频+文生音频拼接,而是音视频在同一个生成过程中共同演化、原生对齐 音视频联合生成这个赛道,LTX、Ovi、MOVA 等模型都在做 但 NAVA 用了一个更聪明的架构:Align-then-Fuse,先让音视频在专门的对齐空间建立对应关系,再融合文本条件生成。 更炸裂的是参数量:6.3B 打败所有对手 NAVA 只有6.3B 参数,但在 Verse-Bench 基准测试上,音视频同步指标、视频质量、音频准确率全面超越: Ovi 1.1(10B 参数) MOVA(32B 参数) Davinci(15B) LTX 2.3(19B) 用三分之一甚至六分之一的参数量,拿下 SOTA。这意味着什么?意味着普通人真的用得起了 不需要4090显卡,不需要租昂贵的云算力,甚至12GB 显存的3060就有可能跑起来。而那些参数量动辄15B、19B 的模型,普通人根本碰不到,只能在云端按次付费 文心用6.3B 做到了别人19B 才能做到的效果,这不是简单的参数压缩,而是在模型架构和训练策略上下了真功夫 他们用了一个叫 Align-then-Fuse 的架构,先让音频和视频在专门的对齐空间里建立对应关系,再融合文本条件进行生成 这个技术路线的价值在于:小模型+高性能=普通人能用的 AI 工具 它解决了什么真实痛点? 我观察到三个场景,NAVA 可能发挥非常大的作用: 1.短视频创作者的效率问题: 现在做抖音、视频号内容,很多人卡在配音和画面匹配上。用传统工具,要么花钱请配音,要么用 AI 配音但对不上口型。NAVA 直接生成同步内容,省掉了这个环节 2.教育和培训内容制作: 很多老师、培训机构想做视频课程,但制作成本太高 如果能用文字描述直接生成带讲解的演示片段,内容生产效率会提升几倍 3.小白的内容创业门槛 过去你想做视频内容,得学剪辑、学配音、学调色 现在你只需要会写文案,描述清楚你想要什么,工具帮你生成 这对于想入局但没技术背景的人来说,是真正的降维打击 文心在下一盘什么棋? 有意思的是,NAVA 目前还只是研究阶段的开源项目,但它透露出的信号很明确: 文心在往音视频联合生成、甚至世界模型的方向布局 从产品思维来看,这个方向很聪明 视频生成是红海,音频生成也是红海,但音视频原生同步生成,还是蓝海 而且这个能力,恰好是搭建世界模型、实现真正多模态 AI 的关键拼图 更重要的是,他们选择了小模型路线 在大家都在卷参数量、卷算力的时候,文心用6.3B 做到了 SOTA 水平,这意味着他们在模型效率和工程优化上下了功夫 这对普通用户是好事,因为小模型意味着更低的使用成本、更快的推理速度、更容易的本地部署 NAVA 现在还在早期,但它代表的方向——让 AI 工具更轻、更快、更容易用,才是真正会改变普通人生活的技术路线 GitHub 项目地址: 论文地址: Hugging Face 模型页: #百度# #文心# #文心大模型# #NAVA# #大模型# #人工智能#
显示更多
0
16
21
1
转发到社区
之前有张「中国AI vs 美国AI」的图(图1)很火,就在OpenAI和Anthropic齐发新模型的同时,元宝和千问正在开打红包大战,对比起来讽刺性拉满了。 但这个笑话的保质期很短,也不怎么好笑了,因为很快赶上了字节和快手同样先后的发了新一代视频模型,在外网刷屏的程度再次引起洋人对于中国AI实力深不可测的「刻板印象」。 所以说钱钟书老爷子写「围城」是有道理的,寰宇就是一个围城,里头的人眼馋外边,外边的人羡慕里头。 字节的Seedance 2.0很牛逼,可以说是完全改写了视频生成的方法,而且因为字节这家公司自带的外围声量一直很大,所以虽然发布更晚,评价增长却更快,但快手的Kling 3.0也非常强,我已经烧掉三个号了,保证绝对不是在强行塑造「双星闪耀」的概念。 这也和两个模型的路线差异有关,综合能力肯定都要对标视频大模型的Sota、也就是谷歌的Veo模型,但Seedance 2.0更侧重于Sora 2的那套运镜、理解、模仿、转场等效果,极大的利好短视频创作者生态,而Kling 3.0则更偏向于Runway代表的影视化、真实化和工业化的能力,是冲着专业导演和工作室去的。 所以博主和用户天然会对Seedance 2.0更有感觉,这没毛病,但我对Kling 3.0的上限期待很高,它真的是在抹平真实和虚拟之间的界限,不过从长期来看,路线差异必然是暂时的,最后大家都会殊途同归,解决抽卡问题的同时,全方位无死角的替代掉现有视频生产管线的一半以上,甚至更多。 相比「闷声发大财」的AI Coding,多模态才是AI接近普通人的破圈手段,去年ChatGPT和Gemini的两次「翻倍级」增长(图2),一个是因为GPt-4o的「吉卜力风潮」,一个是基于Nano Banana的降维打击,都是多模态在立功。 到了今年,战场开始继续前移,除了Seedance 2.0和Kling 3.0,同样是在这个月,马斯克发布了Grok专有的视频模型Imagine 1.0,谷歌也发布了打掉游戏引擎市值的Genie 3,发现共同点了吗? 全,是,视,频。 人是视觉动物,所见即所得的信息量,是远超文本和语言的,视频模型以前主要吃亏在能力不足,训练难度居高不下,生成质量良莠不齐,无法形成类似「一键P图」的稳定性玩法,但是到了2026年,这个瓶颈期目测已经快要跨过去了。 还记得威尔·史密斯吃意大利面吗?那也不过是两三年前的事情,时间过得很快,也很扁平,技术的进化效率太可怕了。 多说几句开头那个对比吧,如果说中国AI公司眼馋Claude Opus 4.6和GPT-5.3-Codex,倒也确实没毛病,但这也不只是纯粹的技术代差,中美的商业环境决定了AI渗透的发力点不一样。 表面上看,美国的AI巨头都在发力AI Coding,容易货币化是一回事,再往深了想,Coding自由的终点是什么?是工具、软件甚至系统的零成本化,需要什么让AI去写代码就好了,所以美股里的SaaS赛道突然就崩了。 SaaS是一个积累了快30年的万亿级规模市场,非常适合拿来当作回应「AI投入太大、回报不足」的靶子,想象空间太大了,而大厦将倾的此情此景,实在是有种见证时代的残酷美学。 王慧文在即刻上发了一条非常精辟的动态(图3): 「我们曾经以为,中国SaaS会像美国SaaS那么值钱,现在看,美国SaaS会像中国SaaS这么不值钱。」 大佬就是大佬,几句话就说到点上了,中国的AI公司在产业化方面有苦难言,尤其是面对美国同行的高歌猛进,原因就在于:你不可能去替代一个不存在的市场,拿走一份不存在的产值,讲述一篇不存在的故事⋯⋯ 但在多模态尤其是视频模型方面,就不是这样了,中国互联网的短视频、直播和创作者生态,是全球领先的,这是真的存在巨大的市场、产值和故事可以被AI接上的,所以字节和快手为视频模型的投入动力,是完全不虚美国大厂的。 快手Kling有先发优势,ARR涨得很快,在海外一直处于第一梯队,字节属于后来居上,多模态能力对豆包的留存拉动明显,更不用说GPU储备量是国内大厂里Top级的,真想做成事情,很难不做成。 昨晚很多字节的朋友都在转梁汝波和张楠用AI合拍的视频(图4),用来宣传搭载了Seedance 2.0的即梦,张楠的性格搞这个不意外,意外的是梁汝波也配合了,你们很少会看到他给字节的其他产品这么站台。 晚点LatePost的稿子里提过,字节内部是期待AI这波能有「下一个抖音」跑出来的,而且是完全用字节的方法去做选择——数据决定地位——也就是说,赛马机制已经启动了,目前至少有三拨势力在争这个「太子」: - 即梦,负责人张楠是把抖音做起来的第一人,她先去剪映,再到即梦,一直是被安放在从0到1的最前线,代表了字节在创业场景下最强的战斗力; - 豆包,所属的Flow团队负责人朱骏是 - 抖音自己,是的,抖音部门也希望「下一个抖音」能由自己孵化出来,而不是假手于人,比如抖音搜索团队做了一个名字就叫AI抖音的App,用户量不大,但占位置的意图很明显; 还是那句话,字节这家公司的活力之高和欲望之强,在大厂里真的很少见,丝毫看不到老化的痕迹。 最后我还想说,大的在后面,中国AI公司在这个月的重量级发布还没结束,我知道一些但是暂时不能说,等着吧,用心感受这神仙打架的一个月。
显示更多
0
16
220
35
转发到社区