1/
star-cover 0.1版本 诞生啦!!一个本地跑的 AI 翻唱工作站。
想介绍一下我做这个的初衷,音乐是我的爱好之一,比重还挺高,一直想听喜欢的歌手唱自己私心喜欢的歌曲。
AI翻唱现在已经很普遍了,技术也很成熟,但是前期准备多,后期处理比较麻烦,所以想自己试试能不能打通。
2/
把运行链路稳定了一轮。
修了 ffmpeg 找不到、bat 双击闪退、模型缓存路径、RVC 基础模型缺失这些问题。现在本地 CUDA、BS-Roformer 分离、RVC 转换、混音这一整条链路可以比较稳定地跑起来。其实这些我之前都不懂,跟着F5和codex干就完了。
3/
补了一批歌手模型:Taylor Swift、Bruno Mars、Rihanna、ROSÉ,加上原来的周杰伦。
4/
今天最大的改动是 GUI,终于落实。
之前用 cmd 和 Gradio 表格凑合跑,但群星分句特别难用。于是重做成自定义网页 UI:暗色界面、歌手卡片、任务摘要、逐句编排列表。
单歌手翻唱是一键跑;群星模式可以每一句选歌手、调变调、批量分配。
5/
群星分句这个功能开始像“制作台”了。
一首歌先分离人声,再转录成一句一句。每句可以指定不同歌手,比如主歌周杰伦,副歌 The Weeknd,某几句 Rihanna,再单独给几句升降调。
6/
下一步想训练一个更具体的音色:04-07 年周杰伦演唱会时期那种金属嗓。
今天也整理了训练思路:素材要偏现场、颗粒感强、观众声少、伴唱少。RVC 能学音色和共鸣,但“撕裂感”很依赖原始唱法,所以素材质量会决定上限。
今天输出的歌曲谈不上完美,继续优化。
有对这个项目感兴趣的,有建议的欢迎留言,我会持续改进并分享。
#
BuildInPublic# #
AI# #
VoiceAI# #
IndieHackers#