MetaSound · AI 元声造影
AI 元声造影(MetaSound) 是一款运行在 Windows 上的本地 AI 创作工作台,集成了语音合成(声音设计 / 声音克隆)、音乐创作、视频生成与数字人生成能力。所有模型引擎均在本机运行,数据不出本机,无需联网调用云端 API。
- 软件名称:AI 元声造影(MetaSound)
- 当前版本:v0.0.3(GUI)
- 作者:聆曦(Nine Clouds Space)
- 官方网站:https://www.aizzx.top/2109.html
一、软件介绍
核心功能
| 模块 | 功能 | 依赖引擎 | 状态 |
|---|---|---|---|
| 语音合成 · 声音设计 | 通过「音色风格 + 声音特质 + 自定义描述」组合生成全新音色并朗读文本,无需参考音频 | VoxCPM2 | ✅ 已完成 |
| 语音合成 · 声音克隆 | 上传一段 ≥3 秒的参考音频,克隆其音色朗读任意文本 | VoxCPM2 | ✅ 已完成 |
| 音乐创作 | 输入歌词与音乐描述,生成带人声的完整歌曲或纯音乐(44.1kHz 立体声,最长约 6 分钟) | MiniMax-Music3 | ✅ 已完成 |
| 视频生成 | 文生视频 / 图生视频 / 全能参考三种模式,画面与立体声音轨同步生成(24fps,5~15 秒) | MiniMax-H3 | ✅ 已完成 |
| 数字人生成 | 文字/参考图 + 音频驱动的头部、上半身与口型合成 | EchoMimic V2 + MuseTalk(本地 runner) | 🚧 需先部署模型环境 |
| 任务中心 | 音频 / 视频任务统一管理:进度、阶段、取消、打开输出目录 | — | ✅ 已完成 |
软件开发整体架构(待考虑是否开源,软件反正免费)
MetaSound/
├── MetaSoundGUI/ # 前端:PySide6 桌面界面(本仓库主体)
│ ├── MetaSound.py # 程序入口
│ ├── app/
│ │ ├── interface/ # 各功能页面(语音/音乐/视频/数字人/任务/设置/关于)
│ │ ├── core/ # 任务管理器(TaskManager)
│ │ ├── services/ # 引擎进程托管(BackendProcessManager)
│ │ ├── thread/ # 任务 Worker 线程(TTS/音乐/视频/数字人)
│ │ ├── config/ # 应用配置、提示词预设、用户设置
│ │ └── resources/ # 样式、图标、Qt 资源
│ └── build_app.py # 可执行程序exe打包脚本(产物输出到 Frontend Build)
├── Backend VoxCPM2/ # 语音引擎(源码形态)
├── Backend Minimax-Music3/ # 音乐引擎(源码形态)
├── Backend Minimax-H3/ # 视频引擎(源码形态)
├── Backend EchoMimic-MuseTalk/ # 数字人网关与本地 runner 配置
├── Backend Build/ # 打包后的引擎发行版(MetaSoundVoiceEngine.exe 等)
└── Frontend Build/ # GUI 打包产物与安装包
工作方式:
- GUI 与模型引擎是分离的。界面本身不加载模型;用户在「偏好设置 → 模型管理」页手动启动某个引擎后,GUI 以独立进程方式拉起对应引擎(一个本地 HTTP 服务,监听
127.0.0.1),通过/api/v1接口提交任务、轮询进度,所以纯后端源码有需要的伙伴可以联系我,环境是以python为主的,拿到源码,支持一键自动配置环境和自动下载模型,也提供接口调用文档,方便二次开发。 - 同一时刻只能运行一个引擎(消费级显卡显存放不下两个大模型),切换引擎前必须先停止当前引擎。
- GUI 退出不会关闭引擎进程,下次打开软件会自动探测并接管仍在运行的引擎;引擎由「模型管理」页显式停止。
- 用户设置保存在
%APPDATA%\AI 元声造影\settings.json,引擎日志位于各引擎目录下的logs\backend.log。
二、基础硬件配置
通用要求:Windows 10/11 x64,NVIDIA 独立显卡(需支持 CUDA 12.6 的驱动),建议使用固态硬盘存放模型权重。
各引擎对硬件的要求差异较大,按需安装:
| 引擎 | 用途 | 显卡 / 显存 | 主机内存 | 磁盘占用(引擎 + 权重) |
|---|---|---|---|---|
| VoxCPM2 | 语音设计 / 声音克隆 | 有 NVIDIA 显卡即可流畅运行(权重约 4.7GB);无独显时自动回退 CPU | 16GB+ | 约 10GB |
| MiniMax-Music3 | 音乐创作 | 峰值显存约 8GB(默认分组卸载模式,RTX 3090/4090 稳定;显存越大可选更快模式) | 32GB+ | 约 30GB(权重约 28GB) |
| MiniMax-H3 | 视频生成 | 24GB 显存(RTX 3090/4090,默认 int8 方案实测峰值 16~18GB) | 约 75GB,建议 96GB 及以上 | 约 85 |
| EchoMimic V2 + MuseTalk | 数字人生成 | 24GB 显存(建议 512p / 快速预览) | 24GB+ | 由用户分别准备文生图、EchoMimic 和 MuseTalk 环境 |
💡 提示:
- 音乐生成耗时参考:RTX 4090 约 3~5 分钟 / RTX 3060 可能 15 分钟以上。
- 视频生成支持「Turbo 加速」(4 步蒸馏 LoRA),去噪提速约 8 倍,仅文生视频 / 图生视频模式可用。
- 视频引擎的 int8 权重会常驻主机内存约 75GB,内存不足会导致任务失败,请优先保证内存容量。
三、使用教程
1. 安装与启动
- 运行安装包
MetaSound v0.0.x Windows x64.exe,按向导完成安装(可选绿色免安装版直接解压使用)。 - 双击桌面图标启动软件。首次启动需要先在「模型管理」中就位并启动引擎(见下一步)。
- 注意:当前版本为临时时间授权,到期后启动会弹窗提示,请前往聆曦博客获取新版本。
2. 模型管理(必做,第一次使用先看这里)
菜单:偏好设置 → 模型管理
- 在引擎列表中查看各引擎状态(已停止 / 模型加载中 / 运行中 / 未安装)。列表会实时显示模型体积,「未安装」表示引擎程序或模型权重尚未就位。
- 若引擎放在自定义位置,点击「选择位置」选择引擎目录(或其上级目录)即可被识别;点击「恢复自动」回到自动探测。
- 选中引擎点击「启动」,等待状态变为「运行中」即可开始创作(首次启动需解压依赖并加载模型,可能需要数分钟)。
- 同一时间只能运行一个引擎。要使用其他引擎,先「停止」当前引擎再启动新的。
- 启动失败时点击「打开日志」查看引擎日志排查原因。
3. 输出设置(建议先配置)
菜单:偏好设置 → 输出设置
- 设置音频输出目录与视频输出目录,生成结果会保存到这里。
- 可自定义文件命名规则:命名方式(纯时间 / 纯文本哈希 / 自定义文本+递增序号)、名称前缀、业务类型标签及其排序与分隔符,下方有实时文件名预览。
- 支持一键清空输出目录内容。
若未设置输出目录,首次生成时会弹窗要求选择保存位置。
4. 语音合成(需启动 VoxCPM2 引擎)
声音设计(凭空造一个音色):
- 从预设中选择「音色风格」(如新闻播音员、有声书主播、电影旁白等 8 种)与「声音特质」(如沙哑质感、低沉磁性、空灵悠远等 10 种),可再追加自定义描述(推荐英文)。
- 需要微调时展开「模型调参」:引导强度(默认 2.0)、采样步幅(默认 10)。
- 输入要朗读的「合成文本」,点击「开始生成」,用内嵌播放器试听结果。
声音克隆(模仿已有声音):
- 选择参考音频来源:「语音设计生成」(自动列出历史生成音频)或「本地参考音频」(支持 wav/mp3/flac/m4a/ogg,至少 3 秒)。
- 填写「参考音频文本(可选,可提升克隆稳定性)」与「表达控制(可选,如:自然、温柔、语速适中)」。
- 输入合成文本,点击「开始克隆」。
5. 音乐创作(需启动 MiniMax-Music3 引擎)
- 选择创作类型:歌曲(有人声) 或 纯音乐(无人声)。
- 左栏编辑歌词:点击段落标签按钮插入
[主歌] [副歌]等结构标签(标签必须独占一行,提交时自动转为英文标签),或使用「一键流行歌曲结构」快速套用模板;纯音乐模式左栏为曲式结构模板。 - 右栏从四个维度描述音乐:音乐风格(流行/民谣/摇滚/古风等)、情绪氛围、人声类型、编曲配器,也可写自定义描述(推荐英文,可写 BPM、乐器细节等)。
- 设置参数:音频时长(15~360 秒,默认 60)、降噪步数(默认 30)、种子(0 为随机;固定正整数可复现同一段音乐)。
- 点击「开始生成」,生成完成后试听并保存。
6. 视频生成(需启动 MiniMax-H3 引擎)
三种模式对应三个页面:
- 文生视频:直接输入画面描述(可选用「画面风格 / 运镜方式 / 声音景观」预设辅助描述)。
- 图生视频:提供首帧图片(必填,支持拖拽),可选尾帧图片;画布宽高比默认跟随首帧。
- 全能参考:添加多模态参考素材(图片 ≤9、视频 ≤3、音频 ≤3,共 ≤12),拖动排序即模型阅读顺序;可将素材拖入描述框自动插入引用标签。注意音频参考需搭配图片或视频使用。
通用参数:
- 视频时长(5~15 秒)、去噪步数(默认 40)、宽高比(16:9 / 9:16 / 1:1 等)、分辨率(768p 标准 / 544p 快速,小画布约提速 2.3 倍)、种子(支持「随机」与「复用上次」)。
- Turbo 加速开关:启用 4 步蒸馏 LoRA,生成提速约 8 倍(仅文生 / 图生模式支持;预览级质量,追求极致质量建议关闭或用 7~9 步)。
- 点击「开始生成」,完成后可「打开视频」或「打开目录」。
7. 任务列表
菜单:任务列表 → 音频任务 / 视频任务
- 所有生成任务在后台排队执行,此处集中查看每个任务的阶段(排队中 / 生成中 / 已完成 / 失败 / 已取消)与错误信息。
- 进行中的任务可点击「取消」;已完成的任务可「打开目录」跳转到输出文件夹。
- 关闭软件主窗口会自动取消仍在进行中的任务(引擎进程不受影响)。
8. 数字人生成
数字人模块采用 EchoMimic V2 生成头部与上半身动作,再由 MuseTalk 做口型精修。文字模式会先调用本地文生图 runner 生成参考人物图;参考图模式直接使用用户上传的图片。模型环境、Python 适配模块和启动方式见 Backend EchoMimic-MuseTalk/README.md 与 DEPLOYMENT.md。
四、常见问题
- 引擎显示「未安装」:引擎程序或模型权重不完整。手动选择位置时会给出具体诊断(缺少引擎程序 / 运行环境 / 模型权重)。
- 引擎启动超时或失败:查看「模型管理」页的引擎日志;确认显卡驱动支持 CUDA 12.6、显存与内存满足要求、杀毒软件未拦截引擎进程。
- 切换引擎时提示引擎运行中:全局只允许一个引擎运行,先在「模型管理」页停止当前引擎。
- 生成结果去哪了:见「输出设置」中的输出目录;任务列表中点击「打开目录」可直接跳转。
五、关于
- 作者:聆曦(Nine Clouds Space)
- 官方网站 / 新版本获取:https://www.aizzx.top/2109.html
- 如果这个项目对你有帮助,欢迎赞助支持。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END


暂无评论内容