README

MetaSound · AI 元声造影

AI 元声造影(MetaSound) 是一款运行在 Windows 上的本地 AI 创作工作台,集成了语音合成(声音设计 / 声音克隆)音乐创作视频生成数字人生成能力。所有模型引擎均在本机运行,数据不出本机,无需联网调用云端 API。

  • 软件名称:AI 元声造影(MetaSound)
  • 当前版本:v0.0.3(GUI)
  • 作者:聆曦(Nine Clouds Space)
  • 官方网站:https://www.aizzx.top/2109.html

一、软件介绍

核心功能

模块功能依赖引擎状态
语音合成 · 声音设计通过「音色风格 + 声音特质 + 自定义描述」组合生成全新音色并朗读文本,无需参考音频VoxCPM2✅ 已完成
语音合成 · 声音克隆上传一段 ≥3 秒的参考音频,克隆其音色朗读任意文本VoxCPM2✅ 已完成
音乐创作输入歌词与音乐描述,生成带人声的完整歌曲或纯音乐(44.1kHz 立体声,最长约 6 分钟)MiniMax-Music3✅ 已完成
视频生成文生视频 / 图生视频 / 全能参考三种模式,画面与立体声音轨同步生成(24fps,5~15 秒)MiniMax-H3✅ 已完成
数字人生成文字/参考图 + 音频驱动的头部、上半身与口型合成EchoMimic V2 + MuseTalk(本地 runner)🚧 需先部署模型环境
任务中心音频 / 视频任务统一管理:进度、阶段、取消、打开输出目录✅ 已完成

软件开发整体架构(待考虑是否开源,软件反正免费)

MetaSound/
├── MetaSoundGUI/            # 前端:PySide6 桌面界面(本仓库主体)
│   ├── MetaSound.py         # 程序入口
│   ├── app/
│   │   ├── interface/       # 各功能页面(语音/音乐/视频/数字人/任务/设置/关于)
│   │   ├── core/            # 任务管理器(TaskManager)
│   │   ├── services/        # 引擎进程托管(BackendProcessManager)
│   │   ├── thread/          # 任务 Worker 线程(TTS/音乐/视频/数字人)
│   │   ├── config/          # 应用配置、提示词预设、用户设置
│   │   └── resources/       # 样式、图标、Qt 资源
│   └── build_app.py         # 可执行程序exe打包脚本(产物输出到 Frontend Build)
├── Backend VoxCPM2/         # 语音引擎(源码形态)
├── Backend Minimax-Music3/  # 音乐引擎(源码形态)
├── Backend Minimax-H3/      # 视频引擎(源码形态)
├── Backend EchoMimic-MuseTalk/ # 数字人网关与本地 runner 配置
├── Backend Build/           # 打包后的引擎发行版(MetaSoundVoiceEngine.exe 等)
└── Frontend Build/          # GUI 打包产物与安装包

工作方式

  • GUI 与模型引擎是分离的。界面本身不加载模型;用户在「偏好设置 → 模型管理」页手动启动某个引擎后,GUI 以独立进程方式拉起对应引擎(一个本地 HTTP 服务,监听 127.0.0.1),通过 /api/v1 接口提交任务、轮询进度,所以纯后端源码有需要的伙伴可以联系我,环境是以python为主的,拿到源码,支持一键自动配置环境和自动下载模型,也提供接口调用文档,方便二次开发。
  • 同一时刻只能运行一个引擎(消费级显卡显存放不下两个大模型),切换引擎前必须先停止当前引擎。
  • GUI 退出不会关闭引擎进程,下次打开软件会自动探测并接管仍在运行的引擎;引擎由「模型管理」页显式停止。
  • 用户设置保存在 %APPDATA%\AI 元声造影\settings.json,引擎日志位于各引擎目录下的 logs\backend.log

二、基础硬件配置

通用要求:Windows 10/11 x64,NVIDIA 独立显卡(需支持 CUDA 12.6 的驱动),建议使用固态硬盘存放模型权重。

各引擎对硬件的要求差异较大,按需安装:

引擎用途显卡 / 显存主机内存磁盘占用(引擎 + 权重)
VoxCPM2语音设计 / 声音克隆有 NVIDIA 显卡即可流畅运行(权重约 4.7GB);无独显时自动回退 CPU16GB+约 10GB
MiniMax-Music3音乐创作峰值显存约 8GB(默认分组卸载模式,RTX 3090/4090 稳定;显存越大可选更快模式)32GB+约 30GB(权重约 28GB)
MiniMax-H3视频生成24GB 显存(RTX 3090/4090,默认 int8 方案实测峰值 16~18GB)约 75GB,建议 96GB 及以上约 85115GB(int8 权重 76107GB)
EchoMimic V2 + MuseTalk数字人生成24GB 显存(建议 512p / 快速预览)24GB+由用户分别准备文生图、EchoMimic 和 MuseTalk 环境

💡 提示:

  • 音乐生成耗时参考:RTX 4090 约 3~5 分钟 / RTX 3060 可能 15 分钟以上。
  • 视频生成支持「Turbo 加速」(4 步蒸馏 LoRA),去噪提速约 8 倍,仅文生视频 / 图生视频模式可用。
  • 视频引擎的 int8 权重会常驻主机内存约 75GB,内存不足会导致任务失败,请优先保证内存容量。

三、使用教程

1. 安装与启动

  1. 运行安装包 MetaSound v0.0.x Windows x64.exe,按向导完成安装(可选绿色免安装版直接解压使用)。
  2. 双击桌面图标启动软件。首次启动需要先在「模型管理」中就位并启动引擎(见下一步)。
  3. 注意:当前版本为临时时间授权,到期后启动会弹窗提示,请前往聆曦博客获取新版本。

2. 模型管理(必做,第一次使用先看这里)

菜单:偏好设置 → 模型管理

  1. 在引擎列表中查看各引擎状态(已停止 / 模型加载中 / 运行中 / 未安装)。列表会实时显示模型体积,「未安装」表示引擎程序或模型权重尚未就位。
  2. 若引擎放在自定义位置,点击「选择位置」选择引擎目录(或其上级目录)即可被识别;点击「恢复自动」回到自动探测。
  3. 选中引擎点击「启动」,等待状态变为「运行中」即可开始创作(首次启动需解压依赖并加载模型,可能需要数分钟)。
  4. 同一时间只能运行一个引擎。要使用其他引擎,先「停止」当前引擎再启动新的。
  5. 启动失败时点击「打开日志」查看引擎日志排查原因。

3. 输出设置(建议先配置)

菜单:偏好设置 → 输出设置

  • 设置音频输出目录视频输出目录,生成结果会保存到这里。
  • 可自定义文件命名规则:命名方式(纯时间 / 纯文本哈希 / 自定义文本+递增序号)、名称前缀、业务类型标签及其排序与分隔符,下方有实时文件名预览。
  • 支持一键清空输出目录内容。

若未设置输出目录,首次生成时会弹窗要求选择保存位置。

4. 语音合成(需启动 VoxCPM2 引擎)

声音设计(凭空造一个音色):

  1. 从预设中选择「音色风格」(如新闻播音员、有声书主播、电影旁白等 8 种)与「声音特质」(如沙哑质感、低沉磁性、空灵悠远等 10 种),可再追加自定义描述(推荐英文)。
  2. 需要微调时展开「模型调参」:引导强度(默认 2.0)、采样步幅(默认 10)。
  3. 输入要朗读的「合成文本」,点击「开始生成」,用内嵌播放器试听结果。

声音克隆(模仿已有声音):

  1. 选择参考音频来源:「语音设计生成」(自动列出历史生成音频)或「本地参考音频」(支持 wav/mp3/flac/m4a/ogg,至少 3 秒)。
  2. 填写「参考音频文本(可选,可提升克隆稳定性)」与「表达控制(可选,如:自然、温柔、语速适中)」。
  3. 输入合成文本,点击「开始克隆」。

5. 音乐创作(需启动 MiniMax-Music3 引擎)

  1. 选择创作类型:歌曲(有人声)纯音乐(无人声)
  2. 左栏编辑歌词:点击段落标签按钮插入 [主歌] [副歌] 等结构标签(标签必须独占一行,提交时自动转为英文标签),或使用「一键流行歌曲结构」快速套用模板;纯音乐模式左栏为曲式结构模板。
  3. 右栏从四个维度描述音乐:音乐风格(流行/民谣/摇滚/古风等)、情绪氛围、人声类型、编曲配器,也可写自定义描述(推荐英文,可写 BPM、乐器细节等)。
  4. 设置参数:音频时长(15~360 秒,默认 60)、降噪步数(默认 30)、种子(0 为随机;固定正整数可复现同一段音乐)。
  5. 点击「开始生成」,生成完成后试听并保存。

6. 视频生成(需启动 MiniMax-H3 引擎)

三种模式对应三个页面:

  • 文生视频:直接输入画面描述(可选用「画面风格 / 运镜方式 / 声音景观」预设辅助描述)。
  • 图生视频:提供首帧图片(必填,支持拖拽),可选尾帧图片;画布宽高比默认跟随首帧。
  • 全能参考:添加多模态参考素材(图片 ≤9、视频 ≤3、音频 ≤3,共 ≤12),拖动排序即模型阅读顺序;可将素材拖入描述框自动插入引用标签。注意音频参考需搭配图片或视频使用。

通用参数:

  • 视频时长(5~15 秒)、去噪步数(默认 40)、宽高比(16:9 / 9:16 / 1:1 等)、分辨率(768p 标准 / 544p 快速,小画布约提速 2.3 倍)、种子(支持「随机」与「复用上次」)。
  • Turbo 加速开关:启用 4 步蒸馏 LoRA,生成提速约 8 倍(仅文生 / 图生模式支持;预览级质量,追求极致质量建议关闭或用 7~9 步)。
  • 点击「开始生成」,完成后可「打开视频」或「打开目录」。

7. 任务列表

菜单:任务列表 → 音频任务 / 视频任务

  • 所有生成任务在后台排队执行,此处集中查看每个任务的阶段(排队中 / 生成中 / 已完成 / 失败 / 已取消)与错误信息。
  • 进行中的任务可点击「取消」;已完成的任务可「打开目录」跳转到输出文件夹。
  • 关闭软件主窗口会自动取消仍在进行中的任务(引擎进程不受影响)。

8. 数字人生成

数字人模块采用 EchoMimic V2 生成头部与上半身动作,再由 MuseTalk 做口型精修。文字模式会先调用本地文生图 runner 生成参考人物图;参考图模式直接使用用户上传的图片。模型环境、Python 适配模块和启动方式见 Backend EchoMimic-MuseTalk/README.mdDEPLOYMENT.md


四、常见问题

  • 引擎显示「未安装」:引擎程序或模型权重不完整。手动选择位置时会给出具体诊断(缺少引擎程序 / 运行环境 / 模型权重)。
  • 引擎启动超时或失败:查看「模型管理」页的引擎日志;确认显卡驱动支持 CUDA 12.6、显存与内存满足要求、杀毒软件未拦截引擎进程。
  • 切换引擎时提示引擎运行中:全局只允许一个引擎运行,先在「模型管理」页停止当前引擎。
  • 生成结果去哪了:见「输出设置」中的输出目录;任务列表中点击「打开目录」可直接跳转。

五、关于

© 版权声明
THE END
喜欢就支持一下吧
点赞12 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容