timoncool/ACE-Step-Studio
GitHub: timoncool/ACE-Step-Studio
一款基于 ACE-Step 模型的便携式本地 AI 音乐生成工作室,支持离线创作完整歌曲、翻唱、音乐视频,无需云端服务或订阅。
Stars: 255 | Forks: 35
# ACE-Step Studio
**家里的 Suno。本地 AI 音乐生成工作室 — 歌曲、人声、歌词、翻唱、音乐视频。**
[](https://github.com/timoncool/ACE-Step-Studio/stargazers)
[](LICENSE)
[](https://github.com/timoncool/ACE-Step-Studio/commits/master)
[](https://github.com/timoncool/ACE-Step-Studio/releases)
**[Русская версия](README_RU.md)**

创作带有完整人声、歌词、翻唱、混音和音乐视频的整首歌曲 — **100% 本地运行**,无需云端,无需订阅,无需联网。支持在 Windows 上一键安装,可在任何拥有 12+ GB VRAM 的 NVIDIA GPU 上运行。
基于 [ACE-Step 1.5 XL](https://github.com/ace-step/ACE-Step-1.5) — 开源的 4B 参数 DiT 音乐生成模型构建。
## 为什么选择 ACE-Step Studio?
- **永久免费** — 无需 API 密钥,无需额度,无使用限制
- **保护隐私** — 你的音乐永远不会离开你的设备
- **便携** — 所有内容都在一个文件夹中,复制到 USB 即可带走,删除即等于卸载
- **一键启动** — `install.bat` → `run.bat` → 开始创作音乐
## 功能
### 音乐生成
- **带有人声的完整歌曲** — 最长可达 8 分钟,支持任何语言、任何流派
- **简单与自定义模式** — 简单描述你的需求,或微调每一个参数
- **3 种 XL 模型** — XL Turbo(8 步,快速),XL SFT(50 步,最高质量),XL Turbo BF16(紧凑型,7.5 GB)
- **AI 歌词与风格** — LLM 自动生成歌词并丰富风格描述
- **模型热切换** — 无需重启即可更改 DiT/LM 模型
- **批量生成** — 一次创建多个变体
- **10 种采样器,7 种调度器** — euler、heun、midpoint、dopri5、deis、ipndm 等
- **LoRA 支持** — 在推理时加载 LoRA 权重
- **ID3 标签** — MP3 文件包含标题、艺术家、封面图、歌词、BPM
### 云端 LLM 与图像(可选,默认关闭)
- **使用 OpenRouter 生成歌词与风格** — 替代本地 LM 的自带密钥(BYOK)方案。选择任何模型(Claude、GPT-4o、DeepSeek、Llama 3.x 等),无需占用 GPU VRAM 即可即时获取歌词 + 描述 + 调性/BPM/时长元数据。本地 LM 可并行工作 — 随时切换。
- **Pollinations.ai 封面生成** — 在生成音频时并行自动生成专辑封面(服务器端,即发即弃,绝不阻塞音频生成)。视觉 prompt 直接来自 OpenRouter LLM(它会根据歌曲的歌词和氛围撰写 1-2 句量身定制的视觉描述),或通过关键字回退生成。匿名层级即可使用;也可提供你自己的 token 以获取更高速率限制并去除水印。
- **手动封面重生成模态框** — 每首曲目上的带铅笔图片按钮。选择任何 Pollinations 模型,编写你自己的 prompt,点击“重试”直到满意,**或从磁盘上传你自己的图片**(JPEG/PNG/WEBP,≤10MB)。保存的封面将替换 `songs.cover_url` 以及嵌入在 MP3 中的 ID3 帧,以便外部播放器也能显示你选择的图像。
- **独立开关** — 每一项云端功能均为可选开启。你可以仅使用 Pollinations 封面 + 本地 LM,或仅使用 OpenRouter 歌词 + 自动 picsum 封面,或两者都用,或都不用。默认模式为纯本地。
### 翻唱与混音
- **翻唱模式** — 在保留旋律的同时,将现有音频转换为新的风格
- **重绘模式** — 重新生成歌曲的特定部分(在波形上进行区域选择)
- **参考音频** — 使用参考曲目来指导生成风格
- **音频强度控制** — 在源音频与生成音频之间进行混合
### 视频工作室

- **音乐视频生成器** — NCS 风格的可视化效果,支持 10 种预设
- **卡拉OK歌词** — 同步的 LRC 字幕,支持 3 种样式(逐行、滚动、卡拉OK填充)
- **所见即所得编辑器** — 拖动元素,滚动调整大小,选择框
- **宽高比** — 16:9、9:16 (Reels/TikTok)、1:1 (Instagram)
- **12 种特效** — 抖动、故障、VHS、CCTV、扫描线、辉光、胶片颗粒、频闪、暗角、色相偏移、信箱模式、像素化
- **背景** — 随机、自定义图片、Pexels 搜索、视频背景
- **服务器端渲染** — 使用原生 ffmpeg 和 NVENC GPU 加速
### 音频工具
- **音频编辑器** — 修剪、淡入淡出、效果处理 (AudioMass)
- **音轨提取** — 分离人声、鼓声、贝斯、其他声音 (Demucs)
- **LRC 下载** — 导出同步歌词
### 模型工具
- **BF16 转换器** — 将 safetensors 从 FP32/FP16 转换为 BFloat16(体积减少约 50%)
- **模型合并器** — 使用可调节的 alpha 合并两个 ACE-Step 模型(3 种方法)
- **烘焙 LoRA** — 将 LoRA 权重烘焙到基础模型中
### 界面
- **单一终端** — 只需一个 `run.bat`,Express 自动管理 Python/Gradio
- **便携** — 所有内容都在一个文件夹中,无需全系统安装
- **5 种语言** — 英语、俄语、中文、日语、韩语
- **局域网访问** — 可从网络上的任何设备(手机、平板电脑)访问
- **GPU 监控** — 实时显示 VRAM、RAM、CPU、温度统计信息
- **深色/浅色主题**
## 系统要求
| 组件 | 最低要求 | 推荐配置 |
|-----------|---------|-------------|
| GPU VRAM | 12 GB | 20+ GB |
| RAM | 16 GB | 32 GB |
| 硬盘 | 30 GB | 60 GB (包含所有模型) |
| 操作系统 | Windows 10/11 | Windows 11 |
| GPU | RTX 3060+ | RTX 4090 |
## 快速开始
或在 Windows 上手动安装:
### 1. 克隆仓库
```
git clone https://github.com/timoncool/ACE-Step-Studio.git
cd ACE-Step-Studio
```
### 2. 安装
```
install.bat
```
选择你的 GPU 类型 (CUDA 12.8 / 12.6 / 12.4)。这将安装便携版 Python 3.12、PyTorch、Node.js 22 以及所有依赖项 — 不会在系统中写入任何内容。
### 3. 运行
```
run.bat
```
浏览器将自动打开 http://localhost:3001。首次运行时会下载模型(默认的 BF16 模型约需 7.5 GB)。
## 启动脚本
| 脚本 | 描述 |
|--------|-------------|
| `run.bat` | 标准启动 — DiT + LM (0.6B PT),启用所有功能 |
| `run-no-lm.bat` | 无 LM 启动 — 为 DiT 释放更多 VRAM,可进行翻唱/重绘,但不支持 AI 歌词/思考 |
| `run-dev.bat` | 开发模式 — 3 个终端并启用 Vite HMR |
| `install.bat` | 一键安装程序 |
| `update.bat` | 更新代码 + 依赖项 + 重新构建前端 |
| `reinstall.bat` | 清理并重新安装(保留模型和数据) |
| `download_model.bat` | 预下载模型 |
## 模型
| 模型 | 大小 | 步数 | 速度 | 质量 |
|-------|------|-------|-------|---------|
| XL Turbo BF16 | 7.5 GB | 8 | 快 | 高 |
| XL Turbo | 18.8 GB | 8 | 快 | 非常高 |
| XL SFT | 18.8 GB | 50 | 慢 | 最高 |
| XL Merge SFT+Turbo | 18.8 GB | 12 | 中等 | 非常高 |
### LM 模型 (文本/歌词 AI)
| 模型 | VRAM 占用 | 质量 |
|-------|------|---------|
| 0.6B | ~0.5 GB | 基础 |
| 1.7B | ~1.5 GB | 良好 |
| 4B | ~4 GB | 最佳 |
LM 后端:**PT** (PyTorch,更轻量) 或 **vLLM** (推理更快,占用 VRAM 更多)。
## API 密钥 (可选)
ACE-Step Studio 在**无需任何 API 密钥**的情况下即可完全使用 — 本地 DiT + 本地 LM 涵盖了所有与音乐生成相关的功能。以下密钥可解锁部分用户为了便利或质量而偏好的可选云端服务。它们仅存储在浏览器的 `localStorage` 中,除了服务提供商自身的服务器外,绝不发送至任何其他服务器。
| 提供商 | 在应用中的作用 | 获取地址 | 免费层级 |
|---|---|---|---|
| **OpenRouter** | 根据你的一行描述生成歌词 + 描述 + BPM/调性/时长元数据,以及一个视觉封面 prompt(替代本地 LM)。让你可以选择 Claude / GPT-4o / DeepSeek / Llama / Mistral / Gemini 或 200+ 模型中的任意一个。 | [openrouter.ai/keys](https://openrouter.ai/keys) — 使用 Google/GitHub 登录,点击 *Create Key*。 | **支持 — 许多完全免费的模型**(在模型选择器中按 `:free` 过滤):DeepSeek R1 free、Llama 3.3 70B Instruct free、Gemini 2.0 Flash free、Qwen 2.5 free、Mistral Small 3 free 等。付费模型按 token 从你的钱包余额中扣费 — 无需包月订阅。 |
| **Pollinations.ai** | 在音频生成的同时生成专辑封面图像,并支持手动封面重生成模态框。Token 还能解锁完整的图像模型目录(FLUX、Qwen-Image、Klein、GPT-Image、Z-Image 等)并去除水印。 | [auth.pollinations.ai](https://auth.pollinations.ai) — 登录,复制 `pk_…` (公开) 或 `sk_…` (私密) 密钥。 | **支持 — 完全免费**,无需任何账户或密钥即可使用匿名层级。速度较慢 (1 次请求/15 秒),且某些模型可能会带有小水印。使用免费 token:1 次请求/5 秒 + 无水印 + 完整模型列表。 |
### 在哪里输入密钥
- **OpenRouter** → 创建面板 → 高级 → 勾选 *"Use OpenRouter"* → 粘贴密钥,选择模型,点击 *Test*。
- **Pollinations** → 创建面板 → 高级 → *Cover image (Pollinations.ai)* → 勾选 *"Generate covers via Pollinations.ai"* → 粘贴密钥(可选),选择模型,点击 *Test*。
这两个开关在不同会话间持久化保存且相互独立 — 关闭其中任何一个即可回退到本地流水线(使用 LM 写歌词,使用 picsum 作封面)。
### 隐私保护如何?
- 密钥仅保存在你浏览器中该站点的 `localStorage` 中。
- 它们仅通过 HTTPS 发送至 `openrouter.ai` / `gen.pollinations.ai`,并附加在单次 API 调用中。ACE-Step Studio 没有后端账户、遥测或代理服务器。
- 你生成的封面图像将保存在你本机的 `app/server/public/audio/标签:MITM代理, NVIDIA GPU, 人工智能, 凭据扫描, 本地部署, 用户模式Hook绕过, 跨平台, 逆向工具, 音乐生成, 音频处理