MartinDelophy/ai-video-editor
GitHub: MartinDelophy/ai-video-editor
一款本地优先的浏览器端 AI 视频编辑器,集成了 ONNX 语音合成、Whisper 字幕、数字人生成和多轨道确定性导出功能。
Stars: 272 | Forks: 21
# Timeline Studio — 浏览器 AI 视频编辑器
**English** | [中文](README.zh-CN.md) | [日本語](README.ja.md) | [한국어](README.ko.md) | [Español](README.es.md) | [Français](README.fr.md) | [Deutsch](README.de.md) | [Português](README.pt-BR.md) | [ไทย](README.th.md) | [Tiếng Việt](README.vi.md) | [Русский](README.ru.md)
[](https://video-editor.ai-creator.top/)
[](https://github.com/MartinDelophy/ai-video-editor/releases)
[](LICENSE)
[](https://skills.sh/MartinDelophy/ai-video-editor)
Timeline Studio 是一款在浏览器中运行的本地优先 AI 视频编辑器。它结合了 CapCut 风格的多轨道时间轴、浏览器端 AI 配音、自动字幕、视觉工具、说话头像生成以及确定性的离线导出。
[打开编辑器](https://video-editor.ai-creator.top/) · [在 YouTube 上观看](https://youtu.be/bqKhpPPa-qo) · [Hugging Face Space](https://huggingface.co/spaces/haixin/timeline-studio)
## 视频演示
https://github.com/user-attachments/assets/e8327caa-429e-40ff-a7fe-a59e6cf7a464

## AI 功能
- **多语言配音:** 中文 Piper/VITS ONNX 语音,英文 Kokoro 82M,以及支持德语、西班牙语、法语、意大利语和巴西葡萄牙语的浏览器 Piper 语音。
- **本地 AI 音乐:** Stable Audio 3 Small Q4 ONNX 通过 WebGPU 运行,支持翻译后的自由格式 prompt,提供 30/60/90/120 秒时长选择,具备波形感知的长音频循环、持久化模型缓存,并自动插入到“我的资源”中。
- **自动字幕:** Whisper small q8 ONNX,具备波形感知时间轴功能和保守的中文识别清理。
- **智能取景:** 使用 YOLOS tiny 进行主体检测,并结合 MODPortrait 人像抠图,实现跨图像和完整视频的智能裁剪、避开字幕以及背景移除。
- **AI 人声分离:** 无需离开浏览器工作流即可分离人声,并将伴奏音轨放置到音乐轨道上。
- **数字人:** 通过 WebGPU 实现 JoyVASA 音频驱动动作和 LivePortrait 神经渲染,提供 256px 预览和 512px 高清路径。
- **本地优先推理:** 大型模型支持延迟加载、版本锁定并由 service worker 缓存;支持的工作流无需将项目媒体上传到编辑后端即可运行。
## 编辑与导出
- 连续的主视觉轨道以及定时的画中画叠加层。
- 直接在画布上进行选择、移动、按比例缩放、旋转、蒙版、滤镜、特效、动画、速度调整以及显式关键帧操作。
- 字幕、贴纸、配音、分离的源音频和音乐位于独立的定时轨道上。
- CapCut 风格的吸附、对齐参考线、片段菜单、分割/复制/删除、时间轴缩放、撤销/重做,以及可移植的 `.timeline` 项目。
- 原生媒体播放带来响应式预览;导出使用单独的确定性离线渲染路径。
- 支持 WebCodecs MP4/WebM 合成,统一预览/导出几何布局,包含音频混合、字幕、叠加层、特效,并具备 MediaRecorder 回退机制。
- 可安装的 PWA,带有缓存的应用外壳和多语言 UI。
## Agent Skill
本仓库包含适用于 Codex、Claude Code、Copilot 和 Gemini CLI 的 [AI 视频编辑技能](skills/edit-timeline-studio/README.md),由 [`edit-timeline-studio`](skills/edit-timeline-studio/SKILL.md) 提供支持,用于规划、执行和验证可编辑的视频时间轴。
它可以帮助 agent:
- 检查媒体并保留用户的编辑需求;
- 使用稳定的片段 ID 和明确的时间戳来描述可逆编辑;
- 通过浏览器兼容路径操作托管或本地编辑器;
- 使用 `skills/edit-timeline-studio/scripts/validate_edit_plan.mjs` 验证声明式编辑计划;
- 验证轨道放置、转场、字幕、叠加层、可听音频以及最终导出产物;
- 将可编辑的 `.timeline` 项目作为唯一事实来源,而不是仅返回不透明的渲染文件。
版本化的无头命令运行器可以加载和检查可移植项目,验证包含版本的 JSON 计划,以事务方式应用支持的操作,支持空运行和幂等操作 ID,并能在不重写媒体文件的情况下生成新的 `.timeline` 存档。它还能将文档化的可移植视觉 + 配音 + 音乐子集渲染为经过验证的 H.264/AAC MP4。对于尚未包含在命令注册表中的更丰富的合成和操作,浏览器控制仍然是兼容路径。
```
npm run agent -- project.inspect /absolute/path/project.timeline
npm run agent -- track.inspect /absolute/path/project.timeline visuals
npm run agent -- clip.inspect /absolute/path/project.timeline visual-123
npm run agent -- transcript.inspect /absolute/path/project.timeline voice-123
npm run agent -- project.diff /absolute/path/edit-plan.json
npm run agent -- project.run /absolute/path/edit-plan.json
npm run agent -- project.render /absolute/path/render-request.json
```
旧版的 `inspect` 和 `run` 别名仍然可用。写入注册表支持基于 ffprobe 和哈希校验的视觉/音频导入(导入到视觉、音乐或可移植的配音槽位),以及事务性的定时编辑、字幕、源精准的视觉/叠加层、转场、已验证的属性、轨道状态和比例更改。读取命令可返回项目、轨道、片段、文本转录、媒体清单以及字段级别的预期差异。有关计划封装结构,请参阅[命令契约](skills/edit-timeline-studio/references/command-contract.md)。
通过公开的 [skills.sh](https://skills.sh/MartinDelophy/ai-video-editor) 目录安装(当前 CLI 需要 Node.js 22.20.0 或更高版本):
```
npx skills add MartinDelophy/ai-video-editor --skill edit-timeline-studio
```
或者使用 GitHub CLI 2.90.0 或更高版本安装:
```
# Claude Code
gh skill install MartinDelophy/ai-video-editor edit-timeline-studio --agent claude-code --scope user
# Codex
gh skill install MartinDelophy/ai-video-editor edit-timeline-studio --agent codex --scope user
```
若要安装已测试的版本而不是跟踪最新发布版本,请添加 `--pin v0.6.1`。在安装前预览 Skill:
```
gh skill preview MartinDelophy/ai-video-editor edit-timeline-studio
```
## 路线图
- **现在:** 扩展版本化命令注册表,强化确定性离线导出,并提高时间轴编辑的可靠性。
- **下一步:** 扩展无头渲染一致性,并通过 MCP 暴露共享的命令引擎。
- **以后:** 添加协作审查工作流、插件扩展接口以及更多经过本地验证的 AI 模型。
路线图的优先级在 [GitHub Discussions](https://github.com/MartinDelophy/ai-video-editor/discussions) 中讨论形成。欢迎提交功能请求和真实场景的工作流反馈。
## 快速开始
环境要求:Node.js 20+ 和现代 Chromium 浏览器。对于重度 AI 工作流,推荐使用 WebGPU。
```
git clone https://github.com/MartinDelophy/ai-video-editor.git
cd ai-video-editor
npm install
npm run dev
```
打开 Vite 打印的本地 URL。首次运行 AI 可能会下载模型文件;之后的运行将重用浏览器缓存。
## 验证与构建
```
npm test
npm run build
npm run preview
```
使用以下命令运行完整的仓库检查:
```
npm run check
```
## 部署
包含的 [`netlify.toml`](netlify.toml) 会通过 `npm run build` 进行构建,发布 `dist` 目录,启用浏览器 AI/媒体 worker 所需的跨域隔离 headers,并提供 SPA 回退机制。
```
npx netlify-cli deploy --prod --dir=dist
```
## 支持与反馈
如果这个项目对您有帮助,请考虑给它点个 ⭐ Star。如果您遇到问题,请[提交一个 Issue](https://github.com/MartinDelophy/ai-video-editor/issues)。
加入我们的 [Discord 社区](https://discord.gg/uq2uvUTBr) 提问、分享反馈,并与其他用户和贡献者交流。
## 许可证
[MIT](LICENSE)
标签:CNCF毕业项目, MITM代理, ONNX, Whisper, 人工智能, 文字转语音, 浏览器, 用户模式Hook绕过, 自定义脚本, 视频编辑, 语音合成