AlayaLab/AlayaWorld

GitHub: AlayaLab/AlayaWorld

AlayaWorld 是一个全栈开源交互式长时序世界模型,通过 3D 空间缓存与时间记忆机制实现稳定、一致且可玩的视频世界生成。

Stars: 449 | Forks: 20

# AlayaWorld:长时序与可玩视频世界生成

Alaya Lab

## 📰 最新动态 - **[2026-07-16]** 推理代码已发布,预训练权重可在 🤗 [Hugging Face](https://huggingface.co/AlayaLab/AlayaWorld) 上获取。请参阅[快速开始](#-quick-start)。 - **[2026-07-08]** 项目主页和技术报告已发布。 ## 🚀 发布路线图 - [x] 推理代码 - [x] 预训练权重 — 🤗 [AlayaLab/AlayaWorld](https://huggingface.co/AlayaLab/AlayaWorld) - [ ] 训练代码 - [ ] 训练数据(部分) ## ✨ 核心特性 AlayaWorld 围绕四个核心特性构建:**交互性**、**一致性**、**稳定性**和**运行时**。 ### 🎮 交互性 两个控制通道:一个带有轻量级 AdaLN 相机调制的渲染 3D 缓存,用于实现基于轨迹感知的接地导航;以及 chunk 级别的 prompt 切换,用于在生成过程中引入新事件。 ### 🧠 一致性 两种互补的记忆形式:重投影到查询视角的显式 3D 缓存用于空间回溯,加上压缩的帧历史 embedding 用于时间连续性,使得重新访问的地方依然可以识别。 ### 🛡️ 稳定性 通过对漂移历史进行训练获得长时序稳定性;错误库将累积的伪影重新注入记忆和目标中,防止误差在长达分钟级的 rollout 中发生复合累积。 ### ⚡ 运行时 通过少步 DMD 蒸馏和短时间 chunk 实现实时交互,并在 chunk 边界处进行 prompt 切换,以最大程度减少视觉和语义延迟。 ## 🏃 快速开始 推理过程为图生视频(image-to-video):给模型提供**首帧图像**、**相机轨迹**和**文本 prompt**,它就会沿着相机路径逐个 chunk 地生成视频(1 个 chunk ≈ 1.33秒 @ 24fps;~45 个 chunk ≈ 1 分钟)。 **1. 环境** — 需要 CUDA GPU 和 PyTorch ≥ 2.6(DiT 使用 `flex_attention`)。 **2. 权重** — 该模型由四部分组成。只有 `merged_infer.safetensors` (AlayaWorld 自有的权重)托管在我们的 🤗 仓库中;text encoder 和 depth model 为第三方模型——请从其原始来源获取: | `checkpoints/` 下的路径 | 来源 | |---|---| | `merged_infer.safetensors` — DiT + VAE + text-encoder + history-encoder 打包文件 | 🤗 [AlayaLab/AlayaWorld](https://huggingface.co/AlayaLab/AlayaWorld) | | `gemma-3-12b-it-qat-q4_0-unquantized/` — Gemma text encoder | 🤗 [google/gemma-3-12b-it-qat-q4_0-unquantized](https://huggingface.co/google/gemma-3-12b-it-qat-q4_0-unquantized)(受控访问——请先接受 Google 的许可协议) | | `Depth-Anything-3/` — DA3 代码仓库 | GitHub [ByteDance-Seed/Depth-Anything-3](https://github.com/ByteDance-Seed/Depth-Anything-3)(见步骤 3) | | `hf_cache/` — DA3 权重,采用 HF-cache 结构 | 🤗 [depth-anything/DA3NESTED-GIANT-LARGE-1.1](https://huggingface.co/depth-anything/DA3NESTED-GIANT-LARGE-1.1)(见步骤 3) | | `taeltx2_3_wide.pth` — *可选* TAEHV bank decoder (`--bank-taehv`) | GitHub [madebyollin/taehv](https://github.com/madebyollin/taehv) | 在仓库根目录下执行: ``` # AlayaWorld 权重(此 repo) hf download AlayaLab/AlayaWorld merged_infer.safetensors --local-dir checkpoints # Gemma 文本编码器(受限:需先登录并在其 HF 页面上接受 license) hf download google/gemma-3-12b-it-qat-q4_0-unquantized \ --local-dir checkpoints/gemma-3-12b-it-qat-q4_0-unquantized ``` 目标目录结构(`configs/infer.yaml` 中的 `paths:` 指向此处;如果你的权重 存放在其他位置,请重新指向): ``` checkpoints/ ├── merged_infer.safetensors ├── gemma-3-12b-it-qat-q4_0-unquantized/ ├── Depth-Anything-3/ # step 3 ├── hf_cache/ # step 3 └── taeltx2_3_wide.pth # optional ``` **3. Depth-Anything-3(必需)** — 空间记忆分支依赖于 DA3,这是一个 外部仓库(如果没有它,推理将会报错): ``` git clone https://github.com/ByteDance-Seed/Depth-Anything-3 checkpoints/Depth-Anything-3 pip install -e checkpoints/Depth-Anything-3 # run AFTER installing the torch stack (see requirements.txt) ``` 其权重 (`depth-anything/DA3NESTED-GIANT-LARGE-1.1`) 将从 `checkpoints/hf_cache/` 加载——你可以让它们在首次运行时下载到此处,或者提前 手动获取: ``` HF_HOME=checkpoints/hf_cache hf download depth-anything/DA3NESTED-GIANT-LARGE-1.1 ``` **4. 运行一个现成的案例**(案例位于 [`playground/`](playground) 下)。 一行命令的启动器将渲染内置的 **case1**(约 1 分钟): ``` # 单个 GPU bash inference/run.sh # 多 GPU(Ulysses context parallel;例如 2 或 4 个 GPU) GPUS=4 bash inference/run.sh ``` `run.sh` 只是转发给 `python -m inference.run`(默认参数为 `--input playground/case1/case1`);直接调用该模块即可运行任何案例或 传入额外的标志: ``` PYTORCH_ALLOC_CONF=expandable_segments:True \ python -m inference.run --input playground/case1/case1 --seed 1234 ``` 生成的 mp4 结果将保存在 `outputs/` 目录下。请参阅 [`inference/README.md`](inference/README.md) 获取完整的选项列表。 **5. 使用你自己的输入** — 一个“案例”是三个共享同一前缀的文件: ``` _image.png first frame (seeds the history) _camera.pt camera trajectory: cam_c2w [F,4,4] + intrinsics _prompt.txt text prompt ``` 将 `--input` 指向该前缀。对于长时序(约 1 分钟)的 rollout,添加 `--ttc` 以抑制外观漂移。请参阅 [`inference/README.md`](inference/README.md) 获取完整的选项列表。 ## 👥 团队 - **核心负责人:** Kaipeng Zhang - **负责人:** Chuanhao Li - **核心贡献者:** Chuanhao Li, Kaipeng Zhang, Yifan Zhan, Yongtao Ge, Yuanyang Yin - **贡献者:** Jiaming Tan, Kang He, Liaoyuan Fan, Ruicong Liu, Xiaojie Xu, Xuangeng Chu, Zhen Li, Zhengyuan Lin, Zhixiang Wang, Zian Meng, Zihui Gao ## 📬 联系方式 如需合作或业务咨询,请联系 **kaipeng.zhang@shanda.com**。 ## 📝 引用 如果你发现 AlayaWorld 对你的研究有帮助,请引用: ``` @article{team2026alayaworld, title={AlayaWorld: Long-Horizon and Playable Video World Generation}, author={Team, AlayaWorld and Zhang, Kaipeng and Li, Chuanhao and Zhan, Yifan and Ge, Yongtao and Yin, Yuanyang and Tan, Jiaming and He, Kang and Fan, Liaoyuan and Liu, Ruicong and others}, journal={arXiv preprint arXiv:2607.06291}, year={2026} } ``` ## 📄 许可协议 本项目基于 Lightricks Ltd. 的 LTX-2。LTX-2 原始代码库 (`flash_alaya/ltx2/`)的部分内容已被 Alaya Lab(盛大 AI 研究 东京)修改,仅供学术和研究目的使用;发布的权重 (`merged_infer.safetensors`)是基于 LTX-2.3 微调而来的。因此,本 项目——包括代码和权重——基于 [**LTX-2 社区许可协议**](LICENSE) 发布。来自 LTX-2 的所有原始版权、许可、 专利、商标和归属声明均已保留。 **仅供学术研究和非商业用途。** 如需将 LTX-2 或其衍生作品用于商业目的,请联系 Lightricks Ltd.(年营业收入 ≥ 1000 万美元 的实体需要获取商业许可)。 有关完整的归属声明,请参阅 [NOTICE](NOTICE) 和 [THIRD_PARTY_LICENSES.md](THIRD_PARTY_LICENSES.md)。第三方权重(Gemma-3 text encoder; Depth-Anything-3)在此处**未进行分发**——请从其原始来源处 根据它们各自的许可协议获取。
标签:AIGC, IaC 扫描, Vectored Exception Handling, 世界模型, 人工智能, 凭据扫描, 深度学习, 生成式AI, 用户模式Hook绕过, 索引, 视频生成, 逆向工具