Lulzx/every-model-is-a-copy

GitHub: Lulzx/every-model-is-a-copy

通过信号测量逆向工程一种 YouTube 动态视频散文风格,将其固化为可执行的代码规范与构建校验规则,并以一段模型蒸馏讲解视频作为完整实例。

Stars: 0 | Forks: 0

# 你使用的每个模型都是副本 通过测量逆向工程一种 YouTube 动态视频散文风格,然后将其作为代码重新构建。 分为两部分: 1. **[`SQUINTIST-STYLE.md`](SQUINTIST-STYLE.md)** — 对一个带有旁白的动态图像散文频道背后的视觉、动态、音频和修辞系统进行拆解,该拆解源自媒体本身而非视觉观察:从帧中提取调色板,通过场景检测获取切换频率,通过 `ebur128` 和 `silencedetect` 获取响度和停顿结构,通过字幕时间获取节奏。 2. **[`every-model-is-a-copy/`](every-model-is-a-copy/)** — 一个关于 **model distillation** 的 3:13 旁白讲解视频,使用 [HyperFrames](https://hyperframes.heygen.com)(从 HTML 渲染的视频)按照该规范构建。

Contact sheet of all twelve scenes

## 拆解发现 测量所得,而非主观猜测: | | | |---|---| | 背景 | 单一扁平的暖近黑色 `#141211`,永不改变 | | 强调色 | 只有一种 —— `#F8883F` —— 承载所有的强调重点 | | 字体 | 三个字体家族,三种固定用途:手写体用于散文,字间距加宽的灰色大写字母用于章节标签,等宽字体用于引用的 artifacts | | 镜头切换 | 在 10:35 内有 **零次** 硬切 —— 但大约有 99 次视觉变化,即每 ~6.4 秒出现一次新状态 | | 动态效果 | 元素在一个持久的白板上建立和移除,然后保持完全静止 | | 音频 | **完全没有音乐**;间隔是 −71 dB 下真正的数字静音;停顿恰好落在章节边界上 | | 节奏 | 147–170 wpm(每分钟字数),在采样的每个视频中,平均句子长度为 10–11 个单词 | 扁平的背景加上真正的静态保持,这就是为什么十分钟的 1080p 视频可以压缩到 ~70 kbps。 ## 视频 这篇散文认为,每个产品系列中便宜的模型 —— mini、flash、small —— 其实都是根据你从未接触过的 teacher 模型训练出来的 student 模型,转移的仅仅是 teacher 不确定性的形态而非它的答案;而且业界大部分所谓的 distillation 根本不是 distillation,因为 API 交给你的只是文本,绝不是这种方法实际需要的概率分布。 它故意在名为 **The Steelman** 的一章中进行了一次自我反驳 —— 这是所研究的视频格式的标志性举动。每一个事实性主张都在 [`DESCRIPTION.md`](every-model-is-a-copy/DESCRIPTION.md) 中提供了来源。 ## 构建它 ``` cd every-model-is-a-copy npm run check # lint + runtime + layout + motion + contrast npm run dev # live preview npm run render # → renders/*.mp4 ``` 旁白已预先生成到 `assets/audio/` 中,因此渲染不需要 API 密钥。要重新生成语音,你需要一个 [fish.audio](https://fish.audio) 密钥;脚本和语音 ID 位于 [`SCRIPT.md`](every-model-is-a-copy/SCRIPT.md) 中。 ## 布局 ``` SQUINTIST-STYLE.md the teardown every-model-is-a-copy/ ├── frame.md the style, as enforceable design truth ├── BRIEF.md confirmed intent ├── STORYBOARD.md twelve frames, shot plan, sources ├── SCRIPT.md locked narration ├── DESCRIPTION.md titles, chapters, sources, thumbnail direction ├── index.html orchestrator — 12 slots + 12 audio tracks ├── compositions/frames/ one HTML sub-composition per scene ├── assets/ fonts (OFL) + generated narration └── .media/recipes/ the whole setup, frozen and reusable ``` `frame.md` 是最有趣的文件。它将测量出的风格转化为规则,供构建时进行核对 —— 一种强调色,没有硬切,没有音乐,屏幕文本最多只能占口述单词的 10–25 %,并且包含一份明确的禁用事项清单。 ## 备注 - **源视频不在此 repository 中。** 它们是在本地下载用于测量的,并且被 `.gitignore` 排除,其中包括从中提取的每一帧画面、缩略图和文字记录。提交的只有属于我们的分析结果。这种风格的完整荣誉属于发明它的频道 —— [@Squintist](https://www.youtube.com/@Squintist)。 - 字体为 [Caveat](https://fonts.google.com/specimen/Caveat) 和 [Caveat Brush](https://fonts.google.com/specimen/Caveat+Brush),在 SIL Open Font License 下自行托管;许可证随 `assets/fonts/` 一起提供。 - 旁白是合成的。它的语速比参考频道测量出的语速范围要快 —— 使用 `prosody.speed: 0.85` 可以将其降回到 ~155 wpm。
标签:AI科普, 前端工程, 动态图形, 多模态安全, 数据可视化, 暗色界面, 视频制作, 音视频分析