ATOM00blue/machine-learning-library
GitHub: ATOM00blue/machine-learning-library
一个将优质机器学习教育资源统一规范化为 Markdown 语料库的项目,专为人类学习、AI 智能体导航及 RAG 和微调等机器学习应用而设计。
Stars: 179 | Forks: 23
# 机器学习库
**一份精心挑选、机器可读的互联网优质机器学习教育库(精选的 ML 语料库 / 数据集)——涵盖顶尖大学课程、经典研究论文和高引用量的科普博客——将其规范化为统一的 Markdown 格式,并保留完整的出处信息。**
923 篇文档 · 约 1100 万 token · 涵盖从入门到前沿(2026 年)的研究 · 每一个来源均注明出处。






## 为什么会有这个项目
学习机器学习的最佳资料散落在数十个课程页面、YouTube 频道、arXiv PDF 和个人博客中——它们格式各异,无论是搜索、向量化,还是喂给模型,都十分困难。
本仓库将信息密度最高的来源汇集到**一个地方**,采用**统一的格式**,并在每个文件上附带**干净的元数据**。精选本身就是核心所在:它不是对 arXiv 的无差别堆砌,也不是充满噪点的网络爬取,而是一份刻意挑选、横跨整个领域的阅读清单——从“什么是神经网络”一直延伸到 2025 年的 sparse-attention 和 reasoning-model 论文。
它的设计初衷是**供人类和机器共同使用**:你可以直接阅读它来学习,或者将其导入 vector database 以构建 RAG 导师,fine-tune 领域模型,或对 embedding 进行 benchmark。
## 内容概览
| | |
|---|---|
| **文档总数** | 923 |
| **总大小** | ~42M 字符(~11M token) |
| **arXiv 论文** | 391(78 篇全文 + 313 篇近期摘要+元数据) |
| **讲座转录稿** | 474(涵盖 14 门课程/频道) |
| **网络文章** | 58(经典科普文) |
| **主题标签** | 17 个受控词汇主题(+ 级别 / 媒介 / 任务 / 技术 分面) |
| **格式** | Markdown + YAML frontmatter |
| **覆盖范围** | 基础入门 → 2025–2026 前沿研究 |
每个文件都以结构化的 frontmatter 开头(标题、来源、URL、作者、日期、主题、**受控 `tags`**、`aliases`),因此整个语料库极其易于过滤和解析——并且可以通过主题进行导航(参见 [`atlas/`](atlas/) 和 [`atlas/TAGS.md`](atlas/TAGS.md))。
## 包含哪些内容
### 研究论文 (`corpus/papers/` — 391)
包含 **78** 篇经典论文的**全文**,以及 **313** 篇**近期(2024H2–2026)**论文的**原始摘要+元数据**(附带全文链接)。涵盖基础到前沿:
- **基础理论** — Dropout、word2vec、Seq2Seq、Adam、Batch/Layer Norm、VAE、GANs
- **视觉** — VGG、GoogLeNet、ResNet、DenseNet、Faster R-CNN、YOLOv3、ViT、MAE、DETR
- **Transformer 时代** — *Attention Is All You Need*、BERT、RoBERTa、T5、GPT-3、Chinchilla、scaling laws
- **高效注意力与服务** — FlashAttention 1/2/3、Linformer、Longformer、Performer、Reformer、PagedAttention/vLLM、MQA/GQA、RoPE/ALiBi
- **生成模型** — DDPM、DDIM、Latent Diffusion (Stable Diffusion)、DALL·E 2、DiT、VQ-VAE、StyleGAN、CLIP
- **LLM 与对齐** — LLaMA 1/2、Mistral、Mixtral、InstructGPT/RLHF、DPO、LoRA/QLoRA/DoRA、GPTQ/AWQ/LLM.int8()
- **推理与智能体** — Chain-of-Thought、Self-Consistency、Tree of Thoughts、ReAct、Toolformer
- **前沿技术 (2024–2025)** — Mamba、State-Space Duality、Mixture-of-Depths、DeepSeek V2/V3/R1、Native Sparse Attention
- **最新添加 (2025–2026)** — Titans、RWKV-7、Gated DeltaNet、Mamba-3 及混合线性注意力;推理与 test-time 计算 (RLVR、GRPO-line);BitNet / FP4 quantization;diffusion language models;视频/图像生成;VLMs;LLM 智能体与 RAG;SAE / attribution-graph 可解释性;世界模型;视觉-语言-动作机器人;前沿模型报告;AI-for-science
### 讲座转录稿 (`corpus/youtube/` — 474)
来自最受推崇的机器学习课程和教育者的完整转录稿:
| 课程 / 频道 | 讲座数 |
|---|---:|
| MIT 6.S191 — 深度学习导论 | 86 |
| Yannic Kilcher — 论文导读 | 99 |
| DeepLearning.AI | 49 |
| fast.ai — 实用深度学习 | 48 |
| Stanford CS224n — 深度学习与自然语言处理 | 46 |
| Stanford CS25 — Transformers United | 39 |
| Stanford CS229 — 机器学习 | 20 |
| Stanford CS336 — 从零开始的 Language Modeling | 15 |
| Stanford CS236 — 深度生成模型 | 15 |
| Stanford CS231n — 视觉识别与 CNN | 14 |
| Stanford CS230 — 深度学习 | 9 |
| Andrej Karpathy — 频道及 神经网络:从零到英雄 | 25 |
| 3Blue1Brown — 神经网络系列 | 9 |
### 网络文章 (`corpus/web/` — 58)
从业者真正会引用的深度解析:Jay Alammar 的 *Illustrated* 系列、Lilian Weng 的深度文章、Sebastian Raschka、Stanford CS231n 笔记、*Dive into Deep Learning*、Distill.pub、Anthropic 的 Transformer Circuits 以及 Karpathy 的博客。
## 仓库结构
```
machine-learning-library/
├── README.md ← you are here
├── SOURCES.md ← full attribution: every source, credited
├── NOTICE.md ← licensing & usage notes
├── AGENTS.md / CLAUDE.md ← how an AI agent should navigate & cite this corpus
├── corpus/
│ ├── INDEX.md ← machine-generated index of all 923 files
│ ├── papers/ ← 391 arXiv papers (78 full-text + 313 abstract+metadata)
│ ├── youtube/ ← 474 lecture transcripts, grouped by channel
│ └── web/ ← 58 articles, grouped by domain
├── atlas/ ← topic navigation layer (Maps of Content + learning paths)
│ ├── Home.md ← start here when browsing in Obsidian
│ ├── TAGS.md ← the controlled tag vocabulary
│ ├── topics/ ← one hub per topic (auto-lists every matching doc)
│ └── paths/ ← curated reading paths (Zero to Transformer, …)
├── .obsidian/ ← bundled vault config — open the folder in Obsidian and it just works
├── tools/ ← scripts that clean, tag, and index the corpus
└── examples/
├── self-attention-study-note.md ← a synthesized, fully-cited study note
└── rag_quickstart.py ← minimal semantic search / RAG over the corpus
```
### Frontmatter 格式
每个文档的样式如下:
```
---
title: "Attention Is All You Need"
source: "arxiv"
arxiv_id: "1706.03762"
url: "http://arxiv.org/abs/1706.03762v7"
authors: ["Ashish Vaswani", "Noam Shazeer", ...]
published: "2017-06-12"
topics: ["transformer", "attention"] # original free-form tags
aliases: ["Attention Is All You Need"] # readable Obsidian wikilink targets
tags: [topic/transformers-attention, level/advanced, medium/paper, task/language, technique/attention]
---
## 摘要
...
## 全文
...
```
`tags:` 是构建在原始 `topics:` 之上的受控、可查询词汇表(主题 / 级别 / 媒介 / 任务 / 技术)——参见 [`atlas/TAGS.md`](atlas/TAGS.md)。
## 使用场景
这个语料库是一个基础的构建模块。它适合用于以下方面:
1. **RAG 机器学习导师。** 对语料库进行 embedding,存入 vector DB,并构建一个 Q&A 助手,使其能够基于真实来源回答机器学习问题——并且能够引用其依据的确切讲座或论文。杜绝虚假参考。
2. **Fine-tune 领域模型。** 约 1100 万干净的、高度相关的机器学习文本 token,是一个用于对小型(1–7B)“机器学习讲解”模型进行持续预训练或指令微调的现实数据集。
3. **Embedding / 检索基准测试。** 一个连贯的单一领域语料库,非常适合用于在技术内容上评估 embedding 模型和检索 pipeline。
4. **生成学习笔记。** 使用 LLM 将关于某一主题的多个资料压缩成一份带引用的笔记。`examples/self-attention-study-note.md` 展示了输出结果:一份由原始论文、两篇博客文章和一场 Karpathy 讲座整合而成的 self-attention 讲解——每一个论点都能追溯回其源头。
5. **概念 / 引用图谱。** frontmatter + 交叉引用使得提取论文与讲座之间的概念讲解关系图变得非常简单。
6. **个性化阅读路径。** 按主题和来源进行过滤,生成有序的学习路径(例如“关于 diffusion 模型的所有内容,从最简单的开始”)。
7. **离线参考库。** 它就是纯粹的 Markdown——grep 它,在 Obsidian 中打开它,在飞机上阅读它。
## 快速开始
```
git clone https://github.com/ATOM00blue/machine-learning-library.git
cd machine-learning-library
# 浏览完整索引
less corpus/INDEX.md
# 一切都是纯 Markdown — 随心所欲地进行搜索
grep -rl "flash attention" corpus/
# 按 frontmatter 过滤,例如所有 2024+ 的论文(使用 yq)
for f in corpus/papers/*.md; do
yq -f extract '.published' "$f" | grep -q '^202[45]' && echo "$f"
done
```
最简 RAG 示例:
```
import glob, frontmatter
from sentence_transformers import SentenceTransformer
docs = [frontmatter.load(p) for p in glob.glob("corpus/**/*.md", recursive=True)]
model = SentenceTransformer("BAAI/bge-small-en-v1.5")
embeddings = model.encode([d.content for d in docs])
# ... 存储在你选择的 vector DB 中并进行查询
```
一个可以直接运行的版本位于 [`examples/rag_quickstart.py`](examples/rag_quickstart.py)
(`python examples/rag_quickstart.py --build`,然后就可以向它提问了)。
## 在 Obsidian 中打开 / 连接你的 agent
这个仓库也是一个可以直接使用的 **Obsidian vault** 和一个 **对 agent 友好
的知识库**——根据你的工作方式选择最适合的方式:
**📓 在 [Obsidian](https://obsidian.md) 中浏览。** 将克隆的文件夹作为
vault 打开——内置的 `.obsidian/` 配置已经设置好了带有主题颜色的图谱和
开箱即用的合理默认设置。
- **`atlas/Home.md`** 是你的起始页;**`atlas/topics/`** 包含每个主题的枢纽,
带有精选的阅读清单和交叉链接——所有这些无需任何插件即可使用。
- 两个**可选的**社区插件能让它大放异彩;Obsidian 会提示你启用它们,
或者从 *设置 → 社区插件* 中安装:
[Dataview](https://github.com/blacksmithgu/obsidian-dataview)(在每个枢纽中实时自动列出
文档表格)以及
[Front Matter Title](https://github.com/snezhig/obsidian-front-matter-title)
(图谱/资源管理器节点显示标题,而不是 arXiv/视频 ID)。
- 一切都能优雅降级——这些枢纽、链接、标签和图谱在 GitHub 上以及
作为没有任何插件的普通 Markdown 也能完美渲染。
**🤖 将你的 AI agent 指向它。** 选择其中一项:
| 你正在使用… | 操作方式 |
|---|---|
| Cursor / Codex / Copilot / Gemini CLI / Aider / Zed | 打开文件夹——它们会自动读取 [`AGENTS.md`](AGENTS.md)。 |
| Claude Code | 打开文件夹——它会读取 [`CLAUDE.md`](CLAUDE.md);内置了 `/ml-library` 技能。 |
| Claude Desktop | 添加一个指向该文件夹的 [Filesystem MCP server](https://modelcontextprotocol.io)。 |
| Obsidian + 实时读/写 | 安装 **Local REST API** 插件(内置 MCP 服务器)并执行 `claude mcp add`。 |
| 语义搜索 / RAG | 运行 [`examples/rag_quickstart.py`](examples/rag_quickstart.py)。 |
你的 agent 随后就会基于这些来源回答机器学习问题,并且**引用
确切的论文或讲座**——杜绝虚假参考。
## 版权归属
**所有荣誉均属于原创作者。** 本仓库是对公开可用教育资料的*收集与格式转换*——它本身不包含任何原创的研究或教学内容。每个文件都在 frontmatter 中保留了其来源 URL 和作者信息,并且 **[SOURCES.md](SOURCES.md)** 列出了所收录的每一个课程、频道、出版物和论文。
如果你觉得这个项目有用,请支持真正创作这些资料的人:订阅这些频道,学习这些课程,阅读这些论文,并引用原作者。
有关许可详情和下架/移除政策,请参阅 **[NOTICE.md](NOTICE.md)**。
## 许可证
- 本仓库的**结构、索引、脚本和组织方式**基于 MIT License 发布。
- **每个文档的内容**版权归原作者/出版商所有,此处收录仅出于研究和教育目的。请参阅 [NOTICE.md](NOTICE.md)。
标签:AI教育, Apex, Markdown, RAG, 开源语料库, 微调, 机器学习, 逆向工具, 防御加固