ATOM00blue/machine-learning-library

GitHub: ATOM00blue/machine-learning-library

一个将优质机器学习教育资源统一规范化为 Markdown 语料库的项目,专为人类学习、AI 智能体导航及 RAG 和微调等机器学习应用而设计。

Stars: 179 | Forks: 23

# 机器学习库 **一份精心挑选、机器可读的互联网优质机器学习教育库(精选的 ML 语料库 / 数据集)——涵盖顶尖大学课程、经典研究论文和高引用量的科普博客——将其规范化为统一的 Markdown 格式,并保留完整的出处信息。** 923 篇文档 · 约 1100 万 token · 涵盖从入门到前沿(2026 年)的研究 · 每一个来源均注明出处。 ![文档](https://img.shields.io/badge/documents-923-blue) ![token](https://img.shields.io/badge/tokens-~11M-green) ![论文](https://img.shields.io/badge/arXiv_papers-391-orange) ![讲座](https://img.shields.io/badge/lectures-474-red) ![文章](https://img.shields.io/badge/articles-58-purple) ![主题](https://img.shields.io/badge/topics-17-blueviolet) ## 为什么会有这个项目 学习机器学习的最佳资料散落在数十个课程页面、YouTube 频道、arXiv PDF 和个人博客中——它们格式各异,无论是搜索、向量化,还是喂给模型,都十分困难。 本仓库将信息密度最高的来源汇集到**一个地方**,采用**统一的格式**,并在每个文件上附带**干净的元数据**。精选本身就是核心所在:它不是对 arXiv 的无差别堆砌,也不是充满噪点的网络爬取,而是一份刻意挑选、横跨整个领域的阅读清单——从“什么是神经网络”一直延伸到 2025 年的 sparse-attention 和 reasoning-model 论文。 它的设计初衷是**供人类和机器共同使用**:你可以直接阅读它来学习,或者将其导入 vector database 以构建 RAG 导师,fine-tune 领域模型,或对 embedding 进行 benchmark。 ## 内容概览 | | | |---|---| | **文档总数** | 923 | | **总大小** | ~42M 字符(~11M token) | | **arXiv 论文** | 391(78 篇全文 + 313 篇近期摘要+元数据) | | **讲座转录稿** | 474(涵盖 14 门课程/频道) | | **网络文章** | 58(经典科普文) | | **主题标签** | 17 个受控词汇主题(+ 级别 / 媒介 / 任务 / 技术 分面) | | **格式** | Markdown + YAML frontmatter | | **覆盖范围** | 基础入门 → 2025–2026 前沿研究 | 每个文件都以结构化的 frontmatter 开头(标题、来源、URL、作者、日期、主题、**受控 `tags`**、`aliases`),因此整个语料库极其易于过滤和解析——并且可以通过主题进行导航(参见 [`atlas/`](atlas/) 和 [`atlas/TAGS.md`](atlas/TAGS.md))。 ## 包含哪些内容 ### 研究论文 (`corpus/papers/` — 391) 包含 **78** 篇经典论文的**全文**,以及 **313** 篇**近期(2024H2–2026)**论文的**原始摘要+元数据**(附带全文链接)。涵盖基础到前沿: - **基础理论** — Dropout、word2vec、Seq2Seq、Adam、Batch/Layer Norm、VAE、GANs - **视觉** — VGG、GoogLeNet、ResNet、DenseNet、Faster R-CNN、YOLOv3、ViT、MAE、DETR - **Transformer 时代** — *Attention Is All You Need*、BERT、RoBERTa、T5、GPT-3、Chinchilla、scaling laws - **高效注意力与服务** — FlashAttention 1/2/3、Linformer、Longformer、Performer、Reformer、PagedAttention/vLLM、MQA/GQA、RoPE/ALiBi - **生成模型** — DDPM、DDIM、Latent Diffusion (Stable Diffusion)、DALL·E 2、DiT、VQ-VAE、StyleGAN、CLIP - **LLM 与对齐** — LLaMA 1/2、Mistral、Mixtral、InstructGPT/RLHF、DPO、LoRA/QLoRA/DoRA、GPTQ/AWQ/LLM.int8() - **推理与智能体** — Chain-of-Thought、Self-Consistency、Tree of Thoughts、ReAct、Toolformer - **前沿技术 (2024–2025)** — Mamba、State-Space Duality、Mixture-of-Depths、DeepSeek V2/V3/R1、Native Sparse Attention - **最新添加 (2025–2026)** — Titans、RWKV-7、Gated DeltaNet、Mamba-3 及混合线性注意力;推理与 test-time 计算 (RLVR、GRPO-line);BitNet / FP4 quantization;diffusion language models;视频/图像生成;VLMs;LLM 智能体与 RAG;SAE / attribution-graph 可解释性;世界模型;视觉-语言-动作机器人;前沿模型报告;AI-for-science ### 讲座转录稿 (`corpus/youtube/` — 474) 来自最受推崇的机器学习课程和教育者的完整转录稿: | 课程 / 频道 | 讲座数 | |---|---:| | MIT 6.S191 — 深度学习导论 | 86 | | Yannic Kilcher — 论文导读 | 99 | | DeepLearning.AI | 49 | | fast.ai — 实用深度学习 | 48 | | Stanford CS224n — 深度学习与自然语言处理 | 46 | | Stanford CS25 — Transformers United | 39 | | Stanford CS229 — 机器学习 | 20 | | Stanford CS336 — 从零开始的 Language Modeling | 15 | | Stanford CS236 — 深度生成模型 | 15 | | Stanford CS231n — 视觉识别与 CNN | 14 | | Stanford CS230 — 深度学习 | 9 | | Andrej Karpathy — 频道及 神经网络:从零到英雄 | 25 | | 3Blue1Brown — 神经网络系列 | 9 | ### 网络文章 (`corpus/web/` — 58) 从业者真正会引用的深度解析:Jay Alammar 的 *Illustrated* 系列、Lilian Weng 的深度文章、Sebastian Raschka、Stanford CS231n 笔记、*Dive into Deep Learning*、Distill.pub、Anthropic 的 Transformer Circuits 以及 Karpathy 的博客。 ## 仓库结构 ``` machine-learning-library/ ├── README.md ← you are here ├── SOURCES.md ← full attribution: every source, credited ├── NOTICE.md ← licensing & usage notes ├── AGENTS.md / CLAUDE.md ← how an AI agent should navigate & cite this corpus ├── corpus/ │ ├── INDEX.md ← machine-generated index of all 923 files │ ├── papers/ ← 391 arXiv papers (78 full-text + 313 abstract+metadata) │ ├── youtube/ ← 474 lecture transcripts, grouped by channel │ └── web/ ← 58 articles, grouped by domain ├── atlas/ ← topic navigation layer (Maps of Content + learning paths) │ ├── Home.md ← start here when browsing in Obsidian │ ├── TAGS.md ← the controlled tag vocabulary │ ├── topics/ ← one hub per topic (auto-lists every matching doc) │ └── paths/ ← curated reading paths (Zero to Transformer, …) ├── .obsidian/ ← bundled vault config — open the folder in Obsidian and it just works ├── tools/ ← scripts that clean, tag, and index the corpus └── examples/ ├── self-attention-study-note.md ← a synthesized, fully-cited study note └── rag_quickstart.py ← minimal semantic search / RAG over the corpus ``` ### Frontmatter 格式 每个文档的样式如下: ``` --- title: "Attention Is All You Need" source: "arxiv" arxiv_id: "1706.03762" url: "http://arxiv.org/abs/1706.03762v7" authors: ["Ashish Vaswani", "Noam Shazeer", ...] published: "2017-06-12" topics: ["transformer", "attention"] # original free-form tags aliases: ["Attention Is All You Need"] # readable Obsidian wikilink targets tags: [topic/transformers-attention, level/advanced, medium/paper, task/language, technique/attention] --- ## 摘要 ... ## 全文 ... ``` `tags:` 是构建在原始 `topics:` 之上的受控、可查询词汇表(主题 / 级别 / 媒介 / 任务 / 技术)——参见 [`atlas/TAGS.md`](atlas/TAGS.md)。 ## 使用场景 这个语料库是一个基础的构建模块。它适合用于以下方面: 1. **RAG 机器学习导师。** 对语料库进行 embedding,存入 vector DB,并构建一个 Q&A 助手,使其能够基于真实来源回答机器学习问题——并且能够引用其依据的确切讲座或论文。杜绝虚假参考。 2. **Fine-tune 领域模型。** 约 1100 万干净的、高度相关的机器学习文本 token,是一个用于对小型(1–7B)“机器学习讲解”模型进行持续预训练或指令微调的现实数据集。 3. **Embedding / 检索基准测试。** 一个连贯的单一领域语料库,非常适合用于在技术内容上评估 embedding 模型和检索 pipeline。 4. **生成学习笔记。** 使用 LLM 将关于某一主题的多个资料压缩成一份带引用的笔记。`examples/self-attention-study-note.md` 展示了输出结果:一份由原始论文、两篇博客文章和一场 Karpathy 讲座整合而成的 self-attention 讲解——每一个论点都能追溯回其源头。 5. **概念 / 引用图谱。** frontmatter + 交叉引用使得提取论文与讲座之间的概念讲解关系图变得非常简单。 6. **个性化阅读路径。** 按主题和来源进行过滤,生成有序的学习路径(例如“关于 diffusion 模型的所有内容,从最简单的开始”)。 7. **离线参考库。** 它就是纯粹的 Markdown——grep 它,在 Obsidian 中打开它,在飞机上阅读它。 ## 快速开始 ``` git clone https://github.com/ATOM00blue/machine-learning-library.git cd machine-learning-library # 浏览完整索引 less corpus/INDEX.md # 一切都是纯 Markdown — 随心所欲地进行搜索 grep -rl "flash attention" corpus/ # 按 frontmatter 过滤,例如所有 2024+ 的论文(使用 yq) for f in corpus/papers/*.md; do yq -f extract '.published' "$f" | grep -q '^202[45]' && echo "$f" done ``` 最简 RAG 示例: ``` import glob, frontmatter from sentence_transformers import SentenceTransformer docs = [frontmatter.load(p) for p in glob.glob("corpus/**/*.md", recursive=True)] model = SentenceTransformer("BAAI/bge-small-en-v1.5") embeddings = model.encode([d.content for d in docs]) # ... 存储在你选择的 vector DB 中并进行查询 ``` 一个可以直接运行的版本位于 [`examples/rag_quickstart.py`](examples/rag_quickstart.py) (`python examples/rag_quickstart.py --build`,然后就可以向它提问了)。 ## 在 Obsidian 中打开 / 连接你的 agent 这个仓库也是一个可以直接使用的 **Obsidian vault** 和一个 **对 agent 友好 的知识库**——根据你的工作方式选择最适合的方式: **📓 在 [Obsidian](https://obsidian.md) 中浏览。** 将克隆的文件夹作为 vault 打开——内置的 `.obsidian/` 配置已经设置好了带有主题颜色的图谱和 开箱即用的合理默认设置。 - **`atlas/Home.md`** 是你的起始页;**`atlas/topics/`** 包含每个主题的枢纽, 带有精选的阅读清单和交叉链接——所有这些无需任何插件即可使用。 - 两个**可选的**社区插件能让它大放异彩;Obsidian 会提示你启用它们, 或者从 *设置 → 社区插件* 中安装: [Dataview](https://github.com/blacksmithgu/obsidian-dataview)(在每个枢纽中实时自动列出 文档表格)以及 [Front Matter Title](https://github.com/snezhig/obsidian-front-matter-title) (图谱/资源管理器节点显示标题,而不是 arXiv/视频 ID)。 - 一切都能优雅降级——这些枢纽、链接、标签和图谱在 GitHub 上以及 作为没有任何插件的普通 Markdown 也能完美渲染。 **🤖 将你的 AI agent 指向它。** 选择其中一项: | 你正在使用… | 操作方式 | |---|---| | Cursor / Codex / Copilot / Gemini CLI / Aider / Zed | 打开文件夹——它们会自动读取 [`AGENTS.md`](AGENTS.md)。 | | Claude Code | 打开文件夹——它会读取 [`CLAUDE.md`](CLAUDE.md);内置了 `/ml-library` 技能。 | | Claude Desktop | 添加一个指向该文件夹的 [Filesystem MCP server](https://modelcontextprotocol.io)。 | | Obsidian + 实时读/写 | 安装 **Local REST API** 插件(内置 MCP 服务器)并执行 `claude mcp add`。 | | 语义搜索 / RAG | 运行 [`examples/rag_quickstart.py`](examples/rag_quickstart.py)。 | 你的 agent 随后就会基于这些来源回答机器学习问题,并且**引用 确切的论文或讲座**——杜绝虚假参考。 ## 版权归属 **所有荣誉均属于原创作者。** 本仓库是对公开可用教育资料的*收集与格式转换*——它本身不包含任何原创的研究或教学内容。每个文件都在 frontmatter 中保留了其来源 URL 和作者信息,并且 **[SOURCES.md](SOURCES.md)** 列出了所收录的每一个课程、频道、出版物和论文。 如果你觉得这个项目有用,请支持真正创作这些资料的人:订阅这些频道,学习这些课程,阅读这些论文,并引用原作者。 有关许可详情和下架/移除政策,请参阅 **[NOTICE.md](NOTICE.md)**。 ## 许可证 - 本仓库的**结构、索引、脚本和组织方式**基于 MIT License 发布。 - **每个文档的内容**版权归原作者/出版商所有,此处收录仅出于研究和教育目的。请参阅 [NOTICE.md](NOTICE.md)。
标签:AI教育, Apex, Markdown, RAG, 开源语料库, 微调, 机器学习, 逆向工具, 防御加固