Ksajjadi/Deep-Learning-CourseProjects

GitHub: Ksajjadi/Deep-Learning-CourseProjects

德黑兰大学深度学习课程的七项作业合集,端到端复现多篇已发表论文并严格对比实验结果,涵盖 CNN 分类、医学图像分割、目标检测、序列模型、注意力重识别、diffusion LLM 微调与生成式建模等核心主题。

Stars: 0 | Forks: 0

# 深度学习课程项目 ![Python](https://img.shields.io/badge/Python-3.12-3776AB?logo=python&logoColor=white) ![PyTorch](https://img.shields.io/badge/PyTorch-EE4C2C?logo=pytorch&logoColor=white) ![TensorFlow](https://img.shields.io/badge/TensorFlow-FF6F00?logo=tensorflow&logoColor=white) ![Jupyter](https://img.shields.io/badge/Jupyter-F37626?logo=jupyter&logoColor=white) ![License](https://img.shields.io/badge/license-MIT-blue) 这是德黑兰大学《神经网络与深度学习》课程的作业。每项作业都端到端地复现了一篇已发表的论文(包括数据、架构和训练方案),然后将结果与论文报告的数据进行比较,而不是仅仅将论文作为粗略的参考。这些项目涵盖了经典学习规则、CNN、分割与检测、序列模型、基于注意力机制的重识别、真实的 diffusion LLM 以及生成式建模。 ## 亮点 有四个项目与原论文结果足够接近,或者自身足够新颖,因此被提取成了独立的仓库: - [使用 INC-VGGN 进行水稻叶部病害检测](https://github.com/Ksajjadi/rice-leaf-disease-inc-vggn) — 复现了 Chen et al. (2020) 的研究;训练出的模型达到了 92.24% 的测试准确率,而原论文报告的准确率为 92.00%。 - [脑部 MRI 组织分割](https://github.com/Ksajjadi/brain-mri-mnet-segmentation) — 一种 M-Net 风格的 U-Net 变体,超越了原论文设定的所有逐类 Dice 目标(WM、GM、CSF)。 - [带有 VampPrior 的 VAE](https://github.com/Ksajjadi/vae-vampprior-posterior-collapse) — 复现了 Tomczak & Welling (2018) 的研究,并直接衡量了对后验塌陷的修复效果:活跃的潜在单元和估计的对数似然均按照论文预测的方向变化。 - [面向 Text-to-SQL 的 LLaDA 微调](https://github.com/Ksajjadi/llada-text2sql-lora) — 使用自定义的掩码扩散采样循环,对真实的 GSAI-ML/LLaDA-8B-Instruct diffusion LLM (NeurIPS 2025) 进行了 LoRA 微调,并将其应用于原论文从未测试过的任务。 ## 仓库结构 | 文件夹 | 复现的论文 | 主题 | |---|---|---| | [`Assignment 1`](Assignment%201) | 经典学习规则(无单一外部论文) | 从零实现 Adaline & Madaline、一个前馈回归网络、一个用于聚类的卷积自编码器 | | [`Assignment 2`](Assignment%202) | Chen et al. 2020 (INC-VGGN); Shawky et al. 2020 (CNN-MLP) | 水稻叶部病害分类、遥感场景分类 | | [`Assignment 3`](Assignment%203) | M-Net 风格的脑部 MRI 分割;改进的 Faster R-CNN | 脑部组织分割、车辆检测 | | [`Assignment 4`](Assignment%204) | Liu & Lane 风格的注意力 BiRNN | 联合意图检测与槽位填充 (ATIS)、递归时间序列预测 | | [`Assignment 5`](Assignment%205) | BoTNet + 反事实注意力学习;LLaDA (Nie et al. 2025) | ResNet50 与 BoTNet50 的重识别对比、LLaDA-8B 的 LoRA 微调 | | [`Assignment 6`](Assignment%206) | Tomczak & Welling 2018 (VampPrior) | VAE 后验塌陷与活跃单元分析 | | [`Assignment +`](Assignment%20+) | Xu & Salimans (wav2vec 2.0); Hu et al. (Llama LoRA) | 图像描述生成、城市声音分类、LoRA 情感微调、FGSM/PGD 对抗攻击 | ## 项目摘要 **Assignment 1 — 经典神经网络模型。** 从零实现 Adaline 和 Madaline,并在乳腺癌诊断以及合成的 moons/circles 数据集上进行评估;基于加州房价数据的前馈回归网络;以及在 Fashion-MNIST 上用于无监督聚类的卷积自编码器。 **Assignment 2 — CNN 分类。** Q1 复现了 Chen et al. 用于水稻叶部病害检测的 INC-VGGN(准确率达到 92.24%,对比原论文的 92.00%,以及 75.5% 的 AlexNet 基线)。Q2 复现了一个用于 UC-Merced 遥感场景分类的 CNN-MLP(使用 Xception 骨干网络)。 **Assignment 3 — 分割与检测。** Q1 是一个用于脑部 MRI 组织分割的 M-Net 风格 U-Net 变体,通过与原论文设定的逐类 Dice 目标进行对比评估,并超越了全部三个目标(WM、GM、CSF)。Q2 是使用 MobileNetV3-Large FPN 骨干网络的改进型 Faster R-CNN 进行车辆检测。 **Assignment 4 — 序列模型。** Q1 是在 ATIS 数据集上利用注意力 BiLSTM 进行的联合意图检测与槽位填充,并加上一个 encoder-decoder 变体进行对比。Q2 比较了用于递归股票价格预测的 MLP、CNN+LSTM 和 CNN+GRU 架构。 **Assignment 5 — 注意力机制与 diffusion LLM。** Q1 比较了 ResNet50 与 BoTNet50 在牛重识别上的表现,并在其基础上叠加了反事实注意力学习,客观地分析了其有效与无效之处。Q2 对真实的 LLaDA-8B-Instruct diffusion 语言模型进行 LoRA 微调以处理 Text-to-SQL 任务,其中包括从零实现的掩码扩散采样循环。 **Assignment 6 — 生成式建模。** 使用 VampPrior(一种可学习的后验混合先验)训练 VAE,并与标准的 Gaussian 先验基线进行对比,通过活跃的潜在单元和估计的对数似然直接衡量后验塌陷情况。 **Assignment +(额外加分)— 四项简短研究。** 图像描述生成(将 VGG16 特征输入到注意力 LSTM 中,外加一个 CLIP 风格的对比检索模型)、比较 Wav2Vec2 迁移学习与从零训练的 CNN 的城市声音分类、针对 Llama-3.2-1B 进行情感分类的 LoRA 微调,以及在 FGSM/PGD 攻击下的对抗鲁棒性(以对抗训练作为防御手段)。 ## 技术栈 PyTorch 和 TensorFlow/Keras,在 Kaggle 和 Colab GPU 上运行。各个 notebook 中列出了它们具体的依赖项和数据集。
标签:AI, NoSQL, PyTorch, TensorFlow, 凭据扫描, 学习项目, 深度学习, 自动化代码审查, 计算机视觉, 逆向工具