初学者启动阶段
Math (数学知识)
知识导图
DL (深度学习)
知识导图
3D (3D Computer Graphics)
3D 方向 — 进阶学习与项目指南
本文件基于原始导图中"3D 计算机图形学"与相关条目(Mesh / Voxel / Point Cloud / 3DGS / NeRF)逐条展开,旨在为希望在 3D 视觉/图形方向做深入研究或工程实现的同学提供完整学习路线与验收模板。
知识体系(逐条映射)
- • Mesh:网格基础、顶点/面/法线、纹理映射、空间变换
- • Voxel:体素表示、体渲染基础
- • Point Cloud:点云表示、ICP 对齐、点云特征提取、噪声处理
- • 3D Gaussian Splatting(3DGS):可微分高斯基元、渲染技术
- • NeRF(神经辐射场):位置编码、体渲染、粗/细采样策略
学习路径(4 周建议)
Week 1 — 基础与数据格式
学习:PLY/OBJ/PCD 格式,Mesh 基础,点云基本操作(PCL / Open3D)
实践:用 Open3D 读取并可视化点云/网格
资源建议:
- • [知识点] Mesh (网格):基本介绍、数学原理(空间变换)、建模方法(手动、扫描、程序)、优缺点(渲染高效、细节不足)。
- • [知识点] Voxel (体素):基本介绍(三维空间单元)、数学原理(光线投射)、优缺点(体积效果好、开销大)。
Week 2 — 点云处理与特征学习
学习:ICP、法线估计、PointNet/PointNet++、点云数据增强
实践:PointNet-lite 实现点云分类/分割
资源建议:
- • [知识点] Point Cloud (点云):基本介绍(离散点集)、特点(稀疏、无序)、关键算法(ICP 配准、特征提取)、优缺点(对接扫描、噪声敏感)。
- • [资源] 论文:《PointNet: Deep Learning on Point Sets...》
Week 3 — NeRF 与体渲染入门
学习:NeRF 原理、位置编码、体渲染方程、训练流程
实践:使用现成实现(tiny NeRF)复现小场景渲染
资源建议:
- • [知识点] NeRF (神经辐射场):核心思想(MLP 隐式学习)、数学原理(粗/细网络)、模型结构(位置编码、体渲染)、优缺点(效果好、训练慢)。
- • [资源] 论文:《NeRF: Representing Scenes as Neural Radiance Fields...》
Week 4 — 3DGS 与进阶技术
学习:3D Gaussian Splatting 的核心思想与实现挑战(可微分渲染、效率优化)
实践:阅读并复现论文中的关键组件(若硬件资源受限可做算法级模拟)
资源建议:
- • [知识点] 3DGS (3D 高斯):核心思想(可微分 3D 高斯基元)、数学原理(Splatting 卷积)、实现方式(点云初始化、自适应调节)、优缺点(实时渲染、显存占用高)。
- • [资源] 论文:《3D Gaussian Splatting for Real-Time...》
项目建议(验收样例)
Point Cloud 分类/分割(基于 PointNet)
数据:ModelNet/ShapeNet 子集
交付:训练日志、分类精度/分割 IoU、可视化
NeRF 简化复现
数据:小型多视角物体图像集
交付:渲染结果对比图、训练细节说明
资源(来源导图)
- • 论文:PointNet、NeRF、3D Gaussian Splatting
- • 工具:Open3D、PCL、PyTorch3D
验收要点
- • 数据处理与可视化(20)
- • 算法实现与训练日志(25)
- • 性能与结果质量(30)
- • 报告与工程(25)
RL (强化学习)
知识导图
- 在 XMind 软件中打开
RL (强化学习).xmind文件 - 点击菜单:文件 → 导出 → 图片
- 选择 PNG 格式,保存到
img1文件夹 - 命名为
RL (Reinforcement Learning).png - 刷新页面即可看到导图
强化学习(RL)— 进阶学习与项目指南
本文档严格映射原始导图中强化学习条目(MDP、DP、TD、Q-Learning、Policy Gradient、DQN、PPO、SAC、Actor-Critic 等),旨在为希望在 RL 方向完成复现或算法实现的学员提供路线与验收模板。
核心知识点(逐条对应)
- • MDP 与贝尔曼方程:状态、动作、转移概率、奖励、折扣因子
- • 价值函数(V、Q)、策略:确定性/随机、策略迭代和值迭代
- • 无模型方法:蒙特卡洛、TD(SARSA、Q-Learning)
- • 策略梯度方法:REINFORCE、Actor-Critic
- • 深度 RL:DQN(经验回放、target network)、PPO(剪切目标)、SAC(最大化熵)
学习路径(4 周建议)
Week 1 — RL 基础与经典算法
学习:MDP 定义、贝尔曼方程、动态规划(Value/Policy Iteration)
练习:实现小规模 GridWorld 的 Value Iteration
资源建议:
- • [知识点] RL 基础:马尔可夫决策过程 (MDP)(五元组 {S, A, P, R, γ})、贝尔曼方程、价值函数 (V(s), Q(s,a))。
- • [资源] 图表:强化学习算法演进路径图
Week 2 — 无模型方法与经典表格法
学习:蒙特卡洛、TD、SARSA、Q-Learning
练习:实现 Q-Learning 并在简单环境中训练(如 FrozenLake)
资源建议:
- • [知识点] 经典求解思路:动态规划 (DP)(Model-Based)、策略迭代、值函数迭代。
- • [知识点] 无模型方法 (Model-Free):蒙特卡洛 (MC)(完整轨迹、高方差)、时间差分 (TD)(单步更新、自举 Bootstrapping)。
- • [知识点] 核心控制算法:Sarsa (On-policy TD)、Q-Learning (Off-policy TD)、策略梯度 (PG)(直接参数化策略)。
Week 3 — 深度 RL 入门(DQN)
学习:经验回放、固定 target network、ε-greedy 等技巧
练习:实现 DQN 在 CartPole 或 LunarLander 上训练并记录回合奖励曲线
资源建议:
- • [知识点] 深度强化学习 (DRL):DQN(Q-Learning + DNN)、经验回放 (Experience Replay)、固定 Q 目标 (Fixed Q-targets)。
- • [知识点] Actor-Critic (AC):结合策略梯度 (Actor) 和价值函数 (Critic)。
Week 4 — 高级策略(PPO/SAC)与稳定性技巧
学习:PPO 裁剪目标、SAC 的熵最大化思想、Actor-Critic 结构
练习:使用现成库(Stable Baselines3)跑 PPO 并对比超参影响
资源建议:
- • [知识点] 高级 AC 算法:PPO (Proximal Policy Optimization)(On-policy, 裁剪目标函数)、SAC (Soft Actor-Critic)(Off-policy, 最大化熵)。
项目建议(验收样例)
DQN 在 CartPole 或 LunarLander 上达到稳定策略
交付:训练曲线、超参说明、稳定性分析
PPO 在连续控制任务上的比较实验(如 MountainCarContinuous)
交付:算法实现或 Stable Baselines3 调用记录、比较结果
验收要点
- • 算法正确性与实现细节(30)
- • 训练曲线与稳定性分析(30)
- • 结果复现与 Hyperparam 敏感性分析(20)
- • 报告与演示(20)
AIGC (生成式人工智能与大语言模型)
生成式人工智能与大语言模型(AIGC)— 进阶学习与项目指南
本文档为 "专项方向:生成式人工智能与大语言模型" 的进阶学习路径,系统梳理生成式 AI 领域核心知识点、技术架构及实践资源,覆盖大语言模型(LLM)、Transformer、扩散模型、生成对抗网络(GAN)等关键技术模块。
目标读者
具备深度学习基础(已通过深度学习阶段验收 I),希望在 AIGC 方向完成复现/微调/工程化项目并通过专项验收的同学。
知识图谱(与原始导图逐条对应)
- • Transformer 架构:起源与核心突破、宏观架构与功能、Encoder/Decoder 子层结构、自注意力机制、多头注意力、位置编码、残差连接与层归一化、输出层功能
- • 视觉 Transformer:ViT 核心流程、Swin Transformer 改进、Twins 架构、BeiT 自监督预训练、MLP-Mixer 特点、DETR 端到端检测、TrackFormer 跟踪机制、STARK 单目标跟踪、MaskFormer 分割方案
- • 大语言模型预训练:预训练本质与三阶段流程、模型架构选型(编码器 / 解码器 / 编解码器、MoE/RetNet)、预训练任务设计(CLM、统一任务范式)
- • 后训练优化:指令微调(定义、特性、数据构建)、RLHF(三阶段流程、关键技术、核心效果)、DPO(核心改进、数学基础、优势)
- • 参数高效微调(PEFT):定义与优势、方法分类(参数附加 / 选择 / 低秩适配)、技术发展(LoRA/QLoRA)、与其他技术关系
- • 提示工程:定义、工作流程、与传统方法对比、模板设计、大模型时代特点
- • LLM Agent:基础定义、应用分类、优势、核心组件(规划、记忆、工具使用、行动)、规划机制(任务分解、自我反思)、记忆系统(分类、RAG)、工具使用(定义、框架、技术、评估)、行动与具身智能
学习路径与每周计划(4 周建议)
Week 1 — Transformer 基础与视觉应用
学习:Transformer 核心原理(自注意力、多头注意力、位置编码)、视觉 Transformer(ViT、Swin Transformer)架构与应用
实践:用 PyTorch 实现简化版 Transformer、运行 ViT 图像分类 demo
资源建议:
- • [知识点] 核心架构:Transformer:起源、自注意力机制 (Q, K, V)、多头注意力、位置编码、Encoder/Decoder 结构。
- • [知识点] 视觉 Transformer:ViT (图像切分 Patch)、Swin Transformer (Window Attention, Patch Merging)。
- • [知识点] 自回归模型 (AR Models):核心思想(用过去预测未来)、NADE。
- • [知识点] 变分自编码器 (VAE):核心改进(输出概率分布)、重参数化技巧、损失函数(重构误差 + KL 散度)、解纠缠 VAE。
- • [知识点] 生成对抗网络 (GAN):核心定义(生成器 G vs 鉴别器 D)、Minimax 博弈、Conditional GAN、DCGAN、CycleGAN、StyleGAN。
- • [知识点] 扩散模型 (Diffusion Models, DM):核心定义(迭代去噪)、训练目标(最小化噪声预测损失)、DDIM、Stable Diffusion (潜在扩散模型)、ControlNet。
- • [知识点] 语言模型 (LM):核心定义(预测下一个词)、N-gram LM、RNN-LM、评估指标(困惑度 Perplexity)。
- • [资源] 论文:《Attention Is All You Need》
- • [资源] 论文:BERT
- • [资源] 论文:VAE (Kingma & Welling, 2013)
- • [资源] 论文:GAN (Goodfellow et al., 2014)
Week 2 — 大语言模型预训练与微调
学习:预训练三阶段流程、指令微调方法、PEFT 技术(LoRA/Adapter)
实践:基于 Hugging Face 库微调小模型(如 DistilBERT)、用 LoRA 实现 LLaMA 系列模型高效微调
资源建议:
- • [知识点] 大模型预训练 (LLM Pretraining):三阶段流程 (Pretrain, SFT, RLHF)、预训练任务 (CLM)、模型架构选型 (Encoder-only, Decoder-only, Encoder-Decoder)。
- • [知识点] 提示工程 (Prompt Engineering):定义、工作流程、模板设计。
- • [知识点] 参数高效微调 (PEFT):全参数微调局限性、LoRA(低秩组合)、Prefix-Tuning, Prompt-Tuning。
- • [知识点] 指令微调 (Instruction Fine-tuning):核心定义((指令, 输出) 样本对)、数据构建(Alpaca)。
- • [资源] 论文:DDPM (Ho et al., 2020)
- • [资源] 论文:LoRA
Week 3 — 大模型优化与提示工程
学习:RLHF/DPO 原理、提示工程技术(CoT、提示模板设计)
实践:构建指令微调数据集、实现基础提示工程案例(如情感分析、问答)
资源建议:
- • [知识点] 基于人类偏好的强化学习 (RLHF):三阶段流程(SFT, RM, RL 优化)、奖励模型 (RM) 训练、KL 散度惩罚。
- • [知识点] 直接偏好优化 (DPO):核心改进(移除 RL)、数学基础(转化为加权最大似然)。
- • [资源] 论文:RLHF (Training language models to follow instructions...)
- • [资源] 论文:DPO (Direct Preference Optimization...)
Week 4 — LLM Agent 核心能力
学习:Agent 四大组件(规划、记忆、工具使用、行动)、RAG 架构、工具调用流程
实践:搭建简易 RAG 系统、开发调用 API 的工具使用 demo、尝试多智能体协作案例
资源建议:
- • [知识点] LLM 智能体 (Agents):核心定义(自主系统)、四大核心组件(规划、记忆、工具使用、行动)。
- • [知识点] 智能体 - 规划:思维链 (CoT)、思维树 (ToT)、ReAct(整合推理与动作)。
- • [知识点] 智能体 - 工具使用:HuggingGPT、Toolformer。
- • [知识点] 智能体 - 记忆:检索增强生成 (RAG)(朴素 RAG, 高级 RAG, 模块化 RAG)。
- • [资源] 论文:Toolformer
项目建议(验收样例)
1. 大模型指令微调与评估
数据:自定义指令数据集(如特定领域问答)或开源数据集(Alpaca、ShareGPT)
交付:微调脚本、训练日志(损失曲线)、评估报告(人工评分 + 自动指标)、推理演示
2. 基于 RAG 的知识库问答系统
交付:数据处理 pipeline(文本分割、向量化)、检索引擎代码、问答交互界面、检索效果评估(召回率、准确率)
3. LLM Agent 工具使用应用
功能:集成天气查询、计算器等 API 的智能体
交付:工具调用框架代码、多轮对话示例、工具调用准确率统计
4. 图像生成模型微调与应用
数据:特定风格图像数据集
交付:Stable Diffusion 微调脚本、生成效果对比(原图 vs 生成图)、风格迁移演示
资源汇总(从原始导图逐条罗列)
- • 论文与文档:大模型训练与微调:Hugging Face 官方文档、LLaMA 系列技术报告;生成模型理论:《深度学习》第 20 章(GAN)、扩散模型原始论文
- • 视频教程:吴恩达提示工程、斯坦福 CS231n 生成模型对比;B 站 Transformer、BERT 论文精读系列
验收要点(详尽)
- • 数据准备与说明(20)
- • 模型训练与日志(曲线、超参)(25)
- • 评估指标(mAP/mIoU/PSNR 等)(25)
- • 工程与可复现性(代码结构、README、推理脚本)(20)
- • 可视化展示(10)
CV (计算机视觉)
知识导图
计算机视觉(CV) — 进阶学习与项目指南
本文档为"专项方向:计算机视觉"的进阶学习路径,严格映射并扩展来源文档《大连理工大学人工智能研究生入门学习指南》中关于 CV 的所有知识点与资源条目。
目标读者
具备深度学习基础(已通过深度学习阶段验收 I),希望在 CV 方向完成复现/微调/工程化项目并通过专项验收的同学。
知识图谱(与原始导图逐条对应)
- • 图像处理基础:直方图、几何变换、插值、颜色空间、直方图均衡化
- • 图像滤波:线性/非线性滤波(Sobel、Laplacian)、卷积运算的本质
- • 边缘检测:Canny 算法(高斯滤波、非极大值抑制、滞后阈值)
- • 特征与匹配:模板匹配、图像金字塔、RANSAC、SIFT/ORB、描述子匹配
- • 核心任务:图像分类(CNN, ViT)、目标检测(R-CNN 系列、YOLO、SSD)、语义分割(FCN、U-Net、DeepLab)、实例分割(Mask R-CNN)
- • 图像恢复:去噪、去模糊、超分(SRCNN, SRGAN)
- • 三维视觉:相机模型(针孔模型)、相机内外参、相机标定(张正友法)、对极几何、双目/多目深度估计
- • 运动估计:光流(Lucas-Kanade)、FlowNet、PWC-Net
学习路径与每周计划(4 周建议)
Week 1 — 图像基础与传统图像处理
学习:OpenCV 基础、图像滤波与边缘检测、颜色空间转换、直方图均衡
实践:实现 Canny 边缘检测、Sobel 滤波、直方图均衡化
资源建议:
- • [知识点] 图像处理基础:图像直方图(灰度、彩色、累积)、直方图均衡化、图像几何变换(平移、仿射)、图像插值(最近邻、双线性)。
- • [知识点] 图像滤波:线性移不变系统 (LSIS)、卷积(可分离卷积核)、平滑滤波器(盒式、二项)、梯度滤波器(Sobel、Laplacian)。
- • [知识点] 边缘检测:Canny 边缘检测器(高斯滤波、非最大值抑制、滞后阈值化)
Week 2 — 特征检测与匹配、相机模型
学习:Harris / SIFT / ORB 特征、RANSAC、单应矩阵、相机成像模型
实践:用 SIFT/ORB 做图像拼接(Homography)、实现张正友相机标定 demo
资源建议:
- • [知识点] 特征与匹配:模板匹配 (SSD, NCC)、图像金字塔、RANSAC、霍夫变换(直线/圆检测)。
- • [知识点] 特征点检测:角点(Harris 角点检测器)、SIFT(DoG 尺度空间)、SIFT 描述子(128 维)、二进制描述子 (ORB)。
- • [知识点] 相机参数:齐次坐标系、相机外参、相机内参。
- • [知识点] 相机标定与对极几何:张正友标定法、PnP、对极几何(基础矩阵、本质矩阵、8点法)。
Week 3 — 深度学习在 CV 的应用(分类 / 检测)
学习:卷积基础、经典 CNN(ResNet)、目标检测框架(Faster R-CNN / YOLO / SSD)
实践:用 PyTorch 训练 CIFAR-10,微调一个预训练 ResNet;尝试使用 YOLOv5 对小数据集微调
资源建议:
- • [知识点] CV 核心任务:图像分类(AlexNet, VGG, ResNet, ViT, Swin-T)。
- • [知识点] 目标检测:R-CNN 系列(R-CNN, Fast R-CNN, Faster R-CNN)、SSD、YOLO、评估指标 (mAP)。
- • [资源] 论文:ResNet 论文原文
Week 4 — 进阶:分割 / 深度估计 /运动估计
学习:U-Net、DeepLab、Mask R-CNN;深度估计方法(单目/双目)
实践:微调 U-Net 做简单医学影像分割或分割比赛数据集;用 FlowNet/PWC-Net 做光流可视化
资源建议:
- • [知识点] 语义分割:FCN、U-Net、DeepLab(空洞卷积, ASPP)、PSPNet、HRNet、评估指标 (mIoU)。
- • [知识点] 实例分割:Mask R-CNN(ROI Align)。
- • [知识点] 深度估计:结构光、ToF、单目深度估计(CNN 方法)、双目/多目深度估计(对极几何、Plane Sweep、MVSNet)。
- • [知识点] 运动估计:运动场、光流(孔径问题)、Lucas-Kanade 方法、FlowNet、PWC-Net。
- • [资源] 论文:Faster R-CNN 论文
- • [资源] 论文:FCN 论文原文
- • [资源] 论文:Mask R-CNN 论文原文
- • [资源] 论文:MVSNet 论文
- • [资源] 论文:FlowNet 论文
项目建议(验收样例)
1. 目标检测微调(YOLOv5/YOLOv8)
数据:自建小数据集或 COCO 子集
交付:训练脚本、推理脚本、mAP 报表、预测可视化
2. 实例分割(Mask R-CNN)
交付:训练日志、mIoU/mAP、分割可视化
3. 单目深度估计小 demo
交付:深度地图可视化、评估(如果有 ground truth)
资源汇总(从原始导图逐条罗列)
- • 论文:ResNet, Faster R-CNN, FCN, Mask R-CNN, FlowNet, MVSNet
- • 工具库:OpenCV、Detectron2、MMDetection、YOLO 家族、PyTorch/Torchvision
- • 教程:PyTorch 官方教程、Papers With Code 对应实现
验收要点(详尽)
- • 数据准备与说明(20)
- • 模型训练与日志(曲线、超参)(25)
- • 评估指标(mAP/mIoU/PSNR 等)(25)
- • 工程与可复现性(代码结构、README、推理脚本)(20)
- • 可视化展示(10)
留下你的想法吧
欢迎在下方评论区发表意见、提问或分享灵感 💡。登录 GitHub 后即可留言。