🧠 AI·learn —— 通过 MiniMind 学大模型

这是我的大模型学习知识库:从 MiniMind(一个 4647 行代码的迷你 GPT)出发,逐个吃透大模型的热门概念。 每个概念都按同一节奏讲:生活比喻 → 图解 → 核心概念正名 → 源码逐块讲 → 真实训练数据验证 → 自测

flowchart LR A[① 大模型是什么] --> B[② 模型架构
MoE/Attention/RoPE] B --> C[③ 数据
清洗/数据集] C --> D[④ 训练范式
Pretrain/SFT/LoRA/蒸馏] D --> E[⑤ 对齐与RL
DPO/PPO/GRPO/CISPO] E --> F[⑥ Agent与工具
Tool Call/Agentic RL] E --> G[⑦ 思考与推理
自适应思考] style A fill:#dafbe1,stroke:#1a7f37 style B fill:#dafbe1,stroke:#1a7f37 style D fill:#fff8c5,stroke:#9a6700 style C fill:#f6f8fa,stroke:#656d76 style E fill:#f6f8fa,stroke:#656d76 style F fill:#f6f8fa,stroke:#656d76 style G fill:#f6f8fa,stroke:#656d76

🟢 绿=已完成 · 🟡 黄=部分 · ⚪ 灰=规划中(随 Kaggle 训练推进滚动更新)

模型架构 ✓ 已完成
Transformer 拆解:词嵌入、Attention/GQA、RoPE、RMSNorm、SwiGLU,以及 MoE 混合专家。
AttentionGQARoPEMoERMSNorm
数据 … 规划中
数据清洗、去重、格式统一:大模型的'食谱'是怎么准备的。
清洗去重Tokenizer
训练范式 § 部分完成
Pretrain(文字接龙)、SFT(学对话)、LoRA(低成本改造)、蒸馏(师徒传承)。
PretrainSFTLoRA蒸馏CE Loss
对齐与强化学习 … 规划中
DPO/PPO/GRPO/CISPO:怎么让模型'听话'和'做对题'。
DPOPPOGRPOCISPOKL
Agent 与工具 … 规划中
Tool Call、多轮交互、Agentic RL:让模型动手而不只是动嘴。
Tool UseAgentic RLRLVR
思考与推理 … 规划中
自适应思考、 标签、思考奖励:'想一下再答'的机制设计。
CoT自适应思考chat_template

🔗 关联资源:源码仓 jingyaogong/minimind · 实验日志(含魔鬼问题自答)在我本地的 minimind 仓 notes/ 目录 · 所有训练数据来自我在 Kaggle T4 上跑的真实 kernel。