湖北大学百度飞桨领航团HUBU · PADDLEPADDLE DEVELOPER GROUP 湖北大学曼城联合学院联合标识 百度飞桨 PaddlePaddle

LEARN BY BUILDING

学习教程

从理解原理到动手实现,沿着公开课程与开源代码,探索强化学习、语言模型与计算机视觉。

强化学习 · 课程与实验

Hands-on Modern RL

现代强化学习:从基础到大模型与智能体

结合概念讲解、数学推导与代码实验,学习价值函数、DQN、策略梯度和 PPO,并进一步探索 RLHF、DPO、GRPO 与 Agentic RL。

来源
walkinglabs
学习内容
强化学习基础 · 大模型后训练 · 智能体

从这里开始先阅读课程导论与环境准备,再跟随章节完成实验;课程仍在完善,优先学习已完成章节。

语言模型 · 代码实践

NanoChat

通过完整代码,理解语言模型如何训练

Andrej Karpathy 的开源语言模型训练项目,以精简、可修改的代码串联分词、预训练、微调、评估与推理,适合结合源码理解完整训练流程。

作者
Andrej Karpathy
学习内容
Tokenizer · 预训练与微调 · 评估与推理

从这里开始先读 README 的入门说明,再沿训练脚本阅读代码;选择与自己设备相符的运行方式。

大模型 · 高效微调

LLaMA-Factory

从准备数据到完成模型微调

面向语言模型与视觉语言模型的微调框架,支持监督微调、LoRA、QLoRA 等训练方式,并提供命令行与可视化界面。

来源
hiyouga / LlamaFactory
学习内容
数据准备 · 监督微调 · LoRA / QLoRA

从这里开始先跟随官方快速开始准备数据,跑通一个小模型的 LoRA 微调,再学习评估与推理。

强化学习 · 大模型后训练

verl

把 PPO 与 GRPO 带入训练实践

面向大模型后训练的强化学习框架,提供 PPO、GRPO 等算法实践,覆盖数据准备、奖励函数、采样生成与分布式训练。

来源
verl-project
学习内容
PPO / GRPO · 奖励设计 · 分布式训练

从这里开始先阅读安装与快速开始,理解数据、奖励函数和训练配置,再跟随官方示例运行实验。

计算机视觉 · 文字识别

PaddleOCR

从图像文字识别到文档解析

飞桨生态的文字识别与文档解析工具,提供文字检测、识别以及表格、版面等文档结构处理能力,适合结合实际图片与文档开展实践。

来源
PaddlePaddle
学习内容
文字检测与识别 · 版面分析 · 文档解析

从这里开始先跑通一张图片的文字识别,理解检测与识别结果,再尝试文档结构解析和应用集成。

计算机视觉 · 目标检测

Ultralytics YOLO

YOLO 系列的 Ultralytics 实践入口

通过 Ultralytics 官方实现学习 YOLO 系列模型,覆盖目标检测、实例分割、姿态估计与目标跟踪,并贯通训练、验证、预测与模型导出。

来源
Ultralytics
学习内容
目标检测 · 分割与姿态 · 训练与部署

从这里开始先用预训练模型完成预测,再用自己的标注数据训练检测模型,逐步学习验证与导出流程。

更多教程,陆续收录。

教程内容由原作者维护,点击相应入口前往原站学习。