课程 / 第三阶段 · 大模型篇 / 第 13 课

从 GPT 到 ChatGPT:SFT 与 RLHF

预训练给了它知识,对齐给了它“人样”。监督微调 + 人类反馈强化学习,把接龙机器调教成助手。

进阶约 30 分钟