课程 / 第七阶段 · 番外篇 / 第 33 课

DeepSeek 拆解:用几分之一的钱训出顶尖模型

详解 DeepSeek 击穿行业成本的秘诀:混合专家(MoE)、多头潜在注意力(MLA)以及多 Token 预测(MTP)架构。

进阶核心难点约 20 分钟
AI 通识课 · 为中文学习者设计的 AI 入门课持续更新中