开源大模型全链路训练实践:预训练、后训练与数据工程
作 者:周佺喜 著
定 价:69.8
出 版 社:清华大学出版社
出版日期:2026年10月01日
页 数:242
装 帧:平装
ISBN:9787302726258
目录
●
第1章 国内开源大模型技术体系概论
1.1 国内大模型发展格局与技术路线
1.1.1 主流开源模型架构对比分析
1.1.2 技术创新点与差异化策略
1.1.3 开源生态与社区建设现状
1.2 DeepSeek系列模型技术解析
1.2.1 MoE架构设计与稀疏激活机制
1.2.2 多头潜在注意力(MLA)创新
1.2.3 DeepSeek-R1推理模型与强化学习训练
1.3 Qwen系列模型技术解析
1.3.1 模型规模谱系与MoE架构演进
1.3.2 多模态统一与多模态融合
1.3.3 混合思考模式与Agent能力
1.4 GLM系列模型技术解析
1.4.1 GLM架构特点与MoE设计
1.4.2 智能体原子能力与推理模型
1.4.3 开源策略与生态布局
1.5 Kimi K2模型技术解析
1.5.1 万亿参数MoE架构设计
1.5.2 MuonClip优化器与训练稳定性
1.5.3
……
内容介绍
本书是一部系统阐述大模型训练技术的专业书籍,聚焦DeepSeek、Qwen、GLM、Kimi K2等国产主流开源模型,深入剖析其架构创新与工程实践。
全书共12章。第1章解析国内开源模型的技术架构,涵盖MoE稀疏激活、多头潜在注意力等前沿设计;第2章介绍训练理论的数学基础;第3、4章聚焦数据工程,包括数据采集、清洗、去重、过滤、质量评估、合成数据生成及课程学习策略;第5、6章详述预训练工程,涉及分布式架构设计、内存优化、训练监控与稳定性保障;第7~9章全面覆盖后训练技术,从监督微调、强化学习优化到对齐训练与安全机制;第10~12章探讨工程化实践,包括基础设施建设、模型压缩部署及持续学习迭代。
本书采用算法伪代码、数学公式、插图与表格等形式......
周佺喜 著
周佺喜,美国约翰霍普金斯大学人工智能硕士、英国华威大学工程硕士,拥有深厚的技术理论基础和工程实践能力。现任国家能源集团大模型智能平台首席架构师,阿里云人工智能高级认证工程师、IBM量子计算认证工程师。