商品详情
前言
在人工智能技术迅猛发展的浪潮中,DeepSeek大模型以其卓越的性能与创新架构异军突起,成为推动行业变革的重要力量; 作为国内大模型领域的领军者,它不仅在技术基准测试中屡创佳绩,更通过重塑具身智能架构为人工智能从单一语言处理迈向复杂场景交互奠定了坚实基础; 在人工智能技术加速渗透产业应用的关键节点,DeepSeek大模型以强大的工程化落地能力成为推动大模型从实验室走向企业级应用的核心引擎; 凭借在长文本处理、领先的自然语言处理与复杂推理能力、多模态融合等关键技术领域的突破,以及轻量化部署方案与AI Agent生态的协同发力,DeepSeek大模型引领着人工智能迈向复杂任务处理的新阶段,开启“AI Agent应用落地元年”,助力产业智能化转型与升级。
本书紧密围绕这一技术脉络展开,系统梳理大模型的核心技术原理、训练与微调技术、RAG、AI Agent、DeepSeek核心技术及企业应用落地实践、多模态具身智能的前沿探索等内容。全书共8章,力求为读者呈现从基础原理到前沿应用实践的完整知识图谱。
第1章“大模型技术原理”从技术起源与核心思想出发,揭示大模型演进逻辑。首先追溯N?gram统计语言模型到神经语言模型、预训练语言模型的发展历程,深入解析基于Transformer的编码、解码及编解码预训练架构。继而探讨提示学习、指令微调与人类反馈强化学习等关键技术,阐明如何通过优化模型输入输出与训练策略提升模型性能。最后聚焦GPT智能涌现原理,从思维链、上下文学习到通用人工智能(AGI)的探索,展现大模型从功能增强到智能本质突破的技术路径。
第2章“大模型训练及微调”聚焦工程实践,详解分布式训练的并行策略,包括数据并行、模型并行与混合并行的技术特点及适用场景,结合DeepSeek、Megatron?LM等框架展现高效训练架构。针对模型压缩与微调,系统介绍结构化剪枝、量化技术及P?Tuning、LoRA、QLoRA等轻量化微调方法,同时解析旋转位置编码RoPE在长文本理解中的关键作用,为大模型落地解决算力与效率难题。
第3章“DeepSeek大模型核心技术”深度剖析DeepSeek大模型创新技术体系,在核心架构方面,MLA机制通过低秩压缩键值技术减少KV缓存,结合DeepSeekMoE的细粒度专家划分与无辅助损失负载均衡策略,在保持模型性能的同时显著提升计算效率。训练基础设施层面,FP8混合精度训练与DualPipe算法的计算?通信重叠技术,使DeepSeek?V3以557万美元成本高效地完成了6710亿参数训练。针对长上下文处理,NSA技术通过动态分层稀疏策略实现64000序列处理11.6倍加速,配合YaRN扩展技术使模型支持128000上下文窗口。推理能力强化方面,DeepSeek?R1通过冷启动强化学习与知识蒸馏,在AIME测试中达到79.8%通过率,其推理系统采用跨节点专家并行架构,结合双Batch重叠技术实现5.76倍吞吐提升。配套基础设施如3FS分布式文件系统实现3.66TB/min数据处理能力,DeepEP通信库优化MoE模型通信效率,FlashMLA内核达成1350十TFLOPS峰值性能。这些技术创新构建了从算法优化、训练框架到硬件协同的全栈优势,为大规模语言模型的高效训练与部署树立了新标杆。
第4章“LangChain技术原理与实践”深入探讨了LangChain与LangGraph的技术原理与实践。LangChain作为一个开源的大模型应用开发框架,通过其六大核心模块(模型I/O、数据增强、链、记忆、Agent、回调处理器)实现了大模型与外部工具、数据源及交互逻辑的深度整合,支持从简单问答到复杂任务自动化的全场景应用,显著地降低了开发门槛。LangGraph则作为LangChain生态的扩展,为构建基于大语言模型的有状态、多代理应用程序提供了一个全新的范式和强大的框架支持。LangGraph作为一个专注于AI辅助开发的库,提供长期内存管理、人机协同、工作流持久化等高级特性,适用于构建高可靠性和复杂逻辑的企业级智能体。两者结合推动大模型应用从单一功能走向系统化、工程化落地。
第5章“检索增强生成”系统阐述了RAG技术的核心架构与实践应用。RAG通过融合检索系统与大语言模型,有效地解决了大模型知识局限性及幻觉问题,其技术体系包含分块向量化、混合搜索索引、查询路由等关键模块。重点剖析了阿里巴巴GTE、智源BGE等文本向量模型及Milvus、Pinecone等向量数据库的选型策略,对比了微调与RAG在知识更新、成本效益等方面的差异。通过企业级知识问答系统案例,验证了RAG在提升答案准确性、实时性及可追溯性的显著优势,并提出文档预处理、多级索引、查询转换等12项优化策略。最后解析了RAGFlow、LLaMAIndex、GraphRAG等开源项目的技术路径,为构建动态知识增强型AI系统提供实践指南。
第6章“AI Agent”系统阐述了AI Agent的技术体系与发展现状,重点解析了AutoGPT、MetaGPT、XAgent、SuperAGI、CrewAI、Manus和OpenManus等主流框架的核心原理。AutoGPT通过ReAct框架实现自主任务规划与工具调用,MetaGPT创新性地采用多角色协作机制模拟软件团队开发流程,CrewAI是基于Python和LangChain的开源多智能体编排框架,通过模块化架构、智能协作机制、多元任务执行模式及多模型适配能力,实现高效多角色代理的动态协同与灵活扩展。商用通用智能体Manus,作为全球首个实现全流程任务自主执行的产品,以动态工具调用、混合架构、分层记忆系统三大技术突破,展现了类人任务处理能力,而开源的OpenManus则通过ReAct框架与模块化工具集成,支持本地部署及多模型适配,构建透明化开源生态。Manus和OpenManus分别从商业落地与技术开源维度,推动AI Agent从单一功能向通用智能体演进,成为AGI发展的重要里程碑。
第7章“DeepSeek大模型应用落地实践”聚焦DeepSeek大模型应用落地实践,介绍Ollama、vLLM、Unsloth等工具的本地化部署及DeepSeek推理模型训练微调方法,涵盖Windows、Linux平台安装、模型管理、推理优化及训练微调技巧。通过Dify平台演示模型接入与应用开发,包括知识库构建、工作流设计、工具插件集成等全栈能力。结合智能客服、销量预测、工业设备预测性维护等场景案例,展示如何利用DeepSeek技术实现从数据处理、算法融合到工作流编排的闭环,为企业智能化转型和开发者创新提供了可复用的技术范式与实践经验。
第8章“多模态具身智能”系统阐述了多模态具身智能的技术体系与应用实践,揭示了人工智能从虚拟认知向物理交互跨越的技术路径。本章以DeepSeek架构革新为切入点,通过十大核心技术构建了“感知—理解—决策—执行”的闭环认知链,重点突破传统具身智能在多模态协同、算力优化等维度的瓶颈。在核心技术层面,详细解析了机器人操作系统ROS的分布式架构演进、多传感器融合定位算法、基于强化学习的运动控制策略,以及世界模型在物理规律建模与预见性推理中的突破。通过Gazebo与Isaac Sim的对比实践,展现了仿真平台在机器人开发全流程中的核心价值。创新性项目(如MultiPLY)通过多感官数据融合实现具身交互,Humanoid?Gym验证了端到端强化学习在人形机器人控制中的零次迁移能力,LEO模型则开创了3D环境中的通才智能体范式。本章不仅构建了从多模态感知到具身执行的技术图谱,更通过开源生态与工具链的深度整合,为智能体在家庭服务、工业制造等场景的落地提供了系统化解决方案,标志着AI从数据驱动向认知驱动的范式转变。
本书全面涵盖DeepSeek大模型与具身智能领域的关键技术及应用,既适合研究人员、工程技术人员作为专业参考,也可作为高等院校计算机相关专业的教学用书,同时对人工智能感兴趣的普通读者亦具有重要学习价值。本书旨在通过系统化的知识梳理和技术解析,为人工智能技术的创新发展提供理论支撑与实践指导,助力读者深入探索这个充满无限可能的人工智能世界,共同推动人工智能技术在实际应用中的转化与落地。
本书的顺利出版离不开清华大学出版社赵佳霓编辑的辛勤付出,她以严谨的学术态度和专业技能,对书稿进行了细致的审阅和修改,确保了本书的高质量完成。在此,对赵佳霓编辑的辛勤付出表示衷心的感谢。
陈敬雷
2026年3月
本书系统梳理大模型的核心技术原理、训练与微调技术、RAG、AI Agent、DeepSeek核心技术及企业应用落地实践、多模态具身智能的前沿探索等内容,旨在通过系统化的知识梳理和技术解析,为人工智能技术的创新发展提供理论支撑与实践指导,助力读者深入探索这个充满无限可能的人工智能世界。
本书系统解析了DeepSeek大模型与具身智能的核心技术及产业应用实践。
全书共8章,从大模型技术原理出发,依次阐述训练微调、分布式训练框架、DeepSeek核心技术体系(如推理强化学习、MLA机制、FP8混合精度训练、NSA长上下文处理技术等),并深入探讨LangChain/LangGraph开发框架、RAG检索增强生成、AI Agent智能体(涵盖AutoGPT、MetaGPT、Manus等主流框架)的技术逻辑与实践路径。此外,书中结合智能客服、销量预测、工业生产设备预测性维护等场景案例,详解DeepSeek模型的本地化部署、训练微调、工作流编排及多模态具身智能的前沿探索,展现从基础理论到工程落地的完整技术图谱。
本书既适合研究人员、工程技术人员开展专业参考,也可作为高等院校计算机相关专业的教学用书。全书内容翔实,既有理论知识的深入讲解,也有大量实践案例和代码示例,既揭秘DeepSeek技术创新,又通过多模态具身智能的系统化解析,助力人工智能技术在实际场景中的转化与落地。
陈敬雷 充电了么创始人,CEO兼CTO。拥有十几年互联网从业经验,曾任架构师、首席技术官、首席科学家等职务。在技术领域,尤其在大数据和人工智能方向有着丰富的算法工程落地实战经验,在猎聘任职期间主导的推荐算法系统项目获得公司优秀项目奖,推荐效果得到5倍的提升。目前专注于大数据和人工智能驱动的上班族在线教育行业,研发了充电了么App,用深度学习算法、NLP、推荐引擎等技术来高效地提升在线学习效率。研发了上百门课程,在51CTO、网易云课堂、腾讯课堂等平台累计有30万名学员。出版了《分布式机器学习实战》《自然语言处理原理与实战》《GPT多模态大模型与AI Agent智能体》,颇受好评。
目录
本书源码
第1章大模型技术原理
1.1大模型技术的起源、思想
1.2基于Transformer的预训练语言模型
1.2.1编码预训练语言模型
1.2.2解码预训练语言模型
1.2.3基于编解码架构的预训练语言模型
1.3提示学习与指令微调
1.3.1提示学习
1.3.2指令微调
1.4人类反馈强化学习
1.4.1强化学习
1.4.2PPO算法
1.4.3大模型人类反馈强化学习对齐
1.5GPT智能涌现原理与通用人工智能
1.5.1什么是智能涌现
1.5.2思维链
1.5.3上下文学习能力
1.5.4指令理解
1.5.5通用人工智能
第2章大模型训练及微调
2.1大模型训练概述
2.2分布式训练的并行策略
2.2.1数据并行
2.2.2模型并行
2.2.3混合并行
2.2.4并行计算框架
2.3预训练模型的压缩
2.3.1模型压缩方案概述
2.3.2结构化模型压缩策略
2.3.3非结构化模型压缩策略
2.3.48位/4位量化压缩实践
2.4大模型微调方法
2.4.1Prefix Tuning微调
2.4.2P?Tuning V1微调
2.4.3P?Tuning V2微调
2.4.4LoRA微调
2.4.5QLoRA微调
2.5基于旋转位置编码RoPE的长文本理解
2.5.1RoPE技术原理
2.5.2RoPE关键特性
第3章DeepSeek大模型核心技术
3.1DeepSeek模型架构
3.1.1基础架构
3.1.2多Token预测
3.2DeepSeek训练基础设施
3.2.1计算集群
3.2.2DeepSeek自研HAI?LLM训练框架
3.2.3FP8训练
3.2.4推理与部署
3.3DeepSeek预训练
3.3.1数据构建
3.3.2超参数
3.3.3长上下文扩展
3.4DeepSeek后训练
3.4.1监督微调
3.4.2强化学习
3.5DeepSeek?R1推理能力强化技术
3.5.1DeepSeek?R1?Zero: 基于基础模型的强化学习
3.5.2DeepSeek?R1: 冷启动强化学习
3.5.3知识蒸馏: 赋予小模型推理能力
3.6原生稀疏注意力(NSA)技术
3.6.1实现高效长上下文建模的创新方法
3.6.2NSA整体架构
3.6.3算法设计
3.6.4内核设计
3.7FlashMLA技术解析
3.7.1技术背景
3.7.2关键技术优化
3.7.3应用场景优势
3.8DeepEP通信库
3.8.1核心特性剖析
3.8.2网络相关特性详解
3.8.3使用指南
3.8.4应用代码示例
3.9高效矩阵乘法库DeepGEMM
3.9.1核心特性与优势
3.9.2关键技术解析
3.9.3使用指南
3.10开源DualPipe及EPLB深入分析
3.10.1双向流水线并行算法DualPipe
3.10.2专家并行负载均衡器
3.11萤火文件系统3FS和数据处理框架Smallpond
3.11.1萤火文件系统3FS
3.11.2轻量级分布式数据处理框架Smallpond
3.12DeepSeek?V3/R1推理系统架构及核心策略
3.12.1DeepSeek?V3/R1推理系统架构剖析
3.12.2DeepSeek?V3/R1核心策略
3.13DeepSeek技术优势总结
3.13.1性能优势
3.13.2效率优势
3.13.3成本优势
第4章LangChain技术原理与实践
4.1LangChain技术原理
4.2LangChain六大核心模块
4.2.1模型I/O模块
4.2.2数据增强模块
4.2.3链模块
4.2.4记忆模块
4.2.5Agent模块
4.2.6回调处理器模块
4.3LangGraph
4.3.1LangGraph技术原理
4.3.2基于DeepSeek大模型的LangGraph代码实践
4.3.3LangGraph Studio
第5章检索增强生成
5.1RAG技术原理
5.1.1RAG的概念与应用
5.1.2RAG技术架构
5.1.3分块和向量化
5.1.4搜索的索引
5.1.5重新排序和过滤
5.1.6查询转换与路由
5.1.7RAG中的智能体
5.1.8响应合成
5.1.9大模型微调和RAG的优劣势对比
5.2文本向量模型
5.2.1Embedding模型、Reranker模型及ColBERT模型
5.2.2阿里巴巴GTE向量模型
5.2.3中文acge_text_embedding模型
5.2.4智源BGE通用向量模型
5.2.5Moka开源文本嵌入模型M3E
5.2.6OpenAI的text?embedding模型
5.3向量数据库
5.3.1Faiss
5.3.2Milvus
5.3.3Pinecone
5.3.4Chroma
5.4RAG应用实践
5.4.1基于大模型构建企业私有数据的知识问答
5.4.2应对大模型落地挑战的优化策略
5.5主流开源RAG项目
5.5.1RAGFlow
5.5.2LLaMAIndex结合DeepSeek实践
5.5.3GraphRAG
第6章AI Agent
6.1AI Agent介绍和原理
6.1.1AI Agent的定义与角色
6.1.2AI Agent的技术原理
6.2主流大模型Agent框架
6.2.1AutoGPT
6.2.2MetaGPT
6.2.3ChatDev
6.2.4AutoGen
6.2.5FastGPT
6.2.6XAgent
6.2.7GPT?Engineer
6.2.8BabyAGI
6.2.9SuperAGI
6.2.10CrewAI
6.2.11Manus通用AI智能体
6.2.12开源OpenManus通用AI智能体
第7章DeepSeek大模型应用落地实践
7.1DeepSeek部署实践
7.1.1Ollama本地部署DeepSeek大模型
7.1.2基于vLLM本地部署企业级DeepSeek
7.1.3基于Unsloth的DeepSeek训练微调及本地运行
7.2Dify应用程序集成DeepSeek
7.2.1接入DeepSeek大模型
7.2.2构建应用程序
7.2.3知识库管理
7.2.4工作流开发
7.2.5工具插件
7.2.6日志及监测
7.3基于DeepSeek工作流应用场景开发实践
7.3.1智能客服/知识问答助手开发
7.3.2销量预测场景开发
7.3.3工业生产设备预测性维护开发
第8章多模态具身智能
8.1DeepSeek重塑具身智能架构
8.2多模态具身智能概念及技术路线
8.2.1多模态具身智能的核心技术
8.2.2多模态具身智能发展路线
8.3多模态感知与场景理解
8.3.1机器人感知系统
8.3.2视觉探索
8.3.3多模态3D场景理解
8.3.4融合语言模型的多模态大模型
8.4机器人操作系统ROS
8.4.1ROS概述
8.4.2ROS 1分层架构设计与核心运行机制
8.4.3ROS 2核心架构及工作原理
8.5机器人定位系统
8.5.1机器人定位系统分类与传感器范式
8.5.2机器人定位算法原理
8.5.3机器人定位任务
8.5.4机器人定位计算系统
8.6机器人规划与控制系统
8.6.1路径规划
8.6.2轨迹规划
8.6.3基于强化学习的规划与控制
8.6.4机器人视觉导航
8.7世界模型
8.7.1世界模型概述
8.7.2开源大世界模型LWM
8.7.3视觉?语言?行动(3D?VLA)模型
8.7.4NVIDIA Cosmos世界模型
8.8基于DeepSeek的具身问答及交互
8.8.1基础具身问答
8.8.2多目标具身问答
8.8.3交互式问答
8.8.4多智能体交互式问答
8.8.5具身问答的感知?决策?执行全流程
8.9具身智能模拟器
8.9.1具身智能模拟器的定义和作用
8.9.2具身智能模拟器的技术原理
8.9.3具身智能模拟器的挑战
8.9.4具身智能模拟器的开源项目实践
8.10Gazebo与Isaac Sim模拟仿真平台实践
8.10.1Gazebo模拟仿真平台实践
8.10.2Isaac Sim模拟仿真平台实践
8.11多模态多感官交互具身智能大模型
8.11.1研究背景与意义
8.11.2多感官宇宙数据集
8.11.3MultiPLY框架
8.12端到端强化学习人形机器人
8.12.1端到端强化学习概述
8.12.2端到端强化学习框架Humanoid?Gym
8.13多模态通才具身智能体
8.13.1模型特点
8.13.2模型训练策略
8.13.3模型能力和分析
- 新华一城书集 (微信公众号认证)
- 上海新华书店官方微信书店
- 扫描二维码,访问我们的微信店铺
- 随时随地的购物、客服咨询、查询订单和物流...