机器学习与大语言模型

出版信息

  • 顾小东,机器学习与大语言模型, 上海交通大学出版社, ISBN:9787313343420

400px 

本书简介

《机器学习与大语言模型》系统介绍了机器学习和大语言模型的核心概念、理论基础与主流算法, 旨在帮助读者建立贯通传统方法与现代深度学习技术的统一知识框架。 全书以“原理—算法—应用”为主线,从基础的线性模型、特征工程与统计学习理论出发, 逐步过渡到神经网络、卷积模型、序列学习, 再延伸至 Transformer、大语言模型等当代前沿技术,为读者展现机器学习技术体系的完整演化脉络。

全书主要内容包括:

  • 经典机器学习算法:经典机器学习方法:线性回归、逻辑回归、支持向量机、树模型等,帮助读者扎实掌握传统方法的数学基础与适用场景。

  • 深度学习基础:揭示神经网络的本质原理和深度学习的核心内涵。介绍反向传播算法等,为理解大型神经网络模型奠定基础

  • 语言模型:深入探究语言模型的本质,从n-gram到循环神经网络(RNN)再到Seq2Seq与注意力机制,系统讲解自然语言处理领域中“序列学习”的逻辑演进。在此基础上引出Transformer及其衍生模型,包括 Self-Attention等。

  • 大语言模型:深入解析BERT与GPT系列模型的设计理念、预训练任务、微调策略,并展示大规模预训练模型在实际任务中的应用方式。参数高效微调(PEFT)、检索增强(RAG)等前沿主题,帮助读者了解当前最具影响力的技术方向。

  • 机器视觉:介绍卷积神经网络的核心思想与设计演化,包括经典网络及其在图像分类、目标检测、语义分割等任务中的应用。结合Vision Transformer(ViT),Vision Language Model等近年来兴起的视觉模型, 展示从卷积范式到视觉理解的迁移路径,帮助读者建立对现代计算机视觉的结构化理解。

  • 生成式模型:系统讲解生成式建模的主要技术路线,包括变分自编码器(VAE)、 生成对抗网络(GAN)、扩散模型等,并结合图像生成、文本生成等应用场景, 阐述其背后的概率建模思想与训练机制,呈现当代生成式 AI 技术的理论基础与应用边界。

  • 强化学习:从马尔可夫决策过程(MDP)、价值函数与策略搜索等基础概念入手, 讲解Q-Learning、策略梯度等经典算法,并逐步扩展到深度强化学习框架,包括DQN等方法。

本书主要概念基本配有详细的例子来解释。主要算法也都通过实际应用问题对算法细节进行详细阐述,相关程序也可以在本网页下载。

本书特点

  • 不仅介绍算法,更讲“思想演化”。 本书的一大特色,是希望把“机器学习”从单纯的算法列表重新还原为一门思想体系, 让每一个知识点都“有来有去、有根有据”。 把“机器学习”从单纯的算法列表重新还原为一门思想体系, 机器学习的每个概念都不是凭空出现的,而是数十年研究和无数实践探索的智慧结晶。 本书坚持从问题动机—方法设计—算法实现—典型应用的逻辑展开, 帮助读者理解“为什么会有这个算法”、“它试图解决什么问题”、“为什么这样设计能解决问题”、 “它与前后知识点的关系是什么”。 不仅介绍算法,更讲“思想演化”。 这种写法既延续了严谨的技术体系,又将理论置于直观的语境之中, 让读者能够真正“看懂、想通、用上”。唯有理解其根本动机与限制, 才能在未来的技术浪潮中真正站稳脚跟。

  • 兼顾传统机器学习与最新发展。 从线性回归、SVM,到深度学习、卷积网络,再到近年的 Transformer、预训练语言模型与提示学习, 本书试图构建一个贯穿经典与现代的统一框架。 事实上,无论是线性回归、逻辑回归,还是神经网络与大语言模型, 它们背后的思想原理都存在深刻的共通性。因此,本书在编排结构时, 刻意打通机器学习“经典算法—深度学习—预训练与生成式模型”的知识链路。 从线性模型中的梯度优化、几何解释,到 SVM 的间隔思想,再到深度网络的表征能力与反向传播机制, 读者可以看到一条逐渐丰富、不断扩展的技术主线。 我们希望呈现的是一个“统一的机器学习世界观”——传统方法与深度学习并不是两个割裂的体系, 而是从不同角度回答同一类问题:如何有效表征数据?如何从有限样本中泛化? 如何设计可优化、可扩展的模型?而大模型时代的许多突破,也可以在经典理论中找到回响。

教材购买信息