又来安利「Hands-On Large Language Models」

又来安利「Hands-On Large Language Models」
作者
@JayAlammar

@MaartenGr


全书绘制了近 300 张自制图,对应理解概念和原理、架构非常有帮助,作者们叫它 "The Illustrated LLM Book"。

Alammar 的图解系列从 2018 年起就是很多人理解 Transformer、BERT、GPT 的入口,被斯坦福、MIT 等课程引用;这本书把那套「先给直觉和图,再给代码」的讲法系统化沉淀成了 12 章内容。

12 章可以分成三段,这个分法也呼应了
@Nils_Reimers
在书评里的概括,生成式、表示式、检索式三类应用:

理解模型(1–3 章):语言模型是什么、token 和嵌入怎么工作、Transformer 内部长什么样。第 3 章就是 Illustrated Transformer 的更新版。

表示与检索(4、5、8、10、11 章):文本分类、聚类与主题建模、语义搜索和 RAG、自己训练嵌入模型、微调 BERT 类表示模型。这是本书区别于其他 LLM 书的部分,大多数书聚焦生成,这条嵌入线来自 Grootendorst 做 BERTopic 的一手经验,讲的是「模型不生成文本、而是把文本变成向量」的那一半应用。

生成与微调(6、7、9、12 章):提示工程、高级生成技术(采样、结构化输出等)、多模态、微调生成模型。

Alammar 对第 3 章的图解:
https://jalammar.github.io/illustrated-transformer/

代码开源在这:
https://github.com/handsOnLLM/Hands-On-Large-Language-Models

两位作者还参加了一次
@DeepLearningAI
课程:
https://deeplearning.ai/courses/how-transformer-llms-work




分类