ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Transformer 与大语言模型:第2章 Transformer 总体架构

Transformer 与大语言模型:第2章 Transformer 总体架构 第2章 Transformer 总体架构本章目标:从整体上理解 Transformer 的结构,知道每个模块负责什么,以及为什么 GPT 只有 Decoder,BERT 只有 Encoder。本章目录2.1 Transformer 到底是什么?2.2 为什么叫 Transformer?2.3 Transformer 架构演进时间线2.4 Transformer 的整体结构2.5 Transformer 的数据入口:文字是如何变成向量的?2.6 Encoder 的结构2.7 Encoder 输出什么?2.8 Decoder 的结构2.9 为什么 Decoder 需要 Cross-Attention?2.10 数据流:一句话是如何被翻译的?2.11 完整数据流:Tensor Shape 如何变化?2.12 为什么 BERT 只有 Encoder?2.13 为什么 GPT 只有 Decoder?2.14 三种架构对比2.15 与 CNN / LSTM 的对比2.16 本章核心思想本章常见误区本章总结本章思考题下一章预告2.1 Transformer 到底是什么?Transformer 是一种神经网络架构(不是某个具体模型),最初用于机器翻译。例如:输入:I love AI 输出:我爱AITransformer 的核心思想只有一句话:不要让信息一步一步传递,而是让每个 Token 直接从所有 Token 中拉取需要的信息。2.2 为什么叫 Transformer?Transformer 的名字来自它的功能:Transform(变换)一个序列的表示。输入是一串 Token 的向量,输出也是一串向量,但每个向量已经包含了整个句子的上下文信息。2.3 Transformer 架构演进时间线2017Google 发布原始TransformerEncoder-Decoder架构用于机器翻译2018OpenAI 发布 GPT-1(Decoder-Only)Google 发布 BERT(Encoder-Only)2019GPT-2 (1.5B 参数)T5(Encoder-Decoder回归)2020GPT-3 (175B 参数,96层)2023Llama 1/2 (Meta)Qwen (阿里巴巴)2024Llama 3, Qwen2,DeepSeek-V2全部 Decoder-Only +MoETransformer 架构演进趋势:2018年之后,生成类任务(对话、写作)统一走向 Decoder-Only;理解类任务(搜索、分类)仍然使用 Encoder-Only。2.4 Transformer 的整体结构原始 Transformer(2017 年论文)由两部分组成:输入序列I love AIEncoderContext Vectors上下文向量Decoder目标序列我爱AI输出序列我 爱 AIEncoder:理解输入句子Decoder:根据理解,生成输出句子但这张图有一个让几乎所有初学者困惑的地方:"目标序列"不就是已经翻译好的中文吗?既然已经知道答案了,为什么还要 Decoder 去翻译?答案是:这张图画的是训练阶段,不是推理阶段。Transformer 有两种完全不同的工作模式。2.5 Transformer 的数据入口:文字是如何变成向量的?在讲 Encoder 的内部结构之前,我们必须先回答一个问题:Transformer 的第一层到底吃进去的是什么?答案是:不是文字,不是 Token ID,而是向量矩阵。完整的入口流程:
返回列表