Transformer模型1的原理和应用有哪些?
- 内容介绍
- 文章标签
- 相关推荐
本文共计4136个文字,预计阅读时间需要17分钟。
Transformer模型是Google团队在2017年提出的一种NLP经典模型,现在与Bert等热门模型一样,也是基于Transformer的。Transformer模型使用了Self-Attention机制,不采用RNN的顺序结构,这使得它能够更有效地处理序列数据。
Transformer 模型 1
Transformer 是 Google 的团队在 2017 年提出的一种 NLP 经典模型,现在比较火热的 Bert 也是基于 Transformer。Transformer 模型使用了 Self-Attention 机制,不采用 RNN 的顺序结构,使得模型可以并行化训练,而且能够拥有全局信息。
1. Transformer 结构
首先介绍 Transformer 的整体结构,下图是 Transformer 用于中英文翻译的整体结构(输入中文,输出英文)。
Transformer 整体结构
可以看到 Transformer 由 Encoder 和 Decoder 两个部分组成,Encoder 和 Decoder 都包含 6 个 block。Transformer 的工作流程大体如下:
第一步:获取输入句子的每一个单词的表示向量 X,X由单词的 Embedding 和单词位置的 Embedding
Transformer 的输入表示
第二步:将得到的单词表示向量矩阵 (如上图所示,每一行是一个单词的表示 x) 传入 Encoder 中,经过 6 个 Encoder block 后可以得到句子所有单词的编码信息矩阵 C,如下图。单词向量矩阵用 X(n×d)表示, n 是句子中单词个数,d 是表示向量的维度 (论文中 d=512)。每一个 Encoder block 输出的矩阵维度与输入完全一致。
本文共计4136个文字,预计阅读时间需要17分钟。
Transformer模型是Google团队在2017年提出的一种NLP经典模型,现在与Bert等热门模型一样,也是基于Transformer的。Transformer模型使用了Self-Attention机制,不采用RNN的顺序结构,这使得它能够更有效地处理序列数据。
Transformer 模型 1
Transformer 是 Google 的团队在 2017 年提出的一种 NLP 经典模型,现在比较火热的 Bert 也是基于 Transformer。Transformer 模型使用了 Self-Attention 机制,不采用 RNN 的顺序结构,使得模型可以并行化训练,而且能够拥有全局信息。
1. Transformer 结构
首先介绍 Transformer 的整体结构,下图是 Transformer 用于中英文翻译的整体结构(输入中文,输出英文)。
Transformer 整体结构
可以看到 Transformer 由 Encoder 和 Decoder 两个部分组成,Encoder 和 Decoder 都包含 6 个 block。Transformer 的工作流程大体如下:
第一步:获取输入句子的每一个单词的表示向量 X,X由单词的 Embedding 和单词位置的 Embedding
Transformer 的输入表示
第二步:将得到的单词表示向量矩阵 (如上图所示,每一行是一个单词的表示 x) 传入 Encoder 中,经过 6 个 Encoder block 后可以得到句子所有单词的编码信息矩阵 C,如下图。单词向量矩阵用 X(n×d)表示, n 是句子中单词个数,d 是表示向量的维度 (论文中 d=512)。每一个 Encoder block 输出的矩阵维度与输入完全一致。

