Transformer模型1的原理和应用有哪些?

更新于
2026-10-03 22:53:22
1阅读来源:SEO资源
  • 内容介绍
  • 文章标签
  • 相关推荐

本文共计4136个文字,预计阅读时间需要17分钟。

Transformer模型是Google团队在2017年提出的一种NLP经典模型,现在与Bert等热门模型一样,也是基于Transformer的。Transformer模型使用了Self-Attention机制,不采用RNN的顺序结构,这使得它能够更有效地处理序列数据。

Transformer 模型 1


Transformer 是 Google 的团队在 2017 年提出的一种 NLP 经典模型,现在比较火热的 Bert 也是基于 Transformer。Transformer 模型使用了 Self-Attention 机制,不采用 RNN 的顺序结构,使得模型可以并行化训练,而且能够拥有全局信息。

1. Transformer 结构

首先介绍 Transformer 的整体结构,下图是 Transformer 用于中英文翻译的整体结构(输入中文,输出英文)。


Transformer 整体结构

可以看到 Transformer 由 Encoder 和 Decoder 两个部分组成,Encoder 和 Decoder 都包含 6 个 block。Transformer 的工作流程大体如下:

第一步:获取输入句子的每一个单词的表示向量 X,X由单词的 Embedding 和单词位置的 Embedding

Transformer 的输入表示

第二步:将得到的单词表示向量矩阵 (如上图所示,每一行是一个单词的表示 x) 传入 Encoder 中,经过 6 个 Encoder block 后可以得到句子所有单词的编码信息矩阵 C,如下图。单词向量矩阵用 X(n×d)表示, n 是句子中单词个数,d 是表示向量的维度 (论文中 d=512)。每一个 Encoder block 输出的矩阵维度与输入完全一致。

阅读全文

本文共计4136个文字,预计阅读时间需要17分钟。

Transformer模型是Google团队在2017年提出的一种NLP经典模型,现在与Bert等热门模型一样,也是基于Transformer的。Transformer模型使用了Self-Attention机制,不采用RNN的顺序结构,这使得它能够更有效地处理序列数据。

Transformer 模型 1


Transformer 是 Google 的团队在 2017 年提出的一种 NLP 经典模型,现在比较火热的 Bert 也是基于 Transformer。Transformer 模型使用了 Self-Attention 机制,不采用 RNN 的顺序结构,使得模型可以并行化训练,而且能够拥有全局信息。

1. Transformer 结构

首先介绍 Transformer 的整体结构,下图是 Transformer 用于中英文翻译的整体结构(输入中文,输出英文)。


Transformer 整体结构

可以看到 Transformer 由 Encoder 和 Decoder 两个部分组成,Encoder 和 Decoder 都包含 6 个 block。Transformer 的工作流程大体如下:

第一步:获取输入句子的每一个单词的表示向量 X,X由单词的 Embedding 和单词位置的 Embedding

Transformer 的输入表示

第二步:将得到的单词表示向量矩阵 (如上图所示,每一行是一个单词的表示 x) 传入 Encoder 中,经过 6 个 Encoder block 后可以得到句子所有单词的编码信息矩阵 C,如下图。单词向量矩阵用 X(n×d)表示, n 是句子中单词个数,d 是表示向量的维度 (论文中 d=512)。每一个 Encoder block 输出的矩阵维度与输入完全一致。

阅读全文