在注意力机制中,查询(Query)、键(Key)和值(Value)是直接从输入序列中取出的。
多头注意力机制通过多个并行的注意力头,可以捕获不同类型的注意力关系。
在Transformer的编码器中,每一层的多头注意力模块需要应用mask。
位置编码的作用是为模型提供序列中元素的位置信息,以便模型能够区分不同位置的重要性。
Transformer模型的解码器层不包含前馈神经网络。
注意力机制中的“查询”、“键”和“值”是如何得到的?
A. 直接从输入序列中取出
通过线性变换(矩阵乘法)从输入序列中得到
随机初始化得到
通过非线性变换(如ReLU)从输入序列中得到
多头注意力机制的主要目的是什么?
提高模型的计算速度
降低模型的参数量
捕获不同类型的注意力关系
简化模型结构
在Transformer的编码器中,每一层的结构顺序是怎样的?
多头注意力→残差连接与层归一化→前馈神经网络
前馈神经网络→多头注意力→残差连接与层归一化
残差连接与层归一化→多头注意力→前馈神经网络
多头注意力→前馈神经网络→残差连接与层归一化
在Transformer的解码器中,为什么要对已经生成的部分应用mask?
防止模型看到未来的信息
提高模型的计算效率
降低模型的内存消耗
增加模型的非线性
位置编码(Positional Encoding)的作用是什么?
增加模型的参数量
为模型提供序列中元素的位置信息
提高模型的计算速度
降低模型的过拟合风险