注意力机制的目的:理解语义;编码器嵌入高纬空间计算;注意力得分“得到S*V”;解码器掩码和交叉注意力层用于训练;最终的编码器和输出实现大模型
目录
注意力机制的目的:理解语义中的它是小白兔
词编码器嵌入高纬空间
计算注意力得分“得到S*V”
权重QKV:连接权重
训练阶段使用解码器:翻译后的语句
解码器掩码和交叉注意力层用于训练
最终的编码器和输出实现大模型
Transformer模型中,QKV
QKV的作用
举例说明
Self-Attention计算公式
定义输入
计算QKV
计算注意力Attention编辑
注意力权重矩阵式QK编辑