Sparse Chunky Attention-Latent: 一种基于SCA与低秩分解思想的稀疏注意力机制
Mulatram Two

我们提出了SCA-L(潜空间稀疏分块注意力),用一个变换矩阵将高维KQ向量变换到低维空间输入SCA,这可以解决目前所有因高维产生的问题,且可以取消面相邻机制转向所有相邻块。

背景

SCA在上一篇的实验报告里已经阐明,表现明显劣于标准注意力,我们认为是由于初始的随机状态会让一些KV永远梯度消失不受反向传播导致(至少有一部分原因是这样)[^1]。且高维空间过于稀疏,不利于SCA工作。

方案

受LoRA启发,我们可以通过一个变换矩阵将KQ分别变换到低维空间(V始终高维),然后输入SCA。这样一来,SCA将在低维空间操作,更重要的是,SCA现在完全可以进行全部的邻域遍历,而不仅限于面相邻。

未来规划

本文只是一个原理阐述,实验报告将在本文发表日晚些给出。
感谢来自Ryan100C的"KV梯度消失"推论,在此致谢。

 评论
评论插件加载失败
正在加载评论插件