Transformer 模型要么需要耗费大量精力来保存完整的历史信息,要么可以使用滑动窗口,虽然效率高但会遗忘窗口外的信息。
本文旨在将遗忘的历史信息循环利用。为此,他们使用了一个更强大的预填充器,可以并行创建记忆目标;以及一个滑动窗口 Transformer 模型,该模型能够学习如何重现这些记忆,并通过其键值缓存将这些记忆传递下去。
预填充器在推理阶段被移除,因此模型获得了具有固定大小注意力机制和键值缓存的持久非线性记忆,同时仍然使用并行 Transformer 迭代进行训练。
https://alphaxiv.org/abs/2608.02870