Kairos05:全局门控线性注意力(GLA)数学推导

发布时间:2026/8/3 1:47:47
Kairos05:全局门控线性注意力(GLA)数学推导 从注意力到动态记忆:高中生也能看懂的 Kairos 门控线性注意力(GLA)数学推导一、先用一句话理解 GLAKairos 使用门控线性注意力(Gated Linear Attention, GLA)来维护长期信息。它可以被理解为一块固定大小的“动态记忆板”:每当新信息到来,模型先查看记忆中原来保存了什么,再判断旧内容是否需要遗忘、修正或覆盖,最后把更新后的记忆传给未来。例如,一个机器人先看到红色杯子位于桌子左侧。后来杯子被手挡住,当前画面中已经看不到杯子,但机器人仍然需要记住:红色杯子没有凭空消失,它之前位于桌子左侧。这种能力叫作物体恒常性(Object Permanence)。Kairos 中的 GLA 主要负责保存:物体是否仍然存在;任务进行到了哪一个阶段;之前是否发生过抓取失败;很久之前的动作是否产生了延迟影响;已经离开局部窗口、但仍可能影响未来的信息。需要先说明一个容易混淆的地方:GLA 是 Kairos 中全局记忆通路的名称;这条通路具体使用门控 Delta 网络(Gated DeltaNet, GDN)来更新记忆。