”
万斯重重地点头。
有道理。
这话简直不能更有道理了。
“不过,”
李东随口地补了一句。
“我倒是好奇一件事。”
“你们费这麽大的劲,又是投影,又是重排,折腾来折腾去,无非是想把那坨越来越臃肿的cache压小一点,对吧?”
“那你们就没想过,干脆,把kv cache彻底扬了?”
万斯愣住了。
把cache扬了?
attention机制不带cache,那他妈还叫……
等等。
他的瞳孔,缓缓地放大了。
不知怎麽的,他脑子里那些散落了快一年的拚图碎片。
线性注意力(linear attention)的递推范式,状态空间模型(ssm)的隐状态方程,还有上个月组会上被他亲手毙掉的那份疯狂的rnn变体提案,在这一瞬间,被一条逻辑链猛地串了起来。
如果,hidden state不再是存放kv对的死仓库,而是一个活的“学生”呢?
万斯整个人,僵在了原地。
而站在他对面的李东,端着咖啡,笑眯眯地看着他。
与此同时,记忆宫殿。
大厅的正中央,凭空多出了一座临时的小书架。
书架上,静静躺着一份崭新的文献。
李东走过去,把它翻开。
【将“记忆”从静态的kv cache,重构为动态更新的权重矩阵。】
【hidden state不再是堆叠键值对的外部显存,而是内嵌於backbone中、在inference阶段同步迭代的微型模型。】
【序列建模等价於在线元学习(online meta-learning)。】
【每自回归生成一个新token,即向该微型模型输入一条样本,“检索回忆”等效於一次forward pass,“上下文记忆”等效於一步gradient descent。】
【至此,context window长度彻底摆脱显存墙(memory wall)的物理桎梏,仅受限於内层学习器的参数容量与遗忘门控。】
【信息压缩不再是暴力的有损截断,而是一场由目标函数驱动的端到端表征学习……】
【至於内
…。。本站若有图片广告属于第三方接入,非本站所为,广告内容与本站无关,不代表本站立场,请谨慎阅读。
Copyright © 2020 祭司书院 All Rights Reserved.kk