这麽一想,李东多少有些失望。
可转念一想他又松了口气。
这样对方肯定就查不到了,难不成你们还能顺着这根线,一路查到平行宇宙里去?
开什麽玩笑。
没有了担心,李东也来了兴致。
“小黑。”
“那你现在,算是把它们摸透了吧?有没有什麽法子,能让它们变得更好玩一点?”
“摸透啦!”小黑一蹦三尺高,叽叽喳喳地说了起来。
“它有个问题,叫Softmax瓶颈(Softmax bottleneck)。”
李东微微一怔。
这词他也不是特别清楚,只是简单的了解过。
其实这批大模型模型,到了最最後,是先把脑子里那个高维的状态,过一道线性映射压到词表上,再经过Softmax归一成下一个字的概率。
可它们也偏偏就栽在这上面。
这一层得出来的所有对数概率,会拚成一张大表,它的秩都死死卡在那个隐藏维度上,再高也高不上去了。
可真实语言里,那张“什麽上文、接什麽下文”的概率表,却是满秩的,比他的能力边界高得多。
拿一张低秩的表,去硬套一张满秩的表,这在数学上本来就不成立。
换句话说,总有那麽一些上文,它底下究竟该接个什麽样的字、什麽样的分布,这模型打根上就表达不出来,跟你喂它多少数据、给它堆多少算力,半点关系都没有。
这是焊死在它骨架里的一道天花板。
“还有还有,它们的注意力也有问题,应该叫注意力汇聚(attention sink)。”
小黑接着说道。
模型读一句话,靠的是注意力。
每个字都会去观察旁边的字,按相关与否分给各自一份权重。
坏就坏在,这份权重,也是拿Softmax归一的,加起来必须凑足一个整一。
这就逼得它,哪怕通篇没有一个字值得它分神,也没法干脆弃权那份多出来的注意力,所以它总得找个地方释放出去。
於是它就释放在了开头那一两个字上,释放到一个跟正文八竿子打不着的锚点上,硬生生攒出一处“注意力汇聚”。
伴随着这个现象还有个熵坍缩(AEC)。
越往後训练,它那点注意力就收得越窄,全部钻在了寥寥几个字上,其他的几乎一概不看了。
…。。本站若有图片广告属于第三方接入,非本站所为,广告内容与本站无关,不代表本站立场,请谨慎阅读。
Copyright © 2020 祭司书院 All Rights Reserved.kk