的最吃亏。”
三位首席科学家面面相觑。
几秒钟后,也不知道是谁先把心一横。
反正答案大家都听得见,那还客气什么?
多问的,才是赚的。
“李东教授。”
还是雅各布先开口。
“那我换个问法。”
“千亿级参数的loss曲面,强上全量hessian矩阵纯属做梦,二阶的预条件子连显存都塞不进,只能退化到一阶的adam系硬磨。”
“如果先用您那套算法重排,把参数空间正交化到近似对角阵……”
“预条件子,是不是就能直接降维成逐元素的标量缩放?”
他一说完,另外两家的人也停下了手中正在记录的笔,抬头看向李东。
李东听完点了点头。
“路子是对的。”
“但你们光盯着算力和显存了,问题的核心不在于算不算得起。”
“而在于你们根本不知道,该在哪个标度上去算。”
雅各布一怔:“标度?”
“loss曲率不是一张静态的地图。”
李东说道。
“它跟着你的batch size缩,跟着学习率漂,还跟着网络的width一起扭曲。”
“我那个算法之所以成立,是因为zeta算子的谱特征背后,有一套解析的scaling law兜底。”
“我是先吃透了规律,才敢去动算的。”
“而你们呢?”
“你们梯度的噪声标度,是怎么做标定和对齐的?”
“网络width翻一倍这个scale往哪边漂移,你们跑过消融实验吗?”
雅各布握张了张嘴没出声,整个人像是被这一问,好像让他想到了什么。
与此同时,李东的记忆宫殿里。
大厅中央那座临时书架上,现出了一份崭新的残篇。
【临界batch size,由梯度噪声的scale唯一确定。 】
【将学习率、批大小、网络宽度与深度,统一收敛至同一套scaling law解析式。 】
【在千万级参数的proxy模型上定死全局超参,借参数化的对称性,零样本无损迁移至万亿参数域。 】
【若该定律成立,不同参数规模的loss下降曲线,在对数坐标系下必将塌缩为同一条母线。 】
…。。本站若有图片广告属于第三方接入,非本站所为,广告内容与本站无关,不代表本站立场,请谨慎阅读。
Copyright © 2020 祭司书院 All Rights Reserved.kk