啦吗?”
李东别说试过了,他连未央出了通用大模型测试版也是今天才知道的。
“我还没有,唐教授试过了?”
“嗯试过了,能力很出色,这不用多说。”
他顿了一下,然後说:“但如果是要往通用方向走,有几个地方,现在看来还不够。”
李东说:“说说看?”
“我先说好的地方。”唐杰说道。
“凡是有标准答案、靠硬推理的榜单,它都强得离谱,简直可以说是断层领先。”
“而且,我很意外他在swe-bench上的表现也是出人预料的好,几乎也是断层的水平。”
swe-bench测试的不是大模型单独写代码的能力,而是把模型直接扔进一个真实的开源项目里,让它读懂整个代码库,再去修一个真实存在的bug。
这玩意儿吃的是长链条的推理能力,一步错,後面全错。
通用模型在这张榜上普遍吃力。
未央能在上面取得好成绩,其实并不意外,未央的底子就是一步一步可核验的推理,它天生不爱跳步,也不爱瞎编,这习惯挪到代码上,反而成了优势。
“但是,”唐杰话锋一转,“另外那些榜,就不太好看了。”
“最明显的是chatbot arena。”
这张榜在大模型圈子里份量很重,它考的不是谁算得准,是真实用户更愿意跟哪个模型聊。
因此并没有标准答案,打分的不是机器,是一个一个的活人,凭感觉投票。
全球的大厂为了在这张榜上有好名次,会专门做一道叫rlhf的工序,反复拿真人的偏好去打磨模型,让它学会怎麽把话说得让人舒服。
未央在这张榜上的名次,低得几乎可以忽略。
“它太死板了。”
“你给它一道题,它的推理无懈可击,可你换个方式问同一件事,它就不一定能灵活地调整切入角度。”
“它的训练信号从来不是人类喜不喜欢,是核验器判它对不对,所以它压根没学过怎麽揣摩人话。”
李东在心里想。
“唐杰教授,你说的没错,但那时因为我没时间去优化这些,额……小黑没时间,算了,反正我没时间就是小黑没时间!”
未央现在的通用侧短板,是架构层面的一些选择带来的,而这些选择本来就是为了让它在数学符号推理上做到极致。
他当
…。。本站若有图片广告属于第三方接入,非本站所为,广告内容与本站无关,不代表本站立场,请谨慎阅读。
Copyright © 2020 祭司书院 All Rights Reserved.kk