返回

第402章 路就在眼前,你们修不修吧。

首页
关灯
护眼
字:
大
中
小
上一章 回目录 下一页 进书架
    第402章 路就在眼前,你们修不修吧。 (第1/2页)

    coex会展中心,主会场侧面的贵宾休息区门口。

    西蒙·哈特低着头,看着手机上的航班追踪软件。

    “还有两个多小时落地。”

    “落了地也得明天。”

    戴维·朗看了一眼表。

    “难道真让他们顶着十二个钟头的时差去和李东盘底层架构?”

    哈特没接话。

    两个人又不约而同地看向了大厅里不断游走的李东。

    这时亚当·凯利也挂断了电话。

    他已经忍不住了,立刻阴沉着脸朝着会场快步走了过去。

    直到离李东只剩几步远,他才放缓脚步,然后阴沉的表情不见了,露出一个标准的笑容。

    然后有意无意地,正好拦在了李东和下一位“交流对象”之间。

    “李东教授。”

    “今天的议程也快结束了,”亚当·凯利笑容可掬,“有没有时间,咱们去喝一杯?”

    李东冲他歉意地笑了笑。

    “不好意思,我酒精过敏。”

    凯利:……

    “对了。”

    李东像是想起了什么问道。

    “那位雅各布博士,什么时候能到呀?”

    亚当·凯利有些懊恼地说道。

    “……可能,要明天。”

    “那行。”李东点了点头,答应得痛快,“那明天,咱们单独聊。”

    说完,他绕过凯利朝着下一位等候多时的同行走了过去。

    亚当·凯利站在原地,望着李东的背影,脸色总算是稍微好看了一点。

    至少……

    李东答应了,单独聊。

    ……

    次日,上午九点。

    还是这间贵宾休息室。

    李东推门进去的时候,屋里的人已经到齐了。

    亚当·凯利脸色难看地看着身旁的朗和哈特。

    “该死,原来李东教授说的单独聊是三家一起单独聊啊。”

    他们各自的身边,都坐着一个李东之前没见过的人。

    而这三个人,看起来都挺疲惫的,下巴上还有没刮掉的胡茬。

    不过当李东进来以后,这三个人都用充满了血丝的眼睛看向了李东。

    “雅各布,我们的首席科学家。”凯利说。

    “马库斯。”

    “伊森。”

    朗和哈特也介绍道。

    李东一边和他们握手,一边在心里舒了口气。

    正主,来了。

    虽然昨天展厅里聊过的那些人,水平也不低。

    可说到底,那些都是二线。

    而真正决定这一行天花板的东西,万卡集群的容错和拓扑怎么搭,千亿数据的清洗管线怎么通,几千万刀的pre-training怎么做到一次不崩盘,这些,都只存于少数人的脑子里,比如……

    眼前这三位。

    李东要自建大模型,主攻ai for math,这些学费迟早是要交的。

    如今教材自己坐着私人飞机送上了门。

    所以李东望着这三张憔悴又亢奋的脸,笑得格外和蔼。

    很快,单间里多余的随行人员都退了出去,门也合上了。

    屋里只剩下八个人。

    三位巨头,三位首席科学家,李东。

    以及,彼得·诺维格。

    诺维格坐在最靠窗的位置,手里端着一杯红茶,从头到尾没怎么出声。

    他是戴维·朗亲自邀请过来的。

    在外人看来,诺维格早就退出一线了,这几年扑在教育上,带带学生,写写教材俨然半个养老的状态。

    可他在最底层那些事情上,根基究竟扎得有多深,凯利不清楚,哈特也不清楚。

    全世界,恐怕只有戴维·朗一个人,心里有数。

    随着最后一位随行人员退了出去,休息室里却陷入安静。

    没人先开口,直到一分钟过后,雅各布带着点疲惫的开口了。

    不过他问的,全是绕着降维算法原始论文打转的东西,loss面的收敛半径、泛化误差上界、离散网格的采样密度。

    没一句是干货。

    李东听了几分钟,大概就明白这到底是怎么回事了。

    这三家,平日里你抢我的人我挖你的墙角。

    谁家的预训练在哪儿卡了壳,那都是压箱底的机密,当着两家死对头的面,谁会真的掏底呀?

    按照这个聊法,聊到大会闭幕,也聊不进正题。

    于是李东放下茶杯,笑眯眯地打断了雅各布。

    “雅各布博士,你问的这些,你们组自己挂出来的技术报告里,就有答案。”

    “咱们立个规矩吧。”李东笑着看向了休息室里的众人,“今天在这间屋子里,不管谁提的问题,我的回答,三家一起听。”

    “所以……藏着掖着的最吃亏。”

    三位首席科学家面面相觑。

    几秒钟后,也不知道是谁先把心一横。

    反正答案大家都听得见,那还客气什么?

    多问的,才是赚的。

    “李东教授。”

    还是雅各布先开口。

    “那我换个问法。”

    “千亿级参数的loss曲面,强上全量hessian矩阵纯属做梦,二阶的预条件子连显存都塞不进,只能退化到一阶的adam系硬磨。”

    “如果先用您那套算法重排,把参数空间正交化到近似对角阵……”

    “预条件子,是不是就能直接降维成逐元素的标量缩放?”

    他一说完,另外两家的人也停下了手中正在记录的笔,抬头看向李东。

    李东听完点了点头。

    “路子是对的。”

    “但你们光盯着算力和显存了,问题的核心不在于算不算得起。”

    “而在于你们根本不知道,该在哪个标度上去算。”

    雅各布一怔:“标度?”

    “loss曲率不是一张静态的地图。”

    李东说道。

    “它跟着你的batch size缩,跟着学

    (本章未完,请点击下一页继续阅读)
上一章 回目录 下一页 存书签