第333章 挖人 (第1/2页)
第二天上午。
棕榈滩国际机场。
按照原定安排,陈默和陆静怡将从这里直接返回香港。
车队刚刚驶进机场,陈默便接到了伊利亚的电话。
“陈,你还没有离开美国吧?”
“正在机场。”
“先别走。”
伊利亚的声音沙哑。
陈默看了一眼时间。
“出什么事了?”
“下一代语言模型的第一次扩大训练失败了。”
“模型结构有问题?”
“不是模型。”
电话另一端传来键盘敲击声。
“昨天晚上,我们按照原方案将训练规模扩大到五百一十二张GPU。”
“单机测试正常,接入的机器越多,训练效率反而越低。”
“显存里堆满重复数据,大量GPU都在等待其他节点完成计算,机器之间传输参数的时间,甚至超过了真正用于训练的时间。”
伊利亚停顿片刻。
“最后系统在第七个小时失去同步,训练结果全部作废。”
陈默没有立即说话。
一台机器工作很快,不代表将几百台机器放在一起,速度便能增加几百倍。
模型需要被拆分到不同GPU上。
每一块GPU计算完自己的部分,还要与其他节点交换结果。
数据如何分配。
显存如何利用。
什么时候通信。
任何一个环节出现堵塞,价值数百万美元的GPU集群都会陷入等待。
纸面算力再大,也无法转化成真正的训练能力。
“现在的利用率多少?”
“平均百分之三十二。”
伊利亚回答。
“最差的时候不到百分之二十。”
OpenAI目前拥有两千多张GPU。
如果始终保持这种效率,真正发挥作用的算力甚至不到账面规模的一半。
未来将集群扩大四倍,问题只会更加严重。
“上次会议结束以前,你说只剩下一个办法。”
陈默想起马斯克推门时被打断的谈话。
“就是这个?”
“对。”
伊利亚说道。
“谷歌拥有比我们更多的机器、工程师和数据中心。”
“只靠采购GPU,我们永远追不上他们。”
“OpenAI必须建立自己的计算系统,让每一张GPU完成更多工作。”
“我们需要真正理解CUDA、显存、通信与分布式系统的人。”
“我已经让Sam在硅谷寻找合适的人选。”
“不用找了。”陈默说道。
伊利亚安静了两秒。
“你有推荐?”
“知道一个。”
陈默挂断电话,看向坐在身旁的陆静怡。
“让机组更改飞行计划。”
“先去旧金山。”
陆静怡显然已经从刚才的通话里听出了原因。
“林启航?”
(本章未完,请点击下一页继续阅读)