返回第二百八十六章 视界,加点  路大头首页

关灯 护眼     字体:

上一页 目录 下一章

的时候,真正麻烦的是反向。

你不只要知道输出是什么,还要知道输出变化之后,q、k、v三组值要怎么调整。

要是按照普通的实现,这里可以用很多其他算子替代。

先算dv,再算dp,再还原softax梯度,再一步步算过去。

最后就可以得到一个新值,但每一个算子运算,都要读写一次显存,都要运输一次数据。

而大家公认的是,搬数据,比算数据贵。

聪明的芯片工程师们想出了一个解决办法。

既然这个反向计算每次都要跑,跑法都是固定的,那我们把这些算子融合在一起,直接在显卡核心里一次性跑完,不就不用把数据搬来搬去了吗?

这就是融合算子。

想法是很好,但是也很难。

反向计算本来占的内存就大,融合之后就更大。

这个算子可以说是在考验工程师对硬件理解、内存编排的极限了。

这么难的任务,怎么办呢?

韩路一调用新拿到的【算子适配】技能,指向了这个注意力融合反向算子。

然后在韩路一的眼中,出现了一个l100显卡的透明模型。

模型在半空中逐渐放大,如同变成了一座悬浮在半空中的立体工厂。

每一个线程块都是一个发光的巨大机械臂。

而每一段共享内存都是一排排透明的储物格。

寄存器像一个传送带,围绕着巨大的计算核心,一块块数据块被送进高速运转的计算核心,然后又被吐出来。

韩路一明白,自己接下来的任务,是优化这个工厂的操作流程。

『加入书签,方便阅读』

上一页 目录 下一章