返回 ppt-master
08_transformer.md
根目录 / examples / ppt169_lora_hu_2021 / notes / 08_transformer.md
1 在 Transformer 上,作者做了一个克制的选择。自注意力里有四个投影矩阵,查询、键、值、输出,论文在大多数实验里只给查询和值这两个矩阵加 LoRA,MLP 模块整个冻结,这是出于简洁和参数效率的考虑。可训练参数量只随秩 r 线性增长。效果非常惊人:在 GPT-3 上,训练显存从一点二个 TB 降到三百五十个 GB,大约只剩三分之一;而检查点的大小从三百五十个 GB 直接降到三十五个 MB,缩小了约一万倍。
1 lines MARKDOWN