AI
AIGIT · AI 工具站
aigit.cc
首页
精品推荐
AI成品工具
提示词
返回 ppt-master
12_glue.md
根目录
/
examples
/
ppt169_lora_hu_2021
/
notes
/
12_glue.md
1
先看 GLUE 的结果,结论是:用更少的参数,持平甚至更优。RoBERTa base 全量微调要训一亿两千五百万参数,平均分八十六点四;LoRA 只训三十万参数,平均分反而是八十七点二。RoBERTa large 上,三亿五千五百万对零点八百万,得分八十八点九对八十九点零。最大的 DeBERTa XXL 上,十五亿对四百七十万,九十一点一对九十一点三。也就是说,LoRA 用大约三四百分之一的可训练参数,在三类模型上都做到了持平或略优。
1 lines
MARKDOWN