LoRA 在推理时需要合并低秩矩阵到原始模型权重中,因此会引入额外的推理延迟。
Adapter Tuning 通过在预训练模型的每一层插入适配器模块,但适配器模块的参数通常比原始层参数少一个数量级以上。
Prefix Tuning 的性能对前缀长度的选择非常敏感,但增加前缀长度一定会提升模型性能。
P-Tuning v2 通过在模型每一层插入可学习的 Prompt tokens,因此其推理速度比仅在输入层插入的 P-Tuning 更慢。
Prompt Tuning 是所有参数高效微调方法中参数量最少的,但需要大规模预训练模型(如 GPT-3)才能达到较好效果。
以下关于 LoRA 的描述中,正确的有?
LoRA 的训练收敛速度通常慢于全模型微调
LoRA 在推理时需要额外存储低秩矩阵
LoRA 可以应用于 Transformer 的自注意力层和前馈网络层
LoRA 通过分解权重矩阵为低秩矩阵来减少可训练参数量
在资源受限的场景下(如移动端),需要微调一个大规模语言模型,且要求无额外推理延迟,以下方法中最合适的是?
LoRA
Prefix Tuning
Adapter Tuning
P-Tuning v2
在微调 BERT 模型进行自然语言推理任务时,若希望最小化内存占用且不引入推理延迟,以下方法组合最合理的是?
使用 P-Tuning v2
使用 LoRA + Prompt Tuning
使用 Adapter Tuning + Prefix Tuning
仅使用 Prompt Tuning
以下关于Prefix Tuning、Adapter Tuning、P-Tuning、Prompt Tuning四种技术的描述,哪一项是错误的?
Prefix Tuning通过在Transformer的每一层输入前添加可训练的前缀向量来引导模型适应下游任务。
Adapter Tuning通过在预训练模型的每一层中插入轻量级的适配器模块,仅更新这些适配器的参数,而冻结原始模型的参数。
P-Tuning通过在输入序列的任意位置插入可学习的提示向量,使模型能够更好地理解下游任务的需求,且这些提示向量通常在输入序列的末端插入。
Prompt Tuning通过在输入序列前添加可学习的提示向量(Prompt Embeddings)来引导模型输出,而无需修改模型参数。