摘要
本文主要是博主在学习专用模型后训练的笔记。
CPT(Continual Pre-Training)
简单来说,CPT就是在已经训练好的通用模型基础上,通过新的数据,学习新的知识,尤其是特定目标领域的知识。形式是自监督学习(self_supervised learning)。CPT通用的epoch数大概为1-2并不是要多次反复的拟合。此阶段最后导出HF格式模型文件,HF(HuggingFace)是通用的标准模型格式。
核心公式
损失函数通常为:
其中:
输入一个文本,T是文本Token长度是第t个Token的真实值
是概率
为参数
损失函数目的极大化预测正确的概率。
因果注意力机制
模型只能关注当前以及以前的token,不能回看后面的token。
例如:
对于【我-喜欢-吃-苹果】这句话
计算【我】的Attention,只能根据【我】
计算【喜欢】的Attention,可以根据【我】【喜欢】
计算【吃】的Attention,可以根据【我】【喜欢】【吃】
计算【苹果】的Attention,可以根据【我】【喜欢】【吃】【苹果】
现实计算时候,可以借助Causal Mask
注意力机制(Attention Is All You Need)
核心公式:
Attention的作用:
衡量前后文的重要性,以【我-喜欢-吃-苹果】举例。例如,【吃】的attention为【0.1,0.2,0.7,0】就是【我】有0.1的重要,【喜欢】有0.2,【吃】有0.7的重要。
下面是具体计算。
Step1
指的是【我】的向量形式,
指的是【喜欢】的向量形式....
Step2
其中为可学习的NxN矩阵
Step3
计算 Attention Score
Step4
加入 Causal Mask,再进行 Softmax
其中M为因果掩码
Step5
对 V 加权求和:
潜在风险
值得注意的是,CPT之后模型可能会忘记之前的通用知识,训练的时候可以放些通用知识做replay。