Twitter-15 和 Twitter-17 数据集上的模型训练与测试
对于公开数据集 Twitter-15 和 Twitter-17,按照原始的数据划分比例进行模型的训练和测试。具体数据分布详见 2.4 节相关介绍。
对于文本数据,使用区分大小写的预训练 BERT 模型进行特征提取。该模型由 12 层 Transformer 编码器组成,每层 Transformer 编码器包含 12 个注意力头,隐藏层向量维度为 768,模型总参数量约 1.1 亿。对于图像数据,使用预训练 ViT 模型进行特征提取。该模型由 12 层 Transformer 编码器组成,每层 Transformer 编码器包含 12 个注意力头,隐藏层向量维度为 768,模型总参数量约 0.86 亿。BERT 模型和 ViT 模型的预训练网络参数均源于 HuggingFace。
基于训练集和 mini-batch 进行模型训练。每完成 10 个 mini-batch 数据的训练,就基于完整的验证集进行一次模型验证。如果模型在验证集上的损失值有所下降,就保存当前模型参数。完成模型训练后,在完整的测试集上进行模型测试,获取模型最终的测试结果。模型的训练采用端到端的方式,优化器使用 Adam optimizer,mini-batch 大小为 32,训练 10 个 epoch。BERT 模型的学习率设置为 1e-5,ViT 模型的学习率设置为 1e-4,其他模块的学习率设置为 1e-4。
原文地址: https://www.cveoy.top/t/topic/mIb9 著作权归作者所有。请勿转载和采集!