杂记

希望多年以后,看到之前记录的文章,会有所感触。

0%

情感识别AI大赛

最近一个星期进行了情感识别的AI大赛,比赛内容是进行10分类,指标看宏F1,不允许使用带有情感数据或者任务的预训练模型。最后结果不尽人意,没有取得前三名,看到前面人的方法,更是让我大吃一惊。
先说我的思路,既然是中英文的二分类问题,我是考虑训练一个语种分类的模型进行二分类(这个正确率一般都非常高,超过99%),后续用中文和英文训练集分别训练两个不同的模型,分别在各自的语种上面达到最好的效果,窃以为非常巧妙,实则效果不如其他人,百思不得其解,也尝试了很多模型,hubert wav2vec whisper wavlm等等等,在中文上可以达到很好的效果,但是英文上怎么样也不行,验证集正F1上不去。到了后面,实在没办法,选取了4个模型进行,对于难分类的问题进行了投票,结果0.55+,现在回想起来,或许不应该把中文的数据集冶金学投票,因为中文本身的F1就很高了,失误了。最后结束,问了别人,别人直接whisper+lora微调然后全量微调,就能到0.57以上了,哎,尴尬。
总结下来有两个失误,第一个失误:显卡资源不足。第二个失误:没有事先进行规划,应该先把主流的模型都跑一遍试一下的。第三个失误:最后专家投票时,不应该修改中文数据的标签。
雄关漫道真如铁,而今迈步从头越,靡不有初,鲜克有终。希望这股对生活的热情,和对工作的激情能一直保持下去。

嘿嘿嘿,学校食堂太贵了,我快吃不饱饭了。