FaceLLM: A Multimodal Large Language Model for Face Understanding

发布时间:2026/9/29 8:22:57
FaceLLM: A Multimodal Large Language Model for Face Understanding 文章主要内容和创新点主要内容现有多模态大语言模型(MLLMs)多在通用数据集上训练,对人脸图像的特定领域视觉线索(如面部结构、表情、情绪、人口统计学特征等)理解能力有限,且缺乏大规模带标注的人脸图像-文本数据集。为此,论文提出:FairFaceGPT数据集:通过弱监督流水线,利用ChatGPT结合属性感知提示,基于FairFace数据集的元数据(年龄、性别、种族等)生成高质量问答对,涵盖表情、姿态、皮肤纹理、法医信息等多种属性。FaceLLM模型:以InternVL3为基础模型,采用低秩适应(LoRA)技术在FairFaceGPT上微调,专注于人脸理解任务。实验表明,FaceLLM在FaceXBench基准的多项人脸任务(如年龄估计、性别预测、人脸识别、深度伪造检测等)中性能优于现有MLLMs,达到当前最优水平。创新点提出一种新颖的弱监督流水线,通过属性感知提示ChatGPT,利用FairFace数据集的元数据生成人脸图像的高质量问答对。构建FairFaceGPT数据集,包含人脸图像的结构化问答,覆盖面部结构、表情、姿态等多维度属性,为特定领域MLLMs训练提供资源。提出FaceLLM模型,通过在FairFaceGPT上微调InternVL3,显著提升了多模态模型在人脸理解任务上的性能,实现当前最优结果。