在野外预测人脸属性具有挑战性,因为存在复杂的人脸变化。我们提出了一种新颖的深度学习框架,用于在野外进行属性预测。它级联了两个 CNN,LNet 和 ANet,它们与属性标签一起进行联合微调,但预训练方式不同。LNet 通过大量通用物体类别进行预训练,用于人脸定位,而 ANet 通过大量人脸身份进行预训练,用于属性预测。该框架不仅以较大优势优于最先进的技术,而且揭示了学习人脸表示的宝贵事实。(1) 它展示了通过不同的预训练策略如何提高人脸定位 (LNet) 和属性预测 (ANet) 的性能。(2) 它揭示了即使 LNet 的滤波器仅使用图像级别的属性标签进行微调,它们在整个图像上的响应图也对人脸位置有很强的指示作用。这个事实使得能够仅使用图像级别的标注训练 LNet 进行人脸定位,而无需人脸边界框或地标,这是所有属性识别工作所必需的。(3) 它还证明了 ANet 的高级隐藏神经元在用大量人脸身份进行预训练后会自动发现语义概念,并且这些概念在用属性标签进行微调后得到显著丰富。每个属性都可以用这些概念的稀疏线性组合来很好地解释。
[
bibtex]
@InProceedings{Liu_2015_ICCV,
author = {Liu, Ziwei and Luo, Ping and Wang, Xiaogang and Tang, Xiaoou},
title = {Deep Learning Face Attributes in the Wild},
booktitle = {Proceedings of the IEEE International Conference on Computer Vision (ICCV)},
month = {December},
year = {2015}
}