
论文地址:https://arxiv.org/pdf/2101.11939.pdf
代码地址:https://github.com/tfzhou/ContrastiveSeg


强判别能力:在该特征空间中,每个像素的特征应具有较强的分类能力(strong categorization ability of individual pixel embeddings);
高度结构化:同类像素的特征应高度紧致(intra-class compactness),不同类像素的特征尽量分散(inter-class dispersion)。
是一张没有标注的训练样本图像 I 的特征向量,
为图像 I 的一个正样本(positive sample)特征,这个正样本往往是对 I 施以某种变换得到的(如 flipping、cropping 操作等),
为一个负样本(negative sample)特征,训练集中其它非 I 的图像均被视为负样本。之后通过对比学习损失函数,如下面的 InfoNCE loss [8] ,进行无监督训练:

表示像素 i 的真实标签,
为的 one-hot 编码。只对每个像素的预测独立地进行约束,而忽略了像素之间的关系 [9] ;
由于使用了 softmax 操作,交叉熵的计算实际只依赖于 logits 之间的相对关系,却无法直接约束习得的像素特征(cannot directly supervise on the learned representations) [10] 。


表示像素 i 的所有正样本像素的特征,
表示像素 i 的所有负样本像素的特征。由上式可以看出,通过像素 - 像素对比学习,研究者直接在语义分割的特征空间上,将同属于一个语义类别的像素拉近,同时迫使不同语义类别的像素互相远离,从而同时强调了交叉熵损失的两个缺点。


对比学习或度量学习依赖于正负样本的质量,更智能的采样策略能够帮助分割网络更快速有效的学习。
从度量学习的角度,交叉熵损失为一元损失函数(unary loss), 而对比损失为二元损失函数(pair-wise loss),探索高阶的度量损失函数有可能带来更大的提升。
对比损失在计算中需要对正负样本采样,有可能借此更自然地实现训练中的类别再均衡(class rebalance)。
本文方案在主流语义分割数据集上取得了有效的性能提升,并且有望在其它图像稠密预测任务中(如 2D 人体姿态估计,医疗图像分割等)发挥优势。
本文网址:




