摘要:目的航空遥感可见光与红外(red-green-blue and infrared, RGB-IR)目标检测中,不同模态对检测任务的贡献会随成像条件动态变化。现有方法虽然能在一定程度上利用条件信息调节模态融合,但对与模态可靠性直接相关的质量属性的显式建模仍然不足,难以根据成像条件变化自适应调节不同模态对检测任务的贡献。针对上述问题,提出一种基于模态可靠性建模的航空遥感RGB-IR目标检测方法,通过语义先验蒸馏引导检测网络学习检测导向的模态可靠性表征,并实现可见光与红外模态的自适应融合。方法首先,构建面向无人机场景的模态质量属性描述数据集,对影响检测性能的关键成像因素进行结构化表达。然后,利用视觉语言模型对属性描述文本进行编码,形成与模态可靠性相关的语义先验,并通过训练阶段的蒸馏监督与属性监督,引导检测网络学习检测导向的模态可靠性表征。最后,从场景级全局可靠性和位置级局部空间可靠性两个层面联合建模可见光与红外模态的有效性,实现面向目标检测的动态自适应融合。结果在DroneVehicle和VEDAI两个公开RGB-IR数据集上,所提方法均取得了较优性能。其中,在DroneVehicle上的mAP@0.5和mAP@0.5:0.95分别达到79.7%和53.7%;在VEDAI上分别达到67.1%和29.8%,并在夜间、弱光及复杂干扰场景下表现出更好的检测精度与鲁棒性。消融实验进一步验证了模态质量属性建模、语义先验蒸馏和全局—局部模态可靠性联合建模的有效性。结论所提方法能够以较低开销将视觉语言模型的模态质量感知能力迁移至检测网络内部,在无需测试阶段额外引入大模型分支的条件下,有效建模复杂成像条件下的模态可靠性变化,提升航空遥感红外与可见光目标检测的精度与鲁棒性。
摘要:目的针对欺诈人脸中存在的光照、几何比例、运动模式等方面的全局不一致性,本文通过引入数据驱动的图拓扑信息以增强模型的结构感知能力,借助Transformer的全局自注意力机制弥补图结构在全局信息建模上的局限,提出了一种基于Transformer图表示学习的自适应人脸欺诈检测模型,旨在提升模型捕捉全局空间中不一致欺诈线索的能力。方法该模型通过交替堆叠图神经网络(graph neural network,GNN)与Transformer层构建两者的互补优势,GNN通过屏蔽无关节点,将Transformer 的盲目全局注意力转变为稀疏、低秩、结构敏感;Transformer凭借长距离依赖拓展了GNN的感受野,使消息传递更远、更灵活,它们的交替堆叠使模型具有更强的关系表示能力。鉴于GNN对图拓扑结构的强依赖性,本模型应用动态K近邻稠密算法改进邻居节点的采样方法,利用数据驱动自适应地调整每个节点的连接性(度),提高了模型的结构表示能力。为了提高模型对关键线索的敏感性,使用双重注意力机制对图中的节点和边分别进行加权,对节点的加权可以使模型重点关注携带更多判别信息的图像块,而对边的加权可以突出信息流动的关键途径。这种双重注意力机制模拟了实体及其关系之间的复杂相互作用,使模型能够专注于最突出和最具信息性的特征和联系。为了提高模型抵御新攻击的能力,引入改进的元学习优化策略,通过组合的KL(Kullback-Leibler)散度损失与软目标交叉熵损失函数促使模型快速适应新的攻击类型或新的场合。结果在人脸活体检测的跨数据集实验中,本文方法平均半总错误率(half total error rate,HTER)超过了所有对比算法;在Deepfake检测的域内测试中,Acc达到98.93%与98.44%,而在的交叉评估与跨域实验中,Acc与曲线下面积(area under the curve, AUC)均高于对比模型。结论本文方法能够有效地捕捉并识别出欺诈样本中存在的细微欺诈线索以及全局不一致性现象,该方法在增强模型对不同数据集的泛化能力和对新环境的适应性方面尤为显著,确保了模型在多变的实际应用场景中均能达到较高的识别性能。本文数据集已在ScienceDB存档,访问链接为https://doi.org/10.57760/sciencedb.j00240.00096。
摘要:目的现有卫星云图预测方法在应对云团非线性运动时存在局限:传统方法难以建模复杂动态,深度学习模型则常受计算复杂、感受野有限或时间依赖建模不足的制约。为此,提出融合频域自注意力的卫星云图预测网络CloudPredUNet。方法CloudPredUNet基于UNet架构,编码器引入频域注意力模块,通过对图像块进行傅里叶变换与频域互相关,以较低计算成本实现全局特征聚合;解码器结合多尺度空洞卷积与空间注意力,增强细节重建;时间映射器融合多分支异感受野卷积与通道重标定,以加强长程时空依赖建模。结果在FY-2D数据集上的实验表明,CloudPredUNet在模型效率与预测精度上均领先。CloudPredUNet在参数量(0.101 M)和计算量(5 GFLOPs)远低于主流对比模型的同时,在4项关键评价指标上均取得最优值:MAE(mean absolute error)为8.393、MSE(mean squared error)为188.922、SSIM(structural similarity index measure)为0.825、PSNR(peak signal to noise ratio)为25.367 dB。消融实验验证了各模块的有效性与互补性,完整模型相比基线在MAE上提升约11.63%。多帧预测结果显示,该模型在连续5帧预测中每一帧的MAE均为最低,且在第5帧预测误差(10.589)较次优的MIM模型(10.852)进一步降低约2.4%,显示出更优的抗误差累积能力。可视化对比进一步证实,所提方法在云团生长、合并及台风眼结构保持等复杂场景中,能更完整地维持细节与运动一致性。结论本文工作为气象业务中实时、精准的云图短时预测提供了轻量高效的解决方案。未来将拓展数据集覆盖范围、探索多模态数据融合,并进一步优化频域注意力机制以提升重建质量。
摘要:目的遥感图像定向目标检测在环境监测、城市规划等领域发挥着重要作用,基于二维高斯分布的定向边界框表示方法实现了对旋转交并比(skew intersection over union,SkewIoU)的近似计算,因此受到了广泛关注。但二维高斯分布表示方法中存在角度边界不连续问题,且对不同宽高比目标角度感知不平衡,导致定位不准确。因此,提出了一种联合角度连续表示与感知平衡的检测算法(joint angle continuous representation and perceptual balance,JCPB)。方法首先,提出角度向量分解法(angular vector decomposition method,AVDM),通过在二维空间内将角度参数分解为向量编码,使得角度在边界和非边界位置处均能连续表示。并提出形状感知系数方法,根据目标宽高比动态调整系数值,在不增加编码长度的前提下调节角度损失函数的变化周期。其次,提出角度感知平衡策略(angle perceptual balance strategy,APBS),动态调节损失权重强化模型对小宽高比目标的方向判别能力。最后,基于二维高斯分布表示方法,通过联合角度连续表示和角度感知平衡策略,增强模型对目标方向的学习能力。结果在DOTA(dataset for object detection in aerial images)、DIOR-R(dataset for object detection in aerial images)和HRSC2016(high-resolution ship collections)数据集上进行大量实验测试。结果表明,在DOTA、DIOR-R和HRSC2016数据集上,与基准方法相比,所提方法在平均精度均值(mean average precision,mAP)上平均提升分别为1.46%、1.31%和4.35%,在SkewIoU阈值为0.75时,平均精准率(average precision,AP)平均提升分别为3.31%、2.19%和6.07%,实验结果验证了所提算法的有效性。结论本文算法通过将角度参数分解为连续的向量表示,并平衡模型对不同宽高比目标的感知能力,实现了遥感图像定向目标的高精度检测。