摘要:目的电力图像监测主要分为传输与识别过程,传统监测方法未从语义层面考虑将二者进行联合优化,使得传输过程中目标语义信息无法充分提取,进一步导致了图像识别率偏低。针对电力图像受噪声干扰导致监测效率低下问题,提出一种基于语义通信联合优化的端到端电力图像监测方法。方法首先,在语义通信框架下设计轻量化卷积自编码器(convolutional autoencoder,CAE)传输模型,并引入基于通道注意力机制模块,使得模型更关注电力语义特征。其次,以vision transformer(ViT)为主体架构设计ViT识别模型,提出注意力引导的卷积编码模块,使得模型更好的理解电力图像局部语义特征。级联上述模型得到CAE-ViT模型,作为电力图像监测框架,并基于所提框架的参数空间扩展与语义优化方向设计联合训练方法,实现语义通信联合优化的电力图像监测。结果实验采用中国电力线路绝缘子数据集(chinese power line Insulator dataset,CPLID)和电力线路资产巡检数据集(inspection power line asset dataset,InsPLAD)进行验证,与对比方法相比,本文方法在低信噪比(-10dB~10dB)条件下电力图像监测识别率提高了4%~26%,验证了所提方法有效性。结论本文提出的方法在复杂电磁环境无线信道中更具鲁棒性,且进一步提升了电力图像的监测效率,为电力图像监测实际应用部署提供了有益的技术借鉴。
摘要:目的分割一切模型(segment anything model 2, SAM 2)在目标跟踪领域已取得显著进展,其具备强泛化的分割先验以及长时序建模能力,能够目标跟踪提供空间信息支持,缓解背景混淆与遮挡后重现易丢失等跟踪关键难题。然而,SAM 2无法利用高光谱数据中的光谱判别信息,当目标与背景在空间纹理上高度相似等情况时,仅依赖空间语义先验生成的掩码可能出现漂移。因此,针对高光谱目标跟踪中目标与背景分离不充分等问题,提出一种面向高光谱目标跟踪的光谱提示与混合注意力方法。方法以分割一切模型SAM 2为基础构建跟踪框架:在空间维度,利用语义掩码进行像素级目标—背景分离;在时序维度,通过记忆库与记忆注意力建立跨帧长时依赖,增强遮挡重现后的关联与恢复;在光谱维度,提出混合嵌入网络以对齐高光谱数据分布,并引入混合注意力与光谱嵌入模块,将目标光谱信息编码为提示向量、学习波段间深层语义关系。此外,为了促进相关领域研究,构建了首个高光谱空中目标跟踪数据集AHOT。结果在3个数据集上与6种最新方法对比,所提方法在HOTC-2024-RedNIR数据集上DP_20相比第二名提升4.08%,在AHOT数据集上DP_20相比第二名提升15.57%,对比实验结果证明所提算法改善了目标跟踪的性能。此外,本文方法的推理速度达到15.4 FPS,在实现较高精度的同时具有近实时的工程效率。结论通过掩码级目标分离与长时记忆建模,并结合光谱嵌入与注意力融合策略,所提方法显著提升了复杂场景下高光谱目标跟踪的精度与鲁棒性。构建数据集将在科学数据银行公开(31253.11.sciencedb.j00240.00255)。
摘要:目的随着人脸伪造技术的快速发展与广泛传播,由其引发的虚假信息泛滥与身份冒用诈骗等社会问题日益严峻。现有的基于人脸图像重建的伪造检测方法仅进行真实或伪造人脸的单视角重建,未显式放大二者重建前后的差异,导致网络模型的检测准确率和泛化性能提升有限。针对上述问题,提出一种差异化重建驱动的残差引导人脸伪造检测方法,扩大真伪人脸重建前后的差异,显著提升了模型检测性能。方法首先,为了显式放大真伪人脸重建前后的差异,提出一种对比差异化重建网络(Contrastive Differential Reconstruction Network,CDRNet),分别为真实与伪造人脸构建清晰与模糊图像的重建目标,提升整体网络模型对真伪人脸的辨别能力。其次,考虑到现有检测方法对残差图的引导信息利用不充分等问题,设计了残差双域引导模块(Residual Dual-Domain Guidance Module,RDDGM),深度融合图像的空间域与高频域特征,并利用重建残差信息引导融合后的双域特征,增强了网络模型捕捉细微伪造痕迹的能力。此外,为了促使模型学习不同伪造方法之间的通用伪造特征,设计了文本感知损失模块(Text-Aware Loss Module,TALM),通过引入文本模态信息的引导,进一步优化对比差异化重建结果,大幅提升了网络模型对未知伪造方式的泛化性能。结果在域内实验中,与性能最好的对比方法相比,该方法的准确率(accuracy,ACC)与曲线下面积(area under the curve,AUC)指标分别提升2.83%和1.75%。在跨域实验中,该方法在5个公开测试集上与13种典型方法进行性能测试与比较,平均AUC指标提高1.75%。结论本文在人脸伪造检测中创新性结合对比学习与图像差异化重建,显著提升了模型对未知伪造方式的检测准确率,在多个基准测试中性能优于已有方法。
摘要:目的针对视觉显著性预测中长程建模开销较大、复杂背景响应易随全局传播扩散以及解码上采样导致注视热点不够集中的问题,提出一种不确定性门控Mamba建模增强与动态频域调制相结合的显著性预测网络(Spatio-Spectral Uncertainty-Gated Mamba Network ,S²UG-Mamba)。方法在编码端,设计不确定性感知状态空间增强模块(Uncertainty-Aware State Space Enhancement Module,UA-SSM),通过双向蛇形交叉扫描Mamba建模捕获长程上下文信息,并结合空间与通道方差统计进行不确定性估计,生成置信度门控,以抑制不可靠区域响应。在解码端,针对连续上采样引起的预测响应扩散问题,提出语义引导的动态频域调制模块(Semantic-Guided Dynamic Frequency Modulation Module,SDFM),利用深层语义先验对频域调制过程进行动态引导,从而提升注视热点区域的响应集中性。结果在SALICON、MIT300等5个公开数据集上的实验结果表明,所提S²UG-Mamba在多个主流评价指标上均优于现有先进方法。与GSGNet相比,S²UG-Mamba在LSUN'17竞赛上将KL由0.190降低至0.176,降低7.4%,IG达到0.943,提升4.0%;在MIT300盲测中,CC相对提升2.2%,KL降低9.8%;在MIT1003零样本测试中,NSS、CC和SIM分别提升2.2%、2.0%和5.6%,KL降低5.1%。结论所提方法实现了长程上下文建模、背景噪声抑制和显著结构恢复的协同优化,在保持较高计算效率的同时提升了复杂自然场景下显著性预测的分布一致性、跨域泛化能力和鲁棒性。