最新刊期

    2026 31 9

      大模型在航空领域的智慧赋能

    • 张艳宁, 张磊, 董晶, 王明波, 闫庆森, 丁晨, 曹聪琦, 赵席彬
      2026, 31(9): 3075-3076. DOI: 10.11834/jig.2600009
        
      0
      |
      0
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 171872383 false
      更新时间:2026-09-16
    • 大模型赋能下的航空图像复原技术研究进展 AI导读

      郑萌萌, 郭宸瑞, 张磊, 魏巍
      2026, 31(9): 3077-3096. DOI: 10.11834/jig.260208
      大模型赋能下的航空图像复原技术研究进展
      摘要:航空图像复原作为低层视觉任务的重要研究方向,对于提升遥感监测与空天信息处理的精度具有重要意义。针对航空图像中普遍存在的噪声、模糊、低光及多退化耦合等问题,本文系统综述了近年来图像复原技术的研究进展。首先,从传统方法与深度学习方法两个层面,梳理了典型单一退化复原技术的发展脉络;进一步,围绕统一建模思想,总结了多退化联合建模方法,包括基于多退化建模、提示学习以及动态路由与专家模型的复原框架。在此基础上,重点分析了大模型驱动的图像复原方法,从视觉基础模型、多模态大模型以及基于智能体的复原方法3个方面展开讨论。视觉基础模型通过大规模预训练提供统一特征表示,多模态大模型通过跨模态语义建模提升复杂场景理解能力,而智能体方法则通过引入决策机制实现复原过程的动态优化。同时,本文进一步归纳了现有方法在多退化耦合建模、语义信息利用以及动态自适应机制等方面面临的关键挑战。最后,结合航空图像的应用特点,对未来发展方向进行了展望,包括多源数据构建、统一表征学习、多模态协同建模及智能化复原系统设计等。本文系统梳理了大模型驱动下航空图像复原的方法体系,并归纳出多退化耦合、语义—视觉协同、物理先验融合与动态决策优化等核心问题,可为后续航空图像智能复原研究提供系统性参考与发展思路。本文提及的数据集已汇总至https://github.com/MengmengZheng/Aerial-Image-Restoration-Datasets。  
      关键词:航空图像复原;计算机视觉(CV);提示学习;统一建模;多源协同;智能体   
      75
      |
      165
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 158902588 false
      更新时间:2026-09-16
    • 航空光谱图像智能处理:方法、应用与挑战 AI导读

      赵兴兵, 郭宸瑞, 李羽珊, 张磊, 魏巍
      2026, 31(9): 3097-3119. DOI: 10.11834/jig.260210
      航空光谱图像智能处理:方法、应用与挑战
      摘要:随着无人机与机载遥感技术的快速发展,航空光谱成像在农业、环境监测及军事侦察等领域发挥着越来越重要的作用。相比卫星遥感,航空平台具有更高空间分辨率、更强机动性和更短重访周期,使其成为精细化观测的重要手段。然而,航空光谱数据具有高维、强相关和噪声复杂等特点,传统处理方法难以充分挖掘其潜在信息。本文系统梳理了航空光谱图像智能处理技术的发展脉络,重点分析深度学习与机器学习方法,涵盖光谱—空间特征提取、分类、分割、目标检测、变化检测及光谱解混等关键技术;总结多光谱与高光谱协同处理在精准农业、环境灾害监测、军事侦察以及地质勘探等场景的应用进展;深入剖析当前面临的数据稀缺与标注困难、模型泛化能力不足、实时处理约束、鲁棒性欠缺及空天地协同困难等核心挑战;围绕遥感基础模型、自监督学习、边缘智能、物理信息驱动模型以及空天地一体化协同等方向展望未来趋势。本文可为航空光谱图像智能处理领域的研究与工程应用提供系统性的参考与理论指导。本文提及的数据集已汇总至https://github.com/zhaoxb2025/Airb-spe-Img。  
      关键词:航空光谱图像;高光谱图像;多光谱图像;智能处理;目标检测;变化检测;分类   
      120
      |
      223
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 158902690 false
      更新时间:2026-09-16
    • 航空遥感场景跨域少样本目标检测进展研究 AI导读

      陈布衣, 郭宸瑞, 单淳, 张磊, 魏巍
      2026, 31(9): 3120-3143. DOI: 10.11834/jig.260206
      航空遥感场景跨域少样本目标检测进展研究
      摘要:航空遥感目标检测在国土资源调查、灾害监测、交通监管和军事侦察等领域具有重要应用价值。然而,真实航空遥感场景中常同时存在目标域标注样本稀缺和源域与目标域分布差异显著的问题,导致传统依赖大规模同分布标注数据的检测方法难以获得稳定性能。跨域少样本目标检测(cross-domain few-shot object detection,CD-FSOD)期望在目标域仅有少量标注样本且存在明显域偏移的条件下实现对目标域目标的有效分类与定位,已成为航空遥感智能解译中的重要研究方向。本文围绕航空遥感场景下的CD-FSOD问题,梳理其基本定义、任务边界及其与少样本目标检测、跨域目标检测和遥感目标检测等相关任务的区别,并分析航空遥感场景中由成像平台、传感器类型、空间分辨率、地理区域、环境条件及目标分布差异所引起的复杂域偏移表现。在此基础上,对现有代表性方法进行分类综述,重点总结基于迁移与域对齐、基于元学习与度量学习、基于生成式数据增强与扩充、基于视觉语言对齐以及基于大模型的方法特点与研究进展。同时,归纳相关数据集、任务设置、常用评测指标及航空遥感目标检测的特殊性,并进一步讨论复杂域偏移统一建模、少样本条件下检测稳定性、数据集与真实应用脱节、多源异构数据适配以及大模型迁移等方面的主要问题与发展趋势。总体来看,CD-FSOD正由单一迁移或少样本学习策略,逐步发展为融合域适应、特征增强、语义建模和基础模型迁移的综合性研究方向。随着遥感专用数据资源的丰富和多模态基础模型的发展,该方向有望为航空遥感智能感知提供更高效、更稳健的技术支撑。本文同步汇总代表性算法在航空遥感跨域少样本情境下的性能表现,并给出所涉及数据集、算法的开放资源访问链接:https://github.com/Farenweh/CD-FSOD-Links(Github)或https://gitee.com/cby1241385936/cd-fsod-links(Gitee)。  
      关键词:航空遥感;目标检测;跨域少样本目标检测(CD-FSOD);视觉语言对齐;大模型   
      120
      |
      202
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 158902731 false
      更新时间:2026-09-16
    • 多模态信息融合研究进展 AI导读

      胡玉梅, 王晓华, 邓豹, 赵洋洋, 赵艺阳
      2026, 31(9): 3144-3155. DOI: 10.11834/jig.260236
      多模态信息融合研究进展
      摘要:随着传感器网络、信息感知方式及大数据处理技术的飞速发展,面对来自于不同类型、不同特性和不同感知方式的信息,及其呈现出的多域、多模态、模糊化以及数据关联不完备特点,多模态信息融合技术以其类人式自动感知与强大的综合推理能力的优势受到越来越多的关注。本文首先介绍了多模态信息融合的意义和必要性,进而,在融合架构层面梳理了从早期融合、晚期融合到混合融合的演进脉络,揭示了各架构在信息保留与计算效率间的权衡关系。同时,详细阐述了基于注意力的交互建模、基于对比学习的语义对齐以及以大语言模型为载体的生成式融合3种前沿多模态融合方式。继而,介绍了COCO (common objects in context)、LAION-400M(large-scale artificial intelligence open network-400M)、Visual Genome、MS COCO Captions、Conceptual Captions、Flickr30k数据集和航空相关数据集等典型多模态数据集及相应应用领域。并且,进一步探讨了多模态融合在包括战场态势感知、多源情报分析与无人系统协同的典型军事领域应用。此外,指出随着对比学习和多模态预训练的成熟,高质量的单模态表示已不再是瓶颈,研究焦点由早期如何将异质模态映射到统一空间,转向于如何在表示对齐的基础上设计能够捕捉模态间复杂、动态,甚至矛盾关系的交互机制,并基于融合架构、融合模型和计算成本给出多模态信息融合的3个发展方向。  
      关键词:多模态信息融合;多模态大语言模型;注意力机制;对比学习;生成式融合   
      180
      |
      196
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 158467709 false
      更新时间:2026-09-16
    • 开放词汇语义分割研究进展 AI导读

      刘明怡, 谢国森, 舒祥波, 张磊
      2026, 31(9): 3156-3168. DOI: 10.11834/jig.260205
      开放词汇语义分割研究进展
      摘要:开放词汇语义分割旨在突破传统闭集语义分割对固定类别集合的依赖,使模型能够根据开放类别文本描述实现任意语义目标的像素级识别与分割。以CLIP(contrastive language-image pre-training)为代表的视觉—语言预训练模型虽然为开放类别理解提供了重要支撑,但其侧重于图像级语义对齐,难以满足像素级密集预测对精确定位与细粒度表达的需求。因此,如何实现图像级开放识别能力向像素级精细分割的有效迁移,仍是该领域面临的关键问题。本文对开放词汇语义分割的研究进展进行系统梳理与分析。首先,介绍该任务的研究背景与技术基础,并梳理其与传统语义分割、零样本语义分割之间的演进关系;其次,围绕零样本语义分割、图文监督早期探索、双阶段方法和单阶段方法等主要研究路线,归纳代表性方法的基本思想、技术特点与局限性,并进一步讨论其在遥感图像场景中的拓展应用;再次,总结常用数据集与评价指标,分析现有评测体系的特点与不足;最后,结合当前研究瓶颈,对该领域未来发展方向与研究趋势进行展望。本文可为开放词汇语义分割领域的研究脉络梳理、方法体系比较及后续研究探索提供参考。  
      关键词:开放词汇语义分割(OVSS);视觉—语言预训练;CLIP;跨类别泛化;开放世界视觉理解   
      177
      |
      151
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 157795001 false
      更新时间:2026-09-16
    • 面向无人机的多模态视觉理解大模型研究进展 AI导读

      余雅婷, 曹聪琦, 王昭颖, 张艳宁
      2026, 31(9): 3169-3197. DOI: 10.11834/jig.260215
      面向无人机的多模态视觉理解大模型研究进展
      摘要:随着低空经济和智能无人系统的发展,无人机逐渐从传统的遥控飞行平台演化为集环境感知、语义理解与自主决策于一体的空中智能体。以视觉基础模型、视觉语言模型和多模态大模型为代表的视觉理解大模型,为无人机在复杂开放环境中的感知、理解与决策提供了新的技术范式。围绕无人机视觉理解能力的演进逻辑,本文构建了基础感知—语义推理—决策规划的3层能力分析框架,并以此为主线系统梳理无人机场景视觉理解大模型的研究进展。在任务层面,依据该能力框架构建无人机视觉理解任务体系,归纳了基础目标感知、事件语义分析、空间环境理解与飞行决策规划等典型任务,并分析航拍视觉在尺度变化、远距离观测与复杂动态环境中的关键挑战;在技术层面,沿着同一能力演进逻辑,系统回顾视觉理解方法从传统深度学习算法与视觉基础模型的感知建模,发展到大语言模型与多模态大模型的语义推理与跨模态交互,再到具身视觉—语言—行动模型的智能决策与任务规划的技术演进路径。在此基础上,重点综述视觉理解大模型在无人机视觉感知增强、视觉语义推理以及视觉决策规划3个核心能力维度的研究进展,并分析其在开放词汇感知、跨模态推理、复杂空间关系理解与具身智能决策等方面带来的关键能力提升。同时,对当前无人机视觉理解领域的主流数据集与评测基准进行了系统总结,并分析当前评测体系正由传统任务导向逐步向能力导向评估范式演进。最后,针对无人机平台资源受限、实时推理需求以及系统安全可靠性等问题,对视觉理解大模型在无人机领域未来的发展方向进行了展望。  
      关键词:多模态大模型(MLLM);视觉基础模型(VFM);无人机(UAV);视觉理解;智能决策;综述   
      208
      |
      122
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 157321805 false
      更新时间:2026-09-16
    • 具身智能视角下无人机视觉语言导航研究进展 AI导读

      郑周一, 郭宸瑞, 单淳, 张磊, 魏巍
      2026, 31(9): 3198-3226. DOI: 10.11834/jig.260203
      具身智能视角下无人机视觉语言导航研究进展
      摘要:无人机视觉语言导航(aerial vision-language navigation,AVLN)是融合计算机视觉、自然语言处理与无人机控制的空中具身智能前沿方向,旨在使无人机依据自然语言指令在非结构化三维环境中实现自主导航。针对传统导航难以理解高层语义、无法适应复杂空间约束的局限,本文系统地梳理了无人机视觉语言导航的研究脉络与技术体系。首先归纳通用仿真、真实场景重建和虚拟场景建模3类仿真平台的特点,对比主流数据集在场景复杂度、指令语义与动作表征上的差异;其次从感知表征、推理范式、记忆存储和具身控制4个核心模块,剖析跨模态对齐、大模型推理、长程记忆与连续控制的关键技术;最后总结该技术在城市巡检、灾害救援、智能物流与精准农业中的落地应用,指出仿真到现实迁移、多机协同和长程鲁棒性等挑战。本文全面地呈现了领域研究现状,为空中具身智能的进一步发展提供参考。  
      关键词:无人机(UAV);视觉语言导航;具身智能;跨模态对齐;大模型   
      180
      |
      257
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 158901857 false
      更新时间:2026-09-16
    • 人工智能辅助的单机长飞行驾驶技术综述 AI导读

      袁林, 李阳, 苗延飞, 李枭扬, 曹聪琦
      2026, 31(9): 3227-3250. DOI: 10.11834/jig.260216
      人工智能辅助的单机长飞行驾驶技术综述
      摘要:随着全球航空运输需求持续增长,单机长体制(single-pilot operation,SPO)成为民航领域应对飞行员短缺与人力成本攀升的核心发展方向。然而,从双人机组向单人驾驶的转变,核心瓶颈在于如何填补缺失副驾驶后产生的认知与决策空缺。“AI(artificial intelligence)副驾驶”概念的提出,旨在通过具备深度感知、语义理解与自主决策能力的智能系统,与人类飞行员构建认知型协作关系。本文系统梳理了人工智能辅助飞行驾驶的关键技术,构建了“感知—认知—推理—交互决策—安全监控”的系统分析框架。重点阐述了基于脑电图(electroencephalogram,EEG)、功能性近红外光谱(functional near-infrared spectroscopy,fNIRS)以及计算机视觉的多模态生理行为感知技术,分析了其在实时监测飞行员负荷与疲劳状态方面的最新进展。同时,针对复杂的陆空通话环境,探讨了基于大模型架构的空管指令意图识别与语义提取技术。此外,本文还归纳了大模型与深度强化学习协同驱动的智能航路规划与冲突解算方法,并深入剖析了当前阻碍AI技术商业化落地的核心壁垒,包括深度学习模型的不可解释性、人机信任机制的缺失以及非确定性智能系统的适航认证困境。最后,本文指出大模型驱动的多模态统一架构与运行时保障适航路径是未来航空人工智能发展的关键方向,旨在为实现高透明度、深层人机协同的智能驾驶舱提供参考。  
      关键词:人工智能(AI);AI副驾驶;飞行员状态感知;智能语音交互;深度强化学习(DRL)   
      144
      |
      80
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 157321179 false
      更新时间:2026-09-16
    • 大模型赋能航空遥感智能解译的进展与思考 AI导读

      郎晋伟, 李娅星, 刘帅, 康晓东, 程俊强
      2026, 31(9): 3251-3265. DOI: 10.11834/jig.260217
      大模型赋能航空遥感智能解译的进展与思考
      摘要:随着航空遥感多源传感器的发展及多模态数据融合与智能解译技术的推进,航空遥感技术正经历从单一模态到多模态的深刻变革。这一进展为精准农业、城市环境监测、生态保护及自然灾害评估等领域的智能化监测与决策提供了重要的应用前景。传统的遥感影像解译方法主要依赖单源传感器数据和单任务学习模型,难以应对地表地物目标尺度多变、语义层次丰富、时空异质性强的复杂场景。近年来,多模态大模型的快速发展推动了遥感技术的显著进步,尤其在视觉—语言融合、跨模态推理,以及基于任务指令的跨模态分析与生成等方面取得了重要成果。然而,如何有效处理多源异构数据、提升模型的可解释性,同时保证实时推理能力,仍是当前面临的核心挑战。针对上述问题,对近年来航空遥感领域多模态数据融合及大模型技术的研究进展进行了系统评述,并深入分析了关键技术瓶颈与未来发展方向。研究重点包括跨传感器、多源及多尺度数据融合、空间语义推理、模型的可信推理与可解释性评估,以及在边缘计算环境下的高效部署与数据隐私保护策略。这些问题不仅是推动航空遥感智能解译技术从理论研究向实际应用转化的关键所在,也是实现技术落地并确保可持续发展的现实挑战。  
      关键词:航空遥感;多模态融合;视觉—语言模型(VLM);大模型;语义理解   
      142
      |
      140
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 158467733 false
      更新时间:2026-09-16
    • 时间差引导的高光谱图像变化检测网络 AI导读

      丁晨, 张景博, 郝小锋, 郑思睿, 闫松
      2026, 31(9): 3266-3277. DOI: 10.11834/jig.260214
      时间差引导的高光谱图像变化检测网络
      摘要:目的高光谱图像变化检测在环境监测、土地利用分析及灾害评估等领域具有重要应用价值。然而,现有深度学习方法多在高层或决策阶段进行特征比较,难以充分利用多层级时间差异信息,导致细微变化难以准确捕获,限制检测精度。针对上述问题,本文提出时间差引导网络(time-difference-guided network, TDG-Net)。方法以Vision Mamba为主干构建孪生架构,设计时间存储器模块(time storage module,TSM),基于简化长短期记忆网络(simplified long short-term memory,sLSTM)对双时相高光谱图像多层特征进行时序建模,提取显式时间差特征;进一步通过时域差引导策略将时间差信息转化为空间注意力权重,并以残差方式反馈至多层特征提取网络,实现对变化区域的强化与未变化区域的抑制。同时引入Dice损失函数缓解类别不平衡问题。与近年Mamba-based方法相比,本文核心区别在于通过轻量LSTM在多层级显式建模并引导时间差,而非仅在高层隐式融合。结果在River、Farmland和Hermiston数据集上,所提方法在总体精度(overall accuracy,OA)和Kappa系数上均优于CVA(change vector analysis)及自监督高光谱空间—光谱特征方法。其中,在River数据集上OA为96.54%、Kappa为78.51%;在Farmland数据集上分别为95.87%、90.11%;在Hermiston数据集上分别为98.21%、91.79%。消融实验表明TSM与时域差引导策略均带来性能的显著提升。结论本文通过显式多层级时间差建模与层次化引导,有效提升高光谱变化检测精度与鲁棒性,在复杂场景下具备良好泛化能力。  
      关键词:高光谱图像(HSI);变化检测(CD);Vision Mamba;时间差建模;深度学习;遥感   
      142
      |
      132
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 157795219 false
      更新时间:2026-09-16
    • 大模型语义增强的多时相多模态遥感影像匹配方法 AI导读

      张旺, 陈涛, 裴根生, 李宝晨, 韦明韬, 姚亚洲
      2026, 31(9): 3278-3292. DOI: 10.11834/jig.260202
      大模型语义增强的多时相多模态遥感影像匹配方法
      摘要:目的针对多时相、多模态遥感影像在显著光谱差异、复杂季节变化及重复纹理条件下匹配稳定性不足的问题,构建统一评测基准并提升跨模态遥感影像匹配精度。方法基于 SeCo(seasonal contrast remote sensing)数据集构建了包含15 000对可见光与近红外跨时相样本的遥感影像匹配基准,其中训练集12 000对、测试集3 000对。通过组织多时相多模态影像对并引入随机单应变换,形成统一数据划分与评价协议;基于此,提出一种基于视觉大模型语义增强的跨模态特征匹配方法,以 XoFTR(cross-modal feature matching Transformer)为基础匹配主干,在粗匹配阶段引入冻结的 DINOv3(self-distillation with NO labels v3)提取高层稠密语义特征,并设计语义提升模块,实现语义先验与几何特征的协同建模,从而增强模型对跨时相、多模态稳定区域的感知与表征能力。结果实验结果表明,所提方法在严格阈值MHA(mean homography accuracy)@3 和中等阈值MHA@5下分别达到33.03%和37.03%,优于各对比方法;在较宽松阈值MHA@7下达到39.17%,略低于SP+SG(SuperPoint+SuperGlue)的 42.34%,但明显优于原始 XoFTR和直接域内微调模型;定性实验结果表明,本文方法能够有效抑制跨区域误匹配,并获得更密集、更稳定的正确对应关系。结论视觉大模型提供的高层语义先验能够有效缓解多时相多模态遥感影像间的表征差异,为大模型赋能航空遥感高精度匹配提供了一种轻量、可复现的语义注入路径。本文公开代码地址:https://github.com/heng-shan/Dino_ft。  
      关键词:遥感多时相;多模态图像匹配;视觉基础模型;语义增强;XoFTR;DINO   
      95
      |
      177
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 158901925 false
      更新时间:2026-09-16
    • 双时相特征增强引导的多关系差异耦合遥感变化字幕生成 AI导读

      于洁潇, 付雨杰, 刘婧
      2026, 31(9): 3293-3307. DOI: 10.11834/jig.260171
      双时相特征增强引导的多关系差异耦合遥感变化字幕生成
      摘要:目的针对遥感变化字幕(remote sensing change captioning,RSCC)生成任务中关键变化区域表征不足、双时相差异关系建模不充分以及模型复杂度较高等问题,提出一种双时相特征增强引导的多关系差异耦合遥感变化字幕生成方法。方法采用基于ResNet-50(residual network)的RemoteCLIP(remote sensing constrastive language-image pre-training),即RemoteCLIP-RN50,提取双时相遥感影像深层语义特征,在此基础上,通过双时相特征增强策略对关键变化区域和重要语义通道进行自适应强化;随后构建多关系差异耦合框架,对双时相原始特征、绝对差异、乘积交互和相似性信息进行关系建模,以增强变化语义表达能力,最后利用文本解码器实现变化描述语句生成。结果在LEVIR-CC数据集的实验结果表明,所提方法的双语评估替补指标BLEU-1为83.62%,BLEU-4为60.22%,基于最长公共子序列的面向召回摘要评估指标ROUGE-L(recall-oriented understudy for gisting evaluation-longest common subsequence)为64.94%,基于共识的图像描述评估指标CIDEr(consensus-based image description evaluation)为128.58%。其中BLEU-1和CIDEr优于对比方法;同时,本文方法参数量为41.50 M,低于多种经典及近年代表方法,体现出较好的性能—复杂度平衡。在DUBAI-CC数据集的补充实验中,本文方法取得的BLEU-1为63.75%、BLEU-4为34.14%、ROUGE-L为56.62%、CIDEr为90.09%,其中BLEU-4、ROUGE-L和CIDEr均取得最优结果,说明所提方法具有一定跨数据集适用性。消融实验表明,双时相特征增强策略和多关系差异耦合单元均能有效提升变化描述性能;进一步的关系项协同实验表明,在双时相特征增强后,完整多关系耦合在BLEU-1、ROUGE-L和CIDEr上取得最佳效果,说明特征增强有助于提升不同差异关系信息之间的互补表达能力。结论本文方法围绕双时相变化表征过程开展针对性设计,在保持模型结构相对简洁的前提下有效提升了遥感变化字幕生成性能,并在不同数据集上表现出较好的适用性。  
      关键词:遥感变化字幕(RSCC);双时相遥感影像;特征增强;多关系差异耦合;变化描述   
      81
      |
      82
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 157794881 false
      更新时间:2026-09-16
    • 模态可靠性建模的航空遥感可见光—红外目标检测 AI导读

      余东, 张淳杰, 张晓宇, 郑晓龙
      2026, 31(9): 3308-3320. DOI: 10.11834/jig.260197
      模态可靠性建模的航空遥感可见光—红外目标检测
      摘要:目的航空遥感可见光与红外(red-green-blue and infrared, RGB-IR)目标检测中,不同模态对检测任务的贡献会随成像条件动态变化。现有方法虽然能在一定程度上利用条件信息调节模态融合,但对与模态可靠性直接相关的质量属性的显式建模仍然不足,难以根据成像条件变化自适应调节不同模态对检测任务的贡献。针对上述问题,提出一种基于模态可靠性建模的航空遥感RGB-IR目标检测方法,通过语义先验蒸馏引导检测网络学习检测导向的模态可靠性表征,并实现可见光与红外模态的自适应融合。方法首先,构建面向无人机场景的模态质量属性描述数据集,对影响检测性能的关键成像因素进行结构化表达。然后,利用视觉语言模型对属性描述文本进行编码,形成与模态可靠性相关的语义先验,并通过训练阶段的蒸馏监督与属性监督,引导检测网络学习检测导向的模态可靠性表征。最后,从场景级全局可靠性和位置级局部空间可靠性两个层面联合建模可见光与红外模态的有效性,实现面向目标检测的动态自适应融合。结果在DroneVehicle和VEDAI两个公开RGB-IR数据集上,所提方法均取得了较优性能。其中,在DroneVehicle上的mAP@0.5和mAP@0.5:0.95分别达到79.7%和53.7%;在VEDAI上分别达到67.1%和29.8%,并在夜间、弱光及复杂干扰场景下表现出更好的检测精度与鲁棒性。消融实验进一步验证了模态质量属性建模、语义先验蒸馏和全局—局部模态可靠性联合建模的有效性。结论所提方法能够以较低开销将视觉语言模型的模态质量感知能力迁移至检测网络内部,在无需测试阶段额外引入大模型分支的条件下,有效建模复杂成像条件下的模态可靠性变化,提升航空遥感红外与可见光目标检测的精度与鲁棒性。  
      关键词:航空遥感;RGB-IR目标检测;视觉语言模型;模态可靠性;语义先验蒸馏;自适应融合   
      149
      |
      159
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 157795179 false
      更新时间:2026-09-16

      数据集

    • 红外视频卫星空中动目标检测数据集及其评估 AI导读

      李若敬, 李朝旭, 陈诺, 郭高伟, 窦泽超, 龙政兴, 罗伊杭, 曾瑶源, 盛卫东, 李博扬, 李志军, 李淼, 安玮, 龙云利, 李海鑫, 余志强, 尹小宇, 查旭阳, 曾柏文, 王吴凡, 张波, 路悦, 褚东皓, 李子怡, 黄康薇, 杨博睿, 邢颖慧, 张世周
      2026, 31(9): 3321-3335. DOI: 10.11834/jig.250536
      红外视频卫星空中动目标检测数据集及其评估
      摘要:目的红外视频卫星是探测空中动目标的重要手段,红外小目标检测技术是其关键基础。深度学习显著推动了单帧红外小目标检测,然而卫星红外视频中的空中动目标普遍空域显著性低、场景复杂,单帧方法难以有效检测,因此亟需发展融合时域信息的红外极弱小目标检测技术。但该领域长期缺乏视频数据集,严重制约了相关技术的发展与应用。为突破此瓶颈,该文构建了首个包含大量真实场景的红外视频卫星空中动目标检测数据集。方法基于武汉一号卫星采集20 126帧真实红外视频卫星动目标数据,设计两阶段“由粗到精”的标注方法,完成29 757个空中动目标的精标注。为了丰富场景多样性,进一步融合两个真实天基背景下的仿真动目标数据,构建包含1 401个真实场景、122 265帧视频图像、454 116个目标的红外视频卫星空中动目标检测数据集。数据集提供实例级掩码标签,支持空中动目标检测与跟踪技术研究,并提出了相关评价指标。结果数据分析表明,该数据集中真实目标的平均信噪比仅为3.06,超过80%的目标信噪比低于2,且实测场景中的目标与背景存在丰富的动态变化与相互干扰,呈现难以模拟的复杂性。结论基于该数据集开展了首届红外视频卫星空中动目标检测比赛,充分验证了该数据集的高挑战性与实际价值,对于红外极弱小目标检测技术研究具有重要支持作用。数据集获取链接:https://github.com/TinaLRJ/DeepPro和科学数据银行ScienceDB:https://doi.org/10.57760/sciencedb.j00240.00077。  
      关键词:红外视频卫星;空中动目标检测;空中动目标跟踪;视频数据集;深度学习   
      1
      |
      0
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 171871630 false
      更新时间:2026-09-16

      图像处理和编码

    • 光照引导反射分量估计的零监督弱光图像增强 AI导读

      包晓安, 陈奕江, 张娜, 胡天缤, 许铭洋, 涂小妹
      2026, 31(9): 3336-3351. DOI: 10.11834/jig.250486
      光照引导反射分量估计的零监督弱光图像增强
      摘要:目的弱光环境下成像质量下降严重制约视觉监控、自动驾驶等高级视觉任务的性能。现有方法虽然可提升亮度,但普遍存在过曝抑制不足且依赖成对正常光照数据的问题,限制了其在真实场景中的应用。方法针对这些局限,提出一种基于光照引导反射分量估计的零监督弱光图像增强方法。首先,通过可逆亮度扰动合成训练样本,设计伪曝光生成策略,在不改变图像固有反射率的情况下,生成多种光照样本以摆脱成对监督数据的依赖;其次,设计双域协同注意力去噪模块以抑制背景噪声;然后,利用多层残差卷积与结构对称的U-Net架构协同生成照明图,并利用其深层光照信息对反射分量进行显式引导;最后,通过引导式反射估计实现结构纹理的高保真重建与过曝抑制。结果在LOL、DICM和WildNight-8K数据集上与9种代表性的最新方法进行对比分析。在LOL数据集上,相比Retinexformer和LightenDiffusion,本文方法的自然图像质量评估指标(natural image quality evaluator,NIQE)分别降低0.62和0.92,感知指数(perceptual index,PI)分别降低1.23和0.25;在DICM数据集上,相比Retinexformer和RUAS(retinex-inspired unrolling with architecture search),本文方法的NIQE分别降低0.11和0.81,PI分别降低0.48和0.72;在WildNight-8K数据集上,相比Retinexformer和EnlightenGAN,本文方法的NIQE分别降低1.32和1.87,PI分别降低0.33和5.98。在YOLOv8目标检测任务中,平均检测精度(mean average precision,mAP@50-95)较原图提升4.60%。结论本文提出的基于光照引导反射分量估计的零监督弱光图像增强方法在多个数据集上取得了领先的客观指标,并能够有效提升下游目标检测任务性能,验证了其在真实弱光应用场景中的价值。  
      关键词:弱光图像增强;注意力机制;零监督;目标检测;卷积神经网络   
      222
      |
      501
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 151295597 false
      更新时间:2026-09-16
    • 李文改, 桂柯, 肖照林, 金海燕, 苏浩楠
      2026, 31(9): 3352-3367. DOI: 10.11834/jig.250342
      频域特征优化与截断采样的条件扩散模型弱光图像增强方法
      摘要:目的现有基于扩散模型的弱光图像增强方法存在计算成本高、高频特征畸变以及色彩偏移等问题,限制了其在实际场景中的应用效果。为此,提出一种频域特征优化与截断采样的条件扩散模型弱光图像增强方法(low-light image enhancement with diagonal frequency feature refinement and truncated sampling in conditional diffusion models)。方法该方法首先在小波低频子空间中实施扩散建模,有效降低了空间维度和计算复杂度,同时保留图像的主体结构与光照分布特征。针对高频子带中对角线方向信息较弱的问题,本文设计高频细化模块,利用水平方向与垂直方向的高频特征作为引导,通过双路径交叉注意力机制实现对角线高频纹理的补全,从而提升局部细节与纹理的清晰度。此外,提出一种高效的条件采样策略,采用特定步数截断技术,大幅减少了推理时间,同时保持增强结果的质量。为进一步提高对比度与色彩还原表现,在反向去噪过程中使用上一步采样的色彩与对比度信息调制当前采样步特征,从而实现对增强图像的对比度校正。结果在LOLv1(low-light image enhancement dataset version 1)、LOLv2-Real和VE-LOL(vision enhancement in low-light conditions)3个配对数据集上,本文方法在定性与定量评估上均优于现有主流方法。在LOLv2-Real数据集上,峰值信噪比(peak signal-to-noise ratio,PSNR)和结构相似性(structural similarity index,SSIM)分别提升8.46%、1.22%,LPIPS(learned perceptual image patch similarity)和NIQE(naturalness image quality evaluator)分别下降10.19%、0.38%。在4个非配对数据集上亦展现良好的跨域泛化性能,相较于基于空域扩散建模的PyDiff(pyramid diffusion models for low-light image enhancement)方法,单幅图像的推理时间由7.617 s减少至0.473 s,显存占用降低48.53%。结论大量定量及定性的实验结果表明,本文方法在提升图像亮度、细节和色彩保真的同时降低了推理开销,展现出良好的实用性与应用前景。代码已共享在Gitee上:https://gitee.com/cv_llie/llie_diff。  
      关键词:弱光图像增强(LLIE);扩散模型;小波包变换(WPT);截断采样策略;频域建模   
      303
      |
      658
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 149620373 false
      更新时间:2026-09-16

      图像理解和计算机视觉

    • Transformer图表示学习驱动的自适应人脸欺诈检测模型 AI导读

      蔡体健, 黄远轩, 王振宇, 胡成, 易晟权, 谢昕
      2026, 31(9): 3368-3381. DOI: 10.11834/jig.250373
      Transformer图表示学习驱动的自适应人脸欺诈检测模型
      摘要:目的针对欺诈人脸中存在的光照、几何比例、运动模式等方面的全局不一致性,本文通过引入数据驱动的图拓扑信息以增强模型的结构感知能力,借助Transformer的全局自注意力机制弥补图结构在全局信息建模上的局限,提出了一种基于Transformer图表示学习的自适应人脸欺诈检测模型,旨在提升模型捕捉全局空间中不一致欺诈线索的能力。方法该模型通过交替堆叠图神经网络(graph neural network,GNN)与Transformer层构建两者的互补优势,GNN通过屏蔽无关节点,将Transformer 的盲目全局注意力转变为稀疏、低秩、结构敏感;Transformer凭借长距离依赖拓展了GNN的感受野,使消息传递更远、更灵活,它们的交替堆叠使模型具有更强的关系表示能力。鉴于GNN对图拓扑结构的强依赖性,本模型应用动态K近邻稠密算法改进邻居节点的采样方法,利用数据驱动自适应地调整每个节点的连接性(度),提高了模型的结构表示能力。为了提高模型对关键线索的敏感性,使用双重注意力机制对图中的节点和边分别进行加权,对节点的加权可以使模型重点关注携带更多判别信息的图像块,而对边的加权可以突出信息流动的关键途径。这种双重注意力机制模拟了实体及其关系之间的复杂相互作用,使模型能够专注于最突出和最具信息性的特征和联系。为了提高模型抵御新攻击的能力,引入改进的元学习优化策略,通过组合的KL(Kullback-Leibler)散度损失与软目标交叉熵损失函数促使模型快速适应新的攻击类型或新的场合。结果在人脸活体检测的跨数据集实验中,本文方法平均半总错误率(half total error rate,HTER)超过了所有对比算法;在Deepfake检测的域内测试中,Acc达到98.93%与98.44%,而在的交叉评估与跨域实验中,Acc与曲线下面积(area under the curve, AUC)均高于对比模型。结论本文方法能够有效地捕捉并识别出欺诈样本中存在的细微欺诈线索以及全局不一致性现象,该方法在增强模型对不同数据集的泛化能力和对新环境的适应性方面尤为显著,确保了模型在多变的实际应用场景中均能达到较高的识别性能。本文数据集已在ScienceDB存档,访问链接为https://doi.org/10.57760/sciencedb.j00240.00096。  
      关键词:人脸欺诈检测;图神经网络(GNN);Transformer;元学习优化;动态K近邻稠密算法;全局不一致性   
      262
      |
      579
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 149622410 false
      更新时间:2026-09-16
    • 记忆机制显式引导的说话人自适应唇语识别 AI导读

      骆嵩涛, 王天月, 杨双, 倪群平, 山世光
      2026, 31(9): 3382-3396. DOI: 10.11834/jig.250392
      记忆机制显式引导的说话人自适应唇语识别
      摘要:目的唇语识别中说话人自适应方法通常依赖目标说话人的带标注数据进行微调,但在实际场景中常面临适应数据缺失的问题,为此提出一种基于记忆机制显式引导的说话人自适应方法,旨在不依赖适应数据以提升模型在跨说话人条件下的唇语识别能力。方法通过显式构建静态视觉模式与动态视觉说话模式记忆库,记录训练阶段已见过的说话人的代表性特征,使模型在面对未见说话人时,通过与记忆库中的特征进行匹配与组合,生成具有个体区分性的表示,以达到说话人自适应的唇语识别。推理过程中,该记忆库将以提示形式嵌入到识别模型的注意力机制中,从而显式引导模型在编码阶段对输入的说话人特征进行自适应建模。结果为了验证该方法对说话人自适应唇语识别的效果,基于大规模公开数据集LRS2(lip reading sentences 2)构造了一个新数据集LRS2-ID,通过按照说话人标签重新划分,确保测试集中的说话人未在训练集中出现过,从而更贴近真实应用中“零样本适应”的说话人泛化场景。在该挑战数据集上的跨说话人识别任务的实验结果,验证了方法的有效性与泛化能力。结果表明,在完全无适应数据的条件下,本文方法显著提升了模型对未见过的说话人的识别性能,且在个体差异显著或外观变化复杂的场景中亦表现出了良好的稳定性和普适性。结论本文为提升唇语识别系统的跨个体泛化能力提供了有效思路和实践路径,解决了无适应数据情况下唇语识别中说话人的自适应问题。  
      关键词:唇语识别;说话人自适应;提示学习;记忆机制;静态视觉模式(SVP);动态视觉说话模式(DVP)   
      280
      |
      697
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 149622450 false
      更新时间:2026-09-16

      计算机图形学

    • 边缘簇驱动的高斯泼溅稀疏视图重建细节增强 AI导读

      马栋林, 惠旭同, 赵宏
      2026, 31(9): 3397-3411. DOI: 10.11834/jig.250538
      边缘簇驱动的高斯泼溅稀疏视图重建细节增强
      摘要:目的稀疏视图下的新视角合成是三维视觉领域的关键挑战。现有方法多依赖复杂外部先验弥补信息缺失,在场景边缘等细节区域重建质量不佳。本文旨在探索一条不依赖外部先验、从表征内部结构入手的优化路径,提出一种边缘簇驱动的三维高斯泼溅方法,以实现稀疏输入下边缘细节增强的高质量视图合成。方法本研究核心在于构建一个“识别—增强—约束”的内生优化框架。首先,引入聚类分析,将离散三维高斯点组织为语义簇,并提出多准则融合的边缘簇识别算法,综合评估簇中心梯度、平均梯度幅值、簇空间规模及簇间邻近度,精准定位表征边缘结构的关键簇。其次,设计局部邻近引导的高斯解池策略,在识别出的边缘簇内部依据局部邻近图智能增补高斯,针对性地强化边缘轮廓的连续性与完整性。最终,提出协同监督的深度正则化方法,通过合成伪视图增强数据,并融合基于SfM(structure from motion)点云尺度归一化的绝对深度损失与对尺度偏移不敏感的皮尔逊相关深度损失,为高斯位置优化提供鲁棒的几何约束。三者协同,形成从内部结构感知到针对性增强与几何一致性保障的闭环。结果在Mip-NeRF360(unbounded anti-aliased neural radiance fields)和LLFF(local light field fusion)数据集共17个场景上的实验表明,在稀疏输入下,本文方法在峰值信噪比(peak signal-to-noise ratio,PSNR)、结构相似性指数(structural similarity index,SSIM)和学习感知图像块相似度(learned perceptual image patch similarity,LPIPS)指标上显著优于主流对比方法。在Mip-NeRF360数据集(1/8分辨率)上,3项指标平均达到23.82 dB、0.753和0.201;在LLFF数据集(1/8分辨率)上平均达到20.48 dB、0.662和0.268。在Deep Blending、Tanks&Temples和DTU(Technical University of Denmark robot image datasets)数据集上的实验进一步验证了方法的有效性与泛化能力,其性能达到或逼近当前最优方法。视觉对比显示,本文方法在自行车辐条、植物茎叶等复杂边缘的重建上更清晰锐利,有效减少模糊与断裂伪影。渲染速度保持在275 帧/s以上,满足实时性要求。结论本文提出的边缘簇驱动方法,通过内部结构感知与针对性增强,有效提升稀疏视图下三维高斯泼溅对场景边缘及各向异性结构的重建质量,为高质量、实时的新视角合成提供一条轻量化且自包含的技术路径。  
      关键词:三维高斯泼溅 (3DGS);稀疏视图合成;边缘簇;聚类分析;深度正则化   
      310
      |
      346
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 147850645 false
      更新时间:2026-09-16

      遥感图像处理

    • 融合频域自注意力的卫星云图预测网络CloudPredUNet AI导读

      贺琪, 臧正源, 郝增周
      2026, 31(9): 3412-3426. DOI: 10.11834/jig.250559
      融合频域自注意力的卫星云图预测网络CloudPredUNet
      摘要:目的现有卫星云图预测方法在应对云团非线性运动时存在局限:传统方法难以建模复杂动态,深度学习模型则常受计算复杂、感受野有限或时间依赖建模不足的制约。为此,提出融合频域自注意力的卫星云图预测网络CloudPredUNet。方法CloudPredUNet基于UNet架构,编码器引入频域注意力模块,通过对图像块进行傅里叶变换与频域互相关,以较低计算成本实现全局特征聚合;解码器结合多尺度空洞卷积与空间注意力,增强细节重建;时间映射器融合多分支异感受野卷积与通道重标定,以加强长程时空依赖建模。结果在FY-2D数据集上的实验表明,CloudPredUNet在模型效率与预测精度上均领先。CloudPredUNet在参数量(0.101 M)和计算量(5 GFLOPs)远低于主流对比模型的同时,在4项关键评价指标上均取得最优值:MAE(mean absolute error)为8.393、MSE(mean squared error)为188.922、SSIM(structural similarity index measure)为0.825、PSNR(peak signal to noise ratio)为25.367 dB。消融实验验证了各模块的有效性与互补性,完整模型相比基线在MAE上提升约11.63%。多帧预测结果显示,该模型在连续5帧预测中每一帧的MAE均为最低,且在第5帧预测误差(10.589)较次优的MIM模型(10.852)进一步降低约2.4%,显示出更优的抗误差累积能力。可视化对比进一步证实,所提方法在云团生长、合并及台风眼结构保持等复杂场景中,能更完整地维持细节与运动一致性。结论本文工作为气象业务中实时、精准的云图短时预测提供了轻量高效的解决方案。未来将拓展数据集覆盖范围、探索多模态数据融合,并进一步优化频域注意力机制以提升重建质量。  
      关键词:卫星云图预测;时空预测;FY-2D卫星;频域自注意力;空间注意力   
      249
      |
      372
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 147850790 false
      更新时间:2026-09-16
    • 联合角度连续表示与感知平衡的遥感图像定向目标检测 AI导读

      王朝阳, 葛芸, 吴梦奇, 陈金梁
      2026, 31(9): 3427-3440. DOI: 10.11834/jig.250447
      联合角度连续表示与感知平衡的遥感图像定向目标检测
      摘要:目的遥感图像定向目标检测在环境监测、城市规划等领域发挥着重要作用,基于二维高斯分布的定向边界框表示方法实现了对旋转交并比(skew intersection over union,SkewIoU)的近似计算,因此受到了广泛关注。但二维高斯分布表示方法中存在角度边界不连续问题,且对不同宽高比目标角度感知不平衡,导致定位不准确。因此,提出了一种联合角度连续表示与感知平衡的检测算法(joint angle continuous representation and perceptual balance,JCPB)。方法首先,提出角度向量分解法(angular vector decomposition method,AVDM),通过在二维空间内将角度参数分解为向量编码,使得角度在边界和非边界位置处均能连续表示。并提出形状感知系数方法,根据目标宽高比动态调整系数值,在不增加编码长度的前提下调节角度损失函数的变化周期。其次,提出角度感知平衡策略(angle perceptual balance strategy,APBS),动态调节损失权重强化模型对小宽高比目标的方向判别能力。最后,基于二维高斯分布表示方法,通过联合角度连续表示和角度感知平衡策略,增强模型对目标方向的学习能力。结果在DOTA(dataset for object detection in aerial images)、DIOR-R(dataset for object detection in aerial images)和HRSC2016(high-resolution ship collections)数据集上进行大量实验测试。结果表明,在DOTA、DIOR-R和HRSC2016数据集上,与基准方法相比,所提方法在平均精度均值(mean average precision,mAP)上平均提升分别为1.46%、1.31%和4.35%,在SkewIoU阈值为0.75时,平均精准率(average precision,AP)平均提升分别为3.31%、2.19%和6.07%,实验结果验证了所提算法的有效性。结论本文算法通过将角度参数分解为连续的向量表示,并平衡模型对不同宽高比目标的感知能力,实现了遥感图像定向目标的高精度检测。  
      关键词:定向目标检测;高斯分布;边界不连续;角度向量分解;角度感知平衡   
      250
      |
      634
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 149620324 false
      更新时间:2026-09-16
    0