最新刊期

    2026 31 8

      具身智能与人形机器人前沿

    • 董军宇, 杨易, 翟广涛, 丛润民, 蹇木伟, 韩向娣
      2026, 31(8): 2687-2688. DOI: 10.11834/jig.2600008
        
      0
      |
      0
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 169109039 false
      更新时间:2026-08-18
    • 具身智能驱动的分心驾驶检测:框架研究与前沿展望 AI导读

      蹇木伟, 凌钰坤, 张昊然, 张琳松, 马嘉骏
      2026, 31(8): 2689-2704. DOI: 10.11834/jig.250514
      具身智能驱动的分心驾驶检测:框架研究与前沿展望
      摘要:分心驾驶是导致交通事故的主要因素之一,每年造成巨额经济损失和人员伤亡,对公共交通安全构成严重威胁。与以静态感知和离线分类为核心的传统驾驶行为识别方法不同,具身智能强调智能体通过身体感知、环境交互与行为反馈形成闭环认知,为分心驾驶检测走向“行为—认知—反馈”协同建模提供了新的研究范式。在分心驾驶检测场景中,驾驶员并非被动的信息输入源,而是与车辆、道路环境持续交互的具身主体,其风险状态由视觉、动作、注意力与情境共同驱动。基于具身智能的核心思想,本文从具身认知视角系统梳理了分心驾驶检测的关键技术路径,将分心驾驶行为视为“驾驶员—车辆—环境”持续交互过程中产生的具身认知结果,重点涵盖了多模态智能驾驶垂域大模型、领域自适应与持续学习等前沿研究方向,并从具身语义建模、环境适应与经验累积的角度分析其在分心驾驶检测中的作用;结合复杂交通环境的动态特征,提出了一个具有层次化结构的具身智能驱动分心驾驶检测理论框架,为分心驾驶检测研究提供新的参考思路和解决方案。最后,本文总结了具身智能驱动的分心驾驶检测系统在落地部署过程中面临的技术瓶颈与挑战,阐述了具身智能在分心驾驶检测中的应用前景,并展望了未来潜在的发展方向,可为具身智能驱动的智能驾驶安全系统的持续演进提供参考。  
      关键词:分心驾驶检测;深度学习;具身智能;具身感知;具身执行;具身学习与进化;智慧交通   
      247
      |
      763
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 147049113 false
      更新时间:2026-08-18
    • 具身智能模型评测:从感知到执行 AI导读

      李春一, 张建博, 肖嘉豪, 闫博闻, 郭晟毓, 叶桐瑞, 林维斯, 翟广涛
      2026, 31(8): 2705-2730. DOI: 10.11834/jig.250550
      具身智能模型评测:从感知到执行
      摘要:具身智能通过“身体—环境—任务”闭环交互,被视为迈向通用人工智能的核心路径。然而,与模型参数和训练数据的高速扩张形成鲜明对照,其评测体系仍处于“任务碎片化、指标多元化、平台封闭化”的自发状态,造成同一功能在不同研究中的性能差异超过10%,却无法判定来源是算法创新、数据扩充还是评测偏差,严重阻碍了技术迭代与产业落地。本文围绕“从感知到执行”的完整链路,对2020—2025年间发表于CVPR(IEEE/CVF Conference on Computer Vision and Pattern Recognition)、ICRA(IEEE International Conference on Robotics and Automation)、NeurIPS(Conference on Neural Information Processing Systems)等顶级会议与 Nature、IJRR(International Journal of Robotic Research)、JMLR(Journal of Machine Learning Research)等期刊的百余篇文献进行系统梳理,首次提出“静态数据集—仿真平台—真实机器人”三级金字塔式评测范式,并从感知、认知、决策、执行4个环节拆解出20余项核心能力维度与量化指标,分别从方法学假设、适用边界、固有局限和成本—可信度曲线4个角度进行横向对比。本文进一步汇总了46套主流基在数据规模、任务类型、评估指标、开源程度和安全伦理考量等维度的差异。基于此,提出“能力导向、协议统一、三级协同”的未来框架:1)在任务层,由“功能对标”转向“能力对标”,建立可分解、可溯源、可加权的多维误差体系;2)在协议层,制定统一的场景描述、接口规范与指标定义,实现跨平台、跨任务、跨模型的可比性;3)在系统层,构建可远程接入、7 × 24 h运行的共享机器人集群,形成“仿真预训练—真机微调—在线更新”的闭环追踪,降低重复建设成本,打通从实验室到场景落地的“最后一公里”。最后讨论了安全伦理、文化偏见和能效评估等新维度如何纳入量化框架,并给出标准化路线图的短、中、长期目标。本文工作为具身智能从“技术涌现”走向“科学共识”提供了可操作的评测基础设施与参考范式,具体的静态—仿真—真机榜单展示在:https://opencompass.org.cn/embodied-intelligence。  
      关键词:具身智能;评测体系;感知—认知—决策—执行;仿真平台;真机测试;仿真—现实一致性   
      468
      |
      429
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 153578177 false
      更新时间:2026-08-18
    • 面向具身智能的视觉—语言—动作模型研究进展

      刘锐, 王文冠, 王俊, 杨易
      2026, 31(8): 2731-2773. DOI: 10.11834/jig.250544
      面向具身智能的视觉—语言—动作模型研究进展
      摘要:具身智能作为人工智能与机器人学交叉的前沿领域,旨在使智能体通过与物理世界的动态交互来感知、推理并执行任务。然而,传统基于深度学习的级联式感知—控制模型在开放、动态环境下泛化能力不足,且高度依赖大规模标注数据。近年来,视觉—语言—动作模型(vision-language-action models, VLA)通过融合视觉感知、语言理解与动作生成,为具身智能的研究与应用提供了新的推动力。本文系统梳理了基于VLA的具身智能研究进展,从发展历程、模型架构、系统分类、训练与评估等方面展开综述。首先,本文追溯了视觉与语言基础模型的演进脉络,并阐述VLA概念的提出背景;随后,本文深入剖析VLA的关键技术模块,包括视觉编码、语言表征及动作词元化与解码机制;在此基础上,引入系统架构分类法,将现有工作归纳为单系统、双系统与层次化3类,并分析其设计权衡与适用场景;此外,本文总结了模型的预训练与后训练策略,并梳理了仿真及真实环境下的主流评测基准;最后,分析了VLA在实时推理效率、数据质量、环境泛化性与安全伦理等维度面临的挑战,并展望从被动感知到主动推理、持续学习、场景泛化与可靠部署等未来方向。本文旨在为相关研究者提供系统的技术参考,推动VLA在开放世界具身任务中的理论发展和应用落地。本文提及的算法、数据集和评估指标已汇总至https://github.com/DefaultRui/vision-language-action-models-for-embodied-AI。  
      关键词:具身智能;多模态大模型;视觉—语言—动作模型(VLA);强化学习;机器人感知与决策   
      0
      |
      0
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 169109037 false
      更新时间:2026-08-18
    • 语义对齐与局部感知驱动的开放词汇语义分割 AI导读

      王馨静, 高颖, 邹亚琦, 朱政宇, 徐春雪, 赵琦
      2026, 31(8): 2774-2784. DOI: 10.11834/jig.250540
      语义对齐与局部感知驱动的开放词汇语义分割
      摘要:目的面向具身智能与人形机器人等需在真实环境中即时感知与决策的系统,针对现有视觉—语言模型在像素级分割中常见的定位模糊及尺度、视角敏感性问题,提出一种无需像素级微调的推理范式,旨在在不改变预训练表征的前提下提升开放词汇语义分割的像素级判别质量与工程可用性。方法构建TG-CLIP(text-guided global-local contrastive language-image pre-training)框架,以冻结的CLIP为特征源,设计两类推理期算子以增强局部与跨尺度语义:1)文本引导的重校准机制,将文本查询作为条件信号对patch级表征进行语义性重构并回投;2)多视角一致性推理,通过重采样与镜像视角的结果融合来放大跨视角一致的预测信号。所有操作均在前向路径上完成,无需额外标注或网络微调。结果在8个公开基准上的评测显示,TG-CLIP的平均交并比(mean intersection over union,mIoU)达45.5%,超越多个现有方法,比排名第2的ProxyCLIP(40.1%)高出4.4%。定性对比实验进一步显示,TG-CLIP在复杂背景与细小结构处能更好地保留目标细节并减少误分割与漏分割,与定量结果相互印证。消融与超参数研究表明,两类算子可累积提升性能:文本引导重校准对温度参数表现出良好鲁棒性,多视角一致性推理在尺度与翻转策略上存在可量化的精度—效率权衡,推荐的部署配置在实用性上取得较好折中。结论TG-CLIP在保持视觉—语言模型零样本能力的前提下,通过两类轻量的推理算子实现了对像素级语义一致性与尺度、视角鲁棒性的显著改进,为免训练的开放词汇语义分割提供了一种易于部署且效果稳健的工程化方案。代码链接:https://www.scidb.cn/s/7baeYf。  
      关键词:开放词汇语义分割(OVSS);零样本学习;视觉—语言模型(VLM);CLIP;像素级语义分割;免训练推理   
      188
      |
      566
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 147049298 false
      更新时间:2026-08-18

      综述

    • 全景视觉显著性检测:原理、方法与应用综述 AI导读

      周强强, 喻嘉聪, 徐佳伟, 陈勇, 黄欣, 石艳娇, 张晴
      2026, 31(8): 2785-2813. DOI: 10.11834/jig.250560
      全景视觉显著性检测:原理、方法与应用综述
      摘要:随着虚拟现实(virtual reality,VR)技术的迅速普及,VR360 o 全景图像(omnidirectional image,ODI)与全景视频(omnidirectional video,ODV)在娱乐、教育、医疗等领域展现出巨大的应用潜力。然而,由于全景内容具有球面畸变、视角分布不均以及实时交互等特有挑战,传统显著性检测方法难以有效应对VR全景场景的复杂性。本文综述了当前VR360o 全景图像/视频下显著性检测的研究进展,从传统机器学习方法到基于深度学习(如CNN(convolutional neural network)、Transformer和LSTM(long short-term memory)架构)的方法进行了全面回顾。首先介绍了VR360 o 内容的成像原理与几何特性;随后,重点讨论了传统方法与深度学习技术在全景显著性检测中的应用与局限,特别是在全景环境中融合了多模态信息的相关研究;此外,还对现有数据集、评测指标及现有方法的性能进行了系统整理。本文还考察了全景显著性检测在图像质量评估和视频质量评估等领域中的实际应用案例,以揭示其在技术优化和用户体验提升方面的潜在价值。最后,展望了未来在VR360°全景显著性检测领域的前沿方向,旨在为后续研究和技术落地提供理论支持和实践指南。本文提及的算法、数据集已汇总至https://github.com/jiacongyu/PVSD。  
      关键词:虚拟现实(VR);全景显著性预测;全景显著性目标检测;深度学习;视觉注意机制;沉浸式体验   
      204
      |
      363
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 152506808 false
      更新时间:2026-08-18
    • 量子图像信息处理方法研究进展 AI导读

      吕品, 吴一全
      2026, 31(8): 2814-2843. DOI: 10.11834/jig.250566
      量子图像信息处理方法研究进展
      摘要:量子计算凭借其叠加性、纠缠性和并行性等核心特性,为解决图像处理领域的新型复杂难题提供了革命性的思路和工具,由此催生了量子图像信息处理这一研究领域。近年来,量子图像信息处理引起了越来越多研究人员的关注。本文对近5年来的相关研究进行了调研。首先介绍了量子计算的特性,并回顾了量子图像信息处理的发展历程。其次总结了近5年来的量子图像表示方法。从量子图像处理方法、量子图像分析方法、量子图像信息安全技术和量子机器学习方法这4个方面详细阐明了量子图像信息处理方法的研究进展,并对比了所采用方法的核心创新、性能突破和关键局限。其中量子图像处理方法涵盖量子图像滤波、量子图像压缩和量子形态变换;量子图像分析方法涉及量子边缘检测、量子图像分割和量子图像匹配3个方面;量子图像信息安全技术包括量子图像加密和量子图像数据隐藏;而量子支持向量机、量子卷积神经网络及量子生成对抗网络,则归属于量子机器学习的关键实现路径。最后指出目前量子图像信息处理方法在硬件、图像表示模型、协同效率和量子图像安全机制上面临的挑战,并针对挑战对未来进一步的研究方向进行了展望,提及的算法已汇总至https://github.com/cococococo7/QIIP。  
      关键词:量子图像表示;量子图像处理;量子图像分析;量子图像信息安全;量子机器学习   
      243
      |
      332
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 144740046 false
      更新时间:2026-08-18
    • 风力发电机叶片缺陷目标检测研究综述 AI导读

      张弪弘, 苏攀, 朱清源, 张超刚, 李冰, 曹旺斌
      2026, 31(8): 2844-2867. DOI: 10.11834/jig.250458
      风力发电机叶片缺陷目标检测研究综述
      摘要:全球能源转型推动了风力发电机的大规模部署,基于无人机图像采集的风机叶片(wind turbine black,WTB)缺陷目标检测技术已成为研究热点。风力发电机叶片的无人机图像存在质量低、缺陷与背景纹理相似、缺陷特征多尺度等问题,且标注缺乏统一标准并高度依赖人工,这些因素显著增加了缺陷检测的难度。当前关于风力发电机叶片缺陷检测的综述主要聚焦于无损检测方法,针对图像检测技术的系统性综述仍然不足,且多集中于模型架构的优化,而忽略了图像预处理和学习策略对检测性能的重要影响。因此,本文将图像预处理和学习策略纳入视角,系统综述了风力发电机叶片缺陷目标检测的研究进展:1)详细列举叶片缺陷类型及特征。2)与电力系统其他检测任务进行对比研究并总结主要问题。3)从图像预处理、网络改进和学习策略3个维度总结现有风力发电机叶片缺陷目标检测方法。在图像预处理方面,基于任务导向将现有方法归纳为3类:图像质量增强、几何校正以及结构特征提取;在网络优化方面,沿目标检测模型发展脉络,梳理了各类架构的改进策略;最后,总结了该领域常用的学习策略。4)对近年来数据集与常用评估指标进行汇总。5)对风机叶片缺陷目标检测方法面临的挑战及未来研究方向进行总结和展望。  
      关键词:风机叶片缺陷检测;无人机图像;图像预处理;目标检测;学习策略   
      434
      |
      2224
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 143378913 false
      更新时间:2026-08-18

      图像处理和编码

    • 基于扩散模型的美颜人脸图像复原 AI导读

      刘佳欣, 李晟, 钱振兴, 张新鹏, 应祺超
      2026, 31(8): 2868-2881. DOI: 10.11834/jig.250242
      基于扩散模型的美颜人脸图像复原
      摘要:目的随着人脸美颜技术的广泛应用,社交网络中充斥了大量经过各种类型美颜操作的人脸图像。人脸美颜技术的使用方便快捷,在为用户提升视觉体验的同时,也给数字内容的真实性带来了严峻挑战,并可能应用于网络欺诈、虚假宣传等领域,带来安全隐患。当前研究主要集中于美颜检测领域,即判断图像是否经过美颜处理,而缺乏对如何从美颜图像中复原原始人脸的探索。本文提出了美颜人脸图像复原(face retouching restoration,FRR)方法,旨在去除因美颜处理导致的色彩纹理改变和结构特征扭曲,从而重建原始人脸图像以便于追溯原始身份特征。方法本文提出了基于美颜痕迹引导去噪过程的扩散模型(retouching-guided diffusion model for FRR,RT-FRR)。通过多尺度篡改痕迹提取模块(multi-scale face retouching trace extraction module,FREM)提取美颜图像中的美颜处理痕迹特征,并构建多尺度条件引导机制控制扩散过程。RT-FRR采用残差预测策略,在去噪过程中预测原始人脸图像和美颜图像之间的人脸残差,从而实现面部纹理细节和结构特征的协同恢复。结果在新构建的重度美颜人脸数据集(extremely retouched face dataset,ExRF)和现有公开美颜检测数据集RetouchingFFHQ上分别进行了实验。实验结果表明,相比现有图像复原方案,本文方法在常用图像质量评价指标上有显著提升。对人脸特征相似度的分析也表明本文方法可以有效恢复原始人脸的身份。结论本文所提的RT-FRR能有效预测原始人脸和美颜人脸之间的残差,并在视觉质量和人脸识别准确率方面均表现出色,显著优于基线模型。  
      关键词:图像复原;美颜人脸复原(FRR);扩散模型;注意力机制;残差预测   
      243
      |
      680
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 147049336 false
      更新时间:2026-08-18
    • 低光照图像的双分支特征增强与校准网络 AI导读

      张奇, 苗壮, 王家宝, 纪文宇, 毕翔鹤, 雷小舟
      2026, 31(8): 2882-2896. DOI: 10.11834/jig.250530
      低光照图像的双分支特征增强与校准网络
      摘要:目的低光照图像增强(low light image enhancement,LLIE)旨在改善低光照条件下的图像质量,在夜间监控、自动驾驶等领域具有重要应用价值。然而,现有方法在sRGB(standard red green blue)、HSV(hue saturation value)、YCbCr(luminance and chrominance blue and red)等色彩空间中常面临亮度—色彩耦合导致的色彩失真与亮度伪影平衡难题。HSV空间存在极坐标量化引起的色彩不连续,YCbCr空间对色度信息处理不足。方法针对上述问题,提出一种基于HVI(horizontal vertical intensity)色彩空间的门控卷积双分支增强网络(gated convolution dual-branch interaction network,GCDINet)。该网络利用HVI空间的物理解耦特性,将亮度信息与色彩结构信息分离处理。设计了门控卷积特征增强(gated convolutional feature enhancement,GCFE)模块,通过双路门控激活函数与逐元素乘法生成空间注意力掩码,强化细节区域特征响应。同时,提出了双路径自适应特征校准结构,使用其引导亮度与色彩分量的重建,并抑制由亮度调整引入的噪声和色彩的偏移。结果在LOLv2-Synthetic数据集上,本文方法的峰值信噪比(peak signal-to-noise ratio,PSNR)、结构相似度(structural similarity index measure,SSIM)和感知相似性(learned perceptual image patch similarity,LPIPS)分别达到25.698 dB、0.935和0.047。与当前先进LLIE方法Retinexformer相比,3个指标分别提升0.028 dB、5.3%和20.3%。同时,计算量为7.94 GFLOPs,比Retinexformer降低了50%,达到了与最优方法相比速度和性能的有效平衡。结论所提出的低光照增强方法,融合了双分支结构与HVI色彩空间的优势,从而实现低光照图像增强过程中模型色彩保真度与亮度伪影抑制的平衡能力。  
      关键词:低光照图像增强(LLIE);HVI色彩空间;双分支特征增强;门控卷积;特征校准   
      149
      |
      728
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 147049186 false
      更新时间:2026-08-18
    • 轻量级稀疏置换自注意力图像超分辨率网络 AI导读

      吴思琪, 柳薇, 陈卫东
      2026, 31(8): 2897-2910. DOI: 10.11834/jig.250519
      轻量级稀疏置换自注意力图像超分辨率网络
      摘要:目的图像超分辨重建是计算机视觉领域一个典型低层视觉任务,能够为目标检测、图像分割等高层任务提供更清晰更结构化的输入。基于卷积神经网络(convolutional neural network,CNN)的图像超分辨率模型注重恢复图像的纹理和边缘信息,而基于Transformer的方法能建模全局上下文信息,但是存在注意力权重冗余问题。针对这两种模型的优缺点,设计了一种轻量级图像超分辨率网络。方法首先改进了传统的Transformer,提出了一种稀疏置换自注意力机制,在扩大窗口的同时解决冗余问题。在此基础上,基于CNN构建高频信息增强模块加强模型对局部细节信息的重建。在得到两种结构提取的特征后,提出一种双分支特征融合模块对全局特征和局部特征进行高效融合。结果本文方法在5个公开数据集上与11种先进超分辨方法进行了对比实验。结果表明,在保证模型轻量化的前提下,稀疏置换自注意力网络(sparse and permuted self-attention network,SPSANet)在不同放大倍率和数据集上均取得最优或次优性能。当放大倍率为3时,在Urban100和Manga109数据集上的峰值信噪比(peak signal-to-noise ratio,PSNR)分别较最新的SOTA(state of the art)方法提升了0.15 dB和0.28 dB。主观视觉效果显示,SPSANet在复杂纹理和细节丰富的场景中重建的图像更加清晰、自然。结论本文提出的轻量级稀疏置换自注意力图像超分辨率网络能够在保持较低参数量与计算复杂度的同时,在多个数据集上取得优异的重建效果,展现出良好的泛化性与应用价值。  
      关键词:深度学习;图像超分辨率;稀疏置换自注意力(SPSA);高频信息增强;双分支特征融合(DBFF)   
      217
      |
      475
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 144741288 false
      更新时间:2026-08-18

      图像分析和识别

    • 融合图文特征对齐和文本解耦的输电线路螺栓缺陷分类 AI导读

      张珂, 高明伟, 郑朝烨, 李硕士, 聂鼎, 周帅
      2026, 31(8): 2911-2924. DOI: 10.11834/jig.250468
      融合图文特征对齐和文本解耦的输电线路螺栓缺陷分类
      摘要:目的视觉—语言模型在缺乏视觉信息的输电线路螺栓缺陷分类中潜力巨大,然而以图像—文本对比学习为代表的视觉—语言模型预训练算法需要大规模的图像和文本数据,实际螺栓缺陷分类研究中数据规模通常较小且缺少丰富的描述文本。为提升视觉—语言模型在螺栓缺陷分类上的适配度,提出一种融合图文特征对齐和文本解耦的输电线路螺栓缺陷分类方法(Transmission line bolt defect classification method integrating vision-language feature alignment and textual decoupling,VL-Bolt)。方法深入分析了图像—文本对比学习不适配螺栓缺陷分类任务的原因,归结为类内语义重叠的影响;针对零样本CLIP(contrastive language-image pre-training)模型中螺栓缺陷类间相似度较高的问题,提出文本特征解耦(text feature decoupling, TFD)损失函数,使不同缺陷类别文本在特征空间有效解耦;针对图像—文本对比学习中的类内语义重叠问题,提出适配螺栓缺陷分类的文本锚点引导的图像特征对齐方法(text-anchor-guided visual feature alignment, TA-VFA),实现同类别图像和文本特征对齐。同时,为提升模型泛化能力,提出渐进式图像编码器微调策略(progressive fine-tuning for the image encoder,PFT),逐层解冻图像编码器的Transformer层参数以实现稳定适配。结果实验结果表明,VL-Bolt 模型分类准确率达到92.2%,相比基线模型提升3.9%。同时,VL-Bolt在与其他4种迁移方法的对比中表现更优。相较端到端微调,PFT能够有效抑制过拟合问题。在Flowers102、StanfordCars和Caltech101等3个公开数据集上,VL-Bolt的准确率均较基线模型取得显著提升。结论本文方法有效提升了视觉—语言模型在螺栓缺陷分类任务中的性能,为视觉—语言模型在输电线路巡检中的实际应用提供了新的思路。  
      关键词:输电线路;螺栓缺陷分类;图文特征对齐;视觉—语言模型;特征解耦;迁移学习   
      206
      |
      287
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 144739947 false
      更新时间:2026-08-18
    • 频域增强与边界感知的自动驾驶实时行人检测 AI导读

      刘涛, 欧阳晖, 高一萌
      2026, 31(8): 2925-2941. DOI: 10.11834/jig.250437
      频域增强与边界感知的自动驾驶实时行人检测
      摘要:目的在自动驾驶场景中,行人尺度变化剧烈、遮挡现象频繁和复杂环境干扰等问题会导致检测性能显著下降。针对这些挑战,提出了一种结合多重频域增强策略与边界感知机制的实时行人检测算法FEBA-DETR(frequency-enhanced and boundary-aware detection Transformer)。方法FEBA-DETR基于RT-DETR(real-time detection Transformer)架构进行改进,通过使用频域增强、边界感知机制以及优化损失函数,提升对小目标的检测能力和遮挡情况下的检测能力。此外,结合频域子带数据增强方法,进一步提升算法在雨、雾、雪和低光照等复杂环境下的检测性能。结果与原RT-DETR算法相比,FEBA-DETR在CityPersons数据集上,AP50(average precision at IoU threshold 0.50 )与AP50:95分别提升2.3%和2%,引入频域子带增强后分别提升3%和2.4%;在代表部分遮挡和严重遮挡的场景中,MR-2(log-average miss rate)分别下降4.92%和2.82%。结论FEBA-DETR算法提升了在自动驾驶场景中对远距离小尺度行人和严重遮挡行人的检测能力,并在复杂环境下也表现出更强的鲁棒性,其性能优势在多组对比实验中得到了充分验证,能有效应对自动驾驶中的行人检测挑战,为自动驾驶系统的安全提供支持。  
      关键词:自动驾驶;行人检测;小目标检测;频域增强;边界感知;数据增强   
      348
      |
      416
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 139330245 false
      更新时间:2026-08-18
    • 多分支感知与跨层语义融合的红外小目标检测 AI导读

      钱孟豪, 刘奎, 章丰博, 苏本跃
      2026, 31(8): 2942-2957. DOI: 10.11834/jig.250448
      多分支感知与跨层语义融合的红外小目标检测
      摘要:目的红外小目标检测在军事和民用等领域具有重要应用价值。然而,由于目标尺度极小且常处于复杂背景之中,如何有效提取边缘等判别性特征仍然是亟待解决的难题。同时,现有基于U-Net的检测网络在跨层特征融合过程中存在明显的语义差异,导致浅层细节信息与深层语义特征难以充分结合,进一步限制了检测精度的提升。方法基于U-Net结构,提出一种多分支感知与跨层语义融合的红外小目标检测网络(multi-branch perception and cross-layer semantic fusion network,MPCF-Net)。在编码器阶段,为增强边缘等判别性特征的提取,引入了多分支感知融合注意力模块(multi-branch perception fusion attention module,MPFM)。该模块通过局部分支、全局分支及串行卷积分支实现多尺度特征提取,并结合局部—全局引导注意力(local-global guided attention,LGGA)与全局通道空间注意力(global channel spatial attention,GCSA),分别强化小目标的响应能力与特征表达能力。随后,为缓解跨层特征间的语义差异并建模上下文依赖关系,采用空间—通道交叉Transformer块(spatial-channel cross transformer block,SCTB)替代传统的跳跃连接,从而提升多层特征融合效果。在解码器阶段,虽然深度可分离卷积能够有效降低参数量和计算复杂度,但缺乏跨通道特征交互,削弱了小目标的细节特征。为此,在输出端引入轻量梯度门控模块(lightweight gradient gating,LGG),利用Sobel梯度引导的空间注意力进一步强化小目标的边缘与细节特征。结果在SIRST、IRSTD和NUDT-SIRST这3个公开红外小目标数据集上的实验显示,MPCF-Net在交并比(intersection over union,IoU)和归一化交并比(normalized intersection over union,nIoU)指标上分别达到80.12% 、66.28%和84.26%,以及78.23%、64.58%和86.48%。同时,该方法在检测概率(probability of detection,Pd)上分别达到99.88%、94.23%和98.21%,虚警率(false alarm,Fa)仅为1.12 × 10-6、4.39 × 10-6和14.57 × 10-6,展现了更优的检测性能。结论所提方法通过多分支感知和跨层语义融合,有效增强了红外小目标的边缘等判别特征提取能力及上下文建模能力,从而实现了更高精度的红外小目标检测。  
      关键词:红外小目标检测;多分支感知;跨层语义融合;注意力机制;Transformer   
      298
      |
      489
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 144741247 false
      更新时间:2026-08-18
    • Mask R-CNN Swin融合注意力机制的斗拱检测方法 AI导读

      金远, 池方爱, 刘迎奥, 李颜娥
      2026, 31(8): 2958-2972. DOI: 10.11834/jig.250460
      Mask R-CNN Swin融合注意力机制的斗拱检测方法
      摘要:目的斗拱作为中国古代木构建筑的重要承重与装饰构件,其形态复杂、方向特征显著,对自动化识别与数字化保护提出了更高要求。为提升斗拱及破损斗拱的识别精度与鲁棒性,本文基于深度学习与Transformer架构构建了一种改进型Mask R-CNN(Mask region-based convolutional neural network)斗拱识别模型。方法以Mask R-CNN_Swin为基础框架,构建包含转角斗拱与非转角斗拱的图像数据集(共3 014幅样本,来源于灵隐寺、法喜寺等古建筑实景及公开网络资源)。针对斗拱结构的方向性特征与复杂背景干扰问题,提出方向坐标注意力机制,通过在水平与垂直方向上独立建模显著性特征,有效增强模型对方向敏感结构的表征能力;同时引入一维压缩激励机制,以实现通道特征的轻量化重标定,强化全局与局部特征间的依赖建模。结果实验结果表明,改进模型SwinE_AM_DIRCA(Mask R-CNN_Swin enhanced with 1D squeeze-and-excitation, automatic mixed precision, multi-scale cropping, and directional coordinate attention)在非转角斗拱与转角斗拱识别中的精度分别达到94.4% 与89.2%,较基础Swin_AM(Mask R-CNN_Swin with automatic mixed precision and multi-scale cropping)模型分别提升6.7%与8.9%,较Mask R-CNN_ResNet50(Mask region-based convolutional neural network with ResNet-50 backbone)模型分别提升10.8%和20.4%;在破损斗拱识别任务中亦取得显著性能提升。结论本研究通过引入方向敏感建模与通道压缩激励相结合的注意力机制,显著增强了模型对斗拱结构特征的表达能力与方向判别能力。创新点在于提出了基于方向解耦的坐标注意力机制DIRCA(directional coordinate attention)与一维压缩激励机制1D-SE(1D-squeeze-and-excitation)的协同设计框架,实现了方向性特征建模与轻量化通道增强的统一,为古建筑构件的智能识别、自动修复及文化遗产数字化保护提供了可行路径与技术支撑。  
      关键词:DIRCA;深度学习;文化遗产;Transformer;古建筑   
      111
      |
      513
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 146768861 false
      更新时间:2026-08-18
    • 面向轻量级人脸识别的二阶段知识蒸馏方法 AI导读

      唐鑫, 张飞飞, 李光辉, 马宇轩, 董正阳
      2026, 31(8): 2973-2986. DOI: 10.11834/jig.250454
      面向轻量级人脸识别的二阶段知识蒸馏方法
      摘要:目的针对移动端与边缘设备计算资源受限的应用场景,现有高性能人脸识别模型虽然精度较高,但计算开销大,难以直接部署。知识蒸馏技术可将高性能教师模型的知识迁移至轻量化学生模型,从而在保持较高精度的同时降低计算复杂度。为进一步提升轻量化模型的人脸识别性能,提出一种新型两阶段对比式知识蒸馏框架TC-Face(two-stage contrastive knowledge distillation for face recognition)。方法第1阶段,学生网络通过引入动量更新机制的对比学习,从教师网络的特征表示中学习,利用特征队列存储历史小批量特征,实现跨批次的知识传递,稳定蒸馏过程并增强特征区分性。为兼顾知识迁移与表征灵活性,第2阶段采用教师网络的分类器权重初始化学生分类器,从而在维持特征空间对齐的同时,赋予学生网络自主优化和拓展其判别能力的空间。结果在IJB-C (IARPA janus benchmark)、IJB-B、MegaFace以及多个小规模验证基准上的综合实验表明,所提方法的识别精度都得到了提升,在IR100-MBF(IResNet100-MobileFaceNet)设置下,相较于最新的SOTA(state-of-the-art)方法UnifiedKD,在IJB-B和IJB-C数据集上,当假阳性率(false acceptance rate, FAR)为1E-5时,真接受率(true acceptance rate, TAR)都提升了1.89%。所有数据集上平均超过SOTA方法1.55%,并且在大规模测试集上的性能提升明显,在MegaFace数据集上平均准确率提升了2.72%,验证了所提方法在高难度人脸识别任务中的有效性与鲁棒性。结论TC-Face框架通过两阶段训练策略,有效缓解了轻量化模型特征空间受限与精度下降的矛盾,兼顾了模型的高精度与轻量化特性,具有较高的实用价值和推广潜力。  
      关键词:人脸识别(FR);知识蒸馏(KD);对比学习;轻量化模型;动量更新   
      152
      |
      376
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 143378807 false
      更新时间:2026-08-18

      图像理解和计算机视觉

    • SMPL引导的残缺点云人体重建 AI导读

      周敏, 安平, 黄新彭, 杨超
      2026, 31(8): 2987-3000. DOI: 10.11834/jig.250262
      SMPL引导的残缺点云人体重建
      摘要:目的点云在人体建模和姿态估计中应用广泛,但常因传感器视角和遮挡而局部缺失,影响重建完整性和精度。点云非结构化特性使模型难以准确建模几何结构和拓扑关系,导致失真、模糊或偏差。现有方法在处理严重缺失和复杂姿态时,仍面临结构完整性和几何精度不足的挑战。方法为此,本文提出一种基于蒙皮多人线性(skinned multi-person linear,SMPL)模型拓扑先验的人体重建与点云补全方法。通过引入逐点语义感知的多尺度特征提取机制,增强对局部几何结构的理解能力;在此基础上,利用SMPL的参数化网格先验构建初始人体形变骨架,有效引导缺失区域的结构推理,缓解因信息缺失带来的拓扑歧义;进一步设计顶点偏移感知优化模块,通过学习输入点云与预测网格间的空间残差,实现对人体表面细节的精细化修正。结果实验结果表明,所提方法在SURREAL(synthetic humans for real tasks)和AMASS(archive of motion capture as surface shapes)数据集上均优于现有方法。在SURREAL数据集上,顶点回归误差降低4.6%,姿态估计精度达当前最优的16.2 mm;在AMASS数据集上的倒角距离指标也显著优于现有点云补全算法,进一步验证了所提出框架的良好泛化性与鲁棒性。结论综上所述,将SMPL的拓扑先验有效融入点云重建流程,可显著提升重建质量,尤其在处理非结构化与不完整点云时展现出更强优势。  
      关键词:点云重建;形状补全;姿态估计;多尺度特征;SMPL拓扑先验   
      223
      |
      522
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 147851798 false
      更新时间:2026-08-18
    • 杨源旺, 马健, 孟源, 李坤
      2026, 31(8): 3001-3014. DOI: 10.11834/jig.250413
      畸变特征解耦与伪多视角约束的透视图像穿衣人体三维重建
      摘要:目的单幅透视畸变图像的穿衣人体重建在虚拟试衣、数字人制作等应用中具有重要意义。然而,现有方法多采用正交或弱透视投影,忽略真实相机的成像规律,将深度简化为单一缩放因子,难以恢复透视畸变条件下真实的人体三维结构。为解决这一问题,提出一种面向透视图像的三维穿衣人体重建方法PerRec,通过畸变特征解耦与伪多视角约束缓解深度歧义与投影失真。方法首先利用均匀分块与虚拟视角变换解耦图像位置与透视畸变;随后设计多尺度注意力增强网络以强化局部细节表达;并将SMPL网格(skinned multi-person linear model)转化为傅里叶占有率场以提升高频几何重建能力;最后通过伪多视角模块模拟多视角特征以增强对畸变的鲁棒性。结果实验结果表明,PerRec在Thuman2.0和CustomHumans 数据集上均取得显著提升,在倒角距离、法线一致性和点到表面距离等指标上相较现有方法平均提升60%~80%。结论本文方法能够有效解决单幅透视图像下的结构失真问题,为真实场景中的高精度穿衣人体重建提供了可扩展的技术途径。  
      关键词:三维人体重建;透视畸变图像;单目相机;伪多视角;RGB图像   
      111
      |
      406
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 146768835 false
      更新时间:2026-08-18
    • 分层解耦引导的情感可控VQ-VAE 3D说话人脸生成方法 AI导读

      陈胜, 孙强, 朱霞天
      2026, 31(8): 3015-3029. DOI: 10.11834/jig.250451
      分层解耦引导的情感可控VQ-VAE 3D说话人脸生成方法
      摘要:目的基于语音驱动的3D说话人脸生成技术已经较为成熟,尤其是基于向量量化变分自编码器(vector quantized variational autoencoders,VQ-VAE)的模型,但现有的基于VQ-VAE的人脸生成模型重建的人脸细节有限,现有方法情感引导方式较为简单,未能充分利用多模态信息,为此,提出了DecTalk3D模型。方法在VQ-VAE框架下对人脸特征进行分层解耦,将其分为顶层特征和底层特征,并引入身份向量和描述文本作为外部条件解耦顶层特征,随后顶层特征再作为内部条件,与外部条件一起解耦底层特征,实现特征的分层解耦,以提升人脸的重建质量并增强情感表达的稳定性。在生成过程中,语音和文本共同引导人脸生成,从而充分利用多模态信息。结果在MEAD(multi-view emotional audio-visual dataset)、3DMEAD和TA-MEAD数据集上的定量实验表明,DecTalk3D在生成人脸的平均顶点误差(mean vertex error,MVE)、平均估计误差(mean estimation error,MEE)和覆盖误差(coverage error,CE)等关键指标上均达到最优,唇部顶点误差(lip vertex error,LVE)为次优。可视化分析显示生成的表情整体上更生动逼真。消融实验验证了外部条件与内部条件对模型效果的关键作用。结论本文方法有效提升了人脸重建的准确性与表情生成的稳定性,生成结果在整体上更接近真实人脸。DecTalk3D代码已在GitHub和ScienceDB开源,链接为:https://github.com/chen114514sheng/DecTalk3D和https://doi.org/10.57760/sciencedb.j00240.00095。  
      关键词:3D人脸生成;向量量化变分自编码器(VQ-VAE);Transformer;特征量化;情感可控   
      217
      |
      939
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 147049044 false
      更新时间:2026-08-18
    • 语义增强与文本重组协同的汉画像石图文检索 AI导读

      姜坤, 钱文华, 刘朋
      2026, 31(8): 3030-3044. DOI: 10.11834/jig.250393
      语义增强与文本重组协同的汉画像石图文检索
      摘要:目的汉画像石是解读汉代历史文化的珍贵载体。图文检索技术能推动汉代文化研究向数字化转型,为文化保护提供智能化解决方案。然而,现有图文检索方法应用于汉画像石时,存在领域偏移、图像与文本难以对齐等问题。本文提出一种语义增强与文本重组协同的图文检索方法以提高检索的准确性和全面性。方法本文通过编码器分别完成汉画像石图像与文本特征的提取。在图像处理阶段,基于汉画像石图像对应掩膜图像,计算各语义对象权重,进而推导得出注意力权重。通过残差连接获取注意力特征,并将所得注意力权重直接作为语义增强特征。通过多阶段特征融合将原始特征、注意力特征和增强特征融合得到组合特征以丰富特征表示。在文本处理阶段,将文本与提取的图像语义对象嵌入随机提示模板,生成结构更清晰的增强文本,增强文本的语义表达能力。同时,为适配本文数据集结构,提出动态温度调整以及非对称相似度计算的方法,基于特征相似度自适应调整温度。对图像到文本和文本到图像双向的相似度矩阵计算采用不同温度系数以提升跨模态匹配的准确性与稳定性。结果通过本文所提方法验证,文本到图像的检索指标Mean_Recall、Recall@1、Recall@5和Recall@10相较于排名第2的BLIP(bootstrapping language-image pre-training)模型分别提高了15.20%、21.84%、14.29%和9.48%。图像到文本的检索指标Mean_Recall、Recall@1、Recall@5和Recall@10相较于排名第2的X2-VLM(all-in-one pre-trained model for vision-language tasks)模型分别提高了17.47%、23.22%、18.45%和10.72%,汉画像石图文可视化检索也得到了更好的效果。结论本文方法显著增强了模型对汉画像石图像与其描述文本的对齐能力,有效提升了图文检索在准确性、全面性等方面的表现。  
      关键词:汉画像石;图文检索;语义增强;文本重组;动态温度   
      127
      |
      404
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 146770194 false
      更新时间:2026-08-18

      遥感图像处理

    • 语义引导对比学习的SAR与光学图像转换 AI导读

      杜文亮, 郭波, 赵佳琦, 姚睿, 周勇
      2026, 31(8): 3045-3059. DOI: 10.11834/jig.250526
      语义引导对比学习的SAR与光学图像转换
      摘要:目的合成孔径雷达(synthetic aperture radar, SAR)与光学图像转换能够融合两种模态数据的优势,提供全天时、全天候与高分辨率的观测能力。然而,当前基于循环一致性生成对抗网络的方法主要侧重于图像结构的宏观重建,未能充分利用跨模态间的深层语义信息来指导图像生成,限制了生成图像的语义保真度和在下游任务中的性能。同时,现有基于对比学习的转换方法在处理遥感图像时,因同类地物特征高度自相关导致正负样本难以区分,造成对比机制失效。针对上述问题,提出了一种语义引导对比学习的SAR与光学图像转换方法。方法提出基于语义分割的特征提取模块,利用预训练的SAR与光学语义分割模型提取像素级语义信息;提出了语义引导的对比学习模块,利用先验的语义分割信息,在对比学习空间中显式构建基于类别一致性的正负样本筛选机制,有效解决了遥感图像特征同质化导致的传统对比学习失效问题;设计了融合循环生成结构与对比学习的联合优化框架,通过引入循环语义分割损失与生成对抗损失,约束生成图像在结构、纹理和语义层面的一致性。结果实验在WHU-OPT-SAR(Wuhan University-optical-SAR)和DDHRNet(dual-stream deep high-resolution network)两个公开数据集上进行。实验结果表明,与当前优秀方法相比,在SAR到光学及光学到SAR的图像转换任务中,生成质量指标分别最高提升了11.9%和3.8%;在下游任务中,语义分割准确率分别提升了49.26%和10.60%,特征匹配的正确内点比例最高提升了1%。消融实验研究表明,语义引导对比学习模块与循环语义分割损失对提升模型性能均起到关键作用。结论本文提出的语义引导对比学习的SAR与光学图像转换方法,能够有效解决传统对比学习在遥感图像转换中的失效问题,显著提升了生成图像的语义保真度与跨模态特征对齐能力,在下游语义分割和图像匹配任务中取得了最优的综合性能,为无监督SAR与光学图像转换提供了新的解决思路。本文代码开源在链接:https://www.scidb.cn/s/VVVBnu。  
      关键词:图像转换;合成孔径雷达(SAR);遥感图像;对比学习;语义分割   
      263
      |
      530
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 146768558 false
      更新时间:2026-08-18

      医学图像处理

    • Mamba架构下多级多尺度特征融合增强的息肉检测网络 AI导读

      胡珂立, 黄杰, 范康鑫, 王臣, 祝汉灿, 赵利平, 任浩炜, 胡剑浩
      2026, 31(8): 3060-3074. DOI: 10.11834/jig.250492
      Mamba架构下多级多尺度特征融合增强的息肉检测网络
      摘要:目的针对结肠镜息肉图像边界模糊、尺度变化范围大的问题,现有分割模型常因计算冗余、特征表征能力不足,难以兼顾分割精度与处理效率。为此,本文提出一种基于Mamba架构的多级多尺度特征融合增强网络(multi-level and multi-scale feature fusion enhanced network, MMF-MambaNet),通过轻量化网络架构与高效上下文感知机制,提升模型对息肉边界细节的捕捉能力。方法MMF-MambaNet以Mamba变体网络VSSM(visual state space model)作为骨干网络,通过嵌入局部序列样式转换增强模块对特征均值与方差进行随机重参数化处理,有效增强骨干特征多样性,网络核心包含三大关键模块:1)引入跨尺度上下文自感知注意力(cross-scale aware self-attention,CASA),通过深层特征引导,使各层级特征在保留细节的同时融入高层语义上下文;2)构建自适应细节增强模块(adaptive detail enhancing module, ADEM),以某一尺度为锚点,融合其他尺度的结构信息,构建语义完整的息肉细节表示;3)构建自适应全局—局部融合门控(adaptive global-local integration gate, AGLI),以轻量结构实现细粒度语义引导,助力网络聚焦语义可靠、边界清晰息肉区域,提升分割精度。此外,模型设计反向特征融合路径,将编码器输出的深层全局语义特征与浅层细节特征有机结合,最终生成包含清晰边界线索的精细化分割掩膜。结果在CVC-300、CVC-ClinicDB、Kvasir、CVC-ColonDB及ETIS-LaribPolypDB五大公开数据集上开展实验,将MMF-MambaNet与PraNet、VM-UNet(vision Mamba UNet)V2和Polyp-Mamba等8种医学图像分割领域的先进算法进行对比。在5个数据集上,与VM-UNet相比,mDice评估指标分别提升1.1%、5.0%、4.2%、9.1%和2.6%。此外,CVC-ColonDB数据集上的实验结果表明,与VM-UNetV2相比,在mDice和mIoU上分别提升4.6%、6.2%。结论本文提出的MMF-MambaNet克服了在处理息肉边界模糊、尺度多变问题时的息肉区域提取精度与效率失衡局限,为结肠镜息肉的精准分割提供了高效可行的模型支撑。  
      关键词:Mamba;多尺度;多级;息肉检测;深度学习   
      97
      |
      243
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 153128028 false
      更新时间:2026-08-18
    0