最新刊期

    2026 31 7

      综述

    • 2025年度三维视觉前沿趋势与十大进展 AI导读

      刘烨斌, 穆尧, 叶琦, 高林, 韩晓光, 陈安沛, 段岳圻, 彭思达, 邵天甲, 张鸿文, 张力, 廖依伊, 许岚, 刘希慧, 姚遥, 胡瑞珍, 弋力, 郭裕兰, 连宙辉, 刘子纬, 陈宝权
      2026, 31(7): 2279-2316. DOI: 10.11834/jig.260114
      2025年度三维视觉前沿趋势与十大进展
      摘要:三维视觉作为计算机视觉、图形学、人工智能与光学成像的交叉学科,是构建具身通用智能与元宇宙的核心基石。2025 年,以 VGGT(visual geometry grounding Transformer)为代表的前馈三维重建技术的突破,为空间智能提供了坚实的场景三维理解基础,并大幅降低高质量三维内容的制作门槛;三维生成质量逐渐达到工业级扫描水平,技术从单图实例生成向动态复杂场景的多实例前馈重建演进;三维重建与三维生成开始深度融合,逐渐实现复杂场景在稀疏视点输入下的前馈式重建;视频生成技术正融入各式三维表征,推动 “感知—生成—交互” 一体化的世界模型技术的发展,世界模型已被广泛认为是实现可泛化具身智能与通用人工智能(artificial general intelligence,AGI)的关键路径;蕴含物理常识、因果推理与交互偏好的人类行为与第一人称视频数据开始得到广泛使用,成为突破具身智能数据瓶颈、驱动具身智能Scaling的核心燃料;具身智能视觉—语言—动作(vision-language-action,VLA)模型正从依赖专家演示的模仿学习,转向融合在线强化学习的复合架构,可在稀疏奖励下显著提升模型的泛化与探索能力。这些技术突破奠定了“多模感知—三维建模—四维生成—实时交互”一体化智能架构的雏形,为空间智能和具身智能的实质性发展提供了关键技术支撑。为促进学术交流,本文分析总结三维视觉领域前沿趋势,并遴选年度十大研究进展,为学术界与产业界提供参考观点。  
      关键词:三维视觉;具身智能;世界模型;重建与生成;空间智能   
      416
      |
      353
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 155139672 false
      更新时间:2026-07-20
    • 音频驱动的数字人技术进展 AI导读

      李卫斌, 高佳峰, 徐兵, 侯彪, 焦李成
      2026, 31(7): 2317-2338. DOI: 10.11834/jig.260103
      音频驱动的数字人技术进展
      摘要:随着人机交互技术的飞速发展,音频驱动的数字人生成(audio-driven digital human generation)已成为数字人领域的研究热点。该技术旨在建立从一维语音信号到三维视觉流的跨模态映射,其核心挑战是在保证唇形精准同步的同时,实现高保真的视觉外观与实时渲染。本文提出了一种音频驱动数字人通用技术框架,并从技术演进的视角系统梳理了该领域的最新进展。本文回顾了早期的二维图像生成方法,分析了其在三维一致性与大姿态驱动上的局限性;进而深入探讨了基于神经辐射场(neural radiance fields,NeRF)的方法,阐述了基于隐式空间建模解决视角一致性的技术方案,并总结该方法面临的推理效率瓶颈;随后,重点综述了当前两大前沿范式:3D高斯溅射(three-dimensional Gaussian splatting,3DGS)范式,其利用显式几何原语突破实时渲染的算力限制;扩散模型(diffusion models)范式,该范式可显著提升生成的细节纹理与动作表现力。此外,本文还归纳了主流的音频驱动数字人数据集与客观评价体系,如唇形同步网络(synchronization network,SyncNet)、FID(Fréchet inception distance)等。最后,对跨身份泛化、情感与全身交互,以及端侧轻量化部署等开放性挑战进行了深入分析与展望。  
      关键词:数字人;音频驱动;说话头生成;神经辐射场(NeRF);3D高斯溅射(3DGS);扩散模型   
      75
      |
      49
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 157321213 false
      更新时间:2026-07-20
    • 21世纪新一代人工神经网络—具身认知神经网络 AI导读

      鲍泓, 梁天骄, 郑颖
      2026, 31(7): 2339-2357. DOI: 10.11834/jig.260112
      21世纪新一代人工神经网络—具身认知神经网络
      摘要:面向21世纪,为构建一种具有自适应结构、可解释、泛化强和能效高的人工神经网络(artificial neural network,ANN),对新一代ANN的基础理论、模型和架构进行探索。按时间线,ANN从20世纪40年代首次提出,发展至今已80多年,并将延展至21世纪中叶,本文按5个维度特征将ANN划分成5个时代。当前,处在第4代ANN,其主要特征是数据拟合、深度学习、注意力机制和Transformer结构,以大语言模型为基础的ChatGPT (chat generative pre-trained Transformer)为代表,通过了对话式图灵测试,但属于“黑箱”测试,并局限于离身智能形态的涌现。根源是基于规模扩展缩放定律的大语言模型本质上不对称性,缺乏对现实世界物理规律的理解,多模态、多任务、多形态输出智能呈锯齿型且能效低;而具身智能形态机器人的神经网络还缺少自主智能,只能按预设程序完成规定动作,ANN在离身智能和具身智能之间出现巨大鸿沟。为解决第4代ANN的这些重大缺陷,需要新的理论、模型和架构支撑。当前,围绕下一代ANN的发展方向和技术路线,出现了很多争论和分歧。本文追溯前4代ANN主流理论、模型和架构的发展,重点分析了第4代ANN的特征,评述了面向第5代ANN的世界模型与联合嵌入预测架构、认知螺旋模型与智痕元胞网络架构。最后,以认知物理学理论和驾驶脑认知技术实践为基础,提出一种具有第5代ANN核心特征的具身认知物理神经网络(embodied-cognitive physics neural networks,E-CoPNN)轻量化架构,基于具身认知架构研发的全球首个跨具身视觉语言基础模型,在跨域的自动驾驶12项基准与具身智能 17 项基准均达到 SOTA,量化验证了统一具身认知模型的双向正向迁移能力。当今,构建面向21世纪的新一代ANN,在哲学上,将从身心二元论转向具身知觉一元论;在基础科学上,将从20世纪的生物物理学升级到21世纪的认知物理学;在数学上,从量的关系拓展到形的关系;在模型上,将推动ANN研究范式从数据拟合转向结构重构;在应用上,将填补ANN发展中离身智能与具身智能的鸿沟,为实现会学习、自成长、自纠错以及可交互的具身认知机器人广泛应用奠定基础;在代际演进上,将从第4代ANN跃升到具有类脑认知和动态自适应结构等特征的第5代ANN;支撑认知为融合先导的四大科技“纳米—生物—信息—认知”聚合发展,提高人类认知能力,迎接新一轮的认知革命。  
      关键词:人工神经网络(ANN);第5代ANN具身智能;离身智能;具身认知;认知物理学;具身认知物理神经网络(E-CoPNN);统一场论;智能场;人类注意力机制;选择性机制;驾驶脑认知;综述   
      270
      |
      249
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 153982493 false
      更新时间:2026-07-20
    • 平行图像:从理论框架到多模态智能视觉应用 AI导读

      张慧, 田永林, 王雨桐, 苟超, 李轩, 王飞跃
      2026, 31(7): 2358-2380. DOI: 10.11834/jig.250231
      平行图像:从理论框架到多模态智能视觉应用
      摘要:在深度学习推动下,视觉感知系统在智能驾驶、安防监控和医疗诊断等领域取得显著进展。然而,现实场景中数据分布的极度不均衡、长尾样本的稀缺性及高昂的人工标注成本,已成为制约模型性能与泛化能力的关键瓶颈。平行图像作为基于平行系统理论发展而来的新型图像生成与建模方法体系,通过构建人工场景系统、开展计算实验推演及虚实平行执行,形成“建模—训练—反馈—优化”的闭环机制,为视觉感知系统提供了高质量、多样化、结构化的合成数据支撑。本文系统梳理了平行图像的理论基础与发展脉络,重点综述其在虚拟场景生成、多模态特征融合、虚实域迁移和异构知识驱动的平行推理等关键技术路径上的研究进展与应用探索。同时,结合当前生成式人工智能和大规模多模态基础模型的发展趋势,分析了平行图像在智能视觉系统演化中的融合潜力。最后,本文指出该领域面临的主要挑战,并对未来的研究方向和应用前景进行了展望。  
      关键词:平行图像;生成式人工智能;虚实融合;场景生成;数字孪生   
      85
      |
      209
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 153576772 false
      更新时间:2026-07-20
    • 遥感图像开放词汇感知进展 AI导读

      李开宇, 曹相湧, 蒋梓轩, 孟德宇
      2026, 31(7): 2381-2407. DOI: 10.11834/jig.260163
      遥感图像开放词汇感知进展
      摘要:传统的遥感图像智能解译技术大多建立在封闭集假设之上,高度依赖海量的人工标注数据,且在推理阶段仅能识别训练集中预先定义的固定类别。面对真实地球观测场景中复杂多变的地表环境、尺度剧烈变化的目标以及长尾分布的罕见地物,传统范式泛化能力受限,难以满足高度动态的开放世界解译需求。近年来,得益于视觉—语言基础模型的快速发展,开放词汇感知技术应运而生。该技术通过跨模态语义对齐打破了传统离散标签的束缚,在零样本与少样本场景下展现出强大的泛化潜力。然而,遥感影像独特的俯视成像视角、复杂的拓扑关联以及多源异构的物理模态,致使自然图像领域的通用大模型在向遥感垂直领域迁移时面临显著的领域鸿沟。为此,本文系统梳理并总结了遥感图像开放词汇感知领域的最新研究进展。从数据和方法两个维度,阐述了遥感视觉—语言预训练数据集的构建策略,以及预训练架构从基础域适配向异构数据感知与地理先验增强的演进脉络;全面剖析了开放词汇感知在零样本场景分类、跨模态检索、图像分割、目标检测与定位、变化检测以及三维点云理解等关键下游任务中的应用范式;深入探讨了当前该领域在高质量训练数据匮乏、细粒度评测基准缺失、多源异构模态深层对齐不足及模型可靠性等方面面临的核心挑战,并从多模态大语言模型驱动的生成式感知、全模态基础模型演进、时空因果推演及星地协同计算等方向对未来发展趋势进行了系统展望,以期为推动遥感智能解译迈向真实开放世界提供详实的理论参考。  
      关键词:遥感图像;开放词汇感知;视觉—语言模型(VLM);零样本学习;智能解译   
      282
      |
      290
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 155139984 false
      更新时间:2026-07-20
    • 薛旭倩, 文杰, 刘新旺, 张军平
      2026, 31(7): 2408-2433. DOI: 10.11834/jig.260125
      先验驱动的多视图聚类:从几何与语义空间到多模态大模型认知前瞻
      摘要:随着多模态大模型与海量异构数据的涌现,多视图聚类(multi-view clustering, MVC)作为无监督知识发现与数据底层关联挖掘的核心技术,其研究范式正经历深刻变革。现有综述多局限于底层算法网络结构的横向归纳,难以揭示该领域在不同技术时代的内在发展逻辑。为此,本文打破传统分类框架,首创性地提出先验驱动的理论视角,对多视图聚类20年来的发展脉络进行了系统性重构。首先,梳理了基于几何先验的浅层结构挖掘,分析了欧氏原型、仿射子空间与流形邻域中的显式数学约束机理;其次,归纳了基于语义协同先验的深层空间建模,揭示了模型如何在嵌入、隐空间、增强及拓扑空间中捕获非线性的跨视图一致性;最后,前瞻性地探讨了基于多模态大模型认知先验的深度对齐,阐述了聚类技术赋能海量数据治理、混合专家(mixture-of-experts, MoE)路由及检索增强生成(retrieval-augmented generation, RAG)的基础设施作用,并分析了多模态大模型逻辑推理反哺聚类任务的潜在机遇。本文通过构建几何—语义—认知的跨范式分析框架,深刻揭示了多视图聚类由底层数据驱动向高阶知识驱动转型的内在逻辑。在此基础上,分析了类别分布长尾失衡、视图严重缺失及评估体系滞后等开放环境下的核心挑战,并探讨了相应的解决思路,旨在为多视图聚类在多模态大模型时代的理论创新与工程实践提供新的研究路线。  
      关键词:多视图聚类(MVC);先验驱动学习;多模态大模型(LMMs);几何结构;语义协同;认知对齐;综述   
      112
      |
      223
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 155139902 false
      更新时间:2026-07-20
    • 夜间无人机航拍图像目标检测与跟踪方法研究进展 AI导读

      毕诗帆, 叶亮, 王志祥, 张梓阳, 洪汉玉, 桑农
      2026, 31(7): 2434-2470. DOI: 10.11834/jig.250459
      夜间无人机航拍图像目标检测与跟踪方法研究进展
      摘要:视觉目标检测与跟踪技术已在白天场景中取得显著突破,为无人机(unmanned aerial vehicle,UAV)在智能领域的广泛应用提供了强大支撑。然而,这些方法在夜间场景往往表现不佳,检测与跟踪精度显著下降。夜间作为无人机应用中不可或缺的场景,其复杂性与挑战性凸显了开展夜间无人机航拍图像目标检测与跟踪研究的必要性和现实意义。针对夜间无人机目标航拍图像检测与跟踪技术的现状及发展趋势,本文分析了感知能力有限、可视化特征不足、硬件平台资源受限以及复杂成像条件等因素所带来的挑战。从夜间无人机航拍图像目标检测研究出发,综述了夜间图像增强、域适应学习、多模态感知融合和轻量化模型等方法的研究进展。在夜间无人机航拍图像目标跟踪方面,重点综述了基于深度学习的5类范式,包括先增强后跟踪、域自适应、视觉提示学习、课程学习和多模态融合,系统总结了相关方法的优缺点及所应对的挑战。随后,介绍了夜间及全天候无人机航拍图像目标检测与跟踪常用的评价指标与典型数据集,并在构建的夜间无人机车辆目标检测集DroneVehicle-Night上进行性能评估与对比分析;同时,从VisDrone2019(vision meets drone 2019)的测试集中筛选昼夜样本,对现有检测方法的夜间适应性进行了对比测试;此外,还汇总了包含4类跟踪范式在内的20种算法在夜间无人机航拍图像目标跟踪数据集UAVDark135(unmanned aerial vehicle dark tracking 135)与NAT2021(nighttime aerial tracking 2021)上的性能评估结果。最后,对夜间无人机航拍图像目标检测与跟踪未来的发展方向进行了展望,为该领域的后续研究提供参考。本文实验中用到的算法、构建的数据集已经汇总至https://github.com/bsfsf/DroneVehicle-Night和https://doi.org/10.57760/sciencedb.32435。  
      关键词:深度学习;无人机航拍图像;夜间无人机;目标跟踪;目标检测   
      424
      |
      389
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 144740091 false
      更新时间:2026-07-20
    • 姜建湘, 吴一全
      2026, 31(7): 2471-2504. DOI: 10.11834/jig.250435
      基于视觉与深度学习的非合作空间目标识别与位姿估计方法研究进展
      摘要:为提升非合作空间目标在轨服务与态势感知中的感知能力,本文系统综述了基于视觉与深度学习的非合作空间目标识别与位姿估计方法研究进展。首先阐明非合作空间目标识别与位姿估计的任务特点,简要回顾了各自的发展历程。其次围绕非合作空间目标识别与位姿估计等关键任务,梳理了当前主流方法。在目标识别方面,重点分析了基于多模态视觉融合、目标检测与分割、迁移学习与少样本学习的识别模型及其在复杂空间环境中的适应性与鲁棒性;在位姿估计方面,主要包括直接回归、关键点检测、无监督与域自适应以及多模态视觉融合等技术。随后梳理了空间目标公开数据集及自建数据集,评估了目标识别与位姿估计方法的性能,并分别对其优缺点进行比较。结果表明,深度学习方法相较于传统方法在弱纹理、遮挡和姿态变化等复杂空间环境下具有更强的鲁棒性,多模态融合与无监督策略进一步提升了跨域泛化能力。最后总结了目标识别与位姿估计方法面临的主要挑战,并展望了未来的发展方向,旨在为该领域的技术研究与工程应用提供参考。本文提及的算法、数据集和评价指标已汇总至https://github.com/viskyll/openResource/tree/main。  
      关键词:非合作空间目标;目标识别;位姿估计;视觉;深度学习;多模态视觉融合;直接回归;关键点检测   
      552
      |
      457
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 139329322 false
      更新时间:2026-07-20

      面向医学影像智能分析的基础模型

    • 应用证据深度学习的可信医学影像分析方法综述 AI导读

      文昕颢, 刘伟, 岳晓冬, 陈宇飞
      2026, 31(7): 2505-2525. DOI: 10.11834/jig.250475
      应用证据深度学习的可信医学影像分析方法综述
      摘要:随着人工智能技术在医疗领域的深度融合,基于深度学习的影像分析模型已在多项任务中展现出显著潜力。然而,这类模型的性能严重依赖于大规模、高质量的训练数据,而真实临床环境下的医学数据常面临三大类挑战:数据稀缺、数据异质性以及数据不均衡问题。传统深度学习模型在处理此类复杂数据时,往往表现出过度自信的错误预测,且缺乏对认知不确定性的表达能力,从而为高风险的临床决策带来潜在安全威胁。证据深度学习(evidential deep learning,EDL)作为一种新兴的不确定性量化范式,通过将狄利克雷分布引入到神经网络的输出对预测进行证据建模,能够一定程度上建模偶然不确定性和认知不确定性,这种能力为应对真实复杂医学数据提供了强有力的工具。本文从数据稀缺、数据异质性及数据不均衡这三大挑战的视角切入,系统性地综述了证据深度学习在复杂医学数据下的影像分析应用,并阐明了证据深度学习凭借其不确定性量化和内在的可解释性,在利用无标签数据、检测异常样本、解析并融合冲突证据、识别尾部数据以及仲裁噪声数据等方面展现的核心优势。最后,本文对该领域当前面临的挑战进行了总结,并对未来的研究方向进行了展望,为研究者们提供了一个清晰的路线图,以推动构建更安全、更可靠、更可信的下一代智能医学影像分析系统。本文提及的相关算法已汇总至https://github.com/oscarab/Medical-EDL。  
      关键词:证据深度学习(EDL);医学影像分析;不确定性量化;主观逻辑;证据理论   
      389
      |
      474
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 143378785 false
      更新时间:2026-07-20
    • 脑结构—功能耦合超图神经网络 AI导读

      雷孟奇, 韩向敏, 李思奇, 高跃
      2026, 31(7): 2526-2537. DOI: 10.11834/jig.250535
      脑结构—功能耦合超图神经网络
      摘要:目的现有基于结构连接(structural connectivity, SC)与功能连接(functional connectivity, FC)的脑疾病诊断方法,通常只使用单一模态建模或仅做跨模态的浅层融合,难以充分刻画SC与FC之间的潜在依赖;同时,结构—功能耦合(structure-function coupling, SFC)与分类任务之间的关系尚缺系统性建模。针对上述问题,本文提出一种以SFC为先验引导的跨模态融合脑疾病诊断基础模型——脑结构—功能耦合超图神经网络(structure-function coupling hypergraph neural network, SFC-HGNN)。方法SFC-HGNN采用双流超图神经网络作为编码器,以SFC矩阵为中间桥梁,在功能分支与结构分支中分别构建超图以建模两种模态的高阶脑网络,并利用超图卷积学习跨脑区的高阶相互作用;在预训练阶段,设计跨模态交叉重建任务,用功能连接的表征重建结构连接、用结构连接的表征重建功能连接,并引入对称性与稀疏性约束的重建损失;在微调阶段,SFC-HGNN冻结编码器部分的参数,仅训练轻量级多层感知机分类器以完成下游任务的诊断。结果为验证方法的有效性,在阿尔茨海默病神经影像学倡议(Alzheimer’s disease neuroimaging initiative, ADNI)和自闭症脑成像数据交换(autism brain imaging data exchange, ABIDE)数据集上进行了广泛的实验。在ADNI数据集上,SFC-HGNN的阿尔兹海默病—正常对照分类任务准确率和特异性分别达到0.705、0.891;在ABIDE数据集上,SFC-HGNN的自闭症谱系障碍—正常对照分类任务准确率和特异性分别达到0.681、0.682,均显著优于对比方法。结论以SFC为先验的跨模态交叉重建预训练与超图计算相结合,能够有效捕获SC与FC之间的潜在高阶依赖,显著提升脑疾病诊断的准确性与鲁棒性,为结构—功能耦合在临床辅助诊断中的应用提供了可行路径。  
      关键词:脑疾病诊断;多模态脑网络;结构—功能耦合(SFC);超图神经网络(HGNN);跨模态交叉重建;脑网络基础模型   
      254
      |
      310
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 154040441 false
      更新时间:2026-07-20
    • 面向脑影像配准的深度展开网络研究 AI导读

      孙嘉颖, 杨双燕, 应时辉
      2026, 31(7): 2538-2552. DOI: 10.11834/jig.250283
      面向脑影像配准的深度展开网络研究
      摘要:目的医学图像配准在手术导航、疾病监测和多模态诊断等临床应用中具有关键作用。传统迭代优化方法可解释性强但计算效率低下,深度学习方法存在黑盒特性导致模型的可解释性不足。对此,提出了一种基于模型解耦的深度展开配准网络,旨在兼顾高效计算与模型可解释性。方法首先通过变量松弛将配准问题解耦为相似性约束和形变正则化两个子问题。在此基础上,受深度展开网络的启发,进一步将迭代优化过程映射为多层神经网络。保真项模块用于解决相似性约束子问题,采用基于TransUnet的架构,实现融合局部特征与全局上下文;去噪模块用于解决形变正则化子问题,采用基于残差连接的去噪网络架构近似正则项。两模块协同完成单次交替迭代,并通过级联构成深度展开网络。所提出的深度展开配准网络与迭代优化步骤严格对应,每层操作具有明确物理意义和数学依据,显著提升了模型的可解释性。结果本文方法在LPBA40(laboratory of neuro imaging probabilistic brain atlas)和OASIS(open access series of imaging studies)公开脑部数据集上的戴斯相似系数(Dice similarity coefficient,Dice)分别为70.1%和79.9%,负雅可比矩阵行列式百分比为0.01%,验证了所提方法的有效性。结论提出的基于模型解耦的深度展开配准网络有效融合了传统迭代优化方法与深度学习方法的优势,在保持较高计算效率和精度的同时显著提升了可解释性。  
      关键词:医学图像配准;展开网络;模型解耦;正则项学习;脑影像   
      166
      |
      530
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 147851942 false
      更新时间:2026-07-20
    • 融合高召回分类策略的胎心标准切面多任务识别模型 AI导读

      陈宇, 朱栋晓, 宿磊, 李可, Michael Pecht
      2026, 31(7): 2553-2568. DOI: 10.11834/jig.250334
      融合高召回分类策略的胎心标准切面多任务识别模型
      摘要:目的胎儿心脏超声检查是诊断先天性心脏病的重要手段,但由于胎儿心脏体积小、搏动速率高且位置受体位变化影响,5个标准切面的捕捉时效要求高且获取过程重复性差,严重制约了筛查效率。为实现准确、全面的标准切面自动识别,提出一种基于“先检测后分类”策略的胎儿心脏标准切面识别多任务模型FHSP-Net(fetal heart standard planes net)。方法在检测任务中,设计路径交织特征金字塔(path weaved network,PWN)、目标感知增强模块(target-aware enhancer,TAE)并引入均衡损失函数(equalization loss version 2,EQLv2),解决胎心超声检测数据集在多尺度与小目标检测、噪声与伪影干扰、样本数量不均等固有难题,提供精确的第一阶段结果;针对基于解剖结构包含条件的切面识别算法精确率高但召回率低的问题,设计候选视图评分识别算法,在保证高精确率的同时显著提高召回率。结果在测试集上的实验结果表明,FHSP-Net多任务模型在解剖结构检测与标准切面识别任务中均展现出优异性能:检测任务平均精度均值达到0.962,相较基线提升0.027;候选视图评分识别算法较基于解剖结构包含条件的切面识别算法准确率提升0.10。最终,FHSP-Net切面识别准确率高达0.959,较基线与解剖结构包含条件切面识别算法的组合模型准确率提高0.194,验证了其有效性与优越性。结论所提FHSP-Net多任务模型在胎心结构检测和标准切面识别任务上均表现优异,路径交织特征金字塔、目标感知增强模块及均衡损失函数显著提高了结构检测模型的鲁棒性,候选视图评分算法在提升分类准确性与召回率方面展现出显著优势,能为超声智能辅助诊断提供有力支持。  
      关键词:胎儿心脏超声检测;标准切面识别;关键解剖结构识别;深度学习;目标检测   
      208
      |
      460
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 143378957 false
      更新时间:2026-07-20
    • 视觉与边界融合的混合注意力结直肠息肉分割 AI导读

      吴琪琪, 邓星, 邵海见, 王飞
      2026, 31(7): 2569-2586. DOI: 10.11834/jig.250488
      视觉与边界融合的混合注意力结直肠息肉分割
      摘要:目的为提升结直肠息肉在复杂内镜图像中的分割准确性与鲁棒性,针对边界模糊、形态多样与光照不均等难点,构建一种在临床部署约束下兼顾精度与效率的轻量化方法。方法提出混合注意力网络ViBound-Net,以EfficientNetV2S为编码骨干,设计局部—全局上下文融合注意力(local-global contextual attention fusion,LGCAF)模块以统一建模细粒度与全局语义;在解码端引入多尺度残差注意融合块(multi-scale residual attention fusion block,MRAFB)与边界引导的尺度感知特征增强(boundary-aware multi-scale feature refinement,BSFE)模块,强化跨尺度交互与边界细化;并配合深层监督与Dice+Focal复合损失缓解类别不平衡、稳定训练。结果为保证可比性,采用统一的数据预处理与增强策略,在Kvasir-SEG、CVC-ClinicDB和CVC-300等5个公开基准上开展系统评估,并与多种代表性方法进行对比;同时报告复杂度指标(参数量与FLOPs)与推理时间的相对表现,以体现轻量化优势。ViBound-Net在Kvasir-SEG、CVC-ClinicDB和CVC-300上,mDice分别为0.908 1、0.936 8和0.871 0,mIoU(mean intersection over union)分别为0.852 7、0.887 8和0.798 9;在ETIS-LaribPolypDB中的平均绝对误差(mean absolute error,MAE)为0.011 7,分割区域在形状保持、轮廓完整性与区域一致性方面优于多数对比方法。可视化结果显示,本文方法在小目标与贴边病灶上边界更为贴合,能显著抑制背景噪声。复杂度与效率对比表明,ViBound-Net在较低参数量与FLOPs的前提下保持竞争性精度,推理延迟满足实时应用需求。结论通过融合局部—全局语义与边界敏感建模,ViBound-Net在结构紧凑的条件下能实现高精度与良好跨域泛化,可适配复杂临床内镜下的任务需求,具备集成至结直肠癌早筛工作流的应用潜力。后续将进一步面向极端低对比与跨设备域偏移场景,加强边界正则与自适应学习,以持续提升稳健性。  
      关键词:医学图像分割;结直肠息肉分割;混合注意力网络;边界引导;多尺度特征增强;轻量化模型   
      117
      |
      390
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 146770240 false
      更新时间:2026-07-20
    • 面向医学图像分割的边缘引导多重感知解码器 AI导读

      黄冠珲, 刘翔, 石蕴玉, 纪雨, 王硕鸿
      2026, 31(7): 2587-2600. DOI: 10.11834/jig.250251
      面向医学图像分割的边缘引导多重感知解码器
      摘要:目的医学图像分割在医学影像辅助诊断中具有重要的应用价值,然而传统的神经网络设计很难满足实际需求。为了解决图像边界分割不准确、特征融合有效性不足的问题,提出一种EMPD(edge-guided multiperception decoder)新型解码器,通过构建有效的边缘信息引导多重感知特征的解码器,实现医学图像的准确分割。方法在保持 Pyramid Vision Transformer 全局建模能力的同时,引入边缘信息感知模块有效提升模型对空间结构的感知能力。该模块在边缘区域表现出更高的响应性,能够更精确地捕捉结构细节,从而缓解因多次下采样所导致的边缘信息模糊问题;通过设计双重尺度级联门控模块及三维注意力融合模块,能够使得网络以更加全面的视角充分利用编码器的信息,不仅能进行信息筛选,还能将编码器与解码器信息有效融合,进而实现了医学图像的准确分割。结果方法在涵盖3类医学图像分割任务的7个公开数据集上进行了系统性评估,在 DICE 指标方面表现出稳定的性能提升。具体而言,在 ClinicDB(colonoscopy videos challengeclinic database) 数据集上,DICE 分数相较于现有主流方法提升了1.58%;在5个 Polyp 数据集及 ISIC2017(international skin imaging collaboration)皮肤病变数据集上,平均提升幅度达 0.77%。 此外,在 Synapse 多器官分割任务中,本文方法在 DICE 和 mIoU(mean intersection over union) 指标上分别较同一编码器的 PVT-Cascade 提升了 2.16% 和 3.81%,进一步验证了其在复杂解剖结构建模方面的有效性与泛化能力。结论本文提出的解码器与主流的方法相比具有更优异的性能,为医学图像分割研究提供了新的工具,能够实现有效的医疗辅助诊断。  
      关键词:边缘感知;双重尺度级联门控(DSCG);三维注意力;特征融合;医学图像分割   
      312
      |
      417
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 139328000 false
      更新时间:2026-07-20
    • 王轩, 邓娜, 谢锋, 邢文宇
      2026, 31(7): 2601-2613. DOI: 10.11834/jig.250510
      面向腹腔超声图像出血区域的双域多尺度注意力分析网络DMA-UNet
      摘要:目的腹腔出血病情凶险,快速准确诊断至关重要。为了解决超声图像出血分割中存在的低对比度、强噪声和边界模糊等挑战,提出了一种基于空间域和频域结合的双域多尺度注意力U型网络(dual-domain and multi-scale attention U-Net,DMA-UNet)用于超声图像腹腔出血区域分割。方法核心架构包含3个关键创新:编码器的空洞注意力卷积模块集成并行卷积注意力机制与空洞卷积,在保证效率的同时增强小目标特征捕获;中间层的快速傅里叶卷积残差块通过频域变换有效建模全局上下文;跳跃连接的联合注意力结构实现跨层级特征优化。三者协同构成双域结合的多尺度注意力分析框架。结果实验基于上海长征医院和复旦大学附属华山医院363幅腹腔出血超声图像,通过数据增强对模型进行训练、验证与测试。结果表明,本文提出的模型Dice和交并比(intersection over union,IoU)指标在两个中心的测试集中分别达到了0.879 7、0.796 1和0.933 9、0.876 2,消融实验验证了所设计模块对模型性能提升的有效性。与主流的分割模型相比,分割性能也具有显著的提升。结论提出了一种双域多尺度注意力分析网络,通过在多个核心模块中引入注意力机制,有效融合了空间域和频域特征,显著增强了DMA-UNet全局上下文建模能力、信息融合效率和模型的泛化性能,为腹腔出血区域分割网络的设计提供了新思路,具有较高的临床应用价值。  
      关键词:腹腔出血;快速傅里叶卷积(FFC);多尺度表征;联合注意力结构(JAS);超声图像分割   
      212
      |
      331
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 146822182 false
      更新时间:2026-07-20

      图像分析和识别

    • 融合双重注意力特征与时空特征的高速公路违停识别 AI导读

      刘电, 尹娜, 张泽宁, 吕洪燕, 罗旭彬, 王昊翔
      2026, 31(7): 2614-2630. DOI: 10.11834/jig.250354
      融合双重注意力特征与时空特征的高速公路违停识别
      摘要:目的为提升高速公路交通管理效率与道路安全,提出一种面向监控视频的违法停车自动识别方法,以解决车流密集场景中目标遮挡、摄像机透视畸变及夜间光照干扰导致的身份混淆与误判问题。方法引入了双重注意力特征融合结构,增强YOLOv8(you only look once)提取的多尺度特征的表达能力,并将生成的外观特征用于后续的轨迹匹配阶段,从而在保持高效跟踪性能的同时,有效缓解了目标身份混淆与切换的现象。此外,还设计了一种基于帧间位移自适应的判别机制来识别违停行为,有效降低了由视角畸变和边框抖动造成的误判和漏判风险。针对夜间检测的困难,进一步引入基于时间序列信号分析的危险报警闪光灯检测技术,以提升夜间判定的稳定性与准确性,从而增强整体算法的鲁棒性。结果鉴于当前尚无公开可用的高速公路违停检测数据集,结合实际交通管理需求,自主构建覆盖多场景的专用数据集,并在此基础上进行实验验证。结果表明,所提方法能够良好适应不同时间段及复杂条件下的高速公路场景,违停识别准确率达94.79%,召回率达92.86%,F1分数为0.94,显著优于对比方法。所提方法的图像处理速度为32帧/s,满足实时处理需求。结论提出的融合双重注意力特征与时空特征的方法,在高速公路违停识别上成效显著,该研究具备显著的开创性和实践指导意义。  
      关键词:高速公路;时空特征;注意力特征;违停识别;双重注意力   
      132
      |
      245
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 144739999 false
      更新时间:2026-07-20
    • FixMatch++:基于半监督学习的有限图像标签数据扩展方法 AI导读

      杨雨晴, 陈谊, 吕程
      2026, 31(7): 2631-2644. DOI: 10.11834/jig.250398
      FixMatch++:基于半监督学习的有限图像标签数据扩展方法
      摘要:目的深度视觉模型对大规模标注数据的高度依赖限制了其实际应用。半监督学习为解决这一问题提供了有效途径,其中的FixMatch框架作为一个具有影响力的基线方法,通过弱—强数据增强策略显著提升了无标签数据的利用效率。然而,该框架在训练初期仍存在特征提取不稳定、图像采集/成像差异致使内容—风格信息易被混淆以及单增强视图伪标签噪声累积等问题,严重制约了模型在实际场景中的性能表现。方法提出了FixMatch++框架,对原始FixMatch进行3个方面的改进:1)设计可学习批量归一化模块修正增强策略带来的通道级统计量偏差,结合双尺度并行卷积模块增强多尺度特征提取能力;2)引入内容/风格分离的双分支表征模块进行特征分离,并采用动态残差门控机制优化特征融合过程;3)提出多级别伪标签融合机制,缓解单增强视图导致伪标签噪声累积,将3种增强视图的分类概率加权,并配合类别阈值筛选策略生成可信标签,有效提升了标签的数量和质量。结果在CIFAR-10(Canadian institute for advanced research 10-class dataset)、CIFAR-100(Canadian institute for advanced research 100-class dataset)和SVHN(street view house numbers)3个公开图像数据集上与7个近期主流半监督学习方法MeanTeacher、UDA(unsupervised domain adaptation)、ReMixMatch、FixMatch、FlexMatch、SoftMatch和UES(uncertainty-aware ensemble structure)进行比较,结果表明:FixMatch++方法在3个数据集上表现出较低的分类错误率,整体优于7种基线方法。在低标签量下表现尤其出色,例如,在CIFAR-10数据集250标签下,FixMatch++的分类错误率为4.56%,比7种基线方法降低了0.35%~27.76%。消融实验与可视化分析进一步验证了各模块的合理性和必要性。结论提出的FixMatch++方法在有限标签数据场景下,能够有效扩展可用训练样本规模并提升图像分类性能。  
      关键词:图像分类;半监督学习(SSL);弱标签数据;数据增强;伪标签融合;跨域适应   
      142
      |
      354
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 143378753 false
      更新时间:2026-07-20
    • 结合自动语义发现的协同显著性目标检测 AI导读

      陈华超, 陈颍州, 王斌, 王峰, 赵佳
      2026, 31(7): 2645-2659. DOI: 10.11834/jig.250377
      结合自动语义发现的协同显著性目标检测
      摘要:目的协同显著性目标检测(co-salient object detection,Co-SOD)旨在从一组相关图像中识别出既具有视觉显著性又具备语义一致性的目标区域。然而,现有方法在判别性建模方面存在局限,特别是在开放词汇场景下,语义泛化能力较弱,难以准确区分协同显著目标与复杂背景干扰。为此,本文提出一种新型框架以提升Co-SOD的语义理解能力和检测准确性。方法本文设计了一种语义引导的开放词汇协同显著性目标检测框架。首先,利用CLIP(contrastive language-image pre-training)模型在组内图像与候选类别之间进行跨模态相似度建模,自动生成与组内语义一致的类别名称,从而减少人工指定类别的烦琐工作。随后,采用OWLv2(open-vocabulary object detector v2)模型将生成的类别名称与图像进行联合建模,输出与语义一致的候选目标框;再通过SAM(segment anything model)对候选区域进行精细分割,提取高质量的显著性掩码。为增强语义表达的覆盖性与匹配稳定性,本文为每类标签构建多种语言描述,并采用多提示并行输入机制,以提升模型对语言歧义的鲁棒性与适应能力。针对复杂背景、遮挡和弱显著目标等挑战,本文还设计了一种动态阈值自适应策略,能够依据候选区域的语义一致性自适应调整检测门限,从而在保证检测准确性的同时有效提升召回率。结果实验在CoCA、CoSal2015和CoSOD3k 3个公开数据集上进行,并与当前主流的15种先进协同显著性检测方法进行了比较,在CoCA数据集中,相比于性能第2的模型,F值提高了25.7%,平均绝对误差(mean absolute error,MAE)降低了5.2%;在CoSOD3k数据集中,相比于性能第2的模型,F值提高了2.5%;在CoSal2015数据集中,相比于性能第2的模型,F值提高了2.2%,MAE降低了1.2%。此外,在CoSOD3k数据集上进行了消融实验,进一步验证了本文所提方法在提升协同显著性检测效果方面的有效性。结论本文所提出的语义引导的开放词汇协同显著性目标检测框架,通过引入CLIP的组内一致类别生成方法,有效缓解了人工指定类别的局限性;结合OWLv2的开放词汇检测能力与SAM的通用分割优势,显著增强了模型的语义泛化能力和目标识别鲁棒性,为开放场景下的协同显著性检测提供了新思路与有效解决方案。  
      关键词:协同显著性目标检测(Co-SOD);语义引导;开放词汇;协同显著性目标检测框架;跨模态相似度;动态阈值自适应策略   
      351
      |
      646
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 139330173 false
      更新时间:2026-07-20

      图像理解和计算机视觉

    • 窗口移位注意力的两阶段掩码引导汽车表面高光去除网络 AI导读

      王嘉成, 周树波, 潘峰, 蒋学芹, 黄荣, 谢颖华
      2026, 31(7): 2660-2673. DOI: 10.11834/jig.250353
      窗口移位注意力的两阶段掩码引导汽车表面高光去除网络
      摘要:目的镜面反射会干扰视觉感知系统,降低目标检测和三维重建等任务的性能。尽管现有高光去除方法已有进展,但大多依赖合成数据训练,难以有效处理真实场景中的反射。针对这一问题,本文构建了多光照条件下的汽车高光数据集,并提出掩码引导的高光去除网络(mask guided Transformer U-Net,MG-TransUNet),显著提升高光去除效果。方法首先,构建了汽车高光数据集,覆盖多种光照条件及不同强度、分布的高光图像对,并提供高光掩码。并且提出协同优化的两阶段网络架构,第1阶段采用轻量级U形网络(U-shaped network,U-Net)实现高光检测,生成高光区域掩码;第2阶段将掩码作为空间先验,指导基于改进型窗口移位注意力(shifted window attention Transformer,SWAT)的U-Net高光去除网络。通过端到端联合训练,实现检测与去除网络的参数协同优化。结果本文在自建数据集和3个公开数据集PSD(paired specular-diffuse image dataset)、SHIQ(specular highlight image quadruples)和SSHR(synthetic specular highlight removal dataset)上进行了系统评估,与8种先进方法进行对比。在PSD数据集上,本文方法以26.37 dB的峰值信噪比(peak signal-to-noise ratio,PSNR)位列第2;在SHIQ数据集上以35.24 dB的PSNR值优于第2名(34.13 dB)1.11 dB;在SSHR数据集上以36.54 dB的PSNR值领先第2名(36.16 dB)0.38 dB;在自建数据集上以25.14 dB的PSNR值优于第2名(25.03 dB)0.11 dB。此外,消融实验表明掩码引导网络和SWAT模块均能提升高光去除性能。结论本文构建了面向真实场景的汽车高光数据集,提出了基于窗口移位注意力机制的掩码引导网络(MG-TransUNet),本文方法在自建数据集上性能达到最优,并在多个公开数据集上取得了具有竞争力的表现。代码地址:https://github.com/chenWULUQI/MG-Trans_Unet。  
      关键词:高光检测;高光去除;高光数据集;U-Net模型;窗口移位注意力机制   
      71
      |
      170
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 151835511 false
      更新时间:2026-07-20

      虚拟现实与增强现实

    • 面向VR物理实验的虚拟具身交互技术研究 AI导读

      孟启帆, 张怡冉, 张鸿文, 胡晓雁, 骆岩红
      2026, 31(7): 2674-2686. DOI: 10.11834/jig.250425
      面向VR物理实验的虚拟具身交互技术研究
      摘要:目的虚拟现实(virtual reality, VR)在物理实验教学中的应用日益广泛,但现有消费级设备受限于稀疏追踪节点,难以实现自然流畅的全身运动重建,导致用户交互体验不连贯且易引发视觉不适。为此,提出一种高保真的虚拟具身运动解算框架,以解决全身运动重构质量差及交互精度低的问题。方法提出结合骨骼重定向、逆向运动学和数据驱动的虚拟具身运动解算框架,为未来实现多用户协同的虚拟具身交互提供理论依据和实践指导。通过脊柱链和肢体链分离与手部调整方法,优化虚拟具身交互行为,有效提升虚拟具身的生物力学合理性、运动自然性和交互精度,实现其比例动态校准与跨平台模型一致性。结果在定量层面,实验组在“拾杯”任务中平均耗时更短(30.78 s vs 32.00 s);在“按钮”交互任务中优势更明显,尤其是左手操作耗时显著降低(36.45 s vs 38.36 s),完成率由55%提升至70%。在主观层面,实验组在具身感(代理感、自我定位)及空间临场感(参与感、总体沉浸)得分上均显著高于对照组。回归分析(R² = 0.543)进一步揭示了双路径机制:该方法不仅能直接提升交互体验,还能通过增强沉浸感显著减轻晕动症易感人群的视觉不适。结论该框架有效解决了现有技术局限,提升虚拟具身性能与用户体验,其双路径优化机制可推广至化学实验、工程模拟等需高精度交互的VR教育场景,在多用户协同沉浸式教学中应用前景广阔。  
      关键词:虚拟现实 (VR);虚拟具身生成;逆向运动学 (IK);虚拟物理实验;用户体验   
      170
      |
      419
      |
      0
      <HTML>
      <网络PDF><WORD><Meta-XML>
      <引用本文> <批量引用> 143378877 false
      更新时间:2026-07-20
    0