最新刊期

    王怡琳, 孟瑜, 席智浩, 邓毓弸, 刘帝佑, 陈静波

    DOI:10.11834/jig.250521
    img
    摘要:目的针对高分辨率遥感影像中山区道路因地形复杂、形态多样及背景干扰严重而难以准确提取的问题,以及现有道路提取数据集对山区道路适应性不足的现状,构建了首个覆盖亚洲多国典型山区的高分辨率遥感影像山区道路数据集(AsiaMountain-Road),并提出多分辨率自适应双聚合网络(multi-resolution adaptive feature dual aggregation network,MR-AFDANet)以支持山区道路自动提取算法的研究与应用。方法数据集从亚洲多国典型山区选取了29个高分辨率遥感影像区域,总覆盖面积达1 836 km²。结合道路稀疏、弯曲、遮挡等复杂场景特征进行采样与标注,最终形成涵盖多种地貌和道路类型的山区道路影像与精细标注。基于该数据集,对多种主流遥感道路提取算法进行了系统基准评测,并验证了所提MR-AFDANet模型在复杂山区环境下的分割性能。结果实验表明,现有主流道路提取方法在AsiaMountain-Road数据集上表现出显著差异,其性能受到山区道路狭窄、弯曲、遮挡及多尺度特征的影响较大。该数据集有效揭示了现有算法在复杂山区环境中的局限性,并为算法鲁棒性提升与结构优化提供了基准支持。结论AsiaMountain-Road数据集填补了高分辨率遥感影像山区道路提取领域的基准数据空白,MR-AFDANet模型有效解决了复杂地形下的道路断裂与漏检问题。两者共同为山区遥感影像的智能化解译提供了高质量的数据基础与方法参考。论文相关数据集与代码下载地址:https://cstr.cn/31253.11.sciencedb.j00240.00109和https://github.com/wyl-ucas/AsianMountain-DataSet。  
    关键词:山区道路提取;高分辨率遥感;遥感基准数据集;复杂地形道路检测;深度学习语义分割   
    1
    |
    1
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 170966454 false
    更新时间:2026-09-04

    丘文安, 钱文华, 刘朋, 李华光

    DOI:10.11834/jig.260388
    img
    摘要:目的运动模糊是图像采集过程中常见的退化现象,严重影响着三维场景重建与新视角合成的质量。现有基于三维高斯泼溅的去模糊方法存在两个问题:一是相机轨迹建模缺乏物理一致性保证,二是采用单一变换难以精确描述复杂非匀速运动。方法针对上述问题,提出一种面向运动去模糊的辛几何双路解耦三维高斯泼溅方法。该方法引入哈密顿动力学框架,将相机运动建模为相空间中的位置-动量对偶演化,再利用辛几何微分方程求解器确保相流满足辛保持性质,从物理本质上保证相机运动轨迹的连续性;在此基础上,提出一种物理先验与残差精修协同的双路自适应运动解耦框架,将相机运动分解为提供全局位姿基线的刚体运动分支和补偿细微运动偏差与积分近似误差的残差精修分支,两条支路通过自适应协同组合实现复杂非匀速运动的稳定表达;结果在 Deblur-NeRF 合成/真实数据集和 ExBluRF 极端模糊数据集上进行验证实验,与主流方法相比,在真实数据集和 ExBluRF 数据集上指标均达到最优,在合成数据集上 PSNR 和 LPIPS 达到最优,其中 PSNR 在三个数据集上较次优方法提升分别达0.12 dB、1.75 dB、1.87 dB,在复杂非匀速运动场景下优势尤为明显。结论实验结果表明,所提方法通过辛几何建模与双路解耦策略,有效提升了运动模糊场景下的三维重建质量。  
    关键词:三维高斯泼溅;运动模糊;辛几何;运动解耦;新视角合成   
    14
    |
    7
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 170759934 false
    更新时间:2026-09-03

    李骑宏, 马丙鹏

    DOI:10.11834/jig.260448
    img
    摘要:目的无监督可见光-红外行人重识别(Unsupervised Visible-Infrared Person Re-identification,USVI-ReID)旨在无标注条件下实现跨模态行人匹配。然而,现有方法中的困难样本挖掘策略通常未考虑困难正负样本在对比学习中的不同优化作用,导致模型的类内紧凑性不足且类间分离性有限。针对上述问题,提出一种角色感知难样本建模方法,在嵌入空间中对困难正负样本进行差异化建模,以协同优化类内一致性与类间判别性。方法首先,基于共享伪标签构建模态特定身份中心,并利用同一身份在不同模态中心之间的偏移生成困难正样本,使生成样本能够在保持身份一致性的同时包含更具挑战性的跨模态差异;其次,通过子簇划分与近邻簇搜索,挖掘不同身份间的局部相似关系,并沿近邻簇方向构造困难负样本,以增强模型对易混淆身份的判别能力;此外,受课程学习思想启发,引入渐进式训练策略,通过逐步调整困难样本生成幅度控制训练难度,提高模型优化稳定性。结果在SYSU-MM01和RegDB两个公开可见光-红外行人重识别数据集上的实验结果表明,所提方法能够有效提升无监督跨模态特征学习性能。在SYSU-MM01数据集全搜索模式下,相比现有最优方法,Rank-1和mAP(mean average precision)分别提升5.5%和4.1%;在RegDB数据集的可见光-热成像搜索模式中,Rank-1和mAP分别达到93.0%和86.2%。结论通过区分困难正负样本在对比学习中的优化角色,并针对性地构造跨模态变化样本和类别边界样本,所提方法能够同时增强跨模态一致性和身份判别能力,为无监督可见光-红外行人重识别提供了一种有效的难样本建模策略。  
    关键词:计算机视觉;行人重识别;可见光-红外;无监督学习;难样本学习;对比学习   
    13
    |
    7
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 170759525 false
    更新时间:2026-09-03

    罗维薇, 刘俊彤, 甘博宇

    DOI:10.11834/jig.260327
    img
    摘要:目的空域自适应隐写算法通常根据图像内容复杂度选择嵌入位置,使隐写修改呈现强内容自适应性和稀疏分布特征。由于嵌入扰动幅度较小,隐写残差容易被图像纹理、边缘和背景噪声掩盖,现有隐写分析模型在弱隐写信号检测中仍存在频带信息利用不足、局部噪声与全局上下文联合建模不充分、特征空间判别边界不清晰等问题。针对上述问题,本文提出一种融合等分辨率频带与对比聚类的图像隐写分析网络 CRF-CCNet(Image Steganalysis Network Integrating Equal-resolution Frequency Bands and Contrastive Clustering),以增强模型对微弱隐写残差的表征和判别能力。方法在预处理阶段,本文构建了等分辨率拉普拉斯频带分解模块,在不进行下采样的条件下提取高频、中频和低频残差信息,并在各频带上引入 SRM 高通滤波器组,以增强不同频率成分中的隐写响应;随后通过自适应注意力融合机制动态调整各频带残差的贡献。在特征提取阶段,本文设计多路径特征增强模块,由轻量级 Swin Transformer 路径、深度可分离卷积路径和中央差分卷积路径并行组成,分别用于建模全局上下文关系、提取局部纹理特征以及增强邻域差值和边缘扰动响应,并通过门控机制实现多路径特征融合。在分类优化阶段,引入多尺度对比聚类损失,通过动态类别原型约束载体图像与隐写图像在特征空间中的分布,压缩类内距离并扩大类间间隔,同时利用跨尺度一致性约束保持不同层级隐写特征之间的结构一致性。结果在 BOSSBase 1.01和BOWS2数据集上,采用WOW、HILL和S-UNIWARD三种典型空域自适应隐写算法进行实验。结果表明,在 BOSS+BOWS2 数据集、0.4 bpp 嵌入率条件下,CRF-CCNet对WOW、HILL和S-UNIWARD的检测准确率分别达到 94.81%、89.55% 和 92.47%,较 HSMNet 分别提高0.83、1.55和1.15%。与轻量级隐写分析网络 LWENet 相比,本文方法在 WOW0.4bpp 条件下将检测准确率由90.59%提高至94.81%,提高4.22%;同时参数量由0.82 M降至0.67M,减少约18.3%。在计算复杂度方面,CRF-CCNet的FLOPs为20.25 G,与LWENet的19.45G处于同一量级,推理速度达到82.4FPS。结论CRF-CCNet 通过等分辨率多频带残差建模、多路径特征增强和多尺度对比聚类优化,提高了模型对弱隐写扰动的感知能力和特征判别能力。在保持较低参数量和较高推理效率的同时,所提方法在多种空域自适应隐写算法上取得了较好的检测准确率,可为轻量化图像隐写分析模型设计提供参考。  
    关键词:图像隐写分析;空域自适应隐写;等分辨率频带分解;多路径特征增强;对比聚类   
    12
    |
    8
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 170759474 false
    更新时间:2026-09-03

    刘鹏栋, 林翰冉, 吴茂念, 郑博, 朱绍军, 施星仁

    DOI:10.11834/jig.260410
    img
    摘要:目的夜间甜瓜识别和采摘严重依赖人工光源。不同人工补光配置下,甜瓜果实和茎部的图像表观可能不同,语义分割模型的训练和跨配置测试结果也可能存在差异。为助力夜间农产品识别和采摘,构建了多颜色人工光照甜瓜分割图像数据集MelonNightColor。方法在保持相机位置、拍摄距离和补光灯方位一致的条件下,切换补光灯红、绿、蓝通道配置,获取红、蓝、绿、青、紫、黄、白7种人工补光配置下的夜间甜瓜图像。当前已发布5474张图像及像素级标注(覆盖782个拍摄位置,标注背景、甜瓜果实和茎部3个类别)。以拍摄位置为最小划分单元划分训练集、验证集和测试集,确保同一场景的7种颜色图像不跨集合,并组织为7个单颜色子集和4个组合颜色子集。采用9种代表性语义分割模型进行基线评测,并以UNet构建7×7跨颜色泛化矩阵。结果9种模型在7种光源下的背景、果实和茎部的类别交并比(intersection over union,IoU)均值分别为99.05%、86.39%和38.84%,茎部因形态细长且易受遮挡影响而分割难度最大。白光和黄光下9种模型平均交并比(mean intersection over union,mIoU)均值较高,分别达78.17%和77.94%;红光和蓝光下相对较低,分别为72.93%和73.23%。UNet同颜色测试平均mIoU为80.38%,跨颜色测试平均mIoU为44.25%。该结果显示,在本数据集的设备、品种和采集条件下,不同补光配置及自动成像过程共同作用下,训练与测试补光配置不一致时模型性能出现明显下降。结论MelonNightColor提供了夜间甜瓜多颜色成组图像和像素级标注。未来,数据集MelonNightColor可为特定夜间人工补光条件下的甜瓜语义分割基线评测和跨配置模型研究提供公开数据基础。数据集已在中国科学院科学数据银行公开,数字对象标识符(digital object identifier,DOI)为https://doi.org/10.57760/sciencedb.j00240.00237。  
    关键词:设施农业;夜间图像;甜瓜分割;人工光源;多颜色数据集;语义分割   
    15
    |
    6
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 170759423 false
    更新时间:2026-09-03

    钟可毅, 黄旭慧, 万欢, 缪轩磊, 魏欣

    DOI:10.11834/jig.250632
    img
    摘要:目的肝肿瘤的精确分割常受限于高质量标注数据的稀缺。尽管数据合成技术提供了替代方案,但现有的一些合成方法容易生成缺乏解剖合理性的样本。此外,合成图像中存在的非自然伪影,可能导致模型陷入捷径学习,进而影响其在真实临床数据上的泛化性能。为应对这些挑战,设计一种无需真实肿瘤标注的肝肿瘤分割框架Know2Seg。方法首先,结合相关临床影像知识,在不同的合成环节设置相应约束,实现临床知识引导的合成策略:利用椭球先验与弹性变形等方法生成肿瘤掩膜,通过全变分去噪与小波变换等处理构建多尺度的合成纹理,进而生成符合临床解剖规律的CT(computed tomography)扫描及其分割标签。其次,为缓解合成伪影对模型训练的干扰,利用合成过程的中间态真值,以及模型输出的肿瘤后验概率,作为辅助监督信号。通过基于图像解耦思想的训练架构引导模型将输入图像显式解耦为健康解剖与病灶纹理两个成分,引导模型将注意力从合成伪影转移至深层语义病理特征。结果实验表明,Know2Seg在不使用真实肿瘤标注的前提下,分割性能与同等实验条件下的全监督方法相当,并且优于一些其他的无标注方法。在LiTS数据集上,Know2Seg的Dice相似系数(dice similarity coefficient, DSC)达到62.9%、归一化表面Dice(normalized surface dice, NSD)达到65.5%、表面距离(surface distance, SD)降至14.0 mm、豪斯多夫距离(95% hausdorff distance, HD95)降至40.4 mm。结论本文通过将相关临床影像知识转化为可计算的合成约束,并利用图像解耦思想缓解了捷径学习问题,构建了一个兼顾可解释性与鲁棒性的无标注肿瘤分割框架。  
    关键词:无标注学习;3D肿瘤分割;临床知识;数据合成;图像解耦   
    62
    |
    34
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169636624 false
    更新时间:2026-08-24

    韩涵, 杨创, 荆纬, 王琦

    DOI:10.11834/jig.250621
    img
    摘要:目的现有自然场景文本编辑方法聚焦在仅包含单一文本内容图像块的同语编辑,无法实现跨语言文本编辑。针对此问题,本文提出一种端到端的英文到中文自然场景图像文本寻译框架SceneTrans,实现自然场景图像文本的精准定位、英文到中文的跨语言翻译及视觉风格一致的图像文本编辑。方法以MiniCPM-V 2.6多模态大模型为基线,设计基于位置增强提示模板的微调策略实现文本定位与翻译的联合学习;设计中文字形结构编码器实现中文字形先验的精准建模,引入中文字形识别监督机制保障生成图像文本的字形准确性;为解决领域内文本寻译数据匮乏的难题,构建英中配对的SynthTrans专用数据集,收集多种中英兼容字体,合成了20万对包含弯曲、倾斜等复杂字形变换的英中匹配自然场景文本图像。结果实验在文本检测数据集及自建SynthTrans数据集上与其他方法进行了比较。在图像文本定位任务上,所提方法的F1值接近主流模型的检测效果;在图像文本编辑任务上,所提方法的平均结构相似性(structural similarity index measure,SSIM)达0.622、峰值信噪比(peak signal-to-noise ratio,PSNR)达18.51,文本渲染准确率(accuracy,ACC)值提升至71.13%;整体框架具备高效的自然场景图像文本寻译能力。结论本文所提出的端到端寻译框架,实现了自然场景图像文本“定位-翻译-编辑”的一体化流程,可生成字形精确、与原始图像文本风格一致的中文图像文本,突破了传统方法的无法定位及同语编辑的局限,为自然场景图像文本寻译提供了新的解决方案与数据集支撑。  
    关键词:自然场景图像文本检测;自然场景文本编辑;图像文本寻译;多模态大模型微调;扩散生成   
    44
    |
    31
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169635965 false
    更新时间:2026-08-24

    杨锦旭, 王志远, 赵鹏铖, 陈雁翔

    DOI:10.11834/jig.260297
    img
    摘要:目的当前人工智能生成图像技术在推动高质量视觉内容创作的同时,也带来了信息安全挑战。在图像伪造检测任务中,现有训练与评测数据中的真实图像与伪造图像存在细粒度语义内容差异,使语义内容与真伪标签之间容易形成虚假关联,从而形成语义偏见——这是一种捷径学习现象,即检测器借助真伪图像间易于区分的语义内容差异进行判别,而非真正学习生成过程遗留的伪造痕迹;这意味着检测器在现有基准上借助语义差异取得的高性能,并不能代表其在语义对齐条件下的真实泛化能力。针对以上问题,提出了一种基于语义对齐约束的图像伪造检测数据集与检测基准。方法为解决上述语义偏见问题,本文以实例级语义对齐为约束构建AIGI-Align数据集:将每张真实图像作为语义参照,生成与之在细粒度语义维度上对齐的伪造图像,从数据层面弱化语义偏见的形成条件。具体而言,从ImageNet中筛选真实图像,利用多模态大模型进行语义类别验证,确保真实图像内容与类别标签一致;在此基础上,引入视觉语言模型为真实图像生成细粒度结构化图像描述,并利用这些描述驱动12种生成模型生成与真实图像语义高度对齐的伪造图像。结果实验表明,现有检测器可能利用真伪图像之间的语义差异进行捷径判别,而AIGI-Align能够提高真实图像与伪造图像之间的语义对齐程度,缓解语义偏见对检测器判别过程的干扰,从而提升其跨生成模型泛化能力。在3个公开基准和AIGI-Align基准上对8种代表性检测器进行了泛化性评估,结果显示:在传统训练设置下,部分检测器在语义对齐测试场景中的性能明显下降,说明其原有性能可能部分依赖语义捷径而非对伪造痕迹的鲁棒识别;在引入语义对齐训练数据后,多数检测器在AIGI-Align和公开基准上的跨生成模型检测性能均得到提升。训练数据控制消融进一步表明,实例级语义对齐约束对AIGI检测任务具有实际意义。结论本文构建了一个面向AIGI检测任务的大规模实例级语义对齐数据集AIGI-Align。在训练方面,语义对齐数据能够引导模型关注底层伪造痕迹,降低真伪判别中对语义内容差异的依赖,从而提升对未见生成模型的泛化能力;在评测方面,AIGI-Align测试集提供了控制语义变量的评估场景,能够在削弱语义捷径的条件下评估模型的真实泛化性能,有助于更准确地反映检测器的跨生成模型泛化水平。论文相关数据集地址:https://huggingface.co/datasets/likeYousif617/AIGI-Align。  
    关键词:人工智能生成图像;图像伪造检测;语义偏见;语义对齐;数据集;基准   
    45
    |
    30
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169634666 false
    更新时间:2026-08-24

    张兴鹏, 刘晓鹏, 李伟, 王秋里

    DOI:10.11834/jig.260306
    img
    摘要:目的精准的多模态磁共振脑肿瘤亚区分割对临床诊疗至关重要。但胶质瘤形态异质性强,现有分割网络常面临边界建模困难、空间信息与深层语义特征融合不充分等问题,易在低对比度区域出现定位偏差与拓扑断裂。为此,本文提出一种融合显式边界先验的多模态脑肿瘤分割网络(boundary prior enhanced network,BPE-Net)。方法设计辅助监督边界预测模块(boundary predictor module,BPM),聚合编码器多尺度层级特征提取具有类别感知能力的边界先验,提供类别相关的空间信息;构建边界特征增强模块(edge feature enhancement module,EFM),利用空间-通道解耦注意力机制以残差方式将边界先验融入解码特征,在优化局部拓扑结构的同时保护核心语义表征。引入边界加权Dice损失(boundary weighted Dice loss,BWD),通过像素级权重矩阵强化对模糊边缘像素的约束,缓解传统算法的体积评估偏见。结果在脑肿瘤分割挑战赛(brain tumor segmentation,BraTS)2019和BraTS 2020数据集上与7种主流方法对比,本方法平均Dice相似系数(Dice similarity coefficient,Dice)分别为93.69%和92.51%,平均95%豪斯多夫距离(95% Hausdorff distance,HD95)分别为1.96mm和2.33mm,较最优对比方法Swin-Unet平均Dice分别提高7.43和8.60个百分点,平均HD95分别降低1.23mm和1.43mm;其中增强肿瘤(enhancing tumor,ET)区域的Dice提升最为明显,分别提高9.91和10.43个百分点。结论显式边界引导策略有助于缓解低对比度区域的边界混淆,为医学图像准确分割与复杂拓扑重建提供了一种有效的新方法。本文代码开源在链接:https://www.scidb.cn/s/eeiMBv。  
    关键词:脑肿瘤分割;多模态磁共振成像;边界先验;辅助监督学习;解耦注意力   
    42
    |
    28
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169633234 false
    更新时间:2026-08-24

    邵天翔, 朱松豪, 刘佳伟

    DOI:10.11834/jig.260221
    img
    摘要:针对低光照图像增强任务中缺乏先验约束导致细节丢失与色彩失真,以及提亮易引发噪声放大等问题,本文提出一种基于光照曲线映射与结构保留去噪的非配对无监督低光照图像增强方法。在生成阶段,设计深层特征驱动的非线性光照曲线迭代映射机制,提升细节增强能力并抑制色彩失真;为保障曲线映射所需参数估计,设计多尺度特征提取与抗噪卷积注意力,缓解全局光照感知受限与噪声干扰参数估计问题;设计结合零初始动态残差的半实例归一化机制,抑制提亮导致噪声放大问题。在判别阶段,采用全局-局部双分支架构联合监督图像宏观语义与微观纹理,并提出通道映射一致性与曝光控制等多维联合约束损失。在此联合约束驱动下,模型训练呈现规律性感知-失真演化,据此提取双阶段模型(Ours-F与Ours-P)。实验结果表明,在全参考LOLv2-Real数据集上,Ours-F模型取得峰值信噪比(peak signal-to-noise ratio,PSNR)为21.485dB、结构相似度(structural similarity,SSIM)为0.808以及学习感知图像块相似度(learned perceptual image patch similarity,LPIPS)为0.233,其中PSNR与LPIPS取得了所列无监督方法中的最优值,且SSIM达到次优水平;在五个真实无参考测试集的横向对比中,Ours-P模型取得3.646的平均自然图像质量评价指标(natural image quality evaluator,NIQE)值优于多数对比方法。本方法在有效改善色偏与涂抹伪影的同时,较好地恢复场景光影与真实结构。本文相关代码已开源,获取地址:https://cstr.cn/31253.11.sciencedb.j00240.00280。  
    关键词:低光照图像增强;光照曲线映射;结构保留去噪;多维联合约束损失;半实例归一化   
    68
    |
    32
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169633152 false
    更新时间:2026-08-24

    董沛宇, 王雨森, 白晨希, 翟锐, 吕科

    DOI:10.11834/jig.260326
    img
    摘要:目的医学图像诊断模型易受年龄、性别和种族等人口统计学属性影响,造成子群间诊断性能差异。现有特征层去偏方法多通过对抗学习或相关性约束抑制人口统计学相关信息,但当其与病理特征耦合时,直接抑制可能削弱疾病判别信息,难以兼顾诊断性能与公平性。为此,本文提出一种潜空间条件扩散去偏方法,用于医学图像公平诊断中的特征学习。方法通过双空间正交约束降低潜在病理特征与人口统计学特征的相关性,对初步解耦的病理特征施加受控高斯扰动,以人口统计学属性和扩散时间步为条件完成去噪重构,并采用子群自适应阈值校准预测结果。结果在 CheXpert 的 4 项病理分类任务上,本文方法的准确率(accuracy,Acc)、受试者工作特征曲线下面积(area under the curve,AUC)、交叉子群AUC差异和等机会差异分别为 0.796、0.857、0.058 和 0.108。与 7 种对比方法在相应指标上的最佳平均结果相比,平均准确率和 AUC 分别由 0.781 和 0.841 提高至 0.796 和 0.857,等机会差异由 0.126 降至 0.108,交叉子群 AUC 差异为 0.058,与最佳对比结果持平。在 MIMIC-CXR 跨数据集分布外测试中,相较于公平性表现最佳的对比方法,交叉子群 AUC 差异和等机会差异分别由 0.121 和 0.287 降至 0.085 和 0.166。结论所提出的潜空间条件扩散去偏方法可在保持疾病判别能力的同时减小人口统计学子群间的诊断性能差异,为医学图像公平诊断提供了一种潜空间特征重构的去偏思路。  
    关键词:医学图像;公平诊断;去偏学习;条件扩散模型;人口统计学属性   
    36
    |
    27
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169633072 false
    更新时间:2026-08-24

    黎凯耀, 章帆, 李青, 彭保, 彭小江

    DOI:10.11834/jig.260250
    img
    摘要:目的人脸表情识别(Facial Expression Recognition, FER)是人机交互与情感计算领域的核心技术,在智能监控、教育评估和医疗诊断等方面具有广阔的应用前景。近年来,Vision Transformer(ViT)架构凭借其强大的建模能力以及与多模态大模型良好的兼容性,正逐步取代传统卷积神经网络,成为FER领域的研究热点。然而,现有基于ViT的FER方法在预训练与后训练策略的选择上缺乏系统性探究,不同方法间性能差异显著,且原生ViT模型通常难以直接取得优于CNN或混合架构的识别效果。方法针对上述问题,本文首先系统梳理并实验对比了监督预训练、自监督预训练及多种后训练策略在原生ViT上的适用性。进一步,结合人脸表情识别需捕捉面部细微形变的特性,本文提出一种混合监督对比学习后训练方法,通过在监督对比学习中引入样本混合策略,有效扩展正样本多样性,增强模型对细粒度特征的判别能力。基于系统评估,本文提出掩码图像预训练与混合监督对比学习后训练相结合的原生ViT训练范式MIMIC(Masked Image Pre-training with Mixed Contrastive Learning)。结果在RAF-DB、AffectNet和FERPlus三个基准数据集上的大量实验表明,MIMIC在不引入任何卷积模块或复杂辅助模块的条件下,显著优于现有训练范式,展现出更强的特征学习能力,并随着模型规模增大,该方法未出现明显性能饱和现象,结论MIMIC能够有效提升原生ViT在面部表情识别任务中的特征学习能力,在多个数据集上达到当前最优或相当的性能,验证了预训练与后训练协同优化策略对于提升ViT模型FER性能的有效性。(本文相关代码可见https://github.com/zfkarl/MIMIC/tree/master/Code_for_MIMIC)  
    关键词:人脸表情识别;自监督学习;视觉Transformer;掩码图像建模;对比学习   
    83
    |
    38
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169441296 false
    更新时间:2026-08-20

    王华珍, 吴鹭平, 胡建刚, 孙菁, 赵毅飞

    DOI:10.11834/jig.260196
    img
    摘要:目的图像辅助词汇习得是国际中文教育的重要教学策略,但现有提示词生成方法未能有效融合国际中文教育等级标准等领域专业知识,导致所生成图像在词义指向性、认知难度匹配性与教学适用性等方面存在显著不足。针对上述问题,本文提出一种面向国际中文教育词汇图像生成的渐进式提示词扩展模型( Progressive prompt expansion model for vocabulary image generation,PPEM-VIG)。方法PPEM-VIG将词汇的认知等级、难度等级、词性、释义等离散教学要素统一建模为结构化教学要素集,并通过渐进式两阶段优化策略自动生成语义准确、结构规范且教学适用的图像提示词。监督学习阶段基于LLaMA模型以模板结构一致性损失与语言流畅性损失为约束,实现提示词的结构化生成;强化学习阶段基于监督微调LLaMA模型并增加模板内容相关性与基于CLIP的词图语义一致性奖励,对提示词进行深度优化,以实现提示词的拓展生成。结果本文构建了首个面向国际中文教育场景的词汇图像提示词数据集(international chinese language education vocabulary image prompt dataset, ICLE-VIPD)。实验结果表明,PPEM-VIG在模板结构覆盖率、CLIP语义一致性得分、及教师主观评价等核心指标上较最优的基线模型分别提升了4.10%,3.13%,4.54%。结论本文提出的渐进式监督-强化优化范式为词汇教学图像资源智能化生成上提供可借鉴的技术路线。  
    关键词:国际中文教育;词汇教学;AIGC;图像生成;提示词模型   
    138
    |
    64
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 168489727 false
    更新时间:2026-08-20

    李雨珂, 徐林婧, 石俊飞, 金海燕, 李军怀

    DOI:10.11834/jig.260220
    img
    摘要:目的针对高分辨率极化合成孔径雷达(Polarimetric Synthetic Aperture Radar, PolSAR)图像由于空间非平稳性和散射异质性导致的边界混淆及区域语义不一致问题,提出了一种语义划分与差异化对比学习的 PolSAR 图像分类方法,旨在提升模型对复杂地物的判别能力和边界保持能力。方法首先,以层次语义模型(Hierarchical Semantic Model, HSM)为理论指导,结合超像素分割技术对图像进行语义划分,精准划分边界敏感区域与非边界稳定区域并构建掩码引导机制;其次,设计双分支异构特征提取网络,利用卷积神经网络(Convolutional Neural Network, CNN)捕获边界区域的细粒度散射特征,同时借助基于超像素的图卷积网络(Superpixel-based Graph Convolutional Network, SGCN)建模非边界区域的长程空间依赖关系;最后,引入自适应边界权重的差异化对比学习策略,通过对边界难分样本的强化监督和跨区域特征对齐,实现特征空间的协同优化。结果在三组公开极化 SAR 数据集上进行了实验验证。在西安数据集中,本文算法的总体准确度(Overal Accuracy, OA)达到 94.58%,相较于其他主流对比方法,OA提升了0.57%至5.48%;在Flevoland数据集中,OA达到 99.63%,且在绝大多数地物类别上取得了最优分类精度;在Oberpfaffenhofen数据集中,OA达到98.65%,显著缓解了郊区类别的错分问题。参数分析表明,5%的训练样本比例可有效平衡精度与人工标注成本。结论本文提出的分类方法通过“语义分区-异构建模-对比增强”的深度融合,有效解决了传统方法中区域信息与特征学习脱节的瓶颈,在显著提升分类精度的同时,表现出优良的边界保持能力与空间一致性。  
    关键词:极化合成孔径雷达;图像分类;层次语义模型;区域划分;对比学习;图卷积网络;异构特征融合   
    80
    |
    42
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169441211 false
    更新时间:2026-08-20

    黄京乐, 周四望

    DOI:10.11834/jig.260307
    img
    摘要:目的现有基于卷积网络或Transformer的图像超分辨率方法受限于像素级损失函数的设计,重建结果常出现细节模糊、高频纹理重建不足等问题。近年来扩散模型凭借强大的生成先验在感知质量上取得了显著提升,但在纹理与边缘等细节区域容易生成与输入视觉内容不一致的幻觉纹理。针对上述问题,提出一种双阶段梯度引导的扩散模型图像超分辨率方法,从训练与推理两个阶段同时增强生成过程的视觉一致性。方法训练阶段引入频域视觉一致性损失,通过前向视觉算子刻画高分辨率图像的频谱结构,并将其梯度注入噪声预测,引导模型更准确地重建高频细节;推理阶段基于扩散后验采样,设计测量一致性与流形粘合的双重约束,对每一步潜变量更新进行校正,使采样轨迹既符合观测退化模型,又保持在自然图像分布内。结果在RealSR(real-world super-resolution)和DRealSR(diverse real-world super-resolution)两个数据集上与现有主流方法进行对比实验。客观指标方面,与基线扩散超分辨率方法相比,所提方法在RealSR数据集上的峰值信噪比(peak signal-to-noise ratio,PSNR)提升1.756 dB,结构相似性(structural similarity index measure,SSIM)提升0.0115,感知图像块相似度(learned perceptual image patch similarity,LPIPS)降低2.76%;在DRealSR数据集上PSNR提升2.139 dB,SSIM提升0.0203,LPIPS降低10.88%。主观评价方面,该方法在字符纹理等高频细节区域有效抑制了幻觉伪影,结构准确性与纹理真实感优于对比方法。消融实验验证了各模块的有效性及协同增益。结论所提出的双阶段梯度引导的扩散模型图像超分辨率方法通过训练阶段的频域视觉引导与推理阶段的双重约束后验采样,有效抑制了幻觉纹理,提升了重建结果的保真度与结构一致性,在感知质量与重建保真度的综合权衡上优于现有方法。  
    关键词:图像超分辨率;扩散模型;梯度引导;扩散后验采样;重建保真度   
    143
    |
    76
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 168489697 false
    更新时间:2026-08-20

    周广彬, 杨延伟, 肖照林

    DOI:10.11834/jig.260267
    img
    摘要:目的自动对焦模型训练通常需要带有深度标注的多焦点数据,但真实场景中精准深度标注获取困难。针对该问题,本文提出一种基于Blender的光场重聚焦堆栈数据合成与标注方法,并在此基础上构建单帧图像离焦程度估计网络。方法首先利用Blender物理渲染与光场重聚焦生成多焦点堆栈数据,并同步获得对应的深度标注,构建包含深度信息的多焦点堆栈数据集。随后,针对单张散焦图像推断对焦步长时存在的镜头移动方向二义性问题,设计行进方向判别器,通过图像由外围到中心的深度变化趋势和散焦梯度估计弥散圆斜率符号,以判断镜头移动方向。在确定方向后,构建步长估计器,由单张焦点切片预测到目标聚焦索引所需的移动步长。同时,引入初始透镜对焦索引的轴向位置编码,增强模型对镜头对焦位置的感知能力。结果实验结果表明,在误差容忍度为±4片索引的条件下,本文方法的聚焦索引预测准确率达到96.8%,相比基线方法提高4.6%。在推理效率方面,本文方法无需遍历完整焦点堆栈,推理速度高于传统全栈遍历算法。结论本文所提出的光场自动对焦数据集构建及图像离焦程度估计方法,在数据合成与标注过程中避免了真实采集中机械标定误差和焦点呼吸效应的影响,缓解了自动对焦模型训练中精准深度标注不足的问题,并提升了聚焦索引预测的准确率与对焦控制的执行效率。  
    关键词:自动对焦;光场重聚焦;行进方向判别;弥散圆斜率;步长估计   
    67
    |
    36
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169441125 false
    更新时间:2026-08-20

    刘扬, 邱云飞, 韩雪峰

    DOI:10.11834/jig.260295
    img
    摘要:目的面向移动医疗与边缘部署场景下皮肤病灶分割对低运算量与高可靠性的双重需求,本文聚焦轻量网络在复杂皮肤镜图像中因浅层噪声传递、跨层融合失衡和边界约束不足而导致的结构感知与边界定位退化问题,提出一种选择性传递、自适应融合和聚焦边界监督的高效分割(selective transmission, adaptive fusion, and focused boundary supervision for efficient segmentation,SAFE)范式,并在轻量主干网络上实例化为轻量注意力特征融合与边界感知约束网络(lightweight attention-based feature fusion and boundary-aware constraints network,LEAF-UNet)。方法首先,在编码器与解码器间的跳跃连接路径入口引入轻量通道重标定机制(lightweight attention skip,LAS),利用通道统计信息对进入解码端前的浅层特征进行选择性筛选,从源头抑制毛发、标尺等背景噪声的传播;其次,在跨层特征聚合节点设计门控加权融合机制(gated weighted fusion,GWF),通过自适应权重分配机制动态协调低层纹理与高层语义的贡献度,以缓解固定融合策略下的语义细节失衡问题;最后,在训练过程中引入边界一致性监督(boundary consistency loss,BCL),其利用拉普拉斯算子提取预测掩膜与真实标注的轮廓响应,并通过显式几何一致性约束强化边界区域学习,改善低对比度和模糊边界条件下的病灶轮廓刻画能力。结果在国际皮肤影像协作组织(International Skin Imaging Collaboration,ISIC)2017和2018挑战赛数据集(ISIC2017、ISIC2018)以及PH2数据集上,LEAF-UNet以0.053 M参数量和0.075十亿浮点运算(giga floating-point operations,GFLOPs)分别取得89.50%、90.32%和94.83%的Dice系数,并较高效组增强U形网络(efficient group enhanced U-Net,EGE-UNet)显著降低第95百分位豪斯多夫距离,最大相对降幅约为30.28%。结论LEAF-UNet在保持极低模型复杂度的前提下,有效缓解了轻量模型在复杂场景下的结构感知退化问题,为资源受限环境下的皮肤病灶分割提供了具有参考价值的轻量化方案。本研究的数据集与源代码已发布于 Science Data Bank,访问链接为:https://doi.org/10.57760/sciencedb.j00240.00278。  
    关键词:医学图像分割;皮肤病灶分割;轻量化网络;注意力特征融合;边界感知损失   
    74
    |
    33
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169441081 false
    更新时间:2026-08-20

    张婧楠, 张逢骏

    DOI:10.11834/jig.260289
    img
    摘要:目的针对高分辨率遥感影像在通用多模态大模型中存在视觉token序列过长、细粒度地物信息易丢失、遥感领域知识表达不足等问题,本文构建一种基于检索增强与参数高效微调的遥感影像多任务语义理解框架FM9G4BV-RS。方法该框架以FM9G4BV为基座模型,首先通过自适应高分辨率切片策略将大幅面遥感影像划分为结构保持性较好的图像块序列,并结合Grouped-Query Attention(GQA)提高长视觉序列下的跨模态对齐效率;其次,采用Low-Rank Adaptation(LoRA)对遥感任务相关投影层进行参数高效微调,并利用NF4量化降低模型存储与推理开销;最后,引入Retrieval-Augmented Generation(RAG)机制,将遥感文献、数据集说明和灾害报告等外部知识作为可追溯上下文融入语言生成过程,从而增强模型在专业遥感场景中的语义表达能力。结果在VRSBench视觉语言评测基准上的实验结果表明,FM9G4BV-RS在图像描述、视觉定位和遥感视觉问答任务上均优于基座模型。其中,BLEU-1、BLEU-2和BLEU-4分别达到34.8%、24.2%和10.1%,较基座模型分别提升18.4、16.6和8.4个百分点;METEOR和ROUGE-L分别达到35.6和37.2,较基座模型分别提高10.3和19.4;Acc@0.5(IoU All)达到30.7%,VQA(All)达到47.3%。进一步的组件级消融结果表明,自适应切片、LoRA微调和RAG知识增强对视觉定位、语义生成和问答准确性具有主要贡献,GQA与NF4量化则主要提升长序列推理效率和资源适配能力。结论本文方法能够在不全量重训练基础模型的条件下提升遥感多模态语义理解性能,为大尺寸遥感影像的图文生成、视觉定位、交互式问答和多时相变化理解等任务提供了一种可扩展的轻量化适配方案。  
    关键词:多模态大模型;遥感影像语义理解;检索增强生成(RAG);参数高效微调(LoRA);视觉语言模型;多任务适配   
    53
    |
    36
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169441032 false
    更新时间:2026-08-20

    马向阳, 陈俊英, 闫孟明, 梁栋

    DOI:10.11834/jig.260187
    img
    摘要:针对低光照场景下可见光与红外双模态目标检测中存在的模态干扰、特征选择性不足及边界框回归适应性差等问题,本文构建了任务驱动双模态自适应融合检测网络(Task-driven Dual-modal Adaptive Fusion Detection Network, TDAFNet)。在特征提取阶段,设计动态局部注意力模块(Dynamic Local Attention, DLA),采用恒等与增强双分支并行结构,通过动态非线性压缩机制和自注意力机制抑制低光照噪声,强化目标边缘与纹理表达。在跨模态交互阶段,构建任务感知双模态融合模块(Task-Aware Dual-modal Fusion, TADF),利用CLIP文本编码器提取类别语义作为查询原型,与可见光及红外特征的共享键值对进行交互注意力计算,并辅以多尺度空洞卷积增强语义相关性,实现语义引导的自适应融合。同时,提出自适应归一化EIoU损失(AN-EIoU),引入尺寸归一化、中心偏移及长宽比三个调节因子,对中心距离项和宽高误差项进行结构化调节。在M3FD数据集上,模型的mAP@0.5和mAP@0.5:0.95分别达到89.3%和62.6%;在LLVIP数据集上,对应指标为97.8%和68.3%。融合质量评估中,所提方法在源图像相关差异(SCD)、视觉信息保真度(VIF)、基于梯度的融合质量(Qabf)等多项指标上均优于对比方法。该方法提升了低对比度、弱纹理及遮挡场景下的检测精度与定位能力,为低光照环境下的目标检测提供了一种有效解决方案。  
    关键词:双模态目标检测;跨模态特征融合;动态局部注意力;自适应归一化EIoU损失;低光照场景   
    44
    |
    32
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169440989 false
    更新时间:2026-08-20

    吕佳豪, 赵明华, 胡静, 都双丽, 石程, 陈逸飞, 吕志勇

    DOI:10.11834/jig.260211
    img
    摘要:目的无人机凭借低成本、高分辨率的数据采集能力广泛应用于低空安防巡检,但其航拍视频常面临复杂背景干扰及异常行为捕捉困难的挑战。针对上述问题,提出一种门控空间频率Mamba驱动的无人机视频异常检测方法。方法提出了基于门控空间频率Mamba的轻量化模型GSFMamba。该方法首先利用轻量化ResNet构建多尺度预训练编码器,并配合瓶颈融合层实现连续帧间的跨尺度时序特征聚合;随后,设计了空频双域并行Mamba架构,同步捕获空间全局演化轨迹与频率域细微扰动;最后,通过门控空间频率模块(GSF)实现双域特征的自适应融合。其中可训练参数量仅为2.8M,显著降低了计算资源消耗。结果实验结果表明,GSFMamba在两个无人机基准视频异常检测数据集上均取得了竞争性的AUC指标,在Drone-Anomaly数据集达到72.8%,在UIT-Adrone数据集达到60.7%。在保持高精度的同时,得益于轻量化的参数设计,模型在推理延迟方面表现优异,基于ResNet18模型的推理速度达到102FPS,基于ResNet34模型的推理速度达到89FPS,实现了检测效能与计算速度的最佳平衡。结论实验结果表明,GSFMamba通过空频双域建模与自适应门控机制,有效增强了对复杂环境下异常行为的辨识力。其极低的参数量证明了该方法在无人机边缘侧进行实时、高效异常监测的实用价值与领先性。  
    关键词:无人机;异常检测;低空目标;门控注意力;状态空间模型   
    67
    |
    26
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169440942 false
    更新时间:2026-08-20
0