最新刊期

    钟可毅, 黄旭慧, 万欢, 缪轩磊, 魏欣

    DOI:10.11834/jig.250632
    img
    摘要:目的肝肿瘤的精确分割常受限于高质量标注数据的稀缺。尽管数据合成技术提供了替代方案,但现有的一些合成方法容易生成缺乏解剖合理性的样本。此外,合成图像中存在的非自然伪影,可能导致模型陷入捷径学习,进而影响其在真实临床数据上的泛化性能。为应对这些挑战,设计一种无需真实肿瘤标注的肝肿瘤分割框架Know2Seg。方法首先,结合相关临床影像知识,在不同的合成环节设置相应约束,实现临床知识引导的合成策略:利用椭球先验与弹性变形等方法生成肿瘤掩膜,通过全变分去噪与小波变换等处理构建多尺度的合成纹理,进而生成符合临床解剖规律的CT(computed tomography)扫描及其分割标签。其次,为缓解合成伪影对模型训练的干扰,利用合成过程的中间态真值,以及模型输出的肿瘤后验概率,作为辅助监督信号。通过基于图像解耦思想的训练架构引导模型将输入图像显式解耦为健康解剖与病灶纹理两个成分,引导模型将注意力从合成伪影转移至深层语义病理特征。结果实验表明,Know2Seg在不使用真实肿瘤标注的前提下,分割性能与同等实验条件下的全监督方法相当,并且优于一些其他的无标注方法。在LiTS数据集上,Know2Seg的Dice相似系数(dice similarity coefficient, DSC)达到62.9%、归一化表面Dice(normalized surface dice, NSD)达到65.5%、表面距离(surface distance, SD)降至14.0 mm、豪斯多夫距离(95% hausdorff distance, HD95)降至40.4 mm。结论本文通过将相关临床影像知识转化为可计算的合成约束,并利用图像解耦思想缓解了捷径学习问题,构建了一个兼顾可解释性与鲁棒性的无标注肿瘤分割框架。  
    关键词:无标注学习;3D肿瘤分割;临床知识;数据合成;图像解耦   
    2
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169636624 false
    更新时间:2026-08-24

    韩涵, 杨创, 荆纬, 王琦

    DOI:10.11834/jig.250621
    img
    摘要:目的现有自然场景文本编辑方法聚焦在仅包含单一文本内容图像块的同语编辑,无法实现跨语言文本编辑。针对此问题,本文提出一种端到端的英文到中文自然场景图像文本寻译框架SceneTrans,实现自然场景图像文本的精准定位、英文到中文的跨语言翻译及视觉风格一致的图像文本编辑。方法以MiniCPM-V 2.6多模态大模型为基线,设计基于位置增强提示模板的微调策略实现文本定位与翻译的联合学习;设计中文字形结构编码器实现中文字形先验的精准建模,引入中文字形识别监督机制保障生成图像文本的字形准确性;为解决领域内文本寻译数据匮乏的难题,构建英中配对的SynthTrans专用数据集,收集多种中英兼容字体,合成了20万对包含弯曲、倾斜等复杂字形变换的英中匹配自然场景文本图像。结果实验在文本检测数据集及自建SynthTrans数据集上与其他方法进行了比较。在图像文本定位任务上,所提方法的F1值接近主流模型的检测效果;在图像文本编辑任务上,所提方法的平均结构相似性(structural similarity index measure,SSIM)达0.622、峰值信噪比(peak signal-to-noise ratio,PSNR)达18.51,文本渲染准确率(accuracy,ACC)值提升至71.13%;整体框架具备高效的自然场景图像文本寻译能力。结论本文所提出的端到端寻译框架,实现了自然场景图像文本“定位-翻译-编辑”的一体化流程,可生成字形精确、与原始图像文本风格一致的中文图像文本,突破了传统方法的无法定位及同语编辑的局限,为自然场景图像文本寻译提供了新的解决方案与数据集支撑。  
    关键词:自然场景图像文本检测;自然场景文本编辑;图像文本寻译;多模态大模型微调;扩散生成   
    2
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169635965 false
    更新时间:2026-08-24

    杨锦旭, 王志远, 赵鹏铖, 陈雁翔

    DOI:10.11834/jig.260297
    img
    摘要:目的当前人工智能生成图像技术在推动高质量视觉内容创作的同时,也带来了信息安全挑战。在图像伪造检测任务中,现有训练与评测数据中的真实图像与伪造图像存在细粒度语义内容差异,使语义内容与真伪标签之间容易形成虚假关联,从而形成语义偏见——这是一种捷径学习现象,即检测器借助真伪图像间易于区分的语义内容差异进行判别,而非真正学习生成过程遗留的伪造痕迹;这意味着检测器在现有基准上借助语义差异取得的高性能,并不能代表其在语义对齐条件下的真实泛化能力。针对以上问题,提出了一种基于语义对齐约束的图像伪造检测数据集与检测基准。方法为解决上述语义偏见问题,本文以实例级语义对齐为约束构建AIGI-Align数据集:将每张真实图像作为语义参照,生成与之在细粒度语义维度上对齐的伪造图像,从数据层面弱化语义偏见的形成条件。具体而言,从ImageNet中筛选真实图像,利用多模态大模型进行语义类别验证,确保真实图像内容与类别标签一致;在此基础上,引入视觉语言模型为真实图像生成细粒度结构化图像描述,并利用这些描述驱动12种生成模型生成与真实图像语义高度对齐的伪造图像。结果实验表明,现有检测器可能利用真伪图像之间的语义差异进行捷径判别,而AIGI-Align能够提高真实图像与伪造图像之间的语义对齐程度,缓解语义偏见对检测器判别过程的干扰,从而提升其跨生成模型泛化能力。在3个公开基准和AIGI-Align基准上对8种代表性检测器进行了泛化性评估,结果显示:在传统训练设置下,部分检测器在语义对齐测试场景中的性能明显下降,说明其原有性能可能部分依赖语义捷径而非对伪造痕迹的鲁棒识别;在引入语义对齐训练数据后,多数检测器在AIGI-Align和公开基准上的跨生成模型检测性能均得到提升。训练数据控制消融进一步表明,实例级语义对齐约束对AIGI检测任务具有实际意义。结论本文构建了一个面向AIGI检测任务的大规模实例级语义对齐数据集AIGI-Align。在训练方面,语义对齐数据能够引导模型关注底层伪造痕迹,降低真伪判别中对语义内容差异的依赖,从而提升对未见生成模型的泛化能力;在评测方面,AIGI-Align测试集提供了控制语义变量的评估场景,能够在削弱语义捷径的条件下评估模型的真实泛化性能,有助于更准确地反映检测器的跨生成模型泛化水平。论文相关数据集地址:https://huggingface.co/datasets/likeYousif617/AIGI-Align。  
    关键词:人工智能生成图像;图像伪造检测;语义偏见;语义对齐;数据集;基准   
    2
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169634666 false
    更新时间:2026-08-24

    张兴鹏, 刘晓鹏, 李伟, 王秋里

    DOI:10.11834/jig.260306
    img
    摘要:目的精准的多模态磁共振脑肿瘤亚区分割对临床诊疗至关重要。但胶质瘤形态异质性强,现有分割网络常面临边界建模困难、空间信息与深层语义特征融合不充分等问题,易在低对比度区域出现定位偏差与拓扑断裂。为此,本文提出一种融合显式边界先验的多模态脑肿瘤分割网络(boundary prior enhanced network,BPE-Net)。方法设计辅助监督边界预测模块(boundary predictor module,BPM),聚合编码器多尺度层级特征提取具有类别感知能力的边界先验,提供类别相关的空间信息;构建边界特征增强模块(edge feature enhancement module,EFM),利用空间-通道解耦注意力机制以残差方式将边界先验融入解码特征,在优化局部拓扑结构的同时保护核心语义表征。引入边界加权Dice损失(boundary weighted Dice loss,BWD),通过像素级权重矩阵强化对模糊边缘像素的约束,缓解传统算法的体积评估偏见。结果在脑肿瘤分割挑战赛(brain tumor segmentation,BraTS)2019和BraTS 2020数据集上与7种主流方法对比,本方法平均Dice相似系数(Dice similarity coefficient,Dice)分别为93.69%和92.51%,平均95%豪斯多夫距离(95% Hausdorff distance,HD95)分别为1.96mm和2.33mm,较最优对比方法Swin-Unet平均Dice分别提高7.43和8.60个百分点,平均HD95分别降低1.23mm和1.43mm;其中增强肿瘤(enhancing tumor,ET)区域的Dice提升最为明显,分别提高9.91和10.43个百分点。结论显式边界引导策略有助于缓解低对比度区域的边界混淆,为医学图像准确分割与复杂拓扑重建提供了一种有效的新方法。本文代码开源在链接:https://www.scidb.cn/s/eeiMBv。  
    关键词:脑肿瘤分割;多模态磁共振成像;边界先验;辅助监督学习;解耦注意力   
    3
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169633234 false
    更新时间:2026-08-24

    邵天翔, 朱松豪, 刘佳伟

    DOI:10.11834/jig.260221
    img
    摘要:针对低光照图像增强任务中缺乏先验约束导致细节丢失与色彩失真,以及提亮易引发噪声放大等问题,本文提出一种基于光照曲线映射与结构保留去噪的非配对无监督低光照图像增强方法。在生成阶段,设计深层特征驱动的非线性光照曲线迭代映射机制,提升细节增强能力并抑制色彩失真;为保障曲线映射所需参数估计,设计多尺度特征提取与抗噪卷积注意力,缓解全局光照感知受限与噪声干扰参数估计问题;设计结合零初始动态残差的半实例归一化机制,抑制提亮导致噪声放大问题。在判别阶段,采用全局-局部双分支架构联合监督图像宏观语义与微观纹理,并提出通道映射一致性与曝光控制等多维联合约束损失。在此联合约束驱动下,模型训练呈现规律性感知-失真演化,据此提取双阶段模型(Ours-F与Ours-P)。实验结果表明,在全参考LOLv2-Real数据集上,Ours-F模型取得峰值信噪比(peak signal-to-noise ratio,PSNR)为21.485dB、结构相似度(structural similarity,SSIM)为0.808以及学习感知图像块相似度(learned perceptual image patch similarity,LPIPS)为0.233,其中PSNR与LPIPS取得了所列无监督方法中的最优值,且SSIM达到次优水平;在五个真实无参考测试集的横向对比中,Ours-P模型取得3.646的平均自然图像质量评价指标(natural image quality evaluator,NIQE)值优于多数对比方法。本方法在有效改善色偏与涂抹伪影的同时,较好地恢复场景光影与真实结构。本文相关代码已开源,获取地址:https://cstr.cn/31253.11.sciencedb.j00240.00280。  
    关键词:低光照图像增强;光照曲线映射;结构保留去噪;多维联合约束损失;半实例归一化   
    3
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169633152 false
    更新时间:2026-08-24

    董沛宇, 王雨森, 白晨希, 翟锐, 吕科

    DOI:10.11834/jig.260326
    img
    摘要:目的医学图像诊断模型易受年龄、性别和种族等人口统计学属性影响,造成子群间诊断性能差异。现有特征层去偏方法多通过对抗学习或相关性约束抑制人口统计学相关信息,但当其与病理特征耦合时,直接抑制可能削弱疾病判别信息,难以兼顾诊断性能与公平性。为此,本文提出一种潜空间条件扩散去偏方法,用于医学图像公平诊断中的特征学习。方法通过双空间正交约束降低潜在病理特征与人口统计学特征的相关性,对初步解耦的病理特征施加受控高斯扰动,以人口统计学属性和扩散时间步为条件完成去噪重构,并采用子群自适应阈值校准预测结果。结果在 CheXpert 的 4 项病理分类任务上,本文方法的准确率(accuracy,Acc)、受试者工作特征曲线下面积(area under the curve,AUC)、交叉子群AUC差异和等机会差异分别为 0.796、0.857、0.058 和 0.108。与 7 种对比方法在相应指标上的最佳平均结果相比,平均准确率和 AUC 分别由 0.781 和 0.841 提高至 0.796 和 0.857,等机会差异由 0.126 降至 0.108,交叉子群 AUC 差异为 0.058,与最佳对比结果持平。在 MIMIC-CXR 跨数据集分布外测试中,相较于公平性表现最佳的对比方法,交叉子群 AUC 差异和等机会差异分别由 0.121 和 0.287 降至 0.085 和 0.166。结论所提出的潜空间条件扩散去偏方法可在保持疾病判别能力的同时减小人口统计学子群间的诊断性能差异,为医学图像公平诊断提供了一种潜空间特征重构的去偏思路。  
    关键词:医学图像;公平诊断;去偏学习;条件扩散模型;人口统计学属性   
    4
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169633072 false
    更新时间:2026-08-24

    黎凯耀, 章帆, 李青, 彭保, 彭小江

    DOI:10.11834/jig.260250
    img
    摘要:目的人脸表情识别(Facial Expression Recognition, FER)是人机交互与情感计算领域的核心技术,在智能监控、教育评估和医疗诊断等方面具有广阔的应用前景。近年来,Vision Transformer(ViT)架构凭借其强大的建模能力以及与多模态大模型良好的兼容性,正逐步取代传统卷积神经网络,成为FER领域的研究热点。然而,现有基于ViT的FER方法在预训练与后训练策略的选择上缺乏系统性探究,不同方法间性能差异显著,且原生ViT模型通常难以直接取得优于CNN或混合架构的识别效果。方法针对上述问题,本文首先系统梳理并实验对比了监督预训练、自监督预训练及多种后训练策略在原生ViT上的适用性。进一步,结合人脸表情识别需捕捉面部细微形变的特性,本文提出一种混合监督对比学习后训练方法,通过在监督对比学习中引入样本混合策略,有效扩展正样本多样性,增强模型对细粒度特征的判别能力。基于系统评估,本文提出掩码图像预训练与混合监督对比学习后训练相结合的原生ViT训练范式MIMIC(Masked Image Pre-training with Mixed Contrastive Learning)。结果在RAF-DB、AffectNet和FERPlus三个基准数据集上的大量实验表明,MIMIC在不引入任何卷积模块或复杂辅助模块的条件下,显著优于现有训练范式,展现出更强的特征学习能力,并随着模型规模增大,该方法未出现明显性能饱和现象,结论MIMIC能够有效提升原生ViT在面部表情识别任务中的特征学习能力,在多个数据集上达到当前最优或相当的性能,验证了预训练与后训练协同优化策略对于提升ViT模型FER性能的有效性。(本文相关代码可见https://github.com/zfkarl/MIMIC/tree/master/Code_for_MIMIC)  
    关键词:人脸表情识别;自监督学习;视觉Transformer;掩码图像建模;对比学习   
    58
    |
    20
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169441296 false
    更新时间:2026-08-20

    王华珍, 吴鹭平, 胡建刚, 孙菁, 赵毅飞

    DOI:10.11834/jig.260196
    img
    摘要:目的图像辅助词汇习得是国际中文教育的重要教学策略,但现有提示词生成方法未能有效融合国际中文教育等级标准等领域专业知识,导致所生成图像在词义指向性、认知难度匹配性与教学适用性等方面存在显著不足。针对上述问题,本文提出一种面向国际中文教育词汇图像生成的渐进式提示词扩展模型( Progressive prompt expansion model for vocabulary image generation,PPEM-VIG)。方法PPEM-VIG将词汇的认知等级、难度等级、词性、释义等离散教学要素统一建模为结构化教学要素集,并通过渐进式两阶段优化策略自动生成语义准确、结构规范且教学适用的图像提示词。监督学习阶段基于LLaMA模型以模板结构一致性损失与语言流畅性损失为约束,实现提示词的结构化生成;强化学习阶段基于监督微调LLaMA模型并增加模板内容相关性与基于CLIP的词图语义一致性奖励,对提示词进行深度优化,以实现提示词的拓展生成。结果本文构建了首个面向国际中文教育场景的词汇图像提示词数据集(international chinese language education vocabulary image prompt dataset, ICLE-VIPD)。实验结果表明,PPEM-VIG在模板结构覆盖率、CLIP语义一致性得分、及教师主观评价等核心指标上较最优的基线模型分别提升了4.10%,3.13%,4.54%。结论本文提出的渐进式监督-强化优化范式为词汇教学图像资源智能化生成上提供可借鉴的技术路线。  
    关键词:国际中文教育;词汇教学;AIGC;图像生成;提示词模型   
    110
    |
    50
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 168489727 false
    更新时间:2026-08-20

    李雨珂, 徐林婧, 石俊飞, 金海燕, 李军怀

    DOI:10.11834/jig.260220
    img
    摘要:目的针对高分辨率极化合成孔径雷达(Polarimetric Synthetic Aperture Radar, PolSAR)图像由于空间非平稳性和散射异质性导致的边界混淆及区域语义不一致问题,提出了一种语义划分与差异化对比学习的 PolSAR 图像分类方法,旨在提升模型对复杂地物的判别能力和边界保持能力。方法首先,以层次语义模型(Hierarchical Semantic Model, HSM)为理论指导,结合超像素分割技术对图像进行语义划分,精准划分边界敏感区域与非边界稳定区域并构建掩码引导机制;其次,设计双分支异构特征提取网络,利用卷积神经网络(Convolutional Neural Network, CNN)捕获边界区域的细粒度散射特征,同时借助基于超像素的图卷积网络(Superpixel-based Graph Convolutional Network, SGCN)建模非边界区域的长程空间依赖关系;最后,引入自适应边界权重的差异化对比学习策略,通过对边界难分样本的强化监督和跨区域特征对齐,实现特征空间的协同优化。结果在三组公开极化 SAR 数据集上进行了实验验证。在西安数据集中,本文算法的总体准确度(Overal Accuracy, OA)达到 94.58%,相较于其他主流对比方法,OA提升了0.57%至5.48%;在Flevoland数据集中,OA达到 99.63%,且在绝大多数地物类别上取得了最优分类精度;在Oberpfaffenhofen数据集中,OA达到98.65%,显著缓解了郊区类别的错分问题。参数分析表明,5%的训练样本比例可有效平衡精度与人工标注成本。结论本文提出的分类方法通过“语义分区-异构建模-对比增强”的深度融合,有效解决了传统方法中区域信息与特征学习脱节的瓶颈,在显著提升分类精度的同时,表现出优良的边界保持能力与空间一致性。  
    关键词:极化合成孔径雷达;图像分类;层次语义模型;区域划分;对比学习;图卷积网络;异构特征融合   
    53
    |
    16
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169441211 false
    更新时间:2026-08-20

    黄京乐, 周四望

    DOI:10.11834/jig.260307
    img
    摘要:目的现有基于卷积网络或Transformer的图像超分辨率方法受限于像素级损失函数的设计,重建结果常出现细节模糊、高频纹理重建不足等问题。近年来扩散模型凭借强大的生成先验在感知质量上取得了显著提升,但在纹理与边缘等细节区域容易生成与输入视觉内容不一致的幻觉纹理。针对上述问题,提出一种双阶段梯度引导的扩散模型图像超分辨率方法,从训练与推理两个阶段同时增强生成过程的视觉一致性。方法训练阶段引入频域视觉一致性损失,通过前向视觉算子刻画高分辨率图像的频谱结构,并将其梯度注入噪声预测,引导模型更准确地重建高频细节;推理阶段基于扩散后验采样,设计测量一致性与流形粘合的双重约束,对每一步潜变量更新进行校正,使采样轨迹既符合观测退化模型,又保持在自然图像分布内。结果在RealSR(real-world super-resolution)和DRealSR(diverse real-world super-resolution)两个数据集上与现有主流方法进行对比实验。客观指标方面,与基线扩散超分辨率方法相比,所提方法在RealSR数据集上的峰值信噪比(peak signal-to-noise ratio,PSNR)提升1.756 dB,结构相似性(structural similarity index measure,SSIM)提升0.0115,感知图像块相似度(learned perceptual image patch similarity,LPIPS)降低2.76%;在DRealSR数据集上PSNR提升2.139 dB,SSIM提升0.0203,LPIPS降低10.88%。主观评价方面,该方法在字符纹理等高频细节区域有效抑制了幻觉伪影,结构准确性与纹理真实感优于对比方法。消融实验验证了各模块的有效性及协同增益。结论所提出的双阶段梯度引导的扩散模型图像超分辨率方法通过训练阶段的频域视觉引导与推理阶段的双重约束后验采样,有效抑制了幻觉纹理,提升了重建结果的保真度与结构一致性,在感知质量与重建保真度的综合权衡上优于现有方法。  
    关键词:图像超分辨率;扩散模型;梯度引导;扩散后验采样;重建保真度   
    114
    |
    57
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 168489697 false
    更新时间:2026-08-20

    周广彬, 杨延伟, 肖照林

    DOI:10.11834/jig.260267
    img
    摘要:目的自动对焦模型训练通常需要带有深度标注的多焦点数据,但真实场景中精准深度标注获取困难。针对该问题,本文提出一种基于Blender的光场重聚焦堆栈数据合成与标注方法,并在此基础上构建单帧图像离焦程度估计网络。方法首先利用Blender物理渲染与光场重聚焦生成多焦点堆栈数据,并同步获得对应的深度标注,构建包含深度信息的多焦点堆栈数据集。随后,针对单张散焦图像推断对焦步长时存在的镜头移动方向二义性问题,设计行进方向判别器,通过图像由外围到中心的深度变化趋势和散焦梯度估计弥散圆斜率符号,以判断镜头移动方向。在确定方向后,构建步长估计器,由单张焦点切片预测到目标聚焦索引所需的移动步长。同时,引入初始透镜对焦索引的轴向位置编码,增强模型对镜头对焦位置的感知能力。结果实验结果表明,在误差容忍度为±4片索引的条件下,本文方法的聚焦索引预测准确率达到96.8%,相比基线方法提高4.6%。在推理效率方面,本文方法无需遍历完整焦点堆栈,推理速度高于传统全栈遍历算法。结论本文所提出的光场自动对焦数据集构建及图像离焦程度估计方法,在数据合成与标注过程中避免了真实采集中机械标定误差和焦点呼吸效应的影响,缓解了自动对焦模型训练中精准深度标注不足的问题,并提升了聚焦索引预测的准确率与对焦控制的执行效率。  
    关键词:自动对焦;光场重聚焦;行进方向判别;弥散圆斜率;步长估计   
    36
    |
    14
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169441125 false
    更新时间:2026-08-20

    刘扬, 邱云飞, 韩雪峰

    DOI:10.11834/jig.260295
    img
    摘要:目的面向移动医疗与边缘部署场景下皮肤病灶分割对低运算量与高可靠性的双重需求,本文聚焦轻量网络在复杂皮肤镜图像中因浅层噪声传递、跨层融合失衡和边界约束不足而导致的结构感知与边界定位退化问题,提出一种选择性传递、自适应融合和聚焦边界监督的高效分割(selective transmission, adaptive fusion, and focused boundary supervision for efficient segmentation,SAFE)范式,并在轻量主干网络上实例化为轻量注意力特征融合与边界感知约束网络(lightweight attention-based feature fusion and boundary-aware constraints network,LEAF-UNet)。方法首先,在编码器与解码器间的跳跃连接路径入口引入轻量通道重标定机制(lightweight attention skip,LAS),利用通道统计信息对进入解码端前的浅层特征进行选择性筛选,从源头抑制毛发、标尺等背景噪声的传播;其次,在跨层特征聚合节点设计门控加权融合机制(gated weighted fusion,GWF),通过自适应权重分配机制动态协调低层纹理与高层语义的贡献度,以缓解固定融合策略下的语义细节失衡问题;最后,在训练过程中引入边界一致性监督(boundary consistency loss,BCL),其利用拉普拉斯算子提取预测掩膜与真实标注的轮廓响应,并通过显式几何一致性约束强化边界区域学习,改善低对比度和模糊边界条件下的病灶轮廓刻画能力。结果在国际皮肤影像协作组织(International Skin Imaging Collaboration,ISIC)2017和2018挑战赛数据集(ISIC2017、ISIC2018)以及PH2数据集上,LEAF-UNet以0.053 M参数量和0.075十亿浮点运算(giga floating-point operations,GFLOPs)分别取得89.50%、90.32%和94.83%的Dice系数,并较高效组增强U形网络(efficient group enhanced U-Net,EGE-UNet)显著降低第95百分位豪斯多夫距离,最大相对降幅约为30.28%。结论LEAF-UNet在保持极低模型复杂度的前提下,有效缓解了轻量模型在复杂场景下的结构感知退化问题,为资源受限环境下的皮肤病灶分割提供了具有参考价值的轻量化方案。本研究的数据集与源代码已发布于 Science Data Bank,访问链接为:https://doi.org/10.57760/sciencedb.j00240.00278。  
    关键词:医学图像分割;皮肤病灶分割;轻量化网络;注意力特征融合;边界感知损失   
    43
    |
    15
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169441081 false
    更新时间:2026-08-20

    张婧楠, 张逢骏

    DOI:10.11834/jig.260289
    img
    摘要:目的针对高分辨率遥感影像在通用多模态大模型中存在视觉token序列过长、细粒度地物信息易丢失、遥感领域知识表达不足等问题,本文构建一种基于检索增强与参数高效微调的遥感影像多任务语义理解框架FM9G4BV-RS。方法该框架以FM9G4BV为基座模型,首先通过自适应高分辨率切片策略将大幅面遥感影像划分为结构保持性较好的图像块序列,并结合Grouped-Query Attention(GQA)提高长视觉序列下的跨模态对齐效率;其次,采用Low-Rank Adaptation(LoRA)对遥感任务相关投影层进行参数高效微调,并利用NF4量化降低模型存储与推理开销;最后,引入Retrieval-Augmented Generation(RAG)机制,将遥感文献、数据集说明和灾害报告等外部知识作为可追溯上下文融入语言生成过程,从而增强模型在专业遥感场景中的语义表达能力。结果在VRSBench视觉语言评测基准上的实验结果表明,FM9G4BV-RS在图像描述、视觉定位和遥感视觉问答任务上均优于基座模型。其中,BLEU-1、BLEU-2和BLEU-4分别达到34.8%、24.2%和10.1%,较基座模型分别提升18.4、16.6和8.4个百分点;METEOR和ROUGE-L分别达到35.6和37.2,较基座模型分别提高10.3和19.4;Acc@0.5(IoU All)达到30.7%,VQA(All)达到47.3%。进一步的组件级消融结果表明,自适应切片、LoRA微调和RAG知识增强对视觉定位、语义生成和问答准确性具有主要贡献,GQA与NF4量化则主要提升长序列推理效率和资源适配能力。结论本文方法能够在不全量重训练基础模型的条件下提升遥感多模态语义理解性能,为大尺寸遥感影像的图文生成、视觉定位、交互式问答和多时相变化理解等任务提供了一种可扩展的轻量化适配方案。  
    关键词:多模态大模型;遥感影像语义理解;检索增强生成(RAG);参数高效微调(LoRA);视觉语言模型;多任务适配   
    33
    |
    15
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169441032 false
    更新时间:2026-08-20

    马向阳, 陈俊英, 闫孟明, 梁栋

    DOI:10.11834/jig.260187
    img
    摘要:针对低光照场景下可见光与红外双模态目标检测中存在的模态干扰、特征选择性不足及边界框回归适应性差等问题,本文构建了任务驱动双模态自适应融合检测网络(Task-driven Dual-modal Adaptive Fusion Detection Network, TDAFNet)。在特征提取阶段,设计动态局部注意力模块(Dynamic Local Attention, DLA),采用恒等与增强双分支并行结构,通过动态非线性压缩机制和自注意力机制抑制低光照噪声,强化目标边缘与纹理表达。在跨模态交互阶段,构建任务感知双模态融合模块(Task-Aware Dual-modal Fusion, TADF),利用CLIP文本编码器提取类别语义作为查询原型,与可见光及红外特征的共享键值对进行交互注意力计算,并辅以多尺度空洞卷积增强语义相关性,实现语义引导的自适应融合。同时,提出自适应归一化EIoU损失(AN-EIoU),引入尺寸归一化、中心偏移及长宽比三个调节因子,对中心距离项和宽高误差项进行结构化调节。在M3FD数据集上,模型的mAP@0.5和mAP@0.5:0.95分别达到89.3%和62.6%;在LLVIP数据集上,对应指标为97.8%和68.3%。融合质量评估中,所提方法在源图像相关差异(SCD)、视觉信息保真度(VIF)、基于梯度的融合质量(Qabf)等多项指标上均优于对比方法。该方法提升了低对比度、弱纹理及遮挡场景下的检测精度与定位能力,为低光照环境下的目标检测提供了一种有效解决方案。  
    关键词:双模态目标检测;跨模态特征融合;动态局部注意力;自适应归一化EIoU损失;低光照场景   
    22
    |
    13
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169440989 false
    更新时间:2026-08-20

    吕佳豪, 赵明华, 胡静, 都双丽, 石程, 陈逸飞, 吕志勇

    DOI:10.11834/jig.260211
    img
    摘要:目的无人机凭借低成本、高分辨率的数据采集能力广泛应用于低空安防巡检,但其航拍视频常面临复杂背景干扰及异常行为捕捉困难的挑战。针对上述问题,提出一种门控空间频率Mamba驱动的无人机视频异常检测方法。方法提出了基于门控空间频率Mamba的轻量化模型GSFMamba。该方法首先利用轻量化ResNet构建多尺度预训练编码器,并配合瓶颈融合层实现连续帧间的跨尺度时序特征聚合;随后,设计了空频双域并行Mamba架构,同步捕获空间全局演化轨迹与频率域细微扰动;最后,通过门控空间频率模块(GSF)实现双域特征的自适应融合。其中可训练参数量仅为2.8M,显著降低了计算资源消耗。结果实验结果表明,GSFMamba在两个无人机基准视频异常检测数据集上均取得了竞争性的AUC指标,在Drone-Anomaly数据集达到72.8%,在UIT-Adrone数据集达到60.7%。在保持高精度的同时,得益于轻量化的参数设计,模型在推理延迟方面表现优异,基于ResNet18模型的推理速度达到102FPS,基于ResNet34模型的推理速度达到89FPS,实现了检测效能与计算速度的最佳平衡。结论实验结果表明,GSFMamba通过空频双域建模与自适应门控机制,有效增强了对复杂环境下异常行为的辨识力。其极低的参数量证明了该方法在无人机边缘侧进行实时、高效异常监测的实用价值与领先性。  
    关键词:无人机;异常检测;低空目标;门控注意力;状态空间模型   
    38
    |
    11
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169440942 false
    更新时间:2026-08-20

    刘嘉玲, 张鑫洁, 金琴

    DOI:10.11834/jig.250601
    img
    摘要:主动对话系统旨在赋予机器根据上下文自主发起交互、预测用户需求并提供适时服务的能力,是人机交互与AI智能体(Agent)领域的一个重要研究方向。早期研究主要关注如何引导用户实现系统预设目标,通过生成引导性提问、建议或信息来主动驱动对话进程,相关方法涵盖基于规则的策略设计、强化学习的动作优化及预训练模型的内容生成。然而,主动性不应仅局限于“说什么”,时间感知与时机把握同样是关键维度:过早干预可能造成打扰,过晚响应则失去帮助价值,何时主动介入直接决定了用户体验的成败。近两年来,随着大语言模型的推理能力提升和多模态感知技术的成熟,关注“何时说”的对话研究快速涌现,但现有综述尚未对这一新兴方向进行系统分析,对主动引导方法的最新进展也缺乏及时跟进。因此,本文首先对现有对话系统研究进行了梳理,依据是否引入时序维度这一核心标准,将现有方法划分为意图主动(intentional proactive)与时序主动(temporal proactive)两大类。针对意图主动,本文从以目标为中心和以用户为中心两个视角解析大语言模型时代的建模范式和内容生成机制演进;针对时序主动,本文将其解构为时机预测、策略规划与响应生成三个关键环节,对各类研究工作的核心思想与技术特点进行了阐述与综合分析。在此基础上,本文进一步从LLM支撑角色、模型版本披露与评估可比性三个维度补充比较性讨论。此外,本文列举了当前用于主动对话的基准数据集,从数据规模、对话轮次及应用场景等方面进行了综合比较。最后,本文指出当前主动对话领域面临的数据稀缺、个性化与自适应能力不足、多模态融合局限及主动干预伦理边界模糊等核心挑战,并对未来的研究方向进行了展望。  
    关键词:主动对话;大语言模型;意图主动;时序主动;人机交互;多智能体   
    23
    |
    11
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169440906 false
    更新时间:2026-08-20

    杨洋, 吴一全

    DOI:10.11834/jig.260249
    img
    摘要:多模态表面缺陷检测系统通过整合各类多模态数据,能够有效突破单一模态的信息局限,实现检测精度与泛化能力的显著提升,但同时也引入了多模态数据噪声、模态质量退化、以及多模态对齐与融合偏差等鲁棒性扰动因素,对多模态融合的可靠性提出了严峻挑战。本文聚焦于多模态表面缺陷检测系统鲁棒性这一核心研究对象,围绕表面缺陷检测场景下的鲁棒性定义与评价、关键影响因素与典型鲁棒性挑战,以及相应的鲁棒性优化路径,系统梳理了近三年来国内外相关研究进展。首先,阐述了多模态表面缺陷检测系统的架构及系统鲁棒性定义,并进一步从外部环境工况与硬件设备、内部系统交互与数据处理两个维度对多模态表面缺陷检测系统的鲁棒性影响因素进行了分析。其次,分别针对多模态表面缺陷检测系统的感知层鲁棒性、交互层鲁棒性以及大模型驱动的多模态系统鲁棒性等三个方面,重点探讨了相关鲁棒性问题、挑战及制约因素,并深入总结了对应的鲁棒性增强、应对策略及典型应用案例。随后,围绕表面缺陷检测领域多模态鲁棒性研究的数据集与评价体系,系统剖析了相关公开数据集的特性,以及鲁棒性评价的核心参数与量化方法。最后,结合当前研究现状与实际应用需求,对面向表面缺陷检测领域的多模态鲁棒性技术的未来发展趋势进行了展望。  
    关键词:表面缺陷检测;多模态系统鲁棒性;鲁棒性影响因素;系统感知层鲁棒性;系统交互层鲁棒性;大模型鲁棒性   
    111
    |
    56
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 168490480 false
    更新时间:2026-08-12

    张若楠, 耿莹, 马凯, 周奥临, 刘立波

    DOI:10.11834/jig.260212
    img
    摘要:点云场景识别是三维感知领域的核心方向,本文聚焦于大规模三维点云检索驱动的地点识别与重定位任务,在自动驾驶、机器人导航等传统应用中发挥重要作用,并在低空经济等新兴场景展现出应用潜力。然而,受点云数据稀疏、无序、密度不均及低空复杂环境干扰影响,现有方法在真实动态场景中仍面临三大核心挑战:特征表达存在“语义盲区”、多模态关联存在“关系误区”、系统框架存在“适配限区”。本文从系统综述视角,将方法划分为特征表达、多模态关联及系统框架三类进行梳理,其中,特征表达包括点特征、体素特征与复值域特征表达,多模态关联涵盖点云内部多特征关联、外部输入源关联及多模态特征融合,系统框架分为单模态与多模态框架以适应不同应用场景。结合Oxford、KITTI、nuScenes等典型数据集,本文整理并对比了代表性方法的性能、适用条件及局限,揭示不同技术路线在识别精度、环境适应性、计算复杂度和部署可行性上的权衡。最后,总结研究瓶颈并展望鲁棒表征、多模态融合、通用化框架设计及统一评测体系等方向,为点云场景识别方法的系统理解与应用提供参考。  
    关键词:点云场景识别;特征表达;多模态关联;复值域特征;系统框架   
    100
    |
    56
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 168490432 false
    更新时间:2026-08-12

    赵明明, 张二虎

    DOI:10.11834/jig.260260
    img
    摘要:目的针对多类别无监督工业品缺陷检测中,现有重建模型难以兼顾浅层细节特征,且易陷入“捷径学习”导致细粒度缺陷漏检的问题,提出一种语义—细节协同融合的细粒度缺陷检测方法SDSF-ViTAD(Semantic-Detail Synergistic Fusion-ViTAD)。方法首先,采用基于DINO先验的纯视觉Transformer提取多层级密集先验;其次,设计语义—细节协同融合模块SDSFM(Semantic-Detail Synergistic Fusion Module),利用交叉注意力机制实现深浅层特征的对齐,并引入空间感知门控机制动态过滤背景噪声,精准强化细粒度特征;接着,在重建阶段引入基于信息瓶颈的特征扰动机制,切断特征直接复制的通路,并结合Top-K稀疏注意力优化解码过程,强制模型通过全局上下文推断正常模式,从而在推理时显著放大异常区域的重建误差;最后,引入结合难分样本挖掘的余弦距离损失函数,使得模型在训练过程中重点关注难以拟合的正常区域,增强模型对细粒度异常的判别能力。结果在VisA(visual anomaly detection dataset)数据集上的实验结果表明,本文算法与基准模型ViTAD相比,在图像级平均受试者工作特征曲线下面积mAUROC(mean area under the receiver operating characteristic curve)、平均精度mAP(mean average precision )和平均F1分数mF1(mean F1-score)指标上分别提升了3.28%、3.00%和3.70%,在像素级mAP和mF1指标上分别提升了3.84%和2.98%,其中对微小缺陷高度敏感的平均区域重叠率曲线下面积 mAUPRO(mean area under the per-region overlap)指标提升了3.8%,同时,在金属零件缺陷检测MPDD(Metal Parts Defect Detection)和BeanTech异常检测(BeanTech Anomaly Detection, BTAD)公开数据集上的实验进一步证明了该模型在应对不同工业场景多类别统一检测中的通用性与有效性。结论SDSF-ViTAD模型提升了复杂工业场景下的细粒度缺陷检测精度,优于现有主流多类别无监督算法。  
    关键词:多类别无监督缺陷检测;细粒度缺陷;视觉Transformer;注意力机制;捷径学习;特征扰动   
    102
    |
    58
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 168490349 false
    更新时间:2026-08-12

    白宇帆, 钱文华, 杨荣懿

    DOI:10.11834/jig.260168
    img
    摘要:目的东巴画作为纳西族传统视觉文化的重要载体,具有古朴写意的笔触与鲜明的色彩特征。利用图像生成技术辅助东巴画创作,对其数字传播、风格理解与活态传承具有重要意义。然而,通用扩散模型仅以噪声预测损失为训练目标,缺乏针对艺术化人体结构的显式语义约束,直接应用于东巴画人像生成任务时,生成的结果存在人体结构伪影与风格退化现象,严重影响视觉质量。为此,本文提出一种融合躯体奖励与风格约束的东巴画人像生成方法。方法针对扩散模型生成东巴画人像的结构伪影问题,设计东巴画躯体伪影奖励函数,将人体结构伪影显式建模为奖励信号,引导生成模型向结构合理分布收敛,减少人体结构伪影;针对抑制伪影过程中的风格退化问题,设计东巴画风格约束奖励函数,将风格一致性转化为奖励约束,引导生成模型保持东巴画风格分布,缓解风格退化。在此基础上,提出自适应权重调度策略,动态平衡躯体奖励损失、风格约束损失与噪声预测损失,实现生成过程中结构合理性与风格一致性的协同优化。结果在自建东巴画人像图文数据集上的实验表明,本文方法的风格一致性指标FID(Fréchet inception distance,数值越低表示风格分布匹配度越高)降至0.1164,躯体合理性指标MAF(mean artifact frequency,数值越低表示人体结构伪影越少)降至0.6767,相对基线模型Stable Diffusion v1.5分别降低1.27%和2.39%。客观指标与主观视觉质量评估结果表明,本文方法能有效抑制人体结构伪影并保持东巴画风格一致性。结论本文首次针对东巴画人像生成任务开展系统性研究,有效解决了伪影抑制与风格退化难以兼顾的矛盾,实现了结构合理性与风格一致性的协同优化,为东巴画人像的高保真数字化生成提供了新的技术路径,对东巴画的数字化保护与活态传承具有重要意义。  
    关键词:东巴画;扩散模型;图像生成;人体伪影;风格约束;偏好对齐   
    110
    |
    56
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 168489774 false
    更新时间:2026-08-12
0