最新刊期

    李忠伟, 鲍君龙, 乔钲, 许向阳, 齐衍萍, 刘昕, 袁德坤

    DOI:10.11834/jig.260408
    img
    摘要:目的浮游动物显微图像实例分割是实现种类识别、数量统计和形态分析的重要基础。传统人工镜检效率低且主观性强,难以满足大规模监测需求,自动化分析需求日益迫切。然而,图像中存在弱边界目标、背景干扰和目标密集分布等问题,导致现有模型分割精度受限。此外,该领域缺乏大规模像素级实例分割数据集。方法为解决上述问题,构建浮游动物显微图像实例分割数据集(zooplankton microscopic image instance segmentation dataset,ZooMIIS5K),包含 5332 张图像和48类浮游动物的精细像素级标注。在此基础上,提出一种基于分割一切模型(Segment Anything Model,SAM)的浮游动物显微图像实例分割模型(zooplankton microscopic image instance segmentation model,ZooMIIS-SAM)。首先,设计双域融合视觉Transformer(dual-domain fusion vision transformer,DDF-ViT),缓解预训练自然图像域与显微图像域之间的特征偏移;接着设计多尺度融合提示模块(multi-scale fusion prompt module,MSFPM),自动生成视觉提示,引导SAM自动理解海洋浮游动物图像;最后,设计目标感知模块(target-aware perception module,TAPM),利用候选区域信息增强全局特征的实例感知能力,提高密集场景下相邻目标的区分效果。结果在 ZooMIIS5K 数据集上,ZooMIIS-SAM 在所比较的卷积神经网络方法和视觉基础模型方法中取得最佳性能,其掩码平均精度均值(mask mean average precision,mAPmask)达到77.4%。消融实验验证了各模块的有效性,可视化分析表明该方法能够更稳定地聚焦于浮游动物区域。ZooMIIS-SAM 具有应用于实际浮游动物监测场景的潜力。所构建的数据集和提出的方法可为浮游动物目标计数及形态分析提供技术参考。  
    关键词:浮游动物;实例分割;Segment Anything Model;双域特征增强;目标感知   
    1
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 173284371 false
    更新时间:2026-10-08

    黄霄蓥, 张三义, 王玺瑞, 郭晓璇, 张勤, 叶龙

    DOI:10.11834/jig.260441
    img
    摘要:目的现有音乐与舞蹈驱动的自动运镜合成方法主要关注生成与节奏和动作匹配的相机轨迹,缺乏对运镜风格与空间轨迹的显式控制,难以满足专业创作中的精细化编辑需求。方法针对该问题,本文提出多风格舞蹈运镜可控合成框架(controllable dance camera movement synthesis framework,CtrlDanceCam),将风格标签和关键帧相机参数作为用户控制条件。框架包含关键帧预测模块(keyframe prediction module,KPM)和可控轨迹合成模块(controllable trajectory synthesis module,CTSM):KPM基于音乐、舞蹈与风格条件预测符合目标风格的关键帧分布;CTSM以关键帧为锚点,通过风格条件化的可学习插值函数生成完整相机运动轨迹,并支持用户指定关键帧参数进行轨迹控制。进一步设计风格感知对抗训练策略(style-aware adversarial training,SAAT),增强不同运镜风格的区分能力与生成一致性。结果在公开舞蹈-运镜配对数据集上的实验表明,CtrlDanceCam的基于运动学特征的弗雷歇起始距离(Fréchet inception distance,FIDk)为3.022,平均欧氏距离(average Euclidean distance,Distk)为3.101,在提升生成质量的同时保持了良好的轨迹多样性。消融实验和可视化结果进一步验证了各模块及双重控制机制的有效性。结论CtrlDanceCam实现了舞蹈运镜的风格与轨迹双重可控合成,在保证生成质量与轨迹多样性的同时增强了用户编辑能力,可为虚拟制作和数字表演中的自动运镜提供技术支撑。代码开源地址为:https://www.scidb.cn/s/vUr2Av。  
    关键词:舞蹈相机轨迹合成;可控合成;风格感知;对抗训练;关键帧预测;数字人动画;跨模态生成   
    6
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 173276620 false
    更新时间:2026-10-08

    王一飞, 赵联, 李雷, 游书航, 刘帆

    DOI:10.11834/jig.260290
    img
    摘要:目的遥感图像指代分割旨在根据自然语言指令生成目标区域的像素级掩码。然而,通用分割基础模型迁移至遥感场景时,仍面临深层跨模态交互过程中语义约束逐渐衰减、解码阶段层级查询信息利用不充分以及复杂目标边界监督不充分等问题。方法针对上述问题,提出一种用于遥感图像指代分割的语义动态边界增强方法—SDM-SAM2。该框架以SAM2(Segment Anything Model 2)为基础,在图像编码阶段构建阶段感知文本记忆,通过保存并检索不同阶段的文本信息,以维持指代表达约束,从而缓解深层语义传播中的语义衰减问题;在Mask Decoder中引入任务自适应多层查询融合模块,通过可学习层级权重对初始查询和不同解码层查询进行融合,使浅层定位信息与深层语义表征共同参与掩码预测,提升模型对复杂目标的定位与分割能力;同时设计文本加权Sobel边界损失,在连续前景概率图上提取可反向传播的边界响应,并结合文本指定目标对目标轮廓施加显式约束。结果在RefSegRS和RRSIS-D两个数据集上开展实验。完整模型在RefSegRS测试集上取得78.05%的平均交并比(Mean Intersection over Union,mIoU)和84.16%的总体交并比(Overall Intersection over Union,oIoU),在RRSIS-D测试集上取得68.49%的mIoU和78.59%的oIoU。两个数据集上的消融结果表明,阶段感知文本记忆、任务自适应多层查询融合和文本加权Sobel边界损失均能从不同环节改善基础模型;其中,阶段感知文本记忆在两个数据集上均取得最高的单模块mIoU。不同边界算子对比结果表明,Sobel算子取得了三种候选算子中最高的mIoU。结论SDM-SAM2从语义保持、动态解码和边界建模三个方面增强了SAM2对遥感图像指代分割任务的适配能力,能够改善复杂遥感场景下文本指定目标的定位和掩码预测效果。代码链接:https://github.com/3038794185-cloud/SDM-SAM2。  
    关键词:遥感图像指代分割;SAM2 (Segment Anything Model 2);视觉语言融合;阶段文本记忆;查询融合;边界损失   
    3
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 173282069 false
    更新时间:2026-10-08

    吴镇, 陈胜, 程晔

    DOI:10.11834/jig.260131
    img
    摘要:目的精准分割牙齿与牙龈对于牙齿正畸及隐形矫治器的设计至关重要,同时可视化的模拟也能显著提升诊断效率,加强医患沟通。然而,现有研究对缺牙和重叠情况下的分割问题关注较少。为此,本文提出一种名为HaTransTooth的混合深度学习框架。方法总体采用“由粗到细”的策略:首先,通过平行投影将三维扫描模型转换为二维深度图像,并利用改进的YOLOv8(you only look once version 8)检测算法实现牙齿的快速检测和编号,有效解决了三维空间中牙齿实例分离的难题,提升了牙位识别的准确率和效率;随后,通过建立的映射关系,将二维检测区反向投影至三维空间,提取出包含单个牙齿及其周边牙龈的三维感兴趣区域(3D regions of interest, 3D ROI);最后,针对每个3D ROI,引入了分层自适应注意力机制的点云转换网络(point cloud transformer,PCT)进行精细分割,同时使用了Focal Loss和Dice Loss的组合损失函数和梯度累积训练策略。结果实验在自行采集的真实病例数据上与经典的7种方法进行了比较,仅是平均准确率(mean accuracy,mACC)位列第二,达到了96.74%,与第一几乎持平,而平均交并比(mean intersection over union,mIoU)和Dice相似系数(the dice similarity coefficient ,DSC)分别比第二名高出4.86%和2.41%。此外还验证了平均表面距离(average symmetric surface distance,ASSD)、召回率(recall,R值)和F1分数(F1 score),均达到了较高水平,具有较高的临床价值。在公开数据集Teeth3DS(teeth 3D scan dataset)上的交叉验证进一步证明了模型的泛化能力。结论本文提出的框架显著提升了对牙齿-牙龈模糊边界的分割精度,并能准确分割具有缺牙和牙齿重叠情况的牙颌,通过实验表明,此框架在多项指标上优于现有主流方法。  
    关键词:口腔点云;实例分割;缺牙情况;维度转换;目标检测;分层自适应注意力机制   
    4
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 173282032 false
    更新时间:2026-10-08

    方承炀, 章楠, 姜文晖, 刘学林, 方玉明

    DOI:10.11834/jig.260072
    img
    摘要:目的场景文字视频问答是多模态理解领域的关键任务,现有多模态大语言模型在处理长视频时受输入帧数限制,直接输入全部视频帧会导致计算开销大,而均匀采样减少视频帧会导致关键文本信息丢失。为了解决以上问题,本文提出一种文本语义协同筛选与区域感知的场景文字视频问答方法,以提升场景文字视频问答的准确性和效率。方法首先,提出基于文本-语义协同的关键帧选择方法,利用多模态大语言模型生成的候选答案作为语义锚点,通过计算其与场景文本的Levenshtein编辑距离精准选择关键帧,并辅以对比语言-图像预训练(contrastive language–image pre-training,CLIP)补充视觉语义相关帧,以解决视频中细粒度文本信息稀疏容易丢失的问题;同时,设计文字区域感知方法,通过基于掩膜的亮度衰减策略构建视觉“聚光灯”效应,抑制无关背景噪声使模型聚焦文本区域,结合推理的置信度差异动态优选答案,从而提升场景文字视频问答的准确率。结果在M4-ViteVQA(multi-category multi-frame multi-resolution multi-modal benchmark for video text visual question answering)、RoadTextVQA(road text video question answering)和NewsVideoQA(news video question answering)三个公开场景文字视频问答数据集上进行充分实验,所提方法在准确率(accuracy,Acc)指标上分别取得 65.55%、72.03% 和 75.54% 的得分,相比均匀采样基线分别提升了 3.04%、0.76% 和 1.08%,优于现有方法。消融实验进一步验证了关键帧选择模块和文字区域感知模块的有效性。结论本文提出的方法有效解决了场景文字视频问答中计算效率与信息完整性的矛盾,通过文本-语义协同选帧策略增强了对细粒度文本的捕获能力,并通过视觉引导抑制背景噪声,从而提升了场景文字视频问答的准确性与鲁棒性。  
    关键词:场景文字视频问答;关键帧选择;Levenshtein距离;视觉注意力引导;置信度融合   
    3
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 173281991 false
    更新时间:2026-10-08

    吴一键, 刘铁, 陈楠, 丁辉, 邵珠宏

    DOI:10.11834/jig.260263
    img
    摘要:目的针对食道病理图像中细胞密集分布、重叠严重及形态复杂等特点,现有检测与实例分割方法难以兼顾目标定位精度与边界表达能力,多任务学习过程中检测与分割分支之间的特征协同不足,影响复杂病理场景下的识别性能。方法提出一种面向食道病理图像细胞检测与实例分割的协同多任务模型DGSeg-YOLO。在统一网络框架下联合完成细胞检测与实例分割任务,设计双向特征交互模块(bidirectional feature interaction module,BFIM),实现检测与分割分支间的跨任务特征融合;设计自适应检测感知分割模块(adaptive detection-aware segmentation module,ADGS),利用BFIM输出的跨任务交互特征生成目标感知权重,并对分割特征进行自适应加权增强;结合难度感知联合损失函数(difficulty-aware joint loss,DAL),动态协调检测与分割任务优化过程,提高模型对复杂样本的学习能力。结果在自建食道病理细胞数据集上的实验结果表明,DGSeg-YOLO在边界框平均精度均值(box mean average precision,Box mAP)@0.5、掩码平均精度均值(mask mean average precision,Mask mAP)@0.5和Dice指标上分别达到0.900、0.909和0.8351,在细胞密集分布及重叠区域具有较好的检测与实例分割性能。消融实验验证了BFIM、ADGS及DAL各模块对模型性能提升的有效性。同时,所提出模型已集成至食道病理智能分析系统,可实现病理细胞的自动检测、实例分割及统计分析,验证了方法在实际应用中的可行性。结论DGSeg-YOLO通过检测与分割任务间的协同特征学习,增强了复杂病理图像中细胞目标的结构表达与边界刻画能力,在保持模型规模适中的同时兼顾检测性能与工程应用需求,可为食道病理细胞自动分析提供一种有效的技术方案。  
    关键词:深度学习;食道病理图像;目标检测;图像分割;多任务学习   
    5
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 173281954 false
    更新时间:2026-10-08

    林晓, 董大腾, 李岩, 洪璇, 杨启哲

    DOI:10.11834/jig.260323
    img
    摘要:目的针对图像修复中空间异质性退化(同时包含中心区域均匀模糊与边缘区域复杂折射)的难题,现有方法因缺乏退化属性先验与频域建模,难以兼顾两类退化属性的修复需求。为此,提出一种基于空间和频域联合处理与不确定性引导的多尺度稀疏变换器。方法首先设计多尺度物理解耦模块,利用不同膨胀率与核大小的并行卷积分支分别侧重提取全局模糊、过渡细节与高频折射特征;进而引入空间-频域联合处理模块,通过空域深度可分离卷积与频域幅度相位调制互补增强特征表示;在此基础上构建不确定性估计模块,生成空间不确定性图以量化各区域修复难度,并据此设计不确定性引导的稀疏注意力机制,使模型在高不确定性区域保持精细纹理,在低不确定性区域抑制冗余计算。同时,采用融合重建损失与不确定性图正则化的复合损失函数,约束不确定性图聚焦于退化区域。结果在SPAD雨纹数据集和AGAN‑Data雨滴数据集上,所提方法的峰值信噪比(peak signal-to-noise ratio,PSNR)和结构相似性(structural similarity index,SSIM)均优于现有基线模型;在Dense‑Haze真实雾霾数据集上,PSNR达到最优。在雨滴去除任务中,相比对比方法中的最优方法,PSNR指标提升了0.30 dB。消融实验验证了多尺度解耦、空间-频域联合处理及不确定性引导机制对性能的贡献。结论本文提出的空频联合与不确定性引导的多尺度稀疏变换器,能够有效应对空间异质性退化,在雨滴、雨纹和雾霾去除任务上均取得优越的修复效果。实验代码与数据已开源发布(https://doi.org/10.57760/sciencedb.j00240.00269)。  
    关键词:图像修复;空间和频域联合处理;不确定性引导;稀疏注意力;多尺度特征   
    5
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 173281916 false
    更新时间:2026-10-08

    刘学林, 鄢杰斌, 方玉明, 侯敬文, 诸汉炜, 眭相杰

    DOI:10.11834/jig.260101
    img
    摘要:随着多媒体技术的飞速发展,虚拟现实(virtual reality,VR)技术以及沉浸式媒体日益受到重视,已逐渐成为一个重要的研究和开发领域。由360°相机捕获的VR内容,如全景图像和全景视频,相比传统2D视频图像能够提供更为丰富和完整的周围环境细节。凭借其全方位视角与沉浸式的观看体验,全景图像和全景视频能够增强用户的真实性、互动性和沉浸感,因此已在众多领域中得到广泛应用。然而,VR内容的固有球形特性对其存储与传输提出了巨大挑战。此外,在内容采集到终端显示的复杂处理流程中,VR内容都可能引入导致质量下降的潜在因素,这些因素共同影响用户的最终体验。因此,准确描述和量化整个处理流程中感知损伤,并提出有效评价用户体验质量的方法至关重要。早期用户体验质量评价主要依赖吞吐量、带宽、延迟、抖动和丢包率等网络性能参数,但难以全面反映多媒体服务中网络波动对用户体验的影响。为弥补这一不足,体验质量作为关键方案被提出,通常指用户使用应用或服务时的满意程度,受用户期望、个性特征以及当前状态影响。体验质量强调以用户为中心,能更准确地反映整体体验。其量化过程将系统性能与人类感知转化为可测指标,并可通过主观和客观两种方式进行测量。尽管已有不少研究致力于面向VR内容的用户体验质量评价,但目前仍缺乏对这一领域现有方法的系统综述,这一定程度上制约了对该领域的深入理解与分析。本文对面向虚拟现实内容的用户体验质量的最新研究进行全面梳理,旨在推动对该领域的统一认识。首先,通过识别并归类当前虚拟现实内容体验质量评价方法的关键特征,建立了一套分类体系与特征描述,从而构建出用于组织现有方法的结构化框架。进一步地,本文将虚拟现实内容体验质量评价技术划分为两个主要阶段,即主观评价与客观评价。一方面。本文对各类VR内容主观数据集的特点及其构建流程进行了分析,并探讨了影响因素、测试方法、环境设置及评分步骤等关键要素。另一方面,本文根据VR内容的不同表达形式,将面向VR内容的客观体验质量评价方法划分为基于二维平面、基于球面和基于视口的方法三类。其中,基于2D平面的方法主要补偿投影伪影,分为启发式方法和数据驱动方法。基于球面的方法直接在球域操作,采用全局或局部采样策略。基于视口的方法从多视角评价内容质量,按采样策略分为基于规则、关键点和扫视路径三类。在完成各类模型的分类阐述后,还深入剖析了不同方法的优缺点。此外,本文对面向VR内容体验质量评价模型性能的评价指标进行了归纳,并探讨了客观评价模型的实际应用场景。最后,本文对当前面向VR内容的用户体验质量主客观评价研究进行总结,剖析该领域尚未解决的研究局限以及当前面临的障碍,并指出未来可能的发展方向。  
    关键词:虚拟现实;体验质量;质量评价;主观评价;客观评价   
    3
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 173281865 false
    更新时间:2026-10-08

    陈瑜, 卢嘉亮, 励雪巍, 李玺

    DOI:10.11834/jig.260229
    img
    摘要:在自动驾驶、机器人和医疗检测等应用中,单一RGB模态在夜间、低照度以及遮挡等环境下存在显著性能瓶颈,限制其在实际场景中的鲁棒性。红外、深度、激光雷达等异源信息的引入有效缓解了这一问题,但如何高效集成RGB与异源成分,同时滤除无关信息,成为限制RGB-X跨模态交互的关键。现有融合技术主要采用显式交互的方式,即通过元素加、桥接或外接复杂融合模块的方式进行异构模态集成。近年来,视觉基础模型(Vision Foundation Models, VFMs)和视觉语言模型(Vision Language Models, VLMs)等基础模型的出现,为RGB-X融合技术提供了新的研究思路。相较于现有融合方法,这类基础模型凭借较强的通用表征、跨模态理解与知识迁移能力,为专用融合模型提供了新的设计策略与能力增强方式,进一步拓展了RGB-X跨模态融合的研究路径。本文围绕这一前沿方向,对基础模型驱动下的RGB-X跨模态交互技术进行系统综述。首先,梳理RGB-X感知与融合技术的基本原理;其次,基于融合过程中信息交互所处的表示层级,分别从模态级融合、特征级融合及表征级融合三个层面出发,深入剖析现有通专结合的融合方法及各自技术特点;随后,在公开数据集上对代表性方法进行性能对比分析,并讨论上述融合技术在自动驾驶、智能机器人、医疗影像等核心下游感知领域中的应用进展;最后,总结当前技术面临的挑战并展望未来发展方向。区别于现有综述主要关注传统显式融合策略,本文聚焦通用智能驱动的RGB-X融合新范式,系统梳理相关技术路线、代表方法及应用进展,旨在为大模型时代的RGB-X跨模态交互研究提供技术参考与发展思路。本文的参考文献及文中涉及的算法、数据集与评估指标,已整理汇总于https://github.com/yuyuxiazhu-pixel/RGB-X-fusion-technologies。  
    关键词:自动驾驶;跨模态交互;跨模态感知;视觉基础模型;RGB-X融合   
    6
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 173281821 false
    更新时间:2026-10-08

    张琦, 吴子昂, 薛万利, 朱旗, 田春伟, 左旺孟

    DOI:10.11834/jig.260516
    img
    摘要:水下图像增强(underwater image enhancement,UIE)旨在从受吸收、散射、悬浮颗粒及非均匀照明影响的退化图像中恢复清晰、自然的场景图像,以满足下游视觉任务需求。近年来,生成式网络已成为 UIE 研究的重要范式,但现有方法在生成主干、监督方式、物理约束、推理效率及评测口径上差异显著,造成各方法间缺乏可比性。本文围绕基于生成式网络的 UIE 方法开展系统性综述:从水下成像退化机理出发,分析传统物理先验、数据驱动学习与生成式建模之间的演进关系;将现有方法归纳为 生成对抗网络(generative adversarial network,GAN)、Transformer 与 Diffusion 三类范式,并从监督方式、生成机制、物理/语义约束及部署成本等维度进行跨方法对比;结合 水下图像增强基准数据集(underwater image enhancement benchmark dataset,UIEB)、U45与TEST-U90等数据集的定量结果,探讨 峰值信噪比(peak signal-to-noise ratio,PSNR)、结构相似性指数(structural similarity index measure,SSIM)、水下彩色图像质量评价(underwater color image quality evaluation,UCIQE)、水下图像质量评价(underwater image quality measure,UIQM) 等指标之间的分离现象及其对方法选择的影响。实验结果表明,GAN、Transformer 与 Diffusion 分别适用于实时增强、全局一致性建模与高保真恢复等不同需求。未来 UIE 研究应进一步关注复杂退化耦合、跨域泛化、评价协议标准化、轻量化部署及可信可控生成等关键问题。本文可为生成式 UIE 方法的分类理解、实验设计与工程部署提供理论依据与实践指导。  
    关键词:水下图像增强;生成式网络;生成对抗网络;Transformer;扩散模型   
    5
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 173281765 false
    更新时间:2026-10-08

    吕品, 吴一全

    DOI:10.11834/jig.260151
    img
    摘要:低空无人机的“黑飞”“乱飞”对公共安全构成严峻挑战,基于视觉与深度学习的检测跟踪技术因此成为研究焦点。本文系统综述了近5年该领域进展。首先概述无人机类型及其视觉探测特点,接着归纳检测跟踪任务面临的核心挑战。在检测方法部分,重点从改进小目标检测、轻量化网络设计、抗恶劣天气及多模态融合四个方向,梳理了深度学习技术的提升路径;在跟踪方法部分,则从鲁棒性增强、轻量化与实时性、长期跟踪与重识别、多目标跟踪四个维度总结了关键进展。此外,整理了常用数据集与评价指标,并评估了代表性方法性能。最后对未来研究方向进行了展望。  
    关键词:反无人机;低空经济;无人机检测;无人机跟踪;小目标检测;多目标跟踪   
    4
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 173276564 false
    更新时间:2026-10-08

    霍瑛, 谢心怡, 陈晶晶, 封文清

    DOI:10.11834/jig.260161
    img
    摘要:目的针对实时检测Transformer(real-time detection transformer,RT-DETR)在极低比特后训练量化下因权重与激活联合离散化而导致检测精度显著退化的问题,研究一种无需重新训练、适用于边缘部署的低比特量化方法。方法提出权重激活协同自适应量化(weight-activation co-adaptive quantization,WCAQ)框架。该方法构建端到端、无需重新训练的后训练量化流程:权重侧采用分组伪量化以抑制静态离散误差,激活侧将量化置于算子输出端并引入样本自适应尺度调节,结合敏感分支保护和轻量级逐层重构,对双侧量化引起的联合误差进行补偿。结果在COCO 2017(Common Objects in Context)上,WCAQ在8位和6位量化下平均精度(average precision,AP)分别达到46.2%和44.8%,与全精度基线高度相当;在4位极低比特下仍保持28.0%的AP,较最优方法QRT-DETR提高5.4%,克服了传统分离量化导致的精度坍塌。整个量化流程仅需19分钟,较QRT-DETR的110分钟降低约82.7%。结论WCAQ在无需重新训练的前提下实现了接近无损的8位量化和稳定的6位量化,并显著改善了4位量化下RT-DETR的部署可用性,为检测Transformer的边缘低比特部署提供了高效可靠的后训练量化方案。本文方法已发布于ScienceDB,访问链接为:https://doi.org/10.57760/sciencedb.j00240.00092。  
    关键词:实时目标检测;RT-DETR;模型量化;后训练量化;Transformer   
    4
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 173276526 false
    更新时间:2026-10-08

    缪济远, 王适雨, 齐洪钢, 赵地

    DOI:10.11834/jig.260027
    img
    摘要:策略优化(Policy Optimization, PolOpt)是增强大语言模型推理能力的核心技术,广泛应用于从RLHF到DeepSeek-R1等主流模型中。然而,随着PolOpt算法的快速演进,该领域缺乏系统性的梳理与分类,研究人员难以从零散文献中把握技术全貌与发展脉络。本文对PolOpt领域的最新进展进行了系统性综述,覆盖从基础PolOpt(PPO、GRPO)到GRPO变体,再到扩展PolOpt的完整发展谱系。我们提出了一个分层分类框架(B1–B3、C1–C7、D1–D19),从优化范式演进的角度对现有算法进行了有机组织。基于该框架,本文总结了不同算法类别的核心改进维度、适用场景与性能特点,并揭示了当前PolOpt研究面临的三大瓶颈:奖励稀疏性与噪声放大、多目标权重冲突、计算资源与扩展性限制。最后,本文展望了未来在奖励密集化、多目标自适应优化及分布式训练架构等方向的研究机遇。  
    关键词:大语言模型;推理模型;策略优化;综述;分类学   
    3
    |
    1
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 173276479 false
    更新时间:2026-10-08

    徐芳, 徐健, 杨文, 夏桂松

    DOI:10.11834/jig.260390
    img
    摘要:目的现有遥感卫星视频目标跟踪数据集主要面向单星连续观测,受单星短时凝视观测限制,难以支撑长时间目标持续跟踪研究。针对上述问题,本文构建了首个面向多卫星协同观测的多目标跟踪基准数据集BatonTrack1.0。方法基于吉林一号GF03C01、GF03C02和GF03C03三颗视频卫星对同一区域的真实接续成像数据,构建跨卫星多目标跟踪序列。通过动态裁剪方式保留目标在不同卫星观测片段中的运动延续关系,并为每个序列提供标准多目标跟踪标注和跨片段时空关系标注,包括目标位置、身份编号、帧时间戳及片段间投影变换关系。在此基础上,构建仿真多卫星观测数据作为训练数据,并选取12种主流多目标跟踪算法在BatonTrack1.0上进行统一评测,涵盖基于运动建模、外观表征以及运动-外观联合关联的代表性方法。结果BatonTrack1.0共构建8个多目标跟踪序列,标注192架飞机目标,包括静止、起飞、降落、进出港滑行和避让等多种典型运行状态;相邻跨卫星观测片段之间存在明显时间空窗,目标在未观测期间持续运动,跨片段位置和运动状态可能发生显著变化。实验结果表明,现有方法在单个卫星观测片段内能够取得较好的目标定位与短时跟踪效果,但在跨卫星片段切换时难以保持目标身份一致性。结论BatonTrack1.0能够为真实多卫星协同观测条件下的跨卫星目标关联、身份保持和长时间持续跟踪研究提供数据支撑与统一评测基准,推动相关算法的设计、验证与创新,对于支持广域目标持续感知能力建设具有重要意义。数据集获取链接:https://doi.org/10.57760/sciencedb.46325。  
    关键词:目标检测;目标跟踪;多目标跟踪;遥感视频;多卫星协同观测   
    5
    |
    3
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 173276441 false
    更新时间:2026-10-08

    徐光柱, 吴昀其, 柯志, 雷帮军

    DOI:10.11834/jig.260305
    img
    摘要:目的开放场景中,待识别车牌版式多样、字符位数不统一,现有车牌识别算法在通用性、识别精度与推理速度方面通常难以兼顾。另外,双行及复杂背景车牌数据集的匮乏,限制了多类型车牌识别技术的发展。针对上述问题本文提出基于并行编解码架构的广域车牌识别网络,同时提出基于冗余回收策略的多类型车牌数据生成方案。方法首先通过专用轻量级卷积网络,实现车牌字符的多尺度特征高效提取。随后,将骨干网特征送入局部-全局交互模块,通过并行分组Transformer实现局部与全局特征的高效交互建模。接着,经过模态适配器聚合后送入并行查询式非自回归双层解码器,实现先粗后精的递进式匹配识别。数据生成方案通过回收单行测试数据集中的冗余样本,利用其背景及车牌区域的位置参数,结合程序化生成的虚拟目标车牌进行几何贴合,构建虚实结合的多类型车牌实验数据。结果实验在CCPD数据集及通过冗余回收策略构建的混合数据集上开展,并与18种有代表性的开源及闭源算法进行对比,同时在两个公开数据集上进行跨数据集测试。结果表明,所提算法在通用性、识别精度和推理速度上均显著优于对比算法,在CCPD数据集上平均车牌识别准确率为99.05%,模型参数量为1.44 M,推理帧率为208.6 FPS。结论基于冗余回收的数据生成方案有效缓解了多类型车牌样本不足的问题;基于并行编解码架构的轻量级车牌识别网络实现了通用性、准确性与实时性的协同优化,具有良好的理论研究与工程应用价值。  
    关键词:通用车牌识别;开放场景;Transformer;并行编解码架构;双行车牌合成   
    205
    |
    70
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 171109203 false
    更新时间:2026-09-15

    王晨绮, 喻迟槿, 翟明玮, 谭欢, 徐梦文, 黄凯雯, 周涛

    DOI:10.11834/jig.260242
    img
    摘要:半监督学习为缓解医学图像分割中高质量标注数据稀缺的难题提供了重要途径。近年来,伪标签生成、一致性正则化与协同训练等技术在充分挖掘未标注数据潜力、提升模型泛化能力方面取得显著进展。本文系统综述了半监督医学图像分割的关键方法,重点回顾了基于伪标签的方法在高置信度伪监督信号生成、边界感知增强等方面的技术创新;探讨了一致性方法在多域异构性与复杂解剖结构下的改进策略,如多层次特征对齐和不确定性对抗训练;分析了协同训练方法通过多模型协作提升分割稳健性的研究进展。随后,本文深入讨论了当前面临的核心挑战,包括伪标签质量控制、类别不平衡以及数据隐私保护,并展望了未来结合医学知识驱动、自适应阈值策略与隐私保护机器学习的新方向。通过全面梳理现有研究,本文旨在为半监督医学图像分割的持续发展提供系统性参考和研究启示。  
    关键词:半监督学习;医学图像分割;伪标签;一致性正则化;协同训练   
    132
    |
    87
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 171109171 false
    更新时间:2026-09-15

    于英, 柏栋, 张珂, 李凯, 李磊, 李力, 冯新月

    DOI:10.11834/jig.260239
    img
    摘要:目的真实场景下,由于目标自身特性、环境交互及成像条件共同作用,导致军用车辆目标在可见光遥感成像条件下的可分辨性、可分离性显著降低。尽管基于深度学习的遥感图像目标检测技术近年来取得了显著进展,但现有研究对遥感图像特殊性的充分适应、效率与精度的平衡、以及真实场景下的泛化能力等方面,仍有待进一步突破。针对真实场景目标检测的难点,基于YOLOv11(you only look once)算法提出一种雾密度引导的真实场景军用车辆遥感图像检测算法(YOLO for military vehicle detection under foggy conditions, MVF-YOLO)。方法在网络输入端增加一个基于雾密度权重的边缘特征恢复模块(fog density-driven edge restoration, FDER),自适应恢复被雾衰减的边缘信息;在网络颈部设计了空间注意力引导的频域信息选择模块(spatial attention-based frequency selection, SFS),增强高频判别特征并抑制低频噪声,并且利用遥感车辆刚性目标特性和目标长宽比先验知识,使用基于目标长宽比先验的分类损失函数(aspect ratio binary cross-entropy Loss, ar_BCELoss)优化分类精度。结果在MVRSD-V2.0数据集上,所提方法在IoU阈值为0.5时的平均准确率达到87.6%,较基线模型提升4.4%。结论试验结果表明,该方法在真实场景下具有强鲁棒性和军用车辆检测能力。  
    关键词:遥感图像;军用车辆;目标检测;真实场景;雾密度   
    99
    |
    76
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 171109048 false
    更新时间:2026-09-15

    胡静, 吕晓鹏, 王芳, 张睿

    DOI:10.11834/jig.260246
    img
    摘要:目的针对现有半监督语义分割方法特征表达不足,以及全图统一一致性约束易造成语义边界模糊和目标内部预测不连贯的问题,提出空频一致性驱动的半监督语义分割框架SF-Match(Spatial-Frequency Match)。方法以自监督预训练DINOv2为编码器、DPT(Dense Prediction Transformer)为解码器,构建兼顾全局语义与局部细节的密集预测网络;在教师—学生框架中,对CutMix后的强增强图像构造高频和低频视图,并依据教师伪标签的形态学梯度动态生成边界与内部掩膜;分别在边界区域施加高频一致性约束、在内部区域施加低频一致性约束,与RGB全局一致性和监督损失联合优化,实现频域信息与空间语义区域的解耦对齐。结果在Pascal VOC 2012和Cityscapes数据集上开展多标注比例对比、消融、困难类别、复杂度及定性实验。Pascal VOC 2012上,SF-Match的平均交并比(mean Intersection over Union,mIoU)为86.4%~90.6%,较semiVL提高1.9~3.6个百分点,较UniMatch提高9.4~11.2个百分点;Cityscapes上,mIoU为83.6%~85.0%,较各划分下最佳外部对比方法提高3.7~5.1个百分点。消融实验中,Pascal VOC 2012的1/4标注划分下,mIoU由传统基线的77.8%提高至89.6%,表明网络重构与区域化空频对齐具有协同作用。结论目前的实验结果支持SF-Match用于少量像素级标注、较多同域未标注图像且重视边界细节的自然场景和城市街景分割。其区域化空频对齐思想具有扩展至其他教师—学生式分割框架的潜力,但尚需进一步验证;对于高度遮挡、远距离小目标、复杂高频背景和跨领域数据,其有效性仍有限或未得到充分验证,且多视角训练会增加计算量与显存开销。  
    关键词:半监督学习;语义分割;空域-频域一致性;边界感知;视觉Transformer   
    95
    |
    61
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 171109003 false
    更新时间:2026-09-15

    周涛, 陈铮, 沈飞宇, 万之瑜, 吕科, 周涛, 胡伏原, 许铮铧, 李晨

    DOI:10.11834/jig.260378
    img
    摘要:医学图像识别是医学人工智能的重要研究方向,已广泛应用于病灶检测、疾病分类、器官分割和辅助诊断等任务。然而,在医学图像识别中,病灶区域占比小、疾病类别分布不均、跨机构成像差异和标注标准不一致等因素,可能使模型对小病灶、罕见疾病、特定患者群体或特定医疗中心的识别性能下降,并使模型依赖背景、设备和人群属性等与诊断目标无直接关系的信息。针对上述问题,本文围绕医学图像识别中的去偏见方法进行总结。首先,从偏见出现的位置出发,将相关问题归纳为像素级偏见、样本级偏见、特征级偏见和算法级偏见;然后,针对如何提升小病灶的权重的问题,像素级去偏归纳为像素重加权去偏,边界重加权去偏和区域重加权去偏;针对如何提高少数类样本的训练贡献,样本级去偏归纳为样本重平衡去偏和样本扩充与生成去偏;针对如何解决跨域特征分布不均的问题,特征级去偏归纳为特征对齐去偏,特征解耦去偏和知识蒸馏去偏;针对如何解决模型对非目标属性的依赖的问题,算法级去偏归纳为因果约束去偏;最后,本文总结医学图像识别的公平性问题研究在偏见来源、去偏与诊断信息的平衡、生成的医学图像的真实性、跨中心公平性评价体系等方面面临的挑战。本文为医学图像识别中偏见缓解方法的研究与应用提供参考。  
    关键词:公平性问题;像素级偏见;样本级偏见;特征级偏见;算法级偏见   
    99
    |
    67
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 171108935 false
    更新时间:2026-09-15

    林泽辉, 沈忠伟

    DOI:10.11834/jig.260280
    img
    摘要:目的组合零样本学习旨在利用训练阶段已见的状态与物体原语识别测试阶段未见的状态—物体组合。现有基于视觉语言预训练模型的方法主要关注组合语义建模和全局跨模态对齐,但仍存在对训练图像风格分布依赖较强、局部判别区域利用不足等问题,导致模型在未见组合场景下泛化能力受限。方法针对上述问题,提出一种风格解偏与局部语义聚焦相结合的组合零样本学习方法。在视觉编码前端,引入风格解偏模块,通过对中间卷积特征的通道均值和标准差进行随机混合,降低模型对颜色、纹理和背景统计模式的依赖;在跨模态交互阶段,设计文本锚引导的局部语义聚焦模块,利用组合、属性和物体分支的文本原型构造语义锚点,对视觉 patch token 进行相似度计算、Top-K 稀疏筛选和重加权,从而突出与当前语义相关的关键局部区域。在此基础上,结合三分支关系建模框架完成属性、物体和组合的联合匹配预测。结果在 MIT-States、UT-Zappos 和 C-GQA 3个基准数据集上进行闭世界和开放世界实验。闭世界设定下,本文方法在 MIT-States、UT-Zappos 和 C-GQA 上的 AUC 分别达到 22.9%、42.8% 和 13.1%;开放世界设定下,AUC 分别达到 7.8%、33.8% 和 3.24%,均优于基线模型。消融实验表明,风格解偏模块和局部语义聚焦模块均能带来稳定性能提升,二者结合后取得最优结果。结论所提方法能够有效缓解视觉风格偏移对组合识别的影响,并增强模型对局部关键语义证据的关注能力,从而提升组合零样本学习中未见状态—物体组合的识别性能和泛化能力。  
    关键词:组合零样本学习;视觉语言模型;风格解偏;局部语义聚焦;跨模态对齐   
    81
    |
    44
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 171784334 false
    更新时间:2026-09-15
0