摘要:随着人工智能技术在医疗领域的深度融合,基于深度学习的影像分析模型已在多项任务中展现出显著潜力。然而,这类模型的性能严重依赖于大规模、高质量的训练数据,而真实临床环境下的医学数据常面临三大类挑战:数据稀缺、数据异质性以及数据不均衡问题。传统深度学习模型在处理此类复杂数据时,往往表现出过度自信的错误预测,且缺乏对认知不确定性的表达能力,从而为高风险的临床决策带来潜在安全威胁。证据深度学习(evidential deep learning,EDL)作为一种新兴的不确定性量化范式,通过将狄利克雷分布引入到神经网络的输出对预测进行证据建模,能够一定程度上建模偶然不确定性和认知不确定性,这种能力为应对真实复杂医学数据提供了强有力的工具。本文从数据稀缺、数据异质性及数据不均衡这三大挑战的视角切入,系统性地综述了证据深度学习在复杂医学数据下的影像分析应用,并阐明了证据深度学习凭借其不确定性量化和内在的可解释性,在利用无标签数据、检测异常样本、解析并融合冲突证据、识别尾部数据以及仲裁噪声数据等方面展现的核心优势。最后,本文对该领域当前面临的挑战进行了总结,并对未来的研究方向进行了展望,为研究者们提供了一个清晰的路线图,以推动构建更安全、更可靠、更可信的下一代智能医学影像分析系统。本文提及的相关算法已汇总至https://github.com/oscarab/Medical-EDL。
摘要:目的医学图像配准在手术导航、疾病监测和多模态诊断等临床应用中具有关键作用。传统迭代优化方法可解释性强但计算效率低下,深度学习方法存在黑盒特性导致模型的可解释性不足。对此,提出了一种基于模型解耦的深度展开配准网络,旨在兼顾高效计算与模型可解释性。方法首先通过变量松弛将配准问题解耦为相似性约束和形变正则化两个子问题。在此基础上,受深度展开网络的启发,进一步将迭代优化过程映射为多层神经网络。保真项模块用于解决相似性约束子问题,采用基于TransUnet的架构,实现融合局部特征与全局上下文;去噪模块用于解决形变正则化子问题,采用基于残差连接的去噪网络架构近似正则项。两模块协同完成单次交替迭代,并通过级联构成深度展开网络。所提出的深度展开配准网络与迭代优化步骤严格对应,每层操作具有明确物理意义和数学依据,显著提升了模型的可解释性。结果本文方法在LPBA40(laboratory of neuro imaging probabilistic brain atlas)和OASIS(open access series of imaging studies)公开脑部数据集上的戴斯相似系数(Dice similarity coefficient,Dice)分别为70.1%和79.9%,负雅可比矩阵行列式百分比为0.01%,验证了所提方法的有效性。结论提出的基于模型解耦的深度展开配准网络有效融合了传统迭代优化方法与深度学习方法的优势,在保持较高计算效率和精度的同时显著提升了可解释性。
摘要:目的胎儿心脏超声检查是诊断先天性心脏病的重要手段,但由于胎儿心脏体积小、搏动速率高且位置受体位变化影响,5个标准切面的捕捉时效要求高且获取过程重复性差,严重制约了筛查效率。为实现准确、全面的标准切面自动识别,提出一种基于“先检测后分类”策略的胎儿心脏标准切面识别多任务模型FHSP-Net(fetal heart standard planes net)。方法在检测任务中,设计路径交织特征金字塔(path weaved network,PWN)、目标感知增强模块(target-aware enhancer,TAE)并引入均衡损失函数(equalization loss version 2,EQLv2),解决胎心超声检测数据集在多尺度与小目标检测、噪声与伪影干扰、样本数量不均等固有难题,提供精确的第一阶段结果;针对基于解剖结构包含条件的切面识别算法精确率高但召回率低的问题,设计候选视图评分识别算法,在保证高精确率的同时显著提高召回率。结果在测试集上的实验结果表明,FHSP-Net多任务模型在解剖结构检测与标准切面识别任务中均展现出优异性能:检测任务平均精度均值达到0.962,相较基线提升0.027;候选视图评分识别算法较基于解剖结构包含条件的切面识别算法准确率提升0.10。最终,FHSP-Net切面识别准确率高达0.959,较基线与解剖结构包含条件切面识别算法的组合模型准确率提高0.194,验证了其有效性与优越性。结论所提FHSP-Net多任务模型在胎心结构检测和标准切面识别任务上均表现优异,路径交织特征金字塔、目标感知增强模块及均衡损失函数显著提高了结构检测模型的鲁棒性,候选视图评分算法在提升分类准确性与召回率方面展现出显著优势,能为超声智能辅助诊断提供有力支持。
摘要:目的为提升高速公路交通管理效率与道路安全,提出一种面向监控视频的违法停车自动识别方法,以解决车流密集场景中目标遮挡、摄像机透视畸变及夜间光照干扰导致的身份混淆与误判问题。方法引入了双重注意力特征融合结构,增强YOLOv8(you only look once)提取的多尺度特征的表达能力,并将生成的外观特征用于后续的轨迹匹配阶段,从而在保持高效跟踪性能的同时,有效缓解了目标身份混淆与切换的现象。此外,还设计了一种基于帧间位移自适应的判别机制来识别违停行为,有效降低了由视角畸变和边框抖动造成的误判和漏判风险。针对夜间检测的困难,进一步引入基于时间序列信号分析的危险报警闪光灯检测技术,以提升夜间判定的稳定性与准确性,从而增强整体算法的鲁棒性。结果鉴于当前尚无公开可用的高速公路违停检测数据集,结合实际交通管理需求,自主构建覆盖多场景的专用数据集,并在此基础上进行实验验证。结果表明,所提方法能够良好适应不同时间段及复杂条件下的高速公路场景,违停识别准确率达94.79%,召回率达92.86%,F1分数为0.94,显著优于对比方法。所提方法的图像处理速度为32帧/s,满足实时处理需求。结论提出的融合双重注意力特征与时空特征的方法,在高速公路违停识别上成效显著,该研究具备显著的开创性和实践指导意义。
摘要:目的深度视觉模型对大规模标注数据的高度依赖限制了其实际应用。半监督学习为解决这一问题提供了有效途径,其中的FixMatch框架作为一个具有影响力的基线方法,通过弱—强数据增强策略显著提升了无标签数据的利用效率。然而,该框架在训练初期仍存在特征提取不稳定、图像采集/成像差异致使内容—风格信息易被混淆以及单增强视图伪标签噪声累积等问题,严重制约了模型在实际场景中的性能表现。方法提出了FixMatch++框架,对原始FixMatch进行3个方面的改进:1)设计可学习批量归一化模块修正增强策略带来的通道级统计量偏差,结合双尺度并行卷积模块增强多尺度特征提取能力;2)引入内容/风格分离的双分支表征模块进行特征分离,并采用动态残差门控机制优化特征融合过程;3)提出多级别伪标签融合机制,缓解单增强视图导致伪标签噪声累积,将3种增强视图的分类概率加权,并配合类别阈值筛选策略生成可信标签,有效提升了标签的数量和质量。结果在CIFAR-10(Canadian institute for advanced research 10-class dataset)、CIFAR-100(Canadian institute for advanced research 100-class dataset)和SVHN(street view house numbers)3个公开图像数据集上与7个近期主流半监督学习方法MeanTeacher、UDA(unsupervised domain adaptation)、ReMixMatch、FixMatch、FlexMatch、SoftMatch和UES(uncertainty-aware ensemble structure)进行比较,结果表明:FixMatch++方法在3个数据集上表现出较低的分类错误率,整体优于7种基线方法。在低标签量下表现尤其出色,例如,在CIFAR-10数据集250标签下,FixMatch++的分类错误率为4.56%,比7种基线方法降低了0.35%~27.76%。消融实验与可视化分析进一步验证了各模块的合理性和必要性。结论提出的FixMatch++方法在有限标签数据场景下,能够有效扩展可用训练样本规模并提升图像分类性能。
摘要:目的虚拟现实(virtual reality, VR)在物理实验教学中的应用日益广泛,但现有消费级设备受限于稀疏追踪节点,难以实现自然流畅的全身运动重建,导致用户交互体验不连贯且易引发视觉不适。为此,提出一种高保真的虚拟具身运动解算框架,以解决全身运动重构质量差及交互精度低的问题。方法提出结合骨骼重定向、逆向运动学和数据驱动的虚拟具身运动解算框架,为未来实现多用户协同的虚拟具身交互提供理论依据和实践指导。通过脊柱链和肢体链分离与手部调整方法,优化虚拟具身交互行为,有效提升虚拟具身的生物力学合理性、运动自然性和交互精度,实现其比例动态校准与跨平台模型一致性。结果在定量层面,实验组在“拾杯”任务中平均耗时更短(30.78 s vs 32.00 s);在“按钮”交互任务中优势更明显,尤其是左手操作耗时显著降低(36.45 s vs 38.36 s),完成率由55%提升至70%。在主观层面,实验组在具身感(代理感、自我定位)及空间临场感(参与感、总体沉浸)得分上均显著高于对照组。回归分析(R² = 0.543)进一步揭示了双路径机制:该方法不仅能直接提升交互体验,还能通过增强沉浸感显著减轻晕动症易感人群的视觉不适。结论该框架有效解决了现有技术局限,提升虚拟具身性能与用户体验,其双路径优化机制可推广至化学实验、工程模拟等需高精度交互的VR教育场景,在多用户协同沉浸式教学中应用前景广阔。