摘要:具身智能通过“身体—环境—任务”闭环交互,被视为迈向通用人工智能的核心路径。然而,与模型参数和训练数据的高速扩张形成鲜明对照,其评测体系仍处于“任务碎片化、指标多元化、平台封闭化”的自发状态,造成同一功能在不同研究中的性能差异超过10%,却无法判定来源是算法创新、数据扩充还是评测偏差,严重阻碍了技术迭代与产业落地。本文围绕“从感知到执行”的完整链路,对2020—2025年间发表于CVPR(IEEE/CVF Conference on Computer Vision and Pattern Recognition)、ICRA(IEEE International Conference on Robotics and Automation)、NeurIPS(Conference on Neural Information Processing Systems)等顶级会议与 Nature、IJRR(International Journal of Robotic Research)、JMLR(Journal of Machine Learning Research)等期刊的百余篇文献进行系统梳理,首次提出“静态数据集—仿真平台—真实机器人”三级金字塔式评测范式,并从感知、认知、决策、执行4个环节拆解出20余项核心能力维度与量化指标,分别从方法学假设、适用边界、固有局限和成本—可信度曲线4个角度进行横向对比。本文进一步汇总了46套主流基在数据规模、任务类型、评估指标、开源程度和安全伦理考量等维度的差异。基于此,提出“能力导向、协议统一、三级协同”的未来框架:1)在任务层,由“功能对标”转向“能力对标”,建立可分解、可溯源、可加权的多维误差体系;2)在协议层,制定统一的场景描述、接口规范与指标定义,实现跨平台、跨任务、跨模型的可比性;3)在系统层,构建可远程接入、7 × 24 h运行的共享机器人集群,形成“仿真预训练—真机微调—在线更新”的闭环追踪,降低重复建设成本,打通从实验室到场景落地的“最后一公里”。最后讨论了安全伦理、文化偏见和能效评估等新维度如何纳入量化框架,并给出标准化路线图的短、中、长期目标。本文工作为具身智能从“技术涌现”走向“科学共识”提供了可操作的评测基础设施与参考范式,具体的静态—仿真—真机榜单展示在:https://opencompass.org.cn/embodied-intelligence。
摘要:目的随着人脸美颜技术的广泛应用,社交网络中充斥了大量经过各种类型美颜操作的人脸图像。人脸美颜技术的使用方便快捷,在为用户提升视觉体验的同时,也给数字内容的真实性带来了严峻挑战,并可能应用于网络欺诈、虚假宣传等领域,带来安全隐患。当前研究主要集中于美颜检测领域,即判断图像是否经过美颜处理,而缺乏对如何从美颜图像中复原原始人脸的探索。本文提出了美颜人脸图像复原(face retouching restoration,FRR)方法,旨在去除因美颜处理导致的色彩纹理改变和结构特征扭曲,从而重建原始人脸图像以便于追溯原始身份特征。方法本文提出了基于美颜痕迹引导去噪过程的扩散模型(retouching-guided diffusion model for FRR,RT-FRR)。通过多尺度篡改痕迹提取模块(multi-scale face retouching trace extraction module,FREM)提取美颜图像中的美颜处理痕迹特征,并构建多尺度条件引导机制控制扩散过程。RT-FRR采用残差预测策略,在去噪过程中预测原始人脸图像和美颜图像之间的人脸残差,从而实现面部纹理细节和结构特征的协同恢复。结果在新构建的重度美颜人脸数据集(extremely retouched face dataset,ExRF)和现有公开美颜检测数据集RetouchingFFHQ上分别进行了实验。实验结果表明,相比现有图像复原方案,本文方法在常用图像质量评价指标上有显著提升。对人脸特征相似度的分析也表明本文方法可以有效恢复原始人脸的身份。结论本文所提的RT-FRR能有效预测原始人脸和美颜人脸之间的残差,并在视觉质量和人脸识别准确率方面均表现出色,显著优于基线模型。
摘要:目的图像超分辨重建是计算机视觉领域一个典型低层视觉任务,能够为目标检测、图像分割等高层任务提供更清晰更结构化的输入。基于卷积神经网络(convolutional neural network,CNN)的图像超分辨率模型注重恢复图像的纹理和边缘信息,而基于Transformer的方法能建模全局上下文信息,但是存在注意力权重冗余问题。针对这两种模型的优缺点,设计了一种轻量级图像超分辨率网络。方法首先改进了传统的Transformer,提出了一种稀疏置换自注意力机制,在扩大窗口的同时解决冗余问题。在此基础上,基于CNN构建高频信息增强模块加强模型对局部细节信息的重建。在得到两种结构提取的特征后,提出一种双分支特征融合模块对全局特征和局部特征进行高效融合。结果本文方法在5个公开数据集上与11种先进超分辨方法进行了对比实验。结果表明,在保证模型轻量化的前提下,稀疏置换自注意力网络(sparse and permuted self-attention network,SPSANet)在不同放大倍率和数据集上均取得最优或次优性能。当放大倍率为3时,在Urban100和Manga109数据集上的峰值信噪比(peak signal-to-noise ratio,PSNR)分别较最新的SOTA(state of the art)方法提升了0.15 dB和0.28 dB。主观视觉效果显示,SPSANet在复杂纹理和细节丰富的场景中重建的图像更加清晰、自然。结论本文提出的轻量级稀疏置换自注意力图像超分辨率网络能够在保持较低参数量与计算复杂度的同时,在多个数据集上取得优异的重建效果,展现出良好的泛化性与应用价值。
摘要:目的在自动驾驶场景中,行人尺度变化剧烈、遮挡现象频繁和复杂环境干扰等问题会导致检测性能显著下降。针对这些挑战,提出了一种结合多重频域增强策略与边界感知机制的实时行人检测算法FEBA-DETR(frequency-enhanced and boundary-aware detection Transformer)。方法FEBA-DETR基于RT-DETR(real-time detection Transformer)架构进行改进,通过使用频域增强、边界感知机制以及优化损失函数,提升对小目标的检测能力和遮挡情况下的检测能力。此外,结合频域子带数据增强方法,进一步提升算法在雨、雾、雪和低光照等复杂环境下的检测性能。结果与原RT-DETR算法相比,FEBA-DETR在CityPersons数据集上,AP50(average precision at IoU threshold 0.50 )与AP50:95分别提升2.3%和2%,引入频域子带增强后分别提升3%和2.4%;在代表部分遮挡和严重遮挡的场景中,MR-2(log-average miss rate)分别下降4.92%和2.82%。结论FEBA-DETR算法提升了在自动驾驶场景中对远距离小尺度行人和严重遮挡行人的检测能力,并在复杂环境下也表现出更强的鲁棒性,其性能优势在多组对比实验中得到了充分验证,能有效应对自动驾驶中的行人检测挑战,为自动驾驶系统的安全提供支持。
摘要:目的点云在人体建模和姿态估计中应用广泛,但常因传感器视角和遮挡而局部缺失,影响重建完整性和精度。点云非结构化特性使模型难以准确建模几何结构和拓扑关系,导致失真、模糊或偏差。现有方法在处理严重缺失和复杂姿态时,仍面临结构完整性和几何精度不足的挑战。方法为此,本文提出一种基于蒙皮多人线性(skinned multi-person linear,SMPL)模型拓扑先验的人体重建与点云补全方法。通过引入逐点语义感知的多尺度特征提取机制,增强对局部几何结构的理解能力;在此基础上,利用SMPL的参数化网格先验构建初始人体形变骨架,有效引导缺失区域的结构推理,缓解因信息缺失带来的拓扑歧义;进一步设计顶点偏移感知优化模块,通过学习输入点云与预测网格间的空间残差,实现对人体表面细节的精细化修正。结果实验结果表明,所提方法在SURREAL(synthetic humans for real tasks)和AMASS(archive of motion capture as surface shapes)数据集上均优于现有方法。在SURREAL数据集上,顶点回归误差降低4.6%,姿态估计精度达当前最优的16.2 mm;在AMASS数据集上的倒角距离指标也显著优于现有点云补全算法,进一步验证了所提出框架的良好泛化性与鲁棒性。结论综上所述,将SMPL的拓扑先验有效融入点云重建流程,可显著提升重建质量,尤其在处理非结构化与不完整点云时展现出更强优势。
摘要:目的单幅透视畸变图像的穿衣人体重建在虚拟试衣、数字人制作等应用中具有重要意义。然而,现有方法多采用正交或弱透视投影,忽略真实相机的成像规律,将深度简化为单一缩放因子,难以恢复透视畸变条件下真实的人体三维结构。为解决这一问题,提出一种面向透视图像的三维穿衣人体重建方法PerRec,通过畸变特征解耦与伪多视角约束缓解深度歧义与投影失真。方法首先利用均匀分块与虚拟视角变换解耦图像位置与透视畸变;随后设计多尺度注意力增强网络以强化局部细节表达;并将SMPL网格(skinned multi-person linear model)转化为傅里叶占有率场以提升高频几何重建能力;最后通过伪多视角模块模拟多视角特征以增强对畸变的鲁棒性。结果实验结果表明,PerRec在Thuman2.0和CustomHumans 数据集上均取得显著提升,在倒角距离、法线一致性和点到表面距离等指标上相较现有方法平均提升60%~80%。结论本文方法能够有效解决单幅透视图像下的结构失真问题,为真实场景中的高精度穿衣人体重建提供了可扩展的技术途径。
摘要:目的汉画像石是解读汉代历史文化的珍贵载体。图文检索技术能推动汉代文化研究向数字化转型,为文化保护提供智能化解决方案。然而,现有图文检索方法应用于汉画像石时,存在领域偏移、图像与文本难以对齐等问题。本文提出一种语义增强与文本重组协同的图文检索方法以提高检索的准确性和全面性。方法本文通过编码器分别完成汉画像石图像与文本特征的提取。在图像处理阶段,基于汉画像石图像对应掩膜图像,计算各语义对象权重,进而推导得出注意力权重。通过残差连接获取注意力特征,并将所得注意力权重直接作为语义增强特征。通过多阶段特征融合将原始特征、注意力特征和增强特征融合得到组合特征以丰富特征表示。在文本处理阶段,将文本与提取的图像语义对象嵌入随机提示模板,生成结构更清晰的增强文本,增强文本的语义表达能力。同时,为适配本文数据集结构,提出动态温度调整以及非对称相似度计算的方法,基于特征相似度自适应调整温度。对图像到文本和文本到图像双向的相似度矩阵计算采用不同温度系数以提升跨模态匹配的准确性与稳定性。结果通过本文所提方法验证,文本到图像的检索指标Mean_Recall、Recall@1、Recall@5和Recall@10相较于排名第2的BLIP(bootstrapping language-image pre-training)模型分别提高了15.20%、21.84%、14.29%和9.48%。图像到文本的检索指标Mean_Recall、Recall@1、Recall@5和Recall@10相较于排名第2的X2-VLM(all-in-one pre-trained model for vision-language tasks)模型分别提高了17.47%、23.22%、18.45%和10.72%,汉画像石图文可视化检索也得到了更好的效果。结论本文方法显著增强了模型对汉画像石图像与其描述文本的对齐能力,有效提升了图文检索在准确性、全面性等方面的表现。