具身智能通过“身体—环境—任务”闭环交互,被视为迈向通用人工智能的核心路径。然而,与模型参数和训练数据的高速扩张形成鲜明对照,其评测体系仍处于“任务碎片化、指标多元化、平台封闭化”的自发状态,造成同一功能在不同研究中的性能差异超过10%,却无法判定来源是算法创新、数据扩充还是评测偏差,严重阻碍了技术迭代与产业落地。本文围绕“从感知到执行”的完整链路,对2020—2025年间发表于CVPR(IEEE/CVF Conference on Computer Vision and Pattern Recognition)、ICRA(IEEE International Conference on Robotics and Automation)、NeurIPS(Conference on Neural Information Processing Systems)等顶级会议与 Nature、IJRR(International Journal of Robotic Research)、JMLR(Journal of Machine Learning Research)等期刊的百余篇文献进行系统梳理,首次提出“静态数据集—仿真平台—真实机器人”三级金字塔式评测范式,并从感知、认知、决策、执行4个环节拆解出20余项核心能力维度与量化指标,分别从方法学假设、适用边界、固有局限和成本—可信度曲线4个角度进行横向对比。本文进一步汇总了46套主流基在数据规模、任务类型、评估指标、开源程度和安全伦理考量等维度的差异。基于此,提出“能力导向、协议统一、三级协同”的未来框架:1)在任务层,由“功能对标”转向“能力对标”,建立可分解、可溯源、可加权的多维误差体系;2)在协议层,制定统一的场景描述、接口规范与指标定义,实现跨平台、跨任务、跨模型的可比性;3)在系统层,构建可远程接入、7 × 24 h运行的共享机器人集群,形成“仿真预训练—真机微调—在线更新”的闭环追踪,降低重复建设成本,打通从实验室到场景落地的“最后一公里”。最后讨论了安全伦理、文化偏见和能效评估等新维度如何纳入量化框架,并给出标准化路线图的短、中、长期目标。本文工作为具身智能从“技术涌现”走向“科学共识”提供了可操作的评测基础设施与参考范式,具体的静态—仿真—真机榜单展示在:https://opencompass.org.cn/embodied-intelligence。
目的真实场景下,由于目标自身特性、环境交互及成像条件共同作用,导致军用车辆目标在可见光遥感成像条件下的可分辨性、可分离性显著降低。尽管基于深度学习的遥感图像目标检测技术近年来取得了显著进展,但现有研究对遥感图像特殊性的充分适应、效率与精度的平衡、以及真实场景下的泛化能力等方面,仍有待进一步突破。针对真实场景目标检测的难点,基于YOLOv11(you only look once)算法提出一种雾密度引导的真实场景军用车辆遥感图像检测算法(YOLO for military vehicle detection under foggy conditions, MVF-YOLO)。方法在网络输入端增加一个基于雾密度权重的边缘特征恢复模块(fog density-driven edge restoration, FDER),自适应恢复被雾衰减的边缘信息;在网络颈部设计了空间注意力引导的频域信息选择模块(spatial attention-based frequency selection, SFS),增强高频判别特征并抑制低频噪声,并且利用遥感车辆刚性目标特性和目标长宽比先验知识,使用基于目标长宽比先验的分类损失函数(aspect ratio binary cross-entropy Loss, ar_BCELoss)优化分类精度。结果在MVRSD-V2.0数据集上,所提方法在IoU阈值为0.5时的平均准确率达到87.6%,较基线模型提升4.4%。结论试验结果表明,该方法在真实场景下具有强鲁棒性和军用车辆检测能力。