具身智能通过“身体—环境—任务”闭环交互,被视为迈向通用人工智能的核心路径。然而,与模型参数和训练数据的高速扩张形成鲜明对照,其评测体系仍处于“任务碎片化、指标多元化、平台封闭化”的自发状态,造成同一功能在不同研究中的性能差异超过10%,却无法判定来源是算法创新、数据扩充还是评测偏差,严重阻碍了技术迭代与产业落地。本文围绕“从感知到执行”的完整链路,对2020—2025年间发表于CVPR(IEEE/CVF Conference on Computer Vision and Pattern Recognition)、ICRA(IEEE International Conference on Robotics and Automation)、NeurIPS(Conference on Neural Information Processing Systems)等顶级会议与 Nature、IJRR(International Journal of Robotic Research)、JMLR(Journal of Machine Learning Research)等期刊的百余篇文献进行系统梳理,首次提出“静态数据集—仿真平台—真实机器人”三级金字塔式评测范式,并从感知、认知、决策、执行4个环节拆解出20余项核心能力维度与量化指标,分别从方法学假设、适用边界、固有局限和成本—可信度曲线4个角度进行横向对比。本文进一步汇总了46套主流基在数据规模、任务类型、评估指标、开源程度和安全伦理考量等维度的差异。基于此,提出“能力导向、协议统一、三级协同”的未来框架:1)在任务层,由“功能对标”转向“能力对标”,建立可分解、可溯源、可加权的多维误差体系;2)在协议层,制定统一的场景描述、接口规范与指标定义,实现跨平台、跨任务、跨模型的可比性;3)在系统层,构建可远程接入、7 × 24 h运行的共享机器人集群,形成“仿真预训练—真机微调—在线更新”的闭环追踪,降低重复建设成本,打通从实验室到场景落地的“最后一公里”。最后讨论了安全伦理、文化偏见和能效评估等新维度如何纳入量化框架,并给出标准化路线图的短、中、长期目标。本文工作为具身智能从“技术涌现”走向“科学共识”提供了可操作的评测基础设施与参考范式,具体的静态—仿真—真机榜单展示在:https://opencompass.org.cn/embodied-intelligence。
目的针对多类别无监督工业品缺陷检测中,现有重建模型难以兼顾浅层细节特征,且易陷入“捷径学习”导致细粒度缺陷漏检的问题,提出一种语义—细节协同融合的细粒度缺陷检测方法SDSF-ViTAD(Semantic-Detail Synergistic Fusion-ViTAD)。方法首先,采用基于DINO先验的纯视觉Transformer提取多层级密集先验;其次,设计语义—细节协同融合模块SDSFM(Semantic-Detail Synergistic Fusion Module),利用交叉注意力机制实现深浅层特征的对齐,并引入空间感知门控机制动态过滤背景噪声,精准强化细粒度特征;接着,在重建阶段引入基于信息瓶颈的特征扰动机制,切断特征直接复制的通路,并结合Top-K稀疏注意力优化解码过程,强制模型通过全局上下文推断正常模式,从而在推理时显著放大异常区域的重建误差;最后,引入结合难分样本挖掘的余弦距离损失函数,使得模型在训练过程中重点关注难以拟合的正常区域,增强模型对细粒度异常的判别能力。结果在VisA(visual anomaly detection dataset)数据集上的实验结果表明,本文算法与基准模型ViTAD相比,在图像级平均受试者工作特征曲线下面积mAUROC(mean area under the receiver operating characteristic curve)、平均精度mAP(mean average precision )和平均F1分数mF1(mean F1-score)指标上分别提升了3.28%、3.00%和3.70%,在像素级mAP和mF1指标上分别提升了3.84%和2.98%,其中对微小缺陷高度敏感的平均区域重叠率曲线下面积 mAUPRO(mean area under the per-region overlap)指标提升了3.8%,同时,在金属零件缺陷检测MPDD(Metal Parts Defect Detection)和BeanTech异常检测(BeanTech Anomaly Detection, BTAD)公开数据集上的实验进一步证明了该模型在应对不同工业场景多类别统一检测中的通用性与有效性。结论SDSF-ViTAD模型提升了复杂工业场景下的细粒度缺陷检测精度,优于现有主流多类别无监督算法。
目的图像辅助词汇习得是国际中文教育的重要教学策略,但现有提示词生成方法未能有效融合国际中文教育等级标准等领域专业知识,导致所生成图像在词义指向性、认知难度匹配性与教学适用性等方面存在显著不足。针对上述问题,本文提出一种面向国际中文教育词汇图像生成的渐进式提示词扩展模型( Progressive prompt expansion model for vocabulary image generation,PPEM-VIG)。方法PPEM-VIG将词汇的认知等级、难度等级、词性、释义等离散教学要素统一建模为结构化教学要素集,并通过渐进式两阶段优化策略自动生成语义准确、结构规范且教学适用的图像提示词。监督学习阶段基于LLaMA模型以模板结构一致性损失与语言流畅性损失为约束,实现提示词的结构化生成;强化学习阶段基于监督微调LLaMA模型并增加模板内容相关性与基于CLIP的词图语义一致性奖励,对提示词进行深度优化,以实现提示词的拓展生成。结果本文构建了首个面向国际中文教育场景的词汇图像提示词数据集(international chinese language education vocabulary image prompt dataset, ICLE-VIPD)。实验结果表明,PPEM-VIG在模板结构覆盖率、CLIP语义一致性得分、及教师主观评价等核心指标上较最优的基线模型分别提升了4.10%,3.13%,4.54%。结论本文提出的渐进式监督-强化优化范式为词汇教学图像资源智能化生成上提供可借鉴的技术路线。