找回密码
 立即注册
科技快报网 首页 科技快报 业界资讯 查看内容
优化技术加持 华硕B860主板双12释放Ultra7 265KF潜力技嘉钛冰雕主板24小时内两破D5内存超频纪录 再创巅峰超能小艺以AI赋能无障碍功能,诠释科技不让任何人掉队《诡秘之主》实机演示 华硕X870/B850主板双12为你揭秘双12装机就选华硕X870、Z890吹雪主板 海景房轻松造美的集团与汇川技术战略携手,构建工业生态新标杆再续华章|悠易科技入选《中国数字营销生态图(2025版)》RoboChallenge测评:π0、π0.5领先,自变量WALL-OSS-Flow零成功率引关注双模沉浸与疾速制霸!ROG电竞显示器提升视觉新体验!正式开售!安吉尔黄金比矿物质水机让“健康好水”成日常标配36 氪WISE2025商业之王年度焦点产品榜单速报Gate 亮相巴西区块链大会,展示 All in Web3 战略与基础设施实力坚守安全行车二十载 | 驾驶员席玉斌获评劳动模范AI守护蔚蓝海域:商汤沙特可持续生态智能平台落地红海跻身新科技百强AI赛道Top13,永洪科技以行动定义AI价值《2077》销量破3500万 华硕B850主板双12带你嗨亚朵酒店提供“隐形摄像头探测仪”借用服务引热议,10月起每店备2台,员工可陪同操作千问接入阿里最强学习大模型,拍题识题更准、解题更细、资料更全京东旅行与尊茂酒店集团深化战略合作 七鲜咖啡在北京辰茂鸿翔酒店正式开业2026站在新周期的起跑线上,突破成长瓶颈 | 密尔克卫集团2026年度预算会

RoboChallenge测评:π0、π0.5领先,自变量WALL-OSS-Flow零成功率引关注

2025-12-04 19:36:00 来自: 中华网

在具身智能竞速加速升温的当下,真实场景的客观评测成为检验机器人模型能力最关键的一环。 

近日,“具身进化论”在查询最新发布的RoboChallenge测试结果时注意到,π0、π0.5 在成功率上遥遥领先其他开源模型。自变量机器人(X Square Robot)的大模型wall-oss-flow虽然在多次企业自我宣传中提到,“基本上和PI、和google在同一个水平线上”,但是在多个任务上成功率偏低。根据公开的测评记录,其在31次测试中大部分成功率为零,这一表现引发业内对其大模型真实能力的讨论。 

RoboChallenge是全球首个具身智能的大规模真机评测平台,也是目前行业内最受关注的真实物理机器人评测平台,由Dexmal原力灵机联合Hugging Face发布,被视作“机器人界的硬核基准”。其最大特点是真机真测:评测同时接入UR5、Franka、Aloha 双臂系统以及国产ARX-5 四类主流机器人,统一软件栈并配备多台RGB-D深度相机,以确保任务在高度一致的物理条件下进行。 

平台的任务覆盖柔性物体处理、双臂协作、多阶段顺序动作等真实世界的关键难点。其中Table30场景包含30个具有代表性的日常任务,包括叠抹布、整理果篮、插花、开关水龙头等,难度从基础操作递进到长链条组合动作。 

据了解,RoboChallenge 之所以被认为更加客观,是因为其采用了 “任务成功率 + 进度评分”的双指标体系。前者统计任务是否完整成功,后者将任务拆解为多个关键阶段并按推进程度累计分值,即便任务未完成也能反映模型做到哪一步,为能力评估提供更细粒度的信息。

在该评测体系中,多款主流开源模型已完成测试。“具身进化论”对比发现,基于Physical Intelligence (Pi)系列构建的π0和π0.5是官方重点基线,它们在成功率与进度得分上整体领先其他开源模型,特别是π0.5,显示出更成熟的任务执行能力。

2_20251204122846.jpg

                                                                                          π0测试结果

3_20251204122700.jpg

                                                                                            π0.5测试结果

相比之下,自变量的wall-oss-flow 在相同条件下的表现明显偏弱。测评结果显示:wall-oss-flow共测试31次,其中2次成功率为60%,1次成功率为50%,1次成功率为20%,其余所有任务成功率均为0。 

4_20251204122309.jpg

                                                                                             wall-oss-flow测试结果

“具身进化论”从进度分情况看到,模型虽然在部分任务中能完成初段动作,但多数情况下未能完成关键步骤,执行链条往往在中段被迫中断。这与平台强调的“多阶段连续操作能力”形成明显差距。 

公开信息显示,自变量2023年成立,创始人兼CEO为王潜。今年9月,自变量发布其开源大模型WALL-OSS,自变量在官方宣传稿中强调该模型“具备强大的泛化性和推理能力,在长程操作任务方面表现优于其他基础模型”。 

王潜甚至曾在接受媒体采访时表示:“我们(自变量)的模型水平基本上和PI、和google在同一个水平线上。” 

但此次RoboChallenge 的评测结果显示,自变量模型的水平、能力在真实机器人执行任务时未能体现,与PI的模型(π0 和 π0.5)也存在明显差距。 

一位具身智能从业者对“具身进化论”分析,RoboChallenge的独特价值正是在于提供透明、可复现的真机评估环境,避免主观展示带来的偏差。随着越来越多模型加入测评,业内对“模型真实能力差异”有了更清晰的认知。 

对具身智能行业而言,此次结果再次提醒:真正的竞争不在PR宣传中,而在三方认可的评测,学术基准线,以及机器人能否稳定完成任务的那一刻。 

真实世界,正在成为检验大模型能力的最终标准。而认识到差距,正是追赶的开始。

  免责声明:本网站内容由网友自行在页面发布,上传者应自行负责所上传内容涉及的法律责任,本网站对内容真实性、版权等概不负责,亦不承担任何法律责任。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,并请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。

发布者:快科技

相关阅读

微信公众号
意见反馈 科技快报网微信公众号