GPT-6 Astra具身智能测评引关注:混合架构大幅领先,机器人技术竞争进入新阶段

一份公开发布的匿名仿真测评报告近日在具身智能领域引发关注。报告显示,将GPT-6 Astra与π₀.₅结合的混合控制架构取得62.60分,而排名第二的方案为38.26分,两者平均分差距约64%。这一结果显示,大模型与机器人动作模型之间的协同方式,可能成为提升具身智能系统能力的重要方向。

值得注意的是,实验并非让GPT-6 Astra直接承担机械臂的全部控制任务,而是利用其进行高层语义判断和动作修正,再与π₀.₅在物理空间交互和动作先验方面的能力结合。两类模型各自承担不同层级的任务,从而形成互补。

GPT-6 Astra与π₀.₅如何协同控制机器人

报告撰写者来自银河通用团队。第一作者为银河通用创始人兼首席技术官王鹤教授的博士生。研究采用严格对齐的闭环控制实验,对两种用于仿真双臂操作的架构进行比较。

直接控制模式

在直接控制模式下,系统不运行π₀.₅,而是由GPT-6 Astra直接接收三路摄像头画面以及机器人的当前状态。

模型根据视觉和状态信息,输出双臂末端执行器的位姿以及夹爪开合指令,每轮决策执行1至5个控制步。完成动作后,系统重新获取环境信息,再进行下一轮判断。

这种方式主要考察GPT-6 Astra能否直接将视觉理解、任务推理和机器人动作控制结合起来。

混合模式引入候选动作机制

混合架构采用了不同的控制思路。

在每个决策时刻,π₀.₅首先生成50步候选动作。随后,GPT-6 Astra同时查看摄像头画面、此前的执行历史,以及候选动作对应的双臂运动轨迹。

获得这些信息后,GPT-6 Astra需要进行选择:一种方式是直接采用π₀.₅生成的前1至15步动作;另一种方式则是放弃候选方案,由模型自行输出1至5步末端位姿进行修正。

执行完选定动作后,系统重新观察环境,再根据最新状态作出下一次决策,由此形成持续反馈的闭环控制过程。

简单架构带来明显性能差距

从设计上看,这种混合控制方式并不复杂。报告第一作者也指出,围绕候选动作进行筛选的TopK思路,此前已经在业内交流中被多次讨论。

此次实验受到关注的关键,在于这一方法最终表现出的性能差距。

测评数据显示,混合模式取得48%的任务成功率,平均得分达到62.60分。相比排名第二方案的38.26分,其平均得分高出约64%。

这一结果意味着,具身智能系统的性能提升未必只能依靠扩大单一模型规模或重新训练机器人基础模型。通过合理划分模型职责,让不同模型分别处理语义理解、任务判断、动作生成和实时修正,也可能带来显著提升。

具身智能竞争转向系统协同能力

从技术路线来看,π₀.₅负责提供更贴近机器人运动规律的动作先验,而GPT-6 Astra则承担更高层级的环境理解、候选方案判断和错误修正。

这种架构相当于为机器人建立两层决策机制:底层模型负责生成“如何行动”的候选方案,高层模型则负责判断当前应该选择哪些动作,以及何时需要进行调整。

对于快速发展的中国具身智能产业而言,这类研究也提供了新的技术参考。国内机器人企业和研究机构除了持续加强视觉语言动作模型、机器人本体、数据采集和仿真训练能力外,如何提高不同模型之间的协同效率,也可能成为下一阶段技术竞争的重要方向。

从仿真优势走向真实机器人仍需验证

目前,这一结果仍来自仿真环境测评。实验中体现出的优势能否完整迁移到真实机器人,还需要通过不同硬件平台、更复杂的现实场景以及长期连续任务进一步验证。

不过,62.60分和48%成功率所体现出的性能提升已经显示,将大模型的语义推理能力与机器人动作模型的物理交互能力结合,是值得继续研究的具身智能技术路线。

未来机器人能力的竞争,可能不仅取决于单个模型本身的性能,也将越来越取决于整个系统能否让不同模型在合适的环节发挥各自优势。

Leave a Reply

Your email address will not be published. Required fields are marked *