Anthropic 机器人实验:Agent 能力为何取决于接口抽象层

发布时间:2026/7/24 13:27:40
Anthropic 机器人实验:Agent 能力为何取决于接口抽象层 谈机器人 Agent 时开发团队很容易先问“该选哪个大模型”。Anthropic 7 月 9 日发布的机器人研究给出了一个更接近工程现实的答案同一个模型看起来强不强很大程度取决于它通过什么接口接触物理世界。让模型直接输出关节力矩、让它写控制器、让它监督预训练策略测到的并不是同一种能力。这项研究的价值不在于宣布通用机器人已经成熟。恰恰相反它展示了当前系统的明显短板也说明了为什么评测不能只盯模型名称和一次成功演示。对开发者更有用的结论是模型、感知工具、策略层、实时控制和安全护栏必须作为一个整体评估。研究是怎样测的研究团队用 MuJoCo 模拟环境和一台真实 Unitree Go2 四足机器人覆盖经典控制、运动与导航、机械臂操作三类任务。机器人形态包括 12 自由度的 Go2、29 自由度的 G1 人形机器人以及固定底座的 7 自由度 Franka Panda 机械臂。模型面对四种控制接口直接输出低层动作、编写 Python 控制器、调用预训练策略并给出高层指令以及自行训练强化学习策略。团队评测了多个 Claude 版本也纳入 GPT、Gemini、Kimi 和 Qwen 等模型多数“模型×实验设置”单元运行 35 次LIBERO-40 操作任务使用 200 次试验高层导航套件使用 100 次试验。这套设计刻意把“模型能力”和“接口提供的能力”拆开。直接控制要求模型持续处理物理状态代码控制把连续反应压缩为一个可执行控制器策略监督则让预训练网络负责低层动作语言模型只决定接受、修改还是拒绝建议。关键结果抽象层改变了能力上限综合图中Claude Mythos Preview 的 Embody 组合分数为 0.389Opus 4 为 0.115。但更值得注意的不是排名而是每根柱子内部的构成代码控制、策略监督和训练监督贡献了很大一部分能力直接控制并没有随模型代际稳定地同步增长。在低层机械臂操作中完整任务成功率仍然很低研究给出的范围是 0% 到 5.5%。较新的模型更常做到“接近目标、发生接触、完成抓取”等中间步骤但一次局部进展不能等同于端到端可靠执行。把预训练视觉—语言—动作策略 MolmoAct 接入后LIBERO-40 的结果发生了明显变化。VLA 单独运行的成功率约为 86%加入语言模型监督后图中较好的 Claude 组合达到 76%另一些组合为 58% 或更低。也就是说高层策略显著抬高了系统能力但语言模型监督也可能因不必要地覆盖正确动作而带来损失。工具的作用也并不均匀。深度图和分割图整体接近中性简单的可查询光标却让 Mythos Preview 在 10 项操作子集上的成功率从 6% 提升到 32%。在四足导航中告诉模型朝向的指南针也比多种复杂视觉叠加更稳定。工程含义很直接增加信息量不一定有用提供可校准、可定位的状态变量往往更关键。推理更久不等于控制更稳研究没有发现“增加推理预算”能普遍改善机器人任务。在部分经典控制任务中更高推理预算反而让新模型退步在 Opus 的高层导航中不同推理设置的差距也很小。作者推测长推理带来的规划收益可能妨碍需要快速反馈的反应式动作。实时性边界尤其重要。四足机器人的低层控制大约需要 83 Hz而研究中的非推理模型调用只有约 0.2—0.4 Hz。为避免只测到 API 太慢团队在许多仿真实验中暂停物理模拟器等待模型返回。因此这些直接控制成绩更像“延迟大幅降低后的能力上限”不能直接外推为今天即可安全部署的实时控制能力。长上下文也不是稳定的补救方案。LIBERO-40 的上下文截断实验保留最初 10 轮和最近 12 轮或 6 轮多数模型并未显著下降个别模型甚至改善。研究者据此判断当前模型更多依赖最近几步进行短期修正而不是形成贯穿整段任务的可靠空间记忆。面向开发者的六层架构把这些结果转成工程方案可以采用“语言模型不进入硬实时闭环”的六层设计层级主要职责必须保留的约束任务契约层把自然语言目标变成对象、区域、时限和完成条件禁止操作对象与最大影响范围必须显式声明感知适配层将图像、力传感器和位姿整理为可校准状态保留原始观测标记时间戳与不确定性LLM 决策层选择子目标判断策略建议是否可信只输出高层意图不直接驱动电机策略执行层用经过验证的控制器完成实时动作动作范围、速度和力限制由策略层强制执行独立安全层做碰撞、越界、超时和急停判断不依赖同一个语言模型自我批准观测与恢复层记录输入、建议、决策、结果和失败原因支持停止、复位、人工接管与可追溯回放这个分层把“会不会做”与“允不允许做”分开。预训练策略可以提供稳定动作语言模型可以处理不完整指令和异常判断但物理边界由独立组件执行。即使模型错误理解一张图系统也不应允许它越过速度、区域或对象白名单。一个仓储分拣场景假设机械臂要把指定料盒从检测区移动到返工区。输入不是一句“把有问题的都拿走”而是一份任务契约允许操作的料盒 ID、目标工位、最大夹持力、有效时间和人工确认条件。感知层同时返回相机画面、料盒位姿、夹爪力反馈与置信度。预训练策略先提出抓取轨迹LLM 只负责三种选择接受、在允许范围内调整高层目标或因观测冲突而拒绝执行。每次交接后验证器检查“对象是否仍是白名单目标、轨迹是否越界、抓取后状态是否符合预期”。若连续两次验证失败、目标丢失或力反馈异常系统立即停止并回到安全位等待人工复核。这个场景对应了研究里的核心发现高层策略可能远强于直接控制但监督者也可能错误覆盖本来正确的动作。因此日志必须同时保存“策略原建议”和“LLM 修改后建议”上线指标也应分别统计接受率、错误覆盖率、人工接管率、越界拦截率和端到端成功率而不是只看模型最终说了什么。评测时至少问五个问题第一模型拿到的是原始像素、文本描述还是带朝向和坐标的结构化状态第二低层动作由谁生成频率是否满足物理闭环第三策略建议正确时LLM 会不会频繁干预策略建议错误时它能否及时拒绝第四测试是否包含遮挡、漂移、反射、目标丢失和初始姿态变化第五失败后能否独立急停、复位并完整回放这五个问题比单一成功率更接近真实部署风险。Anthropic 的真实 Go2 试验中模型曾把玻璃门里的目标倒影当成真实目标也曾错误判断垃圾桶不在行进路径上。研究人员及时停止了机器人。这些案例说明偶尔成功的演示不能替代异常场景和独立安全机制。研究边界这项研究仍有明确限制。大量结果来自仿真真实机器人试验数量较少直接控制实验暂停了模拟器弱化了现实延迟VLA 监督主要依赖一种预训练策略提示模板没有针对各模型单独调优。部分新模型或预览模型的结果也不能代表所有部署环境。此外各控制接口的任务难度和可用信息不同组合分数适合观察整体趋势不适合当作通用机器人排行榜。模型代际与成绩变化是实验相关性不证明某项训练改动造成了提升。开发团队应把论文结果当作评测设计线索而不是产品可用性承诺。结论Anthropic 的实验提示了一条稳健的路线让语言模型负责目标解释、异常判断和策略编排让经过验证的控制器负责实时动作再用独立安全层限制物理影响。模型升级当然重要但接口抽象、可校准状态、权限边界和失败恢复同样决定系统能做什么。当 Agent 开始影响真实设备时最关键的问题不再只是“模型会不会”而是“系统通过什么接口让它做、允许它做到哪里、失败后由谁立即停下”。这才是从演示走向可验证部署的分界线。原文来源Anthropic Research《Claude plays robotics》2026 年 7 月 9 日。https://www.anthropic.com/research/claude-plays-robotics

相关新闻