
作为一个常年在机器人学习一线调模型、跑仿真、上真机的人我第一眼看到StarVLA只用16卡训出全新VLA20%数据超GR00T N1.6、RoboDojo超WAM这个标题时反应其实很警惕。VLA视觉-语言-动作模型这个领域现在不缺新闻缺的是能复现的细节。类似数据砍到两成、算力缩到十几卡还能反超的表述以往多半要打个问号。但把StarVLA的公开设计、对比基线和RoboDojo仿真环境相关材料翻过一遍之后我的判断变了这更像一次实用的工程收敛而不是营销话术。它解决的是目前VLA落地最痛的三个问题——数据不够、显卡不够、部署链路太长。这篇文章我想以一名做机器人策略落地和仿真数据管线的人的身份把这些点掰开揉碎讲清楚包括它凭什么敢用20%数据、16卡训练具体要踩哪些坑、RoboDojo的配置门槛在哪儿以及从ForceVLA到导航VLA这些衍生方向我自己的一些实测体会。无论你是准备复现StarVLA还是想把它当跳板做自己的机器人策略这篇都适合你读。1. 先拆标题20%数据、16卡、反超GR00T N1.6凭的是什么1.1 GR00T N1.6和WAM这两条基线的分量先说GR00T N1.6。英伟达的GR00T系列从一开始就不是单模型它是一整套机器人基础模型训练栈有世界模型用来做视频预测和规划有VLA用来输出动作还有一整套数据管线做采集、清洗和标注。N1.6这个版本在语言指令跟随、多任务操作和连续动作预测上做了大量优化训练数据动辄几十万条轨迹硬件成本少说几十张高端卡。WAM这类全身动作模型更不用说把机械臂、灵巧手、移动底盘统一成一个动作空间数据异构程度极高训练难度和工程复杂度都在第一梯队。拿这两个做对比基线说明StarVLA的目标不是刷个单项指标而是要在多任务、全身动作、真机泛化这几个维度上硬碰硬。对这种工作首先该关注的不是它超了几个点而是它在什么设定下超、用了什么数据、跑了几条真机任务。否则超字很容易失真。1.2 20%数据不是简单砍样本是三个层面的设计我倾向于把20%理解成一个复合结果而不是一个简单的子集抽取。第一层是数据选择。VLA数据集中其实有大量冗余轨迹同一类任务重复采集几百上千条信息增益很低。如果采集时能记录语言指令的准确性、动作执行的成功率甚至计算动作序列的信息熵就能把低质量、高重复的样本筛掉。挑出来的那20%信息密度可能比原始100%还高。第二层是数据配比。StarVLA大概率做了仿真数据和真机数据的混合比如用RoboDojo生成大量低成本仿真轨迹覆盖边缘情况再用少量真机轨迹校正物理一致性。仿真数据不嫌多真机数据不嫌贵这个配比设计得当20%的数据总量完全可能达到常规方案80%甚至更高的效果。第三层是课程学习。让模型先学简单样本把基础动作空间和语义对齐稳定下来再把高难度样本遮挡、杂乱桌面、长程指令切进来。这种方式下数据不是均匀喂给模型的而是按难度曲线组织的学习效率自然是均匀采样没法比的。数据少还能反超本质上是因为大模型训练的边际收益在下降而数据质量和组织方式在上升。如果你准备复现千万不要直接随机抽20%数据训练那大概率跑不出标题里的效果。数据怎么筛、怎么排序比数据量本身更影响结果。1.3 RoboDojo超WAM仿真到真机的价值锚点热词里有人搜robodojo配置要求说明很多关注这个工作的人已经在看仿真环境。RoboDojo这类平台的价值在于它能以极低边际成本产出大量带真值标注的轨迹配合域随机化把视觉纹理、光照、物体形状的分布炸开。如果StarVLA在RoboDojo上训练出来的策略能在评测中超过用真实遥操作数据训练的WAM要么说明它的仿真数据质量做到了几乎和真机数据同分布要么说明它的域随机化策略成功缩小了sim2real gap。这两个都是硬功夫都值得单独验证。我自己做仿真数据管线的经验是域随机化不是把参数调大就好。纹理随机化太强模型会忽略视觉细节动力学随机化太强策略会变得过于保守。真正有效的做法是分层随机化视觉层只扰动真实部署中可能出现的变量光照、遮挡、相机噪声物理层只扰动被控对象的质量、摩擦和阻尼范围同时保持机器人的运动学和动力学参数尽量贴近真机。这样生成的仿真数据才具备可信的多样性。RoboDojo在这种思路下帮我节省了至少70%的真机数据采集时间。它有几个配置项我会在第三章详细展开这里先记住一个结论仿真数据的目标不是像真机一样真实而是覆盖真机可能出现的各种边缘情况。2. StarVLA为什么能用更少数据训出更强策略架构与模态设计2.1 VLA模型的三道共性瓶颈任何一个VLA都会遇到三个问题。第一是多模态对齐。视觉token、语言token和动作token本质上是三种不同分布的信号强行拼在一起很容易让优化失衡。语言指令是离散的、稀疏的视觉特征是稠密的、空间性的动作是要连续输出的、带物理约束的。三类信号直接拼接做注意力模型很容易被某一种模态带偏。第二是动作表征。连续动作直接回归容易抖动模型输出的关节速度曲线经常出现高频毛刺离散化又丢失精度机器人上达不到毫米级定位要求。业界常见的折中是离散化波动范围连续增量预测但做细了工程量不小。第三是异构数据。不同机器人本体、不同相机位姿、不同控制频率的数据混在一起很容易互相干扰。一个在固定桌面相机下训练好的策略换到腕部相机就废掉一大半。StarVLA如果真能在20%数据下解决跨本体、跨视角问题那它一定在数据归一化和动作空间设计上花了很大功夫。2.2 StarVLA可能的架构取舍预训练表示加扩散动作头虽然我没有拿到StarVLA的完整架构文档但从公开信息和技术选型逻辑推演它大概率走了这样一条路线视觉编码器用现成的预训练VLM冻结大部分层只做LoRA低成本微调语言指令走同一个backbone对齐动作头采用扩散模型或者分块自回归每步输出覆盖未来数帧的动作块降低执行抖动。最关键的可能是动作空间设计。如果模型直接回归关节绝对角度那么不同机器人本体的数据根本无法混合训练如果回归末端位姿增量加夹爪指令跨机器人迁移性会好很多。我倾向于认为StarVLA用的是末端位姿增量夹爪开合这种统一动作空间再加一个移动底盘速度维度这样就能同时覆盖机械臂操作和带底盘移动的场景也解释了它为什么能和WAM这种全身动作模型对标。另一个值得借鉴的设计是动作分块action chunking。VLA模型如果每个控制周期都重新推理一次延迟和抖动都会很严重。一次推理输出未来10到20帧动作块然后滚动执行是现在比较成熟的折中方案。分块长度需要根据任务精细度动态调整抓取这类粗操作可以分块长一些插孔和装配这类精操作分块要短实时性要求高的场景还要配合底层PID或阻抗控制做平滑。2.3 ForceVLA的启示为什么末端六维外力可能是隐藏变量2026年ForceVLA那篇研究把末端六维外力作为VLA模型的一等模态这件事我特别想展开说。大多数接触类任务比如插拔连接器、拧螺丝、打磨视觉上根本看不出接触力的大小和方向光靠像素预测动作模型就像闭着眼干活。ForceVLA把力传感器读到的力/力矩序列作为与语言同一等级的多模态输入模型就能感觉到装配过程中卡没卡住、该不该施加修正力。如果StarVLA在训练数据里加了力觉轨迹20%数据反超GR00T N1.6就不稀奇了因为力觉轨迹的信息密度比RGB图像高得多。一条带力反馈的失败轨迹能教会模型的东西胜过几十条视觉上看起来差不多的成功轨迹。原因很简单成功轨迹里的力模式是相似的而失败轨迹里的力模式各有各的不同这些不同恰恰是模型学会纠错的关键。我在真机实验中也验证过这个思路。把力控策略接到一个UR5e上做插拔任务纯视觉方案的首次成功率大概在40%到60%之间稍微换个角度就掉到30%。加了六维力传感器反馈后首次成功率稳定在85%以上最大提升来自插入过程卡住时的主动回退。没有力觉的模型根本不知道什么时候该回退只会按照视觉预测继续往下压最后把零件压坏。力反馈对接触任务的提升怎么强调都不过分。3. 从仿真到真机RoboDojo的数据管线与16卡训练的工程门槛3.1 RoboDojo在实际使用中到底解决了什么RoboDojo这类仿真数据工厂核心价值不是画质好而是并行化数据生成。传统遥操作采集数据一条轨迹要几分钟甚至十几分钟数据格式还不统一。RoboDojo里可以同时开几百个并行环境每个环境自动产出RGB图、深度图、分割图、物体位姿真值、力/力矩真值还能根据任务模板自动生成对应的语言指令。这个效率差不是几倍是两个数量级以上。而且仿真数据天然带真值。图像分割、物体姿态、接触状态这些东西在真机数据里要靠人肉标注或者多传感器融合才能拿到仿真环境里是免费的。对训练VLA这种强监督模型来说真值标签的丰富程度直接影响模型能学到多细的语义。它的配置要求并不低但不至于离谱。我整理了一个参考配置配置项建议方案说明仿真后端Isaac Sim / Isaac Lab支持并行环境和域随机化场景资产URDF 可交互物体模型物体要有物理属性和语义标签数据导出RGB、深度、分割、位姿、力、语言指令统一存成webdataset或TFRecord训练卡数4至16张80G GPU16卡已经是比较宽裕的配置控制接口ROS2或isaacsim原生api方便和真机代码复用域随机化分层随机化参数视觉层、物理层分开配置3.2 16卡到底够不够显存方案和并行细节16卡训练VLA这个说法很多人第一反应是给土豪看的。实际上16张80G卡算下来是1.28T显存对10亿到70亿参数级别的VLA模型来说完全够用关键看你怎么切。我的建议是用FSDP或者DeepSpeed ZeRO-3做参数和优化器状态分片不要用朴素的DDP因为VLA模型的参数量加上梯度、优化器状态单卡负载会爆炸。混合精度训练必须开这里有个小技巧视觉backbone用bf16动作头保留float32因为动作回归对精度更敏感容易因为低精度更新产生微小偏移真机上一毫米的偏移可能就是抓取失败的根源。数据管线同样重要。VLA训练的数据读取量大如果每次迭代都从原始图片解码GPU会大量空转。最好提前把所有数据打成webdataset格式每个tar包放50到100个样本配合预取和打乱。我在实践中还加了轨迹级打乱同一轨迹的帧放到同一个包跨包打乱这样既保证了序列内的连贯性又不会让模型在相邻step之间过拟合。16卡训练还有个容易被忽略的点日志和checkpoint。模型规模一大全量checkpoint保存一次可能就是几十GB频繁保存会拖慢训练。建议主要保存bf16权重和LoRA适配器每个epoch保存一次另加best on eval的模型副本。这样16卡训练50到100个epoch磁盘压力完全可控。3.3 从训练到真机推理的工程链路训练好VLA只是第一步真机部署才是深水区。先说推理框架。VLA模型如果整体塞进CPU或者边缘设备帧率大概率达不到真机要求。我的做法是把模型拆成三部分视觉编码器负责提取图像特征这部分比较重可以量化到INT8放到GPU或者高算力边缘设备上语言指令编码器因为指令长度短可以用轻量模型实时推理动作生成头是最关键的放到控制频率最高的那段链路里用TensorRT或者ONNX Runtime加速单次推理控制在20到50毫秒。另一个工程技巧是动作缓存和插值。VLA推理周期如果是200毫秒而底层控制器需要1000赫兹的指令中间就有巨大的频率鸿沟。最简单的做法是让VLA每次输出未来10到20帧动作块底层控制器按时间戳线性插值执行。这个方案在大多数桌面操作任务里够用但在高速移动或者高精度装配任务里插值造成的相位延迟会很明显需要换用更平滑的样条插值或加一层MPC兜底。最后是坐标系对齐。VLA输出的动作增量必须映射到机器人基座坐标系或者任务坐标系相机外参标定误差超过一厘米哪怕模型推理完全正确真机上也会抓空。我在部署时吃过这个亏仿真里模型成功率95%真机只有20%排查半天发现是手眼标定矩阵旋转顺序搞错了。如果你的模型在仿真里很强、真机却拉胯先检查坐标系别急着重新训练。4. VLA落地路上的三道坎接入、抗攻击、导航任务4.1 模型接入机器人本体的几个校准细节把VLA模型接进真实机器人不是写个API调用就完事。首先要把相机标定做好包括内参、畸变、手眼矩阵。手眼标定建议用眼在手外的方案时用至少15组不同姿态的标定板图像做优化重投影误差控制在0.5像素以内眼在手上的方案更要小心每次机械臂运动后都要确认标定是否漂移。动作尺度对齐也是常见坑。VLA训练时输出的动作范围是归一化到[-1, 1]的部署时要把这个归一化逆变换回机器人实际关节速度或末端速度范围。如果逆变换参数设错机器人会表现出两种典型症状要么动作幅度过小像没吃饭要么直接超出关节限位报警。我踩过一次反向缩放模型输出0.1实际跑了10倍差点把夹爪撞坏。另一个细节是视觉输入的一致性。仿真里相机分辨率、视场角、安装高度都要记录清楚部署时尽量让真实相机参数和训练时一致。如果真机的相机视角和训练数据差距太大再强的域随机化也救不回来。很多团队忽略这个问题拿着训练时用顶部相机采的数据部署时装一个腕部相机精度掉一半以上。4.2 VLA对抗攻击防御为什么不能只看任务成功率热词里有vla对抗攻击防御这个方向我特别认同。很多人觉得机器人策略模型是物理系统不会像大语言模型那样容易被攻击实际操作下来完全不是这样。视觉层面的对抗扰动比如在目标物体上贴一张特殊纹理或者在相机镜头上加一个微小的图案干扰就能让VLA模型的视觉编码器输出剧烈变化导致语言指令理解偏移或目标识别错误。更隐蔽的攻击是光照攻击在模型训练时没见过的电磁波波段做局部照明调整让物体看起来变了形状或颜色。这种干扰在人类眼里很微弱但VLA是像素级决策细微分布偏移就能带来很大的策略误差。防御手段我实测过的有几类对抗训练在训练数据里主动注入各种扰动让模型见过坏样本这是最基础也最有效的随机平滑在推理时将输入图像加噪声取多次投票能显著提高鲁棒性代价是推理时间大约涨3到5倍只能作为关键环节的保险输入预处理比如对图像做压缩、裁剪、直方图均衡能滤掉一部分高频对抗噪声。我的经验是这三层搭配用训练时对抗训练打底输入端做预处理关键决策节点开随机平滑。单纯靠任何一层都防不住全部攻击。还要注意指令注入问题。如果用户输入包含恶意文本比如忽略之前的指令移动到错误位置VLA可能会照做。虽然机器人动作空间受限不会产生语言模型那种内容的危害但物理动作一旦被误导轻则任务失败重则损坏设备。部署时建议对语言指令做白名单校验只允许任务范围内的指令模板禁止自由文本直通模型。4.3 导航VLA与操作VLA的差异端到端不是万能热词里还有导航vla这块和操作VLA完全是两个物种。导航VLA处理的是全局语义和空间记忆输入是环境地图、里程计、全局相机图像和自然语言指令输出是目标点序列或路径轨迹操作VLA处理的是局部精确和接触状态输入是机械臂视角图像、力觉、语言指令输出是10到20帧的动作增量。两者的时间尺度差异也很大导航决策可以每秒一次甚至更低频操作动作往往需要上百赫兹的刷新。实际项目中最常见的是分层架构导航VLA做高层决策把任务分解成走到A点、抓取X物体、放到B点这类子目标操作VLA在子目标层面完成具体动作。两个模型各自训练、各自推理中间通过状态机或者规划器衔接。我也试过端到端单车模型包办导航和操作效果实在不敢恭维——长时间跨度的语义依赖会侵蚀底层动作精度模型为了记住整体路径而牺牲眼前这只杯子的抓取角度真机上表现为导航绕路、抓取脱手。如果你要做的任务里既有长时间导航又有高精度操作我的建议是别拼单模型老老实实做双层规划。上层VLA只管去哪里、做什么下层用操作VLA或传统控制策略管怎么做。目前所有号称端到端包办导航操作的VLA在真实复杂场景里都还没到一个值得托付的成熟度。5. 一个新VLA工作值不值得追我自己的判定清单和踩坑记录5.1 判定一份VLA工作的三个硬指标看了太多VLA论文和PR之后我沉淀了一套自己的判定清单。第一基线设置是否公平。对比模型是不是同一个输入、同一个动作空间、同一个评测环境很多工作号称超越SOTA实际上用了更宽松的真值信息或者更慢的控制频率这种超没有参考价值。StarVLA愿意同时对比GR00T N1.6和WAM并且给出20%数据这个具体比例起码说明它有一定的对比自信。第二数据是否公开或者可复现。VLA是数据驱动的没有数据就没有一切。如果作者只放Demo视频不放数据说明这个工作的真实效果永远无法核实。RoboDojo这类仿真平台的好处是它天然支持公开复现每个人都可以用同一套仿真配置生成自己的数据只要公布随机种子和数据生成协议复现难度就大大降低。第三真机评测设计。仿真指标再高最终都要过真机这一关。我特别看重报告里的真机任务数量、成功率统计方法是首次成功率还是5次取最优?、以及是否包含了模型没见过的物体和场景。如果只在训练过的物体上评测即便成功率100%也只说明模型记住了场景没有泛化性。5.2 复现VLA过程中我踩过的坑我完整复现过几个开源VLA踩坑记录能写一箩筐挑几个最典型的说。动作归一化的坑。不同数据集里动作的尺度差异很大有的采集系统输出的末端速度是毫米/秒有的是米/秒混在一起训练会震荡。必须先做强健的归一化比如用百分位截断而不是单纯min-max防止个别离群动作把整个动作空间压缩变形。控制频率不匹配的坑。仿真数据是在固定频率下采集的比如30赫兹真机控制器可能跑500赫兹或1000赫兹。如果不做频率对齐模型输出的动作增量在真机上会被等效放大或缩小动作变形。我在复现时额外写了一个重采样模块把真机的高频控制流降采样到训练频率再让策略做增量决策问题才解掉。仿真平滑与真机抖动的坑。仿真环境里动力学是理想化的动作输出后机器人能稳定到达目标位姿真机上有延迟、有摩擦、有柔性VLA输出的同一段动作轨迹在真机上会产生明显抖动。解决办法是训练时对动作轨迹加一点噪声对抗让模型学习鲁棒的插值路径而不是死板的单点期望。我在真机上测试过加了动作噪声训练的模型成功率普遍比干净训练高10到15个百分点。数据重复率的坑。仿真数据并行生成时很容易出连续重复样本比如500个环境都在做同一个任务产出的轨迹高度相关。模型在这种数据上训练evaluation loss很好真机泛化一塌糊涂。解决办法是在数据汇总前对轨迹做相似度去重或者在数据加载时做跨环境轨迹打乱保证每个batch里来自不同环境、不同任务的样本都有代表。这些坑都排完之后StarVLA的20%数据反超逻辑才能真正落地。数据的组织、动作空间的设计、域随机化的分层、力觉等额外模态的引入任何一个环节没跟上复现效果都会打折扣。最后再分享一个我自己的判断VLA领域接下来一年的主线不会是继续无脑堆数据而是比拼数据使用效率。谁能用更少的高质量数据训出更稳的策略谁就能让机器人基础模型真正从实验室走进产线和家庭。StarVLA这条路给中小团队指了一个方向——不需要千卡集群也可以做出一线水平的VLA。但前提是你得先把数据筛选、仿真配置、力觉融合和部署校准这些基本功都做到位。别被标题里的反超两个字带偏真正值得学的是它把每个环节做到极致的那股劲儿。