
上篇结尾留了个扣,正好是VLA模型。这篇展开讲字节跳动的具身智能研究工程师面试里这一关怎么过。VLA模型:这题考到最后,考的是体系面字节跳动时,VLA模型被问到的概率接近百分之百。建议先把它在AI Lab机器人里的角色想清楚。面试官开门见山:“OpenVLA和RT-1在架构与数据上的核心差异是什么?你们怎么选基座?”参考答案思路:RT-1用FiLM条件化EfficientNet+TokenLearner把图像压到约256 token再接Transformer,动作离散为11维bin,训练数据来自真实遥操作约13万片段。OpenVLA基于LLaMA-7B+SigLIP视觉编码器的开放权重VLM改动作头,复用互联网多模态数据做预训练初始化,再用机器人数据微调,泛化更强但推理更重。选型上实时性苛刻选RT-1类轻量,要零样本泛化到新物体选OpenVLA并配量化。这段关键逻辑写成代码是这样:def discretize_action(a, bins=256, lim=(-1, 1)): # 连续动作映射到 bin,便于自回归预测 lo, hi = lim idx = ((a - lo) / (hi - lo) * (bins - 1)).round().long().clamp(0, bins-1) return idx # 11维动作各自独立离散面