不依赖人工标注数据,AI还能从哪些信号中学习?空间智能与具身智能的答案

发布时间:2026/8/27 10:05:49
不依赖人工标注数据,AI还能从哪些信号中学习?空间智能与具身智能的答案 李飞飞在一段公开访谈里聊到一个非常反直觉的观察人学习时其实并不完全依赖现实数据。小孩学走路、学避障、学抓东西没有人提前给这些动作打上标注也没有人把房间里的每个物体整理成训练集。这个观点放到今天的 AI 语境里很容易被简化成“数据没那么重要”但如果只是这样理解会错过整段话真正指向的问题当真实人工标注数据不够用、分布覆盖不全、获取成本又高的时候AI 到底应该从什么地方获得学习信号。把这个问题翻译成工程语言它其实是三条线第一人类的学习并不只有“读数据和记答案”这一种方式运动反馈、物理试错、好奇心驱动的探索都在产生学习信号第二当前以互联网文本和人工标注数据为核心的大模型范式在空间感知、物理交互、长尾场景上存在明显瓶颈第三空间智能、具身智能、仿真环境、世界模型这一整套研究方向本质上都在尝试回答同一个问题——如果不依赖大规模现实标注数据模型又能靠什么学会“世界是如何运作的”。这篇文章不讨论访谈的八卦也不做观点复述。我会把这句访谈观点拆成可检验的技术命题再沿着“人类学习信号从哪来 → 数据驱动范式卡在哪 → 空间智能和具身智能怎么补位 → 工程上用什么数据替代真实标注 → 如何评估和排错”这条主线整理成一篇可以用于技术讨论和实践参考的博客。无论你是做 CV、机器人、自动驾驶还是做大模型应用这篇内容都值得读到最后。1. 先把访谈观点翻译成技术问题人的学习信号到底从哪来1.1 人类学习不等于“读数据”感知、动作和物理反馈是三条线访谈标题里的“现实数据”四个字很容易让人误以为李飞飞在质疑数据的重要性。实际上她质疑的是“把所有学习都建模成从现实数据中提取模式”这件事。人类学习至少包含三条并行的信号线。第一条是视觉感知。眼睛接收光线大脑把像素组织成物体、边界、深度和运动轨迹。这一层确实很像今天视觉模型从图像数据里学特征的过程但它不完全等于“读标注数据”。婴儿看世界时并没有人每天告诉他“这是杯子、那是桌子、杯子在桌子的左边”他是通过大量未标注的观看逐渐建立对空间结构的基本理解。第二条是动作反馈。小孩伸手去抓一个杯子抓空了或者抓到了但杯子滑落这个反馈信号不是某个人工标注者提供的而是物理世界直接给出的。动作和结果之间的差异比任何标签都密集也更有因果性。它会告诉学习者自己的手臂长度、力度、物体材质、摩擦系数这些看不见的属性到底是怎么运作的。第三条是内部推演。人类会在头脑里模拟“如果我这样走过去会不会撞到桌角”“我侧身一点是否能通过这个缝隙”。这种想象不需要真实执行也能产生学习信号。它依赖的是大脑中已经建立的世界模型——一组关于物理规律和空间关系的内部假设。所以把“人也不全靠现实数据学习”翻译成技术语言应该是人类学习使用了多种来源的训练信号真实世界的人工标注数据只是其中之一而且不是唯一的、甚至不一定是最基本的一种。1.2 从“现实数据”到“非现实学习信号”的三层含义这一句观察里的“现实数据”至少可以拆成三个层次每个层次对应的技术问题完全不同。第一层是“物理现实”。真实世界中物体的光照、遮挡、材质、运动方式极其复杂很难用任何标注数据完整覆盖。人类的学习信号来自与物理环境直接交互训练数据的“密度”和“多样性”天然高于任何离线数据集。第二层是“人工标注”。传统监督学习依赖一个前提有人把真实世界转写成标签例如“这张图里有猫”“这个坐标是障碍物”。这种标注本质上是把多维世界压缩成离散答案信息损失很大。而人类的大量学习并不经过这个压缩步骤。第三层是“统计分布”。互联网数据、公开数据集本质上是人类活动留下的数字痕迹分布高度偏向文本、画面和常见物体。人类学习还会接触到物理规律、因果链条和罕见的长尾场景而这些信息在互联网文本里很难找全。理清这三层之后访谈观点就变得很适合落到 AI 训练的分析框架里它不是在说数据无用而是在说如果把学习信号人为限制成“人工标注过的现实数据”那模型的泛化能力上限早就被锁死了。1.3 反直觉之处先验、试错和想象都不需要昂贵标注很多讨论把学习等同于“从样本中学”但人类学习的很大一部分来自“假设”和“验证”。比如一个孩子第一次看到透明玻璃门他没有足够的数据判断这是一扇门还是空气他可能会直接撞上去但那之后他就学会了玻璃门的视觉特征。这个学习过程只需要一次真实的物理反馈而不需要一万张标注了“玻璃门”的图片。再比如“物体被遮挡后仍然存在”这个常识。婴儿在很早期就会表现出对物体永久性的理解玩具被布盖住他知道去掀开。这个知识无法完全靠观察静态图片获得它来自对空间连续性和物体一致性的内部建模。要给一个视觉模型建立这种能力只喂标注图片是不够的必须让它接触物体的消失、重现、遮挡和运动并从中提取规律。这就是空间智能和后来世界模型研究最核心的动机真实世界的数据太昂贵但物理规律、空间关系、动作后果这些学习信号可以通过预测任务、试错反馈、内部推演等方式低成本获得。理解这一点是理解整篇文章所有后续技术方案的起点。2. 为什么数据驱动的 AI 会遇到“真实数据不够用”2.1 互联网文本和大规模标注数据带来的繁荣与局限过去十几年AI 的重大进展几乎都建立在数据规模之上。ImageNet 证明了大标注集配合深度模型可以极大提升图像识别能力Transformer 配合互联网文本训练则带来了大语言模型的能力爆发。这条路线很成功但也有两个隐含前提一是数据量可以无限增长二是训练数据与真实任务空间的分布足够接近。在大语言模型上这两个前提暂时成立因为人类语言的大部分书面表达都被数字化了爬取互联网文本可以在低成本下逼近“世界上所有可读文本”。但对空间感知和物理交互来说这两个前提都不成立。世界并没有被完整地数字化成可以训练的格式物理环境、三维结构、物体动态关系、动作结果这些信息在互联网上只有非常稀疏、非常碎片的投影。所以你会发现大模型在聊天、总结、写代码这些任务上越来越强但在“判断一张桌子的承重后把杯子放上去”“在从未见过的房间里规划一条不撞墙的路径”“理解物体被遮挡后去了哪里”这些空间物理任务上能力仍然非常不稳定。2.2 真实世界数据获取成本高、覆盖长尾难、标注质量不稳定为什么不能把所有真实场景都采集下来像 ImageNet 一样建成一个巨型数据集核心限制有三个。第一个是获取成本。标注一张图片里的物体类别只需要一个画框和一个标签但标注一段机器人操作数据需要真实机械臂、真实物体、真实环境还需要记录连续的关节角度、力反馈、视觉观测和执行结果。这类数据的采集速度远慢于互联网文本爬取。第二个是长尾覆盖。真实世界的物体组合、光照条件、遮挡模式几乎是无限的。一个机器人要学会在厨房、卧室、办公室、野外等各种环境下工作如果全部依赖真实数据采集成本会高到无法承受。更麻烦的是很多危险场景、罕见场景、极端场景根本无法真实采集比如自动驾驶中的极端碰撞、工厂中的异常状态。第三个是标注质量不稳定。真实世界数据的标注往往比图像分类复杂得多。判断一个机器人的抓取动作是否“成功”、一个规划结果是否“安全”本身就没有唯一标准不同标注者给出的结果可能不一致。这种噪声会直接传导到模型训练中导致模型学会的是标注者的主观偏差。这也是为什么很多团队开始转向仿真环境、合成数据和自监督信号不是因为真实数据没用而是因为真实数据无法在规模、覆盖、成本、质量四个维度上同时满足要求。2.3 数据规模上去了空间推理仍然可能出错一个容易被忽视的事实是数据规模并不能直接解决空间推理问题。大模型在图像识别、物体检测上的高分并不代表它真正理解了空间关系。举一个很常见的工程例子。给定一张厨房照片问“烧水壶是在灶台的左边还是右边”很多视觉语言模型会把这个问题当成一个高频共现匹配题看到水壶和灶台同时出现就输出一个大概率的位置关系而不是真正计算二者的三维位置。换一个少见的角度拍同一个场景模型的答案就可能变化说明它记忆的是“物体组合与答案的统计关联”而不是空间几何本身。在机器人领域这个问题更明显。一只机械臂可以在仿真环境里完成上万次抓取训练但换一个不同材质的物体、加一个轻微光影变化成功率就会骤降。原因不是模型容量不够而是训练信号里缺少了对“空间位置、物理属性、动作后果”这三者的结构化理解。从这个角度看李飞飞在访谈中说的“人不全靠现实数据学习”其实是在提醒如果我们继续依赖“堆积真实标注数据”来解决一切问题就会不自觉地回避一个更根本的问题——模型是否真正学到了一套关于世界的内部模型还是仅仅记住了数据分布。3. 空间智能和具身智能不靠“现实数据”也能学习的另一条路径3.1 空间智能从感知、记忆到预测和生成李飞飞长期推动的“空间智能”概念核心是让 AI 不仅能识别物体还能理解物体在物理空间中的位置、关系、变化并据此进行预测和生成。它要比“物体检测”多出几个关键能力。第一个能力是空间感知。模型要能从二维图像或三维传感器数据中恢复出三维结构知道一个物体在哪里、边界在哪、朝向如何、与其他物体的相对位置是什么。这个能力不能完全依靠平面图像标注需要深度估计、点云理解、多视角几何等技术配合。第二个能力是空间记忆。看到一张图之外模型要能记住场景的结构并在视角移动、物体遮挡、光照变化后仍然保持对空间布局的稳定理解。这意味着它不能只做单帧特征提取而要维护一个场景图或空间状态表示。第三个能力是空间预测和生成。给定一个当前场景和一个动作候选模型要能预测场景会如何变化。比如杯子被推倒会掉到哪里门后应该是什么结构人走过去之后视野会看到什么。这种预测能力是空间智能最核心的部分也是从“理解图片”变成“理解世界”的关键。第四个能力是空间生成。在预测能力之上模型还能根据条件生成新的三维场景或视角比如从一张厨房照片生成从另一个角度看过去的画面。这就是把空间智能与生成模型结合起来也是很多神经渲染、三维重建工作的目标。这四种能力都不依赖传统的“现实标注数据”。它们更多依赖几何结构、连续视角、传感器时序信号这些非人工标注的监督信息。这正是从“人工标注现实数据”到“非现实学习信号”转变的技术路径。3.2 具身智能在动作中获取反馈把环境变成“老师”如果说空间智能解决的是“理解世界”具身智能解决的就是“在动作中学习世界”。具身智能强调 AI 必须有一个身体并能通过传感器和执行器与环境交互。它的核心学习信号不再是标签而是动作产生的后果。典型的工作循环是观察环境 → 决定动作 → 执行动作 → 观察结果 → 更新内部模型。整个过程里没有哪一步需要人工标注。机器人把杯子放歪了杯子倒了这个信息直接以传感器数据的形式返回模型据此调整下一次抓取。这就是把环境本身当作教师。这种学习方式有几个明显优点。第一反馈信号稠密且连续执行一次动作就能获得大量关于物理属性的信息。第二数据分布天然贴合任务机器人学的都是自己将要执行的任务不存在“训练数据和实际场景分布不一致”的问题。第三它可以持续学习在部署之后通过执行任务不断积累新经验而不是训练一次就固定下来。但它也有代价真实机器人的动作采集慢、机械磨损大、场景布置成本高完全靠真实试错学习效率仍然很低。所以工程上通常不会让机器人完全在真实环境里“从零开始学”而是会和仿真环境、世界模型结合先用虚拟数据进行大规模预训练再用真实反馈做微调。3.3 把人的学习方式映射到 AI 训练流程把人类学习方式与主流 AI 训练方式放一起对比会看得更清楚学习来源人类学习方式主流 AI 训练方式工程化难度视觉观察大量未标注观看逐步建立空间感需要人工标注或自监督预训练自监督已可部分替代动作试错从失败中调整反馈来自物理世界需要奖励信号或人工评估需要仿真器和反馈设计内部推演在脑中模拟动作后果不需要真正执行世界模型生成预测样本模型稳定性要求高语言指导通过语言间接获得经验文本预训练但缺乏空间落地多模态对齐有难度模仿他人看别人怎么做自己模仿需要示范数据或逆动力学标注数据采集成本中这张表基本就是当前“从语言大模型走向空间智能和具身智能”的研究路线图。它说明人类学习信号源足够多AI 过去只用了其中少数几种并且过度依赖了成本最高的那一种——人工标注的现实数据。4. 替代“真实标注数据”的四种工程手段4.1 仿真环境用低成本生成大规模空间数据仿真环境是当前替代真实数据最成熟的手段。通过物理引擎、三维渲染引擎和场景编辑器可以在程序中批量生成包含不同物体、光照、布局和纹理的训练场景并自动导出深度图、分割图、边界框、位姿标注甚至机械臂的关节角度和力反馈。相比真实数据仿真环境的优势非常明显规模无上限、标注自动生成、场景可编程控制、危险场景可以随意模拟而且所有训练数据天然带有“三维结构和空间关系”标签。比如场景编辑器里每个物体都有精确的三维坐标和朝向模型可以直接学习“物体 A 在物体 B 左侧 30 厘米处”这样的结构化事实。但仿真数据也有一个著名问题sim-to-real gap也就是仿真到真实的迁移鸿沟。训练时看到的物理引擎摩擦力、碰撞响应、光照模型和真实世界总有差异。直接用在真实环境中模型经常“见光死”。常用的缓解手段包括域随机化、域自适应和混合训练。域随机化是在仿真中随机化光照、纹理、颜色、物理参数让模型无法依赖某个固定的视觉特征只能学习更本质的结构信息域自适应是在真实数据有限的情况下通过对抗学习或特征对齐把仿真特征迁移到真实域。配置仿真数据来源时可以把不同数据源按策略混合起来工程示意如下learning_signal: sources: - name: annotated_real_data weight: 0.25 note: 人工标注真实数据用于冷启动和最终校准 - name: synthetic_simulator weight: 0.35 note: 仿真器自动生成带标签数据覆盖长尾和危险场景 - name: self_supervised_signal weight: 0.25 note: 传感器原始时序信号用于预训练空间特征 - name: embodied_feedback weight: 0.15 note: 真实机器人执行任务后的成功/失败反馈这里要注意上面的比例不是标准答案不同任务、不同传感器、不同仿真保真度下最优配比差异很大。实际项目中建议用消融实验确定每一类信号对下游任务的贡献。4.2 世界模型让模型在想象中预演并生成伪样本真实数据不够还可以靠模型自己“想象”数据。世界模型的基本思路是训练一个模型让它能够根据当前状态和动作预测未来的环境状态。有了这个预测模型后AI 可以在内部模拟器里进行“脑内试错”生成大量虚拟的交互轨迹再把这些轨迹当作训练数据。世界模型的一个经典设计思路是只观测静态画面让模型预测未来下一帧以及动作带来的变化。模型会逐渐学到“移动视角后场景会变成什么样”“物体被推动后会往哪个方向移动”这些物理规律。这些规律并不来自人工标注而是从高维观测数据的压缩和预测中涌现出来的。工程上的世界模型通常包含三部分编码器负责把高维观测压缩成结构化表示动力学模型负责预测下一个状态的表示解码器负责把预测后的表示还原成观测。训练目标很简单给定当前观测和动作让解码器还原出的未来观测尽量接近真实未来观测。它的意义在于训练完世界模型后可以把它当成一个可微分的“模拟器”用来生成大量不完整但信息丰富的伪轨迹。模型可以先在伪轨迹上进行策略训练再回到真实环境中微调从而大幅减少真实交互数据需求。4.3 自监督与对比学习把传感器原始信号变成学习信号自监督学习是另一个不依赖人工标注的信号来源。它通过构造预测任务让模型从数据自身结构中获得监督信号。比如遮住图像的一部分让模型预测被遮住的内容或者把同一场景的不同视角看作正样本让模型学习“不同视角下物体的本质表示应该一致”。这类方法在空间智能中的应用尤其重要。因为空间数据有一个天然结构同一物体在不同视角下应该产生一致的三维表示同一场景的前后帧之间存在运动连续性。这些约束不需要任何人工标注只要有多传感器或多帧数据就能自动构造学习任务。对比学习的典型用法是在一段连续的机器人传感器数据中同一时刻不同传感器的观测、或相邻时刻的观测被视为语义相关的正样本随机采样的不相关样本作为负样本。模型通过拉近正样本、推远负样本学会从原始传感器信号中提取出稳定、一致的空间特征。这些特征可以直接用于下游的空间关系判断或运动规划。这种方法最大的价值在于数据来源广泛任何安装传感器的机器人、任何有视场重叠的摄像头、任何带时间戳的视频都可以不经人工标注直接进入训练管线。4.4 机器人自采数据从执行结果中持续学习最后一种信号来自机器人自身。机器人执行任务时产生的传感器数据即使没有人工标注本身就包含大量信息。比如一次抓取成功意味着当前动作策略和空间判断是正确的一次抓取失败意味着模型对物体位置、材质或摩擦力的理解存在问题。工程上可以让机器人在真实环境中进行一批探索性动作比如轻轻推动物体、改变视角、尝试靠近目标记录整个过程的视觉、关节、力传感数据。这些数据先送入自监督模块或世界模型让模型学会环境的基本结构再用少量标注数据校准最终策略。真实自采数据质量不稳定需要做一些清洗和预处理否则会把噪声注入模型。常见问题是传感器时间戳不同步导致观测断裂、动作执行失败但记录信号正常、数据总量太少分布不均。实践中可以先把自采数据用来更新世界模型而不是直接微调策略网络这样对样本量和质量的容忍度会高很多。对应到一个具身智能体的推理流程伪代码如下class EmbodiedAgent: def __init__(self, perception, memory, policy): self.perception perception # 视觉编码器 self.memory memory # 空间记忆 self.policy policy # 动作策略 def act(self, observation): # 1. 感知将图像转为场景表示 scene self.perception.parse(observation) # 2. 记忆更新空间坐标和对象关系 world_state self.memory.update(scene) # 3. 决策在想象中推演动作结果 candidate_actions self.policy.propose(world_state) # 4. 执行前筛选检查物理可行性与冲突 return self.policy.select(candidate_actions, world_state)这段代码是概念示意实际系统里感知、记忆和决策模块可能由多个网络组成但整体数据流是一致的不是从标注标签直接到答案而是从原始观测中构建结构化空间状态再基于空间状态做预测和行动。在真实项目落地时还要区分学习环境和生产环境。学习环境可以使用高保真仿真器大量生成数据模型可以随便试错生产环境部署时则要考虑传感器标定误差、硬件延迟、数据合规、日志监控、模型回滚等额外问题。仿真阶段再有效的方案进入真实硬件前都要单独做一次“仿真到真实”的验证不能直接把离线评测结果当作部署结论。5. 工程上如何验证指标、评估和落地检查点5.1 评估空间推理能力从单场景到分布外测试“模型是否真的理解了空间关系”不能靠一两个示例展示来证明需要系统的评估方法。常见的验证思路分为三个层次。第一个层次是空间关系问答。给模型一个场景图像和问题比如“球在桌子的左边还是右边”“椅子到门的距离大约是多少”模型输出答案。这个层次考察的是最基础的概念理解但它容易被统计捷径干扰所以评估时必须覆盖不同拍摄角度、不同布局、不同物体组合。第二个层次是场景结构预测。让模型从单图或视频中输出场景图、深度图、点云再与真实三维结构对比。这个层次考察模型是否真的恢复了空间结构而不是仅仅输出了语言答案。评价指标常用深度误差、点云距离、场景图关系正确率。第三个层次是分布外测试。把训练集中未出现的场景风格、物体组合、光照条件拿来测试看模型是否还能保持空间推理能力。这是最难的评估能直接筛选出“记住了分布”的模型和“学到了规律”的模型。如果模型在训练分布内表现很好但在分布外任务上明显下降说明它依赖的是图像表面的统计特征而不是三维几何结构。这个结论会直接影响后续方案需要加入更多三维监督信号或者仿真数据而不是继续堆同分布的数据。5.2 机器人任务的成功率与 sim-to-real 差距对具身智能系统来说最终验证指标不只是感知精度还要看真实任务成功率也就是从起点到目标状态机器人在真实环境中完成任务的概率。常用评估维度包括验证维度常用方式典型问题空间关系理解空间关系问答、场景图预测模型把相对位置当成统计共现导航能力仿真环境中到达目标成功率过度依赖先验路线新地图表现下降操作能力机械臂抓取、摆放成功率训练环境与真实环境的摩擦、材质差异分布外泛化更换光照、遮挡、物体组合记忆数据分布而非学习物理规律仿真到真实迁移仿真训练后直接部署真实硬件sim-to-real gap 导致成功率骤降在实验中最容易出现的情况是仿真成功率很高、真实成功率很低。这时不要急着调网络结构先检查三个方面仿真器的物理参数是否贴近真实环境、域随机化范围是否足够大、真实环境中传感器噪声是否被模型见过。这里有一个关键工程原则仿真数据的作用是提前淘汰错误策略、降低真实试错成本而不是替代真实验证。真实环境中的一轮测试无论成功还是失败都要完整记录日志用于下一次迭代。5.3 在真实项目中如何设计一个验证闭环一个可复用的验证闭环可以按下面五步设计第一步定义任务边界。先规定“成功”是什么例如“机械臂在 10 次抓取中成功 8 次”“机器人在 20 个新场景中到达目标区域且无碰撞”。没有明确的成功定义后续所有指标都不可比。第二步确定评估数据集。把训练数据、验证数据、真实测试数据分开。真实测试数据应来自模型从未见过的场景且尽量贴近实际部署环境。如果条件允许保留一组“最不像训练分布”的困难场景作为压力测试。第三步建立仿真与真实的双轨评估。每天先在仿真环境跑回归测试确认修改没有破坏已有能力每周或每版本在真实环境跑一轮小样本验证检查 sim-to-real gap 是否变大。第四步建立失败案例库。每次测试失败都把场景、图像、传感器数据、动作序列、失败原因记录下来。失败案例库是排查问题的重要依据也是下一轮数据补充的起点。第五步设计回滚策略。模型更新后如果真实成功率下降要能快速回退到上一版本而不是在线上继续试错。这要求模型版本、配置、训练数据、评估结果全部有对应记录否则很难定位问题。6. 常见误区与踩坑清单6.1 “不靠现实数据”不等于“不需要数据”这是访谈观点在传播中最容易被误读的一点。李飞飞讨论的是“学习信号的来源”不是“数据量的重要性”。人类学习不使用大量人工标注数据并不代表人类学习不消耗信息恰恰相反人类通过感知、动作、反馈持续接收海量信息。落到工程上这个误区的危害在于有人可能认为既然可以不靠现实数据那“少数据、小模型、弱算力”也能做好空间智能。这个结论不存在。仿真是数据自监督是数据世界模型生成的是伪数据机器人自采的传感器流也是数据。区别只是这些数据的获取成本、标注形式和分布覆盖与人工标注不同。实际项目里正确的做法是优化“数据获取成本结构”而不是幻想“不需要数据”。要计算每一条有效训练信号的成本然后选择最低成本的来源组合。仿真可能便宜但迁移有损自监督便宜但信息不够结构化真实数据贵但在最终部署阶段不可替代。6.2 仿真数据带来的偏置和迁移困难仿真数据可以无限生成但它不一定“无限正确”。物理引擎对接触、摩擦、断裂、流体等复杂物理现象的模拟仍有误差场景编辑器里生成的物体布局也可能偏向设计者的主观选择。一个具体案例是机器人训练时总是看到物体摆放在桌面中央真实环境中物体经常靠在墙边、被其他物体半遮挡模型就会失效。这不是因为模型容量不够而是因为仿真场景的参数分布没有覆盖真实分布。解决办法有三个扩大域随机化的范围和种类在仿真场景中建模常见的人为摆放习惯训练后加入真实数据微调。一定要把仿真数据当作“覆盖长尾场景的手段”而不是当作“替代真实分布的途径”。另外仿真器版本和物理参数必须与训练记录一一对应否则模型性能变化时很难定位是算法问题还是仿真环境问题。6.3 把访谈观点当作成熟工程方案直接落地把学术观点或研究趋势直接映射到工程方案是技术团队最常犯的错误。访谈中讨论的是研究方向和长期目标距离可以直接套用的工程方案还有很长的距离。在一个具体项目里落地时要先做拆解到底要用空间智能解决哪个子问题是机器人抓取还是自动驾驶感知还是工业质检里的缺陷定位每个子问题对应的数据策略完全不同。不要因为看到一个研究概念很有启发就推翻现有方案重新搭一个世界模型风险极高。推荐的做法是先在现有系统中找一个“真实标注数据最贵、模型表现最差”的环节用仿真数据或自监督信号做一个小规模实验对比加入前后指标变化。如果实验效果明显再逐步扩大范围。每次引入新数据源都要记录数据比例、训练成本、模型效果和失败案例形成可复用的经验。6.4 可复用的实践清单检查项检查方式未通过时的处理任务是否定义了量化成功标准验收指标是否可计算先定义指标再开始训练训练数据、验证数据、测试数据是否严格分开数据版本和路径是否隔离统一数据管理建立数据版本表仿真器物理参数是否贴近真实环境对比关键动作的真实与仿真录像调整参数或扩大域随机化范围模型是否真的理解空间结构跑分布外空间关系测试增加三维监督信号或仿真数据sim-to-real gap 是否可控真实环境小样本验证加入真实数据微调和失败案例回放失败案例是否被记录是否有失败案例库和日志建立自动化的失败样本收集流程模型回滚是否可执行训练版本与配置是否可追溯固定模型版本保存完整训练元信息这份清单可以用于周会评审、模型迭代前后检查和实验设计阶段。它能保证团队在讨论空间智能和价值判断时始终有一部分可量化的数据作为依据。收尾把这个观点变成下一步可做的事李飞飞在访谈中的这句话真正的价值不在于“人也不需要数据”这个表面结论而在于逼迫我们去区分三种东西人工标注的现实数据、来自物理世界的反馈信号、以及模型内部的预测推演。过去主流 AI 训练过度押注了第一种而空间智能和具身智能的研究方向本质上是想更多利用后两种。对一个工程师来说最有价值的行动不是反复讨论访谈观点是否正确而是先回答一个具体问题当前项目里哪些数据最贵哪些场景最难覆盖哪些失败案例反复出现然后选择一个最痛点的小环节用仿真环境、自监督学习或世界模型做一次最小实验对比引入前后指标变化。如果这篇文章只能留下一个判断那就是无论 AI 是否有一天能像人一样学习工程上都必须先学会用更低成本获取更高质量的学习信号。空间智能、具身智能、仿真数据和世界模型不是几条技术路径的简单集合它们共同指向一个方向——让模型不再只是记住现实数据而是理解现实背后的规律。

相关新闻