
EXECUTIVE BRIEF2026-08-22 · AI技术研究科普AI 技术与科研科普你训练了一个AI Agent测试集上表现不错一上线就总犯低级错误。你查数据、调超参、甚至换模型但问题依旧。你可能会想是不是过拟合或者是部署环境有什么坑但一个被忽略的元凶可能藏在计算机处理小数的方式里它就是浮点非结合性。高管视角落地方法风险边界2026-08-22 · 全文约2538字 · 阅读6分钟研究问题浮点非结合性会造成训练与推理的logprob不一致且误差会核心机制SkyRL的IsoExec通过执行合同和统一模型实现位级一致已知边界位级一致不是免费午餐25.3%的开销需要在稳定性与成本之间 BOARD MEMO · 董事会摘要一句话结论浮点非结合性会造成训练与推理的logprob不一致且误差会随并行度放大。实验发现SkyRL的IsoExec通过执行合同和统一模型实现位级一致实测误差降低5个数量级。现实意义位级一致不是免费午餐25.3%的开销需要在稳定性与成本之间权衡。⚖ 方案对比浮点顺序不同结果漂移训练时多GPU并行计算不同卡上的累加顺序可能不同logprob结果有微小偏差推理时单卡或另一种并行布局累加顺序改变导致同样的输入得到不同概率 流程设计IsoExec如何做到位级一致执行合同强制所有计算算子使用固定顺序禁止自由重排统一模型训练和推理共用同一代码路径消除实现差异位级验证对比每个bit输出确保训练与推理完全一致壹训练时9分上线就变7分不是过拟合很多做AI落地的团队都遇到过这种诡异现象模型在训练集和测试集上指标漂亮一部署到线上实际效果就掉一截。常见归因是「过拟合」或者「数据分布偏移」但有时候真正的元凶根本不在数据和算法层面而在硬件和计算的细节里。SkyRL团队在研究强化学习训练时发现即使用完全相同的模型权重和数据训练时算出的动作概率logprob和部署后推理时算出的值也会不一样。这个差异不大通常在1.6e-2这个量级但足以让策略更新方向发生偏移累积下来模型就像「学错了东西」。问题根源是浮点数的非结合性。计算机用二进制表示小数时精度有限而且浮点加法不满足结合律。举个例子在十进制下(0.10.2)0.3 和 0.1(0.20.3) 结果相同但在二进制浮点下二者可能不同。当模型在多个GPU上并行训练时每个GPU对一批数据的累加顺序可能不同最后汇总的结果就带有随机性。 管理层提示模型训练和部署表现不一致很多时候不是模型的锅而是计算顺序的锅。贰生活类比做菜加盐的顺序决定了咸淡为了理解浮点非结合性可以把它想象成做菜。同样一勺盐先放后放、分几次放最终菜的味道会略有不同。计算机做浮点加法也一样顺序不同结果会因舍入产生细微差别。在单机单卡上这个顺序是确定的所以训练和推理还能对得上。但一旦引入多GPU并行比如把一个大矩阵拆到8张卡上分别计算每张卡独立累加再把结果合并那么合并的顺序就变成不确定的了。训练时用一套并行策略推理时可能用另一套或者同一套策略在不同硬件上执行顺序会有差异这就导致同一模型对同一输入给出了不同的概率。对于确定性要求极高的强化学习来说这种误差是致命的。强化学习依赖「动作概率」来计算梯度如果训练时概率和实际部署时概率不一致就相当于模型在一个错误的目标上优化。用SkyRL论文的话说这不是简单的精度问题而是「策略不一致」问题。 管理层提示并行计算像多个厨师一起做菜每个人加盐的时机不同最后味道就会飘。叁IsoExec的三板斧执行合同、统一模型、位级验证SkyRL团队提出的解决方案叫IsoExec核心思路是让训练和推理的每个计算步骤都保持「位级一致」也就是二进制层面完全相同。第一板斧是「执行合同」。他们为所有算子强制定义一个计算顺序不允许编译器或硬件做任何重排。比如矩阵乘法必须按照固定分块方式累加即使这样会牺牲一点性能。第二板斧是「统一模型」。训练和推理共用同一套代码路径彻底消除因为实现不同比如训练用一种算法推理用另一种带来的系统性偏差。第三板斧是「位级验证」。他们在训练过程中周期性地对比训练和推理的logprob输出确保两者完全一致即每个bit都相同而不是仅比较近似误差。最终在Qwen3.5-35B-A3B模型上使用DAPO配置logprob差值从1.6e-2降到了6.7e-7降低了超过4个数量级。 管理层提示与其事后排查线上「灵异事件」不如在计算层面把训练和推理焊死在同一条轨道上。肆不是免费午餐25.3%的开销换来了什么你可能会想把训练和推理完全对齐会不会让训练慢很多确实IsoExec不是零成本。论文报告全步骤开销为25.3%这意味着训练时间大约增加四分之一。这个开销来自固定的计算顺序和额外的验证操作。对于大规模训练任务这不算小数目。但SkyRL认为相比训练不稳定导致的反复调试、模型上线后出错造成的业务损失25.3%的开销在多数场景下是划算的。更关键的是这个方案提供了一种可复现的工程路径。如果你的团队在训练RL模型或者做任何需要高一致性的AI系统可以考虑引入类似执行合同的机制哪怕先只做「训练推理一致性检查」也能提早发现潜在问题。需要注意的是这项研究目前还没有说明是否适用于所有模型和所有并行策略25.3%的开销也是在特定硬件和配置下测得的。但在位级一致这个方向上它给出了一个明确的参照。 管理层提示为稳定性多付25%的算力比上线后半夜救火便宜得多。伍对普通团队意味着什么至少加上一致性检查你不一定需要立刻用IsoExec但可以从这个研究里学到一件事训练和推理环境不一致是真实存在的而且会静默影响模型效果。如果你在微调或从零训练模型建议在部署前做一次「训练推理一致性测试」用同一批输入对比训练环境和推理环境的输出logprob如果差值超过某个阈值比如1e-4就要检查并行策略、框架版本和硬件差异。对于使用开源RL库如SkyRL、OpenRLHF等的团队关注这类新特性什么时候进入稳定版。在执行合同和统一模型之外也可以先从限制并行布局、固定随机种子、统一浮点精度入手降低不一致风险。说到底AI落地不只是选模型、调prompt底层计算细节同样决定成败。这个研究提醒我们对AI系统的可靠性追求应该从「差不多能用」升级到「可复现、可验证」。 管理层提示把一致性当做一个上线指标而不是等出了问题才想起来检查。 RESEARCH · 结论与边界今天就能做的动作在你下一次模型部署前加一个简单的logprob一致性检查。如果发现训练和推理输出有明显差异先别急着换数据去查查并行布局和浮点精度。把这条检查加入你的上线清单能避免不少深夜救火。ABOUT PARSENOVA · 宇析智能把前沿论文讲成人人都能懂的技术故事ParseNova 宇析智能成立于2021年服务覆盖新媒体、制造、教育、电商、物流等20行业深耕欧洲及中国市场已为100海内外客户提供AI定制化方案在欧洲多地设有办公地点海外业务覆盖瑞士、德国、荷兰、法国等地。AI定制化方案Agent与自动化工作流AI技术咨询数据与RAG知识库客户案例经脱敏荷兰物流 · 德国零售线路规划与排班自动化在线超市客服系统AI化改造。瑞士娱乐 · AI数字媒体搭建AI数字媒体内容与运营流程支持多语言分发。深圳与杭州电商 · 自动化增长海外AI自动营销商品视频、图片等资料自动生成。你的业务里哪条流程最该先用 AI评论区聊聊你的场景或私信「行业 业务环节」我们免费帮你梳理一份改造优先级清单。