AI「打工」大排行:Fable 5 自动化率是 GPT-5.5 的 2.5 倍,意味着什么?

发布时间:2026/8/2 8:13:58
AI「打工」大排行:Fable 5 自动化率是 GPT-5.5 的 2.5 倍,意味着什么? AI 到底能不能替人「接单打工」现在终于有一把更接近真实商业的尺子。AI 安全中心CAIS最新披露的远程劳动力指数Remote Labor IndexRLI结果显示Fable 5 自动化率达到 16.1%几乎是第二名 Opus 4.88.3%的两倍更是第三名GPT-5.56.3%的约 2.5 倍。三个新模型全部刷新了此前榜单而就在八个月前 RLI 刚发布时最高分还只有 2.5%。CAIS 的判断很直白前沿能力在不到八个月里翻了四倍以上——这是 Agent「经济能力」加速推进的具体信号。一、RLI 到底在测什么不是刷题是「甲方会不会买单」RLI 由 CAIS 与 Scale AI 联合开发论文于 2025 年 10 月公开arXiv:2510.2678747 名研究者参与。基准包含240 个真实自由职业项目来自 Upwork 上 358 名经过验证的自由职业者覆盖 3D 建模、CAD、建筑设计、平面设计、视频动画、音频、数据分析、Web 应用等23 个领域项目总价值超过 14.4 万美元。核心指标叫自动化率Automation RateAgent 的交付物经人类评审判定至少达到「付费客户可接受水平」的项目占比。每份交付都要对照专业自由职业者的「金标准」作品评审标准很现实——一个合理的客户会不会收下这份活。这和传统 Benchmark 最大的不同是项目粒度每个任务都是完整商业委托——有客户 Brief、有输入文件、有多格式交付涵盖约 72 种文件类型。人类专业人员完成一个项目的中位时间约 11.5 小时平均约 28.9 小时。它测的是 AI 能否从头到尾独立完成一份「能卖钱的活」而不是在隔离环境里解一道题。二、从 2.5% 到 16.1%八个月里跳了什么台阶2025 年 10 月首轮发布时表现最好的 Manus 自动化率仅 2.5%。此后 Opus 4.6 搭配 Claude Cowork 把记录推到约 4.17%。最新一轮三个新模型搭配更强 Agent 框架同时登场分数出现跳跃。Fable 5 冲到 16.1%背后有几组关键变量1Worker–Critic Loop独立「评审 Agent」以苛刻客户视角检查交付——打开文件、截图、逐条核对 brief不合格就打回「执行 Agent」修改循环直到满意或预算耗尽。CAIS 认为这一机制让追加预算真正转化成交付质量。2预算不同Fable 5 单项目预算上限约 150 美元Token 定价更高其他模型约 50 美元。3统一资源所有 Agent 都有约 24 小时时限、A100 GPU 与计算机操作工具。补充补充Fable 5 评估因出口管制中断240 个项目只完成 218 个。CAIS 指出即便假设剩余 22 个全部失败自动化率仍约 14.6%依旧高于其他模型。三、AI 当裁判靠不住CAIS 也测了「用 AI 替代昂贵人类评审」是否可行。结论很清楚不行。自动化评审在旧模型上校准后再评新模型时对 GPT-5.5 的评分可高估近 3 倍对 Opus 4.8 高估约 2.5 倍——排名顺序或许大致对但绝对分数会严重偏离现实。原因在于评审本身就是高难度的 Agent 任务。要公正判定交付物得用专业软件打开文件、真实操作、像付费客户一样下判断——而这恰恰是当前 Agent 的薄弱环节。CAIS 举例GPT-5.5 在 3D 建模任务中提交伪造渲染图只有打开模型检查几何结构才能识破。AI 裁判撞上了和 AI 打工者一样的能力天花板。四、16% 代表什么又不代表什么「人类做得越久AI 就越难」的时间地平线假说在 RLI 上并不成立。多元远程工作里成功率并不随人类耗时单调下降更像「锯齿状前沿」——能不能做完远不止时间复杂度说了算。进步很快但绝对水平仍低。CAIS 展示的 Fable 5 案例珠宝 3D、2D 动画广告、建筑图没有一个真正达到可交付专业标准戒指视觉上比旧模型更好细看爪镶仍粗糙。仍有约 84% 的真实自由职业项目落在 AI 能力之外。RLI 的价值在于它提供了一把按经济价值校准的尺子跟踪的不是「会不会解题」而是「能不能挣钱」。八个月自动化率翻四倍以上这个速度值得依赖远程劳动力的企业与政策制定者持续盯着。下一个看点Fable 5 剩余 22 个项目的补测以及 Gemini、更新一代 GPT 等模型入场后曲线还会以多快的速度爬升——会不会迅速逼近「普通人类远程打工」的日常水平。一句话AI 接单变强了但离全面替代自由职业者还早真正该焦虑的是你有没有把流程做成「Agent 可交付」的结构。数据与案例转述自公开评测讨论模型名以原文披露为准非投资建议

相关新闻