欢迎您来到辽宁人才派遣网,在这里为您提供最一流的人力资源服务!

全球大厂正在修改AI绩效评估:从“用量"转向“产出",弃用采用率仪表盘与Token指标

来源:HRflag

  本周,Meta 负责应用 AI 工程的 Maher Saba 与负责基础设施与工程的 Santosh Janardhan,向内部发出一份更新工程师期望的备忘录。9 月 2 日,WIRED 等媒体披露了其中的内容。文件里有一句话很快传到了外面:公司“不会使用 AI 采用率仪表盘或 token 使用量来评估员工影响力”。

  Meta 发言人 Tracy Clayton 向媒体确认了这一表述。同一份备忘录披露,Meta 目前 93% 的代码修改已由 AI 代理辅助完成;但文件同时写明,采用人工智能“本身并不是最终目标”,目标是“更好的结果——更高质量的交付、更快的迭代”。管理者被要求把注意力放回三件事:产出质量、工作速度,以及一个人所负责问题的复杂度与范围。

  一并被废止的还有两样东西:原始 token 计数,以及挂在员工档案上的 AI Native / AI First / AI Enabled 标签。绩效语言也换了口径——过去写的是“AI 驱动的影响力”(AI-driven impact),现在写的是,这些成果“可以由 AI 支持,也可以由其他方式达成”。

  这不是一次胜利宣告。这是一次撤退。

  要理解它撤到了哪里,得先回到十个月前,Meta 是怎么走上去的。

  一、一块屏被关掉了

  先说一个已经被反复转述、但很少被认真读完的故事。

  今年 4 月 7 日,The Information 报道了 Meta 内部一块叫 “Claudeonomics” 的看板。它不是公司项目,是一名员工自己做的。它把全公司八万多人的 AI token 消耗拉成一张排行榜,只显示前 250 名,并且给上榜者发头衔——“Token Legend”(token 传奇)、“Cache Wizard”(缓存巫师)。

  数据是这样的:30 天内,员工累计消耗超过 60.2 万亿 token。榜首那位,月均 2810 亿 token,按外部估算,仅此一人的月度成本就可能超过 140 万美元。

  还有一个细节值得停一下:扎克伯格和 CTO 博斯沃思(Andrew Bosworth)都不在前 250 名里。

  4 月 9 日,报道发出两天后,这块看板下线了。页面留了一句话:“由于本看板的数据被分享到了外部,我们决定暂时关闭 Claudeonomics。”Meta 后来的说法是,员工自愿撤下的。

  请注意这句公告的措辞。它给出的关闭理由是“数据泄露到了外面”,不是“这个指标是错的”。

  从 4 月 9 日到 9 月 2 日,隔了将近五个月。这五个月里发生的事,才是这次备忘录真正的注脚。

  二、“刷 token”不是员工的道德问题,是制度的输出

  时间线其实很清楚。

  2025 年 11 月 14 日,Meta 人力负责人 Janelle Gale 发出内部备忘录:“当我们走向一个 AI 原生的未来,我们希望认可那些帮我们更快抵达那里的人。”从 2026 年起,“AI 驱动的影响力”成为绩效的核心期望。同年 12 月 8 日,公司上线“AI Performance Assistant”,员工可以用它来写自己的绩效自评——用 AI 写“我如何使用了 AI”。

  指标随后一层层压下去。据外媒报道,Meta 负责 Facebook、WhatsApp、Messenger 的 creation 组织,在 2026 年上半年期望 65% 的工程师用 AI 写出超过 75% 的代码;可扩展机器学习部门的区间是 50%—80%;2025 年底的全公司口径是,中心产品团队 55% 的代码修改要由 AI 代理支持;此外,80% 的中高级工程师需要采用 Gemini、DevMate、Metamate 等平台。

  于是有了一个新词:tokenmaxxing。

  把这三件事放在一起看——绩效挂钩“AI 驱动的影响力”、档案上贴 AI Native 标签、公司里有一块公开的 token 排行榜——“刷 token”就不是什么值得批判的个人行为,它是这套制度在理性人身上的必然输出。一个员工如果不去把 token 数刷上去,他反而是在承担风险。

  这件事的原理古老到有点乏味。1975 年,古德哈特(Charles Goodhart)说过:当一个指标被用作政策目标,它就不再是一个好的度量。更早一点,比尔·盖茨有一句更适合软件行业的比喻:用代码行数衡量编程进度,就像用重量衡量飞机制造的进度。

  苏联计划经济时代有个被讲烂了的例子:钉子厂按吨位考核,就生产巨钉;改成按数量考核,就生产微钉。它讲烂了,但它没过时——过去二十年,互联网公司拜 DAU、拜 GMV,然后有了刷量和刷单;医院考核床位周转率,然后有了“该住院的赶出去”。

  AI 时代的新变化是:这一次,被考核的那个动作,成本几乎为零。

  刷 DAU 需要买流量,刷 GMV 需要垫资金,刷代码行数至少还得敲键盘。刷 token 只需要把一个 prompt 扔进 agent,然后去开会。这是 tokenmaxxing 传播得如此之快的技术原因——它是所有“表演式 KPI”里边际成本更低的一种。

  今年 6 月,博斯沃思在一份发给约 6000 名员工的备忘录里写道:“没有人应该为了用 AI 工具而用 AI 工具。所有的动作都不等于进展,而 token 使用量本身,在任何意义上都不是影响力的度量。”

  那时候,30 天的读数已经从 60.2 万亿涨到了 73.7 万亿。

  三、Shopify 考的是举证责任,Meta 考的是计量

  把镜头拉远一点会发现,Meta 不是一家把 AI 使用写进绩效的公司,但它选了最容易出事的那种写法。

  2025 年 4 月 7 日,Shopify 创始人 Tobi Lütke 把一封内部信公开了,标题是“反射性地使用 AI,现在是 Shopify 的基线期望”。信里有三句关键的话:

  他还写了一句相当不留退路的话:“我看不出(不用 AI)在今天能行得通,明天更不行。停滞几乎是必然的。”

  同一时期,微软、谷歌、亚马逊都把 AI 使用从“可选”变成了“不可选”;埃森哲更进一步,把 AI 使用与晋升资格挂钩。2025 年 9 月一项覆盖 1295 家公司的调研显示,58% 的企业已经硬性要求一定数量的员工使用 AI 工具。

  但请仔细看 Shopify 那句话和 Meta 那块看板之间的差别。

  Shopify 的做法本质上是转移举证责任:默认答案变成“先用 AI 试”,你要走人力路线,得给出理由。它考的是决策顺序,不是消耗量。这种设计有它自己的问题——它会制造“为了应付审批而编造的 AI 可行性论证”——但它至少没有给出一个可以被直接刷高的数字。

  Meta 的做法是计量:AI 驱动的影响力、AI Native 标签、token 排行榜。计量型指标一旦公开、一旦挂钩绩效、一旦刷起来几乎不花钱,它的结局就已经写好了。

  一句可以拿去用的判断:在 AI 落地这件事上,改默认选项通常比设数字目标安全。 前者改变行为的起点,后者改变行为的伪装。

  四、220% 与 36%

  真正让这套指标体系撑不住的,不是排行榜被曝光,是另一组数字。

  据 The Next Web、Forbes 等媒体基于内部信息的报道,Meta 今年推进过一个代号 Project OT 的重组计划:部分团队削减最多 60%,产品团队从 10—20 人的专家组,压缩成 3—5 人的 “pod”,所有人统一一个头衔——“builder”(构建者),中层管理被抹掉,单元负责人直接管 30—50 人。这个计划据称在 1 月成形于扎克伯格的夏威夷住所。

  然后是内部数据:

  - 基础设施的代码修改量同比增长 220%;

  - 但真正到达用户、形成新功能或功能升级的改动,只增长了 36%;

  - 重大技术与安全事故同比上升 40%;

  - 用于事故响应的“救火”时间上升 70%;

  - 半年度 Pulse 员工调研的好评率,从 74% 掉到 55%。

  220% 对 36%。这两个数字之间的那道口子,就是“用量”和“产出”的全部距离。

  代码修改量是能被自动采集的,功能交付不是。事故是滞后发生的,token 是实时计数的。当考核只认前者,一个组织会非常高效地生产出前者。

  5 月 19 日,第一波裁员执行前几个小时,扎克伯格取消了原定 11 月的第二波。5 月 20 日,第一波落地,约 8000 人离开,占员工总数约 10%;同一周,7000 人被转入 AI 相关岗位。7 月,26 名被裁员工提起诉讼,指控裁员的筛选方式针对了处于病假中的员工。

  扎克伯格给出的解释是:“agentic development 在过去至少四个月里的轨迹,并没有像我们预期的那样加速。”

  工程界的评论要直接得多。Gergely Orosz 的说法是:一种建立了二十年的工程文化,被一夜之间摧毁——这也顺带解释了,为什么在业务表现并不差的时候,工程师仍在流失。

  五、验证税:用量指标为什么会系统性地骗人

  Meta 的遭遇不是孤例,它甚至不算意外。过去一年,几份严肃的行业研究已经把这件事说得很清楚了。

  第一个证据是关于“人会骗自己”。

  METR 做过一次随机对照试验:16 名经验丰富的开源贡献者,246 个真实任务(bug 修复、新功能、重构),仓库是平均两万两千星以上、百万行级别的大型项目,工具是 Cursor Pro 配 Claude 3.5/3.7 Sonnet。

  结果是:允许使用 AI 工具时,他们完成任务的时间长了 19%。

  而这些开发者事前预计会快 24%;做完之后,在已经真实变慢的情况下,他们仍然认为 AI 让自己快了 20%。

  19% 的实际变慢,和 20% 的自我感觉加速,之间是接近 40 个百分点的认知落差。研究者说他们本来是预期看到正向加速的。

  这一点对管理的含义很硬:自评问卷和“用了多少”的自我报告,都不足以支撑绩效判断——不是因为员工不诚实,是因为人在这件事上会真诚地估错。

  第二个证据是关于“吞吐和稳定性同时动”。

  DORA 2025 报告的数据:90% 的技术从业者已经在工作中使用 AI,超过 80% 认为它提高了自己的生产力,但同时有 30% 的开发者表示对 AI 生成的代码“几乎没有信任”。

  更关键的是它的相关性发现:AI 采用度越高的组织,软件交付吞吐量和交付不稳定性同时上升。

  DORA 给这个现象起了个名字——验证税(verification tax)。写代码省下来的时间,被重新分配到了验证环节。报告里有一句工程师原话:“我感觉自己生产力高了一点,但这是有代价的。我写代码的时间变少了,但我花更多时间在给 AI 当保姆。”

  报告的建议写得很不客气:必须“停止依赖这类狭窄的、基于产出量的指标来度量真实的生产力”,因为 AI 会在不提升开发者实际效能的前提下,先把代码体量做上去。

  广告

  第三个证据是关于“能委托的边界”。

  Anthropic 今年的 Agentic Coding 趋势报告给出了一组更精细的比例:工程师大约 60% 的工作会用到 AI,但真正能“完全委托”出去的任务只有 0%—20%;另有 27% 的 AI 辅助工作,属于“过去根本不会去做的任务”。

  这组数字解释了两件看似矛盾的事同时为真:AI 的渗透率可以很高(60%,或者 Meta 的 93%),而可自动化的完整任务份额可以很低(0%—20%)。渗透率高不等于替代率高。 把这两个数混为一谈,就是 Project OT 那份重组方案在算术上出错的地方。

  回到度量本身。用量指标的根本缺陷不在于它“不准”,而在于它测的是投入。在传统生产里,投入至少是一种稀缺资源,测投入还算有点信息量。而 AI 的边际调用成本极低——投入几乎不构成约束。当一个约束消失,围绕它建立的指标就同时失去了两样东西:区分度,和抗操纵性。

  六、出问题的时候,是谁写的?

  用量考核还有两笔成本,从来不出现在任何仪表盘上。

  第一笔是影子 IT。

  Spektrum Labs 的 CISO Joshua Brown 说过一句很实在的话:“人总会去做任何能让自己把活高效干完的事。”当公司下达“必须多用 AI”的指令,而批准的工具又不好用或者被限流,员工会自己找工具。企业采购目录之外的模型、个人账号、把内部代码粘进公开对话框——这些行为不会体现在采用率上升的那条曲线里,但它们真实地扩大了攻击面。

  Brown 对管理者的建议只有一句:“别只说’多用 AI’,要说’多用 AI 去做什么’。”

  值得一提的是,Meta 今年夏天开始对员工 AI 用量做配给。配给和“必须多用”是两条方向相反的指令,同时存在于一个组织里的时候,一线员工会怎么解题,是可以预料的。

  第二笔是责任归属。

  Silverfort 的副总裁 Roy Akerman 提了一个问题,值得每个技术管理者认真回答一遍:

  “这是谁做的?我?那些 AI 代理?还是 copilot?”

  他补了一句更根本的:“旧的框架假设,访问系统、执行操作的主体是人。”

  这件事和 Meta 的数字直接咬合。当代码修改量同比涨 220%、重大事故涨 40%、救火时间涨 70%,事故复盘会面对一个新问题:一次故障,归因到写下这段代码的工程师,还是归因到生成它的 agent,还是归因到批准合并的评审人?

  如果考核体系奖励的是“我用 AI 做了多少”,那么在出成绩时,功劳自然归人;在出事故时,责任就很容易滑向工具。这种不对称一旦形成,它会比任何指标都更快地腐蚀工程质量——因为它让“少看一眼”变成了一个低风险选择。

  93% 这个数字里,藏着的正是这个问题的规模。

  七、账本这一边,也不站在“用量”这里

  值得注意的是,Meta 这次转向并不只是一次管理观念上的自我纠正。账本也在推着它走。

  据报道,仅内部使用一项,Meta 2026 年的 AI 成本就在向数十亿美元逼近。公司为此准备了三步:从 2027 年起对消耗实施预算与配额;上线一个叫 “AI Gateway” 的中央看板,追踪用量与支出;以及,把工程师从 Claude 这类第三方工具,导向自研的 MetaCode 助手。今年夏天,Meta 已经开始对员工的 AI 用量做配给。

  这里有一个必须说出来的落差。据 The New Stack 报道,Meta 自研模型 Muse Spark 1.1 在 DeepSWE 1.1 榜单(113 个任务)上的成绩是 53%,而 GPT-5.6 Sol 是 73%,Claude Opus 5 是 74%。价格更便宜——每百万输入 token 1.25 美元、输出 4.25 美元——但在 OpenAI 于 7 月大幅降价之后,这点价格优势也在被挤压。

  Meta 补这个差距的办法,颇有意思:让工程师改 MetaCode 犯的错。报道称,Maher Saba 的一份内部备忘录提到,7000 名周活用户已经提交了 800 多处代码纠正;公司捕捉的是完整的真实工作流——原始任务、MetaCode 的输出、工程师的修改,以及通过评审所需的测试。这些数据被用于 Muse Spark 1.1 和一个代号 “Watermelon”(西瓜)的内部模型的后训练。

  激励方式是:在员工档案上发彩色徽章。

  这就是这次转向里最微妙的一处。 公司在同一时期做了两件方向相反的事:一边废止 token 计数和 AI Native 标签这类“过程激励”,一边用彩色徽章鼓励另一种过程行为——提交纠错。

  区别当然是有的:纠错徽章激励的是一个有明确外部效用的动作(喂出更好的模型),而 token 排行榜激励的只是消耗本身。但机制是同一类机制。一个组织如果不改变“用可采集的行为换积分”这个底层习惯,它只会换一次刷分的对象。 这也是接下来值得盯的地方:徽章会不会变成新的 tokenmaxxing。

  八、新指标的难处:它需要中层,而中层刚被砍掉

  备忘录给管理者留下的新准绳是三条:产出质量、工作速度、所负责问题的复杂度与范围。

  方向没错。但把这三条拿到一个 8 万人的工程组织里逐条落地,每一条都比“数 token”难一个量级。

  产出质量是滞后的。 一次改动的质量,要经过评审、上线、灰度、事故窗口,才能被看清。Meta 自己的数字就是证明——代码修改涨 220% 的同期,重大事故涨 40%、救火时间涨 70%。这些是季度之后才结算的账。而绩效周期不等账。

  工作速度会被“量”污染。 速度的分子是交付,分母是时间。AI 最擅长的,恰恰是把分子里那个“看起来像交付”的部分做大。Meta 的 220% 对 36%,就是分子被注水后的样子。如果不重新定义“什么算一次交付”,考核速度会退化成考核吞吐量,而考核吞吐量就是换了名字的用量考核。

  复杂度与范围没法自动采集。 这一条最重要,也最主观。判断一个人今年扛的问题是不是更难了、边界是不是更宽了,只能靠了解他工作的人做判断——也就是一线经理和同行。

  这就撞上了 Project OT 留下的结构性矛盾:新的度量方式高度依赖人的判断,而这套重组方案的核心动作之一,就是抹掉中层管理、把单元负责人的管辖半径扩到 30—50 人。

  一个经理带 5 个人,他能对每个人负责问题的复杂度做出可辩护的判断。带 40 个人,他能拿到的只有仪表盘。

  于是形成了一个闭环:因为管理带宽不够,所以依赖自动指标;因为依赖自动指标,所以指标纵;因为指标纵,所以决策失真;因为决策失真,所以继续砍人以求效率。Meta 这一年,几乎把这个循环走了一整圈。

  软件工程度量领域有个老结论,今天读起来更刺人:凡是能被自动采集的,通常都不重要;凡是重要的,通常都得靠人来判断。 AI 把前半句的产量放大了一百倍,却一点也没有减轻后半句的负担。

  最后一个问题:为什么是 Meta 先撞上这堵墙?

  不是因为它最激进,而是因为三件事在它身上恰好叠在了一起。

  一是路径依赖。从 2023 年的“效率之年”开始,Meta 已经习惯用“效率”这套叙事驱动组织变动,并且尝到过股价上的甜头。当 AI 出现,它几乎是自动地把 AI 接到了同一根叙事管道上——AI 意味着更少的人、更快的交付。这不是新决策,是旧成功的延长线。

  二是打分机制。Meta 的绩效体系以强区分度著称,需要在大量员工之间给出可比、可辩护的评级。这种体系天生渴求可量化、可自动采集的输入——而 token 计数刚好是全公司最容易拿到、最“客观”的一个数。

  三是规模。八万多人的组织里,靠人来判断“问题的复杂度与范围”,管理成本高得惊人。仪表盘是看起来能规模化的方案。

  三件事叠加,Meta 成了最有可能把采用率直接焊到个人绩效上的公司,也因此成了最快看到这条路尽头的公司。这一点对旁观者其实是好消息:Meta 用一年时间、约 8000 个岗位、40% 的事故增长和 19 个百分点的员工好评率下滑,替所有人做完了这次实验。

  九、对中国公司,这件事的可操作含义

  Meta 的这轮反复,对国内正在推 AI 落地的组织,有几个直接可用的判断。

  前面提过的那组数字值得再看一遍:58% 的企业已经硬性要求一定数量的员工使用 AI 工具。国内的对应物大家都熟悉:AI 使用率周报、提示词大赛、“每个部门月内提交 N 个 AI 应用场景”、把工具登录天数纳入部门考核。

  第一,采用率指标在推广期是有效的,问题在于它没有退出机制。

  这一点需要说公道话:在渗透率从 5% 到 50% 的阶段,考核“用不用”是有用的。它对抗的是组织惯性,成本低、见效快。Meta 用一年把 AI 辅助的代码修改推到 93%,采用率考核在其中是起了作用的。

  真正的错误是把一支临时的脚手架当成了建筑。所有推广期指标都应该在设立的当天就写好退役条件——比如“渗透率连续两个季度超过 70% 后自动作废”。没有退役条件的过程指标,一定会活得比它的用处更久,然后开始反过来消耗组织。

  第二,判断该不该退役采用率指标,有一个很简单的标准:区分度。

  当一个指标在你的组织里已经无法区分好员工和差员工,它就该下线了。93% 意味着几乎所有人都在用 AI,此时继续考核“用不用”,测出来的差异全部来自噪声和表演。反过来,如果你的渗透率还在 20%,那这个指标暂时还有信息量。

  第三,替代方案不是“换一个更聪明的自动指标”。

  这是最容易犯的错。很多组织从“AI 使用率”退下来之后,转向“AI 生成代码占比”“AI 处理工单数”“AI 节省人时”——这些依然是用量指标,只是包装换了。它们会以完全相同的方式纵。

  Meta 给出的三条(质量、速度、问题的复杂度与范围)之所以看起来“不够量化”,正是因为它们必须不够量化。可行的做法更接近这样:

  - 把度量单位从“动作”换成“交付物”——不数调用次数,数真正到达用户/客户手里、并且在事故窗口之后活下来的东西;

  - 把成本一并入账——省下的人时,要减去验证、评审、返工和事故响应的增量。DORA 的“验证税”不是修辞,它是需要真实计入的一行支出;

  - 承认这件事需要人来判断,并且为这件判断保留管理带宽。这是一条花钱的建议,也是最容易被跳过的一条。

  如果要更具体一点,可以落成三个能被审计的口径:

  交付物存活率。 不看提交了多少改动,看这些改动在 30 天或 90 天之后还活着多少——没有被回滚、没有被重写、没有引发事故。AI 生成的代码在这个口径下的表现,才是它真实的价值。这个口径的好处是它无法被“多调用几次”刷高。

  事故归因表。 每一次重大事故的复盘,都要回答一个新增问题:这段代码是谁写的、谁评审的、AI 参与到哪一步、评审时看了多久。不是为了追责,是为了让“验证税”变成一笔看得见的账。Meta 的救火时间涨 70%,如果没有这张表,这 70% 就永远只是一个成本,不会变成一个可改进的输入。

  证据链自评。 绩效自评里不问“你用了多少 AI”,改问三个问题:今年你负责过的最难的一个问题是什么?它难在哪?如果没有 AI,这件事会怎么做、要多久?第三个问题会自然逼出 AI 的真实贡献,而且它很难编——因为它需要对业务有具体理解,而不是对工具有使用记录。

  这三条都需要人来读、来判断,都无法自动生成一张周报。这正是它们的价值所在。

  第四,也是最容易被忽略的一条成本:采用率考核真正的代价,不是员工演戏,是它教会整个组织用错误的语言讨论 AI。

  当一家公司连续一年在周会上汇报“我们的 AI 使用率提升到了 78%”,它的管理层会逐渐失去讨论“我们靠 AI 多做出了什么”的能力。指标塑造话语,话语塑造决策。Project OT 那份按 60% 比例砍团队的方案,正是在“渗透率很高、所以人可以很少”这套话语里被写出来的。

  尾声:93% 也是一个用量指标

  最后回到那个被所有人转载的数字。

  93% 的代码修改由 AI 代理辅助完成——这句话里的“辅助”没有定义。是 agent 独立提交并通过评审,还是工程师在 IDE 里接受了一次补全?是整个改动由 AI 生成,还是其中一行?口径不同,93% 的含义可以相差几个数量级。

  一个可以拿来对照的数字:2025 年 4 月 30 日,在 Meta 自己举办的 LlamaCon 开发者大会上,纳德拉(Satya Nadella)当着扎克伯格的面说,“我想大概 20%、30% 的代码,在我们今天的仓库里、在我们的一些项目里,可能全都是软件写的。”

  注意他的措辞——“我想大概”、“我们的一些项目”。同一年,同一个行业,一个说 20%—30%,一个说 93%。这不是两家公司的技术差距,这是两个没有对齐的定义。

  Meta 在同一份备忘录里废止了 token 计数、废止了 AI Native 标签、宣布不再用采用率仪表盘评估员工影响力——然后把 93% 放在了最显眼的位置。

  这不算自相矛盾,但它说明了一件事:在公司层面,用量数字依然是更好用的叙事工具。 它对投资者好用,对媒体好用,对内部动员好用。被废止的只是它在个人绩效上的用法。

  从“用量”转向“产出”,听起来像是一次认知升级。放在时间线里看,它更像是一次由账单、事故率和 Pulse 分数共同促成的被动修正——先有 4 月的排行榜曝光,再有 5 月取消第二波裁员,再有夏天的用量配给,最后才是 9 月这份把话说明白的备忘录。

  值得记住的其实只有一句话:AI 能把“做了很多”变得极其廉价,却没有让“做对了”变得便宜一点。

  所有以为可以用前者代替后者的组织,都会在某个季度收到账单。

  ---

  几个想听听你怎么看的问题:

  1. 你所在的公司现在考核“AI 使用率”吗?如果考核,它是用什么口径统计的——登录天数、调用次数,还是别的?

  2. 如果你要给一位下属做今年的绩效判断,在不能看任何 AI 用量数据的前提下,你会拿什么当证据?

  3. 220% 的代码改动只换来 36% 的功能交付——这个比例,在你自己的团队里大概是多少?

  4. 最后一个可能更扎心的:你有没有为了让某个仪表盘好看一点,而做过明知没有价值的操作?

  事实来源与说明:

  本文中 9 月 2 日备忘录的表述、Meta 发言人 Tracy Clayton 的确认、93% 数据及新的评估口径,来自 WIRED 及多家媒体的报道;Claudeonomics 排行榜的细节来自 The Information 的报道及后续转述;Project OT 的重组方案与 220%/36%/40%/70%/74%→55% 等内部数据,来自 The Next Web、Forbes 等媒体基于内部信息的报道,未经 Meta 官方逐条确认;MetaCode 纠错机制与 Muse Spark 1.1 的榜单成绩来自 The New Stack;METR 随机对照试验、DORA 2025 报告、Anthropic 2026 Agentic Coding 趋势报告为公开研究。文中对指标机制的分析为评论,不代表上述机构立场。

  原文链接:https://mp.weixin.qq.com/s/iL-CWFjgCkUiF50w3_3mhQ

[返回上一页]
在线咨询服务