AI使用量该不该成为绩效指标?
来源:HRflag
AI使用量原本只是观察工具渗透的过程信号。当它进入奖金、晋升和人才评价,企业开始面对一个更复杂的问题:一次调用,究竟能够解释多少真实绩效?
企业从鼓励采用走向重新计算价值
2026年,企业对AI的态度出现了一次不太显眼、却相当关键的转弯。前两年,管理层最担心的是员工不用AI,许可证买了、培训办了、账号开了,工作方式却没有变化;现在,另一种担心逐渐浮上来:调用次数上去了,Token消耗增加了,业务结果却没有同步变化。AI采用的讨论,正在从“有没有使用”移向“使用之后发生了什么”。
8月26日,SHRM发布《Should AI Usage Be a Standalone Employee Performance Metric?》,把这种变化放进了绩效管理的语境。文章提到,一些企业曾把AI使用视为员工拥抱变化的可见证据,随着模型成本、人工复核、输出质量和投资回报进入管理视野,单独考核使用量的做法开始受到重新审视。争议的焦点并不是AI是否重要,而是一次调用、一条提示词或一段在线时长,究竟能够解释多少真实绩效。
这类指标很容易获得,也很容易传播。后台可以实时显示活跃用户、调用频率和部门排名,管理层在经营会议上能够看到一条持续上升的曲线,员工也清楚怎样留下“正在转型”的数据痕迹。相比之下,判断一份方案是否更准确、一次招聘是否更有效、一项决策是否因AI而改善,显然要复杂得多。
企业管理中经常出现这样的场景:最容易被记录的数据,慢慢取代了最初想解决的问题。AI使用量原本只是观察工具渗透的过程信号,进入奖金、晋升和人才评价以后,却可能被理解为员工态度、学习能力甚至未来价值的证明。 当过程数据开始承担结果指标的功能,AI绩效就不再只是技术问题,而变成了组织如何定义“好工作”的问题。
“用起来”曾经是最现实的转型目标
把AI使用量纳入管理,并非毫无缘由。生成式AI进入企业的早期,更大的障碍往往不是技术能力,而是旧流程的惯性,许多员工知道工具存在,却找不到值得改变工作方式的理由。活跃率、体验营、创新比赛和部门排行榜,帮助企业把一项抽象战略变成了可以观察的行为。
在这个阶段,使用量承担的是启动作用。没有足够多的人真正接触工具,组织就无法形成场景经验,也难以识别数据、权限、成本和安全上的现实问题。很多AI项目从少数爱好者的实验走向部门级应用,恰恰经历了这样一段强调覆盖率和参与度的时期。
问题出现在转型进入下一阶段之后。启动指标往往比启动期本身活得更久,季度目标仍然追踪活跃率,部门负责人仍然汇报调用量,员工也继续用“本月使用了多少次”证明自己没有掉队。原本用来打开局面的指标,逐渐变成了组织对AI价值最熟悉、也最省力的表达方式。
SHRM原文使用了一个带有戏谑意味的词——“tokenmaxxing”,指员工尽可能增加AI Token使用,企业也以生产率之名鼓励这种行为。它所描述的并不只是计算成本上涨,而是一种典型的指标反应:当组织强调输入量,人们便会围绕输入量调整行为。一次能够完成的任务可能被拆成多轮调用,原本由人直接判断的问题也会先经过模型,以便留下更充分的使用痕迹。
这并不意味着员工在刻意制造无效工作。多数情况下,他们只是准确理解了组织释放的信号:AI使用越多,越能证明自己积极、现代、适应变化。绩效指标一旦与职业评价相连,员工优化指标几乎是一种理性选择。
一次调用背后,可能是完全不同的工作
AI使用量最难解决的问题,是它看见了动作,却看不见动作所处的任务。两名招聘经理都可以在一个月内调用AI一百次,其中一人用它整理职位画像、归纳面试证据并缩短关键岗位招聘周期,另一人则反复生成相似的邀约话术,却没有增加有效候选人。后台记录相近,业务价值却可能相差很远。
同样的差异也存在于研发、市场、财务和客服。一次代码生成可能替代几十分钟重复劳动,也可能带来数小时测试与修正;一份市场摘要可能帮助团队更早识别机会,也可能只是把息重新排列;一段客服建议可能提高一次解决率,也可能让员工花更多时间确认模型是否理解客户语境。调用发生了,并不意味着净收益已经形成。
岗位之间的差异更大。内容、软件研发、数据分析等岗位天然拥有较高的AI交互密度,劳动关系、现场运营、商务谈判和高管决策则可能使用频率较低,但每一次辅助都更接近关键判断。统一的使用门槛表面上显得公平,实际上把不同任务结构压进了同一个数字。
技术进步还在不断改变这个数字的含义。今天需要十轮提示完成的工作,明天可能被一个自动化流程或智能体一次执行,员工的调用次数下降,反而代表工作流更成熟。若绩效仍然偏爱高频手工操作,组织可能奖励了较低层级的熟练,而忽略了流程设计和系统复用。
模型成本让这层矛盾更直观。长上下文、多模态生成和智能体任务可能在后台触发大量推理,员工看到的是一次操作,企业承担的却是多轮计算和后续复核。使用量越高越先进的简单叙事,到了财务和运营层面,很快会遇到一张更复杂的账单。
一项AI动作,穿过四层组织结构后才成为绩效
AI生产率从来不是一条平滑曲线
过去几年的研究,已经把AI生产率描绘成一条起伏明显的曲线。美国经济研究局对客服场景的研究发现,生成式AI辅助使员工平均每小时解决的问题数量提高约14%,经验较少员工的提升更加明显。AI在这里像一套能够即时调用的优秀经验库,让新人更快接近成熟员工的服务方式。
哈佛商学院与波士顿咨询公司围绕758名顾问开展的实验,则提出了“锯齿状技术前沿”。在AI擅长的创意、写作和分析任务中,参与者完成速度提高超过25%,输出质量也出现显著改善;到了需要发现隐藏信息、综合复杂材料的任务,使用AI的参与者反而更容易跟随模型得出错误结论。相似难度的任务,可能位于AI能力边界的两侧。
2025年,METR针对熟悉自身代码库的开源开发者进行随机对照研究,在当时的实验条件下,允许使用AI工具的参与者完成任务慢了19%。研究团队反复提醒外界,不宜把这一结果概括成“AI让开发者变慢”,因为样本、工具和任务都有明确边界。它的商业价值在于提供了一个反例:员工面对高上下文任务时,生成、理解、测试和修正AI输出,也会形成新的劳动。
到了2026年,工具能力和使用经验都在继续前进。微软年度工作趋势指数显示,66%的AI用户认为AI让自己把更多时间投入高价值工作,58%表示自己正在完成一年前还无法完成的工作。与此同时,受访者把AI输出质量控制和批判性思维列为更重要的人类能力,成熟使用者也更常在任务开始前判断哪些部分交给AI、哪些部分由人完成。
BCG对近1.2万名员工、经理和的调查显示,74%的前线员工已经成为AI的经常使用者,42%的前线高频用户称每周至少节省八小时。另一半故事是,许多组织尚未明确这些时间流向何处,超过一半的相关员工没有把节省时间转向战略性工作。效率已经在部分任务中出现,价值分配却还停留在组织设计的空白地带。
这些研究并不互相否定。它们共同呈现了AI进入工作后的真实状态:收益与任务、经验、数据、流程和复核方式高度相关,频繁使用既可能是生产率提升的结果,也可能是额外劳动的来源。 AI不是一种均匀作用于所有岗位的效率添加剂,使用量自然也很难成为一条通用的绩效刻度。
AI采用已经很高,价值转化仍在分化
不同研究、不同样本口径,仅作指标对照
74% 前线员工经常使用AI
66% AI用户将更多时间投入高价值工作
58% AI用户完成一年前无法完成的工作
42% 前线高频用户每周节省至少8小时
数据来源:BCG《AI at Work 2026》、Microsoft《2026 Work Trend Index》
企业开始追问:节省下来的时间去了哪里
“节省时间”是AI商业案例中最常出现的表达。员工用原来一半的时间完成报告、代码或分析,似乎已经形成清晰收益,但在组织里,时间并不会自动转化为收入或利润。它需要被重新安排,才可能表现为更多客户、更高质量、更快创新或更低成本。
一名员工每周节省八小时,可能用来承担更复杂的工作,也可能被更多会议、更多版本和更多低价值需求填满。部门产出看似增长,接收这些产出的同事却要花更多时间筛选、校对和确认,局部效率就会转化为下游负担。生成成本下降以后,组织最稀缺的资源从“生产内容”变成了“判断什么值得被生产”。
这也是“AI工作垃圾”一词迅速传播的背景。材料数量增加、格式更加完整、语言更加流畅,但事实错误、语境缺失和同质化仍需要人处理。发出一份AI生成文件的人节省了时间,接收文件的五个人各自多花十分钟,企业总成本反而上升。
传统绩效体系更容易记录前端产量,却很少计算下游核验和返工。员工提交了更多方案、生成了更多代码、完成了更多纪要,这些数字进入个人成果;同事花费的确认时间、客户理解成本和管理者的修正劳动,则散落在其他人的日程里。AI放大产能的同时,也放大了这种归因偏差。
所以,当企业从使用量转向价值,更先变化的往往不是指标名称,而是成本边界。一次任务的周期不再只看生成速度,还会延伸到核验、修改、沟通和最终采用;一项自动化的收益也不只看减少多少人工步骤,还会看异常处理和维护成本。绩效管理开始与流程管理重新靠近。
广告
AI改变的不是岗位名称,而是岗位里的任务组合
多数企业的岗位说明书仍然以职责为单位,写着“负责市场分析”“负责招聘交付”“负责经营报告”。AI进入工作时,并不会一次性取代或增强整份岗位,而是先落在其中一些任务上。资料搜集、信息归纳、初稿生成、例行回复可能变化很快,判断、沟通、关系建立和责任承担则呈现另一种节奏。
这让岗位的内部结构变得比岗位名称更值得观察。招聘专员仍然叫招聘专员,但花在搜索、邀约和面试纪要上的时间下降,花在人才判断、业务沟通和候选人体验上的时间可能上升;财务分析师仍然叫财务分析师,但数据整理减少以后,异常解释和情景判断占比增加。岗位没有消失,绩效含义却已经改变。
不同任务也形成了不同的人机关系。重复、规则清晰的工作更接近自动化,信息整理和初稿生成更像能力增强,高影响决策仍然围绕人的判断展开,边界不清的任务则停留在实验状态。员工是否高频使用AI,与岗位中这几类任务各占多少比例直接相关。
HR岗位尤其能说明这种差异。AI可以帮助生成结构化面试问题、归纳面试记录和梳理候选人信息,却很难仅凭输出承担录用责任;它可以辅助薪酬数据清洗与情景分析,却无法替代企业对公平、激励和成本的取舍;它也可以为HRBP准备业务材料,但组织中的信任、权力和真实阻力仍然存在于人与人的互动之中。
当岗位内部的任务组合发生变化,原有的工作量指标便开始失真。过去一周完成十份报告可能代表高负荷和高产出,现在同样数字可能只需要几个小时,质量与影响的重要性随之上升。AI使用量之争的深处,其实是岗位价值单位正在变化。
绩效表开始容纳一种更复杂的产出
AI参与以后,一份成果很难再被简单归为个人独立完成。员工定义问题,企业数据平台提供信息,模型生成分析,同事进行校验,负责人作出判断,最后交付给客户或管理层。个人贡献仍然存在,但它越来越表现为对资源的组织、对结果的判断和对责任的承担。
这与传统知识工作的绩效逻辑有所不同。过去,写得更多、做得更快、掌握更多信息常常意味着更高绩效;现在,生成和搜索的边际成本下降,选择什么问题、识别什么错误、保留什么判断的价值上升。工具帮助员工扩大产出,也让“产出是谁创造的”变得更难解释。
一些企业因此开始把AI影响拆回原有业务指标。客服仍然观察问题解决率与满意度,招聘仍然观察周期、质量和业务反馈,研发仍然观察缺陷、稳定性与交付速度,内容仍然观察事实准确、编辑返工和读者反应。AI不再单独占据一栏,而是作为这些结果变化的背景变量出现。
另一些组织则保留使用数据,但改变了它的位置。活跃率、调用次数、合规工具使用率和场景覆盖率留在转型仪表盘,用来识别推广、培训、成本与治理问题;个人绩效更多回到结果、质量和协作。相同的一组数据,由于进入了不同的管理场景,产生的行为影响也完全不同。
这类变化还在早期,没有一套统一模板。对AI产品负责人、自动化专家和数字化转型岗位而言,采用率本身可能就是工作结果的一部分;对大多数知识岗位而言,采用率与个人价值之间的距离更远。绩效体系正在从“有没有用”转向“在哪个任务中、以什么方式、带来了什么变化”。
AI能力的含义,也在悄悄改变
生成式AI刚出现时,会写提示词是一项醒目的新技能。随着产品界面简化、模型越来越能理解自然语言,单纯的操作熟练度正在快速普及,差异开始转移到问题定义、上下文组织、证据核验和业务判断。一个人可以很熟练地调用模型,却未必能识别模型何时在生成一份流畅但不可靠的答案。
世界经济论坛《未来就业报告2025》显示,到2030年,员工约39%的核心技能预计发生变化,AI与大数据相关技能增长迅速,分析思维、韧性、领导力与协作依然位于企业关注范围。PwC《2026全球AI就业晴雨表》则发现,AI暴露度更高岗位的技能变化速度是低暴露岗位的两倍以上,新增任务更可能依赖同理心、判断和创造力。AI技能并没有独立于专业能力生长,而是与人的高阶能力重新组合。
微软把一小部分成熟用户称为“前沿专业人士”,他们约占受访AI用户的16%。这些人不仅更深入地使用智能体,也更常在开始工作前判断任务适合交给人还是AI,并有意识地在部分任务中不用AI,以保持关键能力。高水平使用不再等于始终使用,而更像一种持续的边界判断。
这种变化也让培训完成率显得不够。员工参加课程、通过测试、掌握提示词框架,只能证明接触过知识,真实任务中的取舍、核验和责任仍然需要另外观察。BCG在2026年提出“能力速度”,关注一项技能从学习、应用到稳定形成绩效的速度,其背后正是企业对“学过”与“做到”之间落差的重新认识。
对HR而言,能力模型由此面临一次细化。工具操作更接近基础门槛,任务拆解、结果验证、风险识别和流程重构逐渐成为区分度更高的行为;到了管理岗位,资源配置、工作设计和责任链条又进入评价。AI能力不再是一条单独的技术维度,而在向岗位专业能力内部渗透。
AI效率之外,还有一张人才账
不同调查口径,仅用于展示组织面临的三类人才变化
39%
2030年前核心技能预计变化
53%
关注初级人才成长变慢
约1/3
员工担忧AI影响工作安全
数据来源:WEF《未来就业报告2025》、BCG、SHRM
初级岗位的效率,可能换来另一张长期账单
AI对低经验员工的帮助,在多项研究中都十分明显。新人可以获得结构化建议、即时反馈和接近成熟员工的初稿质量,组织也看到更短的上手周期。对长期受培训资源和经理时间限制的企业而言,这种能力具有很强吸引力。
另一面是,很多专业判断正是在低效率的重复中形成。初级员工通过搜集资料、制作初稿、处理例外和反复修改,逐渐理解什么信息重要、什么答案不可信、客户为何不接受一个逻辑上正确的方案。如果这些步骤全部被AI吸收,新人拥有了更好的交付,却未必经历了形成判断所需要的过程。
BCG在2026年的研究中指出,近九成受访担心员工过度依赖AI输出而缺少压力测试和质疑,53%的关注初级人才成长变慢。PwC的研究也显示,AI暴露度高的初级岗位越来越早地要求领导和战略思考等过去更偏阶段的能力。职业阶梯正在被压缩,但支撑员工向上走的学习路径还没有同步完成重建。
这让绩效评价出现一个时间尺度问题。员工今天借助AI更快完成任务,是清晰可见的短期收益;几年后组织是否还有足够多能够独立判断、指导新人和处理例外的专家,则是一项更难被季度指标捕捉的长期结果。效率账与人才账开始发生交叉。
不少企业正在尝试把复盘、案例教学、无AI练习和导师反馈重新放进工作流程。它们看起来不如调用量增长直观,却与专业能力的延续有关。AI越多地承担基础劳动,组织越需要重新解释经验从哪里来。
管理者在AI绩效里变得更难隐身
当员工AI使用不足时,最简单的解释是缺少积极性或能力。可在真实组织中,使用效果同时受到工具权限、数据质量、流程设计、目标清晰度和经理支持影响,很多变量并不掌握在普通员工手里。单独考核个人使用量,会把这些组织条件折叠成一个个人数字。
管理者是否选对场景,决定了团队在优化什么。一个部门持续用AI润色邮件、整理会议纪要,采用率可以很高,却未必触及客户、收入和核心流程;另一个部门只改造一项关键工作流,调用次数未必惊人,却可能缩短交付周期。两种结果之间的差异,更多来自工作设计,而不是员工是否勤奋调用工具。
AI节省出来的时间如何分配,也属于管理问题。它可能转向更多客户、更复杂项目、更高质量、员工学习或成本调整,不同选择对应不同的经营逻辑。如果组织没有给出解释,员工很容易把效率提升理解为“更快做完以后获得更多任务”,分享有效方法的意愿也会随之改变。
SHRM引用的2026年全球员工监测显示,约三分之一员工至少中度担忧企业实施AI会在未来一年影响自己的工作安全。AI使用量一旦与奖金和晋升相连,就不再只是生产率数据,也会被解读为一种就业信号。员工展示的不只是工具使用,还在证明自己仍然适应未来岗位。
这种心理会改变组织获得信息的质量。员工更愿意报告成功案例,较少暴露失败、额外成本和模型局限,部门也更倾向于展示漂亮的活跃率。绩效制度原本用于了解真实表现,却可能让AI转型变成一场集体乐观展示。
三种“繁荣”,正在考验企业对数字的判断
最容易出现的是数据繁荣。账号活跃率持续提高,提示词总量不断增长,各部门都能提供使用截图,核心业务指标却没有明显变化。企业获得了充分的采用证据,价值证据仍然留白。
另一种是产量繁荣。报告、代码、海报、方案和会议纪要明显增加,工作看上去更快,接收者却花费更多时间筛选、修改和确认。生成端的成本下降,下游的判断成本上升,个人效率与组织效率由此分开。
还有一种是能力繁荣。员工完成大量培训并获得认证,能够流利演示工具,遇到模糊问题时仍然难以定义目标、判断证据和承担决策。学习数据很好看,工作方式却没有进入稳定变化。
这三种繁荣都不是虚假数据。活跃率、产量和培训完成率确实发生了增长,只是它们解释的是采用、生产和学习,并不自动解释客户价值、经营结果和组织能力。问题不在数据本身,而在企业赋予了它多大的含义。
AI让组织拥有前所未有的行为数据,也让管理者更容易把可见性误认为因果。调用量能够说明人们打开了工具,却无法独自说明工具改变了什么。绩效管理接下来要处理的,正是这段从动作到结果之间的距离。
AI使用量不会消失,但它的位置正在变化
从管理实践看,AI使用量大概率不会被企业放弃。它对判断许可证利用率、识别低采用部门、监测成本异常、发现培训需求和观察场景扩散都有现实意义。变化发生在它被放置的位置:从个人价值的直接证明,回到组织转型的诊断信号。
一些企业开始形成两层数据。上层观察活跃用户、场景覆盖、模型成本、合规工具占比和复用资产,帮助管理层了解AI转型运行状态;下层仍然以业务结果、质量、效率、协作和风险为主要绩效证据。两层数据彼此关联,却不再被简单画上等号。
成熟场景与探索场景的指标也在分开。已经稳定运行的流程更容易比较周期、成本和质量,仍在实验的场景则更关注假设是否被验证、失败原因是否被记录、方法能否复用。短期未产生结果的试验,与低质量执行之间,需要更细的判断。
这意味着AI进入绩效,并不一定表现为绩效表里新增一个醒目的“AI使用”栏目。它也可能分散在原有目标中,表现为交付周期变化、质量提升、返工减少、客户影响、知识复用和风险控制。AI越深入工作,反而越不容易被单独切出来计算。
企业正在重算的,不只是AI绩效账
PwC对超过十亿条招聘广告的分析显示,AI暴露度较高的企业正在获得更快的生产率增长,相关岗位的技能要求也在快速变化。部分岗位被AI“专业化”:基础执行被工具吸收,人更早承担判断、领导和战略思考。生产率上升与岗位升级正在同时发生。
这也解释了为什么AI使用量会在2026年成为一个争议话题。企业已经越过“有没有AI”的阶段,开始面对增长如何发生、时间如何分配、岗位如何重组、能力如何延续和责任如何承担。单一数字很难承载这些问题,却又因为清晰易得而格外诱人。
绩效管理在其中扮演的角色,也从推动采用转向识别价值。过去,组织希望员工尽快试用工具,使用量是一种合理的早期信号;现在,更多企业开始区分使用、产出和结果,也开始把下游复核、能力损耗和管理责任纳入同一张账。AI绩效正在从一条曲线变成一组相互制约的证据。
这场调整并不代表企业对AI热情下降。相反,当工具从展示项目进入日常经营,管理自然会变得更具体,也更关心成本、质量和长期能力。 正在发生变化的,是企业不再满足于证明“大家都在用”,而开始追问“工作究竟因此变成了什么”。
AI使用量仍然会出现在仪表盘上,也可能继续成为转型阶段的重要观察项。只是当它进入个人绩效表,企业会面对一个无法绕开的事实:使用是动作,绩效是动作穿过岗位、流程与责任之后留下的结果。两者之间的那段距离,正是2026年企业AI转型最值得关注的部分。
参考资料
SHRM:Should AI Usage Be a Standalone Employee Performance Metric?
Microsoft:2026 Work Trend Index
BCG:AI at Work—Strategy Matters More Than Tools
BCG:From AI Upskilling to AI Performance
BCG:When Everyone Uses AI, Companies Risk Critical Skills
PwC:2026 Global AI Jobs Barometer
World Economic Forum:The Future of Jobs Report 2025
NBER:Generative AI at Work
Harvard Business School:Navigating the Jagged Technological Frontier
METR:Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity
原文链接:https://mp.weixin.qq.com/s/VSGM0NhTEvMYIHXRWkiYOA
[返回上一页]
