欢迎您来到辽宁人才派遣网,在这里为您提供最一流的人力资源服务!

MIT最新研究:真正拉开AI绩效差距的,不是模型能力,而是十大管理杠杆

来源:HRflag

  (图片由HRflag使用Chatgpt image2.5生成 )

  2026年,生成式AI在企业里的身份已经发生变化。它不再只是少数技术爱好者偷偷打开的网页,也不再停留在创新日的演示台上,而是进入了邮件、会议、客服、研发、销售、财务和人力资源的日常流程。很多管理者因此开始面对一个看似简单、实际相当棘手的问题:员工使用AI的频率越来越高,为什么部门绩效、交付质量和经营结果并没有同步出现清晰的跃升?

  MIT Sloan管理学院近期发布的文章《塑造真正提升员工绩效的生成式AI十大杠杆》,把这个问题从技术讨论重新拉回了管理现场。文章依据MIT“生成式AI与工作的未来”工作组的研究,研究团队在2023年至2025年间走访了20多家企业,覆盖医疗与生命科学、零售、金融保险与房地产、制造业等行业,并访谈负责AI部署的高管、管理者和实际使用工具的员工。研究还结合了一项大规模员工调查以及公开的AI使用数据,试图回答的并不是“AI能不能工作”,而是“企业怎样部署AI,才能让人的工作真正变得更好”。

  这项研究给出的起点颇有现实感。到2026年1月,大约一半的美国员工已经报告在工作中使用AI,但AI究竟改善了多少工作质量,仍然很难得到统一答案。企业看见的是工具渗透率迅速上升,员工感受到的则可能是写得更快、改得更多、会议更密、任务边界更模糊;两者之间的差距,正是当前AI管理最值得警惕的“绩效空档”。

  MIT研究将生成式AI未能提升绩效的原因归纳为三种:该用却没有用的“弃用”,用在错误任务或产生低质量结果的“误用”,以及工具表现良好却引发新问题的“过度使用”。这三个词看上去像技术采用问题,背后其实分别对应三类管理缺口:企业没有找到值得解决的问题,没有建立质量与风险边界,也没有看见效率提升之后出现的学习、协作和责任成本。 AI无法自动产生绩效,它只能放大企业已经设计好的工作系统,也会放大其中原有的缺陷。

  AI上线之后,企业最容易高估的是“可见的快”

  过去几年,企业判断AI项目是否成功,最常使用的证据是节省了多少时间。写一份初稿从两小时缩短到二十分钟,整理会议纪要从半天缩短到十分钟,客服人员可以更快获得建议回复,程序员可以更快生成测试代码,这些变化直观、容易测量,也很适合出现在项目汇报中。问题在于,节省时间只描述了任务的一部分,没有回答这段时间是否真的转化成了更高质量的产出、更多收入、更好的客户体验,或者更低的经营风险。

  一项AI工具可能让员工更快完成初稿,却把时间转移到事实核验、语气修正、格式清理和跨系统复制上。它也可能让单个员工的产出数量迅速增加,但下游审核者需要处理更多看似完整、实际参差不齐的材料。局部环节出现的十分钟节省,经过返工、沟通和审批后,可能在整个流程中变成额外的二十分钟;如果企业只看工具端的使用数据,就会把这种成本误判为生产率提升。

  这也是MIT研究反复强调“证据先于规模”的原因。真正成熟的AI项目通常不是先采购工具、再寻找场景,而是从一个企业已经确认存在的业务问题出发:医疗机构希望减少医护人员维护记录的“睡衣时间”,零售企业希望帮助一线员工更快获取产品知识,制造企业希望让经验不足的技术人员更快排查设备异常。问题已经被定义,旧流程的时间、质量和成本也相对清楚,企业才有可能判断AI是否真的优于原来的做法。

  与之相反,很多效果模糊的项目从一句“大家都可以用”开始。工具账号发下去,培训做完了,管理者看到周活跃用户和对话次数持续上升,便默认组织正在变得更高效。可员工把AI用于什么任务、输出是否进入正式决策、节省的时间去了哪里、错误由谁发现、团队总价值是否增长,这些决定绩效的核心问题往往没有进入仪表盘。

  AI使用量是活动指标,不是绩效指标。 一家企业可以拥有很高的AI渗透率,同时没有改善任何关键业务结果;也可能只有一个小团队在一个高价值瓶颈上稳定使用AI,却产生可观回报。管理层真正需要比较的,不是“用了AI”和“没有用AI”的人数,而是同一类任务在采用AI前后的净结果,包括速度、质量、返工、风险、学习和协作成本。

  看懂三类任务,比预测哪些岗位会消失更重要

  围绕AI与工作的讨论,常常以岗位为单位展开:招聘会不会被自动化、程序员会不会减少、咨询顾问是否仍然需要那么多人。MIT研究在企业实践中看到的却是另一幅图景。大多数早期应用并不是让AI接管一个完整岗位,而是围绕任务进行重组,主要解决三类问题:堵点问题、专家食堂问题和学习曲线问题。

  所谓堵点问题,是指员工被大量接近常规、又不得不完成的小任务占据时间,无法投入更高价值的工作。医生整理病历、工程师编写单元测试、HR回答重复的制度咨询、销售整理拜访记录,都属于这一类。AI的价值不是证明它能“像一个员工”,而是把这些持续消耗注意力的窄任务从流程中移开,让专业人员重新获得可用于判断、沟通和创造的时间。

  专家食堂问题更像企业里常见的跨部门取餐。一个员工为了完成报告、方案或决策,需要不断向法务、财务、技术、产品和业务专家收集意见,再把不同口径拼接成完整结果。生成式AI可以根据已有文件和历史知识,预测不同专家可能提供的信息,降低搜寻与整合成本,但这并不意味着专家可以退出;一旦问题超出既有知识、涉及权衡或缺少上下文,真正的专家判断仍然决定结果是否可靠。

  学习曲线问题则出现在新人进入复杂领域时。过去,他们需要在文档、师傅指导和反复试错中慢慢获得经验,AI可以根据大量资料即时回答问题,帮助新人更快理解术语、流程和异常情况。制造企业可以让年轻技术员快速查询设备手册,金融机构可以帮助新员工理解复杂产品,HR也可以让业务经理更快找到制度与案例,但这种“表现得像更有经验”并不等于真正拥有经验。

  三类问题对应三种完全不同的价值逻辑。堵点任务看重净时间和高价值工作释放,专家食堂任务看重信息整合质量与协同成本,学习曲线任务看重达到独立胜任所需的时间以及知识保留程度。如果企业把它们都放进一个“AI提升效率”的口袋,只统计生成速度或调用次数,绩效结论必然失真。

  这也解释了为什么同一种AI工具在不同岗位、甚至同一岗位的不同员工身上,会产生不同效果。新人可能从标准示例和即时提示中获益更多,员工则更擅长发现模型遗漏的条件,并把AI用于扩大探索范围;有些人用它替代枯燥步骤,有些人用它跳过必要思考,还有些人只在结果容易核验时使用。企业面对的不是一项具有固定回报率的软件,而是一种会被个人经验、任务类型和组织环境共同塑造的通用能力。

  杠杆之一:先拿到证据,再讨论全面推广

  MIT提出的原则,是在规模化之前收集证据。这里的证据不是员工“感觉更快”,也不是一场演示中出现令人惊艳的答案,而是AI与现有方案在真实任务上的对照结果。企业需要知道,速度提高了多少,质量发生了什么变化,返工是否增加,新增了哪些审核任务,最终对团队价值和客户结果产生了什么影响。

  在管理实践中,这意味着AI试点要有明确的基线。以招聘为例,AI可以帮助撰写职位描述、生成面试提纲或汇总面试记录,但三个场景的成功标准并不相同:职位描述要看合格申请比例和用人经理修改量,面试提纲要看结构化程度与预测效度,面试记录要看准确性、完整性和合规风险。如果只用“每份材料节省多少分钟”统一衡量,企业很容易把速度当成价值本身。

  证据还必须覆盖流程的下游。AI让销售更快生成客户方案,并不代表售前、法务和交付团队的工作也随之减少;如果方案数量增加但定制质量下降,下游反而会承担更多澄清。一个环节的生产率不能代表一条价值链的生产率, 真正有意义的AI指标,应当沿着工作流观察净增值,而不是停留在生成按钮附近。

  这并不要求企业为每一个小场景建立复杂的科研实验,而是要求管理层在推广前保留基本的比较意识。可以选择相近团队或相似任务做短周期对照,也可以比较员工采用前后的结果,同时记录质量、返工和风险事件。重要的不是让业务变成实验室,而是避免在缺少结果证据时,用热度、声量和使用次数代替经营判断。

  杠杆之二:接受同岗员工不会以同一种方式使用AI

  传统企业软件追求标准化:同一套流程、同一组字段、同一种操作路径。生成式AI却具有很强的可塑性,同一个聊天入口可以被用于搜索、写作、分析、模拟、学习和创意发散。MIT研究发现,即使承担同一岗位的员工,也会用截然不同的方式与AI协作,这种差异让影响更难测量,却也提供了观察“什么对谁有效”的丰富证据。

  不少企业喜欢从最积极的“AI”开始试点。这些员工愿意花时间研究提示词、尝试新工具,也会主动反馈问题,是早期探索的重要力量。但MIT研究中的房地产企业曾发现,从经纪人开始试用面向经纪人的AI应用并不理想,因为拥有丰富经验和客户网络的高绩效者,与仍在建立知识和关系的新手,需要的支持完全不同。

  如果企业只观察高手,可能高估普通员工的采用能力;如果只观察新人,也可能把AI的价值局限在基础辅助。更合理的做法,是依据任务复杂度、经验水平、风险暴露和使用意愿建立员工画像,允许不同人群采用不同入口、权限和支持方式。对怀疑者,可以从收益明确、学习成本低的场景开始;对熟练用户,则可以开放更复杂的工作流,同时要求更严格的结果记录和复盘。

  差异化并不意味着放弃治理,而是把治理从“一刀切的使用要求”转向“清楚的结果边界”。员工可以选择如何调用工具,但不能自行降低事实准确、客户承诺、数据安全和专业伦理标准。这样的安排既保留一线探索空间,也避免把AI使用本身变成新的任务。

  杠杆之三:培养的不是信任,而是校准信任

  很多AI培训把重点放在“敢不敢用”上,仿佛员工只要克服抗拒,价值就会自然出现。MIT的表述更准确:员工需要学会的不是总体上更加信任或更加怀疑AI,而是知道在什么情境下可以信任、何时必须追问,以及哪些输出根本不应交给模型决定。过度怀疑会导致弃用,盲目信任会带来误用和过度使用,二者都会损害绩效。

  这种能力之所以重要,是因为生成式AI的错误往往并不难看。它可能用流畅、完整、专业的语言给出一个存在事实缺口的答案,使员工产生“看起来已经完成”的错觉。微软研究团队对319名知识工作者收集了936个AI辅助工作实例,发现对AI越有信心,员工投入批判性思考的程度往往越低;与此同时,对自身专业判断更有信心的人,更可能继续进行验证和审视。

  信任校准不能只靠一句“请检查AI输出”。企业需要把风险提示、来源显示、置信信息、强制复核点和升级路径嵌入工作流,让员工在关键节点自然停下来判断。对于低风险、易验证的文本整理,可以给予更高自动化程度;对于影响招聘决定、薪酬、健康、安全、客户权益或财务结果的任务,应当要求明确的人类审批和证据留痕。

  管理者还需要区分“用户知道AI会犯错”和“用户能识别这一次是否错了”。前者是一种常识,后者依赖领域知识、上下文和时间投入。如果员工没有能力核验,所谓“人在回路中”很容易退化成象征性点击确认,人仍在流程里,却没有真正发挥控制作用。

  杠杆之四:减少令人疲惫的工作,而不是拿走工作的意义

  员工通常欢迎AI处理重复、琐碎、低判断含量的任务,却未必欢迎它接管工作中最有成就感的部分。一个招聘顾问可能希望AI整理候选人资料,但仍然重视与候选人建立信任;一名设计师可能愿意让AI生成版本,却不希望自己的核心创意只剩下筛选;一位医生希望减少文书负担,而不是减少与患者的交流。技术上可以自动化的任务,并不都值得优先自动化。

  MIT把“减少苦差事”列为重要杠杆,关键是让最接近工作的员工参与识别真正的堵点。管理者看到的重复任务,可能是员工理解客户、训练判断或建立关系的重要过程;员工抱怨最多的环节,也可能恰恰是组织最应该优先改造的摩擦。只有把工作体验和业务价值放在一起,才能判断哪些任务适合删除、自动化、增强或保留。

  这对HR的启示尤其直接。AI项目若只从人力成本表出发,容易优先选择用工数量多、任务看似标准的岗位;若从工作结构出发,则会先寻找高频、低价值、影响体验且结果可核验的任务。后者通常更容易获得员工支持,也更容易释放专业人员的有效产能。

  释放出来的时间如何使用,决定了这项杠杆能否真正转化为绩效。如果会议纪要自动生成后,员工只是被安排参加更多会议,效率收益就被新的工作吞没;如果医护人员减少文书后仍无法增加患者沟通或获得恢复时间,工作质量未必改善。AI节省时间之后的“再投资方案”,应当在试点设计阶段就被说明,而不是等工具上线后由任务自然填满。

  杠杆之五:让AI促进学习,而不是制造“会交付、不会成长”的员工

  生成式AI最隐蔽的成本之一,是员工完成了任务,却没有形成完成这项任务所需的知识。MIT将其称为“心智卸载”:人借助AI给出答案、写出方案或完成分析,但没有理解背后的逻辑,也无法在工具不可用、情境变化或输出出错时独立处理。短期看,任务完成率提高了;长期看,组织可能积累一批善于提交结果、却缺少稳定判断基础的员工。

  这个问题在初级岗位上尤其突出。过去,新人通过整理资料、撰写初稿、旁听讨论和接受修改逐渐建立专业模式,这些工作虽然不总是令人兴奋,却承担了训练功能。如果AI把它们全部压缩为一次生成和一次确认,企业会得到更快的初级产出,却可能失去培养中高级人才的通道。

  因此,衡量AI是否促进学习,不能只看培训完成率或工具熟练度。企业需要观察员工能否解释AI结论、识别关键假设、在相似但不同的情境中迁移知识,并在没有模型建议时作出基本判断。AI可以成为教练,通过追问、反馈和针对性材料帮助员工看见知识缺口,也可以成为代写者,让员工绕过本应发生的学习;两种结果取决于产品和流程怎样设计。

  绩效制度在这里具有很强的导向作用。如果组织只奖励更快、更多的可见产出,员工自然会把AI当作捷径;如果评估中包含推理质量、复盘能力、知识沉淀和带教贡献,员工才有动力把节省下来的时间投入能力增长。 企业真正要防止的不是员工借助AI,而是组织奖励了一种不需要理解的交付方式。

  杠杆之六:保留团队协作,避免组织变成一群高效的孤岛

  AI可以让员工独立完成过去需要请教多位同事的任务。销售不必每次都找产品经理确认基础功能,HRBP可以快速查询政策口径,咨询顾问可以整合多个领域的公开知识,这些变化减少等待,也提高个人自主性。但个人效率提高,并不必然带来团队能力提高。

  很多跨部门互动表面上是在索取信息,实际还承担着建立关系、理解彼此约束和形成共同语言的功能。新人向同事请教,不只是获得答案,也在学习什么问题值得问、哪些细节代表风险;不同职能一起讨论,不只是拼接知识,也在建立未来合作所需的信任。AI把信息传递变快之后,这些不容易量化的组织资本可能同时减少。

  广告

  MIT因此提出“保留团队协作”,不是要求员工为了协作而增加会议,而是识别哪些互动具有学习、判断和信任价值。标准知识查询可以由AI承担,涉及取舍、例外和新问题的讨论仍应保留;AI可以先生成共同底稿,让团队把时间集中在争议和决策上,而不是让每个人分别生成一份看似完整的答案。

  对管理者而言,新的风险不是员工不沟通,而是他们各自在AI帮助下迅速完成工作,却在关键假设上逐渐分叉。等到结果汇总时,差异已经隐藏在大量流畅文本之中,协调成本反而更高。团队绩效评估因此需要关注知识共享、共同决策和跨职能质量,而不能只把个人产出速度相加。

  杠杆之七:界面不是包装,它在决定员工如何思考

  越来越多企业选择购买成熟AI产品,而不是自行训练基础模型,这并不意味着企业失去了设计空间。员工看到什么信息、在什么时候收到建议、是否能查看来源、如何反馈错误、审批按钮放在哪里,仍然可以通过界面和工作流进行塑造。MIT把界面设计列入十大杠杆,因为它直接影响员工的情境意识和认知负荷。

  一个只给出完整答案的界面,容易让用户把自己理解为最后的校对员;一个展示证据、假设、冲突信息和待确认项的界面,则更容易让用户保持判断。默认设置同样重要:系统是默认自动发送,还是默认保存为草稿;是把风险提示藏在角落,还是在高风险动作前要求确认;这些设计选择会比一次性培训更持续地影响行为。

  界面还决定了AI究竟减少负担,还是创造新的“监督劳动”。如果员工需要在多个窗口之间复制内容、反复补充上下文、逐条检查格式,再把结果录入原系统,所谓自动化很可能只是把执行劳动改造成更碎片化的审核劳动。企业采购AI工具时,除了比较模型能力和价格,也应测量员工的心理负荷、信息保留和异常识别能力。

  这意味着AI项目不能只由技术与采购团队完成。业务专家要定义什么信息足以支持判断,HR和学习团队要观察界面是否促进能力形成,风险团队要设置关键控制点,一线员工则能指出哪些提示真正有帮助、哪些设计只增加点击。界面是管理制度的一部分,也是企业价值观被翻译成日常行为的地方。

  杠杆之八:AI潜力越高,领域专家可能越稀缺

  生成式AI经常被描述为一种降低专业门槛的技术,这在部分学习曲线任务上确实成立。新人可以更快获得基础答案,非技术人员可以编写简单程序,跨职能员工可以理解陌生领域的概念。但MIT研究提醒,能力扩展不能被误解为专业知识已经失去价值,因为AI结果仍然需要人提供情境、解释意义、验证可靠性并处理例外。

  在医药、计算机科学、生命科学等AI潜力较高的领域,这个矛盾尤其明显。短期内,部分初级支持任务的需求可能下降;长期内,AI会产生更多可供探索的技术、方案和候选结果,需要足够多的专家提出好问题、完成测试、解释风险,并穿越复杂的监管与组织流程。如果人才培养通道因为初级任务减少而萎缩,未来真正限制AI突破的,可能不是算力和模型,而是能够判断结果的专家数量。

  这一判断对企业人才战略提出了比“全民学提示词”更深的问题。提示技巧会随着产品迭代迅速变化,领域知识、因果判断、客户理解和专业伦理却决定一个人能否识别输出边界。MIT报告也指出,目前没有强证据表明企业仅靠AI就能跨越混乱的数据、薄弱的文档和不足的技术基础;缺乏可靠参照时,模型给出的答案甚至难以验证。

  因此,企业不应因为AI能够承担部分初级任务,就停止招聘和培养初级人才。更现实的方向,是重构他们的训练任务:减少纯机械劳动,增加带反馈的案例练习、现场观察、异常处理和结果解释,让AI加速学习但不替代学习。领域专家也不应只作为最后的审批节点,而应参与构建知识库、定义评估标准和训练下一代员工。

  杠杆之九:把责任留在人身上,也把验证条件交给人

  生成式AI可能带来一种新的道德风险:员工可以用很低成本生成看似专业的工作成果,而错误和理解缺口被流畅表达掩盖。组织通常基于信任运行,决策者不会逐条复算分析人员的所有结论,客户也不会检查服务人员背后的每一个信息来源。如果出错的结果没有被发现,也无法追溯到具体的审查责任,AI的速度就可能放大低质量工作的传播范围。

  “人类负责”常被写进AI政策,却很少被翻译成可执行的安排。真正的责任需要说明谁对最终结果签字,哪些内容必须核验,核验依据在哪里,发生错误后如何追溯和修正。责任人还必须拥有足够的时间、权限和专业能力,否则责任只是从系统转嫁给员工,却没有提供完成审查所需的条件。

  MIT借用机场安检的随机复检说明,组织可以通过抽样审查提高注意力,并验证自动系统是否持续可靠。企业不必审核每一项低风险输出,但可以根据任务风险设置不同抽检率,追踪常见错误和漏检原因,再把结果反馈到流程、界面和培训中。这样做的目的不是营造惩罚感,而是防止“没有出事”被误认为“系统没有问题”。

  绩效管理也必须避免把全部责任压在最后使用AI的员工身上。如果公司要求高速度、高产量,却没有提供可靠数据、验证工具和合理时间,错误就是系统激励的结果。管理责任应覆盖目标设定、工具选择、流程控制和人员配置,员工则对在既定边界内的专业判断和披露负责。

  杠杆之十:把节省的时间变成新工作,而不是新的空白

  技术进入组织后,最容易被计算的是它消除了多少任务,最难设计的是这些任务消失后,人应该做什么。MIT把“创造新工作”放在最后一个杠杆,正是因为效率不会自动转化为增长。员工每天节省一小时,如果组织没有新的客户需求、产品改进、质量提升或能力建设来承接,这一小时最终可能被会议、消息和更多同类任务重新填满。

  新工作并不等于创造一批带有“AI”字样的新职位。它可以是销售人员进行更深的客户洞察,客服团队识别产品缺陷,财务人员开展情景分析,HRBP更早介入组织问题,工程师处理长期积压的技术债。AI先改变任务组合,岗位随后围绕新的价值重点重新形成,这比先画出一张未来组织架构图更接近真实的转型过程。

  创造新工作也需要回应员工希望发展什么能力。企业只从当下业务缺口出发,把AI节省的时间塞进更多任务,员工会把技术理解为工作加速器;如果新的任务同时带来学习、成长和更高的专业自主性,员工更可能把AI视为职业发展的正向力量。技术采用与员工关系并不是两条平行线,它们会在岗位设计中相遇。

  从经营角度看,AI最有吸引力的回报也未必来自成本压缩。软件团队可以把节省的时间用于过去排队等待的项目,零售一线可以用更完整的信息改善顾客体验,专业服务团队可以把原本无法经济覆盖的小型需求转化为新服务。 当企业只问“可以少做多少”,往往只能得到一次性效率;开始问“因此可以多创造什么”,才可能得到新的收入和能力曲线。

  岗位重构:从职位说明书转向动态任务组合

  十大杠杆最终会落到岗位上。传统职位说明书以职责清单描述工作,默认任务边界相对稳定;生成式AI进入之后,同一个岗位中的任务会以不同速度被自动化、增强或重新分配。HR如果仍以岗位名称讨论替代率,很容易错过真正发生变化的地方。

  更有用的做法,是把岗位拆成任务组合,并标注每项任务的价值、频率、风险、可验证性、学习作用和协作作用。高频、低判断、结果容易验证的任务适合优先自动化;需要大量信息整合但仍依赖专业判断的任务适合AI增强;承担新人训练、客户信任和跨部门协调作用的任务,即使技术上可以替代,也需要谨慎保留或重新设计。

  这种拆解会改变编制讨论的方式。某岗位有30%的任务可被AI承担,不等于这个岗位可以减少30%的人,因为剩余任务可能更复杂、更波动,也可能需要覆盖更多新需求。组织需要观察释放的产能能否集中成可取消的工作量,还是分散在许多人每天的零碎时间中;后者通常更适合岗位增值,而不是简单换算为人数。

  入门岗位尤其需要单独审视。如果企业删除了新人过去用来学习的基础任务,却没有设计新的训练路径,中层和专家人才的供给会在几年后出现断层。岗位重构的目标不应只是让现有员工更快交付,还要保证组织继续生产未来需要的判断力。

  绩效重构:不考核“用了多少AI”,而考核AI之后的净结果

  当AI逐渐成为基础工作工具,把使用次数直接写进绩效指标看似能推动采用,实际可能制造大量低价值行为。员工为了完成指标,会在原本不需要AI的任务中使用AI,或者把一次可以完成的工作拆成多次调用;管理者得到漂亮的活跃数据,却无法确认任何经营改善。更严重的是,使用量指标会鼓励员工追求生成,而不是审慎选择何时不用。

  新的绩效体系需要回到结果,但“结果”也不能只剩产出数量。对AI增强型工作,至少要同时观察净时间、一次通过率、返工量、业务质量、风险事件、客户或内部用户结果,以及员工是否形成可迁移能力。不同任务的权重应当不同,低风险内容生产可以更看重速度,高风险决策支持则应把准确、证据和责任放在前面。

  个人绩效与团队绩效也要重新平衡。AI可能让某位员工的个人产量显著上升,却把审核和协调成本推给同事;也可能让员工减少向专家请教,短期独立性增强,长期团队知识流动下降。若绩效系统只奖励个人可见输出,就会系统性低估协作、带教、知识沉淀和风险控制。

  管理者还需要关注“节省时间的去向”。同样节省1000小时,一家企业把时间投入客户增长、产品创新和能力建设,另一家企业让工作自然膨胀,经营结果会完全不同。AI绩效不是工具上线后的统计项目,而是资源重新配置的管理决策。

  能力重构:AI素养的核心不是提示词,而是专业判断

  过去的AI培训常围绕工具功能和提示词技巧展开,这些内容有必要,却很容易过时。真正稳定的能力,是员工能否定义问题、提供有效上下文、判断输出质量、核验证据、识别风险、整合不同观点并对结果负责。生成式AI把知识工作的重心从“亲自执行每一步”推向“监督、解释和纠偏”,人的能力结构也随之改变。

  这并不意味着执行能力不再重要。一个从未写过高质量报告的人,很难稳定判断AI报告的问题;不了解招聘逻辑的管理者,也无法因为获得一套面试题就做出更可靠的选择。监督能力建立在一定程度的亲自实践和领域知识上,企业如果过早把基础执行全部交给AI,可能同时削弱未来监督者的来源。

  更成熟的能力模型,可以把AI协作能力分成几个相互连接的部分:问题定义决定模型解决什么,领域知识决定能否识别错误,证据意识决定是否追问来源,协作能力决定何时引入其他人,责任意识决定是否愿意为最终结果签字。这些能力不适合用一次在线考试衡量,更适合通过真实任务、案例复盘和不同风险情境下的表现来观察。

  学习团队的角色也需要变化。培训不只是教员工怎样获得更好的答案,而要让他们经历AI回答不完整、信息冲突和高置信错误的情境,并练习升级与纠偏。AI时代的熟练,不是永远得到正确输出,而是在输出不可靠时仍能稳定完成工作。

  管理责任重构:AI的绩效差距,本质上是组织设计差距

  当AI项目效果不佳,企业容易把原因归结为员工不会用、意愿不足或培训不够。这些因素确实存在,但MIT的十大杠杆把更多责任放回了组织:问题是否定义清楚,证据是否充分,界面是否支持判断,流程是否保留学习与协作,责任是否匹配权限,释放的时间是否被重新投资。员工位于回路中,不代表管理层可以退出回路。

  高管需要决定AI究竟服务哪一类经营目标。是降低某项流程成本、改善客户质量、缩短新人胜任周期,还是打开新的收入空间,不同目标会导向完全不同的场景、指标和人才安排。模糊的“提高效率”很难形成资源取舍,也让任何使用数据都可以被包装成成功。

  业务管理者则要负责工作重构。他们最了解任务间的依赖关系,也最能判断哪些环节看似琐碎却承担质量控制,哪些协作看似缓慢却在减少后续风险。HR和技术团队可以提供方法、工具与治理框架,但无法代替业务负责人设计日常工作。

  HR的价值在于把技术采用与岗位、绩效、能力和员工关系连接起来。它需要帮助企业识别人才管道风险,避免学习型任务被无意识删除;调整绩效标准,防止使用量取代结果;建立分层能力模型,让领域专家、管理者和新人获得不同支持;同时确保责任、发展机会和工作负荷不会在AI上线后失去平衡。

  技术、数据与风险团队则要让“负责”具备可操作条件。可靠的数据基础、来源追踪、权限管理、抽样审核、异常升级和使用记录,看似是系统细节,实际上决定员工能否完成被赋予的监督责任。没有这些基础,企业要求员工“对AI结果负责”,只是在用制度语言掩盖系统能力不足。

  一份比“AI使用率”更有价值的绩效账本

  企业不必立刻建立庞大的AI指标体系,但可以先把一项核心场景的账算完整。最基础的一页账本,应当同时记录旧流程基线与新流程结果,既计算可见收益,也计算转移成本。它可以围绕五个问题展开:任务是否更快、结果是否更好、返工是否更少、员工是否学会、团队与客户是否真正受益。

  速度指标应计算端到端周期,而不是单次生成时间。质量指标应包括一次通过率、错误类型和下游接受度,而不是只依赖使用者自评。成本指标要纳入审核、纠错、系统集成和培训投入;风险指标要观察错误是否被发现、能否追溯以及可能造成的影响;成长指标则要关注新人胜任时间、知识保留和专家带教负担。

  这份账本还应当区分不同员工群体。平均值可能掩盖新人获得巨大提升、专家收益有限,或者少数高频用户创造了大部分价值的事实。理解“什么对谁、在什么任务和条件下有效”,比证明AI总体上有效更能支持下一步投资。

  评估也不应只做一次。模型、界面、数据和员工习惯都在变化,一个三个月前表现稳定的流程,可能因为任务范围扩大而进入新的风险区;一个早期收益不明显的场景,也可能在数据基础改善后变得可行。AI治理需要像经营复盘一样持续,而不是在采购验收时宣布完成。

  真正的分水岭,不是有没有AI,而是有没有新的管理方法

  PwC对超过10亿条招聘广告的2026年分析显示,具备AI技能的员工平均获得62%的薪酬溢价;世界经济论坛则预计,到2030年,全球22%的岗位将经历结构性变化。企业对AI人才和组织转型的投入仍会继续增加,但人才价格和工具预算并不能替代工作设计。AI能力越普及,单纯“拥有工具”的差异越小,管理方法带来的差异反而会更明显。

  MIT十大杠杆的价值,正在于它没有把生成式AI描述成一条自动抵达生产率的捷径。它提醒企业,技术可能被弃用、误用,也可能因为使用过度而损害学习、协作和责任;同一项工具可以让工作更有价值,也可以让员工成为疲惫的内容审核员。结果并非由模型单方面决定,而是由问题选择、流程设计、绩效激励和人才投资共同塑造。

  对于企业高管而言,下一阶段的关键问题不再是“员工有没有用AI”,而是AI是否改变了最值得改变的任务,是否把时间转化为更高价值,是否让组织在速度之外保留质量、学习和信任。对于HR而言,任务也不只是推广工具和组织培训,而是确保岗位仍有成长路径、绩效仍奖励真实价值、能力仍能持续形成、责任仍与权力和资源相匹配。

  真正提升员工绩效的AI,不是一款被更多人打开的产品,而是一套被重新设计过的工作系统。 当企业能够用证据选择场景,允许差异化使用,建立校准信任,减少无意义劳动,保护学习与协作,重视界面、专业与责任,并把释放的时间转化为新工作,AI才会从一项活跃度很高的工具,变成可以进入经营结果的生产力。

  参考资料

  MIT Sloan School of Management, “10 levers for shaping generative AI that truly improves worker performance,” September 3, 2026.

  MIT Industrial Performance Center, “Humans in the Loop: The Evolution of Work in Early Experiments With Generative AI,” April 2026.

  Microsoft Research, “The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers,” CHI 2025.

  PwC, “2026 Global AI Jobs Barometer,” June 2026.

  World Economic Forum, “Future of Jobs Report 2025,” January 2025.

  原文链接:https://mp.weixin.qq.com/s/3fQGH8_-tz3KyTQV5D3WqA

[返回上一页]
在线咨询服务