全球AI创新治理|英国公共部门AI生产力测算批判

作者:栗子宜 发布时间:2026-10-07 来源:全球人工智能创新治理中心+收藏本文


编者按


在全球公共治理数字化的浪潮中,生成式人工智能已被多国政府视为重塑公共服务与缓解财政压力的关键抓手。英国艾达·洛夫莱斯研究所(Ada Lovelace Institute)在2026年5月11日发布政策简报《评估成效:审视关于人工智能与英国公共部门生产力的言论》,回应了如何在技术狂热中保持理性审慎,以及防止过度承诺造成公共财政浪费和制度风险等核心治理议题。报告表示,决策者应当建立一套批判性的审慎评估框架,从方法学多元化、成本全生命周期审视以及回归公共价值等维度,严格审视人工智能生产力虚高的言论。


文中观点不代表编译者或发布平台立场,完整论述及作者原意请参阅英文原文。


摘要


报告聚焦英国公共部门将人工智能视为核心效率驱动力的宏观趋势,对其背后的评估方法与模型展开了严谨的审视。报告认为,当前业界及政府高频引用的“人工智能每年可节省数百亿英镑”等乐观预测,普遍建立在脆弱的理论假设之上。这些方法论缺陷主要表现为四个方面:一是任务自动化模型过度简化了公共行政的复杂逻辑;二是直接套用标准化任务数据库,忽视了跨国别、跨行业的现实错位;三是依赖大语言模型进行自我能力评估,陷入了黑箱操作与循环论证的怪圈;四是主观问卷和脱离实际的实验室试验,无法还原真实治理环境中的流程摩擦和审校负担。


这些评估盲区导致最终的宣传标题往往过滤掉了高技能专家效率不升反降等负面证据,极易误导重大的公共财政投入。为此,报告呼吁决策层必须重塑评估标准,在预测中坦诚交代技术效益的动态区间与不确定性,并将服务质量、容错率、员工福祉及社会公平等多元公共价值作为核心考核指标,以此打破盲目的效率幻觉,让数字公共投资真正回归服务公众的初心。


作者简介


苏梅达·德希穆克(Sumedha Deshmukh)与马特·戴维斯(Matt Davies)均为艾达·洛夫莱斯研究所(Ada Lovelace Institute)的政策研究员,长期专注于社会与经济政策、全球人工智能治理、跨国数据流动以及数字技术对公共部门转型影响的实证研究。


图片

图片来源:报告原文

01

核心发现:对人工智能生产力测算的审视



英国政府当前将人工智能视为提升公共部门生产力的决定性力量,并将其置于国家经济议程的核心地位。在财政压力和公共服务需求激增的背景下,官方通讯、行业调研以及第三方政策分析频繁论证该技术在削减成本、压缩工时和刺激经济增长方面的巨大潜力。值得注意的是,这种普遍的乐观情绪正在实质性地影响重大公共财政支出决策。例如,在2025年政府支出审查中,基于某些声称人工智能每年可带来高达450亿英镑潜在收益的测算,官方做出大幅增加公共服务数字化与人工智能投资的战略承诺。然而,这些被呈递给核心决策者的人工智能量化数据是否足够稳健,能否合理化其背后的高额投资,在公共政策领域依然缺乏足够的审慎评估。


图片

英国财政大臣雷切尔·里夫斯在贝叶斯商学院演讲

图片来源:LabourList


尽管以往针对公共部门负责人的调查显示出对人工智能应用前景的强烈乐观态度,但实证研究同样记录了将人工智能成功整合进复杂公共系统时面临的严峻挑战。面对不确定性,政策制定者必须精确厘清人工智能在哪些具体业务场景中能够真正解锁生产力,并全面评估随之而来的综合成本与资源消耗。报告认为,提升公共部门生产力的根本价值在于推动服务的持续改善,使公共服务人员能够更高效地为更广泛的群体提供更优质、更具成本效益的服务。如果片面追求生产力而忽视社会公平与制度容错,可能会进一步加剧权力的不平衡并放大弱势群体的脆弱性。因此,一份知情且清醒的人工智能技术前景预测,对于确保公共投资的科学性具有不可替代的战略价值。

02

公共部门生产力的定义与测量困境



生产力作为经济学中衡量资源使用效率的核心指标,在私营部门通常有着直观的货币化衡量标准,即投入与产出市场价值之间的比率。然而,在不以市场化定价为导向的公共部门,准确界定并测量生产力是一个极其复杂的方法学难题。过去传统的会计统计往往采取“投入等于产出”的简化法,直接将公共支出的资金规模等同于其创造的社会价值,这客观上忽略了技术和管理革新带来的效率红利。为了修正这一偏差,英国国家统计局开始尝试通过估算公共服务的实际交付数量与服务质量来综合评估其对经济的真实贡献,但这种质量加权的测算在实操中依然充满争议。


这种测量维度的不确定性直接导致了人工智能生产力评估的基准混乱。当前关于人工智能效益的论证往往假定技术能同时缩减投入并增加产出,从而推导出了庞大的纳税人资金节省额度。然而,来自技术应用史和公共管理实践的实证表明,数字化与人工智能工具的全面接入在初期往往伴随着系统整合障碍与员工满意度下滑等逆向冲击。组织层面的流程再造、历史遗留系统的技术债务以及跨部门协同机制的滞后,才是阻碍技术红利兑现的最大非技术瓶颈。由于目前缺乏标准化和强制性的跨部门人工智能应用追踪机制,决策层甚至无法获得一个关于人工智能具体部署现状的宏观视图,这使得任何大范围的效益跨越式推导都显得过于脆弱,且缺乏严密的论证支撑。

03

透视人工智能生产力评估的方法与背景



一

研究生态背后的利益纠葛与行业偏见


审视当前针对公共部门人工智能生产力进行预测的研究,可以发现一个不容忽视的结构性特征,即人工智能系统的研发实体与研究这些系统社会经济效应的学术或政策主体之间的界限正变得日趋模糊。强大的利益导向和激励结构正在悄然改写政策评估的客观性,导致研究生态系统开始向技术乐观主义倾斜。人工智能科技巨头不仅是研究对象,更是研究经费的提供者、智库的战略合作伙伴以及底层核心数据的控制者。这种深度交织使得底层数据往往带有强烈的选择性披露特征,甚至有文献记录了研究人员因难以在科技公司内部发表负面或零效应的评估报告而选择离职的现象。


图片

OpenAI与英国签署战略合作

图片来源:英国政府网


这种行业主导的研究生态导致评估视角出现严重失衡。目前被广泛引用的行业数据集和研究模型,其指标设计依赖于对技术使用频率的测量,而忽略了更广泛的公众福祉和前线工作人员的真实反馈。前线文官如何处理人工智能输出的差错、中层管理人员如何在复杂的行政流程中应对系统异构性以及公民在体验技术替代后的感知变化,均在研究设计初期被系统性地排除在外。由于特定开放平台的盛行,大量未经独立同行评议的实证研究被直接推向公众,并在政治势能的催化下迅速演变为官方决策的重要依据。研究机构若缺乏多学科团队的介入和利益冲突的对冲,其推导出的巨额生产力增长数据必然存在极高的信任赤字。


二

预设结论的研究框架与倾向性假设


研究框架的预设立场对下游的研究结论具有决定性的导向作用。当前诸多针对政府公共部门人工智能试点的调研,其核心研究假设在设计之初就默认了人工智能必将带来效率提升,从而将测量重点聚焦在“技术能省出多少时间”等容易量化的初阶指标上。报告通过对比2025年夏季英国政府内部开展的两项极为相似的大语言模型辅助工具试点研究,清晰地揭示了预设倾向对结果的严重影响。研究一在问卷设计和研究立意上大量采用积极的修饰性修辞,极少考虑潜在的系统负面反馈,最终得出了“人工智能试点显示其每年可为每位文官节省近两周时间”的标志性正面结论。


相反,由商业贸易部主导的研究二则在研究设计中极具前瞻性地纳入了对系统风险、全流程额外工作量、幻觉差错以及质量把关负担的考量。其最终的评估结果虽然承认人工智能在特定的文字总结与草拟场景中能带来小幅工时节省,但同时也直言在排程和图像生成等任务中引入人工智能反而造成了显著的时间沉没。这种截然相反的研究结论深刻表明,如果研究者将追求量化指标本身作为终极目标,而剥离了系统在公共价值层面的真实变动,其推导出的数据便极易误导高层决策。缺乏客观行为对照的主观问卷调查,往往难以真实反映技术在应对复杂治理现场时的制度摩擦与现实瓶颈。

04

拆解效益测算方法与潜在盲区



一

自动化模型对行政复杂逻辑的过度简化


在当前主流的人工智能生产力量化测算中,任务自动化研究占据了主导地位。该方法将行政岗位拆解为离散的“任务组合”,测算可替代比例,再乘以平均薪酬换算出资金节省总额。这种推导依赖层层简化假设,极易引发统计扭曲。例如,模型通常假定员工在各项任务上分配的时间绝对均等,且常规任务可百分之百被替代,这与复杂的公共部门工作实际相去甚远。


图片

任务自动化测算流程与决策点图模型

图片来源:报告原文


更为致命的是,此类模型通常直接将“技术理论可行”等同于“组织可实际兑现红利”。报告显示,这种多层抽象会使每一阶段的估计误差不断复合放大,最终收敛为一个看似精确却极具欺骗性的单一数字。模型推演选择性地忽视了系统集成与员工长期培训的沉没成本,以及公共事务中最核心的默会知识、上下文情境评判与人际信任链接。当分析框架将薪酬视作唯一的成本削减渠道时,它既无法捕捉组织变迁的摩擦系数,也无法对关键假设进行必要的敏感性测试。


二

通用数据库在特定公共场景中的套用错位


任务自动化研究高度依赖底层任务数据库的质量。然而,目前核心评估模型所采用的通用数据库,在创立之初并非专为公共部门设计。将此类带有特定国别和时代局限性的职能标尺,直接套用到英国的文官体制与公共服务场景中,往往面临明显的匹配度挑战。公共职能的实际内涵在不同的行政架构、组织文化和地域部门之间存在显著差异,难以由通用型的职业代码完全涵盖。


图片

国际标准职业分类(ISCO)

图片来源:国际劳工组织


评估方法学的修正轨迹已证实了这种粗放测算的局限性。早期研究基于职业整体视角,曾推测约有40%以上的岗位面临高风险。然而,后续研究在引入“同职不同责”的异质性修正(即承认拥有相同头衔的雇员,日常处理着不同复杂度的事务)之后,该估算指数大幅下降至10%以下。当前的许多人工智能公共政策论证未能充分汲取这一方法学修正经验,仍倾向于直接引用基于通用数据库衍生出的效率数据,这导致最终的推演结果往往脱离了实际的治理环境。


三

依赖人工智能进行自我评价的黑箱怪圈


伴随着生成式人工智能的爆发,一种更新奇也更具争议的方法学开始在公共人工智能评估领域泛滥,即研究人员开始高度依赖大语言模型来自动对职业任务的自动化潜力进行分类打分,其本质上落入了“用人工智能来评价人工智能能力”的逻辑圈层。这种高度自我参照的评估范式在独立性和准确性上面临双重赤字,并带来严重的黑箱效应。模型的自我评价判定完全受制于其底层的训练数据集,而这些数据集内部本身就充斥着关于人工智能全能论的行业偏见与失真假设。


图片

人工智能生产力测算模型图

图片来源:报告原文


此外,大语言模型在本质上具有非确定性特征,这直接对实证科学的核心底线,即“可重复性”发起了挑战。即使在完全相同的输入提示词下,模型的随机参数变动以及底层微调版本的迭代,都会导致其对同一批公共职能的自动化概率产出截然不同的量化判定。在多层模型推演的复合效应下,这种微小的判定偏移足以将某个关键岗位从“中度风险”直接错误地划定为“高额可替代群体”,进而彻底扭曲最终提交给财政决策者的整体预算节省预期。若没有真实世界中前线文官的深度参与和人工交叉校准,这种自动化推演极易沦为特定技术参数操纵下的空中楼阁。


四

主观工时问卷带来的认知与记忆偏差


对于未采用自动化潜力模型的评估研究,通常会转向对试用员工进行工时分配的主观问卷调查。然而,从统计学与行为科学的视角来看,此类依赖主观陈述的数据收集模式存在显著的方法学偏误。在缺乏客观记录工具的情况下,个体对工时消耗的记忆往往存在系统性偏差,容易受到回忆偏误、社会合意性偏见以及规划谬误的叠加影响。例如,雇员为展现对新技术的适应能力或配合管理层的数字化考核指标,可能会在潜意识中高估技术所带来的工时缩减效应。


图片

GitHub Copilot智能代码编程辅助工具

图片来源:Clarion Technologies


当研究者将此类主观自评数据与客观的对照组行为监测进行比对时,结果往往呈现出明显的方法论脱节。在一项针对开发人员引入人工智能辅助工具的实证研究中,开发者主观认为该工具使研发速率提升了约20%;然而,通过对真实代码产出和调试周期的客观度量,研究团队发现,在使用人工智能辅助后,实际任务完成工时反而延长了约20%。这种主观认知与客观成效的背离,充分表明了单纯依赖满意度问卷的局限性。若在报告成果时选择性地忽略样本代表性不足等方法学限制说明,相关数据在传播中极易被误读为不具备稳健基础的“权威共识”。


五

理想实验室与生动治理现实的场景脱节


部分研究为提升方法学评级而引入了随机对照试验(RCT),但这些试验的设计通常局限于相对理想化的模拟环境,未能充分考量复杂的行政现实。例如,某些被常态化引用的学术试验表明,人工智能辅助工具能将公文写作效率提升约40%,并将产出质量提高近20%。然而,拆解其试验设计可以发现,受试者处理的多为高度去上下文且无需跨部门协同与长周期合规审查的标准化模拟任务。


相比之下,在真实的公共治理现场,政策决策或公文的出台需要嵌套在复杂的法律框架、历史脉络以及多元利益相关者的沟通机制之中。模拟试验的受试者无需承担行政或法律责任,亦无需应对公共舆论的约束。此外,多数随机对照试验试点存在明显的时间周期碎片化局限,未能评估长周期应用中因“技术新鲜感”消退而引发的边际递减效应。这种在受控实验室环境下录得的高效率,在移植到具有科层制摩擦力的真实公共系统时,往往面临显著的协同与合规约束。

05

跨越宣传标语走向客观透视



一

核心标题对复杂效率分布的选择性过滤


在信息快速流转的政策决策环境中,研究报告的标题、媒体通稿的摘要以及简明扼要的要点列表,正在系统性地过滤掉底层数据中极为关键的区间分布与负面证据。这种对标语新闻的过度依赖,导致公共人工智能政策的讨论呈现出极度危险的单向透明状态。诸如“试点参与者平均节省26分钟”的宏观结论背后,往往隐藏着过半数的试用雇员其实际工时节省在30分钟以下,甚至有近两成的人员未体验到任何效率变动的统计事实。


图片

英国科学、创新与技术部人工智能聊天机器人试点

图片来源:英国政府网


更深层次的研究表明,人工智能在公共部门的效能分布展现出明显的“补短板”效应,即其对于缺乏行业经验、技能相对底层的初级文官具有极其显著的质量补强与工时缩减效应。然而,对于公共部门中处理高复杂度、高政治敏感度事务的高技能和资深专家而言,引入人工智能非但不能提供建设性帮助,反而往往因为审校负担的激增而引发了工作质量的边际下滑。如果政策制定者在规划文官编制调整或部门重组时,单纯依赖被拉平的宏观平均数,往往会忽视不同职能部门之间的技能异质性。这种评估盲区极易导致关键岗位的人才流失,进而削弱公共部门处理高复杂度事务的专业决策能力。


二

产业资本对数据与结论的隐性塑造


除了统计数据的选择性过滤,技术繁荣背后相互交织的行业利益也是导致效率预测虚高的深层原因。当人工智能企业深度参与从研究资助、智库合作到发布自主报告的全生命周期时,所谓的独立第三方评估便很难保持绝对的客观立场。科技企业往往利用其对底层专有工具和私有数据集的控制权,系统性地筛选并披露那些最有利于商业推广的效率模型,而对技术带来的系统排异反应和逆向摩擦闭口不谈。


这种由资本深度干预的研究生态,进一步窄化了公共政策的讨论视野。它使得决策者在面对人工智能技术时,容易产生一种被技术代差逼迫的焦虑感,从而在缺乏严谨同行评议和跨方法交叉验证的情况下,盲目地将行业游说的推测性数据转化为政府的财政预算承诺。该报告警示,如果公共数字转型的知识库长期被技术持有者垄断,政府将面临丧失独立评估能力的制度风险,最终为不切实际的效率神话承担沉重的公共财政红利沉没代价。

06

重塑评估范式与理性决策标准的建议



一

引入综合指标


为了优化公共部门人工智能效益的决策机制,未来的技术评估框架需要进行系统性调整。报告建议,应当在现有的评估流程中充分引入技术不确定性,避免过度依赖单一的绝对化量化预测。任何提交给决策层的效益模型,均应明晰地呈现效率区间的分布状况,不仅要识别出人工智能发挥增量效应的特定场景,也需客观披露技术可能引发的效率边际递减或审查负担激增的节点。


同时,公共部门的效益测算应超越传统的“工时精简”单一指标,转向兼顾公共价值的多元综合评估体系。一个完善的数字化治理反馈机制,应当将公共服务的最终交付质量、系统容错率、前线文官的职业福祉以及技术应用过程中的社会准入公平性共同纳入核心考量。这要求财政和评估机构推广复合型方法学,将前线行为监测、主观问卷调查与长周期的纵向追踪进行交叉互证,以此消除单一评估路径带来的方法论盲区。


图片

英国国家统计局(ONS)外景

图片来源:英国政府网


二

面向不同主体的行动指南


基于上述方法学反思,报告面向不同的治理主体提出了具体的优化路径。对于政策制定者而言,可将简报中列出的批判性评估清单作为审阅数字化预算申请的参考依据,重点审查资金来源是否存在潜在的利害关系,以及底层推演假设是否具备实证数据支撑。资金资助与委托方则宜加大对独立第三方科研网络的支持力度,并鼓励受资助的研究项目向社会公开其底层提示词设计与分类数据集,以便利于同行评议的开展。


对于负责技术落地的政府职能部门,建议在项目启动阶段同步建立多维度的效果跟踪与监测机制,并保持组织弹性,根据实操中对前线审校负担的实际影响,及时调整或重塑相关技术项目。从宏观治理层面来看,公共部门在引入人工智能时,应超越单纯的工具理性,平衡好行政成本精简与人性化治理之间的关系。明确技术变革在不同群体中的效益与风险分布,有助于确保数字公共投资切实转化为社会公共福祉,避免技术效益评估流于形式。





原文链接




https://www.adalovelaceinstitute.org/policy-briefing/measuring-up/