全球AI创新治理|AI安全治理要让评估真正影响决策——日内瓦AISE26会后观察

作者:张傲 栗子宜 发布时间:2026-09-06 来源:全球人工智能创新治理中心+收藏本文

2026年8月底,Dynamo AI在官方社交账号发布了一段第二届全球人工智能、安全与伦·理·大·会(AISE26)会议上的发言片段。发言直指人工智能治理的可执行性。这段视频再次提出一个核心问题:围绕人工智能安全形成的原则,怎样成为能够约束系统行为的制度安排?


这段发言源于2026年6月18日至19日,联合国裁军研究所(UNIDIR)主办AISE26在日内瓦万国宫举行。会议以人工智能对国际和平与安全的影响为切口,重点讨论高风险系统在全生命周期中的保障、智能体治理和责任划分。


图片

日内瓦万国宫外的成员国旗帜资料图。第二届全球人工智能、安全与伦·理·大会(AISE26)于2026年6月18日至19日在万国宫举行

图片来源:联合国图片/Violaine Martin


UNIDIR研究员Yasmin Afina在个人社交平台回顾会议时指出,AISE26不是谈判活动,而是让各方倾听、交流并理解彼此立场的平台。会议中的方案可以进入后续政策讨论,却不是各国已经接受的标准。


多边对话的作用,在于把笼统分歧拆成可以研究和协作的具体问题。各方可以先就风险识别、测试方法和事故信息交换经验,再逐步讨论更复杂的制度安排。会议能否产生持续影响,要看这些讨论是否真的进入后续落地阶段。

01

从模型测试走向系统安全


AISE26议程把测试评估、产品生命周期和人的责任放在同一讨论框架中。模型只是完整系统的一部分,风险还取决于模型接入何种数据和工具,以及人员怎样使用它。只看一次模型测试,很难回答系统在真实环境中是否可靠。


同一个模型用于整理公开资料,错误通常还可以复核。用于辅助公共服务决定时,遗漏或偏差可能直接影响具体个人。安全要求应当跟随用途和后果变化。一项社会技术安全评估研究也提出,除模型能力外,还应考察人机互动及更广泛的系统影响,因为使用情境会改变风险的性质和程度。


智能体让这种差别更加突出。一个助手只能读取文件、生成摘要,另一个却能调用外部系统并发起业务操作。两者即使使用相同的基础模型,所需的安全安排也完全不同。对可能造成重大后果的操作,系统需要限定权限,在关键步骤设置复核,并预留可用的中止和恢复机制。提示词告诉系统不要做什么,权限设计则决定它实际上能够做什么。


图片

英国人工智能安全研究所开源的Inspect Evals模型评估界面,展示评估任务的配置、运行和结果查看

图片来源:英国人工智能安全研究所(AISI)


人工监督也要看是否真正有效。若关键信息已被系统筛选,替代方案没有呈现,操作人员又没有足够时间核查,最后的确认就容易沦为形式。有效监督应让人看得懂建议依据,能够提出异议,并在必要时拒绝或中止操作。保留一个批准按钮,并不等于把判断权留给了人。

02

让评估真正影响部署决定



完整系统往往由多方共同完成,责任也要沿着开发、集成和部署过程具体划分。谁掌握关键信息,谁控制风险,谁就承担与其能力相匹配的责任。模型开发者需要说明能力边界和已知局限。系统集成者要检查模型接入数据和工具后出现的新风险。部署运营者则要根据实际用途安排监督,并处置运行异常。


美国国家标准与技术研究院2023年发布人工智能风险管理框架,2024年又推出面向生成式人工智能的配套文件。作为自愿性风险管理资源,这套框架强调在人工智能产品、服务和系统的全生命周期持续开展风险管理与评估。


图片

2023年11月,美国国家标准与技术研究院(NIST)在美国商务部举办人工智能安全研究所研讨会,与会者围绕人工智能安全测量、风险管理和评估协作展开讨论

图片来源:NIST(活动视频画面)


评估只有进入决策流程,才会成为治理工具。测试发现某项用途风险过高,就应限制权限或缩小部署范围。重大更新改变系统行为,需要重新测试。运行中出现新的异常,则应启动调查和纠正。评估结论若不改变任何决定,再完整的报告也很难降低现实风险。


透明度同样要围绕可核验的信息设计。公众需要知道系统的基本用途、能力边界和主要风险。监管部门应能取得履职所需的数据和材料。具备资质的专业机构还可在保密条件下开展独立检查。分层提供信息既能保护必要的商业和安全利益,也能避免企业用笼统承诺代替证据。


利益冲突是独立检验必须面对的问题。若测试方法、披露范围和风险判断都由被评估者决定,企业更可能突出对自身有利的指标。成本高昂却缺少减险效果检验的要求,还可能抬高市场门槛。产业参与不可或缺,但风险定义和评估结论不能由被评估者包办。公共部门与独立机构需要稳定的专业人员、必要的信息权限和持续资源。


中国的生成合成内容标识制度把透明度要求落实到传播流程。2025年3月,国家互联网信息办公室等四部门发布《人工智能生成合成内容标识办法》,自同年9月1日起施行。办法区分显式标识与写入文件数据的隐式标识,并把义务落实到生成服务、内容传播和应用上架审核等环节。


标识能够提供生成方式和来源线索,内容真伪仍需另行核验。制度的实际价值在于让标识随传播流程保留,在发生冒充或误导时为核验和追责提供依据。原则要产生约束力,必须对应具体主体、操作环节和处置后果。


图片

Meta平台展示的“AI info”信息标签。此类标签可提示内容可能由人工智能生成或编辑,并为用户提供生成方式和来源线索

图片来源:Meta官方新闻室


安全评估不是一张长期有效的合格证。它应当说明系统在什么条件下可以使用,条件变化后由谁重新判断,并触发相应措施。报告数量只是过程信息,治理成效应看评估是否改变了有风险的开发和使用行为。

03

让更多国家获得判断能力


AISE26还纳入非洲、加勒比和拉丁美洲的区域视角,并讨论基础设施依赖。对技术能力较弱的国家而言,接入先进模型只是起点。能否用本国语言和本地数据开展测试,能否判断系统是否适合公共服务,能否要求供应商纠正问题,决定了技术使用会带来自主能力还是新的依赖。


如果公共机构主要依据供应商的说明作出部署决定,又缺少专业人才和评估条件,应用范围越大,治理上的被动就可能越明显。智能鸿沟也会从网络和算力差距,延伸为独立判断能力的差距。能力建设因此要留下能够持续工作的队伍和制度,而不能只统计使用额度或培训场次。


图片

数据基础设施是人工智能能力建设的重要支撑。对低收入和中等收入国家而言,模型接入之外,还需要连接、算力、数据和技能等基础条件

图片来源:世界银行集团


2023年10月18日,中国提出《全球人工智能治理倡议》,主张增强发展中国家在人工智能全球治理中的代表性和发言权,并通过国际合作与援助弥合智能鸿沟及治理能力差距。包容性治理的实质,是让更多国家能够界定本地风险、参与测试设计,并对规则形成产生影响。


常设合作机制可以为这种能力积累提供支撑。UNIDIR在7月9日发布的北京访问消息中介绍,其负责人在6月30日至7月3日访华期间与清华大学签署合作协议,并同有关部门、研究机构和人工智能企业交流。新设卓越中心也把成员国能力建设列为工作方向。此类合作的意义,取决于能否形成可持续的研究联系,并把知识转化为当地能够使用的工具。


国际合作可以先从共同开发跨语言测试、整理风险案例做起。人员培养需要结合真实应用持续推进,事故处置经验也应形成稳定的交流渠道。在这些基础上讨论评估结果比较或监管结论互认,才能看清各方标准、程序和责任条件是否相容。


评估能否改变高风险部署,异常能否触发纠正和追责,是检验人工智能治理成效的关键。能力较弱的国家还须形成独立判断。做到这些,原则承诺才会成为系统运行中的实际约束。