辛艳艳 王奕博:“深度伪造”风险升级,怎么破?

作者:辛艳艳 王奕博 发布时间:2026-09-06 来源:瞭望智库+收藏本文

随着生成式人工智能和多模态技术快速发展,“深度伪造”正成为影响信息生态、社会认知和个人权利的重要风险来源。


9月1日,新华社瞭望智库刊发由全球人工智能创新治理中心副秘书长、复旦大学发展研究院助理研究员辛艳艳与全球人工智能创新治理中心、复旦大学发展研究院科研助理王奕博共同撰写的文章。文章聚焦人工智能深度伪造带来的内容安全风险及其监管难点,并提出构建“事前预防—事中风控—事后救济”治理链条,以技术标准、跨平台协同、责任追溯和权利救济等机制,推动人工智能安全治理走向全周期、全链路治理。


图片

图片来源:新华社


当地时间8月12日,马斯克旗下SpaceXAI正式发布新一代大模型Grok 4.6。SpaceXAI称,新模型重点强化长时间运行的智能体(Agent)、复杂编程、知识工作以及交互式和视觉任务能力。此前,马斯克在开源大模型Kimi K3相关评测报道下留言“令人印象深刻”,并披露研发计划称,Grok 4.6大模型性能有望超越Kimi系列模型。


但Grok模型在快速迭代、性能升级的同时,也曾多次因被用户诱导生成非自愿色情图像而陷入内容安全争议,成为全球人工智能(AI)内容安全监管领域的焦点事件,受到英国、法国、印度等国和欧盟方面的批评,一些国家的监管机构已介入调查。


今年5月,美国明尼苏达州州长签署一项针对AI“深度伪造(Deepfake)”问题的州立法,重点整治未经许可AI生成不雅图像相关情况。马斯克旗下xAI(现已变更为SpaceXAI)据此向明尼苏达州联邦法院提起诉讼,认为该法案对AI创作与表达自由干涉过度。


自2022年生成式预训练语言模型ChatGPT问世以来,生成式人工智能(AIGC)的深度伪造问题进入爆发期,虚假信息正借助AI技术加速变异。界经济论坛发布的《2026年全球风险报告》显示,“错误信息和虚假信息”在未来两年风险展望中排名第2(仅次于地缘经济对抗),在未来十年风险展望中排名第4。


当AI技术与日常生活深度融合,谁为AI安全风险负责?当技术挑战伦理,治理如何跟上?


图片

2026年7月6日,在瑞士日内瓦,参会者在首届“人工智能治理全球对话”现场

图片来源:新华社


成为风险来源





2023年,一段AI生成的“威尔·史密斯吃意大利面”视频曾引发讨论。当时,深度伪造更多被视为一种技术实验或娱乐工具。但短短几年后,AI生成视频、语音和图像的真实性快速提升,深度伪造正在从“娱乐内容”转变为影响安全的重要风险来源。


深度伪造技术是AI通过自我对抗实现“以假乱真”的训练过程。多模态生成技术的突破使AI能够跨模态合成文本、图像、视频不仅让错误和虚假信息以更低的门槛、更高的仿真度和更快的速度扩散,也带来信息传播生态、社会认知导向和个体权利保障三个层面的风险外溢度伪造引发的各类安全风险正成为AI技术和社会治理的新痼疾,涉黄问题也只是冰山一角。


在信息传播生态层面,深度伪造技术的滥用会污染网络内容生态,在虚假信息长期泛滥后,由AI打造的拟态环境可能一定程度上取代真实世界获得普通用户信任。2025年8月,美国一名56岁男子因长期与AI对话,加剧偏执妄想,杀害83岁母亲后自杀。


深度伪造技术在代议制民主国家的政治传播中被广泛使用。近期欧洲不同国家出现AI技术散播虚假新闻、导致政党选举受到干扰的例子,随着深度伪造技术日益逼真,事实核查往往滞后于虚假信息传播速度,长此以往,将破坏社会对信息环境的信任。


在社会认知导向层面,AI生成的内容缺乏多样性,更易放大社会偏见。2025年《科学报告》(Scientific Reports)刊发的一项针对五种代表性大语言模型的研究显示,每种大语言模型生成的内容都存在显著的性别和地域偏见,以及年龄和教育方面的刻板印象。在较为普遍的AI涉黄问题中,各种聊天机器人生成的性化图像也是基于物化女性的不良价值观。


有调查结果显示,在Sora模型生成的视频中,不仅存在外貌的单一审美,同时职业身份背后带有明显的性别固化认知。这种社会偏见随着AI使用的日益低龄化,将对未成年人的价值观产生深刻影响。


根据美国相关非营利机构一份针对13岁至17岁未成年人的调查,在收集的1066份样本中,有72%的美国青少年使用过AI陪伴产品,52%是固定用户(每月使用超过几次或更多)。 如果未成年人在接触AI工具过程中,受AI诱导性内容、色情暴力影响,则会身心受损,不利于正确价值观的确立。


当然,最直接的风险是对个体权利的侵害。用户利用AI工具,以真实人物为原型,未经授权擅自使用他人肖像并进行违法演绎,严重侵犯了公民的合法权益。在Grok一案中,不仅有公众人物,许多普通民众发布在社交平台上的生活照也被用来篡改传播。


此外,在多模态模型下,人们的声音也可能被伪造,AI合成语音技术可以模拟明星、学者或亲朋好友的声调、语速、气口,此类内容传播引发的诈骗犯罪、人肉搜索、网络暴力等连锁反应,会进一步扩大对个体权利的侵害范围和程度。这种未经本人同意的篡改,严重威胁了公民的个人权利和财产安全,恶意使用甚至会对受害者的个人生活和社会声誉造成毁灭性打击。


监管难点何在





AI内容安全风险已经外溢至社会各个方面,但现实对这一问题的监管却面临难题。AI时代的内容生成与传播,由生成端(大模型)、场景端(应用)、分发端(平台)、使用端(用户)共同组成。数据训练、算法学习、提示词注入、平台分发与用户再生产各环节相互关联、深度耦合。这意味着AI内容安全治理已经需要超越平台时代以人为中心、以账号管理为主要制度的治理方式,全面覆盖训练数据、模型能力、应用设计、交互机制和传播链路等不同机制。


第一,监管困难的一个主要原因在于,对深度伪造的治理前提是对伪造信息的有效识别和监测。从技术手段上来说,过去的检测更多是通过识别AI生成内容的异常值实现,例如画面边缘不自然、帧间不一致、人物比例失调等结构性缺陷。现在伴随着大模型的迭代升级,这些结构性缺陷正在快速磨平。而围绕既有特征反复更新的检测工具在新的技术手段面前,始终处于“补漏洞”的追赶位置。特别是对掺杂了真实素材的深度伪造,检测时很难快速找到具体伪造点。


可以说,深度伪造和事实核查之间天然存在成本与速度的博弈,提升了治理难度。因此,内容标识和溯源显得尤为重要,特别是在治理路径上转向以生成源头标识为基础、平台传播核验的全过程治理。


第二,AI工具与社交平台的深度融合,使有害内容的传播能力显著提升。随着AI应用正从单一的内容生成工具扩展至智能助手、AI伴侣、任务型智能体等多元应用形态,内容安全风险不仅快速渗透至日常生活。部分有害内容无需跨平台流转,即可完成“生成-发布-传播”全流程,而平台的算法推荐机制又进一步放大了有害内容的触达范围。


以Grok涉色情内容传播为例,即使X平台宣布实施违规内容清除政策,也无法处置扩散后的相关内容跨平台搬运、二次改编以及与其他素材拼接使用。


第三,当前AI生成内容还不具备稳定性和一致性,事后难以通过实验复现的方式判定主要责任主体。与平台治理时期,账号主体承担内容传播的主要责任不同,AI内容生产牵涉模型开发者、应用开发者、平台分发者、用户等多个主体,难以清晰界定谁承担主要责任。


在Alien Chat一案(国内首起AI服务提供者涉黄获刑案件)中,争论的焦点之一便在于两位被告对于系统提示词的编写修改、与色情聊天内容的生成乃至传播是否具有直接的因果关系或显著作用。


对此,不同专家对“用户‘聊黄’,APP开发者和运营者是否应被追究刑责”“AI服务如果不是人为故意涉黄,以模型缺陷为由是否可以免责”等问题观点不一。这些问题让对AI生成内容的监管面临“责任难追溯、判罚难服众”的尴尬境地。


第四,取证搜寻难。打击利用AI深度伪造牟利面临不少挑战。我国在打击相关内容的过程中,就发现犯罪嫌疑人会通过频繁更换服务器、匿名网络信息等手段隐藏踪迹,再加上电子证据极易被加密、篡改或销毁,使得警方搜集证据、研判案情时常面临阻碍 。此外,随着智能化产品的普及度提高,AIGC的入口日益分散,模型厂商APP、第三方应用、插件、本地部署都可能成为AI使用场景,导致受害者难以明确取证对象。


完善治理链条





目前,全球多个国家和地区高度关注AI生成内容的危害,制定相关政策或推动立法。中国的《互联网信息服务深度合成管理规定》《生成式人工智能服务管理暂行办法》《人工智能生成合成内容标识办法》,欧盟的《数字服务法案》(Digital Services Act)、《人工智能法案》(Artificial Intelligence Act),美国的《删除法案》(TAKE IT DOWN Act),英国《数据法案》【Data (Use and Access) Act 2025】、《在线安全法》(Online Safety Act 2023)等逐步填补了对AI生成内容的“监管荒原”。


在此基础上,建议完善“事前预防—事中风控—事后救济”链条,构建基于全链路、全周期责任划分的治理体系。调动多主体力量,统合数据、算法、内容安全治理各项制度和标准,筑牢AI时代内容安全的法律底线。


一是事前预防,在数据集和模型侧丰富内容多样性,减少歧视和偏见。


事前预防是遏制有害内容生成的第一道防线,核心是将伦理规则嵌入生成端与应用端的数据训练优化、算法学习、产品设计与制度建设等环节,特别是当前多模态已经成为大模型的主要发展方向。


建议推进公布多模态大模型技术要求和测试方法标准,指导行业落实负责任、可信任的AI发展方向,特别是积极使用对抗机制和公平性评估指标,提升对偏见信息的识别和抵抗。此外,设计用户使用测试机制,在用户注册使用阶段进行伦理规范提示,加强对大众的AI使用素养教育。


二是事中风控,把高危内容的可见性、传播速度、再生产能力降到最低。


在内容监测层面,构建多模态内容检测体系,综合运用数字水印、区块链溯源等技术,实现对AI生成内容的实时识别与追踪。在传播管理层面,优化平台算法推荐机制,对于深度伪造涉及的高发场景,以及重点弱势人群设置专门的安全机制,阻断传播链条。


在再生产限制层面,建立跨平台协同风控机制,共同治理高危内容的二次编辑与传播,通过信息共享与平台联动,降低不良乃至有害信息在不同平台间转移扩散。同时,建立便捷有效的用户反馈机制和平台规则调整的意见征询,形成全社会共同参与的事中监管格局。


三是事后救济,回归伦理底线,采取对弱者及公共信任更保守的策略。


在权利救济方面,建立AI生成内容侵权的快速响应机制,简化维权流程,降低受害者的维权成本;针对未成年人等弱势群体,协同社会力量设立专项保护基金与法律援助机制,对受侵害的个体提供全方位支持。


在责任追究方面,探索技术复现可能,明确生成端、应用端、分发端、用户端的责任划分标准,对恶意生成、传播有害内容的行为依法从严惩处,形成震慑效应;完善跨境执法协作机制,解决AI内容风险的跨国追责难题。同时,探索建立AI行业社会责任报告,促进相关企业和行业协会有意识地关注AI相关风险,并建立有效的预防和保护措施,最大限度排除或降低不良影响。


近期AI深度伪造案例反映出,中小企业是关注的重点对象。目前,国内外第一梯队的AI应用在处理用户生成需求过程中表现相对合规,但中小企业更多在初创阶段,既缺乏相应的伦理及安全意识,也容易在利润驱动下,为抢占市场而绕过安全防护,做出越过伦理底线的行为。


这提醒监管部门在治理过程中既要“抓大”,确保前沿企业在监管框架下平稳发展,也不能“放小”,要鼓励、支持和引导中小企业在合规前提下积极健康竞争。


原文链接:https://mp.weixin.qq.com/s/DTj2xRYh2uQbHzdB00Af0w?scene=25&sessionid=#wechat_redirect