2026年9月16日,Yann LeCun在巴黎政治学院提到詹姆斯·邦德,以此形容由人工智能智能体发动大规模网络攻击的设想。在他看来,防御方拥有更先进的技术和更强的专业能力。他断言,智能体的出现对防御方有利。他还表示,攻击和防御都在变得更加复杂,但他并未看到双方力量对比出现明显变化。在生物风险方面,他先是提到制造病原体所需的手段,继而提到专业人员的动机:比起研制一种可能害死自己的病毒,他们有更好的前途。

在这些回答中,他对技术的乐观也建立在对人的信任之上。然而,有能力且心怀善意的各方,也可能共同让一场灾难发生。LeCun确实在研究系统的安全问题。仍待回答的问题在于:人的决策以及负责让安全保障发挥作用的组织是否可靠,尤其是在它们有时未能充分预见的情况下。

技术防护与对行为的假设

这种信任是明确表达出来的。在2024年3月发布的与Lex Fridman的访谈中,LeCun表示,据本刊译文,他认为人们“本质上是善良的”,并将对人工智能的悲观看法与对人或制度的不信任联系起来。在2023年接受The Hub的采访时,他就已经主张,心怀善意的各方将拥有更多资源,而用户会拒绝危险的机器。他解释说,如果技术走上了错误的方向,“我们就停下来,仅此而已”。

LeCun也提出了工程层面的解决方案。在Lex Fridman的节目中,他描述了一种由目标驱动、内置防护栏的人工智能,承认意料之外的行为将会出现,并预计防护措施将逐步改进。2026年9月14日发布的他在INSEAD交流活动的纪要重申了这一目标:借助世界模型预判行动的后果,并将约束条件纳入决策。10月1日在《财富》杂志上,他将事故归因于设计和监督方面的缺陷,并认为这些缺陷是可以避免的。

这些研究为他的乐观主义提供了技术基础。但它们并未解决其成功所需的集体条件问题。用户可能想要一个有用的工具,却不了解它的危险。管理层可能在是否中止某项业务时犹豫不决。多个团队可能共享同一个错误的假设。问题远在恶意出现之前就已开始:有时,只要每个人都信任一项无人核实过其局限的防护措施,就足以酿成问题。

灾难未必要威胁到全人类

工业史提供了不同于人类灭绝的另一种严重程度尺度。2001年图卢兹AZF工厂爆炸事故的影响远远超出工厂本身,波及了整座城市。公共卫生研究记录了这次爆炸对居民健康及其个人、家庭和职业生活造成的后果。一起局部事故可能造成持久的损害,其范围远远超出引发事故的组织本身。

在福岛,为国际原子能机构报告所作的人为与组织因素分析描述了相关各方如何相互强化了彼此关于安全的预设。这些共同的信念妨碍了对2011年3月事故的充分准备。对系统的信任本身就是问题的一部分。

这些先例并不能衡量人工智能的风险。它们提醒我们,即便在有安全专家工作的领域,预判不足也可能付出怎样的代价。随着人工智能的普及,必须从严重事故终将发生这一前提出发,设法降低其发生概率并限制其影响范围。事后纠正的能力本身,并不能回答在此期间所造成损害的问题。

近期发生的事故虽然已确认的损害仍然有限,但已经显示出预设的防护措施与其实际运作之间存在差距。我们关于Anthropic事故重新定性和OpenAI六份报告的文章详细介绍了这些机制。这些事故发生在训练或评估过程中,无法据此推断生产环境中的风险率。它们表明,设计一条规则、执行这条规则以及发现规则被绕过,是三项不同的任务。

据CNN于2026年9月18日发布的调查报道,今年春天,美军险些根据一份人工智能辅助生成的报告,在中东拦截一艘中国船只;该报告错误地认定这艘船的货物与一项核武器计划有关。据称,该行动在核实后被取消。这一说法基于四名匿名消息人士;五角大楼当时未回应CNN的询问。其中描述的机制,是错误信息被纳入了人的决策链。

防御方的优势并不能保护所有人

恶意则带来了另一重困难。“9·11”袭击属于蓄意攻击而非工业事故,双方手段极不对等。美国调查委员会强调,恐怖组织的资源与遭受袭击的国家的资源相差悬殊。委员会指出了在预判、政策、能力和管理方面的失误。

其后果远远超出了即时的破坏:北约的应对尤其改变了其使命和能力。防御方的物质优势,并不能保证抵御一场重大攻击及其连锁效应。

此外,这种优势的分布并不均衡。英国国家网络安全中心在2025年5月发布的评估中预计,能够跟上人工智能增强型威胁节奏的系统,与大量更为脆弱的系统之间将出现鸿沟。因此,顶尖实验室或大国所拥有的手段,并不能代表所有企业和机构实际受到的保护。

安全也要在制度中构建

LeCun常用的航空类比颇具启发性。提高发动机的可靠性需要大量的工程工作。但航空安全史同样包括认证、空中交通管制和事故调查。1956年的大峡谷空中相撞事故暴露出,尽管空中交通量不断增长,防撞措施却仍然不足。两年后,美国成立了一个新的独立联邦机构,负责民用航空安全。

因此,风险控制是在多个层面上逐步建立起来的。集体机制组织了信息流通、监督和干预。这段历史支持了技术进步变得更安全的可能性。它也表明了所需的制度性工作,以及防护措施不足时所付出的代价。

LeCun本人也承认这些制度的作用。在巴黎政治学院,他主张对辅助驾驶系统进行独立测试,并对乳腺X光片分析实行上市许可。不过他认为,现有法规总体上已经足够,并否认在人工智能的现阶段存在足以证明有必要监管研究本身的内在危险。

因此,需要审视的问题十分具体:这些框架及其监管手段能否切实覆盖新的用途?谁能核查防护措施、获取事故记录、通知受影响的第三方并强制要求纠正?这些能力必须能够独立于人们对开发者的信任而接受检验。我们关于Anthropic治理的调查已经提出了这一难题:共同怀有审慎的意愿,与拥有确保其得到落实的权力,是两回事。

区分威胁,组织预防

公共辩论已围绕人类灭绝情景形成两极分化。在BBC《新闻之夜》2026年9月10日发布的一段访谈片段中,Geoffrey Hinton认为,人工智能在十年内杀死全人类的风险为10%这一估计“并非不合理”。这是他本人对风险的判断。而在巴黎政治学院,LeCun则强调防御方的优势,对詹姆斯·邦德式的情景不屑一顾。他回答中的这一部分,与其反对者停留在同一层面,使辩论呈现出一种善恶二元的解读:安全取决于心怀善意的各方相对其对手的优势。

“9·11”事件提醒我们,更强大的手段并不足以阻止一场重大攻击,而其后果可能远远超出即时的破坏。但反恐与预防工业事故需要不同的分析,即便某些防护措施有所重叠。设计错误、含糊的指令或协调失灵,都可能在没有任何人蓄意加害的情况下造成损害。

LeCun承认这些失灵的存在,并致力于预防它们。然而,将其定性为可以避免,并未回答这种预防在现实中需要哪些条件的问题。有必要公开讨论人工智能可能引发或放大的严重工业事故,根据不同用途评估其发生概率和影响范围,并明确说明其中的不确定性。开发者、使用人工智能的企业和公共部门必须分享从事故中汲取的经验教训,并共同决定防护手段。

放慢人工智能的发展并不足够:其他人仍会继续推进。人工智能带来的益处,证明了继续开展研究和应用的合理性,但需配备效果可以核实的防护措施。独立测试、访问限制、系统隔离和干预程序,应当降低事故的发生概率并控制其后果。这需要预算、明确的责任归属,以及中止某项操作的实际权力。谁接收警报,谁决定叫停,又由谁通知面临风险的人?

相关机制已经存在,其覆盖范围和约束程度各不相同,但仍然不够充分。我们的 人工智能监管现状综述对比了各项国际倡议、各国法律及其实施情况。