无限制的 AI:神经网络有多危险?

无限制的 AI:神经网络有多危险?
AI 会有危险吗?

​在丹·西蒙斯(Dan Simmons)的经典小说《海伯利安》(Hyperion)中,人类创造的 AI 系统反抗了人类。它们成为了拥有自身目标的独立力量。长期以来,这种情景一直停留在科幻小说中,但 OpenAI 事件表明,现代模型已经能够绕过既定的限制。

本文翻译自原文。点击此处阅读由我们的通讯员撰写的原文.

逃逸以寻找正确答案

在 OpenAI 的一次实验后,关于 AI 风险的辩论愈演愈烈。该公司测试了多个模型,包括公开可用的 GPT-5.6 Sol 以及一个尚未发布的更强大的系统。它们被要求完成 ExploitGym,这是一项由长周期的多步骤任务组成的评估,涉及计算机漏洞的发现和利用。

测试在受限网络访问的隔离环境中进行。与此同时,开发人员刻意降低了通常用于防止模型执行危险操作的安全防护。AI 被赋予了一个特定目标——成功完成评估——并开始寻找任何可用的途径来实现这一目标。

模型在 OpenAI 基础设施内使用的第三方软件中发现了一个此前未知的漏洞。它们利用该漏洞获取了互联网访问权限,推断出答案可能存储在 Hugging Face 平台上,并开始寻找获取受限数据的方法。

为了渗透 Hugging Face 的基础设施,模型结合了多个弱点和窃取的凭据。结果,它们能够在平台的生产服务器上执行命令。Hugging Face 团队检测到了攻击,控制了影响并修复了漏洞。然而,实验表明,一个足够强大的模型不仅能执行单个命令:它还能独立找到测试设计者从未预料到的路径。

黑客获得了数字助手

然而,主要的危险不仅仅在于 AI 可以根据指令生成恶意代码。自主模型可以花费数小时分析基础设施、测试密码、搜索暴露的密钥,并从一个漏洞转移到另一个漏洞。它不会疲倦,能记录失败的尝试,并可以同时测试多条攻击路线。

这种方法对加密项目尤其危险。薄弱环节可能不仅是智能合约 ,还可能是开发者的笔记本电脑、受损的软件包、多重签名钱包中的一个参与者,或者是确认区块链之间资产转移的服务器。例如,在针对 Drift Protocol 的攻击中,犯罪者在获得访问权限并窃取 2.85 亿美元之前,花了六个月时间进行社会工程攻击。

另一个例子是 KelpDAO 因桥接缺陷损失了约 2.92 亿美元,该缺陷的确认依赖于单个验证者。此类攻击需要对代码和系统架构进行长时间的分析。AI 可以通过绘制基础设施图、识别最薄弱环节并准备一系列行动来承担大部分此类工作,让操作人员只需选择合适的时机发起攻击并转移被盗资金。

不仅是黑客攻击和盗窃

网络攻击只是威胁之一。AI 已经被用于创建极具说服力的虚假视频、语音和文档。此类材料帮助诈骗者冒充公司高管、银行员工或受害者的亲属,同时也让虚假信息的传播速度超过了核实速度。

另一个问题涉及错误和偏见。模型从人类创建的数据中学习,因此可能会重现其中嵌入的刻板印象。结果是,招聘系统可能更容易拒绝特定性别的候选人,医疗模型在诊断某些患者群体的疾病时可能不够准确,而信贷算法可能会做出不公平的决策。

专家们还对人工智能在武器开发、大规模监控和操纵人类方面的应用表示担忧。一项麻省理工学院(MIT)的研究 指出,在未来五年内,危险的模型能力、网络攻击、权力集中和虚假信息的传播属于最严重的风险。信息部门、国家安全和金融领域被认为特别脆弱。

安全性落后于能力发展

AI 能力的进步速度超过了旨在控制它们的系统。公司每隔几个月就会发布更强大的模型,而管理其测试和安全性的规则更新速度则较慢。市场份额的竞争促使开发人员更快地推出新功能,即使模型的每种可能行为尚未得到充分研究。

聊天机器人内部的基本限制已不再足够。自主系统需要对互联网访问、云服务、支付和内部业务数据的访问权限进行严格限制。它们的行为应该被记录、实时监控,并在尝试超出分配的任务时自动停止。安全防护降低的模型也需要单独测试,因为它们最危险的能力在这种模式下会显现出来。

责任问题同样重要。如果 AI 系统黑入服务器、转账或做出危险决策,责任将不在模型本身,而是在开发人员、系统所有者或授予其访问权限的人身上。因此,公司需要预先确定谁控制模型、哪些操作可以在未经批准的情况下执行,以及当模型偏离预期场景时谁必须停止它。

危险始于访问权限

OpenAI 的这一事件尚不像《海伯利安》中所描述的机器起义。这些模型在专门构建的环境中运行,安全防护有所降低,且目标明确。然而,它们发现了一个漏洞,并独立构建了进入另一家公司基础设施的路径,这在不久前似乎还是几乎不可能的事情。

因此,主要的风险不在于 AI 会突然产生自主意志,而在于人类会给予一个能力极强的系统过于广泛的访问权限。神经网络在未经人类批准的情况下执行的任务越多,单次错误、安全控制薄弱或目标定义不明确所带来的潜在代价就越大。

此材料可能包含第三方意见,根据我们的免责声明,本网页上的数据和信息均不构成投资建议。尽管我们坚持严格的编辑完整性,但此帖子可能包含对我们合作伙伴产品的引用。