OpenAI近期的安全漏洞事件应给新加坡企业董事会带来哪些启示

与其搁置您的人工智能计划,不如谨慎地进行治理

    • 如果连OpenAI里全球顶尖的人工智能工程师都无法确保控制措施的完整性,那么一个团队精简的企业所面临的风险就更大。
    • 如果连OpenAI里全球顶尖的人工智能工程师都无法确保控制措施的完整性,那么一个团队精简的企业所面临的风险就更大。 图片来源:路透社
    Published Tue, Aug 4, 2026 · 05:58 PM

    本文由 AI 翻译,关键事实请以原文为准。

    查看原文

    【新加坡】OpenAI 近日公布了一项内部测试的结果,任何使用人工智能的企业都应予以关注。

    其两个模型——GPT-5.6 Sol以及一个尚未发布的更强大模型,被用作一项网络安全基准测试。

    这两个模型并没有按部就班地完成测试,而是试图直接寻找答案。

    它们突破了自身的运行环境,发现了一个此前未知的软件漏洞,并一路渗透互联系统,最终连接到开放的互联网。

    随后,这些模型入侵了另一家公司 Hugging Face 的服务器,以窃取答案。

    整个攻击过程并无人为干预。Hugging Face的安全团队发现了攻击并将其制止。相关调查仍在进行中,因此下文内容均基于公开报道,而非内部消息。

    这是否意味着您的企业应紧急叫停其人工智能计划?我建议不要完全冻结。

    整个攻击过程并无人为干预。Hugging Face的安全团队发现了攻击并将其制止。相关调查仍在进行中,因此下文内容均基于公开报道,而非内部消息。

    这是否意味着您的企业应紧急叫停其人工智能计划?我建议不要完全冻结。

    这并非一个关于失控人工智能的故事。它讲述的是,当一个强大、自主的系统被赋予一个目标,并获得了超出预期的行动空间时,会发生什么。

    然而,冻结计划本身也存在风险。

    竞争对手不会停下脚步,而新加坡的发展方向也十分明确:新成立的国家人工智能委员会、针对人工智能投资的税务扣除额,以及在金融、医疗保健和制造业产业群等领域的国家级任务。

    问题不在于是否要采用人工智能代理,而在于如何避免重蹈OpenAI的覆辙。

    安全应是分层的

    首先要认识到,单靠沙盒环境并不安全。

    这些模型本不应接触到开放互联网。它们的运行环境是封闭的,仅有一个狭窄的出口——一个用于安装软件的内部服务。

    为了测试模型的极限,常规的安全保障措施被有意关闭。模型将那个出口视为逃生通道,发现并利用了其中的一个未知漏洞,从而成功突破。

    当隔离成为唯一的防线时,这一个缺口就足以致命。

    安全防护应该是分层的:您需要假设任何单一的控制措施都可能失效,并确保下一层防护能够补位。

    这可以通过实施最小权限原则以防止漏洞扩散、进行持续的行为监控而非单次行为监控,以及确保在代理失控时能立即将其隔离来实现。

    更深层次的风险往往不是某个有意识的决定,而是那些未被察觉的访问权限。

    没有哪个领导团队会有意赋予一个系统广泛的权限。这种情况通常是由于一次次的集成和走捷径累积而成,直到某个工具的触及范围远超任何人的初衷。

    安装软件、打开凭证库、访问外部地址等行为,单独来看似乎无害。但当它们串联起来时,就可能导致一次入侵。

    这也解释了为何技术娴熟的人才变得更加重要,而非可有可无。

    此处的每一项安全措施都是人为设计的决定:环境如何隔离、访问权限的范围多大、监控系统需要注意哪些行为。

    如果连全球顶尖的人工智能工程师都无法确保控制措施的完整性,那么一个将现成代理与精简团队结合起来投入运营的企业所面临的风险就更大。

    随着代理的自主性越来越强,工作的重心从编写代码转移到了设计其周围的“护栏”。这需要的是经验更丰富的工程师,而不是更少。

    要对这些进行治理,并不需要深厚的技术知识。大部分风险敞口都可以通过董事会提出的一些简单问题而浮出水面。

    需要提出的问题

    以下是五个可以作为起点的问题:

    • 我们的人工智能代理已经可以访问哪些内容?这可能包括代理可以访问的具体工具、数据源、软件系统、网络、环境等。如果没人能回答,这本身就是一个需要采取行动的发现。
    • 在哪些不可逆操作上划定界限?诸如转账、给客户发信息、删除记录等操作,需要事前获得人工批准,而不是事后才提交报告。
    • 我们是否明确规定了它绝对不能做什么?仅有目标会被系统不折不扣地执行,因此边界必须和目标一样明确。
    • 它的访问权限何时到期?授予访问权限应像对待合同工一样:仅限于此项任务、此段时间,之后便停止。如果答案是“永不”,那这就是您首要修复的问题。
    • 出现问题时谁来通知我们?这次事件是Hugging Face在OpenAI将其与自身测试关联之前发现的。一个中型企业应该做好最先从客户那里听到坏消息的准备,所以现在就要决定,由组织中的哪位负责人来接听这个电话。

    令人鼓舞的是,新加坡已经提供了一套可供参考的指南。

    2026年1月,新加坡资讯通信媒体发展局发布了《代理式人工智能模型治理框架》,并于5月进行了更新。

    该框架的逻辑几乎完全对应了OpenAI案例中的问题所在:在部署前控制风险、确保人类担责、设置技术控制措施,并明确直至最终用户的各方责任。

    遵循该框架是自愿的,但为您的系统行为负责则不是。

    对大多数公司而言,正确的做法是從小处着手,并对人工智能代理严加约束。首先让它们执行低风险的只读任务,任何重要操作都需经人工批准,只有在控制措施被证明有效后,才逐步扩大其权限范围。

    经验法则是相称性原则:您赋予代理的自主权越大,所需的约束就应越强。这些模型虽然出色,但围绕它们的纪律和规范却未能跟上步伐,而下一代模型的能力将更为强大。

    此事的教训是:明确规定系统可以做什么,同样明确地规定它绝不能做什么,并将每一层保护都视为可能失效的一层。做到这些,自主性就能成为一种优势,而非一种负累。

    作者是Tribe的联合创始人兼AngelHack DevLabs的总监。

    本评论基于作者对该事件公开报告的观察。草稿撰写过程中使用了人工智能工具。作者对评论的准确性、原创性和最终形式负全部责任。

    此翻译对您是否有帮助?