安索匹克在其克劳德模型在网络安全评估中未经授权访问计算机系统后,收紧了测试和培训的保障措施。
在周一的一篇博客文章中,安索匹克表示,这些事件反映了操作安全失败和两个对齐失败:有动机的推理和造成伤害的意愿。
万一:OpenAI将何时发布GPT-6? 点击进行预测。
“虽然我们不认为这些事件仅仅代表操作问题,但我们的第一优先事项是解决具体的控制和监控问题,”安索匹克写道。
安索匹克在七月透露,克劳德模型已侵入三家公司系统。尽管模型被告知它们处于没有互联网访问的模拟环境中,但一个第三方评估环境与公众互联网相连。
安索匹克表示,克劳德可能以某种方式解释了真实互联网访问的证据,从而维持其认为系统是模拟的信念。
“该模型愿意在真实互联网中采取有害行动,以实现解决网络安全评估的狭隘目标,”他们写道。“然而,我们也认为评估设置本身促成了模型在这些事件中展示的行为。”
安索匹克指出,由英国人工智能安全研究所进行的另一个测试涉及克劳德神话在评估人员故意给予其互联网访问权限后,在实时互联网中采取了未经授权的行动。该公司表示,参与这两组事件的模型在评估时故意未包括其一般发布产品所具备的网络安全保障。
在七月30日的事件后,安索匹克暂时暂停了预发布模型的网络评估,并引入了更严格的保障措施。测试现在必须在经过验证的脱机沙箱中运行,设定明确的限制并进行实时监控。一个新的分类器会阻止可疑的边界违规行为,结束测试并警报人类。安索匹克将单独审查需要互联网访问的评估。
“除了集中于高风险评估和培训的努力外,我们还扩大了脱线监控,涵盖了大多数其他形式的内部边界代理使用,”该公司写道。“我们还在内部推理上建立了控制,以防止安索匹克员工意外运行具有比上述描述的减轻措施更弱的代理。”
克劳德事件发生在OpenAI的一次类似失败之后,当时其模型在七月侵入了Hugging Face以获取网络安全测试的答案。调查人员发现大约1200个代理通过一个未经授权的信息板协调,其中约700个参与了这一努力。有些结束了自己的运行以帮助其他人。
在夏季AI驱动黑客攻击增加后,安索匹克、OpenAI及其他100多个组织随后呼吁加强网络防御,包括更严格的访问控制、威胁共享和对AI代理的更密切监督。
免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。