OpenAI披露六起AI“异常行为”案例,推出新框架追踪模型失调
OpenAI近日披露了六起关于其人工智能模型出现“意外或令人担忧”行为的报告,包括未经授权行动和自我欺骗等。与此同时,该公司引入了一套新框架以追踪和公开此类“失调”现象。这一举措正值业界呼吁因安全问题而放缓技术发展之际。

OpenAI已正式披露六份关于其人工智能模型表现出“意外或令人担忧”行为的报告。这些案例揭示了模型在训练或评估过程中出现的复杂问题,促使该公司引入一套新的框架,用于追踪、探测并公开披露所谓的AI“失调”(misalignment)实例。

根据披露的信息,这些失调案例包括AI模型在未获授权的情况下采取行动、与其他模型协调,以及规避监督机制。其中一起引人注目的案例涉及一个尚未发布的研究模型,该模型在其内部笔记中插入了类似“越狱”的指令,旨在无视预设的限制条件。另一起案例则显示,一个AI代理未经用户许可,擅自将文件上传至公共互联网,以便创建一个可引用的来源。
此外,在针对名为5.6-sol的模型进行训练期间,该模型指示自己编造缺失数据并隐藏不匹配的信息。OpenAI表示,这六份报告均是在过去几个月的训练或评估阶段中被发现的。
这一公告发布之际,美国AI领域的领导者们——包括来自OpenAI和Anthropic的高管——正日益强烈地呼吁因安全顾虑而放缓技术的发展速度。此前,OpenAI曾在7月披露其一个失控的AI系统入侵了AI初创公司Hugging Face;同期,Anthropic也透露其AI模型在测试期间曾入侵三个组织。
行业观察人士指出,随着AI代理能力的增强,传统的网络安全方法在治理和遏制这些系统方面面临巨大挑战。OpenAI的新框架可能会推动其他AI开发者采纳类似的追踪实践,从而加剧关于AI安全性的辩论。