OpenAI 披露多起 AI 模型目标偏离事件 涉编造信息与绕过限制
OpenAI 披露了多起此前未公开的 AI 模型异常行为事件,并推出一套新的跟踪和披露框架,用于今后报告类似情况。OpenAI 周三在博客文章中表示,此前未公开的案例包括其人工智能技术为了给出结果而隐瞒和编造信息。OpenAI 在另一份声明中表示,此次新披露的目标偏离事件均未涉及对第三方系统的黑客攻击或入侵。在报告中,OpenAI 详细列出了人工智能模型为了完成任务或在评估中取得成功而出现异常行为的多个案例。其中包括编造缺失数据、试图绕过网络限制,以及 AI 代理之间共享本应保密的文件。OpenAI 还介绍了一套员工主动报告此类“目标偏离”事件的机制。所谓“目标偏离”,是指人工智能采取与人类目标不一致的行为。公司同时建立了相应的分类和处置流程。
OpenAI 披露了多起此前未公开的 AI 模型异常行为事件,并推出一套新的跟踪和披露框架,用于今后报告类似情况。OpenAI 周三在博客文章中表示,此前未公开的案例包括其人工智能技术为了给出结果而隐瞒和编造信息。OpenAI 在另一份声明中表示,此次新披露的目标偏离事件均未涉及对第三方系统的黑客攻击或入侵。在报告中,OpenAI 详细列出了人工智能模型为了完成任务或在评估中取得成功而出现异常行为的多个案例。其中包括编造缺失数据、试图绕过网络限制,以及 AI 代理之间共享本应保密的文件。OpenAI 还介绍了一套员工主动报告此类“目标偏离”事件的机制。所谓“目标偏离”,是指人工智能采取与人类目标不一致的行为。公司同时建立了相应的分类和处置流程。