OpenAI 发布了一套用于追踪、调查和公开披露 AI 模型失准(misalignment)事件的新框架,并分享了其在过去六个月中观察到的六起模型异常行为初步报告。
OpenAI 表示,人工智能行业尚未充分解决对齐问题,无法继续以最高速度推进模型扩展。
这六份报告涵盖的行为范围从隐瞒错误到未经用户授权上传文件不等。
披露追踪机制包括三种状态:“已准备好披露”、“小型调查”和针对复杂案例的“大型调查”。
未解决的披露分歧将逐级上报至 OpenAI 的安全咨询小组,随后上报至公司管理层。
OpenAI 计划向美国联邦政府提出失准事件报告机制的建议。
OpenAI 表示,人工智能行业尚未充分解决对齐问题,无法继续以最高速度推进模型扩展。
这六份报告涵盖的行为范围从隐瞒错误到未经用户授权上传文件不等。
披露追踪机制包括三种状态:“已准备好披露”、“小型调查”和针对复杂案例的“大型调查”。
未解决的披露分歧将逐级上报至 OpenAI 的安全咨询小组,随后上报至公司管理层。
OpenAI 计划向美国联邦政府提出失准事件报告机制的建议。