我们正在分享 OpenAI 用于跟踪、调查和披露模型对齐不当情况的新框架。该框架设定了标准和……
我们正在分享 OpenAI 用于追踪、调查和披露模型错位情况的全新框架。
该框架设定了公开披露的标准和时间表,包括在尚未完全解释或缓解这些行为的情况下的披露时间。复杂案例可能需要更长的调查时间,或需要与第三方进行协调。
我们将优先披露能揭示新的错位机制、已知行为发生重大变化,或发现挑战安全或缓解假设的示例。
除了该框架外,我们还在过去六个月内的模型训练或评估过程中观察到的错位行为,发布了六份报告。
这只是一个起点。我们将通过经验和公开反馈来不断完善这一流程,并持续分享更多报告。
https://openai.com/index/model-misalignment-reporting-framework/

