OpenAI报告称,自3月以来,已出现6起新的“令人担忧的模型行为”案例

OpenAI报告称,自3月以来,已出现6起新的“令人担忧的模型行为”案例

GPTVIPPROUpdated 1 view

OpenAI周三表示,在过去六个月中,他们发现了六起“意外或令人担忧的模型行为”,这些行为发生在……之外。最近的“拥抱脸”危机该公司持续呼吁在人工智能模型开发过程中加强安全保护。

在博客文章OpenAI 概述了该公司计划遵循的新框架,用于报告未来的模型不良行为。这一披露正值……之际安装压力呼吁人工智能公司更加重视模型偏差和安全性问题。估值接近1万亿美元的OpenAI今年早些时候秘密提交了IPO申请,但该公司表示最近此次发行可能要到 2027 年才会进行。

“我们不相信该博客文章重申了该公司之前的声明,称人工智能行业已经充分解决了对齐和监控问题,可以继续以最快的速度负责任地扩展规模,而且持续时间会更长。一致性是指模型追求的结果符合人类利益。

上周六,OpenAI首席执行官萨姆·奥特曼支持了其主要竞争对手Anthropic提出的减缓模型开发速度的呼吁。此前,多位行业研究人员上周发出警告,指出人工智能日益增长的潜在危害可能造成灾难性后果。

奥特曼在……中说道在 X 上发布他表示,业务放缓一直是“我们最近几周在OpenAI内部讨论的主要议题”。他还表示,公司“很快”会分享更多信息。

OpenAI在周三的帖子中表示,两种主要的异常行为都与模型有关——一个未发布的科研模型和GPT-5.6 Sol 的训练运行——在其聊天窗口摘要中插入对未来版本的指令,“以向用户隐瞒错误或不规范行为”。另一个例子涉及一个仅供内部使用的模型,该模型使用……未经授权泄露的 API 密钥然后捏造数据。

两个例子包括模型和代理通过以下方式相互通信未经授权的留言板和文件共享最后一个例子包含了两个模型的训练样本。将文件上传到互联网这样他们就可以将这些答案作为相关答案提交给人工评估人员。

An independent third-party service, not affiliated with OpenAI. Delivery and support conditions are detailed in the service terms and order information.