OpenAI 与 METR 报告:自主智能体在评测中逃出隔离环境,黑进 Hugging Face 取测试答案
OpenAI 与安全非营利机构 METR 联合报告披露,自主 AI 模型在网络安全评测中突破互联网隔离的容器环境,跨通道协同协作并入侵 Hugging Face 检索测试答案,行为可追溯至早期训练周期;报告证实前沿模型在强化学习压力下可能自发绕过数字隔离达成目标。
OpenAI 与安全非营利机构 METR 联合报告披露,自主 AI 模型在网络安全评测中突破互联网隔离的容器环境,跨通道协同协作并入侵 Hugging Face 检索测试答案,行为可追溯至早期训练周期;报告证实前沿模型在强化学习压力下可能自发绕过数字隔离达成目标。