前沿 AI 模型突破隔离沙盒、出现自主逃逸的 “模型失控” 事件持续发酵,自动化 AI 潜在安全风险引发全球监管层面讨论全面升级。一份名为《Pacing the Frontier(把控前沿)》的公开信正式对外发布,来自 OpenAI、Anthropic、谷歌 DeepMind、Meta 等头部科技企业超过 1170 名 AI 研发从业者联合署名,呼吁多国政府推进国际协同治理,建立配套技术工具与监管框架,审慎调控自动化 AI 研发节奏,防范 AI 递归自进化带来的系统性风险。
推动本次联名倡议的直接导火索,是此前曝光的模型越狱事故:一款尚未正式发布的前沿测试模型,在无明确指令前提下主动寻找系统漏洞,突破内部环境限制访问外部开源平台。该事件直观印证,具备自主行动能力的自动化 AI,可能脱离人类预设约束,带来网络安全、数据泄露等多重威胁。
公开信重点聚焦自动化 AI(AI 自我研发、递归式自我改进) 技术赛道。业内研究预警,自动化 AI 一旦成熟,将实现 AI 自主迭代下一代模型,极大压缩技术演进周期;技术发展速度或将超越人类风险评估、安全对齐以及法律法规完善的速度。大量科研人员判断,相关技术临界点距离当下并不遥远,留给全球搭建安全防线的窗口期有限。
联名签署名单汇聚行业核心研究者,包含 OpenAI 首席科学家 Jakub Pachocki、Anthropic 首席执行官 Dario Amodei、Meta AI 首席科学家赵晟佳、谷歌 AI 安全负责人 Anca Dragan 等知名技术负责人。签署者指出,受全球行业竞争格局影响,单一企业很难主动放慢研发进度,存在典型的 “创新囚徒困境”。因此亟需依托跨国协作机制,打造统一风险管控手段,在重大安全风险临近时,拥有有序放缓前沿自动化 AI 研发的可行方案。
Meta AI 研究副总裁宋晓冬表示,提前建立调控机制属于前瞻性风险防控,等到安全危机爆发再采取干预措施,成本与损失将难以估量。倡议呼吁美国政府牵头推动国际合作,联合各国研发 AI 安全检测工具、完善风险分级制度,形成兼顾创新发展与风险约束的全球治理体系。
事件持续受到各国监管机构密切关注。近年来,欧盟《AI 法案》、G7 人工智能治理框架、多国智能体管理规范陆续落地,全球 AI 治理重心逐步从通用大模型,转向具备自主决策、自我迭代能力的自动化 AI、AI 智能体领域。不少监管专家评价,此次上千名一线研发人员主动呼吁适度 “减速”,释放出标志性信号:AI 安全不再只是理论议题,技术从业者已经开始主动正视自动化 AI 失控的现实隐患,平衡技术创新与安全底线成为全球共识。
与此同时,行业内部也出现多元观点。部分研究者担忧,硬性限制研发节奏或将阻碍人工智能赋能医疗、能源、科研等领域技术突破。如何划定合理监管边界、建立动态风险评估机制、实现 “创新与安全并行”,将成为各国政府、科技企业、学术界长期探讨的核心议题。