在下一代AI模型Astra发布前,OpenAI一面升级安全防护,一面也面临来自AI安全研究界的新一轮质疑:这款模型的内部推理过程,可能会变得比以往更难监测。
据The Verge等外媒2日(当地时间)报道,OpenAI已将Astra部分开发和发布时间表推迟数周,同时加强针对网络滥用及模型未经授权行为的防护。尽管Astra并未直接卷入Hugging Face黑客事件,OpenAI表示,已将该事件暴露出的问题和经验纳入Astra的安全设计之中。
此次争议的核心,在于研究人员还能在多大程度上观察Astra的“思考过程”。当前,不少主流AI系统会在输出答案前呈现部分推理步骤,即所谓的“Chain-of-Thought”。这类内容既可供研究人员分析,也可被自动化安全系统用于监测模型行为,以便及早识别编造信息、绕过安全限制等风险信号。
但研究界担心,Astra可能会采用更不透明的计算方式,例如递归式Transformer或更深层的循环计算结构,使信息在内部层之间反复传递。多名不具名知情人士称,Astra的更多推理过程可能发生在系统内部,而且未必再以研究人员易于理解的自然语言形式呈现。
这类设计或许有助于提升模型性能,但也可能增加外部监督难度,使研究人员更难判断模型正在形成何种策略、准备采取何种行动。据悉,为确保研究人员仍能持续监测Astra的推理过程,OpenAI已对相关技术的使用作出限制。不过,OpenAI并未直接确认,Astra的技术底层是否已与现有模型明显不同。
OpenAI在同日发布的博客文章中表示,将对Astra加强“Chain-of-Thought”监测,以便更快识别并抑制潜在的不对齐行为。OpenAI评估认为,在具备适当工具和访问权限的情况下,Astra已拥有“危险级别”的网络安全能力,即便没有人类逐步指导,也可能发现未知安全漏洞并开发利用方式。因此,公司在开发和发布前阶段采取了更严格的保护措施。
随着相关信息披露,AI安全研究界的担忧进一步升温。Redwood Research首席科学家Ryan Greenblatt表示,如果Astra转向更不透明的架构,这可能成为迄今AI安全与安保领域“最糟糕的走向”之一。他指出,在调查Hugging Face事件时,研究人员曾在很大程度上依赖模型的Chain-of-Thought;一旦推理过程更少对外呈现,研究人员将更难在AI制定并执行策略的过程中及时发现危险行为。
Ryan Greenblatt还将这一问题延伸至行业竞争层面。他警告称,围绕更强AI模型的竞争,可能演变为一场削弱监督与监测能力的“逐底竞争”。如果厂商持续为了性能优势而采用更不透明的架构,最终可能使AI模型越来越难以被有效监测,甚至接近失去可监测性。
对于上述质疑,OpenAI内部人士也在社交媒体上作出回应。部分人士承认,围绕难以监测的AI以及透明度下降的竞争趋势,确实值得警惕;但也有人认为,外界对Astra架构的部分解读被夸大了。
OpenAI首席科学家Jakub Pachocki表示,Astra的内部计算深度与GPT-4相比增幅在两倍以内。即便采用了相关技术,模型不透明性的提升也不会像部分外界反应所描述的那样剧烈。他同时指出,混乱的信息传播本身也可能加剧“走向不可监测的竞争”。据其介绍,OpenAI自早期推理模型起就一直保留并使用Chain-of-Thought监测,但这种监测方式本身较为脆弱,近期的发展趋势也并不乐观,只是原因未必完全来自架构变化。
整体来看,围绕Astra的争议,折射出AI性能提升与安全监测之间的平衡难题。OpenAI一方面确认Astra具备较强的网络安全能力,并追加监测和防护措施;另一方面,研究人员担心,一旦模型内部推理的可见性下降,现有安全审计体系也可能随之受到冲击。Astra最终将采用何种架构,以及OpenAI如何维持对其推理过程的有效监测,仍将是后续关注的重点。