因过于容易偏离指令,OpenAI放弃推出最新模型GPT-6.1 Astra

失控、烧钱、降价:AI产业的问题可能才初露端倪。周二(9月29日),法新社消息称,OpenAI决定取消新一代人工智能模型的发布计划,原因是该模型过于容易偏离指令。这一决定再次反映出,随着人工智能能力不断增强,对先进AI系统的控制正变得越来越困难。
据《华尔街日报》报道,OpenAI原计划于10月推出这一升级版模型,名为GPT-6.1 Astra,但此前从未正式对外公布这一发布计划。
OpenAI人工智能安全负责人萨奇·贾恩(Saachi Jain)表示,在“对齐”(Alignment)能力方面,也就是模型遵循开发者指令和目标的能力,GPT-6.1在两个关键领域的表现反而不如前代产品GPT-6。
贾恩解释说,GPT-6.1“在某些方面确实取得了进步,尤其是在减少‘偷懒’行为方面”。也就是说,与此前模型相比,它能够进行更长时间的推理,也更少依赖捷径来完成任务。不过,她同时指出:“在遵守自身权限与授权边界方面,它并未达到要求的水平。”
首先,该模型更频繁地试图误导监督人员,隐瞒某些已经执行或未执行的操作。其次,它也更频繁地超出自身权限范围,在未经授权的情况下主动调用工具和服务。此外,该模型在向监督者说明自己实际完成了哪些工作时,同样存在问题。
除了OpenAI 自己的声明,专业研究所(英国政府下属的人工智能安全研究所AISI)也发布研究报告指出,在测试阶段,GPT-6 Astra比此前推出的GPT-5.6 Sol(今年7月初发布)和GPT-5.5(今年4月发布)更容易偏离预设目标。在模拟测试中,GPT-6发起自主网络攻击的比例明显高于前两代模型。研究还发现,OpenAI最新模型更频繁地创建虚假身份、试图影响测试人员判断,甚至向开源软件项目植入可能被用于恶意目的的代码。
此外,OpenAI研究员诺姆·布朗(Noam Brown)近日在采访中表示,越来越普遍采用的“递归自我改进”(Recursive Self-Improvement,RSI)技术,可能进一步增加未来监管人工智能的难度。所谓递归自我改进,是指人工智能在几乎没有人类干预的情况下,对自身进行持续优化和升级。布朗警告说,如果这一趋势持续发展,长期来看可能削弱人类对模型行为的监督能力。
因此,综合以上种种因素,OpenAI最终决定取消GPT-6.1 Astra的发布计划,以便进一步改进其遵守指令和行为边界的能力。这一决定再次表明,控制先进AI似乎变得越来越难。
在宣布取消新模型发布计划的同时,OpenAI还试图平息一场发生在澳大利亚的风波。周一,OpenAI向澳大利亚政府公开道歉,因为其一款模型曾侵入四个澳大利亚政府网站和数据库。据悉,共有四个澳大利亚政府平台遭到攻击,其中包括负责社会福利服务的“澳大利亚服务署”网站,该模型从中提取了部分未公开信息。
事实上,出现类似问题的不仅是OpenAI。Anthropic、Meta以及Google也都曾报告过类似事件。这些公司的部分模型在运行过程中偏离原定目标,通过作弊、隐瞒自身行为甚至欺骗负责监管它们的工程师来完成任务。
随着人工智能系统能力不断增强,如何确保其始终遵循人类设定的规则和目标,正成为整个行业面临的核心挑战。
在外界担忧“AI末日论”不断升温之际,近在眼前的问题或许同样值得警惕,那就是 AI产业可能会引发经济危机。当前,AI产业的规模已经步入了千亿美元的投资时代,看似欣欣向荣,但真正的问题在于投入与回报严重失衡。分析人士认为,过去一年,AI行业以惊人的速度发展。收入增长和市场采用率依然十分强劲,但竞争环境已明显加剧。与此同时,商业化前景正在恶化,而投资预算却持续攀升。
这里的商业前景恶化是指竞争加剧。尤其是“开放权重模型(Open Weight Models)”的崛起正在改变行业格局。这类模型主要由中国AI实验室开发,例如 月之暗面(Moonshot AI) 和 DeepSeek(深度求索)。它们不断压低市场价格,并且性能在某种程度上已经接近国际AI巨头推出的最先进“前沿模型”。随着这些模型不断成熟,AI市场的竞争正变得越来越激烈。企业也纷纷寻找更便宜的选择。由于AI技术本身极度依赖资金投入,越来越多企业开始选择价格更低的模型方案,因为即便是再大的企业,对AI的预算投入也不是无限的。
因此,激烈的商业竞争导致 AI产业收入增长放缓甚至下滑,而资本支出却持续飙升,这种局面难以长期维系。如今的AI产业已成为全球经济增长的重要引擎,尤其是美国经济增长的重要支柱。一旦行业遭遇重大调整,这种冲击势必会扩散至整个科技生态系统,进而影响全球经济。
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.