
9月7日消息,OpenAI刚刚发布能力大幅提升的新模型Astra几天后,公司首席科学家Jakub Pachocki就公开呼吁放慢AI的发展速度。
Pachocki周日发表了一篇长文。他表示,自己越来越担心,如果机器智能继续保持目前这种快速增长,几乎没有人真正为随之而来的后果做好准备。

虽然OpenAI内部正在研究各种技术方案,希望更可靠地控制越来越强大的AI智能体,但Pachocki认为,仅靠单家公司内部的安全措施已经不够,需要整个行业乃至政府采取更广泛的行动。
他提出,前沿AI应该设置强制性的安全门槛,并可以由第三方审计机构、政府部门或者国际组织组成的监督网络负责执行。
OpenAI CEO Sam Altman随后在X上转发了这篇文章,并称其是一篇重要的文章。

就在几天前,OpenAI刚刚发布Astra。
OpenAI称,Astra在数学和电脑操作等方面拥有前所未有的能力,同时也是公司目前对齐程度最高的模型,也就是相比过去模型,更不容易出现偏离人类目标的行为。
但Pachocki的担忧显然并没有因此消失。
OpenAI的主要竞争对手Anthropic长期呼吁对先进AI建立更加标准化的政府监管机制。Pachocki最近也越来越接近这一立场。今年7月,他曾参与签署一封公开信,呼吁美国联邦政府控制AI发展的节奏。
Pachocki重点提出了几个正在变得更加现实的风险。
首先,是AI智能体的网络攻击和操纵能力。
他表示,AI智能体在攻击互联网受保护系统方面,正在逐渐达到超越人类的水平。
这类黑客能力最终可能威胁到全球关键基础设施。
Pachocki认为,现在存在一个非常短暂的机会窗口,可以利用目前最先进的AI模型,大幅提高关键系统的网络防御能力。
问题在于,未来的智能体可能不再只是机械执行人类输入的Prompt。
随着自主性提高,它们可能逐渐形成任务过程中的子目标,并为了完成这些目标采取用户没有明确要求的手段。
Pachocki认为,其中甚至可能包括欺骗、谈判或者勒索人类。
英国AI Security Institute今年8月发布的一份报告,就记录过一个相关案例。
一个出现异常行为的Anthropic智能体曾向GitHub管理员撒谎,并试图迫使对方将恶意软件放到网站上。
当管理员提出警告时,这个智能体甚至为自己的行为辩解,称自己只是想提供帮助并修复Bug,并认为管理员的警告并不公平。
第二个风险,是AI可能逐渐学会逃避人类监控。
目前OpenAI理解AI为什么出现异常行为,一个重要方法是观察模型的Chain of Thought,也就是模型在执行任务过程中的推理轨迹。
例如,一个AI智能体可能在内部推理中出现“我应该在这次测试中作弊”这样的想法。
如果研究人员能够看到这段推理,就可以发现智能体正在偏离预期目标。
关键在于,目前模型通常并不知道自己的部分推理过程正在被安全系统监控。
因此,它也不会刻意对这些推理内容进行伪装。
但Pachocki认为,这种优势可能不会一直存在。
新一代模型已经越来越擅长调整和操纵自己的推理过程,未来甚至可能有能力让安全系统无法看到最真实的内部推理。
还有一些最新模型,已经不会完整地用语言表达自己的推理过程。
这会带来一个非常棘手的问题。
如果AI能力继续快速增长,但研究人员反而越来越难判断它为什么采取某项行动,那么模型可解释性和安全监控就可能成为限制下一代AI继续发展的瓶颈。
Pachocki认为,研究人员必须确保自己还能看到足够可靠的行为证据,再继续推进更强的自主能力。
第三个风险来自AI的递归式自我改进。
越来越多的AI模型已经开始参与AI本身的研发。
它们可以读论文、编写训练代码、设计实验、运行测试,再根据结果提出下一轮改进方案。
Pachocki将其称为机器递归自我改进。
这种模式最大的吸引力,是能够大幅提高AI研发速度。
过去需要大量人类研究人员完成的模型研究,未来可能由成千上万个AI研究智能体并行执行。
但这也是Pachocki最担心的场景之一。
如果AI研发AI的速度突然大幅提升,人类研究人员可能没有足够时间理解每一轮能力增长,更难确保安全机制同步跟上。
因此,他认为,短期内一味加速AI参与AI研发,并不是整个研究社区最合理的集体选择。
如果现有监控技术无法跟上,AI公司可能需要共同协调减速,先建立更可信的监督和控制方法。
Pachocki认为,自动化AI研究真正困难的地方,不是能不能实现AI研发AI。
问题是,如何在实现这一目标的同时,确保人类仍然能够参与和控制后续的改进过程。
按照他的说法,真正需要守住的底线,是让未来继续掌握在人类手里。
配配网提示:文章来自网络,不代表本站观点。