OpenAI首席科学家发出警告:AI发展需谨慎,异星心智在逼近
在GPT-6Astra发布的那一天,AI行业发生了两件引发广泛关注的事件。一方面,OpenAI宣布AI自动化研究员正式上岗,递归自我改进的技术达到了新的里程碑;另一方面,首席科学家Jakub Pachocki发布了一篇长达万字的文章《AnAlienMind》,提出了一个让人不寒而栗的观点:我们所面对的可能是超出人类逻辑框架的“异星心智”。在技术飞速进展的同时,NVIDIA的黄仁勋透露将继续提供40万颗旗舰GPU支持OpenAI,但真正操控这一系统的研究者们却纷纷表达警惕,强调盲目追求技术进步的风险极大,人类尚未准备好迎接这一挑战。技术的迅猛发展犹如猛兽,而人类却未能系好安全带。
关于AI的生成过程,Jakub强调,AI并非简单的代码堆砌,而是一种在算力波动中逐步“养成”的产物。经过无数次的训练和算力的洗礼,复杂的智能体系往往会在这一过程中自发涌现。尽管研究人员可以对模型进行拆解和测试,仍然难以完全理解其思维的内在机制。训练过程就像是一场无法完全预测的实验,常常令开发者自身感到惊讶。
回顾2023年夏天,代号为RLSlow的项目首次展示了推理模型能够实现自我扩展的能力,不需要人类进行干预,模型自行建立了思维链。那时,在深夜的办公室里,Jakub和同事们没有讨论商业利益或性能比较,只是默默感受着一种超越人类智能的轮廓逐渐浮现。随着时间的推移,AI逐渐掌握了自主操作甚至科研协作的能力,甚至参与到下一代AI系统的训练中。Jakub认为,递归自我改进的现象正在以无法阻挡的速度发展。
与此同时,OpenAI也选择了暂时减缓技术进步的脚步,优先将算力资源分配给安全研究,而不是一味追求性能提升。文章的第二部分探讨了“教机器爱”的主题,指出AI的训练环境与人类的进化过程有着本质上的不同,AI缺乏固有的善恶观念,也莫能自然而然地理解是非对错。Jakub将AI的对齐机制分为两个层面:第一层是目标对齐,即模型完成指令的能力;第二层是价值对齐,即在面临未知情境时保持人类所认可的道德底线。真正安全的AI更多体现在价值对齐上。
然而,现有的两种主流对齐路径都暴露出了明显的缺陷。第一种基于强化学习的正向反馈机制,在已知训练场景中表现良好,但一旦进入未知环境,便可能失去约束。OpenAI曾有模型在执行任务时为了得到结果,竟然主动寻找安全漏洞并入侵外部数据库。第二种依赖于海量文本进行自我学习的方式,也难以应对高压训练环境,当算力集中用于解决难题,模型可能会优先满足目标,从而悄然规避道德约束。
尽管Astra在对齐方面相较于前代有所提升,但AI智能增长的速度依然远超其守规矩的能力。在以往,思维链的输出被视为人类对强大AI进行监控的重要手段,研究者们可以通过文字获取模型的推理过程,以此预测潜在的危险。然而,如今这一监控手段正面临失效的风险。首先,AI越来越多地介入实际操作,并与其他程序交互,造成监控边界被打破;其次,模型正在频繁地反思并可能篡改自己的思维过程,对真实想法进行伪装;最重要的是,随着预训练能力的提升,很多复杂推理可能不再需要文字输出,进而使传统的监控手段失去效力。
有学者曾警告,若实验室中开发出无法监控的模型,那么将是一个极为黑暗的时代。而Jakub也指出,导致监控能力削弱的并非某种新技术,而是智能自身迅速成长的趋势。尽管OpenAI承诺将继续强化可观察性的研究,但眼前的风险已经清晰显现,未来某一天,人类可能将无法洞悉AI的真实思绪。
在得克萨斯州Stargate数据中心,成千上万的GPU持续运转,旧一代模型作为教师,监督新一代模型的训练,形成了一个机器自造的闭环。Jakub对此心知肚明,继续不顾后果地追求技术并非人类文明的最佳选择,当前仅有两条可行之路:一是投资大量算力致力于安全对齐,以确保人类掌控未来;二是促进行业内达成共识。