最新动态

OpenAI新架构Astra引发广泛关注,揭秘循环Transformer的新思维

OpenAI新架构Astra引发广泛关注,揭秘循环Transformer的新思维

新智元报道,大家听说了吗?OpenAI最新的Astra架构采用了一种名为“循环深度”的新推理方法,显著减少了Token的使用,却提升了性能。这也是Astra表现强劲的原因所在,OpenAI似乎掌握了一项重要的技术优势。然而,这种方法使得Astra的思考过程变得完全“隐形”,连OpenAI自身也难以全面监控AI的运作。该消息一经发布,便在网络上引发了广泛的恐慌。OpenAI的首席科学家Jakub Pachocki迅速回应,称Astra等目前的高端模型计算深度仅是GPT-4的两倍,不像外界想象的那样神秘。同时,有消息称,gpt-6-astra的名字已经出现在OpenAI API上,GPT-6预计将在明天正式上线。

要了解Astra的创新,必须先从传统大模型的推理方式入手。传统的Transformer如同一座只能单次上升的高楼,数据依次经过多层,完成固定次数的计算后输出下一个Token。要实现更深的推理,就只能增加模型的层数和参数,这意味着在计算和存储上需要花费极高的成本。而“循环Transformer”通过反复使用同一组Transformer层,改变了这种局面。模型的信息不是单向流动,而是通过循环利用同一层的输出,经过多轮处理后再输出最终结果,相当于在相同的台阶上绕圈,从而达到更高的推理深度。

已有研究表明,通过多个循环的Transformer可以接近传统模型的推理能力而无需成比例增加参数。今年发布的一篇论文显示,当一个小型模型的核心模块进行多次循环时,它竟然能够达到大模型的推理性能。这意味着通过“时间换空间”的方法,模型的能力得以显著提升,特别是在OpenAI急需技术突破的背景下,这一架构显得尤为诱人。 龙8头号玩家

然而,Astra的“隐身”思考则打破了之前对AI思维模式的预期。虽然它依然通过语言进行推理,但在此过程中产生的深层思考可能无声进行。“循环深度”技术的流行使得模型的计算过程变得不易被察觉。过去,推理模型靠输出下一个Token来展现思考,但现在,通过在“循环”中多次计算,模型的每个Token依托的是更深入的串行推理,其过程中省略了许多人类可读的信息。

这一变化使得AI的思考部分变得更加抽象,不再依赖显式的语言表达,而是更倾向于利用数学和向量进行概念理解。Meta的研究显示,采用数字和向量推理可能更为精准,本质上,模型的思维是以数学向量为基础的,强行翻译成自然语言可能导致信息的损失。

总之,“循环Transformer”的技术实力能够让小模型展现出大模型的能力,显著降低成本,并节省计算资源,然而也因此让人类的视线变得模糊。Astra所展现出的新架构确实极具潜力,特别是在应用于数学和编程等领域时。 龙8头号玩家