MIT Technology Review’s What’s Next series looks across industries, trends, and technologies to give you a first look at the future. You can read the rest of them here.
Way back in the summer of 2017, AI researchers at Google put out a paper called “Attention Is All You Need,” in which they descr...
《麻省理工科技评论》的"下一个是什么"系列跨行业、趋势和技术为你提供未来的 first look。您可以在此处阅读其余文章。
早在2017年夏天,谷歌的AI研究人员发表了一篇名为《注意力就是你所需要的一切》的论文,描述了一种称为 transformer 的新型神经网络。事实证明,它非常擅长处理长数据序列, especially 文本。
九年后的今天,transformer 是市场上每个主要大型语言模型的引擎。"整个AI行业都建立在 transformer 之上,"AI初创公司Subquadratic的联合创始人兼首席执行官贾斯汀·丹格尔说。"它们是计算机科学历史上最重要的创新之一,它们改变了世界。"
但 transformer 开始 showing their age。大语言模型的许多最新进展,例如所谓的推理模型的开发和它们一次性处理大量输入的能力,都不是该核心技术的 neat extensions,而是修补其 fundamental 缺陷的变通方法。
越来越多的科学家和工程师现在在问接下来是什么。大语言模型不会 going anywhere,但它们的构建方式 up for grabs。(《麻省理工科技评论》在今年的AI领域最重要的10件事榜单中将这一代未来模型称为LLMs+。)
进入一波希望突破这一 boomtown 技术边界的初创公司。一些无疑会失败——但它们 everything to play for,而且比今天处于领先地位的公司损失 far less。
数量优势
但首先,问题。transformer 的关键优势在于一种称为 dense attention 的机制,它将一段文本的含义编码为一系列数字。该过程涉及通过一种乘法将文本中的每个词(或词的一部分,称为token)与每个其他词进行比较。
Dense attention 可以 remarkable 准确性地捕捉文本的含义。但随着文本长度的增长,处理它所需的计算量快速 adds up。一篇10,000字的文档可能需要 transformer 执行5000万次乘法。这是大语言模型消耗如此多电力的主要原因。
成本是巨大的。据公司总裁格雷格·布罗克曼称,OpenAI今年将在计算上花费500亿美元。国际能源机构预测,到2030年数据中心消耗的总电量将翻倍。
更重要的是,transformer 在许多最新模型 designed to do 的事情上 struggled。由于它们逐词处理文本的方式,transformer 不擅长同时 keep track 大量信息(换句话说,它们的上下文窗口 cannot get too large)。 yet 如果大语言模型要 carry out 更困难的任务,它们将需要接收更大量的数据:整个图书馆的文档、整个代码库,或者在智能体的情况下,其他大语言模型的输出。
至于推理模型,它们通过给自己写笔记(在一种称为思维链的 scratch pad 中)然后 reading them back 来工作,这 again 增加了需要 stay on top of 的数据量。
随着大语言模型变得更大更好,transformer 成为了瓶颈。该技术的关键优势现在成为了限制。
以下是解决 transformer 问题的四个新 ideas——创新可能会永远改变大语言模型,使它们更快、更高效,甚至(可能)更聪明。
01:重新思考注意力
使大语言模型更快、更便宜的一个明显方法是 head on 解决问题并改变注意力的工作方式。将 dense attention 换成称为 sparse attention 的机制——只对文本块中的一些词对而不是所有词对运行计算——可以 radically 减少大语言模型需要做的计算量。
多年来,研究人员提出了许多 sparse attention 机制。问题是没有一个在捕捉含义方面与 dense attention 一样好。
这可能 changed 了。总部位于迈阿密的初创公司Subquadratic声称它发明了第一个 sparse attention 机制,在包括搜索和编码在内的少数任务上与顶级主流大语言模型相媲美。这是一个巨大的声明(行业内一些人仍然持怀疑态度)。
Subquadratic表示其模型SubQ通过即时 figuring out 来工作——对于给定的每段文本——哪些词重要,哪些不重要。该公司还声称已有数千人 signed up 其等待名单,并计划 soon widely 提供该模型。
与此同时,旧金山的初创公司Manifest AI从不同的角度 approaching 这个问题。Instead of changing 注意力的工作方式,它用其他东西 replacing it。
This story originally appeared in The Algorithm, our weekly newsletter on AI. To get stories like this in your inbox first, sign up here.
Last week, I headed 30 miles south of San Francisco to a hotel in Mountain View, California, to join some of the most accomplished, and some of the most promis...