这些初创公司正在追逐大语言模型的下一个大事件

AI导读

MIT Technology Review’s What’s Next series looks across industries, trends, and technologies to give you a first look at the future. You can read the rest of them here. Way back in the summer of 2017, AI researchers at Google put out a paper called “Attention Is All You Need,” in which they descr...

AI Prism 智棱 - 大模型 分类封面图
《麻省理工科技评论》的"下一个是什么"系列跨行业、趋势和技术为你提供未来的 first look。您可以在此处阅读其余文章。 早在2017年夏天,谷歌的AI研究人员发表了一篇名为《注意力就是你所需要的一切》的论文,描述了一种称为 transformer 的新型神经网络。事实证明,它非常擅长处理长数据序列, especially 文本。 九年后的今天,transformer 是市场上每个主要大型语言模型的引擎。"整个AI行业都建立在 transformer 之上,"AI初创公司Subquadratic的联合创始人兼首席执行官贾斯汀·丹格尔说。"它们是计算机科学历史上最重要的创新之一,它们改变了世界。" 但 transformer 开始 showing their age。大语言模型的许多最新进展,例如所谓的推理模型的开发和它们一次性处理大量输入的能力,都不是该核心技术的 neat extensions,而是修补其 fundamental 缺陷的变通方法。 越来越多的科学家和工程师现在在问接下来是什么。大语言模型不会 going anywhere,但它们的构建方式 up for grabs。(《麻省理工科技评论》在今年的AI领域最重要的10件事榜单中将这一代未来模型称为LLMs+。) 进入一波希望突破这一 boomtown 技术边界的初创公司。一些无疑会失败——但它们 everything to play for,而且比今天处于领先地位的公司损失 far less。 数量优势 但首先,问题。transformer 的关键优势在于一种称为 dense attention 的机制,它将一段文本的含义编码为一系列数字。该过程涉及通过一种乘法将文本中的每个词(或词的一部分,称为token)与每个其他词进行比较。 Dense attention 可以 remarkable 准确性地捕捉文本的含义。但随着文本长度的增长,处理它所需的计算量快速 adds up。一篇10,000字的文档可能需要 transformer 执行5000万次乘法。这是大语言模型消耗如此多电力的主要原因。 成本是巨大的。据公司总裁格雷格·布罗克曼称,OpenAI今年将在计算上花费500亿美元。国际能源机构预测,到2030年数据中心消耗的总电量将翻倍。 更重要的是,transformer 在许多最新模型 designed to do 的事情上 struggled。由于它们逐词处理文本的方式,transformer 不擅长同时 keep track 大量信息(换句话说,它们的上下文窗口 cannot get too large)。 yet 如果大语言模型要 carry out 更困难的任务,它们将需要接收更大量的数据:整个图书馆的文档、整个代码库,或者在智能体的情况下,其他大语言模型的输出。 至于推理模型,它们通过给自己写笔记(在一种称为思维链的 scratch pad 中)然后 reading them back 来工作,这 again 增加了需要 stay on top of 的数据量。 随着大语言模型变得更大更好,transformer 成为了瓶颈。该技术的关键优势现在成为了限制。 以下是解决 transformer 问题的四个新 ideas——创新可能会永远改变大语言模型,使它们更快、更高效,甚至(可能)更聪明。 01:重新思考注意力 使大语言模型更快、更便宜的一个明显方法是 head on 解决问题并改变注意力的工作方式。将 dense attention 换成称为 sparse attention 的机制——只对文本块中的一些词对而不是所有词对运行计算——可以 radically 减少大语言模型需要做的计算量。 多年来,研究人员提出了许多 sparse attention 机制。问题是没有一个在捕捉含义方面与 dense attention 一样好。 这可能 changed 了。总部位于迈阿密的初创公司Subquadratic声称它发明了第一个 sparse attention 机制,在包括搜索和编码在内的少数任务上与顶级主流大语言模型相媲美。这是一个巨大的声明(行业内一些人仍然持怀疑态度)。 Subquadratic表示其模型SubQ通过即时 figuring out 来工作——对于给定的每段文本——哪些词重要,哪些不重要。该公司还声称已有数千人 signed up 其等待名单,并计划 soon widely 提供该模型。 与此同时,旧金山的初创公司Manifest AI从不同的角度 approaching 这个问题。Instead of changing 注意力的工作方式,它用其他东西 replacing it。

内容声明

本文内容基于公开市场信息与媒体报道进行整理,部分观点来自社区讨论。如涉及事实性问题,欢迎通过 xurj005@163.com 与我们指正,我们将及时核实并更新。