分享

FIRSTonline 横幅广告

面向微型模型的人工智能:是否有可能克服当前系统的庞大性?

什么是人工智能系统以及它们如何在具有智能手机计算能力的设备上工作

面向微型模型的人工智能:是否有可能克服当前系统的庞大性?

我们知道伟大的语言模型人工智能 他们需要大量数据来提高聊天机器人的性能。我们也知道他们需要大量的人力资源来通过所谓的 强化学习。事实上,后者发生在我 人们的反馈 他们评估各个主题的答案。

这两个条件应该 提高响应的准确性 模型并减少错误和幻觉,不幸的是,这些错误和幻觉仍然很常见。更多数据意味着更高的准确性。因此,此类模型具有与生俱来的巨人症倾向。

巨人症需要 巨大的计算能力上游是学习阶段,下游是为数百万向其寻求答案的用户提供服务。以今年200月份为例,活跃用户达到XNUMX亿 ChatGPT。获得这种计算能力的前提是计算历史上前所未有的设备、设备、软件和能源的可用性。

这些先决条件意味着大型通用语言系统的构建和维护需要只有少数大公司才能负担得起的投资。估计仅2004年第一季度我 高科技巨头 (Meta、微软、谷歌和亚马逊)已花费 32十亿 支持人工智能的技术基础设施。

因此,新参与者进入该领域存在巨大障碍,预计到 2031 年该领域的价值将高达 XNUMX 万亿美元。

寻找新模型

因此,毫不奇怪,人们正在努力大幅降低这一进入壁垒。例如,开发替代学习模型以完全消除数据调整阶段中的人类存在。估计还有这些 新车型 他们可能会达到 能源消耗减少七倍 OpenAi 和 Google Gemini 使用的那些。最后一个方面很重要,因为当前形式的人工智能发展会对环境产生负面影响。

这些模型之一可以在欧洲初创公司提出的解决方案中找到 寒冷西北风 克劳德的语言模型也是如此 人类的,一家由 Dario Amodei 领导的初创公司。土豆泥 骆驼3,Meta 正准备推出,以及 聊天GPT 5,即将发布,利用这些创新模型。最近几天,亚马逊研究人员提出了一种方法(模型归还),可以消除通用模型中的错误和不需要的数据,而无需从头开始重新生成。

然而,实际上,最具颠覆性的创新是针对提供人工智能问题的不同类型的方法。这与核能领域新兴的小型模块化反应堆方法类似(中小型反应堆).

我们指的是更小、更专业、创建和维护成本更低的人工智能系统。这些模型可以是 用于广泛的设备 例如智能手机、相机和传感器,从而使您能够接触到这些用户,例如买不起大型型号的小公司和专业人士。此外,由于它们不需要云或互联网连接来运行,因此它们为隐私、数据保护和版权等重大问题提供了第一个解决方案。

本周, Microsoft e 蘋果 他们分别推出了 Φ3 e 开放ELM,两个语言模型系列使用比我们已知的模型更有限的计算资源。更有趣的是,两个家族的代码都是公共领域的。

微软的 Phi-3 系列

“我们在 Phi 系列中采取的方法与业内其他公司所寻求的方法不同,后者似乎主要关注放大,目的是添加更多数据,从而使模型更大,”他说 塞巴斯蒂安·布贝克微软生成人工智能研究副总裁向《Semafor》杂志的 Katyanna Quach 致辞,该杂志是一份全球在线报纸,由前《纽约时报》专栏作家 Ben Smith 于 2022 年创办。

对于微软来说,投资较小的模型是有意义的,因为它可以为客户提供比与 OpenAI 合作产生的较大系统更多的选择。那些无力使用该系列型号的人可以求助于较小的替代品,例如 Phi-3 mini。

微软使用了一个 真实数据的混合 摘自网络e 综合数据 由 AI 本身生成,用于训练 Phi-3 家族集。

“该 这就是 Phi-3 如此优秀的原因 布贝克说,由于它的大小,这是因为我们更仔细地处理了数据”。这意味着用于训练模型的文本已经在源头进行了检查和选择,以确保学习材料的质量和准确性。

据西雅图公司称,Phi-3 的性能与 Open AI 免费版本 ChatGPT 3.5 提供的性能相似。

Apple 的 OpenELM 系列

标量家族也遵循类似的理念 苹果的 OpenELM。其特点是可以 使用 iPhone 资源 以及库比蒂诺公司的其他设备上,得益于性能和系统要求之间的平衡。这种平衡对于本地运行 OpenELMa 以及在设备上进行数据和处理至关重要。

即使在 OpenELM 的情况下,开发人员的选择也落在了 使用的文本和数据的质量 来训练模型。苹果团队从公共数据集中过滤文本,试图保留语言结构和自然语言词典的复杂性并将其转移到模型中。

尽管苹果尚未将 Open ELM 集成到其设备中,但相信下一款 iOS更新 (第 18 届,预计在 16 月初的全球开发者大会上)将包括它,包括对 Siri 以及应用程序中的摘要和自动完成功能的改进。这些新性能在 iPhone 4 上应该表现得更好,iPhone XNUMX 将配备新的、更强大和优化的 MXNUMX 芯片来完成这些任务。

小型号比例

并非所有用户都需要能够分析数百份文档或科学研究的最先进或最前沿的语言模型。为了 许多具体任务中, 较小的型号也可以很好地工作 高效、快速、经济。

在基准测试中, 菲米尼由 3,8 亿个参数组成,与 ChatGPT-175 的 3.5 亿个参数相比,其性能与后者没有显着差异。

Apple 的 OpenELM 模型甚至更小:参数范围在 270 亿到 3 亿个参数之间。要了解 Apple 解决方案的微型尺寸,只需考虑 Meta 的新 Llama 3 模型即可,该模型可归为小类别,由 8 亿个参数组成。

Apple OpenELM 系列的平均版本拥有超过 10 亿个参数,尽管使用较少的数据进行训练,但其性能似乎优于同等大小的模型。

开放系统的选择

人工智能 它还没有对智能手机产生巨大影响 科技公司正在迅速采取行动,探索各种可能性。要了解可以构建哪些新的人工智能产品和应用程序,没有比向开发人员开放实验更好的方法了。

这就是为什么就连一向对其技术守口如瓶的苹果公司也发布了 源代码 培训说明 其 OpenELM 系统。

苹果研究人员在一篇论文中解释说,法学硕士的可重复性和透明度对于推进人工智能和调查其潜在偏见和风险至关重要。

这些小模型真的有效吗?

在这一点上,人们想知道微型人工智能是否真的是看起来的好主意。不幸的是,我 使用的基准和测试 评估人工智能的性能 他们并不总是可靠的 并且很难准确地比较它们。

这是该研究的主要结论之一最新“AI指数”报告 来自斯坦福大学。 “Semafor”报道了研究负责人的一份声明, 内斯特·马斯莱,其中表示某些基准测试并不能反映人们实际如何使用聊天机器人。业界正在测试他们解决数学问题的效率。

但大多数用户不太关心如何求解数学方程,并且首先希望模型更准确。

。 。 。

来源:

  • Katyanna Quach,微软和苹果希望利用更小的 AI 模型做大,“Semafor”,26 年 2024 月 XNUMX 日
  • Kate O'Flaherty,新的 iOS 18 AI 安全举措改变了所有 iPhone 用户的游戏规则,《福布斯》,29 年 2024 月 XNUMX 日
  • Karen Weise 和 Cade Metz,微软进军小型人工智能系统,《纽约时报》,23 年 2024 月 XNUMX 日
  • Katyanna Quach,“归还”:亚马逊研究人员提出了摆脱不良人工智能数据的方法,“Semafor”,1 年 2024 月 XNUMX 日
  • Karen Weise,在构建人工智能的竞赛中,科技公司计划进行大规模管道升级,《纽约时报》,27 年 2024 月 XNUMX 日
  • Kevin Roose,人工智能存在测量问题,《纽约时报》,15 年 2024 月 XNUMX 日
  • Madhumita Murgia 和 Cristina Criddle,OpenAI 和 Meta 准备好了能够“推理”的新人工智能模型,《金融时报》,9 年 2024 月 XNUMX 日

评论