官方网站-首页官方网站-首页

国家高新技术企业
中股交挂牌企业 股权代码:200649
热线电话:400-8453-696
如何在基于Arm Neoverse平台的Google Axion处理器上构建RAG应用
发布时间 2025-04-28 16:00:02 作者 阅读 472次

【导语】在人工智能(AI)领域,如何确保聊天机器人提供准确且最新的答案一直是一大挑战。检索增强生成(RAG)技术应运而生,为解决这一问题提供了有效方案。本文将深入探讨RAG技术的性能优势,并分享如何在基于Arm Neoverse平(píng)台(tái)的(de)Google Axion处(chù)理(lǐ)器上构建RAG应用,以实现AI工作负载的优化。通过实际测试数据,我们将展示Google Axion处理器在提升RAG性能、降低成本方面的显著成效,为实时、动态AI应用提供有力支持。无论你是AI开发者还是对企业AI战略感兴趣的读者,本文都将为你带来有价值的见解和实践指导。

作者:Arm 基础设施事业部 AI 解决方案架构师 Na Li 等

你是否好奇如何防止人工智能 (AI) 聊天机器人给出过时或不准确的答案?检索增强生成 (Retrieval-Augmented Generation, RAG) 技术提供了一(yī)种(zhǒng)强(qiáng)大(dà)的(de)解(jiě)决(jué)方(fāng)案(àn),能(néng)够(gòu)显(xiǎn)著(zhe)提(tí)升(shēng)答(dá)案(àn)的(de)准(zhǔn)确(què)性(xìng)和(hé)相(xiāng)关性(xìng)。

本(běn)文将(jiāng)探(tàn)讨(tǎo) RAG 的(de)性(xìng)能(néng)优(yōu)势(shì),并(bìng)分(fēn)享(xiǎng)如(rú)何(hé)在(zài)基(jī)于(yú) Arm Neoverse 平(píng)台(tái)的(de) Google Axion 处(chù)理(lǐ)器(qì)上构建 RAG 应用,以优化 AI 工作负载。在本文的测试中,Google Axion 处理器相较于 x86 架构处理器,性能提升了 2.5 倍,并节省了 64% 的成本。Google Axion 处理器通过更好的 RAG 性能加速推理过程,从而实现更快的知识检索、更(gèng)低(dī)的(de)响(xiǎng)应延迟和更高效的 AI 推理,这对于实时、动态 AI 应用至关重要。

了解 RAG:高(gāo)效(xiào)的(de) AI 文本(běn)生(shēng)成(chéng)方(fāng)法(fǎ)

RAG 是一款主流 AI 框架(jià),能(néng)够(gòu)实(shí)时(shí)检(jiǎn)索(suǒ)相(xiāng)关外(wài)部(bù)知(zhī)识(shi),从(cóng)而(ér)提(tí)升(shēng)大(dà)语(yǔ)言(yán)模(mó)型(xíng) (LLM) 生(shēng)成(chéng)文本(běn)的(de)质(zhì)量(liàng)和(hé)相(xiāng)关性(xìng)。与(yǔ)仅(jǐn)依(yī)赖(lài)静(jìng)态(tài)预(yù)训(xun)练(liàn)数据集的方法不同,RAG 动态集成了最新外部资源信息,能够生成更精确且贴近上下文的输出结果。这使得 RAG 在实际应用场景中表现出色,例如客服聊天机器人、智能体工具和动态内容生成等场景。

何时选择 RAG 而非微调或重新训练?

基础 LLM 通过类似人类的文本生成功能彻底改变了 AI 领域,但(dàn)其(qí)有(yǒu)效(xiào)性(xìng)取(qǔ)决(jué)于(yú)模(mó)型(xíng)是(shì)否(fǒu)拥(yōng)有(yǒu)企(qǐ)业(yè)所(suǒ)需(xū)的(de)最(zuì)新(xīn)信(xìn)息。对经过预训练的 LLM 模型进行重新训练和微调是集成额外知识的两种常用方法。重新训练 LLM 是一个资源密集型的复杂过程;而微调则能够使用特定数据集对 LLM 进行训练,调整模型的权重,以更好地完成目标任务。不过,模型仍然需要定期重新部署,以保持与时俱进。

通常,在将 LLM 纳入 AI 战略时,必须评估 LLM 的能力和局限性。主要考虑因素包括:

训练数据集的局限性:对于训练数据集未包含的主题,LLM 可能难以提供准确或最新的信息。

资源需求高:重新训练这些大模型需要大量的算力和工程资源,使得频繁更新难以实施。

对内部知识的访问受到限制:由于企业的主要业务数据受到防火墙的保护,因此 LLM 无法通过定期重新训练纳入专有信息,这可能会限制 LLM 在企业内部使用时的相关性。

RAG 的优势

RAG 无需修改 LLM,只需利用外部数据源更新知识库,将动态信息检索与语言模型的生成能力相结合。如果你所在的领域知识经常变化,那么 RAG 是保持准确性和相关性,并减少 LLM 幻觉的理想解决方案。

RAG 的实际应用:对比分析

在以下所举的例子中,比较了通用 LLM(左)和经过 RAG(右)增强的聊天机器人。左图中,由于信息过时或缺乏特定领域的知识,聊天机器人难以准确回答用户的询问;而 RAG 增强型聊天机器人能够从上传的文件中检索最新信息,提供准确且相关的回复。

8f36d394-217d-11f0-9310-92fbcf53809c.jpg

图 1:通过 LLM 实现的聊天机器人(左)

和经过 RAG 增强的聊天机器人(右)

为何选择 Axion 来实现 RAG 解决方案

基于 Arm Neoverse 平台的 Google Axion 处理器为运行 LLM 的 AI 推理功能提供了理想平台,该处理器能够以高性能和高效率支持 RAG 应用的运行。

优化 AI 加速:基于 Neoverse 平台的 CPU 具有高吞吐量向量处理和矩阵乘法功能,这对于高效处理 RAG 至关重要。

云计算的效率和可扩展(zhǎn)性(xìng):基(jī)于(yú) Neoverse 平(píng)台(tái)的(de) CPU 可(kě)最(zuì)大(dà)限(xiàn)度(dù)地(de)提(tí)高(gāo)每(měi)瓦(wǎ)性(xìng)能(néng),在(zài)高(gāo)速(sù)处(chù)理(lǐ)和(hé)能(néng)效(xiào)之(zhī)间(jiān)取(qǔ)得(de)平(píng)衡(héng)。因(yīn)此(cǐ),特(tè)别(bié)适(shì)用于需要在云端快速推理并兼顾成本效益的 RAG 应用。基于 Neoverse 的处理器还可用于扩展 AI 工作负载,确保无缝集成各种 RAG 用例。

面向 AI 开发者的软件生态系统:对于希望在基于 Arm 架构的基础设施上利用最新 AI 功能的开发者,Arm Kleidi 技术能够显著提升 RAG 应用的性能和效率。Arm Kleidi 已经集成到 PyTorch、TensorFlow 和 llama.cpp 等开源 AI 和机器学习 (ML) 框架中,使开发者能够实现开箱即用的默认推理性能,而无需使用供应商插件或进行复杂的优化。

这些特性的结合带来了显著的性能提升,首个基于 Google Axion 的云虚拟机 C4A 与 x86 同类方案相比,大幅提升了基于 CPU 的 AI 推理和通(tōng)用(yòng)云(yún)工作负载的性能,使 C4A 虚拟机成为在 Google Cloud 上运行 RAG 应用的理想(xiǎng)选(xuǎn)择(zé)。

Google Axion 性能基准测试

使用 RAG 系统进行推理涉及两个关键阶段:信息检索和生成响应。

信息检索:系统搜索向量数据库,根据用户的查询找到(dào)相(xiāng)关内(nèi)容(róng)。

生(shēng)成(chéng)响(xiǎng)应(yīng):检(jiǎn)索(suǒ)到(dào)的(de)内(nèi)容(róng)与(yǔ)用(yòng)户(hù)查(chá)询(xún)相(xiāng)结(jié)合(hé),生(shēng)成(chéng)与(yǔ)上(shàng)下(xià)文相(xiāng)关的(de)准(zhǔn)确(què)回(huí)复(fù)。

一(yī)般(bān)来(lái)说(shuō),检(jiǎn)索(suǒ)速(sù)度(dù)取(qǔ)决(jué)于(yú)数(shù)据(jù)库(kù)的(de)大(dà)小(xiǎo)和(hé)搜(sōu)索(suǒ)算(suàn)法(fǎ)的(de)效(xiào)率。在基于 Neoverse 平台的 CPU 上运行时,经优化的算法可在几毫秒内返回结果。然后,将检索到的信息与用户的输入相结合,构建新的提示词,并将其发送给 LLM 进行推理和生成响应。相较于检索阶段,生成响应阶段耗时更长,RAG 系统的整体推理延迟在很大程度上受 LLM 推理速度的影响。

本次测试使用 llama.cpp 基准和 Llama 3.1 8B 模型(Q4_0 量化方案)评估了多个 Google Cloud 虚拟机的 RAG 推理性能。使用 48 个线程进行了所有测试,输入词元 (token) 大小为 2058,输出词元大小为 256。以下是测试配置:

Google Axion (C4A, Neoverse V2): 在 c4a-standard-48 实例上进行了评估。

Intel Xeon (C4, Emerald Rapids): 在 c4-standard-48 上进行了性能测试。

AMD EPYC (C3D, Genoa): 在启用 48 个核心的 c3d-standard-60 上进行了测试。

Axion 处理器实现更快处理与更高效率

推理性能根据提示词处理速度和词元生成速度来测定。图表 1 的基准测试结果表明,与当前一代 x86 实例相比,基于 Google Axion 的 C4A 虚拟机在提示词处理和词元生成方面实现了高达 2.5 倍的性能提升。

8f3dca50-217d-11f0-9310-92fbcf53809c.jpg

图表 1:运行 Llama 3.1 8B/Q4 模型时(shí),提(tí)示(shì)词处(chù)理(lǐ)(左(zuǒ))

和(hé)词元(yuán)生(shēng)成(chéng)(右(yòu))与(yǔ)当(dāng)前(qián)一(yī)代(dài) x86 实(shí)例(lì)的(de)性(xìng)能(néng)比(bǐ)较(jiào)

成本效益:降低 RAG 推理成本

为了评估推理任务的实例成本,还测量了从提交提示词到生成响应的延迟。有几个因素会影响延迟,包括检索速度、提示处理效率、词元生成速率、输入和输出词元大小以及用户批处理规模。由于信息检索延迟通常在毫秒级,与其他因素相比可以忽略不计,因此未纳入计算。批次大小选择为 1,以确保在单个用户级别进行公平(píng)的(de)比(bǐ)较(jiào)。为(wèi)了(le)与(yǔ)基(jī)准(zhǔn)测(cè)试(shì)保(bǎo)持(chí)一(yī)致(zhì),测(cè)试(shì)中(zhōng)将(jiāng)输(shū)入(rù)和(hé)输(shū)出(chū)词元(yuán)大(dà)小(xiǎo)分(fēn)别(bié)设(shè)置(zhì)为(wèi) 2048 和(hé) 256。首(shǒu)先(xiān)通(tōng)过(guò)提(tí)示(shì)词编(biān)码(mǎ)速(sù)度(dù)和(hé)词元(yuán)生(shēng)成(chéng)速(sù)度(dù)计(jì)算(suàn)提(tí)示(shì)词处(chù)理(lǐ)和(hé)词元(yuán)生(shēng)成(chéng)的(de)延(yán)迟(chí),然(rán)后(hòu)根(gēn)据(jù) Google Cloud 上(shàng)的(de)实(shí)例(lì)定(dìng)价(jià)图(tú)表(biǎo)[3]计(jì)算(suàn)每(měi)次(cì)请(qǐng)求(qiú)的(de)成本,再将这些数字归一化为所有三个实例的最大成本。

图表 2 中的结果表明,基于 Axion 的虚拟机可节省高达 64% 的成本,处理每次请求所需的成本仅为当前一代 x86 实例的三分之一左右。

8f4d955c-217d-11f0-9310-92fbcf53809c.jpg

图表 2:使用 RAG 处理推理请求的归一化成本对比注

注:成本计算基于截至 2025 年 3 月 5 日公布的实例定价,可参见

https://cloud.google.com/compute/vm-instance-pricing

快速入门:基于 Arm 平台构建 RAG 应用

以 Neoverse 平台为核心,Google Axion 赋能的实例能以更低的成本提供高性能,助力企业构建可扩展且高效的 RAG 应用,同时与 x86 方案相比显著降低了基础设施开支。

为了帮助开(kāi)发(fā)者(zhě)快(kuài)速(sù)入(rù)门(mén),Arm 开(kāi)发(fā)了(le)分(fēn)步(bù)演(yǎn)示(shì)和(hé) Learning Path 教(jiào)程(chéng),以(yǐ)便(biàn)开(kāi)发(fā)者(zhě)使(shǐ)用(yòng)自(zì)己(jǐ)选(xuǎn)择(zé)的(de) LLM 和(hé)数(shù)据(jù)源(yuán)构(gòu)建(jiàn)基(jī)本(běn)的(de) RAG 系统。

以下资源能够帮助刚接触 Arm 生态系统的开发者顺利踏上开发旅程:

通过 Arm Learning Path 迁移到 Axion:依照详细的指南和最佳实践,简化向 Axion 实例的迁移进程。

Arm Software Ecosystem Dashboard:及时了解 Arm 平台上支持的最新软件信息。

Arm 开发者中心:无论你是刚接触 Arm 平台,还是正在寻找资源来开发高性能软件解决方案,Arm 开发者中心应有尽有,可以帮助开发者构建更好的软件,为数十亿设备提供丰富的体验。在 Arm 不断壮大的全球开发者社区中,开发者可以访问资源、交流学习和提问探讨。

还等什么?即刻开启你的迁移之旅,利用 Arm Neoverse 平台释放云和 AI 工作负载的全部潜力!

服务热线
服务热线:
400-8453-696
  • 24小时服务热线:15966587632
  • 地址:郑州市金水区政七街13号院南楼5层516号
  • 厂区:河南郑州经济开发区(航海东路高速公路入口处)
  • 邮箱: 15966587632@163.com
二维码框
二维码
关注微信公众号
Copyright © 2016-2025 郑州机器人有限公司 备案号: 沪ICP备14051834号 网站地图