智能体AI或将推动企业级AI服务器架构重新设计

网易专栏6小时前发布 nxnqh
1 0 0

🤖 AI总结

主题

微软与大学合作提出新型AI服务器架构Agora,以应对智能体AI工作负载的挑战。

摘要

微软与大学研究揭示智能体AI基础设施瓶颈,提出Agora架构显著提升效率,建议企业采购工作流而非硬件。

关键信息

  • 1 智能体AI工作负载导致CPU和GPU利用率低,存在瞬时瓶颈。
  • 2 Agora架构通过动态资源分配和角色分离,提升CPU利用率30%,生成吞吐量82%,降低尾延迟2.5倍。
  • 3 企业应关注整体工作流效率而非单一处理器性能。

智能体AI或将推动企业级AI服务器架构重新设计

来自微软Azure与德克萨斯大学奥斯汀分校的研究人员指出,随着企业部署智能体AI,现有以GPU为核心的基础设施在执行多步骤AI工作流时效率不足,新一代AI服务器的需求正在浮现。

研究人员基于微软Azure云平台的生产遥测数据及主流开源智能体框架的实验结果发现,AI智能体在协调模型、工具与编排软件上所花费的时间,远超传统推理系统的预设。与独立的大语言模型请求不同,智能体应用以动态工作流的形式运行,任务在CPU、GPU与外部服务之间反复流转,暴露出当前服务器架构的效率瓶颈。

研究人员在论文中写道:”我们的研究表明,智能体的执行过程本质上是碎片化且异构的。每个请求会扩展为一个由大语言模型推理、工具调用和编排决策组成的工作流,并反复跨越CPU与GPU之间的边界。”

论文指出,这种执行模式使CPU处于应用关键路径上——编排软件与工具在宿主机上运行,而模型推理则在GPU上执行。研究人员认为,传统服务器架构与此类工作负载存在明显不匹配:碎片化执行导致CPU和GPU资源闲置,宿主侧不同软件角色的资源需求各异,多智能体并发运行还会增加协调开销。

研究人员通过CORAL框架进行的受控实验显示,单个工作负载扩展为580次大语言模型调用与552次工具调用交替执行,导致任务在两个处理器之间”来回切换数百次”。研究还发现,宿主CPU利用率在较长时间内维持低位,随后在工具执行密集期急剧攀升;GPU利用率则因工作流构成不同而差异显著,部分加速器处于饱和状态,另一些则处于空闲状态。

研究人员表示,这种碎片化执行模式导致CPU和GPU平均利用率偏低,同时又可能使任一处理器成为工作流关键路径上的”瞬时瓶颈”,令静态资源配置难以适应智能体工作负载。

Greyhound Research首席分析师Sanchit Vir Gogia表示,上述发现说明企业在评估智能体AI基础设施时,应采用不同于传统推理部署的标准。”智能体AI不是一个更大的聊天机器人,它是一个内嵌推理能力的分布式应用。各个组成部分并不陌生,但执行图是全新的。”他补充道:”GPU依然不可或缺,但它不再独占整个时钟周期。在超过27%的请求中,工具执行时间与推理时间相当甚至更长,平均利用率指标正在对基础设施团队产生误导。”

基于上述发现,研究人员提出了一种名为Agora的服务器架构。该架构能够动态重新分配CPU和GPU资源,将调度、编排与工具执行分离为专用宿主角色,并根据工作负载行为自适应调整资源分配。

研究人员在论文中写道:”Agora动态调配空闲CPU核心用于协同吞吐任务,同时保护智能体尾延迟免受工具执行峰值的影响。它还通过在每个GPU上部署更多智能体来超额订阅GPU内存,并预取下一个智能体的状态以隐藏交换延迟。为使硬件与异构角色相匹配,Agora按角色对核心进行池化,并采用亲和性感知调度来恢复局部性。这些技术在保持智能体尾延迟的同时,显著提升了CPU和GPU利用率及单服务器吞吐量。”

评估结果显示,Agora将宿主CPU利用率提升约30%,在低负载下恢复了协同工作负载约95%的独立吞吐量,通过工作负载整合释放了约三分之一的GPU,将生成吞吐量提升82%,并将尾延迟降低2.5倍。

Gogia表示,这些发现意味着基础设施采购的重心应从单个处理器转向整体AI工作流的执行效率。”CPU并非重回王座,而是王座本身正在消失。竞争优势正从单个处理器转移到异构服务器、机架与运行时作为一个整体系统协同运作。”他建议企业”采购工作流,而非采购硬件盒子”,并指出工作负载分析与调度优化所带来的收益,很可能超过单纯基于模型推理来规划基础设施规模。

Q&A

Q1:Agora服务器架构是什么?它解决了什么问题?

A:Agora是由微软Azure与德克萨斯大学奥斯汀分校研究人员提出的新型AI服务器架构,专为智能体AI工作负载设计。它通过动态重新分配CPU和GPU资源、将调度与工具执行分离为专用角色、以及自适应资源分配,解决了传统GPU中心架构在执行多步骤智能体工作流时CPU与GPU利用率低、出现瞬时瓶颈的问题。评估显示,Agora可将CPU利用率提升约30%、生成吞吐量提升82%、尾延迟降低2.5倍。

Q2:智能体AI工作负载为什么会导致现有服务器架构效率低下?

A:智能体AI的执行模式与传统大语言模型推理请求根本不同。每个请求会扩展为大语言模型推理、工具调用和编排决策交替进行的动态工作流,任务在CPU与GPU之间反复切换。实验显示,单个工作负载可产生580次大语言模型调用与552次工具调用交替执行。这种碎片化模式导致CPU和GPU平均利用率偏低,同时又可能在任意时刻成为关键路径上的瓶颈,使静态资源配置难以应对。

Q3:企业在部署智能体AI时应如何重新考量基础设施采购策略?

A:研究人员和分析师建议,企业应将评估重心从单个处理器性能转向整体AI工作流的执行效率。具体而言,应优先进行工作负载分析与调度优化,而非仅依据模型推理需求来规划基础设施规模。分析师Gogia指出,竞争优势正从单个处理器转移到异构服务器、机架与运行时的整体协同,企业应”采购工作流,而非采购硬件盒子”。

© 版权声明

相关文章