果核Pulse
📡 X 信号

开源本地AI推理测试工具AA-AgentPerf-Local发布

我们宣布推出AA-AgentPerf-Local,这是我们针对本地AI模型的开源推理测试工具——它可以测试智能体AI在你自己的笔记本电脑或工作站上的运行速度,你还可以浏览我们的服务配置列表来规划下一次智能体部署。

要点:
➤ 我们开源了AA-AgentPerf-Local,它可以在笔记本电脑和工作站硬件上重放真实的智能体轨迹来测试推理性能
➤ 我们发布了针对NVIDIA DGX Spark、NVIDIA GeForce RTX 5090、AMD Ryzen AI Halo和MacBook Pro M5 Pro的初始测试结果
➤ 该工具和排行榜很快会扩展覆盖更多硬件、框架和模型,并且会随着新品发布持续更新

我们已经对手机和数据中心级硬件进行了推理性能基准测试,现在正在将覆盖范围扩展到笔记本电脑和工作站。除了托管显示热门模型和硬件组合结果的排行榜外,我们还开源了运行AA-AgentPerf-Local所需的所有代码和数据,以确保个人和公司能够运行自己的测试,为他们的本地AI服务决策提供参考。

AA-AgentPerf-Local可以重放真实的智能体会话。我们的默认工作负载是8个已记录的智能体任务,涵盖168个模型轮次。每个请求都携带到目前为止的完整对话,就像真实智能体那样,因此上下文会增长到约56K令牌。每一轮生成的令牌数都和记录的完全一致,因此每个系统执行的都是完全相同的工作。默认会跳过工具执行来隔离推理速度,但在对自己的系统进行基准测试时,你也可以重放记录的真实工具延迟或在CPU上实时运行工具调用。

发布之初,我们聚焦于单个智能体在能够利用整个系统的情况下可以实现的性能;我们计划未来扩展覆盖多智能体系统,以及智能体必须与其他常规进程并行运行的场景。

我们官方页面最初覆盖的硬件是:NVIDIA DGX Spark(128 GB)、AMD Ryzen AI Halo(128 GB)、MacBook Pro M5 Pro(64 GB)和NVIDIA GeForce RTX 5090(32 GB)。选择这些是为了覆盖一系列平台(CUDA、ROCm、Vulkan、Metal)、内存容量和带宽。我们未来会扩展特色硬件,包含x86(及其他)笔记本电脑、AI聚焦显卡如RTX PRO 6000 Blackwell等,为消费者提供不同硬件类型性能的全面视图。

发布之初的特色模型是:Qwen3.5-9B、Qwen3.8-27B、Qwen3.6-35B-A3B和Ling 3.0 Flash(124B / 5B active)。这些初始模型覆盖了一系列内存需求和密集/MoE架构,每个都在4位量化下进行基准测试,以反映真实的服务条件。我们特色模型的核心集合会随着新开放权重模型发布而随时间调整。除了特色模型外,AA-AgentPerf-Local能够对用户运行的任何OpenAI兼容推理服务器进行性能基准测试,这意味着任何模型和配置都可以在本地测试。

服务配置的选择很重要,运行时、量化和 speculative decoding 都会大幅改变结果。如果某个系统和模型组合有官方现成配置,我们就使用发布的配置。其他情况我们都开发了自己的配置。每个配置都使用 speculative decoding(MTP、DFlash或DSpark),全部14个配置都发布在仓库和我们网站的配置页面中。

初始结果:
➤ 完成时间与每个模型的活跃参数数量相关性最高:Qwen3.6-35B-A3B(3B active)在每个系统上都是最快的模型,例如比密集型的Qwen3.8-27B快2.5-3.3倍。不过,活跃参数不能说明全部问题,Ling 3.0 Flash(总124B,5B active)在所有能支持它的硬件上,完成时间仍然落后于Qwen3.5-9B(活跃参数数量几乎翻倍)。

➤ 对于所有能适配其32 GB显存的模型,GeForce RTX 5090是最快的系统,完成时间比其他系统快3.5倍以上。单用户解码受内存带宽影响很大,GeForce RTX 5090的带宽是1,792 GB/s,而统一内存系统的带宽是256-307 GB/s。

➤ DGX Spark和Ryzen AI Halo整体是相似的系统,拥有相同容量的统一内存、相近的内存带宽,发售价也同样是4000美元。在我们的默认轨迹集上,DGX Spark在四个模型中的三个上快1.4-1.7倍,Ryzen AI Halo仅在Qwen3.5-9B上与之打平。性能差距比它们7%的带宽差异大得多——Spark比Ryzen AI Halo拥有更强的低精度计算能力,因此预填充更快,同时它更成熟的CUDA软件可能也对更好的MoE和speculative decoding表现起到了作用。

➤ MacBook Pro(M5 Pro,64 GB,20核GPU)是目前唯一测试的笔记本电脑,表现出了有竞争力的结果,在Qwen3.6-35B-A3B和Qwen3.8-27B上的完成时间仅比Ryzen AI Halo慢2–9%(不过在Qwen3.5-9B上慢21%)。它在三个统一内存系统中拥有最高的内存带宽(307 GB/s),当前售价3700美元,是目前测试的系统中最低的。它的结果很可能受限于软件成熟度和可用于预填充的计算能力。

➤ 尽管智能体轨迹中73-93%的提示令牌来自KV缓存,但在预填充期间仅读取每一轮的新输入就占用了端到端完成时间的很大比例,例如Qwen3.8-27B占到了22-41%。这对于相对于内存带宽来说计算FLOP/s较低的系统影响尤其大,例如Ryzen AI Halo,MacBook Pro可能也属于这类(MacBook的FLOP/s未公开)。

➤ 目前所有表现最好的配置都实现了speculative decoding,例如它让Qwen3.8-27B的解码速度比带宽约束上限提升了约30-120%。

大多数硬件的当前市场价格相比发售价都有明显上涨。按当前市场价格,最初测试的四种硬件价格随端到端完成时间减少而上涨,MacBook Pro(M5 Pro,64 GB)目前是最便宜的,GeForce RTX 5090系统则贵得多。我们页面默认显示发售价,但允许输入自定义价格。我们在下方展示了我们对当前市场价格的最佳估计。

Qwen3.8-27B的解码速度在三个统一内存设备上大致相似,这三个设备的内存带宽相近,在256-307 GB/s之间。GeForce RTX 5090的解码速度比它们快5倍以上,这主要得益于它超过5倍更快的内存,带宽达到1,792 GB/s。

Qwen3.8-27B的预填充速度遵循与解码相似的规律,但DGX Spark不成比例的高计算/带宽比带来了更快的上下文读取速度。这在我们的智能体轨迹中很重要,因为即使每个提示的大部分都来自缓存(llama.cpp中约93%),每个会话仍然有约196K个新输入令牌,对应约31K个输出令牌。当工具返回一个大文件时,智能体在Halo上最多会暂停24秒,在MacBook上最多暂停39秒,而在GeForce RTX 5090上只需要约2秒。

随着相关新硬件和软件推出,AA-AgentPerf-Local和笔记本电脑与工作站页面会频繁更新。我们计划实现一系列额外功能,来更好地帮助用户最优运行本地AI:
➤ 覆盖更广泛的热门硬件和模型
➤ 更全面的本地AI部署配置仓库
➤ 更多自定义推理框架,比如目前正在测试的Inco Splash
➤ 用户提交结果排行榜
➤ 包含实时CPU工具调用的排行榜
➤ 多智能体场景

在你自己的硬件上试用AA-AgentPerf-Local:在此查看初始结果:

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

📬 订阅 果核Pulse

每日早间更新,不错过重要信号

▲ 回到顶部