果核Pulse
📡 X 信号

RunAnywhereAI发布开源前沿模型推理栈Wally 速度业内领先

来认识 Wally。它是我们为前沿开源模型打造的推理栈,目标是成为运行这些模型最快的平台。性能快照:GLM-5.3 Flash:380 tok/s。GLM-5.3 Max:790 tok/s;Qwen3.8-27B:485 tok/s;DeepSeek-V4.1 Flash:615 tok/s。
1/7

基准测试并不总能反映真实情况。所以我们使用同一个真实提示词、同一个 OpenCode 测试框架,同时在 Wally、@nebiusai 、@FireworksAI_HQ 和 @Zai_org 上运行了 GLM-5.3 Flash 构建任务。
Wally 的吞吐量比 Nebius 高 43%,是 Fireworks 的 3.1 倍,是 Z ai 的 4.5 倍。
2/7

可以把 Wally 接入你已经在使用的测试框架。现在已支持:
->Claude Code
->Claude Desktop
->OpenCode
->DeepSeek Harness
->Hermes
->OpenClaw

超高速开源模型推理,首字生成耗时不到 300 毫秒。新用户赠送 5 美元免费额度,把这句粘贴到你常用的代码代理中就能开始使用:“set up
3/7

我们在同一个真实提示词上对 Wally、Nebius、Fireworks 和 Z ai 进行了三次测试。以下是结果:
4/7

2026 年 9 月,Artificial Analysis 对各服务商的 GLM-5.3 Flash 进行了测试,结果如下:Nebius:313 tok/s。Fireworks:185 tok/s。模型厂商自有 API:72 tok/s。用相同方法测得的 Wally 结果是:380 tok/s。
5/7

Wally 上的每个模型都能以业界顶尖速度运行。这对实时应用来说至关重要:带 LLM 环的语音管线、代码代理、浏览器自动化、实时 copilots。可部署在我们的 GPU 上,也可部署在你的 GPU 上(BYOC/本地部署)
6/7

开始使用:把这句话粘贴到你最喜欢的代码代理中:“set up 或者使用 Curl 命令: curl -fsSL | sh
Windows: irm | iex
wally login
wally claude-code -m glm-5.3-flash

注册即得 5 美元免费额度,无需绑定信用卡。之后按 token 标准计费。
7/7

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

📬 订阅 果核Pulse

每日早间更新,不错过重要信号

▲ 回到顶部