果核Pulse
📡 X 信号

土耳其开发者讨论:未来AI基础设施将走向分离

近日,@fatihguzeldev 和 @mertcobanov 在𝕏上讨论了未来AI基础设施的形态,话题延伸到了AI产业的分工变化。

当前我们使用ChatGPT、Claude这类头部AI服务商产品时,模型、硬件、基础设施、请求调度、缓存、推理和整个服务栈都由服务商一手包办,我们只是通过互联网发送请求,获得返回结果。我们实际上购买的不是单一模型,而是模型、算力、推理、服务打包后的整体方案。

这种模式在当前是合理的,头部大模型参数规模极大,权重不公开,要实现低延迟高吞吐量的服务本身就是一个巨大的基础设施难题。同时,模型开发企业也能掌控性能、安全和产品体验,打造面向消费者的完整产品。

但长期来看,这种一体化模式没有理由一直成为唯一解决方案,从现有数据来看也不具备可持续性,目前模式靠外部风投补贴,商业模式并不健康。Sam Altman曾在2025年初提到,定价200美元的ChatGPT Pro计划因为用户使用量超出预期,OpenAI正在亏损。尽管我们不知道订阅服务的真实成本,但可以推测实际成本很容易超过订阅费用。

固定订阅费和动态变化的推理成本之间天然存在矛盾。随着AI使用逐渐转向智能体,推理需求量也发生了变化。智能体的工作流程是推理、推理工具调用、再推理的循环,单用户的推理消耗量已经远多于几年前。

这种需求变化也让硬件领域出现新趋势。我们不能说GPU不适合AI推理,但训练和推理本质是不同的问题,二者的优化方向并不一样。推理更关注内存带宽、内存容量、KV缓存、延迟、批处理、每瓦生成token数量这些关键指标。

行业已经出现硬件层面的分化,谷歌今年推出的第八代TPU,首次将训练和推理拆分为两种不同架构:TPU 8t针对训练优化,TPU 8i针对低延迟推理优化。谷歌认为,智能体持续循环工作带来的现有基础设施效率问题,在当前规模下已经非常重要,因此专门为推理推出独立硬件是很明确的方向。

两人讨论后得出第一个结论:如果推理硬件未来会变得更便宜、高效、易用,推理就没有必要全部放在远程超大规模数据中心。Mert提出,未来我们可能会像现在家里装调制解调器、路由器一样,在家放置个人推理盒。这个说法听起来很合理:用户可以下载开源权重模型,让智能体全天在本地网络运行,数据保留在用户自己手里,即使没有互联网也能完成部分工作,也不需要为每个token向企业付费。

英伟达目前已经在测试名为“pair”的项目,能够把同一个家庭网络里的Mac、RTX、DGX Spark等多台设备聚合在一个本地推理端点后,把 incoming推理请求路由到合适的节点,各个设备作为独立推理节点工作。这意味着推理本地化已经有了初步实践。

但如果用户不想在家添置昂贵的推理设备,花几千美元买了加速器一天只用一小时,剩下时间设备闲置怎么办?另一种可能是在城市或者区域设立面向数千人共享的推理农场,大量独立工作负载汇聚到同一个基础设施,硬件利用率会高很多,请求可以批量处理,热门模型可以一直保留在内存里,相同前缀请求可以做缓存,请求可以按照缓存局部性路由,不同特性的工作比如预填充可以分配到不同的加速器池。

这些优化方向很多已经不是理论,很多做推理服务的企业已经在实践这些思路,比如Cerebras。因此,本地个人推理虽然合理,但并不是所有工作负载的最优经济方案,共享推理反而更符合经济逻辑。

现在已经有企业提供无服务器推理服务,用户可以按token使用开源模型;也有专属托管推理服务,用户可以带入自己的模型权重,在托管基础设施上运行服务,比如CoreWeave、Scaleway。现有数据中心的基础产品是存储、计算、网络,未来会不会出现专门的AI中心,核心产品就是推理能力?这些AI中心专门做一件事:帮用户把模型转换成最低成本、最高效率的token输出,用户可以选择任何可访问的模型,比如Qwen、Mistral、DeepSeek或者自己微调的模型,头部服务商也可以通过授权协议把推理卸载出去,分摊自身压力。

核心分歧在于:开发模型的企业和做模型推理的企业,没必要是同一家企业。现在的消费级AI大多是这种模式,云计算领域我们也早就习惯了分工:应用开发商、CPU设计商、服务器生产商、数据中心运营商、云服务商本来就不是同一家企业,因此AI也没必要一直保持一体化。

这种分工的雏形其实已经出现:AWS Bedrock已经把不同服务商的模型通过同一个推理界面提供给用户,支持跨区域推理,请求不会固定在单个区域,可以路由到合适的AWS区域算力。阿里巴巴也有模型工作室,除了通义千问之外,还提供DeepSeek、Moonshot等不同服务商的模型。这说明模型服务商和推理服务商已经是两个独立概念。

未来可能会形成这样的拓扑结构:用户家里有个人推理节点,城市或者ISP附近有推理节点,区域/国家级有大型共享AI中心,超大规模模型和高算力需求工作可以放在头部超大规模集群,所有这些节点都运行在公共互联网上。

当用户给智能体分配任务时,除了“选哪个模型”,还会多出一个问题:“在哪里推理?”总结个人文件可以在本地推理,需要并行计算的工作可以放在就近的推理农场,对延迟不敏感的大规模批量工作可以放在最便宜的地方,复杂的大规模推理需求就放在模型服务商自己的集群。路由选择不光看能力,还要结合成本、延迟、隐私等多个维度。

最终形态不会是单一解决方案,而是一个巨大的异构推理网络。部分算力属于用户自己,部分是共享算力,部分是预留算力,还有部分在全球另一端的集群里,智能体会根据需求在这些不同的推理节点之间切换。

接下来话题延伸到网络层面。智能体不光消耗大量推理资源,也不是按照人类的方式使用互联网。人类浏览网页是点击链接、阅读、再点开新链接,智能体可以用“软件速度”完成所有这些操作,单个任务内可以产生数十次搜索、网页获取、API调用、数据库查询、模型调用和智能体跳转。

按照Cisco 2026年的研究预测,到2035年AI推理流量会占到整个广域网流量的25%,智能体不是按照人类速度,而是按照“软件速度”工作的网络高需求用户,流量规模会出现数倍增长。

在此基础上,还引出了全局检索增强生成的想法:把整个互联网爬取一遍,把整个互联网的副本存进向量数据库显然不现实,但如果推理本身分布在不同节点,为什么推理需要的上下文不能放在就近的节点呢?

现在智能体从互联网获取信息需要每次重复搜索、找链接、抓网页、解析、提取内容,这个过程没必要每次都从头来一遍。AI中心附近可以放置热网页缓存、检索索引、嵌入、重排序和其他上下文基础设施。新鲜的上下文从就近节点获取,不新鲜的再让智能体去互联网找。

其实这种上下文层的雏形也已经存在,已经有企业推出面向智能体的网页访问层,不只是返回链接列表,而是返回给模型可用的重排后上下文,把搜索、爬取、提取、索引、缓存这些工作整合为面向智能体的单一层,搜索端点针对智能体需求做了优化。

总结一下整个讨论的结论:底层是互联网,互联网之上是分布式推理算力,算力附近是上下文和检索层,智能体在这之上运行,就像内容分发网络把内容靠近用户一样,未来算力也会靠近用户,上下文也会靠近算力。

现在还不确定多少构想会落地:也许头部实验室会把推理经济做得很好,模型和推理不会像我们预想的那样拆分;也许个人硬件发展太快,本地推理会成为主流;也许少数超大规模企业会包办所有层级;也许根本不会出现专门的AI中心类别,现有的数据中心自然就会转型成这个方向。但从当前不同企业的分工来看,模型和推理已经是分开的两件事,推理运行的位置是另一件事,模型和模型的上下文来源又是另外两件事。现在我们把所有这些都看作同一个产品的一部分,未来究竟会变成什么样,还需要时间给出答案。

查看 X 原帖

📬 订阅 果核Pulse

每日早间更新,不错过重要信号

▲ 回到顶部