不,本地模型不会赢
每当新的开放权重 AI 模型发布,就会有人说,本地模型才是未来。既然人人都能在笔记本电脑或手机上运行 AI 模型,为什么还要花费数十亿美元建设数据中心?我认为,这种设想注定行不通。无论开放权重模型变得多强,大多数推理始终都会在 AI 数据中心完成。
本地模型太弱,难以广泛使用
本地模型永远不可能具备数据中心前沿模型那样的能力。这一点应该显而易见:目前所有前沿模型,无论是闭源模型还是开放权重模型,规模都大到必须依靠数据中心里的一整套 GPU 集群才能运行。当然,小模型也在逐渐变得更智能。或许一年后,你就能在笔记本电脑上运行一个能力大致相当于 GPT-5.6-Sol 的模型。但到了那时,你又会觉得 GPT-5.6-Sol 太弱,已经没什么用了。
很多人不认同最后一点,但事实就是如此:从人们的实际选择来看,只要预算允许,几乎所有人都会使用自己能用到的最强模型。假如 GPT-4 之后没有再进步,我们原本也能围绕 GPT-4 开发出一些非常强大的工具。可放到今天,还有谁愿意用 GPT-4?随着 LLM 的能力不断增强,我们对它的期待也越来越高。如今,我们希望 Agent 系统能够独立解决越来越多的问题。只要它犯迷糊或卡住,就会让人非常恼火。只要有得选,人们就会选择那个更不容易让自己受挫的模型,而这样的模型总会是规模更大、能力更强的那一个。
本地模型成本更高、效率更低
除此之外,在数据中心运行模型的成本永远会更低。我不明白为什么总有人说本地模型更便宜。这就像说跑 Uber 网约车是在赚“无本钱的钱”:只有漏算油费和车辆损耗,这笔账才会显得划算。单是搭建一套低端家庭实验室1的费用,就足够支付某家 AI 服务商好几年的付费订阅。每月电费还会达到约 50 到 300 美元,具体取决于推理负载,这笔钱同样够再买好几份付费订阅。
为什么数据中心的推理更便宜?不是因为这项业务得到了补贴。事实上,推理本身相当便宜。即使本地和数据中心跑的是同一个模型,数据中心也天然更高效。
主要原因是批处理。GPU 完成数十万次数学运算,所用时间可以和只完成一次运算完全相同。但对单个用户的推理来说,每个新 Token 都依赖上一个 Token 的结果,因此无法批处理2。真正能做的是把数百名用户的推理放在一起批量执行。这样一批推理花费的时间、消耗的电力和产生的热量,基本上与单独为一名用户推理一次相同。
在家运行自己的推理服务时,你没有足够的请求可供批处理,充其量也只是并行运行几个 AI Agent,因此利用率极低。你花钱买下了大量潜在的推理能力,却根本用不上,只能白白浪费。唯一的解决办法,是找来一些朋友,向他们开放你的本地推理端点。走到这一步,你基本上就是在运营一座自建的蹩脚数据中心。
另一个原因是,数据中心能使用规模更大、效率更高的 GPU。本地模型通常运行在 RTX 4090 这类面向游戏的消费级 GPU 上。数据中心里的 B200 专为批量 AI 推理而设计。在功耗相同的情况下,它的浮点运算性能约为 RTX 4090 的 3 倍,内存带宽则接近但不到 RTX 4090 的 4 倍3。把批处理和 GPU 效率这两方面的优势结合起来看,本地运行模型消耗的资源大约会达到数据中心的 30 倍。
这也解释了为什么我不太相信另一种说法。有人认为,本地模型不需要像那些“又大又坏”的数据中心一样消耗大量资源,所以更值得使用。真想提高 LLM 的运行效率,就应该尽可能把推理需求集中到 AI 数据中心里!往好处理解,他们真正的意思也许是人人都该运行 更小的 模型。但即便如此,更合理的选择也是通过 GPT-5.6 Luna 之类的 API 调用小模型,而不是自己部署模型。
本地模型还有可能胜出吗?
有没有什么情况能让本地模型最终胜出?我想还是有的。比如,政府可能彻底禁止使用 AI 数据中心,原因可能是担心 AI 带来危险,也可能只是迫于公众压力。如果所有 AI 数据中心都遭到禁止,本地模型就会成为唯一的选择。
另一种可能是,超大型 AI 模型不知为何停止进步,小模型却仍在继续变强。除了前面提到的政府干预,我很难想象这会怎样发生。但如果 30B 参数模型也能跻身前沿,到了那时,本地模型或许确实有竞争力。
又或者,模型变得 如此 出色,以至于 30B 模型已经足够聪明,什么都能做。这样一来,除非要解决黎曼猜想,否则谁都不需要 Opus 或 Sol 这样的模型。我不太相信会发生这种事。今天的模型已经能从事前沿数学研究,重构大型代码库却仍然不如我。很难想象有一天,我会不再想用自己能用到的最聪明模型。
本地模型并非毫无用处
我确实认为,本地模型永远都会有自己的小众用途。这让我想到 Thinking Machines 提出的“交互模型”。这个想法简单得出人意料,也十分直观,OpenAI 也在这么做:在语音聊天这类对延迟敏感的应用中,由一个小而快的模型负责对话,再把需要深入思考的难题交给更大、更慢的模型。五年后,大多数人与 AI 的交互或许都会先经过手机或笔记本电脑上的本地模型,由它在前端与用户交流,再把任务转交出去。真到了那一天,我也不会感到意外,不过几乎所有实际计算仍会在 AI 数据中心完成。
有些用户就是会更喜欢本地模型,哪怕它们能力更弱、成本更高。例如,用户可以借助 steering vectors(引导向量)在本地定向控制模型行为,这对他们来说可能是一个杀手级功能。另一些人可能只是希望完全掌控自己的基础设施,也可能是因为网络连接不可靠4。如果你属于这类人,尤其是只和模型聊天,不用它做研究或写代码,那么本地模型很适合你。不过,我认为这始终只会是一个小众群体。大多数用户还是会继续通过数据中心完成推理。
Footnotes
下面是一篇与本文标签相关的文章。
高阶 AI 谄媚
AI 的谄媚不只表现为直白夸奖,也可能伪装成聪明人容易接受、却不真正构成威胁的反对意见。
继续阅读……