推理

Inference

运行训练好的模型以生成输出——每次模型请求都会发生的事。参数保持不变;模型只是基于给定的上下文做 下一个 Token 预测。相比训练成本低,但按 Token 计费,是使用模型的主要成本。

模型的生命周期分为两个阶段:

阶段发生时机做什么参数
训练一次,发布前从训练语料中产生参数被写入
推理每次有人使用模型时基于你的上下文运行冻结的参数以生成 Token只读

你在推理时做的任何事都不会写回参数——这就是为什么你今天做的纠正明天不会保留。模型在下一次 session 犯了同样的错误,即使你之前仔细解释过修复方案,也不是它无视了你;它无法从这次交流中学习。模型是无状态的——连续性必须来自外部——来自上下文窗口或记忆系统。

这一机制也解释了你为什么被这样计费。每次请求都要基于完整上下文运行模型,因此成本随输入 Token 和输出 Token 增加,而一个 Agent 执行几十次工具调用时,每一轮往返都要为推理付费。所以上下文大小既是成本问题,也是质量问题。

用法:

“为什么账单随用量增长,而不是固定授权费?”

“你付的是推理费用——每次模型请求都在提供商的硬件上运行模型。训练已经完成,但推理成本按请求累计,而调用工具时,单轮对话可能扩展成多个请求。”