推理
Inference
运行训练好的模型以生成输出——每次模型请求都会发生的事。参数保持不变;模型只是基于给定的上下文做 下一个 Token 预测。相比训练成本低,但按 Token 计费,是使用模型的主要成本。
模型的生命周期分为两个阶段:
| 阶段 | 发生时机 | 做什么 | 参数 |
|---|---|---|---|
| 训练 | 一次,发布前 | 从训练语料中产生参数 | 被写入 |
| 推理 | 每次有人使用模型时 | 基于你的上下文运行冻结的参数以生成 Token | 只读 |
你在推理时做的任何事都不会写回参数——这就是为什么你今天做的纠正明天不会保留。模型在下一次 session 犯了同样的错误,即使你之前仔细解释过修复方案,也不是它无视了你;它无法从这次交流中学习。模型是无状态的——连续性必须来自外部——来自上下文窗口或记忆系统。
这一机制也解释了你为什么被这样计费。每次请求都要基于完整上下文运行模型,因此成本随输入 Token 和输出 Token 增加,而一个 Agent 执行几十次工具调用时,每一轮往返都要为推理付费。所以上下文大小既是成本问题,也是质量问题。
用法:
“为什么账单随用量增长,而不是固定授权费?”
“你付的是推理费用——每次模型请求都在提供商的硬件上运行模型。训练已经完成,但推理成本按请求累计,而调用工具时,单轮对话可能扩展成多个请求。”