输入 Token

Input tokens

Harness 在每次模型请求时发送的 Token——System Prompt、对话历史、工具结果,也就是模型在生成之前读到的所有内容。单价比输出 Token 低,因为处理成本更低。

做 AI 编程时,输入 Token 通常占账单大头。模型是无状态的,所以每一轮都要把整个 Session 作为输入重发:你的第一条消息、每次回复、从那时起的每个工具结果。第五十轮的输入里包含了前四十九轮的内容。单次模型请求可能只产生几百个输出 Token,却要重发累计十万量级的输入 Token。

前缀缓存能降低成本:与之前请求完全匹配的历史会被计为便宜的缓存 Token,而不是全价输入。如果输入成本仍然过高,解决方法是减少重发内容——在任务之间清空或压缩上下文。

用法:

“账单很高,但 Agent 几乎没写什么。”

“这是输入 Token 的问题——每一轮都重发整个 Session。没有前缀缓存,每次请求都要为历史重新付费。”