下一个 Token 预测

Next-token prediction

模型实际在做的事。给定一个上下文,它采样一个下一个 Token,追加进去,然后再运行一次。每一次输出——一句话、一次工具调用、一个千行文件——都是逐个 Token 构建的。模型没有其他运行模式。

每一步的工作方式都相同:上下文窗口里的 Token 经过参数运算,生成词表中每个 Token 的概率——这个 Token 接下来很可能,那个则不太可能。从概率中采样一个 Token,追加进去,然后用稍长的上下文再次运行循环。正是这个采样步骤让同一 Prompt 在不同运行中生成不同输出:非确定性内置于机制中,而非后来附加的 bug。

牢记这一机制,才能解释那些否则看起来很奇怪的行为。模型在输出前从不检查某个 Token 是否真实——只检查它是否可能——这就是幻觉的根源。它边生成边承诺每个 Token,所以一句听起来自信的引言可能把后续答案带偏。而且因为输出 Token 严格逐个生成,生成速度决定了任何 Agent 工作速度的下限。

用法:

“Agent 是怎么决定调用工具的?”

“它并没有决定——说到底都是 下一个 Token 预测。工具调用只是 Harness 从输出流中解析出来的结构化字符串。”