参数
Parameters
模型内部的数字——通常有数十亿个——在训练过程中调整得到。模型所知的一切都存在其中。训练设定它们;推理时它们保持不变。也称 weights。
从机制上讲,参数就是把输入变成输出的东西。下一个 Token 预测 是一场巨型计算:上下文窗口里的 Token 输入,经过参数相乘,得出下一个 Token 的预测。模型内部没有事实数据库,也没有代码查找表——只有这些数字,它们的排列方式使得计算倾向于产生有用的输出。模型能从训练中背诵出来的事实,比如标准库 API,就是 parametric knowledge:存储在参数中,而非从某处检索而来。
值得牢记的细节是:训练结束后参数就被冻结。你在一次 session 中做的任何事都不会改变它们——你的任何纠正、展示给它的代码库、它从错误中学到的东西,都不会。每次 session 都运行在同样的数字上。这就是为什么模型是无状态的,为什么它的内置知识止于知识截止时间,为什么任何项目特有的东西都必须通过上下文输入。改变参数的唯一方式是更多训练——实际上那会产生一个不同的模型。
用法:
“我们能用它在我们的代码库上做 fine-tune 吗?”
“那会更新参数——之后就是另一个模型了。对单个项目来说,把代码库作为上下文加载几乎总是比重训便宜。”