模型提供商

Model provider

任何为推理提供模型的东西。通常是远程服务(Anthropic、OpenAI、Google),也可以是本地——Ollama、LM Studio、你自己机器上运行的 llama.cpp。Harness 本身不运行模型;它向模型提供商请求。

提供商掌握机器:参数存在于它的硬件上,每次模型请求都是 Harness 通过网络发送 Token 并取回预测。这让模型提供商成为一整类问题的源头,而这些问题常被误归于模型或 Harness——速率限制、容量下降和宕机都在这里。当 Agent 在 session 中途卡住或每轮都报错时,先查提供商的状态页面比其他什么都值得。

提供商也设定商业条款:输入 Token 和输出 Token 的按 Token 定价、前缀缓存折扣,以及哪些模型可用。注意模型提供商和模型制造商可能是不同公司——Bedrock、Vertex 和 OpenRouter 提供的是别人的模型。

本地提供商用能力换取控制权:能跑在你自己硬件上的模型远小于前沿模型,但数据不会离开机器,也没有按 Token 计费。

用法:

“我们能在离线环境下给这个隔离网络的客户跑吗?”

“把模型提供商换成本地的——在他们机器上跑 Ollama 或 llama.cpp。Harness 不在乎,它只是请求另一个 endpoint。”