为工具调用微调 toolshim 模型
· 阅读需 7 分钟

我们最近发布的 goose 基准揭示了工具调用并非直接支持的模型(例如 Gemma3、Deepseek-r1、phi4)存在显著的性能限制。这些模型常常无法在合适的时机调用工具,或产生格式错误、格式不一致的工具调用。随着 Llama4 和 Deepseek v3(0324)的最新发布,我们再次观察到有效工具调用性能上的挑战,即便在这些旗舰开放权重模型上也是如此。

我们最近发布的 goose 基准揭示了工具调用并非直接支持的模型(例如 Gemma3、Deepseek-r1、phi4)存在显著的性能限制。这些模型常常无法在合适的时机调用工具,或产生格式错误、格式不一致的工具调用。随着 Llama4 和 Deepseek v3(0324)的最新发布,我们再次观察到有效工具调用性能上的挑战,即便在这些旗舰开放权重模型上也是如此。

我们一直在用各种 AI 模型衡量 goose 的表现,其中包括不少能在消费级硬件(RTX 4080、Mac M 系列)上本地运行的流行开源模型。我们知道,社区里很多人看重完全开源、本地运行、不依赖云服务的体验。
这篇博文分享我们把开源模型与闭源模型对比后的发现,既指出当前的性能差距,也标出今后改进的路径。我们的基准测试仍处早期,但我们希望把它作为一个起点:用模型驾驶 goose 的能力,区分哪些模型展现出更强的智能体能力(这不同于其他流行基准里常测的推理或其他能力)。