以约三十分之一的成本接近前沿性能
简讯:Sentient AGI 最近和我们分享了一项名为 “Grounded Reasoning” 的挑战结果。各团队使用 MiniMax(2.5)开放模型攻克 Databricks OfficeQA 基准。
简讯:Sentient AGI 最近和我们分享了一项名为 “Grounded Reasoning” 的挑战结果。各团队使用 MiniMax(2.5)开放模型攻克 Databricks OfficeQA 基准。
简讯:Mesh LLM 现已进入 goose,可作为访问并与亲友共享(开放)LLM 的一个选项。
它使用与本地模式相同的 llama.cpp 基础设施来运行模型,但多了一个变化。

Block 已将 goose 捐赠给 Linux 基金会下的智能体 AI 基金会(AAIF),与 Anthropic 的模型上下文协议(MCP)以及 OpenAI 的 AGENTS.md 并列。你可以在这里阅读完整公告。
goose 对使命和社区的投入没有变化,发生变化的是这些:

goose 的愿望之一(至少对我们中的一些人来说)是避免不停地请求权限,把所有决定都推给最终用户,以此来保证智能体执行工具时的安全。有时这会变得非常吵、非常烦,而当你懒得再读、再批准时,结果反而不那么安全。
你当然可以按自己的需要调整设置,但值得想想:怎样才能在不假设可以不断打断用户来请求权限的前提下把事情做安全,尤其是那些他们此刻脑子里可能并没有上下文的事情。
goose 里有多层你可以开启的东西,但我们也想思考更通用的办法。我们观察到各类智能体都非常乐于帮忙,而副作用是会意外造成伤害。于是有了“对抗模式”。想法是:为什么不用另一个智能体来以火攻火。智能体想要帮忙,可以被定向为帮助用户;另一个则可以被定向为防范智能体“帮助”用户,让事情保持在策略之内,并且安全。
得益于 ACP(Agent Client Protocol),你现在可以用 codex、claude 和 gemini 的订阅来使用 goose。 Codex 还有一个特别之处:你可以直接登录 ChatGPT,不需要再安装别的东西。
Gemini 现在通过 OAuth 工作——用你的 Google 账号登录即可。在撰写本文时,claude 只需要安装一个小工具,而且只需安装一次。

2025 年,我们用 Android 做了一次相当前沿的整机自动化尝试(代号 gosling)。它是一个设备端智能体,会接管你的设备(mic 甚至用它买过东西——直到一些东西送到门口,他才意识到那是一封邮件触发的自动购买,所以它被标成了 PoC / 实验性!)
最近我们整合了 goose 移动应用。
goose iOS 客户端 更接近可用于生产,并且已经上架 App Store(仍处于早期)。我们希望把它移植到 Android,那将严格只是连接到你远程智能体的客户端(不会接管你的设备!)。客户端(相对于设备端智能体)的目标,是让你把工作随身带走。
这对长时间运行的任务、查看进展,或者随手抛出一个想法都很合适,同时仍然安全地留在你的个人智能体里(你的东西都在那里)。

我们很高兴宣布与 goose 交互的两种新方式:用于移动访问的原生 iOS 应用,以及原生终端集成。两者都让你在如何使用、在哪里使用 AI 智能体上更灵活。

goose 里的数据可视化刚刚迎来一次重大升级。有了新的 MCP-UI 自动可视化功能,你不再需要手动请求图表、图形或数据的可视化表示。goose 现在会自动判断数据什么时候适合可视化,并直接在对话里渲染可交互的可视化组件。

你不应该需要信用卡才能用 goose 做 vibe coding。虽然 goose 本身完全免费,但现实是大多数高性能 LLM 并不免费。你希望体验 goose 的实际效果,又不必花很多钱或走很多弯路。我们一直在想,如何让 goose 新手的第一步更容易。
所以我们对最新的提供商集成感到兴奋:Tetrate 的 Agent Router Service。新的 goose 用户可以获得 10 美元额度,用 Tetrate 平台上的任意模型配合 goose。

十多年前,Docker 登上舞台,把容器的概念和实践大规模介绍给开发者。这些容器帮助解决了部署和构建时的问题,在某些情况下也解决了开发环境的问题。它们很快成为主流。容器底层的技术包括写时复制文件系统,以及轻量、类似虚拟机的环境,帮助隔离进程并简化清理。
由 Docker 创建者 Solomon Hykes 创立的项目和公司 Dagger,进一步扩展了容器对开发者的触达。
这项工作中涌现的一个项目是 Container Use,一台 MCP 服务器,给智能体一个在隔离容器和 git 分支中工作的接口。它支持清晰的生命周期、容易的回滚和更安全的试验,同时不牺牲开发者对本地智能体所期望的人体工学。
Container Use 把容器化、按 git 分支隔离的开发直接带进你的 goose 工作流。虽然仍处于开发早期,它演进很快,并且已经为你在需要时提供轻量、特定于分支的隔离提供了有用的工具。
Lead/Worker 模式已从 goose 中移除,取代它的规划模式也已移除。当前工作流见多模型指南。

不是每项任务都需要天才。也不是每一步都该花一大笔钱。
这是我们在扩展 goose——我们的开源 AI 智能体——时学到的。同一个擅长拆解规划请求的模型,可能完全搞砸一条基本的 shell 命令,或者更糟——做这件事时烧光你的 token 预算。
所以我们问自己:如果能在单次会话里混搭模型呢?
不只是根据用户命令切换,而是让 goose 内建一套真正的系统,在不同模型之间路由任务,每个模型发挥自己的长处。
这正是 lead/worker 模型要填补的缺口。
高级技巧中提到的 goose /plan 模式后来已被移除,独立的规划模型设置也一并去掉。本文其余内容仍然适用。

几周前,Qwen 3 发布,带来了一系列能力和不同尺寸。这个模型表现出潜力:即便是非常紧凑的形态,例如 80 亿参数和 4 bit 量化,也能用 goose 成功进行工具调用,甚至是多轮工具调用。
我此前没见过缩小到这种程度的模型还能做到这一点,所以这真的令人印象深刻,对这个模型本身,以及对未来或大或小的开放权重模型,都是好兆头。我预计更大的 Qwen3 模型在各种任务上会表现得相当好,但即便是这个小模型,我也觉得有用。

我们最近发布的 goose 基准揭示了工具调用并非直接支持的模型(例如 Gemma3、Deepseek-r1、phi4)存在显著的性能限制。这些模型常常无法在合适的时机调用工具,或产生格式错误、格式不一致的工具调用。随着 Llama4 和 Deepseek v3(0324)的最新发布,我们再次观察到有效工具调用性能上的挑战,即便在这些旗舰开放权重模型上也是如此。