google/ax :给 AI 智能体装上「Kubernetes 运行时」

AI工具32分钟前发布 FuturX-Editor
2 0

AI智库导航-aiguide.cc为您提供最新的AI新闻资讯和最新的AI工具推荐,在这里你可以获得用于营销的AI聊天机器人、AI在商业管理中的应用、用于数据分析的AI工具、机器学习模型、面向企业的AI解决方案、AI在商业客户服务中的应用、AI和自动化工具等。

主要介绍

google/ax(读作「Agent eXecutor」)是 Google Go 语言核心团队(主贡献者 rakyll,即 OpenTelemetry Go SDK 的主导者)开源的分布式 Agent 运行时框架。它的核心命题只有一句话:Agent 既不是无状态的微服务,也不是一次性批处理任务,传统的 Kubernetes 调度器对它非常不友好。ax 把 Google 在 Kubernetes 时代沉淀下来的可靠性模式——事件溯源、单写者、可恢复执行——搬进 Agent 世界,并以「四原语(Task / Workspace / Gateway / Model)+ kubectl 风格 CLI」的形态把这一切变成可声明、可观测、可恢复的生产基础设施。它构建在 Google 同期开源的 Agent Substrate(专门为 Agent 负载打造的 K8s 抽象层)之上,能在长空闲等待中释放计算资源、在突发任务中重新激活,适合把智能体从「几小时跨天任务、跨周任务」的生产场景。9 月 21 日它登上 Hacker News 第一名(179 分、74 评论),GitHub Trending 当日头部,是本周最具讨论度的 Agent 基础设施型框架之一。
google/ax :给 AI 智能体装上「Kubernetes 运行时」
google/ax 仓库预览图(GitHub 3,300+ Star)

功能特点

  • 四原语抽象:Task 提供隔离沙盒(CPU 与 memory 限额),Workspace 预装 Git 仓库、MCP 服务器与 Skills,Gateway 提供出口主机白名单,Model 统一管理 LLM 与凭据。
  • kubectl 风格 CLI:apply / get / describe / watch / delete,以及 agent 专属的 suspend / resume / ssh 与 kubectx / kube context 自动联动,kubectl 用户零学习曲线。
  • 亚秒级挂起与恢复:ax suspend task 把 actor 状态完整保存,ax resume task 从检查点继续运行,不必从头跑;这是「写一个多小时的任务崩了就从头再来」的传统痛点的根治。
  • 生成式工作区(Generative Workspace):不必手写 Dockerfile,直接用自然语言描述目标(如「搭一个 Python 3 开发环境」),由 Agent 在首次启动时自行搭建工具链。
  • 出口网络隔离与凭据注入:Gateway 同时承担白名单和凭据注入,确保 Agent 只能访问三个白名单 API;模型凭据走 Kubernetes Secret。
  • 可观察的阶段与条件:ax watch 实时推送 Task 的 phase 与 condition 变化,便于上层构建仪表盘和告警。
  • atenet 路由层:不论从集群、笔记本还是 gRPC 客户端,都能访问同一个 Task,无需打通复杂网络。

优缺点

优点:

  • Google 官方背书:仓库挂在 google GitHub 组织下、没有「unsupported」免责声明、Apache-2.0 协议,主贡献者 rakyll 是 Go 团队核心成员,长期维护可信度高。
  • 解决真痛点而非造新概念:把微服务时代的可靠性模式(事件溯源、单写者、可恢复执行)系统地搬进 Agent 领域,对准的是「跑了几小时突然断网或超时全丢」这一最大生产风险。
  • 复用 K8s 心智模型:声明式 YAML + apply + watch 三件套让运维和 SRE 几乎零成本迁移,底层运行在 K8s 之上、可直接复用现有可观察与多租户体系。
  • 沙箱与凭据治理双内置:CPU/memory 限制、出口白名单、凭据注入、Workspace 预装 Skills,一次性把 Agent 安全边界说清楚,无需自行拼装。
  • 四原语抽象克制可扩展:Task、Workspace、Gateway、Model 四件套覆盖 90% 场景,避免过早抽象;同时允许自定义 runner 镜像替换默认执行环境。
缺点:
  • 早期预览阶段,API 仍会大改:README 顶部明示「We are still actively refining our core concepts, protocols, and specifications. We will likely to introduce major breaking changes prior to a stable release」,目前仅 v0.3.0,不建议直接上生产。
  • 部署门槛高,不是开箱即用:需要一套 K8s 集群、ko(Go 镜像构建工具)、可达的容器仓库、Agent Substrate Control API,并以 make deploy 部署整套控制平面,对个人开发者不友好。
  • 默认模型绑定 Google 生态:默认 Model 指向 Gemini-3.8-flash,跨云、混合云或私有化模型接入需自行编写配置;脱离 Google Cloud 后的路径官方尚未给出承诺。
  • 配套生态尚浅:底层 Agent Substrate 仅 3,500+ Star、README 同样标注「no backward compatibility guarantees」,其与 AX 的耦合度很高,若 Substrate 改动 AX 也得跟着升级。

如何使用

第一步,准备环境:安装 Go 1.21 或更高版本、准备一套可访问的 Kubernetes 集群、安装 ko(Go 镜像构建工具)以及一个集群可拉取的容器仓库。第二步,安装 CLI:通过 go install 一行命令把 ax 二进制放入 GOPATH/bin 并加入 PATH。第三步,部署控制平面:在仓库根目录运行 make deploy 并指定镜像仓库地址,命令会先部署 Redis、再用 ko 构建并推送控制平面镜像到 ax-system 命名空间。第四步,写一个 task.yaml:用声明式 YAML 描述 Workspace(要克隆的 Git 仓库、要预装的 MCP 服务器与技能包)、Task(要跑的目标、可选 debug 开关方便后续 ssh)、Gateway(出口白名单)与 Model(要用的 LLM 与凭据引用)。第五步,提交任务:使用 ax apply 指定 YAML 文件提交,ax get tasks 查看列表、ax watch task 实时观察阶段与条件变化。第六步,进阶操作:通过 ax ssh 进入沙箱直接观察 Agent 行为,使用 ax suspend 与 ax resume 随时挂起与恢复长任务,使用 ax delete 清理。

框架技术原理

ax 的技术哲学是把 Agent 当作一类新型工作负载:它既不是无状态微服务(需要保留长时状态),也不是传统批处理(等待用户或外部 API 时大量空闲,却依然霸占计算资源)。其原理可拆为三层:第一层是借鉴微服务时代验证过的可靠性模式——事件溯源(每个状态变更是一条事件而不是直接改状态)、单写者(避免并发冲突)、可恢复执行(崩溃后可从事件日志重放到检查点),这套组合在大规模分布式系统中已成熟。第二层是基于 Kubernetes 构建 Agent Substrate 子系统,提供专门针对 Agent 形态的 K8s 抽象:动态把 Agent 在不同计算节点间迁移,活跃时分配资源、等待时释放,实现对突发性工作负载 97% 的硬件效率提升。第三层是 ax 自身的四原语控制面:Task 是隔离沙盒 + CPU/memory 限额,Workspace 预装 Git 仓库、MCP 服务器、Skills 与自然语言描述的生成式工作区,Gateway 同时承担出口白名单与凭据注入,Model 统一管理 LLM 与凭据;并通过 atenet router 让外部能在任何网络位置访问运行中的 Task。沙箱内部还提供 metadata server、guest services 与固定环境,让 Agent 命令可依赖。

创新点

  • 重新定义 Agent 工作负载:把 Agent 明确归类为既非微服务也非批处理的新型计算单元,配套提出「动态迁移 + 等待时释放资源」的调度策略,对传统 K8s 调度器是脆弱点。
  • 四原语抽象克制可扩展:Task / Workspace / Gateway / Model 四件套覆盖 90% 场景,同时允许用户自定义 runner 镜像替换默认执行环境,避免过早抽象。
  • 事件溯源 + 单写者 + 可恢复执行:把微服务可靠性模式系统搬入 Agent 域,单一组合就能解决「长任务崩了就从头跑」这一最大生产风险。
  • Generative Workspace 自然语言描述环境:不必手写 Dockerfile,直接用自然语言声明目标,由 Agent 在首次启动时自行搭建工具链。
  • 亚秒级 suspend / resume 与 ax ssh 调试:把「挂起/恢复/SSH」做成一等公民动词,长任务调试与迁移成本降到接近零。

评估标准

  • 沙箱隔离强度:CPU 与 memory 限额是否真的生效?是否能阻止恶意代码访问白名单之外的出口?
  • 故障恢复能力:Task 在网络抖动、LLM 超时、工具调用失败后是否能自动恢复?恢复点是否精确到事件级?
  • 可观察性:ax watch 输出的 phase 与 condition 是否足够支撑上层仪表盘与告警?事件日志是否可查询?
  • 学习曲线:会 kubectl 的运维/SRE 多久能独立写出可跑的 task.yaml?是否需要深入理解 K8s Operator 机制?
  • 扩展能力:自定义 runner 镜像是否方便?是否支持接入非 Gemini 模型?是否支持私有化部署?
  • 性能与成本:对比自建裸 K8s Pod 跑 Agent,引入 AX 后的吞吐、成本、suspend/resume 延迟增益有多大?

应用领域

  • 长周期编码 Agent:跨天、甚至跨周的大 PR 编写与重构任务,能在 LLM 超时或网络抖动后从检查点继续。
  • 自动渗透测试与漏洞扫描:需要严格出口白名单与沙箱隔离的高风险工作负载,Gateway 是天然安全边界。
  • 数据处理 / ETL Agent:需要预装大量工具与凭据注入的批处理型任务,Workspace 一次预装即可复用。
  • 客服 / 工单处理:高频空闲等待且需严格数据边界的场景,suspend/resume 释放等待期间的计算资源。
  • CI/CD 流水线替代:把 Agent 作为 CI 阶段执行,ax ssh 可观察内部状态、ax suspend 支持断点续跑。
  • Agent 评测与基准测试:统一 Model 接入与隔离执行环境,避免不同 harness 间相互污染,是构建公平评测平台的天然候选。

项目地址

google/ax 是 Google 官方开源项目,仓库直接挂在 google GitHub 组织下,没有「unsupported」免责声明,且与同期开源的底层运行时 Agent Substrate 配套发布。
项目官网、代码仓库与官方文档三个入口分别如下:
  • 项目官网:https://agentexecutor.io
  • 代码仓库:https://github.com/google/ax
  • 官方文档:https://github.com/google/ax/blob/main/docs/concepts.md

同类型工具比较

框架
定位
管理方式
状态恢复
部署门槛
google/ax(本期)
Kubernetes reinvented for agent workloads
声明式 YAML + kubectl 风格 CLI
suspend/resume 亚秒级 checkpoint + 事件溯源
需 K8s + ko + 镜像仓库 + Agent Substrate
LangGraph
有状态多智能体图编排
Python SDK 编排图
内建 checkpoint,需 LangSmith 平台
Python 包即可起步,云端走 LangSmith
Temporal
通用工作流编排
代码即工作流(Workflow/Activity)
事件溯源 + 自动重试
自托管 Temporal 集群或 Temporal Cloud
裸 Kubernetes
通用容器编排
YAML Deployment/Job
Pod restart,状态需自行管理
自身
Scion(Google Cloud)
包装现有 harness 的控制平面
包装层,不重写底层
取决于底层 harness
Google Cloud 内部或自托管
© 版权声明

相关文章

暂无评论

暂无评论...