AIGridHQ News
返回首页

从一个浏览器标签页并行运行 Claude Code、Codex、Copilot、Cursor 和 Grok

📅 2026-07-14 GitHub

在一个浏览器标签页中并行运行 Claude Code、Codex、Copilot、Cursor 和 Grok

发生了什么

一个名为 many-ai-cli 的新开源项目(作者 ishizakahiroshi)出现在 GitHub 上。它使用 Go 语言编写,让开发者能够同时启动 Claude CodeOpenAI Codex CLIGitHub Copilot、Cursor(代理模式 CLI)和 Grok CLI 的官方命令行界面。每个会话的差异或操作都需在一个统一的 Web 仪表板中等待批准——该仪表板使用 xterm.js、WebSockets 和一个可在手机上运行的渐进式 Web 应用(PWA)构建。

该仓库非常小(撰稿时仅有 4 颗星),显然处于实验阶段。但这个想法非常精准:无需逐个运行每个编码助手,而是将同一个提示同时发送给五个代理并行执行,并实时比较它们的输出。

为什么现在并行运行 AI 编码代理很重要

AI 辅助编码市场拥挤不堪。团队在决定采用影响生产代码的工作流程之前,经常在 Cursor、Copilot、Codex、Claude Code 和新兴工具之间摇摆不定。并行执行将主观的“我喜欢它”转变为可观察的比较:

  • 并行输出质量:你可以看到谁更好地处理模糊需求,谁会虚构库 API,谁编写地道的代码。
  • 风险感知的审批:因为每个代理的提议更改都需等待统一的批准/拒绝关卡,你可以尽早否决不安全的差异——而单独的 CLI 循环很容易忽略这类问题。
  • 速度与成本的权衡:同时运行它们可以揭示同一任务在令牌使用量和迭代次数上的差异。
  • 降低评估摩擦:在五个终端之间切换上下文非常痛苦。一个浏览器标签页将比较结果带给创始人、技术负责人,甚至需要参与评估的非终端用户。

谁应该关注

创始人与工程领导

在购买企业计划或绑定 IDE 的代理之前,你可以使用代表性的内部提示(重构遗留函数、生成样板代码或搭建微服务脚手架)对候选工具进行压力测试。并行运行的仪表板使这种测试可重复且快速。

开发者与平台工程师

你可以基于该项目进行修改,使用自定义模型端点进行扩展,或利用它构建内部基准测试套件。WebSocket + PWA 架构也展示了如何使代理工具在移动端友好,以便在值班审批场景中使用。

营销人员和技术内容创作者

一个实时的并行输出演示是在视频、教程或推介文稿中展示各助手差异的高可信度方式——远比精心挑选的截图更具说服力。

实际用例

  • 每日模型对决:每天早上,在各个代理上运行相同的编码挑战,以发现 API 更新后的退化或改进。
  • 安全至上的代码审查:允许代理提出更改,但强制人类从手机上批准每个差异,即使在无法访问终端时也是如此。
  • 团队决策会议:在冲刺计划会议期间投影单一仪表板,集体评估哪个代理编写的测试夹具最干净。
  • 多提供商成本分析:并排跟踪每个代理的令牌消耗,为 Anthropic API 或 OpenAI 工作负载的预算分配提供信息。

需要注意的限制与风险

这是一个预 v1 版的实验工具,没有发布基准测试,且仓库尚未被广泛采用。请记住以下几点:

  • 未经证实的稳定性:Go 代码库及其 WebSocket 仪表板还很新。预计会出现与并发会话以及特定代理 CLI 特性相关的边缘情况。
  • API 成本可能快速倍增:在单个提示上运行五个代理会并行消耗五个提供商的令牌。目前还没有内置的预算保护。
  • 安全暴露面:通过 Web 界面(即使是本地)暴露 CLI 会话需要谨慎的网络配置。审批界面增加了一层保护,但默认设置在生产使用前可能需要加固。
  • 代理 CLI 可用性偏移:该工具依赖每个提供商的官方 CLI 保持兼容。OpenAI Codex CLI 或 Grok CLI 的中断性变更可能会悄然破坏会话,直到社区修复它。
  • 没有内置评估指标:仪表板显示输出和差异,但不对正确性、延迟或成本进行评分。由你自己判断。

使用并行运行器时如何评估 AI 编码工具

像 many-ai-cli 这样的工具消除了上下文切换,但你仍然需要一个强大的评估框架。否则,并行输出只会变成“更多的标签页”。使用这些标准:

  • 正确性:代码能否编译/运行并完全满足提示要求?
  • 代码质量和风格:检查是否符合项目约定和地道的语言模式。
  • 令牌效率:衡量每个正确解决方案消耗的令牌数——一个类似低语者、却消耗大量上下文窗口的代理,可能比一个冗长但便宜的模型成本更高。
  • 自我修正能力:如果你拒绝一个提议,代理在下一次迭代中适应得如何?
  • 安全默认值:它是否避免执行危险命令,除非明确允许?

当你使用这些标准并排放置比较像 Claude CodeOpenAI Codex CLIGitHub CopilotCursor 这样的工具时,模式很快就会出现——通常只需一个下午的测试。

常见问题

我需要五个代理都使用付费 API 密钥吗?

是的。每个 CLI 都需要对其各自服务进行身份验证访问。在启动许多并行会话之前,请规划预算上限,因为成本会实时累积。

我可以从手机安全运行它而不暴露我的机器吗?

PWA 使用 WebSocket,可以通过本地网络或经过加固的隧道提供服务。该项目提供审批界面,但安全部署由你负责。将其视为任何远程终端访问一样对待。

这是专用 copilot IDE 的替代品吗?

不是。它是一个评估和比较层,而不是 IDE 集成。它通过在将代理引入日常编辑器工作流之前,为你提供一个中立的环境来对代理进行基准测试,从而补充了像 GitHub Copilot 编辑器内插件或 Cursor IDE 这样的工具。

如果我只想比较两个代理,而不是全部五个呢?

架构是模块化的。你可以只配置你关心的 CLI,降低复杂性和成本。从与你的技术栈最相关的一对开始,然后逐步扩展。