Cua(trycua/cua):给大模型一双「操作电脑的手」——计算机使用代理的基础设施拆解
一、导读
Cua(仓库 trycua/cua)是 YC 背景团队做的计算机使用代理(Computer-Use Agent,CUA)基础设施:它不训练通吃的大模型,而是把"给代理一台真电脑、一层可靠的 GUI 工具面、一套可验证的评测与数据管线"做成开源件(MIT)。当日涨星 1,112(Trending daily,2026-09-19 页面,09-20 抓取),总星 24,318。它最值得读的是对"代理可靠性"的工程化回答:把模型能力与桌面执行彻底解耦,用一次前向的 70 万参数小模型(CUA-S1)替代部分大模型调用,并用 7 类独立 oracle 给每一次点击找证据。
二、项目速览
| 项目 | 详情 |
|---|---|
| 仓库 | trycua/cua(官网 cua.ai,署名 Cua AI, Inc.) |
| 定位 | CUA 基础设施:桌面驱动 + 隔离沙箱 + 评测/数据管线 + 专用小模型 |
| 主语言 | 多语言单仓(Rust 驱动内核、Python/TypeScript SDK、Swift、Shell;GitHub 标为 HTML) |
| Star 总数 | 24,318(GitHub API,2026-09-20 抓取) |
| 当日涨星 | +1,112(Trending daily,2026-09-19 页面) |
| License | MIT(第三方:Kasm MIT、OmniParser CC-BY-4.0;可选 cua-agent[omni] 含 AGPL-3.0 的 ultralytics) |
| 首次发布 | 仓库创建于 2025-01-31,早期 CLI 版本 v0.1.x |
| 近期版本 | cua-driver-rs v0.28.2、sandbox v0.8.0(均 2026-09-15),另有每日 nightly 构建 |
| 社区规模 | 1,675 fork、1,029 开放 issue、Discord 社区、GitHub Sponsors(CodeRabbit 等) |
| 资本背景 | 官网与招聘页标注 YC 背景(批次 X25/P25 两处口径不一,待确认);第三方数据库称累计融资 50 万美元(待确认) |
三、为什么是它
它切中的是 CUA 的真实瓶颈:模型会看,但系统不会干活。 官方文档讲得很直白:计算机使用模型只负责"解释观察、提出动作",而计算机使用代理是模型外围的整套运行系统——提供计算机、工具、记忆、指令、权限与反馈回路,还要决定何时停止、重试、请求确认或换动作面。模型再强,若没把输入送进正确的窗口、没在步骤之间保住状态、没在界面变化后恢复,任务依然失败。Cua 选的就是这段"周边系统"。
它的技术主张与主流路线相反:把能力往下沉。 例如 CUA-S1-FORMS——一个 706,048 参数、2.8 MB 的检查点,专做表单"该填哪个值"的决策。它不做自回归生成,而是在一次前向里为每个可交互元素并行打分,执行顺序(先填、再勾选、最后一次提交)由下游代码决定。官方对比:合成测试集(表单字段不重叠、约 1.5 万个决策)top-1 达 99.95%,真实 demo(3 个真实表单 + 3 份真实 PDF、196 个决策)达 100%,打乱上下文对照仅 37%;与托管 Jev API(jev-latest,零微调)相比,本模型整体 99.7%、对方 83.6%(分组口径待确认)。这类"小模型专管一步决策"直接对冲了 CUA 每步都要调大模型的成本与延迟。
第三,它把"验证"当成产品的一部分。 Driver 用两层证据:单元/协议测试回答"驱动的确定性决策是否正确",夹具端到端测试回答"动作是否真的到达桌面"。夹具不是 mock,而是从源码编译并真实启动的进程;判定成功的 oracle 包括夹具自持状态、无障碍树(AX/UIA/AT-SPI)、像素前后对比、焦点与 z-order、物理光标是否移动、前台哨兵是否收到越界输入、协议层是否给出精确拒绝码。每次发布保留逐格视频与日志。
涨星动因可归为三条叠加:cua-bench 用 KiCad 等硬任务把"能力悬崖"可视化(见 4.4);Driver 从"容器里的 Linux"扩到"你正在用的 macOS/Windows/Linux 真机"并支持后台投递;以及 YC 背景带来的关注。需要克制的是:它年轻、issue 余额高(1,029 开放),仍在快速演进。
四、架构原理
4.1 整体架构与数据流
Cua 的架构可概括为模型归你、电脑归它、证据归流程。官方反复强调一条边界——"Cua Driver 是连到 harness 上的 UI 工具层,它不选择也不运行模型":
你的模型 / 订阅(GPT 系 / Claude 系 / 本地模型)
│
▼
┌─────────────────────────────────────────────┐
│ Agent Harness:Claude Code / Codex / Cursor │
│ / OpenClaw / 自研循环(负责规划与推理) │
└───────────────┬─────────────────────────────┘
│ MCP(stdio) │ CLI │ 类型化 SDK(Python/TS/Rust)
┌───────────────▼─────────────────────────────┐
│ Cua Driver:Rust 内核 + UniFFI 绑定 │
│ 快照/元素令牌 · 权限模式 · 后台投递 · 录制 │
└───────────────┬─────────────────────────────┘
│ 原生输入事件 + 无障碍树 + 截图
┌───────────────▼─────────────────────────────┐
│ 目标计算机 │
│ ① 宿主真机(Driver 直连,保留登录态与文件) │
│ ② Cua Sandbox(容器或全 VM 的独立电脑) │
│ code half ⇄ 同一文件系统/进程 ⇄ GUI half │
└─────────────────────────────────────────────┘
横向组件:
Fleet 池(pool)预置容量 → 认领(claim)→ 客户机 computer-server 端点
Lume Apple Silicon 上的 macOS/Linux 本地 VM(Virtualization.Framework)
CUA-S1 一次前向的打分器,替掉部分"每步问大模型"
Cua-Bench 任务 + 评测 harness + 轨迹导出(评测、SFT/RL 数据)
三条动作面是核心概念:写代码(文本密集、需重复执行)、调工具/API/MCP(有类型契约)、操作 GUI(原生应用、无 API 的老系统、登录态页面)。Cua 称之为"计算机使用 2.0"——一次任务内自由切换三条面,而不是把一切退化成点击;选哪条面本身就是代理的能力。
4.2 分层模块拆解
驱动层(libs/cua-driver)。Rust 写成,向上暴露三类接口:MCP(stdio,运行时中立的代理协议)、CLI(cua-driver call,给 shell 型代理)、类型化 SDK(Python cua_driver、TypeScript @trycua/cua-driver,经 UniFFI 生成绑定直连进程内原生运行时)。MCP 适配器建立在同一份 SDK 契约之上,不另写一套桌面工具实现。
沙箱与运行时层。沙箱是"一台完整隔离电脑"而非远程桌面:code half(shell.run、computer.pty、venv_install/venv_exec/@sandboxed 的沙箱内 Python)与 GUI half(截图、无障碍树、点击/输入/滚动)共享同一文件系统、进程与 OS 状态。Image 是不可变的启动状态契约,本地执行按层应用(apt_install/pip_install/run/copy/env),Fleet 则直接启动预构建产物并拒绝这些构建层。运行时:Linux 容器走 Docker(XFCE + KasmWeb),Linux/Android VM 走 QEMU,macOS 走 Lume,Windows 走 QEMU 或 Hyper-V。
编排层(libs/fleet)。用"池 + 认领"两段式管理托管容量:池定义启动产物与暖容量,认领把某台客户机保留给某工作负载。文档明确提示一个易踩的坑——释放认领不等于删除池,保活容量会继续计费。
模型层(libs/cua-s1)。CUA-S1 用"System 1"作工程类比:只负责快速、边界明确的决策,不承担通用规划。代码含 Python 模型 + 合成数据生成 + 训练 + 评测 + 可选 Driver 集成;git 版本是"仅源码"研究发布,权重与数据集另托管在 Hugging Face,源码 MIT 不自动覆盖未来权重与商业条款。
评测与数据层(libs/cua-bench)。提供 gym 风格接口(make/reset/step/evaluate)、HTTP worker 服务(/reset、/step)、benchmark runner,以及压测基础设施吞吐的 benchmark_workers(输出平均 reset/step/finish 时间)。任务可导出轨迹,用于 SFT/RL 数据生成——这是把评测与训练闭环的关键件。
4.3 核心机制与算法原理
进程拓扑与授权。 Driver 有两种调用界面(SDK / MCP)与三种本地拓扑(同进程、私有 worker、常驻 daemon)。daemon 存在的理由很实际:macOS 的辅助功能与屏幕录制授权绑定应用身份,稳定的 CuaDriver.app 身份才能让授权在反复重连后继续有效。授权检查位于原生运行时之内,MCP/HTTP/CLI 适配器可更早拒绝但不能削弱它;Windows 命名管道只授权给 daemon 属主 SID 并校验连接方 SID,是刻意的 fail-closed 变更。
权限模式。 standard 为免弹窗默认档;bounded 只放行经评审清单内的工具与资源;unrestricted 必须显式带 --dangerously-bypass-approvals。模式在启动时固定(CUA_DRIVER_PERMISSION_MODE、CUA_DRIVER_CAPABILITY_MANIFEST_FILE、CUA_DRIVER_CAPABILITY_MANIFEST_APPROVED),运行中要改必须重启。附着已登录的 Chromium 配置也是显式动作:cua-driver mcp --grant existing-profile。
后台投递(不抢焦点)。 当应用与平台支持时,代理可在不移动用户指针、不抢焦点下投递输入;文档同时限定这是"尽力而为"契约,平台不支持则退回前台,失败必须给出精确拒绝码而非假装成功。
CUA-S1 的打分式决策。 结构是字节级嵌入 + 2 层 Transformer 编码器(宽 128、4 头),分别编码上下文与每个选项文本;每个选项作为 query 去 attend 上下文,再经共享点积把"(选项, 上下文)"压成一个 logit,最后在活跃选项数上做 softmax。上下文形如 TASK … / FORM … / ELEMENT Edit "Phone number" value="",选项为每个文档实体加 check/click/skip 三个固定动作。训练数据是 1 万条合成 episode(每表单 2–16 字段、取自 55 个概念目录,并强制注入易混对如 email/street、phone/emergency contact phone),划分按表单字段签名严格不重合。这让"决策"从生成问题变成排序问题,可并行批量打分。
验证机制。 夹具从源码编译启动,覆盖点击、输入、按键、滚动、拖拽、子窗口、编辑器保存等行为格;每格声明动作、寻址方式(无障碍元素或像素坐标)、投递方式(前台/后台)、作用域、界面类型与预期结果(成功或一个精确的结构化拒绝)。报告器拒绝缺行、重复行、未声明结果与证据不全——"环境失败"不能悄悄变成一张更小的绿灯表。
4.4 性能优化手段与设计取舍
容器换启动速度,全 VM 换 OS 保真度。 Linux 容器共享宿主内核、启动快,但内核行为、设备访问与隔离度继承自宿主;全 VM 自持内核与硬件模型,保真度高但慢。选择标准是任务是否依赖"完整客户 OS 的行为",而非性能偏好。
快照未实现,用产物替代。 在 cua-sandbox 0.7.0 中,本地沙箱与 Fleet 创建路径都未实现 Sandbox.snapshot(),Fleet 也拒绝快照派生的镜像输入,替代方案是准备可复用的启动产物并发布到注册表。对需要频繁重置环境做 RL 的团队,这是必须提前规划的点。
把上下文预算花在任务上。 官方强调本地模型吞吐更低、上下文更紧,因此工具 schema、截图与无障碍树大小会直接影响代理能坚持多久;收窄工具面、限制状态读取是变相的性能优化,也解释了 Driver 为何把动作面做小并显式声明拒绝语义。
用小模型替掉一部分大模型调用。 表单场景用 2.8 MB 打分器替换"每步调用大模型",把延迟与成本从"按步数线性增长"改为"一次前向"。代价是适用范围极窄:只能在文档抽取器已找到的 Label: value 实体里选择,不能凭空造值;训练集以英文标签为主,且未用 TypeSafe 的 RLCD 方法校准(官方明示)。
能力悬崖是真的。 Cua-Bench 官网(2026-09-20 抓取)公布 25 个专家编写的 KiCad 电路任务:最好成绩为 Claude Fable 5 的 6/25,Gemini 3.5 Flash、Claude Sonnet 4.5、Claude Haiku 4.5、Gemini 3.1 Pro 各 5/25,Claude Opus 4.8 为 4/25,Gemini 3 Flash 仅 1/25,"没有模型能从空白画布可靠画出一张原理图"。第三方评测(Snorkel,二手)称 Cua-Bench 上最好代理全通过率约 16%;作为参照,OSWorld 有 369 个任务、顶尖 CUA 完成率报道约 45%(Citrix 博客 2025-07,二手),OpenCUA 论文自报 OSWorld 平均成功率 34.8%。同一代理在不同 UI 上方差也很大,社区讨论提到同任务在 Windows 11 与 Windows XP 上可能从 90% 掉到 9%(Hacker News,二手待确认)。
4.5 与其他架构路线的差异
模型自带工具(Anthropic 的 computer-use 工具、OpenAI CUA)把 GUI 能力做进模型,开箱即用但绑定模型、拿不到执行证据;浏览器自动化(browser-use 一类)只覆盖网页,遇到原生应用与系统对话框就断;代码沙箱(E2B 的 microVM、Daytona 的容器)强在跑代码,但默认没有"看得见的桌面 + 无障碍树"半台机器;开放 CUA 模型(OpenCUA 等)解决"谁来当大脑"。Cua 的位置是横切一层:不选模型,提供电脑、UI 工具面与评测设施,让任一类大脑接上同一台机器。
五、应用场景
场景一:桌面客户端的端到端回归测试
痛点:桌面软件(安装、改设置、点菜单、验证可见结果)的传统自动化依赖固定坐标与选择器,界面一改就碎,且很难在 CI 里跑。 做法:在 CI 里用 Sandbox SDK 起一次性 Linux 沙箱,用 code half 装包与备数据,用 GUI half 操作并留证。
import asyncio
from cua import Sandbox, Image
async def main():
async with Sandbox.ephemeral(Image.linux(), local=True) as sb: # 退出即销毁
print((await sb.shell.run("echo hello")).stdout) # code half
# GUI half:截图/点击/输入走同一台机器
asyncio.run(main())
集成要点:Image 里用 apt_install/pip_install/copy 描述初始状态以保可复现;需要"跑完留档"时改用持久沙箱(Sandbox.create(..., name=...) 后 disconnect()),用完显式 destroy()。多平台矩阵(Linux 容器 + Windows VM)可复用同一套 SDK 与任务脚本,减少重复实现。
收益与量化:容器沙箱启动快、可并行;证据面是逐格视频 + 夹具日志 + 像素前后对比,能直接进缺陷单。边界很明确:不要用它替代单元测试(协议层回归更快更便宜);0.7.0 的 snapshot() 本地/Fleet 均未实现,需频繁重置就提前准备启动产物;全 VM 启动慢,不适合每提交一跑。
场景二:给现有编码代理装一只"操作桌面的手"
痛点:团队已为 Claude Code / Codex / Cursor 付了订阅,但要它们操作原生应用、保留登录态、或在系统对话框里完成一步就无能为力。
做法:不换模型,只接 Driver。从官方地址下载安装脚本后执行(macOS/Linux 为 install.sh,Windows 为 install.ps1);随后让代理走 MCP:cua-driver mcp,需要复用已登录浏览器配置时加 --grant existing-profile。集成存在不对称性——Claude Agent SDK 支持在 Python/TS 里用进程内自定义工具直接回调原生 SDK,而 Codex SDK 没有自定义工具回调边界,只能走 MCP。
cua-driver mcp # 给 MCP 型代理
cua-driver call # 给 shell 型代理
export CUA_DRIVER_PERMISSION_MODE=bounded
export CUA_DRIVER_CAPABILITY_MANIFEST_FILE=./manifest.json
export CUA_DRIVER_CAPABILITY_MANIFEST_APPROVED=1
收益与量化:复用既有订阅,零新增模型成本;后台投递在不抢焦点时可边干边用电脑(受平台支持限制)。用本地模型时要留意上下文预算:工具 schema 与截图越大,代理能坚持的步数越少(官方文档明示)。适用边界:macOS 首次需授予辅助功能与屏幕录制权限且授权绑定应用身份;unrestricted 档必须显式确认风险;对"没有 API、界面又经常变"的流程收益最大,反之有稳定 API 的任务不该退化成点界面。排查"点了却没生效"时,第一检查点是浏览器标签页与原生窗口的映射是否被正确绑定——这一层在文档里是显式建模的。
场景三:跨 OS 的 CUA 评测与训练数据生成
痛点:代理在不同 UI 上方差极大,没有可复现评测就没法选型;想自训或微调 CUA,又缺环境和轨迹数据。
做法:用 Cua-Bench 起任务并导出轨迹;sandbox v0.8.0 新增了在 Fleet 上跑 OSWorld 的能力(agent_type="osworld"),可直接复用既有基准镜像。
uv tool install 'cua-bench[browser]'
uv tool run --from 'cua-bench[browser]' playwright install chromium
uv run python -m cua_bench.scripts.benchmark_workers --num_workers 16 --num_steps 10
收益与量化:benchmark_workers 直接输出平均 reset/step/finish 时间,能先确认基础设施吞吐再谈模型效果(16 worker × 10 步即可给出基线);同一批任务既用于评测、又产出训练轨迹,避免评测与训练两套环境的重复建设。KiCad 那组 25 个任务最高 6/25,正是"选型前先量一量"的价值证明。边界:基准本身也会误判——已有研究(arXiv:2607.28367,细节待确认)专论 CUA 评测的误评分与坏任务,把 benchmark 分数当唯一验收标准是危险的。
场景四:本地 macOS/Linux 虚拟桌面机(不污染宿主)
痛点:需要在干净、可反复重置的 macOS 环境里验证安装流程或教代理操作 Mac,但 CI 云上跑 macOS 成本高。
做法:用 Lume 在 Apple Silicon 上从 IPSW 建 vanilla VM,--unattended 预设会自动创建 lume 用户、打开 SSH、开启自动登录并关闭休眠与锁屏:
lume create macos-tahoe --ipsw ~/Downloads/macos-tahoe.ipsw --unattended tahoe
lume run macos-tahoe # 默认凭据 lume / lume
收益与量化:无需 GUI 自动化即可完成初始化,适合作为"一次性克隆种子"——文档称 macOS 端的驱动端到端测试即在停止的 Lume 种子的可抛弃克隆中运行。也就是说,团队可以先把初始化与验收脚本跑通、把这台 VM 当作复用模板,再按任务克隆出干净环境。边界:Sequoia 在首次显示启动时仍可能出现辅助功能设置步骤(issue #2155);依赖 Apple 虚拟化,非 Apple Silicon 主机不适用。
场景五:表单/票据类高精度字段决策
痛点:发票、登记表这类"从文档抽实体、再填进界面"的环节,用大模型逐步推理成本高、且会给出幻觉值。
做法:用 CUA-S1-FORMS 做决策层,一次前向给每个元素打分,执行顺序由代码保证(先填、再勾选、最后一次提交;submit=true 时最多允许一个标签恰为 Submit/Submit Form 的按钮)。
from pathlib import Path
from huggingface_hub import hf_hub_download
from cua_s1.model import load_checkpoint, select_device
w = Path(hf_hub_download("cua-ai/cua-s1-forms", "cua-s1-forms.safetensors"))
hf_hub_download("cua-ai/cua-s1-forms", "cua-s1-forms.json", local_dir=w.parent) # 校验 SHA-256
model, collator, config = load_checkpoint(w, select_device("auto"))
收益与量化:706,048 参数、2.8 MB,合成测试 99.95%、真实 demo 196 个决策 100%、打乱上下文对照 37%;同任务对比托管 Jev 整体 83.6%(本模型 99.7%)。对受监管场景还有一层价值:它不做生成、输出是每个选项的概率,便于留存"为什么选它"的审计痕迹。边界:只能在已抽取实体中选择、不能创造值;真实世界表单验证不足(仅 196 个决策的 demo 集);英文标签为主;加载器出于安全考虑拒收 pickle 检查点。
六、快速上手
最省事的路只有三步,且都不需要 GPU:
- 给现有代理加桌面能力:从官方地址下载并执行安装脚本(macOS/Linux 的
install.sh或 Windows 的install.ps1),然后执行cua-driver mcp接入 MCP 型代理。 - 起一台隔离电脑:前往 run.cua.ai 领取 Fleet 凭据,认领一台 Linux 桌面,用 Sandbox SDK 在其中执行命令、截图与操作界面;结束时注意"释放认领 ≠ 删除池"。
- 建评测任务:
uv tool install 'cua-bench[browser]',再执行uv tool run --from 'cua-bench[browser]' playwright install chromium,即可跑通一个无需 VM、Docker 与模型 key 的模拟任务。
最小验证建议:先用教程里的"让代理在计算器里算 6 × 7 并确认显示 42",确认权限、截图与输入链路都通,再上真实任务。
七、横向对比
| 维度 | Cua(trycua/cua) | 模型自带计算机使用工具(Anthropic / OpenAI CUA) | 代码沙箱(E2B / Daytona) | 浏览器自动化(browser-use 一类) | 开放 CUA 模型(OpenCUA 等) |
|---|---|---|---|---|---|
| 提供什么 | 电脑 + GUI 工具面 + 评测/数据管线 | 模型内建的 GUI 动作能力 | 跑代码的隔离运行时 | 网页内的代理控制 | 可自训/自部署的大脑 |
| 模型选择 | 任意(BYO,可本地) | 绑定该厂商模型 | 与模型无关 | 与模型无关 | 权重开放 |
| 操作系统覆盖 | macOS / Windows / Linux,容器 + 全 VM(另含 Android 路径) | 视厂商实现 | 多为 Linux | 浏览器内 | 不涉及 |
| 可见桌面/无障碍树 | 有(截图 + AX/UIA/AT-SPI) | 有(多为截图) | 通常无桌面 | 仅 DOM/页面 | 不涉及 |
| 证据与可审计 | 7 类独立 oracle + 逐格视频留存 | 黑盒 | 无桌面级证据 | 有限 | 论文/自评 |
| 成本结构 | 自付推理;含 2.8 MB 小模型降本路径 | 按 token 计费 | 按沙箱时长/资源计费 | 自付推理 | 自付训练与推理 |
| 授权 | MIT(部分组件另有条款) | 商业条款 | 商业条款 | 多为开源 | 视项目 |
补充口径:E2B 常被描述为 Firecracker microVM、Daytona 为 Docker 容器(单沙箱默认规格各约 4–8 vCPU、8 GB 级,第三方评测,待确认)。Cua 是少数同时覆盖"可见桌面 + 无障碍树 + 全 VM + 评测设施"的方案,代价是自建与运维成本更高。
八、局限、风险与社区观察
年轻且演进快。 仓库 2025-01 创建,在这个多语言单仓里 Driver 已到 0.28.x、Sandbox 到 0.8.x,并每天产出 nightly 构建。接入生产应锁定版本并阅读对应版本的限制页(例如 snapshot() 未实现、Fleet 拒绝构建层与快照派生镜像)。
Issue 余额高。 1,029 个开放 issue,平台差异(Hyprland、Windows 会话、macOS TCC 授权、Sequoia 首次启动)仍在打磨。"只在被测平台通过证据的格子才算支持"值得赞赏,但也意味着支持矩阵阶段性偏窄——上线前务必对照平台支持页。
License 与合规要分开看。 仓库整体 MIT,但第三方组件各有条款(Kasm MIT、OmniParser CC-BY-4.0),可选的 cua-agent[omni] 会引入 AGPL-3.0 的 ultralytics;CUA-S1 源码 MIT 不覆盖未来权重、数据集与托管服务,官方已预告某些检查点可能"研究可用、生产需另行签约"。企业引入必须逐件核对。
安全模型是"防误配"导向,但不是零风险。 三档权限模式、清单审批、Windows 管道 SID 校验、本地 HTTP MCP 监听器默认关闭且需 32–4096 字符 token、后台动作不得抢焦点,都在降低"代理误操作"概率;但 CUA 天然与你的文件、账号、登录态共处,官方也要求最小权限、后果性动作需确认、不可信任务隔离。用宿主真机跑不可信任务仍是最常见的错误用法。
评测的独立性有限。 Cua-Bench 与官方基准多由项目方发布(第三方复现较少),而 CUA 评测本身已被研究指出存在误评分问题;"能力悬崖"的结论可信,具体分数宜当趋势而非定论。
九、小结与行动建议
Cua 的价值不在于把模型变强,而在于把"代理如何安全、可验证地操作一台电脑"这件脏活工程化:Driver 提供带证据链的 GUI 工具面,Sandbox/Fleet 提供可复现的隔离电脑,Cua-Bench 提供可量化的评测与轨迹,CUA-S1 演示了把一步决策下沉到 2.8 MB 小模型的降本路径。给落地者的建议:
- 先做 15 分钟可行性验证:安装 Driver,接上已有的 Claude Code/Codex,用"计算器 6 × 7 = 42"这类带独立验证的任务跑通权限与截图链路。
- 按动作面选工具,而不是一把梭:能写代码就写代码、有 API 就调 API,只在"没有别的接口"时才落到 GUI——官方文档本身就这么建议。
- 权限从
bounded起步:用清单声明允许的工具与资源,只在受控环境放开unrestricted;把"后果性动作需确认"写进代理指令。 - 把评测当交付物:用 Cua-Bench 建 10–20 个业务真实任务(含一个"应当拒绝"的负例),固化轨迹与通过率,再谈扩展。
- 算清环境账:需要频繁重置就避开未实现的
snapshot(),改用预构建启动产物;用 Fleet 时明确"认领释放"与"池删除"是两件事,避免为暖容量持续付费。
资料来源(抓取日期 2026-09-19 至 2026-09-20):GitHub Trending daily/weekly 页与 GitHub REST API(仓库元数据、Releases、目录结构);仓库 README 与 libs/cua-driver/README.md、libs/cua-s1/README.md、libs/cua-bench/README.md、libs/lume/README.md;官网文档 cua.ai/docs/concepts/ 下 what-is-computer-use、how-sandboxes-work、sdk-mcp-and-hosting、how-cua-driver-is-validated、how-permission-policies-work 等页,以及 cua.ai/docs/how-to-guides/sandbox/manage-local-lifecycle;Cua-Bench 官网 cua.ai/cuabench(KiCad 任务榜)与第三方评测(Snorkel,二手);Hugging Face 模型卡 cua-ai/cua-s1-forms;YC 公司页、LinkedIn 与第三方融资数据库(部分待确认);arXiv:2607.28367(CUA 评测误评分,待确认细节);OSWorld 与 OpenCUA 数字来自第三方报道与论文摘要(二手)。凡属二手转引、估算或口径不一致的数字,文中均已标注"待确认"。
读者留言
COMMENTS 暂无还没有留言,来说第一句?