文章摘要
近期,吴恩达与Rohit Prasad联合开源桌面端AI Agent工具OpenWorker,上线一周获超1.1万星标。它能直接交付成果,运行在本地设备。采用四层架构,预置30款大模型。其亮点是分级权限系统,解决了权限管理问题。目前处于公测,有Mac和Windows版,适合关注隐私、想改造框架的团队和开发者,可源码部署或下载客户端。

近期,AI领域知名学者吴恩达与前亚马逊Alexa首席科学家Rohit Prasad联合开源了一款桌面端AI Agent工具OpenWorker。这款采用MIT开源协议的免费工具上线仅一周,便在代码托管平台收获了超过1.1万颗星标,引发了开发者和AI爱好者的广泛关注。

项目地址:https://github.com/andrewyng/openworker
官网下载:https://openworker.com

这款工具的核心定位非常清晰——它并非传统的聊天式AI助手,而是能够直接交付可用成果的本地AI协作伙伴。用户只需要告知其需要完成的目标,比如“帮我整理本周的会议纪要并生成明日客户沟通简报”“分类梳理Slack指定频道的聊天记录”“自动整理我的本周日历安排”,OpenWorker会自主拆解任务、跨工具执行流程,最终直接交付可直接使用的成品文件,而非一段对话或待办清单。值得注意的是,在执行任何带有潜在风险的操作前,比如发送消息、修改日历、运行命令行脚本,工具都会主动暂停并请求用户确认,只有得到用户许可后才会继续执行。

本次开源项目的两位主创背景实力雄厚:吴恩达是全球知名的AI教育与投资领域标杆人物,同时也是DeepLearning.AI创始人、AI Fund管理合伙人、斯坦福大学教授以及亚马逊董事会成员;另一位主创Rohit Prasad曾担任亚马逊Alexa首席科学家,后续升任亚马逊AGI团队负责人,直接向亚马逊CEO Andy Jassy汇报,于去年年底离开亚马逊,拥有十亿级设备上AI Agent交互的丰富工程经验。

四层本地部署架构

OpenWorker的技术栈采用四层本地部署架构,所有运行流程都在用户本地设备完成,无需依赖云端服务:

┌────────────────────────────────────────────────┐
│           OpenWorker desktop app             │  Tauri 2 + React 18
├────────────────────────────────────────────────┤
│           local agent server (Python)         │  FastAPI · 127.0.0.1:8765
├───────────────┬────────────────┬───────────────┤
│   your files  │   your tools  │   your model  │  25+ 集成 + MCP
│   & terminal   │  25+ connectors│   any provider│  30+ 预置模型 + Ollama
└───────────────┴────────────────┴───────────────┘

最上层是桌面应用外壳,基于Tauri 2和React 18构建,负责提供用户可见的桌面应用窗口,其中Tauri处理原生容器逻辑,React负责UI界面的渲染。

第二层是本地Agent服务器,由Python编写,采用FastAPI + uvicorn框架,默认绑定本地地址127.0.0.1:8765,作为整个系统的核心,负责任务规划、工具调用以及记忆管理等核心逻辑。

第三层是能力与连接器层,包含本地工具和远程集成能力:本地工具涵盖文件系统操作、Git版本控制、ripgrep文本搜索以及终端命令执行;远程集成支持超过25款主流协作工具,包括GitHub、Slack、Jira、Notion、Linear、HubSpot、Outlook、monday.com、Gmail以及Google Calendar等,同时支持通过MCP协议接入更多自定义工具。

最底层是模型路由层,该模块用到了吴恩达团队开源的aisuite轻量级Python库,能够提供跨大语言模型厂商的统一chat-completions接口,同时支持Agent层、工具层以及MCP协议。OpenWorker官方文档中明确提到,如果开发者想要自行搭建Agent框架,可以优先参考aisuite项目,OpenWorker本身就是该库的一个参考实现。

在模型支持方面,OpenWorker预置了30款经过工具调用验证的大模型,覆盖OpenAI、Anthropic、Google Gemini、DeepSeek、Kimi、GLM、Qwen、MiniMax、Mistral、xAI Grok等主流厂商,同时支持Together和Fireworks平台的开源权重模型,以及通过Ollama运行的本地模型。最新的v0.1.7版本还新增了AWS Bedrock、Google Vertex AI、OpenRouter和Meta Muse Spark的支持,用户只需要填入对应模型的API密钥即可自由切换使用。

分级权限设计:为AI安全量身打造

OpenWorker最值得关注的设计亮点之一,是其针对AI Agent安全设计的分级权限系统,解决了当前多数AI Agent工具在权限管理上要么过于粗放要么过于繁琐的问题。

首先,工具会将每一次操作划分为四个风险等级:

  • read:读取类操作,无任何副作用,会自动通过执行

  • write_local:本地写入操作,限定在用户指定的工作区路径范围内

  • exec:命令执行操作,包括终端脚本运行等

  • external:外部交互操作,比如发送消息、调用外部API、修改日历等

在此基础上,OpenWorker提供了五种权限模式,适配不同的使用场景:

  • discuss与plan模式:纯只读模式,AI仅会分析任务需求,不会执行任何实际操作

  • interactive模式:默认模式,读取操作自动通过,写入、执行以及外部交互操作都需要用户手动确认

  • auto模式:允许所有操作,但仍限定在工作区路径范围内

  • custom模式:用户可以自行指定哪些工具或操作可以自动放行,无需额外确认

该项目有一个反直觉但非常实用的设计:无人值守模式并不会提升AI Agent的自主权限上限。也就是说,当用户设置定时任务让OpenWorker在后台自动运行时,如果遇到需要确认的操作,工具不会自行做主执行,也不会跳过该步骤,而是将确认请求放入收件箱并暂停当前会话,等待用户回来处理后再继续。多数AI Agent框架会将“用户是否在场”和“Agent可执行的权限”绑定,用户不在场时默认开放更高权限,而OpenWorker则将这两个维度拆分:用户不在场仅会改变AI的通知方式,不会扩大其可执行的操作范围,且所有shell命令在任何模式下都必须经过用户确认,没有例外。

产品现状与适用人群

目前OpenWorker处于公开测试阶段,Mac版本已经正式上线,完成了签名公证并支持自动更新;Windows版本提供了适配Windows 10和11的安装包,但尚未完成代码签名,安装时可能会触发SmartScreen安全警告;暂未推出Linux版本,也没有中文界面支持。

从代码规模来看,OpenWorker是一个具备完整工程结构的产品级代码库:coworker目录下包含约119个Python文件,总计约32400行代码;surfaces/gui目录下有约149个TypeScript/TSX文件,加上78个后端测试模块。项目仍在快速迭代,自7月23日发布以来,已经更新至v0.1.7版本,新增了自动上下文压缩、Token用量显示以及Anthropic模型的prompt缓存等功能。项目官方也提到,团队内部有明确的开发计划,不会接受所有方向的PR贡献。

与Claude Cowork和ChatGPT Work等商业化AI协作工具相比,OpenWorker的核心优势在于开源免费、本地优先部署以及模型无关性。对于关注数据隐私、希望自主改造Agent框架的团队和开发者来说,这款工具是非常理想的选择。

源码部署方式

如果想要从源码编译运行OpenWorker,需要先准备好Python 3.10+和Node 20+的开发环境,具体步骤如下:

git clone https://github.com/andrewyng/openworker
cd openworker
# 初始化开发环境,创建.venv虚拟环境
bash packaging/setup_dev_env.sh
# 启动本地Agent服务器
.venv/bin/openworker-server --cwd ~/your/project --port 8765
# 新开一个终端,启动UI界面
cd surfaces/gui
npm install
npm run dev

如果想要运行完整的桌面应用而非浏览器版UI,还需要安装Rust工具链,并将最后一步的启动命令替换为`npm run tauri dev`。

对于普通用户来说,也可以直接访问openworker.com下载桌面客户端,安装完成后填入对应大模型的API密钥即可直接使用。

项目地址:https://github.com/andrewyng/openworker
以上内容不代表本平台立场,仅供读者参考