模型 / 官方
以 WorkSpace 为核心的智能体生产平台
PilotDeck 是由清华 THUNLP、ModelBest、OpenBMB 与 AI9Stars 联合开源的智能体操作系统,以 WorkSpace 为基本单元对每个项目的文件、记忆与技能进行完全隔离,并原生支持 Model Context Protocol,跨 Web、命令行与即时通讯前端保持一致体验。它围绕白盒记忆、智能路由与后台常驻三条主线设计:记忆可逐条追溯与编辑,任务可按难度自动分配不同模型,代理可在用户离席后继续发现任务并把结果落到本地文件。官方数据显示,在小红书类社媒运营中启用智能路由可节省约 70% 成本,在七项复杂任务上其“强主力 + 轻子代理”路由以约六分之一的成本追平或超过单前沿模型。项目在 GitHub 获 3.8k 星、393 次 Fork,目前仍处于早期迭代阶段。
PilotDeck 是一个由清华 THUNLP、ModelBest、OpenBMB 与 AI9Stars 联合发起的开源智能体操作系统,以 WorkSpace 作为基本组织单元,对每个项目的文件系统、记忆库和技能集做完全隔离,从而让并行运行的任务互不污染,检索范围可控,技能随任务沉淀而非混入全局上下文。
围绕智能体在多任务长期协作中的痛点,平台提出三条核心能力。第一是白盒记忆,记忆的生成、抽取、存储与检索全程可查看,出现错误时可以直接定位并修改对应条目,内置的 Dream Mode 还能在空闲时段整理记忆并支持一键回滚。第二是智能路由,系统自动判断任务难度,复杂调用交给旗舰模型,简单任务下沉到轻量模型,再配合端云协同编排以压缩 token 成本。第三是后台常驻,智能体不再局限于“一问一答”,用户离席后仍可主动发现候选任务、运行长周期监控,并把交付物以本地文件形式落地。
官方给出的实测数据印证了智能路由的经济性。在小红书类社媒运营工作流中,开启路由后单次任务成本约 2.83 美元,相比全部使用旗舰模型的 12.58 美元节省近 70%。在七项涵盖多语种播客推送、多源数据报告、领域文献综述、代码库架构文档等复杂任务的基准中,强主力搭配轻量子代理的组合以 3.15 美元的成本得到 70.6 分,单前沿模型 Claude Sonnet 4.6 以 18.36 美元得到 69.1 分。
记忆机制上,官方对比了黑盒智能体与 PilotDeck 白盒记忆的差异:黑盒方案中用户看不到 AI 究竟记住什么,写入后也无法编辑或删除,出现问题时难以追溯根因;白盒方案则允许查看每条记忆的存储内容与时间归属,对关键决策可以置顶锁定,从生成到检索全链路可审计,避免不同 WorkSpace 之间的风格与排版串味。
工程层面,仓库同时提供英文与简体中文文档、Docker 镜像、源码安装脚本以及 pnpm 工作区配置,前端覆盖 Web、命令行与即时通讯三类入口,跨端行为一致。官方将 WorkSpace 视为对智能体“生产力”边界的一次增量探索,把多项目并行、长周期执行与成本可控作为主要解题方向,而非替代 IDE 编程助手或桌面知识工作场景。
社区层面,PilotDeck 于 2026 年 5 月 28 日正式开源,GitHub 仓库已积累 3.8k 星与 393 次 Fork,提交数超过 1362 次。项目明确欢迎贡献、反馈与 Star,目前仍处于早期快速迭代阶段,后续路线将围绕记忆精度、路由策略与后台任务的可靠性继续推进。
要点
- PilotDeck 由清华 THUNLP、ModelBest、OpenBMB 与 AI9Stars 联合开源,定位为面向多任务并行的智能体生产平台。
- 三大支柱是白盒记忆、智能路由与后台常驻,原生支持 MCP 并覆盖 Web、命令行与 IM 前端。
- 智能路由在社媒场景可降低约 70% 成本,在复杂任务上以约六分之一成本追平或超过单前沿模型。
- 白盒记忆允许逐条查看、编辑与置顶,解决黑盒智能体跨项目记忆串味的痛点。
- 项目已于 2026 年 5 月开源,GitHub 获 3.8k 星,仍处于早期迭代阶段。
原始标题:OpenBMB/PilotDeck — Task-oriented AI Agent productivity platform
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。