腾讯 WorkBuddy 效率智能体应用师认证笔记

从产品认知、对话技巧、职场实战到企业智能体治理,一篇串起六大考试模块

Posted by iceyao on Sunday, July 26, 2026

一、先看考试:这张证书到底考什么

官方指南:腾讯 WorkBuddy 效率智能体应用师认证考试指南

适用人群:希望用 AI 智能体提升个人或团队效率的职场人士,以及负责企业智能体构建与治理的开发者。

本文依据 2026 年 7 月 24 日更新的官方指南和课程笔记整理。产品界面、考试安排可能调整,报考前应再核对官方页面。

这门考试表面上在考 WorkBuddy 的功能,实际考的是一条完整能力链:先理解 Agent,再把它用到读、写、分析等日常工作中,随后扩展专家、Skill、连接器和自动化,最后处理安全、权限、资产和组织治理。

官方考试为线下理论考试:简体中文,60 道题,其中单选 40 道、多选 20 道;考试时长 120 分钟,满分 100 分,70 分通过。多选题错选或漏选都不得分,理论考试成绩在考试后 3 天内公布。官方指南没有公布各题型单题分值,也没有承诺各模块固定题量,因此不宜把知识占比机械换算成题数。

WorkBuddy 认证考试地图

六个模块的权重可以分成三档:

复习优先级 模块 占比 应掌握到什么程度
第一档 高效对话技巧、职场实战应用 20% + 20% 能判断、能写 Prompt、能选择工作流
第二档 进阶功能探索、安全与合规 18% + 18% 能区分概念、能识别风险和权限边界
第三档 初识 WorkBuddy、企业智能体构建与管理 12% + 12% 熟悉产品结构,理解组织级资产与治理

如果复习时间有限,先拿下中间四个模块。它们合计占 76%,也是最容易通过场景题、多选题交叉考查的部分。


二、初识 WorkBuddy:从「会回答」到「能完成」

2.1 Agent 补上了大模型的执行环节

AI 的能力演进可以粗略分成四步:规则驱动、数据驱动、语言驱动,再到智能体。大语言模型擅长理解和生成,却有四个天然短板:不能直接动手、默认不能连接外部系统、没有可靠的长期记忆、执行过程缺少权限约束。Agent 用自主规划、工具调用、持续记忆和权限管控补上这些缺口。

从语言模型到可执行智能体

因此,WorkBuddy 的四重身份不是四个彼此独立的宣传词,而是同一产品在不同视角下的描述:

  • 对企业,它是可管理的 AI 智能体;
  • 对岗位,它是承担任务的数字化员工;
  • 对任务,它是自主任务执行者;
  • 对结果,它是工作效率引擎。

考试遇到产品定位题时,先判断题干站在哪个视角,不必死记整句话。

2.2 个人体验、个人订阅与企业版

版本 主要特点 适合场景
体验版 免费试用、基础积分额度,高频使用可能限频 初次体验、低频轻任务
订阅用户 解锁更多模型与完整功能,额度更高,按场景调度模型 个人高频办公和内容生产
企业版 增加组织架构、企业知识库、资产管理、安全审计等能力 团队复用、权限治理、成本管理

个人版与企业版的分界不在于「模型更聪明」,而在于能力能否被组织复用,以及管理是否可见、可控、可追溯。

WorkBuddy 可从 官网工作台 进入。登录后,主界面可以按六个区域记忆:

  1. 功能导航栏:所有功能的入口。「新建任务」是起点;「助理」管理远程控制;「项目」组织项目空间和团队协作;「专家」包含技能市场和连接器;「自动化」设置定时任务;「更多」中还有我的文件、腾讯文档、ima 知识库、乐享知识库和灵感;
  2. 任务列表:历史任务按时间排列,点击切换,右键可以重命名或归档;
  3. 对话区域:顶部可切换日常办公、代码开发和设计创意,中部展示文档处理、金融服务等场景卡片,底部是输入和工具区;
  4. 快捷模板:切换场景后展示文档处理、文本改写等对应卡片,点击即可发起任务,不必从零写指令;
  5. 输入框:支持打字、粘贴截图和拖入文件,Enter 发送,Shift + Enter 换行,@ 引用对话文件,/ 调用技能和指令;
  6. 底部工具栏:切换 Craft / Plan / Ask 工作模式、Auto 模型、技能、连接器和默认权限。

2.3 模型怎么选:先 Auto,再按任务特征切换

模型 出品方 优势与适用任务
Auto 系统调度 根据任务复杂度、上下文长度和多模态需求自动选用模型,拿不准时优先选
DeepSeek 深度求索 综合能力强、推理快,适合日常任务;Pro 版能力更强,Flash 版更轻更快
混元 腾讯 中文理解突出,与腾讯文档、企业微信、腾讯会议等腾讯生态配合顺畅
GLM 智谱 AI 中文长文本处理较好,支持文字和图片的多模态任务
Kimi 月之暗面 适合一次读取和总结超大文档、海量材料
MiniMax 稀宇科技 轻量快速,简单问答响应快,复杂任务能力相对有限

这张表适合作为场景题的判断依据,不要把模型标签理解成绝对排名。真实使用时,模型能力和产品调度策略都会更新。

推荐设置不要只背功能名称,还要记住入口和权限原则:

功能 路径 设置建议
技能自动更新 设置 → 通用 自动升级 Skills,避免旧版本能力不一致
锁屏远程 设置 → 通用 确有远程需求时开启,避免电脑休眠导致任务中断
对话记忆 设置 → 通用 提取并保留关键信息,让后续任务关联个人偏好
系统权限 设置 → 权限管理 文件读取、浏览器控制、辅助功能按实际任务开启
沙箱模式 设置 → 通用 默认保持开启,让 AI 操作运行在隔离环境中
文件权限 任务授权范围 日常只操作工作目录;需要目录外文件时临时开放,用完切回

原始课程建议将系统权限全部打开,以获得完整功能体验;从安全角度,实际使用仍应遵守最小授权,只开放当前任务真正需要的能力。

2.4 Ask、Plan、Craft:用风险和确定性做选择

三种模式的判断可以压缩成三个问题:

  1. AI 只需回答,不需要操作文件或应用?用 Ask
  2. 需要执行,但需求、步骤或影响范围还不够明确?用 Plan
  3. 流程已经清楚,风险可控,希望直接完成?用 Craft

Ask、Plan、Craft 模式选择

模式 权限级别 执行逻辑 典型任务
Ask 只读,不操作文件 以单次推理和问答为主 解释概念、讨论方案、润色建议
Plan 先只读,用户确认后解锁写入 先规划、纠偏,再按清单执行 架构调整、复杂 PPT、跨文件改造
Craft 在授权范围内可读写文件 Agent 自主调用工具并循环迭代 批量处理、明确的文件修改、固定流程

Plan 的价值是把「规划」单独拿出来,减少传统 AI 直接执行带来的偏差和返工。完整流程包括:

阶段 具体动作
需求澄清 用 1—2 轮关键问题对齐技术栈、功能范围和项目约束
方案生成 形成需求分析、技术方案、视觉设计和任务清单
编辑确认 用户调整方案,在执行前纠偏,避免后期重构
方案执行 按任务清单逐步执行,反馈进度,并允许暂停调整
方案归档 将方案保存为 Markdown 文件,作为项目知识复用

架构级改动先用 Plan,局部且明确的调整用 Craft;两种模式可以在同一任务中切换,并非互斥。


三、高效对话:Prompt 只是入口,上下文才是工作台

3.1 Token、上下文和三层记忆

LLM 的基础行为是根据已有 Token 预测下一个 Token。输入越明确,模型需要猜的部分越少。分词规则会直接影响模型理解语义;中文存在多音字和词组组合,切分通常比英文更依赖上下文。BERT、GPT 等不同模型或模型家族的分词逻辑也不完全相同,因此不要用「一个汉字等于一个 Token」这类简单公式估算所有模型。

对话历史也不是人类意义上的记忆。模型通常是在当前上下文窗口中重新读取前文,这更像短期工作记忆。WorkBuddy 的长期记忆可以按作用域理解:

层级 位置 作用域 适合保存
云端记忆 服务端 跨设备 用户画像、历史对话索引
本地记忆 用户配置目录 跨项目 长期偏好、使用习惯、工具记录
工作空间记忆 当前工作区 当前项目 项目笔记、工作日志、项目约束

判断一道记忆题时,先看「是否跨设备」,再看「是否跨项目」。

3.2 温度与幻觉:流畅不等于可靠

温度越高,输出通常越有变化;温度越低,结果更稳定,但不能因此保证事实正确。课程笔记中,Ask 模式默认使用中等温度;Craft 执行关键操作时可能自动降低温度,减少操作出错。用户要求「正式」「简洁」「友好」,也会间接改变词语选择和输出发散程度。

处理幻觉有三个固定动作:联网检索后打开原始链接;数字、日期、人名至少回到一手来源核对;遇到不确定结论,直接追问来源和证据。尤其要区分「500 万」和「不超过 500 万」,摘要中丢掉一个限定词,意思就变了。

3.3 Prompt 四要素和三阶段优化

一个可执行的 Prompt 至少交代四件事:

角色 + 背景 + 任务 + 格式

例如:

你是项目运营负责人。我们要向不熟悉技术的业务负责人汇报本周进展。
请根据附件中的任务记录,按「完成成果、数据亮点、风险、下周计划」整理周报。
控制在 600 字内,语气简洁,所有没有来源的数字标注为「待核实」。

Prompt 可以分三轮优化。与其写「请输出得专业一点」,不如明确告诉模型下一步该增加什么信息。

阶段 操作 作用 示例
第一阶段:搭骨架 明确角色、背景、任务、格式 防止任务方向跑偏 「我是 HR,需要一份新员工入职培训计划,按周输出,用表格呈现。」
第二阶段:加约束 补充字数、风格、禁止事项和验收要求 缩小发挥空间,提高精准度 「控制在 500 字内,正式语气,不包含薪酬具体数字。」
第三阶段:给范例 提供参考样本或输出模板 让模型模仿目标结构 「参考格式:第 1 周:入职手续(事项 A/B/C)。」

3.4 追问不是补救,而是正常工作流

策略 适用场景 追问示例 效果
要求细化 回答太笼统、缺少细节 「第 2 点能否展开,给出具体执行步骤?」 补足操作细节
换个角度 需要多视角或风险评估 「如果预算减半,方案怎么调整?」 获得备选方案和取舍
请求举例 理论太多,无法落地 「用我们行业的实际业务场景举个例子。」 把抽象方法落到场景
质疑验证 判断可靠性、查找盲点 「这个方法有什么潜在风险?」 暴露限制和反例
格式转换 内容已对,交付形式不对 「把刚才内容整理成表格或 PPT 大纲。」 直接产出可用格式

3.5 用语气指令控制交付风格

同一件事换一种语气,收件人的感受和行动意愿会明显不同。语气要求最好同时说清对象和场景。

语气类型 适用对象 指令关键词 示例场景
正式商务 客户、领导、合作伙伴 「用正式、专业的语气」 客户方案邮件
友好亲切 同事、团队内部 「用轻松、友好的语气」 团队通知、内部沟通
简洁直接 紧急事务、快速同步 「用简洁、直接的语言」 进度同步、问题反馈
委婉礼貌 拒绝请求、提出建议 「用委婉、礼貌的方式」 拒绝需求、提出改进建议

3.6 四类高频场景的指令公式

场景 指令公式 使用提示
文档 上传材料 + 指定动作 说明摘要、比较、翻译还是提取信息
写作 类型 + 目的 + 核心信息 + 语气 再补收件人、篇幅和结构
数据 数据范围 + 分析目标 + 输出形式 写清口径、空值和异常值处理方式
搜索 主题 + 时间范围 + 来源要求 + 输出格式 要求保留链接,并打开关键来源验证

四、职场实战:把任务拆成「读、写、析」

职场任务看起来零散,多数可以归入三条主线:先读懂材料,再写成交付物,最后通过数据或多来源比较形成判断。真正影响结果的,不是多写几句「请认真分析」,而是明确关注维度、输出结构和验证动作。

WorkBuddy 读写析工作流

4.1 「读」:先决定为什么读

目的 读法 Prompt 关键词 输出
先判断是否值得精读 速览 「300 字总结结论、依据和风险」 一分钟摘要
全面理解并归档 精读 「按章节提取,每章 3—5 个要点」 结构化笔记
只找一个问题 定向 「只提取预算、排期和责任人」 目标信息清单

双文档比较不要默认逐字找不同。先说清楚关注排期、预算、人员还是条款,再让 AI 标记变化。多文档比较则要找共识和分歧:三份材料都支持的结论可以提高信任度,只有单一来源提出的判断要保留来源标签并谨慎采用。文档对比的价值不是列出越多差异越好,而是找出会影响当前决策的变化。

外文翻译适合三步走:

步骤 做什么 Prompt 示例
快译 快速看懂大意 「翻译成中文,不用追求文采。」
精修 指定术语和风格 「甲方统一译为 Party A,保持正式商务风格。」
校对 回到原文核实关键信息 「金额、日期、人名必须逐项对照原文。」

批量文件处理可以交给 Craft,但应先复制少量样本验证规则,避免直接处理唯一原件。

场景 常见岗位 指令示例
格式转换 行政 「把发票文件夹里的所有 PDF 转成图片。」
批量重命名 运营 「按『日期-项目名-版本号』重命名这 50 个文件。」
文件归类 所有人 「把下载文件夹里的文件按类型分到不同子文件夹。」
合并拆分 文职 「把客户文件夹里的所有 Word 合并成一个 PDF。」

跨文档问答的前提是资料边界清楚。资料库支持多种数据源,指定文件夹或知识库后即可检索。要求回答附来源;检索不到时明确返回「资料中未找到」,不要让模型凭常识补齐。

4.2 「写」:结构比文采更重要

邮件至少交代收件人、目的、核心信息、语气和篇幅。少一个,模型就多猜一层。

邮件要素 如果不说清楚 可能的后果
收件人身份 只说「帮我写封邮件」 不知道写给领导、同事还是客户,语气容易错
邮件目的 只说「帮我回复一下」 无法判断是通知、请求、感谢还是拒绝
核心信息 没有时间、金额、事由 AI 只能猜测,后续反复修改
语气要求 未交代 可能太冷硬,也可能过于随便
篇幅限制 未限制 容易冗长,重点被淹没

汇报可以固定成四个模块:完成成果、数据亮点、遇到的问题、下阶段计划。直接告诉 AI「按这个结构组织」,比泛泛地说「帮我写周报」有效。

我是[岗位],汇报对象是[上级]。
我做了:[列出事项,越具体越好]
数据:[有什么数据就写什么]
请按照「完成成果 → 数据亮点 → 遇到的问题 → 下阶段计划」的结构,
整理成[周报/月报],突出[核心亮点],控制在[X]字。
没有来源的数据不要补写。

PPT 生成通常跨越大纲、页面内容、视觉布局和文件导出,适合使用 Plan,完整流程是:

准备工作空间 → 选择 PPT 功能或加载 pptx 技能
→ 输入主题、受众、时长、数据和风格
→ AI 生成大纲 → 人工审查并修正大纲
→ 生成完整页面内容 → 导出 .pptx 或 .html

一份已核实的工作总结可以继续派生出三种交付物:

原始素材:一份完整的工作总结 + 数据
    ├──→ 邮件版:150 字,供老板快速了解
    ├──→ 周报版:完整四模块,用于团队存档
    └──→ PPT 大纲版:5 页,用于周例会汇报

这里的重点不是在一个指令里同时要求三种交付物,而是复用同一份已核实素材,分任务产出,减少目标竞争和上下文干扰。

4.3 「析」:先说分析目标,再选图

分析类型 Prompt 示例 得到什么
基础统计 「计算 A 列总和、平均值、最大值,说明空值处理方式。」 汇总数据
分组对比 「按 B 列分组,统计各组数值和占比。」 分类洞察
趋势判断 「分析月度数据变化趋势,找出拐点。」 趋势结论
查找异常值 「找出明显偏高或偏低的记录,不要直接删除。」 数据质量清单

图表选型取决于数据关系,而不是哪种图更好看:

要展示什么 图表 Prompt 示例
比大小:各部门完成情况 柱状图 「用柱状图对比各部门 Q1 指标完成情况。」
看趋势:近 12 个月变化 折线图 「用折线图展示月度数据变化趋势。」
看占比:各分类分布 饼图或条形占比图 「用图表展示各类别占比。」
看流程:审批或项目阶段 流程图或时间轴 「生成项目各阶段的时间轴图。」

图表只是表达,分析前仍要核对数据范围、单位、缺失值和口径。

行业研究可以按「搜、读、整」完成:

步骤 实际操作 参考耗时 AI 产出
「联网搜索 XX 最新动态:规模、主要玩家、近期大事、政策动向,整理成表格并标注来源。」 约 30 秒 结构化汇总表
打开来源核对 1—2 个关键数据,再问「最关键的两个趋势是什么?」 约 2 分钟 两个核心判断及来源
「基于以上信息写 400 字汇报要点:先给结论,再展开趋势,最后给建议。」 约 30 秒 可用于汇报的要点

表中的耗时是原笔记给出的参考值,实际取决于网络、材料数量和任务复杂度。

方案对比应明确维度、逐项判断优劣,并单列建议依据和不确定因素:

对比以下两个方案:
方案 A:[要点]
方案 B:[要点]

从以下维度分析:
① [维度 1]:哪个更优?为什么?
② [维度 2]:哪个更优?为什么?
……

最后给出建议,并标注建议依据和不确定因素。

4.4 五个最常见的坑

错误 问题 改法
摘要后不核原文 限定词、数字容易失真 金额、日期、人名回原文确认
对比前不说维度 得到大量无关差异 先指定排期、人员、费用等关注项
写作不给结构 输出内容齐全但不可用 提供四模块、五要素或页面大纲
数据冲突不标注 AI 可能擅自选择一个来源 要求列出冲突,不替人做决定
一次塞入多个交付物 目标竞争、上下文混乱 一个任务一个对话,复用已核实素材

五、进阶能力:专家、Skill、RAG 和 MCP 各管一层

5.1 四个概念不要混

概念 一句话解释 解决的问题 WorkBuddy 对应功能
MCP AI 与外部系统通信的标准协议 模型默认无法访问业务系统 连接器
Skill 给模型使用的操作手册和工具包 模型知道怎么说,却未必知道怎么做 技能安装、自定义技能
RAG 先检索资料,再基于资料回答 训练数据不够新、不覆盖私有知识 资料库、知识库
专家模式 用系统提示注入领域角色、方法和边界 通用回答缺少岗位方法论 专家切换、自定义专家

WorkBuddy 能力组装栈

遇到能力不足时,可以沿三条路线升级:

痛点 具体表现 升级路线 入口
不够专业 回答像教科书,缺少行业方法 切换专家 左侧「专家」→「专家」标签
能力缺失 需要生成配图或处理文件,AI 无法执行 安装 Skill 左侧「专家」→「技能」标签
系统隔离 需要查邮件或读业务文档,AI 无法访问 配置连接器 左侧「专家」→「连接器」标签

若问题是「不知道公司的内部规则」,通常应补知识库或 RAG,而不是继续加长 Prompt。

5.2 专家和 Skill 怎么创建

以下三类情况适合创建自定义专家:

场景特征 示例
垂直领域反复出现的工作 医疗器械注册、跨境电商税务、教育政策研究
小众专业领域缺少现成专家 地方性政策解读、细分行业合规、冷门技术栈架构评审
希望体系化复用个人经验 投资分析框架、谈判策略体系、特定疾病诊疗思路

一个合格专家至少写清行业背景、岗位经验、角色定位、关联 Skill、执行 SOP 和安全边界。

Skill 有三种获取方式:

方式 操作 适合场景
查找技能 在对话框描述需求,系统搜索并安装匹配技能 快速获取现成能力
上传技能 上传包含 SKILL.md 的文件夹或 .zip 已经有写好的技能文件
创建技能 在对话中调用 @skill-creator 并描述需求 从零创建自定义技能

第三方 Skill 会获得一定执行能力,安装前要确认来源、阅读说明,并检查它申请的文件和网络权限。

连接器背后通常是 MCP Server:它把外部系统能力包装成一个个标准工具接口,AI 再通过接口操作系统。mcp.json 记录 MCP Server 的地址和认证方式,告诉 WorkBuddy 如何连接。考试中要抓住边界:MCP 是通信协议,连接器是产品入口,外部系统权限仍由认证凭据和平台授权决定。

5.3 单专家、专家团与 OPC

单专家适合合同条款咨询、政策合规确认、劳动法问题等单一专业领域。专家团与 OPC 更适合跨平台内容分发、多语言本地化、新品上市宣发等需要多个角色接力的任务:内容主体已经准备好,再由不同专家铺到合适的平台和时间。

拿不准时先用单专家。专家若提示「还需要 XX 领域的专业意见」,再考虑升级为专家团。

5.4 远程控制和多渠道接入

远程运行分为云端沙箱和本机远程:

模式 电脑要求 数据存放 适合场景
云端沙箱 不要求个人电脑开机 云端沙箱,任务结束后按平台机制清理 通勤、外出时的写文档和生成报告等轻量任务
本机远程 电脑开机且 WorkBuddy 在线 数据留在本机授权范围 操作本地文件、读取电脑资料

远程渠道只改变任务入口,不会自动扩大授权范围。

渠道 入口 配置方式 适用人群
微信小程序 微信小程序入口 微信授权登录 不想安装 App 的用户
微信助理 桌面端设置页 手机微信扫码绑定 个人用户,使用频率较高
元宝 元宝客户端 账号登录授权 腾讯元宝用户
企业微信机器人 企业微信管理后台 获取机器人凭证后填入桌面端 企业团队
企业微信客户端 管理后台配置后使用 配对机器人凭证 已在企业微信生态的团队
移动端 App 应用市场 使用与桌面端相同账号登录 iOS / Android 用户
飞书 / 钉钉 / QQ 对应平台集成入口 完成各平台授权 对应平台的企业或个人用户

5.5 定时自动化、灵感与项目协同

定时自动化适合重复、规则清楚、结果可检查的工作,例如定期汇总、固定提醒和日报生成。原笔记中的「网格工作没有惊天动地的大事,更多的是家长里短的小事、繁杂琐碎的琐事、急难愁盼的实事」,恰好说明了自动化的价值:它未必解决最难的问题,但能接住大量稳定重复的小事。

灵感模块收录社区验证过的任务模板,把复杂 Prompt、Skill 和专家组合成一键可用的方案,不必每次从零摸索。

项目空间把任务管理、文件共享和 AI 配置整合在同一工作区。每个项目可独立设置指令、专家、Skill 和连接器,让不同项目的 AI 行为互不干扰。

项目角色 能做什么 不能做什么 适用对象
创建者 编辑项目、管理成员、删除项目 项目发起人
管理员 管理任务和成员 删除项目 核心成员、分担管理的人
成员 查看内容、执行任务、上传文件 增删成员、修改项目设置 项目执行者
访客 只查看 执行操作、上传文件 外部合作方、临时参与者

六、安全与合规:先画清数据流,再谈效率

安全题通常不考口号,而是给一个具体场景,让你判断数据去了哪里、授予了什么权限、谁负责最终结果。可以按「平台保护、用户授权、输出审核」三层作答。

6.1 平台机制解决什么

课程笔记列出了九类平台保护。它们能降低风险,但不能替代用户的最小授权和人工复核。

安全机制 具体作用
本地执行 Excel、PDF、合同等文件优先在本地处理;需要云端模型时,只传输任务所需指令和上下文
沙箱隔离 从文件、进程和网络层隔离 AI 操作,限制其访问沙箱外资源
执行前确认 任务启动前预览执行计划和拟访问的目录,由用户确认
自动拦截 阻止访问系统敏感目录,并拦截 rm -rfformat 等高危命令
危险操作确认 删除文件等操作需要二次确认
Skill 审核 官方 Skill 经过审核,第三方 Skill 安装前进行安全扫描
微信直连 微信作为消息通道,不代表 WorkBuddy 自动读取微信私人数据
凭据保护 课程笔记强调密钥不应出现在任务文本、普通文件和上报内容中
全链路审计 保留操作记录,支持追溯和企业合规检查

6.2 先看数据去了哪里

「文件在本地处理」不等于所有内容都不会离开电脑。对话文本和必要上下文可能发送给所选模型服务;切换到云端沙箱后,文件会进入云端处理环境;远程指令还会经过相应的即时通信平台。

数据类型 流向 风险等级 需要记住的边界
对话内容 所选 LLM 服务商,如混元、DeepSeek、GLM、Kimi 对话文本会离开电脑进入模型服务
上传文件 本地沙箱处理 默认在本地读取和处理
上传文件:切换云端沙箱后 腾讯云服务器 文件上传云端,按平台机制在任务结束后清理
授权文件夹 本地文件系统 AI 可以读写被授权目录内的文件
远程指令 微信、企业微信等 IM 平台转发 指令文本会经过对应 IM 服务
API Key 由 WorkBuddy 的本地凭据机制管理 一旦写进截图、文档或对话就可能扩散
连接器授权 QQ 邮箱、腾讯文档等第三方服务 授权后 AI 可能直接操作外部账户

原始笔记对 API Key 的实现描述同时出现了「仅加载到内存」和「存于本地配置」两种说法。这里保留其共同安全结论:密钥不得进入 Prompt、普通文件、截图或代码仓库,具体存储实现以当前客户端和官方说明为准。

6.3 数据分级 80/15/5

WorkBuddy 数据安全边界

比例 典型场景 怎么做 示例
80% 直接用 会议通知、文案改写、周报、销售趋势 可直接交给 AI,输出仍需检查 纯模板且无可识别个人信息,风险较低
15% 简单处理 客户反馈、含姓名的报表、面试简历 花几秒脱敏,只传任务必需字段 姓名替换为「客户 A」,删除手机号
5% 绝对不碰 API Key、Token、密码、未公开合同、生产配置、身份证号 不输入、不上传、不截图传播 密钥可能被日志记录,合同可能被缓存

6.4 权限边界与最小授权

三种模式的风险和平台保护不同:

模式 风险等级 主要风险 平台保护
Ask 输出内容可能不准确 以只读和问答为主
Plan 用户可能习惯性跳过确认 执行前展示方案和访问范围
Craft 误删、误改、误覆盖 删除确认、系统目录拦截、高危命令阻断

最小授权落成四步:

  1. 新建一个临时文件夹;
  2. 只放入本次任务必需的文件副本;
  3. 只授权这个文件夹;
  4. 任务完成后在「设置 → 文件授权」中移除授权。

连接器写操作比读操作风险高,应优先只读,并给关键写入增加人工确认。Craft 任务还应保留原始文件备份。

6.5 六类场景的人机边界

场景 AI 可以做 AI 不能直接做 原因
内容创作 生成初稿、改写语气、整理结构 不核实就作为正式内容发布 事实和组织口径需要确认
数据分析 汇总统计、发现趋势、生成图表 作为财务或审计最终结论 数据口径和来源可能有偏差
决策支持 列出选项、比较优劣、提供参考 代替责任人作最终决定 决策责任不会转移
法律合同 辅助起草、整理格式 未经审核作为正式法律文件 需要专业人员审核
客户沟通 生成回复草稿 未确认就直接对外发送 需要核对授权口径和承诺
人事工作 整理简历、生成面试问题 直接作为筛选和录用依据 涉及公平性与个人隐私

6.6 输出验证三步法与信任分级

收到 AI 输出后的标准动作:

① 核数据
   数字有没有来源?日期对不对?人名准不准?
   找不到原始来源 → 标注「待验证」

② 核逻辑
   结论是否被前面的分析支撑?有没有跳跃推理?
   存在逻辑断点 → 补充证据、重算或人工验证

③ 核场景
   输出适合当前公司、客户和流程吗?
   不匹配 → 人工调整后再交付
信任等级 内容类型 处理方式
可信 语法润色、格式整理、语气改写 可以直接使用
需验证 数据引用、趋势分析、方案建议 核实来源和逻辑后使用
不可直接信 法律解读、财务结论、医疗建议、对客承诺 必须由专业人员审核

6.7 五道日常防线

  • 账号只由本人使用,不代登录、不共享,责任从登录开始;
  • 远程控制二维码不截图、不转发,不再使用时及时解绑;
  • 默认模式下不要额外配置 API Key;开启自定义模型后,密钥只进入受控凭据机制,不外传;
  • 文件授权按最小权限原则,建立临时目录,用完收回;
  • Skill 只安装官方或可信来源,定期检查并移除不再使用的扩展。

七、企业智能体:从个人工具变成可治理的组织资产

个人提效解决「我能不能做快一点」,组织提效还要处理规模化协同。常见的四个卡点是:管理难闭环、团队难协作、知识难传承、资产难治理。企业版的目标是让能力可以复用、权限可以控制、成本可以归集、操作可以审计。个人版与企业版的核心差异,正是能力能否被组织复用,以及管理是否可控、可见。

7.1 三类能力资产

资产 一句话解释 本质 主要负责人
Skill 封装好的工具能力,让 AI 完成特定操作 可执行脚本与工作流,属于工具层 业务骨干提炼,管理员发布
专家 角色化的 AI 顾问,通过人设、方法论和工具链切换专业身份 角色切换机制,属于顾问层 资深员工设计,管理员发布
连接器 统一的系统接口,让智能体接入 OA、文档和邮件 MCP Server 与认证凭据,属于接入层 技术团队搭建,管理员配置

Skill 的生命周期不是上传后就结束:

创建 ──→ 试用 ──→ 发布 ──→ 运行 ──→ 迭代 ──→ 下架
  │        │        │        │        │        │
定义场景  脱敏样例  分类可见  收集反馈  更新版本  关闭过期能力
         验证      范围      运行监控  编写说明

7.2 专家设计要素与开发规范

要素 应写清什么 写不好的后果
行业背景 熟悉的行业、业务场景、典型约束 只写「熟悉互联网」,回答会很通用
相关经验 岗位任务、方法论、分析框架 只写「经验丰富」,AI 不知道如何分析
角色定位 代表什么岗位能力、服务什么人 身份不明,输出视角不稳定
关联 Skill 可以调用哪些工具能力 只能聊天,无法执行任务
执行 SOP 先做什么、再做什么、如何验收 每次输出结构都不同
安全边界 哪些事情不能做,何时转人工 可能越权操作或代替用户决策

完整开发流程如下:

第一步:初始化项目结构
  mkdir -p contract-review-expert/{.workbuddy-plugin,avatars,agents,skills}

第二步:编写 plugin.json
  填写 name、displayName、expertType、category、tags、agents、skills
  name 使用英文标识符,agents 路径必须指向实际文件

第三步:编写 agents/*.md
  ① 角色定位:职责与目标用户
  ② 工作流程:SOP、步骤与顺序
  ③ 关联能力:Skill / MCP 的调用时机
  ④ 安全边界:禁止事项与转人工条件
  ⑤ 输入输出范例
  核心规则放 Agent 定义,详细资料放知识库

第四步:测试验证
  ① 单元测试:典型输入 → 检查结构和质量
  ② 对抗测试:越界提问 → 检查拒绝机制
  ③ 业务验收:真实用户试用 → 与人工结果比较

第五步:打包提交
  zip -r contract-review-expert.zip contract-review-expert/
  ① 自动校验:格式、字段和文件完整性
  ② 人工审核:内容质量、安全合规和头像规范

审核通过后,专家可在企业内发布使用。专家或专家团的本地市场目录为 ~/.workbuddy/plugins/marketplaces/experts/.codebuddy-plugin/marketplace.json;实际路径仍应以当前客户端版本为准。

7.3 专家、助理、项目是递进关系

专家让个人获得岗位级方法;助理让这个能力可以从手机或企业协作工具远程触达;项目再把人、数字员工、文件和上下文放进同一空间,实现任务接力和资产复用。后者建立在前者之上,不是三个互相替代的入口。

第三层:项目(组织协同)
┌─────────────────────────────┐
│ 人 + 数字员工 + 同事在同一空间协作 │
│ 共享上下文 · 任务接力 · 资产复用   │
└────────────▲────────────────┘
             │ 从个人连接到组织协同
第二层:助理(远程连接)
┌─────────────────────────────┐
│ 手机 / 企微 / 飞书远程指挥电脑干活 │
│ 持续在线 · 多端触达 · 即时响应     │
└────────────▲────────────────┘
             │ 从坐着用到随时用
第一层:专家(个人强化)
┌─────────────────────────────┐
│ 一句话召唤岗位级 AI 专业能力       │
│ 角色化 · 有方法论 · 有关联工具     │
└─────────────────────────────┘
起点:任何员工都可以从专家开始

7.4 Agent、Runtime、Session 三层

企业智能体三层架构与治理

层级 管什么 管理动作
Agent 身份、System Prompt、Skill、专家、MCP、知识库、渠道和自动化 配置后先测试,通过再发布
Runtime 计算资源、运行状态和环境版本 监控状态,异常时查日志、回滚或停止
Session 单次交互的上下文、消息、文件和调用链 检查异常回复、越权访问和敏感信息

Managed Agents 承载 Runtime 层,为 Agent 提供云端托管运行服务。每个 Agent 使用隔离沙箱和独立数据环境,具有独立身份、全程审计、版本管理和状态快照。一个 Agent 可以有测试和正式等多个 Runtime,不同用户的 Session 应彼此隔离。

能力组装仍要遵守最小化:

能力类型 选择原则 风险点
Skill 只关联与业务目标直接相关的 Skill 无关 Skill 可能被误调用
专家 只关联专业方向匹配的角色 专家过多,员工不知道该选谁
MCP 工具 优先开放只读工具,谨慎开启写入 写入工具需要人工确认机制
知识库 只选择与服务场景匹配的知识范围 权限过大可能导致信息泄露

每个 Agent 都应有清晰的能力边界和最小权限。

7.5 管理后台看六组指标

管理维度 管理者关心什么 后台能力 实际用法举例
组织架构 谁在用、哪些部门渗透率高 部门设置、成员管理、坐席分配 HR 导入全员后按团队授权,并限制外包人员范围
资产管理 哪些 Skill 和专家被复用,哪些已过时 统一发布、管理和下架 Skill、专家、连接器、知识库 运营每月巡检,关闭三个月无调用的 Skill
权限控制 岗位看到的能力是否符合职责 角色边界、可见范围、成员授权 普通员工不开放财务审批 MCP,实习岗位不开放客户数据查询
用量统计 部门花费是否合理,高消耗场景是否值得 部门归集、趋势分析、单场景消耗分解 市场部消耗激增时查看明细,判断是否应沉淀模板
安全审计 是否有越权和敏感信息泄露 操作日志、异常告警、会话审查 会话出现不应访问的字段后,收紧 Agent 的 MCP 权限
成本管理 预算余额和下季度安排 预算设置、超额预警、部门账单 部门消耗达到预算 90% 时通知管理者评估追加

企业版落地不宜一次铺满全公司。先选一个高频、边界清楚、结果可验证的场景,跑通「资产发布—成员使用—效果反馈—权限审计—版本迭代」的最小闭环,再向其他部门扩展。


八、冲刺复习:把知识点变成判断题

8.1 三轮复习顺序

第一轮按权重建立地图:重点掌握对话技巧、读写析、进阶能力和安全。第二轮做场景判断,把每个知识点改写成「什么情况下应该选它」。第三轮专门检查易混概念和多选题边界。

建议优先复盘这些对照:

  • Ask / Plan / Craft:是否执行、是否先确认、权限有多大;
  • 专家 / Skill / RAG / MCP:角色、操作、知识、连接分别解决什么;
  • 本地沙箱 / 云端沙箱 / 本机远程:电脑是否开机、文件在哪里处理;
  • Agent / Runtime / Session:配置、运行、会话分别由谁管理;
  • 创建者 / 管理员 / 成员 / 访客:成员管理、项目设置、执行和查看权限;
  • 可信 / 需验证 / 不可直接信:谁对最终结果负责。

8.2 做多选题时逐项判断

多选题错选、漏选均不得分。不要先猜「应该有三个答案」,而要把每个选项单独改写成判断题:它是否符合题干条件?是否偷换了数据流向?是否把「可以辅助」说成了「可以直接决策」?是否把平台保护等同于零风险?

看到绝对化表达要多检查一次,例如「所有文件都不会离开本地」「Plan 永远只读」「企业版只是模型额度更高」「RAG 可以替代权限控制」。这类说法往往忽略了模式切换、确认阶段、数据源或治理边界。

8.3 考前清单

  • 记住考试形式、题量、时长、通过线和多选计分规则;
  • 能口述六大模块占比:12 / 20 / 20 / 18 / 18 / 12;
  • 能用场景解释 Ask、Plan、Craft,而不是只背定义;
  • 能写出包含角色、背景、任务、格式的 Prompt;
  • 能把常见工作归入读、写、析,并说出验证动作;
  • 能区分专家、Skill、RAG、MCP;
  • 能画出数据流向,执行 80/15/5 和最小授权;
  • 能区分 Skill、专家、连接器三类企业资产;
  • 能说明 Agent、Runtime、Session 的职责;
  • 报考前重新打开官方指南,确认考试和产品信息没有变化。

九、结语

这套认证最值得保留的,不是一份功能菜单,而是一种任务判断方式:先看目标,再选模式和能力;执行前划清数据与权限边界;输出后核数据、核逻辑、核场景;进入企业环境后,把个人经验沉淀成有版本、有权限、有审计的资产。

掌握这条主线,产品界面即使变化,也不会把复习过的知识全部推倒重来。


参考资料

说明:本文是个人学习笔记,不替代官方课程、报名规则或考试通知。官方指南未明确的费用、考点、补考和证书有效期等信息,请以报名页面和考试预约页面为准。

「真诚赞赏,手留余香」

爱折腾的工程师

真诚赞赏,手留余香

使用微信扫描二维码完成支付