Grok Bot 的七步验证法、从零开始打造可靠的24/7全时助理

cover.png

说来惭愧,直到昨天晚上,我终于真正打开了 Grok Bot……这人拖延症有多严重啊……

这件事有点微妙。过去几周,我已经看过不少关于 Grok Bot 能力的讨论,也把它和自己用过的 Hermes Agent 做过比较——它其实早就有 Bot 功能了。但说到 Grok Bot 本身,在此之前我仍然处在“听说过,没用过”的状态。

第一次登录也没有想象中顺滑:点击授权后,页面从 Grok Bot 客户端跳到 X 账户,识别我的 SuperGrok 权益,再转入 Cursor 的 OAuth 流程,最后回到 Agent 主界面。绕了一圈,才真正进入 New Bot 的界面。

我一直订阅 X Premium+,账户自动获得了 SuperGrok 权益。xAI 又在 8 月 26 日把 Grok Bot 扩展到所有 SuperGrok 套餐,所以我没有再单独购买一份订阅,账户里已经有了 Grok Bot 的使用额度。

说起来,我其实早在6月份使用过 Bot 功能,那是在参加 Stripe 、英伟达和 Hermes Agent 联合举办的一场黑客松活动中,使用 Hermes Agent 创建过类似于 Grok Bot 的 Bots,而且我当时是设计让它们 3 个“自己挣钱”,它们都各自有自己的社交账号、自己的 Stripe 收款账号。

01-screenshot-hermes-hackathon-bots.png

Grok Bot 给我的第一个强烈感受,是三只 Bot 都运行在云端。电脑合上,它们仍然可以继续工作,不占用本机资源,也不需要我守着一个终端窗口。到这个时候,“24/7 助理”才从一句产品介绍,变成了我能直接感受到的工作方式。

为了开始测试,我先去跟 ChatGPT 聊了好些个“十块钱”的天:额度是单独还是共用?怎么创建 Bot?提示词是不是直接输入在 New Bot 界面里?等等等等。

03-screenshot-chatgpt-prompt-generation.png

从这个很基础的问题开始,我陆续建立了三只 Bot ,一个是满足我个人看演出的兴趣爱好,另两个是服务于我当前的主要工作的:

  • Theatre Scout:每周扫描演出安排和评价,筛选值得专门安排时间或旅行去看的剧场演出,并整理票务、场地和时间信息。

  • AI Signal Radar:追踪 Agent 工具、多模态产品和行业研究中的高信号变化,为视频和文章提供原始材料。

  • Brand 5.0 Lab Researcher:持续研究企业 AI 转型、品牌与营销工作流,积累案例、反证和假设,为 Brand 5.0 Lab 的咨询框架提供研究底座。

02-screenshot-grok-bot-three-agents.png

一个下午,我从对 Grok Bot 几乎没有概念,走到了三只云端 Bot 开始分工。

但回头看,创建本身、真的只是占工作量中——也是重要性——很小一部分。真正花时间的、也是更加重要的,是后面的调试:怎样让它知道自己负责什么,怎样阻止它为了给出漂亮答案而过度推断,怎样把一次做对的过程固化成 Skill,再放心地交给 Routine 自动运行。

这才是从“建了一只 Bot”走到“有了一位 24/7 助理”的分界线。

第一个 Bot 应该怎么建?

Grok Bot 的官方流程很简单:在侧边栏选择 New,进入 New chat,点击 Create new agent,然后在 Edit Profile 中填写 Name、Title 和 Description。我当时看到的设置界面把第二项写作 Label,官方文档里对应的是 Title,本质上都是给这个 Bot 一个简短的岗位名称。

新手最容易把这三个字段都写成同一句话。我的理解是,它们应该各自解决一个问题:

  • Name 回答“它是谁”,例如 Theatre Scout。

  • Title 或 Label 回答“它负责哪一类结果”,例如 Opportunity Monitoring。

  • Description 回答“它平时怎么工作,有什么长期边界”。

04-flowchart-bot-role-task.png

以我的 Theatre Scout 为例,第一版可以这样填:

Name: Theatre Scout
Title / Label: Theatre Opportunity Monitoring
Description: Monitor upcoming theatre performances relevant to my interests.
Verify the date, venue, city, ticket status, and source. Prioritize events
worth arranging time or travel for. Never buy tickets or contact a venue
without my approval.

Description 不需要塞进某一次任务的全部细节。适合长期不变的规则放在这里,例如只报告可核验的信息、保留来源、不要代替我购买或发布。某一周要查什么、时间范围是什么、最后交付什么,则放进对话里的任务提示词。

这也是官方教程反复强调的一点:一只 Bot 最好只负责一个清晰的结果。一个叫 General Helper 的万能助手,短期看起来什么都能做,长期积累下来的上下文却会越来越混。角色边界越模糊,后面越难判断它到底有没有做好。

我没有一上来就建十只 Bot。第一阶段只选了三个已经真实存在的需求:演出机会、AI 外部信号、Brand 5.0 Lab 研究。它们的来源不同、判断标准不同、输出节奏也不同,拆成三只比较合理。

创建完成后,先给它一次真实任务

创建第一只 Bot 后,我原本很自然地想到下一步:既然它可以 24/7 工作,是不是马上设置一个每周定时任务就可以了?

后来证明,这个方式不好。

xAI 官方文档给出的顺序是:先运行一次单次任务,把结果修到可靠,再保存成 Skill,最后才自动化。官方还建议,在创建或修改 Routine 后使用 Test run,并检查它有没有选对输入、输出格式是否合格、关键结论有没有来源、应该停下来等待批准的地方有没有停,以及失败状态是否写清楚。

这里还有一个很容易误解的地方:Test run 不是沙盒演示,它会真的浏览网站、调用工具和修改文件。第一次测试最好使用安全输入,把发送、购买、删除、发布等动作留在人工批准之后。

我的实际过程也验证了这个顺序。

我给另外一只 Grok Bot、Brand 5.0 Lab Researcher 的第一项任务,是建立企业 AI 在品牌、营销和知识工作中的研究基线。任务要求它寻找企业案例、落地与失败模式、咨询服务和 ROI 证据,并给来源分级。当时我还特别写了:先做 baseline,在我看过并纠正方向之前,不要建立 Routine。

它很快给出了一份看起来相当专业的结果。里面有 Unilever、L'Oréal、Nestlé、P&G、Klarna、Microsoft、Walmart 等案例,也整理了咨询公司和企业 AI 工作流的共同模式。

问题出在结论开始跑得比证据更快。

它把“企业正在购买工具,少数获得明显价值的公司在重做工作流”进一步推成“品牌编码的工作流操作系统是稀缺对象”;又说市场存在一个空白位置,甚至用了“最自然的垄断位置”这样的表达;最后还给出了 5 万到 25 万美元的价格带。

这些结论读起来很有力量,也很符合我对 Brand 5.0 Lab 的兴趣。但符合我的方向,恰恰是最危险的地方。因为一份研究一旦顺着使用者的期待往下推,很容易把“我想验证的假设”写成“市场已经证明的事实”。

如果这时直接开启每周 Routine,这些没有站稳的结论就会变成下一轮研究的前提。它会继续寻找支持材料,逐渐忽略反例。跑得越久,偏得越远。

自动任务为什么会越跑越偏?

很多人把目标漂移理解成模型偶尔答非所问。Routine 里的漂移更隐蔽,它通常来自几个连续的小变化。

第一轮里,一个推断被写成了结论。第二轮读取旧结果时,把这个结论当成了已知事实。第三轮开始围绕它筛选材料。再往后,系统会越来越擅长证明自己已经相信的东西。

Brand 5.0 Lab Researcher 的第一轮就出现了三个典型信号:

  • 把“公开样本里暂时没看到”写成市场空白。

  • 把公司自己发布的案例当成强测量证据。

  • 在没有公开报价、合同或采购记录时推断价格区间。

05-flowchart-goal-drift-loop.png

这几类问题单独看都不大。放进自动任务后,它们会积累成一套越来越自洽、也越来越难被纠正的叙事。

所以我没有让它继续扩展研究,而是做了一次 calibration。新的要求是把“来源等级”和“测量强度”拆开:公司官网属于一手来源,不代表它证明了因果;没有对照组的效果数据,只能保留在较弱的测量等级;“品牌编码系统稀缺且有价值”改成 H1 假设;5 万到 25 万美元改成“未经验证的价格假设”;所谓市场空白,降级为需要继续验证的 candidate gap。

第二轮输出明显收敛了。很多原来听起来很强的数字被降级,Duolingo、JPMorgan、Microsoft 被移出核心品牌营销案例,Coca-Cola 被放入失败与反证,Klarna 的客服回撤也被保留下来。最重要的变化是,它开始主动区分 Research Finding、Pattern、Hypothesis 和 Product Question,不再直接从研究跳到“Brand 5.0 Lab 应该做什么”。

这一步才算把研究方向拉回轨道。

Skill 可以直接在对话里生成

当一轮任务已经跑通,Grok Bot 可以直接在当前对话里把过程保存成 Skill。你只需要告诉它:保存刚才的工作方法,叫什么名字,必须包含哪些步骤、判断规则、输出格式和安全边界。

在我平时使用的 ChatGPT 或 Claude 工作流中,创建 Skill 往往要进入专门入口,或者调用 Create Skill 一类的专门能力。Grok Bot 给我的体验更直接:任务做完后,继续在同一段对话里说“把刚才经过校准的流程保存为 Skill”,它就会完成整理。创建 Routine 也是一样,可以直接告诉它执行频率、时区、输入来源、输出方式和禁止事项。

在这个流程里,Skill 是一次真实工作的沉淀。先把任务做对,再把已经验证过的方法保存下来。

我把 Brand 5.0 Lab Researcher 跑通的流程保存为 Brand 5.0 Lab Research Sweep。Skill 里不仅有搜索范围,还保留了证据等级、测量强度、因果状态、可迁移性、市场空白纪律、价格纪律和策略边界。

但保存成功还不能马上自动运行。Skill 只说明“应该怎么做”,不代表它在第二个任务里仍然做得对。

我故意挑了一个最容易跑偏的题目做验证

验证时,我没有再给它一个宽泛的企业 AI 研究任务,而是专门选择 AI workflow diagnostics 和 30/60/90-day implementation services。这个领域最容易制造“市场上没人做,所以我们应该占领”的幻觉。

我要求它先读取已有的四个研究库,只报告增量信息;不能重新抄一遍原来的咨询公司;不能根据营销文案猜价格、周期、IP 归属和交付深度;必须主动检验 H1 到 H5,而不是只找支持 H1 的证据;最后还要回答九个验证问题,包括旧状态是否成功加载、去重是否有效、哪些字段无法核验、公开页面访问限制是否影响结果。

这轮结果通过了。

它找到了五个新的公开服务,但没有把它们包装成市场空白。Helium42 的公开价格只被当作一家精品咨询公司的英镑报价,没有拿来证明原先的美元价格假设;Prophet、IBM 等没有公开的信息都明确标成 Not publicly verified;几个公司没有搜索结果,也只被记录为公开覆盖不足,没有推成“它们不提供这类服务”。H1 到 H5 的置信状态没有因为新材料看起来顺眼就被抬高。

不过验证又暴露出两个运营问题。第一,四个长期研究库的真实路径没有写进 Skill,Bot 需要靠既有约定去找。第二,主研究库、镜像文件和验证产物之间存在形成多套真相的风险。

于是我又做了一次 operational patch:明确四个 canonical stores 是唯一事实源,每次增量研究前先读取,完成证据分类后再更新;镜像、索引和验证文件只能作为报告,不能独立维护;如果主研究库无法加载,必须报告“增量比较已降级”,不能假装已经去重,也不能靠对话记忆偷偷重建。

这种修补看起来不像研究,却决定了自动任务能不能稳定运行。一次回答差一点还能人工纠正,从错误旧状态继续工作,则会让后面的每一轮都建立在偏差之上。

最后才建立每周 Routine

通过校准、保存 Skill、第二个输入验证和状态修补后,我才让 Brand 5.0 Lab Researcher 建立正式 Routine:每周四上午 9 点,Asia/Singapore 时区,运行一次增量研究。Routine 在云端后台运行,电脑合上后也可以继续,这是它真正接近 24/7 助理的地方。

我没有把它和 AI Signal Radar 都放在周一。AI Signal Radar 负责周一发现外部高信号变化,Brand 5.0 Lab Researcher 放在周四做更慢、更深的证据积累。这样,周一出现的重要企业 AI 信号,如果真的与品牌和营销有关,周四可以继续寻找案例、实施过程和反证。两只 Bot 不需要在同一个时间抓同一批信息。

Routine 里还写了一个很重要的沉默规则:如果四个研究库都没有实质变化,只返回一句“No material new Brand 5.0 research findings this cycle.”不要为了证明自己工作过,重复旧案例或硬凑一份周报。

Theatre Scout 和 AI Signal Radar 也采用了相同逻辑:先做单次任务,修正筛选标准,保存 Skill,验证去重和状态管理,最后再定时。三只 Bot 到这里才算正式上线。

我形成的一套打磨方法

经过这三只 Bot,我把整个过程总结成七步:单次任务、结果校准、规则固化、对抗验证、状态修补、定时上线、运行复盘。

06-flowchart-seven-step-validation.png

单次任务的目标,是验证它能不能完成一件真实工作,不要求一开始就完美。结果校准要把“哪里不对”改写成长期规则,而不是只让它重答一次。规则稳定后再保存 Skill,把输入、步骤、判断、输出和审批边界固定下来。

对抗验证不能挑最容易成功的题目。应该专门选择它最容易过度推断、重复旧材料或迎合你的领域,看它能不能在新输入下守住边界。验证通过后,再修补路径、事实源、失败处理和去重方式。Routine 是第六步,不是第二步。

上线后我准备观察 2 到 4 周,只看三个指标:

  • 命中率:输出里真正值得我看的内容有多少。

  • 增量价值:它有没有带来旧研究库里没有的新信息。

  • 行动变化:它有没有真正改变我的安排、判断或下一步行动。

产出很多并不等于助理有效。一个每周稳定制造十页材料、却从不改变任何判断的 Bot,只是在自动生产噪音。

几段可以直接复制的提示词

下面几段模板可以替换方括号里的内容,直接发给你正在调试的 Bot。

单次任务,先禁止自动化:

Complete one real task for [goal].
Use only [sources]. Return [deliverable] with source links.
Do not create a Skill or Routine yet.
Stop and report anything you cannot verify.

把一次修正变成长期规则:

Revise the previous result.
Separate verified facts, inferences, hypotheses, and unknowns.
Downgrade any claim that lacks direct evidence.
Keep counterevidence and do not make strategy recommendations.

保存 Skill:

Save the calibrated process as a Skill called [skill name].
Include when to use it, required inputs, steps, validation rules,
output format, failure handling, and approval boundaries.
Do not create a Routine.

做一次防漂移验证:

Use [skill name] on [high-risk test topic].
Load [canonical previous state] first and report only material changes.
Do not restart from zero, infer missing facts, or search only for support.
At the end, list any ambiguity, access failure, or state problem found.

验证通过后再建立 Routine:

Create one Routine owned by [Bot name].
Run [schedule] in [timezone] using [skill name] and [canonical state].
Return only material changes. If inputs are missing, report failure.
Do not send, publish, purchase, delete, or modify external systems.
Do not run it immediately.

小白最应该避开的几个坑

第一,不要把 Description 写成一段漂亮的职业介绍。它要写的是长期工作规则,尤其是来源、输出和禁止事项。

第二,不要把 Bot 的记忆当作数据库。官方文档也提醒,记忆不能替代权威事实源。长期任务要明确上一轮状态保存在哪里,哪个文件才是唯一事实源。

第三,不要把“公司官网”与“强证据”混为一谈。一手来源只能说明这句话确实由公司说过,不能自动证明结果存在因果关系。

第四,不要为了固定周报而要求每周必须有发现。没有变化时保持沉默,比重复旧信息更有价值,也能节省用量。

第五,不要把外部动作交给未经验证的 Routine。发送消息、购买、删除、发布、修改生产系统,都应该保留人工批准。xAI 官方也建议从只读、整理和草拟类任务开始。

第六,所有 Bot 共享同一台云端电脑。不同 Bot 是角色分工,不是安全隔离。某只 Bot 登录过的网站、保存在共享空间里的文件,其他 Bot 也可能访问。敏感账号和资料要按最小权限处理。

第七,注意用量。Grok Bot 的额度独立于普通 Grok 和 Cursor 使用量,但仍然是每周额度。Routine 太多、监听范围太宽、每次都从零开始搜索,都会消耗不必要的用量。

24/7 助理,关键不在于一直运行

从“这个界面是不是直接输入提示词”,到三只 Bot 开始按自己的节奏工作,我最大的变化不是学会了某个复杂功能,而是开始把 Agent 当成真正的岗位来设计。

岗位需要明确的职责、输入、判断标准、交付物、事实源和权限边界。一个人类助理入职后也不会第一天就完全自动工作,AI Bot 同样需要试做、反馈、固化和复盘。

Grok Bot 把创建 Skill 和 Routine 变得很轻。你不需要先学会工作流画布,也不需要离开对话去搭一个复杂系统。轻到可以直接说一句“把刚才做对的过程保存下来,每周四上午九点再做一次”。

但入口越轻,前期约束越重要。

真正的 24/7 助理,不是永远在输出。它应该在该工作的时候按稳定规则工作,在没有新信息的时候保持安静,在证据不足的时候承认不知道,在需要你判断的时候停下来。

我现在还没有继续创建 Content Scout 或 Chief of Staff。先让 Theatre Scout、AI Signal Radar 和 Brand 5.0 Lab Researcher 跑 2 到 4 周,看它们到底改变了多少真实判断和行动。

接下来,我就看看:

如果命中率不够,先修规则。

如果命中率够高,再扩团队。

参考资料