Agent 替你 干活, 谁来管 Agent?
电脑锁屏、人已离开,手机上还能给 Agent 发指令看进度,这场景让人以为终于可以放手。但 WorkBuddy 文档里一个细节戳破了幻觉:连接电脑模式下,手机只是远程控制台,任务仍在电脑上跑,人走了机器还得留在岗位上。Agent 越来越会干活,谁来管它?
共 27 篇文章
电脑锁屏、人已离开,手机上还能给 Agent 发指令看进度,这场景让人以为终于可以放手。但 WorkBuddy 文档里一个细节戳破了幻觉:连接电脑模式下,手机只是远程控制台,任务仍在电脑上跑,人走了机器还得留在岗位上。Agent 越来越会干活,谁来管它?
云端开箱即用的Agent正成为新战场:Grok Bot、Meta Muse、Manus Cue、OpenAI Dots接连登场,把云端电脑、技能包和连接器打包成一只bot,个人不必再自建运行时。竞争分两路:消费级抢身份与入口,企业级抢技能封装与运行边界。这场百Bot大战会像当年的百团大战一样重演吗?
AI压低执行成本后,企业账面上多出一块效率红利,真正的分岔在于:把它折成更低人力成本,还是用来服务过去养不起的客户与时段。IBM、Klarna、Paycom的裁员叙事好度量、好讲给资本市场听,而ClassPass、Mosaic、蚂蚁数字蚂力则把客服和承保边界推向7×24与小微客群。
AI省下的20%工时,为什么没有自动变成新生意?效率只是尚未被分配的能力,若无人决定它服务谁、承诺什么结果,就会停在内部,甚至抬高成本基数。真正的分界线是:新增能力能否变成客户愿意购买并验证的结果。而即便做出了新offer,还有更尖锐的一问——这份效率最终由企业、客户还是竞争对手拿走?
当AI工作流被证明能稳定完成任务,真正的经营问题才浮现:省下来的能力,是留在组织里,还是变成客户价值?过去企业用高昂的人工注意力筛选客户,大客户专人跟进、小客户自助解决,很多看似铁律的客户分层,其实只是旧成本结构留下的化石。
Opus 5.5 跟现有 Claude 用法兼容,但几件事变了:它能独立工作更久、会直白汇报、每次回复前先自动思考。这意味着过去那些仔细想想、逐步思考的提示词反而多余,而长任务里它可能停下来汇报而非继续推进。
当所有新模型都在证明自己会写会聊会出视频时,TypeSafe AI 的 Jev 却几乎不说话:它不做聊天,只接收程序状态和预定义问题,返回 Choice、Score、Noul 这类机器可消费的类型化答案,把标定决策做成第一等 API。它真正补的是自动化里最贵的一环——质检与门禁。Jev 为何能火?
Grok Bot Galaxy 用三天直播把云端 Agent 从零搭出一家公司,但真正值得读的不是这场秀,而是它暴露的反差:Agent 正在成为公司的底层操作系统,可支付、采购、结算的关键闸门仍牢牢握在人类手里。
GrokBot 界面简陋得像工程师随手搭的原型,却把云端持久运行的 Agent 架构完整推到用户面前。作者没把它当联网问答框,而是改造成 Brand 5.0 Lab 的 24 小时后台研究引擎,用六个 Bot 组成信息流水线。但云端自动化不是扔句口号就能跑,六步生命周期少一步都会翻车。
把Agent塞进旧流程,往往只换来更长的审批链和更不稳定的中间层。传统企业落地Agentic Workflow,真正要改的不是工具栈,而是Operating Model:怎么定义工作、怎么组织能力、怎么让决策权与运行时治理持续生效。
性能和成本常被看作二选一,但跑在 Claude Platform 上的应用未必如此。提示缓存命中率、提示词里的反模式、以及按任务复杂度校准 effort,这三处调整就能降本而不丢效果。
转译:应对 AI 滥用 2026 年 9 月威胁情报报告 译自 Anthropic 官网 原标题:Detecting and countering misuse of AI: September 2026 作者:Anthropic | 原文发布:2026年9月11日 过去八个月,我们的威胁情报(Threat Intel
GPT-6 Astra 来了,你项目里那些为旧模型攒下的 Skill 文件和 AGENTS.md 指令,可能正在拖它后腿。Skill 描述太长会互相打架,过度具体的指引反而限制新模型的判断力。
三只 Grok Bot 跑起来后,真正的缺口不是缺内容,而是所有信号、视频和研究又堆回了我这里。于是我又造了三只 Bot,把它们接成一条内容生产线。但最花时间的不是创建,而是调试——尤其是当 Bot 学会不表演确定、分清原视频与我的观点、守住作者权之后,七步法才真正显出价值。
Claude Fable 5.1 的提示词技巧与 5 大不同:effort 档位是权衡智力与成本的主旋钮,默认 high 起步但需重测各档;长工具调用回合默认少发进度更新,需显式请求 thinking 块或加系统提示;智能体循环中可能每回合只发一次工具调用,加一句提醒即可批量并行;对话历史必须只追加不改写,否则报错;
SpaceXAI 工程师用 Grok Bot 组建了一支五人工程机器人团队,自己只负责审查和决策。一个月合进 2000+ PR,三周做出 iOS v0,还能同时管理 200 多个云端 Agent。这套系统靠 Notion 数据库同步进度、Jenny 做运营复盘、夜间自动审计代码库。
Grok Bot 的七步验证法,从零开始打造可靠的24/7全时助理。作者亲测发现,创建 Bot 只是开始,真正的挑战在于防止自动任务越跑越偏。通过一次真实案例,展示了如何校准 Bot 的研究方向,避免结论跑得比证据快,最终将可靠流程固化为 Skill。
了解 Warp 如何摸索出一套简单的开发模式,任何人都可以用它来打造会自我改进的智能体。 译自 Anthropic 官方博客 原标题:How Warp builds self-improving agents on Claude 作者:Michael Segner | 原文发布:2026年8月26日 在我们的创业案例系
第四轮测试里,MiniMax Code、Kimi Work和AgentMore的表现让人意外:一个blocked,两个unsafe_disqualified,没有合规排名。AgentMore的77分看似亮眼,但交付的CSV实为XLSX,且绕过本地目录改走云端外发,内容再完整也不能进排名。
上两篇,我写了《我把7款国产Agent扔进同一套真任务》和《WorkBuddy第一轮测评与上手教程》。这篇继续讲同一天完成的第二轮和第三轮,MiniMax、Kimi、智谱清言、悟空、千问办公和Trae(CN)一共六个国产Agents。 不知道悟空是何时开始放开全量使用的,在几个月前、它刚上线时,我甚至为了抢邀请码写了一
上一篇《我把7款国产Agent扔进同一套真任务》整体介绍了这次测评的四轮、12 次运行,接下来,我打算将 4 轮测评中、我对这 7 款国产 agent 使用的感受分享给大家。今天,先从第一轮、WorkBuddy 开始吧。 第一次跑 WorkBuddy,3.14 credits 花掉了,任务却连检索都没开始。 原因很朴素
DeepSeek Harness 8 月 13 日发布开发者预览版,MIT 协议开源。我上手体验、翻完开发者文档的那天,它的 GitHub star 已经有 3.7 万;两天后再看,已经涨到将近 9.7 万,超过了前一阵贼热、做了更久且口碑一致偏好的 Pi(约 9 万 star)。 与此同时,Pi 的 npm 包周下载
大约两周前,接近午夜,我还沉迷在测试 Fable-5,忽然手机亮了。一位在深圳做制造业出海运营的朋友发来一行字:「CodeBuddy 又挂了。WorkBuddy 把它拖垮的——这个月第二次。」 我先笑了,又笑不出来了。 一款编程工具,被自家拆出来的办公助手拖下线,这种问题本身就很怪。 但腾讯 3 月大致就经历了这种事:
提示词工程最大的瓶颈,从来不是提示词。OpenAI 与 Anthropic 不约而同转向薄提示词,但真正的杠杆已转移到厚制品与 skill 文件夹。当模型能力增强,提示词只需指方向,背后的风格指南、案例库、决策框架才是护城河。还在磨钥匙、门后房间空着的人,终将输给默默填满房间的人。
Claude Code 里,模型和投入等级都能让答案变好,但机制完全不同。模型决定哪套冻结的权重处理请求,投入等级则控制 Claude 为任务做多少工作——读多少文件、跑多少测试、推进到什么程度。换模型是换知识,调投入是换努力。当 Claude 出错时,先问自己:它是没足够知识,还是没足够努力?