AI 产品与 Agent

共 27 篇文章

Agent 替你干活,谁来管 Agent?

电脑锁屏、人已离开,手机上还能给 Agent 发指令看进度,这场景让人以为终于可以放手。但 WorkBuddy 文档里一个细节戳破了幻觉:连接电脑模式下,手机只是远程控制台,任务仍在电脑上跑,人走了机器还得留在岗位上。Agent 越来越会干活,谁来管它?

一场可期待的“百Bot大战”:云端 Ready-to-Go Agent

云端开箱即用的Agent正成为新战场:Grok Bot、Meta Muse、Manus Cue、OpenAI Dots接连登场,把云端电脑、技能包和连接器打包成一只bot,个人不必再自建运行时。竞争分两路:消费级抢身份与入口,企业级抢技能封装与运行边界。这场百Bot大战会像当年的百团大战一样重演吗?

AI 效率红利:砍人,还是扩大业务范围

AI压低执行成本后,企业账面上多出一块效率红利,真正的分岔在于:把它折成更低人力成本,还是用来服务过去养不起的客户与时段。IBM、Klarna、Paycom的裁员叙事好度量、好讲给资本市场听,而ClassPass、Mosaic、蚂蚁数字蚂力则把客服和承保边界推向7×24与小微客群。

AI 真正改变的,不是成本,而是企业能做什么生意(下篇)

AI省下的20%工时,为什么没有自动变成新生意?效率只是尚未被分配的能力,若无人决定它服务谁、承诺什么结果,就会停在内部,甚至抬高成本基数。真正的分界线是:新增能力能否变成客户愿意购买并验证的结果。而即便做出了新offer,还有更尖锐的一问——这份效率最终由企业、客户还是竞争对手拿走?

Jev,一个“沉默寡言”的模型,为什么能够火遍全网?

当所有新模型都在证明自己会写会聊会出视频时,TypeSafe AI 的 Jev 却几乎不说话:它不做聊天,只接收程序状态和预定义问题,返回 Choice、Score、Noul 这类机器可消费的类型化答案,把标定决策做成第一等 API。它真正补的是自动化里最贵的一环——质检与门禁。Jev 为何能火?

我把 GrokBot 改造成 Brand 5.0 的 24 小时后台研究引擎

GrokBot 界面简陋得像工程师随手搭的原型,却把云端持久运行的 Agent 架构完整推到用户面前。作者没把它当联网问答框,而是改造成 Brand 5.0 Lab 的 24 小时后台研究引擎,用六个 Bot 组成信息流水线。但云端自动化不是扔句口号就能跑,六步生命周期少一步都会翻车。

Agentic Workflow 落地:传统企业的组织题

把Agent塞进旧流程,往往只换来更长的审批链和更不稳定的中间层。传统企业落地Agentic Workflow,真正要改的不是工具栈,而是Operating Model:怎么定义工作、怎么组织能力、怎么让决策权与运行时治理持续生效。

转译:给 Claude Fable 5.1 写提示词

Claude Fable 5.1 的提示词技巧与 5 大不同:effort 档位是权衡智力与成本的主旋钮,默认 high 起步但需重测各档;长工具调用回合默认少发进度更新,需显式请求 thinking 块或加系统提示;智能体循环中可能每回合只发一次工具调用,加一句提醒即可批量并行;对话历史必须只追加不改写,否则报错;

转译:用 Grok Bot 组建开发工程团队

SpaceXAI 工程师用 Grok Bot 组建了一支五人工程机器人团队,自己只负责审查和决策。一个月合进 2000+ PR,三周做出 iOS v0,还能同时管理 200 多个云端 Agent。这套系统靠 Notion 数据库同步进度、Jenny 做运营复盘、夜间自动审计代码库。

千问办公测评:从悟空的D级,到目前最高分

上两篇,我写了《我把7款国产Agent扔进同一套真任务》和《WorkBuddy第一轮测评与上手教程》。这篇继续讲同一天完成的第二轮和第三轮,MiniMax、Kimi、智谱清言、悟空、千问办公和Trae(CN)一共六个国产Agents。 不知道悟空是何时开始放开全量使用的,在几个月前、它刚上线时,我甚至为了抢邀请码写了一

同一张任务:WorkBuddy交了58分,另外两款没跑起来

上一篇《我把7款国产Agent扔进同一套真任务》整体介绍了这次测评的四轮、12 次运行,接下来,我打算将 4 轮测评中、我对这 7 款国产 agent 使用的感受分享给大家。今天,先从第一轮、WorkBuddy 开始吧。 第一次跑 WorkBuddy,3.14 credits 花掉了,任务却连检索都没开始。 原因很朴素

Chat、Work、Code:为什么各大 AI 公司都在搭同一套三层产品栈

大约两周前,接近午夜,我还沉迷在测试 Fable-5,忽然手机亮了。一位在深圳做制造业出海运营的朋友发来一行字:「CodeBuddy 又挂了。WorkBuddy 把它拖垮的——这个月第二次。」 我先笑了,又笑不出来了。 一款编程工具,被自家拆出来的办公助手拖下线,这种问题本身就很怪。 但腾讯 3 月大致就经历了这种事:

提示词工程最大的瓶颈,从来不是提示词

提示词工程最大的瓶颈,从来不是提示词。OpenAI 与 Anthropic 不约而同转向薄提示词,但真正的杠杆已转移到厚制品与 skill 文件夹。当模型能力增强,提示词只需指方向,背后的风格指南、案例库、决策框架才是护城河。还在磨钥匙、门后房间空着的人,终将输给默默填满房间的人。

转译:Claude Code 中的模型与投入等级:知道得更多,还是更肯下功夫?

Claude Code 里,模型和投入等级都能让答案变好,但机制完全不同。模型决定哪套冻结的权重处理请求,投入等级则控制 Claude 为任务做多少工作——读多少文件、跑多少测试、推进到什么程度。换模型是换知识,调投入是换努力。当 Claude 出错时,先问自己:它是没足够知识,还是没足够努力?