Brand 5.0 Lab by Keye · 博客

科爷关于企业 AI 转型、品牌与营销、组织与工作流、AI 产品与 Agent 的长期写作。

共 36 篇文章

千问办公测评:从悟空的D级,到目前最高分

上两篇,我写了《我把7款国产Agent扔进同一套真任务》和《WorkBuddy第一轮测评与上手教程》。这篇继续讲同一天完成的第二轮和第三轮,MiniMax、Kimi、智谱清言、悟空、千问办公和Trae(CN)一共六个国产Agents。 不知道悟空是何时开始放开全量使用的,在几个月前、它刚上线时,我甚至为了抢邀请码写了一

同一张任务:WorkBuddy交了58分,另外两款没跑起来

上一篇《我把7款国产Agent扔进同一套真任务》整体介绍了这次测评的四轮、12 次运行,接下来,我打算将 4 轮测评中、我对这 7 款国产 agent 使用的感受分享给大家。今天,先从第一轮、WorkBuddy 开始吧。 第一次跑 WorkBuddy,3.14 credits 花掉了,任务却连检索都没开始。 原因很朴素

中国 API 中转站产业的崛起与生态重构(下篇)

(在中篇里,我们分析了API中转站产业的技术风险——从数据可见节点到agent工具链的风险放大,从上游封号到协议转换的隐性损失。我们也梳理了监管边界——从备案登记到数据出境,从电信资源到上游合同,四条红线越来越清晰。但更重要的问题是:在这波泼天富贵中、在这个缺口里,到底谁能活得久,谁可能会出事,谁更有可能长大?) 这一

中国 API 中转站产业的崛起与生态重构(中篇)

(承接上篇:我们看到了API中转站产业从"知道的人才知道"变成"几乎所有AI用户都绕不开"的爆发式增长,也梳理了从开源底座到托管平台到具体入口的五层价值链。但当产业结构分层完成、当孙宇晨和傅盛相继入局,一个更深层的问题浮现出来:这个产业最危险的地方,到底在哪里?) 现在大家火热的"API中转站"讨论中,更多关注着高额利

中国 API 中转站产业的崛起与生态重构(上篇)

这几天,趁着假期到香港处理一些积压的事情,晚上约了几个朋友一起吃蛇羹,许久未见一桌人、不约而同的聊到了同一个话题——不是什么新出的AI模型,而是某个"API中转站"。 一个说他们团队都在用OhMyGPT,一个说他这几天正在试B.AI,我有点儿好奇:这玩意儿什么时候从"知道的人才知道"变成"几乎所有AI用户都绕不开"了?

Chat、Work、Code:为什么各大 AI 公司都在搭同一套三层产品栈

大约两周前,接近午夜,我还沉迷在测试 Fable-5,忽然手机亮了。一位在深圳做制造业出海运营的朋友发来一行字:「CodeBuddy 又挂了。WorkBuddy 把它拖垮的——这个月第二次。」 我先笑了,又笑不出来了。 一款编程工具,被自家拆出来的办公助手拖下线,这种问题本身就很怪。 但腾讯 3 月大致就经历了这种事:

提示词工程最大的瓶颈,从来不是提示词

提示词工程最大的瓶颈,从来不是提示词。OpenAI 与 Anthropic 不约而同转向薄提示词,但真正的杠杆已转移到厚制品与 skill 文件夹。当模型能力增强,提示词只需指方向,背后的风格指南、案例库、决策框架才是护城河。还在磨钥匙、门后房间空着的人,终将输给默默填满房间的人。

转译:Claude Code 中的模型与投入等级:知道得更多,还是更肯下功夫?

Claude Code 里,模型和投入等级都能让答案变好,但机制完全不同。模型决定哪套冻结的权重处理请求,投入等级则控制 Claude 为任务做多少工作——读多少文件、跑多少测试、推进到什么程度。换模型是换知识,调投入是换努力。当 Claude 出错时,先问自己:它是没足够知识,还是没足够努力?

三个model、五个等级,新款Codex中的GPT-5.6究竟应该怎么选?

这两天 AI 业界的顶流是 OpenAI,它家新款 model GPT-5.6 上线,整个过程都挺魔幻的: 先是 Codex 被产品经理一声不吭地强行塞进 ChatGPT,图标和名字都被抹掉。 然后,死忠粉们在各大社区吵翻了天,吵到第二天,官方又服软,给它在应用里留了一块"牌位",算是保住了点体面。 这场闹剧之外,我们

WorkBuddy、千问办公……我把7款国产Agent扔进同一套真实任务,4轮、12次运行,仅2次合规通过测试

7款国产Agent,4轮、12次真实任务,仅2次合规通过。它们能检索、写报告、生图,却卡在时间窗、目录权限、文件格式这些细活儿上。有的把CSV存成XLSX,有的改写路径越权写入,有的直接卡在环境初始化。能回答问题,和能进入工作流,之间隔着多少具体细节?