全网都在骂Claude变笨了。

Anthropic——就是Claude的开发商——自己出来回应了。结论出乎很多人意料:模型没变,问题出在提示词和上下文管理。

说白了就是:不是AI变蠢了,是大家没学会怎么跟它说话。

四条信号,一个方向

有意思的是,同一天还有三条信号,全在说同一件事——

36氪热榜#8:「越来越多公司发现AI不能替代人工」。不是AI不行,是用法错了。

36氪热榜#4:「AI批量造App也在批量埋雷」。AI写出来的东西没人审核,系统性风险正在暴露。

Hacker News上两个帖子同时刷屏——一个说「我的AI怀疑论朋友们都疯了」(↑2356),另一个说「整个公司被AI精神病控制了」(↑2105)。一个极端说AI万能,一个极端说AI无用。

四条信号合在一起看,指向同一个真相:不是AI太强或太弱,是同一把刀,有人切菜有人切手。


说个真事

做了17个品牌从0到1,说白了是赶上好时候、手里有好牌、团队给力。换个时间,什么都不是。

但不管哪个品牌,有一条经验是真金白银换来的。

做电商投流那会儿,同一个计划、同一拨人投,素材和定向变了,ROI能差十倍。

不是人变蠢了,是喂的东西不一样。

AI工具一模一样。

同一个DeepSeek、同一个豆包、同一个ChatGPT,有人用出花来,有人用出一堆废话。差的不是模型,是你怎么喂它。

提示词就是素材,上下文就是定向。 你给AI的背景信息越充分、任务描述越具体、格式要求越明确,输出质量就越高——和投流一模一样的道理。


为什么团队用AI效果参差不齐

根本原因就一条:90%的团队用AI是临时随手写提示词。

问你的团队:「你用AI写商品描述,提示词是什么?」大概率得到三种回答——

第一种:「就让它帮我写一段产品介绍。」——没有角色、没有受众、没有语气、没有格式。AI给你一段废话,你觉得AI不行。

第二种:「你是一个专业的电商文案,帮我写一段商品描述。」——好一点,但仍然没有产品参数、没有目标受众、没有竞品参考。

第三种:有一套模板——角色(电商文案)+ 任务(写商品描述)+ 背景(产品参数/目标受众/价格带/平台规则)+ 格式(标题/卖点/使用场景/促销话术)+ 约束(不夸大/不超过200字/不用违禁词)。

同一个模型,第一种出来的东西用不了,第三种出来的东西改两字就能发。

差距不在模型,在提示词。


三个场景,差距一目了然

电商/直播间

AI写商品描述。同一个DeepSeek——

提示词A:「帮我写一段零食的商品描述」

提示词B:「你是一个有10年经验的电商文案。帮我写一段智利车厘子JJ级的商品描述,目标受众是25-40岁女性白领,平台是抖音商城,要求:标题不超过15字,卖点3个(新鲜度/规格/性价比),使用场景1个(办公室下午茶/送礼),促销话术1句,全文字数150-200字,语气活泼但不low」

A出来的东西你自己都看不下去。B出来的东西,改两个形容词就能直接上架。

客服/售后

AI自动回复客户咨询。提示词写得好,回复精准且有温度;写得差,答非所问惹客户生气。

差的提示词:「你是客服,回复客户问题」

好的提示词:「你是某品牌的售后客服。回复原则:先确认客户问题,再给出解决方案,最后安抚情绪。涉及退款和赔偿的,必须先道歉再询问订单号,不要直接拒绝。语气:礼貌、简洁、有同理心。如果客户情绪激动,建议转为人工客服。」

差距全在提示词设计。

B2B/工厂

AI做报价单和方案书。给AI喂的行业背景、客户画像、产品参数越充分,输出越接近人工水平。

团队不会喂上下文——AI再强也白搭。


先做一件事:让团队展示最常用的5个提示词

不讲道理,讲动作。

第一步:让团队把最常用的5个提示词发给你看。

写商品描述?回复客户?做报价?做数据日报?让他们把实际用的提示词原文发出来,别让他们整理后发,要原始的。

第二步:检查有没有结构化模板。

是随手临时写的,还是有标准模板?大概率是临时写——这就是质量参差不齐的根因。

第三步:做一次对比实验。

选1个场景(如商品描述),让A用旧提示词写、B用结构化提示词写,对比输出质量。

差距一目了然。

第四步:盘点AI生成内容的去向。

团队用AI生成的东西发到哪里了?商品页?客服回复?广告文案?这些直接面对客户。质量差=客户体验差=转化率掉。


7天实验

项目 内容
假设 如果把团队最常用的5个提示词改成结构化模板(角色+任务+背景+格式+约束),可以在7天内将AI输出质量评分提升50%以上且减少返工率
动作 ① Day1:收集团队最常用的5个提示词,分析质量(有无角色定义/任务描述/输出格式/约束条件);② Day2-3:选3个最高频场景,编写结构化提示词模板;③ Day4-5:团队用新模板跑日常任务,对比旧提示词的输出,打分(1-5分质量评分);④ Day6-7:迭代模板,扩展到第4-5个场景,形成团队提示词库
指标 AI输出质量评分提升率(目标≥50%)、返工率下降(目标≥30%)、模板覆盖率(目标:TOP 5场景全覆盖)、团队满意度(目标:≥4/5分)
停止条件 ① 如果7天后输出质量评分无提升→说明该场景不适合模板化,需要人工判断为主;② 如果团队抵触使用模板→说明模板设计过于复杂,简化到「填空式」再试;③ 如果AI输出仍不稳定(同一提示词不同次结果差异大)→说明该任务复杂度超出当前模型能力,保留人工

诚实说几个局限

第一,提示词模板不是万能的。 模板提升的是下限——保证团队最差也能达到及格线。上限靠人的判断力。复杂场景仍需人工审,AI不能替你做最终判断。

第二,Claude在国内使用受限。 但核心论点适用于所有AI工具——DeepSeek、豆包、Kimi都一样。Anthropic的回应是信号源,不是推荐工具。

第三,别把提示词变成另一种形式主义。 模板是为了降低门槛、保证下限,不是为了限制创造力。如果团队觉得模板比写提示词还累,说明模板设计有问题,简化到「填空式」。

第四,这不是「买最贵的模型就能解决」的事。 团队不会用,换了也一样差。差的不是工具,是用法。省下换工具的钱,投到培训上。


回到开头

Anthropic说「模型没变,问题在提示词和上下文管理」。

说白了就是:AI没变蠢,是大家没学会怎么跟它说话。

当年做抖音电商是看见风口就扑上去。今年AI元年一样——光会做不够,得知道做什么。

AI工具人人能买、人人能用,差距全在使用方式。

花一天建提示词模板库,比换三个工具都管用。

先做一件事:让团队展示最常用的5个提示词。

差的不是模型,是你怎么喂它。 工具人人能买,差距在使用方式——这个判断,只有你能做。

机器听我的,不是机器替我。