昨天你问AI一个问题,它给你一段文字。今天你给AI一个任务,它替你干完了。

36氪今天热榜#1——OpenAI正式推出ChatGPT智能体。不是又一个新模型,是AI的能力边界变了。以前ChatGPT是你问它答,现在它可以跨应用执行任务、持续干几个小时、目标导向地自己跑完一件事。

就在前一天,Codex独立App下线,能力并入了ChatGPT。两天之内,OpenAI完成了从「最强模型」到「自主执行平台」的关键一跳。

有意思的是,同一天还有五条信号,全在说同一件事——

六个信号,一个方向

把今天的信号铺开看:

36氪热榜#1,ChatGPT智能体落地——AI从回答问题变成执行任务。

36氪07-11PM,Codex死了——独立App下线,能力并入ChatGPT Work。OpenAI从工具公司变成平台公司。

ReadHub,腾讯考虑入股Manus——通用Agent赛道被资本争抢,20亿美元估值。

ReadHub,中国移动上线Claw应用号——运营商在做Agent基础设施,短信就能远程操控AI智能体。

人工智能安全网,GuardFall披露开源AI智能体安全漏洞——Agent执行Shell命令有系统性风险。

新浪科技,工业品AI直播上岗——线上销售增三成。AI自动抓留言、匹配话术、归集线索、客户分级,人盯着转化节奏。

六个信号,从产品落地、资本验证、基础设施、安全风险、真实场景五个维度,交叉确认一件事:AI不再只是回答你的问题了,它开始替你干活了。


这跟你做生意有什么关系

说个真事。做了17个品牌从0到1,说白了是赶上好时候、手里有好牌、团队给力。换个时间,什么都不是。

但不管哪个品牌,头几个月都在盯同一件事——谁在接客户、谁在跟订单、谁在做报价

以前这些活全是人干的。客服团队回复常见问题,销售发报价跟进客户,运营整理数据做日报。每个品牌从0到1的时候,人手永远不够,重复活永远干不完。

现在呢?

AI不只能帮你写文案了。它可以帮你接住直播间的留言、匹配话术、归集线索。可以帮你查表发报价、打包发资料。可以帮你24小时回复咨询、确认预约、管理评价。

工业品AI直播增三成,就是这么干的——AI自动抓留言、匹配话术、客户分级,人盯着转化节奏。

问题不是「要不要用AI」。问题是「哪些活该交给机器、哪些必须人盯着」。


哪些活该交出去

讲一个判断框架。不是理论,是自己搭体系踩出来的。

自己搭了一个内容流水线——5个Agent跑情报、选题、写作、品控、增长。AI能推选题、写初稿、做品控。但最终发不发、角度对不对——靠人的判断。

这中间的分工很清楚:

AI干的活:24小时采集情报、按规则筛选选题、写初稿、做格式检查。这些活的特点是——重复、有规则可循、错了不会出大事。

人干的活:判断选题值不值得做、内容角度对不对、最终发不发。这些活的特点是——需要审美判断、错了会出大事、涉及品牌信誉。

把这个逻辑套到你的团队里:

AI可以接的活 必须人盯的活
客服常见问题回复(营业时间/地址/价格/退换货政策) 客户投诉和差评处理
报价发送(查表发标准报价) 谈判和定价决策
订单确认和物流跟进 大客户关系维护
数据整理和日报生成 战略判断和方向选择
线索分级和标签整理 创意和内容方向

左边那列,AI干得比人快、比人稳定、24小时不间断。右边那列,AI干不了,或者说——你不敢让它干。

这个分界线,就是你的审美判断。哪些活交出去、哪些留给自己——不是技术问题,是你对你生意的理解。


三个行业场景

电商/直播间

客服团队是最先被AI卷的。

直播间几十条留言同时进来,人工根本接不住。让AI Agent接住留言、匹配话术、归集线索、客户分级。人盯着转化节奏和货盘——哪个品该上、什么时候逼单、怎么配赠品。

工业品AI直播增三成就是这么干的。AI干24h接待,人做成交判断。

你省下的客服人力,可以去做复购运营和私域沉淀——这才是AI干不了的。

B2B/工厂

报价、资料发送、客户跟进这些标准化流程,让Agent自动跑。采购问「这个规格多少钱」,AI查表发报价;客户要案例资料,AI打包发送。

但谈判和关系维护——这是AI干不了的。一个大客户的合同条款、交期博弈、信任建立——这些必须人来做。

AI接走重复活,人腾出来做高价值的事。不是裁员,是让团队结构变合理。

本地门店

咨询回复、预约确认、评价管理。让AI Agent 24小时接咨询,自动回复常见问题(营业时间/地址/价格),复杂问题转人工。

你的店员不用再被「你们几点开门」「有没有停车位」这种问题打断。省下的时间做服务体验和复购运营。


先做一件事:列出你的5件事

不讲道理,讲动作。

第一步:列出团队每天重复做的5件事。

客服常见问题回复 / 报价发送 / 订单确认 / 客户分级 / 数据日报——你的团队每天花时间最多的重复活是什么?写下来。

第二步:标记哪些可以交给AI,哪些必须人做。

用上面那个表格的逻辑。重复、有规则、错了不出大事的——标记「AI可接」。需要判断、涉及关系、错了会出大事的——标记「必须人」。

第三步:给AI设围栏。

这一步最关键。列出让AI自动执行的边界——

  • 可以自动执行:回复常见问题、整理资料、发送标准报价、归集线索、生成数据日报
  • 必须人工确认:发最终报价、改订单、退款、处理投诉、发对外公告

GuardFall安全漏洞说的就是这件事——AI替你干活快,但它不懂什么是危险操作。给AI权限之前先设围栏:哪些操作它可以自己做,哪些必须你点一下确认。

第四步:算你的重复人力成本。

5件事每天占团队多少小时?如果AI接走3件,省下的人可以做哪些更高价值的事?


7天实验

项目 内容
假设 如果把团队每天重复做的5件事中的3件交给AI Agent,可以在7天内提升处理速度50%以上且客户满意度不降
动作 ① Day1:列出团队每天重复做的5件事,标记AI可接手的3件;整理TOP 20常见问题文档;② Day2-3:选1件最小重复活(如客服常见问题回复),用ChatGPT、豆包或DeepSeek训练Agent回复,人工审核质量;③ Day4-5:让Agent自动处理,人工只审核+接复杂问题,记录处理速度和客户反馈;④ Day6-7:扩展到第2件事(如报价发送),对比前后效率变化和客户满意度
指标 处理速度提升率(目标≥50%)、客户满意度变化(目标不降)、人工释放时间(目标每天≥2小时/人)、Agent错误率(目标<5%,超5%必须人工复核)
停止条件 ① 如果7天后客户满意度下降→说明Agent回复质量不够,缩减自动范围,只保留最简单的FAQ;② 如果Agent错误率>10%→说明该任务复杂度超出当前Agent能力,暂停自动执行恢复人工;③ 如果行业场景太复杂(如高客单价B2B需深度谈判)→说明该场景不适合Agent自动处理,保留人工

诚实说几个局限

第一,ChatGPT Agent在国内用不了。 但豆包、DeepSeek、Kimi都能做类似的事。核心不是用哪个平台,是「哪些活交给AI」的判断框架。别绑定单一平台——平台会变,判断框架不变。

第二,Agent在标准化任务上有效,复杂判断仍然需要人。 别指望AI替你谈判、替你做战略决策。它能帮你干重复活,但不能替你思考。

第三,安全围栏不是可选项。 GuardFall披露的漏洞说明Agent执行Shell命令有系统性风险。给AI权限之前,先想清楚:哪些操作它可以自己做、哪些必须你确认。宁可慢一步,不要让AI替你发了不该发的报价、改了不该改的订单。

第四,5个Agent流水线的效果不能直接套用。 自己搭的体系是自己控制的——流程、规则、质量标准都能自己管。不等于你搭一个Agent就能立刻跑通。给的是框架(哪些活交、怎么设围栏、怎么实验),不是承诺。


趁规则还没定,先实验

当年做抖音电商是看见风口就扑上去。今年AI元年一样——光会做不够,得知道做什么。

AI从回答问题变成替你干活,正在发生。不是「可能会」,是「已经在」——ChatGPT智能体落地了,Codex并进去了,Manus被争抢了,中国移动在做基础设施了,工业品直播间已经用上了。

现在Agent能力刚落地,规则未定、最佳实践未形成。先实验的人先积累经验,等大家都用上了你就是追赶者。

先做一件事:列出团队每天重复做的5件事,标记哪些可以交给AI。

然后挑1件最小的,跑一周看看。

机器听我的,不是机器替我。 AI替你干活,但哪些活交出去、哪些留给自己——这个判断,只有你能做。