上周,Anthropic 扔出了一份报告。起初我没太当回事,毕竟这家公司最近的动静实在太多了,一会儿推行实名认证,一会儿顶级模型只给看不给用,还跟美国政府闹出一些纠葛。现在再看到他们家的名字,都快没什么感觉了。
不过,等我把报告的详细内容认真看完之后,还是忍不住想把它分享给你。因为这不是那种“我们猜测未来会如何”的趋势畅想,而是一份扎扎实实的真实数据报告。
他们剖析了约 40 万次真实的 Claude Code 交互对话,这些对话来自大约 23.5 万名用户,时间跨度为 2025 年 10 月到 2026 年 4 月,整整七个月。

▲Anthropic 报告图表
01 为什么这份报告值得细看
先说说它为什么值得你花时间读下去。
Claude Code 是过去一年里,全球知识工作者重点使用的 AI 编程产品之一。说“之一”只是为了不把话说满,但在 AI 这个圈子里,它几乎成了必选项。即便是它的竞争对手谷歌,其工程师也一边开发自家的同类产品,一边公开夸 Claude Code 好用。
要留意的是,它现在早已不是单纯的“写代码工具”,而是一个能够独立完成复杂任务、具备专业 BG 视讯服务级响应能力的 AI 产品。
你只需一个指令,它就会自行读完文件、改动代码、执行命令、检查结果,最后再回到你面前。报告里有一个小数据:一条指令下去,它平均会触发约 10 个动作,输出接近 2400 字。
因此,这份报告里的数据不是实验室里跑出来的,不是安排测试人员按预设任务来完成的,而是几十万人在日常工作中,用 AI 干活的真实印记。
在 AI 行业,这种一手数据几乎是从前没出现过的。大多数 AI 研究报告,要么是跑跑测试题,要么是发发调查问卷,要么是分析一下公开的代码仓库。
可真实的人机协作过程究竟是什么样子的,人说了什么、AI 做了什么、最终成了没有,这些细节只有像 Anthropic 这样既做模型又能看到实际使用情况的公司,才握在手里。
当然,有了这个先例,我倒希望能看到 Codex 也拿出一份类似的报告。这样一来,就能把两个平台的数据并排对比了。
02 判断归人,执行归 AI
这份报告最重大的发现,是头一回用真实数据坐实了一件事:人主要做判断,AI 主要做执行。
具体来说,在一个典型的会话里,大约 70% 的规划决策是人做的——比如“做什么”“选哪条路”“做到什么程度才算完”;而 AI 则承担了大约 80% 的执行决策,也就是“改哪些文件”“写什么代码”“跑哪些命令”。
70% 和 80%,这两个数字不是猜测,也不是推演,而是 40 万次对话中实际发生的分工比例。人把控 what,AI 处理 how,这句话以前很多人都在讲,可从来没有人用数据给出过支撑。现在有了。
那么,这种分工具体是什么样子呢?
举个简单的例子:你跟 Claude Code 说一句“帮我把这个登录页面的 bug 修一下”,接着 Claude Code 自己读了三份配置文件,改了两处代码,跑了一遍测试,没过,又回过头改了一处,再跑,通过了,最后把所做的修改列出来给你看。
整个过程中你只说了一句话,Claude Code 却做了十几个动作。你决定要修什么,它决定怎么去修。这就是那 70% 和 80% 的含义。
而且这种分工还在继续深化。报告追踪了七个月的变化,发现了一个相当有意思的趋势:
修 bug 的会话占比从 33% 落到 19%,说明用户不再仅仅用它来打补丁了;运行软件从 14% 升到 21%,说明用户开始让 AI 去部署和跑流程了;写作和数据分析加在一起,从大约 10% 翻倍到了 20%,说明非程序员也正大批进场。
七个月下来,用户开始把更靠近最终交付的任务交给它。任务的平均估算价值也攀升了 27%。
AI 编程工具的进化方向,已经不是“更会补全代码”,而是用户正尝试让它去做代码之外的活计了。
03 在 AI 面前,人的资历被清零了
好,判断归人,执行归 AI,分工理清了。那么接下来的问题就是:既然 AI 负责动手干活,究竟是什么决定了人的判断水平是优是劣?
我觉得报告里最犀利的发现就在这里了,连它使用的定义本身都很有意思。
Anthropic 给每个会话里的用户打上了一个“专业度”评分,从新手到专家共分五个等级。不过他们口中的“专家”,跟我们通常所理解的可完全不一样。一提起专家这个词,我们脑海里常常浮现的是老教授、名医,衡量标准大多是职业资历。
但在这一份报告里,它根本不管你的职位头衔,不管你在行业里摸爬滚打多少年,也不看你的学历和证书。它只盯着你在这一个具体任务上的具体表现,主要看三个信号——
你的指令够不够精准,你知不知道该让 AI 验证什么,以及当 AI 理解偏了的时候,你能不能发现并且把它纠正过来。
一个从来没写过代码、不懂 Python 的会计,却能明明白白地告诉 Claude Code,对账脚本必须遵循哪些规则,并且能够抓住月末结账时的边界错误。就这个任务而言,她就是专家。
反过来,一名资深的软件工程师,如果对 Rust 并不熟悉,那么他在 Rust 相关任务里给出的指令就会失之精准,也不太知道该让 AI 核实什么,在 AI 眼里,他就是个新手。不是因为他资历浅,而是因为在这个具体任务上,他给出来的指令质量就是新手的水准。
这背后意味着什么?意味着我们在人类圈子里的资历,在 AI 面前被清零了。
比方说,我做了 20 年产品经理,但如果只是扔给 AI 一句“你帮我写一下某个功能的产品需求文档”,那么在 AI 眼中我就是一个产品经理新手,因为指令的质量太低了。
这么看下来,一批只习惯于管人的中高层领导,到了 AI 面前,恐怕要被划归“职场新手”了。
04 专家的一条指令,抵得上新手五倍
“指令质量”带来的差距到底有多大?这份报告给了我们实打实的数字。从前没有数据说得清这件事,但现在答案摆在这里了。
在典型的新手会话里,用户每发出一条指令,Claude Code 平均触发 5 个动作,输出 600 字。而在专家会话里,每条指令能触发 12 个动作,输出 3200 字。
12 对 5,3200 对 600。专家的一条指令,顶得上新手的好几条。按每条指令的产出来衡量,专家从 AI 那里拿回来的东西,是新手的五倍还不止。不是 AI 故意偏心,而是专家的指令让 AI 能跑出去更远。
而且这个差距并非因为专家打进来的字数更多。报告做了变量控制,在拉平了工作类型、任务价值、时间、职业和模型家族等因素之后,专业度每提升一个等级,Claude Code 的动作数依然增加 9%,输出字量增加 13%。这种趋势依旧十分明显。
这说明什么?好的指令不代表事无巨细地操控,不是把每一步该怎么走都一股脑儿地告诉 AI。好指令是一种高质量的授权,是你把目标、边界和验收标准讲得足够明白,让 AI 接手后能自己跑出很远。
你或许会说,这不就跟带团队一样吗?给下属布置任务时,把目标讲透彻、把验收标准定清晰,下属自然就能自己往下推进。
确实有些像,但有一个关键区别:你的下属是一个有判断力的大活人,你跟他说“帮我做一个对账脚本”,他心里大致有谱,知道一个合格的对账脚本该长什么样,会自行补上你没讲的那部分。
可 AI 不一样,它能力很强,但理解维度很窄。你不把边界说清楚,它不会自己去猜;你不把验收标准亮出来,它不知道该往哪个方向跑。
你对 AI 说“帮我写个脚本”,它当真就只给你写个脚本,至于对没对上账、规则对不对,它一概不管。可如果你对 AI 说“帮我写个对账脚本,必须校验这三条规则,月末结账的边界情形要单独处理”,AI 拿过去就能自个儿跑出一条完整的路径来。
前者是甩手掌柜,后者才是高质量授权。差的不在于你说了多少字,而在于你有没有把 AI 真正需要的东西交到它手里。
05 管理者的验证成功率
说到指令质量,报告里还有一个让人颇感意外的发现。
在那些确实新增或修改了代码的会话里,Anthropic 把用户按职业分了类,然后比较他们完成任务的成功率。
这里所说的成功率,不是 AI 自己说一句“我做完了”就算数。报告设了一个更严格的标准,叫作“验证成功”,要么代码已经提交,要么测试已经通过,要么用户在对话中明确确认“这就是我要的”。必须得有硬证据,才作数。
按照这个标准,十大职业的验证成功率,跟软件工程师之间的差距全都不超过 7 个百分点。软件工程师及相关数学岗位的用户,任务验证成功率大约在 34%;管理类职业约 37%,法律类约 33%,商业金融约 29%,医疗、设计、销售、教育、科学类则在 27% 到 28% 上下。
留意到了吗?管理职业的验证成功率居然比软件工程师还要高。
报告特别说明,这可能与管理者的工作习惯有关,他们更擅长明确地确认结果,毕竟当领导的人早就习惯了说“对对对,就是这个”。
但哪怕打个折,这份数据依然释放出一个强有力的信号:拆解任务、讲清目标、授权委派、核查结果,这些原本属于管理动作的技能,现在也成了操作 AI 的技术动作。过去能管好人,现在同样能管好 AI。
你并不需要先把自个儿训练成工程师,但你得能把业务规则、边界条件和验收标准说明白。AI 可以帮你写代码,可它没法替你判断什么才叫“对”。
06 翻车之后,才是真正的分水岭
前面讲的是让 AI 知道什么叫“对”,但这和发现 AI 哪里理解错了,还不完全是同一回事。
报告里还有一组数据,我觉得比前面所有的都更值得反复琢磨。
它把会话中“遇到麻烦”的情况单独抽了出来。所谓“遇到麻烦”,就是指出现了报错、测试失败、反复重试、用户流露出不满等信号。在执行复杂任务时,AI 出错是常态,这没什么可丢人的。
然而,在碰到麻烦之后,不同专业度的用户,结局就完全两样了。
碰上麻烦以后,新手会话的验证成功率滑落到只有 4%,专家则是 15%。4% 是什么概念?就好比 100 次遇到麻烦,新手只有 4 次能成功挽救回来。
更扎眼的是放弃率:遇到麻烦后,19% 的新手直接放弃了,判定为失败且最终没有再写任何代码。而其他专业度级别的用户,放弃率只有 5% 到 7%。
这告诉我们,专业用户的优势,不在于永远不出错,而在于翻了车之后懂得怎么把 AI 拽回来。他们知道该补充什么约束,该要求 AI 验证什么,该朝哪个方向去纠偏。
而新手呢,不是 AI 不卖力,而是自己根本不晓得该往哪里拽。AI 在等着你给方向,可你给不出来,那就只能放弃。
这其实也是最令人忧心的地方。新手的放弃率高,并不是因为 AI 帮不了他们,恰恰相反,AI 就在那里候着,只要你给出正确的方向它就能跑起来。
可新手给不出方向,于是得出一条结论:“AI 不好用”,然后就放弃了。而专家遇到同样的困境,会说“你这里理解错了,应该是这样的”,而后继续往前推进。
同一个工具,同一个困境,结局却截然不同。差的不是工具,而是人对问题的理解深度。
写在最后
报告里有一句话给我留下了很深的印象:
❝
生产软件,也许正在从一种程序员专属的职业能力,演变为一种普适的工作能力。
这是报告中的一项推测,我觉得说得挺在理。当然,这绝不是说非程序员就可以替代软件工程师了,工程师的价值从来不只是写代码,还包括系统架构、风险控制、长期质量维护,这些是 AI 暂时还替代不了的。
但方向是对的——未来,不是每个人都变成程序员,而是各行各业里懂问题的人,可以直接生产脚本、自动化流程、内部工具和技术文档。
律师会写合同检查脚本,还是一名律师;会计指挥 Python 对账,还是一名会计。编程将不再是程序员的专利,而是各行各业解决自身问题的工具。
透过这份报告,我们更清楚地看到:在 AI 面前,你的资历被清零了,但你的专业能力并没有被清零,它只是换了一种接口和表现形式。
所以,下次你跟 AI 对话前,不妨先在脑子里过一遍这三件事:
① 我有没有把目标说清楚?
② 我有没有告诉它该去验证什么?
③ 假如它理解错了,我能不能发现并把它纠正过来?
把这三件事做到位,你就是那个能让 AI 跑出五倍产出的人。
相关报告:
《Agentic coding and persistent returns to expertise》
https://www.anthropic.com/research/claude-code-expertise