卡码笔记-最强八股文
首页
计算机基础
C++
Java
Go
🔥大模型🔥
  • 大模型面经
  • Java面经
  • C++面经
简历专栏
秋招投递表
代码随想录 (opens new window)
首页
计算机基础
C++
Java
Go
🔥大模型🔥
  • 大模型面经
  • Java面经
  • C++面经
简历专栏
秋招投递表
代码随想录 (opens new window)
  • Claude学习专栏

    • 专栏介绍与学习路线
  • 入门与能力地图

  • 上下文与代码理解

  • Agent Loop与工作流

  • 团队与生产工程

  • 数据与行业观察

    • 40万次Claude Code会话
      • 这40万次会话,到底统计了什么
      • 最稳定的分工:人决定做什么,Agent决定怎么做
      • 真正的专家,一条指令能撬动更多行动
      • 从新手变成熟手,收益最大
      • 不会写代码的人,已经能做出软件了吗
      • Claude Code正在从“修Bug”走向“替你跑完整件事”
      • 想让Claude Code更靠谱,先补这5件事
      • 这份研究也不能被神化
      • 参考链接

# 40万次Claude Code会话揭示:真正拉开差距的,不是Prompt

前面我们写过Claude Code高效使用指南,讲了CLAUDE.md、Skills、Hooks和多Agent怎么配。

但还有一个更扎心的问题:大家用的是同一个Claude Code,为什么有人一句话能让它连续干十几步,有人来回聊半天,最后还是做不成?

Anthropic最近分析了约40万次Claude Code交互会话,覆盖约23.5万名用户。结论不是“专家更会写Prompt”,而是:越懂当前要解决的问题,越能让Agent真正干活。

# 这40万次会话,到底统计了什么

研究覆盖2025年10月至2026年4月的Claude Code CLI、Claude.ai和桌面端交互,不包含IDE集成、SDK和claude -p这类无人值守调用。

Anthropic用隐私保护工具分析完整会话,再结合代码增删、Git提交、PR和测试结果等信号,判断用户在做什么、谁负责决策,以及任务有没有成功。

这里的“专业程度”也不是看职位。

一个高级工程师第一次写Rust,可能还是新手;一个不会Python的会计,如果能说清月末对账规则,还能抓住脚本漏掉的边界情况,在这个任务上就是专家。

专业程度是针对当前问题的,不是简历上的头衔。

# 最稳定的分工:人决定做什么,Agent决定怎么做

研究把决策分成两类:

  • 规划决策:要做什么、选哪条路、什么算完成;
  • 执行决策:改哪些文件、写什么代码、跑哪些命令。

结果很清楚:典型会话里,人做了约70%的规划决策;Claude做了约80%的执行决策。

这说明Claude Code最有效的姿势,不是人盯着每一行代码,也不是把目标都扔给Agent自己猜。

人守住目标、约束和验收,Agent接管搜索、修改、运行与修复。

这张图回答的是:人机协作为什么不是“五五开”。人像建筑师一样决定盖什么、边界在哪、怎样才算完工;Agent施工队负责选择工具和完成具体动作。

# 真正的专家,一条指令能撬动更多行动

一条Prompt发出去,Claude平均会执行约10次行动:读文件、搜代码、修改、跑命令、再根据结果继续。

但不同用户之间差距很大。

用户在当前任务上的水平 每条Prompt触发的行动 Claude输出量
新手 约5次 约600词
专家 约12次 约3200词

别把这个结果理解成“专家的Prompt更长”。研究判断专业程度时,看的是用户能不能准确描述问题、要求Claude验证什么,以及出错后谁在纠正谁。

新手常说:“这个功能不对,帮我修一下。”

熟手会说清业务规则、失败现象、不能破坏的边界和验收证据。Agent不需要走两步就回来猜一次,自然敢连续做更多事。

真正有效的上下文,不是字多,而是里面有判断。

这张图回答的是:为什么两个人用同一个Agent,产出差距会这么大。新手只给一句模糊命令,熟手则把业务地图、边界和验收标准交给机器人。

# 从新手变成熟手,收益最大

Anthropic用了一个很严格的“验证成功”指标:不只让模型判断任务像是完成了,还要看到测试通过、匹配的Git活动或用户明确确认等硬证据。

新手会话达到验证成功的比例约15%,中级及以上达到28%—33%;如果放宽到“至少部分成功”,两边是77%和91%—92%。

更值得注意的是出错以后。

遇到明显错误、测试失败或反复重试时,新手最终验证成功的比例只有约4%,专家约15%。困难会话里,新手有19%直接放弃,其他层级只有约5%—7%。

不过,差距主要发生在“新手到中级”。从中级继续走到专家,提升反而没那么陡。

这对普通录友是个好消息:你不需要先成为顶级专家,但至少要对问题有一套能工作的理解。

# 不会写代码的人,已经能做出软件了吗

在真正产出代码的会话里,软件相关职业的验证成功率约34%,其他职业约29%;看“至少部分成功”,两边分别约89%和88%。

十大职业类别和软件工程师的差距都在7个百分点以内。管理类用户甚至略高,但研究也提醒,这可能和管理者更善于分派任务、表达完成有关,也可能受统计方式影响。

所以结论不是“编程已经没用了”。

更准确的说法是:代码语法和实现正在变得更容易获得,领域知识、任务拆解和结果判断正在变得更值钱。

律师能让Agent写合同检查工具,前提是他知道什么条款算风险;会计能让Agent写对账脚本,前提是他知道哪些差异必须报警。不会写代码不再是绝对障碍,不懂业务仍然是。

这张图回答的是:AI降低编程门槛以后,什么能力没有贬值。法律、财务和产品人员可以把规则交给Agent实现,但最后仍要靠专业判断验收。

# Claude Code正在从“修Bug”走向“替你跑完整件事”

七个月里,修复代码的会话占比从33%降到19%;部署、配置和运行软件从14%升到21%;写作与数据分析从约10%升到20%。

研究估算的平均任务价值也提升了约27%。这个数字来自和自由职业平台任务的粗略匹配,只适合看相对变化,不能当成Claude真的替用户赚了多少钱。

趋势仍然很明显:用户不再只让Agent补一段代码,而是开始把部署、数据、文档和完整工作流交给它。

这和我们在从Prompt走向Agent Loop里讲的是同一件事。任务越完整,真正重要的越不是某一句Prompt,而是目标、工具、验证和错误恢复能不能连成闭环。

# 想让Claude Code更靠谱,先补这5件事

第一,先把问题搞懂,再研究Prompt。 至少说清现状、目标、不能碰的边界和失败代价。

第二,把“什么算完成”写出来。 测试、截图、日志、指标和人工确认,都比“你检查一下”更有用。

第三,把专业证据交给Agent。 业务规则、历史案例、接口契约和项目文档,才是它做判断的材料。

第四,别替Agent遥控每一步。 人控制规划,执行层给它足够空间;否则你只是把Claude Code用成了昂贵的代码补全。

第五,出错时诊断,不要只换一种说法再问。 看测试为什么失败、假设哪里错了、缺了什么证据。能从错误里把Agent拉回来,正是熟手和新手最明显的差距。

这些经验可以继续沉淀进CLAUDE.md和Skills。个人脑子里的专业判断,只有变成项目规则、验收脚本和失败案例,团队里的Agent才能反复用上。

# 这份研究也不能被神化

40万次会话很多,但它仍然不是一次严格的因果实验。

职业、专业程度和成功结果主要由模型读取会话后分类;研究看不到代码最终有没有进入生产,也排除了大量无人值守和IDE里的Claude Code调用。“验证成功”比只听用户说完成更严格,但仍不等于真实商业结果。

所以不要拿这些数字证明“程序员会消失”,也不要证明“人人都能做软件”。它真正说明的是:当实现能力越来越便宜,懂问题的人会获得更大的杠杆。

别再只收藏万能Prompt了。

先让自己成为那个知道该做什么、也知道怎样才算做对的人。

# 参考链接

  • Anthropic研究(Agentic coding and persistent returns to expertise):https://www.anthropic.com/research/claude-code-expertise
Last Updated: 8/12/2026, 3:21:56 PM

← Claude Managed Agents

评论

验证登录状态...

侧边栏 侧边栏
夜间模式 夜间
卡码简历 卡码简历
代码随想录 代码随想录
卡码投递表 卡码投递表🔥
2026实习校招群 2026群
添加客服微信 2026实习校招客服微信 PS:通过微信后,请发送姓名-学校-年级-2026实习/校招
支持卡码笔记 支持卡码笔记
鼓励/支持/赞赏Carl 卡码笔记赞赏码
1. 如果感觉本站对你很有帮助,也可以请Carl喝杯奶茶,金额大小不重要,心意已经收下
2. 希望大家都能梦想成真,有好的前程,加油💪