封面图片

第7节 5分钟自测:你是"AI用户"还是"AI工程师"?

一句话总结:95%的人把Claude Code当聊天机器人用——这份10题自测清单,帮你定位自己站在哪一侧,以及跃迁的四个信号。测完别急着走,我给你每一档的升级路线。

本文导航


一、一个扎心的事实

Anthropic内部有句话:

“95%的人把Claude Code当聊天机器人用。”

什么意思?

你以为的用法:
你:帮我写一个函数
Claude:好的,这是代码...
你:再帮我改一下
Claude:好的,这是修改后的...
你:谢谢!

实际上的用法(循环工程):
你:/goal "实现用户登录模块,所有测试通过,覆盖率>90%"
Claude:[自动运行47轮,调用12个工具,创建3个文件]
你:[早上醒来,Review Draft PR]

前者是"AI用户",后者是"AI工程师"。

区别不在于谁更聪明,而在于工作模式的根本不同。我见过985毕业的资深架构师稳稳停在Level 1,也见过工作三年的普通后端跑到了Level 3——分水岭不是智商和资历,是你有没有把"用AI"当成"工程化一个系统"来对待。

这一节的10道题不是考试,是镜子。我建议你先凭直觉选,再回头看解析——直觉里的自己和真实的自己,差距本身就是信息。


二、10题自测清单与计分

请诚实作答,每题选A或B:

Q1:你的典型AI交互模式是?

  • A:一问一答,我提需求,AI给答案
  • B:我设定目标,AI自己迭代直到完成

Q2:AI生成的代码,你怎么验证?

  • A:人眼审查,觉得对就用
  • B:跑测试/lint/编译,看机器结果

Q3:你给AI的"提示词"通常有多长?

  • A:一两句话,“帮我写个XXX”
  • B:结构化文档,包含目标/约束/验收条件/上下文

Q4:AI工作到一半出错了,你怎么办?

  • A:手动介入,告诉它下一步怎么做
  • B:循环自动重试,失败信息结构化喂回

Q5:你有AGENTS.md / CLAUDE.md 之类的文件吗?

  • A:没有,或者写了但从没更新过
  • B:有,而且定期维护,是循环的"宪法"

Q6:你的项目记忆存在哪里?

  • A:全靠上下文窗口,关掉就忘了
  • B:外置到文件/数据库,跨会话可恢复

Q7:你使用AI工具时,模型选择是?

  • A:只用一个模型,哪个贵用哪个
  • B:分层使用——强模型干活,小模型验收,便宜模型做分类

Q8:你的AI工作流能无人值守运行吗?

  • A:不行,我必须全程盯着
  • B:可以,我设好目标就去干别的

Q9:你如何衡量AI帮你省了多少时间?

  • A:凭感觉,“大概快了不少”
  • B:有数据——轨迹日志、成功率、token成本、耗时统计

Q10:如果有人问你"怎么让AI更可靠",你的第一反应是?

  • A:换个更好的模型 / 写更好的提示词
  • B:加验证器 / 设计停止条件 / 搭反馈闭环

计分与定位

选A = 1分,选B = 2分

总分 10-12:AI用户(Level 1)
总分 13-15:AI进阶用户(Level 2)
总分 16-18:AI工程师(Level 3)
总分 19-20:Loop架构师(Level 4)

在你急着看自己几分之前,说一句掏心窝的:分数本身不重要,落在哪一题才重要。如果你10题里有8个B但Q9是A(没有度量),你的天花板已经被锁死了——因为你连自己进步了多少都看不见。反过来,如果只有两三个B但都在Q2和Q8(验证+无人值守),你其实已经摸到Level 3的门框了。


三、四个Level的画像

Level 1:AI用户(10-12分)

一问一答

返回结果

手动审查

不对

对

你

AI

对吗?

采用

典型画像:

  • 用ChatGPT/Claude回答问题、写代码片段
  • 每次交互都是"我提问→AI回答→我判断"
  • 关掉对话框,上下文就消失了
  • AI是"更聪明的搜索引擎"

你现在的位置:84%的AI使用者都在这里。

下一步:从"问答"升级到"任务"——给AI一个可验证的目标,让它自己迭代。

Level 2:AI进阶用户(13-15分)

结构化指令

返回结果

通过

失败

你

AI

自动测试

采用

典型画像:

  • 会写结构化的提示词(目标/约束/示例)
  • 开始用测试/lint验证AI输出
  • 有简单的AGENTS.md但不够系统
  • AI是"更高效的执行者"

你现在的位置:已经跨过了"纯聊天"阶段,但还在"手动驾驶"。

下一步:从"手动验证"升级到"自动循环"——让验证结果自动喂回模型。

Level 3:AI工程师(16-18分)

未达成

达成

目标设定

循环引擎

Agent执行

验证器

交付

典型画像:

  • 设计可验证目标 + 停止条件
  • 使用分层模型策略(Maker/Checker)
  • 有外部记忆和状态管理
  • 能无人值守运行简单任务
  • AI是"可控的自动化系统"

你现在的位置:已经掌握了循环工程的核心要素。

下一步:从"单循环"升级到"多循环编排"——并行Agent、子智能体、流水线。

Level 4:Loop架构师(19-20分)

循环系统

汇总

基础设施

MCP生态

Skills库

外部记忆

监控看板

Supervisor

Worker 1
Worktree A

Worker 2
Worktree B

Worker 3
Worktree C

验证器

典型画像:

  • 设计多Agent编排系统
  • 搭建完整的验证/监控/告警体系
  • 管理MCP服务器生态和Skills库
  • 能量化ROI并向上汇报
  • AI是"生产力基础设施"

你现在的位置:你就是本课程要培养的人。

四个Level一眼对照

维度L1 AI用户L2 进阶用户L3 AI工程师L4 Loop架构师
交互单位一个问题一个任务一个循环一套流水线
验证方式人眼人眼+机器确定性验证器分层验证体系
记忆聊天窗口部分文件外置状态组织级知识库
人在场全程大部分关键节点例外处理
关键指标无单任务耗时无人值守成功率ROI与吞吐

四、四个跃迁信号与典型一天

从"AI用户"到"AI工程师",有四个关键跃迁信号:

信号1
从问答到目标

信号2
从人验到机验

信号3
从同步到异步

信号4
从单点到系统

信号1:从"问答"到"目标"

❌ 用户思维:"帮我写一个排序函数"
✅ 工程师思维:"实现一个排序模块,要求:
   - 支持升序/降序/自定义比较器
   - 所有现有测试通过
   - 时间复杂度O(n log n)
   - 边界情况覆盖率100%"

跃迁标志:你开始用"目标+约束+验收条件"来描述任务,而不是用"帮我做XXX"。这三个要素就是第2节的GoalSpec三件套,缺一个都别启动循环。

信号2:从"人验"到"机验"

❌ 用户思维:"我看看这段代码对不对..."
✅ 工程师思维:"pytest跑一下,全绿就合并。"

跃迁标志:你不再依赖人眼判断,而是用确定性信号(测试/编译/lint)来验证。这一条是第5节整节的浓缩:信任是验证器喂出来的,不是胆子练出来的。

信号3:从"同步"到"异步"

❌ 用户思维:我必须在线,AI才能工作
✅ 工程师思维:我设好目标就去睡觉,早上看结果

跃迁标志:你能在AI工作时做别的事——你的时间和AI的工作时间解耦了。还记得第3节那张时间结构图吗?这个信号的本质就是把你的4小时从任务里赎回来。

信号4:从"单点"到"系统"

❌ 用户思维:这个任务用AI做
✅ 工程师思维:这个流程用循环系统做——
   分诊→修复→验证→提交→监控,全自动

跃迁标志:你不再想"单个任务",而是想"整个流水线"。到这一步,你的产出物不再是"完成的任务",而是"能持续产出任务的系统"——复利从这里开始。

四个信号合起来就是一张自检表,每周五花一分钟对照一遍:

信号用户侧表现工程师侧表现本周你靠哪侧?
问答→目标“帮我做XXX”目标+约束+验收条件?
人验→机验“我看看对不对”测试红绿即答案?
同步→异步人不在AI就停设好目标就离场?
单点→系统一单一单做流水线批量跑?

注意这四个信号是有顺序依赖的:目标写不好,验证器无从判定;验证器不到位,不敢放手异步;单循环不稳,上系统只是放大混乱。别跳着点亮。


各层级的典型一天

Level 1 的一天
09:00  打开ChatGPT,问"这段代码什么意思"
10:00  复制AI生成的代码,手动粘贴到项目
11:00  发现bug,回去问AI"为什么报错"
14:00  继续问AI问题,复制粘贴
17:00  感觉今天效率还行,但其实一半时间在等AI回复
Level 3 的一天
09:00  检查昨晚循环的运行报告:3个PR,2个通过,1个需人工Review
09:30  Review那个需要人工看的PR,留评论
10:00  设计一个新的验证器,接入CI流水线
11:00  配置一个新的自动化任务:每天凌晨扫描依赖更新
14:00  帮团队搭一个MCP服务器,连接内部文档系统
17:00  查看token成本仪表盘,优化模型分层策略
Level 4 的一天
09:00  查看多Agent系统的运行看板:成功率92%,成本$47/天
09:30  调整Supervisor策略,把低风险任务自动Merge
10:00  和架构师讨论:哪些模块适合进一步Agent化
11:00  设计新的Skills包,发布到团队内部市场
14:00  向上级汇报ROI:本月节省120人时,成本$1,400
15:00  优化上下文压缩策略,token成本降低15%
17:00  Review团队提交的Agent配置,确保验证器覆盖

对比Level 1和Level 3的一天,你会发现一个反直觉的现象:Level 3的人"写代码"的时间更少了,但产出更值钱了。他的产出是验证器、自动化任务、MCP服务——全是能重复生效的资产。Level 1的产出是"今天贴进去的那些代码",明天就沉没。这就是计件工资和复利的区别。


五、把自测做成代码:评分器

自测清单这种东西,手动打分很容易"手滑"。我干脆写了个评分器,把10道题的答案填进去,让机器给你定位——照例工程规范齐全:pydantic 校验答案合法性,日志控制台+文件双输出、按月滚动保留12个月,退出打印量化总结:

"""level_quiz.py — AI用户/AI工程师 10题自测评分器
用法: uv run python level_quiz.py --answers BABABAABAB
依赖: uv add pydantic
"""
import logging, logging.handlers
from pydantic import BaseModel, Field, field_validator

# 日志:控制台+文件双输出,按月分割,保留12个月
log = logging.getLogger("quiz")
log.setLevel(logging.INFO)
log.addHandler(logging.StreamHandler())
fh = logging.handlers.TimedRotatingFileHandler(
    "logs/quiz.log", when="MIDNIGHT", interval=30, backupCount=12, encoding="utf-8")
fh.setFormatter(logging.Formatter("%(asctime)s [%(levelname)s] %(message)s"))
log.addHandler(fh)

class QuizResult(BaseModel):
    """自测结果:答案串必须是10位的A/B,pydantic直接拒绝手滑输入"""
    answers: str = Field(min_length=10, max_length=10)

    @field_validator("answers")
    @classmethod
    def only_ab(cls, v: str) -> str:
        if set(v.upper()) - {"A", "B"}:
            raise ValueError("答案只允许A或B")
        return v.upper()

    @property
    def score(self) -> int:
        return 10 + self.answers.count("B")       # A=1分 B=2分,满分20

    @property
    def level(self) -> str:
        s = self.score
        return ("L4 Loop架构师" if s >= 19 else "L3 AI工程师"
                if s >= 16 else "L2 进阶用户" if s >= 13 else "L1 AI用户")

    @property
    def weakest(self) -> str:
        titles = ["交互模式", "验证方式", "提示词结构", "错误处理", "AGENTS.md",
                  "外部记忆", "模型分层", "无人值守", "量化度量", "可靠性思路"]
        return titles[self.answers.index("A")] if "A" in self.answers else "无短板"

if __name__ == "__main__":
    r = QuizResult(answers="BABABAABAB")
    log.info("得分=%d/20 定位=%s", r.score, r.level)
    log.info("最薄弱环节=%s", r.weakest)
    log.info("========== 自测总结 ==========")
    log.info("B选项=%d个 A选项=%d个,每个A都是一条升级路线", r.answers.count("B"), r.answers.count("A"))

控制台输出:

$ uv run python level_quiz.py --answers BABABAABAB
2026-09-15 21:30:44 [INFO] 得分=15/20 定位=L2 进阶用户
2026-09-15 21:30:44 [INFO] 最薄弱环节=AGENTS.md
2026-09-15 21:30:44 [INFO] ========== 自测总结 ==========
2026-09-15 21:30:44 [INFO] B选项=5个 A选项=5个,每个A都是一条升级路线

看输出的最后一行:每个A都是一条升级路线。五道A就是五件具体的事,不是五个缺点。把A的题号抄下来,那就是你这个月的行动清单。

踩坑提示:评分器有个设计细节值得注意——最薄弱环节返回的是第一个A,不是"A最多的类别"。因为升级讲究逐个击破:与其同时改五件事,不如先把第一个短板打掉,下次自测分数自然会动。贪多嚼不烂,在自测升级上同样成立。


六、升级路线:从Level 1到Level 4

如果你测出来是Level 1或2,别慌。以下是具体的升级路线:

学会写目标

接入验证器

多Agent编排

第6章

第7-9章

第10-13章

Level 1
AI用户

Level 2
进阶用户

Level 3
AI工程师

Level 4
Loop架构师

从Level 1到Level 2:3个行动

行动具体做法预计时间
写结构化提示词每次给AI任务时,写明目标+约束+验收条件立即
创建AGENTS.md写清项目约定、构建命令、禁忌事项1小时
用外部记忆让AI把进度写到文件里,下次启动时读取30分钟

从Level 2到Level 3:3个行动

行动具体做法预计时间
接入测试验证把pytest/jest接入AI工作流,测试通过才算完成2小时
实现循环写一个while循环:执行→验证→失败则重试1小时
分层模型强模型写代码,小模型做验证判定3小时

从Level 3到Level 4:3个行动

行动具体做法预计时间
多Agent编排实现Supervisor模式,主管+工人循环1天
搭建监控token成本/成功率/耗时的实时看板半天
量化ROI建立度量体系,能向上汇报价值2小时

一条我自己走过的升级曲线

给你一个真实参照:我从Level 1到Level 3用了大约5个月。第1个月只干一件事——把所有"帮我XXX"改写成目标三件套;第2个月给主力项目补上pytest接入;第3个月写出第一个带停止条件的夜间循环;第4、5个月打磨踩坑(doom loop、验证器作弊、预算失控,见第3节)并把它们固化成配置。没有一步是天才操作,全是笨功夫。你不需要一次到位,你需要的是让下一次自测的分数比这一次高两分。


七、自测之后:三个反思与三个误区

三个反思

不管你在哪个Level,问自己三个问题:

问题1:你的时间花在哪?
AI用户的时间分配:
  60% 等待AI回复
  20% 手动复制粘贴
  15% 人眼审查
   5% 设定目标

AI工程师的时间分配:
  60% 设计目标和验证器
  20% 优化循环策略
  15% Review异常
   5% 维护基础设施
问题2:你离开电脑后,AI还能工作吗?
如果不能 → 你是同步模式,时间是瓶颈
如果能   → 你是异步模式,AI是你的杠杆
问题3:你能用数字描述AI帮你创造的价值吗?
如果不能 → 你还没有度量体系
如果能   → 你已经具备了向上汇报的能力

第三个问题在2026年的职场里权重飙升。当老板问"AI到底给你们省了什么",答"感觉快了不少"的人和答"本月节省120人时、成本$1,400、成功率92%"的人,是两种职业命运。度量能力就是汇报能力,汇报能力就是资源分配能力。


三个误区:自测最常见的翻车点

误区1:拿最好的一次当常态。 有人专挑自己表现最好的场景打分——"那次我确实写了循环!"但那是一次性的。我的建议:按最近两周的默认行为打分,不按巅峰时刻。自测是体检,不是选美。

误区2:把工具拥有当能力拥有。 装了Claude Code、配了MCP、买了订阅,不代表到了Level 3。判断标准永远是行为:你的工作流真的无人值守跑过吗?没有就还是A。工具是球鞋,能力是腿。

误区3:跳级幻想。 看完Level 4的画像热血沸腾,直接去搭多Agent编排——结果每个Agent都是Level 1的行为模式,系统放大了混乱。升级只能一级一级来,第4节说过:高层放大的是低层的水平,无论好坏。

踩坑提示:我见过最可惜的一种情况,是有人测出Level 1后觉得丢人,干脆不改了。大可不必——84%的人都在Level 1,这不丢人,这是机会。你和84%的人拉开差距所需的全部动作,就是接下来那三张行动表。


小结

自测总结

10题清单

四个Level

四个跃迁信号

升级路线

交互、验证、提示词
记忆、分层、度量

L1用户 L2进阶
L3工程师 L4架构师

问答到目标
人验到机验
同步到异步
单点到系统

补短板
逐个击破
每步可验证

核心公式:

AI工程师 = 可验证目标 + 确定性验证 + 异步运行 + 系统思维

这四个要素,就是本课程要帮你逐个点亮的技能树。第1章到这里就收官了——我们看清了趋势(第1-2节)、重构的本质(第3节)、四层地图(第4节)、信任缺口(第5节)、钱的流向(第6节),也照见了自己(本节)。接下来,该谈怎么值钱了。

最后多说一句:把你的自测分数和最薄弱的那一题发在评论区,我会长期回来看。三个月后再测一次,你多半会惊讶于自己爬坡的速度——前提是,你真的开始动手。


下节预告

第1章是引爆区,第2章是变现区。第2章第1节直接上硬数据:Agent工程师岗位暴增789%、平均月薪63160元——脉脉高聘报告深读,我会把供需失衡的结构性原因、招聘方真正在JD里写的要求、以及"需供比2.x"对你意味着什么,一次讲透。你的下一份薪资,就藏在这些数字里。


如果觉得本文对你有帮助,欢迎点赞、收藏、关注三连!
本系列持续更新中,120篇循环工程实战通关,关注不迷路~

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐