AI智能体循环工程-第1章第7节-2026循环工程元年-5分钟自测你是AI用户还是AI工程师

第7节 5分钟自测:你是"AI用户"还是"AI工程师"?
一句话总结:95%的人把Claude Code当聊天机器人用——这份10题自测清单,帮你定位自己站在哪一侧,以及跃迁的四个信号。测完别急着走,我给你每一档的升级路线。
本文导航
- 一、一个扎心的事实
- 二、10题自测清单与计分
- 三、四个Level的画像
- 四、四个跃迁信号与典型一天
- 五、把自测做成代码:评分器
- 六、升级路线:从Level 1到Level 4
- 七、自测之后:三个反思与三个误区
- 小结
- 下节预告
一、一个扎心的事实
Anthropic内部有句话:
“95%的人把Claude Code当聊天机器人用。”
什么意思?
你以为的用法:
你:帮我写一个函数
Claude:好的,这是代码...
你:再帮我改一下
Claude:好的,这是修改后的...
你:谢谢!
实际上的用法(循环工程):
你:/goal "实现用户登录模块,所有测试通过,覆盖率>90%"
Claude:[自动运行47轮,调用12个工具,创建3个文件]
你:[早上醒来,Review Draft PR]
前者是"AI用户",后者是"AI工程师"。
区别不在于谁更聪明,而在于工作模式的根本不同。我见过985毕业的资深架构师稳稳停在Level 1,也见过工作三年的普通后端跑到了Level 3——分水岭不是智商和资历,是你有没有把"用AI"当成"工程化一个系统"来对待。
这一节的10道题不是考试,是镜子。我建议你先凭直觉选,再回头看解析——直觉里的自己和真实的自己,差距本身就是信息。
二、10题自测清单与计分
请诚实作答,每题选A或B:
Q1:你的典型AI交互模式是?
- A:一问一答,我提需求,AI给答案
- B:我设定目标,AI自己迭代直到完成
Q2:AI生成的代码,你怎么验证?
- A:人眼审查,觉得对就用
- B:跑测试/lint/编译,看机器结果
Q3:你给AI的"提示词"通常有多长?
- A:一两句话,“帮我写个XXX”
- B:结构化文档,包含目标/约束/验收条件/上下文
Q4:AI工作到一半出错了,你怎么办?
- A:手动介入,告诉它下一步怎么做
- B:循环自动重试,失败信息结构化喂回
Q5:你有AGENTS.md / CLAUDE.md 之类的文件吗?
- A:没有,或者写了但从没更新过
- B:有,而且定期维护,是循环的"宪法"
Q6:你的项目记忆存在哪里?
- A:全靠上下文窗口,关掉就忘了
- B:外置到文件/数据库,跨会话可恢复
Q7:你使用AI工具时,模型选择是?
- A:只用一个模型,哪个贵用哪个
- B:分层使用——强模型干活,小模型验收,便宜模型做分类
Q8:你的AI工作流能无人值守运行吗?
- A:不行,我必须全程盯着
- B:可以,我设好目标就去干别的
Q9:你如何衡量AI帮你省了多少时间?
- A:凭感觉,“大概快了不少”
- B:有数据——轨迹日志、成功率、token成本、耗时统计
Q10:如果有人问你"怎么让AI更可靠",你的第一反应是?
- A:换个更好的模型 / 写更好的提示词
- B:加验证器 / 设计停止条件 / 搭反馈闭环
计分与定位
选A = 1分,选B = 2分
总分 10-12:AI用户(Level 1)
总分 13-15:AI进阶用户(Level 2)
总分 16-18:AI工程师(Level 3)
总分 19-20:Loop架构师(Level 4)
在你急着看自己几分之前,说一句掏心窝的:分数本身不重要,落在哪一题才重要。如果你10题里有8个B但Q9是A(没有度量),你的天花板已经被锁死了——因为你连自己进步了多少都看不见。反过来,如果只有两三个B但都在Q2和Q8(验证+无人值守),你其实已经摸到Level 3的门框了。
三、四个Level的画像
Level 1:AI用户(10-12分)
典型画像:
- 用ChatGPT/Claude回答问题、写代码片段
- 每次交互都是"我提问→AI回答→我判断"
- 关掉对话框,上下文就消失了
- AI是"更聪明的搜索引擎"
你现在的位置:84%的AI使用者都在这里。
下一步:从"问答"升级到"任务"——给AI一个可验证的目标,让它自己迭代。
Level 2:AI进阶用户(13-15分)
典型画像:
- 会写结构化的提示词(目标/约束/示例)
- 开始用测试/lint验证AI输出
- 有简单的AGENTS.md但不够系统
- AI是"更高效的执行者"
你现在的位置:已经跨过了"纯聊天"阶段,但还在"手动驾驶"。
下一步:从"手动验证"升级到"自动循环"——让验证结果自动喂回模型。
Level 3:AI工程师(16-18分)
典型画像:
- 设计可验证目标 + 停止条件
- 使用分层模型策略(Maker/Checker)
- 有外部记忆和状态管理
- 能无人值守运行简单任务
- AI是"可控的自动化系统"
你现在的位置:已经掌握了循环工程的核心要素。
下一步:从"单循环"升级到"多循环编排"——并行Agent、子智能体、流水线。
Level 4:Loop架构师(19-20分)
典型画像:
- 设计多Agent编排系统
- 搭建完整的验证/监控/告警体系
- 管理MCP服务器生态和Skills库
- 能量化ROI并向上汇报
- AI是"生产力基础设施"
你现在的位置:你就是本课程要培养的人。
四个Level一眼对照
| 维度 | L1 AI用户 | L2 进阶用户 | L3 AI工程师 | L4 Loop架构师 |
|---|---|---|---|---|
| 交互单位 | 一个问题 | 一个任务 | 一个循环 | 一套流水线 |
| 验证方式 | 人眼 | 人眼+机器 | 确定性验证器 | 分层验证体系 |
| 记忆 | 聊天窗口 | 部分文件 | 外置状态 | 组织级知识库 |
| 人在场 | 全程 | 大部分 | 关键节点 | 例外处理 |
| 关键指标 | 无 | 单任务耗时 | 无人值守成功率 | ROI与吞吐 |
四、四个跃迁信号与典型一天
从"AI用户"到"AI工程师",有四个关键跃迁信号:
信号1:从"问答"到"目标"
❌ 用户思维:"帮我写一个排序函数"
✅ 工程师思维:"实现一个排序模块,要求:
- 支持升序/降序/自定义比较器
- 所有现有测试通过
- 时间复杂度O(n log n)
- 边界情况覆盖率100%"
跃迁标志:你开始用"目标+约束+验收条件"来描述任务,而不是用"帮我做XXX"。这三个要素就是第2节的GoalSpec三件套,缺一个都别启动循环。
信号2:从"人验"到"机验"
❌ 用户思维:"我看看这段代码对不对..."
✅ 工程师思维:"pytest跑一下,全绿就合并。"
跃迁标志:你不再依赖人眼判断,而是用确定性信号(测试/编译/lint)来验证。这一条是第5节整节的浓缩:信任是验证器喂出来的,不是胆子练出来的。
信号3:从"同步"到"异步"
❌ 用户思维:我必须在线,AI才能工作
✅ 工程师思维:我设好目标就去睡觉,早上看结果
跃迁标志:你能在AI工作时做别的事——你的时间和AI的工作时间解耦了。还记得第3节那张时间结构图吗?这个信号的本质就是把你的4小时从任务里赎回来。
信号4:从"单点"到"系统"
❌ 用户思维:这个任务用AI做
✅ 工程师思维:这个流程用循环系统做——
分诊→修复→验证→提交→监控,全自动
跃迁标志:你不再想"单个任务",而是想"整个流水线"。到这一步,你的产出物不再是"完成的任务",而是"能持续产出任务的系统"——复利从这里开始。
四个信号合起来就是一张自检表,每周五花一分钟对照一遍:
| 信号 | 用户侧表现 | 工程师侧表现 | 本周你靠哪侧? |
|---|---|---|---|
| 问答→目标 | “帮我做XXX” | 目标+约束+验收条件 | ? |
| 人验→机验 | “我看看对不对” | 测试红绿即答案 | ? |
| 同步→异步 | 人不在AI就停 | 设好目标就离场 | ? |
| 单点→系统 | 一单一单做 | 流水线批量跑 | ? |
注意这四个信号是有顺序依赖的:目标写不好,验证器无从判定;验证器不到位,不敢放手异步;单循环不稳,上系统只是放大混乱。别跳着点亮。
各层级的典型一天
Level 1 的一天
09:00 打开ChatGPT,问"这段代码什么意思"
10:00 复制AI生成的代码,手动粘贴到项目
11:00 发现bug,回去问AI"为什么报错"
14:00 继续问AI问题,复制粘贴
17:00 感觉今天效率还行,但其实一半时间在等AI回复
Level 3 的一天
09:00 检查昨晚循环的运行报告:3个PR,2个通过,1个需人工Review
09:30 Review那个需要人工看的PR,留评论
10:00 设计一个新的验证器,接入CI流水线
11:00 配置一个新的自动化任务:每天凌晨扫描依赖更新
14:00 帮团队搭一个MCP服务器,连接内部文档系统
17:00 查看token成本仪表盘,优化模型分层策略
Level 4 的一天
09:00 查看多Agent系统的运行看板:成功率92%,成本$47/天
09:30 调整Supervisor策略,把低风险任务自动Merge
10:00 和架构师讨论:哪些模块适合进一步Agent化
11:00 设计新的Skills包,发布到团队内部市场
14:00 向上级汇报ROI:本月节省120人时,成本$1,400
15:00 优化上下文压缩策略,token成本降低15%
17:00 Review团队提交的Agent配置,确保验证器覆盖
对比Level 1和Level 3的一天,你会发现一个反直觉的现象:Level 3的人"写代码"的时间更少了,但产出更值钱了。他的产出是验证器、自动化任务、MCP服务——全是能重复生效的资产。Level 1的产出是"今天贴进去的那些代码",明天就沉没。这就是计件工资和复利的区别。
五、把自测做成代码:评分器
自测清单这种东西,手动打分很容易"手滑"。我干脆写了个评分器,把10道题的答案填进去,让机器给你定位——照例工程规范齐全:pydantic 校验答案合法性,日志控制台+文件双输出、按月滚动保留12个月,退出打印量化总结:
"""level_quiz.py — AI用户/AI工程师 10题自测评分器
用法: uv run python level_quiz.py --answers BABABAABAB
依赖: uv add pydantic
"""
import logging, logging.handlers
from pydantic import BaseModel, Field, field_validator
# 日志:控制台+文件双输出,按月分割,保留12个月
log = logging.getLogger("quiz")
log.setLevel(logging.INFO)
log.addHandler(logging.StreamHandler())
fh = logging.handlers.TimedRotatingFileHandler(
"logs/quiz.log", when="MIDNIGHT", interval=30, backupCount=12, encoding="utf-8")
fh.setFormatter(logging.Formatter("%(asctime)s [%(levelname)s] %(message)s"))
log.addHandler(fh)
class QuizResult(BaseModel):
"""自测结果:答案串必须是10位的A/B,pydantic直接拒绝手滑输入"""
answers: str = Field(min_length=10, max_length=10)
@field_validator("answers")
@classmethod
def only_ab(cls, v: str) -> str:
if set(v.upper()) - {"A", "B"}:
raise ValueError("答案只允许A或B")
return v.upper()
@property
def score(self) -> int:
return 10 + self.answers.count("B") # A=1分 B=2分,满分20
@property
def level(self) -> str:
s = self.score
return ("L4 Loop架构师" if s >= 19 else "L3 AI工程师"
if s >= 16 else "L2 进阶用户" if s >= 13 else "L1 AI用户")
@property
def weakest(self) -> str:
titles = ["交互模式", "验证方式", "提示词结构", "错误处理", "AGENTS.md",
"外部记忆", "模型分层", "无人值守", "量化度量", "可靠性思路"]
return titles[self.answers.index("A")] if "A" in self.answers else "无短板"
if __name__ == "__main__":
r = QuizResult(answers="BABABAABAB")
log.info("得分=%d/20 定位=%s", r.score, r.level)
log.info("最薄弱环节=%s", r.weakest)
log.info("========== 自测总结 ==========")
log.info("B选项=%d个 A选项=%d个,每个A都是一条升级路线", r.answers.count("B"), r.answers.count("A"))
控制台输出:
$ uv run python level_quiz.py --answers BABABAABAB
2026-09-15 21:30:44 [INFO] 得分=15/20 定位=L2 进阶用户
2026-09-15 21:30:44 [INFO] 最薄弱环节=AGENTS.md
2026-09-15 21:30:44 [INFO] ========== 自测总结 ==========
2026-09-15 21:30:44 [INFO] B选项=5个 A选项=5个,每个A都是一条升级路线
看输出的最后一行:每个A都是一条升级路线。五道A就是五件具体的事,不是五个缺点。把A的题号抄下来,那就是你这个月的行动清单。
踩坑提示:评分器有个设计细节值得注意——最薄弱环节返回的是第一个A,不是"A最多的类别"。因为升级讲究逐个击破:与其同时改五件事,不如先把第一个短板打掉,下次自测分数自然会动。贪多嚼不烂,在自测升级上同样成立。
六、升级路线:从Level 1到Level 4
如果你测出来是Level 1或2,别慌。以下是具体的升级路线:
从Level 1到Level 2:3个行动
| 行动 | 具体做法 | 预计时间 |
|---|---|---|
| 写结构化提示词 | 每次给AI任务时,写明目标+约束+验收条件 | 立即 |
| 创建AGENTS.md | 写清项目约定、构建命令、禁忌事项 | 1小时 |
| 用外部记忆 | 让AI把进度写到文件里,下次启动时读取 | 30分钟 |
从Level 2到Level 3:3个行动
| 行动 | 具体做法 | 预计时间 |
|---|---|---|
| 接入测试验证 | 把pytest/jest接入AI工作流,测试通过才算完成 | 2小时 |
| 实现循环 | 写一个while循环:执行→验证→失败则重试 | 1小时 |
| 分层模型 | 强模型写代码,小模型做验证判定 | 3小时 |
从Level 3到Level 4:3个行动
| 行动 | 具体做法 | 预计时间 |
|---|---|---|
| 多Agent编排 | 实现Supervisor模式,主管+工人循环 | 1天 |
| 搭建监控 | token成本/成功率/耗时的实时看板 | 半天 |
| 量化ROI | 建立度量体系,能向上汇报价值 | 2小时 |
一条我自己走过的升级曲线
给你一个真实参照:我从Level 1到Level 3用了大约5个月。第1个月只干一件事——把所有"帮我XXX"改写成目标三件套;第2个月给主力项目补上pytest接入;第3个月写出第一个带停止条件的夜间循环;第4、5个月打磨踩坑(doom loop、验证器作弊、预算失控,见第3节)并把它们固化成配置。没有一步是天才操作,全是笨功夫。你不需要一次到位,你需要的是让下一次自测的分数比这一次高两分。
七、自测之后:三个反思与三个误区
三个反思
不管你在哪个Level,问自己三个问题:
问题1:你的时间花在哪?
AI用户的时间分配:
60% 等待AI回复
20% 手动复制粘贴
15% 人眼审查
5% 设定目标
AI工程师的时间分配:
60% 设计目标和验证器
20% 优化循环策略
15% Review异常
5% 维护基础设施
问题2:你离开电脑后,AI还能工作吗?
如果不能 → 你是同步模式,时间是瓶颈
如果能 → 你是异步模式,AI是你的杠杆
问题3:你能用数字描述AI帮你创造的价值吗?
如果不能 → 你还没有度量体系
如果能 → 你已经具备了向上汇报的能力
第三个问题在2026年的职场里权重飙升。当老板问"AI到底给你们省了什么",答"感觉快了不少"的人和答"本月节省120人时、成本$1,400、成功率92%"的人,是两种职业命运。度量能力就是汇报能力,汇报能力就是资源分配能力。
三个误区:自测最常见的翻车点
误区1:拿最好的一次当常态。 有人专挑自己表现最好的场景打分——"那次我确实写了循环!"但那是一次性的。我的建议:按最近两周的默认行为打分,不按巅峰时刻。自测是体检,不是选美。
误区2:把工具拥有当能力拥有。 装了Claude Code、配了MCP、买了订阅,不代表到了Level 3。判断标准永远是行为:你的工作流真的无人值守跑过吗?没有就还是A。工具是球鞋,能力是腿。
误区3:跳级幻想。 看完Level 4的画像热血沸腾,直接去搭多Agent编排——结果每个Agent都是Level 1的行为模式,系统放大了混乱。升级只能一级一级来,第4节说过:高层放大的是低层的水平,无论好坏。
踩坑提示:我见过最可惜的一种情况,是有人测出Level 1后觉得丢人,干脆不改了。大可不必——84%的人都在Level 1,这不丢人,这是机会。你和84%的人拉开差距所需的全部动作,就是接下来那三张行动表。
小结
核心公式:
AI工程师 = 可验证目标 + 确定性验证 + 异步运行 + 系统思维
这四个要素,就是本课程要帮你逐个点亮的技能树。第1章到这里就收官了——我们看清了趋势(第1-2节)、重构的本质(第3节)、四层地图(第4节)、信任缺口(第5节)、钱的流向(第6节),也照见了自己(本节)。接下来,该谈怎么值钱了。
最后多说一句:把你的自测分数和最薄弱的那一题发在评论区,我会长期回来看。三个月后再测一次,你多半会惊讶于自己爬坡的速度——前提是,你真的开始动手。
下节预告
第1章是引爆区,第2章是变现区。第2章第1节直接上硬数据:Agent工程师岗位暴增789%、平均月薪63160元——脉脉高聘报告深读,我会把供需失衡的结构性原因、招聘方真正在JD里写的要求、以及"需供比2.x"对你意味着什么,一次讲透。你的下一份薪资,就藏在这些数字里。
如果觉得本文对你有帮助,欢迎点赞、收藏、关注三连!
本系列持续更新中,120篇循环工程实战通关,关注不迷路~
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)