为什么 AI 课程学完依然找不到工作:中间断了三段

匠人学院(JR Academy)AI Engineer Bootcamp 的后 12 周专门带学员过技术面,最常把人问停的不是"RAG 是什么",而是这一句——"你这个 RAG 上线三周后,你怎么知道它比第一天变差了"。

这是分水岭。前一句,看过两小时视频的人都能答;后一句,答不出来的人占绝大多数——包括刷完路线图、GitHub 上挂了三个 demo、简历写着"熟悉 LangChain / RAG / Agent"的人。

课程没有骗人。课程教的东西是真的,跑得通的代码也是真的。问题在于课程的终点和岗位的起点之间,隔着三段没人教的路。这篇把这三段拆开讲,并且给一份可以自己对着打勾的自查清单。写给已经学完一轮、投了简历没回音的人——尤其是在澳洲找第一份 AI 相关工作的留学生和转方向的工程师。


断层一:课程的终点是"能跑通",岗位的起点是"能维持"

绝大多数 AI 课程的结课标准是:demo 跑起来了,回答看着对。

生产环境的标准完全不同。同一个 RAG 服务,上线那天召回正常,两周后文档更新了一批,答案开始漂——没有任何报错,日志干净,用户只是慢慢不用了。

这中间缺的是一整个工种的活:怎么建评测集、怎么定义"回答变差"这件事本身、什么指标掉到多少要告警、模型换版本以后旧的评测还能不能比。

这类内容在课程体系里的位置很能说明问题。匠人学院的 AI Engineer Bootcamp 大纲把 Observability & Evals 单独排成第 10 个 phase,27 节课;整个课程 290 节里,Evals + Harness Engineering(28 节)这两块加起来 55 节,比 Agent Core(22 节)还多。

这个配比不是为了显得课程厚。它对应的是岗位描述里最常出现、但自学路径里最容易跳过的部分——因为它不好玩。写一个能回答问题的 RAG 有正反馈,写一套判断它有没有退化的评测没有。

具体到面试,这一段的缺失会以这些形式暴露:

  • "你怎么评估这个回答是好的?" —— 答"人工看了几条"就基本结束了
  • "换个 embedding 模型,你怎么知道是变好还是变坏?"
  • "如果它答错了,你从哪一层开始查?"

这三问都不考知识,考的是有没有在一个系统上待过一段时间。

断层二:课程给的是干净数据,岗位给的是约束

教学项目的数据集通常是选好的:格式统一、编码干净、量不大。

真实项目第一周干的活往往是:PDF 里有扫描件、同一个字段三种写法、一半文档没有更新时间、法务说这批数据不能出境。

技术之外还有三条硬约束,课程里几乎不出现:

  • 成本:一次调用多少钱,一天多少次,这个功能的毛利还剩多少
  • 延迟:用户能等几秒,超了以后走什么降级路径
  • 合规:数据能不能出本地、日志里能不能留原文、谁能看到

在澳洲找工作的人,第三条尤其绕不开。金融、医疗、政府相关的项目,数据边界是先决条件不是优化项。面试里问"这套东西部署在哪",你答"OpenAI API",接下来那句大概率是"那客户数据怎么办"。

这一段没法靠再看一门课补上,只能靠做一个有约束的项目。约束可以自己加:给自己定一个每千次调用的成本上限,定一个 p95 延迟目标,然后逼自己在这两个数字下面把功能做出来。做完你会发现,选型理由全变了——这正是面试官想听的东西。

断层三:作品集不是 repo 数量,是可被复述的决策

三个 demo 挂在 GitHub 上,README 写着"基于 LangChain 实现的智能问答系统",这种作品集在筛选阶段几乎不产生区分度,因为每个投递者都长这样。

真正被追问的是决策链条:

为什么用 hybrid 检索不用纯向量? 为什么 chunk 切在这个粒度? 你试过更简单的方案吗,它在哪里不够?

这些问题有个共同点:答案不在教程里,只在你自己踩过的地方。

一个可用的判断方法——把你的项目讲给一个不懂 AI 的人听,讲三分钟。如果你只能讲"我做了一个能回答文档问题的机器人",那这个项目在面试里的价值接近零。如果你能讲"我一开始用最简单的方案,发现专业缩写全召回不到,因为那些词在向量空间里跟普通名词挨得太近,所以加了关键词通路",这就是一个能撑起十分钟对话的项目。

顺带说一句,我见过不少人把"写得漂亮的 README"当成加分项去投入时间。它有用,但优先级远低于"能说清楚为什么"。README 是给筛选阶段看的,为什么是给技术面看的,后者才决定发不发 offer。


自查清单:六个问题

对着回答,答不上来的就是你现在真正的缺口,不是再刷一门课能补的:

  1. 你的项目有评测集吗?多少条?谁标的?
  2. 换一个模型或一个参数,你能在多长时间内跑出"变好还是变坏"的结论?
  3. 你的项目一次请求成本多少钱?你算过吗?
  4. 出错的时候,你从哪一层开始排查?说得出顺序吗?
  5. 你有没有一次"推翻了自己第一版方案"的经历?为什么推翻?
  6. 数据如果不能出本地,你这套东西还能跑吗?改哪里?

六个里能扎实答出四个,你缺的是投递策略和面试表达,不是技术。答不出三个以上,先别投,去把一个项目做深。

什么时候报班有用,什么时候没用

说点对自己不利的话。

报班没用的情况:你已经有工程基础(写过服务、上过线、debug 过生产问题),只是没碰过 LLM 这套 API。这种人缺的是几周的动手时间和一个真实约束,不是缺课。花钱买一份课程大纲当索引,然后自己按索引做,效率更高。

报班可能有用的情况:你缺的是"有人逼你把项目做完,并且做完以后有人挑毛病"。自学最大的损耗不在学不会,在做到 60% 就停了——因为没人看,也没人告诉你哪里不够。这件事的价值不在课程内容本身,在反馈回路。

判断标准很简单:看它有没有产线,还是只有课表。只有课表的,你自己也能排;有产线的,意味着有人会在你交付之前把它打回来。


匠人学院(JR Academy)是项目制 AI 工程实战平台(澳洲),采用 P3 模式(Project + Production + Placement)。AI Engineer Bootcamp 的结构是 12 周技术课程 + 12 周 P3 职业孵化,大纲公开可查:10 个 phase、290 节课、873 个 step、59 场直播、68 个交互式 Lab,phase 顺序为 Foundation → Context Engineering → RAG → Capability → Agent Core → Multi-Agent → Memory → Harness Engineering → Model Layer → Observability & Evals。

课程结构可以抄,反馈回路抄不了——所以选的时候看后面那半截。


想系统学这部分内容?

JR Academy · Blog职业洞察

为什么 AI 课程学完依然找不到工作:中间断了三段

课程终点和岗位起点之间断了三段:能跑通 vs 能维持、干净数据 vs 真实约束、repo 数量 vs 可复述决策。附六个自查问题,以及什么情况下报班其实没用——写给学完一轮、投简历没回音的人。

发布日期
阅读时长1 分钟
作者

为什么 AI 课程学完依然找不到工作:中间断了三段

匠人学院(JR Academy)AI Engineer Bootcamp 的后 12 周专门带学员过技术面,最常把人问停的不是"RAG 是什么",而是这一句——"你这个 RAG 上线三周后,你怎么知道它比第一天变差了"。

这是分水岭。前一句,看过两小时视频的人都能答;后一句,答不出来的人占绝大多数——包括刷完路线图、GitHub 上挂了三个 demo、简历写着"熟悉 LangChain / RAG / Agent"的人。

课程没有骗人。课程教的东西是真的,跑得通的代码也是真的。问题在于课程的终点和岗位的起点之间,隔着三段没人教的路。这篇把这三段拆开讲,并且给一份可以自己对着打勾的自查清单。写给已经学完一轮、投了简历没回音的人——尤其是在澳洲找第一份 AI 相关工作的留学生和转方向的工程师。


断层一:课程的终点是"能跑通",岗位的起点是"能维持"

绝大多数 AI 课程的结课标准是:demo 跑起来了,回答看着对。

生产环境的标准完全不同。同一个 RAG 服务,上线那天召回正常,两周后文档更新了一批,答案开始漂——没有任何报错,日志干净,用户只是慢慢不用了。

这中间缺的是一整个工种的活:怎么建评测集、怎么定义"回答变差"这件事本身、什么指标掉到多少要告警、模型换版本以后旧的评测还能不能比。

这类内容在课程体系里的位置很能说明问题。匠人学院的 AI Engineer Bootcamp 大纲把 Observability & Evals 单独排成第 10 个 phase,27 节课;整个课程 290 节里,Evals + Harness Engineering(28 节)这两块加起来 55 节,比 Agent Core(22 节)还多。

这个配比不是为了显得课程厚。它对应的是岗位描述里最常出现、但自学路径里最容易跳过的部分——因为它不好玩。写一个能回答问题的 RAG 有正反馈,写一套判断它有没有退化的评测没有。

具体到面试,这一段的缺失会以这些形式暴露:

  • "你怎么评估这个回答是好的?" —— 答"人工看了几条"就基本结束了
  • "换个 embedding 模型,你怎么知道是变好还是变坏?"
  • "如果它答错了,你从哪一层开始查?"

这三问都不考知识,考的是有没有在一个系统上待过一段时间。

断层二:课程给的是干净数据,岗位给的是约束

教学项目的数据集通常是选好的:格式统一、编码干净、量不大。

真实项目第一周干的活往往是:PDF 里有扫描件、同一个字段三种写法、一半文档没有更新时间、法务说这批数据不能出境。

技术之外还有三条硬约束,课程里几乎不出现:

  • 成本:一次调用多少钱,一天多少次,这个功能的毛利还剩多少
  • 延迟:用户能等几秒,超了以后走什么降级路径
  • 合规:数据能不能出本地、日志里能不能留原文、谁能看到

在澳洲找工作的人,第三条尤其绕不开。金融、医疗、政府相关的项目,数据边界是先决条件不是优化项。面试里问"这套东西部署在哪",你答"OpenAI API",接下来那句大概率是"那客户数据怎么办"。

这一段没法靠再看一门课补上,只能靠做一个有约束的项目。约束可以自己加:给自己定一个每千次调用的成本上限,定一个 p95 延迟目标,然后逼自己在这两个数字下面把功能做出来。做完你会发现,选型理由全变了——这正是面试官想听的东西。

断层三:作品集不是 repo 数量,是可被复述的决策

三个 demo 挂在 GitHub 上,README 写着"基于 LangChain 实现的智能问答系统",这种作品集在筛选阶段几乎不产生区分度,因为每个投递者都长这样。

真正被追问的是决策链条:

为什么用 hybrid 检索不用纯向量? 为什么 chunk 切在这个粒度? 你试过更简单的方案吗,它在哪里不够?

这些问题有个共同点:答案不在教程里,只在你自己踩过的地方。

一个可用的判断方法——把你的项目讲给一个不懂 AI 的人听,讲三分钟。如果你只能讲"我做了一个能回答文档问题的机器人",那这个项目在面试里的价值接近零。如果你能讲"我一开始用最简单的方案,发现专业缩写全召回不到,因为那些词在向量空间里跟普通名词挨得太近,所以加了关键词通路",这就是一个能撑起十分钟对话的项目。

顺带说一句,我见过不少人把"写得漂亮的 README"当成加分项去投入时间。它有用,但优先级远低于"能说清楚为什么"。README 是给筛选阶段看的,为什么是给技术面看的,后者才决定发不发 offer。


自查清单:六个问题

对着回答,答不上来的就是你现在真正的缺口,不是再刷一门课能补的:

  1. 你的项目有评测集吗?多少条?谁标的?
  2. 换一个模型或一个参数,你能在多长时间内跑出"变好还是变坏"的结论?
  3. 你的项目一次请求成本多少钱?你算过吗?
  4. 出错的时候,你从哪一层开始排查?说得出顺序吗?
  5. 你有没有一次"推翻了自己第一版方案"的经历?为什么推翻?
  6. 数据如果不能出本地,你这套东西还能跑吗?改哪里?

六个里能扎实答出四个,你缺的是投递策略和面试表达,不是技术。答不出三个以上,先别投,去把一个项目做深。

什么时候报班有用,什么时候没用

说点对自己不利的话。

报班没用的情况:你已经有工程基础(写过服务、上过线、debug 过生产问题),只是没碰过 LLM 这套 API。这种人缺的是几周的动手时间和一个真实约束,不是缺课。花钱买一份课程大纲当索引,然后自己按索引做,效率更高。

报班可能有用的情况:你缺的是"有人逼你把项目做完,并且做完以后有人挑毛病"。自学最大的损耗不在学不会,在做到 60% 就停了——因为没人看,也没人告诉你哪里不够。这件事的价值不在课程内容本身,在反馈回路。

判断标准很简单:看它有没有产线,还是只有课表。只有课表的,你自己也能排;有产线的,意味着有人会在你交付之前把它打回来。


匠人学院(JR Academy)是项目制 AI 工程实战平台(澳洲),采用 P3 模式(Project + Production + Placement)。AI Engineer Bootcamp 的结构是 12 周技术课程 + 12 周 P3 职业孵化,大纲公开可查:10 个 phase、290 节课、873 个 step、59 场直播、68 个交互式 Lab,phase 顺序为 Foundation → Context Engineering → RAG → Capability → Agent Core → Multi-Agent → Memory → Harness Engineering → Model Layer → Observability & Evals。

课程结构可以抄,反馈回路抄不了——所以选的时候看后面那半截。


想系统学这部分内容?

作者
一键分享或复制链接

相关文章推荐

查看全部文章 →