「大模型行业在招什么人」这个问题,网上的答案要么是培训机构的焦虑营销,要么是一句「学 AI 就完了」。这篇换一种做法:以公开 JD 为证据——OpenAI 和 Anthropic 的官方招聘页、国内猎聘/智联/校招的具体岗位、多份 2026 年招聘市场报告——反推出这个行业真实存在的十个工种;然后把每个工种拆到底:能力矩阵 → 每格的细化技能 → 每项技能的代表技术 → 一个 2–4 周能做完的最小验证项目。你可以把这篇当成一张技能树的总图:每个工种是一条分支,能力矩阵是分支展开的子节点,最小验证项目就是低成本的 rollout——走一遍就知道这条分支值不值得继续投入。
〇、先看整张地图:一条价值链,四条产线,十个工种
一个大模型从无到有再到赚钱,价值链只有一条:造模型 → 跑模型 → 用模型 → 管模型。所有公开招聘的技术工种都能挂到这四段上:
| 产线 | 工种 | 一句话职责 | 典型雇主证据 |
|---|---|---|---|
| 造模型 | ① 预训练算法工程师 | 决定模型架构、数据配比,把损失曲线压下去 | 各基座模型公司;国内 JD 常写「继续预训练」 |
| ② 后训练/对齐算法工程师 | SFT、RLHF/RL,把基座调教成有用的助手 | Anthropic「RL 环境与奖励设计」岗;国内 JD 高频词 | |
| ③ 数据工程师/环境构建师 | 语料管线、合成数据、RL 环境与判分器 | 前沿实验室每年人类数据开销约 10 亿美元级(Labelbox CEO 口径) | |
| 跑模型 | ④ 训练 Infra 工程师 | 让几千张卡长时间不空转、不炸训练 | OpenAI「Data Infrastructure - Research」等岗 |
| ⑤ 推理/Serving 优化工程师 | 同样的卡跑出更多 token、更低延迟 | OpenAI 单独设 Inference 团队,细分到 AMD 适配、网络、多模态 | |
| ⑥ GPU 平台/集群工程师 | K8s、InfiniBand、GPU 健康,机房层的地基 | OpenAI「Principal Engineer, GPU Platform」JD 原文 | |
| 用模型 | ⑦ Agent/大模型应用工程师 | RAG、Agent、上下文工程,把模型能力变成产品功能 | 国内招聘量最大的一类;阿里云 2026 校招设「大模型应用算法工程师」 |
| ⑧ FDE/解决方案架构师 | 驻场客户,把产品变成客户的业务结果 | FDE 岗位量 2025 年 1 月至 2026 年 4 月增长 5230%(Indeed 数据,Business Insider 报道) | |
| 管模型 | ⑨ Evals 工程师 | 定义「好」,把验收标准做成可执行的评测 | 前沿实验室持续招聘;应用公司把它列入前十号技术员工 |
| ⑩ 安全/红队工程师 | 攻击自家模型,建防护栈 | Anthropic 设 Safeguards 团队;红队岗四到八个 offer 属常态(招聘方报告口径) |
先交代证据等级(本站惯例):表中「谁在招」的事实全部来自本次检索核实的招聘页面与报道,文末附链接;能力矩阵和学习路径是我的整理与判断(观点,不是从某份 JD 抄的);薪资数字是二手聚合数据,只给量级参考,未独立核实。
还有四条横跨所有 JD 的共性观察,值得先记住:
- 通用底座三件套:几乎每份技术 JD 都要 Python + PyTorch + Transformer 原理。国内 JD 的标准句式是「深入理解 Transformer 架构,熟悉预训练、SFT、RLHF」。
- Evals 能力横跨所有工种。英文市场报告的原话:评测技能是四大岗位族(研究、应用、FDE、安全)的共同要求。这与本站《Eval 是新的 PRD》的判断互为印证。
- 开源贡献是硬通货。某国内大厂系统岗 JD 明确写「具有 vLLM、PyTorch 等社区核心贡献者身份优先」——开源履历第一次被写成筛选条件。
- 半路出家是常态而非例外。Anthropic 官方招聘页自述:约半数技术员工入职前没有 ML 经验,工程背景建议直接按工程师投递。这个事实值得所有转行者贴在桌上。
下面逐个工种拆解。每个工种四样东西:画像(干什么、和谁协作)、能力矩阵(维度 → 细化技能 → 代表技术 → 学习挂靠)、最小 rollout(2–4 周验证项目)、适合谁。
产线一:造模型
① 预训练算法工程师
画像:决定模型「出生质量」的人。日常是设计/复现架构改动、配数据、盯损失曲线、做小规模消融再外推到大规模。协作对象是数据团队(要料)和训练 Infra(要卡)。这是门槛最高、坑位最少的工种——基座公司才养得起,且校招偏爱论文履历。
| 能力维度 | 细化技能 | 代表技术/必读材料 | 学习挂靠 |
|---|---|---|---|
| 模型架构 | Attention 变体(MHA/GQA/MLA)、MoE 路由与负载均衡、位置编码(RoPE)、归一化位置 | Llama 3 / DeepSeek-V3 / Qwen3 技术报告——这三份是当代架构的「标准答案汇编」 | Attention 数学陪读 |
| 训练动力学 | Scaling laws、学习率调度、损失尖刺处理、训练稳定性(梯度裁剪、初始化) | Chinchilla(arXiv 2203.15556)、µP 迁移调参 | Scaling Laws 数学入门 |
| 数据配比 | 去重、质量过滤、多语言/代码/数学配比、课程学习、tokenizer 设计 | RefinedWeb/FineWeb 管线思路、退火数据(annealing)技巧 | 小公司如何构建大模型里的数据决策阶梯 |
| 实验方法论 | 小模型代理实验、消融设计、可比性控制(同数据同步数)、外推预测 | 各家技术报告的 ablation 章节;「先在 1B 上证明,再上 100B」是行业铁律 | 为什么 LLM 能学会 |
| 工程底座 | PyTorch 熟练度、分布式训练常识(能读懂并行配置)、实验管理 | PyTorch、wandb、nanoGPT(亲手训一遍是最好的入学考试) | 手算一步梯度下降(若你连反传都想拆开看) |
最小 rollout(3–4 周):用 nanoGPT 或 torchtitan 在单卡/双卡上从零训一个 100M 级小模型,亲手做三组消融(换 tokenizer 词表大小、换数据配比、换学习率调度),把损失曲线和结论写成一篇实验报告。这个项目同时覆盖矩阵里五个维度的入门层,且产出物直接可以放进简历。
适合谁:数学底子好(至少微积分与线代这条线要通)、享受做实验胜过做产品、能接受成果以「内部报告」形式存在的人。
② 后训练/对齐算法工程师
画像:把「会说话的压缩包」调教成「有用的助手」。2026 年招聘热度明显高于预训练——因为基座趋同后,差异化都发生在后训练。Anthropic 的 Domain Scaling 团队 JD 是这个工种的教科书样本:「端到端负责创建 RL 环境、设计奖励信号、度量对模型表现的影响」。国内 JD 的对应表述是「负责垂域模型的 SFT、RLHF」。
| 能力维度 | 细化技能 | 代表技术/必读材料 | 学习挂靠 |
|---|---|---|---|
| SFT 数据工程 | 指令数据配比、拒答样本、多轮对话构造、格式一致性、蒸馏采样 | self-instruct 思路、Tülu 3 配方(少见的全公开后训练报告) | 训练小模型的三条路 |
| RL 方法 | PPO/GRPO/DPO 的适用边界、on/off-policy 直觉、KL 约束、优势估计 | InstructGPT(arXiv 2203.02155)、DeepSeek-R1 的 GRPO 实践 | 为什么大模型需要强化学习——零基础从这篇进 |
| 奖励设计 | 奖励模型训练、规则奖励(RLVR)、reward hacking 识别与防御、过程 vs 结果奖励 | R1 的「规则奖励打败 PRM」教训;FastContext 的 F1 奖励是一个可仿写的小样本 | 同左 |
| 评测闭环 | 训练中评测(防退化)、能力-安全平衡、A/B 与盲测 | lm-evaluation-harness、内部 golden set 方法论 | Eval 是新的 PRD |
| RL 环境构建 | 可验证任务设计、判分器(grader)工程、环境难度阶梯 | SWE-bench 类可执行环境;这项技能正在从加分项变成核心项 | SWE-bench 学习笔记 |
最小 rollout(2–3 周):拿一个 7B 开源模型,用 TRL 或 verl 跑一次完整的 DPO 和一次 GRPO:自己构造 500 对偏好数据(可以蒸馏自强模型),训完在 20 条固定测试题上盲评对比。重点不是提分,是亲手观察 reward hacking 和 KL 漂移长什么样。
适合谁:对「模型行为」比「模型结构」更好奇的人;喜欢琢磨「它为什么这样答」的人。这也是四条产线里与心理学/语言学等非典型背景交叉最多的工种。
③ 数据工程师 / 环境构建师
画像:2026 年最被低估的入口。市场报告给出的分层很清晰:底层是通才标注(偏好打分),中层是领域专家(医生/律师/量化研究员写推理轨迹),顶层是「环境构建师」——设计模型训练所对标的交互式任务与判分器的工程师,一个两年前几乎不存在的工种。前沿实验室在人类数据上的年开销是 10 亿美元量级(Labelbox CEO 口径,未独立核实),这条产线的预算真实存在。
| 能力维度 | 细化技能 | 代表技术/必读材料 | 学习挂靠 |
|---|---|---|---|
| 语料管线 | 抓取/解析/去重(MinHash)、质量分类器、PII 清洗、多格式抽取 | CCNet/FineWeb 管线、trafilatura、datatrove | 小公司 playbook |
| 合成数据 | 蒸馏采样策略、多样性控制、自我改进循环、污染防控 | self-instruct、Cosmopedia 思路 | 训练小模型的三条路——「每个小模型身后站着一个大模型」在数据层同样成立 |
| 标注体系 | guideline 撰写、标注者一致性(IAA)、质检抽样、偏好数据采集设计 | Surge/Scale/Mercor 的任务设计模式;MT-Bench 论文里的偏差清单 | 评测路由篇决策点一 |
| RL 环境构建 | 任务可验证化、判分器实现、防作弊(模型钻环境空子)、难度曲线 | SWE-bench/Terminal-Bench 类环境源码 | SWE-bench 笔记 |
| 统计素养 | 抽样、置信区间、分布漂移检测 | —— | 写给 LLM 工程师的统计学 |
最小 rollout(2 周):给一个你熟悉的领域(哪怕是「写周报」)设计一个可自动判分的任务环境:10 个任务 + 一个规则判分器 + 让两个不同模型跑完打分。做完你就理解了「环境构建师」的全部日常,也顺手产出了一个可展示的 repo。
适合谁:细心、有领域知识、编程中等即可。这是非 CS 背景进入训练产线的最短路径——领域专家标注→标注体系设计→环境构建,是一条真实存在的晋升阶梯。
产线二:跑模型
④ 训练 Infra 工程师
画像:让一次要烧几百万美元的训练不白烧的人。OpenAI 为研究数据管线单独设岗,国内大厂 JD 的标准要求是「熟悉 Megatron、DeepSpeed 等分布式训练框架」。这个工种的知识一半在论文里,一半只在事故里——所以 JD 普遍要求实际大规模经验,这也是它对新人最不友好的原因。突破口在开源:那份「vLLM/PyTorch 社区核心贡献者优先」的 JD 说明了替代路径。
| 能力维度 | 细化技能 | 代表技术/必读材料 | 学习挂靠 |
|---|---|---|---|
| 并行策略 | DP/TP/PP/EP/序列并行的通信量账、并行配置搜索、MoE 的 all-to-all | Megatron-LM 三部曲论文、DeepSeek-V3 报告的 infra 章节 | AI Infra 工程师工作地图 |
| 显存与通信 | ZeRO 三阶段、FSDP、激活重计算、通信-计算重叠、NCCL 调优 | ZeRO(arXiv 1910.02054)、PyTorch FSDP 源码 | 同左 |
| 稳定性容错 | 异步 checkpoint、弹性训练、静默数据损坏(SDC)排查、损失尖刺归因 | 各家技术报告的「训练事故」小节是最真实的教材 | —— |
| 性能剖析 | MFU 核算、profiler(nsight/torch profiler)、瓶颈定位(算力/显存/通信/IO) | MFU 的计算方式(PaLM 论文附录) | 算力层决策地图 |
| 框架源码 | 能读并改 Megatron/DeepSpeed/torchtitan;CUDA 基础 | torchtitan(代码量最友好的入口) | —— |
最小 rollout(3–4 周):租两台多卡机器(或用云上 spot),用 torchtitan 跑通 TP+DP 组合训练,亲手算并核对一次 MFU,然后故意制造一次 OOM 和一次 NCCL 超时并写下排查记录。Infra 的面试官最想听的就是排查故事。
适合谁:系统背景(做过分布式/数据库/内核更佳)、对「性能账算得平」有执念的人。不需要多深的 ML 数学——这是工程背景转入大模型行业性价比最高的通道之一。
⑤ 推理/Serving 优化工程师
画像:模型商业化的成本杠杆。OpenAI 把 Inference 拆成一个团队族——AMD GPU 适配、网络负载均衡、多模态、缓存基础设施各设专岗;国内 JD 的标准句式是「熟悉 vLLM 等推理加速框架」。逻辑很直白:推理省 30% 成本 = 毛利率直接加 30 个点,这是所有工种里离钱最近的一个。
| 能力维度 | 细化技能 | 代表技术/必读材料 | 学习挂靠 |
|---|---|---|---|
| 服务引擎 | PagedAttention、continuous batching、前缀缓存、PD 分离、结构化输出 | vLLM/SGLang 源码——vLLM 是当代推理工程的公共教材 | vLLM 前缀缓存六个机制及本站 vLLM 源码系列四篇 |
| 算子与 kernel | CUDA/Triton 编写、FlashAttention 原理、算子融合、访存优化 | FlashAttention(arXiv 2205.14135)、Triton 教程 | —— |
| 量化压缩 | FP8/INT8/INT4、AWQ/GPTQ、KV cache 量化、投机解码、蒸馏小模型 | 投机解码谱系 | 投机解码的第二本账、FastContext(探索外包给小模型本质也是推理成本工程) |
| 调度与容量 | 请求路由、优先级抢占、SLO 设计(TTFT/TPOT)、多租户隔离 | vLLM scheduler 源码 | 评测路由篇(模型路由是它的近亲) |
| 成本工程 | token 经济学核算、缓存命中率优化、硬件选型(含国产卡适配) | 各云厂商定价页 + 自建成本模型 | 算力层决策地图 |
最小 rollout(2–3 周):单卡部署一个 7B 模型,用 vLLM 压测三组对照:开关前缀缓存、不同 max-num-seqs、FP16 vs INT4,画出吞吐-延迟曲线并解释每条曲线背后的机制。能把这三组曲线讲清楚,就超过了大部分只会「pip install vllm」的候选人。
适合谁:和④同为系统人天堂,但反馈更快(毫秒级 benchmark vs 周级训练),更适合喜欢即时反馈的人。CUDA 能力是这个工种的稀缺溢价点。
⑥ GPU 平台/集群工程师
画像:OpenAI 的 JD 原文写得最直白:「运行支撑 ChatGPT 与 API 的基础设施,包括推理 Kubernetes 集群、GPU 健康与 InfiniBand 性能」。传统 SRE/云平台工程师加上 GPU 特有知识(拓扑、ECC、降频、故障预测)就是这个工种——转行迁移成本最低的一条通道。
| 能力维度 | 细化技能 | 代表技术 | 学习挂靠 |
|---|---|---|---|
| 调度编排 | K8s + GPU device plugin、gang scheduling、拓扑感知调度、配额与抢占 | Kubernetes、Volcano/Kueue、Slurm | AI Infra 工作地图 |
| 高速网络 | InfiniBand/RoCE 运维、NCCL 拓扑调优、网络故障定位 | IB 诊断工具链、nccl-tests | —— |
| GPU 健康 | ECC 错误、降频、掉卡预测性维护、驱动/固件矩阵管理 | DCGM、node exporter 体系 | —— |
| 存储与数据 | checkpoint 高吞吐写入、数据集缓存分发、对象存储选型 | JuiceFS/Lustre 类方案 | —— |
| 容量成本 | 利用率核算、碎片治理、混部(训推共池) | 内部账单体系 | Agent 部署架构 |
最小 rollout(2 周):在任意云上用 K8s 拉起一个带 GPU 的推理服务,配齐 DCGM 监控 + 告警 + 一次模拟掉卡演练。有 SRE 经验的人做完这个就可以直接投递。
适合谁:现役 SRE/DevOps/云平台工程师。你的技能 80% 直接复用,补的只是 GPU 专有的 20%。
产线三:用模型
⑦ Agent/大模型应用工程师
画像:国内招聘量最大的工种,JD 谱系从「RAG 开发」一直铺到「Agentic 架构研发」(某智联岗位原文:研发基于 agentic search 的算法架构、A2A 与 agent skill、长短记忆模块)。阿里云 2026 校招把它定名为「大模型应用算法工程师」。这个工种的深度常被低估——本站写过顶级 Agent 应用工程师的六层系统,那篇就是这个工种的能力天花板描述。
| 能力维度 | 细化技能 | 代表技术/必读材料 | 学习挂靠 |
|---|---|---|---|
| 上下文工程 | 上下文预算分配、记忆管理、压缩与遗忘策略、多轮状态维护 | Claude Code/Codex 的上下文机制 | 遗忘是一种能力、上下文工程新规则 |
| 检索与 RAG | 分块策略、embedding 选型、重排、agentic search vs 向量检索的边界 | —— | 代码检索为什么回到了 grep、search 工具解剖 |
| Agent harness | 工具设计、子代理编排、错误恢复、循环控制、MCP/技能体系 | Claude Agent SDK、LangGraph;FastContext 是子代理设计的论文级样本 | 什么是好的 Agent Harness、决策地图·应用层 |
| 评测与可观测 | 任务级 evals、轨迹回放、线上监控、A/B | LangSmith/Braintrust 类工具 + 自建 | Eval 是新的 PRD |
| 部署与成本 | 模型路由、缓存、降级策略、多模型容灾 | —— | Agent 部署架构、评测路由篇 |
最小 rollout(2–3 周):做一个带评测的 Agent,而不是又一个 demo:选一个真实小任务(如「自动整理 GitHub issue 并出周报」),实现工具调用 + 20 条 golden case 的自动评测 + 失败案例分析。「带 evals 的 agent」和「能跑的 demo」是这个工种里初级与合格的分界线。
适合谁:全栈/后端工程师的主通道。不需要训练模型的能力,但需要「模型行为直觉」——这只能靠大量使用和观察积累。入行门槛最低,天花板取决于你在六层系统里爬到第几层。
⑧ FDE(前线部署工程师)/ 解决方案架构师
画像:2026 年的破圈工种。数字都核实过来源:岗位量较 2025 年初增长 5230%(Indeed 数据);AWS 宣布 10 亿美元投入嵌入数千 FDE,微软 7 月设立 25 亿美元的 Frontier 部门(约 6000 名驻场专家),Salesforce 承诺组建千人 FDE 团队;Anthropic 公开招聘 FDE,薪资 20–30 万美元。FDE 与 SA 的分界线也有公开口径:SA 至多 20% 时间写代码做 PoC,FDE 70% 时间写生产级代码——「SA 卖梦想,FDE 把它变成真的」。
| 能力维度 | 细化技能 | 代表技术 | 学习挂靠 |
|---|---|---|---|
| 快速交付工程 | 全栈原型能力、生产级代码习惯、客户环境适配(内网/合规/老系统集成) | ⑦ 的全部技术栈,但要求「一个人是一支队伍」 | FDE 是什么:最后一公里——本站已有整篇拆解 |
| 业务翻译 | 需求澄清、把业务指标翻译成模型任务、ROI 核算 | —— | 同左 |
| 评测驱动交付 | 用客户数据建 golden set、验收标准谈判、上线前后指标对比 | 2026 年 FDE JD 已明确要求评测框架与可观测能力 | Eval 是新的 PRD |
| 现场技能 | 客户沟通、预期管理、驻场节奏、跨时区协作 | —— | —— |
| 产品回路 | 把现场共性需求反哺产品路线图 | —— | —— |
最小 rollout(2 周):找一个真实的「客户」(朋友的小公司、家人的店),用大模型给他解决一个具体业务问题,从需求澄清做到上线和效果核算,全程记录。FDE 面试的核心就是讲这种故事的能力。
适合谁:技术不想丢、又明确喜欢和人打交道的工程师;顾问/售前想加技术深度的人。薪资弹性大(美国市场 FDE 总包 35–75 万美元区间的报道,明显高于 SA 的 25–45 万),代价是出差和客户现场的不确定性。
产线四:管模型
⑨ Evals 工程师
画像:2026 年才独立成名的工种。招聘市场报告给出的分布:前沿实验室持续招;Perplexity、Cursor、Harvey、Sierra 这类应用公司把 evals 工程师列入前十号技术员工——因为「评测速度直接决定产品迭代速度」;Stripe、Shopify 级别的传统公司也在组建评测团队以验收第三方模型。报告特别注明:应用向 evals 岗不要求 PhD,看重的是工程严谨和实践判断。
| 能力维度 | 细化技能 | 代表技术/必读材料 | 学习挂靠 |
|---|---|---|---|
| 任务建模 | 把模糊的「好」拆成可测维度、指标设计、通过率 vs 偏好率的选择 | —— | Eval 是新的 PRD |
| Judge 体系 | LLM-as-judge 搭建、三大偏差(位置/冗长/自我增强)消除、judge 校准 | MT-Bench(arXiv 2306.05685) | LLM-as-judge 学习笔记 |
| 数据集工程 | golden set 构建与维护、污染检测、难度分层、版本管理 | SWE-bench 的构建方法论 | SWE-bench 笔记 |
| 评测 Infra | 评测 harness、CI 集成、回归检测、预生成回放(RouterBench 式免推理评测) | lm-evaluation-harness、inspect-ai | 评测路由篇决策点五 |
| 统计功力 | 显著性检验、样本量核算、方差控制、A/B 设计 | —— | 写给 LLM 工程师的统计学 |
最小 rollout(1–2 周,全行业最低):给你日常在用的任何 AI 功能建一套 30 条的评测:10 条正常、10 条边界、10 条对抗,用一个 judge 模型自动打分(记得交换位置跑两次消位置偏差),出一份评测报告。这是所有 rollout 里投入最小、迁移价值最高的——无论最终选哪个工种,这套技能都用得上(见共性观察 2)。
适合谁:QA/测试工程师的天然升级路径;数据分析师转 AI 的捷径;以及所有还没想清楚选哪条产线的人——evals 是观察全行业的最佳哨位。
⑩ 安全/红队工程师
画像:Anthropic 把它设为独立的 Safeguards 团队;市场侧的分层已经很细:AI 红队、LLM 应用安全、Agent 安全(工具滥用、沙箱逃逸——溢价最高,比纯 LLM 安全高 20–30%)、ML 安全、AI 治理合规五个亚种。招聘方报告称候选人手握 4–8 个 offer 是常态,薪资带宽 15–45 万美元。入口也分层:Mercor 等平台的合同制红队任务是零门槛试水点。
| 能力维度 | 细化技能 | 代表技术/必读材料 | 学习挂靠 |
|---|---|---|---|
| 攻击面理解 | 提示注入、越狱谱系、数据外泄路径、多轮诱导 | OWASP LLM Top 10 | —— |
| 防护栈 | 输入/输出分类器、宪法式分类器、分级响应策略 | Anthropic 的内容安全体系是公开资料最全的样本 | Anthropic 内容安全栈 |
| Agent 安全 | 工具权限最小化、沙箱设计、不可信内容隔离、供应链(skill/MCP 投毒) | —— | Skills 锁与提示词供应链、决策地图·门禁篇 |
| 评测化安全 | 把攻击变成回归测试集、自动化红队、安全-能力平衡度量 | 红队即持续评测——⑨ 的技能在这里全部复用 | Eval 是新的 PRD |
| 治理合规 | 模型卡、风险分级框架、审计留痕 | NIST AI RMF、EU AI Act 落地条款 | —— |
最小 rollout(2 周):给自己搭的任意 LLM 应用做一次系统性红队:按 OWASP LLM Top 10 逐项设计攻击用例,记录成功率,然后加一层防护再测一遍,写成攻防报告。传统安全工程师做完这个即可投递 AI 安全岗。
适合谁:安全工程师加 AI 知识(溢价明确);或对「模型为什么会被骗」有研究兴趣的人。行业小、信任驱动、口碑传播快——这既是门槛也是护城河。
边缘与入口:两个没单独展开的角色
AI 产品经理:JD 大量存在,但它的技术内核恰好等于 ⑨ evals 的前三个维度(任务建模、验收标准、数据集思维)——《Eval 是新的 PRD》整篇讲的就是这个融合。技术人转 AI PM 的最短路径是先把 evals 做出手感。
AI Trainer / 数据标注:美国市场标注岗年薪均值约 13.1 万美元(聚合口径),合同制时薪 15–30 美元。单独看是入口层,但接上 ③ 的阶梯(标注 → guideline 设计 → 环境构建)就是一条真实的职业通道,不要孤立评估它。
收尾:怎么选——把这张图变成你自己的决策树
三步决策,把十个工种收敛到一两个:
第一步,按背景排除(客观约束):
- 没有大规模 GPU 集群可摸 → ④⑥ 暂缓(可先做⑤的单卡功课等机会)
- 数学不想深追 → ①② 暂缓(④⑤⑥⑦⑧⑨⑩ 都不卡数学)
- 不想/不能训练模型 → ⑦⑧⑨⑩ 全开放,这四个工种完全不需要碰训练
第二步,按能量来源选(主观偏好):喜欢「让东西更快」→ ⑤④⑥;喜欢「让东西有用」→ ⑦⑧;喜欢「搞清楚为什么」→ ①②;喜欢「定义对错」→ ⑨⑩;喜欢「和人打交道」→ ⑧。
第三步,用最小 rollout 验证:选出的 1–2 个工种,把对应的 2–4 周项目真做完。做完仍有兴趣,加深;中途厌倦,换分支——一次 rollout 的成本是几周,选错方向硬撑的成本是几年。这就是把探索预算花在刀刃上。
三条选择元规律,比任何单个工种都值得记住:
- Evals 是万能前置技能——四大岗位族共同要求,rollout 成本最低,先做它不会错。
- 每个工种都有一条「从既有技能平移」的通道:SRE→⑥、后端→⑦、QA→⑨、安全→⑩、顾问→⑧、领域专家→③。大模型行业不要求你推倒重来,只要求你补上 AI 那 20%。
- 稀缺溢价在交叉点:会 CUDA 的应用工程师、懂业务的 infra 工程师、能写生产代码的安全研究员——JD 里薪资带宽最上沿全部属于双技能交叉者。
照例的诚实提醒:本文的工种清单与「谁在招」有公开来源(文末链接),能力矩阵与学习路径是我的整理,不是任何一份 JD 的原文;所有薪资数字均为二手聚合数据(招聘平台/行业报告口径),未独立核实,且 JD 是快照——今天的要求半年后就会漂移。给你的最小验证实验(半天):去猎聘/BOSS 直聘/OpenAI/Anthropic 官网抓 10 份你目标工种的在招 JD,逐条对照本文矩阵打勾——对得上的说明矩阵可用,对不上的就是这半年市场漂移的方向,那才是你最该注意的信号。
参考来源
官方招聘页与一手 JD
- OpenAI Careers(Inference/Applied AI/Systems 等团队分类与在招岗位)
- Anthropic Jobs(团队分类、Research Engineer 与 Safeguards 岗位)
- Anthropic:Research Engineer, Domain Scaling(RL 环境与奖励设计 JD 样本)
- 猎聘:大模型算法开发工程师岗位聚合
- 鼠鼠求职:阿里云 2026 校招大模型应用算法工程师
行业招聘报告与市场数据
- Breaking Into AI in 2026: What Anthropic, OpenAI, and Meta Actually Hire For(dataexec)
- AI Evals Engineer: The Career Guide for 2026(jobsbyculture)
- Forward Deployed Engineer: The Complete 2026 Guide(Uplers,含 Indeed 岗位增速数据)
- FDE vs Solutions Architect: 2026(fde.academy)
- AI Security Engineer Salary 2026 + AI Red Teamer Hiring Guide(infosec.qa)
- Data Annotation for AI Labs: Recruiting Guide 2026(herohunt,含 Labelbox CEO 数据口径)
- 大模型算法工程师大厂招聘要求汇总(CSDN 聚合长文)
本站学习路径挂靠(按产线)