跳转至

AI Infra 相关岗位

岗位是什么

AI Infra 相关岗位是「让模型跑起来、跑得快、跑得便宜」的岗位群:算法团队负责模型能力,Infra 团队负责承载模型的那套系统——训练集群、推理服务、算力调度、数据管道。产品经理感知不到 Infra 的存在,是它做得好;但一旦模型贵、响应慢、部署不动,第一个被找的往往是 PM。

岗位谱系:

角色一句话定位常见别名
MLOps / ML 平台工程师打通「训练→评测→上线→监控」的工程化链路ML 平台开发、MLOps 工程师
推理优化工程师把模型推理搞快搞便宜:量化、蒸馏、KV Cache、批处理推理加速工程师、性能优化工程师
GPU 集群与算力平台工程师算力资源的调度、监控、故障排查,最大化 GPU 利用率算力平台工程师、集群 SRE
分布式训练框架工程师大模型训练的训练框架与并行策略(数据/模型/流水并行)分布式训练工程师、AI 系统工程师
云原生 AI 平台工程师把模型服务容器化、弹性伸缩、多租户隔离AI 平台工程师、云平台工程师

AI 系统架构 的四层地图里,Infra 处在最底层的「算力与基础设施」层——上面跑着模型、应用与产品,PM 对 Infra 的理解不需要到代码级,但需要知道每一层约束了什么。

时效性说明

信息截至 2026-08,岗位名称与 JD 写法变化较快,以最新公开招聘信息为准。

典型 JD 长什么样

MLOps / ML 平台工程师 JD

职责(归纳公开 JD 的常见要素,典型写法大致是):

  • 建设模型训练、评测、上线、监控的自动化流水线
  • 维护模型版本管理、实验管理与上线回滚机制
  • 建设线上模型质量监控:效果劣化、异常输入、服务稳定性
  • 与算法、产品协作,缩短模型迭代到上线的时间

要求:

  • 计算机相关专业本科及以上,X 年后端/平台开发经验
  • 熟悉 Docker、Kubernetes 与 CI/CD,有 Python/Go 开发能力
  • 了解 LLM 推理服务的基本原理(显存、吞吐、延迟指标)
  • 有较强的问题排查与跨团队沟通能力

加分项:

  • 有 LLM 应用平台(RAG、Agent 服务)建设经验
  • 有推理优化(量化、vLLM/TensorRT 等)经验
  • 有大流量高并发服务经验

推理优化工程师 JD(简)

  • 职责:优化模型推理延迟与吞吐,降本增效(量化、蒸馏、缓存、批处理调度)
  • 要求:熟悉推理框架与 GPU 编程(CUDA 等),理解显存与带宽瓶颈
  • 加分项:有端侧部署经验,有成本优化实战案例

GPU 集群与算力平台工程师 JD(简)

  • 职责:算力资源规划、调度与监控,故障排查,利用率分析
  • 要求:熟悉 Slurm/Kubernetes 调度体系,懂 GPU 硬件特性与故障模式
  • 加分项:有大规模集群运维经验,有成本核算经验

JD 关键词解读

  • 「MLOps/LLMOps」:把模型当软件工程来管的思路——版本、流水线、监控、回滚;面试考「模型上线后效果劣化了怎么发现、怎么回滚」
  • 「推理优化」:AI 应用降本的核心战场,量化/蒸馏/缓存是高频考点——与 LLM 成本测算 直接相关
  • 「GPU 利用率」:算力平台岗的核心 KPI,考的是调度策略与资源池设计——利用率低不是技术问题,是钱的问题
  • 「服务稳定性/SLA」:AI 应用的线上承诺,面试常问「模型服务挂了怎么办、延迟劣化怎么兜底」
  • 警惕点:名为「AI Infra」实为普通运维/后端搬砖的 JD——看职责里有没有「模型服务、推理、算力」相关词;「Infra」岗位普遍要求扎实的工程底子,不适合零基础转行,但适合后端工程师切入

与产品经理的协作

Infra 与 PM 的协作集中在三件事:钱、快、能不能部署。这三件事的决策都影响用户体验与业务成本,PM 不能只把 Infra 当「后台」。

  • 成本测算与口径:PM 要向业务方汇报 AI 功能的成本,必须与 Infra/算法对齐口径——token 成本、GPU 利用率、单请求成本怎么算,LLM 成本测算 是共同语言;「功能赚钱吗」的问题,PM 拿不出成本口径就是失职
  • 延迟与体验的权衡:流式输出(首 token 时间、token 间隔)、响应延迟直接影响对话类产品的手感;「更快」与「更便宜」往往冲突(更多算力 vs 量化降质)——PM 要能用业务指标说话:延迟劣化多少会掉多少留存,再决定为速度花多少钱
  • 模型部署策略对产品的约束:公有云(弹性但数据出域)、私有化(合规但成本高)、混合部署各有约束——是否支持私有化直接决定能否签某些大客户;PM 要参与决策,并把约束写进产品方案(比如私有化版本功能裁剪清单)
  • 日常协作界面:模型上线/回滚的排期(发版日历要对齐)、线上质量监控看板(效果劣化、异常输入、服务稳定性)、容量规划(大促/推广活动前确认算力够不够)
  • 常见摩擦与解法:PM 要新功能、Infra 说「加机器就行」→ 成本谁买单、利用率怎么算,先立口径再谈需求;Infra 说「量化降质」、PM 怕体验变差 → 用 A/B 或评测集量化影响,再决定;模型要上线、Infra 排期满 → 把模型上线纳入发版管理,和功能发版一样走排期与评审

能力要求与准备建议

  1. 懂架构分层AI 系统架构 是 PM 理解 Infra 的入口——知道算力层、模型层、应用层各约束什么,才能跟 Infra 对话
  2. 学成本测算LLM 成本测算 的计费模型与估算三步法,是 PM 与 Infra 协作最实用的技能——会算成本的人,在 AI 团队里天然有话语权
  3. 理解延迟指标:首 token 时间、吞吐、p95 延迟这些词要能听懂,并知道它们怎么影响体验;面试 AI 产品岗常问「怎么评估一个 AI 功能的性能」
  4. 了解部署形态:公有云/私有化/混合的差异与适用场景,支撑你参与部署策略讨论(合规、成本、安全要求)
  5. 与 Infra 协作的常识:读 AI 产品开发生命周期(CC/CD),把模型上线、容量规划、成本评审纳入产品流程,而不是临时抱佛脚

发展路径

  • 入行:后端/运维/SRE 背景切入最顺;应届生从 ML 平台、推理服务方向投,竞争激烈但天花板高
  • 进阶:Infra 方向负责人/架构师——主导推理优化与平台建设,成为「模型降本增效」的关键角色
  • 横向:转 AI 平台产品经理(懂技术的 PM 稀缺)、转算法工程、转数据工程
  • 纵向:算力平台负责人、AI 基础设施总监——大模型公司的核心部门,薪资与话语权都在高位

相关阅读