职位详情
技术-架构
41.6-66.6K
上海-上海
不限
不限
更新 2026-07-28 浏览 32
职位详情
  • 招 2 人
  • 不限性别
【工作职责】 我们正在建设面向万亿级 Token/日、万卡级异构 GPU 集群的 MaaS 调度系统,目标打造行业领先的大模型推理调度能力。你将负责核心调度系统建设,支撑多类大模型推理负载,通过在线离线混部、弹性调度和异构算力调度,在保障 SLA 的同时提升算力利用率、降低单位 Token 成本,让超大规模 MaaS 推理服务更稳、更快、更省。 工作职责 1、万亿级 Token/日吞吐优化:围绕 QPS、RPM/TPM、并发、Token 吞吐、TTFT、TPOT延迟等指标,优化推理服务整体吞吐和资源效率。 2、在线推理与离线批推混部:在保障在线推理 SLA 的前提下,将批量推理、模型评测、数据生成、异步任务、低优先级推理等离线/准离线负载调度到闲置 GPU 资源中运行,提升集群整体利用率。 3、弹性调度与成本优化:建设基于流量预测、队列状态、GPU 利用率/SMA、显存、KV Cache、模型热度等指标的弹性伸缩能力,实现容量预热、快速扩缩容、资源回收和成本归因。 4、大规模异构算力调度:面向万卡级异构 GPU 集群,建设跨集群、跨机型、跨芯片架构、跨模型的统一调度系统,解决资源分配、模型副本放置、容量池治理、热点迁移、故障迁移和资源碎片治理问题。 【任职要求】 1、有分布式系统、云原生、资源调度或高性能服务治理经验。 2、熟悉 Kubernetes 调度体系、弹性伸缩、服务发现、流量治理等技术。 3、理解大模型推理链路,熟悉 GPU、显存、KV Cache、batching、Token 吞吐、TTFT/TPOT 等概念。 4、有 GPU 集群、MaaS 平台、模型服务平台或推理系统经验优先。 5、具备强指标意识,能够围绕 SLA、GPU 利用率/SMA、吞吐、延迟和成本持续优化系统。 加分项 1、熟悉 AIBrix、llm-d、vLLM、SGLang、KServe、Ray Serve 等推理框架或服务化体系。 2、有在线离线混部、弹性调度、算力资源池化、异构算力调度相关经验。 3、有大规模 GPU 集群、万亿级 Token 推理服务或商业化 MaaS 平台建设经验。 4、有提升 GPU 利用率、SMA、推理吞吐或降低单位 Token 成本的实际案例。 5、熟悉多租户资源隔离、优先级调度、抢占、配额、成本归因和容量治理。
公司信息
行吟信息科技(上海)有限公司
· 上市公司 · 通信/电子/半导体/硬件
上海市黄浦区马当路388号SOHO复兴广场
职介网温馨提示
求职过程请勿缴纳费用,谨防诈骗!若信息不实请举报。 立即举报
公司问答
我要提问
对此职位有疑问?快来问问吧 !
相似职位
交通项目经理
18-22K
江苏-苏州 本科学历 1年以上经验
中亿丰基础设施开发集团有限公司
2026-08-24
交通事业部-项目经理/项目总工
20.8-29.1K
江苏-苏州 本科学历 1年以上经验
中亿丰基础设施开发集团有限公司
2026-08-24
前端/后端开发工程师-技术解决
13-18K
北京-北京 本科学历
五险一金 包吃住 年终奖金 销售奖金
抖音视界有限公司
2026-08-04
TS运维-边缘云运维工程师(外
7-10K
北京-北京 本科学历
五险一金 综合补贴 奖励计划
抖音视界有限公司
2026-08-04