阿里巴巴
校招面向大模型推理的通用后端运行时系统研究-阿里星/A Star
北京 · 校招 · 2027 届 · 本科
长期有效
任职要求
- 1.2027届毕业生,计算机科学、软件工程或相关专业,研究方向涉及操作系统、高性能计算或AI基础设施
- 2.扎实的系统编程能力,精通C/C++,对Linux内核机制(进程管理、内存管理、cgroup/namespace)有深入理解
- 3.熟悉以下至少一项:进程checkpoint/restore(如CRIU)、GPU编程与CUDA Runtime内部机制、容器/虚拟化技术、高性能I/O(RDMA/DMA/PCIe)、推理框架(如SGLang)、kvcache(如Mooncake)
- 加分项:
- 1.在OSDI/SOSP/EuroSys/ATC/ASPLOS/NSDI等系统顶会有论文发表;
- 2.有CRIU、Linux内核、GPU驱动或虚拟化相关的开源贡献经验;
- 3.熟悉LLM推理系统架构(vLLM/SGLang/TRT-LLM),理解推理进程的运行时行为特征;
- 4. 有GPU显存管理、CUDA VMM、Multi-Process Service等GPU系统层面的研发经验。
岗位描述
- 1.负责面向大模型推理场景的通用后端运行时系统研究与架构设计,核心目标是构建引擎无关的系统层,统一管理推理进程状态、模型权重生命周期与GPU设备资源;
- 2.研究并优化推理进程的高效快照与恢复机制,在Linux CRIU基础上针对GPU推理进程进行深度定制,推动关键路径逼近PCIe/RDMA硬件带宽极限;
- 3.设计模型权重的跨进程、跨实例共享机制,支撑多模型混部、热升级、弹性扩缩容等生产场景下的零拷贝权重复用;
- 4.与百炼推理平台团队紧密协作,将后端运行时能力落地到模型上下线、故障恢复、跨可用区调度等真实业务链路,形成可量化的成本与弹性收益。
- 1.2027届毕业生,计算机科学、软件工程或相关专业,研究方向涉及操作系统、高性能计算或AI基础设施
- 2.扎实的系统编程能力,精通C/C++,对Linux内核机制(进程管理、内存管理、cgroup/namespace)有深入理解
- 3.熟悉以下至少一项:进程checkpoint/restore(如CRIU)、GPU编程与CUDA Runtime内部机制、容器/虚拟化技术、高性能I/O(RDMA/DMA/PCIe)、推理框架(如SGLang)、kvcache(如Mooncake)
加分项:
- 1.在OSDI/SOSP/EuroSys/ATC/ASPLOS/NSDI等系统顶会有论文发表;
- 2.有CRIU、Linux内核、GPU驱动或虚拟化相关的开源贡献经验;
- 3.熟悉LLM推理系统架构(vLLM/SGLang/TRT-LLM),理解推理进程的运行时行为特征;
- 4. 有GPU显存管理、CUDA VMM、Multi-Process Service等GPU系统层面的研发经验。
你的简历匹配这个岗位吗?
上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方
该岗位可能会问的问题
基于 后端开发 岗位的常见面试问题整理
请解释 RESTful API 的设计原则,并举一个你实际设计过的例子
查看答题思路
1. 资源导向:URL 表示资源而非操作 2. HTTP 方法语义:GET/POST/PUT/DELETE 对应查增改删 3. 无状态:每个请求包含全部所需信息 4. 统一接口:一致的响应格式(如 JSON) 5. 举例:用户模块 /users/{id},GET 查/POST 创/PUT 改/DELETE 删,返回统一 {code, data, message}
MySQL 索引的底层数据结构是什么?为什么用 B+ 树而不是哈希表或红黑树
查看答题思路
1. B+ 树:非叶子节点只存 key 不存 data,单次 IO 读更多 key 2. 叶子节点形成有序链表,支持范围查询(哈希表不支持范围) 3. 高度低(3-4 层可存千万级数据),减少磁盘 IO 4. 对比红黑树:B+ 树是多叉的,高度更低,磁盘 IO 更少
你参与过的最复杂的后端项目是什么,你承担了什么角色
查看答题思路
1. 项目背景:一句话说清业务场景 2. 技术栈:语言/框架/数据库/中间件 3. 个人职责:你做的,不是团队做的——用「我设计了」「我优化了」 4. 难点:遇到了什么具体问题,怎么解决的 5. 数据佐证:QPS 从多少提到多少 / 延迟降了多少
什么是微服务架构,和单体架构相比各有什么优劣
查看答题思路
1. 单体:所有功能在一个进程,部署简单,初期开发快;缺点是耦合高、扩展难 2. 微服务:按业务拆分独立服务,独立部署/扩展/技术栈 3. 优点:故障隔离、团队自治、技术栈灵活 4. 缺点:网络开销、分布式事务、运维复杂度 5. 判断标准:团队<10 人或业务不复杂时,单体是更好的选择
如何设计一个高并发的秒杀系统
查看答题思路
1. 前端限流:按钮置灰、验证码 2. 网关层:Nginx 限流 + 负载均衡 3. 业务层:Redis 预减库存(原子操作),消息队列异步下单 4. 数据库:乐观锁扣库存,读写分离 5. 降级方案:流量过大时返回「已售罄」而非崩溃
更多面试题库功能即将上线
信息来源:企业官方招聘页。投递前请以官网信息为准。