虚拟化研发工程师(GPU智算方向)-基础技术
字节跳动
岗位职责
1、GPU虚拟化研发:负责GPU虚拟化技术的底层研发与定制,包括GPU直通、vGPU、API转发等方案的实现与优化,提升GPU资源的利用率与隔离性;
2、算力池化引擎开发:设计并实现GPU算力池化组件,支持细粒度的GPU资源调度(如显存分片、算力切分),服务于AI训练和推理场景;
3、高性能计算适配:针对主流AI框架(TensorFlow/PyTorch)和HPC场景,优化虚拟化层的数据传输路径,降低虚拟化带来的性能损耗,追求接近裸金属的性能;
4、异构算力纳管:负责主流GPU(NVIDIA、AMD)及国产化GPU(如寒武纪、昇腾等)在虚拟化环境中的适配、驱动集成与兼容性调试;
5、故障排查与稳定性建设:深入分析Linux内核、KVM/QEMU及GPU驱动相关的疑难问题,提升智算平台在虚拟化环境下的可靠性与可观测性。
任职要求
1、计算机或相关专业本科及以上学历,3年以上虚拟化或操作系统底层开发经验;
2、熟练掌握C/C++或Rust,能够编写高性能、内存安全的代码;
3、熟悉Linux内核架构,对进程调度、内存管理、文件系统及cgroup等模块有深入理解;
4、虚拟化技术栈:深入理解KVM机制、Virtio协议、VFIO直通方案,有QEMU、Firecracker开发经验;
5、GPU虚拟化经验:熟悉CUDA、GDS、GDR方案,有GPU性能调优、算力切分开发经验;
6、GPU互联加速经验:熟悉PCIe/RDMA/CXL/NVLink/UALink协议规范,有DPU/智能网卡的开发经验。
加分项:
1、曾有过GPU性能优化、算子优化、GPU驱动开发者优先;
2、在Linux内核、QEMU/KVM、Rust-vmm、Kata Containers等开源项目中有代码贡献;
3、对TensorFlow/PyTorch等主流AI框架,熟悉vLLM/SGlang等推理框架者优先。