Head of Machine Learning Infrastructure

AXQ Capital · Beijing; Shanghai

  • Senior
  • Full-time
  • Posted 2026-07-06
  • Confirmed live on 25 September 2026

Apply at AXQ Capital

Job description

关于我们

安贤投资(AXQ Capital)致力于以严谨的量化研究与先进的信息技术驱动投资。我们打造科学高效的量化研究框架,构建多市场多策略投资体系。策略布局覆盖全球股票统计套利、A股指数增强、CTA、股票日内、期货高频等领域,在全球市场部署运行,覆盖多个地区、资产类别及交易周期。自2018年成立以来,安贤持续为海内外投资者创造长期稳健的投资回报,资产管理规模稳步增长。公司在北京、上海、香港、纽约设有办公室,为国内员工提供海外交流与培训机会。

岗位使命

作为 Head of Machine Learning Infrastructure,你将向 CTO 汇报,负责公司面向机器学习和量化研究的核心计算与平台基础设施,包括 GPU/CPU 集群、分布式训练、研究计算平台、机器学习平台及开发者工具。
核心目标是打造一套能够支撑大规模特征工程与机器学习训练的基础设施体系,支持 PB 级数据处理能力,并能够高效利用数十 TB 级别训练数据进行模型训练与实验迭代。系统需具备高性能、可扩展、可复现、易使用且成本高效的特性,持续提升研究与工程效率。

主要职责

• 负责机器学习基础设施团队建设、技术规划和项目推进,制定中长期平台路线。

• 建设和优化 GPU/CPU 集群、任务调度和分布式计算平台,支持大规模模型训练、特征计算和量化研究。

• 构建支持 PB 级数据规模的特征工程与数据处理平台,提升海量数据的计算、存储与访问效率。

• 支持基于数十 TB 级训练数据的分布式训练与实验体系,优化数据加载、并行训练与资源调度效率。

• 建设统一的机器学习平台,包括开发环境、实验管理、模型版本、依赖管理和模型部署流程。

• 优化训练与研究场景下的存储、网络、数据管道和计算性能,提高 GPU/CPU 资源利用率并控制基础设施成本。

• 建设模型训练、批量/在线推理及相关生产基础设施,提升模型从研究到生产的效率和可靠性。

• 持续优化开发者工具和研究工作流,提升大规模数据与模型实验的迭代效率。

• 建设平台监控、容量规划、权限、安全和自动化体系,保障大规模系统的稳定性与可维护性。

岗位要求

• 8 年以上机器学习基础设施、分布式系统、平台工程、高性能计算或云基础设施相关经验。

• 有基础设施或平台团队管理经验,以及复杂系统架构和落地能力。

• 扎实的 Linux、网络、存储、分布式系统和容器技术基础。

• 熟悉 GPU 计算、分布式训练和大规模机器学习工作负载,对任务调度、数据 I/O、特征工程和系统性能优化有实践经验。

• 熟悉 Python、Go、C++、Rust、Java 等至少一门编程语言。

• 熟悉 Kubernetes、Docker、CI/CD、Infrastructure as Code、监控和云计算基础设施。

• 具备较强的平台产品意识,能够深入理解量化研究员、机器学习研究员和工程师在大规模数据与模型训练场景下的需求。

加分项

• 有量化投资、对冲基金、机器学习平台或大规模研究计算平台经验。

• 有 GPU 集群、分布式训练或 HPC 平台建设经验。

• 熟悉 PyTorch Distributed、Ray、Slurm、NCCL、CUDA、RDMA 等技术。

• 有大规模特征工程平台、数据管道系统或 PB 级数据处理经验。

• 有 AWS、GCP、阿里云、腾讯云等云平台的 GPU 资源和成本优化经验。

• 熟悉 Claude Code、Codex、Cursor 等 AI coding tools,并有推动其团队化应用的经验。

Prepare for the interview

Nothing collected for this employer yet. The Blind 75 is what technical screens draw from; practise it here, with a coach, in Java or Python.

More at AXQ Capital

All open software jobs