logo
登录 / 注册

ai infra存储 base北京,

头像
calin
06-10 · 猎头顾问
专家定位,薪资可以open聊 岗位职责 1、存储架构设计与优化 1)设计面向大规模 AI 工作负载的存储架构(分布式文件系统、对象存储、缓存层等),满足高吞吐、低延迟的训练数据供给需求; 2)优化存储 I/O 路径,减少数据加载瓶颈,提升 GPU/加速器利用(Data Pipeline → Storage → GPU 的全链路优化); 3)评估并引入新型存储介质(NVMe SSD、NVMe-oF、CXL Memory、HBM 等)在 AI 场景下的适用性。 2、数据管理与编排 1)构建高效的数据预处理与加载管线,与训练框架(PyTorchTensorFlow、DeepSpeed、Megatron 等)深度集成; 2)实现checkpoint的高性能读写与管理策略(异步保存、增量快照、分布式存储一致性)。 3、分布式存储系统开发与运维 1) 开发或深度定制分布式存储系统(如 Lustre、GPFS/Spectrum Scale、CEPH、MinIO、Weka、VAST 等)以满足 AI 场景特有需求; 2)实现存储集群的弹性伸缩、容灾恢复与数据一致性保障; 3)构建存储系统监控与可观测性体系(IOPS、带宽、延迟、容量热力图、异常检测)。 4、训练-存储协同优化 1)与训练框架团队协作,实现存储感知的调度策略(数据局部性调度、拓扑感知调度); 2)优化大模型训练中的存储瓶颈:参数持久化、梯度聚合存储、混合精度训练中间态管理; 3)研究并落地新型存储范式:如 In-Memory 分布式缓存(Alluxio)、数据预取策略、RDMA 直连存储。 5、平台化与工程化 1)将存储能力抽象为标准化服务,提供 API / SDK 供上层 AI 平台调用 2)推动存储系统自动化运维(自动扩缩容、故障自愈、性能调优建议) 3)编写技术文档、最佳实践指南,赋能 AI 团队高效使用存储资源
ai infra存储 base北京,脉脉
阅读 6
声明:本文内容由脉脉用户自发贡献,部分内容可能整编自互联网,版权归原作者所有,脉脉不拥有其著作权,亦不承担相应法律责任。如果您发现有涉嫌抄袭的内容,请发邮件至maimai@taou.com,一经查实,将立刻删除涉嫌侵权内容。
相关推荐
最新发布
大家都在看
热门人脉圈
    全部3条评论
    头像
    我先生

    啥公司

    06-14
    头像
    在先生

    哪家

    06-11
    头像
    浪先生

    06-10
    头像
    我来说几句...