← 返回产品

深讲案例

AI 算法开发平台

能力主题 AI 产品化与平台

网易 AI 高性能深度学习计算平台:托管训练作业与模型服务,统一多框架与 GPU 集群调度,让业务方专注算法本身。

可核对信息

对内覆盖约 80% 算法团队;外部拓客 10+。

可核对信息

相对外部采购商用 GPU 系统,大规模算力成本可节省约 60%(平台材料口径)。

可核对信息

多框架分布式训练加速性能接近线性加速(平台性能展示口径)。

可核对信息

一键/快速部署降低冷启动成本;高可用设计让用户对底层故障无感知。

问题

业务方自建深度学习环境成本高:框架各搭各的、集群难建、资源利用率低、跨平台难统一、系统维护重。结果是算法团队被基础架构拖住,算力成本高且难规模化。

我的角色

负责平台定位与架构规划、产品规范、定价与合作模式,以及从立项到推广的全生命周期;推动对内规模化采用与对外拓展。

我负责的边界

  • 平台价值主张:高性能深度学习计算平台,帮助业务方快速托管训练作业与模型服务,屏蔽环境安装、性能调优与资源管理复杂性。
  • 训练计算:统一 GPU 集群调度,支持 TensorFlow / PyTorch / Caffe 等主流框架及分布式训练;面向 CTR/推荐等场景的大规模稀疏化分布式计算能力拓展。
  • 推理服务:标准化 GPU/CPU Docker 推理;训练模型一键部署到推理服务;压缩/量化与统一推理工具方向拓展。
  • 产品化与商业化:规范、易用性、高可用;综合定位/竞品/机器成本形成定价与合作模式,服务对内采用与外部客户。

明确不负责

  • 具体业务算法效果本身(CV/语音/推荐等由业务算法团队负责;平台提供算力与工程化托管)。
  • 底层机房/网络物理设施建设(平台消费高性能网络与存储能力,而非替代基础设施部门)。

协作方式

  • 算法团队:视觉、语音、数据智能等团队作为核心用户,提出框架与作业形态需求。
  • 数据与存储:与大数据计算/存储体系协同(如 HDFS、NAS 并行存储,以及集团数据源互通)。
  • 商业化:对外拓客与合作模式设计,结合机器成本约束。

需求分析过程

以下把简历中的职责边界,对齐到公开行业方法(OTD/配置化 BOM 或 MLOps)后展开;标注发现项便于核对,不编造未确认的内部细节。

1. 痛点驱动的需求陈述

材料将自建深度学习平台痛点收敛为三类:计算资源利用率低、环境搭建难度高、系统维护成本高。对应产品需求不是「再做一个训练脚本工具」,而是统一调度的托管平台。

  • 各部门各自搭框架 → 需要统一多框架与一键部署。
  • 非集群/分散资源 → 需要更大集群弹性与更高利用率。
  • 各自运维 → 需要高可用托管,用户无感底层故障。

2. 服务清单:训练 / 推理 / 拓展

已有服务强调分布式训练(TF/Caffe/PyTorch 等)与标准化推理 Docker;拓展方向包括大规模稀疏化 CTR/推荐训练、模型压缩量化、统一推理引擎与异构设备成本优化。需求分析据此划分 P0 主路径与后续拓展。

  • P0:多框架训练托管 + 推理一键部署 + 统一 GPU 调度。
  • 拓展:CTR 超大规模稀疏训练、压缩工具链、新异构算力。

3. 架构需求:存储 · 调度 · 计算 · 算法作业

技术架构将存储(HDFS/NAS 等)、大数据计算、GPU/CPU 高性能网络、作业调度与多框架训练 JOB 分层。产品需求要保证:业务数据进得来、训练作业跑得稳、推理服务发得出。

  • 存储多样性是需求:NAS 并行存储、HDFS、与集团数据源互通。
  • 作业形态覆盖 CV / NLP / Speech / CTR 等不同训练 JOB。

4. 验收与价值口径

验收看采用与成本:内部算法团队覆盖率、外部客户数;相对外购商用系统的成本节省;分布式加速是否接近线性;以及业务案例是否真正跑在平台上(视觉/语音/推荐等)。

  • 成本:大规模算力相对外购可节省约 60%。
  • 采用:约 80% 内部算法团队 + 外部 10+ 客户。
  • 案例域:计算机视觉、语音语言、数据智能/推荐等。

流程与架构示意

文案与图示整合简历口径与《网易 AI 深度学习平台介绍》中的可公开能力描述;未展开内部集群拓扑与未授权业务明细。

流程图:自建痛点 → 平台托管主路径(脱敏)

业务方自建痛点

环境搭建难 资源利用率低 维护成本高

平台主路径

统一调度托管 多框架分布式训练 推理一键部署 对内采用 / 对外拓展

来自网易 AI 深度学习平台介绍:用统一平台替代各部门自建,把训练托管与模型服务产品化。

架构示意:存储 · 调度 · 多框架训练 · 推理服务(脱敏)
存储与数据 HDFS / NAS 等 业务数据接入 统一调度 GPU 集群调度 高可用托管 训练计算 TF / PyTorch / Caffe … 分布式训练 JOB 推理服务 GPU/CPU Docker 一键部署上线 产品价值 业务方专注算法 · 降低自建与运维成本 · 提升资源利用率 相对外购商用系统:大规模算力成本可节省约 60%(材料口径)

按《网易 AI 深度学习平台介绍》能力层整理:统一调度托管多框架训练与推理;省略内部集群拓扑与未授权业务明细。

做法

  • 以托管平台替代业务方自建:统一 GPU 调度与多框架支持,降低环境与运维负担。
  • 打通训练到推理:分布式训练作业 + Docker 推理一键部署,形成可重复交付路径。
  • 用成本与性能口径支撑产品化:资源利用率、近线性加速、相对外购成本优势,并设计定价/合作模式。

结果

  • 建成面向集团重点业务的高性能深度学习计算平台,覆盖训练托管与模型服务。
  • 对内覆盖约 80% 算法团队;外部拓客 10+。
  • 在成本与性能上形成可讲述的平台优势(约 60% 成本节省口径;分布式近线性加速)。

附录与外链