深讲案例
AI 算法开发平台
能力主题 AI 产品化与平台
网易 AI 高性能深度学习计算平台:托管训练作业与模型服务,统一多框架与 GPU 集群调度,让业务方专注算法本身。
可核对信息
对内覆盖约 80% 算法团队;外部拓客 10+。
可核对信息
相对外部采购商用 GPU 系统,大规模算力成本可节省约 60%(平台材料口径)。
可核对信息
多框架分布式训练加速性能接近线性加速(平台性能展示口径)。
可核对信息
一键/快速部署降低冷启动成本;高可用设计让用户对底层故障无感知。
问题
业务方自建深度学习环境成本高:框架各搭各的、集群难建、资源利用率低、跨平台难统一、系统维护重。结果是算法团队被基础架构拖住,算力成本高且难规模化。
我的角色
负责平台定位与架构规划、产品规范、定价与合作模式,以及从立项到推广的全生命周期;推动对内规模化采用与对外拓展。
我负责的边界
- 平台价值主张:高性能深度学习计算平台,帮助业务方快速托管训练作业与模型服务,屏蔽环境安装、性能调优与资源管理复杂性。
- 训练计算:统一 GPU 集群调度,支持 TensorFlow / PyTorch / Caffe 等主流框架及分布式训练;面向 CTR/推荐等场景的大规模稀疏化分布式计算能力拓展。
- 推理服务:标准化 GPU/CPU Docker 推理;训练模型一键部署到推理服务;压缩/量化与统一推理工具方向拓展。
- 产品化与商业化:规范、易用性、高可用;综合定位/竞品/机器成本形成定价与合作模式,服务对内采用与外部客户。
明确不负责
- 具体业务算法效果本身(CV/语音/推荐等由业务算法团队负责;平台提供算力与工程化托管)。
- 底层机房/网络物理设施建设(平台消费高性能网络与存储能力,而非替代基础设施部门)。
协作方式
- 算法团队:视觉、语音、数据智能等团队作为核心用户,提出框架与作业形态需求。
- 数据与存储:与大数据计算/存储体系协同(如 HDFS、NAS 并行存储,以及集团数据源互通)。
- 商业化:对外拓客与合作模式设计,结合机器成本约束。
需求分析过程
以下把简历中的职责边界,对齐到公开行业方法(OTD/配置化 BOM 或 MLOps)后展开;标注发现项便于核对,不编造未确认的内部细节。
1. 痛点驱动的需求陈述
材料将自建深度学习平台痛点收敛为三类:计算资源利用率低、环境搭建难度高、系统维护成本高。对应产品需求不是「再做一个训练脚本工具」,而是统一调度的托管平台。
- 各部门各自搭框架 → 需要统一多框架与一键部署。
- 非集群/分散资源 → 需要更大集群弹性与更高利用率。
- 各自运维 → 需要高可用托管,用户无感底层故障。
2. 服务清单:训练 / 推理 / 拓展
已有服务强调分布式训练(TF/Caffe/PyTorch 等)与标准化推理 Docker;拓展方向包括大规模稀疏化 CTR/推荐训练、模型压缩量化、统一推理引擎与异构设备成本优化。需求分析据此划分 P0 主路径与后续拓展。
- P0:多框架训练托管 + 推理一键部署 + 统一 GPU 调度。
- 拓展:CTR 超大规模稀疏训练、压缩工具链、新异构算力。
3. 架构需求:存储 · 调度 · 计算 · 算法作业
技术架构将存储(HDFS/NAS 等)、大数据计算、GPU/CPU 高性能网络、作业调度与多框架训练 JOB 分层。产品需求要保证:业务数据进得来、训练作业跑得稳、推理服务发得出。
- 存储多样性是需求:NAS 并行存储、HDFS、与集团数据源互通。
- 作业形态覆盖 CV / NLP / Speech / CTR 等不同训练 JOB。
4. 验收与价值口径
验收看采用与成本:内部算法团队覆盖率、外部客户数;相对外购商用系统的成本节省;分布式加速是否接近线性;以及业务案例是否真正跑在平台上(视觉/语音/推荐等)。
- 成本:大规模算力相对外购可节省约 60%。
- 采用:约 80% 内部算法团队 + 外部 10+ 客户。
- 案例域:计算机视觉、语音语言、数据智能/推荐等。
流程与架构示意
文案与图示整合简历口径与《网易 AI 深度学习平台介绍》中的可公开能力描述;未展开内部集群拓扑与未授权业务明细。
业务方自建痛点
平台主路径
来自网易 AI 深度学习平台介绍:用统一平台替代各部门自建,把训练托管与模型服务产品化。
按《网易 AI 深度学习平台介绍》能力层整理:统一调度托管多框架训练与推理;省略内部集群拓扑与未授权业务明细。
做法
- 以托管平台替代业务方自建:统一 GPU 调度与多框架支持,降低环境与运维负担。
- 打通训练到推理:分布式训练作业 + Docker 推理一键部署,形成可重复交付路径。
- 用成本与性能口径支撑产品化:资源利用率、近线性加速、相对外购成本优势,并设计定价/合作模式。
结果
- 建成面向集团重点业务的高性能深度学习计算平台,覆盖训练托管与模型服务。
- 对内覆盖约 80% 算法团队;外部拓客 10+。
- 在成本与性能上形成可讲述的平台优势(约 60% 成本节省口径;分布式近线性加速)。