开发内容与工作范围
以下工作可根据现有系统和项目条件组合实施,具体模块与交付责任在项目范围中确认。
平台与资源评估
核对目标芯片、板卡、SDK、接口、供货和验收条件,确认可实施范围与关键风险。
硬件方案与载板开发
按照参考资料和目标外设开展电源、存储、网络、显示、摄像头及扩展接口设计。
BSP 与嵌入式系统
围绕可取得的 SDK 开展启动、内核、设备树、文件系统、系统服务、升级和日志开发。
驱动与外设集成
结合原理图、接口时序和器件资料完成驱动、配置及业务接口联调。
应用与整机验证
集成设备管理、数据处理和业务程序,并在约定样机上验证功能、资源与持续运行。
版本交付与导入支持
交付约定范围的设计、源码或补丁、固件、构建烧录说明和测试记录。
Atlas 800开发为什么需要确认完整型号?
Atlas 800包含多种服务器产品。官方产品形态涵盖Atlas 800训练服务器、Atlas 800推理服务器,以及Atlas 800T A2、Atlas 800I A2、Atlas 800T A3、Atlas 800I A3等不同代际和用途。开发前需确认完整产品名称、配置、NPU拓扑、CPU架构、网络存储、驱动固件和CANN配套,再制定训练、推理、大模型、容器、调度和运维方案。
服务覆盖Atlas 800服务器级环境和应用工程。不同I/T、A2/A3及历史3000/9000等型号分别建立技术规格、版本配套和测试基线,硬件参数、模型支持和性能结果以目标设备官方资料及实测数据为准。
适用项目
以下场景可进入评估;具体工作包以目标硬件、资料和验收条件为准。
- Atlas 800服务器到货后需要完成环境验收和软件基线
- 训练模型或推理服务需要迁移到明确的Atlas 800型号
- 需要部署MindIE、AscendCL、torch_npu、MindSpore或经验证组件
- 多卡或多机任务存在通信、拓扑、网络、存储或调度问题
- 需要容器镜像、Kubernetes或现有平台的任务和资源接入
- 需要建立监控、日志、健康检查、升级、回滚和故障处置流程
Atlas 800服务器开发服务内容
每项服务在启动前确认输入资料、版本基线、交付成果、验收方法和范围边界。
01 · 服务器型号与拓扑确认
记录完整产品名、BOM配置、NPU、CPU、内存、网络、存储、固件和机房条件,形成节点清单。
02 · 驱动固件与CANN基线
按产品配套部署或核验驱动、固件、CANN、算子包、框架和组件,建立校验和版本锁定。
03 · 训练或推理应用
按服务器用途适配模型、代码、数据、服务接口、检查点或OM产物,建立最小闭环。
04 · 多卡通信与调度
核对拓扑、HCCL、网络、进程、容器、资源标签和任务调度,处理超时与失败恢复。
05 · 性能与容量验证
以固定模型、数据、批量、并发或训练规模测试计算、通信、内存、I/O和服务链路。
06 · 运维与变更
建立节点检查、监控、日志、备份、升级、回滚、故障替换和版本一致性流程。
项目评估需要的输入
建议在项目启动前准备以下资料;如部分资料暂缺,可先完成环境梳理和关键功能验证。
- Atlas 800完整产品名称、配置清单和序列信息
- NPU拓扑、CPU架构、内存、网络、存储和机房条件
- 驱动、固件、CANN、算子包、框架和容器版本
- 模型、权重许可、训练或推理代码、数据和依赖
- 调度平台、镜像仓库、网络策略、账户和安全要求
- 功能、性能、稳定性、规模、故障和验收脚本
实施路径
节点验收
检查硬件状态、拓扑、固件、网络、存储和基础诊断。
软件基线
部署并冻结驱动、CANN、算子包、框架、容器和检查命令。
业务扩展
从单卡/单节点闭环扩展到目标卡数、服务或训练规模。
系统验收
按固定脚本验证功能、性能、稳定性、故障和运维流程。
交付物与验收边界
在窄屏设备上可左右滑动,使用键盘时可按左右方向键查看完整表格。
| 工作包 | 主要交付物 | 验收依据 | 范围边界 |
|---|---|---|---|
| 节点与环境 | 资产拓扑、版本矩阵、部署脚本、镜像和检查报告 | 目标节点状态一致且基础任务通过 | 硬件供货、保修和机房责任按照合同界定 |
| 业务系统 | 训练或推理代码、服务配置、接口和任务模板 | 约定模型、数据、卡数和业务用例通过 | 不同I/T或代际型号分别建立验证结论 |
| 性能运维 | 基准脚本、容量报告、监控日志、升级回滚和故障手册 | 约定负载、时长和异常场景通过 | 服务等级适用于合同约定的规模和外部系统条件 |
兼容性、许可与责任边界
需另行约定的内容
- Atlas 800I与800T、A2与A3或历史型号之间的环境迁移
- 集群规模评估所需的机房电力、散热、网络和存储条件
- 模型、软件包和商业组件的授权及再分发
- 合同之外的数据中心建设、服务器销售、硬件维保和长期驻场
常见问题
Atlas 800是训练服务器还是推理服务器?
Atlas 800系列同时包含训练和推理产品,并有不同代际。项目需根据完整产品名称和配置确定方案。
服务器到货后先做什么?
先检查硬件、NPU拓扑、固件、网络、存储和基线日志,再部署与型号匹配的软件栈。
支持大模型推理吗?
可根据具体Atlas 800I型号、模型版本、权重许可、CANN和MindIE等支持矩阵开展关键功能验证和服务化。
支持分布式训练吗?
可在明确Atlas 800T型号、节点数量、网络、存储、框架和调度环境后进行评估和实施。
可以接入Kubernetes吗?
可按照现有集群版本、设备插件、调度组件、镜像仓库、网络和权限进行集成,具体组件支持范围需核对。
怎样开展性能验收?
固定设备、模型、数据、精度、批量、并发或卡数、预热和计时范围,并保留原始日志与命令。
升级CANN会影响业务吗?
升级可能涉及驱动、算子、框架、模型和应用,建议先在隔离节点完成回归并准备备份和回滚方案。
可以只开展环境故障排查吗?
可以。提供完整型号、版本、拓扑、日志、复现步骤和变更记录后,可按节点、通信、框架或业务层定位。
官方资料与版本依据
下列链接用于确认产品形态和软件配套;正式项目仍以双方冻结版本的官方资料为准。
服务与验收说明
本页说明可讨论的工程服务范围,不构成对固定性能、周期、价格、认证、审批或业务结果的承诺;最终范围以目标环境、输入资料及双方确认的技术和商务文件为准。
在线咨询
电话咨询
微信咨询
回到顶部