开发内容与工作范围
以下工作可根据现有系统和项目条件组合实施,具体模块与交付责任在项目范围中确认。
平台与资源评估
核对目标芯片、板卡、SDK、接口、供货和验收条件,确认可实施范围与关键风险。
硬件方案与载板开发
按照参考资料和目标外设开展电源、存储、网络、显示、摄像头及扩展接口设计。
BSP 与嵌入式系统
围绕可取得的 SDK 开展启动、内核、设备树、文件系统、系统服务、升级和日志开发。
驱动与外设集成
结合原理图、接口时序和器件资料完成驱动、配置及业务接口联调。
应用与整机验证
集成设备管理、数据处理和业务程序,并在约定样机上验证功能、资源与持续运行。
版本交付与导入支持
交付约定范围的设计、源码或补丁、固件、构建烧录说明和测试记录。
昇腾910B开发与Atlas A2产品是什么关系?
官方CANN文档将910B算子包用于Atlas A2系列产品。项目实施时需进一步确认Atlas 800T A2、Atlas 800I A2、Atlas 200T A2或其他具体产品形态。服务可覆盖CANN环境、torch_npu或MindSpore训练适配、MindIE等大模型推理路线、HCCL通信、单机或约定范围的多机验证、性能分析和部署运维,并根据服务器型号、内存配置和集群拓扑建立技术基线。
大模型项目先做模型支持、权重许可、资源需求、序列长度、并发或训练规模评估,再确定训练、微调、推理或服务化路线。公开模型名称不等于目标版本在指定环境中自动可用。
适用项目
以下场景可进入评估;具体工作包以目标硬件、资料和验收条件为准。
- 在Atlas A2训练或推理产品上部署开源或自有大模型
- PyTorch训练、微调或推理代码需要迁移到torch_npu环境
- MindIE或其他经验证路线需要模型适配、服务化和接口接入
- 单机多卡或多机任务存在HCCL、拓扑、显存、超时或性能问题
- 需要进行量化、批处理、并发、KV缓存或资源调度验证
- 需要建立容器、健康检查、监控、日志、升级和回滚的交付基线
昇腾910B与Atlas A2开发服务内容
每项服务在启动前确认输入资料、版本基线、交付成果、验收方法和范围边界。
01 · 产品与资源评估
确认Atlas A2产品、NPU数量和拓扑、CPU、内存、网络、存储及可用软件栈,估算模型装载与业务约束。
02 · CANN 910B环境
核对驱动固件、toolkit、910B算子包、框架插件、NNAL或相关组件,形成可复现安装与版本锁定。
03 · 训练与微调适配
处理设备迁移、算子、混合精度、数据、优化器、检查点、并行策略和分布式启动。
04 · 大模型推理与服务化
评估支持矩阵,完成模型加载、服务接口、并发、批处理、流式输出、异常处理和调用侧集成。
05 · 通信与性能工程
定位计算、内存、通信、数据、算子和服务链路瓶颈,使用固定负载形成前后对比。
06 · 稳定性与运维
验证长时运行、重启恢复、任务失败、日志、健康检查、资源隔离、升级和版本回滚。
项目评估需要的输入
建议在项目启动前准备以下资料;如部分资料暂缺,可先完成环境梳理和关键功能验证。
- Atlas A2具体产品、规格、NPU拓扑和网络存储环境
- 驱动、固件、CANN、910B算子包、框架与组件版本
- 模型名称与精确版本、权重来源、许可和配置
- 训练或推理代码、依赖、容器和启动脚本
- 输入长度、输出长度、并发、批量、精度与业务SLA口径
- 验收数据、测试脚本、安全要求和部署边界
实施路径
支持矩阵确认
冻结产品、模型、版本、资源、许可和目标指标。
最小闭环
完成单卡或最小卡数的模型加载、功能和结果验证。
扩展与服务化
扩展多卡、并发、接口、调度和异常恢复。
基准与交付
按固定负载完成精度、性能、稳定性和复现验收。
交付物与验收边界
在窄屏设备上可左右滑动,使用键盘时可按左右方向键查看完整表格。
| 工作包 | 主要交付物 | 验收依据 | 范围边界 |
|---|---|---|---|
| 环境基线 | 版本矩阵、安装脚本、容器或部署包、检查命令 | 目标节点可复现设备、框架和模型基础运行 | 厂商软件与第三方模型按照相应许可提供 |
| 训练或推理工程 | 代码、配置、服务接口、启动脚本和测试工具 | 约定模型、数据和任务用例通过 | 模型和算子范围以目标版本支持矩阵及验证结果为准 |
| 性能稳定性 | 基准脚本、参数、日志、分析和回归报告 | 在约定拓扑、负载和时长下达到书面指标 | 测试结果适用于约定卡数、序列和并发条件 |
兼容性、许可与责任边界
需另行约定的内容
- 跨Atlas A2配置的模型兼容性验证
- 大规模集群服务等级所需的规模化测试
- 模型权重、数据集和商业组件的授权及再分发
- 智算中心建设中的机房、网络、存储和调度平台总包
常见问题
910B算子包对应什么产品?
官方CANN安装文档将其用于Atlas A2系列产品;项目还需确认具体服务器或异构组件型号。
支持哪些大模型?
支持范围以目标CANN、MindIE或所选框架的当期支持矩阵和关键功能验证结果为准。
可以开展PyTorch训练迁移吗?
可以评估torch_npu路线,并检查API、算子、精度、数据、并行和检查点。
MindIE部署需要哪些输入?
建议提供精确模型版本、权重许可、配置、目标硬件、软件版本、输入输出、并发和服务接口要求。
吞吐性能如何确认?
在明确硬件拓扑、模型、序列长度、并发、批量和精度模式后,按照约定测试方法进行测量。
单机多卡和多机多卡有什么差别?
多机环境还涉及网络、HCCL拓扑、调度、存储、容错和节点一致性,工作范围需单独确认。
怎样验收大模型服务?
固定模型、权重、请求集、并发、输入输出长度和计时范围,检查正确性、时延、吞吐、资源、稳定性和错误恢复。
可以只开展故障排查吗?
可以根据约定范围提供环境、模型、通信或服务问题诊断,并交付复现证据、原因分析和修复方案。
官方资料与版本依据
下列链接用于确认产品形态和软件配套;正式项目仍以双方冻结版本的官方资料为准。
服务与验收说明
本页说明可讨论的工程服务范围,不构成对固定性能、周期、价格、认证、审批或业务结果的承诺;最终范围以目标环境、输入资料及双方确认的技术和商务文件为准。
在线咨询
电话咨询
微信咨询
回到顶部