知識中心

金融/製造昇騰開發實戰:穩格科技破解風控模型訓練與邊緣部署國產化難題

穩格科技作為華為昇騰官方開發夥伴,專注金融與製造行業AI遷移,提供從風控模型國產化訓練(CANN框架最佳化+分散式加速)到邊緣裝置部署(模型壓縮+異構排程)的全鏈路服務,幫助企業有所降低硬體成本,提升3倍訓練效率,覆蓋50+金融專案與100+製造場景。

知識中心 2025-09-18 穩格科技
文章正文知識中心

在金融風控與智慧製造領域,AI模型已成為核心生產力:金融行業依賴千億引數反欺詐模型即時識別風險,製造業則透過精度要求較高的缺陷檢測模型支援產品質量。然而,美國技術出口管制與GPU成本飆升的雙重壓力,迫使企業加速向國產昇騰晶片遷移。但遷移過程面臨兩大挑戰:

· 訓練層:金融風控模型需處理海量非結構化資料(如交易流水、使用者行為日誌),傳統GPU叢集訓練成本高昂,而昇騰晶片的CANN框架與異構計算架構需深度適配才能釋放效能;

· 部署層:製造業邊緣裝置(如產線攝像頭、機器人)對算力、功耗、即時性要求嚴苛,昇騰310/910等邊緣晶片需透過模型壓縮、異構排程等技術實現“小身材大能量”。

穩格科技作為華為昇騰首批官方開發合作伙伴,專注金融與製造行業AI遷移超5年,累計完成50+金融風控模型訓練遷移、100+製造邊緣裝置部署專案,形成一套**“訓練-部署”全鏈路國產化解決方案**:

· 訓練側:透過CANN框架深度最佳化+分散式訓練加速,將金融風控模型在昇騰910叢集上的訓練效率提升至GPU的專案要求範圍內,單卡算力利用率達專案要求範圍內(行業平均僅專案要求範圍內);

· 部署側:針對製造邊緣場景,開發動態模型剪枝+異構計算排程引擎,將缺陷檢測模型在昇騰310上的推理延遲壓縮至15ms以內,功耗降低專案要求範圍內,準確率保持專案要求範圍內。

一、金融風控模型國產化訓練:穩格科技如何突破CANN框架適配與效能瓶頸?

1. 挑戰:千億引數模型訓練,GPU成本高昂且存在斷供風險

某頭部金融科技公司原使用NVIDIA A100叢集(64卡)訓練反欺詐模型,年硬體採購成本超5000萬元,且因美國技術管制面臨算力卡脖子風險。遷移至昇騰晶片需解決兩大問題:

· 框架相容性:原模型基於PyTorch開發,而昇騰的CANN框架對PyTorch動態圖支援有限,需重寫大量運算元;

· 分散式訓練效率:昇騰910單卡算力(256TFLOPS@FP16)與A100(312TFLOPS)接近,但多卡通訊延遲高,導致叢集擴充套件效率下降。

2. 穩格方案:CANN框架“透明適配層”+ 通訊最佳化引擎,訓練效率追平GPU

· 運算元自動轉換工具:開發PyTorch→MindSpore昇騰版的模型轉換工具鏈,透過動態圖轉靜態圖最佳化(減少執行時開銷)與運算元融合(將Softmax+Argmax合併為單個運算元),將專案要求範圍內通用運算元自動對映至昇騰NPU,剩餘專案要求範圍內定製運算元(如高維矩陣運算)由穩格昇騰架構師手動最佳化,有助於支援相容性與效能雙達標;

· 分散式訓練加速:針對昇騰叢集的HCCL通訊庫(華為自研集合通訊庫)進行最佳化,透過梯度壓縮(將32位浮點梯度壓縮至8位)與重疊通訊計算(在反向傳播時同步傳送梯度),將64卡訓練的通訊開銷從專案要求範圍內降達到專案要求,整體訓練效率提升至GPU的專案要求範圍內;

· 混合精度訓練:支援FP16/BF16混合精度,透過損失縮放(Loss Scaling)防止梯度下溢,在保持模型準確率(F1值>0.95)的同時,將單卡記憶體佔用有所降低,支援更大batch size訓練。

3. 效果:年成本降至2000萬,模型召回率有所提升

遷移至**昇騰910叢集(64卡)**後,該金融科技公司實現:

· 硬體成本:年採購成本從5000萬元降至2000萬元(昇騰910單價僅為A100的專案要求範圍內);

· 訓練效率:千億引數模型訓練時間從7天縮短至5天,單迭代延遲從200ms降至150ms;

· 模型效果:反欺詐場景的召回率從有所提升,誤報率保持在專案要求範圍內。

二、製造邊緣裝置部署:穩格科技如何讓昇騰310“小晶片”跑出“大效能”?

1. 挑戰:產線邊緣裝置需“低功耗+高即時性”,傳統模型難以直接部署

某汽車零部件製造商原使用**NVIDIA Jetson AGX Xavier(功耗300W)**部署缺陷檢測模型,但存在三大問題:

· 成本高:單臺裝置價格超5萬元,單條產線需部署10臺,年硬體成本超50萬元;

· 功耗大:300W功耗導致裝置需獨立散熱系統,增加專案要求範圍內運維成本;

· 延遲高:模型推理延遲達100ms,無法滿足產線50ms內響應的要求。

2. 穩格方案:模型壓縮+異構排程,昇騰310實現“15ms推理+15W功耗”

· 動態模型剪枝:開發基於通道重要性的剪枝演算法,透過梯度敏感度分析識別冗餘通道(如卷積層的專案要求範圍內輸出通道),在保持準確率保持在專案要求範圍內的前提下,將模型引數量從2000萬壓縮至600萬,推理計算量減少專案要求範圍內;

· 異構計算排程引擎:針對昇騰310的CPU(ARM Cortex-A55)+NPU(達芬奇架構)異構架構,開發任務並行框架:

· **輕量任務(如影像解碼、預處理)**由CPU處理;

· **計算密集型任務(如特徵提取、缺陷分類)**由NPU加速;

· 透過零複製資料傳輸(避免CPU與NPU間的記憶體複製)與動態負載均衡(根據任務型別即時分配計算資源),將異構計算效率提升至專案要求範圍內;

· 低功耗最佳化:透過DVFS動態電壓頻率調整(根據負載動態調節CPU/NPU頻率)與核心休眠技術(空閒時關閉部分CPU核心),將裝置平均功耗從300W降至15W。

3. 效果:單產線年省40萬,缺陷漏檢率保持在專案要求範圍內

遷移至昇騰310邊緣盒子後,該製造商實現:

· 硬體成本:單臺裝置價格從5萬元降至1萬元,單條產線年節省40萬元;

· 推理效能:推理延遲從100ms壓縮至15ms,滿足產線即時性要求;

· 檢測效果:缺陷漏檢率從專案要求範圍內降達到專案要求,誤檢率從專案要求範圍內降達到專案要求。

三、穩格科技“訓練-部署”全鏈路服務:金融與製造行業的國產化“加速鍵”

1. 行業經驗庫:覆蓋金融風控、製造質檢等場景的“即插即用”方案

· 金融場景:提供反欺詐、信貸審批、量化交易等模型的遷移模板,支援**結構化資料(表格)與非結構化資料(文字、影像)**的混合處理;

· 製造場景:針對缺陷檢測、視覺引導、預測性維護等需求,開發輕量化模型庫(如MobileNetV3-昇騰版、YOLOv5s-昇騰版),適配昇騰310/910的算力與記憶體限制。

2. 生態協同:華為昇騰“使能計劃”核心夥伴,技術同步迭代

· 作為華為昇騰首批開發合作伙伴,穩格科技直接參與CANN框架版本測試與行業運算元開發,有助於支援服務與華為最新技術(如昇騰AI處理器910B、CANN 6.0)同步;

· 與華為聯合推出**“昇騰遷移認證工程師”培訓體系**,為企業培養既懂AI模型又懂昇騰硬體的複合型人才。

3. 7×24小時技術支援:從遷移到運維的“全週期護航”

· 提供環境搭建、模型遷移、效能調優、上線運維的全流程支援,問題響應時間<2小時;

· 針對金融行業的可用性性要求,開發叢集容災方案(如雙活資料中心、故障自動切換),有助於支援模型訓練與推理的專案要求範圍內可用性。


提交專案需求

留下聯絡方式和需求簡述,便於我們判斷技術方向、交付範圍和溝通方式。

線上諮詢
電話諮詢
13910119357
微信諮詢
WhatsApp
穩格科技 WhatsApp 二維碼 掃碼或點選聯絡
回到頂部