在人工智慧技術飛速發展的今天,行業AI應用的落地需求愈發迫切。然而,不同硬體架構間的相容性、計算效率的瓶頸以及模型遷移的複雜性,成為制約AI應用快速部署的關鍵挑戰。作為昇騰晶片開發領域的專家,穩格科技憑藉對CANN(Compute Architecture for Neural Networks)框架的深度掌握與異構計算加速技術的創新應用,為行業客戶提供從模型遷移到高效能部署的一站式解決方案,助力企業突破技術壁壘,搶佔AI落地先機。
一、CANN框架:昇騰生態的“橋樑”與“引擎”
CANN是華為推出的異構計算架構,專為AI場景設計,向上相容PyTorch、TensorFlow、MindSpore等主流AI框架,向下無縫適配昇騰AI處理器(如昇騰910、310),是連線硬體算力與軟體生態的核心樞紐。穩格科技基於CANN框架的技術優勢,構建了三大核心能力:
1. 跨框架相容性:支援將TensorFlow、PyTorch等框架訓練的模型自動遷移至昇騰平臺,透過工具鏈自動分析API支援度並生成適配指令碼,大幅降低遷移成本。例如,某醫療影像企業透過穩格科技的遷移工具,將原本基於TensorFlow的CT影像分析模型平滑遷移至昇騰910,推理速度提升3倍,硬體成本有所降低。
2. 計算圖最佳化:CANN透過圖引擎技術對神經網路計算圖進行深度最佳化,包括運算元融合、記憶體複用、多流並行等策略。以Transformer模型為例,穩格科技利用CANN的FlashAttention融合運算元,將注意力計算中的矩陣乘與Softmax操作合併,減少HBM訪存次數,使大模型推理延遲有所降低。
3. 異構資源排程:針對CPU、NPU、DVPP(數字視覺預處理模組)等異構單元,CANN透過智慧任務排程實現資源較大化利用。穩格科技為某智慧製造企業部署的缺陷檢測系統,透過CANN的異構並行策略,將影像預處理(DVPP)、特徵提取(NPU)、結果分析(CPU)三階段任務並行執行,整體吞吐量提升2.8倍。
二、異構計算加速:從“算力釋放”到“場景落地”
異構計算的核心在於透過多樣化硬體協同解決單一架構的效能瓶頸。穩格科技結合昇騰晶片的硬體特性與CANN的軟體最佳化能力,打造了三大加速場景:
1. 大模型訓練加速:針對千億引數級大模型,穩格科技採用3D並行(資料並行+模型並行+流水並行)策略,結合CANN的ZeRO記憶體最佳化技術,將訓練過程中的啟用記憶體佔用有所降低。例如,在某語言大模型預訓練專案中,透過穩格科技的最佳化方案,昇騰叢集的算力利用率保持在專案要求範圍內有所提升,訓練週期有所降低。
2. 即時推理最佳化:在自動駕駛、工業質檢等低延遲場景中,穩格科技利用CANN的KV Cache技術與量化壓縮演算法,實現模型記憶體佔用與計算效率的平衡。某自動駕駛企業透過穩格科技的方案,將BEV感知模型的INT8量化精度損失控制在專案要求範圍內內,推理幀率從15FPS提升至35FPS,滿足即時決策需求。
3. 分散式部署支援:針對超大規模模型,穩格科技基於CANN的自動並行切分能力,實現模型在跨節點叢集中的穩妥部署。例如,在某金融風控大模型專案中,透過穩格科技的分散式編譯工具,將原本需單卡128GB視訊記憶體的模型切分為8個子圖,在16卡昇騰叢集上完成訓練,硬體成本有所降低。
三、穩格科技:行業AI遷移的“全棧夥伴”
作為昇騰生態的核心合作伙伴,穩格科技提供從技術諮詢、模型遷移、效能調優到部署運維的全鏈條服務:
· 技術諮詢:基於行業經驗,為客戶定製AI硬體選型與架構設計方案。
· 模型遷移:透過自動化工具與手工最佳化結合,有助於支援模型在昇騰平臺上的精度與效能無損。
· 效能調優:利用CANN的調優引擎(AOE)進行運算元級、子圖級、模型級的多層次最佳化。
· 部署運維:提供叢集監控、故障診斷、模型迭代等全生命週期支援。
目前,穩格科技已成功助力醫療、製造、交通、金融等領域的30餘家企業完成AI應用遷移,平均提升計算效率3倍以上,硬體成本有所降低。
線上諮詢
電話諮詢
微信諮詢
回到頂部