0
人工智能由一種技術發展成產業,這是過去數年方興未艾的行業軌跡,AI產業化如語音識別,想象空間很大卻有天花板,而將千行百業AI化,則是公認的廣闊天地大有可為。
“行業信息化市場已經步入了產業AI化階段,這將會是一個萬億級的市場。”在近日召開的IPF2020浪潮云數據中心合作伙伴大會上,浪潮集團執行總裁、首席科學家王恩東如此表示。
從技術AI進化至產業AI的中途,不同企業都在探索,邊界模糊、定位重塑,這是全新的機會,可能誕生新產業形態的巨頭,也可能淘汰一些競爭壁壘不強的企業,置身變革之中的浪潮,也在從底層算力向上尋找突破垛口。
結合浪潮自身的定位和產業AI化的前景,浪潮搭建了生產算力、聚合算力、調度算力和釋放算力來加速落地AI的流水線,體現出浪潮對于AI算力的理解。
作為服務器廠商,算力的生產是浪潮最基礎的能力,浪潮已經形成完整的產品布局,能夠提供全線定制化的人工智能芯片和加速卡,覆蓋從訓練到推理,從語音到語義,從邊緣到云到AI加速到各類相關的AI應用的場景。

據浪潮官方表示,浪潮目前能夠提供業界最全和擁有最高性能組合的AI服務器產品線,拳頭型產品如針對訓練場景的AGX-2,是目前全球首款在2U空間能夠支持互聯八顆最高性能GPU的AI服務器,AGX-5是目前全球單機AI計算性能最強的AI超級服務器,單機張量計算性達每秒兩千萬億次,此外還有面向邊緣計算的NE5250M5等產品。
本次大會上,浪潮發布了全球首個AI開放加速計算系統MX1,在同一機組內能夠支持不同廠家的AI芯片,意味著它可以支持多種符合OAM(OCP Accelerator Module)開放標準的接口。

生產算力不只是硬件工作,如何讓大規模計算在硬件平臺上實現,必須要有與之相匹配的軟件優化產品和技術。比如當下Common Crawl數據集最大接近250TB,如此之大的數據集,需要大規模深度神經網絡來訓練,受限于GPU顯存有限,無法實現超大參數規模和高分辨率圖片模型訓練。對此,浪潮研發出LMS系統,它可以實現大模型內部細粒度模型的分層,從而釋放GPU顯存壓力,同時針對圖像計算整體優化。
“在針對三維的核磁共振圖像的模型訓練,浪潮LMS系統支持到350百萬像素立方的超大尺寸圖像分辨率,而在現在通用的GPU技術只能做到200百萬像素立方左右的尺寸分辨率。”浪潮AI&HPC總經理劉軍表示。
浪潮自研的AI大模型計算框架LMS,在NLP智能語言模型訓練突破70億參數規模,相比通用參數模型規模提升20倍以上。
算力生產之后,數據中心扮演聚合算力的角色,當前云數據中心仍有許多固有挑戰,比如虛擬交換、VXlan等技術大量消耗CPU的資源,最多時損耗高達50%,此外,網絡抖動、帶寬、IOPS的增加都可能拉低云數據中心性能,同時裸金屬服務器、軟件定義網絡等需求成為主流,也給數據中心帶來新的難題。
AI算力中心上線推理服務時,尤其高并發推理服務,最大挑戰來自海量文件IO處理的瓶頸,浪潮專門針對高并發推理集群進行架構優化,構建高性能的基于NVMe的存儲池。具體操作是將AI計算的軟件棧進行深度的優化,把所有推理節點進行高帶寬,低延遲的高速網絡優化,性能提升3.5倍以上。
在數據中心網絡加速方面,推出N20X智能網絡加速方案,最高可釋放50%的CPU計算資源,IOPS延遲降低30%以上。
N20X智能網絡加速方案可將主機網絡、存儲和計算的負載的卸載到網卡,對主機計算、存儲和網絡實現有效的加速,它支持 OVS、 NVMe、Virtual IO的技術融合,甚至能夠實現接近于物理機性能的裸金屬服務,容器和VM分鐘級資源交付。
如何能把生產、聚合之后的算力高效的調度用于更多的創新?
AI應用從開發環境、生產環境,模型上線、部署復雜度遠超以往,人工智能企業需要一個強大的高效的資源管理平臺,幫助完成一站式模型開發和部署,這就是浪潮AIStation資源平臺。

AIStation訓練平臺首先能夠解決研發模型開發訓練的挑戰,實現高效共享AI算力,加速AI創新的研發。通過AIStation,企業不同工作小組,不同開發者,都可以高效共享AI服務器資源,保證算力資源的高效利用。
“我們可以實現計算資源非常細粒度的切割共享,一塊GPU資源可以共享到多個用戶來同時使用,面對訓練場,大規模數據集的IO挑戰,我們實現了對訓練數據的緩存加速,越來模型開發和訓練越來越復雜,浪潮在AIStation上海提供了分布式訓練和編排,保證開發人員盡可能自動化調度更大規模的計算力,來提升AI訓練模型的精度。”劉軍解釋道。
在AI模型生產上線階段,AIStation推理平臺可以幫助客戶部署和推理,從而提速整個AI生產交互過程,這其中浪潮解決了很多問題。比如兼容多種深度學習框架和推理服務,AIStation推理版本能提供多模型計算結果,保證推理結果的準確性和可信度。
雷鋒網了解到,僅就單一AI應用,其實現平均至少需要消耗6個人月的專家人力,以智能化工具提升AI開發的效率,有效降低人力的成本,成為不少企業用戶的訴求。
浪潮升級了AutoML Suite自動機器學習平臺,AutoML Suite可實現企業級一站式模型自動構建,支持私有化部署,全面支持圖像分類/回歸/目標檢測CV場景應用,模型大小與計算量極致壓縮,用戶提供原始圖片數據和標注數據,經過AutoML Suite處理,自動生成所需的AI算法模型。

AutoML Suite之所以可實現上述功能,來源于其三大核心引擎: AutoNAS可根據數據特性,從無到有構建網絡模型,實現AI模型與用戶應用場景的最佳匹配; AutoTune可進行超參自動調整,使算法工程師從繁瑣耗時的手動調參中解放出來; AutoPrune基于元學習技術,可對任意網絡進行無損壓縮,使生成的模型滿足用戶應用生產部署要求。
目前,浪潮AutoML Suite已在智慧城市、鐵路、公路等場景中得到應用。在智慧城市路口通過監測領域,基于40萬數據集,AutoML自動生成的模型在日間識別準確率達91.5%,夜間識別準確率為83.6%,高于專家手動設計模型精度;在鐵道開口銷設備故障檢測中,運用浪潮AutoML Suite自動生成的模型實現了81.8%的召回準確率;在高速公路團霧識別領域,對14000張圖片進行搜索訓練后,自動生成模型對團霧的檢出準確率率為99.25%,模型效果符合生產應用水平。
“未來五年、十年,人工智能會成為未來最核心的計算力,面臨大數據和深度學習的計算需求,人工智能會帶來一個指數型增長的對計算力的需求。浪潮一直致力于創新AI計算,也是為我們當前的新基建提供原動力,浪潮會提供最領先的算力機組來生產算力,我們會通過更敏捷的數據中心來聚合算力,通過高效的調度算力我們產業AI提供更多創新的可能,同時通過釋放算力來快速落地進化AI。”劉軍總結表示。
正如王恩東所說,智慧社會離不開智慧的生態。在AI產業化過程中,浪潮是新興AI企業的主要合作伙伴和算力提供商,新興IT企業已經積累了大量優質的算法框架、模型和數據,這些優質的AI技術正是產業AI化過程中行業用戶所需要的,也是為這些用戶服務的傳統合作伙伴所欠缺的。
為了幫助行業用戶更好的進行智慧化轉型,連接傳統合作伙伴和新興AI企業,浪潮此前就提出了元腦生態計劃,元腦由浪潮聯合具備AI開發核心能力的左手伙伴和具備行業整體方案交付能力的右手伙伴共同組成,在本次大會上浪潮進一步推出“E基金”計劃,“E基金”首期將由浪潮投入億元作為啟動資金,針對以下三個方向進行重點投入:
方案火種源:助力合作伙伴AI技術創新,浪潮自主投入市場經費,搭建AI計算平臺開放環境,并免費向合作伙伴提供浪潮算法工具服務,賦能合作伙伴進行AI算法開發,并與合作伙伴聯合產品創新,打造行業AI解決方案;
項目火種源:面向金融、通信、智慧城市、交通、能源等8大重點行業,給予合作伙伴聯合市場推廣資金支持,推動高價值AI場景化解決方案的落地,加速重點行業的產業AI進程;
人才火種源:賦能行業AI人才培養,聯合打造ASC、AICC等頂級AI資源交流平臺,開放資源賦能行業,培養更多優秀行業AI人才。
浪潮的目標是聚合AI最強算力平臺、最優質的算法模型開發能力和最優質的集成、部署和服務能力,從而支撐和加速各行業、各產業與人工智能的融合,讓各個行業、各個產業具備可感知、自學習、可進化的能力,最終幫助用戶完成業務智能轉型升級,以生態之力成就行業、產業AI大腦。(雷鋒網雷鋒網)
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。