國內首個異構混合推理系統發布

算力成本降逾一半
15/09/2026
1002
收藏
分享
算力成本降逾一半

中國移動雲公司在2026中國算力大會發布面向大模型的異構混合推理系統,以國產GPU配合類腦晶片,讓兩種處理器分擔不同計算任務。公司稱,系統較同類國產GPU算力集群的性價比提升一倍以上,是國內首個公開發布的「國產GPU +類腦晶片」大模型混合推理方案。

中國移動雲發布國產GPU與類腦晶片混合推理系統。 (網絡圖片)

系統由移動雲聯同中國電子雲、北京靈汐科技及相關研究團隊合作開發。傳統大模型推理主要依靠GPU完成所有運算,新方案則把適合高並行矩陣運算的部分交由GPU,把部分稀疏、事件驅動或能效要求較高的工作分配給類腦晶片,再由軟件統一調度。

大模型完成訓練後,每次回答問題、生成文字或調用工具都屬推理。隨着企業把模型接入客服、辦公和智能體,推理次數快速增加,所需算力逐步超過集中式訓練。降低單次推理成本,因而成為國產芯片商業落地的重要條件。

類腦晶片模仿生物神經系統的脈衝和稀疏處理方式,只在特定事件出現時啟動部分計算單元,理論上可減少不必要的能源消耗。GPU擅長成熟的大規模並行計算,軟件生態也較完整。混合架構並非由其中一種完全取代另一種,而是按任務特點配置算力。

軟件調度決定實際效能

異構系統最困難的部分不只是把不同晶片放進同一機房。模型需要被拆分,資料在處理器之間傳送時亦會產生延遲;若調度不當,節省的計算時間可能被資料搬運抵銷。系統因此要處理模型切分、任務排程、記憶體管理及通信協議。

發布方表示,方案已針對大模型注意力計算及部分專家模型結構作分工,並透過統一軟件層屏蔽不同芯片接口。企業部署時毋須為每款硬件重新改寫完整應用,可按吞吐量、延遲和成本需要選擇資源組合。

官方所稱「性價比提升一倍以上」,主要是與同類國產GPU集群比較,並不等於單顆類腦晶片性能超越國際先進GPU。實際效果仍會因模型大小、輸入長度、並發量及精度要求不同而改變,也需要更多第三方測試驗證。

國產AI晶片近年面對高頻寬記憶體、先進製程及軟件適配限制。單靠增加GPU數量會提高耗電、機房和互連成本,採用多種國產處理器協同工作,可在硬件供應受限時增加配置彈性,亦讓較專用晶片找到應用場景。

中國移動擁有雲端數據中心、網絡和大量企業客戶,可把新架構放進客服、網絡運維、內容處理和智能體等實際業務。若系統能在穩定性、開發工具和模型兼容方面達標,較容易由展示平台走向規模部署。

大會期間,中國移動亦公布算力網絡及AI安全產品,希望由底層芯片、雲平台到模型服務形成完整供應鏈。異構推理系統可與其雲端服務結合,企業按實際使用量購買推理能力,不必自行管理不同品牌的服務器。

檢舉
檢舉類型:
具體描述:
提交
取消
評論
發佈

力報會員可享用評論功能

註冊 / 登錄

查看更多評論
收藏
分享

相關新聞

推薦新聞

找不到相關內容

七日預報