【時報記者王逸芯台北報導】代理式AI(Agentic AI)正從「回答問題」進一步走向能理解情境、自主規劃,甚至跨應用程式替使用者完成任務,也讓手機晶片架構面臨新一波變革。高通指出,代理式AI並非單純靠一個更大的AI模型就能實現,而是需要依照任務、情境及使用者需求,動態調度不同專用模型,因此行動運算架構也必須重新設計,新一代Qualcomm Hexagon NPU即鎖定裝置端代理式AI需求而來。
高通表示,代理式AI未來將能理解個人情境、跨應用程式運作、持續推理,並代表使用者採取行動。相較目前多數生成式AI以單一模型處理需求,代理式AI更像是一支「AI團隊」,依不同工作選擇適合的模型,因此除了追求更快的推論速度,也需要兼顧持續運行、多模態處理及低延遲。
為因應這項變化,高通新一代Hexagon NPU導入兩大關鍵設計,包括針對Transformer工作負載打造的Element Accelerator,以及容量增加50%的共享記憶體。其中Element Accelerator搭配純量、向量及矩陣擴充功能,可加速大型模型關鍵運算,讓AI代理更快速完成推理與回應,同時兼顧行動裝置的功耗效率。
記憶體則是另一項關鍵。隨著AI代理開始處理更長的上下文、更多工具及並行任務,需要頻繁存取大量模型資料。新一代Hexagon NPU將記憶體子系統容量增加50%,讓更多模型狀態、啟用值及中間張量留在晶片內,降低存取外部DDR記憶體的次數,進而縮短等待時間,並提升token生成速度及不同任務間切換的流暢度。
高通也押注混合專家模型(Mixture-of-Experts,MoE)成為裝置端AI的重要架構。以300億參數MoE模型為例,雖然擁有數百億個參數,但每次生成token時僅需啟用約30億個經路由選擇的參數,不必像傳統密集模型每次推論都動用大部分參數,因此可降低實際運算量及記憶體頻寬需求。
在運算精度方面,Hexagon NPU支援INT2、INT4、INT8、FP8及FP16,讓開發者依效能、記憶體、模型品質及功耗需求進行配置。其中INT4模型的預填(prefill)效能最高可提升50%,並強化解碼吞吐量及推測解碼能力,目標就是讓手機上的AI回應速度更接近即時。
值得注意的是,代理式AI也不再只是NPU「單打獨鬥」。高通指出,Hexagon NPU主要負責加速Transformer工作負載,CPU則負責多步驟工作負載的協調、智慧路由及資料準備;AI加速能力也逐步延伸至GPU。換言之,隨代理式AI走向裝置端,手機晶片競爭也將從過去比CPU、GPU或NPU單項效能,進一步轉向不同運算單元、記憶體及AI模型之間的整體協同能力。
☞警語:以上媒體報導,非任何形式之投資建議,投資前請獨立思考、審慎評估。nStock網站所有內容僅供APP使用教學參考,並無任何推介買賣之意,投資人應自行承擔交易風險。