
高通新一代 Snapdragon 平台中的 Hexagon NPU。
在下周高通 Summit 峰會前的發表預熱活動,繼 CPU、GPU 後,來到 AI 時代不可或缺的 NPU 架構,新世代高通 Snapdragon 平台在這一代的 Hexagon NPU 中導入了全新的元素加速器(Element Accelerator)與大幅擴增容量的大型共享記憶體系統,提供 AI 代理運算所需要的快速回應以及有效率的推論效能,並且在行動裝置功耗效率的限制下提供更豐富的體驗。
高通預先揭露新一代 Snapdragon 處理器架構 首款具備 5GHz 高時脈的行動 CPU 登場!
高通針對新一代 Adreno GPU 導入內建快取、矩陣核心以及神經渲染技術 讓顯示效能與電池功耗不再是天秤兩端

這次高通 Hexagon NPU 在硬體配置上的最大特色就是加入了新的元素加速器(Element Accelerator),這是高通這次專為生成式 AI 以及 AI 代理所打造的架構,支援 Transformer 模型,透過結合向量與純量擴充的設計,高通表示可以加速對大型模型的關鍵運算以及 AI 代理的回應/推論速度,並且不會對行動裝置所在乎的功耗效率產生影響。

另外影響 AI 代理反應速度與效能的另一項因素:資料記憶部分,高通在這次的 Hexagon NPU 中大幅擴展了其大型共享記憶體,將更多模型狀態、情境和 KV 快取(KV-cache)資料保留在更靠近加速器的位置,高通表示透過更大的共享記憶體減少了記憶體存取資料的瓶頸(直接存取記憶體的機率降低),並在 AI 代理處理更長的上下文、更多工具和更多併發任務時,維持其快速的反應能力。

透過這兩個新設計,新一代的 Snapdragon 處理器在 INT4 模型下,比起上一代 Snapdragon 8 Elite Gen 5 處理器,在預填充(Pre-fill)效能提升最高 50%,而首個 Token 產生時間縮短至 1.5 秒,帶來了更即時的裝置端 AI 體驗,讓代理感覺起來更快、功能更強大,且更具個人化。

而在模型參數量的支援部分,新一代 Hexagon NPU 可以支援最大 30B 參數量的 MOE 混合專家模型,但這並非如密集型模型般一次啟動 30B 的大模型,而是會透過輸入內容,動態選擇模型中適合的專家模型進行調用,一次僅會啟動 3B 參數量進行 Token 生成,進而降低主動運算以及記憶體頻寬需求,這也是 AI 代理的運作趨勢。

而回到整個 AI 代理在新一代 Snapdragon 平台的運作流程,透過 Oryon CPU、Adreno GPU 以及 Hexagon NPU ,讓裝置端的 AI 代理更為可用,在下周正式舉辦的 Snapdragon Summit 活動中,高通將會完整揭露新一代 Snapdragon 處理器的架構表現與應用,陳拔屆時也會做更完整的介紹,不要錯過囉。
感謝分享&介紹,就等下周高通正式發表啦

























































































