蘋果A20 Pro新特性曝光:AI算力反超GPU!雙16核NPU強攻端側大模型

A20 Pro此前已在Geekbench 6中刷新了智慧型手機晶片的單核成績紀錄,多核表現較A19 Pro和M3最高提升27%,甚至超越了M5 Max。

近日這款SoC又有一項新特性被曝光:其雙16核神經網路引擎的峰值算力可以高於晶片內建的7核GPU,但前提是工作負載必須專門為NPU量身打造。

這一消息來自知名爆料博主Max Weinbach在X平台上的分享。他提到關於A20 Pro和M6的一個有趣事實:只要任務專門針對神經網路引擎進行最佳化,雙16核設計帶來的性能增益便可超過GPU。

但反過來,如果讓神經網路引擎去處理圖形密集型負載或特定動畫,速度會慢到幾乎無法接受,這類工作仍然必須交給GPU。

蘋果A20 Pro新特性曝光:AI算力反超GPU!雙16核NPU強攻端側大模型

這一架構調整意味著A20 Pro在設計邏輯上已向AI算力傾斜。在運行30億(3B)參數規模的端側AI模型或處理量化模型的提示詞預填充階段時,雙16核NPU能夠提供極高的執行效率。

也就是說,NPU的流水線設計已針對AI提示詞處理進行了專項最佳化,這使得大量原本需要GPU介入的任務可以被NPU高效接管,從而為系統留出更多資源余量。

除了模型處理,A20 Pro的NPU還承擔了大量的視覺與音訊專項任務。例如即時攝影機的深度估計、背景虛化、文字識別以及圖像分割等特徵提取工作,均由NPU在底層完成。

而在音訊側,即時語音識別和環境音增強也已實現硬體級加速,這些任務在NPU上的運行能效比遠高於傳統核心。

不過NPU也並非全能的萬金油,在處理非量化的32位(FP32)或64位浮點數學運算,以及涉及動態張量形狀的任務時,系統仍會回退至CPU或GPU進行計算。

此外對於大語言模型的單Token生成階段,由於NPU存在調度開銷問題,CPU和GPU反而更適合處理此類任務。

目前首批搭載A20 Pro的iPhone 18 Pro、iPhone 18 Pro Max以及iPhone Duo尚未發貨。

隨著裝置陸續上市,後續將出現更多專門針對雙16核神經網路引擎設計的任務,屆時才能更直觀地看出這次升級究竟能帶來多大的實際收益。
補充:

雖然 A20 Pro 整顆 SoC 晶片是基於 ARM 指令集架構 (ISA) 開發的,但這僅限於它的 CPU 部分(如 Everest 超級核心與 Sawtooth 能效核心)需要遵循 ARM 的指令解碼規範。在 NPU 和 GPU 的硬體設計上,蘋果一直以來都堅持全自研:
  • 獨立的雙組 32 核設計: A20 Pro 搭載了兩組獨立的、共 32 核心的自研神經網路引擎(Neural Engine),其流水線與運算單元(包含針對 FP8 低精度硬體加速)都是蘋果針對端側大模型(如 3B 參數規模模型)深度定制的結果。
  • CPU 核心內的 Neural Accelerator: 除了主要的 NPU 模組,A20 Pro 也在 6 個 CPU 核心內部整合了獨立的「神經網路加速器(Neural Accelerator)」,這同樣屬於蘋果自定義的硬體電路,與 ARM 公版的 NPU 沒有關係。

簡而言之,A20 Pro 是一顆「採用 ARM 指令集架構的 CPU,搭配蘋果完全自研 NPU 與 GPU」的客製化晶片
左轉隔壁蘋果看板
算力強,也要看每TOPS算力得花費多少錢
而且還要看各種運算工具程式的支援度如何
目前支援度基本上是Nvidia的天下
而且同樣N卡,光RTX5000系列到現在支援度也還不如RTX4000系列
又不是每間公司或個人都有能力為這套設備寫出專用工具

所以只看算力排名意義不大
chanp
NV在移動端的支援度…[哈欠]
文章分享
評分
評分
複製連結

今日熱門文章 網友點擊推薦!