270 億參數塞進 iPhone!PrismML 神級壓縮術讓蘋果 Siri 看見新出路
2026 年 7 月 14 日媒體報導,蘋果正與新創公司 PrismML 展開早期技術評估,後者已將阿里巴巴開源模型 Qwen 從約 54 GB 壓縮至不到 4 GB,270 億參數得以在 iPhone 15 上直接運行,無需雲端連線。

重點摘要
- 2026 年 7 月 14 日媒體報導,蘋果正與新創公司 PrismML 展開早期技術評估,後者已將阿里巴巴開源模型 Qwen 從約 54 GB 壓縮至不到 4 GB,270 億參數得以在 iPhone 15 上直接運行,無需雲端連線。
- PrismML 宣稱壓縮後記憶體佔用減少 10 至 15 倍、響應速度提升 6 至 8 倍,但整體效能通常下降數個百分點,事實性記憶的衰退早於推理與數學能力,規模化可靠性尚待驗證。
- 摩根士丹利估計蘋果 2027 財年 DRAM 單位成本年增約 190%,D.A. Davidson 分析師 Gil Luria 則認為模型瘦身只是把晶片需求從資料中心移到手機,不使整體需求消失。
2026 年 7 月 14 日,就在蘋果推出 iOS 27 公測版的隔天,媒體報導蘋果正與矽谷新創 PrismML 展開早期洽談。PrismML 執行長 Babak Hassibi 向 CNBC 表示,蘋果已開始評估其技術,洽談「進展順利」,但仍處於非常早期階段,走向尚不明朗。PrismML 的技術主張是:把阿里巴巴的開源模型 Qwen 從約 54 GB 壓縮至不到 4 GB,270 億個參數得以在 iPhone 15 或更新機型上直接推論,整個過程在裝置端完成。
蘋果評估 PrismML 的極限壓縮技術,揭示了端側 AI 試圖擺脫雲端算力與硬體成本制約的關鍵博弈。
PrismML 怎麼把 54 GB 模型壓進 4 GB?
Hassibi 的技術解釋直白:把模型內部每個數值的儲存方式從 16 位元大幅簡化,每個位置只保留 1 到 3 個可能值,藉此削減儲存與推論所需的記憶體。結果是記憶體佔用縮小 10 至 15 倍、響應速度提升 6 至 8 倍、耗電量降低 3 至 6 倍。PrismML 已免費釋出兩個壓縮版本,可在 iPhone、MacBook 及搭載輝達晶片的 PC 上運行;下一個壓縮目標是 Google 的開源模型 Gemma,之後還要處理需要資料中心硬體才跑得動的更大規模前沿模型。
取捨也說清楚了:整體效能通常下降數個百分點,事實性記憶的衰退比推理、數學和程式能力更早出現。這是「效能換空間」的明確交換,不是沒有代價的壓縮。公司還表示,同一套壓縮方案能讓原本需要 8 張 GPU 才跑得動的雲端模型縮到只需 1 張,讓伺服器等級的任務遷移到筆電和手機上。
PrismML 由加州理工學院(Caltech)研究團隊孵化,Caltech 持有底層專利並獨家授權給 PrismML,Khosla Ventures 在 2026 年 3 月領投了 1,625 萬美元的種子輪。
蘋果為什麼需要端側壓縮?
蘋果目前已在裝置端本機執行部分 AI 功能:翻譯、部分摘要生成,以及與個人資料高度相關的特性;較複雜的請求路由到自建的私有雲端基礎架構,或交給 OpenAI 等外部模型。這個分層架構看起來就已反映蘋果一直在尋找能把雲端比重往下壓的技術方案。
Asymco 創辦人 Horace Dediu 的研判是:蘋果很可能希望把絕大多數日常 Siri 互動留在裝置端,只把最高需求的任務送上雲端。原因不複雜,本機推論帶來更低延遲、更強隱私保護,以及更低的授權費與雲端算力成本。Creative Strategies 總裁 Carolina Milanesi 指出更具體的應用場景:更小的模型可讓蘋果把計算攝影、影片生成,以及需要存取健康資料與藥物資訊等敏感內容的健身工具,都移到 iPhone 本機處理。蘋果在這條路上有一個相對優勢:晶片與軟體協同設計,讓它對模型在裝置端怎麼跑有比其他手機廠更細緻的控制權。
但關鍵門檻也說清楚了。Counterpoint Research 研究總監 Tarun Pathak 指出,長提示下的表現、多工處理時的電池消耗,以及跨數百萬次請求、數千種裝置組合的可靠性,才是真正的壓力測試。IDC 客戶端處理器研究負責人 Phil Solis 補了耗電這個變數:一個夠強大、被頻繁使用甚至在背景持續執行 agent 任務的模型,就算記憶體佔用低,也可能把電量快速消耗。
模型瘦身,晶片需求真的會縮水嗎?
市場對「AI 所需記憶體低於預期」的訊號向來反應敏銳。今年 3 月,Google 發布 TurboQuant 論文(研究在不損害模型效能前提下削減記憶體用量),美光科技股價隨即大跌,儘管後來有所回升。PrismML 的技術主張走的邏輯相近,但需求是否會因此縮水,兩個方向的分析都有根據。
摩根士丹利給了一組讓人繃緊的數字:估計蘋果在 2027 財年的 DRAM 每比特平均成本可能年增約 190%、NAND 儲存年增約 180%,並預期蘋果把 iPhone 18 同等起售機型的售價拉高約 200 美元以護住利潤率。這個估算背後的邏輯是:AI 功能持續上線的情況下,記憶體需求只增不減。
D.A. Davidson 分析師 Gil Luria 則把模型瘦身的影響說得更直接:GPU 和記憶體還是要用,只是從資料中心搬到手機。他進一步指出,在單一裝置上跑 AI 其實比共用資料中心基礎架構效率更低,因為手機晶片大多數時間閒置;而且效率突破的歷史規律是帶動更多使用量,不是壓低支出。需求移位,而非需求消失。
真正的分歧點在於:本機 AI 的使用深度,能不能真的把雲端請求量壓下來,還是 AI 更無處不在之後反而帶動更多總體使用?目前沒有答案。但 PrismML 的公開發布,至少讓外界有機會在受控示範以外開始驗證它的技術主張,這也是為什麼即便洽談極早期,這件事已經在雲端算力的多空爭論裡插了一根旗。
蘋果與 PrismML 的洽談仍在早期,記憶體成本增幅來自摩根士丹利的估算口徑,壓縮性能數字為 PrismML 自行發布的數據,規模化的可靠性分析師一致說尚待驗證。工程師和創業者現在最值得追的問題不是壓縮比多漂亮,而是蘋果會怎麼劃定「留在本機」與「上雲」的任務分界。那條線畫在哪裡,才是端側 AI 能撬動多少雲端市場的真正指標。


