繞開整合地獄:Apple 用 vision LLM 重押 Siri AI 的技術路線
WWDC 2026 的 Siri AI 公告,最值得細看的不是功能清單,而是 Apple 選擇了哪條技術路,以及為什麼偏偏是現在。
WWDC 2026 的 Siri AI 公告,最值得細看的不是功能清單,而是 Apple 選擇了哪條技術路,以及為什麼偏偏是現在。
Apple Intelligence 過去兩年最深的困境之一是整合地獄。 每個 app 要讓 Siri 理解自己的內容,都得寫專屬整合碼,這條路既慢又碎,第三方 app 的配合速度跟不上。今年,Apple 的回答是:不走整合碼,改用 vision LLM 直接讀螢幕,把 UI 當圖像輸入,理解畫面上的資訊。
這個方案在 2024 年行不通,那時 vision LLM 的成熟度還不足以可靠地讀取結構化介面資訊。現在條件改變了,路線才跟著轉。換句話說,這看起來不是急就章,而是等技術條件具備之後才換方向。理論上,這意味著 Siri AI 的能力覆蓋範圍可以一次跳過所有未接入的 app,而不用逐一談整合。
第二個架構轉向是模型授權方式。Apple 取得了一個 Gemini 衍生的自訓模型授權,並跑在自家的 Private Cloud Compute 上,而非直接呼叫外部雲端 API。這個安排推測兼顧了兩件事:推論留在 Apple 基礎設施內,隱私主張得以維持;同時 Apple 不必從零訓練基礎模型,省下的時間和成本可觀。
第三條線是開發者端。Core AI 函式庫透過 coreai-torch 這個 Python 套件橋接 PyTorch 生態系。工程師把既有 PyTorch 模型匯出為 `torch.export.ExportedProgram`,coreai-torch 走過 FX graph,逐節點把 ATen 運算子映射到 Core AI 操作,最終在 Apple 硬體上執行。對工程師的意思是:不需要重寫模型,走匯出流程就能讓現有 PyTorch 模型直接落地 Apple Silicon,入門門檻理論上大幅降低。
但這一切目前都還沒有可信的實測支撐。 Simon Willison 的態度值得借鑑:2024 年 Apple Intelligence 公告讓很多人信了,結果落空;這次維持「看到才相信」的原則。iOS 27 Developer Beta 今天開放安裝,新 Siri AI 卻仍在 waitlist 管制中。MacRumors 的 Aaron Perris 據報已通過等待名單,後續他的第一手報告,才算是真正可信的田野資料。
對 AI 產品工程師而言,這次技術選擇有幾個值得觀察的點。視覺理解取代 API 整合,是一個用感知層繞過協議層的思路,關鍵問題在 latency、準確率、以及各種邊緣情境的穩定性,目前看來都還沒有答案。coreai-torch 的 FX graph 橋接模式如果走得通,Apple 裝置的本地推論生態才有機會真正活起來。這兩件事,等 waitlist 之後的實測才能驗證。


