百度 0.9B 輕量模型 PaddleOCR-VL-1.6 聲稱壓倒 Gemini-3-Pro 與 GPT-5.2,開源可平滑遷移
百度文心正式發布 PaddleOCR-VL-1.
百度文心正式發布 PaddleOCR-VL-1.6,這個僅 0.9B 參數的輕量專用模型,在文檔解析評測 OmniDocBench v1.6 上達到 96.33%。廠商公告稱其綜合性能超越 Gemini-3-Pro、GPT-5.2、MinerU-2.5-Pro、GLM-OCR 等通用大模型與專用 OCR 方案,刷新該評測榜單 SOTA。
PaddleOCR-VL-1.6 基於文心大模型訓練,支援超 100 種語言,覆蓋 170 多國用戶。在面向真實複雜場景的 Real5-OmniDocBench 評測中,總指標達 93.19%,廠商稱較 Gemini-3-Pro 高出近 4 個百分點,涵蓋掃描件、彎折文件、螢幕拍照、光照變化、傾斜文件五類場景。此次升級在 PaddleOCR-VL-1.5 基礎上保持相同模型結構,現有用戶可直接平滑遷移,無需額外適配。程式碼與權重已開源至 GitHub(累計 79.2K Stars,已超越 Google 開源 OCR 項目 Tesseract OCR)與 Hugging Face。
以上數字均出自廠商發布材料,尚待獨立第三方驗證。對做文件數位化與 RAG 前處理的工程師而言,核心訊號在此:OCR 與版面解析是典型垂直任務,0.9B 的專用小模型在廠商跑分上仍可壓倒通用大模型;更關鍵的是,這個規模可在端側或低成本環境直接部署,推理延遲與 API 費用遠低於調用 Gemini 或 GPT 系列。若你的 pipeline 目前仰賴通用模型做文件解析,此方案值得納入 benchmark。
本文由 DeltaMedia 編輯團隊審核後發布 · 編輯原則


