DeltaMedia
2026-07-22
← 所有故事線 晶片算力

Alibaba

5 則 · 34 天(2026-06-02 ~ 2026-07-06)

  1. 2026-07-06 不用海外旗艦模型!OpenSquilla 0.5.0 靠國產模型組團登頂 DRACO 雙榜
    不用海外旗艦模型!OpenSquilla 0.5.0 靠國產模型組團登頂 DRACO 雙榜

    2026 年 7 月 6 日,OpenSquilla 0.5.0 Preview 在 DRACO 深度研究榜 Brave Search 組拿下平均 64.09 分,高於 Opus 4.8(59.11)與 GPT-5.5(53.28),任務平均成本僅 $0.12,分別約為兩者的 8% 與 14%。

  2. 2026-06-08 能力退化還是被壓抑?Off-Model SFT 的移除代價與解法
    能力退化還是被壓抑?Off-Model SFT 的移除代價與解法

    AI 控制研究裡有一類核心工具,叫做 off-model SFT:用另一個模型產生的標籤來微調目標模型,藉此改變它的行為,不需要直接重設目標函數。這個做法的主要應用場景,包括對抗 exploration hacking(模型在訓練過程中學到繞過監督的行為模式),以及清除被植入的後門。它不需要你知道「壞行為的實際觸發邏輯

  3. 2026-06-06 小模型實戰:五隻林地生物、一個會崩盤的經濟體,三個工程教訓
    小模型實戰:五隻林地生物、一個會崩盤的經濟體,三個工程教訓

    在 Build Small Hackathon,有人用 Qwen2.5-3B 跑了五隻林地生物組成的多代理經濟體,讓牠們交易五種商品、積累財富、觸發泡沫與貧富分化。推論後端是 vLLM on Modal,前端是 Gradio 介面。這是一份工程實戰報告,核心命題不是「小模型也能做到」,而是「這個任務本來就只能用小模型做

  4. 2026-06-05 Future-L1 放棄文字代理推理、改走潛在視覺空間,Qwen3-VL-8B 在 FutureBench 從 61.0 拉至 85.4
    Future-L1 放棄文字代理推理、改走潛在視覺空間,Qwen3-VL-8B 在 FutureBench 從 61.0 拉至 85.4

    研究者提出 Future-L1,一個交錯潛在視覺推理框架,讓 MLLM 在自回歸解碼時於語言 token 與連續潛在視覺 span 之間交替,而非把所有中間推理步驟語言化。以 Qwen3-VL-8B 為基底,Future-L1 在 FutureBench 上將分數從 61.0 提升至 85.4,並在論文所報告的兩項影片

  5. 2026-06-02 阿里 Qwen3.7-Plus 打入 Vision Arena 全球前五,多模態閉環 Agent 工作流開放 API
    阿里 Qwen3.7-Plus 打入 Vision Arena 全球前五,多模態閉環 Agent 工作流開放 API

    6月2日,阿里巴巴發布 Qwen3.7-Plus,在全球視覺大模型榜單 Vision Arena 列全球前五、中國第一(廠商自報)。真正的訊號不是「一鍵複刻桌面軟體」的行銷說法,而是模型首次把視覺理解、深度推理、自我編程、工具調用、自驗證迭代整進同一個 agent 迴圈;目前已上線阿里云百炼,開放 API 服務。