短訊
共 134 篇 · 第 6/6 頁
-
研究前沿
NUS 余浩泳 ICRA 2026 直指:外骨骼遲遲沒普及,問題出在研究者自己手上
新加坡國立大學教授余浩泳在 ICRA 2026 醫療機器人 keynote 拋出反直覺命題:外骨骼需求明確(老齡勞動力、工傷防護、建築與物流的肌骨損傷全是剛需)但普及率低迷的根源不是市場沒準備好,而是研究者把裝置做得太重、穿戴太麻煩、控制太複雜、成本太高。
-
模型動態
VSTAT 基準測試揭穿影片理解幻覺,SOTA 模型僅略勝矇答基線
一份新基準讓多模態大語言模型(MLLM)的影片理解成績大幅縮水。VSTAT 以 834 段影片配上 1500 道刻意設計的問題,這些題目單憑任何一幀或短片段都無法作答,必須跨整段影片持續追蹤實體與狀態演變。測試結果:現有 SOTA 模型得分遠低於人類,且僅略高於不看影片、只靠統計分佈猜答案的「答案先驗」基線。
-
Agent與應用
Pollen Robotics 替 Reachy Mini 引入遠端 MCP 工具,打破「每個工具都得是本地 Python」的硬限制
Pollen Robotics 在 Reachy Mini 對話應用中新增第三類工具,遠端 MCP 工具,讓機器人能在不修改本地 app 的前提下,直接呼叫發布在 Hugging Face Space 上的外部能力。過去所有工具都是本地 Python,搜尋、天氣、查詢這類無狀態能力也得打包進 app,形成不必要的摩擦。
-
研究前沿
上海交大王賀升 ICRA 2026:從畫地圖到預測未來,動態 Gaussian SLAM 正打破靜態世界假設
2026 年 6 月 2 日,上海交通大學教授王賀升在奧地利維也納 ICRA 2026 上,系統性指出傳統 SLAM 的結構性侷限:整套架構建立在「環境靜止、結構穩定」的假設之上,面對自動駕駛場景的車流行人、或手術機器人面前持續形變的人體組織,已逼近天花板。
-
晶片算力
OpenSquilla 發布 Meta Skill,9 個開源 Workflow 模板上架,技能自動組裝打通長程 SOP
Agent 框架 OpenSquilla 新上線 Meta Skill 功能:一個 Meta Skill 內嵌多個原子 Skill,Agent 執行時自動判斷所處階段、呼叫對應子技能,搭配心跳機制定時檢視狀態檔案持續推進,全程無需人工介入。
-
研究前沿
LongLive-RAG 把 AR 長影片生成轉型成 RAG 問題,以非區域性記憶對決滑動視窗漂移
自回歸(AR)影片擴散模型雖能生成任意長度的影片,卻有一個結構性死穴:滑動視窗注意力一旦累積外觀錯誤,後續幀只能在已劣化的軌跡上繼續生成,誤差與身分漂移會越滾越大,且無法回頭修正。LongLive-RAG 提出的解法是把問題定性重寫,長影片生成本質是個 RAG 問題,而非單純的上下文延伸。
-
晶片算力
阿里 Qwen3.7-Plus 打入 Vision Arena 全球前五,多模態閉環 Agent 工作流開放 API
6 月 2 日,阿里巴巴發布 Qwen3.7-Plus,在全球視覺大模型榜單 Vision Arena 列全球前五、中國第一(廠商自報)。真正的訊號不是「一鍵複刻桌面軟體」的行銷說法,而是模型首次把視覺理解、深度推理、自我程式設計、工具呼叫、自驗證迭代整進同一個 agent 迴圈;目前已上線阿里雲百鍊,開放 API 服務。
-
開源生態
Nathan Lambert 辭別 Ai2:OLMo 從未刷榜奪冠,影響力卻滲透整個開源生態
Nathan Lambert 宣佈離開 Allen Institute for AI(Ai2),結束以 OLMo 開源模型為核心的研究歷程。他在反思文章中直指一個矛盾:OLMo 在效能上從未站上前沿,即便在同尺寸桶內也非頂尖,影響力卻遠超排名數字所能呈現的範圍。值得追問的是:不靠刷榜,影響力從何而來?
-
開源生態
百度 0.9B 輕量模型 PaddleOCR-VL-1.6 聲稱壓倒 Gemini-3-Pro 與 GPT-5.2,開源可平滑遷移
百度文心正式發布 PaddleOCR-VL-1.6,這個僅 0.9B 參數的輕量專用模型,在文件解析評測 OmniDocBench v1.6 上達到 96.33%。
-
模型動態
深度原理 MPA 把 LLM 三段式訓練移植材料模型,40 個工業任務全取 SOTA
深度原理(Deep Principle)釋出材料基座模型 MPA(Materials Property Axiom),直接借用大語言模型預訓練/中期訓練/後訓練三段式配方做材料性質預測。
-
研究前沿
xAI Ethan He:影片模型的智慧源自 LLM,下一個 Sora 是影片 Agent
前 NVIDIA Cosmos 世界模型主導工程師 Ethan He 加入 xAI 後,率小型團隊在三個月內從零建出 Grok Imagine,並在 Latent Space podcast 拋出反直覺核心論點:影片模型的「智慧」主要來自 LLM,不是來自看更多影片訓練資料。這個判斷直接改寫了影片生成的下一步路線圖。
-
大廠戰略
AWS 王曉野 AIGC2026 直言:87% 企業喊 AI 落地、只有 10% 真正拿到生產價值,Harness 才是企業級 Agent 真門檻
2026 中國 AIGC 產業峰會上,亞馬遜雲科技產品技術部技術總監王曉野拋出一組刺眼對比:87% 的企業宣稱已大規模部署 AI,真正從中拿到生產價值的只有 10%。他的核心論點:Demo 不難,難的是在企業分散式環境讓幾千個 Agent 穩定跑起來,而這個工程問題的解答不在模型本身,在模型外圍的 Harness。
-
資本市場
美國 AI GDP 藏身統計盲區:Anthropic、UVA、加拿大央行估出 2500 億,品質調整增速高達 2600%
美國 AI 經濟的真實規模正被官方統計嚴重低估。Anthropic、維吉尼亞大學(UVA)與加拿大央行的經濟學家聯合估算,2025 年美國名目 AI GDP 約 2500 億美元,品質調整後的實質年增率卻高達 2600%。這個驚人數字幾乎完全不見於任何官方 GDP 統計。
-
資本市場
VAST Project Eden 押注狀態渲染解耦,三層架構正面挑戰 Genie 與 World Labs
VAST 完成近 2 億美元 A+ 及 A++ 輪融資,同步首度對外披露世界模型路線 Project Eden。融資規模是背景,關鍵是 VAST 在世界模型賽道押了一條差異化路線:把底層狀態推演與視覺渲染原生解耦,讓兩件事由專門子系統各自負責,而非全部壓進同一個模型。