研究前沿
共 33 篇 · 第 2/2 頁
-
LoomVideo 5B 對決 13B+ 主流框架,零開銷條件注入打破影片編輯序列翻倍死結
統一影片生成與編輯框架長期被一個計算瓶頸卡住:把來源影片 token 直接拼接進序列後,序列長度翻倍,self-attention 複雜度四倍暴增,讓實際部署成本高到難以接受。LoomVideo 提出一套 5B 參數的統一架構,對比主流做法慣用的 13B 以上參數規模,宣稱在不拉長序列的前提下同時處理影片生成與編輯任務
-
小鵬 CVPR 拒答路線之爭:VLA 與世界模型雙軌協同,Tesla、Waymo、英偉達同台聆聽
CVPR 2026 首屆具身智能基座模型部署研討會上,特斯拉、Waymo、英偉達等物理 AI 第一梯隊悉數到場。受邀登台的唯一中國企業是小鵬。小鵬通用智能中心負責人劉先明被問及「走 VLA 路線還是世界模型路線」,給出第三個答案:小鵬物理世界基座模型既是第二代 VLA、也是世界模型,二者用不同訓練訊號協同進化。
-
智在无界 Being-H-Flash 月費 150 元落地端側,隐式路線把世界模型成本打到英伟达 Cosmos 的 2%
智在无界發布隐式世界模型產品 Being-H-Flash,在單台機器人每日掃碼千件的流水線場景中,月算力成本僅需 150 元,相當於一張 GPT Plus 訂閱費,是英伟达 Cosmos 方案的 2%、比 VLA 架構的 Pi0.5 便宜 70%。更關鍵的是,它能在類似 Orin NX 的百 TOPS 級端側芯片上以接
-
材科源圖將 AI 智能體推進光刻膠研發,下一站指向 EUV
蘇州材科源圖(MatSource)發布有機高分子應用智能體,首選技術壁壘最高的 ArF 光刻膠作為驗證場景,據稱已完成從樹脂設計、配方篩選到性能預測的全流程實測。核心架構整合了材料知識圖譜、多模態資料與領域機理模型,目標是將難以傳承的專家經驗轉為可複用的數位能力。下一步計畫延伸至 EUV 先進製程光刻膠,並橫向擴展至功
-
跨维智能奪下 WorldArena Track 2 全球第一,世界模型的勝負標準從畫面真實轉向數據可執行性
WorldArena 5 月 25 日截止的最新榜單顯示,跨维智能的世界模型 DSCFuncWorld 拿下 Track 2(Data Engine)全球第一,比分顯著領先第二名,並超越 WoW、BLM 等國際旗艦模型。值得注意的是,跨维智能拿下的不是視覺逼真度賽道,而是以機器人實際作業任務成功率為核心評判標準的 Tr
-
NUS 余浩泳 ICRA 2026 直指:外骨骼遲遲沒普及,問題出在研究者自己手上
新加坡國立大學教授余浩泳在 ICRA 2026 醫療機器人 keynote 拋出反直覺命題:外骨骼需求明確(老齡勞動力、工傷防護、建築與物流的肌骨損傷全是剛需)但普及率低迷的根源不是市場沒準備好,而是研究者把設備做得太重、穿戴太麻煩、控制太複雜、成本太高。
-
上海交大王賀升 ICRA 2026:從畫地圖到預測未來,動態 Gaussian SLAM 正打破靜態世界假設
2026 年 6 月 2 日,上海交通大學教授王賀升在奧地利維也納 ICRA 2026 上,系統性指出傳統 SLAM 的結構性局限:整套架構建立在「環境靜止、結構穩定」的假設之上,面對自動駕駛場景的車流行人、或手術機器人面前持續形變的人體組織,已逼近天花板。他的解法不是打補丁,而是把導航的底層邏輯從「建靜態地圖」推向「
-
LongLive-RAG 把 AR 長影片生成轉型成 RAG 問題,以非局部記憶對決滑動窗口漂移
自回歸(AR)影片擴散模型雖能生成任意長度的影片,卻有一個結構性死穴:滑動窗口注意力一旦累積外觀錯誤,後續幀只能在已劣化的軌跡上繼續生成,誤差與身分漂移會越滾越大,且無法回頭修正。LongLive-RAG 提出的解法是把問題定性重寫,長影片生成本質是個 RAG 問題,而非單純的上下文延伸。
-
xAI Ethan He:影片模型的智能源自 LLM,下一個 Sora 是影片 Agent
前 NVIDIA Cosmos 世界模型主導工程師 Ethan He 加入 xAI 後,率小型團隊在三個月內從零建出 Grok Imagine,並在 Latent Space podcast 拋出反直覺核心論點:影片模型的「智能」主要來自 LLM,不是來自看更多影片訓練資料。這個判斷直接改寫了影片生成的下一步路線圖。