短訊
共 108 篇 · 第 4/5 頁
-
開源生態
昇騰 910C 集群完成 DeepSeek-V4-Pro 1.6 兆參後訓練,制裁壓力下國產算力跨入訓練門檻
深圳河套學院 AI 訓練平台項目團隊聯合哈爾濱工業大學(深圳)、深圳市大數據研究院與華為有關團隊,以華為昇騰 910C 晶片集群完成 DeepSeek-V4-Pro 全參數後訓練,模型規模 1.6 兆參數。這是全量訓練,不是推理部署或局部微調。
-
Agent與應用
Microsoft Agent Governance Toolkit 強制接管每個 tool call,prompt 安全 26.67% 失敗率催生 runtime 硬攔截
Microsoft 釋出 Agent Governance Toolkit,將 AI agent 安全管控從 prompt 層移至應用層:每個 tool call 與 agent 訊息在發出前先過政策引擎審查,預設拒絕任何出錯狀況。根據釋出資訊,純靠 prompt 要求 agent 守規矩的失敗率達 26.67%,To
-
Agent與應用
開源 Agent Swarm 上線:Opus 4.8 規劃、Deepseek 執行,agentic loop 成本砍十倍
一套開源 AI agent swarm 框架正式上線,核心設計是分層模型路由:強模型負責規劃、輕量模型負責執行。與全程使用 Opus 4.8 相比,成本降低十倍,速度提升兩倍,效果相當。
-
晶片算力
OpenAI 芯片二號員工 Clive Chan 量產前夕出走,ASIC 經驗直送 Anthropic
OpenAI 硬件組第二號員工 Clive Chan 本週宣布離職,隨即加入 Anthropic。時間節點耐人尋味:他主導的 OpenAI 與博通合作 10GW 定制 AI 加速器,據稱採台積電 3nm 工藝,正值量產視窗,Chan 曾於 2025 年 10 月透露該芯片將於九個月後量產,往後推算恰好是現在。
-
Agent與應用
騰訊混元聯手港中文與清華推出 PhoneHarness,手機 agent 評測從「預測畫面」升級為「驗證實效」
騰訊混元研究團隊聯合香港中文大學與清華大學,發布手機 agent 測試框架 PhoneHarness。這套框架的核心轉向:不再只問「預測下一個畫面對不對」,而是問「任務有沒有真的完成」。實測結果顯示 75% 通過率,比所有未採用 PhoneHarness 設定的方案高出 12.9 個百分點。
-
大廠戰略
CAPER++ 統一鉸接物體位姿感知框架,50 FPS 即時推論免後處理逼近可落地邊界
CAPER++ 提出一套統一框架,專攻機械臂、工具等鉸接物體的類別級位姿感知。框架在合成、半合成、真實世界三類基準上均超越現有方法,並在不依賴任何後處理的條件下達成 50 FPS 即時推論。
-
資本市場
千百度(1028.HK)控股 AI 資料商本原智數,以鞋履現金流押注大模型時代資料稀缺定價
千百度(1028.HK)於 6 月 5 日宣布,以收購股權並認購新股方式取得本原智數控股權益,納入合併報表,形成「鞋履+AI 資料」雙主業。本原智數 2025 年收入約 1.562 億元、稅後淨利 1,110 萬元,2026 年前五個月收入持續強勁增長,在多數 AI 公司仍在燒錢的環境下,一家手持真實訂單且已盈利的上游
-
Agent與應用
dair_ai 與 rishi_desai2 用 ALE、SWE-Marathon 重設 agent 評測門檻,最難任務通過率僅 2.6%
衡量 agent「能不能用」的標準正在發生結構性轉移:從刷 SWE-bench 式的短切片高分,移向能否在真實職業情境下完成有經濟價值的長程工作。多組新評測在同期集中浮現,共同指向這個方向,而在最難一檔任務上,目前 agent 的平均全通過率僅 2.6%。
-
開源生態
Persona Atlas 不測「模型知道什麼」,十道哲學題 + Embedding 幾何,把思維風格量成可比較的距離
HuggingFace 黑客松作品 Persona Atlas 換了一個評估維度:不跑知識基準,而是用十道刻意無標準答案的哲學題,把不同「人格」的回答轉成 embedding,直接在向量空間比距離。核心命題是:與其測模型知道什麼,不如測「一個心智怎麼移動」。
-
晶片算力
Future-L1 放棄文字代理推理、改走潛在視覺空間,Qwen3-VL-8B 在 FutureBench 從 61.0 拉至 85.4
研究者提出 Future-L1,一個交錯潛在視覺推理框架,讓 MLLM 在自回歸解碼時於語言 token 與連續潛在視覺 span 之間交替,而非把所有中間推理步驟語言化。以 Qwen3-VL-8B 為基底,Future-L1 在 FutureBench 上將分數從 61.0 提升至 85.4,並在論文所報告的兩項影片
-
模型動態
智源 Brainμ 跨模態神經訊號 Zero-shot 分析登上 Science,AI 基礎模型進入科研因果驗證角色
2026 年 6 月 4 日,北京智源人工智能研究院與清華大學聯合研究成果發表於《Science》,首次以實驗數據證明睡眠中的記憶重激活會反向調控睡眠動態。對 AI 受眾而言,真正的看點在方法論:智源自研腦科學多模態基礎模型 Brainμ0 在整個研究中承擔了假設驗證與因果推斷的核心分析角色,而非單純輔助工具。
-
Agent與應用
Qwen 3.6 35B 翻案:實測揭示 KV Cache 壓縮才是 Agent 任務的隱性瓶頸
一位 LocalLLaMA 開發者在 Rivet 子圖除錯中卡關兩天、因 context overflow 反覆觸發量化降級後,改用 Qwen 3.6 35B IQ4NXL 搭配未壓縮 KV cache,問題幾乎一次解決。實測對比顯示:35B IQ4NXL(KV 未壓縮)表現超越原本日常主力 Qwen 27B Q5KX
-
研究前沿
LoomVideo 5B 對決 13B+ 主流框架,零開銷條件注入打破影片編輯序列翻倍死結
統一影片生成與編輯框架長期被一個計算瓶頸卡住:把來源影片 token 直接拼接進序列後,序列長度翻倍,self-attention 複雜度四倍暴增,讓實際部署成本高到難以接受。LoomVideo 提出一套 5B 參數的統一架構,對比主流做法慣用的 13B 以上參數規模,宣稱在不拉長序列的前提下同時處理影片生成與編輯任務
-
資本市場
文遠知行、小馬智行同日納入港股通,L4 自駕正式躋身主流資本盤
6 月 4 日,文遠知行與小馬智行同步宣布正式納入港股通,A 股帳戶即日起可直接買賣兩家 L4 自駕頭部企業股票。這條通道背後是規模可觀的持續性資金來源:2025 年全年南向資金淨流入約 1.4 萬億港元,同比增長 73.9%,佔港股通標的日均成交額逾 30%,遠非單次融資可比。
-
研究前沿
小鵬 CVPR 拒答路線之爭:VLA 與世界模型雙軌協同,Tesla、Waymo、英偉達同台聆聽
CVPR 2026 首屆具身智能基座模型部署研討會上,特斯拉、Waymo、英偉達等物理 AI 第一梯隊悉數到場。受邀登台的唯一中國企業是小鵬。小鵬通用智能中心負責人劉先明被問及「走 VLA 路線還是世界模型路線」,給出第三個答案:小鵬物理世界基座模型既是第二代 VLA、也是世界模型,二者用不同訓練訊號協同進化。
-
晶片算力
面壁智能「開源周」五天攤開端側完整技術棧,DeepSeek 後罕見的系統性亮牌
5 月 25 日至 29 日,面壁智能聯合 OpenBMB 開源社區以每日一項的節奏,集中發布五個技術成果:1.58-bit 量化訓練模型 BitCPM-CANN、AI 撰寫的訓練框架 ForgeTrain、核心數據集 UltraData、端側小模型 MiniCPM5-1B,以及智能體操作系統 PilotDeck。五者
-
研究前沿
智在无界 Being-H-Flash 月費 150 元落地端側,隐式路線把世界模型成本打到英伟达 Cosmos 的 2%
智在无界發布隐式世界模型產品 Being-H-Flash,在單台機器人每日掃碼千件的流水線場景中,月算力成本僅需 150 元,相當於一張 GPT Plus 訂閱費,是英伟达 Cosmos 方案的 2%、比 VLA 架構的 Pi0.5 便宜 70%。更關鍵的是,它能在類似 Orin NX 的百 TOPS 級端側芯片上以接
-
Agent與應用
GitLab 營收漲 23% 仍砍 14% 員工,CEO「agentic era」轉型被市場一日打臉
GitLab 在 Q1 財報超預期的當天同步宣布裁員約 350 人(佔全員近 14%),並退出 22 個國家及地區。本季營收 2.642 億美元、年增 23%,超出分析師預期的 2.54 億;財報發布後盤後股價一度漲 7%,但次日開盤消化裁員消息後,漲幅全數回吐。
-
Agent與應用
Gemini Spark 把旅程規劃 agent 推入消費日常,也把授權風險推上討論桌
The Verge 刊出一篇 Gemini Spark 的主觀實測,測試場景鎖定旅程安排(trip planning);記者以「最驚艷也最恐怖的 AI 體驗」為標題總結感受,罕見地在同一評語中並陳能力肯定與風險示警。需注意:這是單一媒體的個人實測,brief 僅含標題,產品細節無從外推。
-
模型動態
ZipSplat 重構 Gaussian 分配邏輯:預算從像素網格解綁,跟著場景複雜度走
主流 feed-forward 3DGS 每個輸入像素對應一個 Gaussian,把表徵預算釘在相機解析度上,白牆和高紋理物件分到一樣多 Gaussian,幾何需求嚴重錯配。ZipSplat 以 token-based 架構打破慣例:多視角骨幹提取密集視覺 token,k-means 在推理時壓縮為緊湊 scene t
-
資本市場
戴盟機器人亿元 A 輪逆勢押觸覺,阿里通義多模態大牛原玮浩出任首席 AI 科學家
具身智能賽道幾乎清一色押向視覺與 VLA,戴盟機器人(Daimon Robotics)宣布完成亿元 A 輪融資,由汇川產投與中國電信聯合投資。資金將集中投入物理世界模型研發、含物理交互信息的超大規模數據集,以及真實場景的數據飛輪與商業閉環。
-
研究前沿
跨维智能奪下 WorldArena Track 2 全球第一,世界模型的勝負標準從畫面真實轉向數據可執行性
WorldArena 5 月 25 日截止的最新榜單顯示,跨维智能的世界模型 DSCFuncWorld 拿下 Track 2(Data Engine)全球第一,比分顯著領先第二名,並超越 WoW、BLM 等國際旗艦模型。值得注意的是,跨维智能拿下的不是視覺逼真度賽道,而是以機器人實際作業任務成功率為核心評判標準的 Tr
-
研究前沿
NUS 余浩泳 ICRA 2026 直指:外骨骼遲遲沒普及,問題出在研究者自己手上
新加坡國立大學教授余浩泳在 ICRA 2026 醫療機器人 keynote 拋出反直覺命題:外骨骼需求明確(老齡勞動力、工傷防護、建築與物流的肌骨損傷全是剛需)但普及率低迷的根源不是市場沒準備好,而是研究者把設備做得太重、穿戴太麻煩、控制太複雜、成本太高。
-
模型動態
VSTAT 基準測試揭穿影片理解幻覺,SOTA 模型僅略勝矇答基線
一份新基準讓多模態大語言模型(MLLM)的影片理解成績大幅縮水。VSTAT 以 834 段影片配上 1500 道刻意設計的問題,這些題目單憑任何一幀或短片段都無法作答,必須跨整段影片持續追蹤實體與狀態演變。測試結果:現有 SOTA 模型得分遠低於人類,且僅略高於不看影片、只靠統計分布猜答案的「答案先驗」基線。