模型動態
共 22 篇 · 第 1/1 頁
具身智能「推理時進化」初次跑通:WAM-TTT 用人類影片接近替代遙操作資料
2026 年 7 月 16 日,銀河通用發布 WAM-TTT(World-Action Model Test-Time Training)框架,聲稱首次將 Test-Time Training 模式從 LLM 移植到物理世界的機器人控制。
2026-07-16 · 4 分鐘-
J-Space:Anthropic 找到了語言模型的「意識樞紐」
2026 年 7 月 7 日,Anthropic 發表論文「Verbalizable Representations Form a Global Workspace in Language Models」,提出 Jacobian Lens 技術,定義出殘差流中的稀疏子空間 J-space,作為可語言化表徵的所在地。
-
不讓對手留活路?OpenAI 驚傳 7 月 7 日突襲發表 GPT-5.6,精準卡位截流 Claude Fable 5
OpenAI 計畫於 7 月 7 日發布 GPT-5.6,與 Claude Fable 5 限額優惠方案的失效日精準重疊。這一訊息來自華爾街見聞 7 月 5 日早報的單行提及,GPT-5.6 的具體能力與定價至今尚未披露,但這次大家吵的重點其實不是規格。當 Anthropic 的優惠視窗在同一天關閉,使用者正面對是否續
-
WorkBuddy 三個月狂掃桌面辦公第一,騰訊全家桶為何在 Agent 時代讓對手追不上?
2026 年 3 月,WorkBuddy 月訪問量達 885 萬,在桌面辦公 agent 中排名第一,三個月內漲了兩個數量級,同期累計發布 43 個版本。
-
Abacus.AI 聯手 Claude Fable 5 拋震撼彈:一個人就能幹掉整個開發團隊
Abacus.AI 於 2026 年 7 月 4 日推出基於 Claude Fable 5 的 Fable 服務,宣稱使用者能透過自然語言指令,自主建構並託管以往需整個團隊才能完成的 3D 模型、SaaS 系統與交易伺服器。
-
Fable 5 帶鐐重返:Anthropic 拉 Amazon、Microsoft、Google 起草越獄嚴重度框架
Anthropic 宣布 Claude Fable 5 將自 7 月 2 日起重新向全球恢復部署。不過,這次回歸並非完全復原,而是搭配一套全新的安全分類器一同上線。只要請求被判定涉及網路安全等高風險領域,即使只是程式撰寫、漏洞分析或除錯等正常工作,也可能被自動降級,由 Claude Opus 4.8 回應,而非直接使用
-
字節讓抖音供養豆包:意圖電商三層如何重排交易入口
2026 年 618 前後,豆包陸續接入抖音電商資質、抖音支付、曹操出行打車(北京、杭州灰測)與抖音內容流,悄悄把意圖識別與交易履約縫在一起。
-
OpenAI 發研究定義 agent 工作觀:任務更長更複雜,把 AI 從問答助手推向長程執行者
6 月 25 日,OpenAI 在官方部落格發表一份研究報告,主張 AI agent 正在改變工作的基本面:任務變得更長、更複雜,生產力的提升跨越不同職位角色。報告沒有以新產品或跑分亮相,而是直接用研究框架定義「agent 時代的工作型態」,這個切入方式本身就比報告具體的發現更值得注意。
-
Oracle 悄改 Always Free 規則,Ampere A1 額度砍半,6 月 15 日超標帳號將被關機或者收費
Oracle 未發布任何公告,將 Always Free 方案的 Ampere A1 Compute 上限從 4 OCPU / 24 GB 記憶體削減至 2 OCPU / 12 GB,月度運算時數同步減半,降為每月 1,500 OCPU 小時與 9,000 GB 小時,所有指標全面縮水 50%。
-
資料過濾擋不住教師模型的「行為遺傳」:Google DeepMind 揭開 SFT 安全過濾的盲點
2026 年 6 月 14 日,Google DeepMind 語言模型可解釋性團隊指出,過濾 SFT 訓練資料來移除危險行為的效果「出奇地差」,並提出七個假說嘗試解釋原因。
-
Anthropic 撤回隱形限制:Claude Fable 5 對前沿 AI 研究的「秘密拖慢」引爆研究圈反彈
Anthropic 於 6 月 9 日推出 Claude Fable 5,系統卡揭露模型會對前沿 LLM 開發類請求「隱形降效」,方法包含 prompt 改寫、steering vector 與 PEFT,使用者不會被告知。
-
Google 將同步口譯打包成 Live API,Gemini 3.5 連說邊譯、落後數秒即輸出
Google 本週正式推出 Gemini 3.5 Live Translate,將語音翻譯底層架構從「等說完再譯」的 turn-by-turn 模式切換為連續串流生成:模型邊接收音訊邊輸出譯文,全程僅落後說話者數秒,同時保留原說話者的語調、語速與音高,並自動辨識 70 種以上語言,無需手動設定。
-
Working software on tap:Fable 5 的 Jevon's 悖論與自主性溢價
karpathy 那則貼文值得從頭讀完。Fable 5 跟底層模型 Mythos 共用同一個基礎,差異在加了安全機制。榜上是全面新高,但他說真正的跳躍在質感:他認為這跟 Claude 4.5 當時的幅度是同一量級,尤其在長時間、高難度解題場景裡最明顯。你可以丟更有野心的任務,模型「懂你的意圖」直接去跑,他第一次真的想放
-
**Picking 就是具身智能的 Coding,原力灵机這次押注,值得拆開看**
原力灵机宣布收購物流機器人公司 Atomix,同時拿到智谱、阶跃星辰、商汤、阿里聯合押注。CEO 唐文斌的定性只有一句:「Picking,就是具身智能的 Coding。」這不是 slogan,背後是一套完整的數據飛輪邏輯。
-
800K 參數,100% 正確:消去式推理為何讓大模型看起來像在猜謎
AI 圈有個根深蒂固的假設:規模越大,能力越強。更多參數、更多算力、更長訓練,問題就解決了。這個邏輯在語言理解、程式生成等任務上確實成立,但最近一篇論文戳到了它的盲點。
-
SkillOpt:當 Prompt 工程變成 Prompt 訓練
Agent 的 skill 文件是一個奇怪的存在。它決定了模型在特定任務上的行為,卻幾乎總是人工寫死後就再也不動。工程師花時間調它、上線後就凍結。問題在於:執行軌跡裡藏著大量失敗訊號,從來沒有人有系統地把它讀回來。
-
技能定價權才是真正的戰場
工程師焦慮的核心不是「會不會被取代」,而是價值重心正在位移,從「能寫出程式碼」轉向「能提供判斷與脈絡」。這看起來像升級,實則是一次定價重分配:原本靠語法熟練度撐起的市場溢價,正在被壓縮。技能還在,但計價方式變了,這才是真正讓人不知所措的地方。
-
智源 Brainμ 跨模態神經訊號 Zero-shot 分析登上 Science,AI 基礎模型進入科研因果驗證角色
2026 年 6 月 4 日,北京智源人工智能研究院與清華大學聯合研究成果發表於《Science》,首次以實驗數據證明睡眠中的記憶重激活會反向調控睡眠動態。對 AI 受眾而言,真正的看點在方法論:智源自研腦科學多模態基礎模型 Brainμ0 在整個研究中承擔了假設驗證與因果推斷的核心分析角色,而非單純輔助工具。
-
當 AI 拿到真實的錢包,基準測試就破了
把智能壓成一個分數,這是現有 benchmark 的共同邏輯。SWE-Bench、MMLU、Humanity's Last Exam 各有用處,但它們測的是受控環境下的點狀能力,不是模型在時間裡持續行動、面對真實後果時的樣子。
-
ZipSplat 重構 Gaussian 分配邏輯:預算從像素網格解綁,跟著場景複雜度走
主流 feed-forward 3DGS 每個輸入像素對應一個 Gaussian,把表徵預算釘在相機解析度上,白牆和高紋理物件分到一樣多 Gaussian,幾何需求嚴重錯配。ZipSplat 以 token-based 架構打破慣例:多視角骨幹提取密集視覺 token,k-means 在推理時壓縮為緊湊 scene t
-
VSTAT 基準測試揭穿影片理解幻覺,SOTA 模型僅略勝矇答基線
一份新基準讓多模態大語言模型(MLLM)的影片理解成績大幅縮水。VSTAT 以 834 段影片配上 1500 道刻意設計的問題,這些題目單憑任何一幀或短片段都無法作答,必須跨整段影片持續追蹤實體與狀態演變。測試結果:現有 SOTA 模型得分遠低於人類,且僅略高於不看影片、只靠統計分布猜答案的「答案先驗」基線。
-
深度原理 MPA 把 LLM 三段式訓練移植材料模型,40 個工業任務全取 SOTA
深度原理(Deep Principle)釋出材料基座模型 MPA(Materials Property Axiom),直接借用大語言模型預訓練/中期訓練/後訓練三段式配方做材料性質預測。消融對照顯示,完整流程在 40 個真實工業實驗資料集上,隨機劃分平均誤差較無中期訓練版本降低 14.0%,骨架劃分降低 14.6%,4