研究前沿
共 33 篇 · 第 1/2 頁
特教 AI 進軍四線城市:一家康復機構利潤增長 40% 背後的結構性缺口
大米和小米推出的 RICE AI 系統讓河南平頂山向日葵康復機構在 2026 年上半年利潤同比增長 40%,評估出方案時間從 2-3 天壓縮至 2-3 小時,效率提升超過 10 倍。
昨天 · 5 分鐘-
Claude 的「個性」沒有統一版本:模型與語言都在悄悄改變它
Anthropic 分析 309,815 段真實對話後發現,Sonnet 4.6、Opus 4.7、Opus 4.6 三個模型版本的溝通風格明顯不同:Sonnet 4.6 最暖且回應最短,Opus 4.7 最坦率謹慎,Opus 4.6 最傾向直入重點。
-
ByteDance 發表 Seedance 2.5 狂飆生成力:單次直出 30 秒影片,180 秒長片測試開跑
ByteDance 於 2026 年 6 月 23 日發布 Seedance 2.5,標準模式可單次生成 30 秒影片,並提供 180 秒長影片測試版,大幅超越前代 15 秒限制。
-
字節跳動 Seedance 2.5 傳最快下週登陸 CapCut,長片模式狂飆至 180 秒
testingcatalog 於 7 月 4 日轉述 @MarsForTech 透過 DevMode 流出的訊息:字節跳動旗下 Dreamina Seedance 2.5 影片生成模型,預計最快下週在 CapCut 及合作 App 上線,標準模式每段最長 30 秒,另附帶 beta 長片模式,可生成最長 180 秒的連
-
Agent 時代需要什麼樣的資料庫:從湖庫一體看 AI-native 架構的收斂
2026 年 7 月 1 日,OceanBase CTO 楊傳輝在量子位撰文指出,AI 正同時改變資料庫的三個維度:使用者從應用程式擴到自主 Agent、資料從結構化擴到多模態、工作負載從事務/分析擴到搜尋與上下文工程。
-
Planet Labs 把 AI 推論搬上軌道,Pelican-4 搭 Nvidia Jetson Orin 0.5 秒辨識十餘架飛機
Planet Labs 的 Pelican-4 衛星在 3 月 25 日從距地約 500 公里的低地球軌道,拍攝澳洲愛麗斯泉(Alice Springs)機場影像後,直接以機載 Nvidia Jetson Orin 模組執行推論,0.5 秒內辨識出十餘架飛機,原始影像下的準確率達 80%。Planet Labs 是少數
-
狀態與動作聯合訓練:Matrix-Game 3.5 的核心賭注
2026 年 6 月 13 日,昆侖萬維 Skywork 首席科學家劉揚在北京智源大會首次公開 Matrix-Game 3.5 技術細節,計畫同年 7 月正式發布並附帶完整技術報告。
-
還原像素背後的真實:LeCun 論文給世界模型一個可量化的成立條件
2026 年 6 月 14 日,alphasignal_x 轉述 Yann LeCun(AMI Labs 共同創辦人兼執行主席)新論文:LeJEPA 能從原始像素還原真實隱變數,實驗規模涵蓋 2D 到 1024 維空間
-
Oxford/Technion/AITHYRA/NVIDIA 提出 KV-CAT:訓練期遮罩 KV 槽,讓事後壓縮效率從根提升
2026 年 6 月 14 日,Oxford、Technion、AITHYRA 與 NVIDIA 的研究團隊公開論文,提出 KV-Compression Aware Training(KV-CAT),一套在持續預訓練(continued pretraining)階段就強迫 Transformer 學會「以稀疏記憶運作」
-
Agent 身分的基礎設施缺口:靜態授權對動態 Agent 為何行不通
2026 年 6 月 14 日,具身分安全背景的研究者公開指出:AI agent 的認證與授權標準仍在制定中,但各廠商技術實作已快速鋪開,標準確立前的搶先部署正在累積碎片化風險。
-
不改一個權重,讓舊模型多想幾步
2026 年 6 月 13 日,論文「Training-Free Looped Transformers via Numerical ODE Integration」提出免 fine-tune 方案,讓凍結的語言模型在推理期間多走幾輪計算。
-
FIFA × Adidas × Lenovo 在 2026 世界盃上線多套即時 AI 推論:10cm 越位警示直推裁判耳機、感應球每秒 500 次回報
2026 年世界盃於 6 月 11 日在墨西哥城開幕,FIFA 同步部署多套即時 AI 推論系統,貫穿裁判判決、轉播製作與戰術分析三個層面,且均為生產環境上線,不是賽前 demo。每場比賽的光學追蹤系統架設 16 支鏡頭,單場累積逾 1.5 億筆資料點;越位偵測結果以音訊訊號即時送進助理裁判耳機,觸發條件是攻方球員越過
-
避開硬體綁定算子:SwiftVR 的部署路線選擇
生成式影片修復要做到即時,模型品質往往不是最難的關卡。難的是把模型搬上消費級 GPU 時遇到的兩道牆:高解析度下注意力計算量隨空間大小平方成長,以及大型影片自動編碼器的記憶體峰值。現有 one-step diffusion(單步擴散)修復方案在這兩點上都卡得很痛。
-
清華、中山、NUS 把壓縮重做一遍:生成式先驗模型,地球觀測資料最高縮 10,000 倍不失科學價值
清華大學、中山大學與新加坡國立大學(NUS)研究人員提出一套生成式壓縮框架,以地球長期重複觀測歷史作為先驗,按需達成 100 至 10,000 倍資料縮減,同時保留科學分析所需的資訊量。核心轉變是:壓縮從存儲後處理,成為基礎模型的主動能力層。
-
JHU、MIT、Google 揭 ThoughtTrace:前沿 LLM 猜不透用戶意圖,個性化助理缺的是「內心獨白資料」
Johns Hopkins、MIT 與 Google Research 研究團隊推出 ThoughtTrace,首個將真實人機對話配對用戶自述想法的大規模資料集,同步記錄用戶「為何發出這個 prompt」以及「看到回覆後有何反應」。關鍵發現:即便是前沿 LLM 也難以從對話脈絡猜中這些想法;將其納入後,預測用戶後續行為
-
繞開整合地獄:Apple 用 vision LLM 重押 Siri AI 的技術路線
WWDC 2026 的 Siri AI 公告,最值得細看的不是功能清單,而是 Apple 選擇了哪條技術路,以及為什麼偏偏是現在。
-
RoPE 的位置增量不必固定為 +1,而這件事讓模型開口說話了
3/ 可解釋性的角度:這可以當作 attention map 之外的第二個探針。attention 告訴你模型「在看哪個 token」,位置增量告訴你模型「認為這些 token 有多遠」。兩者量的是不同維度,理論上能互補而非替代。
-
港中大聯手華為重構語音輸入表徵,TextPro-SLM 在 3B/7B 兩尺度達目前最低 modality gap
香港中文大學與華為研究人員提出 TextPro-SLM,把縮小語音-文字模態差距的主戰場從輸出端移到輸入端。他們設計統一語音編碼器,同步抽取文字 tokens 與韻律嵌入(prosody embeddings),讓語音輸入在進語言模型之前就更接近文字表徵。成果:在 3B 與 7B 兩個模型尺度上達到目前最低 modal
-
教原理還是示範行為?Anthropic SDF 的對齊實驗與自駕車驗證方法的交集
Anthropic 近期公開了一項訓練實驗的細節,結論有些反直覺:要讓大型語言模型在對齊上表現更好,示範「正確行為」的效果,遠不如教它「為什麼這樣做是對的」。這套做法被稱為 SDF,具體操作是把憲法文件與虛構故事混入預訓練的 next-token 預測任務,不靠強化學習(RL)塑形行為。結果顯示對齊偏差降低超過 3 倍
-
三星 MeKi:用「查詢記憶庫」取代「擴大參數」的 LLM 擴展新路線
三星研究提出 MeKi(Memory-based Expert Knowledge Injection),核心思路是給模型掛載一個可動態查詢的專家知識記憶庫,而非透過增加參數來內化更多知識。論文摘要聲稱在效率與準確度上優於標準 scaling 方法,尤其在推理與事實回憶等知識密集型任務上表現突出。這條「retrieve
-
理論說「吸引力驅動聚類」,真實模型說:不對
3/ 第一條崩:理論要求交互能量單調遞增,但在每個模型、每個 prompt、每種溫度下都出現下降。聚類是真實的,但背後不是理論描述的純吸引梯度流。這是普遍性的反例,不是邊緣案例。
-
幾何重建連霸、資料牆被捅破、遊戲成基座:讀懂 CVPR 2026 三條主線
CVPR 2026 在丹佛落幕,74 篇入圍、5 篇獲獎。略過花名冊,三條主線值得做研究和建產品的人記好。
-
Raschka 2026 上半年 LLM 精選論文清單出爐,重心悄悄位移
ML 研究者 Sebastian Raschka 釋出個人策展的 2026 年 1–5 月 LLM 論文清單,涵蓋架構設計、推理效率、KV cache、RL/RLVR 等十大類別。作者明確自承這是偏向個人工作需求的精選清單,非全年完整盤點。值得注意的是,相較 2025 年清單,今年在 agent harnesses、t
-
CBS 把擴散時間軸切成難度等價的段
均勻一網跑整條時間線是浪費。CBS 以 de Boor 原理將時間軸切成難度等價段,用 Dirichlet 能量與幾何度量估計複雜度,複雜處分更多容量。模型容量可沿時間軸調度,做擴散模型的研究者值得記下這個範式。