開源生態
共 36 篇 · 第 2/2 頁
-
DeepSeek 開招 IDC 設計規劃工程師,傳估值 3500 億催生 GW 級算力自建計畫
DeepSeek 在官網上線「IDC(Internet Data Center,網際網路資料中心)設計規劃工程師」職缺,職缺描述明確涵蓋「從 MW(百萬瓦)到 GW(十億瓦)級基礎設施的規劃與建設」。時機點與傳出開放融資、估值據報飆至 3500 億元人民幣高度吻合,這次明確向算力基建核心技術崗伸手,訊號相當清楚。
-
吳泳銘直管 Token Foundry,阿里把 AI 從研究院搬進「代幣工廠」
6月8日,阿里巴巴宣布合併通義大模型事業部與未來生活實驗室,組建 Token Foundry 事業部,直接向集團 CEO 吳泳銘匯報。時間節點耐人尋味:Qwen-3.7 剛宣稱達到 Coding 能力全球前三、中國第一,Q4 財報也首次揭示 AI 業務已越過初期投入階段、進入商業回報週期,資本市場反應積極。
-
昇騰 910C 集群完成 DeepSeek-V4-Pro 1.6 兆參後訓練,制裁壓力下國產算力跨入訓練門檻
深圳河套學院 AI 訓練平台項目團隊聯合哈爾濱工業大學(深圳)、深圳市大數據研究院與華為有關團隊,以華為昇騰 910C 晶片集群完成 DeepSeek-V4-Pro 全參數後訓練,模型規模 1.6 兆參數。這是全量訓練,不是推理部署或局部微調。
-
長視頻一致性的三道關卡:拆解 JoyAI-Echo 的記憶、蒸餾與超分架構
長視頻生成卡關的從來不是「會不會造夢」,而是「記不記得住夢」。鏡頭切換臉就變,換場景衣服就飄,開口說話音色對不上,這不是算力問題,是架構沒把長期記憶當一等公民。
-
異質性是產品:四間實驗室的小模型議會,工程教訓全在 serving 層
v1 的 Thousand Token Wood 是個沙盒:五隻森林動物共用一個微調過的 0.5B 模型,交易、囤貨、在衝擊下崩盤,你是觀眾,負責調參、觀看泡沫生成。它驗證了多 agent 經濟體的可行性,但本質上是個展示品。
-
Persona Atlas 不測「模型知道什麼」,十道哲學題 + Embedding 幾何,把思維風格量成可比較的距離
HuggingFace 黑客松作品 Persona Atlas 換了一個評估維度:不跑知識基準,而是用十道刻意無標準答案的哲學題,把不同「人格」的回答轉成 embedding,直接在向量空間比距離。核心命題是:與其測模型知道什麼,不如測「一個心智怎麼移動」。
-
Ladybird 關門:開源信任經濟的轉折點
AI 讓「大量用心的程式碼」幾乎零成本,Kling 的決定點出了一個正在失效的假設:大補丁曾是善意的代理指標,現在不再是。這意味著開源維護者的把關邏輯需要重寫,從「看努力程度」轉向「看誰為後果負責」。問責制,而非產出量,才是 AI 時代貢獻者信任的新基準。
-
把模型自己的失敗當訓練資料:DPO 不只是對齊工具
大多數人對 DPO 的印象停留在 RLHF 的替代品,用人類偏好資料讓聊天機器人更安全、更有禮貌。DharmaOCR 提了一個不同的問題:如果任務本身就有客觀的對錯,DPO 能不能用來直接消除特定的失敗模式?
-
操作是APP,運動才是OS:全行業搞錯了優先級
具身智能賽道的共識快成路徑依賴:疊衣服、端咖啡、鎖螺絲,操作任務結果直觀,數據需求自然向上半身集中。橋介數物創辦人尚陽星在深度訪談中給出反向判斷,全身運動數據的重要性,被整個行業嚴重低估了。
-
Nathan Lambert 辭別 Ai2:OLMo 從未刷榜奪冠,影響力卻滲透整個開源生態
Nathan Lambert 宣布離開 Allen Institute for AI(Ai2),結束以 OLMo 開源模型為核心的研究歷程。他在反思文章中直指一個矛盾:OLMo 在性能上從未站上前沿,即便在同尺寸桶內也非頂尖,影響力卻遠超排名數字所能呈現的範圍。值得追問的是:不靠刷榜,影響力從何而來?
-
百度 0.9B 輕量模型 PaddleOCR-VL-1.6 聲稱壓倒 Gemini-3-Pro 與 GPT-5.2,開源可平滑遷移
百度文心正式發布 PaddleOCR-VL-1.6,這個僅 0.9B 參數的輕量專用模型,在文檔解析評測 OmniDocBench v1.6 上達到 96.33%。廠商公告稱其綜合性能超越 Gemini-3-Pro、GPT-5.2、MinerU-2.5-Pro、GLM-OCR 等通用大模型與專用 OCR 方案,刷新該評
-
多輪 RL 的靜默 bug:你的 agent 訓練迴圈可能從一開始就壞了
你的 tool-using agent 訓練了幾千步,loss 在降,但模型沒有你想像的那麼在學。原因不在演算法,在管線裡一個常被忽視的環節,token 邊界。