觀點
共 127 篇 · 第 6/6 頁
-
把模型自己的失敗當訓練資料:DPO 不只是對齊工具
大多數人對 DPO 的印象停留在 RLHF 的替代品,用人類偏好資料讓聊天機器人更安全、更有禮貌。DharmaOCR 提了一個不同的問題:如果任務本身就有客觀的對錯,DPO 能不能用來直接消除特定的失敗模式?
-
操作是 APP,運動才是 OS:全行業搞錯了優先順序
具身智慧賽道的共識快成路徑依賴:疊衣服、端咖啡、鎖螺絲,操作任務結果直觀,資料需求自然向上半身集中。橋介數物創辦人尚陽星在深度訪談中給出反向判斷,全身運動資料的重要性,被整個行業嚴重低估了。
-
Token 不是問題,進不了 Production 才是
去年六月,OpenAI 執行長放話「廉價到幾乎免費的智慧」近在咫尺。一年後,現實是:有公司幾個月就燒完全年 token 預算,部分 AI 計畫悄悄喊停。「tokenmaxxing」成為業界最新的恐慌詞彙,有人開始懷疑 AI 的動能只是泡沫在撐著。
-
醫療缺口達千萬,Agentic AI 能否真正補上那道裂縫
全球醫療體系正面臨一場慢性崩潰。數十年的投資不足與招募困境,撞上老齡化人口帶來的需求爆炸,讓這個矛盾無所遁形。世界衛生組織(WHO)警告,醫療人力缺口到 2030 年將擴大至 1,100 萬人。這不是遠期預測,而是已在進行中的事實:照護資源碎片化、第一線醫護人員的職業倦怠持續攀升。
-
開源 Agentic Coding 的差距正在收斂,M3 的真正訊號不是跑分
MiniMax M3 最值得認真看的,不是 SWE-Bench Pro 的 59%,雖然這個數字超過 GPT-5.5 和 Gemini 3.1 Pro、接近 Opus 4.7 確實夠硬。真正的訊號是:它是國內第一個把長上下文、多模態、Coding 三件事同時做到的開源模型。
-
憑證不進 sandbox,就無法外洩:拆解 Anthropic 跨產品的沙箱架構
多數沙箱產品的通病是文件含糊,讓使用者根本無從判斷該給它多少信任。Anthropic 最近公開了一份少見的詳細說明,把 Claude.ai、Claude Code 和 Cowork 三個產品各自怎麼做隔離說清楚了。
-
Anthropic 的雙重翻盤:估值是煙火,Agent 編排才是結構變局
去年 12 月,Anthropic 的年化營收是 $9B。五個月後,這個數字跳到 $47B。同步完成的 $65B Series H 讓其估值達到 $965B post-money,投資人涵蓋 Altimeter、Dragoneer、Greenoaks、Sequoia,以及包含 Amazon 在內的主要雲端業者。