模型動態 資料過濾擋不住教師模型的「行為遺傳」:Google DeepMind 揭開 SFT 安全過濾的盲點 2026 年 6 月 14 日,Google DeepMind 語言模型可解釋性團隊指出,過濾 SFT 訓練資料來移除危險行為的效果「出奇地差」,並提出七個假說嘗試解釋原因。 2026-06-15 · 4 分鐘