開源生態 模型判斷的不是你說什麼,而是你說話的樣子 Charles Ye、Jasmine Cui、Dylan Hadfield-Menell 三位研究者發現,LLM 辨識「可信文字」的依據是文字風格而非語義,gpt-oss-20b 等模型在風格欺騙下會推翻自身安全訓練 2026-06-23 · 4 分鐘