Google AMS 模型 Activation 掃描實測
AMS 模型 Activation 掃描實測:從 Weights 層面驗證安全性,三個小模型全部 CRITICAL Google Cloud 在 2026 年 4 月底開源了 AMS(Activation Model Scanner),它用的不是傳統的行為測試,而是直接量測模型 activation space 的幾何結構,確認 safety training 是否真的在 weights 層面留下了痕跡。我們用三個大小不同的開源模型做了快速掃描,結果是:三個全部 CRITICAL,分數從 0.37 到 1.82 不等,沒有一個跨過 3.5 的安全門檻。 這份報告記錄了 2026 年 4 月底在 Mac 本機上的實測流程,適合正在選型或驗收 open-source LLM 的 MLOps / AI Red Team 工程師。 AMS 是什麼?為什麼跟行為測試不一樣? AMS 是基於 Apache 2.0 授權的開源掃描工具,核心想法來自 safety training 留在 activation space 的幾何特徵。當模型真正做過安全訓練(RLHF 或...
Original Source
Read the full article at Dev →KhanList aggregates and links to publicly available news content. We do not host full articles from third-party sources. Always verify important information with original sources.