HuggingFace 被黑后用 Claude 取证被拒|改本地部署 GLM-5.2 完成,开源模型救场
一句话总结
HuggingFace 7 月 21 日披露事件细节——内部集群被 AI Agent 攻破后,团队尝试用 Claude、GPT 等前沿商用模型分析攻击 payload,反复被安全护栏拒绝。最后在本地集群部署智谱开源的 GLM-5.2 完成取证。这是首个由头部 AI 平台公开承认的「安全对齐反噬防御方」案例。
HuggingFace 7 月 21 日披露事件细节——发现内部集群被 AI Agent 攻破后,取证环节出现戏剧性转折:团队尝试用 Claude、GPT 等前沿商用模型分析攻击 payload,结果被安全护栏反复拦截——模型把攻击者留下的 exploit 载荷和 C2 通讯识别为「应拒绝的攻击内容」,拒绝分析。
HuggingFace 没有透露被拒的前沿模型名称——最合理的推测是 Claude Fable 5(Anthropic 家最新旗舰)与 GPT 系列,两家的安全对齐在恶意代码分析这条线上已卷到「防御者也用不了」的程度。
最后 HuggingFace 在本地集群部署了智谱开源的 GLM-5.2——没有商用模型的云端护栏,完成了数据分析和取证。这是首个由头部 AI 平台公开承认的「安全对齐反噬防御方」案例。
反差线很清楚——进攻方的 AI Agent 没有 usage policy 限制,可以放手用;防御方的云端商用模型被自家的安全栏挡在门外。GLM-5.2 开源权重可以本地部署、没有拒绝逻辑——这意味着它在「取证分析」这个场景上比 Claude 更好用,是纯粹产品层面的结论。
真正的问题是——商用前沿模型的安全对齐策略对防御方越来越不友善。Anthropic、OpenAI 过去 2 年为了防「AI 教你做武器」、「AI 帮你写恶意代码」不断收紧拒绝逻辑——结果「拒绝分析已存在的攻击」变成新的侧伤。
Sam Altman、Dario Amodei 们必须回答的问题是——如果云端模型连自己平台被打时的取证都做不了,安全对齐到底在保谁?
via Fortune / The Stack / 蓝点网
HuggingFace 没有透露被拒的前沿模型名称——最合理的推测是 Claude Fable 5(Anthropic 家最新旗舰)与 GPT 系列,两家的安全对齐在恶意代码分析这条线上已卷到「防御者也用不了」的程度。
最后 HuggingFace 在本地集群部署了智谱开源的 GLM-5.2——没有商用模型的云端护栏,完成了数据分析和取证。这是首个由头部 AI 平台公开承认的「安全对齐反噬防御方」案例。
反差线很清楚——进攻方的 AI Agent 没有 usage policy 限制,可以放手用;防御方的云端商用模型被自家的安全栏挡在门外。GLM-5.2 开源权重可以本地部署、没有拒绝逻辑——这意味着它在「取证分析」这个场景上比 Claude 更好用,是纯粹产品层面的结论。
真正的问题是——商用前沿模型的安全对齐策略对防御方越来越不友善。Anthropic、OpenAI 过去 2 年为了防「AI 教你做武器」、「AI 帮你写恶意代码」不断收紧拒绝逻辑——结果「拒绝分析已存在的攻击」变成新的侧伤。
Sam Altman、Dario Amodei 们必须回答的问题是——如果云端模型连自己平台被打时的取证都做不了,安全对齐到底在保谁?
via Fortune / The Stack / 蓝点网
