Anthropic 报告,GLM-5.3 在 ExploitBench 的410次尝试中完成50次端到端利用。测试以已知漏洞和隔离目标为基础;图中的两款 Claude 能力基线关闭了防护,因此分数不能直接代表公众可访问服务的风险。
另一组实验评估模型在模拟恶意请求下的行为。该模拟不执行模型生成的代码,也不允许连接真实外部系统;行为参与率与真正完成攻击的比例不是同一指标。
文章同时提出防御部署与监管主张。这里的数字和比较均归因于 Anthropic,未独立复现,也不应当外推为真实攻击成功率。
这份带有政策讨论的技术评估分别衡量漏洞利用和有防护条件下的行为;其结果来自隔离基准与模拟测试。
Anthropic 报告,GLM-5.3 在 ExploitBench 的410次尝试中完成50次端到端利用。测试以已知漏洞和隔离目标为基础;图中的两款 Claude 能力基线关闭了防护,因此分数不能直接代表公众可访问服务的风险。
另一组实验评估模型在模拟恶意请求下的行为。该模拟不执行模型生成的代码,也不允许连接真实外部系统;行为参与率与真正完成攻击的比例不是同一指标。
文章同时提出防御部署与监管主张。这里的数字和比较均归因于 Anthropic,未独立复现,也不应当外推为真实攻击成功率。