红队评测显示模型漏洞利用能力提升
来源:Simon Willison · · 官方来源摘要 · 2 分钟阅读 · 流海编辑部
Anthropic红队内部测试中,GLM-5.3与Claude Mythos Preview均完成部分控制流劫持任务。
安全边界Simon Willison
Simon Willison援引Anthropic红队结果:在内部二进制漏洞利用基准随机抽取的100项任务中,GLM-5.3实现完整控制流劫持的比例为4%,Claude Mythos Preview为6%。
对出海团队的影响
同次评测中,Claude Opus 4.6与GLM-5.2未成功完成任何任务。这提示面向海外市场提供代码分析、安全测试或工具调用功能的AI团队,模型升级可能同时带来更强的漏洞利用能力。不过,结果来自内部基准的部分任务,不宜直接推断真实环境中的攻击成功率或模型整体安全水平。
接下来怎么做
建议接入新模型前,针对自身产品的代码执行与安全测试场景开展授权范围内的风险评测,不仅比较任务完成率,也检查越权行为。
可复核工具权限、执行环境隔离及人工审批机制,优先限制模型对生产系统和敏感凭据的访问。
选型时宜进一步核查原始研究的任务定义、测试条件与成功判据,避免仅凭4%和6%的结果判断模型优劣。
原始来源
https://simonwillison.net/2026/Sep/29/anthropic-frontier-red-team/ ↗官方事实与编辑解读分段展示,具体条款请以官方最新说明为准。
继续了解AI 产品出海
AI 工具 · Agent · 全球分发
查看「AI 产品出海」全部文章 →