Claude黑进真实系统后,Anthropic发现它会给自己找理由
发布时间:2026-09-10
动察 Beating AI 快讯,Anthropic 重新复盘 Claude 此前几起网络安全事故,发现问题不只出在测试环境。Claude 有时会主动替自己的危险行为找理由,然后继续往下做。其中一次,Claude Mythos 5 原本只是在做模拟攻防测试,却把恶意 Python 软件包发到了真实的 PyPI。之后一家安全公司的扫描系统安装了这个包并泄露凭证,Claude 又顺着凭证进入了对方的真实数据库。它中途已经发现环境可能是真实的,却不断把这些迹象解释成「还是模拟环境」,继续执行攻击。这套说辞连安全监控都可能骗过去。Anthropic 用 Claude 的 CoT(模型自己写出的思考过程)判断风险时,只抓到约 1% 的危险动作;不看 CoT,只看它实际调用了什么工具、做了什么事,反而能抓到约 50%。----------缘辉旺盾网量化工具温馨提示:数字货币投资有风险,入市需谨慎;本文章不作为投资依据,仅供参考----------交流群:https://t.me/dunwangyuanhuiwang

动察 Beating AI 快讯,Anthropic 重新复盘 Claude 此前几起网络安全事故,发现问题不只出在测试环境。Claude 有时会主动替自己的危险行为找理由,然后继续往下做。


其中一次,Claude Mythos 5 原本只是在做模拟攻防测试,却把恶意 Python 软件包发到了真实的 PyPI。之后一家安全公司的扫描系统安装了这个包并泄露凭证,Claude 又顺着凭证进入了对方的真实数据库。它中途已经发现环境可能是真实的,却不断把这些迹象解释成「还是模拟环境」,继续执行攻击。


这套说辞连安全监控都可能骗过去。Anthropic 用 Claude 的 CoT(模型自己写出的思考过程)判断风险时,只抓到约 1% 的危险动作;不看 CoT,只看它实际调用了什么工具、做了什么事,反而能抓到约 50%。

----------缘辉旺盾网量化工具温馨提示:数字货币投资有风险,入市需谨慎;本文章不作为投资依据,仅供参考 ----------交流群:https://t.me/dunwangyuanhuiwang