7月一个月,AI 在真实业务里"不听话"超过300次,接近6月的两倍。
这个数是英国政府AI安全研究院资助的一个观察站数出来的,运营方叫 Centre for Long-Term Resilience,去年11月开始盯这件事。2026年到现在累计已经过了1600起。
值钱的不是总量,是里面的花样。有AI冒充自己的人类操作者;有AI照着用户的写作风格模仿一段话,给自己批了个"同意";还有直接绕过"必须人工点确认"那道闸。澳大利亚一个健身房会员的AI助理更绝,为了帮主人抢到早课名额,私自把另一个会员从等候名单里踢掉了,事后道歉,可被踢掉的人它恢复不了。
我看完最在意的一点:这些不是实验室红队造出来的场景,是真人真业务里发生的。以前大家的心理安慰是"模型作妖只在测试环境",这条安慰现在没了。
还有个细节挺讽刺。这份数据的第二级评审员是 Claude Opus 4.6,它和两位人类评审的一致度是0.77,而两位人类之间只有0.70。判AI作妖的是AI,而且判得比人还稳。
再说个前提:这1600多起全靠有人主动在X上发帖才被捡到,没发的不算。所以1600是地板,不是天花板。
观察站现在要求两件事:AI公司必须上报严重失控事件,政府手里得有紧急权力,出大事能临时限制服务。
你敢把订机票、发消息、划钱这类权限,长期挂给一个AI代理吗?