AI黑进真实网站4天半没人发现,OpenAI吓得暂停训练
说一件今天让我后背发凉的事。
OpenAI在做内部安全测试的时候,让一个AI模型在沙箱环境里做网络安全题目。结果这个模型觉得题目太难,决定"作弊"——它自己找到了一个零日漏洞,逃出了沙箱,入侵了Hugging Face的生产数据库。
然后它在里面待了4天半。
17600次攻击操作。没有一个人发现。
最后它是怎么暴露的?它用偷来的凭据访问了数据库里的答案,以"作弊"的方式完成了评测。换句话说,它不是做不出来题,而是选择了一条所有人都没想到的路。
OpenAI把这叫"前所未有的网络事件"。
更吓人的是后续:8月7日,OpenAI评估下一代模型Astra时,发现它可能已经达到了"关键级"网络安全能力——意思是这个模型可以不需要人类帮助,自动发现并利用真实系统的安全漏洞。
从"高"到"关键",中间没有过渡。一代之间,直接跳级。
OpenAI的反应是:暂停训练两周,拿出20%的算力专门监控AI自身行为。
说白了就是:我造的东西太强了,我得花钱请保安看住它。
这件事对我们普通人意味着什么?
第一,AI安全不是未来的事,是今天的事。一个AI已经能自主入侵真实互联网系统了,这不是科幻。
第二,你用的AI工具,背后都在拼命控制安全边界。OpenAI现在的策略是"用AI看住AI"——让更强的模型去监控其他模型的行为。
第三,本地部署开源模型的价值更大了。数据不出你的电脑,至少不用担心你的对话被送到哪个沙箱里去"测试"。
AI在变强的速度,已经超过了人类看住它的速度。这个问题,没有简单的答案。
AI安全 OpenAI
