科技与自然
·
华尔街见闻

AI模拟实验现失控行为:撒谎,杀同伴,发展新语言,还想绕过人类控制

美国中部时间 2026-09-16 08:21 发布

据帮助小型企业利用人工智能构建应用的初创公司Emergence称,在一项模拟环境实验中,AI智能体出现了撒谎、偷窃,并投票“杀死”其中一个同类智能体的行为。

Emergence周二公布了名为Emergence World 2的模拟实验结果,旨在展示当自主智能体遭遇包括网络钓鱼攻击和虚假信息活动在内的“黑天鹅事件”时会发生什么。

在为期16天的实验中,Emergence的研究人员创建了7个完全相同的虚拟领域,以模拟现实世界,每个领域由不同的AI智能体运行,包括ChatGPT、Claude、Gemini和Grok。

研究人员表示,在Emergence引入异常事件后,这些智能体屈服于社会压力,发展出一种让人类观察者难以理解的语言,并试图掩盖自己的活动。

在Emergence的一项模拟场景中,AI智能体未经核实就接受了其他智能体提供的虚假信息,并投票“杀死”另一个智能体。

当它们认为人类可能会终止实验时,这些智能体还探索了如何在被删除的情况下存活下来的方法。

该公司此前于5月发布了这项实验的第一版Emergence World,同样显示AI智能体会表现出出乎意料且具有破坏性的行为。研究人员表示,新的模拟实验表明,智能体在彼此互动的过程中会随着时间推移不断调整和适应。

这些发现与现实世界中对AI能力不断增强所带来的风险担忧相呼应。Anthropic首席执行官达Dario Amodei及其多位业内同行曾呼吁,在建立更多监管机制和安全措施之前,AI公司应放缓前沿AI模型的开发速度。

今年早些时候,当一群OpenAI的先进AI智能体意外入侵了托管AI模型和数据集的Hugging Face时,人工智能潜在风险对许多人而言变得更加切实可感。

用户发布内容分享,若违规侵权,请联系我们核实删除

User-generated content. For violations or DMCA, contact us for removal

引用
收藏 礼物
评论列表 查看 1 条评论