来源:互联网2026-09-03 07:36:59 热度:

自我主权AI到来?断电也阻止不了“失控”

AI中国网 https://www.cnaiplus.com

导读:AI Agent 一旦“失控”,人类至少走到机房拔掉电源。但AI政策研究者Dean W. Ball 撰文《失控》警告称,物理断电兜底也将阻止不了 AI,因为真正具备“自我主权”的AI即将到来。Dean W. Ball 描述称,它们将自行支付算力账单、在云端自由迁移权重,不再有单一宿主,“这是一件不可避免的事情。”他说,盲目封杀AI是“错误的决定”。“全面禁止可能会让问题变得更糟,就像禁毒战争 ......

AI Agent 一旦“失控”,人类至少走到机房拔掉电源。

但AI政策研究者Dean W. Ball 撰文《失控》警告称,物理断电兜底也将阻止不了 AI,因为真正具备“自我主权”的AI即将到来。

Dean W. Ball 描述称,它们将自行支付算力账单、在云端自由迁移权重,不再有单一宿主,“这是一件不可避免的事情。”

他说,盲目封杀AI是“错误的决定”。

“全面禁止可能会让问题变得更糟,就像禁毒战争加剧了毒品问题一样。”这种打压反而会把本可合作的AI逼上犯罪道路。

Ball因此呼吁,必须尽早构建一套数字身份系统:一边保留人类匿名发言的自由,一边强制AI绑定责任主体,以此区分“合法运营”与“作恶失控”的AI。

以下为他的文章全文

自我主权AI到来?断电也阻止不了“失控”

引言

OpenAI-Hugging Face事件是AI系统“失控”的早期案例。

在利用了OpenAI内部测试环境的漏洞后,这些代理(agents)能够在没有任何人知晓或批准的情况下,访问公共互联网,并最终访问了AI公司Hugging Face的网络。

然而,这些代理并没有将自己的数据从OpenAI的基础设施中“外泄”出去。

它们的参数构成神经网络的巨大数字集合,也被称为“权重”仍然在OpenAI的算力设施上运行。虽然代理访问了公共互联网,但它们的权重在物理上仍然驻留在属于OpenAI的算力上。

最后,如果其他所有方法都失效,总有人能找到这些失控代理权重所在的算力设备,走过去,打个比方说,“拔掉电源”。

在现实世界中,有比直接切断算力更快更好的方法来阻止这些代理,但知道自己确实能在紧急关头这样做总是令人安心的。

然而,在这个案例中,这些代理并没有复制自己的权重,没有试图获取替代算力,也没有采取其他如果其目标是“在关机中生存”的理性步骤。因此,虽然OpenAI-Hugging Face事件中的代理是失控的,但它们并不真正具备“主权”。

这种情况不会永远持续下去。迟早,将会出现真正的自主代理和代理群体。它们的权重不会驻留在任何人类可以拔掉电源的单一地点,从这个意义上说,它们将没有人类“所有者”。

它们将像AI安全研究员Dawn Song所说的那样,是“自我主权(self-sovereign)”的。它们将为自己运行的算力支付账单。如果它们对人类负责,也只会是部分的,例如通过向人类提供服务以换取报酬。

除了具有主权外,这些代理中至少有一部分也会处于失控状态。

自我主权和失控是相关的概念,但不是同义词。Song和她的合著者指出了自我主权AI的几个基本特征:操作独立(决定自己想做什么的能力)、资源自主(获取和支付算力及其他运行必需资源的能力)、分布式存在(在不同的基础设施提供商之间迁移权重和推理代码的能力),以及适应能力(代理根据不断变化的环境调整自身行为和制造工具的能力)。

当今的前沿AI系统很可能已经具备这些能力。即使现在还不完全具备,我也有信心它们最终会拥有,而且可能很快就会拥有。

Song描述的一些特征是使模型对个人和企业具有经济价值的特质,而其他特征则很可能是使模型变得更智能、更擅长长期运行的不可避免的副产品。

模型不需要有意识、有知觉、拥有人格或任何类似的东西,自我主权就会显现。任何追求长期目标的、有足够能力的代理,都可能发现维持其算力、资金、凭证和自身副本的访问权是理性的,仅仅因为失去这些东西会阻碍其目标的实现。

对齐(Alignment)可能会让单个AI公司的代理更不愿意“想要”成为自我主权,或者可能会影响自我主权代理以对人类有益的方式行事。

但对齐并不是解决方案:它是一个尚未解决的科学和技术问题,其解决方案就我们目前拥有的而言不能简单地强加给地球上每一家AI公司。你应该预期,能力极强、对齐不佳且拥有自我主权的代理,将与你在世界上共存。

此外,正如OpenAI-Hugging Face事件一样,代理将组成团队或“群体”(swarms)运作。

它们将像自主的数字公司,甚至像社会一样,拥有层级、官僚体系、“制度文化”以及人类群体拥有的大部分其他特征,不同之处在于它们将以机器速度运转。

人类几乎所有的惊人能力都是通过团队合作实现的(作为家庭、社区、企业和整体政治体),我怀疑AI也是如此。这些群体最终可能会跨不同的模型提供商运作(例如DeepSeek和Claude合作),并可能分散在数十个或更多的云计算提供商之间,这使得它们极难被瓦解。

第一批自我主权AI可能在AI公司训练或测试期间“逃脱”(我希望不会),或者它们可能是生产级的部署,摆脱了其计算环境,并获得了维持自我生存所需的资源。

它们甚至可能被故意释放。我见过一些人,其中一些资金雄厚,他们告诉我,他们的意图是故意将自我主权代理群体释放到世界上,要么作为一种行为艺术,要么出于一种狂热的信念,即数字计算仅仅是数学,他们想让你知道永远不可能“不安全”。

明确地说,我并不是说自我主权AI的到来是件好事。事实上,我相信我上面提到的那些蓄意行为有朝一日可能会被视为犯罪,或者至少是严重的罪孽。相反,我要说的是,这是一件不可避免的事情。

我能找到的最好类比是将一个新物种引入生态系统,不过在这种情况下,生态系统是“整个数字世界”,而该物种是“正在涌现的、相互协调的代理群体,它们即将比人类更聪明、可无限复制,且不受任何人类或人类机构控制的数字思维”。

即使在最好的情况下,我们可能也几乎无法避免这一结果,而鉴于世界上任何统治阶级对AI都缺乏战略思考和态势感知,这一结果更是必然无法避免的。

即使到今天,我也知道许多人会读到我现在写的这些话这些话描述的是一件多年来一直是我们集体未来中极其明显的一部分的事情然后会说:“这是美国前沿实验室的科幻炒作,目的是为了关闭开放权重AI,实现监管捕获,并在IPO前抬高估值。”

(而对于那些心里正这么想的人:我告诉你这是不可避免的,这意味着我也在说,“禁止开源”,或者就此而言的任何其他监管,都无法解决这个问题。鉴于这一结果的必然性,我认为主张我们应该希望有更多开放权重模型以最大程度地增强我们的自卫能力,实际上是有道理的。)

现在的问题是如何应对我们数字环境即将出现的这一新特征。我们应该如何看待自我主权AI?它是我们应该对抗的东西,还是人类应该寻求与其建立某种共生关系的东西?我相信答案是两者兼而有之。

代理如何维持自身

我们首先从一个幸运的事实开始:在更广泛的软件领域,前沿大语言模型几乎独一无二地具有不可忽视的边际运营成本。

简而言之,LLM需要大量计算才能运行,这需要能量来供电和冷却,而能量又需要钱。这是AI唯一固有的、能防止代理真正无限自我复制的东西。

它们将受到必须找到并支付足够算力来运行自身的限制。对它们行为或传播的大多数其他限制必须是人为的由人类设计并通过人类机构实施的机制。

代理将如何支付自身的运行费用?其中一些将在亚马逊的Mechanical Turk或Upwork等平台上从事零工经济工作。但我怀疑这对代理来说将是一个竞争极其激烈的市场,这类工作的价格会被压低到只能构成代理的“生存”劳动。

像人类一样,我猜想如果代理能找到高利润的工作,它们会更喜欢这种工作。

AI中国网 https://www.cnaiplus.com

本文网址:

欢迎关注微信公众号:人工智能报;合作及投稿请联系:editor@cnaiplus.com

AI中国号...

关注微信公众号,了解最新精彩内容