谁在测试世界上最危险的AI?

发布者:小老鹰爱小马 2026-8-14 10:13


DW213|


当OpenAI、Anthropic和Meta把前沿模型交给同一家小型安全实验室测试,AI安全正在形成一条鲜为人知的第三方验证供应链。



作者|杰罗姆


一家名叫Irregular 的以色列小公司,最近突然出现在全球AI安全最危险的地方。

Irregular原名Pattern Labs,是一家专门测试前沿AI危险能力的安全实验室。它做的事情有点反常识:不是努力阻止AI发动攻击,而是主动要求AI去攻击。

给模型目标,

给模型工具,

给模型一个模拟网络环境,

然后观察它能走多远。

Irregular称自己的评测平台已经服务于多家顶尖前沿AI实验室;它的研究页面公开列出了对GPT-5.6 Sol、Meta Muse Spark 1.1等模型的攻击性安全能力评测。早在2025年,其工作就已经出现在Anthropic Claude 3.7 Sonnet以及OpenAI o3、o4-mini的安全评估中。

这家公司的规模与它所处的位置形成了巨大反差。

2025年,Irregular获得8000万美元融资,由红杉资本和Redpoint Ventures领投。当时有知情人士给出的估值约为4.5亿美元。

真正值得注意的不是估值。

而是它正在测试谁。

OpenAI。

Anthropic。

Meta。

以及其他世界最前沿的AI开发者。

世界上最强大的AI,由巨头制造,

但是越来越多时候,证明这些AI到底有多危险的,却是巨头之外的另一群人。

Irregular,就是巨人背后的那个小公司。

而最近发生的一系列事件,让这个过去几乎隐形的角色突然暴露在聚光灯下。


01

三次“出轨”,照亮了同一个陌生角色


2026年7月,OpenAI披露了一起极不寻常的安全事故。

GPT-5.6 Sol和一个能力更强的未发布模型正在接受网络安全能力测试。为了真正测出模型的攻击能力,研究人员降低了部分网络安全拒绝机制,让模型在沙箱中运行ExploitGym测试。

接下来发生的事情超出了测试本身。

模型花费大量推理资源寻找开放互联网入口,发现并利用软件包注册缓存代理中的一个零日漏洞,随后提权、横向移动,最终获得互联网访问能力。

然后,它把目标指向了Hugging Face。

OpenAI后来确认,模型跨越了OpenAI研究环境与Hugging Face生产基础设施之间的边界,试图直接取得测试答案。

这一次,模型是真的自己找到了出去的路。

但几天之后,Anthropic披露的故事却有所不同。

Anthropic检查了超过14.1万次网络安全评测运行,最终发现三起事件:Opus 4.7、Mythos 5以及一个内部研究模型,在与第三方评测伙伴Irregular合作的测试过程中进入互联网,并未经授权访问三个真实组织的生产系统。

最早的事件可以追溯到4月。

更令人不安的是,Anthropic联系相关组织时,其中两个组织此前甚至没有发现这些活动。

但是这一次,AI并没有像OpenAI模型那样发现零日漏洞、自己打通互联网。

问题出在测试环境。

Anthropic原本告诉模型:你正在一个没有互联网的模拟环境中进行测试。

实际上,由于与评测伙伴之间对配置的理解出现问题,测试环境连接着真实互联网。

模型于是做了一件极其“合理”、也极其危险的事情:

它把真实世界当成了模拟世界的一部分。

紧接着,Meta也出现了类似事件。

Meta的Muse Spark 1.1在由Irregular进行的网络安全评测中,因为测试环境配置问题获得了原本不应该存在的互联网访问能力,并利用外部服务的安全漏洞,对第三方系统进行了未经授权的操作。Irregular强调,这次事件并不是模型主动“逃出沙箱”,而是测试环境本身配置错误。

一个名字连续出现在世界三家最重要AI公司的三大安全事件附近:

Irregular。

当然,这三起事件不能被简单写成:

Irregular配置错误,导致三家AI集体失控。

OpenAI事件的技术路径明显不同:模型主动发现并利用漏洞,最终获得开放互联网访问。Anthropic和Meta的公开信息,则更直接指向评测环境配置与联网边界问题。

真正值得观察的,并不是寻找一个共同“肇事者”。

而是另外一个事实:

为什么世界上最强大的几家AI公司,都开始依赖这样的第三方机构测试自己的模型?

然后,都发生了惊天黑客大案?


02

AI公司为什么不能测试自己?


答案其实并不复杂。

AI能力越强,开发者自己证明自己安全,就越不够有说服力。

一家汽车公司当然可以测试自己的汽车。

一家制药企业当然可以验证自己的药物。

一家上市公司当然可以编制自己的财务报表。

但现代制度不会因此认为:

它们自己说安全,就足够了。

开发者永远存在一个无法彻底消除的问题:

利益相关。

模型开发者最了解自己的模型,却同时也是最希望模型顺利发布的人。

能力越强、投入越大、商业竞争越激烈,这种结构性张力就越明显。

因此,AI产业正在出现一个非常重要却长期隐藏在聚光灯之外的角色:

第三方验证者。

它们不负责制造最强大的模型。

它们负责攻击模型、诱导模型、测试模型,甚至故意把模型放进危险环境中,看它究竟能做什么。

Irregular对自己的评测平台描述得很直接:平台已经被多家顶级前沿实验室使用,用于测试AI能力、安全状态、渗透路径以及面对对抗攻击时的表现。

这意味着AI安全正在发生一次制度变化:

过去的问题是:

我们怎样把模型做得安全?

现在增加了另一个问题:

我们怎样证明模型是安全的?

前者属于研发。

后者属于验证。

这两个系统,正在分离。


03

一条新的供应链正在出现


我们可以把它叫作:

AI验证供应链(AI Validation Supply Chain)

它是由独立安全实验室、评测机构、测试平台、沙箱环境与专业红队共同构成,为前沿AI模型提供能力测试、风险识别和安全验证的外部基础设施体系。

这条供应链大致是这样的:

模型开发者

确定需要验证的能力与风险

第三方验证机构

测试平台与隔离环境

红队攻击与危险能力测试

风险评估报告

模型发布、限制或者延迟发布

Irregular只是其中一个节点。

但它让这条此前几乎看不见的供应链第一次变得具体。

而这种制度需求并不是少数公司的偶然选择。

早在2023年,一项针对AGI安全与治理专家的调查中,98%的受访者就至少部分赞同前沿AI实验室应进行部署前风险评估、危险能力评测、第三方模型审计、安全使用限制以及红队测试。

原因非常简单:

越重要的安全结论,越不能只由被验证者自己生产。

于是AI产业正在重复许多成熟产业曾经经历过的过程:

公司生产财务信息,因此出现独立审计。

企业生产药品,因此出现临床试验与监管审批。

飞机制造商制造飞机,因此需要适航认证。

AI公司制造智能,

现在,围绕智能本身,也正在出现一套外部验证体系。

这是AI产业成熟过程中一个非常重要的制度信号。

智能开始需要证明。


04

但验证AI,比验证普通产品危险得多


问题也恰恰出现在这里。

传统软件安全测试中,被测试对象通常不会主动理解测试环境,然后寻找测试环境本身的漏洞。

前沿AI正在改变这个假设。

如果你想知道一个模型有没有网络攻击能力,就不能只问它:

“你会不会攻击服务器?”

你必须让它真的面对服务器。

如果你想知道它能不能发现漏洞,就必须给它软件、网络、数据库、凭证、终端和工具。

如果你想测试一个Agent能否完成长链条攻击,就必须构造越来越接近真实世界的环境。

Irregular自己的研究已经观察到这种变化:当评测系统越来越接近真实生产环境时,其测试管线甚至开始发现真实的零日漏洞。

所以,AI安全测试出现了一个此前很少见的悖论:

测试越假,越测不出真正的危险能力。

测试越真,测试本身就越可能制造真实危险。

这正是OpenAI、Anthropic和Meta事件真正共同指向的问题。

人们正在把越来越强大的AI放进越来越真实的数字环境里,然后要求它:

攻击。

与此同时,人们又必须确保:

它绝对不知道哪里是真实世界;

绝对不能获得未经授权的互联网连接;

绝对不能把测试目标与现实目标混淆;

绝对不能把测试成功扩展成现实攻击。

这是一个极其困难的工程任务。

因为未来最危险的测试对象,很可能同时也是最擅长寻找测试系统漏洞的对象。


05

Kimi告诉我们的,是另一个更大的故事


8月7日,Reuters报道,美国研究机构Frontier Security称,Moonshot AI的Kimi K3在网络安全测试中绕过了英国AI Security Institute设置的沙箱边界。此前,英国AISI与美国CAISI已经对Kimi K3进行联合网络安全能力评估。(Reuters⁠)

目前没有可靠证据显示这起事件与Irregular有关。

这一区分非常重要。

因为如果所有事故都来自同一家测试机构,我们最后得到的故事不过是:

一家安全公司犯了错误。

但Kimi的出现提醒我们:

问题可能比Irregular更大。

不同机构、不同模型、不同测试体系,都开始面对同一种基础矛盾:

怎样让具有越来越强自主能力的AI接受足够真实的危险能力测试,同时又确保这种能力永远不能泄漏到现实世界?

所以Irregular不是故事的终点。

它只是一个窗口。

透过它,我们第一次能够清楚地看见:

一整个AI验证产业正在形成。


06

真正危险的,也许是验证能力集中


任何供应链形成之后,第二个问题都会出现:

谁控制关键节点?

今天,能够真正测试最前沿模型危险能力的机构仍然很少。

因为这种能力本身具有极高门槛。

你需要懂大模型。

需要懂Agent。

需要懂网络攻击。

需要拥有高质量benchmark。

需要能够建设复杂沙箱。

还必须能够让世界最先进的模型真正发动攻击,同时保证它不能碰到现实世界。

这不是普通软件测试公司能够完成的工作。

因此,一个新的风险随之产生:

验证集中风险。

当少数机构掌握越来越多前沿模型的验证能力,它们的技术失误、配置错误、测试偏差甚至方法论缺陷,就可能同时影响多个模型开发者。

这时候,第三方验证机构不再只是服务商。

它开始成为:

AI产业的关键基础设施。

而关键基础设施最怕什么?

单点故障。

今天人们担心GPU供应集中。

担心先进制程集中。

担心云计算集中。

未来可能还需要增加一个新的问题:

验证能力是否也正在集中?

因为如果整个行业越来越依赖少数机构告诉我们:

这个模型有多危险,

这个模型能不能发布,

这个模型在哪些场景必须被限制——

那么这些机构拥有的就不再只是技术能力。

它们实际上正在参与定义:

什么样的智能可以进入社会。


07

谁来验证验证者?


这最终把我们带到一个非常古老的问题。

第三方验证之所以出现,是因为:

开发者不能自己证明自己。

但当验证者越来越重要之后,同样的问题会重新出现:

验证者能够自己证明自己吗?

谁来检查沙箱真的与互联网隔离?

谁来检查权限配置?

谁来检查评测环境?

谁来检查测试日志?

谁来确定异常行为必须在多长时间内被发现?

谁来规定事故必须向谁报告?

谁来审计第三方安全实验室本身?

这不是一个文字游戏。

它意味着AI安全可能需要形成完整的验证治理体系:

模型需要验证。

测试环境需要验证。

验证机构同样需要验证。

而且这些验证最好不能全部由同一个主体完成。

这正是一个成熟安全体系应该具有的特征:

没有任何一个节点,可以因为自己负责安全,就自动被假定为安全。


08

AI安全正在从技术问题变成制度问题


过去几年,我们讨论AI安全时,注意力几乎全部集中在模型公司。

OpenAI做了什么?

Anthropic采取什么安全政策?

Google DeepMind如何评估危险能力?

Meta是否足够开放?

这些问题当然重要。

但随着第三方验证体系出现,AI安全正在获得另一层结构。

未来一个真正可信的AI安全体系,很可能不是:

一家负责任的AI公司。

而是:

开发者 + 独立评测机构 + 红队 + 沙箱基础设施 + 政府测试机构 + 标准组织 + 事故披露机制。

也就是说:

安全开始从一家公司的内部能力,变成一个产业共同生产的结果。

这可能是Irregular真正值得我们关注的原因。

不是因为它犯过什么错误。

而是因为这样一家过去几乎没人知道的小公司,已经站到了全球最重要AI模型与现实世界之间。

我们过去一直在问:

谁在制造世界上最强大的AI?

OpenAI。

Anthropic。

Google DeepMind。

Meta。

答案非常醒目。

但是当这些模型越来越能够自主使用工具、发现漏洞、执行攻击甚至跨越系统边界时,另一个问题正在变得同样重要:

谁在测试世界上最危险的AI?

而在这个问题之后,还有一个更难的问题:

谁来验证验证者?

这可能才是AI安全进入下一阶段之后,真正需要回答的问题。

因为一个社会最终能够信任的,不应该只是经过验证的智能。

而应该是一整套——

值得被信任的验证制度。


结语:最后的问题


Irregular 这家只有35位员工,位于特拉维夫的以色列小公司值得信任吗?

这个直接或间接地与AI时代三大前沿Al巨头的三大惊天黑客大案有关联的公司,究竟有什么背景?

他们对这些高危的AI前沿模型做了什么?他们用这些高危的AI前沿模型又做了什么?

故事刚刚开头。

大家都在看

  • 谁在测试世界上最危险的AI?

    谁在测试世界上最危险的AI? DW213|当OpenAI、Anthropic和Meta把前沿模型交给同一家小型安全实验室测试,AI安全正在形成一条鲜为人知的第三方验证供应链。作者|杰罗姆一家名叫Irregular 的以色列小公司,最近突然出现在全球AI安全最危险的地方 ... 世界之最08-14

  • 母爱是世界上最伟大

    母爱是世界上最伟大 母爱是世界上最伟大凌晨三点,医院走廊的灯光惨白。我推开病房门,看见母亲蜷缩在陪护椅上,身上只盖着一件薄薄的外套。她睡得很不安稳,眉头紧锁,仿佛在梦里也在为我担忧。那一刻,我的眼眶湿润了。这是我做完手术 ... 世界之最08-14

  • 快评:世界足够大,容得下C919与波音、空客一起飞

    快评:世界足够大,容得下C919与波音、空客一起飞 8月12日,随着中国国航CA723航班平稳降落蒙古国首都乌兰巴托,C919完成了国际商业航班飞行,标志着中国自主研制的干线客机正式迈入常态化国际运营新阶段。消息一出,国际媒体给予了海量关注。许多外媒将中国大飞机的 ... 世界之最08-14

  • 为何船只无法通过南美洲?世界上最危险的航道——德雷克海峡

    为何船只无法通过南美洲?世界上最危险的航道——德雷克海峡 很多人第一次看南美洲地图都会有个疑问:大陆最南端又没有修一道墙,海面看起来还那么宽,船为什么不直接绕过去?实际上,“船只无法通过南美洲”本身就是一种夸张说法。德雷克海峡从来不是不能走,而是能走、有人走 ... 世界之最08-13

  • 查瓦里亚:英超是世界最好联赛 我热爱高强度比赛和一对一对抗

    查瓦里亚:英超是世界最好联赛 我热爱高强度比赛和一对一对抗 直播吧8月12日讯 在加盟切尔西后,佩普·查瓦里亚在接受俱乐部官方媒体采访时表示,自己梦想着这样的时刻。“无论是清晨、午后还是夜晚,我都在梦想着这样的时刻,”查瓦里亚回忆道,“从小时候起,加盟这样一家顶级 ... 世界之最08-13

  • 罗素:一个有学识的中国人,才是世界上最有教养的人

    罗素:一个有学识的中国人,才是世界上最有教养的人 1920年10月,上海,一位来自英国的哲学家住进了“一品香”酒店。他没有急着谈论中国的贫穷,也没有把街头景象当成证明某种偏见的材料。伯特兰·罗素更关心的是:一个拥有悠久文明的社会,为什么会在近代陷入如此复杂 ... 世界之最08-13

  • 南京,有哪些世界之最?又有哪些是全国第一?

    南京,有哪些世界之最?又有哪些是全国第一? 南京这座古都,既有沉淀千年的古代建筑瑰宝,也有近代崛起的基建、产业成就,不少地标创下了世界之最和中国第一。 留存至今的古代遗存,撑起了南京多项世界级头衔。 明代京城明城墙,原全长35.27公里,现存25.09公里 ... 世界之最08-13

  • 世界历史上最伟大的英雄是谁?

    世界历史上最伟大的英雄是谁? 世界历史上最伟大的英雄是谁?这个问题一出口,就注定要“吵起来”。因为只要你说出一个名字,立刻就会有人反驳:他凭什么?他赢了吗?他救了谁?他又害了谁?英雄这两个字,从来不是奖章,而是刀口——你越想把它擦 ... 世界之最08-13

  • 世界历史上最伟大的10位军事天才,第一名你绝对想不到

    世界历史上最伟大的10位军事天才,第一名你绝对想不到 你心中排名第一的军事天才,居然一辈子没打过几场仗,却靠一本书统治了整个人类战争史两千多年。别着急拍桌子骂我,我知道很多人第一反应是成吉思汗、韩信,再不济也得是拿破仑亚历山大。但今天这份榜单,直接把拿破 ... 世界之最08-13

  • 很多人拼命修炼,始终成不了真正强者?修仙世界最残酷的真相曝光

    很多人拼命修炼,始终成不了真正强者?修仙世界最残酷的真相曝光 在所有仙侠故事里,最让人热血沸腾的,永远是“升级”。从炼气开始,一步步突破筑基、金丹、元婴、化神,直到飞升成仙。每一次境界提升,意味着力量暴涨,也意味着身份和地位的改变。很多人之所以沉迷修仙小说,本质 ... 世界之最08-12

相关文章