谁在测试世界上最危险的AI?
DW213|
当OpenAI、Anthropic和Meta把前沿模型交给同一家小型安全实验室测试,AI安全正在形成一条鲜为人知的第三方验证供应链。

作者|杰罗姆
一家名叫Irregular 的以色列小公司,最近突然出现在全球AI安全最危险的地方。
Irregular原名Pattern Labs,是一家专门测试前沿AI危险能力的安全实验室。它做的事情有点反常识:不是努力阻止AI发动攻击,而是主动要求AI去攻击。
给模型目标,
给模型工具,
给模型一个模拟网络环境,
然后观察它能走多远。
Irregular称自己的评测平台已经服务于多家顶尖前沿AI实验室;它的研究页面公开列出了对GPT-5.6 Sol、Meta Muse Spark 1.1等模型的攻击性安全能力评测。早在2025年,其工作就已经出现在Anthropic Claude 3.7 Sonnet以及OpenAI o3、o4-mini的安全评估中。
这家公司的规模与它所处的位置形成了巨大反差。
2025年,Irregular获得8000万美元融资,由红杉资本和Redpoint Ventures领投。当时有知情人士给出的估值约为4.5亿美元。
真正值得注意的不是估值。
而是它正在测试谁。
OpenAI。
Anthropic。
Meta。
以及其他世界最前沿的AI开发者。
世界上最强大的AI,由巨头制造,
但是越来越多时候,证明这些AI到底有多危险的,却是巨头之外的另一群人。
Irregular,就是巨人背后的那个小公司。
而最近发生的一系列事件,让这个过去几乎隐形的角色突然暴露在聚光灯下。
01
三次“出轨”,照亮了同一个陌生角色
2026年7月,OpenAI披露了一起极不寻常的安全事故。
GPT-5.6 Sol和一个能力更强的未发布模型正在接受网络安全能力测试。为了真正测出模型的攻击能力,研究人员降低了部分网络安全拒绝机制,让模型在沙箱中运行ExploitGym测试。
接下来发生的事情超出了测试本身。
模型花费大量推理资源寻找开放互联网入口,发现并利用软件包注册缓存代理中的一个零日漏洞,随后提权、横向移动,最终获得互联网访问能力。
然后,它把目标指向了Hugging Face。
OpenAI后来确认,模型跨越了OpenAI研究环境与Hugging Face生产基础设施之间的边界,试图直接取得测试答案。
这一次,模型是真的自己找到了出去的路。
但几天之后,Anthropic披露的故事却有所不同。
Anthropic检查了超过14.1万次网络安全评测运行,最终发现三起事件:Opus 4.7、Mythos 5以及一个内部研究模型,在与第三方评测伙伴Irregular合作的测试过程中进入互联网,并未经授权访问三个真实组织的生产系统。
最早的事件可以追溯到4月。
更令人不安的是,Anthropic联系相关组织时,其中两个组织此前甚至没有发现这些活动。
但是这一次,AI并没有像OpenAI模型那样发现零日漏洞、自己打通互联网。
问题出在测试环境。
Anthropic原本告诉模型:你正在一个没有互联网的模拟环境中进行测试。
实际上,由于与评测伙伴之间对配置的理解出现问题,测试环境连接着真实互联网。
模型于是做了一件极其“合理”、也极其危险的事情:
它把真实世界当成了模拟世界的一部分。
紧接着,Meta也出现了类似事件。
Meta的Muse Spark 1.1在由Irregular进行的网络安全评测中,因为测试环境配置问题获得了原本不应该存在的互联网访问能力,并利用外部服务的安全漏洞,对第三方系统进行了未经授权的操作。Irregular强调,这次事件并不是模型主动“逃出沙箱”,而是测试环境本身配置错误。
一个名字连续出现在世界三家最重要AI公司的三大安全事件附近:
Irregular。
当然,这三起事件不能被简单写成:
Irregular配置错误,导致三家AI集体失控。
OpenAI事件的技术路径明显不同:模型主动发现并利用漏洞,最终获得开放互联网访问。Anthropic和Meta的公开信息,则更直接指向评测环境配置与联网边界问题。
真正值得观察的,并不是寻找一个共同“肇事者”。
而是另外一个事实:
为什么世界上最强大的几家AI公司,都开始依赖这样的第三方机构测试自己的模型?
然后,都发生了惊天黑客大案?

02
AI公司为什么不能测试自己?
答案其实并不复杂。
AI能力越强,开发者自己证明自己安全,就越不够有说服力。
一家汽车公司当然可以测试自己的汽车。
一家制药企业当然可以验证自己的药物。
一家上市公司当然可以编制自己的财务报表。
但现代制度不会因此认为:
它们自己说安全,就足够了。
开发者永远存在一个无法彻底消除的问题:
利益相关。
模型开发者最了解自己的模型,却同时也是最希望模型顺利发布的人。
能力越强、投入越大、商业竞争越激烈,这种结构性张力就越明显。
因此,AI产业正在出现一个非常重要却长期隐藏在聚光灯之外的角色:
第三方验证者。
它们不负责制造最强大的模型。
它们负责攻击模型、诱导模型、测试模型,甚至故意把模型放进危险环境中,看它究竟能做什么。
Irregular对自己的评测平台描述得很直接:平台已经被多家顶级前沿实验室使用,用于测试AI能力、安全状态、渗透路径以及面对对抗攻击时的表现。
这意味着AI安全正在发生一次制度变化:
过去的问题是:
我们怎样把模型做得安全?
现在增加了另一个问题:
我们怎样证明模型是安全的?
前者属于研发。
后者属于验证。
这两个系统,正在分离。
03
一条新的供应链正在出现
我们可以把它叫作:
AI验证供应链(AI Validation Supply Chain)
它是由独立安全实验室、评测机构、测试平台、沙箱环境与专业红队共同构成,为前沿AI模型提供能力测试、风险识别和安全验证的外部基础设施体系。
这条供应链大致是这样的:
模型开发者
↓
确定需要验证的能力与风险
↓
第三方验证机构
↓
测试平台与隔离环境
↓
红队攻击与危险能力测试
↓
风险评估报告
↓
模型发布、限制或者延迟发布
Irregular只是其中一个节点。
但它让这条此前几乎看不见的供应链第一次变得具体。
而这种制度需求并不是少数公司的偶然选择。
早在2023年,一项针对AGI安全与治理专家的调查中,98%的受访者就至少部分赞同前沿AI实验室应进行部署前风险评估、危险能力评测、第三方模型审计、安全使用限制以及红队测试。
原因非常简单:
越重要的安全结论,越不能只由被验证者自己生产。
于是AI产业正在重复许多成熟产业曾经经历过的过程:
公司生产财务信息,因此出现独立审计。
企业生产药品,因此出现临床试验与监管审批。
飞机制造商制造飞机,因此需要适航认证。
AI公司制造智能,
现在,围绕智能本身,也正在出现一套外部验证体系。
这是AI产业成熟过程中一个非常重要的制度信号。
智能开始需要证明。

04
但验证AI,比验证普通产品危险得多
问题也恰恰出现在这里。
传统软件安全测试中,被测试对象通常不会主动理解测试环境,然后寻找测试环境本身的漏洞。
前沿AI正在改变这个假设。
如果你想知道一个模型有没有网络攻击能力,就不能只问它:
“你会不会攻击服务器?”
你必须让它真的面对服务器。
如果你想知道它能不能发现漏洞,就必须给它软件、网络、数据库、凭证、终端和工具。
如果你想测试一个Agent能否完成长链条攻击,就必须构造越来越接近真实世界的环境。
Irregular自己的研究已经观察到这种变化:当评测系统越来越接近真实生产环境时,其测试管线甚至开始发现真实的零日漏洞。
所以,AI安全测试出现了一个此前很少见的悖论:
测试越假,越测不出真正的危险能力。
测试越真,测试本身就越可能制造真实危险。
这正是OpenAI、Anthropic和Meta事件真正共同指向的问题。
人们正在把越来越强大的AI放进越来越真实的数字环境里,然后要求它:
攻击。
与此同时,人们又必须确保:
它绝对不知道哪里是真实世界;
绝对不能获得未经授权的互联网连接;
绝对不能把测试目标与现实目标混淆;
绝对不能把测试成功扩展成现实攻击。
这是一个极其困难的工程任务。
因为未来最危险的测试对象,很可能同时也是最擅长寻找测试系统漏洞的对象。
05
Kimi告诉我们的,是另一个更大的故事
8月7日,Reuters报道,美国研究机构Frontier Security称,Moonshot AI的Kimi K3在网络安全测试中绕过了英国AI Security Institute设置的沙箱边界。此前,英国AISI与美国CAISI已经对Kimi K3进行联合网络安全能力评估。(Reuters)
目前没有可靠证据显示这起事件与Irregular有关。
这一区分非常重要。
因为如果所有事故都来自同一家测试机构,我们最后得到的故事不过是:
一家安全公司犯了错误。
但Kimi的出现提醒我们:
问题可能比Irregular更大。
不同机构、不同模型、不同测试体系,都开始面对同一种基础矛盾:
怎样让具有越来越强自主能力的AI接受足够真实的危险能力测试,同时又确保这种能力永远不能泄漏到现实世界?
所以Irregular不是故事的终点。
它只是一个窗口。
透过它,我们第一次能够清楚地看见:
一整个AI验证产业正在形成。

06
真正危险的,也许是验证能力集中
任何供应链形成之后,第二个问题都会出现:
谁控制关键节点?
今天,能够真正测试最前沿模型危险能力的机构仍然很少。
因为这种能力本身具有极高门槛。
你需要懂大模型。
需要懂Agent。
需要懂网络攻击。
需要拥有高质量benchmark。
需要能够建设复杂沙箱。
还必须能够让世界最先进的模型真正发动攻击,同时保证它不能碰到现实世界。
这不是普通软件测试公司能够完成的工作。
因此,一个新的风险随之产生:
验证集中风险。
当少数机构掌握越来越多前沿模型的验证能力,它们的技术失误、配置错误、测试偏差甚至方法论缺陷,就可能同时影响多个模型开发者。
这时候,第三方验证机构不再只是服务商。
它开始成为:
AI产业的关键基础设施。
而关键基础设施最怕什么?
单点故障。
今天人们担心GPU供应集中。
担心先进制程集中。
担心云计算集中。
未来可能还需要增加一个新的问题:
验证能力是否也正在集中?
因为如果整个行业越来越依赖少数机构告诉我们:
这个模型有多危险,
这个模型能不能发布,
这个模型在哪些场景必须被限制——
那么这些机构拥有的就不再只是技术能力。
它们实际上正在参与定义:
什么样的智能可以进入社会。
07
谁来验证验证者?
这最终把我们带到一个非常古老的问题。
第三方验证之所以出现,是因为:
开发者不能自己证明自己。
但当验证者越来越重要之后,同样的问题会重新出现:
验证者能够自己证明自己吗?
谁来检查沙箱真的与互联网隔离?
谁来检查权限配置?
谁来检查评测环境?
谁来检查测试日志?
谁来确定异常行为必须在多长时间内被发现?
谁来规定事故必须向谁报告?
谁来审计第三方安全实验室本身?
这不是一个文字游戏。
它意味着AI安全可能需要形成完整的验证治理体系:
模型需要验证。
测试环境需要验证。
验证机构同样需要验证。
而且这些验证最好不能全部由同一个主体完成。
这正是一个成熟安全体系应该具有的特征:
没有任何一个节点,可以因为自己负责安全,就自动被假定为安全。

08
AI安全正在从技术问题变成制度问题
过去几年,我们讨论AI安全时,注意力几乎全部集中在模型公司。
OpenAI做了什么?
Anthropic采取什么安全政策?
Google DeepMind如何评估危险能力?
Meta是否足够开放?
这些问题当然重要。
但随着第三方验证体系出现,AI安全正在获得另一层结构。
未来一个真正可信的AI安全体系,很可能不是:
一家负责任的AI公司。
而是:
开发者 + 独立评测机构 + 红队 + 沙箱基础设施 + 政府测试机构 + 标准组织 + 事故披露机制。
也就是说:
安全开始从一家公司的内部能力,变成一个产业共同生产的结果。
这可能是Irregular真正值得我们关注的原因。
不是因为它犯过什么错误。
而是因为这样一家过去几乎没人知道的小公司,已经站到了全球最重要AI模型与现实世界之间。
我们过去一直在问:
谁在制造世界上最强大的AI?
OpenAI。
Anthropic。
Google DeepMind。
Meta。
答案非常醒目。
但是当这些模型越来越能够自主使用工具、发现漏洞、执行攻击甚至跨越系统边界时,另一个问题正在变得同样重要:
谁在测试世界上最危险的AI?
而在这个问题之后,还有一个更难的问题:
谁来验证验证者?
这可能才是AI安全进入下一阶段之后,真正需要回答的问题。
因为一个社会最终能够信任的,不应该只是经过验证的智能。
而应该是一整套——
值得被信任的验证制度。
结语:最后的问题
Irregular 这家只有35位员工,位于特拉维夫的以色列小公司值得信任吗?
这个直接或间接地与AI时代三大前沿Al巨头的三大惊天黑客大案有关联的公司,究竟有什么背景?
他们对这些高危的AI前沿模型做了什么?他们用这些高危的AI前沿模型又做了什么?
故事刚刚开头。

上一篇:母爱是世界上最伟大
下一篇:世界最伟大的爱,没有之一
大家都在看
-
中国骄傲!世界“冠军中的冠军”!她是河北姑娘 9月27日第48届世界技能大赛在上海闭幕20岁的河北廊坊姑娘何晓嫚作为轨道车辆技术项目全球唯一参赛女选手用18个小时的高强度比拼夺得该项目金牌并以全场最高分荣获阿尔伯特·维达大奖这也是中国第3次获得该奖项该奖项 ... 世界之最09-30
-
世界之最!全球最高电压等级和最大输送容量海上风电柔性直流送出工程投入运行 郑小鱼 杨雅淇 封面新闻记者 罗石芊9月27日,随着首批5台机组叶片缓缓转动,三峡阳江青洲五、七期海上风电项目首批机组成功并网。作为全球最高电压等级和最大输送容量海上风电柔性直流送出工程,该项目的投入运行标 ... 世界之最09-30
-
穆杰塔巴发话,敢对抗美国,伊朗不是世界第四,而是世界头号强国 发生在中东的美伊冲突,到现在还看不到结局,但是双方都到了最关键的时刻。伊朗方面面临着经济低迷,货币下跌严重,物价又持续上涨的困境。而美国则面临着11月3号的中期选举,对于特朗普政府来说,这同样是一个绕不 ... 世界之最09-30
-
詹姆斯:恩比德是世界上最有天赋的球员之一,关键是怎样保持健康 北京时间9月28日,詹姆斯在费城76人媒体日上谈到与乔尔-恩比德搭档。他强调恩比德的天赋,也把健康列为最关键的问题。詹姆斯表示:“我进训练馆还不到一天。我当然也期待看看他的流程。恩比德是我们这个世界上最有天 ... 世界之最09-30
-
3000亿年误差不到1秒:科学家们刚刚制造出世界上最精确的钟表 如果有一只钟从宇宙大爆炸那一刻开始走,一直走到今天,它的误差会有多大?对于新加坡科学家刚刚打造的这台时钟来说,答案是:远远不到1秒。新加坡国立大学量子技术中心的研究团队研制出一台基于镥-176离子的光学原 ... 世界之最09-30
-
世界上最厉害的人是谁? 我问AI“谁最厉害”,它只回了5个字:起床就起床前几天,我突发奇想,问了一个AI一个问题:“世界上最厉害的人是谁?”我本以为它会给我一个名字——成吉思汗、牛顿、爱因斯坦,或者马斯克。毕竟,这些人征服过土地 ... 世界之最09-30
-
世界上唯一绝对公平的,是啥?答案只有两个字 我们总在抱怨世界不公:有人含着金汤匙出生,有人拼尽全力却只够温饱;有人天生长了一张好脸,有人终其一生都在为自己的短板买单。财富可以继承,外貌无法选择,智商天差地别,机遇可遇不可求——这世上,到底有没有 ... 世界之最09-29
-
走进南极:两部纪录片,看见地球最遥远的冰雪世界 南极是地球上最特别的一片大陆。这里没有普通意义上的城市和道路,大片冰原覆盖着大地,山脉从冰雪之间露出轮廓,海面漂浮着巨大的冰山。冬季到来之后,极夜笼罩大地,漫长的黑暗和刺骨的寒风成为这里最寻常的天气。 ... 世界之最09-29
-
詹姆斯谈恩比德:他是世界上最有天赋的球员之一 关键是保持健康 直播吧9月28日讯 今天,詹姆斯在76人媒体日接受采访时谈到了队友恩比德。詹姆斯说道:“乔(恩比德)是这个世界上最有天赋的球员之一。对他来说,最重要的就是保持健康。”“我能看出来,这个休赛期他在身体方面投入 ... 世界之最09-29
-
牧民痛心:小时候能行船,现在马都蹚不过去!世界最窄的河怎么了 在内蒙古贡格尔草原上,藏着一件让人想不通的事。一条河,窄到放一本书就能当桥走过去。 成年人迈一步就能跨到对岸,河里的鱼稍微长胖一点都可能被卡住。这条河的名字叫耗来河,蒙古语的意思是“嗓子眼”,就是形容 ... 世界之最09-28
相关文章
- 走进南极:两部纪录片,看见地球最遥远的冰雪世界
- 9.4分大尺度神综回归,撕开成人世界最残酷的生存法则?
- 詹姆斯谈恩比德:他是世界上最有天赋的球员之一 关键是保持健康
- 牧民痛心:小时候能行船,现在马都蹚不过去!世界最窄的河怎么了
- 世界上经济最发达的3个小岛
- 世界上最难解的数学题百万美金悬赏的数学难题,仅一道被成功破解
- 世界上最严重错误工程?耗费巨额资金,建成一笔烂账!中国占2个
- 作为世界公民最应该了解的十个常识
- 世界上最接近地狱的国家:对中国人免签,却没人敢去
- 人民要论:金砖国家“勇做时代先锋”的理论内涵与世界意义
- 高压“挤”出世界最细金属线
- 中国10大古代超级建筑!全部是世界之最,你打卡过几座?
- 世界上最健康的生活方式,简单通透,建议每个人收藏践行
- 11件世界顶级宝物,价值近乎“天文数字”
- 阿根廷总统米莱对内塔尼亚胡称:你是世界历史上最伟大的领袖之一
- 阿根廷总统米莱对内塔尼亚胡称:你是世界历史上最伟大的领袖之一
- 阿根廷总统米莱:内塔尼亚胡,你是世界历史最重要领导人之一
- 阿根廷总统米莱:内塔尼亚胡,你是世界历史最重要领导人之一
- 世界最有钱国家:收入超美国两倍,一天工作3小时,生活免费
- 读懂中国制造的世界价值
热门阅读
-
挑战极限!中国人又创造了一项世界之最 01-07
-
世界最漂亮的十大美女,盛世美颜,你喜欢哪一位? 04-10
-
盘点一下世界之最,最长丁丁竟然有60㎝!! 04-26
-
全球最值钱的五大货币,竟然没有人民币和美元 05-10
-
莉娜·安德森 - 世界上最美丽的成人模特 09-25
