谷歌让AI互怼几天,小模型竟复现3道博士级难题
如果不看名字,你肯定会以为这又是一个强大到不能公开发行的顶级模型,甩出的一份「开挂」战绩:
做科研:一口气解开7道顶尖数学和计算机难题,交出的40页长篇证明连最严苛的机器审核都挑不出错;
干工程:从零手写了一个极度逼真的CPU模拟器,不仅成功启动系统,运行误差0.71%;
写代码:顺手把Eigen和ParlayHash两个主流开源库的核心代码给优化了,改动直接被上游维护者合并。
这是谷歌Antigravity团队8月27日刚亮出的一张成绩单。

在Teamwork技术长文中,谷歌Antigravity团队集中公布数学、系统与开源三类成果。
让人意外的是,这次扛大梁的不是什么算力吞金兽,而是主打「快和便宜」的小模型:Gemini 3.7 Flash。

谷歌官方甚至定调:这是Flash级模型第一次做出博士级的数学研究成果。
便宜模型凭什么能够越级打怪?
秘密不在参数里,而在一套名为Teamwork的多智能体编排框架。
谷歌真正想向行业传递的信号是:不是Flash突然变聪明了,而是干活的组织方式变了。
Pro主导探索
Flash成功复现
谁是这张成绩单的主角,谷歌的技术长文给出了非常严谨的界定:
7项数学与理论计算机科学结果,最初全部由Gemini 3.1 Pro在Teamwork的长证明模式下拿下。
但惊艳之处在于,其中3项硬核成果,被Gemini 3.7 Flash给完整复现了。
这3项绝不是用来凑数的边缘问题:ℓp子空间近似的coreset构造、最大内积嵌入的维度下界、以及把领先常数直接压低约5.93倍的Hadamard量化。
每一项,都是正儿八经的学术界开放难题。

剩下的4项则由3.1 Pro独挑大梁,包括稀疏凸优化的条件数下界、前缀矩阵分解的近似最优下界、Knuth's Cycles难题,以及在断网条件下独立重现的Erdős单位距离问题。
不仅如此,那个刷新谷歌内部记录的TCSBench评测71%最高分,也是3.7 Flash与3.1 Pro强强联手跑出来的,直接超越了上一代3.6 Flash搭3.1 Pro拿下的67.7%纪录。
其中,真正值得我们注意的信号是:
只要把编排框架搭对,像Flash这样主打轻量的小模型,完全能把旗舰模型做出来的研究重新跑通一遍。
这足以刷新我们对「小模型能干什么」的认知边界。
Teamwork把「找茬」做成硬核制度
Teamwork是Antigravity团队开发的多智能体编排框架。
你只需敲一个/teamwork-preview,Gemini就会读完提示词自己挑模式,当场摇人组建一个「AI专家团」,一跑就是几小时甚至几天。
前文提到的数学成果,全出自其中的长证明(Long Proof)模式。
它的设计思路极其反直觉:不靠堆砌参数,而是靠让一群Flash聚在一起互相「挑刺、抬杠、挑软肋」。
那这帮AI到底是怎么开会的?拆解下来总共有四步:
第一步:疯狂内卷的「竞争策略搜索」。
系统会同时孵化一堆候选方案,并给每个方案指派一个专职的「抬杠专员」,唯一KPI就是把这个方案驳倒。
有意思的是,被喷到体无完肤的方案绝不直接扔进回收站,而是带着满身反对意见留在流程里。
毕竟,在一条走不通的「歪路」里,往往藏着能救命的灵感。
第二步:按图索骥,「精准拆解」。
一旦选定靠谱的策略,系统就会把它拆成一堆带依赖关系的子问题,画成严密的拓扑图。能并行的独立推进,有先后顺序的就乖乖排队。
第三步:疯狂内卷的「内部锦标赛」。
每个子问题内部再开一局淘汰赛,节点一边读候选方案,一边看毒舌批评,合力揉搓出一个升级版。
如果综合失败,就带着累积的反对意见重跑,直到把漏洞补死。
第四步:吃一堑长一智的「跨轮学习」。
失败的草稿原封不动留给下一轮,验证器踩过的每个大坑统统沉淀进「陷阱登记簿」。
走过的死路、证出的结论,全部实时同步到共享知识库里,供全员随时调用。

Long Proof模式的锦标赛网络:候选策略各配一名falsifier,被否路线带着反对意见留在流程中。
这一套流程跑下来,与其说它是个冷冰冰的超级大脑,不如说它复刻了一个极其残酷、谁也别想浑水摸鱼的学术组会。
在这里,谁的方案都得先被狂撕几轮,撕不烂的硬骨头才能顺利通关。
这就直接治好了传统多智能体最容易犯的群体癔症:
以往一个AI一不小心带偏了节奏,其他AI就会盲目当「应声虫」,最后在错误的地基上越盖越高。
Teamwork的杀手锏,不过是把「互相找茬」,实打实地变成了一套谁也无法逃避的硬核制度。
Knuth难题的真相
关于这7项成果,最引人注目、也最容易被误读的,莫过于高德纳(Donald Knuth)提出的Knuth's Cycles难题。
事实上,这道题在今年春天就已经被AI接力解完了。

Donald Knuth,2023年斯坦福圣诞讲座。
今年2月底,Claude Opus 4.6仅用了一小时左右,就闪电般给出了奇数情形的构造,逼得高德纳在论文开头连写两个「Shock!」。

紧接着,gpt-5.3-codex与GPT-5.4 Pro等模型接力登场,把最难啃的偶数情形也给补全了。
到了4月中旬,高德纳在论文修订版中明确盖章:偶数情形已经毫无悬念。
那谷歌这次做了什么?
简单来说,谷歌为偶数情形找到了两个更优雅、更简单的新构造,并顺手砸出了两份长达40多页和70多页的首批长篇证明。
其中那份40多页的硬核证明,更是通过了Lean形式化验证,连机器都完全挑不出毛病。
这当然是相当扎实的学术贡献,但它的真正意义在于「给出了更漂亮的证明」,而不是真正意义上的从零破局。
这反而显示出Teamwork真正强大的地方:
它没有去补齐某一个单体模型的「孤岛智商」,而是通过制度化的博弈与编排,彻底治好了多智能体一盘散沙、互相附和的协作短板,释放出「群体智慧」。
从定理到Shell
这回真是Flash干的
同一套找茬机制,谷歌换个模式,直接拿去啃了硬核工程。
这一次技术长文明确写着「使用Gemini 3.7 Flash」。Teamwork从零构建了一个周期级、乱序执行的RISC-V CPU模拟器。
乱序执行是现代高性能CPU的标配,也是模拟器最容易写崩的地方。
Teamwork分两步走:先保证微架构功能正确,自己写乱序流水线和重排序缓冲,成功把xv6操作系统启动到Shell;再逐周期对齐时序。

Teamwork构建的RISC-V模拟器启动xv6内核并进入Shell的过程。
最难的一关,谷歌称之为「静默执行鸿沟」。
模拟器的微架构状态可能在几百个周期里悄悄跑偏,等架构层面报错时早已找不到根源。
Teamwork的解法是把参考模拟器Spike沙箱化隔离,防止智能体作弊抄袭,然后全程锁步协同仿真,每一步都对账。
最终,这套模拟器跑通了100多个RISC-V标准基准,在未见过的测试负载上,与BOOM硬件的平均周期误差仅为0.71%。

谷歌披露:Teamwork模拟器与BOOM硬件的周期对齐对比,未见测试负载上平均误差0.71%。
不过这里需要说清楚的,这是软件层面的模拟器,绝不是RTL芯片设计,更谈不上流片造芯。
真刀真枪开源实战
AI科研下半场拼的是落地与验收
相比于数学和模拟器,最后一类成果看着最不起眼,证据却最硬核。
Eigen是C++世界里应用极广的高性能线性代数库。
Teamwork在其中揪出了一处单行或单列矩阵向量乘的次优实现,并直接手搓了一条SIMD快速路径。
而在并发哈希表ParlayHash中,Teamwork则引入了Swiss Table的优化思路,让64线程的初始插入吞吐直接翻倍,单线程整体吞吐提升1.5倍,同时每个元素还少用了25%的内存。
这两处改动绝不是闭门造车的自嗨跑分,而是老老实实走完了严苛的开源代码评审,被外部人类维护者正式合并到上游分支里的真代码。
比跑分更值得留意的,是一篇数学论文末尾的一句作者声明:证明先由谷歌内部的Gemini智能体系统做出,再由作者核验、编辑。
智能体负责在无尽的草稿纸上疯狂探索,人类则负责签字和最终验收。这才是眼下AI科研最真实的分工。
谷歌自己说得很清楚:这些问题原本要顶尖专家啃上几个月,Teamwork压缩的是试错周期,方向盘和最后签字权,还在人手里。
AI科研的下半场,比的已经不是谁的模型参数更大,是谁的AI团队组得更好。
模型越便宜、越像随用随取的日用品,人类的验收和把关就越值钱。
以前,人是解题的人。现在,人是出题和验收的人。
高德纳给Claude找到的构造手写了证明,后来得知有人用Lean验证了它,他说「这真是件好事」,因为自己「最近越来越容易出错」。
连88岁图灵奖得主的证明都要过验证器这一关,AI写的证明更不能例外。
解题的活,机器会越干越多。验收这一关,一定要有人守着。
参考资料:
https://antigravity.google/blog/teamwork-when-ai-becomes-a-research-partner
https://www-cs-faculty.stanford.edu/~knuth/papers/claude-cycles.pdf
本文来自微信公众号“新智元”,作者:ASI启示录,编辑:元宇,36氪经授权发布。
上一篇:机器人没有互联网
大家都在看
-
12位院士2位国家最高奖得主!中科大1959级为何堪称中国最强一届 现在的年轻人,总有人感慨:时代内卷、机会太少、成长太难、很难做出成绩。 但66年前,有一群十八九岁的年轻人,给出了最震撼的答案。 没有优越条件,没有繁华校园,没有完善设备,甚至连安稳的读书环境都稀缺。就是 ... 机械之最09-06
-
警钟再次敲响!吉隆泥石流灾害为何难预警、难救援? 据央视新闻消息,2026年8月26日,中尼边境吉隆口岸突发特大泥石流灾害,冰岩崩引发的泥石流,以极快速度冲入河谷,造成重大人员伤亡和设施损毁。总台记者深入灾害现场,跟随救援人员抢通被冲毁的道路、挺进核心灾区 ... 机械之最09-06
-
2026 IFA展:从三个关键词看中国品牌“热度” 中新网柏林9月5日电 题:2026 IFA展:从三个关键词看中国品牌“热度”中新网记者 马秀秀清洁设备能“爬楼”、烤箱会识别食材、无线充电也用上液冷......正在举行的2026年德国柏林国际消费电子展(IFA)上,中国“智能 ... 机械之最09-06
-
美司令:用实力震慑中国,我军亮出机器狼,改写近海作战规则 8月1日刚过去建军99周年,就在节前的7月31日,央视军事的专题片《制胜》里,出现了国产机器狼扛着双联装单兵火箭筒冲上滩头的画面。而不久前,美军印太司令帕帕罗在东南亚的安全场合又放了狠话,说要靠美军硬实力遏 ... 机械之最09-06
-
美国疯狂找矿,难撼中国稀土优势 一边押注本土矿山,一边盯上外国矿产,美国为摆脱稀土供应链对外依赖,开启“全球找矿”模式。美媒直言,多重现实瓶颈制约下,全球寻矿难解美国稀土困局。特朗普政府支持的美企收购巴西稀土矿美国稀土企业——美国稀 ... 机械之最09-06
-
西藏吉隆泥石流灾害主因披露!真正决定风险的,不仅是山上“垮了多少”,更是沟谷里“卷了多少” …… 由中国科学院青藏高原研究所牵头的联合研究团队,最近在西藏吉隆“8·26”泥石流灾害成因及放大机制方面取得重要研究进展,他们综合研究发现,高位冰岩崩+沿程增容是造成此次泥石流灾害的主因。相关成果论文,近日以 ... 机械之最09-03
-
“还我季洁”上热搜!开播即翻车,除了名字,这剧和《重案六组》还有什么关系? 澎湃新闻记者 戴媛媛“还我季洁”四个字冲上热搜第一,某种程度上已经替这部顶着经典IP光环的新剧写了墓志铭。《重案六组:消失的警号》开播即翻车。片方打出的旗号是“情怀不消费,经典不糊弄”,导演甚至说自己“ ... 机械之最09-03
-
“血脉觉醒”,传统文化成了“顶流” 早晨,黑龙江职业学院教学楼里,早自习铃声刚落,诵读声便从教室里传出;传统文化节上,书法、剪纸、漆扇制作等活动吸引不少学生驻足参与,现场舞龙翻腾,国风雅集与人文讲堂相映成趣。传统文化正以润物无声的方式进 ... 机械之最09-03
-
两栖无人装备:抢滩登陆的“机甲先锋” 土耳其U-MAV无人两栖战车。 美国“潜行者”号两栖半潜式军用水下潜航器。 美国“刺刀”系列两栖无人载具。资料图片 据外媒报道,今年8月,在土耳其“泰克诺费斯特蓝色祖国”活动中,该国FNSS公司的8吨级U-MAV无人两 ... 机械之最09-02
-
别被电视剧骗了!真实的张居正,才是明朝最狠的"卷王之王" 家人们,今天咱聊一个经常在电视剧里被“洗白”的人物——张居正。在剧里,他往往是鞠躬尽瘁的老臣形象,操心到死。但真实的张居正,远比这复杂得多。用今天的话说,他就是一个:极致的理想主义者,搭配极致的权力狂 ... 机械之最09-02
相关文章
- 2026 IFA展:从三个关键词看中国品牌“热度”
- 美司令:用实力震慑中国,我军亮出机器狼,改写近海作战规则
- 美国疯狂找矿,难撼中国稀土优势
- 国门处,五星红旗飘展
- 新产业催生新职业,湖北多措并举让就业“长”在产业上
- 西藏吉隆泥石流灾害主因披露!真正决定风险的,不仅是山上“垮了多少”,更是沟谷里“卷了多少” ……
- 再难,也要挺进!他们接力打通救援“生命线”
- 葡萄皮上冒出“小疙瘩”,还能放心吃吗?
- “还我季洁”上热搜!开播即翻车,除了名字,这剧和《重案六组》还有什么关系?
- “血脉觉醒”,传统文化成了“顶流”
- “最后一公里”这样打通
- 两栖无人装备:抢滩登陆的“机甲先锋”
- 别被电视剧骗了!真实的张居正,才是明朝最狠的"卷王之王"
- 一米一米挺进,没有捷径但绝不退缩
- 闽人智慧丨“三下五除二”,福建人的数学功底原来这么深厚
- 8点1氪丨片仔癀市值蒸发超2100亿;苹果换帅,特努斯接替库克任苹果CEO;Anthropic签署由英伟达支持的350亿美元云计算协议
- 看完一场“准点下班”黑客松,我想做一个公司下班榜单
- 实测OpenClaw 2.0:“龙虾”史上最大更新,网友:爱过,我选Hermes
- 二十世纪最伟大的30项发明之十六:电梯(美国)1852年
- 大弧度弯道成为道路抢通难点 西藏吉隆增设首条绳梯避险通道
热门阅读
-
天下第一暗器暴雨梨花针,传说中的唐门暗器做出来了 07-13
-
汽车投诉排行榜前十名汽车 问题最多的就是这些车 07-13
-
世界上最牛挖掘机,甚至可以挖穿一座城市 11-05
-
世界最大核潜艇制造厂,产量远超中美法 11-20
