Kimi K3“登顶”,正在开启“国产算力1.0时刻”
21世纪经济报道记者 赵云帆
近日,由月之暗面发布的Kimi K3模型,以1679分的成绩,力压GPT、Claude系列两大“轮庄”神话模型,登顶全球三大代码类AI基准平台之一FCA的全模型榜首。
中国原生AI模型,第一次真正意义上触碰到了全球“SOTA(最高水平)”的铁王座——而在这背后,一则更为震撼的中国AI算力叙事,已悄然写下了它的注脚。
过去一段时间,国产算力到底能不能撑起前沿模型的推理需求,在产业、舆论端始终存疑。而在K3同步披露的种种信息中,我们却明确地找到了国产算力与国产模型珠联璧合的种种线索。
比如,在配置声明中,K3将“≥64卡超节点”列为其规模化商用的推荐配置,并将前沿算力“金标准”的英伟达NVL72(GB200/GB300)列为达标底座。
而在随后的世界人工智能大会(WAIC)期间,月之暗面却披露已同步适配包括华为昇腾在内的国产芯片。同期,华为在上海展出的昇腾950 SuperPod 64卡“超节点”机柜,似乎呼应了K3将“≥64卡超节点”作为推荐配置的做法。
在这中间,我们甚至能读到,国产模型与国产算力在工程配置上的“默契”。
突破摩尔定律的“集群”
早在几年前,半导体行业就已预见摩尔定律触及物理极限——当制程微缩难以持续推高单芯片算力时,业界转而通过增加芯片数量、扩大集群规模来延续算力增长格局。
但到了AI时代,新的问题又出现了:AI大模型的并行计算对卡间通信时延极为敏感,单纯的“堆芯片”同样会遇到瓶颈。
就像韩信点兵,“多多益善”的前提是指挥体系能同步调动每一路兵马,否则兵越多,弱点越多。
Kimi K3推荐底座之一——英伟达NVL72,正是为此而生。它通过NVLink五代技术,将72张英伟达高算力GPU焊入同一机柜,构建一个低时延、高带宽的一致性计算域,突破多卡协同中的通信瓶颈。
当然,NVL72仍然是一个非常“娇气”的算力架构。它不能无限扩展其集群,因为单机柜供电有上限,因为卡间要有散热空间,也因为铜线高保真低延迟传输有物理长度限制。
从原理上,GPU 之间要协同工作,最基本的需求是能互相读取缓存空间的数据。但是在微观尺度上,跨卡的数据读取与本卡写入数据会因为传输延迟产生致命冲突。
就像古代行军打仗,“将在外,君命有所不受”,因为战场形势的变化远快于指挥命令的下达。
为了实现GPU跨卡计算,英伟达NVLink配套了一套复杂的硬件机制。这套机制的核心是一颗专门的交换机芯片“NVSwitch”:它的内部维护着一张表格,记录着每张 GPU 的缓存里有哪些数据、状态如何(干净的、脏的、无效的),它可以向所有GPU广播“无效”通知。
用专业的叫法,这叫“缓存一致性”。但之所以它又很“娇气”,是因为从GPU发出读写请求,到NVSwitch转发无效通知,到所有 GPU 确认收到,整个往返必须在极短时间内完成。如果某个 GPU 迟迟收不到通知,它就可能拿着旧数据继续计算,进而造成错误。
因此,为了实现具有“强缓存一致性”的GPU互联,NVL72机柜不得不选择在内部使用铜线互联。
铜线的优点是低延迟、高保真,契合短距离算力集群的通信需求。当然,铜线也有缺点。NVLink 5 的信号速率高达每秒 1120 亿次变化,而高频信号在铜线里跑超过 2 米,信号质量就会差到无法可靠识别。所以NVL72机柜的5000多条铜缆全都被限制在2米以内,NVLink并行GPU的数量,也会受到物理空间和通信延迟极限的双重约束,被控制在非常有限的范围内。
“超节点”的中国解决方案
既然铜缆传输有空间限制,那为什么不用光纤呢?这可能是理解算力集群工作原理之后,第一个冒出来的问题。
光纤具备长距离稳定传输的优势——但芯片只能处理电信号,光电转换本身会引入额外延迟。而在NVLink强缓存一致性架构下,从GPU发出写请求到所有GPU确认收到无效通知,整个往返必须控制在1.5微秒以内。因此,铜线在2米内的传播延迟仅约20纳秒,且无需转换;而光纤方案会面临更高的成本、更大的功耗和更复杂的系统设计。
因此,英伟达等厂商最终选择了“铜光互联”的分层策略:机柜内部走铜线,利用其低延迟满足强一致需求;机柜之间或跨机房通信则切换为光纤,光纤的长距离优势在此发挥作用。
选择以上策略,是受限于英伟达GPU自身已然成型的架构——但若从底层架构上就和英伟达GPU、NVLink等设计思路区分开,更广泛的集群光通信,反而变成了一种可选方案。
以华为的算力芯片NPU,以及其推出的集群连接方案灵衢 UB为例:
在芯片端,华为把光引擎直接集成在NPU封装旁边,而不是像传统方案那样外挂一个可插拔的光模块。这就好比电梯入户,甚至是“地铁入户”,省去了通勤短驳带来的延迟。
而在协议层,华为放弃了英伟达那种“写下去,全世界立刻知道”的强一致缓存语义,改用了“最终一致”。
这是什么意思呢?从微观尺度来看,如果NPU-A写了一块地址X的数据,NPU-B可能在短时间内还会读到旧值,但协议保证“最终”B能看到新值。中间这段时间,软件自己负责处理。
这就像一个单位的文件流转制度:不是每份文件签署后立即传真给所有部门,而是每天下班前统一归档,各部门第二天上班时从档案室调阅最新版本。它的时效性比实时同步低一点,但系统可以做得很大、覆盖范围可以很广。
由于在芯片近端便使用了光通信作为传输介质,中国算力可以横跨多个机柜,组成一个相对低延迟、高带宽的一致性通信域——这也就是华为可以部署高达128个计算柜、32个互联柜、8192个NPU体量的“超节点”的原因。
埋下超越英伟达的可能
那么为什么说这次不仅是Kimi的高光时刻,更是国产算力的高光时刻?
原因藏在Kimi K3随模型披露的技术博客中。
K3模型的参数总数高达2.8万亿,其无疑需要更大规模的多卡协同才能实现模型的加载。
同时,在推理架构上,K3采用了国产模型普遍使用的MoE(混合专家模型)。不过,K3采用的专家数量首次提升至896个。也就是说,K3首次引入了早前还在学术论文中的“WideEP”——即“大规模专家并行”的结构。
具体怎么做呢?在K3的模型算力部署端,896个专家会被平均部署到64张算力卡上,每张卡恰好对应14个专家;这个算力架构要求集群内部具备低时延、高带宽的特点,因此只有包括华为、英伟达在内的“一柜多卡”超级算力集群,才能承接这样的配置需求。
鉴于此,K3才会特地把“64卡及以上超节点”写进官方推荐配置。
但是,英伟达NVL72本身的延展性,无疑受限于铜互联的物理极限。
我们不妨假设一个场景。未来,Kimi或其他国产模型厂商发布了更多基于“大规模专家并行”策略的模型,专家数量、算卡数量需求开始“指数级增长”,那么即便英伟达拥有高带宽的优势,其单域规模上限的劣势,却会被“大规模专家并行”的架构放大。
反倒是国产算力,从算力芯片设计之初,到集群架构总体设计,早就完成了与国产模型工程架构的适配与互补。“大规模专家并行”与“超节点”,反而成了反超海外AI前沿配套的黄金搭档。
国产算力集群固然有其短板,如单卡带宽低、数据同步有延迟。但在“大规模专家并行”策略中,这些问题恰好不那么尖锐。其原因有两条:一是K3的专家权重是固定的,在推理任务时不涉及修改,不需要卡间实时同步;二是K3的缓存数据要么是只读的旧内容,要么是每步新增的新内容,不存在两张卡同时改同一份数据的情况。所以华为用“同步稍慢”换取“域更大、跨机柜”的架构,反而成了K3这种模型最适合的底座。
此外,Kimi K3的种种架构创新,如创新的注意力机制KDA、分发机制Stable Latent MoE等,都体现出对国产算力“单卡不足,集群来补”特点的适应性。
而K3的跑分登顶,恰恰证明了“大规模专家并行”策略的优越性,也进而证明国产算力“超节点”真的可以跑前沿模型。
当然,“超节点”并非毫无缺点——华为NPU的算力相比英伟达GPU仍有差距。这意味着通过堆叠更多机柜构建的超节点,其功耗往往要超过提供同等算力的NVL72。但是,中国在发电量和电网配置能力上有优势,超节点的功耗和成本问题可以被这些优势所弥补。
与此同时,中国在算力设施的基础能力上,拥有更强的光通信产业化基础。这也令以光通信作为主流通信介质的超节点架构非常契合国内的优势产业。
Kimi K3的发布被许多人理解为“DeepSeek时刻”的2.0再现。但是,从算力适配的角度看,K3的发布其实更接近“国产算力1.0时刻”。

更多内容请下载21财经APP
大家都在看
-
诺兰电影《奥德赛》登顶环球影业影史全球票房冠军 IT之家 9 月 13 日消息,环球影业今日宣布,诺兰新片《奥德赛》登顶环球影业影史全球票房冠军。IT之家查询获悉,本片全球票房已突破 15.63 亿美元(IT之家注:现汇率约合 105.2 亿元人民币),拿下 2026 年意大利、 ... 世界最重09-21
-
2026上半年全球新能源车销量榜出炉,问界全军未入前20 #王阳新座驾比亚迪海狮08##长文创作激励计划#榜单一出来,朋友圈就炸了。特斯拉Model Y上半年狂卖576921辆,稳稳守着头把交椅;比亚迪宋PLUS排第三,吉利星愿第四,光比亚迪自己就有8款车杀进全球前20;小米造车 ... 世界最重09-21
-
中国把多余的电压进千米地底!效率72%全球第一,西方惊呆 地下1000米藏了个“充电宝”!西方看完直呼看不懂,中国这波操作太绝了前言深夜两点,风电场疯狂转动的风机发出的电没人用,只能白白浪费,这在过去是中国新能源行业的“心头病”。如今,这个难题有了一个匪夷所思的 ... 世界最重09-21
-
全球超大型贫民窟TOP10,百万人口扎堆求生,贫富差距一眼看透 人间的繁华与荒芜,从来都在同一颗星球并存。联合国人居署长期深耕全球人居环境调研,发布的权威数据显示:全球近10亿人口,被迫栖身于各类城市贫民窟中。这些区域没有正规住房、没有稳定净水、没有完善排污系统,医 ... 世界最重09-21
-
23岁,大满贯亚军,最高世界第四:郑钦文能成为世界第一吗? 2026年美网,郑钦文从世界排名第121位、从资格赛打起,一路杀进八强,单届赛事狂升69位,即时排名回到第52位,收获470个积分和92.6万美元税前奖金。美网结束后,一个问题开始在评论区反复出现:郑钦文未来能成为世界 ... 世界最重09-21
-
360米,全球最高测风塔落成木垒 9月17日,80万千瓦实验风电场360米测风塔在木垒县落成,全国风力发电标准化技术委员会同期授牌“风电标准技术验证基地”。这是全球风电行业已建成的最高测风塔,标志着我国在高空风观测与风电标准技术验证领域迈上新 ... 世界最重09-21
-
最胖的男人,减掉249公斤后,终于可以下床走路了 吉尼斯纪录作为确认世界之最的国际权威和标准,可以说是每个人都梦寐以求的一项称号了,毕竟这代表着在某一领域上处于世界第一的位置,光是说出去就够吓人一跳的了,但事实证明并非每个领域的头名都令人向往,有些人 ... 世界最重09-19
-
亚洲、欧洲:全球冰崩加剧,气候变化到底多大了?人类该怎么办? 亚洲高山冰雪崩塌带来影响,让世界都知道了,气候变化背后的严峻性,然而?这并非是亚洲单独的问题,在世界其他区域也出现了这样的情况。这不,来自阿尔卑斯冰川和永久冻土加速消融,也引发了连锁效应出现了,这都凸 ... 世界最重09-16
-
全球市场突遭“三高”袭击!美债突破5%、油价逼近110美元,黄金美股重挫,关键一周来了 FX168财经报社(北美)讯 周一(9月14日),全球金融市场在美联储关键利率决议前出现明显重新定价。美国10年期国债收益率盘中一度升破5%,触及5.014%,创2023年10月以来最高水平;布伦特原油最高升至109.80美元/桶,美国 ... 世界最重09-16
-
400分赛事日本全主力二线出击,女单四强零对手,国乒年轻人在哪 00分的小站,日本女乒把它打成了自己的“实战实验室”北京时间9月13日,WTT常规挑战赛帕纳久里什泰站接近尾声。这站比赛在保加利亚打,9月8日开赛,冠军只有400个世界排名积分,总奖金10万美元。什么概念?同期澳门 ... 世界最重09-16
相关文章
- 400分赛事日本全主力二线出击,女单四强零对手,国乒年轻人在哪
- 全球最贵“实习生”,身价220亿
- 刷新影史纪录!荷兰弟登顶全球票房最高演员,成最年轻票房王者
- 年度积分最高者,BLG以LPL二号种子身份出征世界赛
- 世界各国货币最大面值一览!
- 标题:一台车卖2亿!全球最贵汽车盘点,有钱也未必能买到
- 世界上最胖的10个人有人体重超千斤连出门都要拆掉墙壁
- 朋友圈都在晒高光,你的“啥也没发生”,才是最贵的奢侈品
- 以色列预测,未来10年的全球科技实力最强“6个国家”,都有谁?
- 8月成76年全球最热月份,海洋热浪、强厄尔尼诺叠加加剧气候危机
- “最佳睡眠时间”出炉!睡多睡少都折寿,关键是把握这几个时间
- 全球公认“最高级抗衰”动作:练对就能把老化速度按下去
- 百万吨铜堆满美国仓库!七成全球现货在手,到底图什么?
- 世界最贵的账单,不是钱能付清的。
- 长鑫利润率反超三星SK海力士:存储芯片企业全球最高
- GPT-6闯入物理世界,哪个变量最限制机器人走进真实世界?
- 新加坡不是最贵城市了?真相是…
- 美商务部长曾炮轰中国芯片:天天说制造先进芯片,但中国根本没有
- 刘翔安置话题持续发酵,奥委会发布动态,苏炳添昔日评价再被翻看
- 不只赢在电动!日媒拆解吉利混动:发动机已进入世界最高水平
热门阅读
-
世界上最重的螃蟹,塔斯马尼亚帝王蟹重达45公斤 07-13
-
世界上最胖的女人,体重达1400斤(图片) 07-13
-
最重的十岁男孩,重达384斤 08-08
-
世界最大最重的蔬菜沙拉,重达19.05吨 04-26
-
世界上最重的动物排名:蓝鲸、非洲象、海牛、猛犸象 05-12
-
世界上最強壮的七个巨兽 12-28
