全球最大的芯片,怎么做到的?

发布者:唐山乌木 2026-8-21 10:12

[0,15457]<0,15457,0>咱们今天要聊的是,Cerebras Systems 这家公司。嗯他们是怎么通过,新的机架设计和对老的计算引擎进行超频。来让自己在这个 AI 硬件的领域里面,可以和英伟达这样的巨头去掰掰手腕。[15457,4709]<0,4709,0>是啊,这个话题确实很有意思,那我们就直接开始今天的讨论吧。[20166,11219]<0,11219,0>先来说说 Cerebras 公司最新系统 CS 四的发布。以及他们这个融资和上市的一些情况,大家都很关心嘛就是说,外界对于这个 CS 四的发布时间点到底是怎么看的?[31385,28898]<0,28898,0>外界的预期一直都挺高的,很多人都希望说今年夏天就可以看到 CS 四亮相。作者在二零二五年十月份的时候,根据 Cerebras 当时手头有的十一亿美元的融资。以及他们当时还没有上市的这个情况。预测的是 CS 四会在二零二六年的八月发布。那现在来看的话这个预测是对的,OK 那也说明就是说。Cerebras 的这个资金流和他们的上市的计划确实是,直接影响了大家对于他们新产品发布节奏的判断。[60283,8762]<0,8762,0>了解了,那这次 CS 四系统里面到底有哪些新的设计?然后哪些是大家之前期待的,但是没有上的一些技术?[69045,31010]<0,31010,0>这次的 CS 四呢其实它是带来了全新的系统架构。还有就是全新的机架设计,OK 它的这个内部代号呢叫 Nexus。然后它也是为 Cerebras 之后的机器打基础的一个东西。那比较遗憾的就是说,大家期待的这个 WSE 四的计算引擎没有出现。其实在去年的十月份。作者也是一度认为说会有这个新一代的引擎。但是其实 CS 四里面用的还是,WSE 三的一个超频的版本。[100055,6867]<0,6867,0>WSE 三 Turbo 这个计算引擎。它到底在硬件的规格上面,和制造工艺上面有哪些值得聊的?[106922,29041]<0,29041,0>这个 WSE 三 Turbo 它其实还是,呃九十万个核心。然后呢四十四 G 的这个片上 SRAM,它依然是台积电的五纳米的工艺。但是呢它是台积电五纳米工艺的一个增强版。所以它比,二零二四年三月份推出的那个 WSE 三,在运算能力上面直接提升了一倍。嗯那这主要的原因就是因为它的这个主频。从一点四 G 赫兹提升到了二点八 G 赫兹,就是它的这个频率直接翻倍了。[135963,7838]<0,7838,0>既然频率提升这么明显,那这个 WSE 三 Turbo 在供电和散热上面,是不是有一些特别的设计?[143801,23662]<0,23662,0>没错没错,因为这个 CS 四的这个晶圆它在封装的时候。它的这个功率输入是翻了一倍的。然后呢冷却能力也比以前强,就略多于两倍。OK 所以它才可以在保证这个芯片不会过热的前提下。把这个时钟频率提升到两倍,同时呢也解决了,早期的这个版本在供电和散热上面的一个瓶颈。[167463,21177]<0,21177,0>明白了,那我们接下来要聊的就是这个 Cerebras 系统的这个未来的路线图的展望。以及他们这个 SRAM 容量的这个瓶颈的问题。大家都想知道就是说,这个 CS 四 Plus 或者说这个 CS 五,有没有可能通过升级到这个 WSE 四引擎。来打破目前多机并行推理时遇到的一些限制?[188640,29028]<0,29028,0>对这个是很多人关心的,就是说之前的那些系统。像 CS two 和 CS three,他们因为这个晶圆级引擎的这个 SRAM 容量有限。所以他们在跑一些前沿的模型的时候,就需要多台机器并行。那其实现在可能就需要几十台机器。那如果说未来的这个,CS 四 Plus 或者说 CS 五,嗯哼如果说能够用上这个 WSE 四的话。就有可能会缓解这个问题。[217668,8465]<0,8465,0>如果真的要推出 WSE 四的话,你觉得它在核心数、SRAM 容量和 I/O 带宽这些方面可能会有哪些升级?[226133,28634]<0,28634,0>作者其实有设想过就是说,WSE 四 Harder 这个版本,嗯他的这个核心数会提升到一百万。然后 SRAM 会提升到三百二十个 G。同时呢这个时钟频率会固定在二点八 G 赫兹。另外呢就是这个 I/O 子系统的带宽会翻倍,就是它的这个总带宽会达到二百四十八 P B 每秒。那这样的话就会让这个,引擎的整体的性能和这个内存的访问,会更加的平衡。[254767,7689]<0,7689,0>好的,那就是 Cerebras 公司的高层,对于这个未来的产品性能的提升,有没有给出什么具体的目标?[262456,18990]<0,18990,0>他们的这个 CEO 有公开表示说就是,Nexus 这个机架的设计是会至少沿用三代。然后呢他们的这个 CTO 也承诺了就是说,从现在开始到二零二九年。每年都会把系统的吞吐量提升一倍,OK 那这个其实是远远超过了摩尔定律的这个速度。[281446,5790]<0,5790,0>每年翻一番这个目标确实很激进啊,对啊那他们打算怎么实现这么快的一个性能提升呢?[287236,30765]<0,30765,0>具体的这个实现的细节他们没有讲,但是他们就是说会,持续的增加这个 SRAM 的容量。来让这个核心的效率可以不断的提升。他们也承认就是说,WSE 三以及 WSE 三 Turbo,其实在 SRAM 的带宽上面都是有瓶颈的。那他们也在考虑就是说未来要上这个,三维的 SRAM 堆叠。嗯来解决这个内存墙的问题,那他们也明确说了就是说。不会通过减少核心的数量这种方式,来提升这个 SRAM 的容量。[318001,18145]<0,18145,0>那我们接下来的主题就是这个 Nexus 机架式系统的详细的设计。以及它带来的这种可升级性,可扩展性的提升,OK 那这个全新的设计到底是。怎么做到让这个计算晶圆,主机 CPU,还有就是电源和网络,这几个部分可以独立的升级的呢?[336146,38969]<0,38969,0>这个 Nexus 它最大的特点就是,它把这个计算晶圆。和这个 AMD 的 EPYC 的主机 CPU,电源组,网络接口。全部都分开了,做成了单独的模块,那这样的话。每一个部分都可以单独的进行升级,或者说进行维护,嗯那比如说这个。网卡它是一个模块化的,那它就可以支持像 OpenAI 和 AWS 这样的一些合作伙伴。可以灵活的去选择,他们想要的网络接口,然后直接连到这个 WSE 引擎上面,那这个对于。推理的预填充,以及这个生成式 AI 模型的训练来说都是非常有用的。[375115,7167]<0,7167,0>这个 Nexus 机架在结构上面有什么特别的地方,然后它在制造或者说在部署的时候有什么优势吗?[382282,29055]<0,29055,0>首先它的前面是三个电源架,然后后面是插着三个 CS 四的计算背包。这种垂直的模块化的设计,让他们实现了百分之六十的制造自动化。所以他的这个组装效率是非常高的,嗯然后另外呢就是。整个这个机架,它的计算能力是比 CS 一到 CS 三,提升了三倍的。那如果说,在散热允许的情况下,一个机架可以装下两套 Nexus,并且还可以很方便的去扩展网络和存储。[411337,5901]<0,5901,0>既然如此,那这个新的设计到底在哪些方面,对大规模的集群部署进行了优化呢?[417238,26139]<0,26139,0>它的这个组件数量比之前减少了一半。然后呢它的部署速度是可以达到,旧系统的三倍。同时呢这个背包它的重量是在一百磅左右,对它是可以分开运输的。就是它可以先把这个机架和电源先运过去。然后等现场都准备好了之后再运这个 SWE 背包,嗯所以这个就大大提高了,整个系统的这个部署的灵活性,也让这个供应链的管理变得更轻松。[443377,12472]<0,12472,0>我们再把关注点聚焦到这个 CS 四的这个背包的内部结构,以及它的这个 I/O 的网络的升级。嗯,你能给大家讲一讲就是这个 CS 四的这个背包里面,各个组件是怎么布局的吗?[455849,18475]<0,18475,0>CS 四的背包它的,后面部分是电源模块。然后 WSE 三 Turbo 模块是在它的上面,再下面就是一块冷板。然后通过很多螺丝把它们全部都固定在一起,OK 网卡呢是有两张,一张在顶部一张在底部。整个这个结构非常的紧凑,而且也方便维护。[474324,5905]<0,5905,0>明白了,那这个 CS 四在网络 I/O 上面,相比之前的那些系统有哪些提升呢?[480229,20620]<0,20620,0>它这个新的系统呢采用的是,新型的高速晶圆链路。然后每一个晶圆的 I/O 模块上面有六个以太网的端口。然后每个端口的速度可以跑到两百 Gb/s,OK 那这个是比。CS 一到 CS 三的那个百 Gb/s 的接口,单端口的带宽直接提升了一倍。[500849,4551]<0,4551,0>端口速度提升这么多,是不是意味着这个集群的扩展性也有大幅提升?[505400,21080]<0,21080,0>理论上来说是这样的,就是网卡的数量翻倍之后。这个 CS 四应该是可以支持超过两千零四十八个节点的数据并行集群的。对,但是呢 Cerebras 官方还没有明确的说,他们的这个拓扑结构和网卡的基数到底能不能支持到这么多,然后也没有说到底能不能突破这个两千零四十八的这个上限。[526480,6735]<0,6735,0>那这个 CS 四它在网络功能上面有哪些,新的特性是可以帮助这个大规模的集群的呢?[533215,23079]<0,23079,0>它的这个网络硬件是支持,可编程的低延迟的数据包流水线。然后也支持这个晶圆之间的直接互联,OK 所以它的这个配置是非常灵活的。另外呢就是它也跟这个以太网交换机的厂商 Arista Networks 合作。可以很容易的去扩展这个集群的规模。同时呢也可以让用户的网络和存储的前端的网络,连接的更加高效。[556294,7402]<0,7402,0>好的,然后关于这个 CS 四系统的这个上市的时间,以及信息的来源,就是这个产品现在市面上能买到了吗?[563696,15389]<0,15389,0>现在已经有部分的客户可以提前去试用这个 CS 四了,然后全面的上市时间是定在。今年的第三季度的晚期,嗯然后这个所有的这些信息都是。编译自 next platform 这个网站的报道。[579085,18709]<0,18709,0>行吧,今天我们其实就是给大家梳理了一下 Cerebras 最新的这个 CS 四系统。它是怎么通过这种老的芯片超频,加上全新的机架设计。去试图挑战英伟达在 AI 计算市场的这个地位,然后顺便展望了一下 Cerebras 未来可能会有的一些突破。[597794,6668]<0,6668,0>好了那么这期节目咱们就到这里啦,然后感谢大家的收听咱们下期再见,拜拜拜拜。

大家都在看