Cerebras发布CS-4:推理速度号称GPU的30倍,晶圆级芯片掀了算力的桌子

来源:互联网 时间:2026-08-20

AI芯片公司Cerebras发布了新一代AI加速器CS-4,喊出的口号相当激进:推理速度最高可达基于GPU方案的30倍。

先看硬参数。CS-4搭载三颗新型WSE-3 Turbo晶圆级引擎,AI算力750 PFLOPS,内存带宽129.6 PB/s。在GPT-OSS-120B模型的测试中,CS-4实现每用户每秒生成超过4400个token——这个数字对体感的影响是:生成速度超过了人的阅读速度,AI对话第一次做到了零等待。官方还给出两个对比数据:每瓦吞吐量最高是上一代CS-3的10倍,可支持超过50万亿参数的模型。CS-4预计今年第三季度开始出货。

Cerebras的路数跟主流完全不同。英伟达的GPU是把众多小芯片封装组合,Cerebras直接在一整块晶圆上造一颗巨大的芯片——晶圆级引擎(WSE),单颗芯片的面积比一张光盘还大。这个思路的出发点很朴素:芯片越大,计算单元之间的通信距离越短,内存带宽就越高,推理时token就不用排队等数据搬运。所谓30倍速度,本质上是大内存带宽对GPU的碾压——GPU推理慢,慢就慢在数据搬运上,不在计算上。

当然,宣传数字听听就好。实际部署中,CS-4未必在所有场景保持这种优势:晶圆级芯片良率天然偏低,成本高企,供电和散热都是绕不开的坎,而GPU生态的护城河从来不在硬件参数,在CUDA和十几年攒下的软件积累。买AI芯片的决策链里,软件兼容性的权重往往比峰值性能更高。

不过CS-4的发布时机很微妙。就在同一天前后,AI芯片初创公司Fractile被曝正以65亿美元估值洽谈融资,Anthropic已经答应采购约2.5亿美元的芯片。再加上OpenAI自研芯片的传闻、谷歌加码TPU供应链、各家云厂定制芯片轮番上场,推理算力市场正在从英伟达一家独大,变成多方围剿。

推理是AI商业化真正的成本大头。训练一个大模型是一次性投入,推理是每天睁眼就要烧的钱——谁跟你说他家AI产品不缺算力,多半是在硬撑。谁能把推理成本打下来,谁就握住了AI普及的闸门。CS-4是不是那个答案还不好说,但桌子已经有人掀了,英伟达的好日子,至少不会像以前那么安稳。

相关文章

A5创业网 版权所有

返回顶部