8月26日晚,智谱在其官方公众号发文,正式上线并开源GLM-5.3-Flash(320B-A18B)。这款模型此前以匿名身份“Ox-Alpha”在海外社区走红,被网友戏称为“牛来”。发布前一周,它在OpenRouter和OpenCode两大海外平台登顶,单日处理Tokens高达62T,并且这些流量全部由国产芯片提供算力支持。

这是国产算力芯片第一次大规模集体“出海”服务全球真实负载。智谱透露,过去一周首次在大规模流量中尝试用大国产芯片集群提供服务,通过自研高带宽互联网络连接。与同一硬件上的初始基线相比,端到端服务性能提升了3倍,硬件效率和单Token成本已经达到与主流英伟达GPU相当的水平。
价格方面,GLM-5.3-Flash直接加入了模型价格战。它在基准测试和真实使用中全面超越参数量高出一倍的上一代旗舰GLM-5.2,但定价仅为后者的1/10。在Artificial Analysis榜单上,GLM-5.3-Flash分数与Anthropic的Claude Opus 4.8持平,但价格只有Opus 4.8的1/40。
支撑低价的是架构层面的重构。GLM-5.3-Flash采用稀疏注意力与线性注意力混合架构,注意力计算量与KV缓存分别降低3.01倍和4.44倍。这意味着省掉了将近67%的运算量和超过77%的显存开销。对开发者来说,相当于用普通模型的成本调用旗舰级别的能力。
智谱这种“匿名模型测榜后再认领”的打法,正在成为国产大模型出海的新套路。今年春节前夕,OpenRouter上也曾出现名为Pony Alpha的神秘模型,后来被证实是智谱的GLM-5。通过先让海外社区自发传播性能数据,再正式公布身份,厂商既能降低发布前的营销成本,也能拿到真实的全球用户反馈。
A5创业网 版权所有