据智谱官微,为收集广大用户的广泛、专业反馈,GLM-5.3-Flash 在正式发布前,以匿名模型 Ox-Alpha(中文社区称作“牛来”)在 OpenCode 和 OpenRouter 上进行了大规模测试。Ox-Alpha 迅速成为当周最受欢迎的模型,创下双平台调用量新高。而这些请求流量全部由国产芯片提供算力支持。“过去一周,我们首次在大规模流量中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接。”智谱表示。“与同一硬件上的初始基线相比,端到端服务性能提升了 3 倍,硬件效率和单 token 成本已达到与主流英伟达 GPU 相当的水平。这证明国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。”智谱称。