Rain科技8月31日消息,前不久Ox-Alpha牛来大模型引发网络热议,它最终揭开身份就是智谱的GLM-5.3 Flash,这是一个不靠NVIDIA显卡而是10万张国产AI芯片支撑的大模型。
智谱今天也发布了上市后的首份半年报,就提到了这批国产AI芯片的信息,称公司目前已经实现10万级国产芯片的规模化低成本推理,单位Token推理成本较年初下降80%。
智谱提到,这批国产算力此前已经经过真实流量压测。GLM-5.3-Flash发布前以Ox-Alpha 匿名上线OpenRouter和OpenCode等平台,Token调用量达到62万亿。值得关注的是,采用国产芯片构建推理系统,在成本和供应链安全上具有战略意义。相比于依赖海外高端GPU,国产芯片虽然单卡性能仍有差距,但通过大规模集群和算法优化,正在逐步缩小与行业标杆的差距。智谱此次将单位Token推理成本降低80%,不仅展示了国产芯片的潜力,也为国内AI企业探索了一条可行的“去英伟达”路径。
在这款大模型正式发布后,全部线上流量也继续由10万张国产芯片承载——只不过智谱依然没有透露这个10万张国产显卡的推理系统到底是来自于哪家公司。目前国内能够提供万片级AI芯片的厂商包括华为昇腾、寒武纪、海光信息等,但具体是单一供应商还是混合方案尚不得而知。从技术角度看,十万级芯片的协同调度和稳定性本身就是巨大挑战,智谱能实现规模化推理,说明其在分布式计算、故障恢复和算力池化方面已具备成熟方案。
业绩方面,智谱公司上半年收入达到9.54亿元人民币,同比增长399.7%,接近去年同期的 5倍。
增长主要来自开放平台和 API,收入从2910万元增至8.25亿元,同比增长2735.7%,已经占总收入的86.5%。这一数据反映出大模型商业化正从“烧钱抢市场”转向“API服务变现”阶段,企业客户对模型调用需求的爆发式增长是核心驱动力。
智谱的API业务毛利率也从去年同期的-0.4%升至24.6%,主要靠调用规模扩大、定价上调和推理成本下降。值得注意的是,即使推理成本大幅下降,毛利率依然不到25%,说明大模型服务的定价竞争依然激烈,且研发投入、服务器折旧等前期成本仍需长时间摊销。
不过智谱的亏损依然很高,同时研发也在大规模投入,上半年研发支出21.31亿元,同比增长33.6%;经调整净亏损19.64亿元,比去年同期的17.52亿元扩大12.1%。这种“增收不增利”的现象在AI行业并不罕见,尤其是基础大模型厂商需要持续投入算力、数据和人才。从行业横向对比看,智谱的研发支出占营收比例高达223%,远高于传统科技企业,但其API收入增速(2735%)也远超亏损增速(12.1%),说明单位研发投入带来的收入效率正在提升。若推理成本继续下降,盈亏平衡点有望在未来1-2年内出现。
