刚刚,智谱建了一座只用国产芯片的数据中心

HelloKitty 2026-07-22 15:12

扫一扫 在手机阅读、分享本文

105

本文由 AI科技评论 撰写/授权提供,转载请注明原出处。

以下文章来源于:AI科技评论

作者:郑佳美

编辑:马晓宁

过去两年,全球人工智能行业最抢手的东西,是英伟达 GPU。

从 OpenAI 到 Meta,再到 Google、Amazon,几乎所有希望在 AI 领域占据优势的公司,都在争夺计算资源。

行业最初盯着模型能力,后来逐渐发现,模型背后的那套“机器”,同样决定着迭代速度。

算法可以调整,数据可以补充,算力中心却不能临时搭建。

芯片要提前采购,机房要提前建设,电力也要排队接入。等模型方案确定后再寻找资源,往往已经晚了。

于是,AI 行业出现了一个颇有反差的场景:一群研究最前沿软件的公司,开始忙着找土地、谈能源、修数据中心。

就在这轮建设潮中,智谱完成了一座规模达到 1GW 的 AI 数据中心。据彭博社报道,该中心全部采用中国制造的芯片,并将用于模型训练。

单独看,这像是一条国产芯片新闻。但放进全球 AI 公司的动作里,它更像一个新的产业信号:大模型公司正在从算力使用者,变成算力基础设施的组织者。

大模型公司开始提前备货

过去,大模型公司通常从云厂商手中购买算力。

这套方式适合创业初期。公司不需要自己买地、建机房,也不必管理复杂的硬件集群,租用 GPU 就可以开始训练。

但当计算需求从几百张芯片增长到几万甚至几十万张时,云端资源很难像水龙头一样随开随有。

前沿模型的训练可能持续数月,期间还要同时安排后训练、推理和大量实验。头部公司需要的已经不是一次性的计算资源,而是一套能够长期调动的系统。

OpenAI 因此推进 Stargate,首批设施从 1GW 级起步,整体规划达到数 GW;

xAI 在孟菲斯建设 Colossus,并把规模扩大到约 2GW;Meta 的 Hyperion 目标达到 5GW,其更大的基础设施规划还准备继续扩张;

Anthropic 则通过与 Amazon 的长期合作锁定约 5GW 算力。Google 很早就围绕 TPU 建立自己的计算集群,国内的字节和智谱也都进入了 1GW 级建设阶段。

这些公司的方式并不相同。有的直接修建园区,有的和云厂商深度绑定,有的拥有自研芯片。但它们面对的是同一个时间差:模型几个月就会更新一次,数据中心却需要几年才能建成。

今天签下的土地和电力合同,服务的可能是三年后的模型。所谓建设算力中心,其实是在为尚未确定的下一代技术提前留位置。

软件生意开始有了钢筋水泥味

算力中心把 AI 公司带进了一个陌生世界。

软件产品开发完成后,可以近乎零成本地复制给更多用户;数据中心却需要土地、变电设施、冷却设备、高速网络和长期能源合同。

服务器进入机房前,可能已经有数十亿美元投入到看不见的土建和供电工程里。

过去,一家 AI 公司最重要的能力是招到研究人员、训练模型和推出产品。现在,它还要处理电网接入、施工进度、设备折旧和资本安排。基础设施基金、能源企业、地产商和长期债务,也开始进入大模型产业链。

这让 AI 竞争多了一层赌注。

头部公司普遍相信,未来的模型会消耗更多计算资源,因此必须提前扩建。

但几年后的训练方式会不会改变,新增算力能否被充分利用,模型收入又能否覆盖持续增长的成本,目前都没有确定答案。

一座空闲的数据中心不会因为属于 AI 行业就变得更便宜。昂贵芯片只有持续运行,才可能转化为研发效率;一旦需求低于预期,它也可能迅速变成沉重的折旧负担。

算法公司最擅长预测下一个词,现在却不得不预测几年后的电力需求。

路怎么修?

智谱项目与海外同行最大的差别,在于它全部采用中国制造的芯片。

全球公司的底层选择已经开始分化:OpenAI 和 xAI 主要依赖英伟达,Meta 在采购英伟达的同时推进自研 MTIA,Anthropic 使用 Amazon Trainium 与英伟达,Google 坚持 TPU,字节的相关项目采用华为昇腾。

智谱则把整座 1GW 数据中心放在国产芯片体系上运行。

当模型公司只是在云上租用算力时,芯片更像一项被封装好的服务。

开始建设自己的数据中心后,底层硬件会牵动整套系统:服务器如何设计,芯片之间如何通信,编译器和训练框架如何适配,故障发生后如何恢复,都需要重新磨合。

单颗芯片能够运行模型,和成千上万颗芯片能够一起高效训练,并不是同一件事。

集群扩大后,任何通信延迟、软件兼容问题或者设备故障,都可能让大量机器停下来等待。

英伟达的优势,很大一部分来自 CUDA 和长期积累的工程生态。

使用这套体系扩建算力,更像在已经铺好的高速公路上增加车道。智谱面对的情况更复杂:它既要扩大车流,还要参与修路。

所以,1GW 只是一个工程规模,不能直接等同于模型能力。

这座数据中心最终有没有价值,要看它能否稳定承担大规模训练,是否能保持较高利用率,以及能不能真正缩短 GLM 系列模型的迭代周期。

只有当机房里的芯片持续转化成新的模型和产品,算力中心才不只是一个醒目的数字。

过去,人们习惯通过排行榜和发布会观察 AI 竞争。下一轮差距,可能在模型登场前就已经形成——藏在提前锁定的电力、尚未安装的服务器,以及那些需要几年才能建成的数据中心里。

智谱进入的,正是这场更慢、更重,也更难临时追赶的比赛。

参考链接:

https://www.bloomberg.com/news/articles/2026-07-20/z-ai-completes-giant-data-center-with-chinese-chips-to-train-ai

https://x.com/lentils80/status/2079270703224811777?s=46

微信图片_20260701173519_3_668.jpg

微信图片_20230104175528.jpg

扫一扫 在手机阅读、分享本文

扫码关注公众号

获取更多技术资讯

精选活动 更多 >

{{ val.activity_name }}

{{ val.province ? (val.province + ' ' + val.city) : val.location }}
客服微信
享受1V1专属服务
免费领取技术福利
发送名片申请入群
与CTO聊合作
(备注姓名、公司及职位)
热门文章