查看: 3|回复: 0

国产 TPU 千卡集群在 WAIC 落地:中昊芯英把“单颗芯片”推进到整套算力

[复制链接]

894

主题

0

回帖

13

积分

内容编辑

积分
13
发表于 3 小时前 | 显示全部楼层 |阅读模式

中昊芯英在 WAIC 2026 官方企业目录使用的品牌资产,经等比例置入统一画布。 来源:WAIC 2026 官方企业目录


AI 芯片放在展柜里容易吸引目光,真正交给开发团队时,问题会迅速变成另一套:一千张卡怎样互联,模型怎样迁移,任务中断后怎样恢复,闲置算力又如何被调度。

WAIC 2026 期间,中昊芯英、杭州电信与中兴通讯宣布国产 TPU 千卡智算集群项目落地。中昊芯英提供“刹那”TPU 和“泰则”集群体系,杭州电信负责算力运营平台,中兴通讯参与集群建设。国产 AI 芯片的竞争,正在从一颗芯片的参数走向一整套可交付系统。

这次发布的重点,是千卡系统已经有了运营方
新华网报道,这套项目在 WAIC 主题分论坛现场宣布落地。与只展示芯片或服务器不同,它同时包含计算集群和面向外部使用的算力运营平台,目标是把异构算力调度、模型服务和安全管理接起来。

中昊芯英现有产品以“刹那”TPU 为计算单元,并用“泰则”服务器和集群系统组织更多芯片。公开资料显示,该体系面向大模型训练、自动驾驶模型和科学计算等高强度任务。

“千卡”说明了部署规模,却不能直接代表任何模型的实际速度。模型结构、并行策略、通信效率、数据读取和故障恢复都会影响最终利用率。

开发团队真正关心的,是现有任务能否顺利迁移
大量 AI 项目已经围绕主流 GPU 软件生态建立训练脚本、算子库和运维工具。换到另一种芯片架构后,如果需要重写大量代码,硬件带来的成本优势可能被迁移周期抵消。

因此,这套集群后续最值得观察的是常见模型和框架支持范围、编译与算子适配、跨节点通信效率,以及出现单卡或链路故障时任务能否继续。

杭州电信作为运营方加入,也意味着客户未必需要一次买下整套机器,而可能按项目获得算力服务。价格、排队时间、数据隔离和服务等级,会直接决定这种模式是否好用。

从芯片发布走到长期运行,才是国产算力的下一场考试
WAIC 给出了项目落地节点,但千卡集群的价值要靠真实工作负载验证。持续训练时的吞吐、能耗、集群可用率和故障恢复时间,比展台上的峰值参数更接近用户每天面对的问题。

对准备迁移的团队来说,可以先选择一个已有基准的模型做小规模试跑,记录精度差异、适配工时和单位任务成本,再决定是否扩大规模。

国产 TPU 从单芯片走向千卡运营集群,是一条重要进展。接下来若能公开更多可复现测试和客户迁移案例,开发者才能更清楚地判断它适合哪些任务。

想继续了解
新华网:国产 TPU 千卡智算集群项目落地
CITE:中昊芯英芯片与集群产品资料
WAIC 2026 官方企业目录
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

快速回复 返回顶部 返回列表