大模型上下文越拉越长,GPU 先扛不住了:天数智芯在 WAIC 发布天垓 300
https://waoo.ai/data/attachment/waoo-hardware/hardware-product--300/04-213293869825.png IT之家 7 月 19 日报道页面显示天垓 300 的发布时间、SIMT 架构和长上下文、MoE、多卡通信等优化方向。来源:IT之家 模型上下文从几千字拉到几万、几十万字以后,GPU 面对的已经不只是“算得快不快”。数据怎么在多张卡之间流动,Attention 会不会吃掉大量资源,MoE 模型能不能把
模型上下文从几千字拉到几万、几十万字以后,GPU 面对的已经不只是“算得快不快”。数据怎么在多张卡之间流动,Attention 会不会吃掉大量资源,MoE 模型能不能把专家调度好,都会直接变成等待时间和成本。
7 月 19 日,天数智芯在 WAIC 2026 发布新一代通用 GPU 旗舰产品天垓 300。它没有只把重点放在一个峰值算力数字上,而是把长上下文、MoE、推理阶段拆分和集群扩展列为主要优化方向。
它瞄准的不是单个算子,而是大模型跑起来后的堵点
公开报道显示,天垓 300 继续采用 SIMT 通用计算架构,可处理标量、矢量和张量计算,并针对 Attention、MoE、AF 分离、PD 分离和大规模系统扩展进行优化。这些名字听起来很技术,背后对应的却是同一个现实问题:模型越大、上下文越长,计算、显存和通信越容易互相等待。
Attention 需要处理上下文里大量词元之间的关系;MoE 模型要在不同“专家”之间分配任务;推理时把预填充和逐词生成拆开部署,又会带来不同的算力与通信需求。GPU 如果只在单项峰值上好看,进入多卡集群后仍可能被通信、调度和数据搬运拖慢。
天数智芯公布的对比数据称,天垓 300 在 64k 上下文 Attention、MoE、首字延迟和 Decode 阶段相对 Hopper 架构方案有不同幅度提升。这些数字目前主要来自发布方,报道没有给出完整测试模型、精度、功耗、显存配置和集群规模,暂时不适合直接理解成普遍领先。
“具备规模化应用条件”,还要经过服务器和软件生态这一关
厂商表示,天垓 300 已与国内云厂商、服务器厂商、互联生态和超节点系统开展适配,可以从单机扩展到规模化集群。对一颗面向训练和推理的 GPU 来说,芯片发布只是开始:服务器能否稳定供货、集群通信是否成熟、常用模型能否少改代码运行,都会影响真正上线的速度。
天数智芯官网目前列出了天垓 100、天垓 150、智铠和彤央等现有产品,也提供软件栈、文档中心、资源中心和开发者入口。截至发稿时,公开产品目录尚未出现天垓 300 的独立规格页,开发者还看不到完整硬件配置、支持矩阵和采购方式。
这也是“发布”和“可用”之间最需要补上的一段。模型团队真正关心的通常不是芯片名字,而是现有 PyTorch 工作流能否迁移、哪些算子需要重写、集群故障如何恢复,以及同一任务的总体成本是否下降。
下一步值得看的,是完整规格和外部测试
天垓 300 选择长上下文、MoE 和多卡通信作为发布重点,反映出国产通用 GPU 的竞争正在从“能不能跑”走向“复杂模型跑起来是否划算”。这比单独强调理论算力更接近日常训练和推理的真实矛盾。
但目前仍缺少几组决定采购判断的公开信息:显存容量与带宽、整卡和服务器功耗、互联方式、标准售价、量产交付时间,以及在同一模型、精度和批次条件下的独立测试。没有这些条件,厂商给出的百分比很难转换成用户最终支付的训练或推理成本。
如果后续产品页、开发文档和外部集群测试陆续开放,市场才能判断天垓 300 是一次针对大模型负载的扎实升级,还是仍需要较长适配周期的新硬件。对开发者来说,最实在的信号不是发布会上的一句“规模化”,而是拿到服务器后能多快把自己的模型稳定跑起来。
资料来源
• 天数智芯官网:现有产品体系、软件栈与开发者入口
• IT之家:天垓 300 架构、优化方向与发布方性能数据
• 上海证券报:中国证券网确认天垓 300 在 WAIC 亮相
• 人民网:WAIC 现场发布与长上下文、MoE 场景数据
• WAIC 2026 官方展商目录
一起维护这篇内容
我要更新 发现链接失效、信息过时或内容有误,可以提交更新建议。


交流讨论
最新评论