东方算芯把 14nm 芯片带到 WAIC:DF1000 想绕开“内存墙”
东方算芯在 WAIC 2026 展示 DF1000,并获得 SAIL 卓越奖。这颗芯片没有追逐先进制程,而是用软件定义架构和 3D 近存计算缩短数据搬运距离。
大模型芯片的新闻,通常从更先进的制程和更大的算力数字开始。东方算芯这次换了一个问题:如果暂时不追逐最先进制程,能不能先把计算和存储之间来回搬数据的距离缩短?
7 月 18 日,东方算芯的 DF1000 在 WAIC 2026 获得 SAIL 卓越奖。几天前,这家公司刚在上海发布围绕 DF1000 的加速卡、一体机、超节点和集群。它最值得看的地方,不是又多了一颗国产 AI 芯片,而是选择了一条“软件定义加 3D 近存计算”的不同路线。
它没有从先进制程开始,而是先处理数据搬运
训练和运行大模型时,计算单元并不是一直在做运算。大量时间和能耗花在把参数与中间结果从存储搬到计算单元,再把结果写回去。模型越大,这种等待越容易成为系统瓶颈,也就是行业常说的“内存墙”。
东方算芯公开的方案是把逻辑晶圆与存储晶圆做 3D 垂直连接,让数据不必在较长链路上往返。公司给出的 DF1000 指标包括 520TFLOPS 的 BF16 算力、6.4TB/s 单卡访存带宽和 900GB/s 卡间互联带宽。
这些数字目前主要来自公司发布与转述材料,不能直接等同于各种大模型任务中的最终速度。芯片真正进入训练和推理集群后,编译器、算子覆盖、通信效率、稳定性与功耗会一起决定可用表现。
14nm 不是卖点,架构能否补足制程差距才是问题
DF1000 使用成熟制程,把竞争重点放到架构和封装。对国内算力企业来说,这条路线的现实意义很清楚:先进制程与高端存储供应受限时,先从数据流和封装方式里寻找增量。
但成熟制程并不会因为换了架构就自动变成先进制程。3D 堆叠会带来良率、散热、制造复杂度和成本问题;软件定义架构也需要工具链把不同模型高效映射到硬件上。
东方算芯董事长魏少军在公开采访中也没有把 3D 堆叠说成万能答案。他强调,堆叠主要解决带宽问题,真正要提高硬件利用率,还要依靠软件定义的数据流架构。
从一颗芯片到四类设备,决定客户要改多少现有系统
东方算芯没有只发布裸芯片。公开产品矩阵包括 DF1000 加速卡、面向中小客户推理场景的擎元 QY100 一体机、拓域 TY64 超节点服务器,以及慧算 HS128 大规模智算集群。
这套组合试图覆盖从单机推理到大规模训练的不同入口。对采购方来说,关键不是产品名有多少,而是现有服务器能否安装、主流框架能否迁移、常用模型需要改多少代码。
公司称编译器、通信库和算子库均为自研,并支持主流深度学习框架。下一步更需要看到公开兼容清单、部署文档、典型模型结果和长期运行数据。
SAIL 奖让路线被看见,但量产和生态才是硬仗
DF1000 在本届 WAIC 获得 SAIL 卓越奖,说明这条技术路线得到了大会评审的关注。奖项可以提高行业能见度,却不会替代量产、交付和软件适配。
AI 芯片最难的阶段往往发生在发布会之后:不同服务器平台要完成验证,框架和模型不断更新,客户还要比较稳定性、单位成本与迁移风险。
东方算芯公布的路线图还包括 2026 年第四季度的 DF2000 和 2027 年的 DF3000。路线图能否按时落地,需要继续观察流片、量产、整机验证和真实客户部署。
真正值得追踪的,是一套模型迁过来要花多久
对普通用户来说,芯片架构很远,但它最终会落到云服务价格、模型响应速度和可获得的算力上。更多可用算力路线出现,意味着开发者不必只在少数硬件选择之间排队。
对小团队而言,最实际的问题是迁移成本。如果一个现成模型能在几天内完成适配并稳定运行,这条路线才会从实验室创新变成可采购的生产工具。
所以 DF1000 下一阶段最有价值的消息,不会只是更大的峰值数字,而是哪些框架、模型和整机已经跑通,部署需要多少工程工作,以及长期运行时的能耗、稳定性和总体成本。
想继续了解
• WAIC 2026 官方展商名录
• 东方算芯官网与 DF1000 产品信息
• 广州市科技局转载广州日报:DF1000 发布
• 人民网:国产 AI 芯片新突破
• 新浪财经 WAIC 现场:DF1000 与 SAIL 奖
一起维护这篇内容
我要更新 发现链接失效、信息过时或内容有误,可以提交更新建议。


交流讨论
最新评论