
图片来自 hothardware.com 的相关公开报道,展示产品、原型、使用场景或事件背景;具体信息以原始来源为准。 摄影/版权标识:hothardware.com。 来源:hothardware.com
当大多数AI开发者还在为云端API账单发愁时,AMD悄悄把一台能跑235B参数大模型的迷你PC塞进了你的桌面。Ryzen AI Max+ 395——这颗代号Strix Halo的处理器,集16个Zen5 CPU核心、40个RDNA 3.5 GPU计算单元和50TOPS NPU于一身,更关键的是它支持高达128GB的统一内存。这意味着,你不再需要为了一块24GB显存的RTX 4090掏空钱包,也不用每月支付数百美元给云服务商。GMKtec、Zotac、Aoostar等厂商已经推出了搭载这颗芯片的迷你PC,价格从1800美元到3999美元不等。AMD自家的Ryzen AI Halo也将在2026年6月开启预售。本地AI的算力门槛,正在被一颗芯片彻底打破。
目前能确认到哪一步
shipping(已出货)。多家厂商已推出搭载该芯片的迷你PC产品,如GMKtec EVO-X2、Zotac Magnus等,AMD官方Ryzen AI Halo迷你PC预计2026年6月开启预购。
统一内存:打破VRAM天花板
传统AI推理的最大瓶颈在于显存。一块RTX 4090只有24GB VRAM,连70B参数的模型都装不下,开发者只能转向云端。但Ryzen AI Max+ 395采用了完全不同的架构:CPU、GPU和NPU共享一个128GB的LPDDR5X-8000内存池,GPU可以从中划出最多96GB作为有效显存——是RTX 4090的四倍。这种设计让本地运行大模型成为可能。
内存带宽同样关键。该芯片的理论带宽约256GB/s,实测在Linux下配合ROCm可达215GB/s。对于大语言模型推理这种内存带宽敏感型任务,这个数字直接决定了token生成速度。当然,要发挥全部GPU性能,开发者需要手动配置AMD的ROCm软件栈,否则系统会默认使用CPU推理,速度减半。
性能实测:235B模型跑得动吗?
GMKtec EVO-X2是首款搭载Ryzen AI Max+ 395的迷你PC,在128GB配置下,它运行Qwen3-235B(混合专家模型)时能达到约11 tokens/s。这个速度得益于MoE架构——每次推理只激活约22B参数。对于70B的稠密模型如Llama 3.3,速度降至约5 tokens/s,仍可用于单用户交互式开发。而7B-13B的小模型则能跑到30-45 tokens/s,几乎感觉不到延迟。
需要注意的是,NPU的50 TOPS峰值并不用于大模型推理——主流框架如Ollama、llama.cpp都将LLM负载路由到GPU。NPU主要负责视频超分、图像分类等固定功能任务。此外,DeepSeek V3等模型也能在128GB内存下流畅运行。对于高并发场景,显存更大的专业GPU仍是更好选择。

图片来自 hothardware.com 的相关公开报道,展示产品、原型、使用场景或事件背景;具体信息以原始来源为准。 摄影/版权标识:hothardware.com。 来源:hothardware.com
生态与价格:从1800到3999美元的选择
目前已有超过30款第三方迷你PC搭载Ryzen AI Max+ 395,价格从GMKtec EVO-X2的约1800美元到Zotac Magnus的未知高价不等。AMD官方Ryzen AI Halo定价3999美元,定位企业级开发者,提供官方软件栈和支持。AMD估算,对于每月花费773美元使用云端AI服务的用户,这台设备能在6个月内回本。
不过,统一内存架构并非AMD独有。苹果M4 Max Mac Studio也提供类似方案,但最高仅96GB内存。对于需要超过96GB显存的模型,AMD平台是目前唯一的消费级选择。此外,Nvidia的DGX Spark定价4699美元,竞争激烈。随着更多厂商入局,价格有望进一步下探。
资料线索
• hothardware.com
• gizchina.com
• hothardware.com
• pcworld.com
• hothardware.com
• zdnet.com
• techtimes.com
• techspot.com
本文是基于公开页面整理的 AI 硬件情报,不是本站实测或购买建议。图片发布副本增加 waoo.ai 水印,原摄影者和来源标识保留。



交流讨论
最新评论