
总部位于米兰的初创公司Lucebox已正式开启其紧凑型AI工作站Zero 495的预订。与ACEMAGIC、MINISFORUM和Framework等完全依赖处理器集成显卡进行推理的竞品不同,Zero 495在AMD最新的Gorgon Halo平台基础上,创新性地引入了一块独立显卡。
该设备搭载了AMD旗舰级Ryzen AI MAX+ PRO 495芯片,支持最高192 GB统一内存(带宽273 GB/s),并配备拥有32 GB GDDR6显存、带宽高达640 GB/s的AMD Radeon AI PRO R9700 GPU。Lucebox通过自研的“Lucebox Engine”推理引擎,利用一种名为“非对称专家并行”的技术,协调R9700的高速视频内存与APU大容量统一内存池之间的速度差异,为每个处理器分配不同的角色。
据Lucebox发布的技术报告,在运行2840亿参数的DeepSeek V4 Flash模型时,该方案实现了每秒86个token的生成速度。公司声称,这一性能表现比单独运行相同模型的NVIDIA DGX Spark快了三倍以上。
打破常规:为何搭配独立显卡
自AMD推出Strix Halo平台(Gorgon Halo前身)以来,主流厂商普遍放弃独立显卡,理由是Ryzen AI MAX+ PRO 495集成的Radeon 8065S GPU及高达273 GB/s的统一内存带宽已超越多数消费级独显。然而,Lucebox创始人Alessandro Puppo指出,这种观点忽略了混合专家(MoE)模型的特性。
在DeepSeek V4 Flash等MoE模型中,每个token仅激活少量“热”专家,且激活高度集中。Lucebox利用这一聚集现象,将频繁激活的“热”专家及密集Transformer层加载至R9700的32 GB GDDR6高速内存中,而将极少被激活的长尾专家保留在APU的192 GB统一内存池中。此外,一个11.3 GB的推测解码草稿模型也部署在R9700上,以预先提出未来token而不阻塞主计算。
在推理过程中,两个处理器同步工作:R9700以640 GB/s带宽处理密集层和热专家,Ryzen AI MAX以273 GB/s带宽处理冷专家,最终由R9700合并输出。为避免PCIe 4.0 ×4链路(实际带宽约7–8 GB/s)成为瓶颈,引擎采用静态权重分配策略,仅在链路间传输少量的激活值,而非庞大的权重张量。
性能声明与注意事项
Lucebox公布的86 tokens/s数据源于对2,000至16,000 token四个上下文长度的平均值(47.75 tokens/s)中的峰值表现,并与DGX Spark的平均值14.09 tokens/s对比,得出3.39倍的性能提升。需要注意的是,该基准测试由Lucebox自行运行,尚未经过第三方独立验证。此外,对比中Lucebox使用了启用推测解码的ROCm FPX构建,而DGX Spark使用了Q2压缩模型,两者软件配置存在差异。
另一项数据显示,在Qwen3.8-27B模型上,吞吐量约为每秒61.3个token。这表明性能优势高度依赖于模型架构。对于LLaMA、Mistral等密集Transformer模型,由于每层均被均匀激活,双池分割无法带来显著优势,PCIe链路反而可能成为约束。因此,Zero 495的目标受众主要是运行DeepSeek、Qwen MoE或Mixtral类架构的用户。
规格与定价
Zero 495采用挤压铝制机箱,尺寸为340 × 110 × 320毫米,重6公斤。核心配置包括:
- 处理器:AMD Ryzen AI MAX+ PRO 495(16核/32线程,最高5.2 GHz)
- 内存:128 GB或192 GB LPDDR5X-8533
- 存储:2 TB或4 TB NVMe SSD
- 网络:5 GbE以太网,可选100 GbE集群套件
- 连接性:USB4、HDMI 2.1、DisplayPort 2.1、Wi-Fi 7等
定价方面,面向个人开发者的版本前200台优惠价为5,999美元(标准价6,999美元),包含128 GB内存和2 TB SSD。升级至192 GB内存需加价2,000美元,4 TB SSD加价250美元,顶配价格为9,249美元。商业版起步价为7,999美元,提供额外服务支持。欧洲和英国市场售价分别为6,499欧元/5,999英镑(开发者版)和8,699欧元/7,999英镑(商业版),均含运费和关税。
作为参考,NVIDIA DGX Spark(128 GB配置)标价约7,000美元,ACEMAGIC F9A PRO 495售价为6,499美元。Lucebox声称其基础版比DGX Spark便宜约14%,且在特定MoE负载下吞吐量更高。
首批设备预计将于2027年1月交付。Lucebox成立于2025年,团队规模约2-10人,已与AMD建立官方合作伙伴关系。其推理引擎开源,GitHub仓库已获近3,000星标。系统发货时提供完整的root SSH访问权限,并暴露兼容OpenAI和Anthropic的API端点。