
过去几天,我对配备256GB内存的M5 Ultra Mac Studio进行了深度测试。结论明确:这是运行本地AI智能体的理想设备。它不仅性能卓越,更免去了云端API的高昂成本。如果你曾怀疑本地模型能否在智能度和速度上匹敌云端,M5 Ultra将改变这一看法。
上周四起,我将这款Mac Studio与前代M3 Ultra(512GB内存)以及搭载RTX 5090显卡的游戏台式机进行对比。凭借苹果统一内存架构、出色的散热及紧凑机身,M5 Ultra从根本上重塑了我对本地模型运行的认知。尽管RTX 5090凭借更高内存带宽在纯算力上略胜一筹,但其庞大的体积、热量和噪音令人劝退。相比之下,M5 Ultra不仅安静凉爽,还拥有macOS优质的应用生态。
本地AI的价值重构
为何在云端模型更强大的当下选择本地AI?答案关乎隐私、成本与控制权。今年夏天,我为iOS和iPadOS 27评测构建了一套名为“Desk”的内部工作流。该系统利用基于DeepSeek V4 Flash的本地智能体团队,在99天内全天候处理了310份文档,包括转录会议、提取特性、交叉引用及整理Notion数据库。若依赖OpenAI或Anthropic API,这笔持续后台任务的费用将难以承受;而本地运行成本为零,且数据完全私有。
提示处理与生成的飞跃
M5 Ultra采用全新的Apple Silicon架构,通过UltraFusion连接两个双芯M5 Max芯片,形成四芯架构。其新一代80核GPU峰值计算能力比M3 Ultra高出4.5倍,内存带宽从819 GB/s跃升至1.2 TB/s,增幅达50%。
实测数据显示,M5 Ultra在令牌预填充(提示处理)和生成速度上均有显著提升。相比M3 Ultra,M5 Ultra生成响应平均速度快约70%,提示处理速度平均提高150%。这意味着在运行Open Minis或Hermes Agent等智能体时,等待时间大幅缩短。例如,Qwen3.8-Flash-Next模型在短提示下每秒可处理100个令牌,即使在64K至256K的大上下文窗口中,仍能保持每秒60至85个令牌的生成速度,使多轮对话和工具调用流畅自然。
在256GB内存配置下,5位量化(oQ5e)在智能性、性能和内存消耗间达到了最佳平衡。虽然8位量化需将部分数据卸载至SSD,但整体体验依然优异。此外,我已在Codex应用中尝试让GPT-6 Astra协调本地子智能体,验证了本地模型在辅助编码任务中的可行性。
M5 Ultra vs. RTX 5090
尽管NVIDIA RTX 5090在提示处理速度上约为每秒3000个令牌(M5 Ultra约为每秒1700个令牌),且在令牌生成上凭借1.79 TB/s带宽保持约25%的优势,但其32GB VRAM成为致命短板。一旦模型超出显存限制,RTX 5090需通过PCIe调用系统RAM,导致性能骤降。相比之下,M5 Ultra的统一内存架构允许轻松运行更大模型(如GLM-5.3-Flash),且在日常高负载下几乎无声,发热可控。
测试方法说明
本次测试使用自定义自动化工具,协调M3 Ultra、M5 Ultra及Windows PC上的多个实例。macOS端采用oMLX后端,运行Qwen3.8-Flash-Next等模型;Windows端使用LM Studio及CUDA 12。数据由Astra在四天内收集,并通过Claude Fable 5.1和Opus 5进行可视化处理。
结语
M5 Ultra的性能提升证实了苹果在定制芯片和统一内存架构上的投入正获得回报。尽管RTX 5090在特定基准测试中领先,但M5 Ultra凭借其能效比、静音表现和大内存优势,成为本地AI智能体开发的更佳选择。随着开源社区对MLX优化的深入,未来在消费级硬件上运行更强大本地模型的潜力巨大。