移动版RTX 5090与苹果M5 Max AI对决:性能占优,但受制于显存瓶颈
近日,在针对大语言模型(LLM)的一系列AI基准测试中,英伟达移动端RTX 5090显卡展现出强劲实力,在提示词处理与词元(Token)生成速度上大幅超越苹果最新的M5 Max芯片,最高领先幅度达133%。然而测试也同时表明,当面对更大规模的AI模型或更长的上下文时,苹果的统一内存架构优势便开始接管比赛。

相关测试由科技博主Alex Ziskind完成,对比设备分别为搭载RTX 5090(24GB显存)的全新雷蛇灵刃18游戏本与搭载M5 Max(配备128GB统一内存)的16英寸苹果MacBook Pro。在使用llama.cpp运行诸如Gemma 4 12B、Qwen3.5 27B以及Qwen3.6 35B A3B等模型时,得益于强大的计算性能,RTX 5090在提示词处理和词元生成方面均占据了明显优势。事实证明,只要工作负载不撑爆其24GB的显存容量,这款英伟达最快的移动端GPU就能保持领先。


不过,战局在上下文长度激增时发生了逆转。在运行4-bit量化的Qwen3 4B模型并将上下文长度设定为262,144时,RTX 5090的24GB显存几乎被彻底耗尽,导致其生成速度骤降至每秒25.28个词元。相比之下,M5 Max凭借充足的统一内存跑出了每秒181.40个词元的成绩。当上下文长度缩减至68,014时,RTX 5090因释放了大量显存使得速度回升至每秒160.36个词元,但依然略逊于M5 Max。分析认为,除硬件本身外,这可能也与不同系统下运行的软件环境差异有关,Windows平台测试使用的是LM Studio,而苹果侧则利用了MLX框架。
在应对极高密度的负载场景(例如Qwen3.5 122B超大模型)时,RTX 5090则因显存限制完全无法完成测试。此时,M5 Max及其128GB统一内存架构成为了唯一的赢家:在消耗了94GB运行内存的情况下,该芯片依然实现了每秒139个词元的提示词处理速度以及每秒47.4个词元的生成速度。这一对比结果充分展现了显存容量在运行重型AI模型时的瓶颈效应,同时也从侧面印证了业界关于英伟达急于推出面向重度AI负载的“RTX Spark”系列产品的传言。

