READING努博新闻
阅读方式
单栏正文
顺序
标题、正文、相关文章
努博新闻 · 资料整理

雷蛇灵刃18与苹果MacBook Pro在AI模型推理测试中的性能对比:显存限制是关键瓶颈

基于对搭载RTX 5090的雷蛇灵刃18游戏本和M5 Max MacBook Pro的对比测试,数据显示RTX 5090在处理Gemma 4、Qwen3.5等模型时展现出明显优势。然而,双方均受限于显存瓶颈,尤其是在超大上下文长度或极大型模型上,性能会急剧下降。苹果M5 Max凭借其统一内存架构,在特定场景下表现出稳定性和竞争力。

努博新闻 · 资料整理

根据一份可追溯的公开资料,对搭载RTX 5090(24GB显存)的全新雷蛇灵刃18游戏本与搭载M5 Max(配备128GB统一内存)的16英寸苹果MacBook Pro进行了对比测试。本次性能对比的核心焦点在于大型语言模型(LLM)在不同负载下的推理能力,尤其是在AI应用日益复杂的背景下。

在实际的模型运行场景中,RTX 5090在提示词处理和词元生成方面展现出明显的性能优势。具体到使用llama.cpp运行Gemma 4 12B、Qwen3.5 27B以及Qwen3.6 35B A3B等模型时,雷蛇灵刃18搭载的RTX 5090在处理这些任务时占据了明显优势。

然而,性能的展现并非一成不变。当测试场景转向极高上下文长度时,显存限制成为了制约双方的关键因素。例如,在使用4-bit量化的Qwen3 4B模型并将上下文长度设定为262,144时,RTX 5090的24GB显存几乎被彻底耗尽,导致其生成速度骤降至每秒25.28个词元。

这种性能波动清晰地勾勒出“显存瓶颈”这一限制。在上下文长度缩减至68,014时,RTX 5090的速度回升至每秒160.36个词元,但该速度依然略逊于M5 Max的表现。

更进一步观察,当测试负载达到极高密度,例如需要处理Qwen3.5 122B超大模型时,RTX 5090则因显存限制完全无法完成测试。这表明对于参数量和上下文长度都极大的任务,当前移动端GPU的显存容量构成了硬性上限。

与此形成对比的是M5 Max MacBook Pro的表现。在消耗了94GB运行内存的情况下,M5 Max实现了每秒139个词元的提示词处理速度以及每秒47.4个词元的生成速度。这体现了苹果M5 Max利用其统一内存架构进行资源调配的稳定性和潜力。

值得注意的是,本次测试在软件环境上也存在差异性。Windows平台测试使用的是LM Studio,而苹果侧则利用了MLX框架。这种不同的软件栈和底层优化机制,也可能影响最终的性能数据解读。

从时间线角度看,这次对比展示了一个清晰的趋势:在模型规模适中、上下文长度可控的情况下,RTX 5090具备峰值性能优势;但在面对超大内存需求时,M5 Max凭借其统一内存架构展现出更强的持续处理能力。因此,用户在选择设备时,需要根据预期的最大模型尺寸和最长上下文长度来权衡显存容量与原始计算速度之间的取舍。

读者提示:对于AI开发者而言,本次测试强调了“显存”的重要性高于单纯的“算力峰值”。未来硬件迭代的方向,很可能是在提升显存带宽和总容量方面进行突破,以更好地支撑万亿参数模型在移动端的部署。

信息来源

本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。