增长案例库 Maxed 归档 综合AI搜索优化

我为 LLM 测试了 19 款 GPU,「最好」的那款反而最差,带宽大于显存

I benchmarked 19 GPUs for LLMs. The "best" one was the worst. Bandwidth > VRAM

中文译文 · 6k 字

一句话摘要

实测 19 款 GPU 跑 LLM,结论是内存带宽比显存容量更重要。

我基准测试了 19 款用于 LLM 的 GPU。"最好"的那一款却是最差的。带宽 > 显存(VRAM) 2026年7月14日 · 6 分钟阅读 · 查看原文 ↗ AI Marketing Hardware 好吧,你已经看到过那些建议了。"加更多显存" ➜ 在每一条帖子、每一个 discord、每一个 reddit 帖子里被反复重复。 没错。显存确实重要。如果模型装不进去,那就什么都装不进去。这是明摆着的事。 但这里有一件没人告诉你的事。 显存决定什么能跑。带宽决定什么能用。而这二者之间有着巨大的差别。 过去两周我一直在基准测试本地推理,覆盖了大约 19 款不同的显卡。结果说实话有点离谱…… 显存较少但带宽很宽的显卡,正在彻底碾压那些拥有 96GB 共享内存的"AI 就绪"机器。差距甚至不接近。 在我放出完整排名之前,先解释一下为什么。 为什么带宽才是真正的大佬 当你的 LLM 吐出一个 token 时,GPU 会主动地在其内存架构中检索并处理数据。 每一个 token 都需要: 从显存中读取完整的模型权重 计算注意力层和前馈层 写回中间结果 为下一个 token 重复以上步骤 而这就是事情变得糟糕的地方。你的 GPU 核心正坐在那里。等待。什么都不做。因为数据还没到。这被称为"内存受限"(memory-bound),它是每一个本地 LLM 配置的无声杀手。 我见过一个 13B 模型在一台拥有 96GB 统一内存的系统上爬行。与此同时,同样的模型在一块只有 24GB 但带宽翻倍的显卡上飞驰。 问题不在核心。 问题在内存总线。 (旁注:这也是为什么量化到更低位能带来这么大帮助的原因。需要搬运的数据更少了。不过那是另一个话题了。) 算一算(这样你就不用相信我了) 13B 模型,Q4 量化。大约每个参数 0.7 字节。每个 token 需要读取大约 2×N 字节。也就是每个 token 大约 18GB。 同一个模型。同样的显存容量。 3.7 倍的速度差异。纯粹来自带宽。 你现在看出问题了吗? 按带宽排序的完整 GPU 排名(2026年7月) 这个列表里的每一款都有 16GB+ 显存,而且现在真的能在 Amazon 上买到。按带宽降序排列。价格是当前区间。 更高的带宽 = 更快的 token 生成。就是这样。 那些陷阱(不要买这些) 陷阱 1:AMD Ryzen AI Max+ 395 迷你主机(约 $2k-$4k) "96GB 统一内存!""AI 就绪!"听起来很惊人。只不过集成的 Radeon 8060S 是从 DDR5 里拉数据,带宽大约 256 GB/s。 就这样。256 GB/s。对于一台比正经台式机组装还贵的机器来说…… 我上个月测试了其中一台。13B Q4 模型每个 token 都要等上半天。它不是慢。它对任何真实工作流来说都无法使用。你花高价买到的 CPU 性能,却配了一颗喂不饱自己的 GPU。 陷阱 2:NVIDIA DGX Spark(约 $4,000-$4,700) "个人 AI 超级计算机"。128GB LPDDR5X。看起来棒极了…… 带宽呢?大约 273 GB/s。 一块二手 RTX 3090,大约 $800-$1,050,带宽是 936 GB/s。比它快 3.4 倍。价格却只要它的四分之一。 DGX Spark 只有在"你必须加载那些物理上装不进 24GB 显卡的模型"时才有意义。对于除此之外的一切用途,它都是一块非常昂贵的镇纸。 如果数据不能足够快地流动,那 128GB 就是没用的。 真正值得买的选择 RTX 3090(eBay 上约 $600-$1,050) 不骗你,这有点疯狂。24GB GDDR6X,936 GB/s。这基本上和 5080 一样的带宽,但显存更多,而且便宜得多。 我一直在跑 Qwen3.6-27B、量化过的 Llama 405B,以及一切能装进 24GB 的东西。很流畅。Amazon 上的翻新机稍微贵一点,但 eBay 上有实打实的好价。 RX 7900 XTX(约 $800-$1,000) AMD 意外地做出了对 LLM 来说性价比最高的显卡。960 GB/s,24GB 显存,完整的 384-bit 总线。带宽和 RTX 6000 Ada 打平,价格却只是它的零头。 2026 年的 ROCm 现在真的能用了。我在 Linux 上测试了 llama.cpp,直接就跑起来了。不需要任何"仪式"。花不到 $2k 拿两块,你就有 48GB 总显存。 Radeon AI PRO R9700(约 $1,350) 带 ECC 和 32GB 显存的工作站显卡。带宽稍低,645 GB/s,但容量正好卡在甜点上。如果你需要可靠性,又不想碰二手市场,就是它了。 驱动现在也没问题了。我也很震惊。 快速决策指南 最后的话 显存告诉你什么装得下。带宽告诉你什么跑得飞。 别买那些营销话术。去查带宽数字。自己算一算。当模型能实时响应时,未来的你会感谢现在的你。 你有什么问题吗?私信(DM)随时开放。 我可以帮你解答任何问题 (◠‿◠✿) ~ @beamnxw 我的 Telegram 频道,更多 alpha 提示词(Prompts) 936 GB/s 带宽 → 每个 token 约 19ms 504 GB/s 带宽 → 每个 token 约 36ms 256 GB/s 带宽 → 每个 token 约 70ms 你需要什么 | 该买什么 ---------------------------------|------------------------------------------ 极致性能,预算不限 | RTX PRO 6000 Blackwell(约 $13k) LLM 最佳消费级性价比 | 二手 RTX 3090(约 $600-$1,050) 每美元带宽最多 | RX 7900 XTX(约 $800-$1k) ECC + 工作站可靠性 | Radeon AI PRO R9700 或二手 RTX A5000 48GB+ 且不交数据中心税 | 二手 RTX A6000 或双 RX 7900 XTX 紧凑型 SFF 装机 | RTX PRO 4000 Blackwell(约 $2.2k) GPU | 显存 | 内存类型 | 总线 | 带宽 | TDP | 价格(USD) ---------------------------------|------|-----------|-----------|-----------|-------|------------- H100 PCIe | 80GB | HBM3e | 5120-bit | 2039 GB/s | 700W | ~$25k-$40k A100 PCIe 80GB | 80GB | HBM2e | 5120-bit | 1935 GB/s | 400W | ~$12k-$18k RTX PRO 6000 Blackwell | 96GB | GDDR7 | 512-bit | 1792 GB/s | 300W | ~$12k-$13k RTX 5090 | 32GB | GDDR7 | 512-bit | 1792 GB/s | 575W | ~$2k-$2.6k RTX PRO 5000 (48GB) | 48GB | GDDR7 | 384-bit | 1344 GB/s | 300W | ~$6.8k-$7.4k RTX PRO 5000 (72GB) | 72GB | GDDR7 | 384-bit | ~1344 GB/s | 300W | ~$9.9k RTX 4090 / 3090 Ti | 24GB | GDDR6X | 384-bit | 1008 GB/s | 350W | ~$1.6k-$2.2k RTX 6000 Ada | 48GB | GDDR6 | 384-bit | 960 GB/s | 300W | ~$7.3k RX 7900 XTX | 24GB | GDDR6 | 384-bit | 960 GB/s | 355W | ~$800-$1k RTX 5080 | 16GB | GDDR7 | 256-bit | 960 GB/s | 360W | ~$1.2k-$1.3k RTX 3090 | 24GB | GDDR6X | 384-bit | 936 GB/s | 350W | ~$600-$1.05k L40S / L40 | 48GB | GDDR6 ECC | 384-bit | 864 GB/s | 320W | ~$7k-$9k RTX A6000 (Ampere) | 48GB | GDDR6 | 384-bit | 768 GB/s | 300W | ~$2.5k-$4.5k RTX A5000 (24GB) | 24GB | GDDR6 | 384-bit | 768 GB/s | 250W | ~$1.3k-$2k A40 | 48GB | GDDR6 | 384-bit | 696 GB/s | 250W | ~$3k-$4.5k RTX PRO 4000 Blackwell | 24GB | GDDR7 ECC | 192-bit | 672 GB/s | 140W | ~$2.2k Radeon AI PRO R9700 | 32GB | GDDR6 | 256-bit | 645 GB/s | 300W | ~$1.35k RTX 4080 | 16GB | GDDR6X | 256-bit | 717 GB/s | 320W | ~$800-$900 链接 x.com/@beamnxw t.me/beamnxw11 标签:# X # AI # Marketing # Hardware # Growth # Thread # Guide 相关文章 OpenClaw: The Personal AI Agent That Went Viral in January and Nobody Explained How to Set It Up OpenClaw: The Personal AI Agent That Went Viral in January and Nobody Explained How to Set It Up AI Marketing Claude Hardware

原文参考:https://maxed.wiki/posts/i-benchmarked-19-gpus-for-llms-the-best-one-was-the-worst-bandwidth-vram/ (Maxed.wiki,本页为站内中文整理)