一句话摘要
用本地 AI 设备降低 AI 账单
本地 AI 阶梯:干掉你 $200 AI 账单的 10 个盒子(从 $0 到 $4,700) 2026 年 7 月 19 日 · 15 分钟阅读 · 查看原文 ↗ AI 硬件 Claude 自动化
此刻某个开发者正在为 AI 支付每月 $200,却从来没算过这笔账。ChatGPT Plus。Claude Pro。Cursor。每个月悄悄往上爬的 API 费用。它永远在自动续费,而"永远"是你租用一个本可以拥有的东西的漫长时间。
有另一种思路。一个放在你家里的盒子,本地运行 AI,每月电费只要几美元,数据留在你自己的机器上,一个字节都不会发到别人的服务器。
2026 年的本地 AI 不再是两年前那种令人心酸的妥协。更好的量化技术、更精简的模型架构、统一内存(unified-memory)芯片,意味着你桌上的一台机器现在能处理大约 80% 的日常 AI 工作:写作、编程辅助、文档分析、总结、分类、自动化、针对你自己文件的问答。剩下那 20%——前沿推理和最前沿的编程——仍属于云端。但这 20% 并不能为一个 $200 的账单辩护,因为一个一次性购买的盒子就能覆盖其余部分。
这就是这个阶梯。十个梯级,从你早已拥有的机器到一台桌面超算,以及每一步诚实的取舍。
改变一切的那个核心想法
你买的不是速度。你买的是内存。
每一个"它跑不起来"的故事,都追溯到同一堵墙:一个塞不进盒子内存的模型。模型要么能加载,要么不能。速度只决定它跑起来之后的体验;内存决定它到底能不能跑。
所以整个阶梯本质上是一个内存阶梯。8GB 跑一个 7B 模型。24GB 舒服地跑一个 32B 模型。128GB 跑一个 70B 模型,并开始撩拨那些真正的大块头。用这个视角去读下面的每一个梯级,并注意这个规律:能撑得最远的盒子,都是那些有统一内存的盒子——CPU 和 GPU 共享一大池内存,而不是在一块被墙隔开的小 VRAM 上抢来抢去。
在罗列规格之前,有一个贯穿全表的提醒:一场全球性的 DRAM 短缺正在把内存价格往 2026 年一路推高,而不是推低。这里的每一个数字都是近似值,而且还在往上漂,这正是一个论据:买你真正会用的盒子,而不是等一个可能永远不会来的降价。
阶梯
梯级 1. 你早已拥有的机器($0)
在你花任何钱之前,先在你桌上已有的东西上把工作流验证一遍。任何一台 8GB 内存的笔记本都能通过 Ollama 跑一个 7B 模型。它不会快,但它回答了唯一重要的问题:本地 AI 对你真正要做的事,够不够好?在你往任何别处花一分钱之前,先在这里花一个周末。
梯级 2. Raspberry Pi 5,16GB(约 $120)
折腾党的梯级。一台 16GB 的 Pi 5 能通过 Ollama 跑 1B 到 3B 的模型,很慢。这不是日常主力,而是一个可以丢在抽屉里一直跑着的概念验证:一个微型的常驻助手、一个智能家居的大脑、一个周末项目。买它是为了学习,不是为了干活。
梯级 3. NVIDIA Jetson Orin Nano Super($249)
最便宜的严肃入门点。一块真正的 NVIDIA GPU,装进一个比钱包还小的盒子里。
AI 性能:67 TOPS
GPU:1024 核 Ampere
RAM:8GB LPDDR5(共享)
功耗:7–25W
跑得好:Llama 3.2 3B、Mistral 7B、Gemma 2、DeepSeek 1.5B
67 TOPS 私密且永久地跑一个 7B 模型。7B 这个级别快得足够感觉即时,好得足够胜任大多数日常任务。它碰不了 7B 以上的任何东西,也碰不了任何撑爆 8GB 的长上下文,但按每月 $100 的订阅费算,它十周就回本了。
梯级 4. Apple Mac mini M4($599 起)
默认的静音家庭 AI 服务器,因为统一内存。普通 PC 上,GPU 的 VRAM 是一堵硬墙。Apple 在 CPU 和 GPU 之间共享内存,所以 Mac mini 能跑出超出规格表的大模型,近乎静音,而且省电。
芯片:Apple M4
统一内存:16–32GB(CPU + GPU 共享)
功耗:负载下 10–30W
24/7 电费成本:大约 $3–8/月
跑得好:Llama 3.2、Mistral 7B、Qwen 2.5、Phi-3 Medium
Jetson 能做的它都能做,外加更大的模型、更长的上下文、同时跑多个服务。这就是人们全天候开着、作为他们自动化后端的那个盒子。不过 $599 只是基础款,而 Apple 在内存上加价很狠。对本地 AI 来说,内存才是重点,所以按你真正需要的配置来定价,而不是看标价。
梯级 5. 二手 RTX 3090,24GB(单卡约 $700)
一个不肯死去的性价比传奇。六年了,它仍然是消费市场上每美元 VRAM 的最优解。一块二手 3090 用大约 $700 给你 24GB 快内存,足以以真实吞吐跑 24B 到 32B 的模型,还带完整的 CUDA 支持,所有工具开箱即用。
VRAM:24GB GDDR6X
带宽:约 936 GB/s
二手价格:约 $600–800(仅卡)
跑得好:Qwen 32B、Llama 3.1 8B–70B(量化)、大多数 32B 级别
诚实的注脚:一块 GPU 不是一台电脑。你需要一台主机围着它,所以再为整机剩下的部分预算 $400 到 $600。但如果你已经有一台带空闲插槽和大功率电源的台式机,这个阶梯上没有别的东西能这么便宜地给你 24GB。
梯级 6. AMD Radeon RX 7900 XTX,24GB(单卡约 $900)
和 3090 一样的 24GB,但全新、带保修,而且 AMD 的软件终于追上来了。在 ROCm 7.x 上,7900 XTX 跑 Llama 3.1 8B 大约每秒 96 tokens,大约是 RTX 4090 的四分之三,价格却只是一小部分。就新硬件上每美元 VRAM 而言,在消费级上 NVIDIA 没有任何东西能碰它。
VRAM:24GB GDDR6
软件:ROCm 7.x(一等支持)
新卡价格:约 $899–1,400(仅卡)
跑得好:Llama 3.1 8B(约 96 tok/s)、32B 级别量化
坑和 AMD 走到哪跟到哪的是同一个:ROCm 已经补上了与 CUDA 的大部分差距,但有些工具仍然默认假设是 NVIDIA。对 Ollama 和 Open WebUI,它今天就能好好工作。对冷门的微调技术栈,就要多准备几个手动步骤了。
梯级 7. AMD Ryzen AI Max+ 395 "Strix Halo",128GB(约 $1,999)
2026 年的甜点位,也是大多数这类清单都忘了的盒子。AMD 的 Strix Halo 芯片把一颗 16 核 Zen 5 CPU 和一块大的 RDNA 3.5 核显、以及最多 128GB 统一内存装进一个小盒子,价格大约是 NVIDIA 台式机的水平,内存却是它的四倍。
芯片:Ryzen AI Max+ 395(16 核 Zen 5)
GPU:Radeon 8060S(40 核 RDNA 3.5)
NPU:XDNA 2,50 TOPS(全系统约 126 TOPS)
统一内存:最多 128GB LPDDR5X(约 96GB 可用作 VRAM)
价格:128GB / 2TB 约 $1,999
跑得好:Llama 3.3 70B、Mixtral、大多数 70B 级别模型
你可以有两种买法。GMKtec EVO-X2 是一台成品 128GB 迷你主机,约 $1,999。Framework Desktop 是同一颗芯片,装进一个可维修、可升级的机箱里,板子 $1,999 起,整机约 $2,850。无论哪种,你都能以对话级速度加载一个 70B 模型,这是本梯级以下任何东西都做不到的。ROCm 成熟度是代价,和梯级 6 一样。
梯级 8. NVIDIA RTX 5090,32GB(单卡约 $3,000)
一个普通人能塞进一台普通塔式机箱的最快的东西。32GB 人类制造的最快消费级内存,以及甩开下面一切的原始速度。这一级是给那些想要前沿级本地推理和偶尔训练、并且更在乎每秒 token 数而不是每 GB 美元数的人。
VRAM:32GB GDDR7
新卡价格:约 $3,000+(仅卡)
跑得好:32B 全速、70B 量化、图像和视频模型
但这笔账很残酷。它比一块二手 3090 贵三到四倍,只多了 8GB 内存,再加上一台主机。买它是因为你需要速度和额外的余量,不是因为高效。它并不高效。
梯级 9. Apple Mac Studio M3 Ultra,96GB($3,999 起)
又大又安静的统一内存工作站。Mac Studio 把最多 96GB 在 CPU 和 GPU 之间池化,带 Metal 加速,近乎静音地跑大模型,而且这个盒子能放在桌上,没有喷气发动机般的风扇曲线。
芯片:M3 Ultra(最高 32 核 CPU / 80 核 GPU)
统一内存:最高 96GB
价格:$3,999 起
跑得好:70B 级别模型、长上下文、多服务
值得诚实知道的一点:随着 DRAM 短缺的冲击,Apple 在 2026 年初撤掉了 512GB 的配置,所以现在 96GB 成了天花板,而过去它还能上探得高得多。尽管如此,作为一台安静的、能跑大模型、同时还能当你的真电脑来用的全天候机器,能让你住得这么舒服的东西不多。
梯级 10. NVIDIA DGX Spark,128GB($3,999 到 $4,699)
一台以为自己是数据中心的桌面机。用于微调开源模型、托管 70B 以上的助手、跑真正需要吞吐的推理管线。
芯片:GB10 Grace Blackwell
AI 吞吐:1 PFLOP
统一内存:128GB LPDDR5x
存储:4TB Gen5 NVMe
功耗:负载下 150–240W
最适合:70B–200B 模型、微调、生产推理
128GB 统一内存能加载消费级 GPU 根本打不开的模型,两台互联则能进入 400B 领域。价格要诚实:它 2025 年 10 月以 $3,999 上市,此后随着内存短缺的冲击被加价到约 $4,699(Tom's Hardware)。跟梯级 7 的 Strix Halo 盒子比,同样的 128GB,它大约贵一倍。你付的是 CUDA 成熟度和吞吐,不是更多的内存。
诚实的账
典型月度 AI 支出:
ChatGPT Plus $20
Claude Pro $20
Cursor Pro $20
API 费用 $50–200
合计 $110–260 /月
本地 AI 月度:
硬件 $0(已购)
电费 $2–15
API $0
合计 $2–15 /月
按每月 $100 的订阅费算,一台 $249 的 Jetson 十周回本,一台 $599 的 Mac mini 六个月回本,一套二手 3090 整机一年内回本,一台 $2,000 的 Strix Halo 盒子约十八个月回本,而那些 $4,000 以上的梯级,只有在你本来每月就已经在烧四位数云 GPU 租赁费时才回本。
然后是炒作永远跳过的那部分。盒子是沉没成本,只有当你真的会一直续订那个订阅时,它才"回本"。买一台 $2,000 的机器去省每月 $20,这笔买卖比订阅还差,不是更好。正确的梯级,是匹配你真实用量、而非幻想用量的那一个。
哪一级是你的
轻度日常使用加好奇:从梯级 1 开始,然后买 Jetson。给家庭或小生意用的静音常驻助手:Mac mini。通往真 24GB 和 32B 模型的最便宜路径:二手 3090,或者 RX 7900 XTX——如果你想要全新带保修、不介意 ROCm 的话。不花数据中心级的钱的最优 70B 体验:Strix Halo 盒子。最大消费级速度:RTX 5090。一台安静大内存、你自己也住里面的工作站:Mac Studio。微调和生产管线:DGX Spark。
一个下午就能搭好的配置
流程在每一级上都一样。
1. 安装 Ollama。开源,把任何模型变成会说 OpenAI 语言的本地 API。
curl -fsSL https://ollama.com/install.sh | sh
2. 拉一个适配你盒子内存大小的模型。
# 8GB Jetson 或 16GB Mac mini:
ollama pull llama3.2
# 24GB 3090 / 7900 XTX:
ollama pull qwen2.5:32b
# 128GB Strix Halo / DGX Spark:
ollama pull llama3.3:70b
3. 在你已有的代码里改一行。
# 之前,按请求付费:
client = OpenAI(api_key="sk-...")
# 之后,本地且免费:
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
你的代码照常跑。什么都不离开机器,什么都不按请求花钱。
4. (可选)用 Open WebUI 加一个浏览器界面,你就在 localhost:3000 有了一个私有 ChatGPT。
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
ghcr.io/open-webui/open-webui:main
在上面到底该跑什么
硬件是决策的一半。模型是另一半。一份 2026 年的粗略地图:
小而快(适合 8–16GB):Llama 3.2 3B、Gemma 2、Phi-3、Mistral 7B。适合草稿、分类、针对你自己笔记的问答。主力层(适合 24GB):Qwen 2.5 32B 和量化后的 Llama,强到足以做真正的编程辅助和文档工作。重量层(需要 64–128GB):Llama 3.3 70B 以及大的 Qwen 和 Mixtral 变体,到这里,本地输出在日常任务上开始感觉接近云端模型了。
量化是这一切下面那根安静的杠杆。一个 70B 模型用 4-bit 量化,能装进全精度版本永远塞不进的地方,质量损失小且通常可接受。对大多数人来说,Q4 到 Q6 是理智区间。低于这个,质量掉得比省下的内存更不值得。
跑起来之后你会搭什么
对个人使用,它每月几美元就覆盖了日常琐事。有意思的部分是商业自动化——你把本地模型接进 n8n,这个开源工具把它连到 Telegram、邮件、日历、CRM 和数百个服务。每一个都在"什么都不离开你的楼、没有每 token 成本"的情况下运行:
AI 前台:
客户在 Telegram 发消息 -> n8n 收到 -> 本地模型识别意图
-> 日历查空档 -> 预约确认
文档分析:
丢进 50 个 PDF -> 本地模型全读一遍 -> 提取关键事实
-> 写一份结构化报告
每日简报:
早上 7 点触发 -> 模型读你的笔记和任务 -> 总结重要事项
-> 发到你的手机
销售线索补全:
表格新增一行 -> 模型研究这家公司 -> 起草一段定制的开场白
-> 排队等你审核
内容复用:
一段长录音 -> 模型转录并剪辑 -> 写帖子
-> 存草稿等你批准
收件箱分诊:
新邮件 -> 模型排序、打标签、起草回复 -> 你点发送或修改
对隐私敏感的工作,它就不再是成本决策,而是唯一选择。法律文件、医疗记录、财务数据、任何处于 NDA 之下的东西,都不该出现在第三方 API 上。本地 AI 在你的机器上处理它们,永不外流。
真正会出问题的部分
那 20% 是真的。前沿模型在硬推理、最前沿编程、以及"唯一最佳答案很重要"的研究上仍然胜出。本地 AI 是另外 80% 的可靠、私密、常驻主力,而不是一切的替代品。保留一个云端订阅来应付那 20% 的硬活,其余在家里跑,你就两头都有了。
内存是天花板,不是 TOPS。为你想要跑的模型大小来买,并记住:统一内存盒子比一块规格匹配、VRAM 分立的 PC 撑得更远。
一块 GPU 不是一台电脑。3090、7900 XTX、5090 这几级都需要一台主机围着。卡价不是整机价,所以在跟一台成品迷你主机比之前,先加 $400 到 $600。
价格在涨。DRAM 短缺已经把 DGX Spark 推高了 18%,还让 Apple 撤掉了 512GB 的 Mac Studio。今天的好价,下个季度可能要更贵。
AMD 省钱但费时间。Strix Halo 和 7900 XTX 给你每美元最多的内存,但 ROCm 在开箱即用工具上仍落后于 CUDA。今天跑 Ollama 没问题,做重训练需要更多耐心。
发热、噪音和量化是小字条款。大 GPU 装机又吵又热。激进量化省内存,但推过头就吃质量。两者都不是致命伤,只是销售话术里没人提。
现在该做的两件事
先免费试试。在你已有的电脑上装 Ollama,这个周末跑一个 7B 模型。任何 8GB 机器都行。在你为硬件花一分钱之前,先验证工作流。
然后买比你真实需求高一级的,而不是高五级。那些在 2025 年悄悄搭好本地 AI 的人,到 2027 年随着云价继续涨、本地硬件继续变好,会显得远远走在曲线前面。大多数人会出于习惯继续每月付 $200。少数人会在这个星期花一个下午,从此再也不往别人的服务器发一个字节。
我经常像这样拆解 AI 工具和用它们赚钱的方式。关注我获取下一篇,并加入我的 Telegram:https://t.me/+lzSPoQ0svRU1ZWZi 标签:# X # AI # 硬件 # Claude # 自动化 # N8n # Chatgpt 相关文章 前沿 AI 现在基本上免费了。难的是你拿它做什么。5 分钟 · $0 · 无需信用卡 AI Claude 自动化 硬件
原文参考:https://maxed.wiki/posts/the-local-ai-ladder-10-boxes-that-kill-your-200-ai-bill-from-0-to-4-700/ (Maxed.wiki,本页为站内中文整理)