一句话摘要
用 Grok 与 Kimi 实现月入大幅提升
我如何从每月 $600 降到 $14。Elon 的 Grok + Kimi 的大脑 August 27, 2026 · 19 min read · View source ↗ Grok Bot AI Hardware Claude
我同时给 Sam Altman、Dario Amodei 和 Elon Musk 付了五个月的钱。别犯我同样的错误。
> 关注并收藏这篇文章——我是 @starmexxx,我追踪 AI 工具正在如何创造大多数人还没听说过的新收入来源。这篇就是完整的搭建方案。
四个人决定你为 AI 付多少钱,其中两个人刚刚"叛变"了。
Sam Altman 每月收你 $200 买 ChatGPT Pro 来获得 Codex。Dario Amodei 收 $200 买 Claude Max 来获得 Claude Code。两者卖的都是"挂在一个你无法查看的模型上的终端代理",而且订阅价格随时可能在董事会要求利润时被重新定价。
然后在 7 月 15 日,Elon Musk 把 xAI 的编程代理放到了 GitHub 上,采用 Apache 2.0 协议——Rust 编写、完整 TUI、MCP、无头 CI、19.6k stars、不可撤销。十二天后,杨植麟——34 岁,卡内基梅隆博士,前 Google Brain,如今在北京运营 Moonshot——在 Hugging Face 上公布了他的权重,其中一个采用纯 MIT 许可证。就在同一时期,Lisa Su 把 256 GB/s 的统一内存放进了一个售价 $2,349、精装书大小的盒子里。
没有人把这三者公开地拼在一起。当你把它们拼起来时会发生什么:Musk 送出了身体,杨送出了大脑,Lisa Su 卖的是它坐的那张桌子——而 Altman 和 Amodei 仍然在为这一对收取每月 $400。
我付了五个月、每月 $600。$3,000 打了水漂,只为了租用如今在我桌上以 140 瓦功率运行的算力。这是完整的搭建方案——代理、模型、主机、配置文件、电费数学,以及一份诚实列出的"它做不到的事"清单。每条命令都可以复制粘贴。每个数字都可以核实。
1/
这张账单会被它取代。$600 在一张表里。
这就是一个重度 AI 用户在 2026 年,如果他想拥有一个常驻代理加两个前沿模型,所付的钱。
什么 | 为什么买它 | 每月 | 每年
SuperGrok Heavy | 唯一带 Grok Bot 的档位 | $300 | $3,600
ChatGPT Pro | 前沿推理 + codex | $200 | $2,400
Claude Max | 5x claude code 席位 | $100 | $1,200
-------- | --------
| $600 | $7,200
一年七千二百美元。花在运行于别人电脑上的软件上,把你的代码库发到他们的服务器,还在你真正需要的当天对你限流。
替代方案,形状相同:
什么 | 从哪来 | 一次性 | 每月
grok-build | github, apache-2.0 | $0 | $0
Kimi-Linear-48B-A3B | hugging face, MIT | $0 | $0
Ollama runtime | ollama.com, 开源 | $0 | $0
主机 | 一台迷你 PC,永久归你 | $609-3,299 | $0
电费 | 每天 20 小时 | -- | $14
-------- | --------
| $14
电费线以上的每一项都是一次性购买或免费。这就是整篇文章在一张表里的样子——其余部分是教你如何真正把它接起来。
2/
Elon 到底送出了什么。以及为什么它比模型本身更重要。
xai-org/grok-build 是 xAI 真正的编程代理——不是 demo,不是封装。它就是他们付费 CLI 背后那套完整的 harness,完整开源。
语言 | Rust (99.6%)
许可证 | Apache 2.0
Stars | 19.6k
它是什么 | 全屏 TUI 编程代理
读取你整个代码库
写文件、打补丁、做完整功能
运行 shell 命令、测试、构建
还支持网页搜索、MCP 服务器、长时任务
模式 | 交互式 TUI · CI 无头模式 · 通过 ACP 嵌入
一行命令安装:
# macOS / Linux
curl -fsSL https://x.ai/cli/install.sh | bash
# Windows PowerShell
irm https://x.ai/cli/install.ps1 | iex
grok --version
下面这部分才是让这篇文章成为可能的关键,而且它埋在文档里、而不是在公告里:grok-build 可以和任何 OpenAI 兼容端点对话。它本来是为调用 xAI 的 API 而构建的,但传输层是通用的。把它指向 localhost,它就永远不会回传任何数据。
这一个设计决策,把一个免费代理变成了一个免费技术栈。你得到的不是付费工具被阉割过的开源克隆版。你得到的是付费工具本身,只是把计费端点换掉了。
在你爱上它之前值得知道的一点:xAI 发布代码但不接收社区补丁——这个仓库是 Apache 2.0,但实际上只读。你可以 fork 它、把它装进你自己的产品里,没人能撤销这一点。你只是无法向上游贡献。完整文档在 docs.x.ai/build/overview。
3/
三个 Kimi 大脑。只有一个放得进你的桌子。
这正是每篇讲"本地运行 Kimi"的文章都搞错的地方,也是能帮你省下一个被浪费的周末、以及可能被浪费的 $4,000 的地方。
Moonshot 发布的权重规模差异极大。它们不可互换,而且旗舰版根本跑不动你的硬件。不是"跑得慢"——是根本跑不动。
模型 | 总参数/激活 | 磁盘占用 | 许可证 | 能在家跑吗?
Kimi-Linear-48B-A3B | 48B / 3B | ~28GB (Q4) | MIT | 可以——单卡
Kimi K2.7 Code | ~1T / 32B | 325GB (2-bit) | 修改版 | 只能在大家伙上
Kimi K3 | 2.8T | ~1.4TB (MXFP4) | 修改版 | 不能
Kimi K3 不是家用模型。2.8 万亿参数。原生 MXFP4 权重约 1.4TB。压缩到 2-bit 你仍然接近 1TB;再压到激进的 2-bit 以下,你会得到一个 650–700GB、严重退化的模型。这里没有消费级 GPU 的位置——不是 5090,不是 3090,连 96GB 的 RTX PRO 6000 也不行。现实的私有部署是四台 512GB 的 Mac Studio 节点通过 Thunderbolt 5 串联,约 $40,000;或者一台双路 EPYC、带 1–1.5TB DDR5 的机器,能给你每秒个位数的 token。租八台 H100 比这两者都便宜。
Kimi K2.7 Code 是严肃家用主机的上限。约 1T 参数、32B 激活、2-bit 下 325GB。这需要一台真正有大内存的机器——512GB Mac Studio 级别,或者带 CPU offload 的大内存服务器。可能,但不便宜、也不快。
Kimi-Linear-48B-A3B 才是你真正会跑的那个。总参数 48B,每个 token 只激活 3B,而且它是 Moonshot 产品线里真正有意思的工程作品,而不只是一个缩水的旗舰:
架构 | 混合线性注意力——Kimi Delta Attention (KDA)
比例 | 3:1 的 KDA 对全局 MLA 比例
上下文 | 1M tokens
KV cache | 比全注意力小最多 75%
解码 | 长上下文下快最多 6x
许可证 | MIT——无收入条款,无署名要求
量化版本 | llama.cpp, Ollama, LM Studio, Jan
那个 KV cache 数字就是它能在桌面上跑起来的原因。长上下文通常会比权重更快地吃掉内存——一个传统模型里 1M token 的对话,早在权重成为问题之前就已经把你的显存打爆了。KDA 把 cache 砍掉四分之三,这正是让家用主机能维持一个真正可用的上下文、而不是玩具上下文的原因。
而且许可证确实是 MIT。没有月活用户门槛,没有收入条款,没有署名横幅。把它装进产品、卖掉产品,谁也不欠。
4/
挑主机。每一台机器,每一瓦。
你需要一台一直开着的机器。这是 2026 年真实的战场,带两个真正重要的数字——内存带宽(它思考有多快)和瓦数(它每月花你多少钱)。
机器 | 内存 | 价格 | 带宽 | 负载功耗 | 跑什么
origimagic A3 | 32GB | $609 | ~90 GB/s | 45W | 7B-13B Q4
Beelink SER9 | 32GB | $859 | ~120 GB/s | 50W | 7B-13B Q4
MINISFORUM AI X1 Pro-470 | 32GB | $1,359 | ~130 GB/s | 60W | 27B Q4
Beelink SER10 MAX | 32GB | $1,799 | ~150 GB/s | 65W | 27B Q4
GMKtec EVO-X2 | 96GB | $2,349 | 256 GB/s | 140W | 70B Q4
GMKtec EVO-X2 | 128GB | $3,299 | 256 GB/s | 140W | 70B Q4 + 余量
Mac Studio M4 Max | 128GB | $3,699 | 546 GB/s | ~180W | 70B Q4, 最快
NVIDIA DGX Spark | 128GB | $4,699 | 273 GB/s | ~170W | 70B Q4
对于 Q4 的 Kimi-Linear-48B,你大约需要 28GB 装权重,再加上下文的空间。32GB 的机器能跑,但长会话时什么都不剩。如果你想让你那 1M 上下文有意义,96GB 是诚实的底线,这也是为什么 EVO-X2 是大多数人的选择。
规格表不会告诉你的两点:
带宽比容量更重要(对速度而言)。Mac Studio 的 546 GB/s 是 EVO-X2 的 256 GB/s 的两倍多,你在每个 token 上都能感受到。如果你的预算能拉满、想让机器"感觉快"而不是仅仅"能用",钱就该花在这里。
而且如果你已经有一台带 3090 或 4090 的游戏 PC,直接跳过这一节。24GB 显存今天就能以 Q4 跑 Kimi-Linear。你这套搭建的边际成本是零硬件,外加稍微高一点的电费账单。
5/
搭建。四条命令加一个配置文件。
这就是全部设置。大约十五分钟,大部分时间花在模型下载上。
# 1 - 运行时
curl -fsSL https://ollama.com/install.sh | sh
# 2 - 大脑(Q4 版本,~28GB)
ollama pull kimi-linear:48b-a3b-q4_K_M
# 3 - 身体
curl -fsSL https://x.ai/cli/install.sh | bash
# 4 - 确认运行时正在 OpenAI 兼容端口上提供服务
curl http://localhost:11434/v1/models
现在把它们接起来。grok-build 读取 ~/.grok/config.toml:
# ~/.grok/config.toml
[model.kimi-local]
model = "kimi-linear:48b-a3b-q4_K_M"
base_url = "http://localhost:11434/v1"
name = "Kimi Linear 48B (local)"
api_backend = "chat_completions"
context_window = 262144
# 在同一份安装里保留一个前沿模型兜底
[model.kimi-k3]
model = "kimi-k3"
base_url = "https://api.moonshot.ai/v1"
name = "Kimi K3 (api)"
api_backend = "chat_completions"
context_window = 1048576
base_url 末尾的 /v1 不是可选的——grok-build 说的是 OpenAI 的 chat-completions 格式,而 Ollama 只在 /v1 下暴露它。不写它会得到一个"能建立连接但什么都不做"的结果,那会是你真正恼火的二十分钟调试。
把 context_window 设成模型在你的量化级别下实际能做到的值,而不是宣传的数字。在一台 32GB 的机器上声称 1M,意味着代理会高高兴兴地构造一个你机器根本装不下的请求。
然后运行:
grok models # 列出已接好的模型
grok -p "explain this repo" -m kimi-local
grok # 完整 TUI
在 TUI 里,/model kimi-local 可以在会话中途切换大脑,或者 Ctrl+M 打开选择器。同一个终端、同一个工作流、同一个代理——唯一变化的是哪台机器在思考。
验证它确实在本地跑。发一条 prompt 时观察运行时日志:
journalctl -u ollama -f # linux
tail -f ~/.ollama/logs/server.log # macOS
如果请求出现在那里,说明没有任何东西离开你的机器。如果没有,你还在用 API,还在付钱。
6/
它到底能处理什么。以及不能处理什么。
这是每篇文章都跳过的那部分。一个 3B 激活的模型不是 Grok 4.6,也不是 Claude Opus,假装它是,正是人们被烧、然后回去付 $600 的原因。
本地表现良好 | 仍然需要前沿模型
文件内重构 | 从零开始的新架构
为现有代码写测试 | 调试一个微妙的并发 bug
解释一个不熟悉的代码库 | 一次成型的 500 行功能,不迭代
样板代码、脚手架、胶水 | 深度多步数学证明
commit message、changelog、文档 | 没有线索的"为什么生产环境这么慢"
带堆栈跟踪的常规 bug 修复 | 任何"错了就代价高昂"的事
搜索并总结你的仓库 | 跨多源的硬核研究
同一任务跑 200 遍 | 你不会去 review 的生产代码
一个月日常使用后的诚实切分:大约 80% 的工作从不离开这台机器。剩下 20% 才是前沿模型值回票价的地方——而 20% 的用量走按量计费 API,只花几美元,不是 $600。
这也是"本地 AI 是玩具"和"本地 AI 是工具"之间的区别。玩具的说法来自那些试图在本地做那困难的 20%、撞了墙、然后把它彻底否定的人。工具的说法来自正确地路由。
7/
电费数学。$14 从哪来。
不糊弄。这是公式和算术。
每月 kWh = (负载瓦数 x 负载小时数 + 空闲瓦数 x 空闲小时数) x 30 / 1000
每月成本 = 每月 kWh x 每 kWh 单价
假设:EVO-X2 负载 140W、空闲 25W、$0.16/kWh(美国平均)
使用模式 | 负载 | 空闲 | 每月 kWh | 每月成本
轻度 - 每天 4h | 4h | 20h | 20.4 | $3.26
工作 - 每天 8h | 8h | 16h | 45.6 | $7.30
重度 - 每天 12h | 12h | 12h | 59.4 | $9.50
常开 - 每天 20h | 20h | 4h | 87.0 | $13.92
钉死 - 每天 24h | 24h | 0h | 100.8 | $16.13
$14 是"常开"的数字——机器每天跑 20 小时,天天如此,做真实的工作。这不是一个往好了算的数字;它是一个激进数字。大多数人落在 $7。
作为对比,同样 8h/16h 模式下其他硬件的电费:
RTX 5090 台式机 | 650W 负载 | 195 kWh | $31.20
RTX 4090 台式机 | 550W 负载 | 166 kWh | $26.56
Mac Studio M4 Ultra | 250W 负载 | 66 kWh | $10.56
MacBook Pro M4 Max | 100W 负载 | 28 kWh | $4.50
没错——一台 5090 游戏机跑本地 AI,电费比一份 Claude Pro 订阅还贵。迷你 PC 赢的不是速度,是瓦数。这正是 Strix Halo 这类机器存在的全部理由。
然后是回本,这才是真正起决定作用的数字:
你每月省下 $600 - $14 = $586
主机 | 价格 | 多久回本
origimagic A3 | $609 | 1.0 个月
Beelink SER10 MAX | $1,799 | 3.1 个月
GMKtec EVO-X2 96GB | $2,349 | 4.0 个月
GMKtec EVO-X2 128GB | $3,299 | 5.6 个月
Mac Studio M4 Max | $3,699 | 6.3 个月
每一台都在一年内回本。大多数在一个季度内。
8/
混合方案。留一把按量计费的 key,而不是三份订阅。
没人应该 100% 本地跑,任何告诉你相反说法的人都没交付过什么硬东西。正确的做法是让前沿模型按量计费、而不是订阅——你只为你真正用到的那 20% 付费,而不是租一个你一周只碰两次的无限访问权。
把两者接进同一个代理,一键切换。第 5 节你已经配置好 kimi-k3 了。那 20% 实际花多少钱:
模型 | 输入 $/1M | 输出 $/1M | 你什么时候用它
本地 Kimi-Linear | $0 | $0 | 默认,所有事
Grok Build | 0.1 | $1.00 | $2.00 | agentic 工具循环,便宜
Grok 4.3 | $1.25 | $2.50 | 1M 上下文,长文档
Grok 4.6 | $2.00 | $6.00 | 硬核推理,500K 上下文
Kimi K3 | $3.00 | $15.00 | 前沿,1M 上下文
算一个真实月份的账。假设 40 个需要前沿模型帮忙的硬核会话,每个烧掉 50K 输入和 8K 输出:
40 个会话 x 50K 输入 = 2.0M 输入 tokens
40 个会话 x 8K 输出 = 0.32M 输出 tokens
在 Grok 4.6 上 2.0 x $2 + 0.32 x $6 = $5.92
在 Grok 4.3 上 2.0 x $1.25 + 0.32 x $2.50 = $3.30
在 Kimi K3 上 2.0 x $3 + 0.32 x $15 = $10.80
你最难的那 20% 工作,在最贵的那个模型上,每月不到 $11。整个技术栈落在 $14 电费加 $6–11 的按量 API——总共约 $25 一个月,取代 $600。
一个路由器让你诚实地区分哪个是哪个:
# route.py - 除非真的难,否则发本地
import os, requests
LOCAL = "http://localhost:11434/v1/chat/completions"
FRONTIER = "https://api.x.ai/v1/chat/completions"
HARD = ("architecture", "race condition", "why is prod",
"design from scratch", "security review")
def ask(prompt: str, force_frontier: bool = False):
hard = force_frontier or any(k in prompt.lower() for k in HARD)
url, model, key = (
(FRONTIER, "grok-4.6", os.environ["XAI_API_KEY"]) if hard
else (LOCAL, "kimi-linear:48b-a3b-q4_K_M", "not-needed")
)
r = requests.post(
url,
headers={"Authorization": f"Bearer {key}"},
json={"model": model, "messages": [{"role": "user", "content": prompt}]},
timeout=600,
)
r.raise_for_status()
return r.json()["choices"][0]["message"]["content"], ("frontier" if hard else "local")
if __name__ == "__main__":
text, where = ask("write a pytest for utils.parse_date")
print(f"[{where}] {text}")
刻意做得粗糙。关键词路由能覆盖大部分,force_frontier 标志处理剩下的。记录两周哪个分支被触发,你就知道自己的真实切分——我稳定在 83/17。
9/
Grok Bot vs 你的常开主机。同样的想法,不同的房东。
xAI 在 2026 年 8 月 11 日推出了 Grok Bot,它确实是个好产品。每个 bot 都有自己的云端电脑,无需 API 就能登录你的应用,保持持久上下文,还能在你离线时工作——只在需要时请求批准。
但它只在昂贵的档位里卖:
如何获得 Grok Bot | 价格 | 还捆绑了什么
SuperGrok Heavy | $300/月 | xAI 顶级消费档
Cursor Ultra | $200/月 | bot 自己的电脑、routines
Cursor Teams Premium | $120/席位/月 | 集中计费、分析
诚实的对比,因为它们不是同一个产品:
| GROK BOT | 你的主机
常开 | 是,在他们的云上 | 是,在你桌上
你睡觉时也工作 | 是 | 是
登录你的应用 | 是,内置 | 你自己接线
前沿模型 | 是,含在内 | 按量,或本地 + 更便宜
你的代码离开机器 | 是 | 从不
每月成本 | 最低 $300 | $14
限流 | 每周额度 | 你的硬件
扛得住涨价吗 | 不能 | 能
Grok Bot 在便利性和应用集成层上赢——那是真正需要你自己去建的工程。你的主机在成本、隐私、以及"没人能在你发版的那个周二给它重新定价、弃用它、或者限流它"这件事上赢。
如果应用集成正是你需要的,付 $300 然后别往下看了。如果你真正想要的,是一个在你的仓库上工作、还没有计费表在跑的代理,那这台主机严格更优。
10/
他们俩谁都没真正送出的东西。
两家公司都做出了真正的赠予,也都留下了对自己最要紧的那块。值得点明,因为它解释了为什么这个组合能成立。
xAI 送出了 harness,留住了模型。grok-build 确实完整、确实是 Apache 2.0。但 Grok 4.6 的权重并不公开、也从未公开——你得到身体,租用大脑。许可证在实践中也是只读的:你可以 fork、发布、售卖,但上游不收你的补丁。对用户来说没问题。如果你想要一个围绕它的社区,会有点沮丧。
Moonshot 送出了模型,留住了工具。权重在 Hugging Face 上,Kimi-Linear 是真正的 MIT。但 K2.7 和 K3 带一个修改版许可证、有商业门槛——基于它们做 model-as-a-service 业务、年收入超过约 $20M 时,你需要单独协议。而且 Moonshot 没有发布任何自己的代理来与你从 xAI 免费得到的东西竞争。
这正是组合能成立的原因:每一方都开源了另一方在保护的那一半。这不是协调——这是两家护城河相反的公司,而你站在这道缝隙里。
别把任何一方当成慈善。xAI 想让这个 harness 成为默认,好让他们的 API 成为默认后端。Moonshot 想让权重遍地都是,好让付费档被考虑。两个赌注都理性。两者都在桌上留下了一套能用的免费技术栈。
11/
你是哪个档位。决策树。
+--------------------------------+
| 你现在付多少钱? |
+---------------+----------------+
|
v
你已经有一块 3090/4090
或一台 32GB+ 的 Mac 吗?
| |
是 否
| |
v v
从这里开始。$0 起步。 你每月的 AI 账单是多少?
第 5 节和第 8 节 | |
今天下午就搞定。 低于 $50 高于 $200
| |
v v
origimagic A3 EVO-X2 96GB
$609 $2,349
约 1 个月回本 约 4 个月回本
| |
+-----+------+
|
v
你需要应用集成吗
(登录你的工具、routines)?
| |
是 否
| |
v v
保留 Grok Bot 用 $14 技术栈。
每月 $300。 本地优先,
主机仍然干掉你的 前沿模型按量兜底
另外两份订阅。 那困难的 20%。
12/
完整技术栈,一屏看完。
存下这一个。
身体
grok-build | github.com/xai-org/grok-build
安装 | curl -fsSL https://x.ai/cli/install.sh | bash
许可证 | Apache 2.0,自由 fork 和发布
配置 | ~/.grok/config.toml
模式 | TUI · 无头 (CI) · ACP 嵌入
大脑
本地 | Kimi-Linear-48B-A3B · MIT · ~28GB Q4 · 1M ctx
大家伙 | Kimi K2.7 Code · 325GB 2-bit
别在家试 | Kimi K3 · ~1.4TB
运行时 | Ollama · LM Studio · llama.cpp · Jan
主机
预算 | origimagic A3 $609 45W 13B
甜点 | GMKtec EVO-X2 96GB $2,349 140W 70B Q4
最快 | Mac Studio M4 Max $3,699 180W 546 GB/s
免费 | 你已有的 GPU $0
账单
电费 | 取决于时长,$3-14/月
前沿按量 | 困难的 20%,$6-11/月
总计 | 约 $25/月 取代 $600/月
回本 | 硬件 1 到 6 个月
接线
base_url 必须以 /v1 结尾
context_window 设为真实值,不是宣传值
验证本地 | 看运行时日志,不是看代理
路由 | 默认本地,关键词触发前沿
窗口期。
六个月前这篇文章还写不出来。xAI 的代理还没公开。Kimi-Linear 还不存在。256 GB/s 统一内存的迷你 PC 还不是 $2,349。这三样都在同一个夏天里落地了。
当本地硬件跟不上时,订阅是有道理的。它跟上了。一台 $609 的主机能跑一个能用的编程模型。一台 $2,349 的主机能跑一个带一百万 token 上下文的 70B 模型。驱动它们的代理,和 xAI 发给付费客户的是同一个,而且发布在无法被撤销的许可证下。
你不需要最贵的选项。你不需要成为 ML 工程师。设置是四条命令加一个配置文件,最难的部分是等一个 28GB 的下载。
$600/月订阅 | $7,200/年
$14/月电费 | $168/年
--------------
省下 $7,032
一台主机永久干掉这张账单。选好你的档位,这个周末把它接起来,别再租你能拥有的算力。
// 窗口开着。关注 @starmexxx——我会继续在它们关闭前找到它们 // Tags: # X # Grok Bot # AI # Hardware # Claude # MCP # Guide # Chatgpt Related articles Grok Bot Is Turning One Person Into an Entire AI Team You are no longer asking, "Can you help me do this?" Grok Bot AI Claude Marketing
原文参考:https://maxed.wiki/posts/how-i-went-from-600-month-to-14-elon-s-grok-kimi-s-brain/ (Maxed.wiki,本页为站内中文整理)