一句话摘要
标题主题:1800 美元一次买断离线运行 Claude Code 的 GMKTEC EVO-X2
GMKTEC EVO-X2 可以没有互联网就跑 Claude Code。1,800 美元一次,每月 0 美元。
June 15, 2026 · 9 min read · View source ↗ Claude AI Hardware
一台迷你 PC。一次安装。Claude Code 指向你的客厅,而不是 Anthropic 的服务器。
如果你每月为 Claude Code Max 付 200 美元,又为 ChatGPT Pro 付 200 美元,你一年在 AI 上花掉近 5,000 美元。那个算术过去是说得通的。桌上没有任何东西能碰到云端提供的水平。
这刚刚变了。
GMKtec EVO-X2 是一台精装书大小的迷你 PC。它卖 1,800 美元。它在本地跑高达 2000 亿参数(200 billion parameter)的模型,而且你可以把它接到 Claude Code 上,让 CLI 把每一个请求都发给你的盒子,而不是 Anthropic。同样的界面,同样的智能体循环,什么都不离开你的网络,什么都不上计费表。
下面就是确切的设置方法,以及你需要复制它的东西。
盒子
EVO-X2 看起来平平无奇。黑色,放在架子上,比大多数游戏笔记本便宜。真正改变算术的,是里面的东西。
┌────────────────────────┬──────────────────────────┐
│ Spec │ GMKtec EVO-X2 │
├────────────────────────┼──────────────────────────┤
│ Chip │ AMD Ryzen AI Max+ 395 │
│ Cores / Threads │ 16 / 32 │
│ Max clock │ 5.1 GHz │
│ GPU │ 40 RDNA 3.5 CUs │
│ NPU │ 50 TOPS │
│ Unified memory │ 128GB LPDDR5X │
│ Usable as VRAM (Linux) │ up to 110GB │
│ Peak power │ ~140W │
│ Price │ $1,700 - $2,000 │
└────────────────────────┴──────────────────────────┘
这颗芯片是 AMD 的 Strix Halo,以 Ryzen AI Max+ 395 名义销售。历史上第一颗能把一个 2000 亿参数模型装进单块硅片的 x86 芯片。Lisa Su 带着其中一台走上了 CES 2026 的主题演讲舞台,后来还在一台上签了名。CEO 不会在硬件上签名,除非有什么东西变了。
变了的东西:统一内存。不是一块带自己小 VRAM 池的独立 GPU,而是 CPU 和 GPU 共享一个 128GB 的池子。模型只加载一次。两颗芯片读同一个地址空间。Apple Silicon 做的也是同一件事,而这就是 Mac 在本地 AI 上能打出超出自身份量的拳的原因。
这里的区别是,EVO-X2 能正常跑 Linux,这意味着 Ollama、llama.cpp、vLLM,以及其余的开源 AI 技术栈,都能跑起来而不会跟你对着干。
它到底能跑什么
公开的基准和社区在 AMD AI Max 平台上的测试,大致显示了 Linux 上一个 Q4 量化栈的以下情况:
┌──────────────────────┬────────────┬───────────────────────────┐
│ Model │ Size │ Approx. speed │
├──────────────────────┼────────────┼───────────────────────────┤
│ Qwen3-Coder 30B │ ~18GB │ ~40-50 tok/s │
│ Llama 3.3 70B │ ~42GB │ ~20-25 tok/s │
│ DeepSeek-V3 │ ~95GB │ ~10-12 tok/s │
│ Qwen3-235B │ ~110GB │ ~6-8 tok/s │
└──────────────────────┴────────────┴───────────────────────────┘
替换 Claude Code Max 时最要紧的两个,是 Qwen3-Coder 30B 和 Llama 3.3 70B。两者都完全可用于开发工作。两者都装得进内存,还有长上下文窗口的空间。在盒子回本之后,两者每个 token 都不再花一分钱。
更大的模型,在你需要它们的时候也在。Qwen3-235B 在很多基准上跟 Claude Sonnet 处在同一个段位。是的,更慢。是的,在那些速度不是瓶颈的查询上,值得。
设置,端到端
安排一个晚上。大部分时间都是下载。
第 1 步。抹掉 Windows。
EVO-X2 出厂带 Windows 11。Windows 把你可用的 VRAM 封顶在 96GB。Linux 解锁到 110GB。没有理由在一台你为 AI 买的盒子上留着 Windows。从一个 Ubuntu 24.04 USB 启动,格式化硬盘,安装。
第 2 步。安装 Ollama。
curl -fsSL https://ollama.com/install.sh | sh
引擎就这些。Ollama 处理模型加载、内存和 API 端点。没有配置文件。不用跟 GPU 驱动搏斗。AMD 的支持现在很扎实了。
第 3 步。拉一个模型。
ollama pull qwen3-coder:30b
等十五分钟下载。模型落在约 18GB,留在磁盘上。
第 4 步。测试它。
ollama run qwen3-coder:30b "write a python function that downloads a file with progress"
如果你拿到了响应,你就已经过了最难的部分。
第 5 步。安装 Open WebUI(可选,但推荐)。
docker run -d -p 3000:8080 \
-e OLLAMA_BASE_URL=http://localhost:11434 \
-v open-webui:/app/backend/data \
--name open-webui ghcr.io/open-webui/open-webui:main
现在你在 http://evo.local:3000 有了一个 ChatGPT 风格的界面,网络上任何设备都能访问。手机、笔记本、平板,全都在打你的盒子。
第 6 步。把 Claude Code 指向本地端点。
这是真正取代订阅的那一步。
export ANTHROPIC_BASE_URL=http://evo.local:11434
export ANTHROPIC_API_KEY=ollama
现在 Claude Code,这个 CLI 工具,把每一个请求都发给你的 EVO-X2,而不是 Anthropic。同样的命令。同样的智能体循环。什么都不离开你的网络。
从头到尾总时间:如果你从没碰过 Linux,大约九十分钟。如果你碰过,四十五分钟。
钱
这一台盒子逐行取代了什么。
┌────────────────────────────┬──────────────┬──────────────┐
│ Subscription │ Monthly cost │ Annual cost │
├────────────────────────────┼──────────────┼──────────────┤
│ Claude Code Max (20x) │ $200 │ $2,400 │
│ ChatGPT Pro │ $200 │ $2,400 │
│ Cursor Pro │ $20 │ $240 │
├────────────────────────────┼──────────────┼──────────────┤
│ Total │ $420 │ $5,040 │
└────────────────────────────┴──────────────┴──────────────┘
盒子是 1,800 美元。24/7 运行,电费大约每月 9 美元。
盈亏平衡点在第 5 个月到来。之后,每个月都是曾经要离开你账户、如今留下来的钱。三年算下来,大约是 13,000 美元没付给 AI 公司。
真正的转变不是省钱。是行为上的改变。当你停止按 token 付费,你就停止精打细算你的用量。你会让智能体整夜跑那些计费表还转着时你根本不会开工的任务。全代码库审计。几百个文件的文档处理。那些你本来会说服自己别试的重构实验。本地推理在边际上是免费的,而这翻转了你使用它的方式。
你能真正拿它做什么
编码是最明显的第一件事。Claude Code 指向本地的 Qwen3-Coder 30B。你写代码的方式,跟你用 Anthropic 模型时一样。这个 30B 在真正难的问题上,明显比 Claude Sonnet 差。它比没有强,而且边际成本是零。对你每天写的 90% 的代码来说,这个交换是划算的。
跑好几个小时的智能体。这是算术真正炸开的地方。搭一个研究智能体,爬取特定账号、总结新帖子、把每日摘要丢进 Telegram。在 Anthropic API 上,那是每天 15–20 美元的 token。在 EVO-X2 上,它在后台跑,你忘了它存在。
对私有文档做 RAG。这台盒子有绰绰有余的余量,能在聊天模型旁边暖着一个 embedding 模型。把你的笔记、聊天记录、工作文档丢进一个向量数据库。按意思搜索,而不是关键词。什么都不离开盒子。
批量转录和摘要。Whisper 在同一块硬件上跑。丢一文件夹语音备忘或录音进去,拿出转写文本。云端版本每分钟收真金白银。本地版本只花电费。
那些过去显得很贵的快速实验。想测一个微调分类器是不是比提示词更好?试。想在一个 LLM 裁判上跑 10,000 个例子?跑。成本是电和时间,不是每 token 的美元,而这改变了你愿意去做的实验的种类。
它做不了的事
有两件事这台盒子取代不了。
第一个是前沿推理。Claude Opus 4.7 和 GPT-5,在那些你真正需要一个模型去死磕的问题上,仍然领先于你在家里能跑的任何东西。最难的那 5% 的问题,你仍然会上云。只不过你会通过按量付费的 API 来做,而不是一份 200 美元的订阅。
第二个是并发。EVO-X2 服务一个人很好。两个人共享能用。五个人共享不行。如果你是在为一个团队搭建,你要么租云 GPU,要么买更多盒子。
至于其他一切——日常编码、起草、智能体、搜索、转录、文档分析——本地栈都够了。那正是大多数人用 AI 实际做的绝大部分事情。
诚实的权衡
这台盒子在持续负载下会发热。不算危险,但你会听到风扇。别把它放卧室。
AMD 上的 Ollama 已经变得很好,但它不是 CUDA。少数几个新模型带着只针对 Nvidia 的优化发布,你得等几个星期让 AMD 路径追上来。那是做早鸟的税。不是致命伤。
开源模型的选择很好,但不是无限。最大的开源模型,在某些任务上,还没完全到 Claude Sonnet 4.6 的水平。编码,可以。推理,可以。最高端的创意写作,还没有。
Linux 设置要求你知道 Linux 是什么。上面的命令很简单。第一次有什么坏了、你得去调试的时候,你会在一篇 Reddit 帖子上耗一个小时。那就是第一天就上本地的代价,而不是再等一年。
而且你在买硬件。如果 AMD 明年发货一个好两倍的东西,你的 1,800 美元不会自己退回来。跟任何科技消费一样的风险。第 5 个月的盈亏平衡点意味着,你不需要为了算术成立而把这台盒子留三年。哪怕只用一年,就覆盖了硬件成本。
为什么是现在
十八个月前,这套设置还不存在。那颗芯片还不存在。桌上放 128GB 统一内存,你根本买不到。Ollama 在 AMD 上跑不干净。Claude Code 不让你用一个环境变量重定向到本地端点。
这四件事,全都在过去一年里落地了。
这个“这还是个不明显操作”的窗口,正在飞快收窄。到下一次 CES,AI 迷你 PC 这个品类会看起来完全不同。更多盒子、更多芯片、更多软件。现在你可以做早鸟,而算术已经一边倒地偏向你了。
一笔 1,800 美元的购买。每月 9 美元电费。Claude Code 跑在你桌上而不是 Anthropic 的服务器上,什么都没有被记录、什么都没有被发到任何地方、没有月账单。
我在这些东西进入主流之前就找到它们。关注 @gippp69,加入频道:https://t.me/GipArcAI 。
Tags: # X # Claude # AI # Hardware # Thread # Chatgpt # Sonnet
相关文章
HOW I WENT FROM $600/MONTH TO $14. ELON'S GROK + KIMI'S BRAIN
Follow & Bookmark this - I'm [@starmexxx](https://x.com/starmexxx), I track how AI tools are creating new income streams most people haven't heard of yet. This one is the entire build.
Grok Bot AI Hardware Claude
原文参考:https://maxed.wiki/posts/the-gmktec-evo-x2-can-run-claude-code-without-the-internet-1-800-once-0-a-month/ (Maxed.wiki,本页为站内中文整理)