一句话摘要
解锁 2.8T 开源模型的步骤
解锁 2.8T 开源模型的 14 个步骤(以及它在哪些方面碾压一切) 2026年7月21日 · 13分钟阅读 · 查看原文 ↗ AI Marketing Claude Design

四天前,史上最大的开源权重 AI 模型上线了。没有发布会。没有直播。[@Kimi_Moonshot](https://x.com/@Kimi_Moonshot) 在一夜之间改版了 [kimi.com](https://kimi-bot.com/activities/viral-referral/share?scenario=invite&from=share_poster&invitation_code=YS7CZL),并发布了 **Kimi K3**:2.8 万亿参数、100 万 token 的上下文窗口,以及任何开源模型都未曾跑出过的编码成绩。
在 Arena 的盲测中(开发者在不知道哪个模型生成了输出的情况下投票),**K3 在 Frontend Code 竞技场中夺得了第一名。** 它击败了 Claude Fable 5。它击败了 GPT-5.6 Sol。在*构建东西*这件事上排名第一,而投票的人并不知道自己选中的是那个开源模型。

大多数人看到标题就划走了。几乎没人点进去看它到底能构建出什么——也没人了解那个决定它是帮你省钱还是悄悄烧光你钱的设置。
> 关注我 我会不带水分地拆解每一次重大 AI 发布,并把测试提示词直接交到你手上:[**@adiix_official**](https://x.com/adiix_official)。趁它还没被刷走,先收藏。
读到最后你会得到:20 个 K3 用一条提示词就能构建出的东西(附可直接复制的提示词)、六分钟上手配置、能帮你省 90% 账单的路由策略,以及那些把便宜货变成惊吓账单的常见错误。这就是完整攻略。
*先把实话讲在前面,因为这正是重点所在:K3 在**前端代码领域排名世界第一**,并在多个编码和智能体排行榜上登顶——但在综合的 **Agent Arena 上它整体排名第 4**,排在 Fable 5、Opus 4.8 和 GPT-5.6 Sol 之后。它赢的地方赢得干脆利落。这份攻略就建立在这片领地上。来源:Moonshot 的发布信息、Arena 排行榜,以及亲手测试。*
### 60 秒看懂 K3 到底是什么
- **大脑** —— 一个混合专家(Mixture-of-Experts)模型。把它想象成一栋住着 **896 位专家**的大楼;对于任何任务,它只会唤醒其中最合适的 **16 位**(约 1.8%),其余的全部沉睡。它承载着 2.8T 的知识,但运行成本却低得多。*纸面上庞大,实践中精瘦。*
- **覆盖范围** —— **1,048,576 token** 的上下文(整个代码库都能装下)、**原生视觉**(直接读取图像和视频),以及 Moonshot 称之为"思考模式"的**常开推理**。
- **两种规格** —— **K3 Max** 用于聊天和智能体工作;**K3 Swarm** 用于大规模并行任务。
- **出身** —— 由前 Google 研究员杨植麟创立的北京实验室,背后有阿里巴巴支持。2026 年 7 月 16 日发布。
- **真正重要的日期** —— 完整权重将在 **7 月 27 日**以宽松的(Modified MIT)许可证开源。
*20 个构建。3 个错误。一个日期。别再截图排行榜了——开始做路由。*
### 真正重要的架构(大多数报道都略过的部分)

三个已发表的想法就能解释整个发布——这是可供同行检验的研究,不是营销话术。
- **Kimi Delta Attention(KDA)** —— 一种混合线性注意力方案。结果是:在百万 token 的上下文中**解码速度最高提升 6.3 倍**。如果永远等下去,1M 窗口只是理论值;KDA 让它变得实用。
- **Attention Residuals(AttnRes)** —— 取代标准残差连接的 α 运算,以 *Block Attention Residuals* 骨干的形式接入。训练效率**提高约 25%,额外成本不到 2%。**
- **Stable LatentMoE + Gated MLA** —— 让 2.8T 稀疏模型保持稳定的路由和注意力堆栈。
这三者共同解释了 token 效率:与上一代相比,K3 在同等任务上使用的**输出 token 大约减少 21%**。记住这个数字——它就是整个定价论证的核心。
还有一个足以让你坐直身子的炫技:Moonshot 把优化 K3 *自己*注意力内核的任务交给它,然后放手不管。**约 24 小时自主实验、零人工干预、可测量的提速——而且不改变数值。** 递归式自我改进,却像一份枯燥的工程日志。(*厂商自报——但这项技术是开源的。*)
### 定价现实——请仔细阅读
K3 **不是**一款折扣模型。**每百万输入 token 3 美元、每百万输出 token 15 美元**,定价大致在 Claude Sonnet 的水平——而非开源模型让你习惯的那种深度折扣。
那么"更便宜"从何而来?**按完成的每个任务算,而不是按每个 token 算。** 由于那 21% 的 token 效率,在一个在更贵的前沿模型上大约要花 **1.30 美元**的代表性编码任务上,K3 的花费接近 **0.25 美元**。
而最大的隐藏杠杆是:**缓存的输入按每百万 0.30 美元计费,而不是 3 美元**——直接砍掉 90%——但前提是你的前缀在每次调用之间逐字节完全相同。

*诚实的说法是:**Sonnet 的价格、前沿级别的输出、更少的步骤就能达到。** 对比 token 价格,K3 看起来平平无奇。对比"完成一个任务的总成本",那就是另一番对话了。*
### 20 个构建——K3 用一条提示词就能做出什么
这就是为它赢得竞技场第一名的领地。复制提示词,亲自测试。
第一部分——游戏与 3D 世界(它碾压一切的地方)
**1. 带真实物理的可玩浏览器游戏。** 受击反应、动量、镜头手感——那些通常会坏掉的二十个小细节。
```
Build a single-file browser game: a top-down arena where the player dodges
and shoots waves of enemies. Canvas or WebGL, no external assets.
Include: real movement momentum, enemy hit reactions, screen shake on impact,
a score counter, and a restart button. 60fps target.
Make it feel responsive, not floaty. Build the whole thing. Don't ask questions.
```
**2. 看起来像渲染图的交互式 3D 产品。** 正确的光泽度、粗糙度、金属度、真实的阴影——一块手表、一台相机的拆解、一个点击即可装配的机械物体。
**3. 计算出来的物理,而非动画。** 会垂坠的布料、会塌进水里的大桥、带真实动量相撞的车辆。
```
Build three HTML5 canvas scenes, computed physics, no libraries, one file each:
(1) a bridge collapsing and dropping a vehicle into water with displacement,
(2) cloth falling over an invisible object, (3) a block tower toppling from a nudge.
Physics computed not animated. 60fps. Reset button. Comment the equations so I
can verify them. Build all three. Don't ask clarifying questions first.
```
**4. Shader 与 WebGPU 场景。** 真正硬核的图形工作——让星空弯曲的黑洞、粒子系统、程序化地形。把*标准*大声说出来;K3 对标准的响应比对着指令更强。
```
Build a single-file WebGL scene: a black hole with gravitational lensing that
visibly bends a starfield behind it, plus a temperature-colored accretion disk.
Add orbit controls. Quality bar: this should look like a science visualization,
not a shader tutorial. Build the file.
```
第二部分——真实产品与界面
**5. 看起来像设计过而非套模板的落地页** —— 给它一种美学("粗野主义""温暖编辑风""干净金融风")。
**6. 从一份规格说明生成的全栈应用脚手架** —— 前端、API、数据库模式(schema)和认证,全部接通。
```
Build the scaffold for a habit-tracking web app. Stack: React front end,
Node/Express API, Postgres, email+password auth. Features: signup,
create/edit/delete habits, daily check-ins, a streak counter, weekly summary.
Build the schema first, then the API, then the UI. Wire them together and note
anything I'd need to configure to run it.
```
**7. 真正保持同步的实时协作** —— 那些弱的模型在这里会悄悄造假。只有打开两个浏览器时 bug 才会现形;逼它拿出实打实的工作证明。
```
Add a real-time layer: live cursors + click-to-drop comment pins, like Figma.
WebSocket (Socket.io or native ws). Cursors live, comments instant for everyone,
graceful reconnect with no ghost cursors, debounced updates. Build end to end,
then prove sync with two simulated clients before calling it done.
```
**8. 从原始数据生成仪表盘** —— 它的图表/图形推理(Python 驱动)能告诉你数据*说明了什么*,而不只是把图画出来。
第三部分——硬核工程(长时程超能力)

**9. 带可衡量目标的整仓工作** —— 使用 K3 最强有力的方式。
```
Read this entire codebase before changing anything.
Objective: cut p95 response time on /search by 30%.
Rules: profile first and show me where the time goes; don't change public
interfaces or outputs; run tests after every change; if a change makes things
worse, revert it and say why. Work until the objective is hit or you can prove
it can't be without breaking a rule.
End with a log: what you changed, what it bought, what you tried that failed.
```
**10. 把真实的仓库一次性装进上下文** —— 针对你的*系统*做推理,而不是针对零散的片段。提醒:一份精炼的、包含关键文件的 200K 胜过臃肿的 900K 单仓库。重质,不重量。
**11. 语言/框架之间的迁移** —— 在多语言 SWE 上处于最先进水平;在移植过程中保持行为不变。
**12. 带可验证成功条件的自主会话** —— "让这个测试通过"有效;"改进一下代码"会让它漫无目的地游荡。给它一个数字,而不是一种感觉。
第四部分——智能体、工具与研究

**13. 终端 + 浏览器编排** —— 驱动 shell、浏览器和 API 调用而不散架。
```
Goal: find the 3 most-requested features in this repo's GitHub issues, then draft
a spec for the top one. Steps: search the issues, rank by reactions and comments,
pick the highest-impact one, and write a one-page spec with scope, edge cases,
and a rough implementation plan. Show your work.
```
**14. 深度、工具增强的网页研究** —— BrowseComp 上排名第一:搜索、阅读一手来源、交叉引用,返回结构化且带引用的内容。
**15. 通过 K3 Swarm 进行大规模并行任务** —— 把一批任务扇出给多个子智能体,然后合并结果。
**16. 一堆文档 → 一份交付物** —— 一个装满 PDF 的文件夹变成一份综合简报,而非十五份摘要。
第五部分——多模态与高阶技巧
**17. 截图或线框图 → 可用的前端** —— 原生视觉 + 前端王冠。
**18. 对图表、图形与视觉数学进行推理** —— 提取数字并在其上计算(Python 驱动)。接近 CharXiv 榜首(91.3)。
**19. 把视频当作输入** —— 给它一段影像,让它推理屏幕上发生了什么。
**20. 7 月 27 日之后彻底拥有这个模型** —— 在宽松许可证下开源权重意味着:自托管、在你的数据上微调、检查它的行为方式、不依赖任何人的 API 或条款。在一个接近前沿的模型上拥有这种独立性,正是重塑市场的东西。
### 六分钟上手配置
**接进去——它是 OpenAI 兼容的。** 一个 base URL 加一个模型字符串,无需重写。
```
from openai import OpenAI
client = OpenAI(api_key=MOONSHOT_API_KEY, base_url="https://api.moonshot.ai/v1")
resp = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "system", "content": STABLE_PROJECT_CONTEXT}, # keep identical → cache hit at $0.30/M
{"role": "user", "content": task}, # only this changes
],
)
```
**在你的仓库里运行它。**
```bash
curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash # Mac/Linux
cd your-project && kim
```
**把这段路由规则块放进你的 CLAUDE.md / AGENTS.md:**
```
## Model routing
- Long-context reading, repo-wide analysis, doc synthesis → Kimi K3 (1M window, cache at $0.30)
- Frontend, 3D, UI-heavy builds → Kimi K3, then verify visually
- Agent loops with repeated context → Kimi K3 via cache-hit prefixes
- Quick edits, boilerplate, formatting → a smaller/faster model
- Highest-stakes factual work → verify, or stay on your audited model
```
### K3 出问题时——故障排查
- **它在琐碎任务上烧 token。** 思考永远是开启的(只有一个档位:最大)。**解法:** 别把样板活路由给 K3。
- **1M 上下文照样会被填满。** **解法:** 一份精炼的、包含正确文件的 200K 胜过臃肿的 900K 单仓库。
- **长时程自主运行时它会跑偏。** **解法:** 每个长时程提示词都需要一个可验证的成功条件——一个数字、一个通过的测试。
- **你复现不了某个基准。** 在 7 月 27 日之前一切都是厂商自报的。**解法:** 相信你自己的五个任务。
- **切换后出现集成错误。** K3 会返回你可能没预料到的推理 token。**解法:** 检查你的 token 记账——大多数"K3 太贵"的抱怨,其实都是"我忘了推理 token 也是输出 token。"
### 让 K3 只能发挥 10% 的 3 个错误

- **让它成为你所有事情的默认选项。** 常开的思考让琐事变得昂贵——测试者眼睁睁看着它**在一个 SVG 上烧掉 13,241 个推理 token**(Simon Willison)。按任务轻重做路由。
- **以为"开源权重"等于"能在我笔记本上跑"。** 即使高度压缩,它依然**远超 1TB**,并且需要几十块加速卡。开源权重是给自托管团队和做微调的研究者的礼物——对几乎所有人来说,"使用 K3"意味着用那个 app 或 API,而这完全没问题。
- **把基准当事实来引用。** 7 月 27 日之前都是厂商自报。还要留意**幻觉税**:准确率升到了约 46%,但自信的胡说也变多了——约 **51%**(Artificial Analysis)。涉及事实时,发布前先核实。
### 谁还不该切换——以及一份诚实的排名

- 大部分是快速编辑和样板活 → 单档位的税让琐事变得昂贵。
- 今天就需要可审计、可复现的数字 → 等到 7 月 27 日。
- 需要最便宜的 token 又无法自托管 → K3 是 Sonnet 的定价,不是清仓价。
- 没有验证层的事实性、高风险工作 → 参见幻觉税。
*如果你在这份清单上,K3 并不是降级——它只是这个月还不是你的工具。*
### 为什么这比一个基准更重要
在三年不断升级的美国出口管制下,Moonshot 通过架构而非堆算力,造出了一个 2.8 万亿参数的前沿级模型——然后宣布把权重免费送人,时机恰好赶在**上海世界人工智能大会**之前。这不是巧合。
有趣的问题从来不是"中国追上了吗"。而是:当一个免费、开源的模型落进同一梯队时,那些封闭、昂贵的前沿模型的经济学会发生什么。当前沿级能力不再只是三家公司能售卖的东西时,闭源实验室的定价权就变了。*这种*压力才是真正的大事。
### 结论
**三年来,这笔交易一直很简单:美国实验室打造前沿,其他人六个月后拿到一份更便宜的复制品。** *Kimi K3 打破了这一点。*
有史以来最大的开源模型。**前端代码世界第一**,多个编码和智能体排行榜登顶,综合第 4。在出口管制下建成。而一周之后,免费送出。
它不是最便宜的 token,它没有包揽所有榜单,你也没法在家里跑它。这些都是事实——但没有任何一点能改变那条头条:**一个在"构建东西"上击败闭源旗舰的前沿级模型,即将属于所有人。**
按任务轻重做路由。缓存稳定的前缀。给它结果,而不是杂活。核实一切。
大多数人会读一读那条发布推文,然后永远不打开这个模型。花一个晚上用它来构建,你就会领先整条时间线一个月。
**拿五个真实任务测它。把重活路由给它。保留好收据。**
**如何试用**
- 聊天与 app:[kimi.com](https://kimi-bot.com/activities/viral-referral/share?scenario=invite&from=share_poster&invitation_code=YS7CZL)(现已上线)· API:OpenAI-SDK 兼容 · 开源权重:**7 月 27 日**
**链接**
- 在 X 上关注我:[**@adiix_official**](https://x.com/adiix_official)
- 我的 Telegram:[**https://t.me/+bkqbSTOD9z02OTQy**](https://t.me/+bkqbSTOD9z02OTQy)
*来源:Arena.ai 排行榜(Frontend Code #1、Agent #4)· [Tom's Hardware](https://www.tomshardware.com/tech-industry/artificial-intelligence/moonshot-releases-2-8-trillion-parameter-kimi-k3) · [MarkTechPost — 架构](https://www.marktechpost.com/2026/07/16/moonshot-ai-releases-kimi-k3-a-2-8-trillion-parameter-open-moe-model-with-kimi-delta-attention-and-1m-context/) · [Simon Willison — 亲手测试](https://simonwillison.net/2026/Jul/16/kimi-k3/) · [Artificial Analysis via apido*](https://apidog.com/blog/kimi-k3-benchmarks/)*
标签:# X # AI # Marketing # Claude # Design # Growth # Guide # Chatgpt # Fable # Sonnet
相关文章
AI 总是交付千篇一律的 UI,解药在这里 我要向你展示,为什么互联网上每一个 AI 生成的 UI 都像是同一个网站换上了 40 个不同的图标,以及那个最简单、最不起眼的工具如何帮你解决这个问题。 Design AI Claude Marketing
如何用 Kimi K3 构建公司操作系统(构建者指南) 太长不看;如果你不想读一篇 4480 词的文章,这里是一个可以直接交给你的智能体的 GitHub 仓库。 https://github.com/codejunkie99/meridian-company-os AI Design Claude Marketing
如何在 Claude Code 中使用 Kimi K3(Fable 级别的编码能力,便宜 5 倍) Fable 5 → 理解问题,制定计划 Claude AI Design Marketing
原文参考:https://maxed.wiki/posts/14-steps-that-unlock-a-2-8t-open-model-and-where-it-beats-everything/ (Maxed.wiki,本页为站内中文整理)