增长案例库 Maxed 归档 AI搜索优化综合

大家都在争论 Kimi K3 跑分,我花 48 小时找到它的真正用途(快收藏)

Everyone's debating Kimi K3 benchmarks. I spent 48 hours finding what it's useful for. Save this.

中文译文 · 5k 字

一句话摘要

花 48 小时实测 Kimi K3 的真实适用场景,值得收藏。

所有人都在争论 Kimi K3 的基准测试。我花了 48 小时搞清它到底有什么用。收藏这篇。 2026 年 7 月 17 日 · 5 分钟阅读 · 查看原文 ↗ Claude AI Design 1M 上下文窗口解锁的五个工作流,从喂给它你的整个仓库,到分析一段没有文字稿的 3 小时视频。一次完整运行花费 $3。重跑花费 $0.30。 1. 60 秒了解上下文 Kimi K3 于 7 月 16 日由 Moonshot AI 发布。规格表:mixture-of-experts(混合专家)架构下的 2.8T 参数,1M token 的上下文窗口,原生支持文本、图像和视频输入。定价是每百万输入 token $3,每百万输出 $15,缓存命中 $0.30。开源权重承诺在 7 月 27 日放出。 基准测试的噪音是真实的。它在 Frontend Code Arena 上超越了 Claude Fable 5 拿下第一,并在 Terminal-Bench 上拿到 88.3 分,对 Fable 的 84.6 分,同时它在硬推理上仍落后于顶级模型。但基准测试没抓住重点。重点是上下文的价格。这么大一个窗口配上这个价格,改变的是你一次性能交给一个模型的东西。那份清单在下面。 2. 工作流 1:喂给它你的整个仓库 一个 4 万行的代码库大约是 520K token。这个装得下,还绰绰有余。所以跳过那个会检索出错误文件的 RAG 管线,直接粘贴整个仓库。 当它装下一切之后,你可以问什么:画出架构和数据流。找出每一个检查 auth 的地方,以及每一个漏掉它的地方。列出死代码和未使用的依赖。规划一次迁移,并展示它触及的每一个文件。 实用模式:把第一次 $3 的运行花在一份架构图和一份风险清单上。之后每一个后续问题都命中缓存,每次 $0.30。一个仓库,一次加载的上下文,一周的便宜提问。 3. 工作流 2:交给它一段 3 小时的视频 K3 把视频当作原始输入来接收。不需要文字稿,不需要抽帧脚本,不需要 Whisper 步骤。上传录像,直接问。 它的用武之地:一场 3 小时的 webinar 变成一份带时间戳的摘要。一次录制的 sprint review 变成一份带人名的行动项清单。一个竞品的产品 demo 变成一张功能对照表。一场会议演讲变成一份可搜索的笔记。 人们漏掉的部分:它读的是屏幕,而不只是音频。视频里的幻灯片、终端输出和 UI 点击都会进入答案。一份文字稿永远不会有这些。 4. 工作流 3:研究资料堆 三本书大约是 450K token。十二份论文 PDF 挨着它们放也放得下。装下这堆资料,问那些单文档对话回答不了的问题。 这些来源在哪里相互矛盾。哪些说法只出现在一本书里、别处都没有。为这堆资料构建一个阅读顺序。把关于 X 的每一个数字都拉出来并附上页码。 这取代了那种工作流:你分别总结每一份文档,然后试图合并那些已经丢掉了你所需细节的摘要。 5. 工作流 4:把它拆给 100 个 agent K3 Swarm Max 最多能运行 100 个并行 agent,而每一个都携带自己的 1M 上下文。你写一个 prompt。一个编排器把任务拆开、分发出去并合并结果。 这在实践中的样子:50 个来源同时被研究,而不是一个接一个。一次全仓库重构,每个模块都有自己的 agent。一次覆盖 30 个产品的竞品扫描,一顿午饭的功夫就完成了。过去要一个团队花一周的工作,被压缩成几分钟的墙上时钟时间。 套中套:swarm 模式住在 Max 档位里,所以在你围绕它做规划之前,先算好价格。 6. 工作流 5:$0.30 循环 缓存是定价里那个安静的杠杆。第一次运行以 $3 加载你的 1M token。上下文保持缓存,之后每一个问题每百万只需 $0.30。 拿真实的一周来算算:20 个问题放在一个已加载的仓库上,等于 $3 加上 19 次 $0.30 的再计费,总共不到 $9。同样的 20 个问题如果每次都用全新上下文,会跑到接近 $60。由此养成的习惯:早上加载一次,问一整天。 7. 那些坑 诚实环节。Thinking 模式总是开着的,所以答案来得更慢,而且你要为 thinking token 付费,不管你想不想要。在硬的多步推理上,它输给 Claude Fable 5 和 GPT-5.6 Sol,所以把你最难的问题留在它们现在待的地方。开源权重只是日期写着 7 月 27 日的一个承诺,而承诺会跳票。swarm 需要 Max 档位。而且二月份那批关于蒸馏的质疑至今仍悬在 Moonshot 头上,没有答案。 这些没有一项能抵消上面的工作流。它们只是标出这头怪物的獠牙在哪里结束。 8. 今天试一个 这里的转变可以用一句话总结:上下文不再是昂贵的那个部分了。当 1M token 只要 $3,瓶颈就从"什么装得下"变成了"你想知道什么"。 上手只要五分钟。API 在 api.moonshot.ai/v1,讲的是 OpenAI 格式,模型 id 是 kimi-k3。挑一个最贴近你这周的工作流:一个你接手的仓库,一场你跳过的 webinar,一堆你一再推迟的 PDF。喂给这头怪物,看看会回来什么。 如果这篇替你省下了一份订阅费程度的折腾,收藏按钮就在那里。 标签:# X # Claude # AI # Design # Chatgpt # Fable # Rag 相关文章 如何用 AI 做设计而不至于两次得到同一块屏幕 模型返回的是它所见过东西的平均值。而设计,是你拒绝让它取平均值的那部分。 AI Claude Design

原文参考:https://maxed.wiki/posts/everyone-s-debating-kimi-k3-benchmarks-i-spent-48-hours-finding-what-it-s-useful-for-save-this/ (Maxed.wiki,本页为站内中文整理)