kimik3.io/开放权重
Kimi K3 开放权重
官方承诺 2026 年 7 月 27 日前开源——目前还没交付。本页跟踪发布状态、把硬件账算清楚,权重落地后会更新。
Kimi K3 的权重还没有公开。月之暗面(Moonshot AI)官方文档写明:「完整模型权重将于 2026 年 7 月 27 日前发布。」截至 2026-07-18,Hugging Face 上没有 Kimi K3 的仓库,没有模型卡,也没有公布许可证。已经官宣的是:总参数 2.8 万亿,混合专家(MoE)架构,每个 token 激活 896 个专家中的 16 个,基于 Kimi Delta Attention(KDA)。在权重落地之前,跑 K3 的唯一方式是 API——它已经上线。
架构与发布承诺引自官方快速开始,读取于 2026-07-18。最近一次查证权重是否落地:2026-07-18。
哪些已官宣,哪些还未知
| 项目 | 状态 | 来源 |
|---|---|---|
| 发布日期 | 2026 年 7 月 27 日前——官方承诺 | 官方快速开始,读取于 2026-07-18 |
| 总参数 | 2.8 万亿,MoE,激活 896 个专家中的 16 个 | 官方快速开始,读取于 2026-07-18 |
| 架构 | Kimi Delta Attention(KDA)+ Attention Residuals | 官方快速开始,读取于 2026-07-18 |
| Hugging Face 仓库 | —— 尚未发布 | 2026-07-18 查证 |
| 许可证 | —— 未公布 | 截至 2026-07-18 无官方说明 |
| 模型卡 / 部署指南 | —— 尚未发布 | 随权重一起到 |
| 官方量化版本 | —— 未知 | 随权重一起到 |
今天任何给出 K3 最低显存数字、部署命令或许可证条款的人,都是在猜。在 7 月 27 日之前,这个页面诚实的版本就是短短一页——我们唯一能诚实去做的,是算术。
硬件账
2.8 万亿参数有一笔固定的存储成本,任何部署技巧都省不掉。下面是乘法,不是实测:
| 精度 | 字节/参数 | 仅权重 | 光是装下它们 |
|---|---|---|---|
| BF16 / FP16 | 2 | 5.6 TB | ≥ 30 块 192 GB 加速卡 |
| FP8 | 1 | 2.8 TB | ≥ 15 块 192 GB 加速卡 |
| 4-bit | 0.5 | 1.4 TB | ≥ 8 块 192 GB,或 ≥ 18 块 80 GB |
这笔算术直接推出两件事。第一,MoE 的稀疏性并不会缩小体积。每个 token 只激活 896 个专家中的 16 个,省的是每个 token 的算力,不是显存:任何一个专家要能被路由到,所有专家就都得常驻。第二,没有任何单机装得下它。就算量化到 4-bit,1.4 TB 的权重也差不多是最大统一内存工作站的三倍,比任何单张 GPU 高出一个数量级——这从第一天起就是多节点部署,还没算 1,048,576 token 窗口的 KV 缓存预算。
给个参照:同等精度下,K3 的 2.8T 是 1 万亿参数的 K2 系列的 2.8 倍——而 K2 的各个开源版本已经是多 GPU 部署了。真实的部署要求(张量并行布局、支持的推理引擎、量化版本)会随模型卡一起到;官方数字一出来,我们当天就用它替换这笔算术。
开源前准备清单
- 盯住 moonshotai 的 Hugging Face 组织页。月之暗面没说权重会落在哪里,但此前每一次 Kimi 开源都发在那里。
- 动手之前先读许可证。它还没公布。在文本公开之前,别假设它和之前的 Kimi 开源版本一致。
- 先别定部署栈。KDA 是一套新的注意力设计——你的推理引擎第一天能不能支持它,恰恰是模型卡才能回答、猜测回答不了的那类问题。
- 诚实地给部署算账。如果上面 4-bit 那一行就已经超预算,自部署 K3 就不是你的路——这也没什么不好,因为托管模型只差一行
base_url。 - 现在就给模型做基线。API 已经上线:你可以在投入硬件之前,先在自己的真实工作负载上验证质量、延迟和成本。我们的实测是个起点。
自部署 vs API,用数字说话
API 的入场券是 $0。自部署的入场券是上面那行 1.4 TB。在这两个极端之间,我们实测出的数字能把 API 这一侧的账算得格外精确:
- 一条 497,718 token 的提示词,单次调用花 $1.49(按官方 $3.00/1M 费率)——实测,打满整个窗口约 $3.15。
- 提示词缓存自动把重复输入降到 $0.30/1M——正是这个 10 倍折扣,让「同一大段上下文、问很多问题」的工作负载不用买一张 GPU 也跑得起。
- 你的工作负载按官方费率一个月要花多少:计算器在浏览器里帮你算。如果那个数字只是多节点 GPU 集群月成本的一个零头,答案就已经出来了——自部署 K3 是为了合规、数据驻留和研究,在常规量级上不是为了省钱。
今天你就能跑的
托管模型已经上线,兼容 OpenAI 格式。下面这段代码,模型上线第一时间我们就在生产环境逐字验证过:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_EVOLINK_API_KEY",
base_url="https://direct.evolink.ai/v1", # <-- 你唯一需要改的一行
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain prompt caching in two sentences."}],
)
print(response.choices[0].message.content)
鉴权、流式输出、真实响应体长什么样:API 指南。让 max_completion_tokens 保持默认值——原因在这。
开放权重常见问题
Kimi K3 的权重什么时候发布?
月之暗面官方文档承诺「2026 年 7 月 27 日前」(读取于 2026-07-18)。截至 2026-07-18,权重尚未发布。情况一变,本页当天更新。
Kimi K3 开源吗?
已承诺、未交付:权重官方定于 2026 年 7 月 27 日前发布,许可证尚未公布。在权重和许可证文本都公开之前,K3 只能以托管模型的方式使用。
本地跑 Kimi K3 需要什么硬件?
模型卡发布之前没人知道。算术下限:2.8 万亿参数在 4-bit 下是 1.4 TB——光是装下权重就至少要 8 块 192 GB 加速卡,还没算 100 万 token 窗口的 KV 缓存。在任何已公布的精度下,它都不可能跑在单张 GPU 或单台工作站上。
权重会在哪里提供下载?
官方没说。此前每一次 Kimi 开源都落在 moonshotai 的 Hugging Face 组织页,所以那里最值得盯。
权重落地之前能用 Kimi K3 吗?
能——API 从发布起就在线。模型 ID kimi-k3,兼容 OpenAI 格式,官方费率输入 $3.00/1M、输出 $15.00/1M。5 分钟发出第一次调用。
不用买 1.4 TB 显存,也能跑 K3
EvoLink 在 OpenAI 兼容接口上承载 kimi-k3——一把 key 即可调用 GPT、Claude、Gemini 等全球主流模型。注册即送 10 个免费额度。