kimik3.io/开放权重

Kimi K3 开放权重

官方承诺 2026 年 7 月 27 日前开源——目前还没交付。本页跟踪发布状态、把硬件账算清楚,权重落地后会更新。

Kimi K3 的权重还没有公开。月之暗面(Moonshot AI)官方文档写明:「完整模型权重将于 2026 年 7 月 27 日前发布。」截至 2026-07-18,Hugging Face 上没有 Kimi K3 的仓库,没有模型卡,也没有公布许可证。已经官宣的是:总参数 2.8 万亿,混合专家(MoE)架构,每个 token 激活 896 个专家中的 16 个,基于 Kimi Delta Attention(KDA)。在权重落地之前,跑 K3 的唯一方式是 API——它已经上线

架构与发布承诺引自官方快速开始,读取于 2026-07-18。最近一次查证权重是否落地:2026-07-18

哪些已官宣,哪些还未知

状态截至 2026-07-18。权重落地当天补全右侧栏目。
项目状态来源
发布日期2026 年 7 月 27 日前——官方承诺官方快速开始,读取于 2026-07-18
总参数2.8 万亿,MoE,激活 896 个专家中的 16 个官方快速开始,读取于 2026-07-18
架构Kimi Delta Attention(KDA)+ Attention Residuals官方快速开始,读取于 2026-07-18
Hugging Face 仓库—— 尚未发布2026-07-18 查证
许可证—— 未公布截至 2026-07-18 无官方说明
模型卡 / 部署指南—— 尚未发布随权重一起到
官方量化版本—— 未知随权重一起到

今天任何给出 K3 最低显存数字、部署命令或许可证条款的人,都是在猜。在 7 月 27 日之前,这个页面诚实的版本就是短短一页——我们唯一能诚实去做的,是算术。

硬件账

2.8 万亿参数有一笔固定的存储成本,任何部署技巧都省不掉。下面是乘法,不是实测:

各精度下的权重存储下限——由官方 2.8T 数字直接算出。运行时开销和 KV 缓存(在 100 万 token 窗口下相当可观)还要另算。
精度字节/参数仅权重光是装下它们
BF16 / FP1625.6 TB≥ 30 块 192 GB 加速卡
FP812.8 TB≥ 15 块 192 GB 加速卡
4-bit0.51.4 TB≥ 8 块 192 GB,或 ≥ 18 块 80 GB

这笔算术直接推出两件事。第一,MoE 的稀疏性并不会缩小体积。每个 token 只激活 896 个专家中的 16 个,省的是每个 token 的算力,不是显存:任何一个专家要能被路由到,所有专家就都得常驻。第二,没有任何单机装得下它。就算量化到 4-bit,1.4 TB 的权重也差不多是最大统一内存工作站的三倍,比任何单张 GPU 高出一个数量级——这从第一天起就是多节点部署,还没算 1,048,576 token 窗口的 KV 缓存预算。

给个参照:同等精度下,K3 的 2.8T 是 1 万亿参数的 K2 系列的 2.8 倍——而 K2 的各个开源版本已经是多 GPU 部署了。真实的部署要求(张量并行布局、支持的推理引擎、量化版本)会随模型卡一起到;官方数字一出来,我们当天就用它替换这笔算术。

开源前准备清单

  • 盯住 moonshotai 的 Hugging Face 组织页月之暗面没说权重会落在哪里,但此前每一次 Kimi 开源都发在那里。
  • 动手之前先读许可证。它还没公布。在文本公开之前,别假设它和之前的 Kimi 开源版本一致。
  • 先别定部署栈。KDA 是一套新的注意力设计——你的推理引擎第一天能不能支持它,恰恰是模型卡才能回答、猜测回答不了的那类问题。
  • 诚实地给部署算账。如果上面 4-bit 那一行就已经超预算,自部署 K3 就不是你的路——这也没什么不好,因为托管模型只差一行 base_url
  • 现在就给模型做基线。API 已经上线:你可以在投入硬件之前,先在自己的真实工作负载上验证质量、延迟和成本。我们的实测是个起点。

自部署 vs API,用数字说话

API 的入场券是 $0。自部署的入场券是上面那行 1.4 TB。在这两个极端之间,我们实测出的数字能把 API 这一侧的账算得格外精确:

  • 一条 497,718 token 的提示词,单次调用花 $1.49(按官方 $3.00/1M 费率)——实测,打满整个窗口约 $3.15。
  • 提示词缓存自动把重复输入降到 $0.30/1M——正是这个 10 倍折扣,让「同一大段上下文、问很多问题」的工作负载不用买一张 GPU 也跑得起。
  • 你的工作负载按官方费率一个月要花多少:计算器在浏览器里帮你算。如果那个数字只是多节点 GPU 集群月成本的一个零头,答案就已经出来了——自部署 K3 是为了合规、数据驻留和研究,在常规量级上不是为了省钱。

今天你就能跑的

托管模型已经上线,兼容 OpenAI 格式。下面这段代码,模型上线第一时间我们就在生产环境逐字验证过:

python · openai sdk
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_EVOLINK_API_KEY",
    base_url="https://direct.evolink.ai/v1",   # <-- 你唯一需要改的一行
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain prompt caching in two sentences."}],
)

print(response.choices[0].message.content)

鉴权、流式输出、真实响应体长什么样:API 指南。让 max_completion_tokens 保持默认值——原因在这

开放权重常见问题

Kimi K3 的权重什么时候发布?

月之暗面官方文档承诺「2026 年 7 月 27 日前」(读取于 2026-07-18)。截至 2026-07-18,权重尚未发布。情况一变,本页当天更新。

Kimi K3 开源吗?

已承诺、未交付:权重官方定于 2026 年 7 月 27 日前发布,许可证尚未公布。在权重和许可证文本都公开之前,K3 只能以托管模型的方式使用。

本地跑 Kimi K3 需要什么硬件?

模型卡发布之前没人知道。算术下限:2.8 万亿参数在 4-bit 下是 1.4 TB——光是装下权重就至少要 8 块 192 GB 加速卡,还没算 100 万 token 窗口的 KV 缓存。在任何已公布的精度下,它都不可能跑在单张 GPU 或单台工作站上。

权重会在哪里提供下载?

官方没说。此前每一次 Kimi 开源都落在 moonshotai 的 Hugging Face 组织页,所以那里最值得盯。

权重落地之前能用 Kimi K3 吗?

能——API 从发布起就在线。模型 ID kimi-k3,兼容 OpenAI 格式,官方费率输入 $3.00/1M、输出 $15.00/1M。5 分钟发出第一次调用

不用买 1.4 TB 显存,也能跑 K3

EvoLink 在 OpenAI 兼容接口上承载 kimi-k3——一把 key 即可调用 GPT、Claude、Gemini 等全球主流模型。注册即送 10 个免费额度。

获取 EvoLink API key