kimik3.io/Открытые веса

Открытые веса Kimi K3

Официально обещаны к 27 июля 2026 года — но пока не выпущены. Эта страница следит за релизом, делает арифметику по железу и будет обновлена после выхода весов.

Веса Kimi K3 ещё не опубликованы. Официальная документация Moonshot AI гласит: «Полные веса модели будут выпущены к 27 июля 2026 года». По состоянию на 2026-07-18 на Hugging Face нет репозитория Kimi K3, нет карточки модели и не объявлена лицензия. Что известно официально: 2,8 трлн параметров всего, архитектура mixture-of-experts, активирующая 16 из 896 экспертов на токен, в основе — Kimi Delta Attention (KDA). До релиза единственный способ запустить K3 — API, который уже работает.

Архитектура и обязательство по релизу — из официального квикстарта, прочитано 2026-07-18. Последняя проверка выхода весов: 2026-07-18.

Что официально, а что неизвестно

Статус на 2026-07-18. Правая колонка заполнится в день выхода весов.
ПунктСтатусИсточник
Дата релизаК 27 июля 2026 — официальное обязательствоОфициальный квикстарт, прочитано 2026-07-18
Всего параметров2,8 трлн, MoE, активны 16 из 896 экспертовОфициальный квикстарт, прочитано 2026-07-18
АрхитектураKimi Delta Attention (KDA) + Attention ResidualsОфициальный квикстарт, прочитано 2026-07-18
Репозиторий на Hugging Face— пока не опубликованПроверено 2026-07-18
Лицензия— не объявленаОфициальных заявлений нет на 2026-07-18
Карточка модели / гайд по развёртыванию— пока не опубликованыПоявятся вместе с весами
Официальные квантизации— неизвестноПоявятся вместе с весами

Любой, кто сегодня называет минимальный объём VRAM, команду запуска или пункт лицензии K3, — гадает. Честная версия этой страницы до 27 июля — короткая. Что мы можем сделать честно — так это арифметику.

Математика железа

У 2,8 трлн параметров есть фиксированная стоимость хранения, которую не убирает ни один приём развёртывания. Это умножение, а не замер:

Нижняя граница хранения весов по точности — арифметика от официальной цифры 2,8 трлн. Накладные расходы рантайма и KV-кэш (существенный при окне в 1 млн токенов) — сверху.
ТочностьБайт на параметрТолько весаЧтобы просто их разместить
BF16 / FP1625,6 ТБ≥ 30 ускорителей по 192 ГБ
FP812,8 ТБ≥ 15 ускорителей по 192 ГБ
4-бит0,51,4 ТБ≥ 8 по 192 ГБ или ≥ 18 по 80 ГБ

Из этой арифметики следуют две вещи. Первая: разрежённость MoE не уменьшает занимаемый объём. Активация 16 из 896 экспертов сокращает вычисления на токен, а не память: каждый эксперт должен находиться в памяти, чтобы любой из них был доступен маршрутизации. Вторая: ни одна машина не вместит это в одиночку. Даже в 4-бит 1,4 ТБ весов — это примерно втрое больше самой крупной рабочей станции с единой памятью и на порядок больше любого одиночного GPU: это мультиузловое развёртывание с первого дня, ещё до бюджета на KV-кэш для окна в 1 048 576 токенов.

Для масштаба: 2,8 трлн у K3 — это в 2,8 раза больше, чем у семейства K2 с 1 трлн параметров при той же точности, а релизы K2 уже требовали нескольких GPU. Реальные требования к развёртыванию (раскладка tensor-parallel, поддерживаемые движки, квантованные сборки) приедут с карточкой модели; мы заменим эту арифметику официальными цифрами в день их появления.

Чек-лист готовности к релизу

  • Следите за организацией moonshotai на Hugging Face. Moonshot не сказал, где появятся веса, но все прежние открытые релизы Kimi публиковались именно там.
  • Прочитайте лицензию, прежде чем строить. Она не объявлена. Не считайте, что она совпадёт с прежними релизами Kimi, пока текст не станет публичным.
  • Отложите решения по стеку инференса. KDA — новая архитектура внимания: будет ли ваш движок поддерживать её с первого дня — ровно тот вопрос, на который отвечает карточка модели, а не догадки.
  • Честно посчитайте стоимость развёртывания. Если строка «4-бит» выше не помещается в бюджет, самостоятельный хостинг K3 — не ваш путь, и это нормальный итог: размещённая модель — в одной строке base_url.
  • Снимите базовые метрики уже сейчас. API работает: качество, задержку и стоимость можно проверить на вашей реальной нагрузке до вложений в железо. Наши замеры — отправная точка.

Самостоятельный хостинг против API — в цифрах

Входной билет в API — $0. Входной билет в самостоятельный хостинг — строка про 1,4 ТБ выше. Между этими крайностями цифры, которые мы замерили, дают вам сторону API с необычной точностью:

  • Промпт на 497 718 токенов стоит $1.49 одним вызовом по официальному тарифу $3.00/1M — замерено; вызов с полным окном выходит примерно в $3.15.
  • Кэширование промптов автоматически снижает повторный вход до $0.30/1M — та самая скидка 10×, которая делает задачи вида «один большой контекст, много вопросов» жизнеспособными без единого собственного GPU.
  • Месячный счёт вашей нагрузки по официальным тарифам считает калькулятор — прямо в браузере. Если это число — малая доля месячной стоимости мультиузлового GPU-кластера, решение принято само: самостоятельный хостинг K3 — про комплаенс, резидентность данных и исследования, а не про экономию на типичных объёмах.

Что можно запустить уже сегодня

Размещённая модель работает и говорит на формате OpenAI. Вот ровно тот код, который мы проверили на проде в первый же день после запуска K3:

python · openai sdk
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_EVOLINK_API_KEY",
    base_url="https://direct.evolink.ai/v1",   # <-- the one line you change
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain prompt caching in two sentences."}],
)

print(response.choices[0].message.content)

Авторизация, стриминг и как выглядит реальное тело ответа — в руководстве по API. Оставьте max_completion_tokens со значением по умолчанию — вот почему.

FAQ по открытым весам

Когда выйдут веса Kimi K3?

Официальная документация Moonshot AI обязуется: «к 27 июля 2026 года» (прочитано 2026-07-18). По состоянию на 2026-07-18 веса ещё не опубликованы. Эта страница обновится в тот день, когда это изменится.

Kimi K3 — open source?

Обещано, но пока не выпущено: веса официально должны выйти к 27 июля 2026 года, а лицензия не объявлена. Пока и веса, и текст лицензии не станут публичными, K3 доступна только как размещённая модель.

Какое железо нужно, чтобы запустить Kimi K3 локально?

Неизвестно до выхода карточки модели. Арифметическая нижняя граница: 2,8 трлн параметров — это 1,4 ТБ в 4-бит, минимум восемь ускорителей по 192 ГБ только чтобы разместить веса, ещё до KV-кэша для окна в 1 млн токенов. Ни на одном одиночном GPU и ни на одной рабочей станции модель не запустится ни в одной опубликованной точности.

Где можно будет скачать веса?

Официально не заявлено. Все прежние открытые релизы Kimi выходили в организации moonshotai на Hugging Face — за ней и стоит следить.

Можно ли использовать Kimi K3 до выхода весов?

Да — API работает с самого запуска. ID модели kimi-k3, совместимость с форматом OpenAI, $3.00/1M входных и $15.00/1M выходных токенов по официальным тарифам. Первый вызов за пять минут.

Запустите K3, не покупая 1,4 ТБ VRAM

EvoLink отдаёт kimi-k3 через OpenAI-совместимый эндпоинт: один ключ открывает GPT, Claude, Gemini и десятки основных мировых моделей. 10 бесплатных кредитов, регистрация из любой страны — китайский номер телефона не нужен.

Получить API-ключ EvoLink