kimik3.io/Открытые веса
Открытые веса Kimi K3
Официально обещаны к 27 июля 2026 года — но пока не выпущены. Эта страница следит за релизом, делает арифметику по железу и будет обновлена после выхода весов.
Веса Kimi K3 ещё не опубликованы. Официальная документация Moonshot AI гласит: «Полные веса модели будут выпущены к 27 июля 2026 года». По состоянию на 2026-07-18 на Hugging Face нет репозитория Kimi K3, нет карточки модели и не объявлена лицензия. Что известно официально: 2,8 трлн параметров всего, архитектура mixture-of-experts, активирующая 16 из 896 экспертов на токен, в основе — Kimi Delta Attention (KDA). До релиза единственный способ запустить K3 — API, который уже работает.
Архитектура и обязательство по релизу — из официального квикстарта, прочитано 2026-07-18. Последняя проверка выхода весов: 2026-07-18.
Что официально, а что неизвестно
| Пункт | Статус | Источник |
|---|---|---|
| Дата релиза | К 27 июля 2026 — официальное обязательство | Официальный квикстарт, прочитано 2026-07-18 |
| Всего параметров | 2,8 трлн, MoE, активны 16 из 896 экспертов | Официальный квикстарт, прочитано 2026-07-18 |
| Архитектура | Kimi Delta Attention (KDA) + Attention Residuals | Официальный квикстарт, прочитано 2026-07-18 |
| Репозиторий на Hugging Face | — пока не опубликован | Проверено 2026-07-18 |
| Лицензия | — не объявлена | Официальных заявлений нет на 2026-07-18 |
| Карточка модели / гайд по развёртыванию | — пока не опубликованы | Появятся вместе с весами |
| Официальные квантизации | — неизвестно | Появятся вместе с весами |
Любой, кто сегодня называет минимальный объём VRAM, команду запуска или пункт лицензии K3, — гадает. Честная версия этой страницы до 27 июля — короткая. Что мы можем сделать честно — так это арифметику.
Математика железа
У 2,8 трлн параметров есть фиксированная стоимость хранения, которую не убирает ни один приём развёртывания. Это умножение, а не замер:
| Точность | Байт на параметр | Только веса | Чтобы просто их разместить |
|---|---|---|---|
| BF16 / FP16 | 2 | 5,6 ТБ | ≥ 30 ускорителей по 192 ГБ |
| FP8 | 1 | 2,8 ТБ | ≥ 15 ускорителей по 192 ГБ |
| 4-бит | 0,5 | 1,4 ТБ | ≥ 8 по 192 ГБ или ≥ 18 по 80 ГБ |
Из этой арифметики следуют две вещи. Первая: разрежённость MoE не уменьшает занимаемый объём. Активация 16 из 896 экспертов сокращает вычисления на токен, а не память: каждый эксперт должен находиться в памяти, чтобы любой из них был доступен маршрутизации. Вторая: ни одна машина не вместит это в одиночку. Даже в 4-бит 1,4 ТБ весов — это примерно втрое больше самой крупной рабочей станции с единой памятью и на порядок больше любого одиночного GPU: это мультиузловое развёртывание с первого дня, ещё до бюджета на KV-кэш для окна в 1 048 576 токенов.
Для масштаба: 2,8 трлн у K3 — это в 2,8 раза больше, чем у семейства K2 с 1 трлн параметров при той же точности, а релизы K2 уже требовали нескольких GPU. Реальные требования к развёртыванию (раскладка tensor-parallel, поддерживаемые движки, квантованные сборки) приедут с карточкой модели; мы заменим эту арифметику официальными цифрами в день их появления.
Чек-лист готовности к релизу
- Следите за организацией moonshotai на Hugging Face. Moonshot не сказал, где появятся веса, но все прежние открытые релизы Kimi публиковались именно там.
- Прочитайте лицензию, прежде чем строить. Она не объявлена. Не считайте, что она совпадёт с прежними релизами Kimi, пока текст не станет публичным.
- Отложите решения по стеку инференса. KDA — новая архитектура внимания: будет ли ваш движок поддерживать её с первого дня — ровно тот вопрос, на который отвечает карточка модели, а не догадки.
- Честно посчитайте стоимость развёртывания. Если строка «4-бит» выше не помещается в бюджет, самостоятельный хостинг K3 — не ваш путь, и это нормальный итог: размещённая модель — в одной строке
base_url. - Снимите базовые метрики уже сейчас. API работает: качество, задержку и стоимость можно проверить на вашей реальной нагрузке до вложений в железо. Наши замеры — отправная точка.
Самостоятельный хостинг против API — в цифрах
Входной билет в API — $0. Входной билет в самостоятельный хостинг — строка про 1,4 ТБ выше. Между этими крайностями цифры, которые мы замерили, дают вам сторону API с необычной точностью:
- Промпт на 497 718 токенов стоит $1.49 одним вызовом по официальному тарифу $3.00/1M — замерено; вызов с полным окном выходит примерно в $3.15.
- Кэширование промптов автоматически снижает повторный вход до $0.30/1M — та самая скидка 10×, которая делает задачи вида «один большой контекст, много вопросов» жизнеспособными без единого собственного GPU.
- Месячный счёт вашей нагрузки по официальным тарифам считает калькулятор — прямо в браузере. Если это число — малая доля месячной стоимости мультиузлового GPU-кластера, решение принято само: самостоятельный хостинг K3 — про комплаенс, резидентность данных и исследования, а не про экономию на типичных объёмах.
Что можно запустить уже сегодня
Размещённая модель работает и говорит на формате OpenAI. Вот ровно тот код, который мы проверили на проде в первый же день после запуска K3:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_EVOLINK_API_KEY",
base_url="https://direct.evolink.ai/v1", # <-- the one line you change
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain prompt caching in two sentences."}],
)
print(response.choices[0].message.content)
Авторизация, стриминг и как выглядит реальное тело ответа — в руководстве по API. Оставьте max_completion_tokens со значением по умолчанию — вот почему.
FAQ по открытым весам
Когда выйдут веса Kimi K3?
Официальная документация Moonshot AI обязуется: «к 27 июля 2026 года» (прочитано 2026-07-18). По состоянию на 2026-07-18 веса ещё не опубликованы. Эта страница обновится в тот день, когда это изменится.
Kimi K3 — open source?
Обещано, но пока не выпущено: веса официально должны выйти к 27 июля 2026 года, а лицензия не объявлена. Пока и веса, и текст лицензии не станут публичными, K3 доступна только как размещённая модель.
Какое железо нужно, чтобы запустить Kimi K3 локально?
Неизвестно до выхода карточки модели. Арифметическая нижняя граница: 2,8 трлн параметров — это 1,4 ТБ в 4-бит, минимум восемь ускорителей по 192 ГБ только чтобы разместить веса, ещё до KV-кэша для окна в 1 млн токенов. Ни на одном одиночном GPU и ни на одной рабочей станции модель не запустится ни в одной опубликованной точности.
Где можно будет скачать веса?
Официально не заявлено. Все прежние открытые релизы Kimi выходили в организации moonshotai на Hugging Face — за ней и стоит следить.
Можно ли использовать Kimi K3 до выхода весов?
Да — API работает с самого запуска. ID модели kimi-k3, совместимость с форматом OpenAI, $3.00/1M входных и $15.00/1M выходных токенов по официальным тарифам. Первый вызов за пять минут.
Запустите K3, не покупая 1,4 ТБ VRAM
EvoLink отдаёт kimi-k3 через OpenAI-совместимый эндпоинт: один ключ открывает GPT, Claude, Gemini и десятки основных мировых моделей. 10 бесплатных кредитов, регистрация из любой страны — китайский номер телефона не нужен.