Сделайте первый вызов Kimi K3 API
ID модели kimi-k3, вход $3.00 / выход $15.00 за 1 млн токенов, окно 1 048 576 токенов. Рабочий код — ниже: скопируйте, вставьте ключ, и первый вызов пройдёт.
{
"model": "kimi-k3",
"choices": [{
"message": {
"content": "OK",
"reasoning_content": "We need answer to user…"
},
"finish_reason": "stop"
}],
"usage": {
"prompt_tokens": 116,
"completion_tokens": 53,
"completion_tokens_details":
{ "reasoning_tokens": 37 }, // тарифицируется как выход
"prompt_tokens_details":
{ "cached_tokens": 116 } // в 10 раз дешевле
}
}
- ID модели
- kimi-k3
- Вход
- $3.00 /1M
- Вход из кэша
- $0.30 /1M
- Выход
- $15.00 /1M
- Контекст
- 1 048 576
- Архитектура
- 2,8 трлн · KDA, гибридное линейное внимание · активны 16 из 896 экспертов · официальный квикстарт, прочитано 2026-07-20
- Открытые веса
- к 2026-07-27 · официальный квикстарт, прочитано 2026-07-20
- Успешность · 24 ч
- live →
Kimi K3 — флагманская модель Moonshot AI, вышедшая в июле 2026 года. API уже доступен: ID модели kimi-k3, контекстное окно 1 048 576 токенов, $3.00 за 1 млн входных токенов ($0.30 при попадании в кэш) и $15.00 за 1 млн выходных. Модель говорит на формате OpenAI, а EvoLink отдаёт её по тем же тарифам — без наценки, меняется одна строка base_url.
Под капотом: 2,8 трлн параметров всего в архитектуре mixture-of-experts (активны 16 из 896 экспертов на токен), в основе — Kimi Delta Attention, с нативным пониманием изображений. Открытые веса официально обещаны к 27 июля 2026 года — мы следим за релизом.
Цены — с официальной страницы, 2026-07-20; архитектура — из официального квикстарта, 2026-07-18. Всё, что помечено словом замерено, мы прогнали сами — вот как.
Мы уже наступили на все грабли — вам не придётся
Мы прогнали kimi-k3 в первые часы после запуска в июле 2026 и нанесли на карту все острые углы. Выставьте правильно три настройки — и интеграция заработает с первого раза, по той цене, на которую вы рассчитывали.
Кэширование входа работает само
Повторите префикс запроса — и вход подешевеет с $3.00 до $0.30 за 1 млн токенов: без параметров, без изменений в коде. Мы замерили, как именно срабатывает кэш, чтобы вы могли держать его горячим.
Держать кэш горячим Перед релизомОдна настройка бережёт ваш счёт
Оставьте max_completion_tokens со значением по умолчанию — и оплата пустых ответов вам не грозит. Если лимит всё же нужен, мы замерили, где проходит безопасный порог.
Выход включает рассуждения — заложите это
K3 рассуждает над каждым запросом: в этом сила модели, и это тарифицируется как выход. Закладывайте в несколько раз больше длины самого ответа — и смета сойдётся.
Смотреть раскладкуПоменяйте одну строку — и всё работает
K3 говорит на формате OpenAI. Направьте base_url на шлюз, где есть модель, укажите её ID — готово.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_EVOLINK_API_KEY",
base_url="https://direct.evolink.ai/v1", # <-- the one line you change
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain prompt caching in two sentences."}],
)
print(response.choices[0].message.content)
Не трогайте max_completion_tokens (по умолчанию 131 072), пока не прочитали, почему ограничение выходит боком. Полный разбор, авторизация и стриминг — в руководстве по API.
Идём глубже
Одна страница — один вопрос. Каждое число на этих страницах либо процитировано из официальной документации с датой, либо замерено нами.
Попробовать Kimi K3 бесплатно
Путь через чат и путь через API с 10 бесплатными кредитами при регистрации — и как растянуть их подольше.
Выбрать свой путь ВнедрениеРуководство по API Kimi K3
Авторизация, рабочий запрос, стриминг, как выглядит реальное тело ответа и как отличить успех от тихого сбоя.
Начать вызовы ПроверкаСтатус Kimi K3
Успешность и задержка на живых графиках во времени.
Смотреть графики БюджетЦены
Официальные тарифы с датой — и накладные расходы на токены рассуждений, из-за которых главной становится именно цена выхода.
Смотреть реальные затраты ИнтерактивКалькулятор затрат
Ваши запросы, ваша структура промпта, ваш процент попаданий в кэш — месячный счёт по официальным тарифам, прямо в браузере.
Посчитать свои цифры СледимОткрытые веса: 27 июля
Официально обещаны, но пока не выпущены. Трекер статуса, математика железа для 2,8 трлн параметров и чек-лист готовности к релизу.
Следить за релизом МасштабКонтекстное окно на 1 млн
Полмиллиона токенов одним вызовом — замерено. И как тёплый кэш делает повторные прогоны в десять раз дешевле. Когда окно окупается — оно окупается по-настоящему.
Смотреть цифры ОценкаЗадержка
Первый токен за ~3 с на тривиальном промпте (2,8 с 07-16, 3,35 с 07-18); на реальных промптах — медиана 21,4 с до первого токена ответа. И схема стриминга, которая прячет всё это ожидание.
Смотреть тайминги ОтладкаОшибки и режимы отказа
Реальные тела ответов от специально сломанных вызовов — включая два неверных параметра, на которые API отвечает HTTP 200 вместо ошибки.
ПочинитьFAQ по Kimi K3
Короткие ответы — за каждым либо официальный источник с датой, либо наш собственный замер.
Что такое Kimi K3?
Kimi K3 — флагманская большая языковая модель Moonshot AI, вышедшая в июле 2026 года: 2,8 трлн параметров всего в архитектуре mixture-of-experts (активны 16 из 896 экспертов на токен), в основе — Kimi Delta Attention, с нативным пониманием изображений и контекстным окном в 1 048 576 токенов. По официальному квикстарту, прочитано 2026-07-18.
Kimi K3 — open source?
Пока нет. Веса официально обещаны к 27 июля 2026 года, но на 2026-07-18 они не опубликованы, а лицензия не объявлена. Мы следим за релизом и обновим страницу в первые часы после выхода.
Сколько стоит API Kimi K3?
$3.00 за 1 млн входных токенов ($0.30 при попадании в кэш) и $15.00 за 1 млн выходных — причём токены рассуждений тарифицируются как выход, в наших прогонах это 43–77% его объёма. Официальная страница цен, прочитано 2026-07-20. Полная раскладка.
Как получить доступ к Kimi K3?
Три способа: чат на kimi.com; официальный API на платформе Moonshot; или OpenAI-совместимый шлюз вроде EvoLink, который отдаёт её по тем же тарифам — для готового кода в формате OpenAI это замена одной строки base_url. Первый вызов за пять минут.
Какого размера контекстное окно Kimi K3?
1 048 576 токенов — полный двоичный миллион. max_completion_tokens по умолчанию — 131 072; заниженный лимит — прямой путь к пустым ответам с оплатой в полном объёме. Во что обходится использование окна.
Работает ли Kimi K3 с изображениями?
Официальный квикстарт заявляет нативное понимание изображений (прочитано 2026-07-18). Vision-нагрузки мы пока не замеряли — всё, что мы уже замерили, задокументировано в нашей методике.
Получите ключ и сделайте первый вызов
EvoLink отдаёт kimi-k3 через OpenAI-совместимый эндпоинт: один ключ открывает GPT, Claude, Gemini и десятки основных мировых моделей. 10 бесплатных кредитов, регистрация из любой страны.