kimik3.io/Задержка

Задержка Kimi K3

Kimi K3 — модель не из быстрых: перед каждым ответом она рассуждает, и это видно по времени до первого токена. Официальных бенчмарков нет, поэтому мы замерили сами: насколько медленно и как это учесть в приложении.

Скорость ответа K3 зависит от того, что вы спрашиваете. На тривиальном промпте первый токен приходит за ~3 секунды — 2,8 с 2026-07-16, 3,35 с при повторном замере два дня спустя. На реальных промптах (объяснение в два предложения) медиана 2026-07-18 составила 11,3 с до первого токена рассуждений и 21,4 с до первого токена контента, отдельные прогоны — от 3 до 40 с. Этот первый токен всегда — рассуждение: K3 по замыслу сначала думает, потом отвечает. Длинный контекст растёт примерно линейно: 98 625 токенов заняли 10,5 с, 497 718 — 52 секунды. Проектируйте с оглядкой на это — стримьте и ставьте таймауты в минутах — и до ваших пользователей ничего из этого не дойдёт. Схема ниже.

Замерено с одного клиента: 2026-07-16 на api.moonshot.ai, повторно 2026-07-18 через оба эндпоинта EvoLink (n=10 на эндпоинт) — как мы замеряли и чем эти цифры не являются.

Время до первого токена

Пять стриминговых прогонов, тривиальный промпт («Count to three»), потолок 128 токенов:

Стриминг, kimi-k3, 2026-07-16. TTFT — первый токен любого типа; у K3 это рассуждение.
ПрогонПервый токенПервый токен контентаИтого
12,74 с4,62 с4,62 с
22,81 стак и не пришёл5,78 с
33,35 с4,12 с4,37 с
43,28 стак и не пришёл6,26 с
52,82 стак и не пришёл5,82 с

Медиана TTFT — 2,82 с. Но взгляните на средний столбец: три прогона из пяти вообще не выдали ни одного токена контента. Это не результат по задержке — это ловушка бюджета рассуждений, пойманная в естественной среде. Потолок в 128 токенов целиком ушёл на размышления, и стрим завершился, выдав только рассуждения. Если вы стримите K3 пользователю, тихий сбой выглядит именно так.

Для ощущаемой скорости важен именно разрыв между первым токеном и первым токеном контента: в прогоне 1 рассуждения начались на 2,74 с, а ответ — только на 4,62 с. Если вы показываете reasoning_content, пользователь видит движение уже через ~2,8 с. Если нет — смотрит на спиннер ~4,6 с.

Повторный замер 2026-07-18: реальные промпты — другой режим

Два дня спустя мы прогнали серию побольше: десять стриминговых прогонов на каждый эндпоинт, каждый со своим реалистичным промптом (задача «объясни в двух предложениях» — над такой K3 действительно думает), без кэш-попаданий, через оба эндпоинта EvoLink:

Стриминг, kimi-k3, 2026-07-18, n=10 на эндпоинт, уникальные промпты. Медианы; для первого токена контента — также p95.
Первый токен рассуждений, медианаПервый токен контента, медианаПервый токен контента, p95Токенов/с, медиана
direct.evolink.ai11,3 с21,4 с35,7 с18,4
api.evolink.ai14,8 с25,3 с35,1 с16,9
  • Сложность промпта сдвигает TTFT в 3–4 раза. В тот же день тривиальный промпт по-прежнему отдавал первый токен за ~3,35 с; попросите модель действительно подумать — и медиана первого токена уходит к 11,3 с. Закладывайте бюджет под промпт, который реально отправите.
  • Разброс огромен. Отдельные прогоны — от 2,9 до 40 с до первого контента. p95 около 36 с означает: один вызов из двадцати заставит пользователя ждать полминуты до первого видимого символа — если не стримить рассуждения или прогресс.
  • Основной эндпоинт оправдывает имя. direct.evolink.ai обошёл резервный api.evolink.ai по всем медианам, примерно на 4 с в середине распределения. В проде используйте direct.

Пропускная способность при этом стабильна: 15–18 токенов/с после начала контента, оба эндпоинта, оба дня. Ожидание сосредоточено в начале; сам стрим в порядке. Сравниваете шлюзы? Тот же протокол прогнали и через OpenRouter, парными раундами в двух окнах — стабильного победителя нет (страница на английском). Собственная медиана EvoLink сдвинулась с 21,4 с в первом окне до 31,1 с часом позже — дрейф по времени суток того же масштаба, что и разрыв между шлюзами.

Длинный контекст

Без стриминга, с тривиальным выходом — то есть по сути «сколько времени нужно K3, чтобы прочитать ваш промпт и подумать над ним»:

Реальное время растёт вместе с промптом

Секунды на вызов, тривиальный выход · замерено 2026-07-16

10 с 30 с 50 с ~90 98 625 497 718 ~90 токенов промпта — 3,6 с 98 625 токенов промпта — 10,5 с 497 718 токенов промпта — 52,0 с 3,6 с 10,5 с 52,0 с токены промпта
По одному прогону без стриминга на точку, до того как K3 начнёт что-либо писать. Примерно линейно по размеру промпта — и тёплый кэш это время не сокращает.
По одному прогону, kimi-k3, 2026-07-16. Стоимость входа по тарифу $3.00/1M при промахе кэша.
prompt_tokensРеальное времяСтоимость входа, один вызов
~903,6 с$0.0003
98 62510,5 с$0.30
497 71852,0 с$1.49

Полмиллиона токенов — это 52 секунды и $1.49 за один запрос, ещё до того, как K3 начнёт что-либо писать. Окно в миллион токенов реально, но оно не быстрое и не бесплатное: при ~5-кратном росте токенов мы увидели ~5-кратный рост реального времени, так что потолок в ~1 млн правдоподобно выходит на отметку около двух минут. Мы это не проверяли — это был бы вывод, а не замер.

Скорость даёт архитектура, а не кэширование

Разумная надежда: прогреть префикс, пропустить работу, вернуть себе задержку. Мы это проверили. Не подтверждается. При сравнении холодных и тёплых вызовов на одинаковых префиксах реальное время стабильно не улучшалось — 3,56 с→3,80 с, 3,02 с→4,29 с, 3,99 с→3,54 с, 4,38 с→4,27 с, 5,22 с→3,78 с. Разброс от прогона к прогону перекрывал любой эффект кэша.

Причина структурная: K3 тратит секунды на рассуждения при каждом вызове, независимо от того, был ли промпт в кэше, — и именно это доминирует в таймлайне. Кэширование — оптимизация счёта, а не задержки.

Что с этим делать

  • Стримьте всегда. Без стриминга длинный контекст — это минута тишины. stream: true плюс stream_options: {"include_usage": true}.
  • Ставьте клиентские таймауты в минутах. Таймауты SDK по умолчанию убьют вполне легитимные вызовы с длинным контекстом. Мы замерили 52 с на одном успешно завершившемся запросе.
  • Решите, что делать с паузой на рассуждения. ~3 с до первого токена рассуждений на тривиальных промптах, медиана 11 с на реальных, а первый токен контента приходит ещё на секунды или десятки секунд позже. Либо показывайте размышления, либо делайте индикатор прогресса, рассчитанный на десятки секунд на p95.
  • Не ставьте K3 в синхронный путь запроса, которого человек ждёт с коротким лимитом времени. Модель думает. В этом и есть продукт.
  • Урезайте контекст. Задержка растёт с размером промпта, и, в отличие от стоимости, кэш-скидки, которая бы её смягчила, здесь нет.

Чем эти цифры не являются

Это не бенчмарк. Один клиент, один сетевой маршрут, два дня, выборки от одного до десяти прогонов. В них зашиты наш маршрут до серверов Moonshot и та нагрузка, под которой Moonshot был — 2026-07-16 и два дня спустя, а свежий флагман в такие дни предположительно занят.

В каждом числе здесь доминируют размышления K3, измеряемые секундами. Сетевая маршрутизация — включая хоп через транзитный шлюз — на этом фоне миллисекунды, поэтому мы считаем эти цифры таймингами K3, а не какого-то конкретного эндпоинта. Где мы их снимали.

Читайте их как порядки величин, а не замеры модели: секунды, а не миллисекунды до первого токена; десятки секунд, а не секунды на 100 тыс.; минута, а не десять секунд на 500 тыс. Такова форма явления, и её достаточно, чтобы проектировать с оглядкой на неё. Один повторный прогон уже сделан — данные от 07-18 выше — и мы продолжим обновлять замеры и даты.

FAQ по задержке Kimi K3

Насколько быстро отвечает API Kimi K3?

Зависит от промпта. На тривиальном промпте медиана до первого токена ~3 секунды (2,8 с 2026-07-16, 3,35 с при повторе 07-18). На реалистичных промптах замер 2026-07-18 дал медиану 11,3 с до первого токена рассуждений и 21,4 с до первого токена контента (n=10, p95 35,7 с), пропускная способность — 18,4 токена/с (медиана) после начала контента. Первый токен всегда — рассуждение, а не ответ. Это замеры с одного клиента, а не бенчмарк.

Сколько времени Kimi K3 обрабатывает длинный контекст?

Мы замерили 10,5 секунды на промпте в 98 625 токенов и 52,0 секунды на промпте в 497 718 токенов, оба раза с тривиальным выходом. Масштабирование выглядело примерно линейным, так что полное окно в 1 048 576 токенов правдоподобно приближается к двум минутам, хотя мы этого не проверяли.

Ускоряет ли кэширование промптов Kimi K3?

Нет. При сравнении холодных и тёплых вызовов на одинаковых префиксах реальное время стабильно не улучшалось, а часть тёплых вызовов оказалась медленнее. K3 рассуждает при каждом вызове независимо от кэширования, и именно это доминирует в таймлайне. Кэширование — оптимизация счёта, а не задержки.

Замерьте на своём маршруте

Наша задержка зависит от нашей сети; ваша не совпадёт. EvoLink отдаёт kimi-k3 через OpenAI-совместимый эндпоинт — 10 бесплатных кредитов, регистрация из любой страны — китайский номер телефона не нужен.

Получить API-ключ EvoLink