API attiva · cifre con data · pesi entro 2026-07-27

Fai la prima chiamata all'API di Kimi K3

ID modello kimi-k3, $3.00 in input / $15.00 in output per 1M di token, finestra da 1,048,576 token. Il codice che funziona è qui sotto: copialo, aggiungi una key e la prima chiamata parte.

kimi-k3 · risposta reale · chiamata ripetuta (hit completo della cache)
{
  "model": "kimi-k3",
  "choices": [{
    "message": {
      "content": "OK",
      "reasoning_content": "We need answer to user…"
    },
    "finish_reason": "stop"
  }],
  "usage": {
    "prompt_tokens": 116,
    "completion_tokens": 53,
    "completion_tokens_details":
      { "reasoning_tokens": 37 },  // fatturati come output
    "prompt_tokens_details":
      { "cached_tokens": 116 }     // 10× più economici
  }
}
ID modello
kimi-k3
Input
$3.00 /1M
Input da cache
$0.30 /1M
Output
$15.00 /1M
Contesto
1,048,576
Architettura
2.8T · KDA, attenzione lineare ibrida · 16 esperti attivi su 896 · guida rapida ufficiale, letta 2026-07-20
Pesi aperti
entro 2026-07-27 · guida rapida ufficiale, letta 2026-07-20
Tasso di successo · 24 h
live →

Kimi K3 è il modello di punta di Moonshot AI, lanciato a luglio 2026. L'API è già attiva: ID modello kimi-k3, finestra di contesto da 1,048,576 token, $3.00 per 1M di token di input ($0.30 con hit della cache) e $15.00 per 1M di output. Parla il formato OpenAI, e EvoLink la offre alle stesse tariffe — nessun ricarico, cambia una riga di base_url.

Sotto il cofano: 2.8 mila miliardi di parametri complessivi in un'architettura mixture-of-experts (16 esperti attivi su 896 per token), costruita su Kimi Delta Attention, con comprensione visiva nativa. I pesi aperti sono ufficialmente attesi entro il 27 luglio 2026 — seguiamo il rilascio.

Prezzi dalla pagina ufficiale, 2026-07-20; architettura dalla guida rapida ufficiale, 2026-07-18. Tutto ciò che è marcato misurato lo abbiamo eseguito noi — ecco come.

Cambia una riga e funziona

K3 parla il formato OpenAI. Punta base_url su un gateway che lo offre, indica il modello, fatto.

python · openai sdk
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_EVOLINK_API_KEY",
    base_url="https://direct.evolink.ai/v1",   # <-- l'unica riga da cambiare
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain prompt caching in two sentences."}],
)

print(response.choices[0].message.content)

Lascia max_completion_tokens al suo valore predefinito di 131,072, a meno che tu non abbia letto perché limitarlo si ritorce contro. Procedura completa, autenticazione e streaming: la guida all'API.

Approfondisci

Una pagina per domanda. Ogni numero è citato dalla documentazione ufficiale con la data, oppure misurato da noi.

Parti gratis

Prova Kimi K3 gratis

La via della chat e quella dell'API con 10 crediti gratuiti alla registrazione — e come farli durare di più.

Inizia gratis
Implementa

Guida all'API di Kimi K3

Autenticazione, la richiesta che funziona, streaming, com'è fatto un corpo di risposta reale e come distinguere un successo da un errore silenzioso.

Inizia a chiamare
Scegli la strada

EvoLink vs OpenRouter

Entrambi offrono K3 allo stesso prezzo. Stessa suite su entrambi, nello stesso giorno: nomi dei campi, cache, affidabilità, latenza.

Vedi il confronto misurato
Verifica

Stato di Kimi K3

Tasso di successo e latenza, su grafici live nel tempo.

Vedi i grafici
Budget

Prezzi

Le tariffe ufficiali con la data — e il peso dei token di ragionamento, che rende la tariffa di output quella che conta.

Vedi i costi reali
Interattivo

Calcolatore dei costi

Le tue richieste, la tua struttura del prompt, il tuo tasso di hit — la fattura mensile alle tariffe ufficiali, calcolata nel browser.

Fai i tuoi conti
Tieni d'occhio

Pesi aperti: 27 luglio

Promessi ufficialmente, non ancora rilasciati. Il tracker dello stato, i conti sull'hardware per 2.8T e una checklist pronta per il rilascio.

Segui il rilascio
Scala

La finestra di contesto da 1M

Mezzo milione di token in una sola chiamata, misurato — e come una cache calda fa costare un decimo le esecuzioni ripetute. Quando la finestra rende, rende davvero.

Vedi i numeri
Valuta

Latenza

Primo token in ~3s sui prompt banali (2.8s il 07-16, 3.35s il 07-18); su prompt realistici: 21.4s di mediana fino al primo token di contenuto — e la configurazione in streaming che nasconde tutta l'attesa.

Vedi i tempi
Debug

Errori e modalità di guasto

Corpi di risposta reali da chiamate rotte di proposito — inclusi due parametri sbagliati che restituiscono HTTP 200 invece di un errore.

Risolvi

FAQ su Kimi K3

Risposte brevi — dietro ognuna una fonte ufficiale con data o una nostra misurazione.

Che cos'è Kimi K3?

Kimi K3 è il modello linguistico di punta di Moonshot AI, lanciato a luglio 2026: 2.8 mila miliardi di parametri complessivi in un'architettura mixture-of-experts (16 esperti attivi su 896 per token), costruita su Kimi Delta Attention, con comprensione visiva nativa e una finestra di contesto da 1,048,576 token. Dalla guida rapida ufficiale, letta 2026-07-18.

Kimi K3 è open source?

Non ancora. I pesi sono ufficialmente promessi entro il 27 luglio 2026, ma al 2026-07-18 non sono pubblicati e nessuna licenza è stata annunciata. Seguiamo il rilascio e aggiorneremo la pagina nelle ore successive alla pubblicazione.

Quanto costa l'API di Kimi K3?

$3.00 per 1M di token di input ($0.30 con hit della cache) e $15.00 per 1M di token di output — e i token di ragionamento si fatturano come output, nei nostri test il 43–77% del totale. Pagina ufficiale dei prezzi, letta 2026-07-20. La ripartizione completa.

Come accedo a Kimi K3?

Tre strade: la chat su kimi.com; l'API ufficiale sulla piattaforma di Moonshot; oppure un gateway compatibile con OpenAI come EvoLink, che la offre alle stesse tariffe — per il codice già in formato OpenAI è una modifica di una riga a base_url. Prima chiamata in cinque minuti.

Quanto è grande la finestra di contesto di Kimi K3?

1,048,576 token — un milione binario pieno. max_completion_tokens ha come valore predefinito 131,072; limitarlo troppo è la strada diretta verso risposte vuote fatturate per intero. Quanto costa davvero usare la finestra.

Kimi K3 gestisce le immagini?

La guida rapida ufficiale indica la comprensione visiva nativa (letta 2026-07-18). Non abbiamo ancora misurato carichi di lavoro vision — tutto ciò che abbiamo misurato è documentato nel nostro metodo.

Prendi una key e fai la chiamata

EvoLink offre kimi-k3 su un endpoint compatibile con OpenAI — una sola key raggiunge GPT, Claude, Gemini e decine dei principali modelli al mondo. 10 crediti gratuiti e registrazione da qualsiasi paese.

Ottieni una API key EvoLink