Fai la prima chiamata all'API di Kimi K3
ID modello kimi-k3, $3.00 in input / $15.00 in output per 1M di token, finestra da 1,048,576 token. Il codice che funziona è qui sotto: copialo, aggiungi una key e la prima chiamata parte.
{
"model": "kimi-k3",
"choices": [{
"message": {
"content": "OK",
"reasoning_content": "We need answer to user…"
},
"finish_reason": "stop"
}],
"usage": {
"prompt_tokens": 116,
"completion_tokens": 53,
"completion_tokens_details":
{ "reasoning_tokens": 37 }, // fatturati come output
"prompt_tokens_details":
{ "cached_tokens": 116 } // 10× più economici
}
}
- ID modello
- kimi-k3
- Input
- $3.00 /1M
- Input da cache
- $0.30 /1M
- Output
- $15.00 /1M
- Contesto
- 1,048,576
- Architettura
- 2.8T · KDA, attenzione lineare ibrida · 16 esperti attivi su 896 · guida rapida ufficiale, letta 2026-07-20
- Pesi aperti
- entro 2026-07-27 · guida rapida ufficiale, letta 2026-07-20
- Tasso di successo · 24 h
- live →
Kimi K3 è il modello di punta di Moonshot AI, lanciato a luglio 2026. L'API è già attiva: ID modello kimi-k3, finestra di contesto da 1,048,576 token, $3.00 per 1M di token di input ($0.30 con hit della cache) e $15.00 per 1M di output. Parla il formato OpenAI, e EvoLink la offre alle stesse tariffe — nessun ricarico, cambia una riga di base_url.
Sotto il cofano: 2.8 mila miliardi di parametri complessivi in un'architettura mixture-of-experts (16 esperti attivi su 896 per token), costruita su Kimi Delta Attention, con comprensione visiva nativa. I pesi aperti sono ufficialmente attesi entro il 27 luglio 2026 — seguiamo il rilascio.
Prezzi dalla pagina ufficiale, 2026-07-20; architettura dalla guida rapida ufficiale, 2026-07-18. Tutto ciò che è marcato misurato lo abbiamo eseguito noi — ecco come.
Le buche le abbiamo già prese noi
Abbiamo eseguito kimi-k3 poche ore dopo il lancio di luglio 2026 e mappato gli spigoli. Imposta bene tre parametri e l'integrazione funziona al primo colpo, al prezzo che ti aspettavi.
Il caching dell'input è automatico
Ripeti il prefisso e l'input scende da $3.00 a $0.30 per 1M: nessun parametro, nessuna modifica al codice. Abbiamo misurato esattamente come si attiva, così puoi tenere la cache calda.
Tieni la cache calda Prima di andare in produzioneUn'impostazione protegge la fattura
Lascia max_completion_tokens al valore predefinito e non ti ritroverai a pagare risposte vuote. Se proprio devi limitarlo, abbiamo misurato dov'è la soglia.
L'output include il ragionamento: mettilo in conto
K3 ragiona a ogni richiesta: è la forza del modello, e si fattura come output. Metti a budget qualche volta la lunghezza della risposta e i conti tornano.
Vedi la ripartizioneCambia una riga e funziona
K3 parla il formato OpenAI. Punta base_url su un gateway che lo offre, indica il modello, fatto.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_EVOLINK_API_KEY",
base_url="https://direct.evolink.ai/v1", # <-- l'unica riga da cambiare
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain prompt caching in two sentences."}],
)
print(response.choices[0].message.content)
Lascia max_completion_tokens al suo valore predefinito di 131,072, a meno che tu non abbia letto perché limitarlo si ritorce contro. Procedura completa, autenticazione e streaming: la guida all'API.
Approfondisci
Una pagina per domanda. Ogni numero è citato dalla documentazione ufficiale con la data, oppure misurato da noi.
Prova Kimi K3 gratis
La via della chat e quella dell'API con 10 crediti gratuiti alla registrazione — e come farli durare di più.
Inizia gratis ImplementaGuida all'API di Kimi K3
Autenticazione, la richiesta che funziona, streaming, com'è fatto un corpo di risposta reale e come distinguere un successo da un errore silenzioso.
Inizia a chiamare Scegli la stradaEvoLink vs OpenRouter
Entrambi offrono K3 allo stesso prezzo. Stessa suite su entrambi, nello stesso giorno: nomi dei campi, cache, affidabilità, latenza.
Vedi il confronto misurato VerificaStato di Kimi K3
Tasso di successo e latenza, su grafici live nel tempo.
Vedi i grafici BudgetPrezzi
Le tariffe ufficiali con la data — e il peso dei token di ragionamento, che rende la tariffa di output quella che conta.
Vedi i costi reali InterattivoCalcolatore dei costi
Le tue richieste, la tua struttura del prompt, il tuo tasso di hit — la fattura mensile alle tariffe ufficiali, calcolata nel browser.
Fai i tuoi conti Tieni d'occhioPesi aperti: 27 luglio
Promessi ufficialmente, non ancora rilasciati. Il tracker dello stato, i conti sull'hardware per 2.8T e una checklist pronta per il rilascio.
Segui il rilascio ScalaLa finestra di contesto da 1M
Mezzo milione di token in una sola chiamata, misurato — e come una cache calda fa costare un decimo le esecuzioni ripetute. Quando la finestra rende, rende davvero.
Vedi i numeri ValutaLatenza
Primo token in ~3s sui prompt banali (2.8s il 07-16, 3.35s il 07-18); su prompt realistici: 21.4s di mediana fino al primo token di contenuto — e la configurazione in streaming che nasconde tutta l'attesa.
Vedi i tempi DebugErrori e modalità di guasto
Corpi di risposta reali da chiamate rotte di proposito — inclusi due parametri sbagliati che restituiscono HTTP 200 invece di un errore.
RisolviFAQ su Kimi K3
Risposte brevi — dietro ognuna una fonte ufficiale con data o una nostra misurazione.
Che cos'è Kimi K3?
Kimi K3 è il modello linguistico di punta di Moonshot AI, lanciato a luglio 2026: 2.8 mila miliardi di parametri complessivi in un'architettura mixture-of-experts (16 esperti attivi su 896 per token), costruita su Kimi Delta Attention, con comprensione visiva nativa e una finestra di contesto da 1,048,576 token. Dalla guida rapida ufficiale, letta 2026-07-18.
Kimi K3 è open source?
Non ancora. I pesi sono ufficialmente promessi entro il 27 luglio 2026, ma al 2026-07-18 non sono pubblicati e nessuna licenza è stata annunciata. Seguiamo il rilascio e aggiorneremo la pagina nelle ore successive alla pubblicazione.
Quanto costa l'API di Kimi K3?
$3.00 per 1M di token di input ($0.30 con hit della cache) e $15.00 per 1M di token di output — e i token di ragionamento si fatturano come output, nei nostri test il 43–77% del totale. Pagina ufficiale dei prezzi, letta 2026-07-20. La ripartizione completa.
Come accedo a Kimi K3?
Tre strade: la chat su kimi.com; l'API ufficiale sulla piattaforma di Moonshot; oppure un gateway compatibile con OpenAI come EvoLink, che la offre alle stesse tariffe — per il codice già in formato OpenAI è una modifica di una riga a base_url. Prima chiamata in cinque minuti.
Quanto è grande la finestra di contesto di Kimi K3?
1,048,576 token — un milione binario pieno. max_completion_tokens ha come valore predefinito 131,072; limitarlo troppo è la strada diretta verso risposte vuote fatturate per intero. Quanto costa davvero usare la finestra.
Kimi K3 gestisce le immagini?
La guida rapida ufficiale indica la comprensione visiva nativa (letta 2026-07-18). Non abbiamo ancora misurato carichi di lavoro vision — tutto ciò che abbiamo misurato è documentato nel nostro metodo.
Prendi una key e fai la chiamata
EvoLink offre kimi-k3 su un endpoint compatibile con OpenAI — una sola key raggiunge GPT, Claude, Gemini e decine dei principali modelli al mondo. 10 crediti gratuiti e registrazione da qualsiasi paese.