kimik3.io/Prezzi

Prezzi dell'API Kimi K3

Kimi K3 costa $3.00 per 1M di token di input ($0.30 con hit della cache) e $15.00 per 1M di output — tariffe ufficiali, datate qui sotto. Quello che il listino non dice: il ragionamento sempre attivo di K3 si fattura come output.

Kimi K3 costa $3.00 per 1M di token di input con miss della cache, $0.30 per 1M con hit della cache, e $15.00 per 1M di token di output. La finestra di contesto è di 1,048,576 token. Il numero che sorprende: il ragionamento di K3 si fattura alla tariffa di output, e l'abbiamo misurato al 43–77% dei token di output totali — quindi il costo effettivo di una risposta vale diverse volte la lunghezza della risposta stessa.

Tariffe lette dalla pagina ufficiale dei prezzi il 2026-07-20. I dati sull'overhead li abbiamo misurati noi — ecco come.

Le tariffe ufficiali

Lette dalla pagina ufficiale dei prezzi di Moonshot il 2026-07-20. Citiamo i prezzi solo da quella pagina e ci mettiamo la data; ricontrolla prima di fare un budget.
VoceTariffaNote
Input — miss della cache$3.00 / 1MOgni prima chiamata paga questa. Le chiamate fredde non vanno mai parzialmente in cache.
Input — hit della cache$0.30 / 1M10× più economico. Concesso a blocchi da 256 token su un prefisso ripetuto.
Output$15.00 / 1MInclude i token di ragionamento — vedi sotto.
Finestra di contesto1,048,576Una chiamata piena con ~500k di input costa $1.49 e 52 secondi.
max_completion_tokens predefinito131,072Abbassarlo può farti pagare il nulla.

La tariffa di $3.00/1M si applica in modo piatto su tutta la finestra da 1,048,576 token: non esiste una fascia maggiorata per il contesto lungo.

Sono anche le tariffe che paghi tramite EvoLink — nessun ricarico del gateway su kimi-k3. Il che rende la scelta piuttosto stretta: stesso modello, stesso prezzo, ma una key che raggiunge anche GPT, Claude e Gemini, e nessun numero di telefono cinese né account Moonshot separato da configurare.

Come si collocano queste tariffe

Un punto di riferimento verificabile: Anthropic indica per Claude Sonnet 5 le stesse tariffe di listino — $3.00/1M in input e $15.00/1M in output, con una promozione a $2.00/$10.00 valida fino al 2026-08-31 (secondo la pagina prezzi di Anthropic, letta il 2026-07-20). Riportiamo solo i confronti che abbiamo verificato noi su una pagina prezzi ufficiale.

Quanto ti costa davvero il ragionamento

K3 non ha un interruttore per spegnere il ragionamento. Ogni risposta contiene un campo reasoning_content, e ogni token al suo interno si fattura alla tariffa di output di $15.00 — come le parole che leggi davvero. Quindi il numero interessante non è la tariffa: è la quota della fattura di output che non vedi mai.

Abbiamo misurato tre prompt il 2026-07-16:

Una esecuzione ciascuno, kimi-k3. Ordini di grandezza a titolo illustrativo, non un benchmark — vedi il metodo.
PromptRagionamentoOutput totaleQuota di ragionamento
«What is 2+2? Answer with the number only.» 324867%
«Explain in one paragraph why prompt caching lowers API cost.» 71593077%
Un problema di testo con due treni, con ragionamento mostrato 22051843%

Chiedere a K3 quanto fa due più due costa 32 token di deliberazione per produrre una risposta di un carattere. Due terzi di quella voce di fattura sono pensiero.

Controintuitivamente, il prompt più difficile ha avuto la quota di ragionamento più bassa (43%). Tre dati non fanno una curva, e non facciamo finta del contrario: quello che serve è l'ordine di grandezza, non una formula. Metti a budget parecchie volte più token di output della lunghezza della risposta, su ogni prompt, anche quelli banali.

Calcolare una fattura reale

Prendi un agente con un prefisso fisso da 50,000 token che serve 200 richieste al giorno — 10M di token di input al giorno. Solo l'input:

ScenarioTariffaAl giornoSu 30 giorni
Ogni richiesta va in miss$3.00 / 1M$30.00$900.00
Il prefisso resta caldo$0.30 / 1M$3.00$90.00
Differenza$27.00$810.00

Aritmetica sulle tariffe ufficiali del 2026-07-20, solo token di input. La riga economica è idealizzata: la prima chiamata di ogni periodo freddo si fattura a $3.00, e fino a 255 token di coda non vanno mai in cache. L'output si fattura comunque a $15.00/1M — e su questo carico il ragionamento potrebbe tranquillamente superare l'intera fattura di input. Prendi questi numeri come il tetto e il pavimento tra cui ti sposta la disposizione del prompt, non come un preventivo.

Dove finiscono davvero i soldi

  • Sui prompt corti domina l'output. A 5× la tariffa di input, più il ragionamento al 43–77% dell'output, un carico chiacchierone con prompt piccoli è un problema di fattura di output. Il caching non ti aiuta.
  • Sul contesto lungo domina l'input. Una singola chiamata da ~500k token costa $1.49 prima che K3 scriva una parola. È lì che il caching si ripaga — un taglio di 10× sulla voce più grossa.
  • Anche le risposte vuote si fatturano. La trappola del budget di ragionamento ti addebita la tariffa di output piena per zero caratteri. È l'unica voce della tua fattura che è puro spreco.

FAQ sui prezzi

Quanto costa l'API di Kimi K3?

$3.00 per 1M di token di input con miss della cache, $0.30 per 1M con hit della cache, e $15.00 per 1M di token di output, secondo la pagina ufficiale dei prezzi il 2026-07-20.

I token di ragionamento di Kimi K3 vengono fatturati?

Sì, alla tariffa di output di $15.00 per 1M — la stessa della risposta. Su tre prompt abbiamo misurato il ragionamento al 43–77% dei token di output totali, e viene fatturato anche quando la risposta non contiene alcun contenuto. Se Moonshot cambia queste tariffe o il comportamento della fatturazione, aggiorniamo la data e registriamo la modifica nel changelog.

Esiste un piano gratuito per Kimi K3?

Le condizioni di Moonshot sono sulla sua piattaforma. Con EvoLink i nuovi account partono con 10 crediti gratuiti — abbastanza per eseguire la guida rapida da qualsiasi paese e confermare la prima chiamata da capo a fondo.

Come ottengo il prezzo di input della cache?

Ripeti un prefisso lungo e identico byte per byte, e tieni per ultima la parte che varia. È automatico — non serve nessun parametro. I dettagli e la meccanica misurata sono sulla pagina sul caching del prompt.

Fai i conti sul tuo carico di lavoro

EvoLink serve kimi-k3 su un endpoint compatibile con OpenAI — una sola key raggiunge GPT, Claude, Gemini e decine dei principali modelli al mondo, così puoi confrontare il prezzo dello stesso prompt su tutti. 10 crediti gratuiti e registrazione da qualsiasi paese.

Ottieni una API key EvoLink