kimik3.io/Prezzi/Finestra di contesto
La finestra di contesto di Kimi K3
1,048,576 token — un milione binario esatto. La specifica è facile da citare. Quanto costa usarla davvero non l'ha scritto nessuno, così l'abbiamo misurato.
La finestra di contesto di Kimi K3 è di 1,048,576 token. max_completion_tokens va da 1 fino allo stesso tetto e ha come valore predefinito 131,072. La finestra è reale, ma non è gratis e non è veloce. Abbiamo misurato un prompt da 497,718 token: 52 secondi e $1.49 di input — una singola esecuzione, 2026-07-16. Alla tariffa di miss di $3.00/1M, riempire la finestra una volta costa circa $3.15 — e richiede, per estrapolazione, quasi due minuti. Dà il meglio sul lavoro ripetuto su un unico contesto grande: con la cache calda, ogni esecuzione dopo la prima costa un decimo.
Dimensione della finestra secondo la pagina dei prezzi ufficiale, letta il 2026-07-20. Tempi e costi misurati da noi — come abbiamo misurato.
Quanto costa riempirla
| Dimensione del prompt | Tempo reale | Costo di input, una chiamata | Riesecuzione da cache |
|---|---|---|---|
| ~90 | 3.6s | $0.0003 | — |
| 98,625 | 10.5s | $0.30 | $0.03 |
| 497,718 | 52.0s | $1.49 | $0.15 |
| 1,048,576 (piena) | ~110s estrapolato | $3.15 | $0.31 |
Da questa tabella si portano via due cose. Primo: una singola chiamata a finestra piena costa più o meno quanto 1,000 turni brevi di chat — la finestra cambia l'unità di costo, non solo l'importo. Secondo: la colonna «riesecuzione da cache» è l'unica cosa che rende sostenibile il lavoro ripetuto su contesti lunghi: un taglio di 10× sulla voce più pesante della fattura. È per quella colonna che l'ordine delle parti del prompt conta più a 500k token che in qualsiasi altro scenario. E la tariffa non cambia con la dimensione: $3.00/1M vale in modo piatto su tutta la finestra — non esiste una fascia maggiorata per il contesto lungo.
L'ultima riga è un'estrapolazione, e l'abbiamo etichettata come tale. Tra le nostre due esecuzioni lunghe abbiamo misurato ~5× di tempo reale per ~5× di token, un andamento all'incirca lineare, ma due punti non definiscono una curva e la finestra piena non l'abbiamo testata. Considera ~110s un ordine di grandezza, non un numero.
Verifica ripetuta il 2026-07-18 tramite EvoLink: un input da 128k token ha impiegato 25.9s al primo token (esecuzione singola) — sensibilmente più lento dei 10.5s totali rilevati a 98k due giorni prima. I 52.0s a 497,718 token restano una singola esecuzione del 2026-07-16 verso Moonshot diretto. Leggi ogni riga come un ordine di grandezza di un solo giorno e una sola esecuzione, non come un numero stabile.
Il tetto non è un regolatore di lunghezza
La finestra e max_completion_tokens vengono confuse di continuo, e su K3 la confusione costa cara.
- La finestra di contesto da 1,048,576 token è quanto K3 può leggere: il prompt.
max_completion_tokens(valore predefinito 131,072) è quanto può scrivere, ragionamento incluso.
Il secondo punto è la trappola. Il ragionamento attinge al budget di completion, quindi abbassare max_completion_tokens per ottenere «risposte più corte» limita invece quanto a lungo K3 può pensare. Sotto circa 2,048 abbiamo misurato risposte del tutto vuote, fatturate per intero. Se vuoi risposte corte, chiedile nel prompt. Le sei esecuzioni →
Vale la pena sapere anche questo: max_completion_tokens: 2000000 — quasi il doppio della finestra — restituisce HTTP 200 invece di un errore. L'API non ti dirà che quel numero non ha senso. Altri errori silenziosi →
Come K3 arriva a 1M di token
Secondo la guida rapida ufficiale di Moonshot (letta il 2026-07-20), K3 è un modello da 2.8 mila miliardi di parametri costruito su Kimi Delta Attention (KDA) — un meccanismo ibrido di attenzione lineare — più gli Attention Residuals, e attiva 16 dei suoi 896 esperti. È l'attenzione lineare a rendere computazionalmente plausibile una finestra da 1,048,576 token. Questa è documentazione di Moonshot, non una nostra misurazione; quello che possiamo misurare noi è quanto costa la finestra e quanto tempo richiede — le tabelle qui sopra.
Quando la finestra conviene
Conviene quando lo stesso contesto grande viene riusato. Una codebase, un contratto, un insieme di documenti a cui fai venti domande: la prima chiamata costa $1.49, le diciannove successive $0.15 ciascuna, perché il prefisso resta caldo. È la forma di lavoro per cui la finestra è stata costruita, e in altro modo è davvero difficile da ottenere.
Non conviene per un recupero una tantum. Se spingi 500k token una volta sola per rispondere a una domanda, spendi $1.49 e 52 secondi dove un passaggio di retrieval e un prompt da 5k token costerebbero una frazione di centesimo e tornerebbero in pochi secondi. La finestra da un milione di token non sostituisce il RAG: è uno strumento diverso, e usarla come sostituto è l'errore più caro disponibile qui.
La latenza è il vincolo che si sottovaluta. Il costo lo ottimizzi con la cache. Il tempo reale no: la cache non ha reso più veloci le chiamate calde in nessuno dei nostri test. Una chiamata da 52 secondi dura 52 secondi, che tu l'abbia pagata a prezzo pieno o no. Se dall'altra parte c'è una persona che aspetta, è quel numero a decidere l'architettura.
Note pratiche
- Sul contesto lungo usa lo streaming. Senza streaming hai un minuto di silenzio, senza alcun segnale che qualcosa stia funzionando.
- Imposta i timeout del client in minuti. I timeout predefiniti degli SDK uccidono una chiamata legittima da 52 secondi.
- Tieni d'occhio
prompt_tokensin produzione. A $3.00/1M, il prompt che si gonfia è la voce di spesa che scappa via. Una chiamata a finestra piena per sbaglio sono $3.15. - Ordina il prompt per la cache dal primo giorno. Byte stabili all'inizio, turno variabile alla fine. A questa scala lo sconto è la differenza tra sostenibile e non sostenibile.
FAQ sulla finestra di contesto
Quanto è grande la finestra di contesto di Kimi K3?
1,048,576 token — 220, un milione binario esatto — secondo la pagina dei prezzi ufficiale letta il 2026-07-20.
Quanto costa usare l'intera finestra di contesto di Kimi K3?
Circa $3.15 di input per una chiamata alla tariffa di miss della cache di $3.00/1M, oppure circa $0.31 se il prefisso è già caldo. Abbiamo misurato una chiamata da 497,718 token a $1.49 e 52 secondi; il valore per la finestra piena è aritmetica ed estrapolazione da quella misurazione.
max_completion_tokens è la stessa cosa della finestra di contesto?
No. La finestra di contesto è ciò che K3 può leggere; max_completion_tokens è ciò che può scrivere, ragionamento incluso, con valore predefinito 131,072. Impostarlo basso non accorcia le risposte — tronca il ragionamento, e sotto ~2,048 abbiamo misurato risposte vuote fatturate per intero.
Fai passare il tuo contesto
EvoLink serve kimi-k3 su un endpoint compatibile con OpenAI: una sola key raggiunge GPT, Claude, Gemini e decine dei principali modelli al mondo, così puoi confrontare l'economia del contesto su tutti quanti. 10 crediti gratuiti e registrazione da qualsiasi paese.