kimik3.io/Info

Informazioni su questo sito

Chi l'ha fatto, perché, e come è stato prodotto ogni numero che ci trovi.

Chi siamo, e il conflitto di interessi

kimik3.io è realizzato dal team di EvoLink, un gateway API che offre kimi-k3 insieme a GPT, Claude, Gemini e decine dei principali modelli al mondo su un endpoint compatibile con OpenAI. Vogliamo che tu usi EvoLink. È per questo che il sito esiste, e vale la pena leggere tutto quello che c'è sopra tenendolo presente.

Ecco allora il patto che abbiamo fatto con noi stessi, e su cui puoi chiederci conto:

  • I fatti non si piegano a nostro favore. I prezzi sono citati dalla pagina ufficiale di Moonshot, con la data in cui li abbiamo letti. Le misurazioni sono quello che è tornato indietro, comprese quelle scomode. Se K3 è lento, scriviamo 52 secondi.
  • Segniamo il confine di quello che sappiamo. Moonshot non documenta né il TTL della cache, né la lunghezza minima del prefisso, né eventuali sovrapprezzi per la scrittura in cache. Avremmo potuto riempire quei vuoti con supposizioni dal tono sicuro. Non l'abbiamo fatto, e dove estrapoliamo lo dichiariamo.

Se trovi qualcosa di sbagliato su questo sito, è un bug e vogliamo correggerlo. I dati grezzi delle misurazioni sono pubblicati qui, quindi non devi crederci sulla parola.

Perché esiste questo sito

K3 è uscito a luglio 2026. Nel giro di poche ore dal lancio c'erano già pagine che citavano prezzi indovinati, ripetevano conteggi di parametri non confermati e ristampavano la guida rapida ufficiale. Quello che non c'era: qualcuno che l'avesse davvero fatto girare e avesse scritto che cosa è successo.

È un vuoto piccolo e preciso, ed è quello che ci siamo messi a colmare. Non «che cos'è Kimi K3»: lo copre la documentazione di Moonshot, e sul proprio modello sarà sempre più autorevole di noi. Il vuoto sta nello strato sopra la documentazione: che cosa si rompe, quanto costa davvero, quanto tempo richiede davvero. Tutto quello che qui non è un fatto ufficiale citato viene da noi: abbiamo fatto girare kimi-k3 e annotato il risultato.

Come abbiamo misurato

Ogni numero contrassegnato come misurato su questo sito è stato prodotto il 2026-07-16 chiamando https://api.moonshot.ai/v1/chat/completions con il modello kimi-k3, da un solo client su un solo percorso di rete.

Che cosa abbiamo fatto

  • I test sulla cache usavano prefissi generati al momento, con UUID e hash casuali, così niente di quello che abbiamo provato era mai stato inviato a Moonshot prima. È questo che rende una chiamata «fredda» davvero fredda: un prefisso che qualcun altro aveva già scaldato avrebbe invalidato il risultato senza farsi notare.
  • I corpi degli errori vengono da richieste reali rotte di proposito: una key non valida, una stringa del modello sbagliata, un array di messaggi vuoto, parametri fuori intervallo. Il JSON sulla pagina degli errori è copiato dalla risposta così com'è arrivata, non ricostruito.
  • La latenza è stata misurata con un client in streaming che cronometrava il primo delta di qualunque tipo, separatamente il primo delta di contenuto, e il tempo totale reale.
  • Il caso della risposta vuota è stato riprodotto su sei budget da 64 a 2,048 token, cambiando solo max_completion_tokens.
  • I grafici di disponibilità sulla pagina di stato leggono l'API pubblica di OpenRouter — un canale di routing verso lo stesso upstream Moonshot. Moonshot non pubblica un proprio feed di uptime, quindi quella vista di routing è il segnale continuo più vicino alla domanda «il modello funziona?». Serie grezza raccolta: status-history.json.

Che cosa non sono questi numeri

Non sono benchmark, e preferiamo dirlo apertamente piuttosto che lasciare che le tabelle promettano più di quanto reggano:

  • Si portano dietro il nostro percorso di rete e il carico di Moonshot nella finestra del lancio, quando un modello di punta appena uscito è presumibilmente sotto pressione. La tua latenza sarà diversa.
  • Le estrapolazioni sono dichiarate. Costo e tempi della finestra piena sulla pagina della finestra di contesto sono aritmetica su due punti misurati, non una misurazione.

Che cosa sopravvive al passaggio da un gateway e che cosa no

Abbiamo misurato su Moonshot diretto. Alla maggior parte degli sviluppatori K3 arriva attraverso un gateway, quindi la domanda utile è quali dei nostri risultati restino validi. La linea è netta:

RisultatoAttraverso un gateway di passaggio
La trappola della risposta vuota, la quota di token di ragionamento, i blocchi di cache da 256 token, prompt_cache_key che non ha effetto, il comportamento di finish_reason Vale. Sono proprietà del modello e del layer di serving di Moonshot. Un gateway che si limita a inoltrare la richiesta non le cambia.
I numeri di latenza Confronta gli endpoint con cautela. Il nostro ritest del 2026-07-18 attraverso EvoLink (prompt realistici, n=10) ha dato una mediana di 21.4s al primo token di contenuto — ben sopra le letture dirette del 2026-07-16 con prompt minimi — e lo stesso endpoint è passato da 21.4s a 31.1s nel giro di un'ora. Quella deriva ha lo stesso ordine di grandezza di qualsiasi differenza tra gateway, quindi una singola finestra temporale non separa l'overhead del gateway dalla deriva legata all'ora del giorno. Solo esecuzioni nella stessa ora e sullo stesso prompt confrontano gli endpoint in modo equo.
Il JSON esatto degli errori di autenticazione e «modello non trovato» Non vale. Una key sbagliata viene respinta dal layer di autenticazione del gateway stesso, nel suo formato — a Moonshot non arriva mai, quindi l'invalid_authentication_error di Moonshot non lo vedrai. Sintomi e soluzioni restano validi; i corpi letterali che abbiamo catturato sono quelli di Moonshot.

Preferiamo tracciare questa linea in modo esplicito piuttosto che lasciare che un disclaimer generico faccia sembrare provvisori i nostri risultati sul modello. Non lo sono: si riproducono ovunque venga servito K3. Le due eccezioni sono eccezioni per una ragione fisica, non per prudenza.

I dati grezzi

Il dataset completo delle misurazioni è pubblicato qui, in formato leggibile da una macchina:

La sezione sul metodo qui sopra descrive ogni test con abbastanza precisione da poterlo rieseguire con una key tua. Se i tuoi risultati divergono dai nostri, ci interessa davvero saperlo.

Verifica il nostro lavoro

Ogni misurazione di questa pagina si riproduce in pochi minuti con una key tua. EvoLink offre kimi-k3 su un endpoint compatibile con OpenAI — 10 crediti gratuiti e registrazione da qualsiasi paese, senza numero di telefono cinese.

Ottieni una API key EvoLink