kimik3.io/Pesi aperti

Pesi aperti di Kimi K3

Impegno ufficiale per il 27 luglio 2026 — non ancora consegnati. Questa pagina segue il rilascio, fa i conti sull'hardware e verrà aggiornata quando i pesi usciranno.

I pesi di Kimi K3 non sono ancora pubblici. La documentazione ufficiale di Moonshot AI dice: «I pesi completi del modello saranno rilasciati entro il 27 luglio 2026.» Alla data del 2026-07-18 su Hugging Face non c'è nessun repository di Kimi K3, nessuna model card e nessuna licenza annunciata. Quello che è ufficiale: 2.8T parametri in totale, un'architettura mixture-of-experts che attiva 16 esperti su 896 per token, costruita su Kimi Delta Attention (KDA). Fino al rilascio, l'unico modo per eseguire K3 è l'API, che è già attiva.

Architettura e impegno sul rilascio dalla guida rapida ufficiale, letta il 2026-07-18. Ultima verifica dell'uscita dei pesi: 2026-07-18.

Cosa è ufficiale e cosa non si sa

Stato al 2026-07-18. La colonna di destra si riempirà il giorno in cui usciranno i pesi.
VoceStatoFonte
Data di rilascioEntro il 27 luglio 2026 — impegno ufficialeGuida rapida ufficiale, letta il 2026-07-18
Parametri totali2.8T, MoE, 16 esperti attivi su 896Guida rapida ufficiale, letta il 2026-07-18
ArchitetturaKimi Delta Attention (KDA) + Attention ResidualsGuida rapida ufficiale, letta il 2026-07-18
Repository su Hugging Face— non ancora pubblicatoVerificato il 2026-07-18
Licenza— non annunciataNessuna dichiarazione ufficiale al 2026-07-18
Model card / guida al deployment— non ancora pubblicateArrivano insieme ai pesi
Quantizzazioni ufficiali— sconosciuteArrivano insieme ai pesi

Chi oggi cita una cifra minima di VRAM, un comando di avvio o una clausola di licenza per K3 sta tirando a indovinare. Fino al 27 luglio la versione onesta di questa pagina è una pagina corta — quello che possiamo fare onestamente è l'aritmetica.

I conti sull'hardware

2.8T parametri hanno un costo di archiviazione fisso che nessun trucco di serving elimina. Qui si moltiplica, non si misura:

Soglia minima di spazio per i soli pesi, per precisione — aritmetica a partire dalla cifra ufficiale di 2.8T. L'overhead del runtime e la KV cache (consistente con una finestra da 1M token) si aggiungono sopra.
PrecisioneByte per parametroSolo i pesiSolo per contenerli
BF16 / FP1625.6 TB≥ 30 acceleratori da 192 GB
FP812.8 TB≥ 15 acceleratori da 192 GB
4-bit0.51.4 TB≥ 8 da 192 GB, oppure ≥ 18 da 80 GB

Dall'aritmetica seguono due cose. Primo: la sparsità del MoE non riduce l'ingombro. Attivare 16 esperti su 896 taglia il calcolo per token, non la memoria: ogni esperto deve stare in memoria perché uno qualsiasi sia instradabile. Secondo: nessuna macchina singola li contiene. Anche a 4-bit, 1.4 TB di pesi sono circa il triplo della workstation a memoria unificata più capiente e un ordine di grandezza oltre qualsiasi GPU singola: è un deployment multinodo dal primo giorno, prima ancora di mettere a budget la KV cache per una finestra da 1,048,576 token.

Per avere un metro di paragone: i 2.8T di K3 occupano 2.8× rispetto alla famiglia K2 da 1T parametri alla stessa precisione, e i rilasci di K2 richiedevano già più GPU. I requisiti reali di serving (layout tensor-parallel, engine supportati, build quantizzate) arrivano con la model card; sostituiremo questa aritmetica con i numeri ufficiali il giorno in cui esisteranno.

Checklist per il giorno del rilascio

  • Tieni d'occhio l'organizzazione moonshotai su Hugging Face. Moonshot non ha detto dove usciranno i pesi, ma ogni rilascio aperto di Kimi finora è stato pubblicato lì.
  • Leggi la licenza prima di costruirci sopra. Non è ancora stata annunciata. Non dare per scontato che coincida con i rilasci Kimi precedenti finché il testo non è pubblico.
  • Rimanda le decisioni sullo stack di serving. KDA è un'architettura di attention nuova: se il tuo engine di inferenza la supporti dal primo giorno è esattamente il tipo di domanda a cui risponde la model card, non la speculazione.
  • Calcola il costo del deployment senza illusioni. Se la riga «4-bit» qui sopra è fuori budget, il self-hosting di K3 non è la tua strada — ed è un esito perfettamente accettabile, perché il modello ospitato è a una riga di base_url di distanza.
  • Misura la baseline del modello adesso. L'API è attiva: puoi verificare qualità, latenza e costo sul tuo carico di lavoro reale prima di impegnarti sull'hardware. I nostri test misurati sono un punto di partenza.

Self-hosting contro API, in numeri

Il biglietto d'ingresso dell'API è $0. Quello del self-hosting è la riga da 1.4 TB qui sopra. Tra questi due estremi, i numeri che abbiamo misurato ti danno il lato API del bilancio con una precisione insolita:

  • Un prompt da 497,718 token costa $1.49 in una sola chiamata alla tariffa ufficiale di $3.00/1M — misurato; una chiamata a finestra piena viene circa $3.15.
  • Il caching del prompt porta l'input ripetuto a $0.30/1M in automatico — lo sconto 10× che rende sostenibili i carichi «stesso contesto grande, tante domande» senza possedere una sola GPU.
  • La spesa mensile del tuo carico alle tariffe ufficiali la calcola il calcolatore dei costi, direttamente nel browser. Se quel numero è una piccola frazione del costo mensile di un cluster GPU multinodo, la decisione si è già presa da sola: il self-hosting di K3 serve per compliance, residenza dei dati e ricerca, non per risparmiare ai volumi tipici.

Cosa puoi eseguire oggi

Il modello ospitato è attivo e parla il formato OpenAI. Questo è esattamente il codice che abbiamo verificato in produzione il giorno del lancio di K3:

python · openai sdk
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_EVOLINK_API_KEY",
    base_url="https://direct.evolink.ai/v1",   # <-- l'unica riga da cambiare
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain prompt caching in two sentences."}],
)

print(response.choices[0].message.content)

Autenticazione, streaming e com'è fatto un corpo di risposta reale: la guida all'API. Lascia max_completion_tokens al valore predefinito — ecco perché.

FAQ sui pesi aperti

Quando usciranno i pesi di Kimi K3?

La documentazione ufficiale di Moonshot AI si impegna a «entro il 27 luglio 2026» (letta il 2026-07-18). Alla data del 2026-07-18 i pesi non sono ancora pubblicati. Questa pagina viene aggiornata il giorno in cui la cosa cambia.

Kimi K3 è open source?

Promesso ma non ancora consegnato: i pesi sono ufficialmente attesi entro il 27 luglio 2026 e nessuna licenza è stata annunciata. Finché i pesi e il testo della licenza non sono entrambi pubblici, K3 è disponibile solo come modello ospitato.

Che hardware serve per eseguire Kimi K3 in locale?

Sconosciuto finché non esce la model card. La soglia minima secondo l'aritmetica: 2.8T parametri sono 1.4 TB a 4-bit, cioè almeno otto acceleratori da 192 GB solo per contenere i pesi, prima della KV cache per la finestra da 1M token. Non girerà su una GPU singola né su una singola workstation a nessuna delle precisioni pubblicate.

Dove si potranno scaricare i pesi?

Non è stato dichiarato ufficialmente. Ogni rilascio aperto di Kimi finora è uscito nell'organizzazione moonshotai su Hugging Face, ed è quindi il posto da tenere d'occhio.

Posso usare Kimi K3 prima che escano i pesi?

Sì — l'API è attiva dal lancio. Model ID kimi-k3, compatibile con OpenAI, $3.00/1M in input e $15.00/1M in output alle tariffe ufficiali. Prima chiamata in cinque minuti.

Esegui K3 senza comprare 1.4 TB di VRAM

EvoLink serve kimi-k3 su un endpoint compatibile con OpenAI: una sola key raggiunge GPT, Claude, Gemini e decine dei principali modelli al mondo. 10 crediti gratuiti e registrazione da qualsiasi paese, senza numero di telefono cinese.

Ottieni una API key EvoLink