kimik3.io/Pesi aperti
Pesi aperti di Kimi K3
Impegno ufficiale per il 27 luglio 2026 — non ancora consegnati. Questa pagina segue il rilascio, fa i conti sull'hardware e verrà aggiornata quando i pesi usciranno.
I pesi di Kimi K3 non sono ancora pubblici. La documentazione ufficiale di Moonshot AI dice: «I pesi completi del modello saranno rilasciati entro il 27 luglio 2026.» Alla data del 2026-07-18 su Hugging Face non c'è nessun repository di Kimi K3, nessuna model card e nessuna licenza annunciata. Quello che è ufficiale: 2.8T parametri in totale, un'architettura mixture-of-experts che attiva 16 esperti su 896 per token, costruita su Kimi Delta Attention (KDA). Fino al rilascio, l'unico modo per eseguire K3 è l'API, che è già attiva.
Architettura e impegno sul rilascio dalla guida rapida ufficiale, letta il 2026-07-18. Ultima verifica dell'uscita dei pesi: 2026-07-18.
Cosa è ufficiale e cosa non si sa
| Voce | Stato | Fonte |
|---|---|---|
| Data di rilascio | Entro il 27 luglio 2026 — impegno ufficiale | Guida rapida ufficiale, letta il 2026-07-18 |
| Parametri totali | 2.8T, MoE, 16 esperti attivi su 896 | Guida rapida ufficiale, letta il 2026-07-18 |
| Architettura | Kimi Delta Attention (KDA) + Attention Residuals | Guida rapida ufficiale, letta il 2026-07-18 |
| Repository su Hugging Face | — non ancora pubblicato | Verificato il 2026-07-18 |
| Licenza | — non annunciata | Nessuna dichiarazione ufficiale al 2026-07-18 |
| Model card / guida al deployment | — non ancora pubblicate | Arrivano insieme ai pesi |
| Quantizzazioni ufficiali | — sconosciute | Arrivano insieme ai pesi |
Chi oggi cita una cifra minima di VRAM, un comando di avvio o una clausola di licenza per K3 sta tirando a indovinare. Fino al 27 luglio la versione onesta di questa pagina è una pagina corta — quello che possiamo fare onestamente è l'aritmetica.
I conti sull'hardware
2.8T parametri hanno un costo di archiviazione fisso che nessun trucco di serving elimina. Qui si moltiplica, non si misura:
| Precisione | Byte per parametro | Solo i pesi | Solo per contenerli |
|---|---|---|---|
| BF16 / FP16 | 2 | 5.6 TB | ≥ 30 acceleratori da 192 GB |
| FP8 | 1 | 2.8 TB | ≥ 15 acceleratori da 192 GB |
| 4-bit | 0.5 | 1.4 TB | ≥ 8 da 192 GB, oppure ≥ 18 da 80 GB |
Dall'aritmetica seguono due cose. Primo: la sparsità del MoE non riduce l'ingombro. Attivare 16 esperti su 896 taglia il calcolo per token, non la memoria: ogni esperto deve stare in memoria perché uno qualsiasi sia instradabile. Secondo: nessuna macchina singola li contiene. Anche a 4-bit, 1.4 TB di pesi sono circa il triplo della workstation a memoria unificata più capiente e un ordine di grandezza oltre qualsiasi GPU singola: è un deployment multinodo dal primo giorno, prima ancora di mettere a budget la KV cache per una finestra da 1,048,576 token.
Per avere un metro di paragone: i 2.8T di K3 occupano 2.8× rispetto alla famiglia K2 da 1T parametri alla stessa precisione, e i rilasci di K2 richiedevano già più GPU. I requisiti reali di serving (layout tensor-parallel, engine supportati, build quantizzate) arrivano con la model card; sostituiremo questa aritmetica con i numeri ufficiali il giorno in cui esisteranno.
Checklist per il giorno del rilascio
- Tieni d'occhio l'organizzazione moonshotai su Hugging Face. Moonshot non ha detto dove usciranno i pesi, ma ogni rilascio aperto di Kimi finora è stato pubblicato lì.
- Leggi la licenza prima di costruirci sopra. Non è ancora stata annunciata. Non dare per scontato che coincida con i rilasci Kimi precedenti finché il testo non è pubblico.
- Rimanda le decisioni sullo stack di serving. KDA è un'architettura di attention nuova: se il tuo engine di inferenza la supporti dal primo giorno è esattamente il tipo di domanda a cui risponde la model card, non la speculazione.
- Calcola il costo del deployment senza illusioni. Se la riga «4-bit» qui sopra è fuori budget, il self-hosting di K3 non è la tua strada — ed è un esito perfettamente accettabile, perché il modello ospitato è a una riga di
base_urldi distanza. - Misura la baseline del modello adesso. L'API è attiva: puoi verificare qualità, latenza e costo sul tuo carico di lavoro reale prima di impegnarti sull'hardware. I nostri test misurati sono un punto di partenza.
Self-hosting contro API, in numeri
Il biglietto d'ingresso dell'API è $0. Quello del self-hosting è la riga da 1.4 TB qui sopra. Tra questi due estremi, i numeri che abbiamo misurato ti danno il lato API del bilancio con una precisione insolita:
- Un prompt da 497,718 token costa $1.49 in una sola chiamata alla tariffa ufficiale di $3.00/1M — misurato; una chiamata a finestra piena viene circa $3.15.
- Il caching del prompt porta l'input ripetuto a $0.30/1M in automatico — lo sconto 10× che rende sostenibili i carichi «stesso contesto grande, tante domande» senza possedere una sola GPU.
- La spesa mensile del tuo carico alle tariffe ufficiali la calcola il calcolatore dei costi, direttamente nel browser. Se quel numero è una piccola frazione del costo mensile di un cluster GPU multinodo, la decisione si è già presa da sola: il self-hosting di K3 serve per compliance, residenza dei dati e ricerca, non per risparmiare ai volumi tipici.
Cosa puoi eseguire oggi
Il modello ospitato è attivo e parla il formato OpenAI. Questo è esattamente il codice che abbiamo verificato in produzione il giorno del lancio di K3:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_EVOLINK_API_KEY",
base_url="https://direct.evolink.ai/v1", # <-- l'unica riga da cambiare
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain prompt caching in two sentences."}],
)
print(response.choices[0].message.content)
Autenticazione, streaming e com'è fatto un corpo di risposta reale: la guida all'API. Lascia max_completion_tokens al valore predefinito — ecco perché.
FAQ sui pesi aperti
Quando usciranno i pesi di Kimi K3?
La documentazione ufficiale di Moonshot AI si impegna a «entro il 27 luglio 2026» (letta il 2026-07-18). Alla data del 2026-07-18 i pesi non sono ancora pubblicati. Questa pagina viene aggiornata il giorno in cui la cosa cambia.
Kimi K3 è open source?
Promesso ma non ancora consegnato: i pesi sono ufficialmente attesi entro il 27 luglio 2026 e nessuna licenza è stata annunciata. Finché i pesi e il testo della licenza non sono entrambi pubblici, K3 è disponibile solo come modello ospitato.
Che hardware serve per eseguire Kimi K3 in locale?
Sconosciuto finché non esce la model card. La soglia minima secondo l'aritmetica: 2.8T parametri sono 1.4 TB a 4-bit, cioè almeno otto acceleratori da 192 GB solo per contenere i pesi, prima della KV cache per la finestra da 1M token. Non girerà su una GPU singola né su una singola workstation a nessuna delle precisioni pubblicate.
Dove si potranno scaricare i pesi?
Non è stato dichiarato ufficialmente. Ogni rilascio aperto di Kimi finora è uscito nell'organizzazione moonshotai su Hugging Face, ed è quindi il posto da tenere d'occhio.
Posso usare Kimi K3 prima che escano i pesi?
Sì — l'API è attiva dal lancio. Model ID kimi-k3, compatibile con OpenAI, $3.00/1M in input e $15.00/1M in output alle tariffe ufficiali. Prima chiamata in cinque minuti.
Esegui K3 senza comprare 1.4 TB di VRAM
EvoLink serve kimi-k3 su un endpoint compatibile con OpenAI: una sola key raggiunge GPT, Claude, Gemini e decine dei principali modelli al mondo. 10 crediti gratuiti e registrazione da qualsiasi paese, senza numero di telefono cinese.