AccueilBlog › Kimi local
Veille frontier · Local réel · Kimi Code

Kimi K3 et K2.7 Code en local : ce qui tourne vraiment

Kimi fait beaucoup parler de lui, mais trois choses sont mélangées : le CLI installé sur votre PC, le modèle servi à distance et les poids auto-hébergés. Au 24 juillet 2026, K2.7 Code est open-weights mais pèse environ 595 Go en INT4 ; K3 est disponible comme service et ses poids complets sont annoncés pour le 27 juillet.

Publié le 24 juillet 202612 minSources Moonshot AI et Hugging Face
K3 / K2.7Service immédiat · 595 Go de poids pour le vrai local K2.7

Verdict OutilsIA

Oui à Kimi sur un PC normal ; non au modèle complet dans une carte gaming

Kimi.com / Kimi Code / APIUtilisable maintenant sur un PC standard. Le programme est local, l'inférence Kimi est distante.
K2.7 Code auto-hébergéPoids INT4 publics d'environ 595 Go. Serveur multi-GPU ou architecture hybride massive.
K3 local aujourd'huiPoids complets annoncés pour le 27 juillet 2026 : aucune commande locale fiable à publier le 24.

Kimi K3, K2.7 Code et K2.6 : lequel choisir ?

ModèleRôleContexteÉtat local au 24/07
Kimi K3Modèle phare : code long, connaissance, raisonnement, visionJusqu'à 1M tokens via les offres compatiblesService/API disponibles ; poids complets annoncés le 27 juillet
Kimi K2.7 CodeCode agentique long-horizon, multimodal, thinking obligatoire256KPoids publics ; environ 595 Go pour le checkpoint INT4 officiel
Kimi K2.6Usage plus général : conversation, analyse, image/vidéo et codeSelon l'accès KimiPoids publics de la même famille d'architecture

Moonshot conseille K2.7 Code pour la programmation et K2.6 pour l'usage général. K3 devient le modèle phare dans Kimi Code et l'API. Cette distinction compte : un nom de modèle dans un sélecteur cloud ne prouve pas qu'un checkpoint local est déjà téléchargeable.

Le chiffre que les présentations oublient : 595 Go

La fiche officielle K2.7 Code décrit un MoE de 1 000 milliards de paramètres totaux, dont environ 32 milliards actifs par token. Le calcul par token profite du MoE, mais la machine doit toujours stocker tous les experts nécessaires.

OutilsIA a additionné les 64 fichiers model-*.safetensors listés par l'API officielle Hugging Face : 595 177 988 208 octets, soit environ 595,18 Go décimaux ou 554,30 Gio. Ce checkpoint est déjà compressé en INT4 natif.

32B actifs ne veut pas dire 32B à télécharger. Une RTX 4090 24 Go ou une RTX 5090 32 Go peut participer à un déploiement hybride, mais elle ne contient pas seule près de 595 Go de poids.

Le matériel documenté officiellement

Le guide de déploiement Moonshot ne présente pas une tour grand public. Il donne trois repères concrets :

Service vLLM / SGLangUn nœud avec 8× NVIDIA H200 en tensor parallel 8. C'est la recette serveur officielle simple.
Inférence hybride KTransformers8× NVIDIA L20 + 2× Intel 6454S. Moonshot rapporte 24,51 tok/s en décodage à 48 requêtes concurrentes.
LoRA, pas inférence légère2× RTX 4090 + Intel 8488C + 1,97 To de RAM et 200 Go de swap pour l'exemple de fine-tuning LoRA.

Le dernier exemple ne signifie pas que deux RTX 4090 suffisent à faire tenir le modèle en mémoire. Les près de 2 To de RAM sont précisément l'information importante.

Kimi Code sous Windows et Linux

Kimi Code est un agent de programmation en terminal. Il peut lire et modifier un projet, lancer des commandes, utiliser MCP et déléguer à des sous-agents. Son installation est disponible sous Windows, Linux et macOS.

Windows PowerShell

irm https://code.kimi.com/kimi-code/install.ps1 | iex
kimi --version
kimi doctor

Linux, WSL ou macOS

curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash
kimi --version
kimi doctor

Au premier lancement, l'utilisateur choisit l'authentification Kimi ou une clé de plateforme. OutilsIA ne doit jamais lire ce jeton. Son intégration source se limite donc à une commande de version bornée : elle prouve la présence du CLI, pas l'état du compte, le quota, le modèle sélectionné ou le coût.

Ce qu'OutilsIA Local Cockpit ajoute

OutilsIA Local Cockpit affiche le diagnostic matériel et les modèles compatibles
Scanner avant d'acheterCPU, RAM, GPU, VRAM, stockage, Windows/WSL/Linux et modèles Ollama installés.
K2.7 classé frontierLe catalogue affiche le modèle sans bouton Installer ou Bench et rappelle son poids officiel.
Kimi Code détecté seulementLe Capability Router peut vérifier kimi --version. Aucun agent ni réseau n'est lancé par cette détection.

Cette extension appartient au candidat source postérieur au build public actuel. Elle ne doit pas être attribuée au téléchargement disponible tant qu'une nouvelle release Windows/Linux cohérente n'a pas été publiée.

La configuration raisonnable : Kimi distant + modèles locaux utiles

Pour la plupart des utilisateurs, le meilleur choix n'est pas un serveur K2.7. C'est une station hybride : Kimi K3/K2.7 via abonnement ou API pour les tâches très lourdes, et un modèle 14B à 32B réellement local pour la confidentialité, l'offline et les tests rapides.

Développeur simple32 Go RAM, SSD 1 à 2 To, iGPU ou GPU existant. Kimi Code fonctionne ; les petits modèles Ollama restent possibles.
Station hybride recommandée64 à 128 Go RAM, SSD 2 à 4 To et GPU 24 à 32 Go. Kimi reste distant ; Qwen, Gemma, Mistral ou Hermes tournent localement selon le benchmark.
K2.7 intégralPlusieurs centaines de Go de mémoire et plusieurs GPU serveur. Passez par un intégrateur/datacenter, pas un panier Amazon improvisé.
Transparence affiliation

Les liens Amazon ci-dessous sont affiliés : OutilsIA peut recevoir une commission sans surcoût. Ils composent une station hybride pour modèles locaux plus petits et Kimi distant. Ils ne permettent pas de charger K2.7 Code en entier. Vérifiez la QVL RAM, les dimensions GPU, l'alimentation et les connecteurs de votre carte mère avant achat.

Faut-il attendre K3 open-weights ?

Oui avant de publier une configuration locale K3. Moonshot annonce les poids complets pour le 27 juillet 2026. Tant que la liste officielle des fichiers, le format, la licence et les recettes de déploiement ne sont pas publics, une estimation matérielle précise serait prématurée.

OutilsIA mettra à jour ce guide et le catalogue après vérification. Si K3 conserve 2,8T paramètres, il restera de toute façon dans la catégorie serveur extrême, même si son architecture MoE réduit le calcul actif par token.

Questions fréquentes

Existe-t-il une commande Ollama officielle pour Kimi K2.7 Code ?

OutilsIA n'en publie pas au 24 juillet. La page Ollama historique Kimi K2 est indiquée comme retirée et sans modèle poussé. Le catalogue garde donc K2.7 en watchlist sans bouton d'installation.

Une RTX 5090 suffit-elle pour Kimi K2.7 ?

Non. Elle peut accélérer une partie d'un déploiement hybride, mais ses 32 Go représentent environ 5 % de la taille des seuls poids INT4 officiels.

Kimi Code est-il gratuit ?

Le CLI est open source sous licence MIT. L'accès aux modèles Kimi dépend ensuite d'un niveau de compte, d'un abonnement ou d'une facturation API. Vérifiez toujours la page officielle des offres avant usage.

K2.7 Code est-il open source ?

Les poids et le code sont publiés sous une licence MIT modifiée. La modification impose un affichage visible du nom “Kimi K2.7 Code” aux produits commerciaux dépassant 100 millions d'utilisateurs actifs mensuels ou 20 millions de dollars de revenu mensuel.

Verdict final

Kimi mérite sa place dans OutilsIA, mais pas comme un modèle “Installer en un clic”. Sa valeur actuelle est double : Kimi Code/K3 comme capacité distante de haut niveau, et K2.7 Code comme signal open-weights majeur pour les serveurs.

Le choix intelligent pour un particulier reste une station locale raisonnable, capable de lancer de bons 14B/32B, complétée par Kimi pour les tâches qui justifient le cloud. Le Cockpit doit rendre cette frontière visible au lieu de pousser un achat inutile.

À faire maintenant

Sources officielles