Kimi K3 : ce qu'un modèle ouvert de classe frontière change pour votre souveraineté et votre facture

Moonshot AI a publié les poids de Kimi K3 le 27 juillet 2026 : 2,8 billions de paramètres, 104 milliards actifs, 1 million de tokens de contexte. Pour la quasi-totalité des ETI, cela ne change rien au self-hosting : les poids seuls pèsent environ 1,4 To de VRAM. Cela change trois choses : la réversibilité, le prix plancher du marché et l'hébergement souverain. Analyse de la licence, du calcul de rentabilité et de la grille de décision. Pour les DSI, CTO et directions innovation.

Note de transparence. Cet article est rédigé conformément à la politique éditoriale d'IgnitionAI. Les caractéristiques du modèle et les clauses de licence proviennent de la fiche officielle Hugging Face, du blog technique de Moonshot AI et du fichier LICENSE original, consultés le 2 août 2026. Les estimations de coût et de dimensionnement sont taguées comme estimations IgnitionAI. IgnitionAI n'a aucun lien commercial avec Moonshot AI.

Moonshot AI a publié les poids de Kimi K3 le 27 juillet 2026 : 2,8 billions de paramètres, dont 104 milliards activés par token, et une fenêtre de contexte d'un million de tokens. Pour la quasi-totalité des ETI, cette publication ne change rien à la possibilité d'héberger le modèle : les poids seuls occupent environ 1,4 To de mémoire GPU. Elle change trois autres choses, qui comptent davantage : votre réversibilité, le prix plancher du marché et la faisabilité d'un hébergement souverain.

Et sa licence n'est pas une licence open source. C'est le point que presque personne ne lit.

Ce que Kimi K3 est, factuellement

CaractéristiqueValeur
Paramètres totaux2 800 milliards (2,8 T)
Paramètres activés par token104 milliards, soit 16 experts sur 896
Fenêtre de contexte1 048 576 tokens
Modalitéstexte et image, nativement
Quantificationpoids MXFP4, activations MXFP8, par entraînement adapté à la quantification
Publication des poids27 juillet 2026, sur Hugging Face
LicenceKimi K3 License (pas une licence open source, voir plus bas)

Source : fiche modèle Hugging Face et blog technique Moonshot AI, consultés le 2 août 2026.

L'architecture repose sur deux mécanismes que Moonshot nomme Kimi Delta Attention et Attention Residuals, associés à un cadre de mélange d'experts baptisé Stable LatentMoE. L'éditeur revendique une efficacité de passage à l'échelle environ 2,5 fois supérieure à celle de Kimi K2, et présente le modèle comme le premier de classe 3 000 milliards de paramètres publié en poids ouverts.

La sparsité est l'information à retenir pour un décideur. Le modèle compte 2,8 billions de paramètres mais n'en active que 104 milliards à chaque token. Le coût de calcul par requête se rapproche de celui d'un modèle de 100 milliards de paramètres, alors que la mémoire nécessaire reste celle d'un modèle de 2,8 billions. Cette dissociation entre coût de calcul et coût de mémoire est exactement ce qui rend le modèle intéressant à servir, et difficile à héberger.

Les performances, sans emballement

Les résultats publiés par Moonshot sur sa fiche modèle :

ÉvaluationScore
GPQA Diamond (raisonnement scientifique)93,5
Terminal-Bench 2.1 (usage d'outils en terminal)88,3
BrowseComp (recherche web agentique)91,2
DeepSWE (ingénierie logicielle)67,5
Video-MME (compréhension vidéo)90,0
MathVision (mathématiques visuelles)94,3 sans outils, 97,8 avec outils

Source : fiche modèle Hugging Face, consultée le 2 août 2026. Scores auto-déclarés par l'éditeur.

Deux précautions de lecture, qui valent pour tous les modèles.

D'abord, ces scores sont auto-déclarés. Ils sont utiles pour situer un ordre de grandeur, pas pour trancher un choix d'architecture. Seule une évaluation sur vos propres données et vos propres requêtes vous dira ce que le modèle vaut pour votre cas.

Ensuite, le protocole compte autant que le score. Moonshot indique que le score BrowseComp de 91,2 est obtenu avec une compaction du contexte à 300 000 tokens, et que la même évaluation menée sur la fenêtre complète d'un million de tokens sans compaction donne 90,4. L'écart est faible, mais il illustre une règle générale : un benchmark sans son protocole n'est pas une donnée exploitable.

Sur le positionnement, l'éditeur est lui-même explicite. Le blog technique de Moonshot indique que la performance globale de K3 reste en retrait des modèles propriétaires les plus puissants, qu'il nomme Claude Fable 5 et GPT-5.6 Sol, tout en revendiquant un niveau frontière sur sa suite d'évaluation. Cette honnêteté de l'éditeur est un signal de sérieux, et elle vous évite de fonder une décision sur une comparaison marketing.

Le piège que personne ne lit : la licence

« Poids ouverts » ne signifie pas « open source ». Kimi K2 était distribué sous une licence MIT modifiée. K3 est publié sous un document nouveau, la Kimi K3 License, qui introduit des seuils commerciaux.

Ce que la licence autorise, dans ses termes : utiliser, copier, modifier, fusionner, publier, distribuer, sous-licencier et vendre des copies du logiciel, ainsi que l'exécuter, le déployer, l'affiner et en créer des travaux dérivés.

Ce qu'elle conditionne :

  • Seuil « modèle en tant que service ». Si vous ou vos affiliés exploitez une activité de modèle en tant que service dépassant 20 millions de dollars sur douze mois consécutifs, un accord distinct avec Moonshot AI est requis avant tout usage commercial.
  • Obligation d'affichage. Si le logiciel alimente un produit commercial dépassant 100 millions d'utilisateurs actifs mensuels, ou 20 millions de dollars de revenu mensuel, la mention « Kimi K3 » doit être affichée visiblement dans l'interface utilisateur.
  • Exemptions. Ces obligations ne s'appliquent ni à un usage interne non mis à disposition de tiers, ni à un usage passant par les produits officiels de Moonshot AI ou ses partenaires certifiés.

Source : fichier LICENSE officiel, consulté le 2 août 2026. Le logiciel est fourni « en l'état », sans garantie.

Traduction pour trois profils. Une ETI qui déploie le modèle pour ses collaborateurs, sans le revendre, entre dans l'exemption d'usage interne : aucune de ces contraintes ne la concerne. Un cabinet ou un éditeur qui revend l'inférence comme service doit surveiller le seuil des 20 millions de dollars. Un produit grand public à très forte audience doit prévoir la mention dans son interface.

La leçon dépasse Kimi K3 : la licence d'un modèle ouvert est une clause contractuelle à lire au cadrage, au même titre qu'un contrat fournisseur. Les licences des modèles ouverts divergent de plus en plus, et un modèle « gratuit » peut porter des obligations qui apparaissent au moment où votre produit décolle.

Le calcul que tout le monde saute : héberger 2,8 billions de paramètres

Faisons l'arithmétique. À la quantification native du modèle, quatre bits par paramètre, 2,8 billions de paramètres occupent environ 1,4 To. C'est la mémoire nécessaire pour les seuls poids, avant le cache d'attention, qui grandit avec la longueur de contexte et le nombre d'utilisateurs simultanés.

Aucun serveur GPU unique ne fournit cette mémoire aujourd'hui. Il faut un nœud multi-GPU de classe datacenter, et davantage encore pour exploiter la fenêtre complète d'un million de tokens. Estimation IgnitionAI : une telle infrastructure, louée chez un fournisseur cloud, se chiffre en dizaines de milliers d'euros par mois, avant les compétences d'exploitation nécessaires pour la maintenir.

En face, l'accès par API se facture autour de 2,90 dollars le million de tokens en entrée et 14 dollars en sortie (tarifs OpenRouter, consultés le 2 août 2026).

Le seuil de rentabilité se calcule simplement :

volume mensuel d'équilibre ≈ coût mensuel de l'infrastructure / prix moyen par token via API

Estimation IgnitionAI : pour la grande majorité des ETI, dont la consommation se compte en dizaines ou centaines de millions de tokens par mois, l'API reste largement moins chère que l'hébergement dédié. Le self-hosting d'un modèle de cette taille se justifie par la souveraineté ou par un volume industriel, rarement par l'économie seule.

Autrement dit : la publication des poids ne signifie pas que vous allez héberger ce modèle. Elle signifie que quelqu'un peut l'héberger pour vous, sans dépendre de l'éditeur d'origine. C'est là que se trouve la vraie nouveauté.

Ce que ça change vraiment pour une ETI

1. La réversibilité devient un fait technique, plus une promesse contractuelle. Un modèle propriétaire peut changer de prix, de version ou de conditions du jour au lendemain. Un modèle dont les poids sont publiés reste disponible dans la version que vous avez validée. Vous pouvez l'héberger vous-même, le faire héberger par un tiers, ou revenir à l'API. Cette optionalité est un argument de négociation avec vos fournisseurs actuels, et une réponse concrète à un comité des risques qui interroge votre dépendance.

2. La souveraineté d'hébergement devient atteignable. Vos données peuvent être traitées par un modèle de niveau élevé hébergé sur une infrastructure européenne, sans transfert vers un éditeur hors Union européenne. Pour les secteurs régulés, cela déplace une contrainte que nous rencontrons sur presque toutes nos missions. Le sujet reste à instruire avec votre DPO : la localisation du calcul ne règle pas à elle seule les questions de base légale et de sous-traitance au sens du RGPD.

3. Le prix plancher du marché baisse. L'existence d'un modèle ouvert performant exerce une pression sur les tarifs de tous les fournisseurs. Vos budgets d'inférence, tels que nous les décomposons dans notre article sur le coût d'un projet RAG, profitent de cette concurrence, quel que soit le modèle que vous retiendrez au final.

La bonne question n'est donc pas « ouvert ou propriétaire ». C'est « quel modèle pour quelle tâche ». Un système en production route les requêtes simples vers un modèle économique et les requêtes complexes vers un modèle plus puissant, avec une évaluation continue de la qualité. Le choix se fait tâche par tâche, sur vos données, pas sur un classement général.

Grille de décision

Votre situationApproche recommandée
Volume modéré, pas de contrainte de localisationAPI, en comparant les fournisseurs. L'ouverture des poids vous sert de levier de négociation, pas de projet d'infrastructure
Données sensibles, contrainte de souverainetéHébergement du modèle ouvert chez un fournisseur européen, ou sur votre infrastructure si vos équipes savent l'exploiter
Volume industriel et continuCalculer le seuil de rentabilité avec vos volumes réels. C'est le seul cas où le self-hosting se défend économiquement
Produit revendu à des tiersLire la licence avant tout engagement, en particulier les seuils commerciaux et l'obligation d'affichage

Estimations IgnitionAI fondées sur nos 3 missions 2024-2025 auprès d'ETI françaises de secteurs régulés. Variation possible selon le contexte.

FAQ : Kimi K3 et les modèles ouverts en entreprise

  • Kimi K3 est-il open source ?

    Non, au sens strict. Ses poids sont publiés en téléchargement libre, mais la Kimi K3 License n'est pas une licence open source. Elle impose un accord distinct avec Moonshot AI pour les activités de modèle en tant que service dépassant 20 millions de dollars sur douze mois. Elle impose aussi l'affichage de la mention « Kimi K3 » pour les produits dépassant 100 millions d'utilisateurs actifs mensuels ou 20 millions de dollars de revenu mensuel. L'usage interne non mis à disposition de tiers est exempté.

  • Peut-on héberger Kimi K3 sur ses propres serveurs ?

    Techniquement oui, mais pas sur du matériel courant. À la quantification native de quatre bits, les 2,8 billions de paramètres occupent environ 1,4 To de mémoire GPU, avant le cache d'attention. Cela suppose un nœud multi-GPU de classe datacenter. Estimation IgnitionAI : l'hébergement dédié se justifie par la souveraineté ou par un volume industriel, rarement par l'économie seule face à un prix API de l'ordre de 2,90 dollars le million de tokens en entrée.

  • Un modèle ouvert vaut-il les modèles propriétaires ?

    Sur les évaluations publiées, Kimi K3 se situe à un niveau élevé, et Moonshot indique lui-même que sa performance globale reste en retrait des modèles propriétaires les plus puissants. L'écart s'est nettement réduit. Le critère de décision utile n'est pas un classement général mais une évaluation sur vos propres données, tâche par tâche.

  • Qu'est-ce que la publication des poids change pour une ETI ?

    Trois choses. La réversibilité devient un fait technique, puisque le modèle reste disponible dans la version validée, hébergeable par vous ou par un tiers. L'hébergement souverain sur une infrastructure européenne devient atteignable pour les secteurs régulés. Et la pression concurrentielle sur les prix profite à vos budgets d'inférence, quel que soit le modèle retenu.

Méthodologie et sources

Sources primaires (consultées le 2 août 2026) :

Réglementaire : Règlement (UE) 2016/679 (RGPD), pour les questions de sous-traitance et de transfert : EUR-Lex.

Calculs et estimations IgnitionAI : l'empreinte mémoire d'environ 1,4 To résulte du calcul direct 2,8 billions de paramètres à quatre bits, hors cache d'attention. Les ordres de grandeur de coût d'infrastructure et les recommandations par situation reposent sur 3 missions livrées en 2024-2025 auprès d'ETI françaises de secteurs régulés. Variation possible selon le contexte. Les scores d'évaluation cités sont auto-déclarés par l'éditeur et n'ont pas été reproduits par IgnitionAI.

Indépendance : IgnitionAI n'a aucun lien commercial avec Moonshot AI, ni avec les éditeurs de modèles cités. Voir notre politique éditoriale.

Dernière relecture des sources : 2026-08-02. Les tarifs d'API et les licences de modèles évoluent rapidement, à re-vérifier au moment de votre cadrage.

Articles connexes IgnitionAI :


Vous vous demandez quel modèle retenir pour votre cas, et si l'hébergement souverain est justifié ? Notre cadrage de deux semaines compare les options sur vos données réelles, chiffre les coûts d'inférence et conclut par un go/no-go écrit. Demander un échange.

À lire ensuite

Sécurité·14 juin 2026

RAG et droits d'accès : faire hériter un RAG des permissions Active Directory (Entra ID)

Un RAG hérite des droits Active Directory en propageant l'appartenance aux groupes de l'utilisateur jusqu'au filtre de recherche, sur trois niveaux : tag ACL à l'ingestion, filtre pré-retrieval à la requête, vérification à la réponse. Tutoriel Entra ID / Microsoft Graph, les six cas qui cassent (groupes imbriqués, débordement du token, révocation), et la généralisation IAM/RBAC. Pour architectes, lead engineers et CTO d'ETI.

Salim Laimeche
Salim Laimeche
Stratégie·13 juin 2026

Pourquoi les projets d'IA n'atteignent pas la production : ce que mesurent vraiment les chiffres d'échec

Selon l'étude, 30 à 95 % des projets d'IA n'aboutissent pas : RAND mesure plus de 80 % d'échecs, Gartner au moins 30 % d'abandons après POC, le MIT 95 % de pilotes sans retour, S&P Global 42 % d'entreprises qui renoncent. Ces chiffres ne mesurent pas la même chose, mais pointent quatre causes traitables au cadrage. Décryptage sourcé et méthode go/no-go pour les DSI, CTO et directions innovation.

Salim Laimeche
Salim Laimeche
Stratégie·12 juin 2026

Combien coûte un projet RAG d'entreprise en 2026 ? Fourchettes réelles, du POC à 100 millions de vecteurs

Un projet RAG s'engage par phases : 8 000 € pour un cadrage qui décide, 25 000 à 60 000 € pour un prototype, 80 000 à 250 000 € pour la production, sans jamais signer le gros budget à l'aveugle. S'y ajoute le poste qui fait déraper les budgets : l'infrastructure récurrente, de 25 à plus de 5 000 dollars par mois selon l'architecture. Décomposition poste par poste, TCO 3 ans de 9 bases vectorielles, et les trois décisions de cadrage qui bornent le coût. Pour les DSI, CTO et directions innovation.

Salim Laimeche
Salim Laimeche
Contact

Présentez-nous votre projet IA

Un premier échange de trente minutes avec un consultant senior. Vous repartez avec un avis documenté sur la faisabilité, le périmètre et l'ordre de grandeur des coûts. Si nous estimons que le projet n'est pas mûr, nous vous l'indiquons par écrit.

Réponse sous 24 heures ouvrées par un consultant nommé.

Kimi K3 : ce qu'un modèle ouvert de classe frontière change pour votre souveraineté et votre facture — IgnitionAI