Contact
IA GÉNÉRATIVE

MiniMax : générer du contenu avec l’IA multimodale

MiniMax M3 est un modèle d'IA chinois optimisé pour le code agentique, doté d'un contexte d'un million de jetons et de tarifs jusqu'à 10x inférieurs aux leaders. Analyse de ses promesses, de l'architecture MSA et de ses limites de conformité.

5 min de lecture 107
Capture d'écran de la page d'accueil de MiniMax Code
À retenir

Les points clés de cet article

Une exécution de noyau CUDA optimisée de 7,6 % à 71,3 % d'utilisation matérielle, en 24 heures, sans intervention humaine. C'est la démonstration mise en avant par MiniMax pour son modèle M3. Le chiffre vient du fournisseur, le tarif, lui, est public. MiniMax est un laboratoire d'IA shanghaïen qui développe des modèles multimodaux (texte, vidéo, voix, musique), exposés via API et abonnements à jetons. Son modèle M3, sorti le 1er juin 2026, cible le code agentique de longue haleine.

  • Code agentique frontière à coût plancher
  • Fenêtre de contexte de 1 million de jetons
  • Multimodal natif : texte, image, vidéo
  • Architecture MSA à attention parcimonieuse
  • Poids ouverts sous licence MIT modifiée

Sous le capot : qui est MiniMax et comment fonctionne M3

MiniMax (稀宇科技, Xīyǔ Kējì) a été fondé en décembre 2021 à Shanghai par Yan JunjieYang Bin et Zhou Yucong. La société revendique plus de 200 millions d’utilisateurs et est cotée à Hong Kong depuis janvier 2026, avec un projet de double cotation sur le STAR Market.

Le catalogue dépasse M3 : générateur vidéo Hailuo AI, app de personnages Talkie, modèles Speech 2.8 et Music 2.6. M3 succède à M2.7, plafonné à 204K jetons.

La pièce maîtresse est MSA (MiniMax Sparse Attention). L’attention dense d’un transformeur classique a une complexité quadratique : doubler le contexte quadruple le coût de calcul.

« MSA casse cette courbe. Une branche d’index découpe le cache clé-valeur en blocs, les score, puis ne retient que les plus pertinents par sélection top-k. L’attention dense ne tourne que sur cette tranche. »

Le gain revendiqué : à 1 million de jetons, le calcul par jeton tombe à environ 1/20e de la génération précédente, prefill 9,7x plus rapide et décodage 15,6x plus rapide.

Sur l’exécution maison de SWE-Bench Pro, M3 atteint 59,0 %, devant GPT-5.5 (58,6 %) et Gemini 3.1 Pro. Ces scores sortent du banc d’essai de MiniMax, avec scaffolding agentique, et n’ont pas encore été reproduits par un tiers indépendant.

Mise en production : trois portes d'entrée concrètes

Le point fort opérationnel : l’endpoint est compatible OpenAI au niveau chat-completions. Vous changez l’URL de base et la clé, votre code tourne sans réécriture.

Pour le développement assisté, MiniMax Code est le harnais maison (bâti sur OpenCode et Pi), en application desktop. Il gère la décomposition de tâches et la mémoire de session. Pour intégrer M3 dans une stack existante, l’API se branche sur Claude Code, Cursor ou OpenCode.

Le modèle est aussi routé via OpenRouter (ID minimax/minimax-m3). Pour la résidence des données, les poids ouverts ont été publiés sur Hugging Face vers le 11 juin 2026, sous licence MIT modifiée : l’auto-hébergement s’impose quand la donnée ne doit pas sortir de votre infrastructure.

Cas d'usage réels et bonnes pratiques

Charger un monorepo entier pour un refactoring transverse

Le contexte 1M ingère plusieurs centaines de fichiers d’un coup. Réservez-le à ça : pour une fonction isolée, un contexte court coûte moins et répond plus vite.

Migrer un agent en test A/B

Via l’endpoint compatible OpenAI, routez 10 % de votre trafic d’agent vers M3 sur OpenRouter et comparez coût et taux de réussite sur vos propres tickets, pas sur un benchmark public.

Mesurez votre taux de cache avant de signer

Le tarif de lecture en cache (0,24 $/M sur M3) pèse sur les prompts répétitifs d’agent. Inspectez le ratio cache_read_input_tokens sur input_tokens dans le champ usage avant tout budget.

Auto-hébergez dès que le RGPD entre en jeu

Pour des données personnelles, l’API hébergée en Chine déclenche une analyse de transfert hors UE. Les poids ouverts sur vos serveurs neutralisent ce point.

Ce que M3 fait réellement (et ce que le marketing tait)

M3 livre un vrai différenciateur : un coût d’inférence par jeton très bas grâce à MSA, doublé de poids réellement publiés. Sur une charge d’agent à fort volume, l’économie est tangible. Trois angles morts subsistent pourtant.

D’abord la comparaison. MiniMax cite Opus 4.7 comme plafond. Or Anthropic a sorti Opus 4.8 le 25 mai 2026 : sur SWE-Bench Pro, les 59,0 % de M3 passent derrière les 69,2 % d’Opus 4.8, écart confirmé sur Terminal-Bench et OSWorld.

Ensuite la reproductibilité. Les démonstrations vedettes (reproduction de papier en 12h, optimisation CUDA en 24h) restent des évaluations internes, non confirmées par un tiers.

Enfin la gouvernance. MiniMax tombe sous la loi chinoise de 2017 sur le renseignement. Ce risque ne disparaît qu’en auto-hébergement, et la licence conditionne l’usage commercial à une autorisation écrite.

Avantages et limites

Avantages

  • Coût d’inférence plancher
  • Contexte de 1 million de jetons
  • Multimodalité native
  • Endpoint compatible OpenAI
  • Disponibilité OpenRouter
  • Poids téléchargeables pour l’auto-hébergement.

Limites

  • Retard de code face à Opus 4.8
  • Benchmarks non reproduits par des tiers
  • Licence à clauses commerciales
  • Gouvernance chinoise sur l’API hébergée
  • Nommage confus entre Hailuo, API et Token Plan

Et du coté des tarifs ?

L’éditeur propose différentes formules selon vos besoins et les services proposés. Vous trouverez ci-dessous les formules du Token Plan.
Pour plus d’informations, consultez la page tarif du site institutionnel en cliquant ici.

PlanPrix mensuelCibleInclus
Starter10 $Test individuelM2.7 seul, ~1 500 requêtes / 5h
Plus20 $Développeur solo~4 500 requêtes, voix + image
Max50 $Petite équipe~15 000 requêtes, suite complète
Ultra120 $Usage intensif~9,8 Md jetons / mois
PAYG (M3)0,30 $/M in, 1,20 $/M outProductionFacturation au jeton réel

Tarifs indicatifs (juin 2026). Le prix M3 est promotionnel au lancement. Vérifiez la page officielle avant tout achat.

Alternatives sur le marché

Produit Différenciateur clé Lien
Claude (Anthropic)Référence qualité code, écosystème mûranthropic.com
GPT-5.5 (OpenAI)Polyvalence et adoption massiveopenai.com
Gemini 3 (Google)Intégration Google Cloud et multimodalitédeepmind.google
DeepSeekOpen-weights chinois, coût agressifdeepseek.com

Verdict de la rédaction

M3 est un complément économique redoutable, pas un remplaçant des modèles frontière. Sur des agents à fort volume, il tient tête à 5 % du prix d’un Opus. Pour la qualité de code pure, Opus 4.8 garde une avance documentée.

La vraie carte maîtresse, ce sont les poids ouverts. Auto-hébergez M3 pour vos charges sensibles, gardez un modèle propriétaire pour le critique, et benchmarkez sur vos propres tickets avant de trancher.

Pour aller plus loin avec Minimax

Vous désirez en savoir davantage, découvrir la dernière grille tarifaire ou encore tester cette solution ?

Rendez vous sur leur site institutionnel en cliquant sur le bouton ci-contre.

FAQ article

Questions fréquentes

1 - Qu'est-ce que MiniMax M3 ?

MiniMax M3 est un modèle d'IA open-weights chinois sorti le 1er juin 2026, conçu pour le code agentique. Il réunit un contexte d'un million de jetons et une multimodalité native via l'architecture MSA.

2 - MiniMax M3 est-il meilleur que Claude Opus ?

MiniMax M3 reste derrière Claude Opus 4.8 sur le code : 59,0 % contre 69,2 % sur SWE-Bench Pro. Son avantage est le coût, environ 5 % du prix par tâche d'Opus.

3 - Combien coûte un abonnement MiniMax ?

Un abonnement MiniMax Token Plan démarre à 10 $ par mois (Starter) et monte à 120 $ (Ultra). Le paiement à l'usage facture séparément, à 0,30 $ par million de jetons en entrée.

4 - MiniMax M3 est-il open source ?

MiniMax M3 est open-weights : ses poids ont été publiés sur Hugging Face vers le 11 juin 2026, sous licence MIT modifiée. L'usage commercial peut exiger une autorisation écrite de MiniMax.

5 - Qu'est-ce que l'architecture MSA ?

MSA (MiniMax Sparse Attention) est une attention parcimonieuse qui sélectionne par top-k les blocs de contexte pertinents. Elle réduit le calcul par jeton à environ 1/20e de la génération précédente.

6 - MiniMax M3 est-il compatible RGPD ?

MiniMax M3 peut être rendu conforme RGPD via l'auto-hébergement des poids ouverts, qui garde la donnée en interne. L'API hébergée en Chine, elle, impose une analyse de transfert hors UE.

7 - Quelles alternatives à MiniMax M3 ?

Les principales alternatives à MiniMax M3 sont Claude (Anthropic), GPT-5.5 (OpenAI), Gemini 3 (Google) et DeepSeek, ce dernier partageant le positionnement open-weights chinois à bas coût.

Cet article vous a plu ? Partagez-le.

Amelie J
À propos de l'auteur

Amelie J

Rédacteur pour VeilleTechno-IT.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

L'Édition Hebdomadaire L'essentiel de la tech,
chaque vendredi.

Gagnez du temps sur votre veille. On filtre le superflu, on garde l’essentiel : actus, outils, insights actionnables pour rester à jour sans y passer des heures.

✓ Merci ! Vérifiez votre boîte mail pour confirmer votre inscription.