Choisir un modèle d'IA pour ses automatisations : la méthode, puis le comparatif

Par Publié le Mis à jour le

Quel modèle d'IA choisir pour vos automatisations ? Celui qui réussit le mieux votre tâche, à un coût et avec un lieu de traitement des données que vous acceptez, et vous ne le savez qu'en le testant sur vos propres cas. Un classement de modèles ne remplace pas ce test, et il date vite. Antomation installe des automatisations et des outils d'IA pour des PME. On donne d'abord une méthode qui reste valable quand les noms changent, puis un encadré des prix et des données publiés par les éditeurs, daté du 3 octobre 2026.

Sommaire
  1. Pourquoi ne pas changer de modèle à chaque sortie
  2. Quel modèle d'IA choisir : les critères qui comptent dans une automatisation
  3. Tester sur ses propres tâches
  4. Un modèle par tâche
  5. Le comparatif du moment : situation au 3 octobre 2026, à revoir
  6. Quand changer de modèle

Pourquoi ne pas changer de modèle à chaque sortie

Parce qu'une annonce ne dit rien de ce que le nouveau modèle fera sur votre tâche, et que chaque changement demande un nouveau test. Rien qu'en septembre 2026, quatre éditeurs ont publié ou ouvert à tous au moins neuf modèles de langage, d'après leurs propres pages.

Le relevé, d'après les pages officielles : trois modèles chez Anthropic (Claude Fable 5.1, Opus 5.5 et Sonnet 5.5), quatre chez OpenAI (GPT-6 Astra, Sol, Luna et GPT-6.1 Sol), un chez Google (Gemini 3.8 Flash, ouvert à tous) et un chez DeepSeek (DeepSeek-V4.1-Flash). Sources : les pages de modèles d'Anthropic, le journal des changements d'OpenAI, les notes de version de Google et le journal de DeepSeek.

Un modèle se remplace parce qu'un test sur vos cas le justifie, ou parce qu'une contrainte (prix, retrait, lieu des données) vous y oblige, pas parce qu'il est nouveau. La méthode qui suit sert à le vérifier.

Quel modèle d'IA choisir : les critères qui comptent dans une automatisation

Cinq critères suffisent à décider : la qualité sur votre tâche, le coût par exécution, la rapidité, le lieu de traitement des données et la stabilité des versions. Aucun ne se lit dans un classement : chacun se vérifie sur votre cas.

La qualité sur votre tâche, pas sur un classement

La qualité qui compte est celle que vous observez sur vos documents, vos mails ou vos demandes, avec vos consignes. Anthropic le dit dans son guide de choix : disposer de son propre jeu de test, bâti sur son cas d'usage, est l'étape la plus importante (Choosing the right model). OpenAI recommande aussi d'essayer ses modèles sur son propre usage (page de tarification).

Les scores que les éditeurs affichent portent sur leurs tests, pas sur votre tâche : on ne les reprend pas, et cet article n'en publie aucun.

Le coût par exécution

Un jeton est un morceau de texte, souvent un mot ou une partie de mot, et c'est l'unité dans laquelle les éditeurs facturent. Le coût d'une exécution se calcule : jetons envoyés multipliés par le prix d'entrée, plus jetons reçus multipliés par le prix de sortie. Les éditeurs publient des prix par million de jetons, jamais un coût par tâche : le calcul reste à faire pour chaque automatisation.

Prenons un exemple théorique, avec les prix publiés : une tâche qui envoie 2 000 jetons et en reçoit 500, exécutée 1 000 fois dans le mois. Avec GPT-6 Luna (0,10 $ en entrée, 0,50 $ en sortie par million de jetons), cela donne 0,45 $ pour le mois. Avec GPT-6.1 Sol ou Claude Sonnet 5.5 (2 $ et 10 $), 9 $. Avec GPT-6 Astra ou Claude Fable 5.1 (10 $ et 50 $), 45 $. À nombre de jetons égal, l'écart est de 1 à 100. Ce calcul ignore la mise en cache, les remises et les majorations, et il ne dit rien de la qualité : un modèle à 0,45 $ qui rate la moitié des cas coûte plus cher qu'il n'en a l'air.

Un même texte ne donne pas non plus le même nombre de jetons selon le modèle : Anthropic indique que ses modèles depuis Claude 4.7 découpent un même texte en environ 30 % de jetons de plus que les précédents (Pricing). Le vrai calcul se fait donc avec les jetons relevés pour chaque modèle, sur vos propres cas.

OpenAI et Anthropic proposent une remise de 50 % pour le traitement par lots, où les résultats arrivent plus tard (dans un délai de 24 heures chez OpenAI), et facturent moins cher les parties de consigne déjà mises en cache, ce qui compte si la réponse n'est pas urgente.

La rapidité

Une automatisation qui tourne la nuit n'a pas besoin de la même rapidité qu'un assistant qui répond à un visiteur. La rapidité se mesure sur votre cas, en temps de réponse moyen et dans les pires cas.

Les éditeurs situent leurs modèles de façon grossière : Anthropic indique pour Sonnet 5.5 une latence « rapide », pour Opus 5.5 « modérée » et pour Fable 5.1 « plus lente » (Models overview). Dans cette gamme, les plus chers sont aussi les plus lents : vérifiez que l'écart apporte quelque chose à votre tâche.

Le lieu de traitement des données

Le lieu de traitement dépend du modèle, de l'éditeur et de l'offre que vous prenez, et il se paie parfois en supplément. Si vos automatisations touchent des données de clients ou de salariés, lisez la page de chaque éditeur sur ce point avant de choisir, pas après. On y consacre un article : l'IA européenne et les données d'entreprise.

Les écarts sont réels : Mistral AI héberge par défaut dans l'Union européenne, OpenAI propose la résidence dans l'Espace économique européen sur approbation, et l'API directe d'Anthropic n'a pas d'option Europe (détail dans le tableau plus bas).

De notre côté, on cadre cette question au démarrage de tout dossier soumis au RGPD (voir notre FAQ), car elle peut orienter le choix du modèle.

La stabilité des versions

Une version que vous pouvez garder des mois vous évite de refaire vos tests ; chaque éditeur encadre la durée de vie de ses modèles avec ses propres règles.

Chez Anthropic, chaque identifiant de modèle correspond à une version figée, le préavis avant retrait d'un modèle public est d'au moins 60 jours, et Sonnet 5.5 ne sera pas retiré avant le 28 septembre 2027 sur les plateformes qu'Anthropic exploite lui-même. Chez OpenAI, le préavis est d'au moins six mois pour un modèle disponible à tous. Sources : Models overview, Model deprecations et Deprecations d'OpenAI.

Claude Sonnet 4.5 sera retiré le 30 novembre 2026, et Sonnet 5.5 est le remplaçant indiqué : Anthropic l'a annoncé aux développeurs le 30 septembre. OpenAI a notifié le 1er octobre 2026 un arrêt au 1er avril 2027 pour GPT-5.1, GPT-5.3-Codex et GPT-5.4-Nano. Une automatisation bâtie sur l'un de ces modèles doit être retestée avant la date.

Tester sur ses propres tâches

Pour comparer deux modèles sans être développeur, donnez-leur les mêmes cas réels, avec les mêmes consignes, et notez les résultats vous-même avec une grille écrite à l'avance. Le protocole tient en cinq étapes.

  1. Rassemblez une vingtaine de cas réels de la tâche (un ordre de grandeur, pas une règle), assez variés pour inclure des situations qui vous ont déjà posé problème, comme une demande mal formulée ou un document incomplet.
  2. Écrivez une seule consigne, la même pour tous les modèles testés, sans la retoucher en cours de route.
  3. Faites passer chaque cas par chaque modèle, sans regarder d'abord quel modèle a produit quelle réponse.
  4. Notez chaque réponse selon une grille décidée avant le test : juste ou fausse, exploitable telle quelle ou à reprendre, et ce qui vous gêne le plus dans les erreurs.
  5. Relevez, pour chaque modèle, le nombre de jetons consommés et le temps de réponse, puis calculez le coût par exécution.

Si un modèle réussit à peu près autant que les autres, prenez le moins cher, le plus rapide ou celui qui traite vos données là où vous le voulez. S'il échoue sur les cas difficiles, vous le saurez avant de le brancher à votre activité. Anthropic ajoute que régler l'effort de réflexion du modèle est souvent plus efficace que d'en changer (Choosing the right model).

Dans n8n, le modèle se choisit dans un nœud dédié : le nœud « Mistral Cloud Chat Model », par exemple, ne montre que les modèles disponibles sur votre compte (documentation n8n). Pour savoir quand un flux classique suffit et quand il faut un agent, voyez l'article Make, n8n ou agents IA.

Un modèle par tâche

Rien n'oblige à utiliser un seul modèle pour tout. Chaque tâche a son profil de qualité, de coût, de rapidité et de données, et une même mission peut combiner plusieurs modèles.

Trois exemples chez nous, sans publier la raison de chaque choix. Dans PrintChance, Claude sert de moteur multi-agents : il analyse la demande, calcule l'imposition et génère le devis. Pour ce projet, on publie « 38 min → 52 sec » par devis. Dans Yataa Globe, Claude enrichit automatiquement les nouvelles destinations (coordonnées, drapeau, aéroports) tandis que Perplexity récupère les événements à destination pendant les dates du séjour. Notre assistant, sur antomation.fr, s'appuie sur Mistral AI. Ce n'est pas la preuve qu'un modèle vaut mieux qu'un autre : ces exemples montrent seulement des modèles différents selon les tâches.

Le catalogue de notre formation couvre d'ailleurs Claude, ChatGPT, Gemini, Perplexity, Mistral et Grok. Pour le détail de ce qu'on installe, voyez nos pages Automatisation et Agent IA.

Le comparatif du moment : situation au 3 octobre 2026, à revoir

Ce comparatif rassemble, pour onze modèles, ce que chaque éditeur publie : nom, date, prix par million de jetons et options de traitement des données en Europe. Rien n'est classé : seul un test sur vos propres cas dira quel modèle convient. Les pages ont été consultées le 3 octobre 2026, prix en dollars américains, sans conversion.

Situation au 3 octobre 2026, à revoir. Prix en dollars par million de jetons.

Éditeur et modèleDate publiéePrix entrée / sortieTraitement des données en Europe, selon l'éditeurPage officielle
Anthropic, Claude Sonnet 5.528 septembre 20262 $ / 10 $API directe : options « global » et « us » seulement, pas d'option Europe. Via Amazon Bedrock : région européenne non précisée sur la page consultéeFiche
Anthropic, Claude Opus 5.522 septembre 20264 $ / 20 $API directe : options « global » et « us » seulement, pas d'option Europe. Via Amazon Bedrock : région européenne non précisée sur la page consultéeFiche
Anthropic, Claude Fable 5.11er septembre 202610 $ / 50 $API directe : pas d'option Europe. Via Bedrock : le point d'accès régional n'existe pour l'instant qu'en us-east-1Fiche
OpenAI, GPT-6 Astra3 septembre 202610 $ / 50 $Résidence EEE et Suisse sur approbation, majoration de 10 %Prix
OpenAI, GPT-6.1 Sol29 septembre 20262 $ / 10 $Résidence EEE et Suisse sur approbation, majoration de 10 %Prix
OpenAI, GPT-6 Luna22 septembre 20260,10 $ / 0,50 $Résidence EEE et Suisse sur approbation, majoration de 10 %Prix
Google, Gemini 3.8 Flash2 septembre 2026 (disponibilité générale)0,75 $ / 3,75 $ jusqu'au 31 décembre 2026, puis 1,50 $ / 7,50 $Offre payante de l'API Gemini : les invites et réponses journalisées peuvent être stockées de façon transitoire ou mises en cache dans tout pays où Google ou ses agents ont des installationsPrix
Mistral AI, Mistral Large 32 décembre 20250,50 $ / 1,50 $Hébergement dans l'Union européenne par défautFiche
Mistral AI, Mistral Small 416 mars 20260,15 $ / 0,60 $Hébergement dans l'Union européenne par défautFiche
Mistral AI, Mistral Medium 3.5non reprise ici1,50 $ / 7,50 $Hébergement dans l'Union européenne par défautFiche
DeepSeek, DeepSeek-V4.1-Flash10 septembre 20260,15 $ / 0,60 $ en heures creuses, 0,30 $ / 1,20 $ en heures pleinesSa politique de confidentialité du 10 février 2026 indique un stockage des données personnelles en ChinePrix

Ce que le tableau ne dit pas, éditeur par éditeur :

  • Chez OpenAI, les prix valent pour le traitement standard et des consignes de moins de 272 000 jetons ; au-delà, l'entrée est facturée le double et la sortie une fois et demie (fiche de GPT-6.1 Sol, même règle pour Astra et Luna). Les dates viennent du journal des changements. La résidence hors États-Unis suppose d'être approuvé pour des contrôles de surveillance des abus et de signer un avenant sur la conservation des données (Data controls).
  • Chez Anthropic, choisir l'option « us » (traitement aux États-Unis uniquement) coûte 1,1 fois le tarif standard, et les points d'accès régionaux de Bedrock ont une majoration de 10 % (Data residency, Bedrock).
  • Chez Google, la ligne porte sur l'API Gemini destinée aux développeurs ; les offres de Google Cloud ne sont pas couvertes par cet encadré.
  • Chez Mistral AI, les données sont hébergées dans l'Union européenne par défaut ; on peut choisir explicitement le point d'accès américain, et elles sont alors hébergées aux États-Unis. Selon la fonction utilisée, des transferts temporaires hors de l'Union européenne restent possibles (page d'aide).
  • Chez DeepSeek, le tarif des heures pleines s'applique en semaine, de 1 h à 4 h puis de 6 h à 10 h en temps universel (UTC) ; les week-ends, les jours fériés chinois et les autres heures sont facturés au tarif des heures creuses. La politique de confidentialité citée concerne les services de DeepSeek en général : on n'a pas trouvé de page propre à l'API sur le lieu de traitement, donc lisez l'article sur l'IA européenne et les données d'entreprise avant de l'envisager avec des données de clients.

Sur l'entraînement des modèles, les engagements diffèrent d'un éditeur à l'autre. OpenAI indique que les données envoyées à son API ne servent pas à entraîner ses modèles, sauf si vous choisissez de les partager (Data controls). Anthropic s'engage à ne pas utiliser pour l'entraînement les données d'API qu'il conserve, sans votre autorisation expresse (API and data retention). Google ne s'y engage que pour l'offre payante : avec l'offre gratuite, les contenus envoyés servent à améliorer ses produits (conditions de l'API Gemini). Pour Mistral AI et DeepSeek, cet encadré ne résume pas leurs conditions : lisez-les.

Un modèle annoncé n'est pas un modèle utilisable. Google a présenté Gemini 4 Argon le 30 septembre 2026, mais au 3 octobre il n'est déployé qu'auprès de défenseurs en cybersécurité de confiance, l'accès des développeurs payants venant ensuite (annonce de Google). Il est donc absent du tableau.

Cet encadré est à revoir avant le 1er janvier 2027, jour où le prix de Gemini 3.8 Flash double. Passé cette date sans mise à jour, ne vous fiez plus à ses lignes.

Quand changer de modèle

Changez de modèle dans quatre cas : un retrait annoncé, un prix qui change, une contrainte sur les données, ou un test sur vos cas qui montre un vrai gain. Sinon, rester sur ce qui marche est raisonnable : relancez votre protocole à ces quatre moments.

Un retrait se lit chez l'éditeur, un prix dans le tableau : Gemini 3.8 Flash passe de 0,75 $ à 1,50 $ en entrée au 1er janvier 2027, et le calcul par exécution est alors à refaire. Une contrainte sur les données (client, contrat ou loi) élimine certaines lignes d'un coup. Un nouveau modèle entre dans votre test comme les autres, avec les mêmes cas et la même grille.

Gardez aussi vos cas de test d'une fois sur l'autre : le jour où un retrait tombe, le protocole est prêt.

Un appel de 30 minutes pour préparer votre test

Si vous hésitez entre deux modèles pour une automatisation, on peut en parler pendant un appel de découverte de 30 minutes, gratuit et sans engagement. Venez avec une tâche réelle et quelques exemples : on regarde ensemble quels critères pèsent pour vous (coût, rapidité, lieu des données) et comment organiser le test sur vos propres cas.

Réserver l'appel de 30 minutes

Sources

À lire aussi

Article préparé avec l'aide d'outils d'IA à partir de sources vérifiées, sous la responsabilité éditoriale d'Antal Rocton.