
L’essentiel en bref
- Sur l’indice d’intelligence d’Artificial Analysis, Gemini 4 Argon obtient 53, à égalité avec GPT-6 Astra et derrière Claude Opus 5.5 (58) et Claude Sonnet 5.5 (56).
- Argon prend la première place sur AutomationBench-AA (78 %) et affiche le taux d’hallucination le plus bas mesuré par AA-Omniscience : 15 %, contre 51 % pour GPT-6 Astra.
- Au tarif promotionnel, une tâche de l’indice coûte 1,99 $ avec Argon, contre 3,26 $ avec Astra et 5,98 $ avec Opus 5.5. Au tarif standard, l’écart avec Astra s’inverse.
- La vitesse et la latence d’Argon ne sont pas encore mesurées publiquement, et le modèle reste pour l’instant réservé au programme fermé Fairwind.
Gemini 4 Argon rivalise avec GPT-6 Astra, pas encore avec Opus 5.5 ?
Dans son évaluation publiée le 30 septembre, Artificial Analysis donne 53 points à Gemini 4 Argon sur son indice d’intelligence, en mode de raisonnement « high ». C’est le score de GPT-6 Astra en mode max, et un point de plus que GPT-6.1 Sol.
Claude Opus 5.5, lui, culmine à 58 en mode max. Plus gênant pour Google, Claude Sonnet 5.5 obtient 56, soit trois points de mieux qu’Argon, pour un tarif de 2 $ en entrée et 10 $ en sortie par million de tokens selon la grille d’Anthropic : ce qui correspond au prix de lancement d’Argon. Le rival d’Astra est donc bien réel mais pour ce qui est de concurrencer Opus 5.5, on n’y est pas encore sur tous les plans.
Ceci dit, il faut noter la progression : le saut est spectaculaire pour Google, puisque Gemini 3.1 Pro Preview plafonnait à 30 sur le même indice.
Si vous aviez écarté les modèles de Google de vos tests faute de niveau, il va peut-être être temps de les réintégrer dans la boucle.
Les résultats d’Argon sur les benchmarks qui comptent pour un professionnel du marketing
Un indice global est intéressant mais pour les pros du marketing, ce qui compte, ce sont les nuances sur des benchmarks très précis.
Pour une équipe marketing, quatre évaluations d’Artificial Analysis sont importants à suivre pour vos usages : l’automatisation de processus métier, la fiabilité factuelle, la qualité d’un livrable professionnel et le travail d’agent en ligne de commande.
Le résultat le plus parlant pour vous est sans doute AutomationBench-AA. Argon y décroche la première place avec 77,5 %, devant Claude Sonnet 5.5 (71,3 %), Opus 5.5 (69,5 %) et Astra (68,5 %), selon les chiffres rapportés par OfficeChai.
C’est le test le plus proche d’un agent qui enchaîne des étapes dans vos outils : mise à jour d’un CRM, routage de leads, préparation d’un reporting.
Le second atout d’Argon concerne la fiabilité : AA-Omniscience mesure la proportion de mauvaises réponses quand le modèle aurait dû reconnaître qu’il ne savait pas : 15 % pour Argon, 51 % pour GPT-6 Astra et 54 % pour GPT-6.1 Sol.
Artificial Analysis note toutefois que la précision brute d’Argon reste inférieure (50 % contre 63 % pour Astra). Argon sait moins de choses, mais l’admet plus volontiers, et pour une équipe qui produit des contenus chiffrés ou des fiches produits, c’est un point clé à ne pas sous-estimer (car on le sait tous, le temps de vérification est souvent bien plus long que le temps de production de nos jours).
Sur le plan technique, l’ordre s’inverse et Argon n’est plus dans le top 3 : sur Terminal-Bench 4, qui évalue des agents travaillant en ligne de commande, Sonnet 5.5 est en tête (64 %), devant Opus 5.5 (60 %), Astra (59 %) et Argon (57 %).
Pour vos intégrations, scripts de tracking ou automatisations maison, Anthropic garde l’avantage.
Côté livrables, Argon atteint 1 494 Elo sur AA-Briefcase avec le meilleur taux de réussite aux critères jamais relevé (65 %), mais une note de présentation plus faible (1 308 Elo) : le fond est donc qualitatif mais sur l’aspect design et mise en forme, il faudra laisser ses concurrents plus créatifs travailler.
Ratio coût et intelligence : la verbosité d’Argon ne l’avantage pas
Sur le papier, Argon écrase la concurrence avec son tarif de lancement : 26,6 points d’indice par dollar dépensé par tâche, contre 16,3 pour Astra et 9,7 pour Opus 5.5 (calcul de la rédaction à partir des coûts par tâche publiés par Artificial Analysis).
Autrement dit, sur le papier, pour une intelligence équivalente à celle d’Astra, vous payez environ 40 % de moins.
Sauf que la promotion ne va pas durer éternellement et qu’il y a plusieurs accrocs : au tarif standard de 4 $ et 20 $, une tâche coûte 3,98 $ et le ratio tombe à 13,3 points par dollar, sous celui de GPT-6 Astra, pourtant affiché 2,5 fois plus cher au million de tokens. L’explication est simple, Argon réponds avec une quantité de tokens trop importante face à ses concurrents : Artificial Analysis relève qu’Argon produit en moyenne 62 000 tokens de sortie par tâche, contre 27 000 pour Astra.
Si on résume : le prix au million de tokens est un indicateur trompeur dès qu’on compare des modèles de raisonnement. Ce qu’il faut regarder avant tout, c’est le coût réel d’une tâche terminée, et il dépend autant du nombre de tokens « pensés » que du tarif in et out.
Si vous chiffrez un projet d’agent, testez vos propres tâches et mesurez la facture finale plutôt que de multiplier une grille tarifaire qui ne donne qu’un aperçu partiel de ce que cela vous coûtera réellement.
PS : notre comparatif des LLM les plus rentables donne d’autres points de repère.
Un modèle que vous ne pouvez pas encore acheter
Selon l’article de Google DeepMind, Argon est pour l’instant réservé au programme Fairwind, destiné aux spécialistes de la cyberdéfense, aux opérateurs d’infrastructures critiques et aux mainteneurs de logiciels.
Ces testeurs reçoivent d’ailleurs le modèle sans les garde-fous cyber prévus pour le grand public.
Google annonce un déploiement « bientôt » aux clients API payants et aux abonnés Google AI Ultra, sans date ni précision pour l’Europe.
Artificial Analysis précise de son côté avoir évalué un modèle « en cours de déploiement auprès d’utilisateurs sélectionnés », il y a donc un risque non négligeable que la version mise à disposition du grand public via l’API soit davantage bridé et donc pas totalement cohérent avec les becnhmarks évalués par Artificial Analysis.
Opus 5.5, Sonnet 5.5 et GPT-6 Astra sont, eux, utilisables dès aujourd’hui… Si vous tenez un classement des meilleurs modèles d’IA pour votre direction, Argon va mériter une évaluation sur vos cas d’usages quand il sera disponible mais pour le moment, il faudra patienter…
Notre verdict :
Avec Argon, Google a enfin un vrai rival à GPT-6 Astra, et même un modèle de référence pour deux usages clés du marketing : l’automatisation de processus et la fiabilité factuelle. Mais non, Argon ne détrône pas encore Claude Opus 5.5 sur tous les cas d’usages. Comme toujours, le mieux reste une approche multi-modèles où l’on va utiliser le meilleur modèle pour chaque cas d’usage précis et chaque automatisation après les avoir préalablement comparés sur nos propres cas d’usages.

Fondateur de LEPTIDIGITAL et SUPASST, je suis également consultant spécialisé en acquisition de leads B2B (SaaS). Passionné par le marketing digital, l’intelligence artificielle et le SEO. Avant de devenir indépendant, j’ai occupé des postes clés en tant que SEO Manager et responsable e-commerce pour plusieurs grandes entreprises (Altice Media, Infopro Digital, Voyage Privé et le Groupe ERAM). Sur le plan perso, je suis un curieux insatiable, également passionné par la photographie, le badminton et les voyages. Pour toute demande de partenariat, privilégiez LinkedIn ou email ([email protected]).