Gemini 4 Argon : enfin un vrai rival de Google pour Claude Opus 5.5 et GPT-6 Astra ?

Avec Gemini 4 Argon, Google revient dans le trio de tête de l’IA. Artificial Analysis lui attribue 53 points sur son indice d’intelligence, exactement le score de GPT-6 Astra, pour un coût par tâche bien plus faible. Claude Opus 5.5 garde pourtant cinq points d’avance, et Argon reste inaccessible à la quasi-totalité des entreprises. Alors, vrai rival ou effet d’annonce ? Et pour vos usages marketing, quel modèle offre le meilleur rapport entre intelligence, coût et temps d’attente ?
Sundar Pichai - PDG Google
Sundar Pichai – PDG Google

L’essentiel en bref

  • Sur l’indice d’intelligence d’Artificial Analysis, Gemini 4 Argon obtient 53, à égalité avec GPT-6 Astra et derrière Claude Opus 5.5 (58) et Claude Sonnet 5.5 (56).
  • Argon prend la première place sur AutomationBench-AA (78 %) et affiche le taux d’hallucination le plus bas mesuré par AA-Omniscience : 15 %, contre 51 % pour GPT-6 Astra.
  • Au tarif promotionnel, une tâche de l’indice coûte 1,99 $ avec Argon, contre 3,26 $ avec Astra et 5,98 $ avec Opus 5.5. Au tarif standard, l’écart avec Astra s’inverse.
  • La vitesse et la latence d’Argon ne sont pas encore mesurées publiquement, et le modèle reste pour l’instant réservé au programme fermé Fairwind.

Gemini 4 Argon rivalise avec GPT-6 Astra, pas encore avec Opus 5.5 ?

Dans son évaluation publiée le 30 septembre, Artificial Analysis donne 53 points à Gemini 4 Argon sur son indice d’intelligence, en mode de raisonnement « high ». C’est le score de GPT-6 Astra en mode max, et un point de plus que GPT-6.1 Sol.

Claude Opus 5.5, lui, culmine à 58 en mode max. Plus gênant pour Google, Claude Sonnet 5.5 obtient 56, soit trois points de mieux qu’Argon, pour un tarif de 2 $ en entrée et 10 $ en sortie par million de tokens selon la grille d’Anthropic : ce qui correspond au prix de lancement d’Argon. Le rival d’Astra est donc bien réel mais pour ce qui est de concurrencer Opus 5.5, on n’y est pas encore sur tous les plans.

Ceci dit, il faut noter la progression : le saut est spectaculaire pour Google, puisque Gemini 3.1 Pro Preview plafonnait à 30 sur le même indice.

Si vous aviez écarté les modèles de Google de vos tests faute de niveau, il va peut-être être temps de les réintégrer dans la boucle.

Les résultats d’Argon sur les benchmarks qui comptent pour un professionnel du marketing

Un indice global est intéressant mais pour les pros du marketing, ce qui compte, ce sont les nuances sur des benchmarks très précis.

Pour une équipe marketing, quatre évaluations d’Artificial Analysis sont importants à suivre pour vos usages : l’automatisation de processus métier, la fiabilité factuelle, la qualité d’un livrable professionnel et le travail d’agent en ligne de commande.

Critère (Artificial Analysis) Claude Opus 5.5 (max) GPT-6 Astra (max) Gemini 4 Argon (high)
Indice d’intelligence 58 53 53
AutomationBench-AA (processus métier) 69,5 % 68,5 % 77,5 %
Terminal-Bench 4 (agent technique) 60 % 59 % 57 %
Taux d’hallucination AA-Omniscience Non publié dans les données consultées 51 % 15 %
Prix catalogue (entrée / sortie, par million de tokens) 4 $ / 20 $ 10 $ / 50 $ 2 $ / 10 $ en promotion, puis 4 $ / 20 $
Coût par tâche de l’indice 5,98 $ 3,26 $ 1,99 $ (3,98 $ au tarif standard)
Tokens de sortie pour passer l’indice 260 millions 60 millions 110 millions
Vitesse de sortie 91,2 tokens/s 63,3 tokens/s Non mesurée publiquement

Le résultat le plus parlant pour vous est sans doute AutomationBench-AA. Argon y décroche la première place avec 77,5 %, devant Claude Sonnet 5.5 (71,3 %), Opus 5.5 (69,5 %) et Astra (68,5 %), selon les chiffres rapportés par OfficeChai.

C’est le test le plus proche d’un agent qui enchaîne des étapes dans vos outils : mise à jour d’un CRM, routage de leads, préparation d’un reporting.

Le second atout d’Argon concerne la fiabilité : AA-Omniscience mesure la proportion de mauvaises réponses quand le modèle aurait dû reconnaître qu’il ne savait pas : 15 % pour Argon, 51 % pour GPT-6 Astra et 54 % pour GPT-6.1 Sol.

Artificial Analysis note toutefois que la précision brute d’Argon reste inférieure (50 % contre 63 % pour Astra). Argon sait moins de choses, mais l’admet plus volontiers, et pour une équipe qui produit des contenus chiffrés ou des fiches produits, c’est un point clé à ne pas sous-estimer (car on le sait tous, le temps de vérification est souvent bien plus long que le temps de production de nos jours).

Sur le plan technique, l’ordre s’inverse et Argon n’est plus dans le top 3 : sur Terminal-Bench 4, qui évalue des agents travaillant en ligne de commande, Sonnet 5.5 est en tête (64 %), devant Opus 5.5 (60 %), Astra (59 %) et Argon (57 %).

Pour vos intégrations, scripts de tracking ou automatisations maison, Anthropic garde l’avantage.

Côté livrables, Argon atteint 1 494 Elo sur AA-Briefcase avec le meilleur taux de réussite aux critères jamais relevé (65 %), mais une note de présentation plus faible (1 308 Elo) : le fond est donc qualitatif mais sur l’aspect design et mise en forme, il faudra laisser ses concurrents plus créatifs travailler.

Ratio coût et intelligence : la verbosité d’Argon ne l’avantage pas

Sur le papier, Argon écrase la concurrence avec son tarif de lancement : 26,6 points d’indice par dollar dépensé par tâche, contre 16,3 pour Astra et 9,7 pour Opus 5.5 (calcul de la rédaction à partir des coûts par tâche publiés par Artificial Analysis).

Autrement dit, sur le papier, pour une intelligence équivalente à celle d’Astra, vous payez environ 40 % de moins.

Si on résume : le prix au million de tokens est un indicateur trompeur dès qu’on compare des modèles de raisonnement. Ce qu’il faut regarder avant tout, c’est le coût réel d’une tâche terminée, et il dépend autant du nombre de tokens « pensés » que du tarif in et out.

Si vous chiffrez un projet d’agent, testez vos propres tâches et mesurez la facture finale plutôt que de multiplier une grille tarifaire qui ne donne qu’un aperçu partiel de ce que cela vous coûtera réellement.

PS : notre comparatif des LLM les plus rentables donne d’autres points de repère.

Un modèle que vous ne pouvez pas encore acheter

Selon l’article de Google DeepMind, Argon est pour l’instant réservé au programme Fairwind, destiné aux spécialistes de la cyberdéfense, aux opérateurs d’infrastructures critiques et aux mainteneurs de logiciels.

Ces testeurs reçoivent d’ailleurs le modèle sans les garde-fous cyber prévus pour le grand public.

Google annonce un déploiement « bientôt » aux clients API payants et aux abonnés Google AI Ultra, sans date ni précision pour l’Europe.

Opus 5.5, Sonnet 5.5 et GPT-6 Astra sont, eux, utilisables dès aujourd’hui… Si vous tenez un classement des meilleurs modèles d’IA pour votre direction, Argon va mériter une évaluation sur vos cas d’usages quand il sera disponible mais pour le moment, il faudra patienter…

Notre verdict :

Avec Argon, Google a enfin un vrai rival à GPT-6 Astra, et même un modèle de référence pour deux usages clés du marketing : l’automatisation de processus et la fiabilité factuelle. Mais non, Argon ne détrône pas encore Claude Opus 5.5 sur tous les cas d’usages. Comme toujours, le mieux reste une approche multi-modèles où l’on va utiliser le meilleur modèle pour chaque cas d’usage précis et chaque automatisation après les avoir préalablement comparés sur nos propres cas d’usages.

Un avis ? post

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *