Grok 4.6 vs Claude Fable 5 et GPT-5.6 Sol : xAI enfin adapté à vos usages pros ?

xAI a publié Grok 4.6 le 12 août 2026, avec un indice d’intelligence au niveau de GPT-5.6 Sol et un prix d’API cinq fois inférieur en sortie. Alors, sur quelles tâches avez-vous intérêt de le tester ? Où vaut-il mieux rester sur Claude ou ChatGPT ? Voici ce qu’il faut retenir.
Grok 4.6, le nouveau modèle d'IA de xAI
Grok 4.6, le nouveau modèle d’IA de xAI

L’essentiel en bref

  • Grok 4.6 est sorti le 12 août 2026, disponible dans Cursor, Grok Build, l’API xAI et chez OpenRouter, Vercel et Cloudflare.
  • Le modèle atteint 61 sur l’indice Artificial Analysis Intelligence, à égalité avec GPT-5.6 Sol Max et un point derrière Claude Fable 5 Max.
  • Le tarif démarre à 2 $ par million de tokens en entrée et 6 $ en sortie, contre 5 $/30 $ pour GPT-5.6 Sol et 10 $/50 $ pour Claude Fable 5.

Ce qu’il faut retenir de Grok 4.6 :

xAI présente Grok 4.6 comme une évolution de Grok 4.5 avec deux spécialités assumées : les agents qui travaillent sur de longues séries d’étapes, et la production de projets interactifs ou visuels aboutis dès la première passe.

L’éditeur revendique aussi davantage d’auto-vérification du modèle sur les longues sessions.

Le modèle est accessible dans Cursor et Grok Build, dans l’API xAI, ainsi que chez OpenRouter, Vercel et Cloudflare. Pendant la première semaine, le quota d’usage inclus dans Grok Build et Cursor est doublé.

Côté budget, l’annonce de xAI fixe le tarif à 2 $ par million de tokens en entrée et 6 $ en sortie, avec une variante rapide facturée le double.

Si vous faites tourner des agents, ce détail de pricing devrait vous intéresser : chez OpenAI, la sortie coûte six fois l’entrée, ici elle en coûte trois. Sur des workflows avec un contexte important, des planifications, des vérifications, des rapports intermédiaires, c’est cette ligne qui gonfle votre facture, pas le contexte que vous envoyez.

Face à GPT-5.6 Sol et Claude Fable 5, l’écart se creuse sur la facture d’API

Avec un score de 61 sur l’indice Artificial Analysis Intelligence, Grok 4.6 se positionne exactement au niveau de GPT-5.6 Sol Max et un point sous Claude Fable 5 Max. Cinq points le sépare de Grok 4.5.

Critère Grok 4.6 High GPT-5.6 Sol Max Claude Fable 5 Max
Indice AA Intelligence 61 61 62
GDPVal-AA v2 (travail de bureau) 1753 1728 1741
AA-Briefcase (dossiers, synthèse) 1577 1502 1574
Terminal-Bench v3.0 (agent en terminal) 26 % 34,6 % 34,1 %
DeepSWE v1.1 (ingénierie logicielle) 65,9 % 73 % 70 %
Harvey LAB (juridique, Vals) 15,8 % 2,5 % 11,3 %
Prix API (entrée / sortie par million de tokens) 2 $ / 6 $ 5 $ / 30 $ 10 $ / 50 $

Les scores de Grok proviennent du tableau d’évaluations publié par xAI, qui indique reprendre pour ses concurrents les meilleurs résultats auto-déclarés ou publiquement disponibles. Les tarifs d’API sont ceux des grilles publiques d’OpenAI et d’Anthropic au 15 août 2026.

Le calcul est vite fait pour une équipe qui consomme du token avec de gros volumes. À performance composite équivalente, un million de tokens générés coûte 6 $ chez xAI contre 30 $ chez OpenAI et 50 $ chez Anthropic, soit un rapport de un à huit entre les deux extrêmes. Nous détaillons régulièrement quels LLM restent les plus rentables à l’usage et cette sortie va encore rebattre les cartes.

Reste que l’indice composite est une moyenne. Quand on analyse les benchmarks dans le détail, on observe trois modèles avec des profils franchement différents, un point que notre comparatif des modèles d’IA les plus performants retrouve à chaque génération.

Le benchmark que xAI met le moins en avant : le terminal

Si vos développeurs lancent des agents dans un terminal, c’est ici que cela se complique pour Grok 4.6 :

Même écart sur DeepSWE v1.1, où le modèle plafonne à 65,9 % quand GPT-5.6 Sol Max monte à 73 %. xAI parle pourtant d’intelligence de pointe sur les benchmarks de codage agentique : la formule tient sur la moyenne, beaucoup moins sur le détail.

Concrètement, Grok 4.6 tient bien la comparaison sur CursorBench v3.2 (69,9 %, contre 67,2 % pour Sol Max), c’est-à-dire sur du code écrit dans un éditeur avec un humain dans la boucle. Il décroche quand il faut agir seul dans un environnement système. La nuance vaut d’être testée avant de reconfigurer vos outils de vibe coding sur le modèle le moins cher du marché.

Notre verdict :

Grok 4.6 n’est pas le meilleur modèle du marché, il est le meilleur rapport qualité-prix sur le travail intellectuel écrit. Gardez GPT-5.6 Sol ou Claude Fable 5 pour les agents qui exécutent seuls dans un terminal, où l’écart de huit points sur Terminal-Bench ne se rattrape pas facilement. Pour la recherche, la synthèse, l’analyse de dossiers et les premières versions d’applications, l’économie de 80 % en sortie justifie un test sérieux dès que vous le pourrez, pendant que le quota doublé de Grok Build est encore actif.

Un avis ? post

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *