Claude Haiku 5.5 : voici les tâches pros que vous devriez lui confier (et celles à éviter)

Anthropic a lancé le 7 octobre Claude Haiku 5.5, son modèle le plus rapide et facturé seulement 0,10 $ le million de tokens en entrée (dix fois moins que la version précédente Haiku 4.5). Artificial Analysis, qui teste les modèles de façon indépendante, lui attribue 43 points sur son Intelligence Index, à 13 points de Sonnet 5.5. Quelles tâches pouvez-vous vraiment lui confier sans perdre en qualité ? Et quelles sont les tâches que vous ne devriez surtout pas lui confier ?
Claude Haiku 5.5, le petit modèle d'Anthropic
Claude Haiku 5.5, le petit modèle d’Anthropic

L’essentiel en bref

  • Claude Haiku 5.5 coûte 0,10 $ en entrée et 0,50 $ en sortie par million de tokens, tant que le prompt reste sous 100 000 tokens. Au-delà, le tarif est multiplié par cinq.
  • Artificial Analysis le mesure à 43 sur son Intelligence Index en effort maximal, contre 17 pour Haiku 4.5, 38 pour GPT-6 Luna et 56 pour Sonnet 5.5.
  • À lui confier : tri et classification, résumés récurrents, extraction et questions-réponses sur documents fournis, hygiène CRM, support de premier niveau, rôle de sous-agent.
  • À éviter : les réponses factuelles sans source (36 % de bonnes réponses sur AA-Omniscience), le code agentique complexe, les prompts de plus de 100 000 tokens et l’effort maximal en production.

Claude Haiku 5.5 en chiffres : ce que mesurent les benchmarks indépendants

43 points : c’est le score de Claude Haiku 5.5 en effort maximal sur l’Intelligence Index d’Artificial Analysis, un indice qui agrège dix évaluations (travail de bureau agentique, code en terminal, raisonnement, documents professionnels, contexte long). Le précédent Haiku, en version 4.5, plafonnait à 17.

À prix affiché identique, sur ce même indicateur aggrégé, le modèle passe devant GPT-6 Luna d’OpenAI (38), Gemini 3.8 Flash (41) et GLM-5.3 Flash (42). Il reste derrière Sonnet 5.5 (56) et rejoint Kimi K3 (44), un modèle ouvert de 2 800 milliards de paramètres.

Sur AA-Briefcase, l’évaluation privée de travail de bureau d’Artificial Analysis, Haiku 5.5 atteint 1 578 points Elo, dans l’intervalle de confiance de GPT-6 Astra et de Claude Fable 5.1 en effort élevé. Pour un modèle facturé à ce prix, c’est le chiffre le plus surprenant des tests réalisés par l’organisme indépendant !

Attention toutefois, ce score de 43 est obtenu au réglage d’effort le plus haut, une première pour un Haiku. Au réglage par défaut (medium), Artificial Analysis mesure 34 points pour 0,05 $ par tâche de son indice, contre 29 points pour 0,02 $ en low et 41 points pour 0,12 $ en xhigh.

Ce qu’il faut retenir de ces chiffres pour vos workflows pros ? Haiku 5.5 travaille bien sur l’information que vous lui fournissez, beaucoup moins sur celle qu’il est censé connaître de lui-même.

Les tâches pros à confier en priorité à Claude Haiku 5.5

Si vous payez aujourd’hui Sonnet ou un modèle équivalent pour trier, résumer ou extraire, une partie de cette facture va pouvoir être optimisée.

Prenons une agence qui résume 10 000 documents par mois, à raison de 5 000 tokens en entrée et 500 en sortie par document : sur la grille publique d’Anthropic, la facture atteint environ 7,50 $ avec Haiku 5.5, 75 $ avec Haiku 4.5 et 150 $ avec Sonnet 5.5.

Le point commun des bons cas d’usage à lui confier ? Des tâches courtes, cadrées, répétées à fort volume, où la source est fournie dans le prompt.

Voici des exemples concrets :

  • Classification et routage : tickets support, leads entrants, avis clients, intentions de recherche à regrouper pour le SEO. Testez d’abord en effort low ou medium.
  • Résumés récurrents : comptes rendus de réunion, reporting hebdomadaire, veille concurrentielle. Box dit vouloir l’utiliser pour ses synthèses financières et revues récurrentes, avec un score supérieur de 11 points à Haiku 4.5 pour une latence divisée par deux.
  • Questions-réponses sur documents : contrats, appels d’offres, fiches fournisseurs. AlphaSense rapporte 0,84 contre 0,76 pour Haiku 4.5 sur 400 requêtes réelles.
  • Hygiène CRM : HubSpot annonce 92,8 % sur sa suite de tâches CRM, le meilleur score qu’il ait observé sur un petit modèle.
  • Catalogue e-commerce : catégorisation de produits, extraction d’attributs à partir de fiches fournisseurs, normalisation de données.
  • Support client de premier niveau, avec escalade prévue vers un modèle plus lourd : Artificial Analysis mesure entre 178 et 188 tokens par seconde selon le réglage, une vitesse que vos clients ressentiront.

PS : si vous ne savez pas avec quels autres modèles le comparer, notre comparatif des LLM les plus rentables vous donnera des points de référence côté tarifs.

Sous-agent et agent navigateur, deux usages concrets à tester sur vos cas d’usages

1- Utiliser Haiku pour vos sous-agents

Anthropic ne dit lui-même, Haiku 5.5 est un très bon modèle pour faire tourner en tant que sous-agent de Sonnet 5.5 et d’Opus 5.5.

Le modèle plus puissant fait office de chef de projet, Haiku exécute les lots répétitifs : Cognition l’a par exemple intégré de cette manière comme assistant d’Opus 5.5 dans son agent de code Devin.

Si vous construisez des workflows multi-agents, c’est probablement là que l’économie sera la plus visible, car ce sont souvent les sous-agents qui consomment le plus de tokens.

2- Piloter votre ordinateur et votre navigateur avec des sous-agents peu chers (avec un taux de fiabilité digne des meilleurs modèles)

Autre piste très intéressante à envisager : les agents qui pilotent un navigateur.

Anthropic revendique un score de 72,4 % sur OSWorld 2.1 (sous-ensemble hors ligne), contre 15,7 % pour Haiku 4.5 et 83,9 % pour Sonnet 5.5 (des chiffres partagés par l’entreprise mais encore non vérifiés à ce stade par des indépendants comme Artificial Analysis).

Et concrètement, vous pourriez lui confier quelles missions allez-vous me dire ? Relevé de prix concurrents, contrôle qualité de pages produit, saisie dans un back-office sans API : ces automatisations deviennent abordables à grande échelle (à condition de vérifier et respecter les conditions d’utilisation des sites visés).

PS : pour vous lancer sans budget dédié, les abonnés Max et Team reçoivent désormais un crédit API mensuel de 100 à 500 $, et Anthropic propose des formations gratuites à Claude pour monter en compétence.

Les tâches à éviter de confier à Claude Haiku 5.5

(Et les analyses indépendantes ajoutent quatre autres zones où vous risquez de perdre en qualité ou en budget).

1- Les réponses factuelles sans source fournie

Avec 36 % de bonnes réponses sur AA-Omniscience, Haiku 5.5 n’est pas un modèle à interroger « à froid » sur un fait de marché, une réglementation ou une fiche technique. Pour ce type de demande, fournissez-lui le document de référence ou passez par un modèle plus lourd connecté à la recherche web.

2- Le code agentique complexe

Artificial Analysis mesure Haiku 5.5 à 33 % sur Terminal-Bench 4.0, contre 0 % pour Haiku 4.5 et 13 % pour GPT-6 Luna. Le progrès est net, mais il reste loin des 70,6 % revendiqués par Anthropic pour Sonnet 5.5 : pour une refonte de thème WordPress ou un script de migration, votre développeur gagnera du temps avec le grand modèle.

3- Les workflows SaaS automatisés, pour l’instant

Haiku 5.5 obtient 35 % sur AutomationBench-AA (workflows SaaS), loin des 53 à 60 % de ses concurrents directs. Artificial Analysis attribue cet écart à un bug de sécurité qui le pousse à refuser trop souvent ; Anthropic travaille à un correctif et une nouvelle mesure est prévue. D’ici là, gardez vos automatisations critiques sur le modèle actuel.

4- Les prompts de plus de 100 000 tokens

Le tarif d’appel ne vaut que sous 100 000 tokens de prompt. Au-delà, Haiku 5.5 passe à 0,50 $ en entrée et 2,50 $ en sortie, cinq fois plus : 1 000 analyses de documents de 120 000 tokens, avec 1 000 tokens de réponse chacune, coûtent environ 62,50 $, quand les mêmes documents découpés en deux moitiés de 60 000 tokens reviennent à 12,50 $.

Le découpage a ses limites, puisque le modèle perd alors la vue d’ensemble du document. Selon Anthropic, 90 % des requêtes envoyées à Haiku 4.5 restaient de toute façon sous le seuil, d’où une baisse de coût moyenne d’environ 75 % annoncée par l’éditeur, nouveau tokenizer compris (il consomme un peu plus de tokens par tâche). Artificial Analysis précise que ses coûts par tâche restent provisoires, car ils n’intègrent pas encore ce palier.

Concrètement, avant toute bascule, demandez à votre équipe technique la distribution de la taille de vos prompts dans les logs actuels. Si une part notable dépasse 100 000 tokens, l’économie devient nettement mois intéressante ; si presque tout reste dessous, avec une lecture en cache facturée 0,01 $ le million de tokens, la marge de manœuvre devient considérable.

5- L’effort maximal en production

Le fameux 43 a un prix caché. En effort maximal, Haiku 5.5 produit environ 162 000 tokens de sortie par tâche, trois fois plus que GPT-6 Luna, et passer de xhigh à max rapporte 2 points pour 1,8 fois plus de tokens. Sur un flux de plusieurs milliers d’appels par jour, ce réglage ne se justifie presque jamais : partez de medium et ne montez que si vos tests le réclament.

Haiku 5.5 ou Sonnet 5.5 : le tableau de décision par tâche

Pour une équipe marketing, vous allez le voir, il est souvent davantage recommandé et plus rentable de garder un modèle haut de gamme pour les livrables qui engagent la marque (en revanche, vous pourrez confier tout le travail préparatoire à Haiku).

Voici quelques pistes sur comment répartir vos tâches au mieux :

Tâche À confier à Haiku 5.5 ? Sonnet 5.5 ou Opus 5.5
Tri, classification, routage Oui, en effort low ou medium Surdimensionné
Résumé de documents sous 100 000 tokens Oui Pour les synthèses à fort enjeu
Extraction et Q&R sur documents fournis Oui Si raisonnement croisé entre sources
Support client de premier niveau Oui, avec escalade prévue Pour les cas complexes escaladés
Sous-agent d’un workflow multi-agents Oui, sur les lots répétitifs En orchestrateur
Réponses factuelles sans source fournie À éviter (36 % sur AA-Omniscience) Préférable, idéalement avec recherche web
Code agentique complexe À éviter (33 % sur Terminal-Bench 4.0) Oui
Workflows SaaS automatisés Pas avant le correctif (35 % sur AutomationBench-AA) Oui
Analyse de très longs documents (plus de 100 000 tokens) Tarif x5, à chiffrer au cas par cas À comparer, cache compris

PS : si vous venez d’un autre écosystème, ou envisagez désormais la bascule depuis les dernières annonces d’Anthropic, notre guide pour passer de ChatGPT à Claude détaille les points de friction à anticiper avant de répartir vos flux entre plusieurs modèles.

Notre verdict :

Haiku 5.5 offre l’un des meilleurs ratios score/prix de sa catégorie selon Artificial Analysis, à condition de l’utiliser comme exécutant et non comme source de vérité. Confiez-lui le tri, le résumé, l’extraction et le support de premier niveau en effort medium, avec la source dans le prompt et sous 100 000 tokens. Gardez Sonnet ou Opus pour le code complexe, les tâches marketing qui demandent un raisonnement important ou du goût (design / copywriting), les réponses factuelles à froid sans sources et vos automatisations simples (synthétiser, classer, catégoriser…).

Un avis ? post

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *