Qwen3.8 : quels cas d’usage concrets pour les pros du marketing ? (En local comme via API)

Alibaba a publié le 17 août les poids de Qwen3.8-27B sous licence Apache 2.0, puis ceux de son modèle phare Qwen3.8-2.4T-A95B. Un modèle multimodal qui lit images et vidéos, avec 262 000 tokens de contexte natif, et qui peut tourner sur un ordinateur à 1 300 euros. La question n’est plus de savoir quel modèle est le meilleur, mais quelles tâches vous avez encore intérêt à envoyer vers une API externe onéreuse comme Anthropic ou OpenAI. Et à quel coût réel ?
Qwen (Alibaba Cloud)
Qwen (Alibaba Cloud)

L’essentiel en bref

  • Qwen3.8-27B est un modèle dense multimodal sous licence Apache 2.0, avec 262 000 tokens de contexte natif extensibles à 1 million, qui tourne sur une machine équipée de 24 Go de VRAM.
  • Le modèle phare Qwen3.8-2.4T-A95B, 2 400 milliards de paramètres dont 95 milliards actifs, est passé lui aussi en poids ouverts. Il se classe troisième sur CodeArena et sur l’Agentic Index d’Artificial Analysis.
  • Via API, Qwen3.8-Max est facturé 2 dollars le million de tokens en entrée et 6 dollars en sortie, avec des endpoints compatibles OpenAI et Anthropic.

Deux modèles Qwen3.8, deux usages à ne pas confondre

La série Qwen3.8 se joue sur deux tableaux, et confondre les deux est une erreur à ne pas faire :

  • Le premier est Qwen3.8-27B, un modèle dense de 27 milliards de paramètres, nativement multimodal, publié sous Hugging Face en Apache 2.0. Selon Alibaba Cloud, il atteint le niveau de Qwen3.7-Plus, un modèle MoE dix fois plus gros, et il est entré dans le top 5 des modèles les plus likés de Hugging Face en deux jours.
  • Le second est Qwen3.8-2.4T-A95B, la version Max : 2 400 milliards de paramètres au total, 95 milliards activés par token, 1 million de tokens de contexte. Ses poids sont publics depuis le 17 août, mais à cette taille le fichier reste un objet de datacenter multi-nœuds, pas quelque chose que vous installerez un jeudi soir sur votre Macbook même boosté avec plus de 40 Go de RAM.

Focalisons-nous donc sur le modèle « accessible » et ce que Qwen3.8-27B débloque une fois installé sur votre machine

Si vous gérez des données clients, des contrats, des exports CRM ou des documents RH, le sujet n’est pas la performance brute : c’est surtout la confidentialité de vos données.

Un modèle local vous sort de l’arbitrage permanent entre utilité et conformité au RGPD, parce qu’il n’y a plus de transfert à documenter.

Concrètement, voilà un aperçu de missions qui deviennent accessibles en interne :

  • Le tri à l’échelle : qualification de leads entrants, catégorisation de tickets support, classement de produits dans une arborescence e-commerce, détection de doublons dans une base. Ce sont des tâches où le coût par appel API finit par peser, et où un modèle local tourne à coût marginal nul une fois la machine payée.
  • La lecture et le classement de documents en masse : factures fournisseurs, rapports d’annonceurs, briefs clients, exports Search Console en capture. C’est le prolongement direct de ce que permettaient déjà des outils comme l’OCR de Mistral, sans la contrainte du fournisseur externe.
  • L’audit de créas : passer 200 visuels d’une campagne et vérifier la présence du logo, la cohérence du wording, le respect de la charte. Un travail que personne ne fait à la main faute de temps.
  • La première passe rédactionnelle : reformulation, méta-descriptions, variantes d’annonces, traduction de fiches produits. Pas la version finale, la matière brute que votre équipe corrige.
  • Le fine-tuning sur votre corpus : la licence Apache 2.0 autorise la modification et l’usage commercial, donc vous pouvez entraîner le modèle sur vos guidelines de marque et redistribuer le résultat.

Les tâches intéressantes où l’utilisation par API garde une longueur d’avance ?

Deux dollars le million de tokens en entrée, six en sortie, et 0,25 dollar pour l’entrée mise en cache : c’est le tarif de Qwen3.8-Max sur Qwen Model Studio depuis le 3 août (comparé à Fable 5 ou GPT5.6 Sol en effort xhigh, on parle de multiplicateurs de jusqu’à quasi x10, ce n’est clairement pas anodin !).

Le cache à huit fois moins cher est hyper intéressant si vous renvoyez constamment le même prompt système lourd, typiquement un document de 30 000 tokens décrivant votre marque, votre ton of voice, votre charte graphique, sur des centaines d’appels…

Le million de tokens de contexte, lui, ouvre des cas usages qu’aucune configuration locale ne pourra malheureusement facilement faire tourner sans faire planter votre ordinateur. Ceci étant dit, voici quelques cas d’usages hyper intéressant à envisger si vous êtes OK avec le fait de faire transiter vos données via des datacenters situés en Chine (dans la plupart des cas, c’est équivalent et comparable en niveau de « risque » à envoyer vos données aux USA) :

  • Vous pouvez y faire entrer l’intégralité d’un site de 300 pages, un an de tickets support, ou un export complet de Search Console, et poser des questions transverses dessus.
  • Le modèle ingère aussi de la vidéo et des flux longs, ce qui permet de construire des bases de connaissances à partir de webinars, de replays ou de démos produit… Un cas d’usage rarement mis en place alors qu’il est ultra intéressant !
  • Côté agentique, Qwen3.8-Max se classe troisième sur l’Agentic Index d’Artificial Analysis et troisième sur CodeArena, le classement front-end d’Arena AI. Pour vos équipes techniques, cela signifie qu’un agent de développement web construit dessus se compare aux références du marché, ce qui n’était pas le cas des générations précédentes et rebat les cartes du choix du meilleur outil de vibe coding.

Le détail qui compte pour l’intégration ? Les endpoints sont compatibles OpenAI, Anthropic et DashScope.

Basculer un pipeline existant se joue sur un changement d’URL de base et d’identifiant de modèle, pas sur une refonte. Vous pouvez donc lancer un test A/B de coût en une demi-journée.

Critère Qwen3.8-27B en local Qwen3.8-Max via API
Ticket d’entrée 1 300 à 1 800 euros pour un ordinateur doté de 24 Go de VRAM, plus une soirée de configuration du setup Une clé API, premier appel en quelques minutes
Coût à l’usage Électricité et amortissement uniquement 2 dollars / million en entrée, 6 en sortie, 0,25 en cache
Sortie des données Aucune, tout reste sur le poste Serveurs Alibaba Cloud, région au choix dont Francfort
Contexte réellement exploitable Bien inférieur aux 262 000 tokens annoncés, la mémoire restante après chargement des poids fait la loi 1 million de tokens
Qualité Version quantifiée, donc dégradée par rapport aux benchmarks publiés Pleine précision

Les limites que le communiqué d’Alibaba ne détaille pas

La promesse d’Alibaba qui dit que Qwen « Tourne sur du matériel grand public » mérite quand même d’être nuancé.

Sauf que la quantification n’est pas gratuite. Alibaba Cloud reconnaît une dégradation sur le raisonnement difficile, les tâches agentiques longues et les langues peu dotées, avec davantage de variabilité entre deux exécutions du même prompt. Autrement dit, la version que vous ferez tourner chez vous n’est pas celle qui produit les scores annoncés via les benchmarks.

La vitesse pose une autre contrainte non négligeable qu’il faut prendre en compte. Les retours communautaires sur la génération précédente situent le débit autour de 26 à 30 tokens par seconde en 4 bits sur une RTX 3090. C’est suffisant pour du traitement par lots la nuit, mais plus que franchement inconfortable pour un outil utilisé pendant une journée de travail classique…

Restent les benchmarks. Le tableau publié par Qwen place Qwen3.8-Max à 67,7 sur SWE-bench Pro contre 80,0 pour Claude Fable 5, et à 73,5 sur FrontierSWE contre 88,8. Le modèle domine sur le multimodal et l’agentique, moins sur le raisonnement pur, et la comparaison multimodale se fait contre Qwen3.7-Plus plutôt que contre le Max précédent (comme pour toutes les captures de becnhmarks partagées par les labos, on veut toujours embellir au max son modèle en le comparant à ce qui n’est pas toujours le mieux ou, du moins, le plus comparable…).

Dernier point important à prendre en compte avant d’opter pour l’option API : passer par l’API revient à envoyer vos données chez un acteur chinois, même avec une région de stockage des données en zone européenne envisageable. C’est un arbitrage politique autant que technique, et il se pose exactement comme il se posait pour les précédents modèles chinois. L’avantage avec le local, c’est que cette question disparaît, mais encore faut-il accepter ne pas aussi avoir de visibilité sur le réel usage qu’en feront les collaborateurs en interne s’ils ont en parallèle l’accès à tous les fichiers et données de l’entreprise…

Notre verdict :

Qwen3.8-27B n’est peut être pas encore le modèle qui remplacera votre outil IA favori pour le moment, et le prétendre serait malhonnête vu la dégradation réelle en 4 bits. Mais cela n’enlève pour autant rien à sa valeur réelle : il rend rentable l’automatisation des tâches ingrates à fort volume, celles que vous ne confiez à personne parce que le coût par appel API ne le justifiait pas. Si vous voulez le tester sans risque et que votre ordinateur est suffisamment puissant, vous pouvez l’installer en quelques clics via Ollama par exemple. Commencez par un cas d’usage sans risque, du tri ou de la classification, avant d’envisager quoi que ce soit de client-facing (et surtout, comme toujours, vérifiez toujours l’output avant d’envoyer le résultat à votre client, vos collègues et/ou responsables).

Un avis ? post

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *