
L’essentiel en bref
- Qwen3.8-27B est un modèle dense multimodal sous licence Apache 2.0, avec 262 000 tokens de contexte natif extensibles à 1 million, qui tourne sur une machine équipée de 24 Go de VRAM.
- Le modèle phare Qwen3.8-2.4T-A95B, 2 400 milliards de paramètres dont 95 milliards actifs, est passé lui aussi en poids ouverts. Il se classe troisième sur CodeArena et sur l’Agentic Index d’Artificial Analysis.
- Via API, Qwen3.8-Max est facturé 2 dollars le million de tokens en entrée et 6 dollars en sortie, avec des endpoints compatibles OpenAI et Anthropic.
Deux modèles Qwen3.8, deux usages à ne pas confondre
La série Qwen3.8 se joue sur deux tableaux, et confondre les deux est une erreur à ne pas faire :
- Le premier est Qwen3.8-27B, un modèle dense de 27 milliards de paramètres, nativement multimodal, publié sous Hugging Face en Apache 2.0. Selon Alibaba Cloud, il atteint le niveau de Qwen3.7-Plus, un modèle MoE dix fois plus gros, et il est entré dans le top 5 des modèles les plus likés de Hugging Face en deux jours.
- Le second est Qwen3.8-2.4T-A95B, la version Max : 2 400 milliards de paramètres au total, 95 milliards activés par token, 1 million de tokens de contexte. Ses poids sont publics depuis le 17 août, mais à cette taille le fichier reste un objet de datacenter multi-nœuds, pas quelque chose que vous installerez un jeudi soir sur votre Macbook même boosté avec plus de 40 Go de RAM.
En clair, l’open-weights sur ce type de modèle ultra lourd et puissant (Qwen3.8-2.4T-A95B), c’est un peu comme si on vous donnait les clés d’une supercar hors de prix mais qu’on ne vous permettait pas de l’ouvrir et de l’utiliser sans que vous n’ayez au préalable payé (ou loué très cher) vous-même la voiture compatible avec cette clé (le datacenter dans ce cas précis). Vous comprenez peut-être un peu mieux la subtilité désormais ?
Focalisons-nous donc sur le modèle « accessible » et ce que Qwen3.8-27B débloque une fois installé sur votre machine
Si vous gérez des données clients, des contrats, des exports CRM ou des documents RH, le sujet n’est pas la performance brute : c’est surtout la confidentialité de vos données.
Un modèle local vous sort de l’arbitrage permanent entre utilité et conformité au RGPD, parce qu’il n’y a plus de transfert à documenter.
Le fait que le 27B soit un modèle vision-langage change la nature des tâches automatisables. Il ne se contente pas de traiter du texte : il lit des captures d’écran, des visuels publicitaires, des PDF scannés et des vidéos.
Concrètement, voilà un aperçu de missions qui deviennent accessibles en interne :
- Le tri à l’échelle : qualification de leads entrants, catégorisation de tickets support, classement de produits dans une arborescence e-commerce, détection de doublons dans une base. Ce sont des tâches où le coût par appel API finit par peser, et où un modèle local tourne à coût marginal nul une fois la machine payée.
- La lecture et le classement de documents en masse : factures fournisseurs, rapports d’annonceurs, briefs clients, exports Search Console en capture. C’est le prolongement direct de ce que permettaient déjà des outils comme l’OCR de Mistral, sans la contrainte du fournisseur externe.
- L’audit de créas : passer 200 visuels d’une campagne et vérifier la présence du logo, la cohérence du wording, le respect de la charte. Un travail que personne ne fait à la main faute de temps.
- La première passe rédactionnelle : reformulation, méta-descriptions, variantes d’annonces, traduction de fiches produits. Pas la version finale, la matière brute que votre équipe corrige.
- Le fine-tuning sur votre corpus : la licence Apache 2.0 autorise la modification et l’usage commercial, donc vous pouvez entraîner le modèle sur vos guidelines de marque et redistribuer le résultat.
Traduction pour une entreprise de dix personnes ? Un ordinateur à 1 300 euros peut être amorti en moins d’un an en permettant de remplacer un abonnement Max d’OpenAI et/ou Anthropic par utilisateur, à condition que les tâches visées soient répétitives et compatibles avec une relecture humaine.
Les tâches intéressantes où l’utilisation par API garde une longueur d’avance ?
Deux dollars le million de tokens en entrée, six en sortie, et 0,25 dollar pour l’entrée mise en cache : c’est le tarif de Qwen3.8-Max sur Qwen Model Studio depuis le 3 août (comparé à Fable 5 ou GPT5.6 Sol en effort xhigh, on parle de multiplicateurs de jusqu’à quasi x10, ce n’est clairement pas anodin !).
Le cache à huit fois moins cher est hyper intéressant si vous renvoyez constamment le même prompt système lourd, typiquement un document de 30 000 tokens décrivant votre marque, votre ton of voice, votre charte graphique, sur des centaines d’appels…
Le million de tokens de contexte, lui, ouvre des cas usages qu’aucune configuration locale ne pourra malheureusement facilement faire tourner sans faire planter votre ordinateur. Ceci étant dit, voici quelques cas d’usages hyper intéressant à envisger si vous êtes OK avec le fait de faire transiter vos données via des datacenters situés en Chine (dans la plupart des cas, c’est équivalent et comparable en niveau de « risque » à envoyer vos données aux USA) :
- Vous pouvez y faire entrer l’intégralité d’un site de 300 pages, un an de tickets support, ou un export complet de Search Console, et poser des questions transverses dessus.
- Le modèle ingère aussi de la vidéo et des flux longs, ce qui permet de construire des bases de connaissances à partir de webinars, de replays ou de démos produit… Un cas d’usage rarement mis en place alors qu’il est ultra intéressant !
- Côté agentique, Qwen3.8-Max se classe troisième sur l’Agentic Index d’Artificial Analysis et troisième sur CodeArena, le classement front-end d’Arena AI. Pour vos équipes techniques, cela signifie qu’un agent de développement web construit dessus se compare aux références du marché, ce qui n’était pas le cas des générations précédentes et rebat les cartes du choix du meilleur outil de vibe coding.
Le détail qui compte pour l’intégration ? Les endpoints sont compatibles OpenAI, Anthropic et DashScope.
Basculer un pipeline existant se joue sur un changement d’URL de base et d’identifiant de modèle, pas sur une refonte. Vous pouvez donc lancer un test A/B de coût en une demi-journée.
Les limites que le communiqué d’Alibaba ne détaille pas
La promesse d’Alibaba qui dit que Qwen « Tourne sur du matériel grand public » mérite quand même d’être nuancé.
Les 16 Go de VRAM, la configuration la plus répandue chez les indépendants, ne suffisent pas : le quant 4 bits le plus utilisé pèse 16,8 Go de poids seuls, avant même le cache d’attention.
Sauf que la quantification n’est pas gratuite. Alibaba Cloud reconnaît une dégradation sur le raisonnement difficile, les tâches agentiques longues et les langues peu dotées, avec davantage de variabilité entre deux exécutions du même prompt. Autrement dit, la version que vous ferez tourner chez vous n’est pas celle qui produit les scores annoncés via les benchmarks.
La vitesse pose une autre contrainte non négligeable qu’il faut prendre en compte. Les retours communautaires sur la génération précédente situent le débit autour de 26 à 30 tokens par seconde en 4 bits sur une RTX 3090. C’est suffisant pour du traitement par lots la nuit, mais plus que franchement inconfortable pour un outil utilisé pendant une journée de travail classique…
Restent les benchmarks. Le tableau publié par Qwen place Qwen3.8-Max à 67,7 sur SWE-bench Pro contre 80,0 pour Claude Fable 5, et à 73,5 sur FrontierSWE contre 88,8. Le modèle domine sur le multimodal et l’agentique, moins sur le raisonnement pur, et la comparaison multimodale se fait contre Qwen3.7-Plus plutôt que contre le Max précédent (comme pour toutes les captures de becnhmarks partagées par les labos, on veut toujours embellir au max son modèle en le comparant à ce qui n’est pas toujours le mieux ou, du moins, le plus comparable…).
Dernier point important à prendre en compte avant d’opter pour l’option API : passer par l’API revient à envoyer vos données chez un acteur chinois, même avec une région de stockage des données en zone européenne envisageable. C’est un arbitrage politique autant que technique, et il se pose exactement comme il se posait pour les précédents modèles chinois. L’avantage avec le local, c’est que cette question disparaît, mais encore faut-il accepter ne pas aussi avoir de visibilité sur le réel usage qu’en feront les collaborateurs en interne s’ils ont en parallèle l’accès à tous les fichiers et données de l’entreprise…
Notre verdict :
Qwen3.8-27B n’est peut être pas encore le modèle qui remplacera votre outil IA favori pour le moment, et le prétendre serait malhonnête vu la dégradation réelle en 4 bits. Mais cela n’enlève pour autant rien à sa valeur réelle : il rend rentable l’automatisation des tâches ingrates à fort volume, celles que vous ne confiez à personne parce que le coût par appel API ne le justifiait pas. Si vous voulez le tester sans risque et que votre ordinateur est suffisamment puissant, vous pouvez l’installer en quelques clics via Ollama par exemple. Commencez par un cas d’usage sans risque, du tri ou de la classification, avant d’envisager quoi que ce soit de client-facing (et surtout, comme toujours, vérifiez toujours l’output avant d’envoyer le résultat à votre client, vos collègues et/ou responsables).

Fondateur de LEPTIDIGITAL et SUPASST, je suis également consultant spécialisé en acquisition de leads B2B (SaaS). Passionné par le marketing digital, l’intelligence artificielle et le SEO. Avant de devenir indépendant, j’ai occupé des postes clés en tant que SEO Manager et responsable e-commerce pour plusieurs grandes entreprises (Altice Media, Infopro Digital, Voyage Privé et le Groupe ERAM). Sur le plan perso, je suis un curieux insatiable, également passionné par la photographie, le badminton et les voyages. Pour toute demande de partenariat, privilégiez LinkedIn ou email ([email protected]).