Timely · outils · 19 août 2026

Outils IA à tester fin août 2026 : Qwen 3.8 en local, Gemini 3.7 Flash dans le cloud

Deux sorties de la quinzaine changent vraiment la pile. Un modèle local installable. Un workhorse cloud moins cher. Le reste est du bruit, ou indisponible en France.

Par Chris Drakkeng · 19 août 2026 · sources datées · pas de tokens/s inventés

À retenir
  • À installer chez vous : qwen3.8:27b (Q4_K_M, 17 Go). Mesuré le 19 août 2026 : 9,4 tok/s sur RTX 4080 SUPER 16 Go, 28 % CPU / 72 % GPU.
  • À tester dans le cloud : Gemini 3.7 Flash (13 août) — code, agents, PDF. Prix d'intro 0,75 / 3,75 $ le million de tokens jusqu'au 31 décembre 2026.
  • À ne pas vendre aux lecteurs FR : Gemini Spark. Google l'exclut de l'EEE.
  • À ignorer pour l'instant : GPT-5.6-Cyber (accès restreint) et Qwen 3.8-Max 2,4 T (pas un modèle de salon).

1. Qwen 3.8 27B — le seul nouvel outil local qui compte

Alibaba a annoncé Qwen 3.8-Max le 2 août (2,4 T de paramètres, 95 B actifs). Ce n'est pas ce que vous lancez sur un PC. La pièce utile, c'est le 27B open-weight, listé dans Ollama sous qwen3.8 : vision, tools, thinking. Architecture interne qwen35, 27,3 B, Q4_K_M. Il faut Ollama ≥ 0.32.12 (0.18.2 refuse le pull).

ollama pull qwen3.8:27b
ollama run qwen3.8:27b
Mesure OutilsIA · 19 août 2026 · réf. OIA-OLLAMA-BENCH-20260819-QWEN38-27B-RTX4080S-WSL
ChampValeur
Modèleqwen3.8:27b · 27,3 B · Q4_K_M · 17 Go disque / 18 Go chargé
MachineRTX 4080 SUPER 16 Go · WSL2 · Ollama 0.32.14
Contexte2048 (prompt type Local Cockpit)
Placement28 % CPU / 72 % GPU · VRAM 15 805 / 16 376 MiB
Génération9,4 tok/s · 147 tokens · 15 638 ms
Préremplissage54 tokens · 641 ms (2e passe, modèle déjà chargé)
1re charge41,7 s · warmup 8,7 tok/s

Méthode : POST /api/generate, eval_count / eval_duration — la même formule que Local Cockpit. Ce n'est pas une capture de l'app Windows. Le 16 Go fait tourner le 27B, mais pas à 100 % GPU : d'où ~9 tok/s, pas 118. Hermes 3 8B sur la même carte (27/07, Ollama Windows, 100 % GPU) : 118,5 tok/s.

Un 12 Go ne tiendra pas ce poids. Un 24 Go devrait supprimer l'offload CPU — pas encore mesuré ici. La revue Qwen 3.6 d'avril reste une photo historique.

Mesurez avant d'acheter de la VRAM : Local Cockpit. Paliers : 8 / 12 / 16 / 24 Go.

2. Gemini 3.7 Flash — le workhorse cloud du 13 août

Google a sorti Gemini 3.7 Flash trois semaines après le 3.6 Flash. Cible officielle : code, agents, PDF, workflows. Chiffres Google (FrontierCode 1.1 : 43,6 % vs 34,4 % ; DeepSWE v1.1 : 65,3 % vs 49,0 %). Ce sont leurs evals, pas un banc OutilsIA.

Prix d'introduction jusqu'au 31 décembre 2026 : 0,75 $ / 1 M tokens en entrée, 3,75 $ en sortie. Au 1er janvier 2027 : 1,50 / 7,50 $. Dispo : Gemini API, Google AI Studio, Android Studio, Gemini Enterprise. Le chatbot Gemini grand public tourne encore sur 3.6 Flash.

Gemini Spark (agent 24/7, forfaits Pro / Ultra) utilise désormais 3.7 Flash — sauf dans l'Espace économique européen, le Nigeria, la Suisse et le Royaume-Uni. En France, ne cherchez pas Spark. Testez 3.7 Flash via AI Studio ou l'API.

Google pointe aussi Antigravity pour des workflows « agent-first ». On ne le note pas comme outil vérifié ici : pas de dogfood OutilsIA à cette date.

3. Ce qu'on n'ajoute pas à la pile

AnnonceDatePourquoi ce n'est pas un outil à installer
GPT-5.6-Cyber11 aoûtModèle Daybreak, accès organisations vérifiées. Pas un ChatGPT du salon.
Qwen 3.8-Max 2,4 T2 aoûtCloud / poids énormes. Pas un pull Ollama.
Filigrane Gemini optionnel14–18 aoûtRéglage média (SynthID reste). Pas un nouvel outil.
AI Act transparence2 aoûtRègle, pas un logiciel. Voir IA interdites France.

4. Pile frugale au 19 août

CoucheOutilRôle
Local volumeOllama + Qwen 3.8 27B9,4 tok/s mesurés sur 16 Go (offload) · viser 24 Go pour 100 % GPU
Local petit7–8B déjà mesurés12–16 Go : ne forcez pas le 27B
Cloud workhorseGemini 3.7 Flash (API / AI Studio)Agents, PDF, webdev — pas Spark en FR
Cloud longClaude Code / OpusSessions multi-repo — voir Qwen vs Claude Code
MesureLocal CockpitScan + tok/s réels, pas une fiche marketing
Photo du 19 août 2026. Qwen 3.8 27B s'installe et tourne sur une 4080 SUPER 16 Go — à 9,4 tok/s, parce que 28 % du modèle reste sur CPU. Ce n'est pas un 8B à 118 tok/s. Gemini 3.7 Flash reste le workhorse cloud. Spark n'est pas en France. Mesurez, n'écoutez pas le communiqué.

FAQ

Quel nouvel outil IA installer en local cette semaine ?

Qwen 3.8 27B (ollama pull qwen3.8:27b, 17 Go, Ollama ≥ 0.32.12). Sur 16 Go VRAM : 9,4 tok/s mesurés, 28 % CPU. Pas Qwen 3.6. Pas le Max 2,4 T.

Gemini Spark marche-t-il en France ?

Non. Google l'exclut de l'EEE. En France : API, AI Studio, Enterprise — pas l'agent Spark 24/7.

Faut-il racheter un GPU pour Qwen 3.8 ?

Un 16 Go le fait tourner, mais en hybride (9,4 tok/s ici). Un 24 Go devrait coller le modèle en VRAM — pas encore mesuré. Un 12 Go : restez sur 7–8B.

Sources

Avant le pull : scannez le PC Local Cockpit Hub IA locale
Le livre du labo — disponible sur Amazon « Les ennemis savaient déjà où vous étiez » : mesurer, ne pas écouter le récit. Kindle 7,98 €. Acheter le Kindle → Page du livre

Partenaire Amazon Associates · tag boiral21-21. Les prix outils cloud sont ceux de Google au 13 août 2026.