Timely · outils · 19 août 2026
Outils IA à tester fin août 2026 : Qwen 3.8 en local, Gemini 3.7 Flash dans le cloud
Deux sorties de la quinzaine changent vraiment la pile. Un modèle local installable. Un workhorse cloud moins cher. Le reste est du bruit, ou indisponible en France.
Par Chris Drakkeng · 19 août 2026 · sources datées · pas de tokens/s inventés
- À installer chez vous :
qwen3.8:27b(Q4_K_M, 17 Go). Mesuré le 19 août 2026 : 9,4 tok/s sur RTX 4080 SUPER 16 Go, 28 % CPU / 72 % GPU. - À tester dans le cloud : Gemini 3.7 Flash (13 août) — code, agents, PDF. Prix d'intro 0,75 / 3,75 $ le million de tokens jusqu'au 31 décembre 2026.
- À ne pas vendre aux lecteurs FR : Gemini Spark. Google l'exclut de l'EEE.
- À ignorer pour l'instant : GPT-5.6-Cyber (accès restreint) et Qwen 3.8-Max 2,4 T (pas un modèle de salon).
1. Qwen 3.8 27B — le seul nouvel outil local qui compte
Alibaba a annoncé Qwen 3.8-Max le 2 août (2,4 T de paramètres, 95 B actifs). Ce n'est pas ce que vous lancez sur un PC. La pièce utile, c'est le 27B open-weight, listé dans Ollama sous qwen3.8 : vision, tools, thinking. Architecture interne qwen35, 27,3 B, Q4_K_M. Il faut Ollama ≥ 0.32.12 (0.18.2 refuse le pull).
ollama pull qwen3.8:27b
ollama run qwen3.8:27b
| Champ | Valeur |
|---|---|
| Modèle | qwen3.8:27b · 27,3 B · Q4_K_M · 17 Go disque / 18 Go chargé |
| Machine | RTX 4080 SUPER 16 Go · WSL2 · Ollama 0.32.14 |
| Contexte | 2048 (prompt type Local Cockpit) |
| Placement | 28 % CPU / 72 % GPU · VRAM 15 805 / 16 376 MiB |
| Génération | 9,4 tok/s · 147 tokens · 15 638 ms |
| Préremplissage | 54 tokens · 641 ms (2e passe, modèle déjà chargé) |
| 1re charge | 41,7 s · warmup 8,7 tok/s |
Méthode : POST /api/generate, eval_count / eval_duration — la même formule que Local Cockpit. Ce n'est pas une capture de l'app Windows. Le 16 Go fait tourner le 27B, mais pas à 100 % GPU : d'où ~9 tok/s, pas 118. Hermes 3 8B sur la même carte (27/07, Ollama Windows, 100 % GPU) : 118,5 tok/s.
Un 12 Go ne tiendra pas ce poids. Un 24 Go devrait supprimer l'offload CPU — pas encore mesuré ici. La revue Qwen 3.6 d'avril reste une photo historique.
Mesurez avant d'acheter de la VRAM : Local Cockpit. Paliers : 8 / 12 / 16 / 24 Go.
2. Gemini 3.7 Flash — le workhorse cloud du 13 août
Google a sorti Gemini 3.7 Flash trois semaines après le 3.6 Flash. Cible officielle : code, agents, PDF, workflows. Chiffres Google (FrontierCode 1.1 : 43,6 % vs 34,4 % ; DeepSWE v1.1 : 65,3 % vs 49,0 %). Ce sont leurs evals, pas un banc OutilsIA.
Prix d'introduction jusqu'au 31 décembre 2026 : 0,75 $ / 1 M tokens en entrée, 3,75 $ en sortie. Au 1er janvier 2027 : 1,50 / 7,50 $. Dispo : Gemini API, Google AI Studio, Android Studio, Gemini Enterprise. Le chatbot Gemini grand public tourne encore sur 3.6 Flash.
Gemini Spark (agent 24/7, forfaits Pro / Ultra) utilise désormais 3.7 Flash — sauf dans l'Espace économique européen, le Nigeria, la Suisse et le Royaume-Uni. En France, ne cherchez pas Spark. Testez 3.7 Flash via AI Studio ou l'API.
Google pointe aussi Antigravity pour des workflows « agent-first ». On ne le note pas comme outil vérifié ici : pas de dogfood OutilsIA à cette date.
3. Ce qu'on n'ajoute pas à la pile
| Annonce | Date | Pourquoi ce n'est pas un outil à installer |
|---|---|---|
| GPT-5.6-Cyber | 11 août | Modèle Daybreak, accès organisations vérifiées. Pas un ChatGPT du salon. |
| Qwen 3.8-Max 2,4 T | 2 août | Cloud / poids énormes. Pas un pull Ollama. |
| Filigrane Gemini optionnel | 14–18 août | Réglage média (SynthID reste). Pas un nouvel outil. |
| AI Act transparence | 2 août | Règle, pas un logiciel. Voir IA interdites France. |
4. Pile frugale au 19 août
| Couche | Outil | Rôle |
|---|---|---|
| Local volume | Ollama + Qwen 3.8 27B | 9,4 tok/s mesurés sur 16 Go (offload) · viser 24 Go pour 100 % GPU |
| Local petit | 7–8B déjà mesurés | 12–16 Go : ne forcez pas le 27B |
| Cloud workhorse | Gemini 3.7 Flash (API / AI Studio) | Agents, PDF, webdev — pas Spark en FR |
| Cloud long | Claude Code / Opus | Sessions multi-repo — voir Qwen vs Claude Code |
| Mesure | Local Cockpit | Scan + tok/s réels, pas une fiche marketing |
FAQ
Quel nouvel outil IA installer en local cette semaine ?
Qwen 3.8 27B (ollama pull qwen3.8:27b, 17 Go, Ollama ≥ 0.32.12). Sur 16 Go VRAM : 9,4 tok/s mesurés, 28 % CPU. Pas Qwen 3.6. Pas le Max 2,4 T.
Gemini Spark marche-t-il en France ?
Non. Google l'exclut de l'EEE. En France : API, AI Studio, Enterprise — pas l'agent Spark 24/7.
Faut-il racheter un GPU pour Qwen 3.8 ?
Un 16 Go le fait tourner, mais en hybride (9,4 tok/s ici). Un 24 Go devrait coller le modèle en VRAM — pas encore mesuré. Un 12 Go : restez sur 7–8B.
Sources
- Google, 13 août 2026 : Gemini 3.7 Flash (prix, Spark, pays exclus).
- Ollama library : qwen3.8 / qwen3.8:27b.
- Banc OutilsIA 19/08/2026 : nos mesures · réf. OIA-OLLAMA-BENCH-20260819-QWEN38-27B-RTX4080S-WSL.
- Qwen Team, 2 août 2026 : Qwen 3.8-Max.
- Point local OutilsIA du 6 août : État IA locale mi-août.
Partenaire Amazon Associates · tag boiral21-21. Les prix outils cloud sont ceux de Google au 13 août 2026.