{
  "id": "OIA-OLLAMA-BENCH-20260819-QWEN38-27B-RTX4080S-WSL",
  "date": "2026-08-19",
  "time_local": "2026-08-19T02:26:28+02:00",
  "level": "mesuré",
  "tool": "Ollama /api/generate (même formule que Local Cockpit: eval_count/eval_duration)",
  "not": "pas une capture UI Local Cockpit Windows",
  "runtime": "Ollama 0.32.14 WSL2",
  "gpu": "NVIDIA GeForce RTX 4080 SUPER 16 Go",
  "model": "qwen3.8:27b",
  "model_id": "22130167c4c2",
  "parameters": "27.3B",
  "quantization": "Q4_K_M",
  "disk_size": "17 GB",
  "loaded_size": "18 GB",
  "processor": "28% CPU / 72% GPU",
  "context": 2048,
  "generation_tps": 9.4,
  "eval_count": 147,
  "eval_duration_ms": 15638.0,
  "prompt_eval_count": 54,
  "prompt_eval_duration_ms": 641.3,
  "vram_used_mib": 15805,
  "vram_total_mib": 16376,
  "warmup_tps": 8.7,
  "show": "  Model\n    architecture        qwen35     \n    parameters          27.3B      \n    context length      262144     \n    embedding length    5120       \n    quantization        Q4_K_M     \n    requires            0.32.12    \n\n  Capabilities\n    completion    \n    vision        \n    tools         \n    thinking      \n\n  Projector\n    architecture        clip       \n    parameters          460.73M    \n    embedding length    1152       \n    dimensions          5120       \n\n  Parameters\n    presence_penalty     0       \n    repeat_penalty       1       \n    temperature          1       \n    top_k                20      \n    top_p                0.95    \n    draft_num_predict    4       \n    min_p                0       \n\n  License\n    Apache License               \n    Version 2.0, January 2004    \n    ...                          \n\n",
  "ps": "NAME           ID              SIZE     PROCESSOR          CONTEXT    UNTIL              \nqwen3.8:27b    22130167c4c2    18 GB    28%/72% CPU/GPU    2048       9 minutes from now    \n",
  "gpu_after": "name, memory.total [MiB], memory.used [MiB], memory.free [MiB]\nNVIDIA GeForce RTX 4080 SUPER, 16376 MiB, 15805 MiB, 241 MiB\n",
  "response": "La VRAM stocke les poids du modèle et les calculs d'inférence, donc plus vous en avez, plus vous pouvez charger un grand LLM localement rapidement."
}