$cat newsletter/issue-002.md
ISSUE #2//21 MAI 2026

Benchmark LLMs locaux 2026 :
Qui code le mieux sur ta machine ?

On a tous une config différente, des besoins différents — mais une question commune : quel modèle local choisir pour bosser vraiment efficacement ? Cette semaine, on a mis 6 modèles sur le banc de test avec des tâches dev concrètes. Pas de démo cherry-pickée : juste du code, du debug et de la doc.

// tl;dr — tableau comparatif
ModèleCodeDebugScore
🥇
Devstral-small-2:24B
Le spécialiste
★★★★★★★★★★4.8/5
🥈
Qwen3.6:27B
Le polyvalent premium
★★★★★★★★★★4.6/5
🥉
Ministral-3:14B
Le rapide et précis
★★★★★★★★★★4.4/5
4.
Gemma3:12B
Le conversationnel Google
★★★★★★★★★★4.0/5
5.
Qwen3.5:9B
Le compact efficace
★★★★★★★★★★3.4/5
6.
granite4.1:8b
L'entreprise par IBM
★★★★★★★★★★3.2/5
// analyses détaillées
🥇

Devstral-small-2:24B

Le spécialiste4.8/5
▸ ForcesEntraîné spécifiquement pour le code, Devstral génère des API REST propres du premier coup, identifie des race conditions subtiles en debug, et sort des fonctions TypeScript correctement typées sans qu'on lui demande. Sur la génération d'une API Express avec auth JWT, il a produit une structure de projet cohérente avec gestion d'erreurs.
▸ FaiblessesVerbeux sur les explications en langage naturel. En dehors du code, les réponses peuvent sembler mécaniques. RAM requise : ~16GB — pas pour les configs légères.
// VerdictLe meilleur outil dev si tu as la RAM. Ton copilote local numéro 1 pour les tâches purement techniques.
🥈

Qwen3.6:27B

Le polyvalent premium4.6/5
▸ ForcesExcellente rédaction de documentation (README, JSDoc, ADRs), qualité conversationnelle remarquable, et code solide. Sur des tâches de refactoring complexes, il reformule avec pertinence. Son multilingue natif en fait le choix idéal si tu alternes français/anglais dans tes prompts.
▸ FaiblessesLégèrement en retrait sur le debug de bugs obscurs comparé à Devstral. La taille (27B) implique ~18GB de RAM.
// VerdictLe choix premium si tu veux tout faire avec un seul modèle — code, doc, communication.
🥉

Ministral-3:14B

Le rapide et précis4.4/5
▸ ForcesLe rapport vitesse/qualité le plus impressionnant du banc. Ses explications de code sont claires, structurées, niveau "senior dev". En NLP, il brille particulièrement — réponses nuancées, bien calibrées. Idéal pour des interactions fréquentes où la latence compte.
▸ FaiblessesCode généré parfois trop concis — manque de gestion d'erreur sans prompt explicite. Sur des architectures complexes, il simplifie trop.
// VerdictLe sweet spot performance/VRAM pour les devs avec 8-12GB de RAM. Parfait pour un assistant de daily workflow.
4.

Gemma3:12B

Le conversationnel Google4.0/5
▸ ForcesExceptionnel pour les explications et le langage naturel — ses descriptions de fonctions complexes sont lisibles par n'importe quel dev de l'équipe, y compris les juniors. Bonne génération de code dans les langages courants (Python, JS, Go).
▸ FaiblessesDébug moins précis sur des edge cases bas niveau. Peut halluciner des APIs moins connues.
// VerdictExcellent choix pour la doc et le knowledge-sharing d'équipe. Moins adapté au debug hardcore.
5.

Qwen3.5:9B

Le compact efficace3.4/5
▸ ForcesSurprenant sur le debug — trouve des bugs logiques dans des snippets Python/JS de manière fiable. Consommation mémoire raisonnable (6GB). Bon rapport taille/résultat.
▸ FaiblessesGénération de code et doc en retrait par rapport aux grands frères. Tendance à produire du code fonctionnel mais peu idiomatique.
// VerdictLa bonne surprise budget. Idéal si tu as une config limitée et que tu veux quand même un debugger local décent.
6.

granite4.1:8b

L'entreprise par IBM3.2/5
▸ ForcesRemarquablement propre sur la rédaction de documentation technique formelle et les templates enterprise (specs, runbooks). Conçu pour les workflows RAG/agentic — très bon pour suivre des instructions structurées avec précision.
▸ FaiblessesCode créatif limité. Peu adapté à la génération de code ex nihilo. Responses NLP parfois trop formelles pour un usage quotidien.
// VerdictPas le premier choix pour coder, mais excellent dans un pipeline RAG ou pour de la doc d'entreprise standardisée.
// tester en 30 secondes
bash
# Installer Ollama (si pas déjà fait)
curl -fsSL https://ollama.ai/install.sh | sh

# Tirer les modèles
ollama pull devstral-small-2
ollama pull qwen3.6:27b
ollama pull ministral:14b
ollama pull gemma3:12b
ollama pull qwen3.5:9b
ollama pull granite4.1:8b

# Test rapide : génération de code
ollama run devstral-small-2 "Write a REST API in Python with FastAPI,
one endpoint GET /users that returns a list of users with pagination.
Include error handling and type hints."

# Comparer la vitesse (tokens/sec)
time ollama run ministral:14b "Explain recursion in 3 sentences"
time ollama run gemma3:12b "Explain recursion in 3 sentences"

// partner spotlight

Capital Intelligenceis an AI-powered financial newsletter for CFOs, finance teams, and AI leaders. Their Weekly AI Finance Brief covers macro finance stories, AI tool spotlights, and CFO insights — sharp and practical reading if you're building at the intersection of AI and finance.

→ capitalintelligence.me

// prochaine issue

RAG local avec LlamaIndex — architecture complète, zéro cloud. Chaque issue, on creuse un sujet concret — pas de hype, que du technique.

Enjoyed this?

Subscribe for $9/month

▸ Subscribe — $9/month

cancel anytime · secured by stripe · no cloud lock-in