Claude Code est devenu l’un des meilleurs assistants IA pour les développeurs. Contrairement à un simple chatbot, il parcourt un projet, modifie plusieurs fichiers, lance des commandes dans le terminal et corrige du code automatiquement. Son principal défaut reste le coût car il reste lié aux modèles d’Anthropic parmi les plus chèrs du marché (si ce n’est le plus cher ?).
Mais une solution existe… remplacer le modèle par un autre LLM par exemple hébergé localement. On garde toute la puissance de Claude Code sur du local avec Ollama ou un modèle gratuit via OpenRouter.
Comment fonctionne cette astuce ?
Claude Code ne réalise pas lui-même les inférences. Il agit comme un orchestrateur : il parcourt ton projet, exécute des commandes, modifie tes fichiers et dialogue avec le modèle.
Le cerveau, c’est le modèle de langage. On peut donc remplacer Claude par Qwen, Gemma, DeepSeek, Llama, Mistral, ou n’importe quel modèle compatible avec Ollama ou OpenRouter. Le résultat est identique côté utilisateur : Claude Code continue de fonctionner normalement, mais les réponses viennent d’un autre LLM.
Méthode n°1 : utiliser un modèle local avec Ollama
Avec cette méthode, tout tourne en local, hors ligne. Les requêtes ne quittent jamais ta machine, aucune API n’est utilisée.
Installer Ollama
On installe Ollama, puis on vérifie que tout fonctionne :
Ollama list
La commande doit renvoyer une liste vide si aucun modèle n’est encore installé.
Télécharger un modèle
Le choix du modèle est à adapter au matériel que l’on possède, sur mon Mac :
ollama pull qwen3:14b
ou
ollama pull gemma3:12b
Ces modèles offrent un bon compromis entre qualité, vitesse et consommation mémoire.
Quel modèle choisir ?
| Config | Modèle conseillé |
|---|---|
| PC ou Mac 16 Go | Qwen3 8B |
| 24 Go RAM | Gemma 3 12B |
| MacBook Pro M3 Pro 36 Go | Qwen3 14B Instruct |
| PC avec Radeon RX 6800 / 7800 XT (16 Go VRAM) | Qwen3 14B |
| Mac M3 Max ou M4 Max (64 Go+) | Qwen3 30B Q4_K_M |
Qwen3 14B est aujourd’hui le meilleur point d’équilibre pour Claude Code : suffisamment rapide, avec une qualité de génération de code convaincante. Enfin à condition de ne pas être trop pressé non plus et de ne rien faire en parallèle sur sa machine.
Lancer Claude Code avec Ollama
Une fois le modèle téléchargé :
claude --model qwen3:14b
Claude Code démarre normalement, mais toutes les requêtes partent vers Ollama.
Les limites des modèles locaux
Les modèles locaux dépendent fortement du matériel. Générer une simple landing page HTML peut prendre jusqu’à 20 minutes sur un MacBook Pro M3. Les modèles plus petits comme Qwen3 14B sont bien plus rapides, mais restent loin (très loin à mon sens) des performances des modèles hébergés dans le cloud.
Méthode n°2 : utiliser OpenRouter gratuitement
La seconde solution : remplacer Anthropic par OpenRouter. Cette plateforme donne accès à des centaines de modèles, dont plusieurs gratuits. L’avantage est immédiat : aucune puissance de calcul nécessaire, les modèles tournent sur les serveurs d’OpenRouter, et Claude Code continue de fonctionner exactement comme avant. Cela permet de faire autre chose en même temps sur sa machine mais on perd au passage l’aspect local…
Créer une clé API
Avec un compte OpenRouter il suffit de génèrer une clé API. Claude Code s’en servira.
Configurer le projet
À la racine du projet, il faut créer :
.cloud/settings.local.json
Ce fichier remplace les variables d’environnement utilisées par Claude Code : il faut remplacer l’URL de l’API Anthropic par celle d’OpenRouter, renseigner la clé API, et laisser la variable ANTHROPIC_API_KEY vide.
Choisir un modèle
OpenRouter donne accès à n’importe quel modèle compatible, par exemple Qwen, DeepSeek, Gemma, Mistral, ou Llama. Il suffit de pointer les variables DEFAULT_OPUS_MODEL, DEFAULT_SONNET_MODEL, DEFAULT_HAIKU_MODEL et DEFAULT_SUB_AGENT_MODEL vers le modèle souhaité.
Vérifier la configuration
Dans Claude Code :
/status
On obtient :
Base URL:
https://openrouter.ai/api/v1
Si c’est le cas, Claude Code utilise désormais OpenRouter.
Ollama ou OpenRouter ?
Ollama pour travailler hors ligne, si la confidentialité compte, ou si la machine est suffisamment puissante… Sinon OpenRouter pour avoir les meilleures performances gratuitement. Hors machine haut de gamme, il sera impossible ou presque manière interactive avec Claude Code avec du local.
Mon avis
Pour la majorité des usages, OpenRouter est aujourd’hui la meilleure solution. La configuration est simple, les performances sont excellentes, et plusieurs modèles très haut niveau restent gratuits. Ollama reste néanmoins une bonne option pour apprendre, ou pour travailler entièrement en local, sans dépendre d’un service tiers, ou encore pour des projets contenant des données sensibles.