Claude code gratuit avec son LLM local ?

Claude Code est devenu l’un des meilleurs assistants IA pour les développeurs. Contrairement à un simple chatbot, il parcourt un projet, modifie plusieurs fichiers, lance des commandes dans le terminal et corrige du code automatiquement. Son principal défaut reste le coût car il reste lié aux modèles d’Anthropic parmi les plus chèrs du marché (si ce n’est le plus cher ?).

Mais une solution existe… remplacer le modèle par un autre LLM par exemple hébergé localement. On garde toute la puissance de Claude Code sur du local avec Ollama ou un modèle gratuit via OpenRouter.

Comment fonctionne cette astuce ?

Claude Code ne réalise pas lui-même les inférences. Il agit comme un orchestrateur : il parcourt ton projet, exécute des commandes, modifie tes fichiers et dialogue avec le modèle.

Le cerveau, c’est le modèle de langage. On peut donc remplacer Claude par Qwen, Gemma, DeepSeek, Llama, Mistral, ou n’importe quel modèle compatible avec Ollama ou OpenRouter. Le résultat est identique côté utilisateur : Claude Code continue de fonctionner normalement, mais les réponses viennent d’un autre LLM.

Méthode n°1 : utiliser un modèle local avec Ollama

Avec cette méthode, tout tourne en local, hors ligne. Les requêtes ne quittent jamais ta machine, aucune API n’est utilisée.

Installer Ollama

On installe Ollama, puis on vérifie que tout fonctionne :

Ollama list

La commande doit renvoyer une liste vide si aucun modèle n’est encore installé.

Télécharger un modèle

Le choix du modèle est à adapter au matériel que l’on possède, sur mon Mac :

ollama pull qwen3:14b

ou

ollama pull gemma3:12b

Ces modèles offrent un bon compromis entre qualité, vitesse et consommation mémoire.

Quel modèle choisir ?

Config Modèle conseillé
PC ou Mac 16 Go Qwen3 8B
24 Go RAM Gemma 3 12B
MacBook Pro M3 Pro 36 Go Qwen3 14B Instruct
PC avec Radeon RX 6800 / 7800 XT (16 Go VRAM) Qwen3 14B
Mac M3 Max ou M4 Max (64 Go+) Qwen3 30B Q4_K_M

Qwen3 14B est aujourd’hui le meilleur point d’équilibre pour Claude Code : suffisamment rapide, avec une qualité de génération de code convaincante. Enfin à condition de ne pas être trop pressé non plus et de ne rien faire en parallèle sur sa machine.

Lancer Claude Code avec Ollama

Une fois le modèle téléchargé :

claude --model qwen3:14b

Claude Code démarre normalement, mais toutes les requêtes partent vers Ollama.

Les limites des modèles locaux

Les modèles locaux dépendent fortement du matériel. Générer une simple landing page HTML peut prendre jusqu’à 20 minutes sur un MacBook Pro M3. Les modèles plus petits comme Qwen3 14B sont bien plus rapides, mais restent loin (très loin à mon sens) des performances des modèles hébergés dans le cloud.

Méthode n°2 : utiliser OpenRouter gratuitement

La seconde solution : remplacer Anthropic par OpenRouter. Cette plateforme donne accès à des centaines de modèles, dont plusieurs gratuits. L’avantage est immédiat : aucune puissance de calcul nécessaire, les modèles tournent sur les serveurs d’OpenRouter, et Claude Code continue de fonctionner exactement comme avant. Cela permet de faire autre chose en même temps sur sa machine mais on perd au passage l’aspect local…

Créer une clé API

Avec un compte OpenRouter il suffit de génèrer une clé API. Claude Code s’en servira.

Configurer le projet

À la racine du projet, il faut créer :

.cloud/settings.local.json

Ce fichier remplace les variables d’environnement utilisées par Claude Code : il faut remplacer l’URL de l’API Anthropic par celle d’OpenRouter, renseigner la clé API, et laisser la variable ANTHROPIC_API_KEY vide.

Choisir un modèle

OpenRouter donne accès à n’importe quel modèle compatible, par exemple Qwen, DeepSeek, Gemma, Mistral, ou Llama. Il suffit de pointer les variables DEFAULT_OPUS_MODEL, DEFAULT_SONNET_MODEL, DEFAULT_HAIKU_MODEL et DEFAULT_SUB_AGENT_MODEL vers le modèle souhaité.

Vérifier la configuration

Dans Claude Code :

/status

On obtient :

Base URL:
https://openrouter.ai/api/v1

Si c’est le cas, Claude Code utilise désormais OpenRouter.

Ollama ou OpenRouter ?

Ollama pour travailler hors ligne, si la confidentialité compte, ou si la machine est suffisamment puissante…  Sinon OpenRouter pour avoir les meilleures performances gratuitement. Hors machine haut de gamme, il sera impossible ou presque manière interactive avec Claude Code avec du local.

Mon avis

Pour la majorité des usages, OpenRouter est aujourd’hui la meilleure solution. La configuration est simple, les performances sont excellentes, et plusieurs modèles très haut niveau restent gratuits. Ollama reste néanmoins une bonne option pour apprendre, ou pour travailler entièrement en local, sans dépendre d’un service tiers, ou encore pour des projets contenant des données sensibles.

By tech