it's free*.ai

Annuaire · vérifié 2 Sep 2026

Exécuter des modèles IA sur votre machine

Aucune limite de débit à heurter, aucune clé à faire pivoter, rien ne quitte l’ordinateur — le seul plafond, c’est votre matériel. Voici les exécutions à connaître, d’un CLI d’une ligne au serveur que la production utilise réellement.

Choisissez par la forme plutôt que par le benchmark : Ollama si vous le voulez fonctionnel en une minute, LM Studio si vous préférez ne pas toucher à un terminal, MLX sur un Mac M-series, vLLM quand vous servez d’autres personnes.

Ollama

CLI + serveur

Une commande et le modèle tourne sur votre machine. Aucune limite, aucun quota.

localhost:11434/v1

LM Studio

Application de bureau

Ollama avec interface : découvrir, télécharger et discuter en local.

localhost:1234/v1

llama.cpp

Moteur

Le moteur sur lequel tourne presque tout le reste. C++ pur, sans dépendances.

localhost:8080/v1

Jan

Application de bureau

Alternative open source à ChatGPT qui fonctionne à 100 % hors ligne.

localhost:1337/v1

GPT4All

Application de bureau

Discutez avec vos documents en local, rien ne quitte le portable.

Local RAG

vLLM

Serveur d’inférence

Le serveur d’inférence qu’utilise la production. PagedAttention et batching continu, sur votre propre GPU.

localhost:8000/v1

MLX

Apple Silicon

Le framework matriciel d’Apple. Sur un Mac à puce M, c’est la voie la plus rapide en local.

localhost:8080/v1

llamafile

Binaire unique

Un seul fichier qui vaut à la fois modèle et runtime. Téléchargez, chmod +x, exécutez. Aucune installation.

localhost:8080/v1

KoboldCpp

Binaire unique

Un exécutable unique autour de llama.cpp, réglé pour les longs textes et l’écriture créative.

GGUF

Questions à ce sujet

De combien de RAM ai-je besoin ?

Un modèle 7B quantifié en 4 bits tient dans environ 5 Go, donc 8 Go de RAM en font tourner un confortablement. Les modèles 70B veulent 40 Go ou plus. Can I Run AI évaluera votre machine précise.

Un modèle local vaut-il une API gratuite ?

Pas en général. Les modèles que vous exécutez chez vous sont plus petits que ceux que NVIDIA ou Groq servent gratuitement. Le local gagne en confidentialité, en usage hors ligne et en l’absence totale de limites.

Autres façons de découper