L'IA locale — pour les particuliers et les organisations
L'IA locale pour les particuliers
L'IA locale pour les particuliers, je l'ai essayée.
Cela fonctionne. Les résultats sont tout à fait corrects. Regardez la vidéo, j'y compare Claude et Qwen.
Mais une chose d'emblée : ce n'est pas pour le consommateur lambda. Sans compétences en ingénierie, je n'y serais pas arrivée.
Voici mon architecture et quelques captures d'écran.

J'utilise un MacBook, Qwen comme LLM et l'agent Hermes de Nous Research comme harness.
J'utilise un MacBook, Qwen comme LLM et l'agent Hermes (https://hermes-agent.nousresearch.com/) de Nous Research comme harness.
On peut tout à fait utiliser une IA locale avec un agent local en tant que particulier. Mais le seuil d'entrée est élevé.
Le matériel est cher et l'installation et la configuration ne sont pas pour ceux que les commandes du terminal dépassent.
Cela changera certainement à l'avenir. Un jour, il existera peut-être du matériel avec une IA locale préinstallée.
À mon sens, l'IA locale vaut la peine pour les particuliers dans trois cas :
- Un nouvel équipement est de toute façon prévu — si vous comptiez déjà acheter un MacBook.
- La protection des données compte beaucoup pour vous — si vous tenez à ce que vos données ne quittent pas la maison.
- Des adolescents à la maison — si les jeunes doivent apprendre à manier la technologie.
Je suis moi-même mère et je pense que les adolescents doivent apprendre à utiliser la technologie — dans un espace protégé. Avec une IA locale, les enfants ne sont pas pistés pendant leurs expérimentations et aucun profil n'est constitué à leur sujet. Si vous pouvez vous offrir le matériel, cela mérite réflexion.
Les LLM locaux pour les PME et les petites organisations
Entre l'usage personnel et le déploiement en entreprise, il existe un niveau intermédiaire important : les petites et moyennes entreprises (PME).
En font partie par exemple :
- les cabinets d'avocats
- les experts-comptables
- les cabinets médicaux
- les bureaux d'ingénierie
- les cabinets de conseil
- les agences
- les petites entreprises industrielles
Ici, les critères diffèrent de ceux des grandes entreprises.
Une PME n'a normalement pas un usage de l'IA suffisant pour justifier économiquement son propre serveur GPU. Les volumes de tokens sont le plus souvent très loin des ordres de grandeur à partir desquels l'auto-hébergement devient rentable.
Cas 1 : PME sans exigences particulières de protection des données
Lorsqu'il n'existe pas d'exigences particulières, une API hébergée est souvent la meilleure solution.
Exemples :
- rédiger des textes marketing
- résumer des documents internes
- développer des idées
- effectuer des recherches générales
- créer des présentations
Avantages :
- aucun matériel propre nécessaire
- accès aux meilleurs modèles disponibles
- aucune exploitation technique nécessaire
- faibles coûts d'entrée
Pour la plupart des petites entreprises, c'est l'approche la plus judicieuse sur le plan économique.
Cas 2 : PME avec de fortes exigences de protection des données
Dans certains secteurs, la décision change.
Exemples :
- les cabinets avec des données de mandats
- les experts-comptables avec des données financières
- les médecins avec des données de patients
- les entreprises avec des données de développement confidentielles
Ici, l'IA locale peut être pertinente, même si elle n'est pas moins chère économiquement.
La motivation n'est alors pas : « Nous réduisons les coûts. » — mais : « Les données sensibles ne doivent pas quitter l'entreprise. »
LLM local sur le poste de travail
Chaque collaborateur utilise son propre modèle sur son ordinateur de travail.
Exemples :
- MacBook Pro
- Mac Studio
- PC Windows performant
Adapté à :
- les brouillons de documents
- les résumés
- le travail de connaissance interne
- l'analyse de ses propres fichiers
Avantages :
- contrôle maximal des données
- aucune infrastructure centrale nécessaire
- aucun serveur GPU requis
Inconvénients :
- chaque appareil doit être maintenu
- des modèles plus petits que chez les fournisseurs cloud
- l'installation et les mises à jour doivent être organisées
Petit serveur d'IA centralisé
Une entreprise peut aussi exploiter sa propre machine d'IA.
Cela devient intéressant lorsque :
- plusieurs collaborateurs doivent utiliser les mêmes modèles,
- un fonds de connaissances commun est nécessaire,
- les documents internes doivent être consultables de manière centralisée,
- des workflows automatisés apparaissent.
Exemples :
- recherche documentaire interne
- base de connaissances
- analyse de contrats
- traitement automatisé de documents
C'est ici que commence la transition vers le scénario classique de l'entreprise.
La véritable décision pour les PME
| Situation | Approche pertinente |
|---|---|
| Peu de données sensibles | API hébergée |
| Documents sensibles isolés | LLM local sur le poste ou environnement d'IA privé |
| Plusieurs collaborateurs avec un savoir commun | Serveur d'IA central ou déploiement managé |
| Utilisation très élevée | Étudier l'auto-hébergement |
IA locale ne signifie pas automatiquement serveur propre
Dans les PME, l'« IA locale » est souvent mal comprise.
Il existe une grande différence entre :
L'IA locale sur le poste de travail
- MacBook
- Mac Studio
- machine locale
L'auto-hébergement d'une IA d'entreprise
- serveur GPU
- infrastructure
- monitoring
- mises à jour
- MLOps
La première variante peut déjà être pertinente pour de petites équipes. La seconde ne devient pertinente que pour de plus grandes organisations ou des besoins spécifiques.
Les LLM locaux pour les grandes entreprises
Pour les grandes entreprises, les questions sont tout autres. Les grandes organisations ont des cas d'usage aux volumes bien plus importants.
En général, il existe les possibilités suivantes :
Les trois modèles d'exploitation
1. API hébergée
Un prestataire externe (par exemple OpenAI ou Anthropic) exploite l'infrastructure. L'utilisateur paie au token traité.
Avantages
- Aucun matériel propre nécessaire
- Utilisable rapidement
- Accès aux modèles les plus performants (« frontier »)
- On ne paie que l'usage réel
Inconvénients
- Les données quittent l'entreprise
- Les coûts augmentent proportionnellement à l'usage
- Dépendance aux changements de prix et aux limites du fournisseur
Adapté à :
- une utilisation faible à moyenne
- une charge variable
- des applications aux plus hautes exigences de qualité.
2. Déploiement managé
Le matériel est loué et géré par le fournisseur, mais fonctionne à l'intérieur de votre propre environnement cloud.
Avantages
- Les données restent dans votre propre tenant cloud
- Pas besoin d'équipe MLOps interne
- Transition facile grâce à la compatibilité API
- Fine-tuning souvent intégré
Inconvénients
- Coûts de location récurrents
- Moins de contrôle
- Uniquement des modèles « open-weight » disponibles
Adapté à :
- les secteurs régulés (santé, finance, juridique)
- les entreprises avec de fortes exigences de protection des données.
3. Auto-hébergement complet
L'entreprise exploite entièrement elle-même les modèles, le matériel et l'infrastructure.
Avantages
- Souveraineté maximale des données
- Coût par requête très faible en cas de forte utilisation
- Possibilités de fine-tuning propres
- Une infrastructure peut servir plusieurs applications
Inconvénients
- Investissements élevés
- Consommation électrique
- Exploitation complexe
- Personnel MLOps spécialisé nécessaire
- Matériel performant indispensable
Adapté à :
- une utilisation élevée et durable
- des données sensibles
- un fine-tuning régulier.
Considérations économiques
L'article cite trois seuils importants :
| Utilisation | Recommandation |
|---|---|
| moins de 1 M tokens/jour | l'API est nettement moins chère |
| 1–2 M tokens/jour | les deux options sont économiquement comparables |
| plus de 2 M tokens/jour | l'auto-hébergement commence à devenir rentable |
| plus de 10 M tokens/jour | le matériel s'amortit généralement en 6 à 12 mois |
Un facteur de coût souvent sous-estimé est le personnel : un ingénieur MLOps engendre des coûts annuels nettement plus élevés que le matériel GPU lui-même.
Logique de décision
L'auteur recommande l'ordre suivant pour la prise de décision :
- Vérifier la protection des données
- Les données doivent-elles impérativement ne pas quitter l'entreprise ?
- Si oui : l'API est exclue.
- Évaluer l'expertise disponible
- Pas d'équipe d'exploitation → déploiement managé.
- Équipe MLOps interne → auto-hébergement possible.
- Analyser le volume d'utilisation
- En dessous d'environ 2 M tokens/jour → l'API est le plus souvent moins chère.
- Au-delà → l'auto-hébergement devient économiquement intéressant.
- Prendre en compte la qualité de modèle requise
- Pour les modèles fermés les plus avancés, seule une API reste souvent utilisable.
L'architecture hybride
L'article considère la solution hybride comme l'approche la plus praticable pour beaucoup d'entreprises :
Les modèles locaux prennent en charge :
- le traitement de documents
- la classification
- l'extraction de données structurées
- les applications critiques pour la protection des données
Les API externes prennent en charge :
- les tâches de raisonnement complexes
- les requêtes rares, particulièrement exigeantes en qualité
Selon l'article, les entreprises font ainsi état de coûts inférieurs de 40 à 70 % par rapport à une solution 100 % API. En parallèle, l'accès aux puissants modèles frontier est préservé.