IA auto-hébergée · guide 2026

L’IA auto-hébergée pour les PME

La machine, les mesures et le calcul qui décident s’il faut posséder son inférence ou la louer.

Posséder son matériel d’IA a désormais un sens commercial pour des entreprises ordinaires — mais pas toujours. Une station d’inférence coûte 4 855 £ HT et fait tourner les meilleurs modèles 27B à 30B du moment. Savoir si cela bat une API dépend de trois choses : le taux d’utilisation, le nombre d’utilisateurs et le contrôle des données. Ce guide montre la vraie machine, les vrais prix et les vrais calculs.

01 · L’essentiel

La réponse d’abord

Pour une PME, posséder son matériel d’IA a désormais un sens commercial dans des situations tout à fait ordinaires.

Si dix personnes ou plus utilisent l’IA quotidiennement, ou si vos équipes manipulent des informations clients qu’il n’est pas raisonnable d’envoyer vers une API hébergée aux États-Unis, une machine d’inférence locale mérite un examen sérieux.

Non pas parce que l’IA locale revient toujours moins cher.

Ce n’est pas le cas.

Tout se joue sur trois éléments : le taux d’utilisation, le nombre d’utilisateurs et le contrôle des données.

Voici la machine que nous avons construite et le calcul qui la justifie.

Matériel : 4 855 £ HT.

Ce montant couvre :

  • Une RTX 5090 avec 32 Go de VRAM
  • 64 Go de mémoire système
  • Un processeur Ryzen 16 cœurs
  • 4 To de stockage NVMe

Ces prix proviennent de SCAN UK en février 2026.

Elle fait tourner sans difficulté les meilleurs modèles actuels de la gamme 27B à 30B. Qwen3.8 27B, publié le 13 août 2026 sous licence Apache 2.0, demande environ 14 à 16 Go en 4 bits. NVIDIA Nemotron 3.5 Lightning 30B A3B tient également sur une seule carte. Les deux autorisent un usage commercial.

L’électricité représente environ 400 £ par an, sur la base d’un tarif professionnel britannique de 26,8 p/kWh.

Sur trois ans :

Possession sur trois ans Montant
Matériel 4 855 £
Électricité 1 200 £
Coût total en trésorerie 6 055 £
Coût annualisé 2 018 £

Réparti sur dix personnes, cela représente environ 17 £ par utilisateur et par mois.

Un GPU loué de catégorie équivalente dépasse 400 £ par mois. Nous avons payé ces factures nous-mêmes. À ce rythme, l’achat de la station rattrape la location en douze mois environ.

La comparaison avec les API est moins spectaculaire.

Un utilisateur intensif sur un modèle de classe Sonnet revient à environ 262 £ par an, selon les hypothèses détaillées plus loin. Dix utilisateurs coûtent donc près de 2 620 £ par an.

La machine possédée coûte 2 018 £.

C’est une économie. Ce n’est pas un raz-de-marée.

Passez à vingt utilisateurs, à des volumes de jetons élevés ou à une tarification de niveau Opus, et le calcul bascule rapidement.

Voici donc ce qu’il faut retenir :

Posséder sa puissance de calcul revient peu cher quand on s’en sert. Un GPU inutilisé coûte cher.

Le contrôle, lui, relève d’une autre logique. Vous l’obtenez dès le premier jour.

Votre modèle tourne sur votre infrastructure. Vos documents restent sur votre réseau. Vos coûts cessent de bouger dès que l’usage augmente.

C’est pour cette raison que l’auto-hébergement est passé du terrain des passionnés à celui des choix d’infrastructure crédibles pour une PME.

02 · Les trois options

Commencer par la décision d’achat

Il existe en réalité trois façons d’acheter de l’inférence.

1. Payer une API

Vous envoyez vos requêtes à OpenAI, Anthropic ou Google.

L’attrait est évident.

Aucun investissement. Aucune administration de serveur. Un accès aux modèles de raisonnement les plus performants du marché.

Vous payez aussi chaque jeton, vos informations quittent votre périmètre et vos coûts augmentent à mesure que l’adoption progresse.

Les tarifs publiés en août 2026 étaient les suivants :

Modèle Entrée $/M jetons Sortie $/M jetons
Claude Opus 5 5,00 $ 25,00 $
Claude Sonnet 5 2,00 $ 10,00 $
GPT 5.6 Sol 5,00 $ 30,00 $
GPT 5.6 Terra 2,00 $ 12,00 $
GPT 5.6 Luna 0,20 $ 1,20 $
Gemini 3.1 Pro 2,00 $ 12,00 $

Pour une petite équipe à l’usage modéré, c’est souvent la réponse la moins chère.

Simple.

2. Louer le GPU

L’option intermédiaire consiste à louer de la puissance dédiée chez RunPod, OVHcloud ou Vast.ai.

Vous évitez l’achat du matériel tout en conservant une maîtrise bien plus grande du déploiement.

Et vous pouvez arrêter facilement.

La location est donc idéale pour tester.

Les ennuis commencent quand la charge devient permanente.

OVHcloud affiche une L4 de 24 Go autour de 1,00 $ de l’heure à la demande. En Europe, un engagement mensuel sur un GPU de la gamme 32 Go dépasse 400 £ par mois.

Soit 4 800 £ chaque année.

Sur trois ans, vous aurez dépensé 14 400 £ sans jamais posséder la machine.

3. Posséder le matériel

Vous payez d’abord.

Ensuite, chaque requête supplémentaire ne coûte pratiquement rien au-delà de l’électricité et de l’administration.

Vous maîtrisez également l’intégralité du parcours des données.

Mais la possession n’est financièrement intéressante que si le GPU a du travail.

Une machine à 5 000 £ peu sollicitée est une mauvaise affaire.

La même machine fortement sollicitée devient du calcul extrêmement bon marché.

Pour beaucoup de PME, l’architecture raisonnable n’est donc ni le tout-cloud ni le tout-local.

Elle est hybride. Nous détaillons cet arbitrage dans notre présentation d’Ascentis Cortex.

Utilisez l’inférence locale pour le travail courant, les connaissances internes et les informations sensibles. Envoyez vers un modèle externe la minorité de requêtes qui exigent réellement un raisonnement de premier plan.

Une entreprise qui affirme qu’il existe une seule bonne réponse pour toutes les charges de travail cherche généralement à vous vendre cette réponse.

03 · Les modèles

Pourquoi 2026 change la donne

Le matériel existait déjà.

Ce qui a changé, c’est le logiciel.

Il y a deux ans, faire tourner l’IA en local supposait d’accepter une baisse de qualité perceptible.

Cet écart s’est réduit.

Pour une large part du travail courant en entreprise, la qualité du modèle n’est plus la principale raison de renoncer à l’auto-hébergement.

Trois évolutions nous ont menés là.

Les modèles denses ont nettement progressé

Qwen3.8 27B est sorti le 13 août 2026.

Il propose :

  • 28 milliards de paramètres denses
  • Une attention hybride
  • 262 k de contexte natif
  • Un contexte extensible à un million de jetons
  • Un encodeur visuel
  • Une licence Apache 2.0
  • Un score de 61,7 sur SWE-bench Pro

Son prédécesseur, Qwen3.7 27B, est déjà en production chez nous comme chez beaucoup d’autres.

Qwen3.8 n’appartient pas à une génération entièrement différente.

Il est simplement meilleur.

Et cela compte.

Les modèles épars ont changé l’équation du débit

NVIDIA a publié Nemotron 3.5 Lightning 30B A3B le 11 août 2026 sous licence OpenMDW 1.1.

Il combine Mamba 2, attention et mélange d’experts.

Il totalise 30 milliards de paramètres.

Trois milliards seulement s’activent pour chaque jeton.

C’est là l’essentiel.

Ses scores publiés comprennent :

Test Score
MMLU Pro 81,62
SWE-bench Verified 52,80

Il tourne sur une seule H100 ou sur un DGX Spark, et NVIDIA annonce des vitesses de sortie jusqu’à quatre fois supérieures à celles de modèles comparables.

Ses couches Mamba évitent par ailleurs que la consommation mémoire ne croisse comme le fait un cache KV classique lorsque le contexte s’allonge.

Les contextes très longs, jusqu’au million de jetons, deviennent donc bien plus praticables sur une seule carte.

Les licences commerciales se sont simplifiées

Ce point exigeait autrefois une vigilance nettement plus grande.

Aujourd’hui, plusieurs grandes familles de modèles ouverts sont assorties de licences exploitables commercialement :

Famille Licence
Qwen Apache 2.0
DeepSeek MIT
GLM MIT
Nemotron OpenMDW 1.1

Aucun seuil de chiffre d’affaires ni déclaration par utilisateur n’y est attaché.

Vous pouvez bâtir des systèmes commerciaux autour de ces modèles.

04 · Dimensionnement

Ce qui tient réellement dans la mémoire GPU

Le calcul approximatif est simple.

En 4 bits, les poids d’un modèle réclament environ 0,5 octet par paramètre.

En FP16, comptez plutôt 2 octets par paramètre.

Prévoyez ensuite 10 à 20 % de plus pour le cache KV et la surcharge du framework. Les fenêtres de contexte longues et les utilisateurs simultanés font monter ce besoin.

Quelques repères utiles :

Modèle Paramètres 4 bits FP8 FP16 Licence
Qwen3.5 4B 4B 2 Go 8 Go Apache 2.0
Gemma 4 12B 12B 6 Go 24 Go Poids ouverts
Qwen3.8 27B 28B 14–16 Go ~28 Go ~56 Go Apache 2.0
Nemotron 3.5 Lightning 30B au total, 3B actifs NVFP4 natif OpenMDW 1.1
DeepSeek V4 Flash 284B 142 Go 568 Go MIT
GLM 4.7 355B 180 Go 710 Go MIT
Qwen 3.5 397B 207 Go 794 Go Apache 2.0
Mistral Large 3 675B 355 Go 1 350 Go Apache 2.0
DeepSeek V4 Pro 1,6 T 800 Go 3 200 Go MIT

La ligne de partage devient alors très nette.

Pour une PME qui achète une seule station, la gamme utile va de 27B à 30B.

Ces modèles tiennent confortablement sur un GPU grand public de 32 Go en 4 bits, tout en laissant assez de mémoire pour une fenêtre de contexte réellement exploitable.

Au-delà de 200 milliards de paramètres environ, vous ne préparez plus une station de travail de bureau.

Vous préparez une infrastructure de centre de données.

05 · La machine

La station à 4 855 £

Ce n’est pas une liste de composants suggérée.

C’est la configuration que nous avons réellement chiffrée chez SCAN UK en février 2026.

Composant Spécification Prix TTC
GPU ASUS RTX 5090 TUF Gaming OC, 32 Go GDDR7 2 999,99 £
Processeur AMD Ryzen 9 9950X, 16 cœurs, 32 threads, 170 W 503,99 £
Mémoire 64 Go Corsair DDR5 6000 CL40 (2 × 32 Go) 770,48 £
Carte mère ASUS ROG Strix X870E H, WiFi 7, 5 GbE 319,99 £
Stockage 2 × 2 To Samsung 990 PRO NVMe 619,97 £
Alimentation Corsair HX1200i, 1200 W, 80+ Platinum 219,98 £
Refroidissement Noctua NH D15 G2 et 3 × NF A14 industrial PPC 216,96 £
Boîtier Fractal Design Meshify 3 XL grand format 174,98 £
Prix final 5 826,35 £ TTC
4 855,29 £ HT

Le GPU

C’est là que réside l’essentiel de la valeur.

L’inférence est avant tout limitée par la bande passante mémoire.

La RTX 5090 offre 1,79 To/s de bande passante GDDR7.

Sur un même modèle de classe 30B, les tests vLLM publiés donnent des débits agrégés d’environ :

GPU Débit agrégé
RTX 5090 4 570 jetons par seconde
RTX 4090 2 259 jetons par seconde

Soit près du double.

Les 32 Go comptent aussi. Un modèle 27B en 4 bits y tient sans vous contraindre à une fenêtre de contexte ridiculement étroite.

La mémoire système

Rien n’impose de passer d’emblée à 128 Go.

Les poids du modèle résident dans la VRAM.

La mémoire système sert au chargement, au traitement documentaire et au système de recherche qui entoure le modèle.

Pour cette configuration, 64 Go suffisent.

Et la DDR5 n’est pas donnée.

Le stockage

Quatre téraoctets paraissent généreux jusqu’au jour où vous stockez plusieurs modèles, plusieurs quantifications et une base vectorielle.

Cela se remplit.

L’alimentation

Une alimentation de 1200 W n’a rien d’excessif ici.

La 5090 affiche à elle seule 575 W de puissance carte et peut provoquer des pics nettement supérieurs.

Une alimentation sous-dimensionnée est l’un des moyens les plus sûrs de transformer un serveur d’inférence fiable en machine qui plante sans raison apparente.

Le refroidissement

Cette machine ne se comporte pas comme un PC de jeu.

Elle peut rester sous forte charge pendant des heures.

Refroidissez-la en conséquence.

Un grand boîtier, un refroidissement à air surdimensionné et des ventilateurs de qualité industrielle évitent l’étranglement thermique au cœur d’un traitement par lots.

Ils rendent aussi la machine supportable dans un bureau.

Un avertissement sur le prix des GPU

Attendre ne vous fera pas nécessairement économiser.

La pression actuelle vient de l’approvisionnement en mémoire GDDR7 et HBM.

Les prix montent.

NVIDIA a relevé le tarif de la RTX 5090 à mesure que le coût de la mémoire augmentait.

La RTX PRO 6000 Blackwell en est l’illustration la plus nette.

Elle est sortie sous les 8 000 $.

La place de marché de NVIDIA l’affiche aujourd’hui autour de 13 250 $.

Soit une hausse d’environ 55 %.

Les prévisions actuelles ne laissent pas espérer un retour à la normale avant 2027 ou 2028.

Si votre plan consiste à attendre parce que les GPU devraient bientôt baisser, rien ne vient aujourd’hui appuyer cette hypothèse.

Et si un seul GPU ne suffit pas ?

Trois pistes s’imposent.

Deux RTX 5090

VRAM cumulée : 64 Go. De quoi accueillir un modèle 27B en FP8, ou un modèle autour de 70B en 4 bits. Comptez environ 3 000 £ de plus, ainsi qu’une carte mère capable de fournir les lignes PCIe nécessaires.

Une RTX PRO 6000 Blackwell

Mémoire : 96 Go. Débit publié sur un modèle 30B : 8 425 jetons par seconde. Vous gagnez aussi la mémoire ECC et une gestion électrique bien plus propre sur une seule carte. Le problème, c’est le prix. Au niveau actuel, ce prix devient le principal argument contre l’achat.

Mac Studio

Cette option mérite plus d’attention qu’elle n’en reçoit. L’architecture à mémoire unifiée d’Apple contourne la pénurie de mémoire GPU discrète parce qu’elle repose sur une filière de fabrication différente. Vous pouvez configurer de très grandes capacités mémoire sans monter une station multi-GPU. Les jetons arrivent plus lentement. Mais l’installation est infiniment plus simple. Pour une petite équipe, l’arbitrage peut être parfaitement justifié.

06 · Performances

La vitesse, il y a deux chiffres

On cite souvent une seule vitesse d’inférence.

Cela masque l’essentiel.

Ce que ressent un utilisateur

Pour un modèle dense 27B en 4 bits sur une 5090, les poids occupent environ 15 Go.

Avec 1,79 To/s de bande passante, le plafond théorique se situe près de 110 jetons par seconde.

En pratique, c’est moins.

Tablez sur 70 à 90 jetons par seconde.

Soit à peu près trois fois la vitesse de lecture normale.

En usage interactif, la réponse paraît immédiate.

Ce que produit la machine entière

Passons maintenant au traitement par lots.

Les résultats vLLM publiés donnent :

Matériel Débit agrégé, modèle 30B MoE
Une RTX 5090 4 570 jetons par seconde
Une RTX PRO 6000 8 425 jetons par seconde

Les modèles épars à mélange d’experts se regroupent bien mieux en lots que les modèles denses.

Pour un modèle dense 27B, prévoyez un débit agrégé de quelques centaines de jetons par seconde plutôt que plusieurs milliers.

C’est ce chiffre agrégé qui détermine combien de personnes la machine peut réellement servir.

Combien d’utilisateurs ?

VMware a publié en avril 2026 une étude de capacité utilisant gpt-oss 120b.

Ses résultats comprenaient environ :

Configuration Utilisateurs simultanés
4 × H100 300
2 × H200 85

La charge de travail mélangeait requêtes courtes, moyennes et longues, plutôt que de supposer un comportement uniforme.

Ramené à une 5090 bien configurée exécutant un modèle 27B à 30B, dix à vingt utilisateurs actifs simultanés constituent une hypothèse de dimensionnement raisonnable pour du dialogue et de la recherche documentaire.

Le nombre total de postes peut être bien supérieur.

Les utilisateurs ne génèrent pas tous des jetons au même instant.

Deux enseignements de l’étude VMware méritent l’attention.

D’abord, la capacité de VRAM n’était pas la contrainte principale.

Les facteurs limitants étaient le calcul d’attention et la bande passante mémoire.

L’utilisation du cache KV n’atteignait que 10,5 %, en grande partie parce que la mise en cache des préfixes éliminait le contexte redondant.

Ajouter de la VRAM n’est donc pas automatiquement le meilleur investissement.

Ensuite, la configuration modifiait sensiblement les résultats.

Plafonner --max-num-batched-tokens autour de 1 024 à 2 048 évitait que les longues phases de préremplissage ne dégradent la latence entre jetons.

Un serveur mal réglé peut gaspiller l’essentiel de la performance que vous avez payée.

07 · Économie

Le dossier financier

Trois ans de possession

Poste Montant
Matériel, hors TVA 4 855 £
Électricité sur trois ans 1 200 £
Total 6 055 £
Annualisé 2 018 £

Le calcul électrique suppose environ 1 385 kWh par an.

Il provient d’environ trois heures par jour sous charge soutenue autour de 650 W, plus une consommation permanente au repos de 110 W.

L’électricité est valorisée à 26,8 p/kWh, moyenne britannique actuelle pour les petites entreprises retenue dans ce modèle.

L’administration n’est pas incluse.

Ajoutez votre propre chiffre.

Une hypothèse raisonnable consiste à prévoir une demi-journée par mois d’une personne compétente, ou le coût d’un contrat de support.

Coût par personne

Utilisateurs Par utilisateur et par an Par utilisateur et par mois
5 404 £ 34 £
10 202 £ 17 £
20 101 £ 8 £
40 50 £ 4 £

Le coût du matériel n’augmente pas avec le nombre d’utilisateurs tant que vous n’avez pas épuisé sa capacité.

C’est là que la possession commence à devenir financièrement intéressante.

Louer ou acheter

Retenons 400 £ par mois pour une instance de catégorie 32 Go.

Cela donne :

Période Location Achat
Un an 4 800 £
Trois ans 14 400 £ 6 055 £

Face à une location continue, le coût d’achat est amorti en douze mois environ.

La location conserve toute sa place.

Utilisez-la lorsque :

  • Vous cherchez à prouver que le cas d’usage existe
  • Votre demande varie fortement
  • Un investissement est difficile à faire approuver

Une fois la charge de travail stabilisée, continuer à louer devient coûteux.

La comparaison avec les API

C’est ici que les arguments simplistes en faveur de l’auto-hébergement s’effondrent souvent.

Prenons un utilisateur intensif.

Hypothèses :

  • 80 interactions par jour ouvré
  • 5 000 jetons en entrée à chaque interaction, contexte et recherche documentaire compris
  • 700 jetons en sortie à chaque fois

Cela représente environ 104 millions de jetons en entrée et 14,6 millions en sortie par an.

Aux tarifs publiés en août 2026 et à un taux de change de 1,3534 $ pour 1 £ au 15 août 2026, les coûts annuels s’établissent approximativement ainsi :

Modèle Coût par utilisateur et par an
GPT 5.6 Luna 28 £
Claude Sonnet 5 262 £
GPT 5.6 Terra 283 £
Claude Opus 5 654 £

Comparons maintenant avec la possession du serveur.

Dix utilisateurs intensifs sur Sonnet :

Option Coût annuel
API ~2 620 £
Machine possédée ~2 018 £

Le serveur l’emporte.

De justesse.

Pour une équipe plus réduite ou un usage plus léger, l’API peut tout à fait revenir moins cher.

Ce n’est pas un échec de l’auto-hébergement.

C’est simplement de l’arithmétique.

L’échelle change le résultat

Scénario API Machine possédée
10 utilisateurs classe Sonnet 2 620 £ 2 018 £
20 utilisateurs classe Sonnet 5 240 £ 2 018 £
10 utilisateurs classe Opus 6 540 £ 2 018 £

Le coût du matériel, lui, ne bouge toujours pas.

Considérons ensuite une charge de travail qui sollicite vraiment le GPU.

Supposons que la machine produise trois heures par jour 800 jetons par seconde en agrégé.

La production annuelle avoisine 2,2 milliards de jetons.

À 2 018 £ par an, le coût de calcul effectif tombe à environ 0,90 £ par million de jetons.

À comparer aux quelque 7,39 £ par million de jetons en sortie d’une tarification API de classe Sonnet.

Environ huit fois moins cher.

Mais la condition compte.

Vous n’obtenez cette économie que si la machine reste occupée.

C’est l’argument en une phrase.

L’argent n’est pas la seule colonne

Trois autres différences pèsent.

Un coût prévisible

La facture annuelle n’augmente pas simplement parce que vos collaborateurs trouvent des usages plus utiles à l’IA. Cela compte. La facturation au jeton crée une incitation étrange dans une entreprise : plus le système devient utile, plus il devient coûteux de laisser les gens s’en servir.

Le parcours des données

Avec un système local, les informations de l’entreprise peuvent rester à l’intérieur de votre réseau. Ce n’est pas une économie comptable. C’est une catégorie de risque que vous cessez de porter.

La propriété

Vous maîtrisez le modèle, la configuration, vos connaissances encodées, les applications qui l’entourent, les artefacts produits et votre porte de sortie.

Vous ne dépendez pas d’un fournisseur unique qui maintiendrait un modèle, un tarif ou l’acceptation de votre cas d’usage.

08 · Quand renoncer

Les cas où acheter la machine est une erreur

Nous vendons ce type de prestation.

Il existe malgré tout plusieurs situations où nous déconseillons l’auto-hébergement.

Moins de cinq utilisateurs réguliers

Si l’usage est léger, prenez une API. Elle coûtera probablement moins cher et n’exigera presque aucune administration. Réexaminez la question dans un an.

Votre travail exige réellement un raisonnement de premier plan

Un bon modèle 27B est impressionnant. Ce n’est pas Claude Opus 5. Ce n’est pas GPT 5.6 Sol. Si votre valeur ajoutée se situe au sommet de la courbe de raisonnement, utilisez ces modèles. Une meilleure architecture consiste souvent à garder les charges courantes en local et à router les requêtes difficiles vers l’extérieur.

Personne n’est responsable du système

Quelqu’un doit prendre en charge les correctifs, les mises à niveau, la supervision et la configuration. Confiez cette responsabilité à une personne nommément désignée. Sinon, vous n’avez pas créé une infrastructure économique. Vous avez créé un serveur non administré.

La demande est imprévisible

Louez. Une fois la charge de travail clarifiée, réexaminez l’achat.

Vous avez besoin des nouveautés de pointe immédiatement

Les modèles fermés livrent généralement les nouvelles fonctionnalités en premier. Les modèles ouverts suivent. Si vous avez besoin de la dernière capacité multimodale la semaine de sa sortie, les poids ouverts en local ne sont pas la bonne architecture principale.

09 · Conformité

La conformité, souvent l’argument le plus fort

Pour certaines PME, le coût est secondaire.

La vraie question est ce qu’elles peuvent affirmer sereinement à un client au sujet de ses informations.

RGPD et cadre britannique

L’auto-hébergement ne fait pas disparaître vos obligations en matière de protection des données.

Il vous faut toujours :

  • Une base légale pour le traitement
  • Une AIPD lorsque le traitement présente un risque élevé
  • Des mentions d’information qui précisent votre usage de l’IA

Ce qui change, c’est la preuve.

Si le traitement se déroule en local, expliquer où sont allées les informations devient bien plus simple.

Elles sont restées dans votre environnement.

Les recommandations du NCSC sur la cybersécurité de l’IA

Les recommandations publiées par le NCSC en avril 2026 fournissent un socle de sécurité pratique que de nombreux acheteurs attendent désormais.

Il comprend :

  • Une certification Cyber Essentials à jour
  • L’authentification multifacteur sur les comptes d’outils d’IA
  • Une protection contre l’injection d’invite
  • Une vérification hors bande pour les actions financières

Ces contrôles s’appliquent que vous hébergiez en local ou que vous passiez par un prestataire externe.

Les accords de traitement des données

Dès que vous utilisez une API tierce, les services achats réclament généralement un accord de sous-traitance.

Ils peuvent aussi exiger une clause explicite de non-entraînement.

Gardez l’inférence dans votre propre infrastructure et vous supprimez purement et simplement cette relation de sous-traitance.

Le règlement européen sur l’IA

Les entreprises britanniques peuvent relever du règlement dès lors qu’elles ont des clients, des salariés ou des produits dans l’Union européenne.

L’obligation de littératie en IA prévue à l’article 4 s’applique depuis février 2025.

Une formation documentée du personnel n’est pas facultative.

Les applications à haut risque, notamment l’emploi, le crédit et l’éducation, ajoutent des exigences d’évaluation de conformité et de gouvernance des données.

Les règles sectorielles ne disparaissent pas

D’autres exigences peuvent se superposer.

Par exemple :

  • Les obligations d’explicabilité au titre du Consumer Duty de la FCA
  • Les recommandations de l’ICO sur la santé et les données sensibles
  • Les règles de confidentialité professionnelle de la SRA
  • Les exigences de l’ICAEW
  • Celles du Bar Standards Board

Pour les entreprises qui manipulent des informations techniques contrôlées, des données de chaîne d’approvisionnement de défense, des dossiers médicaux ou des informations couvertes par le secret professionnel, une phrase est particulièrement forte :

Les données ne sont jamais sorties de notre réseau.

Elle répond vite à la question la plus délicate d’un appel d’offres.

10 · La pile logicielle

Le logiciel autour du GPU

Acheter la machine est la partie facile.

C’est la configuration qui détermine si elle fonctionne bien.

Le service d’inférence

Pour l’expérimentation ou un utilisateur unique, prenez Ollama.

L’installation prend une dizaine de minutes et sa bibliothèque de modèles est excellente.

Dès que plusieurs personnes ont besoin de la machine, passez à vLLM.

Le traitement par lots continu et l’attention paginée transforment le nombre d’utilisateurs qu’un matériel identique peut servir.

Un serveur qui gère confortablement deux personnes avec une configuration simple peut en supporter vingt avec une couche de service correctement conçue.

Ne laissez pas toute une équipe de production sur Ollama au seul motif que c’était le point de départ le plus facile.

La quantification

Pour la plupart des déploiements en entreprise, le 4 bits doit être la valeur par défaut.

AWQ, GPTQ et NVFP4 réduisent l’empreinte mémoire à environ un quart de la pleine précision, avec un écart de qualité que beaucoup de tâches courantes ne permettent pas de détecter.

Si vous disposez d’assez de VRAM pour du FP8, testez-le.

Ne partez pas du principe qu’une précision supérieure vaut automatiquement la mémoire supplémentaire.

Évaluez d’abord les résultats.

La recherche documentaire

Le modèle généraliste n’est pas là où réside l’essentiel de votre valeur.

Vos connaissances internes, elles, le sont.

Cela comprend :

  • Les documents de l’entreprise
  • Les grilles tarifaires
  • Les procédures
  • Les informations produits
  • Les conventions techniques
  • L’historique client

Maintenez ce corpus à jour et placez un système de recherche devant le modèle.

C’est ce qui transforme un modèle téléchargeable par n’importe qui en un actif propre à votre entreprise. C’est précisément la vocation d’Ascentis Cortex.

La journalisation et les contrôles

Enregistrez chaque invite et chaque réponse.

Rattachez l’activité à un utilisateur.

Conservez ces traces selon vos règles de rétention habituelles.

Vous en aurez besoin pour produire une AIPD.

Vous les voudrez aussi le jour où quelqu’un contestera une réponse générée par l’IA.

Le routage

Concevez le routage externe dès le départ.

Même si 95 % des requêtes restent locales, prévoyez la possibilité d’envoyer les 5 % restants vers une API de premier plan.

Le système en devient nettement plus robuste.

Le modèle local n’a pas besoin de gagner tous les classements.

Il doit traiter ce qu’il fait bien, à faible coût et de façon fiable.

11 · Mise en oeuvre

Un parcours pratique en 30 jours

Jours 1 à 5. Mesurez ce que font vos équipes aujourd’hui. Comptez les requêtes réelles. Ne comptez pas l’enthousiasme. Si personne ne sait combien l’entreprise dépense chaque mois en API, acheter du matériel est prématuré.

Jours 6 à 10. Louez d’abord de la puissance. Faites tourner Qwen3.8 27B et Nemotron 3.5 Lightning sur vos vrais documents et vos vrais flux de travail. Utilisez une carte louée pendant une quinzaine de jours. Définissez ce que signifie « suffisamment bon » avant d’examiner les résultats. Vous éviterez de déplacer la cible après avoir vu le modèle.

Jours 11 à 15. Prenez la décision à partir de trois questions :

  1. Quel taux d’utilisation attendez-vous ?
  2. Combien de personnes s’en serviront ?
  3. Quelle est la sensibilité des informations ?

Si deux de ces trois réponses plaident nettement pour le local, l’achat commence à se justifier. Sinon, restez sur l’API. Réexaminez la décision quand les effectifs ou l’usage évoluent.

Jours 16 à 25. Construisez. Installez vLLM. Réglez le traitement par lots. Raccordez la couche de recherche documentaire. Ajoutez la supervision. Attendez-vous à ce que le réglage logiciel pèse davantage que l’assemblage des composants.

Jours 26 à 30. Testez un flux de travail mesurable avec un groupe réel d’utilisateurs. Comparez-le à la référence relevée la première semaine. Ne déployez pas à toute l’entreprise au seul motif que le serveur tourne. Commencez par un travail que vous pouvez mesurer.

12 · Questions

Questions fréquentes

Combien coûte un serveur d’IA auto-hébergé ?

Une station d’inférence à GPU unique et réellement capable revient autour de 4 855 £ HT, soit 5 826 £ TTC, sur la base de la machine RTX 5090 chiffrée chez SCAN UK en février 2026.

L’électricité ajoute environ 400 £ par an à 26,8 p/kWh.

Le coût en trésorerie sur trois ans s’établit donc autour de 6 055 £.

Posséder son infrastructure IA revient-il moins cher qu’OpenAI ou Anthropic ?

Parfois.

Pas automatiquement.

En dessous d’une dizaine d’utilisateurs intensifs réguliers, une API de premier plan est souvent moins chère et sera assurément plus simple.

À partir de vingt postes, de volumes de jetons importants ou d’une tarification de haut de gamme, la possession devient bien plus convaincante.

Une machine bien occupée peut atteindre un coût effectif proche de 0,90 £ par million de jetons, contre environ 7,39 £ par million de jetons en sortie sur une tarification de classe Sonnet.

Quel modèle une PME devrait-elle exécuter en local en 2026 ?

La gamme la plus utile se situe entre 27B et 30B.

Deux options solides : Qwen3.8 27B, Apache 2.0, sorti en août 2026, en particulier pour le travail généraliste et le code ; et NVIDIA Nemotron 3.5 Lightning 30B A3B, OpenMDW 1.1, lorsque le débit et le contexte long importent.

Les deux tiennent sur une seule carte de 32 Go en 4 bits.

Combien d’utilisateurs un GPU peut-il servir ?

Une RTX 5090 correctement réglée exécutant un modèle de 27B à 30B en 4 bits peut servir environ dix à vingt utilisateurs actifs simultanés pour du dialogue et de la recherche documentaire.

Elle peut en accueillir bien davantage au total, puisque tous ne génèrent pas en même temps.

La configuration compte énormément.

Les plafonds de jetons par lot et le réglage de la latence déterminent si un matériel identique paraît excellent ou inutilisable.

Louer un GPU dans le cloud est-il pertinent ?

Oui, au bon stade.

Louez pendant l’évaluation.

Louez quand la demande est irrégulière.

Louez quand l’investissement est difficile à obtenir.

Pour une charge de travail établie, 400 £ ou plus chaque mois deviennent difficiles à défendre lorsqu’une station possédée atteint le seuil de rentabilité en douze mois environ.

L’auto-hébergement rend-il une entreprise conforme au RGPD ?

Non.

Il vous faut toujours la bonne base légale, une AIPD lorsque le traitement présente un risque élevé, et des mentions d’information expliquant l’usage de l’IA.

Le déploiement local rend en revanche la chaîne de traitement plus facile à démontrer et supprime le prestataire d’IA externe de la relation de sous-traitance.

Faut-il attendre une baisse du prix des GPU ?

Rien n’indique aujourd’hui qu’attendre produira des prix plus bas.

Les pénuries de GDDR7 et de HBM poussent les coûts vers le haut, et les prévisions actuelles suggèrent un retour à la normale pas avant 2027 ou 2028.

La RTX PRO 6000 Blackwell en donne un bon exemple : partie d’un prix de lancement inférieur à 8 000 $, elle se négocie autour de 13 250 $, soit environ 55 % de hausse.


13 · Verdict

La conclusion commerciale

L’auto-hébergement n’est pas la réponse économique par défaut.

Pour un système peu sollicité, il peut même être la réponse la plus chère.

Pour un système très sollicité, l’économie devient très favorable.

La décision s’impose surtout lorsque trois conditions apparaissent ensemble :

  • Dix utilisateurs réguliers ou plus
  • Un volume d’IA significatif et prévisible
  • Des données que vous préféreriez ne pas envoyer vers une API externe

À vingt utilisateurs, l’argument financier devient nettement plus simple.

Pour des informations techniques contrôlées, des documents confidentiels clients ou des données réglementées, l’argument du contrôle peut à lui seul l’emporter sur le coût.

Et il n’y a aucune raison d’en faire un choix idéologique entre modèles ouverts et API de premier plan.

Utilisez les deux.

Faites tourner en local le travail répétitif, volumineux et sensible.

Envoyez ailleurs le raisonnement véritablement difficile.

C’est l’architecture que nous retiendrions aujourd’hui pour la plupart des PME établies.

Parlons-en

À propos d’Ascentis AI

Ascentis AI conçoit des systèmes d’IA opérationnels pour les entreprises.

Ils tournent sur votre infrastructure, appartiennent à vos équipes et se jugent à des résultats mesurables.

Si vous hésitez entre l’inférence locale et une API externe, nous pouvons refaire le calcul avec votre charge de travail réelle. Découvrez nos expertises ou contactez-nous.

Et si le calcul indique qu’il vaut mieux rester sur l’API, nous vous le dirons aussi.

ascentis-ai.com · erwan.lhermitte@ascentis-ai.com

Ascentis AI Ltd · Certifié Cyber Essentials · Conforme aux référentiels JSP 936 et DEFCON 658

Provenance

Sources et dates

Les prix du matériel proviennent d’un panier SCAN UK daté du 5 février 2026.

Les performances GPU s’appuient sur les tests vLLM de CloudRift publiés en 2025 et 2026.

Les chiffres de simultanéité viennent de l’étude de capacité VMware Cloud Foundation publiée le 30 avril 2026.

Les spécifications des modèles reposent sur Qwen3.8 27B, 13 août 2026 ; NVIDIA Nemotron 3.5 Lightning 30B A3B, 11 août 2026 ; et le classement Onyx des modèles auto-hébergés, 20 juillet 2026.

Les tarifs d’API reflètent les prix publiés au 14 août 2026.

Les tarifs d’électricité professionnels britanniques proviennent d’AquaSwitch, août 2026.

La conversion de devises utilise 1,3534 $ pour 1 £ au 15 août 2026.

La situation réglementaire est à jour en août 2026 et ne remplace pas un avis juridique.

Les débits en flux unique sur modèle dense sont déduits d’un calcul de bande passante mémoire. Validez-les sur votre propre charge de travail avant toute décision de dimensionnement.

Tous les calculs de coûts sont illustratifs.

Votre résultat dépendra de l’usage réel que vous ferez de la machine.