De quoi parle-t-on exactement ?
Un assistant IA sur vos documents est un outil qui retrouve dans vos fichiers (procédures, contrats, fiches produits, comptes rendus) les passages utiles à une question, puis demande à un modèle de langage de rédiger la réponse à partir de ces seuls passages.
Cette technique s'appelle le RAG, ou génération augmentée par récupération. Elle évite d'entraîner un modèle sur vos données : les documents restent dans votre base, et seuls les extraits utiles partent vers le modèle à chaque question. Exemple : un technicien demande le couple de serrage d'une pompe ; l'assistant retrouve la page de la notice concernée et répond en citant sa source.
Quels sont les postes de coût de la mise en place ?
La mise en place pèse plus lourd que l'usage du modèle, parce que la qualité des réponses dépend d'abord de l'état des documents et des réglages.
| Poste | Ce qu'il comprend | Ce qui le fait grossir |
|---|---|---|
| Préparation des documents | Inventaire, retrait des versions obsolètes, extraction du texte | PDF scannés, tableaux, schémas, documents qui se contredisent |
| Découpage et indexation | Découpage en passages, indexation, mise à jour automatique | Corpus qui change chaque jour, sources multiples (drive, GED, messagerie) |
| Choix du modèle et tests | Jeu de questions de référence, mesure de l'exactitude | Obligation de citer la source, plusieurs langues |
| Interface | Fenêtre de dialogue dans un outil existant ou page dédiée | Intégration dans le logiciel métier ou une application mobile |
| Droits d'accès | Chaque utilisateur n'interroge que les documents qu'il peut lire | Droits par service, par client ou par dossier |
| Journalisation | Historique des questions, des sources utilisées et des réponses | Exigences d'audit, durée de conservation encadrée |
| Hébergement | Base documentaire, index, serveur applicatif | Localisation imposée des données, haute disponibilité |
Selon La Fabrique du Net, qui a analysé 89 projets d'intelligence artificielle menés par des agences, la médiane s'établit à 8 000 €, 39 % des projets restent sous 5 000 € au stade de la preuve de concept, et la médiane passe de 3 000 € pour une TPE à 15 000 € pour une PME ou une ETI. Le baromètre 2026 replace ces chiffres parmi les autres types de projets.
Combien coûte l'usage d'un modèle de langage ?
L'usage d'un modèle de langage se paie au token, l'unité de découpage du texte, avec un prix pour le texte envoyé au modèle (entrée) et un prix plus élevé pour le texte qu'il produit (sortie).
| Éditeur | Modèle | Entrée, par million de tokens | Sortie, par million de tokens |
|---|---|---|---|
| Anthropic | Claude Haiku 4.5 | 1 $ | 5 $ |
| Anthropic | Claude Sonnet 5.5 | 2 $ | 10 $ |
| Anthropic | Claude Opus 5.5 | 4 $ | 20 $ |
| Mistral AI | Mistral Small 4 | 0,15 $ | 0,60 $ |
| Mistral AI | Mistral Large 3 | 0,50 $ | 1,50 $ |
| Mistral AI | Mistral Medium 3.5 | 1,50 $ | 7,50 $ |
| OpenAI | gpt-6-luna | 0,10 $ | 0,50 $ |
| OpenAI | gpt-6.1-sol | 2 $ | 10 $ |
| OpenAI | gpt-6-astra | 10 $ | 50 $ |
Tarifs publics relevés en octobre 2026 sur les pages de prix officielles, en dollars US, tarif standard (contexte court pour OpenAI). Deux options réduisent la facture : chez Anthropic, le traitement par lots est facturé moitié prix et la relecture d'un contexte mis en cache coûte un dixième du prix d'entrée, voire moins pour certains modèles. Chez OpenAI, l'outil de recherche dans les fichiers est facturé 2,50 dollars les 1 000 appels, plus 0,10 dollar par Go et par jour de stockage au-delà du premier Go gratuit.
Exemple de calcul : 2 000 questions par mois
Pour une PME où 40 personnes posent chacune 50 questions par mois, chaque question envoyant environ 6 000 tokens au modèle (la question et les extraits retrouvés) pour une réponse de 500 tokens, le coût mensuel du modèle varie de 1 à 100 selon le choix :
| Modèle | Coût par question | Coût pour 2 000 questions |
|---|---|---|
| gpt-6-luna | 0,00085 $ | 1,70 $ |
| Mistral Small 4 | 0,0012 $ | 2,40 $ |
| Claude Haiku 4.5 | 0,0085 $ | 17,00 $ |
| Claude Sonnet 5.5 ou gpt-6.1-sol | 0,017 $ | 34,00 $ |
| Claude Opus 5.5 | 0,034 $ | 68,00 $ |
| gpt-6-astra | 0,085 $ | 170,00 $ |
Calcul sur les tarifs standard du tableau précédent, sans cache ni traitement par lots, hors indexation et hébergement. Le volume de 6 000 tokens est une hypothèse : pour un même texte, il varie selon le tokeniseur de chaque modèle, Anthropic indiquant par exemple environ 30 % de tokens en plus pour ses modèles Claude 4.7 et suivants. Deux enseignements. Le coût du modèle reste modeste devant celui de la mise en place et de la maintenance. Et le premier levier d'économie est la quantité d'extraits envoyés à chaque question : en envoyer deux fois moins réduit la facture d'un peu plus d'un tiers dans cet exemple (35 à 38 % selon le modèle). Un petit modèle peut suffire pour retrouver une procédure ; un modèle plus puissant se justifie pour comparer deux contrats.
Faut-il faire traiter les données en Europe ?
Dès que vos documents contiennent des données personnelles, l'éditeur du modèle et l'hébergeur les traitent pour votre compte : ce sont des sous-traitants au sens du RGPD.
L'article 28 du RGPD, publié par la CNIL, prévoit que le traitement par un sous-traitant est régi par un contrat ou un autre acte juridique qui en définit l'objet, la durée, la nature, la finalité, le type de données et les catégories de personnes concernées. Avant de choisir un modèle, vérifiez dans la documentation de l'éditeur où les données sont traitées, combien de temps elles sont conservées et si elles servent à l'entraînement. Le lieu de traitement peut aussi changer le prix : chez Anthropic, imposer un traitement aux seuls États-Unis multiplie le tarif par 1,1 pour les modèles Claude 4.6 et suivants. Les hébergements européens sont comparés dans le guide hébergement souverain, et les obligations propres à l'IA dans le guide AI Act pour les PME.
Quelles alternatives prêtes à l'emploi existent ?
Avant de financer un assistant sur mesure, vérifiez si un abonnement professionnel à un assistant du marché couvre déjà le besoin.
| Option | Ce que vous payez | Quand elle suffit | Quand passer au sur mesure |
|---|---|---|---|
| Abonnement professionnel à un assistant (ChatGPT, Claude, Microsoft Copilot) | Un prix par utilisateur et par mois | Corpus limité, mêmes droits pour tous | Droits par service ou par client, réponses attendues dans vos outils |
| Fonction d'IA de votre GED ou de votre suite bureautique | Une option de la licence existante | Documents déjà centralisés dans cet outil | Sources réparties dans plusieurs outils |
| Assistant sur mesure | Un projet de mise en place, puis l'usage au token | Sources multiples, droits fins, intégration au logiciel métier | Sans objet |
Le comparatif ChatGPT Enterprise ou assistant IA sur mesure détaille ce choix.
Comment YMHB Web cadre un assistant IA sur vos documents ?
YMHB Web commence par le corpus et les questions, pas par le modèle : inventaire des documents, jeu de questions de référence rédigé avec les futurs utilisateurs, mesure des réponses avant d'élargir.
Le modèle se choisit ensuite sur ce jeu de questions, en comparant exactitude et coût par question. Les droits d'accès, la journalisation et la citation des sources sont conçus dès le départ, car les ajouter après coup oblige à revoir l'architecture. Sur le site de pièces Peugeot Motocycles, YMHB Web a ainsi intégré un assistant conversationnel connecté au catalogue. Le code appartient au client au paiement intégral, ce qui permet de changer de modèle ou de prestataire sans repartir de zéro.
Questions fréquentes
- Combien coûte une question posée à un assistant IA ?
- Aux tarifs publics relevés en octobre 2026, une question qui envoie 6 000 tokens au modèle et reçoit 500 tokens en réponse coûte environ 0,12 centime de dollar avec Mistral Small 4, 0,85 centime avec Claude Haiku 4.5, 1,7 centime avec Claude Sonnet 5.5 et 8,5 centimes avec gpt-6-astra. Le coût dépend surtout de la quantité d'extraits envoyés et du modèle choisi.
- Faut-il entraîner un modèle d'IA sur ses documents ?
- Non, dans la plupart des cas il n'est pas nécessaire d'entraîner un modèle d'IA sur ses documents. La technique dite RAG retrouve les passages utiles dans votre base documentaire et les transmet au modèle au moment de la question. Elle se met à jour dès qu'un document change, évite un coûteux entraînement et permet de citer la source de chaque réponse.
- Un assistant IA peut-il respecter les droits d'accès aux documents ?
- Oui, un assistant IA sur mesure respecte les droits d'accès si le filtrage a lieu avant l'envoi au modèle : la recherche ne retourne que les passages des documents que l'utilisateur a le droit de lire. Ce filtrage se conçoit dès le départ, à partir des droits existants dans la GED ou le logiciel métier, et se vérifie par des tests avec des comptes de profils différents.
- Combien coûte un projet d'intelligence artificielle pour une PME ?
- Selon La Fabrique du Net, qui a analysé 89 projets d'intelligence artificielle menés par des agences, la médiane atteint 15 000 € pour une PME ou une ETI en 2026, contre 3 000 € pour une TPE. Sur l'ensemble des projets, 39 % restent sous 5 000 €, au stade de la preuve de concept. La source ne détaille ni l'usage du modèle ni la maintenance, à budgéter à part.
- Quel modèle de langage choisir pour un assistant documentaire ?
- Le modèle de langage d'un assistant documentaire se choisit sur un jeu de questions de référence tiré de votre activité, en comparant l'exactitude des réponses et le coût par question. Un petit modèle peut suffire pour retrouver une procédure ; un modèle plus puissant se justifie pour comparer des documents ou raisonner sur des échéances. Le comparatif de YMHB Web entre Mistral, OpenAI et Anthropic détaille les autres critères.
À lire aussi
Sources
- Anthropic, Claude Platform Docs, « Pricing » (tarifs publics relevés en octobre 2026)
- Mistral AI, documentation, « Pricing » (tarifs publics relevés en octobre 2026)
- OpenAI, API Docs, « Pricing » (tarifs publics relevés en octobre 2026)
- La Fabrique du Net, « Tarifs des agences IA en 2026 » (89 projets)
- CNIL, texte du RGPD, chapitre IV, article 28 « Sous-traitant »