Sommaire · 5 sections
Vous voulez que ChatGPT, Claude ou Gemini réponde avec les connaissances spécifiques de votre PME (catalogue produit, procédures internes, base de connaissances client). Deux approches s'affrontent : RAG (Retrieval-Augmented Generation) ou fine-tuning. Sur 11 projets livrés en 18 mois, voici les vrais critères de choix et les pièges à éviter.
Quelle est la différence concrète entre RAG et fine-tuning ?
Les deux approches répondent au même besoin : faire en sorte qu'un modèle d'IA (Claude, GPT-4o, Gemini) connaisse votre métier. Mais elles fonctionnent de manière radicalement différente.
Fine-tuning : on prend un modèle existant (Claude, GPT-4o-mini) et on l'entraîne sur votre base de connaissance. Le résultat est un nouveau modèle, version personnalisée, qui répond à partir de ce qu'il a "appris". C'est l'équivalent d'envoyer le modèle à l'école sur vos données.
RAG : on garde le modèle standard. À chaque question d'un utilisateur, on cherche d'abord les documents pertinents de votre base de connaissance (recherche vectorielle), puis on les passe au modèle en contexte. Le modèle répond en s'appuyant sur ces documents. C'est l'équivalent d'un consultant qui a une bibliothèque ouverte à côté.
Les deux approches sont valides en théorie. En pratique, sur les 11 projets PME observés, le RAG l'a emporté 9 fois sur 10.
Combien coûte vraiment chaque approche en 2026 ?
Voici les chiffres réels pour une PME de 25-50 salariés avec une base de connaissance de 500 à 2 000 documents (typique : procédures internes, FAQ client, catalogue produit) :
Coût RAG (Retrieval-Augmented Generation) :
- Setup initial : 4 500 à 8 500€ (architecture, ingestion docs, vectorisation)
- Hébergement vector store : 25 à 80€/mois (Qdrant self-hosted, Pinecone Starter, ou Supabase Vector)
- Coût par requête : 0,02 à 0,06€ (appel modèle standard + embedding)
- Maintenance : 200 à 500€/mois (re-ingestion des nouveaux docs)
Coût fine-tuning :
- Setup initial : 15 000 à 35 000€ (préparation dataset, entraînement, évaluation)
- Coût d'entraînement par version : 800 à 4 500€ (selon volume de tokens)
- Coût par requête : 0,01 à 0,03€ (modèle custom plus léger)
- Maintenance : 2 500 à 8 000€/mois (re-entraînement régulier)
Médiane sur 11 projets : RAG coûte 4,2 fois moins sur l'année 1 et 6,8 fois moins sur l'année 2 (le re-entraînement régulier du fine-tuning est le gros poste caché).
Dans quels cas le RAG bat-il systématiquement le fine-tuning ?
Sur les 11 projets observés, le RAG l'emporte dans 5 situations :
Quand votre base de connaissance évolue souvent Procédures internes mises à jour mensuellement, catalogue produit qui change, prix qui bougent : tout fine-tuning devient obsolète en 30-60 jours. Avec RAG, vous mettez à jour vos documents et l'IA répond avec les nouvelles infos dès la requête suivante.
Quand vous voulez citer vos sources Un client demande à votre chatbot SAV "où est-ce écrit ?". Avec RAG, vous pouvez répondre "voici l'article de votre CGV qui le précise". Avec fine-tuning, l'IA a "mélangé" les connaissances et ne peut plus pointer vers une source.
Quand vous traitez plusieurs sujets distincts Un fine-tuning unique sur 500 procédures internes + 200 FAQ + 1 000 specs produit dilue le modèle. Le RAG sépare naturellement : à chaque requête, il prend les 5-10 docs les plus pertinents et ignore le reste.
Quand vous avez moins de 5 000 documents Le fine-tuning a besoin de beaucoup de données pour bien fonctionner. Sous 5 000 documents, le RAG est imbattable. Au-dessus, on commence à hésiter.
Quand vous voulez tester rapidement Un POC RAG se monte en 5-10 jours. Un POC fine-tuning sérieux prend 4-8 semaines. Pour valider rapidement si l'IA peut résoudre votre problème, RAG d'abord.
Vous hésitez entre plusieurs stacks pour votre PME ?
30 min en visio, on analyse votre contexte et on vous dit quel outil est le plus pertinent. Gratuit, sans engagement.
Quand le fine-tuning devient-il vraiment justifié ?
Sur les 11 projets, 2 ont basculé en fine-tuning après un POC RAG. Voici les vraies raisons :
1. Domaine extrêmement spécialisé avec vocabulaire propre Cabinet d'avocats avec terminologie juridique pointue, laboratoire pharmaceutique avec nomenclature chimique : un modèle standard se trompe sur les termes, même avec le bon document en RAG. Fine-tuning aide à "parler la langue".
2. Coût d'inférence à très grande échelle Au-delà de 100 000 requêtes/jour, le fine-tuning d'un modèle plus petit (Claude Haiku, GPT-4o-mini fine-tuné) devient moins cher à l'usage que le RAG sur un gros modèle. À cette échelle, la PME est devenue ETI ou plus.
3. Style de réponse très particulier Vous voulez que l'IA réponde exactement comme votre meilleur commercial répond, avec le même rythme, les mêmes tournures de phrase, le même type d'objection. Le fine-tuning capture mieux ce "style" qu'un prompt RAG.
En dehors de ces 3 situations, partir en fine-tuning est généralement de l'over-engineering qui coûte cher en setup et en maintenance.
Quelle architecture RAG fonctionne pour une PME ?
Sur les 9 projets RAG livrés, voici l'architecture qui revient systématiquement :
Couche 1 — Ingestion des documents Script qui scanne vos sources (Google Drive, Notion, SharePoint, fichiers locaux), extrait le texte, et le découpe en chunks de 500-1 000 tokens avec un overlap de 100 tokens. Outils : LangChain document loaders, ou custom Python selon vos sources.
Couche 2 — Vectorisation et stockage Chaque chunk est transformé en vecteur via un embedding model (OpenAI text-embedding-3-small, Cohere, ou local via sentence-transformers). Stockage dans un vector store : Qdrant, Pinecone, Supabase pgvector. Coût mensuel : 25-80€.
Couche 3 — Recherche au moment de la requête À chaque question utilisateur, on vectorise la question, on cherche les 5-10 chunks les plus similaires (cosine similarity), on les passe au modèle (Claude Sonnet, GPT-4o) avec un prompt système qui dit "réponds en t'appuyant uniquement sur ces extraits".
Couche 4 — Filtrage qualité Un agent fact-checker vérifie que la réponse cite bien les sources fournies et ne contient pas d'hallucination. Si REJECT, on régénère. Architecture détaillée dans notre guide setter IA B2B.
Stack production pour une PME : N8N + Qdrant + Claude API. Coût total opérationnel : 80-150€/mois pour 5 000 à 20 000 requêtes/mois. Pour un comparatif des stacks possibles, voir notre guide de choix no-code, low-code, custom dev.
Questions fréquentes
Le fine-tuning va-t-il devenir obsolète à terme ?
Pas obsolète, mais cantonné à des cas d'usage de plus en plus précis. Les modèles standards 2025-2026 sont si performants qu'ils n'ont plus besoin de fine-tuning pour la majorité des cas. Le fine-tuning reste pertinent pour les cas spécialisés cités plus haut.
Peut-on combiner RAG et fine-tuning ?
Oui, c'est même une bonne pratique avancée. Vous fine-tunez le modèle sur le style/ton de votre marque, et vous utilisez RAG pour les connaissances factuelles. Coût élevé en setup mais résultats supérieurs sur certains projets premium.
Quelle taille de base de connaissance est-elle minimale pour un RAG efficace ?
À partir de 50 documents bien structurés, le RAG commence à donner des résultats utiles. Sous 50 documents, un simple system prompt avec les infos clés suffit. Au-dessus de 10 000 documents, la qualité de la recherche vectorielle devient critique (re-ranking, hybrid search).
Comment évaluer la qualité d'un RAG en production ?
3 métriques à suivre : (1) taux de réponses sans hallucination (cible 95%+), (2) taux de citation correcte des sources (cible 85%+), (3) latence médiane (cible < 3 secondes). Un humain doit relire 50 réponses aléatoires par mois les 3 premiers mois pour calibrer.
Existe-t-il des limites RGPD au fine-tuning sur données client ?
Oui, sérieuses. Le fine-tuning intègre les données dans les poids du modèle de façon non-effaçable. Si un client demande la suppression de ses données (RGPD art. 17), vous devez re-entraîner sans lui, coûteux. Le RAG est beaucoup plus simple : vous retirez les documents du vector store, c'est fait. Pour les sujets sensibles, voir aussi notre checklist AI Act PME.
Sur 11 projets PME livrés en 18 mois, le RAG s'est imposé 9 fois sur 10 comme la solution la plus pragmatique : moins cher, plus flexible, plus facile à maintenir. Le fine-tuning n'est justifié que dans des cas très spécifiques que vous reconnaîtrez vite si vous y êtes. Le réflexe à avoir : commencez en RAG, prouvez la valeur en 5-10 jours, et basculez en fine-tuning uniquement si vous avez documenté précisément ce que le RAG ne fait pas bien chez vous.
Sources et références
2 sources externes citées dans cet article.
- [1]Qdrantqdrant.tech
- [2]OpenAI text-embedding-3-smallplatform.openai.com

Charles Gautier
Cofondateur, CTOCTO de VantaCrew. Dev senior full-stack IA, spécialiste des projets où le no-code ne suffit plus : custom dev, agents IA et intégrations complexes.
Vous aimerez aussi
Sélectionné pour vous parmi nos publications similaires.