Qu’est-ce qu’une base de connaissances ?

Une base de connaissances est un espace structuré où l’information d’une organisation ou d’une personne est stockée, organisée et rendue consultable. Sa valeur ne tient pas au volume accumulé mais à la capacité de retrouver la bonne information au moment où elle est nécessaire.

Une archive de classeurs gris et de papiers au sol, traversée par une lentille qui la restitue en un réseau clair de documents reliés.

De quoi parle-t-on exactement ?

Une base de connaissances est un ensemble organisé d’informations, conçu pour être interrogé. Cette dernière précision est décisive : ce qui distingue une base de connaissances d’un dossier de documents, c’est qu’elle est structurée en fonction des questions qu’on lui posera, et non en fonction de l’ordre dans lequel les contenus sont arrivés.

Le terme vient de l’intelligence artificielle symbolique des années 1970, où la knowledge base désignait le corps de faits et de règles qu’un système expert consultait — MYCIN, développé à Stanford entre 1972 et 1976 pour le diagnostic des infections bactériennes, en est l’exemple canonique. L’usage s’est ensuite élargi à toute documentation structurée.

Quelles sont les trois grandes formes ?

FormePublicContenu typiqueCritère de réussite
PubliqueClients, utilisateursFAQ, guides, dépannageBaisse des tickets support
InterneSalariés, équipesProcédures, décisions, runbooksAutonomie sans solliciter un collègue
PersonnelleUne personneLectures, notes, sourcesRéutilisation dans une production

Ces trois formes échouent de la même manière et pour la même raison. Le contenu existe, mais la personne qui le cherche ne le trouve pas, alors elle refait le travail ou pose la question à quelqu’un. Chaque occurrence de ce scénario réduit un peu plus la probabilité que quiconque consulte la base la fois suivante.

Comment construire une base qui sera réellement consultée ?

  1. Partir des questions, pas des documents. Lister les vingt questions réellement posées, puis écrire les pages qui y répondent. L’ordre inverse produit une documentation complète que personne n’interroge.
  2. Une page par question. Une page qui traite six sujets ne remontera bien pour aucun d’entre eux et sera abandonnée en cours de lecture.
  3. Dater et attribuer. Une page sans date de mise à jour ni auteur ne peut pas être évaluée par son lecteur, qui devra la vérifier ailleurs.
  4. Prévoir la péremption. Fixer une revue périodique et archiver sans état d’âme. Le contenu périmé est plus coûteux que le contenu manquant, parce qu’il induit en erreur.
  5. Mesurer les recherches infructueuses. Les requêtes à zéro résultat sont la liste de courses la plus fiable pour savoir quoi écrire ensuite.

Pourquoi la recherche est-elle le point critique ?

Une base de connaissances est consultée par la recherche, pas par la navigation. Passé quelques centaines d’entrées, plus personne ne parcourt l’arborescence : on tape trois mots et on juge la base sur les cinq premiers résultats. La qualité du moteur détermine donc la valeur perçue de l’ensemble du contenu.

Le problème est plus difficile qu’il n’y paraît. La recherche par mot-clé exige que l’utilisateur devine le vocabulaire employé par le rédacteur — c’est le vocabulary problem, quantifié dès 1987 par George Furnas et ses coauteurs : deux personnes choisissent le même terme pour désigner le même objet dans moins de 20 % des cas.

La recherche sémantique corrige ce défaut mais en introduit un autre, celui du seuil. Sur un corpus mesuré de 948 synthèses vectorisées avec le modèle bge-m3, la requête « féodalisme » — cinq documents pertinents en base — plafonne à 0,510 de similarité, tandis qu’une requête ne correspondant à rien plafonne à 0,424. Neuf centièmes séparent les deux situations. Un article sur Cléopâtre marque encore 0,350 face à « féodalisme », parce que deux textes dans la même langue partagent toujours un plancher de ressemblance. Il n’existe pas de zéro naturel, donc pas de seuil universel.

Comment obtenir une recherche qui rend vraiment les sources ?

La réponse tient en deux mécanismes. D’abord, fusionner les deux signaux : le sémantique retrouve les formulations différentes, le lexical garantit les termes exacts, noms propres et références compris. Ensuite, cesser de juger la pertinence sur une valeur absolue et la juger sur l’écart : un document pertinent se détache de la distribution des scores de sa propre requête, alors que sur une requête sans réponse tous les candidats se tassent ensemble.

C’est le fonctionnement retenu par Synthiz. La recherche y combine sémantique et lexical sur des scores normalisés, et la pertinence est calculée par requête comme mean + z*stddev sur la distribution du corpus, complétée d’un minimum absolu qui évite qu’un document isolé ne se détache artificiellement quand rien ne correspond. En pratique, on retrouve une source sans se souvenir des mots employés pour la décrire, et une requête sans réponse renvoie zéro résultat plutôt que du bruit — la seule réponse honnête, et celle qui maintient la confiance dans la base.

Questions fréquentes

Quels sont les types de bases de connaissances ?
On en distingue trois. La base publique, destinée aux clients — centres d’aide et FAQ. La base interne, destinée aux équipes — procédures et documentation. La base personnelle, destinée à une seule personne — notes, lectures et sources. Les trois posent le même problème de récupération.
Pourquoi les bases de connaissances internes sont-elles si peu consultées ?
Presque toujours pour la même raison : la recherche ne rend pas ce qu’on cherche. Un contenu qui existe mais qu’on ne retrouve pas équivaut à un contenu absent, avec le coût d’entretien en plus. Les équipes reposent alors la question à un collègue, ce qui achève de dévaluer la base.
Une base de connaissances doit-elle être exhaustive ?
Non, et l’exhaustivité est souvent contre-productive. Une base de 200 pages à jour est plus utile qu’une base de 2 000 pages dont la moitié est périmée, parce que la seconde oblige à vérifier chaque résultat avant de s’y fier.

Publié le 05/09/2026