Qu’est-ce que le résumé automatique ?

Le résumé automatique est la production, par un programme, d’une version condensée d’un texte ou d’une transcription qui en conserve l’information essentielle. On distingue le résumé extractif, qui sélectionne des phrases du document, du résumé abstractif, qui reformule.

De quoi parle-t-on exactement ?

Le résumé automatique est la génération par programme d’une version courte d’un document, qui préserve l’information jugée essentielle. C’est l’une des tâches historiques du traitement automatique du langage : Hans Peter Luhn en pose les bases chez IBM en 1958, avec une méthode qui note les phrases selon la fréquence des mots significatifs qu’elles contiennent.

Le critère de réussite n’est pas la brièveté mais la conservation : un résumé de dix lignes qui omet la conclusion du document est plus mauvais qu’un résumé de trente lignes qui la garde. C’est pourquoi le taux de compression seul ne mesure rien.

Extractif ou abstractif : quelle différence ?

CritèreExtractifAbstractif
PrincipeSélectionne des phrases existantesReformule le contenu
Risque d’inventionNulRéel
FluiditéParfois heurtéeÉlevée
TraçabilitéImmédiateÀ reconstruire
Méthodes typiquesTextRank, LexRankModèles de langue
Bon usageDocuments juridiques, techniquesTranscriptions, contenus longs

TextRank, publié par Rada Mihalcea et Paul Tarau en 2004, reste la référence extractive : il applique au graphe des phrases d’un document une logique proche du PageRank de Google. Les approches abstractives ont basculé avec l’architecture Transformer introduite par Vaswani et ses coauteurs en 2017, puis les modèles de langue de grande taille à partir de 2020.

Comment mesure-t-on la qualité d’un résumé ?

Trois dimensions, souvent confondues, doivent être évaluées séparément.

  • La couverture : le résumé contient-il les points saillants du document ? C’est ce que mesurent approximativement les métriques ROUGE, proposées par Chin-Yew Lin en 2004, en comparant les n-grammes du résumé produit à ceux d’un résumé humain de référence.
  • La fidélité factuelle : chaque affirmation du résumé est-elle soutenue par le document ? Une phrase parfaitement fluide et parfaitement fausse obtient un bon score ROUGE si elle réutilise le bon vocabulaire.
  • L’utilité : le résumé permet-il de décider s’il faut lire la source, ou de s’en passer ? C’est le critère qui compte en usage réel, et le seul qu’aucune métrique automatique ne capture.

Quels sont les échecs typiques ?

L’hallucination. Un modèle abstractif peut produire une date, un chiffre ou une attribution absents de la source. Le phénomène se raréfie mais ne disparaît pas, et il est d’autant plus dangereux que le texte produit est convaincant.

La perte du désaccord. Un résumé tend à lisser les contradictions. Un article qui expose deux thèses opposées ressort souvent en une thèse moyenne qu’aucun des deux camps ne défend.

L’aplatissement de la hiérarchie. Sans indication de structure, un modèle peut accorder autant de place à une remarque incidente qu’à la conclusion principale.

La dépendance au format d’entrée. Une transcription de podcast non ponctuée, avec plusieurs locuteurs non identifiés, dégrade considérablement le résultat. La qualité du résumé plafonne à la qualité de la transcription.

Comment fiabiliser un résumé en pratique ?

  1. Contrôler l’entrée. Une transcription avec ponctuation et locuteurs identifiés produit un résumé nettement meilleur que le même audio traité brut.
  2. Exiger la traçabilité. Chaque affirmation doit renvoyer au passage source. C’est la seule vérification qui tient à l’échelle, parce qu’elle est faisable en quelques secondes.
  3. Adapter la longueur au document. Un ratio fixe est une erreur : une interview d’une heure et un rapport dense de dix pages n’ont pas la même densité informationnelle.
  4. Conserver la source. Un résumé sans accès au document d’origine est un cul-de-sac dès que la question devient précise.
  5. Vérifier chiffres et noms propres. Ce sont les éléments les plus utiles et les plus souvent altérés.

À quelles conditions le résumé devient-il utilisable au quotidien ?

Un résumé isolé a peu de valeur : il évite une lecture, une fois. La valeur apparaît quand les résumés s’accumulent dans un même espace et deviennent comparables — quand il devient possible de voir qu’une notion revient dans six sources et que deux d’entre elles se contredisent.

C’est la logique retenue par Synthiz : les sources — articles, vidéos, podcasts, PDF, flux RSS — sont transcrites puis synthétisées avec citations sourcées rattachées au passage exact, et versées dans une « mémoire » thématique où les concepts communs se relient d’une source à l’autre. Le résumé cesse d’être un livrable jetable pour devenir une brique vérifiable d’un ensemble.

Questions fréquentes

Quelle est la différence entre résumé extractif et abstractif ?
Le résumé extractif sélectionne et recopie des phrases du document source : il ne peut rien inventer, mais produit un texte parfois heurté. Le résumé abstractif reformule avec ses propres mots : il se lit mieux, mais peut introduire des affirmations absentes de la source.
Un résumé automatique peut-il inventer des informations ?
Oui, c’est le risque principal des méthodes abstractives, désigné sous le terme d’hallucination. La parade opérationnelle consiste à exiger que chaque affirmation du résumé soit rattachée à un passage précis de la source, vérifiable d’un clic.
Comment évalue-t-on la qualité d’un résumé automatique ?
Les métriques historiques ROUGE, introduites par Chin-Yew Lin en 2004, mesurent le recouvrement de n-grammes avec un résumé de référence. Elles sont aujourd’hui jugées insuffisantes et complétées par des évaluations de fidélité factuelle et par jugement humain.

Publié le 05/09/2026