À quoi ressemblent vraiment 13 000 documents de sinistres
96 % étaient des photos prises au téléphone. Le diagnostic exact n'était récupérable que sur un sinistre sur dix. Et lire tout le portefeuille a coûté moins de 25 dollars. Ce qu'un vrai corpus de sinistres apprend sur l'automatisation.
Sep 26, 2026
La plupart des articles sur l'automatisation des sinistres partent d'un échantillon propre, soigneusement choisi. Nous avons pris l'inverse : le portefeuille complet d'un assureur européen, un peu plus de 13 000 documents répartis sur quelque 6 500 sinistres, neuf mois de tout ce que les assurés ont réellement envoyé, sans rien écarter.
La première mesure a suffi à balayer toutes les hypothèses qui suivaient.
Que contient vraiment un portefeuille de sinistres ?
96 % ne contiennent aucun texte exploitable. Aucun texte à sélectionner, à copier ou à analyser : des photos, tout simplement. Le cabinet imprime sa facture, l'assuré la prend en photo avec son téléphone, et la photo part par mail sous forme de PDF. Résolution médiane de 256 ppp, un tiers du corpus en dessous de 200, sans compter ce qui arrive flou ou recadré de travers.
La porte d'entrée n'est donc pas le parsing mais la lecture d'une image, comme le ferait un humain, et tout le reste en dépend.
Deux constats plus discrets ont fait autant de dégâts. Alors que les noms de fichiers annonçaient 54 documents contenant à la fois une facture et une feuille de soins, le contenu en a révélé 642 ; et chercher le mot « facture » dans le texte a ramené près de 4 900 feuilles de soins, tout simplement parce que la mention pré-imprimée du formulaire dit « non accompagnée de la facture correspondante ». Classez sur le contenu, jamais sur le nom de fichier, et surtout jamais sur un mot-clé isolé.
Comment savoir si l'extraction est juste sans aucune annotation ?
Votre métier imprime déjà de quoi vous contrôler. Une facture porte son propre total : si les montants extraits le reconstituent, la lecture est très probablement bonne.
Vous disposez alors d'un moyen de contrôle gratuit, automatique et applicable à chaque document du portefeuille, bien avant que quiconque ait annoté quoi que ce soit. C'est la chose la plus utile que nous ayons faite, et elle a tranché toutes les questions de conception qui ont suivi :
- Un parseur à expressions régulières, patiemment réglé, réconciliait 16 % des factures.
- Le même modèle lisant la transcription OCR : 92 %.
- Le même modèle, le même prompt, mais regardant l'image de la page : 96 %.
Mieux vaut donc donner l'image au modèle que sa transcription, et l'écart se creuse à mesure que les factures s'allongent, ce qui trahit un problème de mise en page bien plus que de reconnaissance de caractères. L'OCR aplatit un tableau à cinq colonnes en une ligne de texte, et la colonne d'origine se perd au passage.
La plupart des métiers disposent d'un garde-fou de ce genre sans jamais s'en servir : les factures ont des totaux, les balances s'équilibrent, le SIRET porte une clé de Luhn. En privilégiant systématiquement le candidat valide au sens de Luhn, la part de SIRET correctement lus est passée de 62,6 % à 91,6 %, sans modèle, sans annuaire et sans le moindre coût.
Pourquoi lire chaque document deux fois ?
Parce que la confiance affichée par un modèle ne vaut pas preuve. Sur les feuilles de soins manuscrites, deux lecteurs indépendants extraient la pathologie déclarée, l'un depuis le texte océrisé, l'autre depuis l'image ; quand tous les deux nomment quelque chose, ils se contredisent sur près d'un tiers des formulaires, alors que chacun affiche une confiance élevée.
Un lecteur unique aurait donc paru parfaitement fiable tout en se trompant une fois sur trois. D'où la règle que nous avons retenue : une lecture ne compte que si deux lecteurs qui n'ont pas vu la réponse de l'autre tombent d'accord, le reste étant écarté. Quand un seul parvient à déchiffrer la page, un troisième modèle, d'un autre éditeur, arbitre.
Le prix à payer est lourd, puisque l'ensemble exploitable s'en trouve réduit de moitié environ, mais c'est la seule raison pour laquelle on peut faire confiance à ce qui reste.
Le corollaire compte tout autant : l'abstention doit être une sortie à part entière. Sur un document de sinistre, un diagnostic inventé est pire qu'une case vide, car plus rien en aval ne distingue une invention d'une lecture. Notre classifieur refuse donc de trancher sur 12 % des sinistres plutôt que de deviner, pour 2 % d'erreurs.
Ce qui n'a pas marché
Trois pistes dont nous attendions un gain, mesurées, puis abandonnées.
L'optimisation automatique de prompt n'a rien donné. Nous avons compilé le prompt d'extraction contre la métrique gratuite avec DSPy, 60 exemples d'entraînement et un jeu de test tenu à l'écart dans les règles, pour arriver à 85,0 % de référence et 85,0 % après compilation. Un prompt déjà affiné par une semaine d'analyse des erreurs se trouvait sur un optimum local qu'aucune recherche n'a permis de dépasser.
Normaliser les libellés a dégradé la prédiction. Nous avons construit un vocabulaire qui replie plus de 9 000 orthographes différentes en un nom canonique par produit et par acte ; donner ces noms propres au classifieur, à la place des libellés bruts du cabinet, a fait chuter la part de sinistres correctement classés de 63,0 % à 61,9 %. La normalisation sert à agréger et à comparer, pas à prédire : l'original, aussi sale soit-il, porte un détail que l'étiquette canonique écarte.
Un quart de nos erreurs venaient de la taxonomie et non du modèle. Deux catégories de notre propre liste se recouvraient, et réécrire la formulation des définitions, sans rien changer d'autre, a suffi à gagner trois points. Avant d'accuser un modèle, vérifiez donc que vos catégories s'excluent vraiment.
Combien ça coûte ?
Moins de 25 dollars pour l'ensemble du portefeuille. L'OCR local était gratuit et fonctionnait sur un simple ordinateur portable. Lire environ 6 500 factures sous forme de lignes structurées a coûté 12,68 dollars, quelque 5 500 formulaires manuscrits, lus chacun deux fois, 5,96 dollars, et le classement de chaque sinistre 1,60 dollar.
La ressource coûteuse n'a jamais été le calcul, mais l'accès au corpus, les autorisations, et la connaissance métier qui permet de savoir ce qu'est une ligne facturée. Choisissez vos modèles sur la qualité plutôt que sur le prix : à cette échelle, le prix n'est pas une contrainte réelle.
La limite honnête
Automatiser l'extraction est désormais simple ; automatiser l'interprétation ne l'est pas.
Nous voulions retrouver la pathologie exacte d'une visite à partir de la seule facture, et sur ce portefeuille cela ne fonctionne que sur un sinistre sur dix. Aucun choix de modèle n'y change quoi que ce soit, pour une raison structurelle : la facture médiane tient en deux lignes d'actes de routine, et un vaccin n'a aucune pathologie à retrouver. En posant une question plus étroite, ranger le sinistre dans l'une de dix-sept catégories au lieu de nommer la pathologie, on atteint 67 %.
Cet écart est la vraie leçon. Le pipeline n'a jamais été le point dur ; savoir à quelle question les documents peuvent réellement répondre, si.
Si vous avez une pile de documents et que vous vous demandez ce qu'on peut en tirer, la réponse se mesure en général en une journée, pour le prix d'un café. Nous menons ce type de travail d'automatisation documentaire en tranche à périmètre fixe. C'est d'ailleurs pour la même raison que nous avions publié à quoi ressemblent 30 000 lignes de données sales : on apprend toujours plus du corpus que du plan. Si vous voulez savoir ce que contient le vôtre, dites-nous ce que vous avez.