De keten achter één document
Bij een factuur, contract of intakeformulier bestaat de verwerking uit vijf schakels. Extractie is de eerste en veruit de kortste.
- Extractie — de velden uit het document halen.
- Validatie — klopt wat eruit kwam, intern en tegen je eigen gegevens?
- Matching — waar hoort dit document bij: welke leverancier, welke order, welk dossier?
- Uitzonderingen — wat gebeurt er als een van de drie hierboven niet lukt?
- Archivering — waar blijft het document, hoe lang, en wie kan erbij?
Wie alleen schakel 1 inricht, verplaatst het werk: de fouten komen nu gebundeld bij één persoon terecht in plaats van verspreid bij iedereen.
Validatie hoort bij regels, niet bij het model
Een model kan een totaalbedrag uitlezen. Of dat bedrag gelijk is aan de som van de regels, of het btw-percentage bestaat, of de datum in de toekomst ligt — dat zijn vergelijkingen. Schrijf ze als regels. Dat is goedkoper, sneller en volledig te testen, en het vangt precies de leesfouten die anders ongemerkt doorstromen.
Laat het model bovendien een twijfelniveau per veld meegeven en gebruik dat: een laag twijfelniveau gaat door de regels heen, een hoog twijfelniveau gaat direct naar een mens, ook als de regels toevallig kloppen.
Matching is waar het echt vastloopt
Een leveranciersnaam op een factuur is zelden de naam in je systeem. "Jansen Techniek B.V.", "Jansen Techniek", "J. Techniek BV" — en de bankrekening is veranderd. Matching is een gegevenskwaliteitsprobleem, geen AI-probleem, en het is vrijwel altijd de schakel die de doorlooptijd bepaalt.
Regel daarom twee dingen vóór de bouw: een manier om een match één keer te bevestigen en te onthouden, en een expliciete route voor een onbekende partij. Zonder dat eerste blijft dezelfde leverancier elke maand een uitzondering.
Uitzonderingen zijn het echte ontwerp
Reken erop dat een deel van de documenten niet volledig automatisch door de keten komt — nieuwe leveranciers, afwijkende lay-outs, scans van slechte kwaliteit. De vraag is niet hoe je dat naar nul brengt, maar hoe het uitzonderingspad eruitziet:
- Komt de uitzondering bij een persoon terecht of in een wachtrij die niemand bekijkt?
- Ziet die persoon het document en de voorgestelde velden naast elkaar, of moet hij opnieuw beginnen?
- Wordt de correctie gebruikt om de volgende keer beter te gaan, of verdwijnt hij?
Een keten met een goed uitzonderingspad en zeventig procent automatische doorstroom is meer waard dan een keten die negentig procent haalt en waarvan de rest vastloopt in een map.
Archivering is een besluit, geen bijproduct
Bepaal vooraf waar het document terechtkomt, hoe lang het bewaard blijft, wie het mag inzien en of de extractiegegevens ook bewaard worden. Voor financiële documenten gelden bewaartermijnen; voor persoonsgegevens in intakeformulieren geldt het omgekeerde — daar is te lang bewaren het risico.
Wanneer je hier niet aan moet beginnen
Bij lage volumes met veel variatie — twintig documenten per maand van vijftien verschillende afzenders — is de inrichting duurder dan het werk. En als de documenten voortkomen uit een proces dat je zelf ontwerpt, is een gestructureerd formulier goedkoper dan elke vorm van extractie achteraf. Dat klinkt flauw, maar het is vaak het juiste antwoord.