Gen8

Documenten verwerken: extractie is stap één

Kennis

Demonstraties van documentverwerking laten altijd de extractie zien, omdat die indrukwekkend is en snel werkt. De tijd gaat zitten in validatie, matching en uitzonderingen — en daar wordt beslist of het iets oplevert.

De keten achter één document

Bij een factuur, contract of intakeformulier bestaat de verwerking uit vijf schakels. Extractie is de eerste en veruit de kortste.

  1. Extractie — de velden uit het document halen.
  2. Validatie — klopt wat eruit kwam, intern en tegen je eigen gegevens?
  3. Matching — waar hoort dit document bij: welke leverancier, welke order, welk dossier?
  4. Uitzonderingen — wat gebeurt er als een van de drie hierboven niet lukt?
  5. Archivering — waar blijft het document, hoe lang, en wie kan erbij?

Wie alleen schakel 1 inricht, verplaatst het werk: de fouten komen nu gebundeld bij één persoon terecht in plaats van verspreid bij iedereen.

Validatie hoort bij regels, niet bij het model

Een model kan een totaalbedrag uitlezen. Of dat bedrag gelijk is aan de som van de regels, of het btw-percentage bestaat, of de datum in de toekomst ligt — dat zijn vergelijkingen. Schrijf ze als regels. Dat is goedkoper, sneller en volledig te testen, en het vangt precies de leesfouten die anders ongemerkt doorstromen.

Laat het model bovendien een twijfelniveau per veld meegeven en gebruik dat: een laag twijfelniveau gaat door de regels heen, een hoog twijfelniveau gaat direct naar een mens, ook als de regels toevallig kloppen.

Matching is waar het echt vastloopt

Een leveranciersnaam op een factuur is zelden de naam in je systeem. "Jansen Techniek B.V.", "Jansen Techniek", "J. Techniek BV" — en de bankrekening is veranderd. Matching is een gegevenskwaliteitsprobleem, geen AI-probleem, en het is vrijwel altijd de schakel die de doorlooptijd bepaalt.

Regel daarom twee dingen vóór de bouw: een manier om een match één keer te bevestigen en te onthouden, en een expliciete route voor een onbekende partij. Zonder dat eerste blijft dezelfde leverancier elke maand een uitzondering.

Uitzonderingen zijn het echte ontwerp

Reken erop dat een deel van de documenten niet volledig automatisch door de keten komt — nieuwe leveranciers, afwijkende lay-outs, scans van slechte kwaliteit. De vraag is niet hoe je dat naar nul brengt, maar hoe het uitzonderingspad eruitziet:

Een keten met een goed uitzonderingspad en zeventig procent automatische doorstroom is meer waard dan een keten die negentig procent haalt en waarvan de rest vastloopt in een map.

Archivering is een besluit, geen bijproduct

Bepaal vooraf waar het document terechtkomt, hoe lang het bewaard blijft, wie het mag inzien en of de extractiegegevens ook bewaard worden. Voor financiële documenten gelden bewaartermijnen; voor persoonsgegevens in intakeformulieren geldt het omgekeerde — daar is te lang bewaren het risico.

Wanneer je hier niet aan moet beginnen

Bij lage volumes met veel variatie — twintig documenten per maand van vijftien verschillende afzenders — is de inrichting duurder dan het werk. En als de documenten voortkomen uit een proces dat je zelf ontwerpt, is een gestructureerd formulier goedkoper dan elke vorm van extractie achteraf. Dat klinkt flauw, maar het is vaak het juiste antwoord.

Volgende stap

Wat je hiermee doet

Pak vijftig documenten van de afgelopen maand en tel hoeveel er zouden afvallen op validatie en hoeveel op matching. Die verhouding vertelt je of je eerst aan je stamgegevens moet werken of meteen aan de keten — en dat scheelt maanden. Hoe die keten er voor inkoopfacturen uitziet, staat bij facturen verwerken en boeken.

Veelgestelde vragen

Hoe nauwkeurig is de extractie?

Dat hangt af van het documenttype en de kwaliteit van de scan, en het is niet het getal dat je moet volgen. Meet liever hoeveel documenten er zonder menselijke tussenkomst door de héle keten komen.

Moet er altijd iemand naar elke factuur kijken?

Niet naar elke factuur, maar wel naar elke factuur die een regel raakt: onbekende leverancier, afwijkend bedrag, gewijzigde bankgegevens. Dat laatste is een bekende fraudevector en hoort altijd langs een mens.

Kunnen we beginnen zonder onze stamgegevens op te schonen?

Ja, maar reken dan op veel uitzonderingen in de matchingstap. Het opschonen gebeurt dan alsnog, alleen verspreid en onder tijdsdruk in plaats van vooraf.

Wil je dit op je eigen proces toepassen?

Breng één proces mee naar een gesprek. We beoordelen geschiktheid, risico en wat de eerste stap kost.

  • Reactie binnen één werkdag
  • Geen verplichtingen