Pipeline OCR comptable anglais-khmer vers ERP

Ingestion de pièces comptables multilingues vers l'ERP, approche benchmark-first.

Pour un cabinet comptable en Asie du Sud-Est, ce projet a mis en place un pipeline d’ingestion documentaire : des pièces comptables en anglais et en khmer, reçues en vrac (scans, photos, PDF), transformées en écritures structurées dans l’ERP.

La difficulté n’était pas l’OCR en soi, mais le khmer : une écriture sans espaces entre les mots, mal servie par les moteurs OCR généralistes, sur des documents de qualité très variable. Plutôt que de parier sur un outil, le projet a commencé par un benchmark : un jeu de documents réels annotés, plusieurs moteurs et prétraitements comparés sur des métriques mesurables, et une décision fondée sur les chiffres plutôt que sur les promesses des éditeurs.

Le pipeline retenu enchaîne prétraitement d’image, OCR spécialisé par langue, extraction des champs métier (dates, montants, tiers, taxes) et contrôles de cohérence avant injection dans l’ERP. Tout document douteux part en file de validation humaine plutôt qu’en écriture silencieusement fausse.

Résultat : une saisie manuelle réduite à la validation d’exceptions, une traçabilité complète de chaque pièce, et un benchmark réutilisable le jour où un meilleur moteur OCR apparaît.

← tous les projets