KognitCapture
Capturez, extrayez et structurez les données de tout document — sur votre propre infrastructure, sans compteur de pages qui tourne.
Une plateforme API-first de capture intelligente de documents. Les documents arrivent par treize canaux, traversent un pipeline d'image en seize étapes, sont lus par l'OCR local, des modèles locaux ou douze fournisseurs distants, sont mappés sur des modèles versionnés, relus par des personnes là où c'est utile, et livrés à treize types de systèmes en aval. Conçue comme un remplacement moderne des suites de capture historiques.
La capture de documents se facture à la page et se livre au trimestre.
Les plateformes historiques de cette catégorie partagent deux caractéristiques. Elles vous facturent à la page, si bien que plus vous en extrayez de valeur, plus vous payez. Et elles nécessitent huit à douze semaines de consulting spécialisé pour configurer un seul type de document. Pendant ce temps, les alternatives cloud exigent que vos factures, formulaires de sinistre et documents d'identité quittent vos murs — ce qui, pour un nombre croissant d'acheteurs, met fin à la conversation.
Une seule plateforme, sur votre matériel, avec une économie inversée.
Fonctionnalités
- Treize canaux d'import : upload, REST, SFTP, FTP, dossier surveillé, e-mail, Kafka, RabbitMQ, ZeroMQ, webhook, script, plugin, jeu de données.
- Numérisation réseau sans pilote via détection eSCL côté serveur, ou branchement direct via le navigateur — rien à installer au poste de scan.
- Les sessions Scan Hub survivent à un portable fermé : réordonner, pivoter, supprimer, rescanner, séparer, puis soumettre en un seul lot.
- Huit modes de reconnaissance combinant Tesseract 5, texte PDF natif, mode hybride et chargement de données ouvertes.
- 129 packs de langues OCR intégrés, moteurs maintenus à chaud, aucun service OCR externe.
- Modèles locaux en interne, plus douze fournisseurs distants derrière une seule interface avec bascule automatique.
- Lecture de codes-barres et QR sur un chemin de décodage dédié — jamais déduite du texte OCR.
- 31 types de champs et 10 méthodes d'extraction — zone, recherche d'étiquette, regex, proximité de mot-clé, modèle, manuel, texte d'ancrage, fichier compagnon, classification, mapping XML.
- Modèles versionnés auxquels les intégrations s'ancrent, pour qu'un changement de conception ne casse jamais une interface en production.
- Extraction de tableaux et de lignes de détail, avec zones de colonnes, regroupement de lignes, détection d'en-têtes et continuation entre pages.
- Génération de modèle à partir d'une seule page d'exemple, et apprentissage à partir des corrections des opérateurs.
- Quatre frameworks de machine learning et 29 types de modèles exécutés en interne — aucun service d'inférence externe.
- Scission de document sur nombre de pages fixe, page blanche, correspondance de code-barres, détection par modèle, en-tête/pied de page ou feuilles de séparation physiques.
- Jeux de données de référence pour la recherche, le preréplissage et la validation, ainsi que des variantes de modèle par fournisseur.
- 16 types d'étapes de flux, de l'import et de l'OCR jusqu'aux hubs de vérification, à l'export et aux scripts personnalisés.
- Un concepteur visuel où le schéma constitue le flux, avec des portes de décision basées sur les propriétés du document et les valeurs de champs.
- Trois hubs opérateurs — Vérification, Traitement et Scan — avec l'image de la page à côté des champs et un remplissage en un clic.
- Trace par champ : valeur reconnue brute, valeur d'origine, qui l'a vérifiée et quand.
- 14 types de règles de validation, du non-vide et des plages jusqu'au checksum, à l'expression, au script, à l'appel REST et à la requête en base.
- Scripts personnalisés en JavaScript, Groovy ou Java, isolés (sandbox), versionnés et testables sur des documents d'exemple.
- Verrouillage à la prise en charge pour qu'aucun doublon d'opérateur ne touche le même travail ; liens de relecture publics pour des tiers sans compte.
- Treize destinations d'export et huit formats, dont le PDF consultable et le PDF/A-2b construits à partir de la géométrie des mots conservée.
- Mapping de champs par objectif d'export — les champs non mappés sont délibérément écartés.
- Onze types de connexions externes, chacun avec un assistant de configuration et une action de test.
- Coffre-fort d'identifiants chiffré par projet.
- SDK de plugins pour des étapes de flux, importateurs et exportateurs compilés, avec leurs propres migrations et points d'accès.
- Un serveur Model Context Protocol natif avec environ 109 outils sélectionnés couvrant projets, documents, vérification, reconnaissance, modèles, flux et administration.
- OAuth 2.1 avec enregistrement dynamique du client et un écran de consentement explicite.
- Outils à portée limitée et à niveaux de risque, avec un canal d'audit séparé qui enregistre aussi les lectures des agents, pas seulement les écritures.
- Hubs de Vérification et de Scan intégrables dans votre propre produit, en iframe, derrière une clé API, une session de courte durée et une origine nommée.
- Des nœuds de cluster conscients des tâches et des capacités qui réclament le travail sans contention — mettre un nœud en drain, le reprendre, ou le dédier à l'OCR, à l'export ou à l'import.
Ce qu'il fait
- 01Aucun verrou de licence, aucun compteur de pages — le coût marginal d'une page est l'électricité nécessaire pour la traiter.
- 02Six modèles sectoriels provisionnent un projet complet en une seule transaction, contre une norme du secteur de huit à douze semaines.
- 03L'OCR et les modèles locaux gardent les documents réglementés sur votre propre infrastructure, les fournisseurs d'IA distants restant une option, jamais une obligation.