Produits · 03 · Capture intelligente de documents
← Tous les produits

KognitCapture

Capturez, extrayez et structurez les données de tout document — sur votre propre infrastructure, sans compteur de pages qui tourne.

Une plateforme API-first de capture intelligente de documents. Les documents arrivent par treize canaux, traversent un pipeline d'image en seize étapes, sont lus par l'OCR local, des modèles locaux ou douze fournisseurs distants, sont mappés sur des modèles versionnés, relus par des personnes là où c'est utile, et livrés à treize types de systèmes en aval. Conçue comme un remplacement moderne des suites de capture historiques.

632Points d'accès REST
31Types de champs
109Outils agent
€0Coût marginal par page
Le problème

La capture de documents se facture à la page et se livre au trimestre.

Les plateformes historiques de cette catégorie partagent deux caractéristiques. Elles vous facturent à la page, si bien que plus vous en extrayez de valeur, plus vous payez. Et elles nécessitent huit à douze semaines de consulting spécialisé pour configurer un seul type de document. Pendant ce temps, les alternatives cloud exigent que vos factures, formulaires de sinistre et documents d'identité quittent vos murs — ce qui, pour un nombre croissant d'acheteurs, met fin à la conversation.

01
Compteurs de pages
La croissance du volume devient un problème de coût plutôt qu'un gain d'efficacité.
02
Migrations forcées
Les fournisseurs retirent la plateforme sur laquelle vous avez construit et vous laissent un projet de reconstruction.
03
Fuite de données
La capture cloud signifie envoyer des documents réglementés vers le tenant de quelqu'un d'autre.
04
Dépendance au consulting
Chaque nouveau type de document est une demande de changement, pas une configuration.
La solution

Une seule plateforme, sur votre matériel, avec une économie inversée.

01
Aucun verrou de licence à l'exécution
Il n'y a ni serveur de licence, ni contrôle de droits, ni compteur de pages. Faites tourner l'OCR et les modèles en local, et le coût marginal d'une page devient l'électricité nécessaire pour la traiter.
02
Des modèles prêts à l'emploi, pas des projets
Six kits sectoriels provisionnent en une seule transaction un projet complet et opérationnel — flux, étapes, routage, point d'upload, objectif d'export et un modèle entièrement structuré.
03
Rien ne sort du bâtiment
Tesseract et les modèles locaux tournent en interne ; le fonctionnement en réseau isolé (air-gapped) est un déploiement pris en charge, pas un contournement. Les fournisseurs de modèles distants restent une option, jamais une obligation.

Fonctionnalités

01Capture & reconnaissance
  • Treize canaux d'import : upload, REST, SFTP, FTP, dossier surveillé, e-mail, Kafka, RabbitMQ, ZeroMQ, webhook, script, plugin, jeu de données.
  • Numérisation réseau sans pilote via détection eSCL côté serveur, ou branchement direct via le navigateur — rien à installer au poste de scan.
  • Les sessions Scan Hub survivent à un portable fermé : réordonner, pivoter, supprimer, rescanner, séparer, puis soumettre en un seul lot.
  • Huit modes de reconnaissance combinant Tesseract 5, texte PDF natif, mode hybride et chargement de données ouvertes.
  • 129 packs de langues OCR intégrés, moteurs maintenus à chaud, aucun service OCR externe.
  • Modèles locaux en interne, plus douze fournisseurs distants derrière une seule interface avec bascule automatique.
  • Lecture de codes-barres et QR sur un chemin de décodage dédié — jamais déduite du texte OCR.
02Modèles & classification
  • 31 types de champs et 10 méthodes d'extraction — zone, recherche d'étiquette, regex, proximité de mot-clé, modèle, manuel, texte d'ancrage, fichier compagnon, classification, mapping XML.
  • Modèles versionnés auxquels les intégrations s'ancrent, pour qu'un changement de conception ne casse jamais une interface en production.
  • Extraction de tableaux et de lignes de détail, avec zones de colonnes, regroupement de lignes, détection d'en-têtes et continuation entre pages.
  • Génération de modèle à partir d'une seule page d'exemple, et apprentissage à partir des corrections des opérateurs.
  • Quatre frameworks de machine learning et 29 types de modèles exécutés en interne — aucun service d'inférence externe.
  • Scission de document sur nombre de pages fixe, page blanche, correspondance de code-barres, détection par modèle, en-tête/pied de page ou feuilles de séparation physiques.
  • Jeux de données de référence pour la recherche, le preréplissage et la validation, ainsi que des variantes de modèle par fournisseur.
03Flux de travail & relecture
  • 16 types d'étapes de flux, de l'import et de l'OCR jusqu'aux hubs de vérification, à l'export et aux scripts personnalisés.
  • Un concepteur visuel où le schéma constitue le flux, avec des portes de décision basées sur les propriétés du document et les valeurs de champs.
  • Trois hubs opérateurs — Vérification, Traitement et Scan — avec l'image de la page à côté des champs et un remplissage en un clic.
  • Trace par champ : valeur reconnue brute, valeur d'origine, qui l'a vérifiée et quand.
  • 14 types de règles de validation, du non-vide et des plages jusqu'au checksum, à l'expression, au script, à l'appel REST et à la requête en base.
  • Scripts personnalisés en JavaScript, Groovy ou Java, isolés (sandbox), versionnés et testables sur des documents d'exemple.
  • Verrouillage à la prise en charge pour qu'aucun doublon d'opérateur ne touche le même travail ; liens de relecture publics pour des tiers sans compte.
04Livraison & intégration
  • Treize destinations d'export et huit formats, dont le PDF consultable et le PDF/A-2b construits à partir de la géométrie des mots conservée.
  • Mapping de champs par objectif d'export — les champs non mappés sont délibérément écartés.
  • Onze types de connexions externes, chacun avec un assistant de configuration et une action de test.
  • Coffre-fort d'identifiants chiffré par projet.
  • SDK de plugins pour des étapes de flux, importateurs et exportateurs compilés, avec leurs propres migrations et points d'accès.
05Conçu pour les agents
  • Un serveur Model Context Protocol natif avec environ 109 outils sélectionnés couvrant projets, documents, vérification, reconnaissance, modèles, flux et administration.
  • OAuth 2.1 avec enregistrement dynamique du client et un écran de consentement explicite.
  • Outils à portée limitée et à niveaux de risque, avec un canal d'audit séparé qui enregistre aussi les lectures des agents, pas seulement les écritures.
  • Hubs de Vérification et de Scan intégrables dans votre propre produit, en iframe, derrière une clé API, une session de courte durée et une origine nommée.
  • Des nœuds de cluster conscients des tâches et des capacités qui réclament le travail sans contention — mettre un nœud en drain, le reprendre, ou le dédier à l'OCR, à l'export ou à l'import.
■Java 25 sur Spring Boot 4, un seul JAR autonome avec bibliothèques OCR intégrées ; image native optionnelle.
■Base de données PostgreSQL, 90 migrations versionnées, chaque table et colonne commentée directement en base.
■632 points d'accès REST répartis sur 83 contrôleurs ; OpenAPI 3 avec console intégrée.
■Fichiers stockés sur une arborescence disque préfixée par tenant, jamais en base ; chiffrement AES-256-GCM au repos pour les clés et identifiants.
■Serveur Model Context Protocol en HTTP diffusable avec OAuth 2.1, pour l'accès des agents IA.
■Autohébergé ; aucune attestation SOC 2 ou ISO 27001 du fournisseur, et le MFA/SSO figurent sur la feuille de route, pas encore livrés.

Ce qu'il fait

  • 01Aucun verrou de licence, aucun compteur de pages — le coût marginal d'une page est l'électricité nécessaire pour la traiter.
  • 02Six modèles sectoriels provisionnent un projet complet en une seule transaction, contre une norme du secteur de huit à douze semaines.
  • 03L'OCR et les modèles locaux gardent les documents réglementés sur votre propre infrastructure, les fournisseurs d'IA distants restant une option, jamais une obligation.

En bref

Pour quiComptes fournisseurs · Assurance · KYC · AML · Logistique
LicenceSous licence par installation, jamais par page. Une redevance annuelle fixe couvre un nombre illimité d'utilisateurs, de projets et d'organisations au sein d'un même tenant, évoluant avec votre propre chiffre d'affaires — de façon marginale comme l'impôt sur le revenu, avec un minimum de 900 € et une hausse annuelle plafonnée à 25 %. L'hébergement, l'usage de l'IA et les services professionnels sont facturés séparément.

KognitCapture dans votre organisation ?