Produits · 04 · Intelligence documentaire
← Tous les produits

Classifix

Transformez des documents non structurés en données catégorisées et exploitables par machine — sans jamais les envoyer où que ce soit.

Téléversez vos documents, lisez-les grâce à l'OCR sur site en 129 langues, puis classifiez et extrayez les champs à l'aide de modèles de langage pouvant fonctionner entièrement sur votre propre matériel. Les utilisateurs vérifient les résultats dans un poste de contrôle piloté au clavier, où les mots reconnus sont superposés directement sur la page.

129Langues OCR incluses
3Formats de sortie OCR
17Types de tâches suivies
0Octets devant quitter le réseau
Le problème

Les documents que vous devez le plus traiter sont justement ceux que vous ne pouvez pas envoyer ailleurs.

Les services cloud de compréhension documentaire sont excellents, mais pour beaucoup de clients, ce n'est tout simplement pas une option : il s'agit de dossiers patients, de dossiers juridiques, de réponses à appels d'offres ou de données du personnel, et dès que ceux-ci franchissent une frontière ou une limite de tenant, le projet s'arrête. Le travail reste donc manuel — tri, saisie, classement — à un coût que personne ne mesure parce qu'il en a toujours été ainsi.

01
Les données ne peuvent pas sortir
La réglementation, un contrat ou une politique interne exclut tout service qui traite les documents hors site.
02
Lots entrants mixtes
Un lot de scans contenant cinq types de documents, qu'une personne est payée pour trier à la main.
03
Ressaisie depuis le papier
Des champs ressaisis dans un système qui aurait pu les lire, avec les erreurs que cela implique.
04
Aucune boucle de rétroaction
Les corrections disparaissent dans la tête d'une personne au lieu d'améliorer le lot suivant.
La solution

L'ensemble du pipeline s'exécute sur votre propre matériel — y compris le modèle.

01
Reconnaissance locale
L'OCR s'exécute en interne avec 129 packs linguistiques déjà inclus. Aucune étape de téléchargement, aucun service facturé à la page, aucun appel sortant.
02
Intelligence locale
Neuf fournisseurs de modèles derrière une seule configuration, dont cinq fonctionnent sur vos propres machines — la classification et l'extraction sans fuite de données sont un simple paramètre, pas un projet.
03
L'humain dans la boucle
Un poste de contrôle conçu pour la rapidité : le document d'un côté, la décision de l'autre, toute la file navigable au clavier.

Fonctionnalités

01Reconnaissance optique de caractères
  • 129 packs linguistiques inclus, dont le chinois, le japonais et le coréen verticaux, le Fraktur et la détection d'écriture.
  • Trois sorties conservées par document : texte brut, balisage positionné au mot et une couche XML d'archivage.
  • Pages PDF rastérisées à 300 points par pouce ; les images sont acceptées directement.
  • Résolution, langue, mode de segmentation de page et format de sortie configurables.
  • Pool de threads dimensionné selon la machine, avec progression par page et résultats mis en cache, afin que relancer un traitement soit un choix, pas un coût.
  • Les PDF chiffrés et sans page sont détectés et rejetés plutôt que de ne produire silencieusement aucun résultat.
02Classification et extraction
  • Définissez vos propres classificateurs et catégories, avec création groupée de catégories à partir d'une liste collée.
  • La classification par modèle de langage renvoie la catégorie, un score de confiance et son raisonnement.
  • Classification par page avec scission automatique : un lot entrant mixte est séparé en un fichier de sortie par catégorie.
  • Des mots-clés de catégorie — termes obligatoires, facultatifs et interdits — notent un document et peuvent le reclasser ou le signaler automatiquement.
  • Extracteurs définis par type de document avec quatre emplacements de prompt — système, extraction, schéma et raffinement — plus une passe de raffinement optionnelle.
  • Sortie en JSON ou XML, enregistrée avec le nombre de champs, la confiance, la méthode, le modèle et le temps de traitement.
  • Points d'accès pour l'extraction unitaire, par lot séquentiel et par lot parallèle.
03Modèles, locaux ou hébergés
  • Neuf fournisseurs de modèles — cinq fonctionnant sur votre propre matériel et quatre hébergés.
  • Profils de modèles nommés par organisation avec un contrôle complet des paramètres de génération et un test de connectivité.
  • Prompts réutilisables et versionnés, avec variables de modèle pour la classification comme pour l'extraction.
  • Une passe de modèle corrige la sortie de reconnaissance avant que quoi que ce soit en aval ne la lise.
  • Un chemin par expression régulière traite les motifs simples et fixes pour lesquels un modèle est superflu.
04Validation et évaluation
  • Un écran de vérification à trois volets — file, document, décision — avec les cadres de mots, lignes et blocs reconnus superposés à l'image de la page.
  • Navigation au clavier : suivant, précédent, accepter et défilement de page sans toucher la souris.
  • Acceptez une classification ou reclassez-la par rapport à la liste des catégories, document par document.
  • Des statistiques de file d'attente permettant à un responsable de voir l'arriéré plutôt que de le deviner.
  • Un comparatif de modèles exécute des modèles nommés sur le même corpus et rapporte la précision, la confiance moyenne et le temps de traitement.
  • Précision, rappel et F-mesure par catégorie, avec les essais conservés en historique pour comparaison.
05Exploitation et intégration
  • Dix-sept types de tâches suivies couvrant la reconnaissance, l'entraînement, la classification, l'extraction, la reclassification, la restauration et l'entretien.
  • Chaque tâche rapporte sa progression, les éléments traités, une fin estimée et un journal détaillé ; les tâches peuvent être annulées, relancées ou nettoyées en masse.
  • 236 points d'accès REST répartis sur vingt-trois contrôleurs, décrits par un document OpenAPI.
  • Clés API à portée limitée, avec une carte de permissions par clé, expiration, révocation et comptabilisation quotidienne de l'usage.
  • Exportez ou diffusez un classificateur entier — fichiers et données — vers une autre instance Classifix, ou copiez-le au sein d'une même instance.
  • Configuration initiale guidée, incluant la génération d'une unité de service.
■Un seul fichier JAR autonome Java 21 / Spring Boot avec moteur OCR et packs linguistiques inclus ; base de données PostgreSQL.
■Interface rendue côté serveur, sans framework ni étape de build ; visualiseur PDF dans le navigateur avec superposition de la position des mots.
■236 points d'accès REST répartis sur 23 contrôleurs, documentés via OpenAPI.
■Neuf fournisseurs de modèles, cinq auto-hébergés ; stockage sur disque local ou dossier cloud connecté.
■Environ 139 000 lignes de code au total (application et tests), 24 entités, 168 classes de test.

Ce qu'il fait

  • 01Tout s'exécute sur votre propre matériel — OCR, classification et modèle de langage — sans aucune fuite de données requise.
  • 02129 langues OCR incluses et neuf fournisseurs de modèles, dont cinq fonctionnent entièrement sur site.
  • 03Un poste de vérification piloté au clavier superpose les mots reconnus directement sur la page, pour que les relecteurs vérifient au lieu de deviner.

En bref

Pour quiComptabilité fournisseurs · Juridique · Secteur public · Bureaux de documents
LicenceSous licence par installation, pas à la page. Classifix s'achète une fois et s'exploite chez vous, avec une redevance annuelle calculée sur votre propre chiffre d'affaires (à partir d'un minimum de 900 €, avec une hausse annuelle plafonnée à 25 %). Chaque tranche inclut un nombre illimité d'utilisateurs, de projets et d'organisations au sein d'un même tenant, ainsi que l'auto-hébergement et le support. L'hébergement, le matériel et les coûts des modèles d'IA restent à votre charge ; le conseil et la formation sont facturés séparément.

Classifix dans votre organisation ?