Classifix
Transformez des documents non structurés en données catégorisées et exploitables par machine — sans jamais les envoyer où que ce soit.
Téléversez vos documents, lisez-les grâce à l'OCR sur site en 129 langues, puis classifiez et extrayez les champs à l'aide de modèles de langage pouvant fonctionner entièrement sur votre propre matériel. Les utilisateurs vérifient les résultats dans un poste de contrôle piloté au clavier, où les mots reconnus sont superposés directement sur la page.
Les documents que vous devez le plus traiter sont justement ceux que vous ne pouvez pas envoyer ailleurs.
Les services cloud de compréhension documentaire sont excellents, mais pour beaucoup de clients, ce n'est tout simplement pas une option : il s'agit de dossiers patients, de dossiers juridiques, de réponses à appels d'offres ou de données du personnel, et dès que ceux-ci franchissent une frontière ou une limite de tenant, le projet s'arrête. Le travail reste donc manuel — tri, saisie, classement — à un coût que personne ne mesure parce qu'il en a toujours été ainsi.
L'ensemble du pipeline s'exécute sur votre propre matériel — y compris le modèle.
Fonctionnalités
- 129 packs linguistiques inclus, dont le chinois, le japonais et le coréen verticaux, le Fraktur et la détection d'écriture.
- Trois sorties conservées par document : texte brut, balisage positionné au mot et une couche XML d'archivage.
- Pages PDF rastérisées à 300 points par pouce ; les images sont acceptées directement.
- Résolution, langue, mode de segmentation de page et format de sortie configurables.
- Pool de threads dimensionné selon la machine, avec progression par page et résultats mis en cache, afin que relancer un traitement soit un choix, pas un coût.
- Les PDF chiffrés et sans page sont détectés et rejetés plutôt que de ne produire silencieusement aucun résultat.
- Définissez vos propres classificateurs et catégories, avec création groupée de catégories à partir d'une liste collée.
- La classification par modèle de langage renvoie la catégorie, un score de confiance et son raisonnement.
- Classification par page avec scission automatique : un lot entrant mixte est séparé en un fichier de sortie par catégorie.
- Des mots-clés de catégorie — termes obligatoires, facultatifs et interdits — notent un document et peuvent le reclasser ou le signaler automatiquement.
- Extracteurs définis par type de document avec quatre emplacements de prompt — système, extraction, schéma et raffinement — plus une passe de raffinement optionnelle.
- Sortie en JSON ou XML, enregistrée avec le nombre de champs, la confiance, la méthode, le modèle et le temps de traitement.
- Points d'accès pour l'extraction unitaire, par lot séquentiel et par lot parallèle.
- Neuf fournisseurs de modèles — cinq fonctionnant sur votre propre matériel et quatre hébergés.
- Profils de modèles nommés par organisation avec un contrôle complet des paramètres de génération et un test de connectivité.
- Prompts réutilisables et versionnés, avec variables de modèle pour la classification comme pour l'extraction.
- Une passe de modèle corrige la sortie de reconnaissance avant que quoi que ce soit en aval ne la lise.
- Un chemin par expression régulière traite les motifs simples et fixes pour lesquels un modèle est superflu.
- Un écran de vérification à trois volets — file, document, décision — avec les cadres de mots, lignes et blocs reconnus superposés à l'image de la page.
- Navigation au clavier : suivant, précédent, accepter et défilement de page sans toucher la souris.
- Acceptez une classification ou reclassez-la par rapport à la liste des catégories, document par document.
- Des statistiques de file d'attente permettant à un responsable de voir l'arriéré plutôt que de le deviner.
- Un comparatif de modèles exécute des modèles nommés sur le même corpus et rapporte la précision, la confiance moyenne et le temps de traitement.
- Précision, rappel et F-mesure par catégorie, avec les essais conservés en historique pour comparaison.
- Dix-sept types de tâches suivies couvrant la reconnaissance, l'entraînement, la classification, l'extraction, la reclassification, la restauration et l'entretien.
- Chaque tâche rapporte sa progression, les éléments traités, une fin estimée et un journal détaillé ; les tâches peuvent être annulées, relancées ou nettoyées en masse.
- 236 points d'accès REST répartis sur vingt-trois contrôleurs, décrits par un document OpenAPI.
- Clés API à portée limitée, avec une carte de permissions par clé, expiration, révocation et comptabilisation quotidienne de l'usage.
- Exportez ou diffusez un classificateur entier — fichiers et données — vers une autre instance Classifix, ou copiez-le au sein d'une même instance.
- Configuration initiale guidée, incluant la génération d'une unité de service.
Ce qu'il fait
- 01Tout s'exécute sur votre propre matériel — OCR, classification et modèle de langage — sans aucune fuite de données requise.
- 02129 langues OCR incluses et neuf fournisseurs de modèles, dont cinq fonctionnent entièrement sur site.
- 03Un poste de vérification piloté au clavier superpose les mots reconnus directement sur la page, pour que les relecteurs vérifient au lieu de deviner.