Classifix
Maak van ongestructureerde documenten gecategoriseerde, machineleesbare gegevens — zonder ze ooit te versturen.
Upload documenten, lees ze met on-premise OCR in 129 talen, en classificeer en extraheer vervolgens velden met taalmodellen die volledig op uw eigen hardware kunnen draaien. Medewerkers verifiëren de resultaten in een toetsenbordgestuurd controlestation waarbij de herkende woorden rechtstreeks op de pagina worden weergegeven.
De documenten die u het meest moet verwerken, zijn net de documenten die u niet mag versturen.
Cloudoplossingen voor documentbegrip zijn uitstekend, maar voor veel klanten simpelweg geen optie: het gaat om patiëntendossiers, gerechtelijke dossiers, offerteaanvragen of personeelsgegevens, en zodra die een grens of tenant-grens overschrijden, stopt het project. Het werk blijft dus manueel — sorteren, intypen, klasseren — tegen een kost die niemand meet omdat het altijd zo is geweest.
De volledige pijplijn draait op uw eigen hardware — inclusief het model.
Mogelijkheden
- 129 meegeleverde taalpakketten, inclusief verticaal Chinees, Japans en Koreaans, Fraktur en scriptdetectie.
- Drie uitvoervormen per document bewaard: platte tekst, woord-gepositioneerde markup en een archiverings-XML-laag.
- PDF-pagina's gerasteriseerd op 300 dpi; afbeeldingen worden rechtstreeks aanvaard.
- Configureerbare resolutie, taal, pagina-segmentatiemodus en uitvoerformaat.
- Threadpool afgestemd op de machine, met voortgang per pagina en gecachete resultaten, zodat herverwerken een keuze is, geen kost.
- Versleutelde en lege PDF's worden gedetecteerd en geweigerd, in plaats van stilzwijgend niets op te leveren.
- Definieer uw eigen classifiers en categorieën, met massale categoriecreatie vanuit een geplakte lijst.
- Classificatie door een taalmodel levert de categorie, een betrouwbaarheidsscore en de redenering op.
- Classificatie per pagina met automatische opsplitsing: een gemengde binnenkomende batch wordt opgesplitst in één uitvoerbestand per categorie.
- Categoriesleutelwoorden — verplichte, optionele en verboden termen — scoren een document en kunnen het automatisch herklasseren of markeren.
- Extractors gedefinieerd per documenttype met vier promptslots — systeem, extractie, schema en verfijning — plus een optionele verfijningsronde.
- Uitvoer als JSON of XML, opgeslagen met veldenaantal, betrouwbaarheid, methode, model en verwerkingstijd.
- Endpoints voor losse, sequentiële batch- en parallelle batchextractie.
- Negen modelleveranciers — vijf die op uw eigen hardware draaien en vier hosted.
- Benoemde modelprofielen per organisatie met volledige controle over generatieparameters en een connectiviteitstest.
- Herbruikbare, geversioneerde prompts met sjabloonvariabelen voor zowel classificatie als extractie.
- Een modelronde corrigeert de herkenningsuitvoer voordat iets verderop deze leest.
- Een regex-pad behandelt eenvoudige, vaste patronen waarvoor een model niet nodig is.
- Een driepanelig controlescherm — wachtrij, document, beslissing — met herkende woord-, lijn- en blokkaders over de paginascan.
- Toetsenbordgestuurde navigatie: volgende, vorige, aanvaarden en pagineren zonder de muis aan te raken.
- Aanvaard een classificatie of herklasseer ze tegen de categorielijst, document per document.
- Wachtrijstatistieken waardoor een verantwoordelijke de achterstand ziet in plaats van te gokken.
- Een modelvergelijking laat benoemde modellen op hetzelfde corpus lopen en rapporteert nauwkeurigheid, gemiddelde betrouwbaarheid en verwerkingstijd.
- Precisie, recall en F-maat per categorie, met testruns bewaard als geschiedenis voor vergelijking.
- Zeventien bijgehouden jobtypes voor herkenning, training, classificatie, extractie, herklassering, herstel en opschoning.
- Elke job rapporteert voortgang, verwerkte items, geschatte eindtijd en een gedetailleerd logboek; jobs kunnen worden geannuleerd, herstart of massaal opgeruimd.
- 236 REST-endpoints verdeeld over drieëntwintig controllers, beschreven in een OpenAPI-document.
- Scoped API-sleutels met een permissiekaart per sleutel, vervaldatum, intrekking en dagelijkse gebruiksregistratie.
- Exporteer of stream een volledige classifier — bestanden en data — naar een andere Classifix-instantie, of kopieer ze binnen één instantie.
- Begeleide eerste opstart, inclusief generatie van een service-unit.
Wat het doet
- 01Alles draait op uw eigen hardware — OCR, classificatie en het taalmodel — zonder verplichte gegevensuitstroom.
- 02129 meegeleverde OCR-talen en negen modelleveranciers, waarvan vijf volledig on-premise draaien.
- 03Een toetsenbordgestuurd controlestation toont herkende woorden rechtstreeks op de pagina, zodat controleurs verifiëren in plaats van te gokken.