Ga meteen naar de inhoud
Nieuw: Data & AI Strategy-oefening.
Blue sky
Azure Cognitive SearchNLPOCRCustom Entity Detection

TAFUTA - Een cognitief zoekplatform

Multiple (VITO, FIT, VLAIO, VIB)

CONTEXT

Maak interne content vindbaar met Tafuta

Organisaties zoals Flanders Investment & Trade, VITO, VLAIO en VIB zetten Tafuta in om hun interne content vindbaar te maken. Tafuta (Swahili voor 'zoeken') is een cognitief zoekplatform dat full-text search combineert met AI-gedreven verrijking. Zo worden ruwe documenten omgezet in doorzoekbare, gestructureerde informatie. Het won de Smart Investigation-challenge op de Smart Policing Hackathon van 2020.

Onderzoekspapers terugvinden

VITO gebruikt Tafuta om technologische onderzoekers een tool te bieden waarmee ze relevante onderzoekspapers en documenten accurater terugvinden. De databron omvat pdf's, Word-documenten, PowerPoints en Excel-bestanden uit on-premise opslag, plus externe bronnen zoals Google Scholar. Een custom entiteitsdetectieskill maakt zoeken mogelijk op basis van economische, chemische en procesparameters.

Rijke resultaatweergave

Zoekresultaten verschijnen in een tabel met de meest relevante documenten eerst. Daarnaast toont een grafweergave hoe documenten met elkaar verbonden zijn en gelinkt aan specifieke entiteiten (personen, organisaties) of onderwerpen. De documentendatabase wordt automatisch aangevuld met nieuwe content op basis van onderzoekstrends.

Op maat per deployment

Elke deployment bevat custom modellen en classifiers, afgestemd op de specifieke businessdoelen en sectorvereisten van de klant.

HOE HET WERKT

Wat is een cognitieve zoekoplossing?

Tafuta is gebouwd op het cognitive search-patroon: een kennisretrievaldienst met ingebouwde AI-mogelijkheden. Het biedt een full-text zoekmachine, persistente opslag van zoekindexen en geïntegreerde AI die tijdens het indexeren extra tekst en structuur uit documenten haalt.

Hoe het werkt

De oplossing gebruikt NLP en AI-diensten voor beeld, taal en spraak. Denk aan OCR, vertaling, sleutelzinextractie en entiteitsdetectie. Samen zetten die ruwe, ongestructureerde informatie om in doorzoekbare content. Ondersteunde formaten: Microsoft Word, PowerPoint, Excel, PDF, PNG, RTF, JSON, HTML en XML.

Indexeren en bevragen

De twee kernprocessen zijn indexeren en bevragen. Indexeren brengt tekst in de oplossing en maakt ze doorzoekbaar door binnenkomende tekst te verwerken tot tokens in inverted indexes. Eens de index gevuld is, kan je query's sturen met relevantietuning, autocomplete, synoniemmatching, fuzzy matching, patroonmatching, filtering en sortering.

AI-VERRIJKING

AI-verrijkte zoekmachine

AI haalt tekst uit afbeeldingen, blobs en ongestructureerde databronnen. Zo wordt content beter doorzoekbaar. Verrijking en extractie gebeuren via cognitive skills die aan de indexer-pipeline hangen: zowel ingebouwde skills als custom skills die we voor jouw domein bouwen.

Natural language processing-skills

Entiteitsherkenning, taaldetectie, sleutelzinextractie, tekstmanipulatie, sentimentdetectie en PII-detectie. Met deze skills wordt ongestructureerde tekst gemapt naar doorzoekbare en filterbare velden in de index.

Beeldverwerkingsskills

Optical Character Recognition (OCR), gezichtsdetectie, beeldinterpretatie, beeldherkenning van bekende personen en landmarks, en attribuutdetectie zoals de oriëntatie van een afbeelding. Deze skills maken tekstrepresentaties van beeldinhoud, waardoor visuele informatie doorzoekbaar wordt.

Praktijkscenario's

Gescande documenten (JPEG) die via OCR full-text doorzoekbaar worden. Pdf's met een combinatie van beeld en tekst waar NLP-verwerking betere resultaten geeft dan standaardindexering. Meertalige content met automatische taaldetectie en vertaling. Multimedia-analyse op audio, video en afbeeldingen.

High Level Architecture Tafuta
WANNEER GEBRUIKEN

Wanneer gebruik je een cognitieve zoekoplossing?

Een cognitieve zoekoplossing past bij organisaties die een interne zoekervaring willen zoals bij commerciële zoekmachines op het web. Of bij organisaties die heterogene contenttypes willen samenbrengen in een private, zelf gedefinieerde zoekindex.

Ongestructureerde content op schaal

Bestaat je ruwe content grotendeels uit ongedifferentieerde tekst, afbeeldingen of applicatiebestanden? Dan identificeert en extraheert de zoekoplossing tekst tijdens het indexeren. Ze creëert structuur en genereert nieuwe informatie, zoals vertaalde tekst of gedetecteerde entiteiten.

Custom tekstanalyse

Heeft je content taalkundige of custom tekstanalyse nodig, dan kunnen analysers geconfigureerd worden voor gespecialiseerde verwerking: diakritische tekens wegfilteren, patronen in strings herkennen of domeinspecifieke entiteitsclassifiers bouwen voor finance, wetenschap of geneeskunde.

Tafuta Search

Wat het platform kan

10+
Ondersteunde documentformaten, waaronder Word, PDF, PowerPoint, Excel, PNG en meer

NLP + CV
Gecombineerde AI-skills voor taal en computer vision, voor diepgaande contentextractie

Custom
Domeinspecifieke entiteitsdetectie en documentclassifiers op maat van jouw sector

Worstel je met een gelijkaardige uitdaging?

PRAAT MET ONS