
TAFUTA - Een cognitief zoekplatform
Multiple (VITO, FIT, VLAIO, VIB)
Maak interne content vindbaar met Tafuta
Organisaties zoals Flanders Investment & Trade, VITO, VLAIO en VIB zetten Tafuta in om hun interne content vindbaar te maken. Tafuta (Swahili voor 'zoeken') is een cognitief zoekplatform dat full-text search combineert met AI-gedreven verrijking. Zo worden ruwe documenten omgezet in doorzoekbare, gestructureerde informatie. Het won de Smart Investigation-challenge op de Smart Policing Hackathon van 2020.
Onderzoekspapers terugvinden
VITO gebruikt Tafuta om technologische onderzoekers een tool te bieden waarmee ze relevante onderzoekspapers en documenten accurater terugvinden. De databron omvat pdf's, Word-documenten, PowerPoints en Excel-bestanden uit on-premise opslag, plus externe bronnen zoals Google Scholar. Een custom entiteitsdetectieskill maakt zoeken mogelijk op basis van economische, chemische en procesparameters.
Rijke resultaatweergave
Zoekresultaten verschijnen in een tabel met de meest relevante documenten eerst. Daarnaast toont een grafweergave hoe documenten met elkaar verbonden zijn en gelinkt aan specifieke entiteiten (personen, organisaties) of onderwerpen. De documentendatabase wordt automatisch aangevuld met nieuwe content op basis van onderzoekstrends.
Op maat per deployment
Elke deployment bevat custom modellen en classifiers, afgestemd op de specifieke businessdoelen en sectorvereisten van de klant.
Wat is een cognitieve zoekoplossing?
Tafuta is gebouwd op het cognitive search-patroon: een kennisretrievaldienst met ingebouwde AI-mogelijkheden. Het biedt een full-text zoekmachine, persistente opslag van zoekindexen en geïntegreerde AI die tijdens het indexeren extra tekst en structuur uit documenten haalt.
Hoe het werkt
De oplossing gebruikt NLP en AI-diensten voor beeld, taal en spraak. Denk aan OCR, vertaling, sleutelzinextractie en entiteitsdetectie. Samen zetten die ruwe, ongestructureerde informatie om in doorzoekbare content. Ondersteunde formaten: Microsoft Word, PowerPoint, Excel, PDF, PNG, RTF, JSON, HTML en XML.
Indexeren en bevragen
De twee kernprocessen zijn indexeren en bevragen. Indexeren brengt tekst in de oplossing en maakt ze doorzoekbaar door binnenkomende tekst te verwerken tot tokens in inverted indexes. Eens de index gevuld is, kan je query's sturen met relevantietuning, autocomplete, synoniemmatching, fuzzy matching, patroonmatching, filtering en sortering.
AI-verrijkte zoekmachine
AI haalt tekst uit afbeeldingen, blobs en ongestructureerde databronnen. Zo wordt content beter doorzoekbaar. Verrijking en extractie gebeuren via cognitive skills die aan de indexer-pipeline hangen: zowel ingebouwde skills als custom skills die we voor jouw domein bouwen.
Natural language processing-skills
Entiteitsherkenning, taaldetectie, sleutelzinextractie, tekstmanipulatie, sentimentdetectie en PII-detectie. Met deze skills wordt ongestructureerde tekst gemapt naar doorzoekbare en filterbare velden in de index.
Beeldverwerkingsskills
Optical Character Recognition (OCR), gezichtsdetectie, beeldinterpretatie, beeldherkenning van bekende personen en landmarks, en attribuutdetectie zoals de oriëntatie van een afbeelding. Deze skills maken tekstrepresentaties van beeldinhoud, waardoor visuele informatie doorzoekbaar wordt.
Praktijkscenario's
Gescande documenten (JPEG) die via OCR full-text doorzoekbaar worden. Pdf's met een combinatie van beeld en tekst waar NLP-verwerking betere resultaten geeft dan standaardindexering. Meertalige content met automatische taaldetectie en vertaling. Multimedia-analyse op audio, video en afbeeldingen.

Wanneer gebruik je een cognitieve zoekoplossing?
Een cognitieve zoekoplossing past bij organisaties die een interne zoekervaring willen zoals bij commerciële zoekmachines op het web. Of bij organisaties die heterogene contenttypes willen samenbrengen in een private, zelf gedefinieerde zoekindex.
Ongestructureerde content op schaal
Bestaat je ruwe content grotendeels uit ongedifferentieerde tekst, afbeeldingen of applicatiebestanden? Dan identificeert en extraheert de zoekoplossing tekst tijdens het indexeren. Ze creëert structuur en genereert nieuwe informatie, zoals vertaalde tekst of gedetecteerde entiteiten.
Custom tekstanalyse
Heeft je content taalkundige of custom tekstanalyse nodig, dan kunnen analysers geconfigureerd worden voor gespecialiseerde verwerking: diakritische tekens wegfilteren, patronen in strings herkennen of domeinspecifieke entiteitsclassifiers bouwen voor finance, wetenschap of geneeskunde.





