Kennisbank

Hybride zoekopdracht

Bijgewerkt: 5 augustus 2026 · 5 min leestijd

Typ je een zoekterm in een zoekbalk, dan gebeurt er meestal een van twee dingen. Ofwel het systeem zoekt naar de exacte woorden die je typte, ofwel het probeert te begrijpen wat je bedoelt en zoekt op betekenis. Een hybride zoekopdracht doet allebei tegelijk: het combineert klassiek zoeken op trefwoorden met modern zoeken op betekenis, en voegt de resultaten samen tot één rangschikking.

Een vergelijking maakt het concreet. Stel je hebt twee bibliothecarissen naast elkaar. De eerste kent de catalogus uit haar hoofd en vindt in een fractie van een seconde elk boek waarin het exacte woord "warmtepomp" voorkomt. De tweede heeft alle boeken gelezen en begrijpt waar ze over gaan, dus als je vraagt naar "iets om je huis duurzaam te verwarmen", weet zij ook boeken te noemen waarin het woord "warmtepomp" nooit letterlijk staat. Hybride zoeken laat beide bibliothecarissen tegelijk werken en combineert hun aanbevelingen tot één lijst.

Wat is het precies?

Hybride zoeken bestaat uit twee zoekmethoden die naast elkaar draaien op dezelfde zoekopdracht.

De eerste methode is lexicaal zoeken (ook wel keyword search of trefwoordzoeken), de klassieke aanpak die zoekmachines al decennia gebruiken. Een veelgebruikt algoritme hiervoor heet BM25. Het telt hoe vaak een zoekterm in een document voorkomt, weegt dat af tegen hoe zeldzaam het woord is in de hele verzameling documenten, en houdt rekening met de lengte van het document. Dit werkt razendsnel via een zogeheten inverted index, een soort register achterin een boek dat per woord aangeeft in welke documenten het voorkomt. Lexicaal zoeken is uitstekend in het vinden van exacte termen: productcodes, namen, foutmeldingen, vakjargon.

De tweede methode is semantisch zoeken of vectorzoeken. Hierbij zet een taalmodel elke zin of elk document om in een embedding: een lijst van enkele honderden getallen die de betekenis van de tekst wiskundig vastlegt. Teksten met een vergelijkbare betekenis krijgen getallenreeksen die dicht bij elkaar liggen in deze zogeheten vectorruimte. Om te zoeken, wordt ook de zoekvraag omgezet in zo'n getallenreeks, waarna een vectordatabase de dichtstbijzijnde documenten opzoekt met een afstandsmaat zoals cosinusgelijkenis. Deze methode vindt ook relevante teksten die geen enkel woord gemeen hebben met de zoekvraag, zolang de betekenis overeenkomt.

Bij een hybride zoekopdracht lopen beide methoden gelijktijdig, en worden de twee ranglijsten daarna samengevoegd. Een populaire techniek hiervoor is reciprocal rank fusion (RRF): elk document krijgt een score op basis van zijn positie in beide lijsten, zonder dat de onderliggende scores (die op heel verschillende schalen zitten) eerst genormaliseerd hoeven te worden. Vaak volgt er nog een derde, duurdere stap: een reranker, een kleiner AI-model dat de kandidaten uit de samengevoegde lijst nog eens grondig herbeoordeelt op relevantie voordat de uiteindelijke top-resultaten worden getoond.

Wat wil men ermee bereiken?

Het doel is simpel te omschrijven maar lastig te realiseren: het beste van twee werelden. Pure trefwoordzoekmachines missen resultaten wanneer gebruikers andere woorden gebruiken dan de tekst zelf bevat, zoals synoniemen, omschrijvingen of vertalingen. Pure semantische zoekmachines zijn juist zwak in exacte matches: een klantnummer, een artikelcode of een foutmelding als "Error 0x8007045D" heeft weinig "betekenis" om op te zoeken, maar moet toch precies gevonden worden.

De belangstelling voor hybride zoeken is sterk toegenomen sinds grote taalmodellen als ChatGPT populair werden, vanwege een toepassing genaamd retrieval-augmented generation (RAG). Daarbij haalt een chatbot eerst relevante documenten op uit een kennisbank voordat hij een antwoord formuleert, om verzonnen informatie ("hallucinaties") te voorkomen. De kwaliteit van dat antwoord hangt volledig af van de kwaliteit van de opgehaalde documenten, en dat is precies waarom hybride zoeken zo aantrekkelijk is geworden: het levert doorgaans relevantere resultaten dan elke methode afzonderlijk.

Ook buiten AI-chatbots is de winst merkbaar, bijvoorbeeld bij productzoekmachines in webwinkels, waar klanten zowel op modelnummer als op vage omschrijving zoeken, of bij zoekfuncties in bedrijfsarchieven vol technische documentatie en jargon.

Voorbeelden uit de praktijk

Verschillende bedrijven hebben hybride zoeken inmiddels als kant-en-klare functie in hun producten ingebouwd.

Elasticsearch, de veelgebruikte zoekmachine-software van het bedrijf Elastic, breidde zijn platform vanaf 2022 uit met vectorzoekfunctionaliteit naast de bestaande BM25-implementatie, en voegde daarna ondersteuning voor reciprocal rank fusion toe zodat gebruikers beide methoden in één zoekopdracht kunnen combineren.

Weaviate, een open-source vectordatabase met wortels in Amsterdam, bouwde hybride zoeken als kernfunctie in het product, met een instelbare parameter die bepaalt hoeveel gewicht lexicaal zoeken versus vectorzoeken krijgt in het eindresultaat.

Microsoft Azure AI Search (voorheen Azure Cognitive Search) biedt hybride zoeken aan als onderdeel van zijn clouddienst, gecombineerd met een herrangschikkingsstap die Microsoft "semantic ranking" noemt.

Vespa, oorspronkelijk ontwikkeld bij Yahoo en tegenwoordig verder gezet als zelfstandig open-source project, combineert al langer lexicale en vector-gebaseerde signalen in één rangschikkingssysteem en wordt onder meer gebruikt door grote streaming- en advertentieplatformen.

Ook nieuwere spelers zoals Pinecone en Qdrant, beide gespecialiseerd in vectordatabases, hebben hybride zoekopties toegevoegd zodat ontwikkelaars sparse (trefwoord-achtige) en dense (semantische) representaties samen kunnen doorzoeken.

Hoe ver is de techniek?

Hybride zoeken wordt inmiddels breed beschouwd als goede praktijk voor zoeksystemen die met natuurlijke taal moeten omgaan, en is in enkele jaren tijd van onderzoeksidee naar standaardfunctie in commerciële zoek- en databaseproducten gegroeid. De onderliggende bouwstenen, BM25 en neurale embeddings, bestaan al langer; wat vooral is versneld is de gebruiksvriendelijke integratie van beide in één systeem.

Toch is het geen opgelost probleem. Het combineren van scores uit twee heel verschillende systemen blijft lastig te finetunen: hoeveel gewicht geef je aan trefwoordmatches versus semantische gelijkenis, en verschilt dat per type zoekvraag? De kwaliteit van de semantische component hangt sterk af van het gebruikte embeddingmodel, dat soms slecht presteert op zeer specifiek vakjargon waar het niet op getraind is. Vectorzoeken op grote schaal kost daarnaast meer rekenkracht en geheugen dan klassiek trefwoordzoeken, en een extra herrangschikkingsstap verhoogt de latentie, wat lastig kan zijn voor toepassingen die direct moeten reageren.

Onderzoek richt zich momenteel onder meer op zogeheten "learned sparse retrieval" (modellen die trefwoordachtige representaties zelf leren in plaats van vaste statistiek te gebruiken) en op efficiëntere manieren om de fusie van resultaten te automatiseren zonder handmatig te hoeven afstellen.

Wie werken eraan?

Aan hybride zoektechnologie wordt gewerkt door een mix van gevestigde softwarebedrijven, cloudleveranciers en gespecialiseerde start-ups. Elastic (met wortels in Amsterdam) en Microsoft (via Azure AI Search) hebben de techniek in hun bestaande zoekproducten geïntegreerd. Google en Amazon bieden vergelijkbare functionaliteit aan binnen hun clouddiensten voor bedrijfszoekfuncties.

Onder de vectordatabase-specialisten vallen vooral Weaviate (opgericht in Nederland), Pinecone en Qdrant op, die hybride zoeken als kernonderdeel van hun product positioneren. Daarnaast leveren bedrijven als Cohere gespecialiseerde herrangschikkingsmodellen die vaak als extra laag bovenop hybride zoeksystemen worden gezet.

Op onderzoeksvlak heeft Meta AI (voorheen Facebook AI Research) met werk aan dense passage retrieval en de vectorzoekbibliotheek FAISS een belangrijke bijdrage geleverd aan de theoretische basis. Ook academische onderzoeksgroepen op het gebied van information retrieval, verspreid over universiteiten wereldwijd, publiceren regelmatig vergelijkende studies en benchmarks waarmee de kwaliteit van verschillende hybride aanpakken wordt getoetst.

Verder lezen