Short-read sequencing: het DNA-alfabet lezen in kleine hapjes
Stel je voor dat je een dik boek uit elkaar scheurt in duizenden snippers van hooguit een paar woorden, en dat je vervolgens het hele boek weer moet reconstrueren door te kijken welke snippers op elkaar aansluiten. Dat is in essentie wat short-read sequencing doet, maar dan met DNA in plaats van tekst. De 'woorden' zijn de vier bouwstenen van DNA (A, C, G en T), en de 'snippers' zijn stukjes van 50 tot 300 lettertjes lang.
Short-read sequencing is de meest gebruikte technologie om de volgorde van DNA-letters in een genoom te bepalen. Het woord 'short' (kort) staat in contrast met nieuwere technieken die duizenden letters in één keer kunnen lezen (long-read sequencing). Ondanks de korte leeslengte is short-read sequencing al twee decennia het werkpaard van de genetica: het is goedkoop, nauwkeurig en kan enorme hoeveelheden DNA tegelijk verwerken. Vrijwel elk nieuwsbericht over een 'doorbraak' in genoomonderzoek, kankerdiagnostiek of coronavarianten leunt ergens op deze technologie.
Wat is het precies?
Het proces begint met het knippen van lange DNA-strengen in kleine stukjes, een stap die 'fragmentatie' heet. Dit gebeurt chemisch of met geluidsgolven (sonicatie). Aan de uiteinden van elk fragment worden kunstmatige DNA-stukjes geplakt, 'adapters' genoemd, die dienen als handvat voor de rest van het proces.
Vervolgens worden de fragmenten vastgezet op een glazen plaatje, een 'flow cell', en lokaal miljoenen keren gekopieerd tot kleine clusters van identiek DNA. Dit vermenigvuldigen is nodig omdat het signaal van één enkele DNA-streng te zwak zou zijn om te meten.
Daarna begint het eigenlijke lezen, 'sequencing by synthesis'. Een enzym bouwt letter voor letter een nieuwe DNA-streng op tegenover elk clustertje, waarbij elke ingebouwde letter (A, C, G of T) een ander kleurtje fluorescentielicht uitzendt. Een camera fotografeert de hele flow cell na elke stap, en een computer leest uit de kleur welke letter er is toegevoegd. Dit cyclus van 'letter toevoegen, fotograferen, herhalen' gebeurt honderden keren, tot de gewenste leeslengte is bereikt.
Tot slot worden de miljoenen korte leesjes met software tegen een al bekend referentiegenoom gelegd (uitlijnen of 'alignment'), zodat ze weer de juiste plek in het genoom krijgen — net als puzzelstukjes die je op een voorbeeldfoto legt. Overlappende stukjes helpen om leesfouten te corrigeren.
Wat wil men ermee bereiken?
Het uiteindelijke doel is simpel geformuleerd: de volledige erfelijke code van een organisme (of van een virus, bacterie of tumor) betrouwbaar en betaalbaar in kaart brengen. Daarachter schuilen heel verschillende toepassingen.
In de geneeskunde helpt short-read sequencing bij het opsporen van erfelijke ziekten, het kiezen van de juiste kankerbehandeling op basis van tumormutaties, en bij het testen van embryo's of ongeboren kinderen op chromosoomafwijkingen. In de volksgezondheid maakt het mogelijk om uitbraken van virussen en bacteriën te volgen door hun genetische materiaal te vergelijken.
In de wetenschap ligt de nadruk op schaal: onderzoekers willen genomen van honderdduizenden mensen of duizenden diersoorten sequencen om patronen te vinden die met kleinere aantallen onzichtbaar blijven. Omdat short-read sequencing relatief goedkoop is per gelezen letter, is het de aangewezen technologie voor dit soort grootschalig werk, ook al is elke individuele read kort.
Voorbeelden uit de praktijk
Het 1000 Genomes Project (2008-2015) gebruikte short-read sequencing om DNA van meer dan 2500 mensen uit verschillende bevolkingsgroepen in kaart te brengen en bouwde zo een referentiedatabase van menselijke genetische variatie.
UK Biobank, een Brits onderzoeksproject, rondde in 2023 de volledige genoomsequencing af van ruim 500.000 deelnemers, uitgevoerd door Illumina-apparatuur bij partnerlaboratoria, om verbanden tussen genen en ziekten op grote schaal te bestuderen.
Tijdens de coronapandemie (2020-2022) werd short-read sequencing wereldwijd ingezet om virusvarianten te volgen en te delen via het internationale databaseplatform GISAID, wat cruciaal was om de opkomst van varianten zoals Alpha, Delta en Omicron snel te signaleren.
Het Amerikaanse All of Us Research Program van de National Institutes of Health sequencet sinds 2018 de genomen van meer dan een miljoen Amerikanen, met als doel onderzoek naar gepersonaliseerde geneeskunde te ondersteunen.
Het Chinese bedrijf BGI zette short-read sequencing in voor grootschalige bevolkingsstudies en prenatale screening, en ontwikkelde met zijn dochterbedrijf MGI eigen sequencingmachines als alternatief voor de Amerikaanse marktleider Illumina.
Hoe ver is de techniek?
Short-read sequencing is volwassen technologie: het wordt al sinds het midden van de jaren 2000 commercieel gebruikt en is inmiddels sterk geautomatiseerd. De kosten zijn spectaculair gedaald. Waar het eerste menselijke genoom (afgerond in 2003, overigens met de oudere Sanger-methode) miljarden dollars kostte, bracht Illumina in 2014 met het HiSeq X-systeem de prijs voor een volledig menselijk genoom terug tot ongeveer 1000 dollar. In 2023 claimden Illumina (met de NovaSeq X-serie) en concurrenten als Ultima Genomics prijzen rond de 200 dollar per genoom, al hangt de uiteindelijke prijs sterk af van het volume en de gewenste nauwkeurigheid.
De belangrijkste beperking blijft de korte leeslengte zelf. Delen van het genoom die veel herhalende patronen bevatten, zijn met korte stukjes moeilijk eenduidig te plaatsen, vergelijkbaar met het proberen samenvoegen van puzzelstukjes uit een egaal blauwe lucht. Grote structurele veranderingen in DNA, zoals stukken die zijn omgedraaid of verplaatst, worden daardoor vaker gemist dan bij long-read sequencing. Dit was een belangrijke reden waarom het Telomere-to-Telomere (T2T) consortium in 2022 voor het eerst een echt compleet menselijk genoom kon publiceren, door vooral long-read technieken te gebruiken en short-read data als controle.
De trend is dan ook een combinatie: short reads voor goedkope, grootschalige screening, aangevuld met long reads waar details over complexe gebieden nodig zijn. Beide technieken concurreren niet alleen, maar worden in de praktijk steeds vaker samen ingezet.
Wie werken eraan?
De Amerikaanse fabrikant Illumina is al jaren marktleider en bepaalt grotendeels welke sequencing-by-synthesis-technologie wereldwijd wordt gebruikt. Concurrentie komt van het Chinese MGI/BGI, dat eigen sequencingplatforms verkoopt, vooral populair in Azië en bij prijsgevoelige projecten. Nieuwere Amerikaanse spelers zoals Ultima Genomics en Element Biosciences proberen sinds de vroege jaren 2020 met andere chemie de kosten verder te verlagen.
Op onderzoeksgebied spelen instituten als het Broad Institute (verbonden aan MIT en Harvard, Verenigde Staten), het Wellcome Sanger Institute (Verenigd Koninkrijk) en het European Bioinformatics Institute (EBI) een centrale rol in het beheren van genoomdata en het ontwikkelen van analysemethoden. Nationale gezondheidsinstanties, waaronder het Amerikaanse NIH en Britse NHS, financieren grootschalige sequencingprogramma's voor de gezondheidszorg.