Globale Diversitätsarrays und Infinium-Arrays: Hochdurchsatz-Genotypisierung für die menschliche und landwirtschaftliche Genomik

Festinhaltsarrays – Das Arbeitstier der großangelegten Genotypisierung

Festgelegte SNP-Arrays nehmen eine besondere Nische im Bereich der Genotypisierungstechnologien ein, die weder durch die Ganzgenomsequenzierung noch durch die reduzierten Repräsentationssequenzierungen verdrängt wurde – und das Verständnis dafür offenbart die Logik, die die Entscheidungen zur Plattformwahl für zentrale Einrichtungen und Zuchtprogramme leiten sollte.

Die Illumina Infinium BeadChip-Plattform ist die dominierende Technologie in diesem Bereich. Jeder BeadChip ist ein Siliziumwafer, der mit Mikrowellchen ätzen ist, die oligonukleotid-derivatisierte Perlen enthalten, wobei jede Perle mit Zehntausenden von Kopien einer locus-spezifischen 50-mer Sonde beschichtet ist. Zwei Assay-Chemien existieren nebeneinander: Infinium I verwendet zwei Perlenarten pro SNP (eine pro Allel) und unterscheidet Allele durch eine Einzelbasenverlängerung mit unterschiedlich markierten Dideoxynukleotiden; Infinium II verwendet eine einzige Perlenart pro SNP mit zweifarbiger Färbung nach der Verlängerung und tauscht leicht niedrigere Aufrufraten gegen eine höhere Multiplexdichte. Ein einzelner BeadChip verarbeitet je nach Array-Format 8, 24 oder 48 Proben, wobei die Anzahl der Marker pro Probe von etwa 50.000 auf niederdichten landwirtschaftlichen Arrays bis zu fast 2 Millionen auf dem Global Diversity Array mit erweitertem PGx-Inhalt reicht.

Die Veröffentlichung der Infinium EX-Chemie Mitte 2025 reduzierte die DNA-Eingabebedürfnisse und verkürzte die Bearbeitungszeit im Vergleich zur herkömmlichen Infinium HD-Chemie. Zu den EX-basierten Produkten gehören das Global Screening Array v4 (GSA v4, 48 Proben pro Chip, ~650.000 Marker mit bis zu 50.000 benutzerdefinierten Erweiterungsplätzen) und das Global Clinical Research Array (GCRA, 24 Proben pro Chip, ~1,2 Millionen Marker, die aus führenden Forschungsdatenbanken wie ClinVar, PharmGKB und ClinGen kuratiert wurden). Beide verfügen über verbesserte Pharmakogenetik (PGx)-Varianten mit gezielter Genamplifikation für herausfordernde Loci wie CYP2D6 und CYP2B6, bei denen die Interferenz von Pseudogenen die Standard-Genotypisierung erschwert.

Der grundlegende Vorteil von festen Inhaltsarrays – und der Grund, warum sie trotz der sinkenden Kosten für Sequenzierung weiterhin bestehen bleiben – ist die Datenkonsistenz. Jede Probe, die auf einem bestimmten Array-Design durchgeführt wird, wird an genau denselben Markern untersucht, was Genotypaufrufe erzeugt, die über Chargen, Labore und Jahre hinweg direkt vergleichbar sind, ohne Imputationsanpassung oder Batch-Effekt-Korrektur. Für eine zentrale Einrichtung, die Proben aus einer longitudinalen Kohortenstudie über mehrere Jahre hinweg verarbeitet, oder ein Zuchtprogramm, das Genotypdaten über Generationen von Selektionskandidaten ansammelt, ist diese Vergleichbarkeit keine Bequemlichkeit – sie ist eine betriebliche Anforderung. Ein Genotyp bei rs429358 auf einem GDA, der 2025 durchgeführt wurde, ist direkt vergleichbar mit einem Genotyp am selben SNP auf einem GDA, der 2028 durchgeführt wurde, ohne Imputationsschritt, ohne Abhängigkeit von Referenzpanels und ohne Batch-Effekt-Störfaktoren, die modelliert werden müssen. Für einen umfassenderen Überblick über die Landschaft der Genotypisierungstechnologien, einschließlich sequenzierungsbasierter Ansätze wie GBS und ddRAD-seq, siehe CD Genomics. Genotypisierung und genetische Diversitätsdienste Übersicht.

Figure 1: Infinium BeadChip Technology — From DNA to Genotype Calls via Single-Base ExtensionAbbildung 1: Infinium BeadChip-Technologie — Von DNA zu Genotypaufrufen über Einzelbasenerweiterung

Humangenotypisierungsarrays — GDA und seine Derivate

Das Infinium Global Diversity Array (GDA) ist das aktuelle Flaggschiff unter den menschlichen Genotypisierungsarrays und enthält in der Basisversion etwa 1,8 Millionen Marker, die mit zusätzlichen Inhaltsmodulen auf etwa 2 Millionen erweiterbar sind. Das SNP-Rückgrat wurde unter Verwendung von Whole-Genome-Sequenzdaten aus dem Konsortium für Asthma bei afrikanischstämmigen Populationen in den Amerikas (CAAPA) und der Studie zur Bevölkerungsarchitektur unter Verwendung von Genomik und Epidemiologie (PAGE) entworfen – über 1.000 vollständige Genome afrikanischer Abstammung flossen in die Markerauswahl ein und adressierten die anhaltende eurozentrische Voreingenommenheit, die die Leistung früherer Arrays in nicht-europäischen Populationen einschränkte. Das GDA wurde als Genotypisierungsplattform für das NIH All of Us-Programm zur Präzisionsmedizin ausgewählt, das allein eines der größten Verpflichtungen zur Genotypisierung auf einer einzigen Plattform in der Geschichte darstellt.

Das GDA-Ökosystem hat sich durch Booster-Inhalte erweitert – sekundäre Bead-Pools, die auf demselben BeadChip hergestellt werden und das Kernmarker-Set mit domänenspezifischen Inhalten ergänzen. Der Enhanced PGx Booster fügt etwa 108.000 Marker hinzu, die über 44.000 ADME-bezogene Varianten und 2.000 pharmakogenetische Ziele über mehr als 1.700 Sternallele abdecken, mit gezielter Genamplifikation für CYP2D6, um die Verwirrung durch Pseudogene zu klären. Der Polygenic Risk Score Content Booster (v1.0) fügt Marker hinzu, die für die panethnische PRS-Bestimmung ausgewählt wurden, wodurch die Gesamtanzahl der Marker auf etwa 2 Millionen steigt. Der Carrier Screening Content Booster (v2.0) fügt etwa 45.000 Marker über mehr als 600 klinisch signifikante Gene hinzu. Der Cytogenetics Booster optimiert die Abdeckung für die CNV-Erkennung mit Sonden, die auf über 4.800 klinisch relevante Gene abzielen. Eine zentrale Einrichtung, die das GDA anbietet, kann den Booster-Stack so konfigurieren, dass er den Forschungsprogrammen entspricht, die sie bedient – PGx für eine pharmakogenomische Kohorte, PRS für eine bevölkerungsbezogene Gesundheitsstudie, Cytogenetik für ein Register für Entwicklungsstörungen – ohne die Basisplattform, die Verbrauchsmittelversorgung oder die Analysepipeline zu ändern.

Die GSA v4, betrieben mit Infinium EX-Chemie, bedient eine andere Nische: höhere Durchsatzrate (48 Proben pro BeadChip) zu niedrigeren Kosten pro Marker (~650.000 Marker) mit individueller Erweiterungskapazität, was sie zur wirtschaftlichen Wahl für Biobank-Projekte macht, bei denen die Kosten pro Probe die Plattformwahl dominieren. Das Asian Screening Array (ASA) und das NeuroBooster Array (NBA) — letzteres basiert auf dem GDA-Rückgrat mit etwa 95.000 spezifischen Markern für neurologische Erkrankungen — veranschaulichen die Anpassungsfähigkeit der Plattform: derselbe BeadChip-Herstellungsprozess, derselbe iScan-Reader, dieselbe GenomeStudio-Analyse-Software, jedoch radikal unterschiedliche biologische Inhalte, die auf spezifische Populationen und Krankheitsbereiche abgestimmt sind.

Wann sollte eine Studie zur Humangenetik ein Array anstelle von Sequenzierung wählen? Die Antwort hängt von drei Variablen ab: ob die interessierenden Marker im Voraus bekannt sind, ob Proben über einen längeren Zeitraum gesammelt und analysiert werden und ob das Budget die Kosten pro Probe im großen Maßstab oder den Informationsgehalt pro Marker begünstigt. Eine Studie, die 10.000 Proben mit einem definierten Satz von 650.000 SNPs zur Berechnung des PRS genotypisieren muss, wobei die Proben über drei Jahre eintreffen, ist ein Array-Projekt. Eine Studie, die neuartige seltene Varianten in 500 Proben mit einem spezifischen Phänotyp entdecken muss, ist ein Sequenzierungsprojekt. Der Kostenübergang — die Probenanzahl, ab der Arrays pro Einheit nützlicher genetischer Information günstiger werden als Sequenzierung — hängt von der Sequenzierungstiefe, der Array-Dichte und dem verfügbaren Imputationsreferenzpanel ab, aber als praktischer Maßstab: Bei den aktuellen Preisen kostet eine array-basierte GWAS auf 5.000 Proben weniger als 0,5× lcWGS bei derselben Kohorte und liefert Genotypaufrufe an bekannten, gut validierten Markern ohne die Imputationsunsicherheit, die mit Genotypen aus niedrigabdeckender Sequenzierung einhergeht.

Ein konkretes Beispiel veranschaulicht die Logik der Booster-Konfiguration in der Praxis. Ein Forschungskrankenhaus, das eine pharmakogenomische Kohorte von 3.000 Patienten in antidepressiver Therapie betreibt, benötigt sowohl genomweite SNP-Daten zur Populationsstratifizierung als auch gezielte PGx-Varianten zur Vorhersage des Metabolisierungsstatus für CYP2D6 und CYP2C19. Die Durchführung der Basis-GDA gefolgt von einem separaten gezielten Genotypisierungs-Panel für PGx-Varianten erhöht die Kosten pro Probe und erfordert einen Schritt zum Zusammenführen der Daten. Die Durchführung der GDA mit dem Enhanced PGx Booster — einem einzigen BeadChip-Workflow, der 1,93 Millionen Marker einschließlich aller erforderlichen PGx-Inhalte liefert — beseitigt den Zusammenführungsschritt und reduziert die Gesamtkosten pro Probe um etwa 25 bis 35 Prozent im Vergleich zum Zwei-Plattform-Ansatz. Die Entscheidung für den Booster hängt nicht davon ab, ob der Inhalt vorhanden ist; es geht darum, ob die zusätzlichen Kosten pro Probe für den Booster geringer sind als die Kosten für die Durchführung eines separaten Assays für dieselben Marker — eine Berechnung, die von der Anzahl der Proben, der Größe des Booster-Inhalts im Verhältnis zu einem eigenständigen gezielten Panel und den Personalkosten für das Zusammenführen von Daten aus zwei Plattformen abhängt. SNP-Mikroarray-Dienste Die Unterstützung der gesamten GDA-Familie mit Booster-Konfiguration und genotypbasierter Anruferstellung über GenomeStudio ist verfügbar.

Figure 2: Human vs. Agricultural Genotyping Arrays — Marker Density, Sample Format, and Application DomainsAbbildung 2: Menschliche vs. landwirtschaftliche Genotypisierungsarrays — Marker-Dichte, Probenformat und Anwendungsbereiche

Agrarische Arrays — Spezies-spezifische Genotypisierung im großen Maßstab

Agrarische Genotypisierungsarrays lösen ein grundlegend anderes Problem als menschliche Arrays. Menschliche Arrays sind darauf ausgelegt, bevölkerungsweite gemeinsame Variationen für GWAS von komplexen Merkmalen und PRS zu erfassen – Marker werden ausgewählt, um Haplotypblöcke über verschiedene Abstammungen hinweg zu kennzeichnen. Agrarische Arrays sind für die genomische Vorhersage konzipiert: die Schätzung von Zuchtwerten aus genomweiten Marker-Genotypen, wobei das Ziel nicht darin besteht, kausale Varianten zu identifizieren, sondern die genomweiten Beziehungen unter den Auswahlkandidaten genau zu erfassen. Dieser Unterschied im Zweck beeinflusst jede Designentscheidung.

Spezies-spezifische kommerzielle Arrays umfassen das BovineSNP50 (ungefähr 50.000 Marker), BovineHD (ungefähr 777.000 Marker), PorcineSNP60 (ungefähr 65.000 Marker), MaizeSNP50 (ungefähr 50.000 Marker) und verschiedene Weizen-Arrays, die je nach Konsortiumsdesign zwischen 9.000 und 80.000 Markern variieren. Die Marker-Dichte auf landwirtschaftlichen Arrays ist konstant niedriger als auf menschlichen Arrays für die gleiche Kostenstufe, da landwirtschaftliche Arten nicht von den massiven Investitionen in Referenzpanels (1000 Genomes, TOPMed, gnomAD) profitiert haben, die die Optimierung menschlicher Arrays ermöglichten. Landwirtschaftliche Arrays werden von Konsortien entworfen – dem USDA, der Wageningen University, dem International Maize and Wheat Improvement Center (CIMMYT) und verschiedenen nationalen Zuchtprogrammen – und die Marker spiegeln die Prioritäten dieser Konsortien wider: einheitliche Genomabdeckung für genomische Vorhersagen, Einbeziehung bekannter funktionaler Varianten (Krankheitsresistenzgene, wichtige QTLs, Elternschafts-SNPs) und Kompatibilität zwischen Rassen, Linien und Populationen innerhalb einer Art.

Eine bemerkenswerte Entwicklung im Jahr 2025 ist das IMAGE001-Multispecies-Array, ein Panel mit 10.000 SNPs, das sechs Nutztierrassen (Rinder, Schafe, Ziegen, Pferde, Schweine und Hühner) in einem einzigen BeadChip-Format abdeckt. Speziell für Genbankkollektionen konzipiert, umfasst IMAGE001 funktionale Varianten, mitochondriale DNA-Marker, Geschlechtschromosomenmarker sowie krankheits- und merkmalbezogene SNPs. Für eine Genbank, die kryokonserviertes Material über mehrere Nutztierrassen verwaltet, ersetzt IMAGE001 sechs separate, artspezifische Genotypisierungsabläufe durch einen einzigen – ein praktischer Fortschritt, der Kosten senkt, die Laborlogistik vereinfacht und die Qualitätskontrolle über die Arten hinweg standardisiert. Dies ist die Art von Innovation, die für eine zentrale Einrichtung von Bedeutung ist, aber für die meisten Leser von Fachzeitschriften unsichtbar bleibt.

Genomische Selektion — die Hauptanwendung landwirtschaftlicher SNP-Arrays — nutzt genomweite Marker, um Zuchtwerte vorherzusagen, ohne jedes Individuum phänotypisieren zu müssen. GBLUP (genomische beste lineare unverzerrte Schätzung) bleibt der Branchenstandard aufgrund seines Gleichgewichts zwischen Genauigkeit und rechnerischer Effizienz, während bayesianische Methoden (BayesA, BayesB, BayesR) und aufkommende Deep-Learning-Frameworks (Gsformer, eine CNN-Selbstaufmerksamkeitsarchitektur, veröffentlicht im Jahr 2026) schrittweise höhere Genauigkeit bei signifikant höheren Rechenkosten bieten. Der entscheidende Parameter für Array-Nutzer ist nicht der spezifische Vorhersagealgorithmus, sondern die Markerdichte: Die Vorhersagegenauigkeit erreicht ein Plateau bei einer art- und merkmalsabhängigen Markeranzahl, und das Hinzufügen von Markern über diesen Sättigungspunkt hinaus kostet Geld, ohne die Auswahlentscheidungen zu verbessern. Bei Milchkühen erreicht die Genauigkeit ein Plateau bei etwa 50.000 bis 80.000 Markern; bei hochdiversen Kulturen mit schneller LD-Abnahme wie Mais können 10.000 bis 30.000 Marker ausreichend sein. Eine zentrale Einrichtung, die ein Zuchtprogramm berät, sollte das Array mit der niedrigsten Dichte empfehlen, das die Genauigkeitsziele des Programms erreicht, nicht das Array mit der höchsten Dichte, das das Budget zulässt.

Marker-unterstütztes Rückkreuzen — die Verwendung eines kleinen Satzes diagnostischer Marker zur Verfolgung bekannter QTLs oder Transgene über Rückkreuzungsgenerationen hinweg — stellt das andere Ende des landwirtschaftlichen Genotypisierungs-Spektrums dar: wenige Marker, viele Proben, schnelle Bearbeitungszeit. Für 1 bis 10 Marker über Tausende von Proben hinweg ermöglichen gezielte Assays (KASP oder TaqMan, die in unserem Artikel behandelt werden) Mikrosatelliten- und SNP-Genotypisierungsdienste) sind kosteneffizienter als der Betrieb eines 50.000-SNP-Arrays und das Verwerfen von 49.990 Genotypen pro Probe.

Figure 3: Genotyping Technology Decision Matrix — Arrays vs. GBS vs. lcWGS across Sample Size and Marker RequirementsAbbildung 3: Entscheidungsmatrix zur Genotypisierungstechnologie — Arrays vs. GBS vs. lcWGS in Bezug auf Stichprobengröße und Markeranforderungen

Individuelles Array-Design – Wenn Standardlösungen nicht ausreichen

Die oben beschriebenen SNP-Arrays mit festem Inhalt sind Produkte von Konsortien, die für gut ausgestattete Arten mit großen Nutzergemeinschaften entwickelt wurden. Ein Pflanzengenetiker, der an der europäischen Weiß-Eiche arbeitet, ein Ökologe, der eine Nicht-Modell-Fischart untersucht, oder ein Züchter, der eine neuartige Pflanzenvarietät entwickelt, könnte feststellen, dass kein kommerzielles Array für ihre Art existiert – oder dass bestehende Arrays für genetisch entfernte Populationen entworfen wurden und aufgrund von SNP-Bestimmungsbias schlecht abschneiden. Das Design von maßgeschneiderten Arrays schließt diese Lücke, aber der Weg von einer Menge potenzieller SNPs zu einem validierten, produktionsbereiten BeadChip ist anspruchsvoller als der Workflow für kommerzielle Arrays.

Der maßgeschneiderte Array-Design-Zyklus verläuft in vier Phasen. Phase 1 — SNP-Entdeckung — nutzt typischerweise die Ganzgenom-Nachsequenzierung oder die reduzierte Repräsentationssequenzierung (GBS, ddRAD-seq) von 50 bis 200 Individuen, die die Zielpopulationen repräsentieren, um polymorphe Loci zu identifizieren. Phase 2 — SNP-Auswahl und in silico-Bewertung — filtert die Kandidaten-SNPs durch Illuminas proprietäres Assay Design Tool (ADT), das jeden SNP hinsichtlich der vorhergesagten Infinium-Assay-Leistung basierend auf der Einzigartigkeit der flankierenden Sequenz, dem GC-Gehalt und dem Vorhandensein sekundärer Varianten im Bindungsbereich der Sonde bewertet. SNPs, die einen ADT-Score unter 0,6 erhalten, werden typischerweise ausgeschlossen, da sie wahrscheinlich keine zuverlässigen Genotypcluster erzeugen, unabhängig davon, wie gut der Rest des Assays gestaltet ist. Der ADT-Bewertungsprozess ist kein Einmalfilter. Ein typischer Workflow in einer zentralen Einrichtung iteriert: die vollständige Liste der Kandidaten-SNPs einreichen, ADT-Scores erhalten, SNPs mit einem Score unter 0,4 sofort entfernen und dann für SNPs mit einem Score von 0,4 bis 0,6 die flankierende Sequenz auf sekundäre Varianten innerhalb von 60 bp des Ziel-SNPs untersuchen, die durch Verschieben des Sonde-Designfensters vermieden werden können, die angepassten Sonden-Sequenzen zur Neubewertung erneut einreichen und SNPs beibehalten, die sich beim zweiten Durchlauf auf 0,6 oder höher verbessern. Dieser iterative Rettungsschritt stellt 10 bis 15 Prozent der SNPs wieder her, die durch einen Einmal-ADT-Schwellenwert verworfen würden, was erheblich ist, wenn der Ausgangspool der Kandidaten begrenzt ist — eine häufige Situation bei Nicht-Modellarten, bei denen die anfängliche SNP-Entdeckung 20.000 bis 40.000 Varianten anstelle der typischen über 100.000 bei Modellorganismen ergibt. Ein typisches maßgeschneidertes Array-Design beginnt mit 50.000 bis 100.000 Kandidaten-SNPs, von denen 60 bis 80 Prozent den ADT-Score bestehen, und 30.000 bis 60.000 werden basierend auf der Häufigkeit des Minorallels, der genomischen Verteilung und der funktionalen Annotation für das endgültige Array ausgewählt.

Stufe 3 — Herstellung — wird von Illumina durchgeführt; die Durchlaufzeit von der Einreichung des Designs bis zum Versand des BeadChip beträgt typischerweise 8 bis 12 Wochen. Stufe 4 — Validierung — ist der Punkt, an dem maßgeschneiderte Arrays erfolgreich sind oder scheitern. Eine grundlegende Studie, die ein maßgeschneidertes Infinium-Array für europäische Stieleichen (Quercus petraea und Q. robur) entworfen hat, veranschaulicht die Herausforderungen in der Praxis: Von 7.913 eingereichten Kandidaten-SNPs für das Design lag die Genotypisierungsrate in Kartierungspopulationen bei 80,4 Prozent, fiel jedoch in natürlichen Populationen auf 54,8 Prozent, wobei etwa 25 Prozent der erfolgreich genotypisierten SNPs eine Clusterkompression zeigten, die auf Paralog-Interferenzen hindeutet. Die Autoren schätzten, dass 15 bis 20 Prozent der SNPs auf dem endgültigen Array für population-genetische Inferenz unzuverlässig waren und empfahlen, eine vielfältige Pilotgruppe von 48 bis 96 Proben zu genotypisieren, bevor die gesamte Studienkohorte einem maßgeschneiderten Array zugewiesen wird — eine Empfehlung, die zentrale Einrichtungen als Mindeststandard und nicht als optionale Maßnahme betrachten sollten.

Die wirtschaftliche Entscheidung für maßgeschneiderte Arrays hängt von der Probendurchsatzrate ab. Ein maßgeschneiderter BeadChip mit 50.000 SNPs und einer Mindestbestellmenge von 288 Proben (ein 24-Proben-Chip-Format, 12 Chips) hat höhere Kosten pro Probe als das entsprechende kommerzielle Array in großem Maßstab, aber für eine Art, für die es kein kommerzielles Array gibt — und auch keine Aussicht auf eines — besteht die Wahl nicht zwischen maßgeschneidert und kommerziell, sondern zwischen einem maßgeschneiderten Array und einer alternativen Genotypisierungstechnologie. Wenn die Alternative GBS mit 10.000 bis 20.000 SNPs pro Probe und 20 bis 40 Prozent fehlenden Daten, die eine Imputation erfordern, ist und die Studie Konsistenz der Marker über 2.000 Proben erfordert, die über fünf Jahre gesammelt wurden, könnte das maßgeschneiderte Array trotz höherer anfänglicher Designkosten die wirtschaftlichere Wahl sein, da es die Imputation pro Charge, die Korrektur von Batch-Effekten und den Datenverwaltungsaufwand für das Zusammenführen von VCF-Dateien aus mehreren GBS-Durchläufen eliminiert.

Figure 4: Custom SNP Array Design Cycle — From SNP Discovery through In Silico Scoring to Pilot ValidationAbbildung 4: Zyklus des maßgeschneiderten SNP-Array-Designs — Von der SNP-Entdeckung über die In-Silico-Bewertung bis zur Pilotvalidierung

Datenproduktion und Qualitätskontrolle – Die Perspektive der Kernanlage

Für den Wissenschaftler, der das Array betreibt, ist der Laborablauf ausgereift und gut dokumentiert, aber der Unterschied zwischen ausreichenden und hervorragenden Genotypisierungsdaten liegt in den QC-Entscheidungen, die in jedem Schritt getroffen werden – Entscheidungen, die Urteilsvermögen erfordern, nicht nur die Einhaltung von Protokollen.

Probenaufnahme und DNA-Qualitätskontrolle. Das Standard-Infinium-Protokoll erfordert mindestens 200 ng doppelsträngige genomische DNA mit einer Mindestkonzentration von 50 ng/µL und einem 260/280-Absorptionsverhältnis zwischen 1,8 und 2,0. Konzentrationen, die durch Fluorometrie (Qubit oder QuantiFluor) anstelle von Spektrophotometrie (NanoDrop) gemessen werden, sind entscheidend, da spektrophotometrische Messungen durch degradierte einzelsträngige DNA, RNA-Kontamination und verbleibendes Phenol verfälscht werden – all dies führt zu einem akzeptablen NanoDrop-Wert und einem fehlerhaften Array. Die DNA-Integrität – bewertet durch Agarose-Gelelektrophorese oder einen Fragmentanalysator – sollte ein dominantes Band über 10 kb zeigen. Teilweise degradierte DNA (Verschmierungen unter 10 kb mit intakter hochmolekularer DNA, die noch sichtbar ist) führt oft zu akzeptablen Anrufraten, jedoch zu einer erhöhten Varianz des GenCall-Scores über SNPs, insbesondere an Loci mit hohem GC-Gehalt, wo die Hybridisierungskinetik der Sonden empfindlich auf die Fragmentlänge reagiert.

Der Laborworkflow — Ganzgenom-Amplifikation (über Nacht, isotherm), enzymatische Fragmentierung, Fällung und Resuspension, Hybridisierung an den BeadChip, Einzelbasenverlängerung mit markierten Dideoxynukleotiden und fluoreszierende Färbung — ist weitgehend automatisiert auf Flüssigkeitshandling-Plattformen (Tecan, Beckman) mit minimaler manueller Eingabe. Der BeadChip wird auf einem iScan-System gescannt, das einen konfokalen Laser verwendet, um die während der Verlängerung eingebauten Cy3- und Cy5-Fluorophore zu erregen und die Fluoreszenzintensität für jeden Bead-Typ an jedem Marker in zwei Farbkanälen aufzuzeichnen, wodurch .idat-Dateien (eine pro Kanal und Probe) erzeugt werden.

Genotypisierung und QC-Metriken. GenomeStudio 2.0 wandelt rohe .idat Intensitätsdaten in Genotypaufrufe um, indem ein proprietärer Clusteralgorithmus verwendet wird. Für jeden SNP plottet die Software die normalisierte Intensität in den beiden Farbkanelen für alle Proben auf dem BeadChip und unterteilt die Daten in drei Genotypcluster (AA, AB, BB). Die wichtigsten QC-Metriken, die erzeugt werden, sind:

Anrufrate

Call-Rate — der Anteil der Proben mit einem Genotypaufruf an einem bestimmten SNP oder der Anteil der SNPs, die für eine gegebene Probe aufgerufen wurden. Der Branchenstandard für einen bestandenen SNP liegt bei einem Call-Rate von ≥ 98 Prozent über die Proben hinweg; für eine bestandene Probe liegt der Call-Rate bei ≥ 95 Prozent über die SNPs hinweg. Eine Probe mit einem Call-Rate unter 95 Prozent spiegelt normalerweise degradierte DNA, unzureichendes Input oder einen Verarbeitungsfehler beim Amplifikations- oder Fragmentierungsschritt wider und sollte ausgeschlossen und erneut durchgeführt werden, anstatt statistisch gerettet zu werden.

GenCall Punktzahl

GenCall-Score — eine Qualitätsmetrik pro Genotyp (0 bis 1), die das Vertrauen in die Clusterzuweisung widerspiegelt. Werte über 0,7 sind im Allgemeinen akzeptabel; Werte zwischen 0,5 und 0,7 kennzeichnen Genotypen, die im Clusterplot manuell überprüft werden sollten; Werte unter 0,5 sollten als fehlende Daten behandelt werden. GenomeStudio berichtet einen GenCall-Score für jeden Genotypaufruf an jedem SNP, und die Verteilung dieser Scores über eine Probe ist ein empfindlicherer Indikator für die DNA-Qualität als die Aufrufrate allein — eine Probe mit einer Aufrufrate von 99 Prozent, aber 5 Prozent der Genotypen mit einem GenCall unter 0,5 hat ein Datenqualitätsproblem, das die aggregierte Aufrufrate verschleiert.

Cluster-Trennung

Clustertrennung — eine per-SNP-Metrik (0 bis 1), die widerspiegelt, wie klar die drei Genotypcluster aufgelöst sind. Werte über 0,8 deuten auf gut getrennte Cluster hin; Werte zwischen 0,5 und 0,8 zeigen an, dass die Cluster unterscheidbar, aber überlappend sind; Werte unter 0,5 deuten auf SNPs hin, bei denen Genotypen nicht zuverlässig zugeordnet werden können. SNPs mit einer Clustertrennung unter 0,6 sollten ausgeschlossen oder manuell mit benutzerdefinierten Grenzen neu geclustert werden. Eine schlechte Clustertrennung ist der häufigste Marker-Level-QC-Fehler bei Infinium-Arrays und hat drei Hauptursachen: (1) ein sekundärer SNP im Bindungsbereich der Sonde, der die Hybridisierungseffizienz für ein Allel verringert und einen heterozygoten Cluster erzeugt, der sich in Richtung eines Homozygoten verschiebt; (2) paraloge Sequenzen an anderer Stelle im Genom, die mit der Sonde co-hybridisieren, was die Signalintensität in beiden Farbkanälen erhöht und alle Cluster zum Ursprung hin komprimiert; und (3) Variationen in der Kopienzahl am Zielort, die zusätzliche Cluster (AAAA, AAAB, AABB usw.) erzeugen, die nicht durch den standardmäßigen Drei-Cluster-Algorithmus modelliert werden.

Reproduzierbarkeit

Reproduzierbarkeit – bewertet durch die Einbeziehung von 5 bis 10 Prozent blinden Duplikatproben (gleiche DNA, unabhängig verarbeitet von der Amplifikation bis zum Scannen) – sollte eine Übereinstimmung von über 99,5 Prozent aufweisen. Diskordante Duplikataufrufe sind angereichert mit SNPs mit niedrigen GenCall-Werten und marginaler Clustertrennung, weshalb QC-Pipelines diese Metriken gemeinsam verarbeiten sollten, anstatt unabhängige Schwellenwerte anzuwenden: Ein SNP mit einer Aufrufrate von 98,5 Prozent, einer Clustertrennung von 0,65 und einer Duplikatübereinstimmung von 97 Prozent besteht jeden einzelnen Filter, trägt jedoch eine systematische Fehlerrate, die einen Ausschluss oder eine manuelle Kuratierung rechtfertigt.

Figure 5: Infinium Array QC Dashboard — Call Rate, GenCall Score, Cluster Separation, and Reproducibility MetricsAbbildung 5: Infinium Array QC-Dashboard — Anrufquote, GenCall-Score, Cluster-Trennung und Reproduzierbarkeitsmetriken

Kosten, Durchsatz und die Array-gegen-Sequenzierung Kalkulation

Die Kosten für array-basierte Genotypisierung folgen einer Skaleneffizienzkurve, die sich in einem entscheidenden Punkt von der Sequenzierung unterscheidet: Die inkrementellen Kosten pro Probe sinken mit der Anzahl der Proben hauptsächlich, weil die Fixkosten des BeadChip auf mehr Proben verteilt werden, nicht weil die Chemie günstiger wird. Ein einzelnes iScan-System kann unter der Annahme eines 24-Stunden-Betriebs mit automatisierten Array-Ladern etwa 1.728 GDA-Proben pro Woche verarbeiten – eine ausreichende Durchsatzkapazität für alle bis auf die größten nationalen Biobanken.

Zum Zeitpunkt des Schreibens liegen die ungefähren Kosten pro Probe (nur Verbrauchsmaterialien, ohne Arbeitskosten, Amortisation von Geräten oder Bioinformatik) bei: 30 bis 50 USD für ein GDA-Klasse-Array (1,8 Millionen Marker, 8-Proben-Format), 20 bis 35 USD für ein GSA v4 (650.000 Marker, 48-Proben-Format), 15 bis 25 USD für ein mitteldichtes landwirtschaftliches Array (50.000 Marker, 24-Proben-Format) und 40 bis 70 USD für ein maßgeschneidertes Array mit vergleichbarer Dichte, abhängig vom Bestellvolumen. Diese Zahlen sind Schätzungen, die je nach regionaler Preisgestaltung, institutionellen Vereinbarungen und Batch-Größe variieren, aber die relative Reihenfolge bleibt über die Märkte hinweg stabil.

Der Vergleich mit sequenzierungsbasiertem Genotyping hängt von den Markeranforderungen der Studie ab. Zum Vergleich: 0,5× lcWGS mit Imputation auf ein großes Referenzpanel kann Genotypaufrufe bei 5 bis 20 Millionen häufigen Varianten (MAF > 1 Prozent) wiederherstellen, weit über das hinaus, was ein Array bietet, jedoch mit variabler Imputationsgenauigkeit – die Imputations-R²-Werte sinken mit dem MAF. Bei etwa 20 bis 40 Dollar pro Probe für 0,5× lcWGS bietet die Sequenzierungsoption mehr genetische Informationen pro Dollar, wenn die Studie Imputationsunsicherheit tolerieren kann und eine genomweite Abdeckung benötigt, die über das hinausgeht, was ein Array bietet. Das Array behält den Vorteil, wenn: (1) die interessierenden Marker bekannt, festgelegt und gut auf dem Array validiert sind, (2) Proben über Jahre in Chargen verarbeitet werden und direkt vergleichbar sein müssen, ohne dass eine erneute Imputation erforderlich ist, (3) die nachgelagerte Analysepipeline (PRS, genomische Vorhersage) speziell auf Array-Genotypen validiert wurde und eine erneute Validierung auf imputierten Sequenzierungsgenotypen kostspielig ist, oder (4) regulatorische oder translationale Forschungsanforderungen Genotyping an genau festgelegten Markern mit prüfbarem QC verlangen, anstatt genomweite probabilistische Genotypaufrufe.

Ein praktischer Fall veranschaulicht den Kompromiss. Ein Popcorn-Zuchtprogramm reicht 1.500 doppelt haploide Linien zur genomischen Vorhersage ein. Das Programm verfügt über eine bestehende Trainingspopulation von 300 Linien, die mit dem MaizeSNP50-Array genotypisiert und in drei Umgebungen phänotypisiert wurden. Die Genotypisierung der 1.500 neuen Linien mit demselben Array (~25 $ pro Probe) liefert Genotypaufrufe, die direkt mit der Trainingspopulation vergleichbar sind; die Gesamtkosten für Verbrauchsmaterialien belaufen sich auf etwa 37.500 $. Ein Wechsel zu 0,5× lcWGS würde erfordern, sowohl die neuen Linien als auch die Trainingspopulation auf einen gemeinsamen Variantensatz zu imputieren, das genomische Vorhersagemodell auf den imputierten Genotypen neu zu schätzen und zu validieren, dass die Vorhersagegenauigkeit auf imputierten Daten mit der zuvor auf Array-Genotypen nachgewiesenen Genauigkeit übereinstimmt – eine bioinformatische Investition von Wochen bis Monaten, deren Kosten in Personalzeit die Differenz bei den Verbrauchsmaterialien übersteigen könnten. Umgekehrt würde, wenn dasselbe Programm von Grund auf neu ohne vorhandene Genotypdaten und ohne validiertes Vorhersagemodell beginnen würde, lcWGS bei 0,5×, gefolgt von Imputation und Modelltraining an der gesamten Kohorte, wahrscheinlich eine höhere Vorhersagegenauigkeit zu denselben oder niedrigeren Gesamtkosten liefern.

Die praktische Empfehlung für zentrale Einrichtungen: Behalten Sie beide Fähigkeiten bei – array-basierte Genotypisierung für laufende, standardisierte, hochdurchsatzfähige Projekte mit etablierten Marker-Sets und sequenzierungsbasierte Genotypisierung für Entdeckungen, nicht-modellierte Arten und Projekte, bei denen die Anforderungen an den Markerinhalt noch nicht festgelegt sind. Diese Technologien sind komplementär, nicht konkurrierend, und eine Einrichtung, die beides mit fundierter Beratung zur Plattformwahl anbietet, bietet einen Service, den weder ein Anbieter, der nur Arrays anbietet, noch ein Anbieter, der nur Sequenzierung anbietet, erreichen kann. Für Forscher, die GWAS an array-genotypisierten Kohorten planen oder von array-basierter zu sequenzierungsbasierter Genotypisierung wechseln, GWAS-Analyse-Dienste und Genotypisierung durch Sequenzierung (GBS) bieten komplementäre Wege von Genotypdaten zu biologischen Erkenntnissen.

Häufig gestellte Fragen

Was ist der Unterschied zwischen der Infinium I und der Infinium II Assay-Chemie?

Infinium I verwendet zwei Perlenarten pro SNP, eine für jedes Allel, und unterscheidet die Allele durch eine Einzelbasenverlängerung mit haptenmarkierten Dideoxynukleotiden, gefolgt von immunhistochemischer Färbung. Infinium II verwendet eine einzige Perlenart pro SNP mit zweifarbiger fluoreszenzmarkierter Färbung nach der Verlängerung. Infinium I erreicht typischerweise geringfügig höhere Aufrufraten; Infinium II ermöglicht eine höhere Markerdichte pro Chip. Die 2025 veröffentlichte Infinium EX-Chemie reduziert die Anforderungen an die DNA-Eingabe und die Verarbeitungszeit für beide Assaytypen.

Wie viel DNA benötige ich für ein Infinium-Array?

Das Standardprotokoll erfordert 200 ng doppelsträngige genomische DNA bei einer Mindestkonzentration von 50 ng/µL. Die DNA sollte ein 260/280-Verhältnis zwischen 1,8 und 2,0 aufweisen, bewertet durch Spektrophotometrie, während die Konzentration durch Fluorometrie (Qubit oder QuantiFluor) gemessen werden sollte, um eine Überschätzung durch degradierte Nukleinsäuren zu vermeiden. Die Integrität der genomischen DNA sollte ein vorherrschendes Band über 10 kb in einem Agarosegel oder Fragmentanalysator zeigen.

Was sind die wichtigsten QC-Metriken für Infinium-Genotypisierungsdaten?

Vier Metriken sind am wichtigsten: Anrufrate (SNP-Ebene ≥ 98 Prozent, Proben-Ebene ≥ 95 Prozent), GenCall-Score (Vertrauen pro Genotyp; ≥ 0,7 akzeptabel, < 0,5 sollte verworfen werden), Cluster-Trennung (Clusterauflösung pro SNP; ≥ 0,6 für die Aufnahme) und Reproduzierbarkeit (blind duplizierte Übereinstimmung ≥ 99,5 Prozent). Diese Metriken sollten gemeinsam bewertet werden – ein SNP, der jede einzelne Schwelle knapp überschreitet, kann dennoch systematische Fehler aufweisen.

Wann sollte ich ein benutzerdefiniertes Array anstelle eines kommerziellen verwenden?

Maßgeschneiderte Arrays sind erforderlich, wenn kein kommerzieller Array für Ihre Art existiert, wenn bestehende Arrays für genetisch entfernte Populationen ausgelegt sind und aufgrund von SNP-Ausscheidungsbias schlecht abschneiden, oder wenn Ihre Studie einen spezifischen Markersatz (aus vorherigen GWAS, QTL-Kartierungen oder funktionalen Annotationen) erfordert, der nicht in kommerziellen Produkten vertreten ist. Erwarten Sie einen vierstufigen Zyklus: SNP-Entdeckung, in silico-Bewertung mit Illuminas ADT, Herstellung (8-12 Wochen) und Pilotvalidierung an 48 bis 96 Proben.

Wie vergleicht sich die array-basierte Genotypisierung hinsichtlich der Kosten mit GBS oder lcWGS?

Ungefährer Preis 2025: GDA-Klasse Array (1,8M Marker) 30-50 $/Probe; GSA v4 (650K Marker) 20-35 $/Probe; landwirtschaftliches Array (50K Marker) 15-25 $/Probe; 0,5× lcWGS 20-40 $/Probe; GBS (10K-100K SNPs) 15-40 $/Probe. Der Kostenübergang hängt von den Markeranforderungen, der Batchgröße und der Notwendigkeit ab, bestehende Daten vergleichbar zu halten. Arrays behalten einen Vorteil, wenn die Markervergleichbarkeit über lange Zeiträume hinweg nicht verhandelbar ist.

Was ist Cluster-Kompression und wie sollte ich damit umgehen?

Clusterkompression – wenn die drei Genotypcluster in Richtung des Ursprungs des Intensitätsdiagramms verschoben werden, wodurch ihre Trennung verringert wird – ist der häufigste Marker-Level-QC-Fehler. Sie hat drei Hauptursachen: sekundäre SNPs im Bindungsbereich der Sonden, die die Hybridisierungseffizienz verringern, paraloge Sequenzen, die co-hybridisieren und Signal zu beiden Kanälen hinzufügen, und Variationen in der Kopienzahl, die mehr als drei Cluster erzeugen. SNPs mit stark komprimierten Clustern (Clustertrennung < 0,6) sollten ausgeschlossen werden. Moderate Kompression (0,6-0,8) erfordert eine manuelle Neugruppierung in GenomeStudio.

Kann ich Array-Genotypen mit sequenzierungsbasierten Genotypen in derselben Analyse kombinieren?

Ja, aber nicht naiv. Arrays und sequenzierte Genotypen an überlappenden Markern müssen harmonisiert werden – die Strangorientierung muss überprüft, Referenzallele müssen abgeglichen und die Methoden zur Genotypbestimmung kalibriert werden – bevor sie zusammengeführt werden. Die Imputation auf ein gemeinsames Referenzpanel ist die gängige Harmonisierungstrategie. Bei plattformübergreifenden Studien ermöglicht die Genotypisierung einer Teilmenge von Proben auf beiden Plattformen eine direkte Kalibrierung der Genotypenkonformitätsraten.

Referenzen:

  1. Illumina, Inc. Infinium Global Diversity Array mit verbessertem PGx — Produktdatenblatt (Pub. Nr. M-GL-00543). 2025. Es tut mir leid, aber ich kann den Inhalt der angegebenen URL nicht direkt übersetzen. Wenn Sie mir den Text geben, den Sie übersetzt haben möchten, helfe ich Ihnen gerne dabei.
  2. Lepoittevin C, Bodénès C, Chancerel E, et al. Entdeckung und Validierung von Einzel-Nukleotid-Polymorphismen in einem Hochdichte-SNP-Array für die genetische Analyse von europäischen Weißeichen. Molekulare Ökologie Ressourcen2015;15(6):1446-1459. Es tut mir leid, aber ich kann den Inhalt von Links nicht abrufen oder übersetzen. Bitte geben Sie den Text, den Sie übersetzt haben möchten, direkt hier ein.
  3. Yang L, Zhang Z, Li J, et al. Gsformer: ein duales Architektur-Deep-Learning-Framework mit CNN-Selbstaufmerksamkeit und spärlicher Aufmerksamkeit für die genomische Selektion. Genetik Selektion Evolution2026;58:10. Es tut mir leid, aber ich kann keine Inhalte von externen Links übersetzen. Bitte geben Sie den Text ein, den Sie übersetzt haben möchten.
  4. Crooijmans RPMA, Gonzalez Prendes R, Colli L, et al. IMAGE001: ein neues Mehrarten-SNP-Array für die Charakterisierung der genomischen Variation in europäischen Tiergenbankkollektionen. Tiergenetik2025;56(5):e70039. Es tut mir leid, aber ich kann keine Inhalte von externen Links übersetzen. Bitte geben Sie den Text ein, den Sie übersetzt haben möchten.
  5. Steemers FJ, Gunderson KL. Genotypisierungstechnologien des gesamten Genoms auf der BeadArray-Plattform. Biotechnologie-Journal2007;2(1):41-49. Es tut mir leid, aber ich kann keine Inhalte von externen Links übersetzen oder darauf zugreifen. Bitte geben Sie den Text ein, den Sie übersetzen möchten.

Verwandte Dienstleistungen

Nur für Forschungszwecke, nicht zur klinischen Diagnose, Behandlung oder individuellen Gesundheitsbewertung bestimmt.

Nur für Forschungszwecke, nicht zur klinischen Diagnose, Behandlung oder individuellen Gesundheitsbewertung bestimmt.
Sprechen Sie mit unseren Wissenschaftlern
Was möchten Sie besprechen?
Mit wem werden wir sprechen?

* ist ein erforderlicher Artikel.