Die Herausforderung
Forschungspublikationen kamen live von Verlagen und Datenbanken wie Springer und PubMed, in vielen Dokumentformaten und in schwankenden Volumen. Die Plattform musste die Rohdaten als Beleg aufbewahren, Metadaten normalisieren, die Anreicherung koordinieren und jedes neue Paper schnell nutzbar machen, während jedes Ergebnis nachvollziehbar und wiederherstellbar blieb.
Streaming, Batch, Suche, Speicherung und Orchestrierung mussten deshalb als ein System zusammenarbeiten.
Warum es schwierig war
Zu den Quellformaten gehörten JATS/BITS-XML und anbieterspezifische Metadaten.
Die Verarbeitung musste bei zig Millionen Events pro Tag zuverlässig bleiben.
Lang laufende Anreicherungsschritte erforderten Replay, Dead-Letter-Handling und Idempotenz.
Die Forschenden brauchten Volltextsuche und einen Knowledge Graph aus denselben Daten.
Die Infrastruktur brauchte wiederholbare Deployments über viele AWS-Services hinweg.
Neue Publikationen mussten die Forschenden bei Veröffentlichung erreichen, nicht in einem wöchentlichen Batch.
Was wir geliefert haben
Jede Stufe bewahrt die Belege, die nötig sind, um ein abgeleitetes Ergebnis bis zur Quelle zurückzuverfolgen und fehlgeschlagene Verarbeitung sicher erneut auszuführen.
Ergebnisse
<1 Min.
Vom Eingang einer neuen Publikation bis zur Nutzung durch die Forschenden
1 Mrd.+
Datensätze, verwaltet in Apache Iceberg
30 Mio.+
Verarbeitete Events pro Tag
500 Mio.+
Verarbeitete Publikationsdatensätze, einer pro XML-Datei
45 Mio.+
Entitäten im Knowledge Graph, verknüpft durch Millionen von Beziehungen
TECHNOLOGIE
AWS
Amazon S3
Apache Iceberg
Amazon MSK
AWS Glue
Amazon ECS auf AWS Fargate
AWS Lambda
Amazon SQS
Amazon SNS
Amazon EventBridge
Amazon OpenSearch ServiceNeo4j
Amazon DynamoDB
Amazon CloudWatchPulumi