Zum Inhalt springen
Logo CDS und DAViS Blog

Computational and Data Science Blog

Vom Da­ten­dschun­gel zum Spiel­be­richt

Geschrieben von Computational and Data Science Studenten Ilaj Lüchinger, Abdul Geylani Semiz und Michael Höhener im Rahmen des Moduls «Natural Language Processing».

Im modernen Fussball sind längst nicht nur Tore entscheidend, sondern vor allem Daten: Die Anzahl der Spiele und damit auch die Menge an Statistiken hat sich durch die Einführung der UEFA Conference League und das neue Format der Champions League enorm erhöht. Anbieter wie StatsBomb erfassen in Echtzeit Daten, wie Expected Goals und Zweikampfquoten, und bieten somit einen perfekten Ausgangspunkt für automatisierte Berichte, die Redaktionen entlasten und Spiele abdecken, für die sonst niemand Zeit hat. Grosse Sprachmodelle wie GPT-4 können aus diesen Daten flüssig lesbare Texte erstellen, aber sie haben mit einem zentralen Problem zu kämpfen: Halluzinationen.

Ein selbst durchgeführter Test, bei dem ein automatisch erstellter Bericht zum Spiel Galatasaray gegen Liverpool genutzt wurde, veranschaulicht das Problem. Das Modell dichtete unter anderem dem Spieler Szoboszlai ein Handspiel zu, obwohl es in Wahrheit einen Kontakt mit dem Gesicht des Gegenspielers gab. Zudem schrieb es Spieler Mohamed Salah eine blasse erste Halbzeit zu, obwohl er erst in der 62sten Minute eingewechselt wurde. Das Modell erwähnte letztlich noch Spieler, die zu diesem Zeitpunkt nicht mehr im Kader standen.

Fehler dieser Art sind nicht nur ärgerlich, sie schaden auch der Glaubwürdigkeit der automatischen Sportberichterstattung, besonders in Situationen, in denen die Fakten eigentlich klar sind.

Die zentrale Idee: Data-to-Text mit Knowledge Graphs

Genau an diesem Punkt setzt das Projekt an. Es erforscht, ob die Qualität von automatisch erstellten Fussballberichten verbessert wird, wenn strukturierte Spieldaten vor der Textgenerierung mit Informationen aus einem Knowledge Graph (auch «Wissensgraph», welches Informationen als Objekte und deren Verbindungen zu einander in einem Netzwerk abbildet) wie Wikidata angereichert werden. Die Forschungsfrage untersucht, ob die semantische Qualität der Berichte verbessert werden kann, ohne die Faktentreue zu beeinträchtigen. Der Ansatz basiert auf dem Prinzip des «Grounding»: Ein Sprachmodell sollte nicht aus seinem unscharfen Trainingswissen schöpfen, sondern gezielt aktuelle und klar verknüpfte Fakten nutzen.

Die Arbeit beschäftigt sich mit der Data-to-Text-Generierung, einem anerkannten Teilbereich der Natural Language Generation, wo strukturierte Daten in Texte der natürlichen Sprache umgewandelt werden. Ältere Systeme arbeiteten vor allem mit Templates: Sie waren faktentreu, doch oft starr, repetitiv und aufwändig zu pflegen. Während neuere, neuronale Verfahren einen deutlich höheren Schreibfluss bieten, tragen sie doch auch die Gefahr, Fakten zu erfinden oder inkonsistent wiederzugeben.

Datenbasis: 38 Spiele von Manchester United

Ein frei zugänglicher Kaggle-Datensatz mit Fussball-Spieldaten aus verschiedenen Ligen dient als Testfeld, aus dem alle Ligaspiele von Manchester United in der Saison 2023/24 gefiltert wurden. Die Daten, die im CSV-Format vorliegen, umfassen neben Spielstand und Ereignissen auch eine Vielzahl von Leistungskennzahlen. Allerdings sind diese Rohdaten in der Praxis alles andere als «plug and play»: Abkürzungen werden für Spielernamen verwendet («Olise M.»), Stadien sind ergänzt durch Zusätze wie «(London)». Ohne eine Bereinigung ist es externen Wissensquellen nur schwer möglich, die richtigen Entitäten zu identifizieren.

Aus diesem Grund wurden die Daten zuerst in ein konsistentes JSON-Format umgewandelt, das zwei Hauptbereiche voneinander trennt. Die Rahmendaten wie Liga, Teams, Ergebnis, Datum, Stadion (einschliesslich Wikidata-Link), Zuschauerzahl und Schiedsrichter sind unter «Match_Info» zu finden. Die tatsächlichen Spieldaten, einschliesslich Kennzahlen wie Expected Goals, Ballbesitz, Karten, Fouls und Schüssen, sind im «Match_Statistics»-Datensatz enthalten, der auch eine chronologische Eventliste mit Toren, Auswechslungen und Verwarnungen umfasst. Die strukturierte Basis ist entscheidend dafür, dass ein Language Model kontrolliert mit den Daten arbeiten kann.

Architektur der Enrichment-Pipeline

Modular aufgebaut, verarbeitet die «Enrichment-Pipeline» die Daten schrittweise von der CSV-Datei bis zum fertigen, angereicherten JSON. Zu Beginn werden die Rohdaten eingelesen und zentrale Matchinformationen extrahiert, bevor sie in ein Zwischenformat überführt werden. Ereignisdaten, wie Tore oder Karten, werden nach dem Spiel aus den Rohfeldern in eine saubere, chronologische Struktur überführt, die später als narratives Rückgrat des Spielberichts fungiert.

Das Herzstück der Anreicherung ist die Verbindung zu Wikidata über SPARQL-Abfragen. Spieler, Teams und Stadien werden über einen öffentlichen Endpunkt gesucht, wobei die Pipeline durch Mechanismen wie Rate-Limiting, Timeouts und Fehlerbehandlung robust gegen Ausfälle und Drosselung aufgestellt ist. Ein Spieler, wie Michael Olise, wird beispielsweise eindeutig über seine Wikidata-ID verknüpft, und Aliasse werden direkt mitgespeichert. Neben der Hauptbezeichnung werden für Teams auch Kurzformen und Spitznamen übernommen, falls diese existieren, um später sprachliche Variation im Text zu schaffen.

Entity Linking: Eindeutige Benennung von Namen

Zuerst erfolgt die Auflösung der Vereine beim sog. Entity Linking: Schreibweisen wie «Manchester Utd» werden zusammen mit Kontextinformationen wie Liga und Saison in Wikidata gesucht und der entsprechenden Vereinsentität zugeordnet. Über bereinigte Namen und die dazugehörigen Städte werden Stadien identifiziert, was Bezeichnungen wie «Selhurst Park (London)» auf eine saubere Wikidata-Entität zurückführt.

Spieler sind hierbei die grösste Herausforderung, da abgekürzte Namen schnell zu Mehrdeutigkeiten führen können. Ein weiterer Kaggle-Datensatz mit vollständigen Spielernamen wird genutzt, um die Kurzformen aus dem Match-Datensatz zu ergänzen und dieses Problem zu lösen. Ein Spieler lässt sich nicht nur über seinen Namen, sondern auch über seinen Verein und die Saison 2023/24 eindeutig identifizieren. Zusätzlich zur Wikidata-ID speichert die Pipeline Aliasse, damit später im Bericht zwischen vollem Namen und alternativen Bezeichnungen gewechselt werden kann, ohne dass es zu Verwirrungen kommt. Der Ansatz löst das Problem, dass generative Modelle sonst Personen mit gleichem Nachnamen verwechseln oder auf veraltete Kaderinformationen zurückgreifen.

Die Kombination von Wissensgraphen und Entity Linking bietet hier einen vielversprechenden Ansatz: mehr Kontext und Sprachvielfalt, während die Faktengrundlage weiterhin kontrollierbar bleibt.

Prompt Creation: Original vs. Enhanced

Zur Messung des Effekts der angereicherten Daten kommen zwei fast identische Prompts zum Einsatz: ein «Original»-Prompt, das nur die Grunddaten ohne Wikidata-Metadaten nutzt, und ein «Enriched»-Prompt, das zusätzlich von den angereicherten Spieler-, Team- und Stadioninformationen profitiert.

Die beiden Prompts sind durch strenge Regeln definiert. Das Modell darf keine Fakten erfinden, keine Spieler oder Statistiken hinzufügen, die nicht existieren, keine historischen Vergleiche stellen und keine Taktikanalysen durchführen, die es nicht gibt. Alles, was nicht ausdrücklich in den strukturierten Daten enthalten ist, wie Torschützen, Spielminuten, Karten, Schiedsrichter, Wettbewerb und Zuschauerzahlen, ist nicht erlaubt. In Bezug auf Stil sollen beide Fassungen wie ein kurzer Zeitungsbericht mit rund 1'000 Tokens aussehen, unterteilt in 3–5 Absätzen mit fliessenden Übergängen. Der Unterschied: Der Enriched-Prompt kann zusätzlich Aliasse und ergänzende Metadaten aus der JSON-Struktur verwenden, was ihm mehr sprachliche Variabilität und Kontextreichtum verleiht.

Evaluationsdesign: Metriken und Menschen vereint

Zur Beurteilung der Qualität der erzeugten Berichte nutzt das Projekt ein mehrdimensionales Evaluationsdesign, das sowohl automatische Metriken als auch menschliche Rater umfasst. In der automatischen Bewertung kommen vier Kennzahlen zur Anwendung: FactScore zur Bewertung der Faktentreue sowie BLEU, ROUGE-L und BERTScore, die lexikalische beziehungsweise semantische Ähnlichkeit messen. Besonders FactScore ist innovativ, da es den Text in atomare Fakten zerlegt und jede Aussage einzeln mit einer Wissensbasis vergleicht, was über traditionelle Metriken hinausgeht.

Allerdings erfassen automatische Metriken nicht alle Aspekte, die Leser:innen als «guten Text» wahrnehmen. Aus diesem Grund bewerten sechs menschliche Rater die Berichte anhand einer 5-Punkte-Likert-Skala in Bezug auf Lesbarkeit, Natürlichkeit, Kohärenz und Gesamteindruck. Die Bewertung geschieht als Blind Review: Die Rater sind sich nicht bewusst, ob sie eine Original- oder Enriched-Version lesen, und entscheiden am Ende jedes Paares, welchen Bericht sie insgesamt bevorzugen.

Ergebnisse der automatisierten Metriken

Die automatische Bewertung erfolgt auf insgesamt 38 Spielberichten. Was den FactScore angeht, der den Anteil korrekt gestützter Fakten erfasst, sind die Original- und die Enriched-Variante praktisch gleichauf: im Durchschnitt 0,812 bzw. 0,813.

Dieser Wert erhält noch mehr Aussagekraft, wenn man ihn mit anderen Benchmarks vergleicht: In früheren Analysen erzielte ChatGPT bei der Biografie-Generierung einen FactScore von etwa 58%, während retrieval-augmentierte Systeme rund 71,5% erreichten. Die hier verzeichneten 81% sind deutlich besser. In diesem Zusammenhang belegen die BERTScore-Werte, die im Schnitt bei 0,93 liegen, eine sehr hohe semantische Übereinstimmung zwischen den Original- und den Enriched-Berichten. Mit einem durchschnittlichen Wert von 37,7 für BLEU und etwa 0,53 für ROUGE-L sind diese Zahlen im mittleren Bereich und belegen, dass Anpassungen an den Formulierungen vorgenommen werden, ohne dass der Inhalt verändert wird.

Was Leser:innen wahrnehmen

Die menschliche Bewertung zeigt klar, dass die angereicherte Variante bevorzugt wird. In Bezug auf allen vier Kriterien erzielen Enriched-Berichte bessere Ergebnisse: Die Werte variieren zwischen +0,42 Punkten in Bezug auf die Lesbarkeit und +0,63 Punkten beim Gesamteindruck. Eine besonders positive Wirkung zeigt die Anreicherung auf Kohärenz und Professionalität.

Der Unterschied wird bei der Präferenzwahl noch deutlicher: In 61,6% der Fälle ziehen die Rater den Enriched-Bericht vor, in 23,6% sehen sie beide Versionen als gleichwertig, und nur in 15,3% der Fälle schneidet die Original-Variante besser ab. Es wird deutlich, dass die Pipeline nicht nur messbar, sondern auch subjektiv zu besseren Texten führt. Oder überspitzt gesagt: «Die Data-to-Text-Pipeline verwandelt Statistiken in Stories, die sich lesen, als hätte ein echter Fussballkenner sie verfasst.»

Grenzen und Transferierbarkeit

Obwohl die Ergebnisse durchweg positiv sind, nimmt die Studie bewusst eine vorsichtige Haltung bezüglich ihrer Generalisierbarkeit ein. Die Evaluation betrachtet nur die Spiele von Manchester United in einer einzigen Saison der Premier League, was die Übertragbarkeit auf andere Teams, Ligen oder Sportarten einschränkt. Ausserdem ist der Ansatz auf strukturierte, tabellarische Daten angewiesen sowie deren Qualität und Vollständigkeit.

Auch FactScore ist nicht ohne Grenzen: Subjektive oder wertende Kommentare wie «Es unterstreicht Garnachos aufstrebendes Talent» können zwar faktisch plausibel sein, werden jedoch als «nicht gestützt» angesehen, weil der zugrunde liegende Datensatz solche Bewertungen nicht enthält. Das beweist, dass Metriken lediglich einen Teilaspekt der Qualität erfassen und ihre Ergebnisse im kontextabhängig betrachtet werden müssen.

Schlussfolgerung: Ein Bauplan für glaubwürdigen Auto-Sportjournalismus

Insgesamt beantwortet das Projekt die Forschungsfrage klar und deutlich positiv: Das Hinzufügen von Knowledge-Graph-Informationen zu strukturierten Spieldaten verbessert die wahrgenommene Qualität automatisch generierter Fussballberichte erheblich, ohne dass die Faktentreue beeinträchtigt wird. Inhaltlich sind die Berichte stabil, aber sie gewinnen durch sprachliche Verbesserungen an Natürlichkeit, Informationsgehalt und professioneller Wirkung und das bei FactScore-Werten, die über die gängigen Baselines hinausgehen.

Die Pipeline bietet Medienhäusern, Datenanbietern und Sportplattformen einen konkreten Bauplan: Es ist eine bessere Investition, in saubere Datenmodelle, Entity Linking und Wissensgraphen zu investieren, als «nur» ein LLM über Rohstatistiken laufen zu lassen. An genau den Punkten, wo Fans, Vereine und Sponsoren besonders empfindlich auf Fehler reagieren, kann dieser Ansatz die automatisierte Sportberichterstattung auf ein Niveau heben, das nicht nur technisch beeindruckt, sondern auch journalistisch überzeugt.

Unbegrenzte Karrieremöglichkeiten in Informatik, Data Science und Computersimulation:

Jetzt für deinen BSc in Computational and Data Science anmelden!

Anzahl Kommentare 0
Kommentare