Zum Inhalt springen
Logo CDS und DAViS Blog

Computational and Data Science Blog

Umgang mit wi­der­sprüch­li­chen In­for­ma­tio­nen in Large Lan­guage Models: Eine em­pi­ri­sche Un­ter­su­chung von Promp­ting-Stra­te­gien

Geschrieben von Computational and Data Science Studenten Philip Solinger, Simon Rüegg und Lars Willi im Rahmen des Moduls «Natural Language Processing».

Large Language Models (LLMs) haben sich in kürzester Zeit zu einer zentralen Schnittstelle für den Wissenszugriff entwickelt. Technologien wie Retrieval-Augmented Generation (RAG) erlauben es diesen Modellen, auf externe Datenbanken zuzugreifen, um Fragen präzise zu beantworten. Doch dies birgt eine fundamentale Herausforderung, die in der Forschung und Praxis oft unterschätzt wird: der Umgang mit widersprüchlichen Informationen.

Was passiert, wenn ein KI-Modell zwei Dokumente erhält, die inkonsistente Fakten enthalten - beispielsweise abweichende Datumsangaben zu einem historischen Ereignis? Idealerweise würde das Modell diese Diskrepanz erkennen und transparent kommunizieren. Die Realität sieht jedoch oft anders aus. Es besteht die Gefahr, dass das Modell halluziniert oder willkürlich eine der beiden Quellen als Wahrheit wählt, ohne den User auf den Konflikt hinzuweisen.

Dieses Phänomen bezeichnen wir als «Silent Failure», ein stilles Versagen. In kritischen Anwendungsbereichen wie medizinischen Diagnoseassistenten, juristischen Recherche-Tools oder automatisierten Fact-Checking-Systemen können solche Fehler gravierende Folgen haben. Während sich bisherige Forschung primär auf die Verbesserung der Suchalgorithmen («Retrieval») konzentrierte, adressiert unsere Arbeit eine Forschungslücke: Wie gut können LLMs Konflikte allein durch ihre logischen Fähigkeiten («Reasoning») bewältigen, und wie können wir sie durch gezieltes Prompt Engineering dabei unterstützen?

Methodik: Ein Stresstest für KI-Modelle

Um diese Fragen zu beantworten, führten wir eine systematische Experimentalstudie durch. Ziel war es, den Einfluss von Prompt-Engineering isoliert von potenziellen Fehlern im Suchprozess zu quantifizieren. Dafür simulierten wir ein ideales Retrieval-Szenario («Oracle RAG»), bei dem wir den Modellen direkt widersprüchliche Textpassagen als Kontext injizierten.

Als Testumgebung diente der WikiContradict-Benchmark. Im Gegensatz zu synthetischen Datensätzen basiert dieser auf realen, von Wikipedia-Editor:innen markierten Widersprüchen («Self-Contradictions»). Dies gewährleistet eine hohe Praxisrelevanz, da echte Wissenskonflikte oft nuanciert und kontextabhängig sind. Unser stratifiziertes Sample umfasste sowohl explizite Widersprüche (z. B. unterschiedliche Zahlenwerte) als auch implizite Konflikte, die logische Schlussfolgerungen erfordern.

Das Experimentelle Design

Wir untersuchten insgesamt 4'200 Inferenz-Schritte in einem voll-faktoriellen Design. Dabei variierten wir drei Dimensionen:

  1. Modellgrösse: Wir testeten ein Spektrum aktueller Open-Weights-Modelle (Stand Ende 2024), vom effizienten Edge-Modell Llama 3.2 3B über das mittlere Qwen 2.5 14B bis hin zum leistungsstarken Llama 3.3 70B.
  2. Prompting-Strategien: Wir verglichen sieben Ansätze, von einfachen Baselines («Zero-Shot») bis zu komplexen Reasoning-Mustern wie «Chain-of-Thought» und «Deliberate Prompting».
  3. System-Prompts: Wir prüften den Einfluss einer neutralen System-Instruktion gegenüber einer widerspruchsbewussten Instruktion («Contradiction-Aware»), die das Modell explizit zur Konflikterkennung auffordert.

Ergebnisse: Die Macht des Kontrastes

Unsere erste Forschungsfrage beschäftigte sich mit der Effektivität verschiedener Reasoning-Strategien. Die Ergebnisse zeigen deutlich, dass LLMs Widersprüche nicht «nebenbei» erkennen. Einfache Strategien, wie Zero-Shot oder One-Shot, versagten in der Mehrheit der Fälle und erreichten nur Erkennungsraten von rund 18%.

Der Durchbruch gelang mit spezialisierten Prompting-Techniken. Als effektivste Methode erwies sich das Contrastive Prompting. Hierbei wird das Modell explizit aufgefordert: «…explain the conflict and indicate which answer, if any, is better supported…».

Diese Strategie erzielte eine durchschnittliche Erkennungsrate von 72,8%. Damit übertraf sie sogar komplexere, mehrstufige Verfahren, wie das Deliberate Prompting (67,2%), bei dem das Modell eine Antwort entwirft und diese in einem zweiten Schritt selbst kritisiert.

Vergleich der Erkennungsraten («Detection Rate») über die sieben getesteten Strategien. Contrastive Prompting zeigt signifikante Vorteile gegenüber den Baselines.

Kognitionswissenschaftlich lässt sich dies dadurch erklären, dass Contrastive Prompting die Aufmerksamkeit («Attention») des Modells explizit auf die Differenz zwischen den Kontexten fokussiert. Das Modell wird gezwungen, in einen analytischen Vergleichsmodus zu schalten, statt lediglich eine glatte Antwort zu generieren.

System-Prompts: Eine Stütze für kleinere Modelle

Ein weiterer spannender Befund betrifft die Skalierungseffekte. Wir untersuchten, ob ein globaler System-Prompt, der das Modell vorab warnt («If the statements conflict, indicate that conflict clearly»), die Leistung verbessert.

Änderung der Erkennungsraten («Detection Rate») mit einem präziseren System Prompt S_1. Kleine Modelle profitieren am meisten.

Die Daten zeigen einen massiven positiven Effekt für alle Prompting Strategien, der jedoch stark von der Modellgrösse abhängt. Während das kleinste Modell (3B) durch diese Instruktion einen durchschnittlichen Leistungssprung von +25,1 Prozentpunkten verzeichnete, profitierte das grösste Modell (70B) nur marginal (+4,6pp).

Dies lässt sich mit der Theorie der abnehmenden Erträge («diminishing returns») erklären: Grosse High-Performance-Modelle verfügen bereits über so ausgeprägte Reasoning-Fähigkeiten, dass sie die Aufgabe auch ohne einer speziellen Warnung relativ gut lösen, sobald die richtige Prompting-Strategie angewendet wird. Kleine Modelle hingegen benötigen den System-Prompt als globales «Task Conditioning». Er fungiert als kognitive Stütze, die verhindert, dass das Modell in einen simplen Textvervollständigungs-Modus verfällt. Für den Einsatz von KI auf lokalen Endgeräten («Edge Computing») ist das Design des System-Prompts daher der entscheidende Hebel für Qualität.

Das «Confidence-Paradoxon»: Warum KI-Unsicherheit trügt

Ein für die KI-Sicherheit kritischer Befund ist die Diskrepanz zwischen der inhaltlichen Erkennung eines Widerspruchs und der sprachlichen Kommunikation von Unsicherheit. Wir analysierten die sogenannte «Hedge Rate» - die Häufigkeit von sprachlichen Weichmachern wie «might», «unclear» oder «suggests».

Das Ergebnis ist ernüchternd: Die durchschnittliche Hedge Rate lag bei nur 2%. Selbst wenn die Modelle einen Widerspruch korrekt erkannten, stieg die Nutzung von Unsicherheitsmarkern kaum an (2,2% bei erkanntem vs. 1,47% bei nicht erkanntem Widerspruch).

Wir nennen dieses Phänomen das «Confidence-Paradoxon» oder die «Hedge Trap». Die Modelle sind darauf trainiert, hilfreiche und definitive Antworten zu geben. Dies führt dazu, dass sie auch bei widersprüchlicher Faktenlage selbstbewusst klingen. Sie beschreiben den Konflikt zwar oft faktisch («Text A sagt X, Text B sagt Y»), drücken aber keine epistemische Unsicherheit aus («Es ist unklar, was stimmt»).

Für die Praxis bedeutet dies: Verlasse dich bei der Evaluation von RAG-Systemen niemals auf den «Tonfall» oder den «Confidence Score» des Modells. Ein Modell kann völligen Unsinn oder einen massiven Widerspruch mit sehr glaubwürdigen Rhetorik vortragen.

Methodische Innovation: LLM-as-a-Judge

Die Bewertung von offenen Textantworten ist eine Herausforderung. Klassische Metriken wie «Exact Match» greifen bei komplexen Erklärungen zu kurz. Einfache Keyword-Suchen (z. B. nach dem Wort «Widerspruch») übersehen oft subtile Formulierungen.

Daher entwickelten und validierten wir eine LLM-as-a-Judge Pipeline. Wir setzten ein unabhängiges Modell (Qwen 2.5 14B) als Evaluator ein, das die Antworten anhand eines strikten JSON-Schemas bewertete.

Der Vergleich mit regelbasierten Heuristiken zeigte eine Übereinstimmung («Overall Agreement») von 76,1%. Interessanterweise war der LLM-Judge in der Lage, semantische Nuancen zu erfassen, die den starren Regeln entgingen. In 753 Fällen erkannte der Judge korrekterweise einen Widerspruchshinweis, den die Keyword-Suche verpasst hatte (z. B. Formulierungen wie «The dates do not align»). Dies unterstreicht das Potenzial von LLMs, nicht nur Text zu generieren, sondern auch als kosteneffiziente Evaluatoren in der Forschung zu fungieren.

Fazit und Ausblick

Unsere Arbeit zeigt, dass das Problem der KI-Halluzinationen bei widersprüchlichen Daten oft kein Mangel an Wissen, sondern ein Mangel an Fokussierung ist. State-of-the-Art Modelle besitzen bereits die latente Kompetenz zur Konflikterkennung. Diese muss jedoch durch sorgfältig designte Strategien explizit abgerufen werden.

Zusammenfassend lassen sich drei Kernempfehlungen ableiten:

  1. Prompting ist entscheidend: kontrastive Strategien überbieten einfache Fragen.
  2. Kleine Modelle brauchen Führung: kleinere Modelle benötigen präzise System-Instruktionen.
  3. Vorsicht bei Confidence-Scores: Der Tonfall eines Modells korreliert nicht zwangsläufig mit der Faktentreue.

In zukünftigen Arbeiten planen wir, adaptive Pipelines zu untersuchen, die je nach Komplexität der Frage dynamisch zwischen kleinen und grossen Modellen umschalten, sowie den Einsatz von Reinforcement Learning, um Modellen beizubringen, bei Unsicherheit auch tatsächlich «unsicherer» zu klingen.

Die Fähigkeit, Widersprüche nicht nur zu tolerieren, sondern aktiv aufzulösen, ist der nächste notwendige Schritt von «wissenden» zu «denkenden» KI-Systemen.

Unbegrenzte Karrieremöglichkeiten in Informatik, Data Science und Computersimulation:

Jetzt für deinen BSc in Computational and Data Science anmelden!

Anzahl Kommentare 0
Kommentare