Hardware · Software · ArbeitsweisenPauls AI-Blog

5 Min. Lesezeit

Sprache und KI-Performance - was die Forschung zeigt [Q2/2025]

Wie relevant ist die Sprache, in der wir mit ChatGPT und anderen GPT-Chats sprechen? ChatGPT kann problemlos deutschsprachige Texte verstehen, übersetzen und uns ebenfalls durchaus detaillierte Ergebnisse auf Deutsch liefern. Dabei ist ChatGPT ein amerikanisches, englischsprachiges Modell, das großteils auf englischsprachigen Daten trainiert wurde, dennoch können wir vermeintlich gleichwertig auf deutsch mit ihm kommunizieren. Bestehen Unterschiede in der Qualität der Antworten, die wir auf Deutsch, auf Englisch oder einer weniger verbreiteten Sprache stellen? Oder sind Ergebnisse zwischen verschiedenen Sprachen gleichwertig? Das sagt die Forschung:

  1. Grundlagen: Unterschiede zwischen Chat-Modellen (1) vs. Retrieval-Systemen (2)
  2. Qualitätsfaktor Sprache
  3. Gemischte Sprachen: „Denglisch"
  4. Einfluss von Rechtschreibung und Grammatik
  5. Take Away / Summary

1. Grundlagen: Unterschiede zwischen Chat-Modellen (1) vs. Retrieval-Systemen (2)

Mit Chat-Modellen sind GPTs, also Sprach-Transformer gemeint, also Modelle, die auf Daten trainierte (angelernt) wurden und Sie in einer uns verständlichen Sprache ausdrücken können. Sie können unsere Sprache ebenso in Daten umwandeln, um daraus wiederum Antworten zu berechnen, die in unserer Sprache verständlich ausgegeben werden. Sie sind limitiert durch „die Bibliothek, die ihnen zur Verfügung steht“. Chat-Modelle sind ChatGPT, Claude, Grok, LeChat, Gemini - wie wir Sie in 2024 kennenlernten.

Retrieval-Modelle hingegen sind Modelle, die zwar auch unsere Sprache verstehen, jedoch nicht auf angelernten Daten eine Antwort formulieren, sondern aus unseren Anfragen Such-Formeln entwickeln - also live Forschung für uns betreiben. Sie sind nicht limitiert durch „das Bücherregal, das ihnen zur Verfügung steht, sondern durch die Menge an Bibliotheken, die ihnen täglich die neusten Informationen bereitstellen.“ Beispiele sind: Perplexity, You.com und diverse Search/Deep Research-Varianten der GPT-Chat-Modelle.

Die wesentlichen Unterschiede: Die Qualität der Antworten von Chat-Modellen basieren auf Qualität und Umfang der Trainings(-Daten), die Präzision der Retrieval-Modelle basiert auf der Präzision der Suchanfrage, denn Quellen sind tagesaktuell und wachsend.

MerkmalChat-ModelleRetrieval-gestützte Modelle
WissensbasisInternes ModellwissenExterne Quellen (Web, Datenbanken)
AntwortstilKonversationell, kreativFaktenorientiert, oft mit Quellen
Halluzination„normale" Wahrscheinlichkeitgeringe Wahrscheinlichkeit
AktualitätAuf Trainingsstand beschränktEchtzeitfähig, aktuell
QuellenangabenKeineMeist automatisch zitiert
RobustheitSehr hoch (bei großen Modellen)Suchfehler möglich

„Normale Wahrscheinlichkeit“ bedeutet hier, dass jedes Modell halluzinieren kann. Neuere Modelle halluzinieren tendenziell weniger. Dies wird in der Entwicklung zunehmend gehemmt.

2. Sprache als Qualitätsfaktor

Große Sprachmodelle sind mehrsprachig – aber nicht gleich gut trainiert in allen Sprachen. Studien zeigen eine klare Tendenz zugunsten von Englisch:

  • Unterschiede in Chat-Modellen: Radiologie-Prüfung mit GPT-4:

    • Englisch: 81 % korrekt
    • Deutsch (Übersetzung): 58 %
    • Deutsch mit GPT-4 Turbo (mit Retrieval): 64 %
  • MMLU-Benschmark (Test, der die Fähigkeiten von Sprachmodellen in verschiedenen Fächern testet; 57 Fachgebiete):

    • Englisch: 86,4 %
    • Deutsch: 74,6 %

Warum? Rund 92–93 % der Trainingsdaten von GPT-3 stammen aus englischen Quellen. Englische Prompts treffen daher eher auf bekannte Muster, liefern differenziertere Interpretationen und führen zu tiefergehenden Antworten – besonders bei komplexen, fachlichen Themen.

Deutsch hingegen ist solide, aber tendenziell weniger tief und etwas anfälliger für Halluzinationen – vor allem bei vage formulierten Prompts. Übersetzungen bürgen zusätzliches Risiko zur Unschärfe.

3. Gemischte Sprachen

Was ist nun wenn wir einen Prompt teils auf Englisch, teils auf Deutsch formulieren oder direkt Denglisch reden? Da GPT-Modelle multilingual sind, reagieren Sie robust auf einen Sprach-Mix. Sie antworten meist in der vorherrschenden Sprache. Hier ist es ratsam vorzugeben, in welcher Sprache die Antwort gewünscht ist. Im Weiteren ist die Datenbasis maßgebend.

4. Einfluss von Grammatik und Rechtschreibung

Chat-Modelle: Neuere Untersuchungen zeigen, dass große generative LLMs relativ robust gegenüber Rechtschreib- und Grammatikfehlern sind. Ein Experiment mit systematisch „beschädigten“ Texten ergab, dass GPT-basierte Modelle auch bei massiven Störungen inhaltlich weitgehend konsistente Antworten liefern – die semantische Ähnlichkeit zwischen korrektem und fehlerhaftem Text lag bei GPT-4 meist noch bei über 94 %. Kleinere Modelle reagieren dagegen sensibler, z.B. LLaMA.

Retrieval-Modelle: Da Prompts hier oft präziser gestellt sein müssen, um das Such-Fenster bei wesentlich größerer Kontext-Menge (Quellen) einzugrenzen, ist es hier wichtiger präzise zu sein. Retrieval-Modelle benötigen präzise, logische Aufforderungen, inhaltlich und syntaktisch (Rechtschreibung und Punktation), um die Treffer im Web genau und zielführend einzugrenzen.

Je mehr ein Modell selbst interpretieren muss, desto mehr Unschärfe kann entstehen - dies gilt für Semantische Interpretation (Sinn), sowie für syntaktische Interpretation (Rechtschreibfehler richtig deuten).

Take Aways

Generell

  • Die Qualität der Antworten hängt immer von der Datenbasis ab
  • Die Qualität der Antworten hängt grundsätzlich von der Präzision der Abfragen ab
  • Die Qualität der Antworten hängt vom Verständnis des Problems ab, je höher der Kontext einer Sprache (ein wort hat viele Bedeutungen - je nach Zusammenhang), desto ungenauer die Antworten. Englisch hat einen geringen Kontext, ist damit sehr präzise und gut geeignet für qualitativ hochwertige Antworten.

Chat-Modelle

  • je mehr Daten ein Modell in einer Sprache X hat, desto besser sind die Antworten
  • Chat-Modelle verzeihen Tippfehler besser als Web-Such-Modelle

Retrieval

  • Je mehr zugängliche Daten im Internet zur Suche bereitstehen, desto besser sind die (Re-) Search-Ergebnisse
  • Je präziser und grammatikalisch das Problem und die Aufgabe beschrieben ist, desto besser sind die Ergebnisse einer Web-Suche

Je kritischer die Anfrage, desto eher sollte Englisch verwendet werden - denn Modelle übersetzen Prompts nicht (ohne Aufforderung) ins Englische um Sie dann mit der größeren, englischsprachigen Datenbasis zu bearbeiten.

Besser auf Englisch: Fachliche Tiefe (Ingenieurwesen, Medizin, IT,), API-Nutzung, Code-Generierung Besser auf Deutsch: Kreativ-Arbeit, Alltag, lokale Fragestellungen (deutsches Recht, deutsche Eigenheiten)

Quellen

Nachtrag

Dieser Beitrag beschreibt den Stand aus Mai 2025. Neuere Modelle sind mittlerweile signifikant weiter entwickelt. Der Abstand zwischen den Sprachen verschwimmt zunehmend. Bei komplexen, fachlichen Anfragen kann er weiterhin relevant sein. Wesentlichen Einfluss kann man u.a. mit präzisem Kontext setzen.