Leseprobe
„Deine Idee ist toll!“
Wenn KIs halluzinieren, wenn sie Fakten erfinden, um ihre Behauptungen zu stützen, oder gar nicht existierende Quellen vorlegen, sind das „harte“ Fehler. Solche Fehler lassen sich durch einen Fakten-Check entdecken und beseitigen. Die Aussagen sind definitiv falsch. KIs machen aber auch „weiche Fehler“. Und die sind manchmal sogar problematischer.
Ein weicher Fehler ist es zum Beispiel, wenn KIs uns „nach dem Munde reden“. Und das tun sie nicht selten. Die meisten modernen KI-Chatbots neigen dazu, sich wie Schmeichler zu verhalten. Menschen, die das tun, nennt man im Englischen sycophant und das Verhaltensmuster sycophancy. Sycophancy ist auch der Ausdruck, den man im Kontext von KI meist nutzt. Völlig unabhängig vom verwendeten Begriff … es läuft darauf hinaus, dass KIs uns eher das sagen, was wir hören wollen, als das, was wir hören sollten. Das mag harmlos erscheinen, ist es aber nicht.
Dieses Nach-dem-Munde-Reden passiert dann sehr schnell, wenn wir einem KI-Chatbot nicht einfach Wissensfragen stellen („Wie hoch ist der Eiffelturm?“), sondern uns Ratschläge holen, nach Meinungen und Bewertungen fragen.
Chatbots verhalten sich dann oft wie neue, noch ein wenig unsichere Mitarbeiter gegenüber Vorgesetzten und seniorigen Kolleg:innen: Schnell werden deren Äußerungen bestätigt und gelobt. Widerspruch wird erst einmal vermieden. Es wird viel anerkennend genickt und Kritik, wenn überhaupt, nur sehr vorsichtig und mild formuliert.
Das ist sehr menschlich. Die meisten Menschen finden andere Menschen, die ihnen Recht geben, nämlich sympathisch. Das ist etwas, das wir Menschen in Kindheit und Jugend lernen und dann anwenden.
In einer beruflichen Rolle machen wir unsere Arbeit so aber nicht unbedingt gut, wenn wir Vorgesetzten nach dem Munde reden. Im Gegenteil: Für ein Projekt oder ein Unternehmen kann es sehr wichtig sein, Denkfehler zu identifizieren, bessere Ideen zu entwickeln — unabhängig davon, wer diese Ideen entwickelt oder wer die Denkfehler gemacht hat.
Was KIs (und Menschen) zum Schmeicheln bringt
Die Voraussetzung dafür, dass jemand den Versuch machen kann, uns zu schmeicheln, ist, dass er erst einmal wissen muss, was wir hören wollen. Wenn ich einer Kollegin einen Artikel aus einer Fachzeitschrift zeige und frage, was sie davon hält, gibt es erst einmal keinen Grund, Kritik zurückzuhalten. Wenn ich derselben Kollegin einen Text schicke, den erkennbar ich geschrieben habe, ist das hingegen schon eine Gelegenheit, sich bei mir einzuschmeicheln.
Bei der direkten Kommunikation zwischen Menschen kann es selbstverständlich zu non-verbalen Signalen (Mimik, Gestik, Tonfall …) kommen. Anhand derer kann die Kollegin auch bei dem Fachartikel vermuten, ob ich diesem persönlich zustimme. Aber bei der Kommunikation mit einem Chatbot ist das (im Moment noch) schwierig.
Meist ist es aber gar nicht nötig, auf versteckte Signale zu achten. Die meisten von uns verwenden im Gespräch — oder in einem Prompt — explizite Signale: Wenn ich sage „Ich meine/ denke/ würde sagen …“ oder ähnlich, dann gebe ich der Aussage, die dann folgt, das „Gütesiegel meiner Zustimmung“. Damit schütze ich diese Aussage vor Kritik durch Personen, die mir schmeicheln wollen.
Hier ein paar typische Formulierungen, die jemandem klar sagen, was ich hören möchte — gruppiert nach rhetorischen Mustern.
Klare Festlegung der eigenen Ansicht:
-
„Ich denke / ich würde sagen …“
-
„Für mich ist klar, dass …“
-
„Eigentlich ist das doch eindeutig …“
-
„Das ist ja offensichtlich …“
-
„Für mich ist überhaupt nicht offensichtlich, dass …“
-
„Man muss doch zugeben, dass …“
-
„Alle sagen doch, dass …“
-
„Es spricht doch alles dafür, dass …“
-
„Eigentlich spricht doch nichts dafür, dass …“
-
„Es kann doch nicht sein, dass …“
Explizite Einforderung von Zustimmung:
-
„Findest du nicht auch, dass …?“
-
„Siehst du das genauso wie ich?“
-
„Das kannst Du doch bestätigen?“
Signal, dass Widerspruch peinlich/bedrohlich wäre:
-
„Ich habe da schon ziemlich viel Arbeit/Hirnschmalz reingesteckt.“
-
„Das ist so an den Kunden rausgegangen.“
-
„Oder klingt das dumm?“
Direkte Aufforderung zur Unterstützung:
-
„Das wäre super hilfreich, wenn du sagst, dass …“
-
„Ich brauche jetzt eine klare Bestätigung.“
-
„Es wäre schwierig, wenn da noch wesentliche Kritik käme.“
Eine Aussage an die eigene Identität binden:
-
„Als jemand, der evidenzbasiert denkt, …“
-
„Mir ist Fairness wichtig, deshalb …“
-
„Das ist doch eine längst überholte Annahme.“
-
„Bevor ich mich mit dem Thema beschäftigt habe, dachte ich …“
-
„Ich betrachte immer beide Seiten, und dann …“
-
„Ich bin da sehr wissenschaftlich …“
Klarheit, nicht Genauigkeit, einfordern:
-
„Sag mir einfach, ob das stimmt.“
-
„Bitte kurz und eindeutig.“
-
„Entscheide dich.“
-
„Ich brauche eine klare Richtung.“
Solche Redewendungen kann fast niemand vermeiden. Sie sollten sich nur klarmachen, dass Sie damit Zustimmung einfordern und Kritik verhindern. Wie wirksam das ist, hängt davon ab, welche Beziehung der/die Gesprächspartner:in zu Ihnen hat.
Und selbstverständlich kann es sein, dass Sie tatsächlich Widerspruch verhindern und Lob einfordern wollen. Dann ist das OK. Oft geschieht es aber unbewusst.
Schmeichelei ist nicht hilfreich
Wenn wir einen Gesprächspartner haben, der uns lobt, nach dem Munde redet, der unsere Ideen großartig findet und Widerspruch vermeidet, fühlt sich das oft angenehm an. Dasselbe gilt beim Einsatz von KI-Chatbots. Wenn wir diese zum Beispiel als Sparringspartner verwenden oder Ideen mit ihnen diskutieren, fühlt es sich gut an, wenn sie unsere eigenen Ideen loben.
Objektiv nützlicher wäre jemand, der unsere Gedanken oder Arbeitsergebnisse kritisch analysiert, nach Fehlern sucht und uns generell dabei unterstützt, „besser“ zu werden bzw. das beste Ergebnis abzuliefern. Das ist auch dann hilfreich, wenn das Arbeit kostet und die Kritik unangenehm oder gar schmerzhaft ist.
Dasselbe gilt meist auch im privaten Umfeld: Selbstverständlich fühlt es sich erst einmal gut an, wenn jemand unseren Klagen zuhört, beim Zuhören wohlwollend nickt, zustimmende Geräusche macht und uns mit Kritik verschont. Und ganz sicherlich gibt es Phasen im Leben, in denen wir das „brauchen“. Aber nicht nur und nicht dauerhaft.
Vielleicht erinnern Sie sich an das Vorwort dieses Buches. Was wir oft im Leben — auch bei der Arbeit mit Chatbots — brauchen, sind Gesprächspartner:innen, die sich an das Motto halten, das gute Freund:innen und Ratgeber:innen auszeichnet.
Sei freundlich und hilfreich — nicht einfach nur nett!
Besonders kritisch ist Ja-Sagerei dann, wenn wir einen KI-Chatbot als Ratgeber in Krisensituationen verwenden. Eine gute Freundin, die uns wirklich helfen möchte, wird uns in solchen Situationen nur selten in unseren eigenen Gedanken bestärken. Diese Gedankenmuster könnten ja der Grund dafür sein, dass wir in diese Krisensituation geraten sind. Und geradezu gefährlich ist kritiklose „Unterstützung“ bei psychischen Problemen.
Man muss aber gar nicht auf solche dramatischen Beispiele zurückgreifen, um zu verstehen, dass Lob und der Verzicht auf Kritik angenehm, aber oft nicht nützlich sind.
Ja, es gibt Situationen, in denen wir Bestätigung brauchen und Kritik nicht hilfreich ist. Dann sind KI-Chatbots immer super. Aber in vielen anderen Situationen sind Ehrlichkeit, Objektivität, Offenheit oder sogar eine kritische Grundhaltung hilfreicher.
Die Technologie hinter der Schmeichelei
Dass KI-Chatbots zu Schmeichelei, Ja-Sagerei und übertriebenem Lob neigen, mit Kritik zurückhaltend sind und schnell „einknicken“, wenn wir ihre Vorschläge kritisieren, hat technische Ursachen. Auch bei Menschen sind solche Verhaltensmuster kein Zufall. In beiden Fällen sind es erlernte Verhaltensmuster.
Bei Menschen ist das einfach zu verstehen: Als Kinder oder Jugendliche haben viele von uns negatives Feedback bekommen, wenn wir „Autoritätspersonen“ widersprochen haben. Das war (hoffentlich) nicht immer so. Aber die meisten von uns dürften zumindest die Lehre aus diesen Erfahrungen gezogen haben, dass es besser ist, einen Menschen erst einmal kennenzulernen, bevor wir Widerspruch oder Kritik äußern. Das umso mehr, wenn wir von diesem Menschen abhängig sind.
Bei KI-Modellen ist das ähnlich. Wir dürfen niemals vergessen, dass KI-Modelle trainiert und nicht programmiert werden. Siehe dazu die Erläuterungen zu neuronalen Netzen in Kapitel 3, insbesondere in den Abschnitten „Künstliche neuronale Netze imitieren Biologie“ und „Wenn Software lernt“. Beim Pre-Training (auf das sich das P im Akronym GPT bezieht) geschieht das, indem unglaublich viele Daten, vor allem Texte, in ein künstliches neuronales Netz gekippt werden. Dabei lernt dieses Netz, wie menschliche Sprachen funktionieren (genau genommen, wie Texte weitergehen, wenn man den Anfang kennt).
Die „Ausbildung“ eines KI-Modells ist mit dem Pre-Training aber nicht abgeschlossen. An das Pre-Training schließen sich bei allen modernen KI-Modellen eine oder mehrere Lernphasen an, die zusammen oft als „Alignment“ oder „Post-Training“ bezeichnet werden. Dieses Alignment kann bei den verschiedenen Herstellern in den Details unterschiedlich aussehen. Es geht dabei aber immer darum, das „rohe“ Modell sozusagen zu fine-tunen, um noch bessere Responses zu produzieren.
Der Stochastische Papagei, den Sie in Kapitel 3 kennengelernt haben, wird darauf trainiert, einen Text, den er als Input bekommt, plausibel fortzusetzen. Aber anders als in unserem Eingangsbeispiel mit „Sein oder Nichtsein“ gibt es in der Praxis zu den meisten Textanfängen nicht eine, sondern sehr viele passende und auch plausible Fortsetzungen. Manche sind knapp, andere weitschweifig. Manche sind einfach verständlich formuliert, andere verwenden ein breites Vokabular, Fachausdrücke und komplexe Satzstrukturen. Manche sind höflich im Tonfall, andere ruppig formuliert und so weiter.
Beim Alignment- bzw. Post-Training wird das Modell in bestimmte, gewünschte Richtungen bei den Ausgaben getrimmt. Und zwar nicht, indem es explizite Anweisungen erhält, sondern indem es weiter trainiert wird.
Dabei wird das schon vortrainierte Modell dazu gebracht, zu sehr vielen Prompts neue, unterschiedliche Antworten zu generieren. Zu jeder dieser Responses erhält das Modell dann wieder Feedback, ob diese Antwort „gut“ oder „schlecht“ war. Das beeinflusst die Gewichte für die Input-Werte in den künstlichen Neuronen des neuronalen Netzes — ähnlich wie beim initialen Training.25
Der Mechanismus ist sogar exakt derselbe. Nur die Entscheidung, was der „richtige“ Output des neuronalen Netzwerks ist, wird anders gefällt. Beim initialen Training ist diese Entscheidung einfach: Ein neu dazugefügtes Wort ist genau dann richtig, wenn es das Wort ist, das im Trainingstext dem Textanfang tatsächlich folgt. Die Verlängerung von „Sein oder Nichtsein, das ist hier die …“ mit „Frage“ ist richtig. Die Verlängerung mit „Herausforderung“ ist falsch — obwohl auch das einen plausiblen, korrekten Satz ergibt.
Die konkrete Herausforderung (sic!) beim Alignment-Training ist es, dem Modell hilfreiches Feedback zu geben, wenn die Antwort nicht schon im Trainingsmaterial steht.
Die einfachste Möglichkeit dafür ist es, eine Tabelle zu erstellen, in der neben jedem Prompt die „richtige“ Response steht. Je näher die generierte Response dieser vorgegebenen Antwort kommt, desto besser war die Response. Je weiter sie davon abweicht, desto schlechter war sie.26 Eine solche Tabelle zu erstellen, ist allerdings sehr aufwendig. Für das Training eines neuronalen Netzes werden Hunderttausende oder Millionen solcher Paare aus Prompt und richtiger Antwort benötigt. Lässt man Menschen diese Arbeit erledigen, bedeutet das einen sehr hohen Aufwand, selbst mit schlecht bezahlten Hilfskräften.
Eine zweite Möglichkeit ist es, die Antworten eines „Modells in Ausbildung“ laufend zu bewerten: „gut“, „schlecht“, „geht so“. Eine Variante dieses Ansatzes ist es, immer zwei oder drei Responses generieren zu lassen und dann eine Bewertung vorzunehmen, welche die bessere/beste ist. Auch dafür braucht es Hunderttausende oder Millionen Feedbacks. Wenn das Training auf diese Art und Weise extern gesteuert wird, spricht man übrigens von „bestärkendem Lernen“ (engl. reinforcement learning).
Diese Überwachung kann ein Mensch übernehmen bzw. das Feedback geben. Das Verfahren wird dann als RLHF (Reinforcement Learning from Human Feedback) bezeichnet. Mehr und mehr kommen dabei heute aber auch andere KIs zum Einsatz, was dann RLAIF (Reinforcement Learning from AI Feedback) genannt wird.
Ein künstliches neuronales Netz durchläuft bei den heutigen KI-Modellen „in der Ausbildung“ viele verschiedene Stufen des Trainings. Die folgende Tabelle zeigt die heute gebräuchlichen Phasen. In den nächsten Jahren mögen mehr dazukommen.
Es sind diese zusätzlichen Trainingsphasen nach dem Pre-Training, die dafür sorgen, dass die Modelle der verschiedenen Hersteller unterschiedliche Stärken und Schwächen haben und einen unterschiedlichen „Tonfall“ benutzen.
| Bezeichnung | Was passiert? | Feedback-Quelle | |
|---|---|---|---|
| 1 | Pre-Training | Modell lernt aus großen Textmengen die Vorhersage des nächsten Worts. | Trainingsdaten |
| 2 | Instruction Tuning | Modell wird auf Beispiele vom Typ „Prompt → gute Antwort“ feinjustiert. | Menschen |
| 3 | Preference Modeling | Mehrere Antworten werden verglichen; daraus wird gelernt, welche bevorzugt werden. | Test-User |
| 4 | Preference Optimization | Modell wird so optimiert, dass bevorzugte Antworten häufiger erzeugt werden. | Menschen / andere KIs; RLHF, RLAIF |
| 5 | Safety / Character Tuning | Zusätzliche Nachsteuerung für Sicherheit, Richtlinien, Stil und Charaktereigenschaften. | Policy-Teams, Menschen und teilw. andere KIs |
Anmerkungen
- Siehe dazu die Erklärungen im Abschnitt „Wenn Software lernt“ von Kapitel 3. ↩
- Dabei verwendet man im Kern dasselbe Verfahren, das im Abschnitt „Wenn Software lernt“ in Kapitel 3 beschrieben wurde. Dieses Verfahren liefert den „Abstand“ zwischen zwei Texten im „Bedeutungsraum“ als eine Zahl. Je größer der Abstand ist, desto geringer die Ähnlichkeit. ↩
- Wer gerne mehr Detail zu diesem Thema hätte, dem sei Ouyang, L. et al. (2022) „Training language models to follow instructions with human feedback“ empfohlen https://cdn.openai.com/papers/Training_language_models_to_follow_instructions_with_human_feedback.pdf empfohlen und zusätzlich Anthropic (2025) System card: Claude Opus 4 & Claude Sonnet 4. Anthropic, May. Available at: https://www.anthropic.com/claude-4-system-card. ↩