Zum Hauptinhalt springen

A4 | Funktionsweise LLM

Schau dir zuerst dieses Video von YouKnow an, in welchem erklärt wird, wie ein grosses Sprachmodell, auch Large Language Model (LLM) genannt, wie z. B. ChatGPT funktioniert.


Du hast nun eine grundlegende Vorstellung zur Funktionsweise erhalten. Sprachmodelle bauen Sätze nach Häufigkeiten von Wortfolgen auf und diese Häufigkeiten stammen aus den Trainingsdaten.
Dieses Prinzip wird nun mit Hilfe eines vereinfachten Beispiels aufgezeigt. Wir nennen es MatterGPT und es handelt sich hierbei um ein kleines Sprachmodell, welches einzig mit dem Liedtext von Mani Matter «I han es Zündhölzli azündt» trainiert worden ist. Dazu muss zuerst im gesamten Liedtext untersucht werden, wie häufig bestimmte Wörter auf andere folgen. Für die erste Liedzeile (I han es Zündhölzli azündt) ergibt sich daraus folgender Möglichkeitenbaum:

Aktuelles Wort Mögliches nächstes Wort Häufigkeit im Songtext Wörter Wahrscheinlichkeit 
han 40% 
 Teppich 20% 
 dr 20% 
 de 10% 
 eim 10% 
han es 100% 
es Zündhölzli 25% 
 hätt 45% 
 Loch 15% 
 Wältchrieg 15% 
Zündhölzli azündt 100% 

Daraus kann folgendes geschlossen werden: Auf das erste Wort «I» folgt 4 mal das Wort «han», als Wahrscheinlichkeit ausgedrückt mit 40% Wahrscheinlichkeit folgt einem «I» ein «han». 

Mit diesem Wissen können wir uns nun unseren eigenen Mani Mattersong basteln, der in den ersten Zeilen wie folgt lauten könnte. (hier braucht es wohl noch weitere Ausführungen)

Diese Analyse der Häufigkeiten von Wortfolgen respektive des Schreibstils von Mani Matter ermöglicht es uns nun, einen neuen Liedtext in exakt seinem Stil zu verfassen, wie z. B.:
I han es Loch azündt, 
Und das het e Wältchrieg gäh. 

MatterGPT ist ein sehr kleines Sprachmodell und berücksichtigt immer nur 1 vorhergehendes Wort und basiert auf einem einzelnen Liedtext. Analog funktionieren grosse Sprachmodelle, wie zum Beispiel ChatGPT. Sie werden allerdings mit sehr grossen Textsammlungen trainiert, wie etwa aus Wikipedia, Büchern, Zeitungsartikeln, wissenschaftlichen Arbeiten oder sonstigen von Menschen geschriebenen und sorgfältig ausgewählten Texten.

Statt nur einzelne Wörter zu vergleichen, können oft mehrere tausend Token gleichzeitig berücksichtigen. In erweiterten Versionen (z.B. 5.3 – Stand 03.2036) kann ChatGPT zum Beispiel bis zu 128 000 Tokens in einem einzigen Kontext verarbeiten (OpenAI, 2026). Gemini, die LLM von Google kann sogar bis zu einer Million Tokens im Kontext verarbeiten (Georgiev et al., 2024) 

Ein Token ist die kleinste Informationseinheit, die von einem Sprachmodell verarbeitet werden kann. Ein Token kann folgendes darstellen: Zeichen, Wortteilen oder ganzen Wörtern. Auf der Webseite behind-ai.ch lassen sich Token anzeigen.