Midterms 2026Wer nach unseren Maßstäben Ihre Stimme verdientZum Leitfaden →
GESCHRIEBEN IN KLAREM DEUTSCH.
CLAY TRIBUNE.
Anzeige

Wie GPT-2 in Embedding, Attention und die MLP-Schicht zerlegt wird

Ein visueller Erklärer führt durch die Funktionsweise von Transformer-Modellen, einschließlich der Tokenisierung, Aufmerksamkeit und MLP-Schichten von GPT-2.

Von mitch·3 Min. Lesezeit
A digital illustration of a neural network architecture, showing nodes and connections representing tokenization and attention mechanisms.

Eine neue Erklärwebsite führt Leser Schritt für Schritt durch die Funktionsweise von Transformer-Modellen.

Die Seite, Transformer Explainer, nimmt ein 124-Millionen-Parameter-Modell und zerlegt es in seine Kernbestandteile: Embedding, Attention und die MLP-Schicht. Die Erklärung ist um das GPT-2 (small)-Modell herum aufgebaut, das die Erklärwebsite als Ausgangspunkt für das Verständnis der Grundlagen von Text-generierenden Transformatoren verwendet.

Hier ist die nackte Struktur eines Transformers, wie die Erklärwebsite sie darlegt:

Anzeige

Kernkomponenten

Die Erklärwebsite identifiziert drei Schlüsselbestandteile jedes Text-generierenden Transformers:

  1. Embedding, wo Textanfragen in numerische Vektoren umgewandelt werden, die das Modell verstehen kann.
  2. Transformer-Block, der fundamentale Baustein, der die Eingabedaten verarbeitet.
  3. Ausgabewahrscheinlichkeiten, wo das Modell verarbeitete Embeddings in Wahrscheinlichkeiten für das nächste Token umwandelt.

Tokenisierung

Die Erklärwebsite veranschaulicht, wie Anfragen wie „Datenvisualisierung befähigt Nutzer zu“ in kleinere Einheiten zerlegt werden, die als Token bezeichnet werden. Token können ganze Wörter oder Teile von Wörtern sein. Die Erklärwebsite weist darauf hin, dass der Wortschatz von GPT-2 50.257 eindeutige Token umfasst.

Attention und die MLP-Schicht

Der Transformer-Block ist der Ort, an dem das Modell seine Arbeit verrichtet. Er umfasst den Attention-Mechanismus und die MLP-Schicht. Der Attention-Mechanismus ermöglicht es Token, miteinander zu kommunizieren, Kontextinformationen und Beziehungen zwischen Wörtern zu erfassen. Die MLP-Schicht verfeinert die Darstellung jedes Tokens unabhängig voneinander.

Der Erklärer führt Schritt für Schritt durch die mehrköpfige Selbstaufmerksamkeitsfunktion (multi-head self-attention) und zeigt, wie der Einbettungsvektor jedes Tokens in Query (Q)-, Key (K)- und Value (V)-Vektoren transformiert wird. Er erklärt außerdem, dass der Selbstaufmerksamkeitsmechanismus durch Multiplikation der Eingabe-Einbettungsmatrix mit gelernten Gewichtungsmatrizen abgeleitet wird.

Die Zahlen hinter dem Modell

Die Entscheidung des Erklärers, sich auf GPT-2 (small) zu stützen, war eine bewusste Entscheidung. Es handelt sich nicht um das neueste oder leistungsstärkste Transformer-Modell, aber es teilt die gleichen architektonischen Komponenten und Prinzipien mit den derzeit modernsten Modellen. Die 124 Millionen Parameter sind kleiner als die Modelle, die heute tatsächlich Internet-Text generieren, was es zu einem zugänglichen Einstiegspunkt macht.

Der Erklärer weist außerdem darauf hin, dass die Einbettungsvektoren in einer Matrix der Form (50,257, 768) gespeichert sind, die etwa 39 Millionen Parameter enthält. Diese Matrix ermöglicht es dem Modell, jedem Token eine semantische Bedeutung zuzuweisen, wobei ähnliche Tokens nahe beieinander im hochdimensionalen Raum und unähnliche Tokens weiter voneinander entfernt platziert werden.

Langstreckenabhängigkeit

Der Erklärer bringt jedoch einen Punkt deutlich zur Sprache: Der Selbstaufmerksamkeitsmechanismus ist die Kerninnovation von Transformers. Er ermöglicht es dem Modell, ganze Sequenzen zu verarbeiten und Langstreckenabhängigkeiten effektiver zu erfassen als frühere Architekturen.

Das ist es wert, es zu wiederholen. Der Aufmerksamkeitsmechanismus ist keine geringfügige Anpassung. Er ist der Grund, warum Transformers zum bevorzugten Architektur für Deep-Learning-Modelle geworden sind und Textgenerierungsmodelle wie OpenAI’s GPT, Meta’s Llama und Google’s Gemini antreiben.

Der Erklärer erläutert außerdem den Trainingsprozess. Er beschreibt, wie das Modell seine eigene Positionskodierungsmatrix von Grund auf lernt und sie direkt in den Trainingsprozess integriert.

Schlüsseldaten

  • Modell: GPT-2 (small), 124 Millionen Parameter
  • Vokabular: 50.257 eindeutige Tokens
  • Einbettungsmatrix: (50,257, 768), etwa 39 Millionen Parameter
  • Transformer-Blöcke: 12
  • Tokenisierungsbeispiel: „Datenvisualisierung befähigt Nutzer zu“

Der Erklärer leistet gute Arbeit: Er macht die Funktionsweise von Transformern verständlich. Es ist ein solider, gut strukturierter Text über technische Kommunikation.

Gleichzeitig ist er, wie vorgesehen, unvollständig. Der Erklärer lässt die Frage der Trainingsdaten vollständig unerwähnt, und das ist der springende Punkt. Der Erklärer konzentriert sich darauf, wie das Modell Informationen verarbeitet, nicht woher diese Informationen stammen. Das ist eine vernünftige Wahl für eine Schritt-für-Schritt-Anleitung, aber es ist auch eine Lücke, die der Erklärer selbst nicht schließt.

Sehen Sie sich das Video an, um das die Geschichte aufgebaut ist, unter poloclub.github.io.

Das Notizbuch

Das Notizbuch abonnieren.

Die besten Geschichten des Tages und jedes neue Urteil, in klarem Deutsch, um sieben im Postfach. Eine Mail am Tag, nicht mehr.

Wir schicken eine Bestätigungsmail. Jede Ausgabe hat einen Abmeldelink, ein Klick genügt.

Anzeige

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Als Amazon-Partner verdient Clay Tribune an qualifizierten Verkäufen.