LLMs verstehen: Architektur und Funktionsweise

// Sprachmodelle

Ein LLM (Large Language Model) ist ein neuronales Netz, das auf enormen Textkorpora trainiert wurde. Es „versteht“ nicht im menschlichen Sinne: Es sagt das nächste Token mit einer erlernten Wahrscheinlichkeit voraus.

LLM-Diagramm

Die Pipeline

  1. Prompt — Eingabetext.
  2. Tokenisierung — Zerlegung in Einheiten.
  3. Schichten — aufmerksamkeitsbasierte Transformer.
  4. Logits — Bewertungen für das nächste Token.

Das Diagramm veranschaulicht diesen Fluss von links nach rechts, dann die Ausgabeschleife. Open-Weight-Modelle (Llama, Mistral, Qwen) ermöglichen einen lokalen Einsatz ohne Cloud-Abhängigkeit — ein Gewinn für die Privatsphäre.

Diesen Mechanismus zu verstehen verhindert Illusionen: Das Modell halluziniert, wenn die Wahrscheinlichkeit es vorgibt.

Schreibe einen Kommentar