Die „Konversation“ besteht nur aus sich wiederholenden Tokens
Large Language Models (LLMs) generieren Text, indem sie wiederholt ein Token nach dem anderen vorhersagen, bis sie eine Antwort vervollständigen. Dieser Mechanismus unterscheidet sich grundlegend vom menschlichen Verständnis, ermöglicht jedoch überraschend ausgefeilte Ergebnisse. Die „Konversation“ ist kein echtes Verständnis; es ist ein probabilistischer Tanz statistischer Assoziationen.
Vor der Verarbeitung durchläuft der Eingabetext eine Tokenization, bei der er in gebräuchliche Wörter und Wortbestandteile zerlegt wird. Zum Beispiel könnte „unbelievable“ in „un“, „believe“ und „able“ aufgeteilt werden. Ein Token entspricht im Durchschnitt etwa drei Vierteln eines Wortes. Die Anzahl der Tokens wirkt sich direkt auf API-Kosten, Limits des Kontextfensters und manchmal auf die Latenz aus. Erkunden Sie diesen Prozess mit OpenAI’s Tokenizer oder der tokenizer summary von Hugging Face.
LLMs sind von Natur aus stateless; sie besitzen kein inhärentes Gedächtnis zwischen Anfragen. Wenn eine Chat-Oberfläche sich an vergangene Interaktionen zu „erinnern“ scheint, erreicht sie dies, indem sie bei jeder neuen Anfrage den gesamten Konversationsverlauf (oder relevante gespeicherte Fakten) erneut mitsendet. Dies verbraucht wertvollen Kontextspeicher und trägt direkt zum Token-Verbrauch bei.
Im Inneren des Transformers: Gewichte, Attention und Training
Unter der Oberfläche der Token-Vorhersage liegt eine komplexe Architektur. Stellen Sie es sich wie die Berechnung eines Hauspreises vor: Geben Sie die Größe ein (1.000 Quadratfuß), multiplizieren Sie sie mit einem weight (sagen wir 300) und erhalten Sie ein Ergebnis ($300.000). LLMs skalieren dies hoch und stapeln Hunderte von layers mit Tausenden von „Neuronen“, um weitaus komplexere Muster zu verarbeiten. Diese Milliarden von Gewichten, die zusammen als parameters bezeichnet werden, sind während der Inferenz fixiert, werden aber während des Trainings angepasst.
Das „T“ in GPT steht für Transformer, und seine wichtigste Innovation ist attention. Stellen Sie sich das Wort „bank“ vor: Seine Bedeutung ändert sich dramatisch zwischen „Flussufer“ (river bank) und „Finanzinstitut“ (financial bank). Attention ermöglicht es jedem Token, die Bedeutung anderer Tokens in der Eingabesequenz dynamisch zu gewichten und die Bedeutung zu klären, indem „bank“ mit „Fluss“ oder „Geld“ verknüpft wird. Dieser Mechanismus, der in dem wegweisenden „Attention Is All You Need“-Paper vorgestellt wurde, verhindert, dass Tokens isoliert verarbeitet werden.
Die Lern-Pipeline umfasst mehrere Phasen. Pre-training beginnt mit zufälligen Gewichten, bei denen das Modell fehlende Tokens vorhersagt und seine Gewichte mittels backpropagation basierend auf Fehlern anpasst. Dieser iterative Prozess, der Billionen Male wiederholt wird, verfeinert die Vorhersagen. Fine-tuning passt das vortrainierte Modell dann mithilfe kleinerer, kuratierter Datensätze an spezifische Aufgaben an. Schließlich kann reinforcement learning das Verhalten weiter optimieren, indem Modellausgaben bewertet und Gewichte angepasst werden, um hoch bewertete Antworten zu bevorzugen, oft unter Einbeziehung von menschlichem Feedback (RLHF) oder automatisierten Prüfungen.
Modelle verkleinern – und sie mit aktuellen Fakten versorgen
Die Anpassung großer Modelle an spezifische Aufgaben kann ressourcenintensiv sein, aber Techniken wie LoRA (Low-Rank Adaptation) bieten eine kostengünstige Lösung. LoRA friert die überwiegende Mehrheit der ursprünglichen Gewichte eines Modells ein und trainiert nur einen kleinen, zusätzlichen Satz von Parametern – oft weniger als 1 % der Größe des Basismodells. Dies reduziert den Rechenaufwand erheblich und ermöglicht das Fine-tuning auf einer einzigen GPU.
Quantization adressiert den Speicherbedarf dieser gigantischen Modelle. Jedes Gewicht in einem LLM wird typischerweise als 16-Bit-Zahl gespeichert. Ein Modell mit 8 Milliarden Parametern verbraucht beispielsweise etwa 16 Gigabyte. Quantization reduziert dies, indem Gewichte mit weniger Bits (z. B. 8 oder 4 Bits) gespeichert und auf weniger präzise Werte gerundet werden. Während dies das Modell verkleinert – eine 4-Bit-quantisierte Version desselben Modells könnte etwa 5 Gigabyte groß sein und auf einem Laptop ausführbar sein –, führt es einen Kompromiss ein, bei dem möglicherweise etwas Genauigkeit geopfert wird.
Um das Wissen eines Modells über seine Trainingsdaten hinaus zu erweitern, nutzt Retrieval-Augmented Generation (RAG) externe Informationen. Dieser Prozess beginnt damit, Text in embeddings umzuwandeln – lange Zahlenreihen, die semantische Bedeutung numerisch erfassen und einen Vergleich durch Ähnlichkeit ermöglichen. Diese embeddings werden zusammen mit ihrem Originaltext in einer Vektordatenbank gespeichert.
Wenn ein Benutzer eine Frage stellt, wandelt die Anwendung diese Anfrage zunächst in ein embedding um. Anschließend durchsucht sie die Vektordatenbank nach semantisch ähnlichen Passagen. Diese abgerufenen Passagen werden dann an den ursprünglichen Prompt angehängt, wodurch das LLM eine Antwort generieren kann, die auf aktuellen oder proprietären Daten basiert, auf denen es nie explizit trainiert wurde. Entdecken Sie mit dem OpenAI Tokenizer Tool, wie Text in Tokens und embeddings umgewandelt wird.
Gefällt Ihnen der Artikel? Erhalten Sie jeden Morgen einen wie diesen per E-Mail.
eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte
Von einer einzelnen Antwort zu Agenten, die handeln
Modelle sind im Kern Textgeneratoren. Sie können nicht eigenständig das Internet durchsuchen oder Befehle ausführen. Hier kommt tool calling ins Spiel: Das Modell erkennt den Bedarf für eine externe Funktion und fordert dann eine spezifische, erlaubte Aktion in einem strukturierten Format an. Der Anwendungscode, nicht das Modell selbst, empfängt diese Anfrage, führt das Tool aus und gibt das Ergebnis als Klartext an das Modell zurück.
Viele Dienste stellen diese Tools über das Model-Client Protocol (MCP) bereit, ein gängiges Verbindungsmuster, das es kompatiblen KI-Anwendungen ermöglicht, externe Funktionen zu entdecken und mit ihnen zu interagieren. MCP definiert, wie eine Anwendung mit einem Tool kommunizieren kann, schreibt jedoch nicht die interne Logik oder die Fähigkeiten des Modells vor. Das Modell verwendet MCP, um Aktionen anzufordern; es führt sie nicht aus.
Diese Konzepte laufen in einer agent loop zusammen. Ein KI-Agent erhält eine Aufgabe, identifiziert notwendige Tools und ruft diese über MCP auf. Anschließend prüft er die Ausgabe des Tools, aktualisiert seinen internen Zustand und wiederholt den Prozess, bis die Aufgabe abgeschlossen ist. Dieser iterative Zyklus ermöglicht komplexe Workflows, von der Flugbuchung bis zur Datenanalyse.
Obwohl diese autonomen Workflows leistungsstark sind, erfordern sie ein sorgfältiges Management. Validieren Sie immer die Tool-Ausgaben, konfigurieren Sie geeignete Berechtigungen, um unbefugten Zugriff zu verhindern, und berücksichtigen Sie sorgfältig die Datenfreigabe. Agenten zeichnen sich bei strukturierten Aufgaben aus, aber ihre Autonomie hat Grenzen; menschliche Aufsicht bleibt für einen robusten und sicheren Betrieb entscheidend.
Häufig gestellte Fragen
Was ist ein LLM in einfachen Worten?
Ein Large Language Model sagt wahrscheinliche nächste Tokens aus seiner Eingabe voraus und wiederholt den Prozess, um eine Antwort zu generieren.
Erinnern sich KI-Chatbots an vergangene Konversationen?
Das Modell selbst ist im Allgemeinen zustandslos. Eine Chat-App kann Kontinuität schaffen, indem sie den Konversationsverlauf oder gespeicherte Informationen mit einer neuen Anfrage sendet.
Was ist der Unterschied zwischen RAG und Fine-Tuning?
RAG ruft zum Zeitpunkt der Antwort relevante Informationen ab und fügt sie dem Prompt hinzu. Fine-Tuning passt die Modellgewichte mithilfe zusätzlicher Trainingsbeispiele an.
Wie unterscheidet sich ein KI-Agent von einem Chatbot?
Ein Agent kann eine Schleife aus Logik und Aktionen ausführen, Tools verwenden, Ergebnisse prüfen und an einer Aufgabe weiterarbeiten, anstatt nur einmal zu antworten.

