
Large Language Models (LLMs) wie ChatGPT oder Claude faszinieren uns unter anderem durch ihre Fähigkeit, menschenähnliche Texte zu erstellen. Oder eigentlich: Uns kommt es mittlerweile selbstverständlich vor, wenn eine Maschine sinnvolle Inhalte ausgibt. Dabei vergessen wir aber oft, dass es Technologie ist, mit der wir uns unterhalten. Oft halten wir die Outputs für so plausibel – und sie sollen plausibel wirken – dass wir sie unkritisch übernehmen (oder die generierten Inhalte für schlauer halten als sie eigentlich sind),
Deshalb lohnt es sich, sich eine grundlegende Frage zu stellen: Wie funktionieren diese KI-Systeme eigentlich?
Content
Die Antwort: Sie verarbeiten Sprache nicht Buchstabe für Buchstabe, Wort für Wort oder Zahl für Zahl, sondern durch Token und Vektoren. Vereinfacht gesagt „merkt“ sich eine KI Wortfetzen – Token – inklusive einer „Position“ in einem n-dimensionalen Kontextraum.
Ein wenig besser versteht man die Technik dahinter mit einer Visualisierung, die du gleich siehst; sie wurde mit Hilfe von Claude 3 bis 5 erstellt (ja, da stecken ein paar Iterationen und LLM-Generationen drin), und die Bugs hat (im zweiten Anlauf) Gemini 3.5 Flash gefixt. Gemini ist beim Coden übrigens ziemlich gut, wenn man ein paar Leitplanken setzt (Gemini neigt zum „Overdelivern“, Stichwort Elefantenbulle im Porzellancodeladen).
Inhalt
Token & Vektoren interaktiv
Das Dashboard bietet dir eine 3D-Visualisierung, um LLM-Konzepte greifbar zu machen. Mit nur einem Klick kannst du zwischen vier verschiedenen Ansichten wechseln:
Wie „verstehen“ ChatGPT, Claude, Gemini & Co. eigentlich, was du schreibst?
Reise in 5 Schritten durch ein KI-Sprachmodell, interaktiv in 3D. Starte die Tour oder klicke dich selbst durch.
Willkommen!
„Versteht ChatGPT wirklich, was ich schreibe – oder tut es nur so?“
Genau das klärst du hier. In 4 Schritten siehst du, was im Inneren eines Sprachmodells mit dem Satz „KI versteht Sprache“ passiert. In Schritt 5 testen wir das Modell mit einer Falle: dem mehrdeutigen Wort „Bank“.
ChatGPT, Claude, Gemini & Co. durchlaufen diese Schritte bei jeder einzelnen Antwort, für jedes Wort neu und in Sekundenbruchteilen.
Die vier Verarbeitungsschritte im Überblick:
- Tokenisierung: Text wird in kleine Einheiten zerlegt bzw. aus kleinen Einheiten (kurze Wörter, Silben) zusammengesetzt
- Vektorisierung: Token werden in mathematische Darstellungen umgewandelt (bzw. aus verschiedenen Ecken des n-dimensionalen Raums zusammengesetzt)
- Attention: Das Modell berechnet Beziehungen zwischen allen Token (die verbundenen Token werden auf Sinnhaftigkeit geprüft)
- Sequenzverarbeitung: Die Informationen fließen durch das neuronale Netzwerk – das ist dann dein z.B. Ouptut
Die Details im Detail
- Token: In der Welt der LLMs sind Token die Grundbausteine der Sprache. Sie können einzelne Buchstaben, Wortteile oder ganze Wörter repräsentieren. Das gilt auch für Code!
- Vektoren: Ähnliche Wörter werden zu ähnlichen Vektoren: „Bank“ als Sitzgelegenheit landet nahe bei „Stuhl“ und „Möbel“, während „Bank“ als Kreditinstitut nahe bei „Geld“ und „Finanzierung“ steht. Die Vektorposition im Raum bestimmt die semantische Bedeutung.
- Attention: Hier werden Vektoren und Token in Beziehung gesetzt. Ein Beispiel ist das Wort „Bank“. „Bitte helfe mir beim Bau einer Bank“ könnte bedeuten, dass man eine Gartenbank bauen will (dann wäre man im Bereich Schreinerei bzw. Heimwerken) – oder beim Bau eines Bankgebäudes, also Architektur / Statik etc. Wenn das LLM nicht gut trainiert ist, erkennt es a) den Kontext nicht und b) kaschiert fehlende Informationen durch Halluzination – anstatt Wissenslücken „zu gestehen“ oder Rückfragen zu stellen. Dazu gleich mehr.
Der Attention-Mechanismus funktioniert also wie ein Suchscheinwerfer: Für jedes Token berechnet das Modell, wie stark es auf alle anderen Token in der Sequenz „achten“ soll. Dadurch kann es beispielsweise erkennen, dass sich „er“ in „Der Mann ging zum Arzt. Er war krank.“ auf „Mann“ bezieht, nicht auf „Arzt“. (Bei einem größeren Kontext könnte das natürlich wieder anders aussehen, denn der „Mann“ könnte auch „Arzt“ sein, der einem anderen Arzt helfen will – wenn sich der Mensch also wirr ausdrückt, kommt das LLM ins Schleudern). - Nächstes Wort: Um wieder zur Bank zurückzukommen. „Um eine Bank zu bauen,“ … geht wahrscheinlich mit „brauchst“ weiter – oder mit „brauchen“, „benötigen“, „sollte“, „würde“ etc. Es gibt also viele Möglichkeiten. Die KI wählt muss sich für eine Möglichkeit entscheiden, und zwar in der Regel für eine wahrscheinliche Möglichkeit. Eine „fette“ KI wurde besser trainiert und hat einen großen Fundus an Wissen und Möglichkeiten. Ein Mini-KI, also sowas, was auf dem Smartphone läuft, kennt nicht viel von der Welt und kann dann in der Folge Stuss labern wie ein Publikumsjoker bei WWM. Je länger der Output dann wird, und wenn wenn die KI schon früh falsch abgebogen ist, wird das Ergebnis bitter. Da User das blöd finden, neigen KIs zu sicheren Wegen. Deswegen fangen bei LinkedIn Posts dann oft mit „I’m thrilled to announce an“ (und der Mensch verschleiert das dann dann, indem er manuell „thrilled“ durch „happy“ ersetzt; der Rest ist aber immer noch freudloser AI Slop).
Was ist die beste KI? So unterschiedlich sind LLM-Outputs
In der grundlegenden Technik – Token, Vektoren etc. – arbeiten die generativen KIs (fast) alle gleich (den Ausflug in Richtung „Transformer“ mit GPT und BERT o.ä. sparen wir uns mal). Theoretisch hat jede KI das Zeug zur besten KI.
Dennoch unterscheiden sich die Arbeitsweisen und Outputs extrem, vor allem aus zwei Gründen:
- Wie „fett“ ist die KI? Hier spielen viele Faktoren rein, wie Anzahl der Parameter, Qualität und Aktualität der Trainingsdaten, Aufwand beim manuellen Feintuning, Strategie des „Anlernens“, „Mixture of Experts“ Technik, „Reasoning“ bzw. „Thinking“, Websuche, Dokumentenverarbeitung uvm.
Mini-KIs sind kompakt und brauchen wenig Rechenpower, sind aber „Fachidioten“ oder für „Hilfsarbeiterjobs“ geeignet (das ist nicht böse gemeint!). Große KIs wie ChatGPT, Claude oder Gemini sind indes ressourcenhungrige Alleskönner. Im Dauerbetrieb können sie echt ins Geld gehen. - Wie ist das (meist geheime) Vorprompting? Das ist die Black Box. Wir als User wissen nicht unbedingt, was die Programmierer der KI an Arbeitsanweisungen in die Wiege gelegt haben. Forscher haben auch schon rausgefunden, dass manche KIs die Input-Sprache bzw. die Intention des Users auslesen und nicht nur den Output verweigern – das wäre transparent – sondern absichtlich Fehler in den Output einbauen. Speziell bei Code ist das übel, wenn bspw. Sicherheitslücken eingebaut werden.
Auch möglich ist es, dass KI-Anbieter die „Spritzufuhr“ drosseln, also die Rechen- bzw. Denkleistung reduzieren, bspw. bei älteren Modellen oder abhängig von der Last in den Rechenzentren. Du merkst sowas u.a. an „Tippfehlern“. Hatte ich neulich bei Claude über die API (als zahlender Kunde im höchsten regulären „Tier“-Level), bei was Harmlosen mit kleinem Kontextfenster. Zack, irgendwo in einem Wort ein Buchstabe zu viel. Sowas ist echt ätzend, wenn du dich bei einem agentischen Setup auf Qualität verlässt, und du dich auf die Qualität nicht verlassen kannst.
Beginnen wir mit einem kleinen Vergleichstest.
Kandidat 1 ist ein kleines LLM, nämlich Mistral 7B aus Frankreich, danach kommen Claude und ChatGPT. Es geht ums Thema „Bank“. „Bank“ ist ein mehrdeutiges Wort.

- Im Bild siehst du, wenn ein LLM Verständnisprobleme hat. Im Test ist das kleine Modell von Mistral (Mistral 7B 0.3), das von Haus aus schlecht Deutsch kann. Prompt: „Bitte helfe mir beim Bau einer Bank“. Das LLM denkt, dass ich eine Bank gründen will. Zuerst soll ich einen Plan „aufpauschen“ (?). Außerdem geht es später um „Käufer“ und „Siedler“ (Hä? Sind wir im wilden Westen?). Sowas ist schlichtweg unbenutzbar. 7B bedeutet 7 Milliarden Parameter, es ist also eine „kleine“ KI. Wenn du eine kleine KI produktiv einsetzen willst, musst du evtl. auf deine Aufgaben „trainieren“, was Zeit und Geld kostet.

- In diesem Bild siehst du, wie Claude Opus 4 mit aktiviertem „Thinking“-Modus auf die gleiche Frage „Bitte helfe mir beim Bau einer Bank“ reagiert: Zuerst wird die Ambiguität der Frage erkannt – die Programmierer haben der KI also eingeschärft „breiter“ zu „denken“.
Dann trifft das LLM dennoch die Annahme, dass man wohl eine Sitzbank bauen möchte – in den meisten Fällen ist das richtig. Das LLM stellt aber eine Rückfrage – es weiß, dass es falsch liegen könnte. Außerdem erkennt das LLM, dass die Anfrage auf Deutsch war und der User deshalb wahrscheinlich Maßangaben in Zentimetern (statt Zoll) erwartet.

- Und was macht ChatGPT, in diesem Fall das LLM o4-mini (mit Reasoning auf „Medium“? Das LLM ist sich komplett sicher, dass ich eine Sitzbank bauen will und liefert eine sehr detaillierte Anleitung. Dass ich ein Kreditinstitut bauen wollen könnte, wird nicht in Betracht gezogen.
- Du siehst also, dass diese drei LLMs zu drei stark unterschiedlichen Ergebnissen kommen. Das liegt unter anderem daran, welche Voreinstellungen die Betreiber vorgenommen haben.
Token, Vektoren: Warum ist das wichtig?
Token und Vektoren ist wichtig, um die Funktionsweise von LLMs wie Claude zu verstehen. Denn nur wenn man die Basis dahinter versteht, kann man mit den richtigen Erwartungshaltungen an die Nutzung rangehen.
- Token sind die Einheiten, in die ein Text zerlegt wird. Sie ermöglichen es dem Modell, Sprache in verdauliche Stücke zu zerlegen – in einen Token passt ein kurzes Wort oder ein Wortfetzen.
- Token pro Sekunde: LLMs brauchen sehr viel Rechenleistung. Als Normal-User von Online-LLMs bekommt man davon nichts mit, weil man LLMs nutzt, die in der Cloud auf extrem schnellen Computern laufen. Ein besseres Gefühl bekommt man, wenn man eine KI auf seinem Laptop laufen lässt. Für Intel-Windows-User ist der „AI Playground“ von Intel interessant, um lokal (kleinere) LLMs laufen zu lassen. Man wundert sich, wie langsam das auf einmal geht, und wie schlecht die Ergebnisse teilweise sind. Manchmal liefert der Computer dann nur ein paar Token pro Sekunde, tippt also in etwa so langsam wie ein Mensch mit Zweifingersuchsystem.
- Vektoren sind die Art und Weise, wie diese Token im „Gehirn“ des Modells repräsentiert werden. Sie erfassen subtile Bedeutungen und Beziehungen zwischen Wörtern. Vektoren sind auch die Grundlage für RAG (Retrieval-Augmented Generation) – das „Chatten mit eigenen Dokumenten“. Dabei werden Dokumente in Textabschnitte zerlegt, vektorisiert und in einer Vektordatenbank gespeichert. Bei einer Anfrage sucht das System ähnliche Vektoren und fügt die gefundenen Textpassagen als Kontext zur Antwort hinzu. So kann das LLM auf Informationen zugreifen, die nicht in seinen Trainingsdaten enthalten waren.
Zur Verarbeitung der Daten werden Vektordatenbanken wie z.B. qdrant genutzt. Erst damit – und mit weiteren technischen Lösungen – wird dann eine a) unscharfe Suche möglich und b) kann das System dann Text generieren. Eine (relativ) einfache Erklärung zur Vektorsuche steht bei qdrant (EN): https://qdrant.tech/documentation/overview/vector-search/
Durch die Umwandlung von Token in Vektoren kann ein LLM die Nuancen der Sprache erfassen und verstehen. Dies ist der Grund, warum Modelle wie Claude in der Lage sind, kontextabhängige und nuancierte Antworten zu generieren.
LLMs haben Milliarden von Parametern, die das „Wissen“ des Modells repräsentieren. Das Vokabular (Token-Set) umfasst meist 50.000-100.000 verschiedene Token. Das Kurzzeitgedächtnis (Context Window) ist hingegen die Anzahl der Token, die das Modell gleichzeitig verarbeiten kann – das sind bei modernen Modellen 32.000 bis 200.000 Token pro Eingabe – teils auch bis zu 1 Million und mehr. Allerdings gilt dann, dass die Output-Qualität bei komplett ausgenutztem Context Window sinkt – du erkennst sowas, wenn das LLM Tippfehler etc. macht.
Fazit
Das Verständnis von Token und Vektoren nicht ganz unwichtig, um als Anwender LLMs sinnvoll zu nutzen. Token bestimmen, wie präzise das Modell deine Eingabe versteht, während Vektoren die semantischen Beziehungen erfassen. Wer diese Grundlagen kennt, kann LLMs gezielter einsetzen, ihre Leistungsgrenzen besser einschätzen und aussagekräftigere Prompts formulieren. Die Unterschiede zwischen den Modellen zeigen: Nicht jedes LLM ist für jeden Zweck gleich gut geeignet.

About
Stefan Golling, Köln. Seit 2011 unterstütze ich freiberuflich Unternehmen bzw. Agenturen mit kreativen Ideen, Konzepten und (textlichen) Umsetzungen rund ums (Online-)Marketing. Vorher: 1998 mit Radiowerbung in Stuttgart gestartet, 2000 als Junior-Werbetexter zu Publicis München, 2001 Counterpart Köln, 2002 als Copywriter zu Red Cell Düsseldorf (heißt heute Scholz & Friends), dort ab 2007 Creative Director.
Kontakt
Magazin
- Als Marke bei KIs auftauchen

- UTM-Parameter: Zähme das Monster

- KI auf dem Laptop: Kosten sparen, Compliance vereinfachen

- Fractional CMO: kleines Invest, große Wirkung

- Instagram: Bilder, Videos, Formate für Frustrierte

- Vibe Coding mit dem Google AI Studio: In diese Fallen kann man tappen

- Abo statt Frust: Honorarvereinbarungen (Retainer)

- (Nicht-)KI-Bilder kennzeichnen bzw. erkennen: Content Credentials, SynthID & EU-AI-Icons

- Die beste KI

- Markenidentität trotz KI-Nutzung konsistent halten: Tipps, Anregungen & Finetuning

- LLM-as-a-Judge: KI-Modelle als Bewertungsinstanz

- MCP: Die Universal-API der KI-Welt

- Human in the Loop: So schlägt die KI das „gefürchtete“ Atari-Schach

- Longevity Marketing: So finden Kunden und Marken zusammen

- Projektmanagement im Marketing: PRINCE2 oder V-Modell® XT?

- Marketing-Digitalisierung: Mehr als nur Software und Automatisierung

- Öffentlichkeitsarbeit: Instrumente, die auch Digital und Social funktionieren

- Employer Branding Kampagnen: Darum solltest du viel mehr KPIs messen

- Recruiting: Vom Employer Branding zum Job Content Branding

- Marketing Automation: 3fach gedacht, plus Customer Experience

- UX-Writing Crashkurs: Do’s und To do’s

- Social-Media-Management-Workflow? Mehrsprachig!

- Website-Audit-Planungshilfe

- KI-Agenten: talentierte Helferlein

- Prompting aufgeschlüsselt: Vieles ist unsichtbar

- KI-Bildgenerierung: SVG, Diffusion oder GAN?

- LLMs verstehen: Token und Vektoren als Dashboard

- Claude: Was kann die KI von Anthropic?

- Performance Marketing: Leistung braucht Kreativität

- Marketingberatung: Erst das Rezept, dann ans Werk

