Skip to content
Learning Lab · 5 min read

Tokenisierung erklärt: Warum Token-Limits wichtig sind und wie man sie einhält

Tokens sind keine Wörter und werden von jedem Modell anders gezählt. Erfahren Sie genau, wie Tokenisierung funktioniert, wo Limits in der Produktion versagen und konkrete Techniken, um im Budget zu bleiben, ohne Qualität einzubüßen.

Tokenization Explained: Token Limits and Working Efficiently

Gestern sind Sie an ein Token-Limit gestoßen. Nicht, weil Ihr Prompt zu lang war – weil Sie nicht verstanden haben, wie Tokens funktionieren. Sie haben ein 3.000 Wörter langes Dokument an Claude gesendet, zugesehen, wie es die ersten 2.800 Wörter verarbeitet, und dann eine gekürzte Antwort erhalten. Das Problem war nicht Ihre Anfrage. Es lag daran, dass Sie Output-Tokens, System-Prompts und die unterschiedliche Zählweise von Text durch verschiedene Modelle nicht berücksichtigt haben.

Tokenisierung ist, wie LLMs Text in Chunks zerlegen, bevor sie ihn verarbeiten. Verstehen Sie es, und Sie werden aufhören, API-Credits zu verschwenden. Ignorieren Sie es, und jede Integration, die Sie erstellen, wird sich in großem Maßstab unerwartet verhalten.

Was Tokens tatsächlich sind

Ein Token ist kein Wort. Das ist wichtig.

In den meisten englischen Texten gilt: Ein Token ≈ 4 Zeichen oder 0,75 Wörter. Aber dieses Verhältnis bricht schnell zusammen. Satzzeichen, Leerzeichen, Zahlen, Code und nicht-englischer Text werden unterschiedlich tokenisiert. Ein Komma kann ein Token sein. Eine Zahl wie 1.234.567 kann drei oder vier sein. Das Wort Tokenisierung ist ein Token. Das Akronym CPU ist manchmal eines, manchmal drei, je nach Modell.

Verschiedene Modelle verwenden unterschiedliche Tokenizer. GPT-4o verwendet einen anderen Tokenizer als Claude Sonnet 4. Der cl100k_base Tokenizer von OpenAI zählt Text auf eine Weise. Der Tokenizer von Anthropic zählt ihn anders. Derselbe Prompt kann bei GPT-4o 150 Tokens kosten und bei Claude 140 Tokens – oder umgekehrt.

Diese Inkonsistenz ist der Grund, warum Sie Token-Anzahlen nicht im Kopf schätzen können. Sie müssen messen.

Input- vs. Output-Tokens (und warum beide wichtig sind)

Token-Limits haben zwei Seiten: Was Sie hineinsenden und was zurückkommt.

Ihr Input umfasst den System-Prompt, die Benutzernachricht, den gesamten Gesprächsverlauf und jeden Kontext, den Sie hinzugefügt haben. Ihr Output ist die Antwort des Modells. Die meisten Plattformen berechnen sie separat – Output-Tokens sind oft teurer als Input-Tokens. GPT-4o beispielsweise berechnet 5 $ pro 1 Mio. Input-Tokens und 15 $ pro 1 Mio. Output-Tokens. Dieses 3:1-Verhältnis beeinflusst, wie Sie Ihre Anfragen strukturieren sollten.

Wenn Sie Dokumente zusammenfassen, sind diese Tokens stark Input-lastig. Wenn Sie Code generieren, dominieren Output-Tokens. Wenn Sie eine Multi-Turn-Konversation führen, bei der Sie bei jedem Turn den Kontext wiederholen, zahlen Sie wiederholt Input-Token-Kosten für dieselbe Information.

Token-Limits in der Produktion: Wo sie versagen

Kontextfenster sind gewachsen – Claude 3.5 Sonnet unterstützt 200.000 Tokens, GPT-4o unterstützt 128.000. Aber Wachstum bedeutet nicht, dass Ihre Limits verschwunden sind. Es bedeutet, dass Ihre Limits jetzt anders sind.

Hier ist das eigentliche Muster: Wenn Ihr Fenster wächst, wachsen Ihre Prompts, um es zu füllen. Ingenieure beginnen, ganze Codebasen anstelle von Snippets einzubeziehen. Analysten beziehen vollständige Datensätze anstelle von Stichproben. Anwälte beziehen ganze Dokumente anstelle von Auszügen. Die Kosten pro Anfrage steigen. Die Antwortlatenz nimmt zu. Und irgendwo bei 80-85 % Ihres verfügbaren Kontexts beginnen die meisten Modelle schlechter zu performen – nicht besser. Sie verlieren den Fokus bei langen Kontexten.

Das praktische Limit ist nicht das technische Maximum. Es ist der Punkt, an dem Kosten oder Latenz unannehmbar werden oder die Modellgenauigkeit sinkt.

So zählen Sie Tokens ohne zu raten

Verwenden Sie den eigenen Tokenizer des Modells. Schätzen Sie nicht.

Für OpenAI-Modelle verwenden Sie die Bibliothek tiktoken:

import tiktoken

enc = tiktoken.encoding_for_model("gpt-4o")
text = "Ihr Prompt-Text hier"
tokens = enc.encode(text)
print(f"Token-Anzahl: {len(tokens)}")
print(f"Geschätzte Kosten (Input): ${len(tokens) * 0.000005:.4f}")

Für Anthropic-Modelle verwenden Sie die count_tokens API oder deren Python-Bibliothek:

from anthropic import Anthropic

client = Anthropic()

message = client.messages.count_tokens(
    model="claude-3-5-sonnet-20241022",
    system="Sie sind ein hilfreicher Assistent.",
    messages=[
        {"role": "user", "content": "Ihr Prompt-Text hier"}
    ]
)
print(f"Token-Anzahl: {message.input_tokens}")

Dies ist keine Option. Wenn Sie eine Integration versenden, benötigen Sie genaue Zählungen, keine Annäherungen. Der Unterschied zwischen „ungefähr 100 Tokens“ und „106 Tokens“ ist der Unterschied zwischen der Einhaltung Ihres Batch-Limits und dem Ausfall um 3 Uhr morgens.

Strategien, die wirklich Tokens sparen

Token-Einsparung bedeutet nicht, kürzere Prompts zu schreiben. Es geht um Struktur.

1. Wiederholen Sie den Kontext nicht in Multi-Turn-Gesprächen. Wenn Sie einen Chatbot erstellen, senden Sie den System-Prompt einmal und verlassen Sie sich auf den Gesprächsspeicher. Jede Runde, in der Sie ihn wiederholen, verschwenden Sie Tokens. Wenn Sie einen Kundenservice-Workflow erstellen, bei dem Sie viele separate Anfragen verarbeiten, fügen Sie jedes Mal Kontext hinzu – aber halten Sie ihn minimal.

2. Verwenden Sie Beispiele strategisch. Few-Shot-Prompts (mit Beispielen) sind kurzfristig günstig, aber langfristig teuer. Eine Konversation mit Beispielen kostet im Voraus mehr als Zero-Shot. Aber wenn diese Beispiele die Fehlerraten um 30 % senken, sind die Token-Kosten es wert. Wenn sie die Ausgabe um 2 % ändern, sind es verschwendete Tokens. Messen Sie den Kompromiss.

Schlechter Ansatz:

Sie sind ein E-Mail-Klassifizierer. Klassifizieren Sie jede E-Mail als "Verkauf", "Support" oder "Spam".

Beispiel 1: "Entdecken Sie unser neues Produkt!" → Verkauf
Beispiel 2: "Ihre Bestellung ist abholbereit" → Support
Beispiel 3: "Klicken Sie hier für kostenloses Geld" → Spam
Beispiel 4: "Sonderangebot im Inneren" → Verkauf
Beispiel 5: "Ihr Passwort wurde zurückgesetzt" → Support

Klassifizieren Sie diese E-Mail: [Benutzereingabe]

Besserer Ansatz (für eine einzelne Klassifizierung):

Klassifizieren Sie diese E-Mail als "Verkauf", "Support" oder "Spam": [Benutzereingabe]

Der zweite spart 80 Tokens. Wenn Sie Tausende von E-Mails klassifizieren, ist das eine signifikante Kostenreduzierung. Fügen Sie Beispiele nur dann wieder hinzu, wenn Ihre Fehlerrate die Kosten rechtfertigt.

3. Verwenden Sie Zusammenfassungen, um Kontext zu komprimieren. Wenn Sie Dokumentenhistorie oder frühere Analysen in eine neue Anfrage einbringen müssen, fassen Sie sie zuerst zusammen. Die Zusammenfassung kostet im Voraus Input-Tokens, spart aber Tokens bei jeder nachfolgenden Anfrage, die diesen Kontext benötigt.

4. Stapeln Sie ähnliche Anfragen. Anstatt fünf separate API-Aufrufe für fünf verschiedene Prompts zu senden, kombinieren Sie sie, wenn möglich. Eine Anfrage zur Klassifizierung von zehn E-Mails kostet weniger Tokens als zehn Anfragen zur Klassifizierung einer E-Mail.

Was Sie heute tun sollten

Wählen Sie eine Integration oder einen Workflow, den Sie im letzten Monat erstellt haben. Führen Sie die tatsächlichen Prompts durch den Token-Zähler Ihres Modells. Berechnen Sie die tatsächlichen Input- und Output-Token-Kosten pro Anfrage. Wenn Sie dies in großem Maßstab ausführen, multiplizieren Sie mit Ihrem Anfragevolumen und Ihren Kosten pro Token. Sie werden entweder feststellen, dass Sie Raum haben, Kontext hinzuzufügen und die Qualität zu verbessern, oder dass Sie rücksichtslos kürzen müssen. Die meisten Leute stellen fest, dass sie massiv über-tokenisiert haben, weil sie Zählungen geraten haben.

Beginnen Sie mit dem Messen. Alles andere ergibt sich daraus.

Batikan
· 5 min read
Topics & Keywords
Learning Lab sie die und tokens wenn sie sind ist den
Share

Stay ahead of the AI curve

Weekly digest of the most impactful AI breakthroughs, tools, and strategies.

Related Articles

Cursor vs. GitHub Copilot vs. Claude Code: Welcher KI-Assistent gewinnt bei Produktionsarbeit?
Learning Lab

Cursor vs. GitHub Copilot vs. Claude Code: Welcher KI-Assistent gewinnt bei Produktionsarbeit?

Drei KI-Coding-Assistenten dominieren Produktionsumgebungen. Dies ist keine Funktionsliste. Es ist eine Aufschlüsselung dessen, was jeder tatsächlich tut, wo er versagt und welche Tools für Architektur, Boilerplate und Debugging verwendet werden sollten.

· 11 min read
Tabellen mit Claude und GPT-4o analysieren
Learning Lab

Tabellen mit Claude und GPT-4o analysieren

Claude und GPT-4o können Ihre Tabellen und CSVs analysieren, aber nur, wenn Sie die Daten korrekt strukturieren und präzise fragen. Lernen Sie, wie Sie Dateien hochladen, Analyse-Prompts schreiben und Fallstricke bei Halluzinationen vermeiden.

· 2 min read
LLM-Halluzinationen: Warum sie auftreten und 5 Wege, sie zu stoppen
Learning Lab

LLM-Halluzinationen: Warum sie auftreten und 5 Wege, sie zu stoppen

Warum erfinden Sprachmodelle selbstbewusst Fakten? Weil sie Token vorhersagen, nicht die Wahrheit. Erfahren Sie, wie Grounding, Constraint Prompting und Temperatureinstellungen die Halluzinationsraten von über 15 % auf unter 5 % in Produktionssystemen senken.

· 6 min read
KI-Workflows für Freelancer, die tatsächlich abrechenbare Stunden erhöhen
Learning Lab

KI-Workflows für Freelancer, die tatsächlich abrechenbare Stunden erhöhen

KI kann Ihre Freelance-Leistung verdoppeln, ohne Ihr Urteilsvermögen zu ersetzen. Lernen Sie vier Produktions-Workflows, die administrative Aufgaben komprimieren und über 10 abrechenbare Stunden pro Monat zurückgewinnen.

· 6 min read
Schluss mit Halluzinationen: Wie RAG LLMs wirklich erdet
Learning Lab

Schluss mit Halluzinationen: Wie RAG LLMs wirklich erdet

Ihr LLM hat gerade selbstbewusst eine Forschungsarbeit zitiert, die es nicht gibt. Sie haben es nach Ihren API-Dokumenten für Ihr Unternehmen gefragt, und es beschrieb Endpunkte, die 2019 depreziert wurden. Das passiert, weil Sprachmodelle Text basierend auf Mustern in Trainingsdaten generieren, nicht indem sie Ihre tatsächlichen Informationen abfragen. Retrieval Augmented Generation (RAG) löst dieses Problem. Nicht, indem Modelle schlauer gemacht werden, sondern indem ihnen Zugriff auf echte Daten gewährt wird, bevor sie eine Antwort generieren. Die Technik ist essenziell für Produktionssysteme geworden, aber die meisten Implementierungen scheitern leise — entweder indem sie irrelevante Dokumente zurückgeben oder die Abrufung so verbessern, dass das Modell von zu viel Kontext verwirrt wird. Diese Anleitung führt durch, wie RAG tatsächlich funktioniert, warum einfache Setups scheitern und welche spezifischen Mustern in der Produktion funktionieren.

· 7 min read
Wohin Ihre Prompts gehen: Datenverarbeitung bei ChatGPT, Claude und Gemini
Learning Lab

Wohin Ihre Prompts gehen: Datenverarbeitung bei ChatGPT, Claude und Gemini

ChatGPT speichert Ihre Daten und verwendet sie standardmäßig für das Training. Claude trainiert nicht mit Web-Konversationen, es sei denn, Sie stimmen zu. Gemini verknüpft Ihre Chats mit Ihrem gesamten Google-Konto. Hier erfahren Sie, was jedes Modell mit Ihren Prompts macht und wie Sie sensible Informationen schützen.

· 5 min read

More from Prompt & Learn

Otter vs Fireflies vs tl;dv: Der ultimative Vergleich von Meeting-Transkriptionstools
AI Tools Directory

Otter vs Fireflies vs tl;dv: Der ultimative Vergleich von Meeting-Transkriptionstools

Drei Tools versprechen, Ihre Meetings zu transkribieren und Aktionspunkte zu extrahieren. Nur eines integriert sich nahtlos in Ihren Workflow. Hier ist der echte Vergleich: Otter vs Fireflies vs tl;dv – Genauigkeitsdaten, Preisaufschlüsselungen und ehrliche Vor- und Nachteile für jedes Tool.

· 4 min read
Gamma vs Beautiful.ai vs Tome: Test der Folgenerstellung
AI Tools Directory

Gamma vs Beautiful.ai vs Tome: Test der Folgenerstellung

Ich habe Gamma, Beautiful.ai und Tome für Produktionspräsentationen getestet. Gamma generiert am schnellsten, hat aber Probleme mit dem Branding. Beautiful.ai liefert visuelle Konsistenz und Datenverarbeitung. Tome bietet Flexibilität und Kollaboration. Hier erfahren Sie, was in der Praxis funktioniert – und wann jedes Tool punktet.

· 12 min read
App-Store-Starts 2026: KI-Tools als Katalysator
AI News

App-Store-Starts 2026: KI-Tools als Katalysator

Appfigures berichtet über einen deutlichen Anstieg von App-Starts im Jahr 2026, angetrieben durch KI-Entwicklungswerkzeuge, die Zeitpläne von Wochen auf Tage komprimieren. Ein einzelner Entwickler mit Claude oder Mistral kann jetzt liefern, was 2022 ein ganzes Ingenieurteam erforderte.

· 3 min read
Julius AI vs. ChatGPT vs. Claude für Datenanalyse
AI Tools Directory

Julius AI vs. ChatGPT vs. Claude für Datenanalyse

Julius AI, ChatGPT Advanced Data Analysis und Claude Artifacts erledigen Datenaufgaben, aber Ausführungsgeschwindigkeit, Preise und Arbeitsabläufe unterscheiden sich erheblich. Hier erfahren Sie, wie Sie das richtige für Ihren Anwendungsfall auswählen.

· 5 min read
Perplexity vs Google AI vs Consensus: Welches Tool gewinnt für akademische Recherchen?
AI Tools Directory

Perplexity vs Google AI vs Consensus: Welches Tool gewinnt für akademische Recherchen?

Perplexity, Google AI und Consensus glänzen jeweils bei unterschiedlichen Forschungsaufgaben. Perplexity punktet bei aktuellen Themen mit Echtzeit-Synthese. Consensus liefert unübertroffene Zitationspräzision für begutachtete Arbeiten. Google Scholar bietet historische Tiefe. Diese Aufschlüsselung zeigt genau, welches Tool Sie für Ihre nächste Arbeit verwenden sollten – und warum.

· 7 min read
Googles Reise-Tools halbieren die Planungszeit. Das funktioniert wirklich
AI Tools Directory

Googles Reise-Tools halbieren die Planungszeit. Das funktioniert wirklich

Google hat im Frühjahr sieben integrierte Reise-Tools veröffentlicht. Die Preisverfolgung prognostiziert optimale Buchungsfenster, die Restaurantverfügbarkeit liefert Echtzeitdaten und Offline-Karten funktionieren ohne Mobilfunkabdeckung. Hier erfahren Sie, welche Funktionen Vertrauen verdienen und wo Sie Erwartungen anpassen sollten.

· 4 min read

Stay ahead of the AI curve

Weekly digest of the most impactful AI breakthroughs, tools, and strategies. No noise, only signal.

Follow Prompt Builder Prompt Builder