Transformer

Ein Transformer ist eine Deep-Neural-Network-Architektur (DNN), also eine tiefe neuronale Netzwerkarchitektur, die Google-Forscher 2017 eingeführt haben. Sie nutzt Self-Attention, um Sequenzen parallel zu verarbeiten, und bildet die Grundlage nahezu aller modernen Large Language Models, Vision-Modelle und multimodalen KI-Systeme.

Das Wichtigste in Kürze

  • Transformer sind eine KI-Architektur (nicht zu verwechseln mit elektrischen Transformatoren) und wurden 2017 im Paper „Attention Is All You Need“ vorgestellt.
  • Self-Attention erlaubt es dem Modell, jeden Token parallel gegen jeden anderen zu gewichten. Damit löst es die langsamere Rekurrenz von RNNs und LSTMs ab.
  • Es gibt drei Hauptvarianten: Encoder-only (BERT) fürs Verstehen, Decoder-only (GPT, Claude) fürs Generieren und Encoder-Decoder (T5) für übersetzungsähnliche Aufgaben.
  • Transformer treiben heute Sprach-, Bild-, Audio-, Code- und Zeitreihenmodelle an, denn sie skalieren berechenbar mit, wenn Datenmenge und Rechenleistung wachsen.
  • In der Debitorenbuchhaltung und im Order-to-Cash lesen transformerbasierte Modelle Zahlungsavise und Rechnungen aus, klassifizieren Kunden-E-Mails und prognostizieren den Zahlungszeitpunkt über ganze Kundenportfolios hinweg.

Was ein Transformer ist und der Ursprung im Jahr 2017

Ein Transformer ist eine Architektur für Deep Neural Networks (DNN), also tiefe neuronale Netze, die Datensequenzen verarbeitet: Wörter, Bildausschnitte, Zeitreihenpunkte oder Audioframes. Vorgestellt wurde sie 2017 in der Veröffentlichung Attention Is All You Need von Forschenden bei Google Brain und Google Research. Die Arbeit zeigte, dass ein Modell, das vollständig auf einem Mechanismus namens Self-Attention aufbaut, die damals dominierenden rekurrenten neuronalen Netze (RNNs und LSTMs) in der Sequenzmodellierung übertrifft. Und das bei deutlich schnellerem Training auf moderner Hardware.

Zur Klarstellung: Gemeint ist eine KI-Architektur, kein elektrischer Transformator. Der Name beschreibt, wie das Modell Eingabesequenzen über mehrere Attention-Schichten in Ausgaberepräsentationen umwandelt. Nahezu jedes moderne KI-System, von dem Finanz- und IT-Verantwortliche hören (GPT, Claude, Gemini, Llama, BERT, Whisper, Stable Diffusion, CLIP), ist ein Transformer oder ein naher Verwandter.

Der Durchbruch durch Self-Attention

Die zentrale Innovation ist die Self-Attention. Für jedes Token in einer Sequenz berechnet das Modell, wie stark es auf jedes andere Token achten sollte, und mischt deren Repräsentationen entsprechend. So erfasst das Modell auch weitreichende Abhängigkeiten. Es verknüpft etwa den Kundennamen am Anfang einer E-Mail in einem einzigen Schritt mit dem Zahlungsbetrag am Ende.

Vor den Transformern verarbeiteten RNNs Sequenzen Element für Element. Das war langsam und verlor über längere Passagen hinweg Information. Self-Attention arbeitet dagegen vollständig parallel: Eine GPU berechnet die Attention über alle Token gleichzeitig. Genau diese Parallelität machte es praktikabel, Modelle mit Billionen von Token zu trainieren und sie auf Hunderte Milliarden Parameter zu skalieren. Und das wiederum erschloss jene Fähigkeiten, die wir heute als LLMs bezeichnen.

Kernkomponenten der Architektur

Ein Transformer besteht aus wenigen Bausteinen, die sich wiederholen:

  • Tokenisierung: Das Modell zerlegt Eingabetext oder -daten in Tokens (Subwörter, Bildausschnitte oder Zeitschritte).
  • Embeddings: Jedes Token wird auf einen Vektor abgebildet, der seine Bedeutung erfasst.
  • Positionscodierung: Der Attention-Mechanismus berücksichtigt die Reihenfolge nicht. Deshalb kommt eine Positionsinformation hinzu, damit das Modell die Reihenfolge der Tokens kennt.
  • Multi-Head Self-Attention: Mehrere Attention-Heads laufen parallel und lernen jeweils unterschiedliche Zusammenhänge (Syntax, Entitäten, numerischer Kontext).
  • Feed-Forward-Schichten: neuronale Netze pro Token, die die durch Attention gewichteten Repräsentationen umformen.
  • Layer-Normalisierung und Residualverbindungen: technische Kniffe, die tiefe Stapel dieser Blöcke während des Trainings stabil halten.

Diese Blöcke stapeln sich dutzende oder hunderte Male. Über die Tiefe der Stapel, die Zahl der Attention-Heads und die Breite der Embeddings skaliert ein Transformer vom kleinen Klassifikator bis zum Spitzenmodell.

Varianten: Encoder-only, Decoder-only, Encoder-Decoder

In der Praxis dominieren drei Architekturvarianten:

  • Encoder-only (BERT, RoBERTa): liest die gesamte Eingabe und erzeugt aussagekräftige Repräsentationen. Ideal, um zu klassifizieren, zu suchen und Embeddings zu erzeugen.
  • Decoder-only (GPT-4, Claude, Llama): generiert Tokens nacheinander und berücksichtigt dabei nur die vorangegangenen Tokens. Das Fundament moderner Chatbots und generativer KI.
  • Encoder-Decoder (T5, der ursprüngliche Transformer): kodiert eine Eingabesequenz und dekodiert eine Ausgabesequenz. Stark beim Übersetzen, Zusammenfassen und strukturierten Umschreiben.

Dieselbe Kernarchitektur treibt auch Vision Transformer (ViT) für Bilder an, Whisper für Sprache, Zeitreihen-Transformer für Prognosen sowie multimodale Modelle wie CLIP, GPT-4o und Claude, die Text mit Bildern verbinden. Die Architektur lässt sich universell einsetzen, die Modalität ergibt sich aus den Trainingsdaten und dem Trainingsziel.

Warum das für Order-to-Cash und Cashflow-Prognosen entscheidend ist

Für Finanzteams sind Transformer keine akademische Spielerei, sondern der Motor hinter fast jeder modernen Funktion zur Automatisierung der Debitorenbuchhaltung. Gerade im Order-to-Cash und in der Cashflow-Prognose (Liquiditätsplanung) übernehmen transformerbasierte Modelle vier Aufgaben, an denen ältere regelbasierte Systeme zuverlässig gescheitert sind.

Erstens das Dokumentenverständnis: Vision-Language-Transformer lesen Zahlungsavise, Rechnungen und Kontoauszüge direkt aus PDF oder Bild und ziehen Beträge, Rechnungsnummern und Kundenreferenzen heraus, ganz ohne fehleranfällige Vorlagen. Zweitens die semantische Klassifizierung: Transformer vom Encoder-Typ ordnen Kunden-E-Mails Kategorien wie Streitfall, Zahlungsbestätigung oder Anfrage nach einer Rechnungskopie zu, selbst wenn die Formulierung ungewöhnlich ist. Drittens die Zeitreihenprognose: Transformerbasierte Modelle sagen voraus, wann jeder Kunde zahlt, und verdichten das zu Cashflow-Prognosen auf Portfolioebene, die sich mit jedem neuen Zahlungseingang anpassen. Viertens die Streitfallanalyse und Zusammenfassung: LLMs vom Decoder-Typ fassen lange E-Mail-Verläufe, ERP-Notizen und Fälligkeitsdetails zu einem Lösungsvorschlag für den Streitfall zusammen. Früher musste ein Analyst dafür alles von Grund auf durchlesen.

Transformance.ai setzt transformerbasierte Modelle in Debitorenprozessen für Dokumentenverständnis, semantische Klassifizierung und Zeitreihenprognosen ein.

Grenzen und aktuelle Entwicklungen

Transformer haben bekannte Grenzen. Die größte ist der quadratische Rechenaufwand des Attention-Mechanismus: Verdoppeln Sie die Kontextlänge, vervierfacht sich der Bedarf an Rechenleistung und Speicher in etwa. Deshalb ließen sich sehr lange Dokumente, etwa die gesamte Kundenkorrespondenz eines Jahres, früher nur schwer direkt einspeisen.

Die aktuelle Forschung setzt hier an: mit spärlichen und linearen Attention-Varianten (Longformer, BigBird, FlashAttention) sowie mit Ansätzen jenseits des Transformers wie den State-Space-Modellen, etwa Mamba, die linear mit der Sequenzlänge skalieren sollen. Mixture-of-Experts-Transformer senken die Inferenzkosten, weil sie pro Token nur einen Bruchteil der Parameter aktivieren. In der Praxis setzen die führenden Modelle 2026 im Kern nach wie vor auf das Transformer-Rezept, ergänzt um diese Effizienztechniken. Für Finanz- und IT-Verantwortliche zählt vor allem eines: Die Architektur ist stabil genug, um darauf aufzubauen. Wer heute auf Transformer setzt, folgt keinem kurzlebigen Trend.

Häufig gestellte Fragen

Ist ein Transformer dasselbe wie ein LLM?

Nein. Ein Transformer ist die zugrunde liegende Architektur eines neuronalen Netzes. Ein LLM ist ein großes Sprachmodell, genauer gesagt ein reiner Decoder-Transformer, den man mit riesigen Textmengen trainiert hat. Alle modernen LLMs sind Transformer, aber nicht jeder Transformer ist ein LLM. Auch Vision Transformer, Zeitreihen-Transformer und Klassifikatoren im BERT-Stil zählen dazu.

Wer hat die Transformer-Architektur erfunden?

Forscher von Google Brain und Google Research stellten die Architektur 2017 im Paper Attention Is All You Need vor. Die acht Autoren, darunter Ashish Vaswani, Noam Shazeer und Aidan Gomez, entwarfen sie ursprünglich für die maschinelle Übersetzung. Seither bildet sie die Grundlage nahezu jedes bedeutenden KI-Systems, das heute im Einsatz ist.

Warum benötigen Transformer so viel Rechenleistung?

Die Self-Attention vergleicht jedes Token mit jedem anderen und skaliert damit quadratisch zur Sequenzlänge. Hinzu kommt: Für das Training müssen Billionen von Tokens über Hunderte Milliarden Parameter hinweg verarbeitet werden. Der Vorteil liegt in der Parallelität. Anders als bei RNNs lässt sich jede Position gleichzeitig auf einer GPU berechnen, und genau das machte das groß angelegte Pretraining überhaupt erst möglich.

Werden Transformer auch außerhalb von Sprachaufgaben eingesetzt?

Ja, und zwar in großem Umfang. Vision Transformer (ViT) klassifizieren Bilder, Whisper transkribiert Sprache, Modelle im Stil von AlphaFold sagen Proteinstrukturen voraus, Zeitreihen-Transformer prognostizieren Nachfrage und Zahlungszeitpunkte, und multimodale Modelle wie Claude und GPT-4o verarbeiten Text, Bilder und Audio in einer einzigen Architektur. Derselbe Kernmechanismus, die Self-Attention, funktioniert über alle Modalitäten hinweg.

Was ist der Unterschied zwischen reinen Encoder- und reinen Decoder-Transformern?

Reine Encoder-Modelle wie BERT lesen die gesamte Eingabe auf einmal und erzeugen Repräsentationen, die man für Klassifikation, Suche oder Embeddings nutzt. Reine Decoder-Modelle wie GPT und Claude erzeugen Tokens nacheinander und beziehen dabei nur die vorangegangenen ein. Das prädestiniert sie für Chat, Textproduktion und logisches Schließen. Encoder-Decoder-Modelle wie T5 kombinieren beides für Aufgaben nach Art der Übersetzung.

Wie helfen Transformer einem Debitoren- oder Finanzteam in der Praxis?

Transformer-basierte Modelle extrahieren strukturierte Daten aus Zahlungsavisen und Rechnungen ganz ohne Vorlagen, ordnen eingehende Kunden-E-Mails nach Anliegen zu, fassen den Verlauf von Streitfällen zu empfohlenen Maßnahmen zusammen und sagen voraus, wann jeder Kunde zahlt. So aktualisieren sich Ihre Cashflow-Prognosen von selbst. Das Ergebnis: weniger manuelle Eingriffe pro Rechnung und eine Prognose, die das aktuelle Kundenverhalten abbildet statt der Durchschnittswerte des letzten Quartals.

Weiterlesen