Eine neue Nvidia-Patentanmeldung beschreibt einen Compiler, der überflüssige Attention-Berechnungen erkennen soll. Transformer-Modelle blenden mit Masken bestimmte Beziehungen zwischen Tokens aus. GPUs bearbeiten die zugehörige Matrix jedoch blockweise. Dadurch kann trotz vieler ausgeblendeter Werte unnötige Arbeit entstehen.
Die US-Anmeldung US 2026/0259730 A1 wurde am 3. September veröffentlicht.
Grenzen statt Einzelprüfung
Der Compiler analysiert eine vorgegebene Maskenregel bereits beim Übersetzen. Daraus erzeugt er linke und rechte Grenzfunktionen für den gültigen Bereich der Attention-Matrix. Der spätere GPU-Kernel kann vollständig maskierte Kacheln überspringen, ohne jede Zelle einzeln zu prüfen.
- Flexibler: Auch benutzerdefinierte Masken sollen unterstützt werden.
- Weniger Aufwand: Nicht benötigte Werte werden gar nicht erst berechnet.
- Gleiche Ausgabe: Nur vollständig ausgeblendete Kacheln dürfen entfallen.
Bewertung: Der Maskentyp entscheidet
Der Ansatz trifft einen wichtigen Kostenfaktor großer Sprach- und Bildmodelle. Der mögliche Gewinn hängt aber von Struktur, Kachelgröße und Compiler-Overhead ab. Bei unregelmäßigen Masken können viele teilweise belegte Kacheln übrig bleiben. Die Anmeldung nennt einen Mechanismus, liefert jedoch keinen öffentlichen Benchmark und belegt keine Integration in CUDA oder ein ausgeliefertes Nvidia-Produkt. Auch eine Patenterteilung ist noch offen.