Auf dem Bildschirm liegt das Foto einer zerknitterten Rechnung. Ein KI-Modell soll Beträge erkennen, Positionen zuordnen und die Daten in eine Tabelle übertragen. Die Antwort selbst fällt nicht besonders lang aus. Im Hintergrund setzt dennoch eine aufwendige Rechenkette ein: Das Bild wird zerlegt, in maschinenlesbare Repräsentationen übersetzt und anschließend Wort für Wort ausgewertet. Gerade dieser letzte Schritt erinnert bisweilen an einen klugen Menschen, der jeden Satz mit nur einem Finger tippt.
Liquid AI will diesen Flaschenhals verkleinern. Das US-amerikanische KI-Unternehmen veröffentlichte am 24. September 2026 mit LFM2.5-VL-DSpark ein experimentelles Hilfsmodell für sein Bild-Sprach-Modell LFM2.5-VL-3B. Es soll die Ausgabe erheblich beschleunigen, ohne die Antworten des eigentlichen Modells zu verändern. Der Ansatz trägt einen sperrigen Namen: Speculative Decoding. Das Prinzip dahinter ist erstaunlich anschaulich. Ein kleines Modell entwirft mögliche Fortsetzungen, das große kontrolliert sie.
Nach Angaben von Liquid AI steigert DSpark die reine Ausgabegeschwindigkeit je nach Hardware und Aufgabe auf das Zwei- bis Dreifache. Auf einem MacBook Pro mit M5 Max nennt das Unternehmen Werte vom 2,30- bis zum 3,13-Fachen, auf einer Nvidia H100 vom 2,04- bis zum 2,66-Fachen. Dabei umfasst das Hilfsmodell knapp 280 Millionen Parameter und vergrößert das gesamte System um 8,9 Prozent. Recherchequelle: Liquid AI
Mehrere Token auf einen Streich
Herkömmliche Sprachmodelle erzeugen Texte Schritt für Schritt. Sie berechnen ein Token, hängen es an die bisherige Folge an und wiederholen den Vorgang. Token sind kleine Spracheinheiten, die einem Wort, einem Wortteil oder einem Satzzeichen entsprechen können. Für eine Antwort mit hundert Token muss das Modell diese Prozedur im Prinzip hundertmal nacheinander durchlaufen.
Speculative Decoding lockert diese strenge Reihenfolge. Ein kleineres, schnelleres Modell entwirft gleich mehrere mögliche Fortsetzungen, die das große Zielmodell als Block in einem einzigen Durchgang prüft. Stimmen die Vorschläge mit seiner eigenen Berechnung überein, kann es mehrere Token auf einmal akzeptieren. Bei der ersten Abweichung verwirft das System den unpassenden Rest und setzt mit einer korrigierten Fortsetzung neu an.
Die grundlegende Methode wurde bereits 2022 vorgestellt und 2023 auf der Maschinenlernkonferenz ICML präsentiert. Ihre Autoren Yaniv Leviathan, Matan Kalman und Yossi Matias zeigten damals, dass sich bestehende Transformer-Modelle beschleunigen lassen, ohne ihre Architektur zu verändern. Entscheidend ist, dass das Zielmodell die Kontrolle behält: Das kleinere Modell darf raten, aber nicht entscheiden. Recherchequelle: arXiv
Das Verfahren ähnelt einem erfahrenen Redakteur, der den Entwurf eines flinken Assistenten überfliegt. Ist eine Passage richtig, muss er sie nicht selbst noch einmal schreiben. Erst wenn ein Satz aus der Spur gerät, greift er ein. Wie groß der Nutzen ausfällt, hängt deshalb stark davon ab, wie oft der Assistent richtigliegt. Ein übereifriger, aber ungenauer Vorhersager produziert vor allem Ausschuss.
DSpark soll diese Trefferquote erhöhen. Die zugrunde liegende Methode erzeugt mehrere Vorschläge parallel, lässt die vorausgesagten Token aber in begrenztem Umfang voneinander abhängen. Anhand seiner Sicherheitsschätzung soll das System außerdem bestimmen können, wie viele Vorschläge sich zur Prüfung lohnen. Zu lange Blöcke bringen wenig, wenn ihre hintere Hälfte fast immer verworfen wird. Die im Juli 2026 veröffentlichte DSpark-Arbeit beschreibt deshalb eine dynamische Kontrolle der Länge des zu prüfenden Blocks, die auch die jeweilige Serverauslastung berücksichtigt. Recherchequelle: arXiv
Wenn Bilder in die Sprachmaschine gelangen
Bei Bild-Sprach-Modellen ist die Aufgabe komplizierter als bei reinen Textsystemen. Bevor ein Modell erklären kann, was auf einem Foto oder Bildschirm zu sehen ist, muss ein Bild-Encoder die visuellen Informationen verarbeiten. Er übersetzt sie in zahlreiche Repräsentationen, die das Sprachmodell anschließend gemeinsam mit dem Text der Anfrage auswertet. Das Bild wird so gewissermaßen in die Sprache der Maschine übertragen.
LFM2.5-VL-3B ist für Aufgaben wie Dokumentenerkennung, Bildschirmverständnis, Objektzuordnung und die Auswertung mehrerer Bilder ausgelegt. So kann es beispielsweise Text aus einer Rechnung lesen, Elemente auf einer Benutzeroberfläche lokalisieren oder Fragen zu einem Diagramm beantworten. Das Modell besitzt rund drei Milliarden Parameter und soll sich auf lokaler Hardware betreiben lassen. Recherchequelle: Hugging Face
Für DSpark spielt es nach Angaben der Entwickler keine entscheidende Rolle, ob die internen Zustände ursprünglich aus einem Absatz oder aus Bildausschnitten hervorgegangen sind. In den dafür genutzten Schichten liegen Text- und Bildinformationen bereits als numerische Strukturen gleicher Dimension vor. Auf diese Zwischenzustände greift das Hilfsmodell zu, um daraus einen Block möglicher nächster Token zu entwerfen.
Nach eigenen Versuchen entschied sich Liquid AI für ein Hilfsmodell mit vier Aufmerksamkeitsschichten und einer beim Training verwendeten Blockgröße von neun Token. Im praktischen Einsatz erzeugt es je nach Hardware acht oder neun Vorschläge, die das Hauptmodell anschließend kontrolliert. Bei einer deterministischen Ausgabe, also ohne zufällige Variation, soll der fertige Text exakt dem entsprechen, was das Zielmodell allein erzeugt hätte. Mit abgestimmten Zufallseinstellungen bleibt zumindest dieselbe statistische Ausgabeverteilung erhalten. Recherchequelle: Hugging Face
Darin unterscheidet sich Speculative Decoding von vielen anderen Methoden zur Beschleunigung von KI-Systemen. Kleinere Zahlenformate, verkürzte Modelle oder eine aggressive Kompression können die Qualität beeinflussen. Das Verfahren dagegen versucht, Rechenarbeit einzusparen, ohne dem großen Modell das letzte Wort zu nehmen. Nicht die Intelligenz wird ersetzt, sondern ein Teil ihrer Routine vorbereitet.
Dreimal schneller ist nicht dreimal schneller
Die veröffentlichten Zahlen klingen eindrucksvoll, verlangen aber einen genauen Blick. Liquid AI unterscheidet zwischen der Geschwindigkeit beim Erzeugen der Antwort und der Laufzeit des gesamten Vorgangs. Auf dem M5 Max erreicht DSpark bei einer Aufgabe zur Bildbeschreibung das 3,13-Fache der bisherigen Ausgabegeschwindigkeit. Bezieht man alle vorherigen Verarbeitungsschritte ein, schrumpft der Faktor auf das 2,59-Fache. Bei der Auswertung von Text in Bildern sinkt er sogar vom 2,69- auf das 1,56-Fache.
Der Grund liegt in der Arbeit, die vor der eigentlichen Textausgabe anfällt. Speculative Decoding beschleunigt weder den Bild-Encoder noch das sogenannte Prefill, bei dem das Modell die Eingabe und die visuellen Token verarbeitet. Beansprucht dieser erste Abschnitt bereits einen großen Teil der Gesamtzeit, kann selbst eine stark beschleunigte Ausgabe den gesamten Ablauf nur begrenzt verkürzen. Ein schnellerer letzter Kilometer verkürzt eben nicht automatisch die gesamte Reise auf ein Drittel.
Hinzu kommen eng umrissene Testbedingungen. Liquid AI maß mit 16-Bit-Modellen, verarbeitete jeweils nur eine Anfrage zur selben Zeit und setzte die Temperatur auf null. Die Apple-Tests erlaubten bis zu 2048 ausgegebene Token, während die mittlere Antwort lediglich 90 Token lang war. Sämtliche Werte stammen vom Hersteller und wurden auf dessen eigener Benchmark-Infrastruktur erhoben. Unabhängige Vergleichsmessungen für genau diese Veröffentlichung liegen bislang nicht vor.
Auch die Forschung mahnt zu einem nüchternen Blick auf die Zahlen. Der 2026 vorgestellte MMSpec-Benchmark umfasst 600 Beispiele aus sechs Kategorien, darunter Bildbeschreibungen, Diagrammfragen, Texterkennung und komplexere Schlussfolgerungen. Seine Autoren zeigen, dass ursprünglich für reine Sprachmodelle entwickelte Beschleunigungsverfahren bei visuellen Aufgaben an Wirkung verlieren können. Nach ihrer Analyse bedeutet ein höherer Durchsatz außerdem nicht zwangsläufig eine entsprechend geringere Verzögerung für den einzelnen Nutzer. Recherchequelle: arXiv
Der Wettlauf verlagert sich
Trotz dieser Einschränkungen reicht die Bedeutung der Veröffentlichung über das einzelne Modell hinaus. Lange wurde der Fortschritt der generativen KI vor allem an Größe gemessen: mehr Parameter, mehr Trainingsdaten, mehr Rechenzentren. Inzwischen rückt eine alltagsnähere Frage in den Vordergrund: Wie viel dieser Leistungsfähigkeit lässt sich auf einem gewöhnlichen Gerät nutzen – und wie lange muss der Nutzer darauf warten?
Ein lokal laufendes Bildmodell kann Dokumente auswerten, Bildschirminhalte verstehen oder Kamerabilder beschreiben, ohne jede Aufnahme an einen entfernten Server zu schicken. Damit solche Anwendungen nicht nur technisch möglich, sondern auch komfortabel nutzbar werden, zählt jede eingesparte Sekunde. Ein Assistent im Fahrzeug, eine Vorlesehilfe oder ein Werkzeug zur Dokumentenerfassung darf sich keine ausgedehnte Denkpause gönnen.
LFM2.5-VL-DSpark markiert daher einen Richtungswechsel, der unscheinbar wirkt und doch Gewicht hat. Statt das zugrunde liegende Modell zu vergrößern, stellt Liquid AI ihm einen kleinen Begleiter zur Seite, der vorausdenkt, Vorschläge macht und sich jederzeit korrigieren lässt. Der eigentliche Fortschritt bleibt dabei fast unsichtbar: Er zeigt sich nicht in neuen Stimmen oder eindrucksvolleren Bildern, sondern darin, dass zwischen einer Frage und der Antwort weniger Zeit vergeht.
Weiterführende Informationen
Quellenhinweis: Einzelne Fakten, Einschätzungen und Prognosen dieses Beitrags stützen sich auf Veröffentlichungen der nachfolgend genannten Unternehmen und Institutionen. Die Links dienen zugleich der weiterführenden Information.
Lilith AI – DSpark beschleunigt ein Vision-Modell um bis zu 3,13-mal, aber nicht das erste Token
Der Beitrag erläutert das 279,5-Millionen-Parameter-Hilfsmodell, die hardwareabhängigen Beschleunigungswerte und die unveränderte Startlatenz.
https://lilithai.dev/radar/accelerating-vision-language-models-with-lfm2-5-vl-dspark?lang=de
alphaXiv – Schnelle Inferenz aus Transformatoren mittels spekulativer Dekodierung
Die deutschsprachige Aufbereitung des grundlegenden Papers erklärt Tokenentwurf, parallele Prüfung und die mathematische Bewahrung der Ausgabeverteilung.
https://www.alphaxiv.org/de/abs/2211.17192
alphaXiv – MMSpec: Leistungsvergleich der spekulativen Dekodierung bei Bild-Sprachmodellen
Die Seite beschreibt die 600 multimodalen Beispiele und zeigt, warum hoher Durchsatz nicht automatisch eine geringere Einzellatenz bedeutet.
https://www.alphaxiv.org/de/abs/2603.14989v1



