Wie ein KI-Agent Produkte zählt, seine Wahrnehmung überprüft – und warum er der eigenen Sicherheit nicht trauen darf
Ein Foto, 13 Prüfpunkte und tausende Entscheidungen: Das Asseco Platform Lab erprobt einen KI-Agenten, der Produkte in Supermarktregalen erkennen und seine erste Wahrnehmung mithilfe zusätzlicher Werkzeuge kontrollieren soll. Der interne Versuch zeigt, wie stark eine digitale Lupe die Genauigkeit erhöhen kann – und weshalb die Selbsteinschätzung eines KI-Modells dennoch keine verlässliche Qualitätskontrolle ersetzt.
Ein Supermarktregal wirkt kaum wie ein Prüfstand für künstliche Intelligenz. Packungen stehen neben Packungen, Flaschen in Reih und Glied, Sonderangebote warten auf Kundschaft. Alles scheint überschaubar. Ein Mensch schaut hin, zählt, vergleicht – fertig.
Für eine KI jedoch ist dieses alltägliche Nebeneinander erstaunlich anspruchsvoll.
Am 24. August 2026 hat das Asseco Platform Lab Ergebnisse eines Forschungsprojekts veröffentlicht, das die Schwierigkeiten der Aufgabe sichtbar macht. Unter dem Namen „Vantage“ experimentiert das Unternehmen mit einem visuellen KI-Agenten, der Fotos von Verkaufsregalen analysieren soll.
Dabei geht es nicht um eine futuristische Filiale ohne Menschen, sondern um ganz gewöhnliche Fragen, die Hersteller und Händler seit Jahrzehnten beschäftigen: Steht das vereinbarte Produkt tatsächlich im Regal? Ist genügend Ware vorhanden? Stimmen die sogenannten Facings – also die von vorne sichtbaren Produkteinheiten?
Aus 587 Regalfotos mit jeweils 13 Ja-Nein-Prüfpunkten ergeben sich exakt 7.631 einzelne Entscheidungen. Diese rund 7.600 Prüfschritte übernehmen bei dem von Asseco beschriebenen Quartalsaudit bislang Menschen. Recherchequelle: assecoplatform.com
Der Versuch weist damit weit über ein paar Packungen Puddingpulver hinaus.
Aus einem Regalfoto werden 13 Prüfaufgaben
Im Lebensmittelhandel entscheidet sich erstaunlich viel auf wenigen Zentimetern Regalfläche. Hersteller vereinbaren mit Handelsketten bestimmte Platzierungen, Aktionsflächen oder eine festgelegte Anzahl sichtbarer Produkte. Zugleich gilt es, leere Stellen zu erkennen, Sortimente zu kontrollieren und Abweichungen zu dokumentieren.
Was einem Menschen selbstverständlich erscheint, wird für eine Maschine schnell zum visuellen Minenfeld.
Viele Verpackungen ähneln einander. Eine Sorte unterscheidet sich womöglich nur durch einen schmalen Farbstreifen von der nächsten. Auf einer Packung stehen 39 Gramm, auf der Packung daneben 71 Gramm. Ein Preisschild verdeckt einen Teil des Produkts, Licht spiegelt sich auf Kunststoff, andere Waren versperren die Sicht. Und irgendjemand hat eine Packung schief zurückgestellt.
Hinzu kommt: Das Foto entstand nicht unter kontrollierten Studiobedingungen, sondern aus zwei oder drei Metern Entfernung vor einem echten Supermarktregal – dort, wo nichts eigens für die Kamera stillhält.
Darin liegt die eigentliche Herausforderung. Die KI soll keine perfekte Produktaufnahme erkennen, sondern den Supermarkt so sehen, wie er wirklich aussieht.
Asseco bietet bereits ein klassisches Bilderkennungssystem für den Handel an. Das Modell wird vorab auf die jeweiligen Produkte trainiert und kann anschließend unter anderem Facings, Warenverfügbarkeit und die Einhaltung eines Planogramms auswerten. Für seine Retail Image Recognition nennt das Unternehmen bei umfangreichen Praxiseinsätzen eine Erkennungsgenauigkeit von bis zu 98 Prozent. Dabei handelt es sich um eine Anbieterangabe, nicht um einen unabhängig überprüften Messwert.
Das Verfahren hat allerdings eine Grenze: Das System muss die Produkte vorher kennen.
Neue Marke, neuer Markt – und schon entsteht zusätzlicher Trainingsaufwand. Vantage schlägt deshalb einen anderen Weg ein.
Warum die digitale Lupe den Unterschied macht
Der entscheidende Unterschied steckt im Wort „Agent“.
Asseco legt dem experimentellen Agenten nicht lediglich ein Foto und einen ausgefeilten Prompt vor, sondern stattet ihn mit zusätzlichen Werkzeugen aus. Er kann einen Produktdetektor aufrufen, der einzelne Waren im Foto lokalisiert. Außerdem darf er einen bestimmten Ausschnitt vergrößern, um ein Etikett oder eine Gewichtsangabe aus der Nähe zu betrachten.
Das klingt zunächst unspektakulär. Die Messwerte erzählen eine andere Geschichte.
In Assecos begrenzter Testreihe mit 49 Fotos und sechs besonders schwierigen Prüfpunkten zu Dessertpulver erreichte das Modell allein mit dem Prompt eine Genauigkeit von 75 Prozent. Ein zusätzlicher Produktdetektor steigerte den intern gemessenen Wert auf 89 Prozent. Nachdem der Agent auch einen Vergrößerungsmechanismus nutzen konnte, waren es 96 Prozent.
Aus 75 wurden 96 Prozent – nicht durch eine kunstvollere Formulierung des Prompts, sondern weil die KI ihre erste Wahrnehmung noch einmal prüfen konnte.
Gleichzeitig sank die Zahl falscher Ja-Antworten bei der Prüfung der Warenverfügbarkeit von 17 auf zwei. Die 96 Prozent gelten allerdings ausdrücklich nur für diese 49 Fotos und sechs Prüfpunkte, nicht für den gesamten Datensatz oder beliebige Produktgruppen.
Der Sprung zeigt, worauf es bei diesem Ansatz ankommt. Vielleicht liegt ein wichtiger Teil der Zukunft künstlicher Intelligenz im Handel gar nicht in immer größeren Modellen und längeren Anweisungen, sondern in den richtigen Augen, Lupen und Messinstrumenten für die jeweilige Aufgabe.
Menschen gehen ähnlich vor. Wer eine winzige Gewichtsangabe auf einer Verpackung nicht entziffern kann, erfindet hoffentlich nicht selbstbewusst eine Zahl, sondern tritt einen Schritt näher heran.
Eine gute KI sollte dasselbe tun.
Wenn eine sichere Antwort trotzdem falsch ist
Zugleich offenbart Vantage eine Schwäche, die weit über den Supermarkt hinausweist.
Dass KI sich irren kann, ist bekannt. Heikel wird es, wenn sie gleichzeitig signalisiert, von ihrer falschen Antwort überzeugt zu sein.
Asseco untersuchte deshalb, ob sich die Selbsteinschätzung des Modells nutzen ließe, um vermeintlich sichere Entscheidungen automatisch freizugeben. Das Ergebnis fällt ernüchternd aus: Antworten, die das Modell selbst als sicher einstufte, waren ohne zusätzliche Werkzeuge nur in 62 bis 64 Prozent der Fälle korrekt. Beim Agenten stieg der Wert auf 74 Prozent.
Damit war selbst beim besseren System noch etwas mehr als jede vierte vermeintlich sichere Antwort falsch – insgesamt 26 Prozent.
So wird das Supermarktregal beinahe zum Lehrstück für eine der zentralen Fragen moderner KI-Systeme: Wie lässt sich eine Maschine überprüfen, bevor ihre Antwort zur Tatsache erklärt wird?
Ein Computer, der sagt „Ich bin mir sicher“, besitzt schließlich keine menschliche Intuition. Seine Sicherheit ist ein berechnetes Signal – und dieses Signal kann täuschen.
Asseco will die Selbsteinschätzung daher nicht isoliert verwenden, sondern mit weiteren Hinweisen abgleichen: Stimmen verschiedene Modelle überein? Was haben die Werkzeuge erkannt? Wie zuverlässig waren die Antworten beim jeweiligen Prüfpunkt in früheren Versuchen?
Für diese zusätzliche Kontrolllogik nennt die Veröffentlichung bislang keine eigenen Erfolgswerte. Auch die Weiterleitung unsicherer Fälle an einen Menschen zählt zu den nächsten Entwicklungsschritten.
Am Ende könnte dieses Prinzip für den Handel wichtiger sein als die letzte Nachkommastelle einer Benchmark. Besonders wertvoll ist nicht eine KI, die niemals zweifelt, sondern eine, deren Unsicherheit technisch erkannt werden kann.
Wie ein Regalfoto zum Datensatz wird
Ein gedanklicher Gang durch einen größeren Lebensmittelmarkt macht die Dimension sichtbar. Schon eine einzelne Filiale führt tausende Artikel. Preise ändern sich, Aktionen beginnen und enden, Produkte verschwinden vorübergehend aus dem Regal. Verpackungen werden überarbeitet, Saisonware kommt und geht.
Über hundert, tausend oder zehntausend Verkaufsstellen hinweg wird aus der simplen Bitte „Schau bitte nach, ob unser Produkt im Regal steht“ eine industrielle Datenaufgabe.
Darin liegt der Reiz der Bilderkennung für den Handel. Ein Außendienstmitarbeiter müsste nicht mehr jedes Detail einzeln dokumentieren. Stattdessen könnte ein Foto zum Datensatz werden: Produkte erkannt, Regalanteile berechnet, Lücken gefunden, vereinbarte Platzierungen überprüft.
Das Bild würde zur Inventur im Taschenformat.
Asseco Platform ist auf solche Anwendungen im FMCG-Bereich spezialisiert – also auf schnelldrehende Konsumgüter. Nach eigenen Angaben arbeiten mehr als 125.000 Nutzer in 74 Ländern mit der Plattform. Zum Angebot gehören Außendienststeuerung, Regalbilderkennung, Handelsdaten und die Planung von Vertriebswegen. Auch diese Reichweiten- und Leistungszahlen stammen vom Unternehmen selbst. Recherchequelle: assecoplatform.com
Bei dieser Größenordnung können schon wenige Prozentpunkte bei der Erkennungsqualität entscheidend sein. Ein einzelner Fehler in einem Datensatz von 49 Bildern bleibt überschaubar. Derselbe Fehlermechanismus wird jedoch zum Geschäftsproblem, wenn er millionenfach in Märkten und bei regelmäßigen Kontrollen auftritt.
Genauigkeit hat einen Preis
Doch selbst wenn die KI richtig sieht, bleibt eine zweite Frage: Was kostet ihr Blick?
Das Experiment liefert dazu konkrete Kosten- und Laufzeitwerte. Die Listenpreise der beiden untersuchten KI-Modelle lagen laut Asseco weniger als 20 Prozent auseinander. Im tatsächlichen Versuch war eines jedoch pro Foto ungefähr sechsmal teurer und neunmal langsamer. Als Ursache nennt das Unternehmen zusätzliche Reasoning-Tokens – also Rechen- und Ausgabeschritte, die während der Verarbeitung anfallen und mitbezahlt werden.
Die Werkzeuge verursachen zusätzliche Kosten. Der vollständige Agent mit Produktdetektor und Lupe kostete pro Foto ungefähr das Sechsfache der Variante ohne Werkzeuge und benötigte etwa viermal so lange. In diese Rechnung floss bereits das optimierte Bildformat ein.
Wie stark sich die Bildverarbeitung auswirkt, zeigte ein weiterer Schritt. Nachdem Bildausschnitte nicht mehr als Text in der Anfrage codiert, sondern als native Bilder verarbeitet wurden, sanken die Kosten pro Foto laut Asseco auf etwa ein Viertel – ohne im Versuch festgestellten Qualitätsverlust.
Was wie eine technische Fußnote wirkt, entscheidet bei großen Bildmengen über die Wirtschaftlichkeit.
Bei 20 Bildern spielt ein kleiner Preisunterschied kaum eine Rolle. In einem von Asseco skizzierten Szenario für den Produktivbetrieb mit zehntausenden Geschäften, mehreren Bildern pro Filialbesuch und monatlichen Wiederholungen kann sich dagegen selbst ein unscheinbarer Betrag je Analyse rasch zu einer relevanten Kostenposition summieren.
KI im Supermarkt muss deshalb nicht nur intelligent sein. Sie muss sich auch rechnen.
Vantage ist ein Versuch, noch kein Produkt
Trotz der genannten Zahlen bleibt eine Einschränkung entscheidend: Vantage ist derzeit kein fertiges Produkt.
Asseco bezeichnet das Projekt ausdrücklich als internen Proof of Concept. Das System wird noch von keinem Kunden eingesetzt. Den vollständigen Ablauf vom Foto bis zur Entscheidung hat das Unternehmen bislang mit Daten von drei Herstellern aus den Bereichen alkoholfreie Getränke, Spirituosen und Dessertpulver getestet.
Ob sich die Ergebnisse gleichermaßen auf Konservendosen, Tiefkühlprodukte, Obstkisten, Kosmetikartikel oder völlig andere Warengruppen übertragen lassen, ist offen.
Technisch unterscheidet sich Vantage ebenfalls von Assecos bereits angebotener Bilderkennung. Retail Image Recognition arbeitet mit Modellen, die zuvor anhand zahlreicher Aufnahmen für bestimmte Produkte trainiert wurden und anschließend auf dem Gerät eines Außendienstmitarbeiters laufen können. Vantage verwendet dagegen allgemeine Modelle ohne gesondertes Training für jede einzelne Marke, gibt ihnen Werkzeuge und lässt sie schrittweise vorgehen.
Gerade dieser produktübergreifende Ansatz macht das Experiment interessant.
Hier wird keine Zukunft präsentiert, in der schon morgen früh sämtliche Supermarktregale Europas von autonomen KI-Agenten überwacht werden. Zu sehen ist vielmehr eine Technologie mitten in der Erprobung: Sie erkennt bereits viel, aber nicht alles. Werkzeuge schärfen ihren Blick, doch ihre eigene Sicherheit taugt noch nicht als zuverlässige Kontrolle. Mehr Genauigkeit wiederum verlangt zusätzliche Rechenleistung.
Bevor aus einem vielversprechenden Versuch ein massentaugliches System wird, sind also noch zahlreiche Fragen zu beantworten.
Das mag weniger spektakulär sein als manche vollmundige Vision eines vollständig automatisierten KI-Supermarkts. Dafür liegt es wahrscheinlich näher an der Zukunft, die tatsächlich entsteht.
KI auf der Agenda einer Branchenkonferenz
Dass solche Versuche in die aktuelle Branchendiskussion passen, zeigt eine Momentaufnahme vom US-amerikanischen GroceryNEXT-Treffen.
Als die Teilnehmer am ersten Konferenztag, dem 24. August 2026, nach ihren wichtigsten Schwerpunkten für das kommende Jahr gefragt wurden, waren „AI and automation“ sowie „loyalty and personalization“ die beiden häufigsten Antworten. Bei der Frage nach ihren größten Sorgen nannten sie unter anderem Amazon, den Wettbewerb und die Kundenzufriedenheit.
Die Befragung ist keine repräsentative Branchenstudie. Sie macht jedoch sichtbar, welche Themen bei den anwesenden Lebensmittelhändlern und Technologieanbietern besonders präsent waren. Recherchequelle: supermarketnews.com
KI hält zunehmend Einzug in die internen Abläufe des Lebensmittelhandels. Dabei muss sie weder mit Kunden sprechen noch Einkaufslisten schreiben, Rezepte erfinden oder Roboter durch die Obstabteilung schicken.
Manchmal besteht ihre Aufgabe lediglich darin, sehr genau auf ein Regal zu schauen.
Hinter diesem Blick steckt allerdings einiges: Bilderkennung, Produktdaten, Kostenoptimierung, Entscheidungslogik, Fehlerkontrolle – und die Frage, wann ein Mensch noch einmal nachsehen sollte.
Die stille KI zwischen Puddingpulver und Whisky
Gerade in dieser Unauffälligkeit zeigt sich eine besonders interessante Seite der künstlichen Intelligenz im Supermarkt.
Am stärksten fallen jene KI-Anwendungen auf, die mit uns reden. Chatbots begrüßen Kunden, Assistenten schlagen Rezepte vor, digitale Einkaufshelfer suchen Produkte. Wirtschaftlich bedeutsamere Systeme könnten dagegen beinahe unsichtbar bleiben.
Eine Kamera nimmt das Regal auf, ein Modell betrachtet das Bild. Erkennt der Agent nicht genug, greift er zur digitalen Lupe und prüft den Ausschnitt erneut.
Dann fällt die Entscheidung: Produkt vorhanden oder nicht, falsche Variante, zu wenige Facings oder ein nicht vollständig bestücktes Regal.
Aus tausenden solcher unscheinbaren Antworten kann nach und nach ein präzises digitales Abbild dessen entstehen, was in den Märkten tatsächlich geschieht.
Der Supermarkt der Zukunft muss deshalb gar nicht aussehen wie Science-Fiction. Vielleicht stehen dort noch immer dieselben Regale, dieselben Einkaufswagen und dieselben Packungen Puddingpulver.
Nur eines hat sich verändert:
Das Regal wird nicht mehr lediglich eingeräumt.
Es wird gelesen.
Weiterführende Informationen
Quellenhinweis: Einzelne Fakten, Einschätzungen und Prognosen dieses Beitrags stützen sich auf Veröffentlichungen der nachfolgend genannten Unternehmen und Institutionen. Die Links dienen zugleich der weiterführenden Information.
Asseco Platform Lab – Wir haben eine KI für das Regal-Audit gebaut. Und wir veröffentlichen die Kosten.
Die Originalquelle dokumentiert den Vantage-Test und den Genauigkeitsanstieg von 75 auf 96 Prozent durch Produktdetektor und digitale Lupe.
https://assecoplatform.com/de/2026/08/24/regalerkennung-ki-agenten-kosten/
OpenAI – Warum Sprachmodelle halluzinieren
Der Forschungsbeitrag erklärt, warum Modelle selbstbewusst falsche Antworten geben und weshalb Unsicherheit sowie Enthaltung bei der Qualitätsbewertung berücksichtigt werden müssen.
https://openai.com/de-DE/index/why-language-models-hallucinate/
Anthropic – Vision
Die technische Dokumentation erläutert, wie Bildauflösung, visuelle Tokens und wiederholt übertragene Bilddaten die Kosten und Latenz agentischer Bildanalysen beeinflussen.
https://platform.claude.com/docs/de/build-with-claude/vision



