Ein Lied beginnt mit einem Schlagzeugpart, den nie ein Mensch eingespielt hat. Darüber liegt eine Basslinie, die auf einem echten Instrument gespielt wurde. Die Stimme stammt von einer Sängerin, die Gitarren hingegen wurden mithilfe künstlicher Intelligenz erzeugt. Anschließend hat ein Mensch alles neu arrangiert, gemischt und gemastert.
Ist das nun KI-Musik?
Diese scheinbar einfache Frage lässt sich immer schwerer eindeutig mit Ja oder Nein beantworten. Einen bemerkenswerten Anlass, sich damit zu beschäftigen, liefert eine am 7. August 2026 veröffentlichte Forschungsarbeit mit dem Titel „How Much AI Is in This Track?“. Statt Musik lediglich als „menschlich“ oder „KI-generiert“ einzuordnen, untersuchen die Wissenschaftler, ob sich der Anteil künstlich erzeugter Bestandteile in einem hybriden Musikstück quantitativ bestimmen lässt.
Das mag zunächst wie ein technisches Detail klingen. Tatsächlich berührt es eine der wichtigsten Fragen der kommenden Jahre: Was bedeutet „KI-generiert“ überhaupt noch, wenn Mensch und Maschine gemeinsam an einem Stück arbeiten?
Zwischen menschlicher Komposition und KI-Song
In der öffentlichen Diskussion gibt es häufig zwei Schubladen. In der einen liegt der von Menschen komponierte Song, in der anderen das vollständig von einer KI erzeugte Stück.
Doch der Bereich dazwischen ist erheblich größer.
Ein Produzent kann ein Schlagzeug generieren lassen, danach einen echten Bass einspielen und eine Sängerin aufnehmen. Ein anderer setzt KI lediglich für die Hintergrundchöre ein. Vielleicht stammt die Melodie von einem Menschen, während ein Modell daraus verschiedene Arrangements entwickelt. Bei einer dritten Produktion wird zunächst ein kompletter KI-Song erzeugt, dessen Bestandteile anschließend fast vollständig ersetzt werden.
Jeder dieser Titel enthält künstlich erzeugte Bestandteile. Trotzdem wäre es irreführend, sie alle unterschiedslos als „KI-Musik“ zu bezeichnen.
Genau hier setzt die aktuelle Forschung an. Die am 7. August veröffentlichte Arbeit versteht KI-Nutzung nicht als binären Schalter, sondern als Kontinuum. Die Forscher erzeugten Mischungen aus menschlich eingespielten und KI-generierten Einzelspuren, sogenannten Stems, und untersuchten, ob ein Modell abschätzen kann, wie groß der KI-Anteil am gesamten Stück ist.
Aus Schwarz und Weiß wird damit plötzlich eine Grauskala.
Wie Einzelspuren hybride Produktionen ermöglichen
Beim Hören erscheint Musik als Einheit. Technisch gesehen besteht sie jedoch aus einzelnen Schichten.
Schlagzeug, Bass, Gesang, Gitarren, Synthesizer und andere Elemente liegen bei der Produktion häufig auf getrennten Spuren. In modernen Produktionsumgebungen können diese Bestandteile unabhängig voneinander erzeugt, bearbeitet und ersetzt werden.
Genau deshalb ist hybride Musik so naheliegend.
Ein Produzent muss sich nicht entscheiden, ob er entweder alles selbst oder alles von einer KI erstellen lässt. Er kann künstliche Intelligenz genau dort einsetzen, wo sie ihm nützt.
Vielleicht fehlen echte Streicher. Dann erzeugt ein Modell eine passende Begleitung.
Vielleicht funktioniert die vorhandene Basslinie nicht. Die KI liefert zehn Alternativen.
Vielleicht gibt es bereits einen vollständigen Song, doch das Schlagzeug soll moderner klingen.
Bei einer solchen Arbeitsweise verliert der Begriff „KI-Musik“ seine klare Kontur. Der künstliche Anteil kann fünf Prozent betragen oder neunzig.
Der KI-Anteil als messbare Größe
Die Forscher hinter der neuen Untersuchung schlagen deshalb eine kontinuierliche Größe vor. Ihr Modell soll nicht nur erkennen, ob KI beteiligt war, sondern auch abschätzen, welchen messbaren Anteil künstlich erzeugte Bestandteile am Audiosignal haben. In den kontrollierten Experimenten erzielte dieser Ansatz vielversprechende Ergebnisse, wobei sich die einzelnen Instrumente unterschiedlich gut erkennen ließen.
Besonders interessant ist, dass sich offenbar nicht alle künstlichen Spuren gleich leicht erkennen lassen.
In der Untersuchung wiesen unter anderem Schlagzeug und Gitarren deutlichere maschinell erkennbare Signaturen auf als etwa Gesang und Bass. Solche Unterschiede hängen mit den eingesetzten Verfahren sowie mit charakteristischen Mustern und technischen Artefakten in verschiedenen Frequenzbereichen zusammen.
Für das menschliche Ohr müssen diese Spuren deshalb keineswegs künstlich klingen.
Ein Hörer kann eine Aufnahme für vollkommen überzeugend halten, während ein Analysemodell darin winzige Muster entdeckt, die für das verwendete Generierungsverfahren typisch sind.
Warum Detektoren an ihre Grenzen stoßen
Doch genau darin liegt ein Problem.
KI-Systeme verändern sich ständig. Ein Detektor kann heute die charakteristischen Spuren eines bestimmten Generators erkennen und morgen an einem neuen Modell scheitern.
Eine weitere Untersuchung, die ebenfalls am 7. August veröffentlicht wurde und sich mit der Erkennung von KI-Musik in tatsächlich ausgestrahltem Fernsehmaterial befasst, macht diese Schwierigkeit besonders deutlich: Detektoren, die unter sauberen Bedingungen hervorragend funktionierten, verloren unter realen Sendebedingungen erheblich an Zuverlässigkeit. Hintergrundgeräusche, Kompression und die zahlreichen Verarbeitungsschritte und Überlagerungen einer echten Ausstrahlung erschwerten die Unterscheidung deutlich.
Die Maschine hinterlässt Spuren. Doch die Welt verwischt sie.
Was eine Prozentangabe wirklich aussagt
Die Vorstellung wirkt zunächst ungewöhnlich.
„Dieser Titel enthält 37 Prozent KI.“
Doch eine solche Information könnte eines Tages sinnvoller sein als die pauschale Kennzeichnung „KI-generiert“.
Eine solche Angabe würde sichtbar machen, dass moderne kreative Prozesse häufig hybrid sind.
Allerdings wäre eine Prozentangabe keineswegs so objektiv, wie sie auf den ersten Blick wirkt. Was genau soll gemessen werden? Die Dauer künstlich erzeugter Audiospuren? Ihre Lautstärke? Ihr kreativer Einfluss?
Eine einzige KI-generierte Melodie kann das prägende Element eines ganzen Songs sein, obwohl sie nur einen kleinen Teil des Audiosignals ausmacht. Umgekehrt könnte ein künstlich erzeugter Hintergrundteppich fast das gesamte Stück hindurch laufen, ohne musikalisch besonders wichtig zu sein.
Technischer Anteil und schöpferische Bedeutung sind nicht dasselbe.
Deshalb dürfte für echte Transparenz auf lange Sicht mehr nötig sein als eine einzelne Zahl.
Aussagekräftiger wäre eine Beschreibung des Entstehungsprozesses: Gesang menschlich aufgenommen, Instrumentalspuren teilweise KI-generiert, Arrangement menschlich überarbeitet, Mastering von einem Menschen vorgenommen.
So könnte ein Hörer nachvollziehen, wie ein Werk entstanden ist, ohne kreative Arbeit in mathematische Prozentwerte zu pressen.
Die menschliche Entscheidung bleibt entscheidend
Die spannendste Erkenntnis dieser Entwicklung liegt deshalb nicht in einem neuen Detektor. Sie liegt in der Auflösung einer alten Grenze.
Fotografen bearbeiten digitale Bilder. Musiker verwenden Softwareinstrumente. Produzenten korrigieren Tonhöhen, verschieben Rhythmen und erzeugen Klänge, die kein akustisches Instrument jemals hervorbringen könnte.
Generative KI erweitert diesen Werkzeugkasten ein weiteres Mal.
Die eigentliche Frage könnte deshalb schon bald nicht mehr lauten: „Hat eine KI diesen Song gemacht?“
Sondern: „Welche Entscheidungen hat der Mensch getroffen?“
Hat er eine Idee entwickelt? Hat er Möglichkeiten ausgewählt, verworfen und verändert? Einzelne Passagen neu aufgenommen? Hat er aus hundert Möglichkeiten genau jene Kombination geschaffen, die etwas ausdrückt?
Maschinen können Töne erzeugen. Sie können Rhythmen hervorbringen und Stimmen synthetisieren.
Doch ein Musikstück erhält seine Bedeutung nicht durch die Anzahl seiner künstlich erzeugten Sekunden. Es erhält sie in dem Moment, in dem jemand entscheidet, warum genau dieser Klang bleiben soll.
Vielleicht wird die Musik der kommenden Jahre deshalb immer häufiger weder eindeutig menschlich noch eindeutig künstlich sein.
Sie wird dazwischen entstehen.
In jenem schmalen Raum, in dem ein Algorithmus Möglichkeiten erzeugt und ein Mensch entscheidet, welche davon zu Musik werden.
Weiterführende Informationen
Quellenhinweis: Einzelne Fakten, Einschätzungen und Prognosen dieses Beitrags stützen sich auf Veröffentlichungen der nachfolgend genannten Unternehmen und Institutionen. Die Links dienen zugleich der weiterführenden Information.
arXiv – How Much AI Is in This Track? Quantifying the Proportion of AI-Generated Stems in Hybrid Music Mixtures
Die Originalveröffentlichung erläutert Versuchsaufbau, Messgröße und Grenzen der quantitativen Bestimmung KI-rekonstruierter Einzelspuren.
https://arxiv.org/abs/2608.07285
arXiv – Assessing AI-generated music detection in real-world broadcast monitoring
Die Studie vertieft anhand eines 40-stündigen Fernsehdatensatzes, weshalb KI-Musikdetektoren unter realen Sendebedingungen deutlich an Zuverlässigkeit verlieren.
https://arxiv.org/abs/2608.07359
IFPI – Music community introduces new labelling program to distinguish generative AI in sound recordings
Die Brancheninitiative zeigt, wie Aufnahmen künftig praktisch als „AI-Generated“ oder „AI-Assisted“ gekennzeichnet werden könnten.
https://www.ifpi.org/music-community-introduces-new-labelling-program-to-distinguish-generative-ai-in-sound-recordings/



