Start / Magazin / KI, Automatisierung & Reporting

Creative Diversity Score: Was Metas neue Spalte misst

Titelbild: Was der Creative Diversity Score wirklich misst. Fünf Iterationen einer Kaffee-Anzeige mit anderer Farbe, Überschrift, Ausschnitt und Format, alle mit einer Ähnlichkeit von 0,91, 0,98, 0,96, 0,95 zum Original und damit ein Motiv, daneben die Stufen Niedrig, Mittel und Hoch der Spalte Creative diversity

Alles auf einen Blick

  • Der Creative Diversity Score ist eine Spalte im Werbeanzeigenmanager. Sie bewertet jede Anzeigengruppe mit Niedrig, Mittel oder Hoch. Meta kennzeichnet sie als Schätzwert und als „in Entwicklung“.
  • Laut Metas Hilfeseite vergleicht der Score nur die Bilder und die Vorschaubilder der Videos in einer Anzeigengruppe miteinander. Texte, Hooks, Botschaften und das Format als solches nennt Meta nicht.
  • Dahinter steht eine Regel, die Meta im Dezember 2025 öffentlich gemacht hat: Anzeigen, die sich zu ähnlich sehen, behandelt das System als Varianten desselben Creatives. Was es über eine lernt, gilt für alle.
  • Im eigenen Test zählten fünf typische Iterationen einer Anzeige als ein einziges Motiv: andere Farbe, andere Überschrift, anderer Ausschnitt, anderes Format. Drei Konzepte in je zwei Formaten ergaben drei Motive, nicht sechs.
  • Meine Einschätzung: Der Score ist ein nützliches Warnlicht, aber kein Ziel. Er spricht dafür, Tests eher gebündelt über ein gemeinsames Budget laufen zu lassen, und er macht KI-Motive zum wichtigsten Hebel für echte Vielfalt.
Inhaltsverzeichnis11 Abschnitte
  1. Was Meta neu im Werbeanzeigenmanager anzeigt
  2. Was der Score wirklich misst
  3. Warum es den Score gibt: Andromeda und die Gruppierung ähnlicher Anzeigen
  4. Was Praktiker auf LinkedIn, X und Reddit berichten
  5. Mein Test: 68 Anzeigenbilder, jedes mit jedem verglichen
  6. Vielfalt-Check: Prüf deine eigenen Anzeigen
  7. Meine Einschätzung
  8. So bekommst du echte Vielfalt in deine Anzeigengruppen
  9. Häufige Fragen
  10. Fazit
  11. Quellen

Seit August 2026 bewertet Meta im Werbeanzeigenmanager, wie abwechslungsreich die Anzeigen einer Anzeigengruppe sind. Die neue Spalte heißt „Creative diversity“, im deutschen Sprachraum hat sich „Creative Diversity Score“ eingebürgert, und sie kennt drei Stufen: Niedrig, Mittel, Hoch. In Deutschland ist sie gerade erst in den ersten Werbekonten aufgetaucht. Florian Litterst von der Agentur adsventure hat sie am 28. September auf LinkedIn vorgestellt, seitdem wird diskutiert, was der Score eigentlich misst und was er für Tests und Budgets bedeutet.

Ich habe dafür Metas eigene Texte gelesen, die Diskussion auf LinkedIn, X und Reddit ausgewertet und einen eigenen Test gemacht: 68 Anzeigenbilder aus meinem Labor, jedes mit jedem verglichen, mit einem kleinen Bildmodell. Dasselbe Modell steckt im Vielfalt-Check weiter unten, mit dem du deine eigenen Anzeigen prüfen kannst, ohne sie irgendwo hochzuladen. Am Ende steht meine Einschätzung, was Shops jetzt ändern sollten und was nicht.

Erster Beleg der Spalte5. August 2026Screenshot von Akvile DeFazio, in Deutschland ab Ende September
Was Meta vergleichtBilder und Vorschaubilderlaut Hilfeseite keine Texte, keine Hooks, keine Formate
StufenNiedrig, Mittel, Hochje Anzeigengruppe, als „Schätzwert“ und „in Entwicklung“
Fünf Iterationen einer Anzeige1 Motivandere Farbe, Überschrift, Ausschnitt, Format: im Test eine Gruppe
Drei Konzepte in 4:5 und 1:13 von 6ein neues Format ist im Test kein neues Motiv
Lernphase je Anzeigengrupperund 50Ergebnisse in 7 Tagen, laut Meta-Hilfe

Was Meta neu im Werbeanzeigenmanager anzeigt

Die Spalte findest du über „Spalten“ und „Spalten anpassen“. In der englischen Oberfläche reicht die Suche nach „creative“, dann erscheint „Creative diversity“ als einziger Treffer. In der deutschen Oberfläche heißt die Kennzahl laut Max Palma von mega3 „Diversifizierung der Anzeigengestaltung“, die deutsche Hilfeseite spricht von „Abwechslungsreicher Anzeigengestaltung“. Wer sie nicht findet, sucht am besten nach „Anzeigengestaltung“. Der Wert steht auf Ebene der Anzeigengruppe. Fährt man mit der Maus darüber, erklärt Meta ihn so: Die Kennzahl zeige, wie visuell unterschiedlich die Bilder und Videos einer Anzeigengruppe voneinander sind. Darunter der Hinweis, dass es sich um einen Schätzwert handelt, der sich noch in Entwicklung befindet.

Dialog Spalten anpassen im Meta-Werbeanzeigenmanager: Suche nach creative, als einziger Treffer ist Creative diversity angehaktHinweisfenster zur Spalte Creative diversity: Creative diversity indicates how visually varied an ad set's images and videos are from each other. This metric is estimated and in development. Daneben steht in jeder Zeile Low
Links der Weg zur Spalte, rechts Metas Erklärung beim Überfahren. In allen sichtbaren Zeilen steht „Low“. Quelle: Screenshots aus dem Werbeanzeigenmanager von Akvile DeFazio in Search Engine Land, 26.08.2026.

Neu ist die Spalte nur für Deutschland. Der früheste Beleg, den ich gefunden habe, stammt vom 5. August 2026: Akvile DeFazio, Chefin der Agentur AKvertise, zeigte auf X den Hinweis „New creative diversity column“ und ein Fenster mit der Meldung, die Vielfalt ihrer Anzeigengruppe sei niedrig. Ihr Kommentar: Ausgerechnet zwei ihrer größten und vielfältigsten Konten stünden auf „Low“. Meta rät in demselben Fenster, neue Medien hochzuladen, und ergänzt einen Satz, der später wichtig wird: Man könne auch mehrere Seitenverhältnisse desselben Creatives hochladen, Meta zeige sie dann in den passenden Platzierungen.

Beitrag von Akvile DeFazio auf X vom 5. August 2026: Meta added a new Creative Diversity metric. It's supposed to measure how visually diverse your ad set is to help prevent creative fatigue. Oddly, two of our biggest, most diverse accounts say low. Darunter zwei Screenshots: der Hinweis New creative diversity column und das Fenster Your creative diversity is low mit der Empfehlung Upload new mediaBeitrag von Florian Litterst auf LinkedIn: NEU: Meta bewertet jetzt eure Creative Diversity. Der Creative Diversity Score ist in den ersten unserer Ad Accounts aufgetaucht. Diese neue Metrik bewertet, wie vielfältig der Creative-Mix innerhalb eurer Kampagnen ist
Links der erste Beleg aus den USA, rechts der Start der Diskussion in Deutschland. Quellen: X, Akvile DeFazio, 05.08.2026; LinkedIn, Florian Litterst, 28.09.2026. Screenshots vom 30.09.2026.

Die Einführung läuft offenbar in Wellen. Auf Reddit schrieb ein Nutzer am 20. September, die Kennzahl sei bei ihm noch nicht verfügbar. Chris Nothdurfter, seit zwölf Jahren mit Meta-Anzeigen unterwegs, kommentierte bei Florian, er habe sie in seinen Konten noch nicht gesehen. Jannik Bork von CONTXT Advertising schreibt am 30. September, der Score sei „gerade noch im Rollout“.

Seit dem 22. September gibt es außerdem eine zweite Stelle, an der der Score auftaucht. Peter Quadrel zeigte auf X einen Block namens „Creative health“ in der Kampagnenansicht. Er fasst zwei Dinge zusammen: die Ermüdung der Creatives und ihre Vielfalt. Bei Quadrel steht dort „6 of 12 ad sets have low creative diversity“, dazu eine Verteilung: 4 Anzeigengruppen ohne Wert („Unknown“, laut Quadrel meist zu wenig Daten), keine auf Hoch, 2 auf Mittel, 6 auf Niedrig. Darunter zeigt Meta „Top industry imagery“, also Bilder, die in der Branche gerade gut laufen.

Block Creative health in der Kampagnenansicht von Meta: links Creative fatigue mit dem Hinweis, dass keine Anzeigengruppe ermüdete Creatives hat, rechts Creative diversity mit Status Low für 6 von 12 Anzeigengruppen und der Verteilung Unknown 4, High 0, Medium 2, Low 6
Der Block „Creative health“ zählt auf Kampagnenebene, wie viele Anzeigengruppen auf welcher Stufe stehen. Die roten Kreise stammen von Quadrel. Quelle: X, Peter Quadrel, 22.09.2026, Ausschnitt.

Das ist wichtig für eine These, die gerade viel geteilt wird: Der Score werde auch auf Kampagnenebene angezeigt, eine Kampagne könne also hoch stehen, obwohl einzelne Gruppen wenig Vielfalt haben. Was Quadrels Screenshot zeigt, ist eine Zählung der Anzeigengruppen. Ob Meta zusätzlich die Bilder über alle Gruppen einer Kampagne hinweg vergleicht, dokumentiert Meta nicht. Die Hilfeseite spricht von einem Wert für eine „Anzeigengruppen- oder Konto-ID“ und von einem Vergleich der Bilder „in deiner Anzeigengruppe“.

Was der Score wirklich misst

Über kaum eine Frage wird gerade so viel geraten. Florian Litterst vermutet, Meta berücksichtige vor allem technische Unterschiede wie Bild, Video und Partnership Ads. Die US-Agentur Common Thread Collective schreibt, der Score lese fünf Dimensionen, von der Botschaft über den Hook bis zum Sprecher. Ein Beitrag auf Reddit hat diese fünf Dimensionen übernommen, mehrere LinkedIn-Posts auch. Die Antwort steht in Metas eigener Hilfe, und sie ist nüchterner.

Deutsche Hilfeseite von Meta, Abwechslungsreiche Anzeigengestaltung: Diversitätslabel für die Diversitätsbewertung der Anzeigengestaltung für eine bestimmte Anzeigengruppen- oder Konto-ID. Diese Kennzahl ist ein Schätzwert und in Entwicklung. Berechnung: Die Vielfalt der Anzeigengestaltung wird berechnet, indem die Bilder und Video-Miniaturbilder in deiner Anzeigengruppe verglichen und auf Ähnlichkeit geprüft werden. Dies wird in eine Punktzahl umgewandelt und anhand von Schwellenwerten als hoch, mittel oder niedrig eingestuft
Metas Beschreibung der Berechnung. Quelle: Meta Business Help Center, „Abwechslungsreiche Anzeigengestaltung“, Screenshot vom 30.09.2026.

Die Vielfalt wird berechnet, „indem die Bilder und Video-Miniaturbilder in deiner Anzeigengruppe verglichen und auf Ähnlichkeit geprüft werden“. Das Ergebnis wird in eine Punktzahl umgewandelt und über Schwellenwerte als hoch, mittel oder niedrig eingestuft. Mehr steht dort nicht. Daraus folgen drei Dinge, die in vielen Beiträgen untergehen:

  • Text zählt nicht. Primärtext, Überschrift und Beschreibung kommen in der Berechnung nicht vor. Fünf Anzeigen mit demselben Bild und fünf verschiedenen Texten sind für den Score ein Bild.
  • Bei Videos zählt das Vorschaubild. Meta vergleicht die Miniaturbilder. Drei Videos mit verschiedenen Hooks, aber demselben ersten Bild, sehen für diese Rechnung gleich aus.
  • Das Format zählt nur indirekt. Ein Karussell, ein Video und ein Bild werden nicht als Formate gezählt. Sie bringen nur dann Vielfalt, wenn ihre Bilder anders aussehen.

Das erklärt auch die vielen „Niedrig“-Werte, über die Praktiker berichten. Akvile DeFazio beschreibt in Search Engine Land Konten mit Bildern, Videos, verschiedenen Hooks und Personen, UGC, Partnership Ads, beworbenen Beiträgen und Karussells, und trotzdem stand überall „Low“. Wenn in all diesen Anzeigen dasselbe Produkt vor demselben Hintergrund zu sehen ist, ist das aus Sicht eines Bildvergleichs folgerichtig.

Faktencheck: fünf Dimensionen?

Die Liste aus Content-Stil, Botschaft, Hook, Format und Sprecher stammt aus einem Beitrag von Common Thread Collective vom 9. September. Meta selbst nennt nur den Vergleich von Bildern und Vorschaubildern. Derselbe Beitrag nennt den 26. August als Starttag. Das ist das Erscheinungsdatum des Artikels in Search Engine Land, die Spalte war schon Anfang August zu sehen. Wer mit Kunden über den Score spricht, sollte sich an Metas Text halten.

Warum es den Score gibt: Andromeda und die Gruppierung ähnlicher Anzeigen

Der Score ist neu, die Idee dahinter nicht. Im Dezember 2024 stellte Meta Andromeda vor, das System, das bei jedem Aufruf von Facebook oder Instagram aus zig Millionen möglichen Anzeigen ein paar tausend Kandidaten auswählt. Erst danach entscheiden Ranking-Modelle wie GEM, welche Anzeige jemand sieht. Andromeda wurde ausdrücklich dafür gebaut, mit der wachsenden Zahl an Creatives aus KI-Werkzeugen zurechtzukommen. Im April 2025 schrieb Meta dann den Satz, der seitdem in jedem Vortrag zu Meta-Anzeigen fällt: Der Fokus habe sich von Nischen-Targeting zur Diversifizierung der Creatives verschoben, sie sei der beste Hebel, um relevante Zielgruppen zu finden.

Die entscheidende Erklärung kam am 16. Dezember 2025 in einem Beitrag mit dem Titel „Demystifying Creative Diversification“. Meta schreibt dort, das System analysiere Creatives und fasse Anzeigen zusammen, die wichtige visuelle und thematische Merkmale teilen. Anzeigen, die sich ähnlich sehen oder anfühlen, gelten als Varianten desselben Creatives. Was das System über sie lernt und wie es sie ausliefert, wird auf dieser gemeinsamen Ebene geteilt und nicht nur je Anzeige.

Beitrag von Meta vom 16. Dezember 2025, Demystifying Creative Diversification: Our ads system also analyzes creatives and groups together ads that share key visual and thematic attributes. When multiple ads look or feel alike, these are seen as variations of the same creative, meaning learnings and delivery optimizations are shared at the creative level, not just the individual ad level
Metas Erklärung zur Gruppierung ähnlicher Anzeigen. Quelle: Meta for Business, „Demystifying Creative Diversification“, 16.12.2025, Ausschnitt, Screenshot vom 30.09.2026.

Im selben Beitrag grenzt Meta zwei Begriffe ab, die oft verwechselt werden. Creative Fatigue, also Ermüdung, entsteht, wenn dieselbe Zielgruppe dasselbe Bild oder Video zu oft sieht. Die Interaktion sinkt, die Kosten je Ergebnis steigen. Creative Similarity, also Ähnlichkeit, liegt vor, wenn Anzeigenbilder sich visuell zu sehr gleichen, auch wenn es technisch verschiedene Dateien sind. Meta fasst es in einem Satz zusammen: Ermüdung ist Überbelastung, Ähnlichkeit ist fehlende visuelle Vielfalt. Der Score misst das Zweite, der Block „Creative health“ zeigt beides nebeneinander.

Absatz aus Metas Beitrag: Creative fatigue occurs when your target audience is overexposed to the same creative. In contrast, creative similarity refers to when ad images are visually too alike, even if technically different assets. Fatigue is about overexposure, while similarity is about a lack of visual diversity
Ermüdung und Ähnlichkeit sind zwei verschiedene Probleme. Quelle: Meta for Business, 16.12.2025, Ausschnitt.

Auf der deutschen Best-Practice-Seite formuliert Meta die Folge für die Auslieferung noch direkter: Sind Anzeigengestaltungen zu ähnlich, erkennt das System sie möglicherweise nicht als unterschiedlich und liefert sie an dieselben Zielgruppen aus. Das führe zu begrenzter Reichweite und schließlich zum Status „Verminderte Anzeigenwirkung“ oder „Ad Fatigue“ in der Spalte „Auslieferung“.

Deutscher Text von Meta: Wenn Anzeigengestaltungen zu ähnlich sind, erkennt unser System sie möglicherweise nicht als unterschiedlich und liefert sie möglicherweise an dieselben Zielgruppen aus. Diese Überschneidungen führen zu einer begrenzten Reichweite und letztendlich zum Status Verminderte Anzeigenwirkung oder Ad Fatigue
Quelle: Meta for Business, Best Practices „Was zählt als differenzierte Anzeigengestaltung?“, Ausschnitt, Screenshot vom 30.09.2026.

Wie die Kennzahl entstanden ist, lässt sich gut nachzeichnen:

DatumWas passiert istQuelle
02.12.2024Meta stellt Andromeda vor, das Auswahlsystem für Anzeigen, gebaut auch für die Flut an KI-CreativesMeta Engineering
22.04.2025Meta nennt die Diversifizierung der Creatives den besten Hebel, um Zielgruppen zu finden, statt Nischen-TargetingMeta for Business
16.12.2025Meta erklärt, dass ähnliche Anzeigen als Varianten eines Creatives gruppiert werden, und kündigt Tests mit „Creative Insights“ im Werbeanzeigenmanager anMeta for Business
ab Juni 2026Einige Agenturen testen Creative-Kennzahlen in der Insights-SchnittstelleMeta-Sprecherin gegenüber Marketing Brew
05.08.2026Erster öffentlicher Screenshot der Spalte „Creative diversity“X, Akvile DeFazio
26.08.2026Search Engine Land beschreibt die Spalte ausführlichSearch Engine Land
22.09.2026Block „Creative health“ mit Ermüdung und Vielfalt in der KampagnenansichtX, Peter Quadrel
28.09.2026Die Spalte taucht in ersten deutschen Konten aufLinkedIn, Florian Litterst

Interessant ist, was Meta zur Frage sagt, wie genau die Modelle ein einzelnes Creative sehen. Die Sprecherin Alisha Swinteck sagte Ende September dem Branchendienst Marketing Brew, man gehe nicht ins Detail, wie die Ranking-Modelle einzelne Creatives darstellen. Die Empfehlung sei bewusst ergebnisorientiert und nicht auf ein Modell zugeschnitten: diversifizieren, testen, das System optimieren lassen. Olivia Cripps von der Agentur Billion Dollar Boy beschreibt im selben Artikel, was Meta Agenturen erklärt: Zwei Videos derselben Person, eines mit „Text A“ und eines mit „Text B“, gelten als dasselbe Creative.

Was Praktiker auf LinkedIn, X und Reddit berichten

Die Diskussion ist jung, aber die Linien sind schon klar. Fast alle, die die Spalte in echten Konten gesehen haben, berichten von vielen „Niedrig“-Werten. Die Deutungen gehen auseinander.

„Bisher geben wir neuen Anzeigengruppen häufig ein fixes Budget. Damit setzen wir dem System harte Leitplanken: Meta kann das Budget nicht frei zwischen unterschiedlichen Creative-Ansätzen verteilen.“

Florian Litterst, adsventure, leitet daraus die These ab, dass Tests künftig stärker über das Kampagnenbudget laufen. Den Score selbst würde er nicht überbewerten.

LinkedIn, 28.09.2026

„Die Story daneben landet nicht bei High, weil sie ein Video ist. Sondern weil sie etwas anderes zeigt: die Tasche im Alltag statt im Studio.“

Jannik Bork, CONTXT Advertising, an einem schematischen Beispiel: zweimal dieselbe Tasche mit anderer Überschrift gegen dieselbe Tasche im Alltag.

LinkedIn, 30.09.2026

„It's a diagnostic, not a lever.“

Darya Makarova, Beraterin für Meta-Anzeigen: Der Score sei ein Befund, kein Hebel. Er zeige, was das System ohnehin tut, und ändere nichts daran. Eine angekündigte Verbindung zur Auslieferung gebe es nicht.

LinkedIn, 30.09.2026

„Bleibt abzuwarten, wie stark Meta bei isolierten Testing-Ad-Sets abgestraft wird“

Cristian Hief, Freelancer für Suchmaschinenmarketing, in den Kommentaren bei Florian Litterst. Er hält es auch für möglich, dass der Score vorerst eine weiche Kennzahl ohne direkten Einfluss auf die Auktion bleibt.

LinkedIn, 28.09.2026

„Oddly, two of our biggest, most diverse accounts say low“

Akvile DeFazio, AKvertise, am Tag des ersten Screenshots. Ausgerechnet die vielfältigsten Konten stehen auf Niedrig.

X, 05.08.2026

„a low diversity score doesn't automatically mean meta will restrict reach or that ten similar ads literally receive one creative's delivery“

Ein Kommentar in r/FacebookAds warnt davor, aus dem Score mehr herauszulesen, als Meta sagt, und rät, ihn als Befund zu nutzen statt blind auf ihn hinzuarbeiten. Ein anderer nennt ihn schlicht eine Eitelkeitskennzahl.

Reddit, 19.09.2026

Jannik Borks Beispiel ist die beste Veranschaulichung, die ich gefunden habe. Er kennzeichnet sie selbst als schematisch, die Motive sind KI-generiert. Die Logik stimmt aber mit Metas Beschreibung überein: Die Überschrift ändert am Bild nichts, die neue Szene schon.

Grafik von CONTXT Advertising: Gerade im Rollout, der Creative Diversity Score. Zweimal dieselbe braune Tasche vor beigem Hintergrund, einmal mit Die Tasche für jeden Tag, einmal mit Deine Business-Tasche für unterwegs, gemeinsam markiert als Low. Daneben ein Video, in dem eine Frau die Tasche auf der Straße trägt, markiert als High
Neue Überschrift, gleiches Bild: Niedrig. Neue Szene: Hoch. Laut Grafik schematisch, Motive KI-generiert. Quelle: LinkedIn, Jannik Bork und Nicolas Guendling, CONTXT Advertising, 30.09.2026, Ausschnitt.

Auf Reddit ist die Diskussion bisher dünn. Der längste Thread in r/FacebookAds vom 19. September fasst vor allem die US-Artikel zusammen. Hängen bleibt ein praktischer Tipp daraus: Leg die Vorschaubilder einer Anzeigengruppe nebeneinander. Wenn du sie in Daumennagelgröße nicht innerhalb von zwei Sekunden auseinanderhalten kannst, kann es Metas System vermutlich auch nicht.

Mein Test: 68 Anzeigenbilder, jedes mit jedem verglichen

Meta verrät weder Modell noch Schwellenwerte. Was sich aber prüfen lässt: Wie ähnlich sieht ein Bildmodell typische Anzeigenvarianten? Dafür habe ich das Material aus meinem Labor genommen. Dort liegen 30 Static Ads für sechs erfundene Marken, von Nahrungsergänzung bis Buchhaltungssoftware, jede in 4:5 und 1:1. Wie sie mit KI entstanden sind, steht im Beitrag über Static Ads mit KI. Für drei Konzepte gibt es zusätzlich eine Fassung aus einem zweiten KI-Modell. Dazu kommen vier Iterationen der Kaffee-Anzeige „Dein Kaffee ist zu alt.“, wie sie in jedem Werbekonto vorkommen: Hintergrund in einer anderen Farbe, eine neue Überschrift, ein anderer Ausschnitt und die quadratische Fassung.

Original: rote Anzeige mit der Überschrift Dein Kaffee ist zu alt. und einer Kaffeetüte der erfundenen Marke RöstkanteIteration mit blauem statt rotem Hintergrund, sonst gleichIteration mit neuer Überschrift Frisch geröstet schmeckt.Iteration mit engerem Ausschnitt, alles etwas größerQuadratische Fassung derselben Anzeige
Original und vier Iterationen. Ähnlichkeit zum Original im Test: Farbe 0,91, Überschrift 0,98, Ausschnitt 0,96, Quadrat 0,95. Eigene Anzeigen aus dem Labor, Iterationen für den Test erzeugt.

Als Bildmodell dient MobileNetV3-Small, ein kleines, frei verfügbares Netz, das an rund 1,3 Millionen Fotos gelernt hat, Bildinhalte zu erkennen. Es macht aus jedem Bild 576 Merkmale. Wie ähnlich zwei Bilder sind, ergibt sich aus dem Vergleich dieser Merkmale, von 0 für völlig verschieden bis 1 für identisch. Ich habe das Modell in JavaScript nachgebaut und gegen das Original geprüft: Die Abweichung liegt unter 0,00001. Meta nutzt mit Sicherheit ein anderes, größeres Modell. Der Test zeigt also nicht Metas Werte, sondern wie ein Bildmodell grundsätzlich auf solche Varianten reagiert. Zur Kontrolle habe ich dieselben Bilder zusätzlich mit CLIP verglichen, einem deutlich größeren Modell, das Bilder und Texte gemeinsam gelernt hat.

Wie ähnlich sieht das Bildmodell die Labor-Anzeigen? 68 Bilder, jedes mit jedem verglichen. Der Balken zeigt die Spanne je Paar-Typ, der Punkt den Median. Ab 0,86 zählen zwei Bilder im Test als dasselbe Motiv.
Gleiche Anzeige in 4:5 und 1:130 Paare
0,96
Iterationen einer Anzeige10 Paare
0,92
Gleiches Konzept, zwei KI-Modelle3 Paare
0,92
Gleiche Marke, anderes Konzept60 Paare
0,65
Andere Marke, anderes Konzept375 Paare
0,52

Spanne vom kleinsten bis größten WertMedianSchwelle „gleiches Motiv“

Werte als Tabelle
Paar-TypPaareKleinster WertMedianGrößter WertÜber 0,86
Gleiche Anzeige in 4:5 und 1:1300,880,960,9830 von 30
Iterationen einer Anzeige100,880,920,9810 von 10
Gleiches Konzept, zwei KI-Modelle30,880,920,923 von 3
Gleiche Marke, anderes Konzept600,350,650,820 von 60
Andere Marke, anderes Konzept3750,260,520,830 von 375

Test-Anzeigengruppen und unsere Einschätzung

Anzeigengruppe aus dem LaborBilderEigenständige MotiveSehr ähnliche PaareEinschätzung
Eine Anzeige, fünf Iterationen5110 von 10Niedrig
Drei Iterationen plus zwei neue Konzepte533 von 10Mittel
Drei Konzepte, je in 4:5 und 1:1633 von 15Mittel
Drei Konzepte, je von zwei KI-Modellen633 von 15Mittel
Kelvra: fünf Konzepte552 von 10Hoch
Rudelkost: fünf Konzepte551 von 10Hoch
Deichgrau: fünf Konzepte550 von 10Hoch
Röstkante: fünf Konzepte550 von 10Hoch
Solvie: fünf Konzepte550 von 10Hoch
Belegwerk: fünf Konzepte552 von 10Hoch
Sechs Marken, je eine Anzeige660 von 15Hoch

Bildmodell: MobileNetV3-Small (torchvision, auf ImageNet trainiert), im Browser nachgebaut, dieselbe Rechnung wie im Vielfalt-Check weiter unten. „Eigenständige Motive“ = Gruppen, deren Bilder unter 0,86 liegen. „Sehr ähnlich“ = ab 0,78. Die Einschätzung ist unsere eigene Regel, nicht Metas Formel: niedrig bei weniger als 3 Motiven oder weniger als halb so vielen Motiven wie Bildern, hoch ab 4 Motiven, wenn mindestens 80 % der Bilder eigenständig sind und höchstens jedes fünfte Paar sehr ähnlich ist. Eigene Daten, gemessen am 30.09.2026.

Das Ergebnis ist eindeutiger, als ich erwartet hatte. Alle 30 Paare „gleiche Anzeige in 4:5 und 1:1“ und alle 10 Paare der Kaffee-Iterationen liegen über 0,86, der niedrigste Wert bei 0,88. Von den 435 Paaren verschiedener Anzeigen liegt kein einziges darüber, der höchste Wert bei 0,83. Selbst der blaue Hintergrund, der für das Auge den größten Unterschied macht, ändert am Urteil nichts: Für das Modell bleibt es dieselbe Anzeige.

Drei Befunde sind für die Praxis wichtig:

  • Ein neues Format ist kein neues Motiv. Die quadratische Fassung einer Anzeige ist für das Modell fast identisch mit dem Original. Drei Konzepte in je zwei Formaten ergeben 3 Motive aus 6 Bildern. Das passt zu Metas eigenem Hinweis, Seitenverhältnisse als Varianten desselben Creatives hochzuladen.
  • Ein anderes KI-Modell macht kein neues Konzept. Dasselbe Briefing, einmal mit Nano Banana Pro und einmal mit GPT Image umgesetzt, landet bei 0,88 bis 0,92. Wer glaubt, mit mehreren Bildgeneratoren Vielfalt zu schaffen, erzeugt Iterationen.
  • Dasselbe Produkt im Bild rückt Anzeigen zusammen. Die fünf Kelvra-Anzeigen zeigen fünf verschiedene Konzepte, aber in jeder steht dieselbe blaue Dose. Im Schnitt liegen sie bei 0,74, deutlich über dem Median von 0,65 für Konzepte derselben Marke. CLIP sieht das noch strenger: 0,69 im Schnitt, im engsten Paar 0,84, während Anzeigen verschiedener Marken bei 0,39 liegen. Genau diese Art Nähe dürfte hinter vielen „Niedrig“-Werten stecken, obwohl Formate und Texte wechseln.

Wie belastbar ist der Test?

68 Bilder und 2.278 Paare reichen, um die Richtung zu zeigen, und die Trennung war sauber. Sie ersetzen aber nicht Metas Modell. Die Schwelle von 0,86 ist meine eigene, abgeleitet aus genau diesem Material. Metas Schwellen sind nicht veröffentlicht, und die vielen „Niedrig“-Werte in echten Konten sprechen dafür, dass Meta strenger urteilt als mein Test. Wer es genau wissen will, schaut in die Spalte im eigenen Konto.

Vielfalt-Check: Prüf deine eigenen Anzeigen

Den Test kannst du mit deinen eigenen Motiven wiederholen. Nimm die Bilder einer Anzeigengruppe, bei Videos das Vorschaubild, und zieh sie in das Feld. Der Check zeigt, welche Bilder das Modell zu einem Motiv zusammenfasst und wie ähnlich jedes Paar ist. Die drei Beispiele stammen aus dem Test oben.

Vielfalt-Check: Welche deiner Anzeigen zählen als dasselbe Motiv? Zieh 2 bis 12 Anzeigenbilder hinein, bei Videos das Vorschaubild. Ein kleines Bildmodell vergleicht jedes Bild mit jedem und gruppiert, was sich zu ähnlich ist. Alles rechnet in deinem Browser: Die Bilder werden nicht hochgeladen, nicht gespeichert und an niemanden gesendet.

So rechnet der Check: Jedes Bild wird auf 224 × 224 Pixel gebracht und durch MobileNetV3-Small geschickt (torchvision, auf ImageNet trainiert, hier in JavaScript nachgebaut). Heraus kommen 576 Merkmale je Bild, die Ähnlichkeit ist der Kosinus zweier Merkmalsvektoren. Ab 0,86 zählen zwei Bilder als dasselbe Motiv, ab 0,78 als sehr ähnlich. Das sind unsere Schwellen aus dem Test mit den Labor-Anzeigen, nicht Metas Werte. Meta nennt weder Modell noch Schwellen. Der Check sagt dir, was ein Bildmodell für ähnlich hält, und nicht, was Meta anzeigt.

Ein Hinweis zum Lesen: Der Check sieht nur Bilder, keine Zahlen. Er sagt dir, ob deine Anzeigen für ein Bildmodell verschieden genug aussehen. Ob sie verschieden genug wirken, zeigt nur die Auswertung im Werbekonto.

Meine Einschätzung

Ich stehe RYMHART bei Google Ads und Meta Ads beratend zur Seite und baue selbst Anzeigenmotive mit KI. Aus diesem Blickwinkel sehe ich den Score so:

Budget umdenken: Konzepte gehören zusammen

Hier bin ich bei Florian Litterst, und der Test macht das Argument sogar noch schärfer. Der klassische Test sieht so aus: Jedes neue Konzept bekommt eine eigene Anzeigengruppe mit festem Budget, damit man sauber vergleichen kann. Genau dieser Aufbau landet beim Score zwangsläufig auf „Niedrig“, weil Meta je Anzeigengruppe vergleicht und jede Gruppe nur ein Motiv enthält. Florians Beobachtung auf Kampagnenebene ist nach Quadrels Screenshot eine Zählung der Gruppen. Das ändert an seinem Schluss nichts: Wer Konzepte in getrennte Gruppen sperrt, gibt dem System weniger Auswahl, als es haben könnte.

Dazu kommt die Lernphase. Laut Metas Hilfe verlässt eine Anzeigengruppe sie in der Regel nach etwa 50 Ergebnissen in den sieben Tagen nach der letzten größeren Änderung. Meta rät ausdrücklich, nicht zu viele Anzeigen und Anzeigengruppen anzulegen und ähnliche Anzeigengruppen zusammenzulegen, damit sich das Gelernte bündelt. Im Beitrag vom Dezember 2025 empfiehlt Meta dasselbe, und das Advantage+ Kampagnenbudget ist genau dafür gebaut: Es verteilt ein gemeinsames Budget in Echtzeit auf die Gruppen mit den besten Chancen. Für kleine Budgets ist das keine Stilfrage. Mit 50 Euro am Tag und 20 Euro je Ergebnis kommen drei getrennte Testgruppen auf knapp sechs Ergebnisse pro Woche und Gruppe. Das lernt nie aus. Der Rechner zeigt das für deine Zahlen.

Test-Rechner: Anzeigengruppe je Konzept oder alles gebündelt? Trag dein Testbudget, deine Kosten je Ergebnis und die Zahl neuer Konzepte pro Woche ein. Der Rechner zeigt, ob die Anzeigengruppen die Lernphase schaffen, wie oft rein rechnerisch ein Gewinner dabei ist und was die Konzepte kosten. Es wird nichts gesendet oder gespeichert.

Rechenweg: Ergebnisse pro Woche = Budget × 7 ÷ Kosten je Ergebnis. Getrennt bekommt jede Anzeigengruppe einen gleichen Teil des Budgets, Meta nennt „etwa 50 Ergebnisse“ in 7 Tagen für das Ende der Lernphase. Trefferquote je neuem Creative nach Motion Creative Benchmarks 2026 (578.750 Meta-Anzeigen, Zeitraum September 2025 bis Januar 2026): 4,0 % unter 10.000 $ Monatsbudget, 6,4 % bis 50.000 $, 8,1 % bis 200.000 $, 8,6 % bis 1 Mio. $, darüber 8,8 %. „Gewinner“ heißt bei Motion: Das Creative bekam mindestens das Zehnfache des mittleren Budgets im Konto, nicht zwingend den besten ROAS. Chance auf mindestens einen Gewinner im Monat = 1 − (1 − Trefferquote) hoch Zahl der Konzepte. Das gilt nur, wenn die Konzepte wirklich verschieden sind, Iterationen zählen als ein Versuch. Kosten je Konzept in den Beispielen: 89 € (eine Stunde Freelance-Design, Durchschnitt laut Freelancer-Kompass 2026), 15 € (rund zehn Minuten eigene Zeit mit KI, Bildkosten im Cent-Bereich, siehe unseren Static-Ads-Test).

Getrennte Gruppen haben weiter ihren Platz, etwa wenn ein Test einen festen Anteil des Budgets braucht oder wenn du bewusst ein neues Produkt gegen den Rest abschirmen willst. Als Standard für Creative-Tests halte ich sie aber nicht mehr für sinnvoll.

KI-Creatives sind der Hebel, aber für Motive, nicht für Varianten

Wenn Vielfalt heißt, dass sich Bilder wirklich unterscheiden, wird die Produktion zum Engpass. Ein Agenturinhaber beschreibt ihn auf Reddit: Seine drei Kreativen schaffen acht bis zehn Videos pro Kunde und Monat, die Kunden wollen dreißig. Motions Benchmark mit 578.750 Meta-Anzeigen zeigt, warum Menge zählt: Nur etwa jedes zwanzigste neue Creative wird ein Gewinner, bei kleinen Konten mit weniger als 10.000 Dollar Monatsbudget sind es 4 %. Diese Konten starten im Schnitt 2,8 neue Creatives pro Woche, die größten 18,8.

Hier ist KI für mich der Hebel. Die 60 Bilder meiner Labor-Anzeigen haben 2,79 Euro an Bildkosten und 52 Minuten Arbeit gekostet, das Briefing nicht eingerechnet. Eine einfache Grafik von einer Agentur kostet laut dem Vermittler AgenturFinder 200 bis 1.000 Euro. Im Beitrag über Magnific Spaces zeige ich, wie aus einem Handyfoto ein Packshot und daraus mehrere Anzeigen werden. Meta selbst meldet für Kampagnen mit seiner Bildgenerierung eine um 11 % höhere Klickrate und eine um 7,6 % höhere Conversion-Rate. Das sind Metas eigene Zahlen, ohne offengelegte Methode.

Der Test zeigt aber auch die Falle: Dasselbe Konzept aus zwei KI-Modellen ist für das Bildmodell ein Motiv, Farbwechsel und neue Überschriften ebenso. KI lohnt sich also dort, wo sie neue Szenen, Personen, Umgebungen und Blickwinkel liefert: das Produkt im Alltag statt im Studio, ein anderes Publikum, ein anderes Problem. Wer mit KI nur zwanzig Varianten derselben Idee erzeugt, kauft sich für den Score und für Andromeda genau eine Anzeige.

Nützlich, aber kein KPI

Der Score ist ein gutes Warnlicht. Er macht sichtbar, was Meta seit Dezember 2025 beschreibt, und er bringt Kreation und Mediaplanung an einen Tisch. Als Ziel taugt er nicht. Meta selbst nennt ihn einen Schätzwert in Entwicklung, eine Verbindung zu Auslieferung oder Kosten ist nicht dokumentiert, und die Meta-Sprecherin rät ausdrücklich davon ab, auf einzelne Modelle hin zu optimieren.

Google hat mit der Anzeigeneffektivität bei Suchanzeigen eine ganz ähnliche Bewertung, von „Schlecht“ bis „Sehr gut“, die ebenfalls vor allem die Vielfalt der Bausteine misst. Google schreibt dazu in der eigenen Hilfe unter „Häufiges Missverständnis“: Die Anzeigeneffektivität sei lediglich ein Feedbacktool, sie werde weder für den Anzeigenrang noch für den Qualitätsfaktor herangezogen und habe keinen Einfluss auf den Zuschlag in der Auktion. Von Meta gibt es eine solche Klarstellung noch nicht. Bis dahin behandle ich den Creative Diversity Score genauso wie die Anzeigeneffektivität: als Hinweis beim Aufbau, nicht als Erfolgsmaß. Entschieden wird nach Kosten je Kauf und Rendite, gemessen mit sauberem Tracking.

Vorsicht bei der 56-%-Zahl

In vielen Beiträgen zum Score steht, die Kreation entscheide über 56 % des Auktionsergebnisses. Die Zahl stammt aus einer Meta-Studie von Nielsen Catalina Solutions (heute NCSolutions) aus dem Jahr 2017 über knapp 500 Kampagnen von Markenartiklern aus 2016 und Anfang 2017. Gemessen wurde, welcher Anteil des zusätzlichen Umsatzes auf die Kreation zurückgeht: bei digitalen Kampagnen 56 %, über alle Kanäle knapp die Hälfte. Die Neuauflage von 2023 kommt auf 49 %. Das belegt, wie wichtig Kreation ist. Mit Metas Auktion hat die Zahl nichts zu tun.

So bekommst du echte Vielfalt in deine Anzeigengruppen

  1. Spalte einblenden und neben die Kosten stellen. „Spalten anpassen“, nach „Anzeigengestaltung“ oder „creative“ suchen, die Spalte neben Kosten je Ergebnis und ROAS legen. So siehst du nach ein paar Wochen, ob „Niedrig“ in deinem Konto mit schlechteren Zahlen zusammenfällt.
  2. Vorschaubilder nebeneinanderlegen. Was du in Daumennagelgröße nicht unterscheiden kannst, zählt vermutlich als ein Motiv. Den Vergleich macht der Vielfalt-Check oben für dich.
  3. Motive statt Varianten produzieren. Neue Szene, neue Person, neue Umgebung, neuer Blickwinkel. Überschrift, Farbe, Ausschnitt und Format sind Iterationen.
  4. Iterationen in die Anzeige, nicht daneben. Textvarianten und Seitenverhältnisse gehören in dieselbe Anzeige. Meta spielt sie dann in den passenden Platzierungen aus, statt sie als Konkurrenz zu zählen.
  5. Bei Videos das Vorschaubild bewusst wählen. Meta vergleicht die Miniaturbilder. Zeigen deine Videos wirklich Verschiedenes, sollte das auch das erste Bild zeigen.
  6. Konzepte bündeln. Neue Konzepte gemeinsam in eine Testgruppe geben oder über ein Kampagnenbudget laufen lassen, statt jedes in eine eigene Gruppe mit festem Budget zu sperren.
  7. Nicht auf „Hoch“ hinarbeiten. Wer Bilder nur verändert, damit der Wert steigt, gewinnt nichts. Neue Motive lohnen sich, wenn sie neue Käufer ansprechen.

Tipp: Konzepte aus Kundenstimmen ableiten

Die besten neuen Motive kommen selten aus dem Bildgenerator, sondern aus den Bewertungen deines Shops. Schreib die drei oder vier Typen von Käufern auf, die dort auftauchen, und bau für jeden eine eigene Szene. Der Creative Strategist Reynold Millet nennt auf LinkedIn als Beispiele die Person, die verschenkt, den Skeptiker, der schon alles ausprobiert hat, und die Stammkundin, die vor Weihnachten einen Grund zum Nachkaufen braucht. Das ergibt Vielfalt, die der Score sieht und die auch Menschen anspricht. Wenn du dabei Unterstützung willst, schau dir an, wie ich bei Google und Meta Ads helfe.

Häufige Fragen

Was ist der Creative Diversity Score?

Eine Spalte im Meta-Werbeanzeigenmanager, die jede Anzeigengruppe als Niedrig, Mittel oder Hoch einstuft. Sie zeigt, wie unterschiedlich die Bilder und Videos einer Gruppe aussehen. Meta nennt sie „Creative diversity“, in der deutschen Oberfläche „Diversifizierung der Anzeigengestaltung“, in der deutschen Hilfe „Abwechslungsreiche Anzeigengestaltung“, und kennzeichnet sie als Schätzwert in Entwicklung.

Wo finde ich die Spalte?

Im Werbeanzeigenmanager unter „Spalten“ und „Spalten anpassen“. Such nach „creative“ oder „Anzeigengestaltung“. Spätestens seit dem 22. September zeigt Meta die Werte zusätzlich im Block „Creative health“ in der Kampagnenansicht. Die Einführung läuft schrittweise, in manchen Konten fehlt die Spalte noch.

Warum steht bei mir „Niedrig“, obwohl ich Bilder, Videos und Karussells nutze?

Weil Meta die Bilder und Vorschaubilder vergleicht und nicht die Formate. Zeigen alle Anzeigen dasselbe Produkt vor ähnlichem Hintergrund, sehen sie für den Vergleich gleich aus, egal ob Bild, Video oder Karussell. Im eigenen Test rückte schon dasselbe Produkt im Bild fünf verschiedene Konzepte deutlich zusammen.

Beeinflusst der Score die Auslieferung oder die Kosten?

Das ist nicht dokumentiert. Meta beschreibt den Score als Hilfe, um mehr abwechslungsreiche Bilder hinzuzufügen. Unabhängig davon gilt Metas Aussage vom Dezember 2025: Ähnliche Anzeigen werden als Varianten eines Creatives gruppiert und teilen, was das System lernt. Der Score macht diese Gruppierung sichtbar, er ist nicht ihre Ursache.

Zählen Überschrift und Anzeigentext mit?

Laut Metas Hilfeseite nicht. Die Berechnung vergleicht nur Bilder und Video-Miniaturbilder. Für die Gruppierung im Auslieferungssystem nennt Meta allerdings „visuelle und thematische“ Merkmale. Verschiedene Texte können dort also eine Rolle spielen, nur nicht für diese Spalte.

Wie bewertet Meta Videos?

Über das Vorschaubild. Drei Videos mit verschiedenen Hooks, aber gleichem ersten Bild, sehen für den Score gleich aus. Wähl für jedes Video ein Vorschaubild, das zeigt, worin es sich unterscheidet.

Soll ich jetzt mehr Anzeigen hochladen?

Nicht mehr, sondern verschiedenere. Zwanzig Varianten desselben Motivs zählen wie eine Anzeige und verteilen nur das Budget. Besser sind wenige Konzepte mit wirklich anderen Bildern, gebündelt in einer Testgruppe.

Ist der Vielfalt-Check dasselbe wie Metas Score?

Nein. Er nutzt ein kleines, frei verfügbares Bildmodell und unsere eigenen Schwellen aus dem Test. Er zeigt, welche Bilder sich für ein Bildmodell zu ähnlich sind. Metas Modell und Schwellen sind nicht veröffentlicht, und Meta urteilt vermutlich strenger.

Fazit

Der Creative Diversity Score misst etwas sehr Einfaches: ob sich die Bilder einer Anzeigengruppe ähnlich sehen. Dahinter steht aber eine Regel, die für jedes Werbekonto zählt: Was sich zu ähnlich sieht, behandelt Meta als eine Anzeige. Der eigene Test zeigt, wie weit das reicht. Farbe, Überschrift, Ausschnitt, Format und sogar ein anderes KI-Modell machen aus einer Idee keine zweite. Für Shops heißt das: Tests bündeln, statt Konzepte in eigene Gruppen zu sperren, KI für neue Motive nutzen statt für Varianten und den Score als Warnlicht lesen, nicht als Ziel.

Beim Finden und Sortieren der Quellen und beim Programmieren des Vielfalt-Checks hat mir KI geholfen. Das Testmaterial stammt aus meinem Labor, die Zahlen im Text werden beim Bauen dieser Seite automatisch gegen die Messdaten geprüft, und die Einschätzung ist meine. Sobald Meta mehr zur Berechnung veröffentlicht oder die Spalte in mehr deutschen Konten auftaucht, aktualisiere ich den Beitrag.

Quellen

Geschrieben von

SEO, GEO und KI-Automatisierung für Online-Shops. Ich teste, worüber ich schreibe, zuerst auf eigenen Seiten und in Kundenprojekten wie RYMHART und Opal-Schmiede.

Das für deinen Shop umsetzen?

Drei Fragen, sofort eine Einschätzung, danach drei konkrete Punkte von mir persönlich. Kostenlos.

Projekt anfragen

Weitere Artikel
aus dem Magazin.

Alle Artikel
KI, Automatisierung & Reporting28 Min.

pdfcn im Test: Rechnungen und Reports mit React, ohne Chrome

Wer aus einer Web-Anwendung PDFs erzeugen will, hatte bisher meist zwei Wege. Entweder läuft auf dem Server ein kompletter Chrome, der eine HTML-Seite druckt. Oder jede Rechnung wird in einer eigenen Layout-Sprache …

KI, Automatisierung & Reporting41 Min.

ChatGPT Dots: Was OpenAIs Agenten können und was sie kosten

Am 29. September 2026 hat OpenAI auf dem DevDay in San Francisco die „Dots“ vorgestellt: Agenten in ChatGPT, die dauerhaft laufen, einen eigenen Computer in der Cloud haben und an deinen Aufgaben weiterarbeiten, …

KI, Automatisierung & Reporting11 Min.

Magnific Spaces mit Claude: Produktfotos und Ads per MCP

KI-Bildmodelle sind gut darin, schöne Bilder zu erfinden. Genau das ist bei Produktfotos das Problem: Sie erfinden auch den Reißverschluss, das Etikett und das Logo. Für RYMHART, einen Strickwaren-Hersteller aus …