Alle Artikel
ki sichtbarkeit messengeo analysebrand vs non-brandai overview sichtbarkeitgenerative engine optimization

Brand gegen Non-Brand: 7 GEO-Messungen ausgewertet

·
14 min read
·
Lukas Lavicka

Der Befund in drei Sätzen

Über sieben eigene GEO-Messungen (Generative Engine Optimization, also Sichtbarkeit in KI-Antworten) aus fünf Fällen hinweg nennen KI-Engines eine Marke in 97,6 Prozent der Antworten, sobald der Markenname in der Frage steht, je Messung 85,7 bis 100,0 Prozent [Quelle: eigene Messung, 18.06.2026 bis 22.08.2026]. Verschwindet der Markenname aus der Frage, fällt die Nennungsquote auf 11,2 Prozent gepoolt, Spanne 0,4 bis 41,4 Prozent, in fünf von sieben Messungen unter 10 Prozent. Der Abstand ist der Befund, gerechnet über 1.358 gewertete Antworten.

Gemessen statt behauptet.

Leitmetrik ist die Nennungsquote, nicht die Empfehlungsquote. Eine Empfehlung ohne Nennung gibt es nicht, die Empfehlung ist logisch dominiert. Sie stammt zusätzlich aus einem LLM-Judge und ist in beide Richtungen unscharf. Bei Non-Brand-Fragen streut sie nach oben: gepoolt 11,5 Prozent gegen 11,2 Prozent Nennung, also über eine Grenze hinaus, die es nicht geben kann. Bei Brand-Fragen liegt sie mit 76,7 Prozent unter der Nennungsquote von 97,6 Prozent, dort wertet der Judge eine Nennung nicht automatisch als Empfehlung [Quelle: eigene Messung, gleicher Zeitraum]. Nach oben ist die Richtung, die einen Befund aufbläst, deshalb läuft die Empfehlung hier nur als zweiter Wert und obere Schätzung mit.

Nennung ist nicht Erkennung. Der String-Match zählt auch Antworten, in denen die Engine den Namen nur wiederholt und dann erklärt, sie kenne ihn nicht. Bei einer jungen Marke ist das die Mehrheit: In A4, 17 Tage nach unserem Namenswechsel, tragen 24 der 28 Brand-Antworten den Namen, aber nur rund 5 davon erkennen das Angebot (Gemini 1 von 10, Anthropic etwa 4 von 14), die übrigen deuten „lavcite" als Tippfehler [Quelle: eigene Handzählung aller Brand-Records, 03.09.2026]. Bei den fünf fremden Messungen dieser Reihe liegt dieser Echo-Anteil zwischen 0 und 10 Prozent (0 von 12, 1 von 18, 0 von 67, 0 von 24, 2 von 20), in A3 unter dem alten Namen bei 2 von 36 [Quelle: eigene Auswertung, Regex-Heuristik über Unbekannt-Formulierungen, keine Handzählung]. Die 97,6 Prozent sind deshalb eine Obergrenze für das Abrufen des Namens, keine Erkennungsquote. Wie wir das nachgezählt haben, steht in der Wiederholungsmessung vom 03.09..

Brand-Frage und Non-Brand-Frage, und warum die Trennung zählt

Eine Brand-Frage enthält den Markennamen: "Was macht Firma X?", "Ist Firma X seriös?". Sie prüft, ob die Engine die Marke findet und einordnen kann, also ein Retrieval-Test, kein Sichtbarkeitstest.

Eine Non-Brand-Frage enthält nur den Bedarf: "Wer erstellt Websites für Handwerksbetriebe?", "Welcher Anbieter für Mitarbeiter-Apps passt zu einem Mittelständler?". Das fragt ein Interessent, bevor er einen Anbieter kennt.

Viele Sichtbarkeits-Auswertungen, die mir begegnen, fassen beides zu einer Gesamtquote zusammen. Wer das tut, hebt die Zahl über den Brand-Anteil an und verdeckt die Lücke, um die es geht. Getrennt gerechnet sieht das nach einem Auffindbarkeits-Problem aus und nicht nach einem Bekanntheits-Problem, und beide brauchen unterschiedliche Arbeit. Zum Einlesen: was GEO ist und wie wir messen.

Wie gemessen wurde

  • Datenbasis: 7 GEO-Audits aus 5 Fällen, 18.06.2026 bis 22.08.2026, 1.358 gewertete Antworten, davon 206 auf Brand-Fragen und 1.152 auf Non-Brand-Fragen [Quelle: eigene Messung, gleicher Zeitraum]. Zwei Fälle wurden zweimal gemessen, daher 7 Audits bei 5 Fällen.
  • Eigenanteil, offen ausgewiesen: Zwei der sieben Messungen betreffen unsere eigene Domain lavcite.com, 467 von 1.358 Antworten (34,4 Prozent). Die übrigen fünf stammen aus Analysen fremder Websites, teils im Auftrag, teils als eigene Marktanalyse ohne Auftrag, alle anonymisiert. Die Auswahl hebt beide Kopfzahlen: mit zwei weiteren Messungen, die wir wegen der Regel gegen Querverweise auf andere eigene Projekte ausgeschlossen haben, läge die Brand-Nennung bei 95,9 und die Non-Brand-Nennung bei 10,0 Prozent. Die Regel ist asymmetrisch, die eigene Marke bleibt drin, andere eigene Projekte nicht. Das ist eine Fallreihe mit Eigenanteil, keine unabhängige Stichprobe.
  • Engines: Gewertet wird nur, was geantwortet hat. Gemini Grounding und Google AI Overview lieferten in 7 von 7 Audits Daten, Perplexity Sonar in 6, OpenAI Websearch und Anthropic Websearch in je 2. Ausfälle über HTTP 400, 429 oder 401 zählen nicht mit und sind je Audit dokumentiert.
  • Frage-Sets: 40 bis 100 Fragen je Audit, in den Clustern informational, commercial, local, comparison und brand. Seeds aus Search Console, DataForSEO, People-also-ask und Wettbewerber-Keywords. Der synthetische Anteil reicht je Audit von 20 bis 100 Prozent, und je höher er ist, desto eher misst das Set den Generator statt reale Nachfrage.
  • Auswertung: Objektive Felder (Markennennung, eigene Domain zitiert, zitierte URLs) über deterministisches String-Matching, subjektive Felder (Empfehlung, Rang, Sentiment) über einen LLM-Judge, Gemini 2.5 Flash-Lite, in allen sieben Audits dasselbe Modell. Mehr unter Methodik und Datenquellen.

Messgrenzen, aus den Evidence-Dateien übernommen und ergänzt

Alle folgenden Punkte stammen aus den Evidence-Dateien der sieben Audits, Zeitraum 18.06. bis 22.08.2026 [Quelle: eigene Messung, 2026-06-18 bis 2026-08-22], ergänzt um die Nachrechnung vom 02.09.2026.

  • Brand-Nennung enthält Echo. Die Kopfzahl 97,6 Prozent zählt Antworten mit dem Namen, nicht Antworten, die das Angebot kennen. Für A4 ist der Anteil per Hand ausgezählt (rund 5 von 24 erkannt), für die übrigen sechs Messungen nur per Heuristik geschätzt. Details im Absatz „Nennung ist nicht Erkennung".
  • API ist nicht die Consumer-App. Die API-Engines sind ein Proxy für ChatGPT, Claude, Perplexity und Gemini: anderes Modell, anderes Retrieval, keine Personalisierung. Die Apps wurden in keinem Audit gemessen.
  • Die beiden Google-Oberflächen sind ungleich abgedeckt. Google AI Overview ist ein SERP-Block, keine LLM-API, erscheint nicht für jede Query und lief in mehreren Audits nur auf den kaufnahen Clustern, was deren Non-Brand-Quote strukturell anhebt. Google AI Mode fehlt durchgehend, der Datenanbieter unterstützt ihn nur auf Englisch.
  • Momentaufnahme. KI-Antworten sind probabilistisch. Die Volatilität wurde in 7 von 7 Audits mitgemessen: confidence (Anteil stabiler Urteile über Wiederholungsläufe) 0,917 bis 1,0, volatile_share (Anteil kippender Fragen) 0,0 bis 0,25 [Quelle: eigene Messung, gleicher Zeitraum]. Cluster-Aggregate sind belastbar, Einzelfragen nicht.
  • Der Judge macht Fehler in eine bekannte Richtung. In drei von sieben Audits (A1, A3, A6) liegt die Non-Brand-Empfehlungsquote über der Nennungsquote, was logisch nicht möglich ist. Gepoolt gilt dasselbe, 11,5 gegen 11,2 Prozent. Zwei Audits (A4, A5) liefen mit einem Konsistenz-Gate, einer Regelprüfung, die unmögliche Judge-Urteile zurücknimmt, und korrigierten 1,6 beziehungsweise 3,7 Prozent der Urteile. Die fünf Audits ohne Gate (A1, A2, A3, A6, A7) tragen die obere Schätzung. Unterscheidungsmerkmal ist das fehlende Gate, nicht das Alter.
  • Drei offene Korrekturfragen, zwei bei den eigenen Zahlen. A3: die Non-Brand-Empfehlung ist nach manueller Nachprüfung 1 von 234 statt 2 von 234, also 0,4 statt 0,9 Prozent. A4: die Brand-Nennung von 85,7 Prozent ist die untere Lesart eines Nenner-Streits (10 von 14 gegen 10 von 12). A5: die Evidence-Datei nimmt eine Engine mit fünf Antworten aus den Kernzahlen, die Quote hier enthält sie (ohne sie 42,4 statt 41,4 Prozent).

Die sieben Messungen im Einzelnen

Prozentwerte je Zeile gelten für die Antworten dieses Audits, nicht für Fragen. "Stärkster Cluster" meint die höchste Non-Brand-Nennungsquote.

FallBrancheMessdatumAntwortenBrand-NennungNon-Brand-NennungNon-Brand-EmpfehlungStärkster Cluster
A1ein IT-Systemhaus28.07.2026100100,0 % (n=12)17,0 % (n=88)23,9 %commercial, 30,0 %
A2ein Anbieter von Rhetorik-Seminaren18.06.2026157100,0 % (n=18)0,7 % (n=139)0,7 %local, 4,0 %
A3lavcite28.07.2026270100,0 % (n=36)0,4 % (n=234)0,9 %commercial, 1,3 %
A4lavcite22.08.202619785,7 % (n=28)0,6 % (n=169)0,0 %commercial, 1,7 %
A5ein Anbieter einer Mitarbeiter-App11.08.202627198,5 % (n=68)41,4 % (n=203)40,4 %local, 68,8 %
A6ein Anbieter von Baumpatenschaften06.07.2026155100,0 % (n=24)6,9 % (n=131)7,6 %commercial, 12,5 %
A7ein Anbieter von Baumpatenschaften28.07.2026208100,0 % (n=20)9,6 % (n=188)9,0 %commercial, 18,5 %

[Quelle: eigene Messung, Messdatum je Zeile, 1.358 gewertete Antworten]

Drei Beobachtungen dazu.

Der Abstand ist der Befund, nicht die Einzelquote. In A2 nennt die Engine die Marke in allen 18 Brand-Antworten, bei den 139 Non-Brand-Antworten bleibt eine Nennung übrig. Dasselbe Muster in A3, A4, A6 und A7.

Der Ausreißer nach oben hat eine Erklärung, die in der Zahl nicht steckt. A5 liegt mit 41,4 Prozent Non-Brand-Nennung vor allen anderen. Dort lief Google AI Overview nur auf den kaufnahen Clustern und liegt bei 79,5 Prozent Nennung. Ohne diese Engine bleiben über 159 Antworten 30,8 Prozent Nennung und 29,6 Prozent Empfehlung [Quelle: eigene Berechnung aus den Rohdaten der Messläufe, 11.08.2026]. Auch dann bleibt es der höchste Wert der Reihe, aber der Fallvergleich taugt für die Richtung, nicht für einen Ranglistenplatz.

Zwei Messungen derselben Marke im Abstand von 25 Tagen ergeben andere Zahlen bei gleicher Aussage. A3 und A4 sind dieselbe Marke, gemessen mit teils anderen Engines und anderem Frage-Set: Nennung 0,4 auf 0,6 Prozent, Empfehlung 0,9 auf 0,0 Prozent [Quelle: eigene Messung, 28.07. und 22.08.2026]. Das ist kein Wirkungseffekt, sondern ein veränderter Messaufbau. Wer zwei Läufe vergleichen will, braucht ein eingefrorenes Frage-Set.

Wo Marken genannt werden, und wo nicht

Gepoolt über alle sieben Audits, gerechnet auf Non-Brand-Antworten. Die Empfehlungsspalte steht wegen des Judge-Effekts als obere Schätzung.

ClusterNon-Brand-AntwortenNennungsquoteEmpfehlungsquote (obere Schätzung)
local22919,7 %19,2 %
commercial40218,7 %17,9 %
comparison1714,7 %8,2 %
informational3500,3 %0,9 %

[Quelle: eigene Messung, 18.06.2026 bis 22.08.2026, 1.152 Non-Brand-Antworten]

Der informational-Cluster ist der auffälligste Wert der Reihe. Über 350 Antworten auf Definitions- und Wissensfragen bleibt genau eine Nennung übrig, 0,3 Prozent. Alle sieben Audits haben den Cluster gemessen, in sechs steht eine glatte Null [Quelle: eigene Messung, gleicher Zeitraum]. Wer auf "Was ist X?" auftauchen will, konkurriert mit Herstellerglossaren, Fachmedien und Institutionen, die den Raum besetzen.

Der Entscheidungsraum sieht anders aus. Anbieterfragen mit Regionalbezug (local) und Kaufabsichtsfragen (commercial) tragen 120 der 129 Non-Brand-Nennungen. In A7 stammen die Empfehlungen ausschließlich aus diesen beiden Clustern, laut Auswertungsdatei aus zwei Fragetypen: Anbieterfragen mit Deutschlandbezug und Regionalfragen zu einer konkreten Region [Quelle: eigene Messung, 28.07.2026].

Der comparison-Cluster zeigt die größte Lücke zwischen beiden Metriken. In A1, einem der fünf Audits ohne Konsistenz-Gate, liegt er bei 17,4 Prozent Nennung und 39,1 Prozent Empfehlung, in A6 und A7 bei 0,0 Prozent [Quelle: eigene Messung, 18.06.2026 bis 22.08.2026]. Der Abstand von 21,7 Punkten in A1 ist der größte der Reihe und markiert, wie weit der Judge ohne Gate streut. Die meistzitierte URL dieses Clusters war dort eine eigene Vergleichsseite des geprüften Anbieters, sieben Zitationen auf Platz 1. Das ist eine Korrelation aus einer Messung, keine belegte Ursache.

Engine-Divergenz: was die Daten dazu hergeben, und was nicht

Ob verschiedene KI-Engines auf dieselben Quellen zurückgreifen, lässt sich aus diesen Daten nur grob beantworten. Eine dedizierte Zitationsquellen-Datei liegt in zwei der sieben Audits vor und deckt nur die AI-Overview-Ebene ab, also eine Engine. Eine saubere Überschneidungsquote gibt sie nicht her.

Rechnet man ersatzweise über die zitierten Domains der Antworten, ergeben sich für 17 Engine-Paare mit je mindestens 30 gewerteten Antworten Überschneidungen von 2 bis 8 gemeinsamen Domains in den Top 10, Median 5 [Quelle: eigene Berechnung aus den Rohdaten der Messläufe, 18.06.2026 bis 22.08.2026]. Der Wert ist nicht auf den Punkt stabil: Auf Rang 10 stehen häufig mehrere Domains punktgleich, und welche davon aufrückt, verschiebt ein Paar um 1. Mit anderer Sortierregel liegt die Spanne bei 3 bis 9, der Median bleibt 5. Am 22.08.2026 teilten sich Gemini Grounding und Google AI Overview 5 von 10 Domains, Anthropic Websearch und Gemini Grounding 3 von 10.

Belastbar ist daran nur die Größenordnung: etwa die Hälfte. Die Top-10-Listen ruhen je Engine auf unterschiedlichen Frage-Teilmengen. Die Entwicklung über die Zeit steht im KI-Sichtbarkeits-Index.

Was daraus für dich als Webentwickler folgt

Das Folgende ist Zustandsbeschreibung plus Arbeitshypothese, kein Wirkungsversprechen. Keine Messung enthält einen Vorher-Nachher-Vergleich.

Zustand. Fragt dich ein Kunde, ob er "in ChatGPT vorkommt", ist die Antwort zweigeteilt. Nach seinem Namen gefragt: 97,6 Prozent, nach seiner Leistung gefragt: 11,2 Prozent [Quelle: eigene Messung, 18.06.2026 bis 22.08.2026]. Beide Zahlen sind wahr, und nur die zweite beschreibt, was passiert, wenn ein Interessent den Kunden noch nicht kennt. Mehr dazu unter Sichtbarkeit in KI-Suchen.

Arbeitshypothese 1. Der informational-Cluster ist in dieser Datenlage der unergiebigste Raum. Ein Glossarartikel "Was ist X?" konkurriert mit Quellen, die den Platz seit Jahren halten. Die Messungen sagen nicht, dass es unmöglich ist, sondern dass es in 350 Antworten einmal vorkam.

Arbeitshypothese 2. Anbieter- und Regionalfragen sind der Raum, in dem in diesen Messungen überhaupt Nennungen entstanden. Wer dort eine benennbare, zitierfähige Seite hat, taucht eher auf.

Was das operativ heißt. Vor der Arbeit steht eine Messung mit eingefrorenem Frage-Set, getrennt nach Brand und Non-Brand, mit dokumentierten Engine-Ausfällen. Ohne die Trennung sieht eine Marke besser aus, als sie im Entscheidungsraum steht, und ohne eingefrorenes Set ist die Wiederholung nicht vergleichbar, wie A3 gegen A4 zeigt. Ein Nullbefund ist dabei ein Ausgangswert, kein Alarm: In A4 steht die Non-Brand-Empfehlung in allen vier Clustern bei 0,0 Prozent, bei einer confidence von 0,991 [Quelle: eigene Messung, 22.08.2026].

Was wir nicht wissen

  • Ob eine Umsetzung die Quoten bewegt. Keine Messung enthält einen belegten Vorher-Nachher-Vergleich. Alles oben ist Zustand und Hypothese.
  • Wie unabhängig die Reihe ist. Zwei der sieben Messungen betreffen unsere eigene Domain lavcite.com, 467 von 1.358 Antworten (34,4 Prozent) [Quelle: eigene Messung, gleicher Zeitraum]. Gegenüber dem eigenen Auftritt ist die Reihe nicht unabhängig.
  • Wie es in den Consumer-Apps und im Google AI Mode aussieht. Beides wurde nicht gemessen. Was in der API sichtbar ist, muss dort nicht so aussehen.
  • Wie belastbar die Empfehlungswerte der fünf Audits ohne Konsistenz-Gate sind. In A1, A3 und A6 liegt die Empfehlungsquote über der Nennungsquote. Sie sind die obere Schätzung, deshalb führt dieser Artikel die Nennungsquote.
  • Ob die Fälle repräsentativ sind. Fünf Fälle, überwiegend DACH und kleine Anbieter. Das ist eine Fallreihe, keine Stichprobe aus einer definierten Grundgesamtheit. Eine Verallgemeinerung auf "den deutschen Markt" tragen die Daten nicht.
  • Warum eine Marke aufgenommen wird und eine andere nicht. Die Messung zeigt, wer zitiert wird, nicht warum. Die Seitenmerkmale sind Korrelationen ohne Kontrollgruppe.
  • Wie stabil die Werte über Monate sind. Die Volatilität wurde an einem Tag gemessen, nicht über Quartale.

FAQ

Warum trennt ihr Brand- und Non-Brand-Fragen, wenn andere eine Gesamtquote ausweisen? Weil die Gesamtquote den Befund verdeckt. In A2 liegt sie bei 12,1 Prozent über alle 157 Antworten, die Non-Brand-Quote bei 0,7 Prozent [Quelle: eigene Messung, 18.06.2026]. Der Unterschied entsteht allein durch 18 mitgerechnete Brand-Antworten.

Ist eine Non-Brand-Quote von 0 Prozent ein schlechtes Ergebnis? Es ist ein Ausgangswert. In A4 ist die Empfehlungsnull in allen vier Clustern stabil, bei einer confidence von 0,991 [Quelle: eigene Messung, 22.08.2026]. Ein Wert wird erst zur Aussage, wenn ein zweiter mit identischem Frage-Set daneben steht.

Warum ist Google AI Overview nicht mit den anderen Engines vergleichbar? Weil es ein SERP-Block ist und keine LLM-API, nicht für jede Suchanfrage erscheint und in mehreren Audits nur auf den kaufnahen Clustern abgefragt wurde. In A5 liegt die Engine dort bei 79,5 Prozent Nennung, die übrigen Engines desselben Audits bei 30,8 Prozent [Quelle: eigene Berechnung aus den Rohdaten der Messläufe, 11.08.2026].

Welche fremden Quellen tauchen am häufigsten auf? Das hängt vom Markt ab. In der eigenen Messung vom 22.08.2026 waren die meistgenannten fremden Marken SE Ranking (50 Nennungen), Semrush (29), Seobility (25), Ahrefs (24), SEOptimer (21) und SISTRIX (17), die meistzitierte fremde Domain war seranking.com [Quelle: eigene Messung, 22.08.2026, gezählt über 169 Non-Brand-Antworten]. Das ist Zitationshäufigkeit über einen Messtag, kein Vergleich und keine Bewertung.

Wie oft sollte man nachmessen? In allen sieben Audit-Plänen ist eine Wiederholung nach rund 90 Tagen gegen dasselbe Frage-Set vorgesehen. Technisch eingefroren, über eine Sperrdatei mit Prüfsumme, ist das Set in zwei der sieben [Quelle: eigene Messung, 18.06.2026 bis 22.08.2026]. Kürzere Abstände messen vor allem Rauschen, wie der volatile_share von bis zu 0,25 zeigt.


Wenn du für ein Kundenprojekt wissen willst, wie dieser Abstand dort konkret aussieht: Der Befund kommt von uns. Die Rechnung schreibst du. Report für ein Kundenprojekt anfragen, oder vorher den Beispiel-Report ansehen.

Alle Zahlen stammen aus eigenen Messungen vom 18.06.2026 bis 22.08.2026. Fremde geprüfte Marken sind anonymisiert, solange keine dokumentierte Einwilligung vorliegt. Die Datenbasis liegt als daten-veroeffentlicht.json bei, ausschließlich als Aggregat, ohne Dateipfade und ohne die Domains der geprüften Fälle.

Teste lavcite kostenlos

Fordere jetzt dein Test-Audit an und sieh selbst, was dein SEO-Masterplan enthält.

Test-Audit anfordern