Methodik
Diese Seite beschreibt den Weg von den Bewertungen auf Google Maps zum fertigen Bericht: woher die Daten stammen, wie Zahlen, Problemkarten und Zitate entstehen, was dabei das Sprachmodell übernimmt und was gewöhnlicher Programmcode - und wo und warum die Methode falsch liegen kann. Wir schreiben das, damit sich das Ergebnis beurteilen und nicht nur hinnehmen lässt.
Fassung vom 24. September 2026
Woher die Daten stammen
Grundlage sind öffentliche Bewertungen Ihres Unternehmens auf Google Maps - dieselben, die jede Besucherin und jeder Besucher Ihres Eintrags sieht. Wir kaufen keine Daten von Dritten und führen keine Umfragen durch.
Google bestätigt nicht, dass die Person, die eine Bewertung geschrieben hat, tatsächlich Ihr Gast oder Ihre Kundschaft war. Stellen Sie die Zahlen dieses Berichts Ihren eigenen Daten gegenüber - Buchungen, Umfragen, Reklamationen - statt Entscheidungen auf eine einzige Quelle zu stützen.
Das Abrufen übernimmt ein externer Anbieter, der in unserer Datenschutzerklärung benannt ist. Wie weit wir zurückreichen, hängt vom gebuchten Tarif ab: Ein kostenloses Konto speichert die neuesten Bewertungen, kostenpflichtige Tarife greifen weiter in die Vergangenheit.
Das Abrufen ist eine Momentaufnahme eines bestimmten Tages. Ändert oder löscht jemand die eigene Bewertung später, beschreibt der Bericht weiterhin den Stand zum Zeitpunkt des Abrufs. Daten und Sternebewertungen übernehmen wir genau so, wie Google sie veröffentlicht - wir korrigieren nichts und ergänzen nichts.
Die kostenlose Berichtsprobe ist ein Sonderfall: Sie steht bewusst auf den 50 neuesten Bewertungen des Betriebs und nicht auf dem gesamten Bestand. Das Dokument sagt das auf der ersten Seite ausdrücklich („Grundlage: 50 neueste von N Bewertungen”), und Abschnitte, die eine längere Historie brauchen - etwa historische Themen - erscheinen darin gar nicht, statt leer zu bleiben.
Die QUALITATIVEN Erkenntnisse - Problemkarten, Stärken, Zitate, Text - entstehen auf einer STICHPROBE der Bewertungen, nicht auf dem gesamten Bestand: bis zu 500 Bewertungen gehen an das Modell, proportional zur Stimmung gezogen (im Netzbericht bis zu 100 je Standort und bis zu 500 aus dem gesamten Netz, mit garantiertem Minimum für jeden Standort). Bei einem großen Betrieb ist das ein Bruchteil des Materials, und das Dokument sagt es im Methodenhinweis ausdrücklich, mit beiden Zahlen. Die KENNZAHLEN - Durchschnittsnote, Stimmungsanteile, Sterneverteilung, Anzahl - werden aus dem GESAMTEN vom Bericht erfassten Material berechnet, nicht aus der Stichprobe.
Es gibt Betriebe, für die wir keinen Bericht erstellen. Hat ein Betrieb weniger als 3 Google-Bewertungen, lehnen wir den Auftrag noch vor jeder Zahlung ab - aus so wenig Material lassen sich keine Erkenntnisse über den Betrieb gewinnen, und das entstehende Dokument spräche nur über fehlende Daten. Dieselbe Bedingung prüfen wir ein zweites Mal nach dem Abruf der Bewertungen, dann an ihrem Text: wir brauchen mindestens 3 Bewertungen mit Text und insgesamt 400 Zeichen dieses Textes, denn eine Bewertung ohne ein einziges Wort gibt nichts zu lesen. Bei einem Auftrag über mehrere Betriebe gilt die Bedingung für deren Summe, und ein Betrieb mit weniger Bewertungen bleibt im Bericht und wird darin beschrieben.
Wie die Zahlen entstehen
Jede Bewertung wird einzeln beurteilt. Ein Sprachmodell liest sie und ordnet ihr eine Tonalität zu - Lob, Beschwerde oder neutrale Äußerung - sowie den betroffenen Bereich, etwa Service, Preise oder Sauberkeit. Eine Bewertung kann mehrere Bereiche zugleich betreffen und zählt dann für jeden davon.
Ein eigener Schritt ordnet die Namen der Bereiche: Varianten desselben Themas - etwa „Service” und „Kundenservice” - werden zusammengeführt, damit ein Problem nicht in zwei kleinere Zähler zerfällt.
Bewertungen werden vor der Analyse nicht übersetzt. Das Modell liest jede in der Sprache, in der sie geschrieben wurde, und das Ergebnis der Einordnung fließt in ein gemeinsames Vokabular der Bereiche - so landen eine Beschwerde auf Englisch und eine auf Polnisch über dieselbe Sache im selben Zähler. Eine Übersetzung kommt erst bei den Zitaten im fertigen Bericht ins Spiel - beschrieben im Abschnitt über Zitate.
Bewertungen, die nur aus einer Sternebewertung ohne Text bestehen, zählen voll zur Zahl der Bewertungen und zur Durchschnittsnote, bauen aber keine Problemkarten und keine Zitate - es gibt in ihnen nichts zu lesen. Deshalb zeigt der Bericht den Durchschnitt zusätzlich getrennt für Bewertungen mit Text: Die beiden Durchschnitte können sich unterscheiden, und dieser Unterschied ist selbst eine Information.
Alle Zahlen im Bericht - Anteile, Beschwerdezähler, Diagramme - sind die Summe dieser Einzelbeurteilungen. Keine davon ist eine Schätzung oder Rundung: Jede lässt sich wieder in konkrete Bewertungen zerlegen.
Lob und Beschwerde zu einem Bereich schließen sich innerhalb einer Bewertung aus: eine insgesamt positive Bewertung, die sich über die Sauberkeit beklagt, zählt für die Sauberkeit als Beschwerde, nicht als Lob. Die Karte der Stärke und die Karte der Schwäche desselben Bereichs folgen derselben Regel und nennen daher dieselbe Zahl an Lobpunkten.
Die Plaketten „stärker“, „schwächer“ und „ähnlich“ bei Wettbewerbern messen wir an der Google-Bewertung des Unternehmens über die gesamte Geschichte des Eintrags, nicht am Durchschnitt des untersuchten Korpus - beide Zahlen können sich unterscheiden, besonders wenn der Bericht nur die neuesten Bewertungen umfasst. Unter der Wettbewerbertabelle steht die Bewertung, an der die Plaketten gemessen wurden; die Schwelle beträgt 0.1 Sterne.
Antworten des Inhabers zählen wir gesondert: Der Anbieter liefert die Antwort aus Google Maps im selben Datensatz wie die Bewertung, und der Bericht nennt, wie viele Bewertungen - und wie viele negative - keine Antwort haben. Die Zahl umfasst ausschließlich Bewertungen mit Messstempel; Bewertungen, die vor dem 22. September 2026 abgerufen wurden, tragen keinen solchen Stempel, und der Bericht schreibt dann „nicht gemessen“ statt eine Null anzugeben. Die Empfehlung, auf Bewertungen zu antworten, entsteht allein aus dieser Zahl - ohne Messung keine Empfehlung. Unsere im Dashboard erzeugten Antwortvorschläge sind nicht diese Zahl: Sie sagen, was man antworten könnte, nicht, ob der Inhaber geantwortet hat. Eine Empfehlung entsteht erst ab 10 gemessenen Bewertungen - eine priorisierte Empfehlung auf Grundlage von einer oder zwei Bewertungen würde mehr behaupten, als bekannt ist. Gemessen sind meist die neuesten Bewertungen, weil die Messung mit jedem weiteren Abruf hinzukommt; die Zahl beschreibt also das aktuelle Antworten, nicht die gesamte Geschichte des Profils, und der Bericht sagt das neben der Zahl.
Aktuelle Probleme, Vorfälle und historische Themen
Der Bericht wirft nicht alle Beschwerden in einen Topf. Wiederkehrende und aktuelle Beschwerden werden zu Problemkarten. Vereinzelte Signale, die vom Lob desselben Bereichs überwogen werden, kommen in den Abschnitt „Einzelne Vorfälle”. Beschwerden, deren jüngste Spur alt ist, während sich der Bereich seither verbessert hat, landen unter „Historische Themen - keine neuen Signale”.
Derselbe Beschwerdegegenstand darf in einem Dokument nicht in zwei Zuständen zugleich stehen. Beschreibt ein Thema im historischen Abschnitt dasselbe wie eine Karte eines aktuellen Problems - auch bei anderer Formulierung -, entfällt der historische Eintrag, denn die Behauptung der Stille wird durch lebende Belege widerlegt. Die aktuelle Karte bleibt unangetastet. Ebenso ein einzelnes Ereignis im Abschnitt der Vorfälle - es sei denn, es ist eine zweite Beschreibung derselben Sache wie die Karte (Absatz unten): Dann trägt es nur, was die Karte bereits trägt.
Die Aktualität messen wir am Ende des untersuchten Zeitraums, nicht am Tag der Erstellung des Dokuments - ein Bericht über das vergangene Jahr beurteilt die Aktualität so, wie sie am Ende jenes Jahres aussah. Den Anteil der Beschwerden berechnen wir innerhalb des betroffenen Bereichs, nicht bezogen auf alle Bewertungen.
Das Gewicht einer Karte - „Kritisch”, „Wichtig”, „Beobachten” - folgt nicht aus der bloßen Zahl der Beschwerden. Es steigt mit dem Anteil der Beschwerden unter den Bewertungen des Bereichs, mit der Frische der jüngsten Meldungen und mit der Art des Bereichs: Themen rund um Sicherheit oder Hygiene wiegen schwerer. Deshalb kann eine Karte mit weniger Beschwerden schwerer sein als eine mit mehr - das Dokument weist auch neben den Karten selbst darauf hin.
Eine Karte unterliegt diesen Schwellen nicht: die Karte mit der Plakette LEBEN / GESUNDHEIT. Sie sammelt Bewertungen, in denen das Sprachmodell - beim Lesen jeder Kandidatenbeschwerde einzeln - ein Ereignis erkannt hat, das Gesundheit oder Leben eines Gastes gefährdet: Vergiftung, Verletzung, Infektion, Ungeziefer, Schimmel, Brand, Wasserschaden, körperliche Aggression, fehlende Hilfe im Notfall oder eine unsichere Konstruktion. Der Code wählt die Kandidaten aus (Beschwerdefragmente, die der Klassifikator den Bereichen Gesundheit, Sicherheit, Sauberkeit, Produktqualität und Essen zugeordnet hat, und - wenn eine Bewertung keine Fragmente hat - eine negative Bewertung mit einem solchen Bereich; der Text eines Kandidaten ist auf 320 Zeichen begrenzt), das Modell urteilt, und der Code setzt durch: Die Karte ist ab der ersten Meldung kritisch, steht an erster Stelle, und ihre Zahlen zählen ausschließlich bestätigte Bewertungen. Karten, Vorfälle und historische Themen zum selben Ereignis werden aufgenommen, damit dasselbe Ereignis nicht zweimal mit unterschiedlichem Gewicht erscheint. Warum ein Urteil über den Text und nicht allein die Kategorien des Klassifikators: Gemessen am 22. September 2026 an 45 zufälligen Beschwerden aus den Bereichen „Gesundheit“ und „Sicherheit“ - 28 betrafen Gesundheit oder Leben eines Gastes, 17 nicht (Tierwohl, Diebstahl, Kamera in der Umkleide, Masken); bei dieser Fehlerquote würde eine rote Plakette Glaubwürdigkeit kosten, statt sie aufzubauen. Auch das Urteil kann in beide Richtungen irren; jede Meldung auf dieser Karte ist auf Ihrer Seite zu prüfen. Als dasselbe Ereignis gilt nur ein Eintrag, dessen SÄMTLICHE Zitate wörtlich in einer als Gefahr erkannten Bewertung stehen und das Ereignis selbst beschreiben, nicht eine andere Beschwerde aus dieser Bewertung; die Kategorie „Gesundheit“ allein ist kein Grund. Ein solcher Eintrag verschwindet, wenn er nicht mehr Beschwerden hat als die Karte LEBEN / GESUNDHEIT; ein größerer bleibt mit seinen eigenen Zahlen, und seine Empfehlungen wandern unter die Karte LEBEN / GESUNDHEIT - das Zitat kann dann unter beiden Karten stehen. Eine Karte mit Dutzenden Beschwerden über etwas anderes bleibt unberührt. Die erste Empfehlung unter dieser Karte ist immer dieselbe: jede Meldung in den eigenen Unterlagen prüfen; Empfehlungen aus der Analyse folgen ihr. Als größtes Risiko auf dem Deckblatt steht die Karte nur, wenn die letzte Meldung aus den 12 Monaten vor dem Ende des Berichtszeitraums stammt - ältere Meldungen bleiben auf der Karte, das Deckblatt spricht aber von einem aktuellen Problem. Hat die Prüfung nicht alle Kandidatenbewertungen erfasst (Zeitlimit oder Modellfehler), sagt der Hinweis im PDF das ausdrücklich, und Empfehlungen unter Karten zu Gesundheit und Sicherheit bleiben auch mit dem Status „Beobachten“ im Dokument.
Dasselbe Problem steht im Dokument nicht gleichzeitig als aktuelle Karte und als Einzelvorfall oder historisches Thema - das Dokument würde sonst über eine Sache zwei gegensätzliche Dinge sagen („besteht“ und „erloschen“). Die Kandidaten bestimmt der Code (Einträge derselben Kategorie); ob es um denselben Beschwerdegegenstand geht, entscheidet das Sprachmodell anhand von Titel und Beschreibung beider Einträge: Eine gemeinsame Kategorie genügt nicht, weil ein Bereich mehrere verschiedene Probleme enthalten kann. Ein Eintrag, der etwas trägt, was der Karte fehlt, kommt nicht zu diesem Urteil: ein als gefährlich markiertes Ereignis, ein Ereignis aus einem Standort der Kette außerhalb der Belege der Karte oder ein Eintrag, der jünger ist als das Datum der letzten Meldung, das die Karte angibt - dann bleiben beide Einträge, weil das Entfernen das jüngste Signal zu dieser Sache aus dem Dokument nehmen würde. Ein als dasselbe Problem beurteilter Eintrag entfällt, die aktuelle Karte bleibt mit ihren Zahlen, und Empfehlungen, die auf den Eintrag verwiesen, wandern unter die Karte und folgen ihren Regeln - unter einer Karte mit dem Status „Beobachten“ werden sie nicht gedruckt. Im Zweifel bleiben beide Einträge.
Der Abschnitt „Was hat sich seit dem vorigen Bericht geändert?“ zeigt neue, fortbestehende und erledigte Probleme sowie den Durchschnitt neuer Bewertungen erst, wenn seit dem vorigen Bericht mindestens 10 Bewertungen hinzugekommen sind. Bei weniger würden Unterschiede zwischen den Problemlisten aus der Analyse selbst stammen, nicht von den Kunden - dann bleibt nur die Beurteilung, ob frühere Empfehlungen gewirkt haben. Das ist ein anderer Abschnitt als „Was hat sich seit dem vorigen Zeitraum geändert?“, der zwei gleich lange, aufeinanderfolgende Zeiträume vergleicht; seine datierten Einträge unter „Plötzliche Änderungen“ sind Häufungen von Bewertungen mit 1-2 Sternen in einem kurzen Zeitfenster, deutlich über dem üblichen Rhythmus des Standorts - Häufungen von 5-Sterne-Bewertungen stehen dort nicht, und dieselbe Häufung von Ein-Stern- und niedrigen Bewertungen zählt einmal. Hat der Zeitraumvergleich keinen Eintrag, wird der Abschnitt nicht gedruckt.
Bei einer Karte LEBEN / GESUNDHEIT verweist die Zeile „Größtes Risiko“ in der Zusammenfassung auf der ersten Seite auf diese Karte - mit der Zahl der Meldungen und einem Verweis -, und „Sofortige Maßnahme“ ist die Empfehlung, jede Meldung unter dieser Karte zu prüfen (aus den sofortigen und kurzfristigen Empfehlungen). Die Zeile „Geschätzte Auswirkung“ aus der Analyse entfällt dann, weil sie eine andere Maßnahme beschrieb. Die Karte ist kritisch und steht an erster Stelle, daher darf die Zusammenfassung nichts anderes als größtes Risiko nennen. Ihr Datum der letzten Meldung stammt vom jüngsten bestätigten Ereignis, auch wenn dieses Ereignis nicht zitiert wird.
Dasselbe Zitat - im selben Wortlaut - steht im Dokument an einer Stelle. Ein kürzerer Ausschnitt einer anderswo länger zitierten Bewertung gilt nicht als Wiederholung, weil er meist ein anderes Thema derselben Bewertung trägt; er kann jedoch dieselbe Beschwerde unter zwei Einträgen sein. Käme derselbe Kundensatz unter zwei Einträge, bleibt er beim früheren in dieser Reihenfolge: Problemkarten, Vorfälle, historische Themen, Stärken - ein gemischter Satz („lecker, aber kalt“) ist ein Beleg für eine Beschwerde. Steht ein Zitat zugleich unter einer Problemkarte und unter einem Einzelvorfall oder historischen Thema, bleibt es beim Vorfall oder Thema, weil diese meist nur einen Beleg haben und die Karte einen ganzen Vorrat. Ausnahmen: Ein Eintrag, dessen Zitate alle Wiederholungen sind, behält eines - das letzte -, weil ein Eintrag ohne Beleg schlechter wäre als eine Wiederholung; es bleibt auch ein Zitat, das der einzige Beleg eines beim Eintrag genannten Standorts der Kette ist; und schließlich die Karte LEBEN / GESUNDHEIT, unter der ein Zitat über eine Gefahr neben der Karte stehen kann, aus der es übernommen wurde.
Die Formeln, auf denen der Bericht steht
Den Beschwerdeanteil eines Bereichs berechnen wir aus den Bewertungen, die sich zu diesem Bereich äußern: Beschwerdeanteil = Beschwerden zum Bereich ÷ Bewertungen zum Bereich. Der Nenner ist nicht die gesamte Menge der Bewertungen - eine Beschwerde über den Parkplatz verdünnt sich nicht in hundert Komplimenten für die Küche.
Die Stimmungsanteile im Ringdiagramm berechnen wir nach der Methode der größten Reste, damit sie sich genau zu 100% summieren, und die Netto-Stimmung leiten wir aus denselben Anteilen ab: Netto-Stimmung = % Lob - % Beschwerden. Eine Definition für Diagramm und Text bedeutet, dass zwei Zahlen über dieselbe Sache nicht einmal um einen Punkt auseinanderlaufen können.
Die Frische eines Signals ist eine Datumsdifferenz: Alter des Signals = Ende des untersuchten Zeitraums - Datum der jüngsten Beschwerde eines Themas. Dieselbe Differenz nutzen die Kartengewichte und der Abschnitt der historischen Themen.
Das Gewicht einer Karte ist eine Schwellenregel, kein Durchschnitt. Vereinfacht: Eine Karte erhält das Etikett „Kritisch”, wenn die Beschwerden in einem Bereich zugleich zahlreich und frisch sind, oder wenn ein Bereich mit hohem Risiko - Sicherheit, Hygiene - ein frisches, gewichtiges Signal trägt. Die Mengenschwellen skalieren mit der Größe des Materials: Bei einigen Tausend Bewertungen hängt die Latte höher als bei hundert, damit eine Handvoll Beschwerden in einem großen Betrieb kein rotes Etikett bekommt. Die genauen Schwellenwerte gehören zum Code und ändern sich mit ihm, deshalb schreiben wir sie hier nicht ab.
Woher die Zitate stammen
Zitate geben wir wörtlich wieder, genau so, wie Kundinnen und Kunden sie geschrieben haben, einschließlich Tippfehlern. Wir kürzen sie nicht so, dass sich ihre Aussage ändert, und fügen keine Sätze aus verschiedenen Bewertungen zusammen.
Zu jedem Zitat gehört das Veröffentlichungsdatum, in einem Bericht für eine Kette zusätzlich der betroffene Standort. So lässt sich jedes Zitat auf Google Maps wiederfinden und überprüfen.
Ein Zitat, das in einer anderen Sprache als der Bericht verfasst ist, zeigt das Dokument in Übersetzung, mit dem Vermerk „(Übersetzung)”. Ausgewählt und mit dem Datum abgeglichen wird immer das Original, Wort für Wort - übersetzt wird erst die endgültig gewählte Fassung, und die Übersetzung übernimmt das Sprachmodell.
Die Auswahl eines Zitats für eine Karte ist eine Entscheidung des Modells, deshalb prüft eine eigene Kontrolle im Nachhinein, ob das Zitat zum Thema der Karte passt, unter der es steht. Die Zuordnung eines Zitats zu Standort und Datum übernimmt dagegen der Code - ein einfacher Abgleich mit der Quellbewertung, ohne Beteiligung des Modells.
Was das Modell tut und was der Code
An einem Bericht arbeiten zwei Modelle unterschiedlicher Stärke: Ein schnelleres liest jede Bewertung einzeln und ordnet sie ein, ein stärkeres schreibt die beschreibenden Inhalte - den Fließtext, die Problembeschreibungen und die vorgeschlagenen Maßnahmen. Das Modell übernimmt alles, was das Verstehen eines Satzes erfordert.
Der Code übernimmt alles, was sich ohne Verstehen prüfen lässt: Zahlen, Daten, das Aufsummieren der Einordnungen, die Zuordnung eines Zitats zu einem Standort, die Stimmigkeit der Abschnitte untereinander. Für den Code ist das Ergebnis des Modells Prüfmaterial, kein Orakel.
Ein fertiger Bericht durchläuft eine Reihe von Prüfungen, bevor wir ihn übergeben. Wir prüfen unter anderem: ob der Titel einer Karte einen einzigen Beschwerdegegenstand beschreibt und nicht mehrere zugleich; ob der Beleg unter einer Karte zu deren Thema passt; ob zwei Karten dasselbe Problem beschreiben; ob im Text Wörter stehen, die es nicht gibt - also Tippfehler des Modells; und ob jeder Bereich mit einem sichtbaren Problem seine Karte hat. Ein Teil der Prüfungen ist reiner Code, ein Teil ist ein erneutes Urteil des Modells über den fertigen Text. Eine Prüfung, die sich nicht sicher ist, lässt den Text unverändert, statt ihn mit Gewalt zu korrigieren; ein Bericht, der die Prüfungen nicht besteht, wird neu erzeugt.
Bericht für eine Kette und Berichte einzelner Standorte
Ein Bericht für eine Kette ist keine Aneinanderreihung von Standortberichten. Alle Bewertungen der Kette werden als ein Ganzes untersucht: Ein Problem, das an mehreren Standorten sichtbar ist, wird zu einer Karte mit der Angabe, wie viele Standorte es betrifft; ein Problem eines einzelnen Standorts kommt in den Teil über örtliche Angelegenheiten. Jedes Zitat trägt den Standort, aus dem es stammt.
Deshalb können die Zahlen im Bericht einer Kette von den Zahlen in den Berichten einzelner Standorte abweichen - und das ist kein Widerspruch. Die Themen im Kettenbericht sind breiter gefasst: Eine Kettenkarte kann mehrere engere Standortkarten umfassen, ihr Zähler kann also größer sein als deren Summe, während es weniger Karten gibt. Beide Sichten beschreiben dasselbe Material in unterschiedlicher Körnung.
Ein Satz in der Beschreibung einer Karte, eines Themas, eines Vorfalls oder einer Stärke, der einen Standort der Kette nennt, den die Belege dieses Eintrags nicht abdecken - weder die Standortliste des Eintrags noch die Zitatangaben -, wird vollständig entfernt; ein Eintrag, dessen gesamte Beschreibung einen solchen Standort betrifft, bleibt unverändert. Eine Empfehlung wird anders beurteilt, weil sie nicht neben Zitaten steht, sondern eine Maßnahme lenkt: Ein in der Empfehlung genannter Standort muss im Dokument eine Beschwerde aus demselben Bereich haben wie der Eintrag, auf den die Empfehlung verweist - in einem beliebigen Abschnitt, auch unter den lokalen Problemen - oder ein Lob aus diesem Bereich unter den Stärken - das zählt nur, wenn die Empfehlung auch einen Standort mit Beschwerde aus diesem Bereich nennt; der gelobte Standort gilt dann als Vorbild - der Code erkennt die Rolle eines Standorts im Satz nicht, er prüft nur diese Nachbarschaft. Ein Standort ohne diesen Rückhalt, der in einer Aufzählung neben gestützten Standorten steht, fällt samt seinem Bindewort aus der Aufzählung, und der Rest der Empfehlung bleibt - sofern es wirklich eine Aufzählung der Form „A, B und C“ ist (zuerst Kommas, dann „und“ - nach der Konjunktion kein Komma mehr): mindestens drei Standorte oder zwei, verbunden mit einer Konjunktion am Satzende, ohne Pluralsubstantiv direkt davor - und sofern direkt vor der Aufzählung eine Ortspräposition („in“, „an“, „für“, „bei“) oder ein Standort-Substantiv („des Standorts“, „im Objekt“) steht, die Aufzählung den Satz beendet und der Satz kein Zahlwort enthält (außer einer Zeit-, Betrags-, Prozent- oder Häufigkeitsangabe wie „alle zwei Wochen“) und kein „jeder“ oder „alle“. Sonst könnten sich der Rest des Satzes, ein Wort vor der Aufzählung („außer“, „zwischen“) oder eine Zahl („beide“, „in 3 Standorten“) gerade auf das entfernte Glied beziehen. In jedem anderen Fall entfällt die ganze Empfehlung, weil ein Komma zwischen zwei Namen die Grenze zweier Teilsätze sein kann und das Entfernen eines Namens den Sinn ändern würde. Eine Empfehlung ohne diese Grundlage wird gar nicht gedruckt statt nur teilweise, weil das Entfernen eines Satzes die Anweisung selbst wegnehmen konnte; nur ein abschließendes „… am Standort X“ wird aus dem Titel entfernt. Empfehlungen, die auf keinen Eintrag verweisen, beurteilt die Prüfung der Grundlage von Empfehlungen. In der Maßnahmentabelle für jeden Standort steht der Satz über das Halten des Standards nicht bei einem Standort, der im Dokument eine kritische oder wichtige Karte hat - er wird durch einen Verweis auf diese Karte mit der Zahl der Beschwerden dieses Standorts, sofern die Karte sie angibt, und der Empfehlung darunter ersetzt. Ein Standort mit Meldungen auf der Karte LEBEN / GESUNDHEIT erhält den Verweis auf sie auch dann, wenn die Maßnahme in der Tabelle von der Analyse stammt - diese Maßnahme steht hinter dem Verweis. Eine Empfehlung kommt nur dann in die Zeile eines Standorts, wenn sie keinen anderen Standort der Kette nennt. Bei einem Standort, dessen jüngste Bewertung älter als 12 Monate vor dem Ende des Berichtszeitraums ist, nennt das Dokument deren Datum in der Standorttabelle, im Kasten des besten und schlechtesten Standorts und in der Maßnahmentabelle - die Einschätzung eines solchen Standorts beschreibt den Stand von vor über einem Jahr.
Worin sich das vom Einfügen der Bewertungen in einen KI-Chat unterscheidet
Die häufigste Frage zu diesem Produkt lautet: Warum zahlen, wenn man Bewertungen in einen kostenlosen KI-Chat einfügen kann. Der erste Unterschied ist banal: Der Chat hat die Daten nicht. Google Maps gibt Bewertungen nicht bequem im Ganzen heraus - sie über den gesamten untersuchten Zeitraum zu sammeln, mit Daten und Sternebewertungen, ist eigene Arbeit, und alles Weitere wird auf diesem Bestand berechnet, nicht auf dem Ausschnitt, der in ein Gespräch passt.
Der zweite Unterschied ist das Zählen. Ein Modell, das Tausende Bewertungen auf einmal liest, zählt nicht - es schätzt. Nach der Zahl der Beschwerden über den Service gefragt, nennt es eine Zahl, die niemand prüfen kann. Hier wird jede Bewertung einzeln eingeordnet, und jede Zahl im Bericht ist eine vom Code berechnete Summe dieser Einzelurteile - und jede lässt sich wieder in konkrete Bewertungen zerlegen.
Der dritte Unterschied ist die Kontrolle. Die Antwort eines Chats ist ein erster Entwurf, den niemand prüft. Dieser Bericht durchläuft die oben beschriebenen Prüfungen - Belege unter den Karten, Duplikate, Abdeckung der Bereiche, nicht existierende Wörter - und die Stimmigkeit der Zahlen zwischen den Abschnitten sichert der Code, nicht das Gedächtnis des Modells. Hinzu kommen Regeln, die für jedes Unternehmen gleich gelten: Bedeutungsklassen, mit der Materialgröße skalierte Schwellen, am Zeitraum gemessene Aktualität.
Ehrlich gesagt: Bei einer Handvoll Bewertungen ist der Unterschied klein - ein guter Chat fasst einige Dutzend eingefügte Bewertungen vernünftig zusammen. Der Unterschied wächst mit dem Material: Bei Hunderten oder Tausenden Bewertungen, mehreren Standorten und einem langen Zeitraum ist eine Zusammenfassung in einem Durchgang weder zählbar noch nachprüfbar - und genau für Zählbarkeit und Nachprüfbarkeit steht dieses Dokument ein.
Wo die Daten täuschen können
Bewertungen beschreiben das, was Kundinnen und Kunden zu schreiben beschlossen haben. Zufriedene schreiben seltener als Enttäuschte, deshalb ist ein Bild aus Bewertungen nicht dasselbe wie ein Bild aus einer Befragung aller Kunden. Der Bericht misst die Stimme derer, die schreiben - und nur ihre.
Bei wenigen Bewertungen wiegt eine einzelne Äußerung sehr schwer. Der Bericht kennzeichnet solche Stellen mit einem Hinweis zur Stichprobengröße, doch der Hinweis ändert nichts am Wesen der Sache: Es bleibt ein Schluss aus dünnem Material, den eine einzige neue Bewertung umstoßen kann.
Der Abschnitt der historischen Themen schließt aus der Stille: Wenn frische Beschwerden fehlen, hat das Problem vermutlich aufgehört. Stille ist jedoch kein Beweis - Kundinnen und Kunden können aus anderen Gründen aufgehört haben zu schreiben, und das Problem kann fortbestehen. Das Wort „vermutlich” ist bei solchen Themen wörtlich zu nehmen.
Wo die Automatik irren kann
Bei mehrdeutigen Bewertungen - die eines loben und anderes bemängeln - kann die Einordnung falsch sein, und die Bewertung landet im falschen Bereich. Jede Zahl im Bericht erbt die Qualität dieser Einordnung: In einem Zähler aus Hunderten Bewertungen gehen einzelne Fehler unter, doch in einem Bereich mit einer Handvoll Bewertungen verschiebt ein einziger Fehler das Bild spürbar.
Die beschreibenden Texte schreibt ein Modell, also kommen Schreibmängel vor: Der Titel einer Karte kann eine Minderheit der behandelten Punkte betonen, eine Beschreibung kann einen Schritt weiter gehen, als der Beleg reicht, und im Text kann ein Tippfehler stehen, der ein Wort erzeugt, das es nicht gibt. Die oben beschriebenen Prüfungen fangen einen Teil solcher Mängel ab - nicht alle.
Auch die Prüfungen selbst sind fehlbar, und zwar in beide Richtungen. Wir haben sie vorsichtig eingestellt: Eine Prüfung ohne Gewissheit lässt den Text stehen, weil eine erzwungene Korrektur auch wahre Inhalte entfernen würde. Der Preis dieser Vorsicht ist, dass ein einzelner Mangel durch das Sieb rutschen kann - zum Beispiel können gelegentlich zwei Karten zu sehr ähnlichen Problemen nebeneinander stehen.
Die Aufteilung in systemische Probleme, Vorfälle und historische Themen beruht auf Schwellen für Anzahl und Frische der Signale, und jede Schwelle trennt etwas um Haaresbreite. Eine seltene, aber ernste Beschwerde kann unter den Vorfällen landen, obwohl Sie sie schwerer gewichten würden. Deshalb zeigt der Abschnitt der Vorfälle solche Signale offen, statt sie zu verbergen.
Die Beschwerdezahl an einer Karte bestimmt die Umfangsprüfung: Ein Sprachmodell markiert, welche Beschwerden vom Thema im Titel der Karte sprechen. Es tut dies dreimal, unabhängig voneinander, und eine Beschwerde zählt zur Karte, wenn mindestens zwei der drei Durchgänge sie markieren - ein einzelner Durchgang konnte derselben Karte auf denselben Bewertungen einmal ein Dutzend und einmal über hundert Beschwerden geben. Manchmal steht eine Problemkarte im Bericht ohne eigene Beschwerdezahl und ohne Gewichtungsplakette - sie trägt dann die Kennzeichnung „Gewichtung: nicht gemessen“. Das geschieht, wenn die Umfangsprüfung keine Bewertungen gefunden hat, die eindeutig vom engen Thema der Karte sprechen, oder wenn sie eine am Ende der Analyse hinzugefügte Karte nicht prüfen konnte. Statt die Zahlen der ganzen, breiteren Kategorie einzusetzen - die etwas anderes beschreiben würden, als der Titel besagt - zeigt der Bericht die Kategoriezahlen mit benannter Grundgesamtheit und räumt offen ein, dass er die Abdeckung dieses Themas nicht gemessen hat. Eine solche Karte ist als Signal zur eigenen Prüfung zu lesen, nicht als gemessener Befund. Eine auf einer solchen Karte beruhende Maßnahme wird ohne Kostenschätzung und ohne hohe Priorität gedruckt - eine Ausgabe für ein Problem, dessen Ausmaß der Bericht nicht gemessen hat, erhält im Bericht keine Kostenspanne.
Sehr selten lässt sich die grafische Ebene des Dokuments nicht setzen - bei einem ungewöhnlich langen Namen oder einem ungewöhnlichen Datensatz. Der Bericht erscheint dann in einfacher Form: vollständiger Inhalt, alle Zahlen und Zitate, ohne Diagramme und farbige Karten. Das Dokument sagt dies im ersten Absatz und nennt eine Adresse, unter der die vollständige Fassung angefordert werden kann. Lieber liefern wir einen Bericht ohne grafische Ebene als gar keinen.
Im Netzwerkbericht betrifft eine Problemkarte meist mehrere Standorte zugleich. Neben jedem Namen steht dann die Beschwerdezahl DIESES Standorts und die Zahl seiner Bewertungen mit Beschwerden: „Willa Hyrny 13 von 84“ bedeutet, dass dreizehn der vierundachtzig Bewertungen mit Beschwerden dieses Standorts das Thema der Karte betreffen. Die Reihenfolge in dieser Zeile richtet sich nach dem Anteil, nicht nach der bloßen Zahl - ein kleinerer Standort hat mitunter weniger Beschwerden und dennoch den schlechtesten Anteil und steht dann an erster Stelle. Die Aufschlüsselung erscheint nur, wenn die Teile die unter der Karte gedruckte Zahl ergeben und wenn sie für jeden genannten Standort berechenbar ist; andernfalls zeigt die Karte eine einzige Gesamtzahl, die nicht jedem Standort einzeln zugeschrieben werden darf.
Die Liste der Standorte an einer Karte - die Zeile „Betrifft“ - folgt den Belegen, nicht allein der Angabe des Modells. Findet die Umfangsprüfung bei einem genannten Standort keine einzige Bewertung zum Thema der Karte, wird sein Name aus dieser Liste entfernt; die Zahlen der Karte ändern sich dadurch nicht, weil dieser Standort nichts zu ihnen beigetragen hat. Eine Ausnahme: Ein Standort, den die Beschreibung der Karte namentlich nennt, bleibt in der Liste, und die Karte zeigt dann eine einzige Gesamtzahl ohne Aufschlüsselung. Fehlt ein Standort in der Liste, heißt das nicht, dass das Problem dort nicht auftritt - nur, dass die vom Bericht erfassten Bewertungen keinen Beleg dafür geliefert haben. Eine Karte, die die Prüfung der Bereichsabdeckung ergänzt hat, also dann, wenn ein Bereich mit sichtbarem Problem keine eigene Karte erhalten hat, zählt Beschwerden nur an den Standorten, die sie selbst nennt, nicht im gesamten Netzwerk.
Die Empfehlungen im Bericht entstehen allein aus Bewertungen und kennen weder Ihre Kosten noch Dienstpläne, Verträge oder Buchungsdaten. Sie sind zu prüfende Hypothesen, nicht das Ergebnis einer Betriebsprüfung: Der Bericht kann zeigen, wie viele Gäste seit wann über ein Problem schreiben, weiß aber nicht, ob die Ursache dort liegt, wo er vermutet, und ob die Behebung in Ihr Budget passt. Prüfen Sie sie vor jeder personellen, preislichen, betrieblichen oder investiven Entscheidung selbst.
Eine Empfehlung muss unter einer Karte stehen, die zum Handeln berechtigt. Eine Karte mit dem Status „Beobachten“ - ein Signal unterhalb der Schwelle für Volumen, Anteil oder Aktualität - zeigt der Bericht mit ihren Zahlen, druckt aber keine Empfehlung darunter: Er kann an derselben Stelle nicht zum Beobachten und zum Ausgeben auffordern. Dasselbe gilt für eine Empfehlung, die auf keine Karte, keinen Vorfall und kein historisches Thema dieses Dokuments verweist - sie fällt aus dem Bericht heraus, statt einen Vorbehalt zu erhalten. Die Ausnahme ist eine ausdrücklich als Erhaltungsmaßnahme gekennzeichnete Empfehlung in einem Bericht ohne aktuelle Schwächen. Gemessen an 586 gespeicherten Berichten (22. September 2026): Die Regel entfernt 1328 von 2785 Empfehlungen, davon standen 889 unter Karten „Beobachten“; in 126 Berichten bleibt keine Empfehlung übrig, und das Dokument sagt dies in seinem Hinweis zur Methode. Die meisten davon sind Berichte vor dem 4. August 2026, als Empfehlungen noch nicht auf eine Karte verweisen mussten: Unter den Berichten seit diesem Tag bleiben 14 von 184 ohne Empfehlung. Der Hinweis nennt, wie viele Empfehlungen herausgefallen sind, und wenn es alle waren, bleibt das Kapitel der Empfehlungen mit einem Satz im Dokument, der das sagt, statt zu verschwinden. Die Kennzeichnung „Instandhaltung“ rettet keine Empfehlung, die auf eine im Dokument nicht vorhandene Karte verweist.
Zur Überprüfung markierte Bewertungen
Über den Inhalt hinaus prüfen wir eine Sache anhand des Kalenders: ob Bewertungen in einer unnatürlichen Häufung aufgetreten sind. Wir teilen die Historie des Unternehmens in überschneidungsfreie Zwei-Wochen-Fenster und zählen, wie viele Bewertungen in jedes davon fallen. Die Schwelle ist keine einheitliche Zahl - wir bestimmen sie für jedes Unternehmen einzeln aus einer an seine eigene Historie angepassten Verteilung, sodass gewöhnliche Schwankungen des Aufkommens sie nur selten überschreiten. Häufungen zählen wir getrennt in zwei Reihen niedriger Bewertungen - in den Ein-Stern-Bewertungen allein und in Ein- und Zwei-Stern-Bewertungen zusammen -, denn eine Häufung der niedrigsten Bewertungen bedeutet etwas anderes als eine gewöhnliche schlechte Woche. Für die Hälfte der Unternehmen unseres Bestands liegt die Schwelle bei drei solchen Bewertungen in zwei Wochen; bei einem Unternehmen mit dichterem Aufkommen kann sie fast viermal so hoch sein. Drei- und Vier-Stern-Bewertungen gehen in diese Rechnung nicht ein: Wir haben das an unserem gesamten Bestand gemessen, und ihre Einbeziehung verdoppelte die Zahl der Fehlanzeigen nahezu, ohne die Erkennung tatsächlicher Häufungen zu verbessern. Bei den meisten der untersuchten Unternehmen ergäbe die Rechnung allein eine noch niedrigere Schwelle - unter drei Bewertungen gehen wir jedoch nie, denn zwei Bewertungen in zwei Wochen sind eine gewöhnliche Woche und kein Muster. Die Prüfung findet nicht statt, wenn die Historie kürzer als etwa drei Monate ist, denn aus einer kürzeren lässt sich nicht bestimmen, was für ein Unternehmen üblich ist. Seit dem 6. September 2026 läuft die Prüfung bei jeder Synchronisierung der Bewertungen, und ihr Ergebnis erscheint im Unternehmensbereich auf einem eigenen Reiter - zusammen mit der Angabe, welche Bewertungen betroffen sind. Dafür muss kein Bericht erstellt werden.
Eine Häufung allein entscheidet nichts und genügt nicht, um eine Bewertung zu markieren. Sie wird dem Modell als Indiz übergeben, und das Modell darf eine Bewertung erst dann markieren, wenn es mindestens zwei unabhängige Anhaltspunkte findet; im Zweifel soll es nicht markieren. Scharfe, aber konkrete und glaubwürdige Kritik an einem tatsächlichen Besuch ist kein Grund für eine Markierung.
Eine Markierung ist eine Information, kein Urteil. Wir stellen nicht fest, dass eine Bewertung unwahr ist, und wir bewerten nicht die Person, die sie geschrieben hat. Markierte Bewertungen BLEIBEN in allen Zahlen des Berichts - in der Durchschnittsbewertung, in der Sterneverteilung und in den Stimmungsanteilen - eben weil die Markierung ein Hinweis zum Prüfen ist und keine Entscheidung. Ob eine Bewertung gegen die Richtlinien von Google Maps verstößt, entscheidet allein Google.
Wir erkennen nicht jede koordinierte Aktion, und wir sagen das ausdrücklich. Die Prüfung erfasst BEIDE Familien von Bewertungen - die niedrigen und die mit fünf Sternen -, denn über die Unnatürlichkeit entscheidet der Rhythmus, in dem Bewertungen eingehen, und nicht, ob sie freundlich sind. Die beiden Listen dieses Dienstes haben allerdings einen unterschiedlichen Umfang, und dieser Unterschied gehört benannt: Die Liste der Ansammlungen im Bereich umfasst ausschließlich Bewertungen mit 1 und 2 Sternen, denn nur auf diesen zählen wir Ansammlungen; die Liste der markierten Bewertungen im Bericht selbst umfasst Bewertungen von 1 bis 4 Sternen. In der Untersuchung selbst kann nur ein Zeitraum mit Bewertungen von 1 und 2 Sternen ein markierter Zeitraum sein: einen ungewöhnlichen Zustrom von Lob markieren wir dort nicht als Zeitraum, denn daraus folgt für Sie keine Handlung - Fünf-Sterne-Bewertungen melden wir nicht. Wir zählen sie dennoch weiter, und das wirkt in die andere Richtung: kamen zur selben Zeit auch mehr der übrigen Bewertungen hinzu, so erklärt sich der Beschwerdezeitraum durch das gewöhnliche Aufkommen im Betrieb, und wir nennen daraus keine Kandidaten. Lob auf Ihrem eigenen Profil beanstanden wir nicht: Wir informieren Sie darüber gesondert, ohne einzelne Bewertungen zu benennen, denn Google bestraft Unternehmen für gekaufte Bewertungen auch dann, wenn jemand anderes sie bestellt hat. Ein über die Zeit gestrecktes Vorgehen sehen wir ebenfalls schlechter: eine über mehrere Fenster verteilte Häufung hebt an, was für das Unternehmen üblich ist, und verbirgt sich dadurch teilweise darin. Das Fehlen einer Markierung bedeutet daher nicht, dass nichts geschehen ist. Seit dem 8. September 2026 ist die Prüfung der zeitlichen Verteilung selbst eine eigene, kostenpflichtige Untersuchung von Bewertungshäufungen - sie lässt sich ohne Konto bestellen oder zum einmaligen Bericht hinzufügen. Im Dienst wird diese Leistung unter dem Namen „Bewertungsprüfung nach den Google-Regeln” geführt. Ergebnis der Untersuchung ist eine Seite mit den markierten Zeiträumen und den Bewertungen, die zu ihnen gehören; der Bericht nennt daraus nur die Zahl der Zeiträume. In der Untersuchung liest ein Sprachmodell zusätzlich den Text jeder Bewertung des Betriebs - unabhängig von der Sternzahl und ohne Begrenzung ihrer Zahl - und entscheidet über genau eines: ob die Äußerung selbst gegen die auf Google Maps geltenden Inhaltsrichtlinien verstößt - etwa obszöne Sprache, Werbung oder einen Angriff auf eine konkrete Person enthält. Die Sternzahl allein qualifiziert keine Bewertung für die Liste - das tut allein ihr Wortlaut. Eine Einschränkung wirkt in die andere Richtung: Fünf-Sterne-Bewertungen setzen wir NICHT auf die Meldeliste, auch wenn sie gegen die Inhaltsrichtlinien verstoßen. Wir raten von einer Meldung ab: die Entfernung eines Lobs würde Ihre Bewertung senken und damit genau dem Zweck zuwiderlaufen, für den Sie diese Leistung bestellt haben. Wir lesen sie trotzdem, damit die Auswahl nicht allein der Negativität folgt. Das Modell liest jede Bewertung zweimal und unabhängig voneinander; ein in einem der beiden Durchgänge erkannter Verstoß kommt auf die Liste - in unserer Messung übersah ein einzelner Durchgang zwischen wenigen und dreißig Prozent der Verstöße, die der zweite fand (im Mittel etwa jeden sechsten). Obszöne Wörter sichert zusätzlich ein Wörterbuch in unserem Code ab: erkennt keiner der beiden Durchgänge des Modells einen im Text stehenden Kraftausdruck, kommt die Bewertung trotzdem mit diesem Wort als Zitat auf die Liste - in unserer Messung übersah das Modell fast zwei von fünf solchen Wörtern. Eine Bewertung aus einem markierten Zeitraum ohne eigenen Verstoß zeigen wir nur dann als Kandidatin für die Entscheidung der Kundin oder des Kunden, wenn sich der Zeitraum nicht durch das allgemeine Aufkommen des Betriebs erklärt (keine Zunahme der übrigen Bewertungen zur selben Zeit) und der Text keine konkreten Angaben zu einem Besuch enthält; die Entscheidung liegt bei der Kundin oder dem Kunden. Die Begründung einer Meldung entsteht in zwei Schritten. Die Fakten - Verstoßkategorie, wörtlicher Ausschnitt der Bewertung, Daten und Zahlen des Zeitraums sowie das Zitat der Google-Maps-Regel - legt unser Code fest. Ein Sprachmodell formt daraus Sätze. Das Ergebnis wird anschließend automatisch geprüft: Einen Text, der eine Zahl, ein Zitat oder eine Behauptung außerhalb der Faktenmenge enthält, verwerfen wir und setzen stattdessen eine fertige Vorlage ein. Einen Satz, der die Wahrheit einer Bewertung oder ihre Verfasserin oder ihren Verfasser beurteilt, schreibt weder das Modell noch der Code - Google entscheidet über einen Regelverstoß, nicht über die Wahrheit einer Äußerung. In unserer Messung am gesamten Bestand (8. September 2026, über zwölftausend Bewertungen mit Text) wies weniger als eine von hundert Bewertungen einen solchen Verstoß auf, die Liste ist also oft kurz oder leer.
Was dieser Bericht nicht leistet
Er umfasst keine Bewertungen aus anderen Diensten als Google Maps und keine Vorfälle, über die niemand geschrieben hat.
Er ist keine Rechts-, Steuer- oder Anlageberatung. Kostenspannen sind Richtwerte und dienen dazu, die Reihenfolge der Arbeiten festzulegen, nicht dazu, Leistungen ohne eigene Prüfung zu beauftragen.
Der Anteil künstlicher Intelligenz
Die beschreibenden Inhalte des Berichts - der Fließtext, die Problembeschreibungen und die vorgeschlagenen Maßnahmen - entstehen unter Mitwirkung eines Sprachmodells. Wir legen das in jedem Bericht offen.
PDF-Dateien tragen zusätzlich eine maschinenlesbare Kennzeichnung, die angibt, dass der Inhalt von einem System künstlicher Intelligenz erzeugt wurde. Das entspricht Artikel 50 Absatz 2 der Verordnung (EU) 2024/1689 - der KI-Verordnung der Europäischen Union.
Regeln zu Kauf, Zahlung und Beschwerden stehen in den Nutzungsbedingungen. Diese Seite ersetzt und ändert sie nicht.