Skip to main content
Isometrische Skizze einer Lupe, die zwei Dokumente auf Ähnlichkeiten untersucht.

Ab wann ist es Duplicate Content? Toleranzen und Lösungen

8 Min. Lesezeit

Die Pflege umfangreicher Webprojekte bringt eine ständige Herausforderung mit sich: die Einzigartigkeit aller veröffentlichten Texte. Oft fragen sich Content-Verantwortliche, ab wann ist es Duplicate Content und wann handelt es sich lediglich um eine harmlose inhaltliche Überschneidung. Sobald identische oder extrem ähnliche Informationen über mehrere URLs erreichbar sind, stehen Suchmaschinen vor einem Bewertungsproblem. Sie müssen entscheiden, welche Variante das Original darstellt. Dieser Konflikt kostet wertvolle Ressourcen beim Crawling und führt dazu, dass im schlimmsten Fall die falsche Unterseite in den Suchergebnissen erscheint.

Ab wann ist es Duplicate Content für Suchmaschinen?

Suchmaschinen wie Google priorisieren stets originelle und nützliche Informationen. Doppelte Inhalte verwässern diesen Anspruch, da sie keinen zusätzlichen Mehrwert bieten. Grundsätzlich unterscheidet man bei der Bewertung zwischen exakten Duplikaten und inhaltlich sehr ähnlichen Seiten. Ein exaktes Duplikat entsteht, wenn derselbe Quellcode und Text unter zwei verschiedenen Internetadressen aufgerufen werden kann.

Komplizierter wird es beim sogenannten Near Duplicate Content. Dies bezeichnet Textpassagen, die kopiert, aber in Nuancen abgeändert wurden. Auch Seiten, die zwar einen identischen Haupttext besitzen, sich aber in wiederkehrenden Navigationselementen oder Fußzeilen unterscheiden, fallen in diese Kategorie. Für die Suchmaschine ist der reine Informationsgehalt entscheidend. Wenn zwei Seiten exakt dieselbe Suchintention mit den gleichen Argumenten und Formulierungen bedienen, wertet der Algorithmus dies als doppelten Inhalt.

Wie viel Prozent Duplicate Content ist erlaubt?

Immer wieder taucht die Frage auf, wie viel Prozent Duplicate Content ist erlaubt, bevor eine Seite ihre Sichtbarkeit verliert. Aus dubiosen Black-Hat-SEO-Kreisen geistert oft ein Wert von 70 Prozent Textgleichheit durch das Netz. Demnach würde eine Seite angeblich noch indexiert werden, solange sie knapp unter dieser Schwelle bleibt. Diese Annahme stützt sich auf manipulative Praktiken wie das massenhafte automatisierte Umschreiben von Texten für den Linkaufbau.

Für seriöse Webprojekte ist diese prozentuale Grenze jedoch ein gefährlicher Mythos. Inhalte auf Ihrer Website sollten immer einzigartig sein. Suchmaschinen arbeiten nicht mit starren Prozentwerten, sondern bewerten den Gesamtkontext einer URL. Ein kurzer, korrekter Zitatblock auf einer ansonsten tiefgründig ausgearbeiteten Seite stellt kein Problem dar. Wenn jedoch der Kern einer Seite nur aus zusammenkopierten Fremdtexten besteht, wird Google diese URL schlichtweg ignorieren. Ressourcen für die Indexierung werden dort eingesetzt, wo echter Nutzerwert entsteht.

Prozentuale Skala, die einen kritischen Wert bei der Inhaltsprüfung anzeigt.

Führt eine Textgleichheit zu einer SEO-Strafe?

Viele Webmaster befürchten, dass ihre gesamte Domain abgestraft wird, sobald doppelte Texte auftauchen. Die gute Nachricht: Führt reine Textgleichheit zu einer SEO-Strafe? Nein, eine manuelle Abstrafung durch Google wegen technisch bedingtem Duplicate Content existiert nicht. Die Suchmaschine erkennt, dass CMS-Systeme oft ungewollt Duplikate erzeugen, und filtert die überflüssigen Ergebnisse lediglich aus den Suchtreffern heraus.

Es droht also keine klassische Penalty für die Domain. Die Ranking-Signale, wie etwa eingehende Backlinks, verteilen sich jedoch ungünstig auf mehrere Versionen derselben Seite. Dadurch rankt keine der URLs so gut, wie sie es als gebündeltes Original könnte. Gefährlich wird es erst bei einer klaren Täuschungsabsicht. Wer massenhaft fremde Texte automatisiert kopiert, um Suchmaschinen zu manipulieren, verstößt gegen die Qualitätsrichtlinien von Google. Ein solcher Content-Diebstahl zieht spürbare Rankingverluste nach sich – oft eine Ursache, wenn der organische Traffic plötzlich ohne Update sinkt – oder führt sogar zum kompletten Ausschluss der Domain aus dem Index.

Typische Ursachen für doppelte Inhalte

In den seltensten Fällen entstehen Duplikate aus böser Absicht. Meist stecken technische Fallstricke oder unbedachte redaktionelle Prozesse hinter dem Problem. Man unterscheidet dabei grob in interne Fehlerquellen auf der eigenen Domain und externe Faktoren.

Interne technische Duplikate

Gerade komplexe Content-Management-Systeme und Online-Shops neigen dazu, denselben Text mehrfach auszugeben. Dies geschieht häufig ohne das Wissen der Redaktion. Zu den klassischen Auslösern gehören:

  • URL-Parameter: Sortierungen, Filter oder Tracking-Kürzel in der Adresse generieren unzählige neue URLs für identische Inhalte.
  • Erreichbarkeit: Wenn eine Seite parallel mit und ohne "www" oder über "http" und "https" aufrufbar ist.
  • Groß- und Kleinschreibung: Uneinheitliche Schreibweisen im Pfad werden oft als separate Dokumente gewertet.
  • Druckversionen: Spezielle Layouts für den Ausdruck, die nicht für Suchmaschinen gesperrt sind.
  • Wiederkehrende Textblöcke: Zu lange, identische Beschreibungen in der Seitenleiste oder im Footer verringern die Einzigartigkeit jeder Unterseite.

Externe Inhaltsdopplungen

Externer Duplicate Content entsteht, wenn Ihre Texte auf fremden Domains auftauchen. Das passiert oft bei der ungefilterten Übernahme von Herstellerbeschreibungen in Online-Shops. Hunderte Händler nutzen exakt denselben Text, wodurch ein Ranking kaum noch möglich ist. Auch Pressemitteilungen, die über zahlreiche Portale unverändert verbreitet werden, fallen in diese Kategorie. Besondere Vorsicht ist bei Scrapern geboten: Das sind automatisierte Programme, die Ihre hochwertigen Texte auslesen und ungefragt auf minderwertigen Seiten veröffentlichen, um Werbeeinnahmen zu generieren.

Trichter bündelt verschiedene URL-Pfade zu einem Hauptpfad.

Was zählt nicht als doppelter Inhalt?

Nicht jede inhaltliche Überschneidung alarmiert die Crawler. Bestimmte Formen der Wiederholung sind technisch notwendig oder redaktionell erwünscht. Solange die Signale klar gesetzt sind, reagieren Suchmaschinen sehr tolerant. Unkritisch sind in der Regel:

  • Sprachvarianten: Korrekt übersetzte Texte für verschiedene Ländermärkte gelten als eigenständige Inhalte, sofern sie technisch sauber gekennzeichnet sind (hreflang).
  • Zitate: Kurze, themenrelevante Auszüge aus anderen Quellen mit korrekter Nennung des Ursprungs.
  • Paginierungen: Mehrseitige Artikel oder paginierte Kategorieseiten kann Google heute gut als zusammenhängendes Konstrukt verstehen.

Maßnahmen zur Auflösung und Vermeidung

Um Suchmaschinen die Orientierung zu erleichtern, müssen klare Vorgaben geschaffen werden. Werden alternative URLs nicht benötigt, sollten sie durch eine permanente 301-Weiterleitung auf das Original umgeleitet werden. So vererben sich auch wertvolle Link-Signale auf die Hauptseite. Ist eine Duplizierung aus technischen Gründen unvermeidbar – etwa durch Filter in einem Shop – weist ein kanonischer Verweis im Quelltext die Suchmaschine verlässlich auf die bevorzugte Original-URL hin.

Bei einem Website-Relaunch passieren ebenfalls häufig Fehler. Testumgebungen, auf denen die neue Seite aufgebaut wird, dürfen für Crawler niemals frei zugänglich sein. Sichern Sie solche Entwicklungsbereiche immer durch einen Passwortschutz auf Serverebene ab. Bieten Sie zudem HTML-Seiten parallel als PDF-Download an, steuern Sie die Indexierung des PDFs über den HTTP-Header, um internen Konkurrenzkampf zu vermeiden.

Klare Signale für langfristige Sichtbarkeit

Das Management von Textgleichheiten ist eine stetige Aufgabe in der Suchmaschinenoptimierung. Wer die Relevanz seiner Inhalte erhalten möchte, verzichtet auf kopierte Textbausteine und steuert technisch bedingte Duplikate konsequent aus. Eine saubere Informationsarchitektur schont nicht nur das Crawl-Budget, sondern bündelt auch alle positiven Ranking-Signale auf den URLs, die tatsächlich für den Nutzer gedacht sind. So vermeiden Sie interne Konkurrenz und stärken die Relevanz Ihrer Kernseiten nachhaltig.

Häufige Fragen zu ähnlichen und identischen Texten

Bei der redaktionellen Arbeit tauchen oft Detailfragen zur Bewertung von Textgleichheiten auf. Hier finden Sie klare Antworten auf praxisnahe Unsicherheiten.

Was versteht man unter Near Duplicate Content?

Dies bezeichnet Texte, die nicht exakt gleich sind, aber eine sehr hohe Ähnlichkeit aufweisen. Das passiert, wenn kopierte Artikel nur leicht umgeschrieben werden oder wenn Seiten identischen Inhalt haben, sich aber in der Navigation oder den Sidebar-Elementen unterscheiden.

Schadet Boilerplate-Text dem Ranking?

Boilerplate-Texte sind wiederkehrende Blöcke in Seitenleisten oder Fußzeilen. Wenn diese zu lang sind und auf jeder URL auftauchen, mindern sie den Anteil der einzigartigen Inhalte pro Seite. Dies kann die thematische Relevanz der einzelnen URL verwässern.

Sind PDF-Dateien ein Risiko für Textduplikate?

Ja, wenn der Text einer normalen HTML-Seite zusätzlich 1:1 als PDF-Download zur Verfügung steht und von Suchmaschinen indexiert werden kann. In diesem Fall konkurrieren PDF und HTML-Seite in den Suchergebnissen miteinander.

Wie schütze ich Testumgebungen vor Indexierung?

Test- oder Staging-Umgebungen sollten niemals durch einfache Meta-Tags blockiert, sondern hart über die Serverkonfiguration (z. B. via .htaccess) mit einem Passwortschutz versehen werden. So haben Crawler garantiert keinen Zugriff auf die noch unfertigen Duplikate.

Zählen Übersetzungen als Duplikate?

Nein, inhaltlich korrekt übersetzte Seiten werten Suchmaschinen als eigenständigen Content. Voraussetzung ist jedoch, dass die Sprachversionen technisch sauber über das hreflang-Attribut den jeweiligen Ländermärkten zugeordnet sind.