WDF*IDF

WDF*IDF ist ein Verfahren zur Gewichtung von Begriffen in Texten. Es setzt die Häufigkeit eines Worts innerhalb eines Dokuments ins Verhältnis dazu, wie verbreitet dieses Wort in einer Sammlung von Vergleichsdokumenten ist. Ein Begriff, der in einem Text oft vorkommt, aber in den meisten anderen Texten selten, ist demnach charakteristisch für diesen Text.

Gleich vorweg, weil es die Einordnung des ganzen Eintrags bestimmt: WDF*IDF ist ein Werkzeugkonzept aus dem deutschsprachigen SEO. Google hat es nie als Bestandteil seines Rankings bestätigt, und niemand außerhalb des Unternehmens kann sagen, ob und in welcher Form etwas Ähnliches dort verwendet wird. Das macht die Methode nicht wertlos — es macht sie zu einer Analysehilfe statt zu einer Vorgabe.

Wie die Formel funktioniert

WDF steht für within document frequency, die Häufigkeit innerhalb des Dokuments. Anders als die einfache Keyword-Dichte, die schlicht Vorkommen durch Gesamtwortzahl teilt, wird der Wert logarithmisch gedämpft. Das ist der entscheidende Unterschied: Die zehnte Wiederholung eines Begriffs erhöht den Wert deutlich weniger als die zweite. Wer ein Wort ständig wiederholt, treibt die Kennzahl also kaum noch nach oben.

IDF steht für inverse document frequency, die umgekehrte Dokumenthäufigkeit. Sie misst, in wie vielen Dokumenten eines Vergleichskorpus der Begriff überhaupt auftaucht. Wörter wie „und“ oder „Website“ kommen fast überall vor und bekommen dadurch ein niedriges Gewicht; ein Fachbegriff, der nur in wenigen Dokumenten steht, ein hohes.

Multipliziert ergibt das eine Termgewichtung: hoch für Begriffe, die im vorliegenden Text prominent und im Vergleichskorpus selten sind. Genau darin liegt der Nutzen — die Formel beantwortet nicht die Frage „wie oft soll ich das Wort schreiben“, sondern „welche Begriffe machen die Texte aus, die zu diesem Thema bereits gut ranken“.

Herkunft

Die Formel ist keine SEO-Erfindung, sondern stammt aus dem Information Retrieval. Der IBM-Forscher Hans Peter Luhn beschrieb 1957 die Idee, die Häufigkeit von Begriffen als Maß für ihre Bedeutung in einem Dokument zu verwenden. Die zweite Hälfte — die Gewichtung anhand der Seltenheit über einen Dokumentenbestand hinweg — geht auf Karen Spärck Jones zurück, die sie 1972 ausformulierte. Zusammen ergibt das TF*IDF, eines der ältesten und meistgenutzten Verfahren der Dokumentenanalyse; es steckt bis heute in Suchbibliotheken, Textklassifikation und Empfehlungssystemen.

Die deutsche Schreibweise mit WDF statt TF sowie die Verwendung im SEO gehen auf den Online-Marketing-Fachmann Karl Kratz zurück, der das Konzept 2012 in die Diskussion brachte. Sein Argument richtete sich damals gegen die Keyword-Dichte, die als Zielgröße mit Prozentwerten zwischen zwei und drei Prozent kursierte. Dass diese Vorstellung falsch war, gilt heute als unstrittig — Google hat mehrfach klargestellt, dass es keine ideale Keyword-Dichte gibt.

Was die Werkzeuge tatsächlich liefern

Die gängigen Werkzeuge laden die Texte der vordersten Suchergebnisse zu einem Keyword, berechnen die Termgewichte und stellen sie dem eigenen Text gegenüber. Herauskommt eine Liste von Begriffen, die in den Vergleichstexten regelmäßig vorkommen, im eigenen aber fehlen.

Diese Liste ist der eigentliche Wert. Sie zeigt keine Optimierungsziele an, sondern thematische Lücken. Wenn ein Text über Fenstersanierung die Begriffe Wärmedurchgangskoeffizient, Förderung, Schallschutzklasse und Einbausituation nicht enthält, obwohl alle konkurrierenden Texte sie behandeln, ist das ein brauchbarer Hinweis — nicht darauf, welche Wörter fehlen, sondern darauf, welche Fragen unbeantwortet bleiben.

Der Fehler beginnt dort, wo aus dem Hinweis eine Zielvorgabe wird. Ein Text, der Begriffe einbaut, um einen Balken in einem Werkzeug auf Sollhöhe zu bringen, liest sich genau so. Und die Vergleichsbasis ist wackliger, als die Darstellung suggeriert: Zehn Ergebnisseiten sind ein kleiner Korpus, ihre Zusammensetzung wechselt, und Nebenelemente wie Navigation, Fußzeilen oder Cookie-Hinweise fließen je nach Werkzeug mit ein.

Grenzen des Verfahrens

Die Methode zählt Zeichenketten. Sie erkennt weder Synonyme noch Umschreibungen, weder Verneinungen noch Bezüge über Satzgrenzen hinweg. „Kein Anspruch auf Rückerstattung“ und „Anspruch auf Rückerstattung“ sind für sie fast dasselbe. Sie kennt keine Suchintention und keine Textsorte — eine Kategorieseite mit zwanzig Produkten wird mit Ratgebertexten verglichen, obwohl sie eine ganz andere Aufgabe hat. Und sie bewertet Wortmaterial, nicht Aussagen: Ob ein Text richtig liegt, ob er etwas beiträgt und ob jemand ihm glaubt, steht außerhalb ihrer Reichweite.

Für Shops mit kurzen Produkttexten ist sie deshalb kaum brauchbar. Wo ein Datenblatt genügt, führt der Vergleich mit ausführlichen Ratgebern in die Irre.

Wo semantische Verfahren übernommen haben

Der wichtigere Einwand ist ein grundsätzlicher: Suchmaschinen arbeiten längst nicht mehr primär mit Wortübereinstimmungen. Mit dem Hummingbird-Update 2013 begann Google, Suchanfragen als Ganzes zu interpretieren statt als Wortliste. 2019 kam BERT hinzu, ein Sprachmodell, das die Bedeutung eines Worts aus seinem Satzkontext ableitet — womit Präpositionen und Wortstellung plötzlich eine Rolle spielten. 2021 folgte MUM, das über Sprachen und Formate hinweg arbeitet. Und die Passage-Bewertung ermöglicht es, einen einzelnen Abschnitt eines langen Textes als Antwort auszuwählen, auch wenn der Rest der Seite von etwas anderem handelt.

Für ein Verfahren, das Wortfrequenzen zählt, bedeutet das eine deutliche Relativierung. Ein Text muss ein Wort nicht mehr enthalten, um für dessen Suchbegriff zu ranken. Die verwandte Idee der latent semantischen Optimierung beschreibt denselben Übergang aus einer anderen Richtung.

Sinnvoll bleibt WDF*IDF damit als das, was es immer war: ein Recherchewerkzeug, mit dem sich vor dem Schreiben die Umrisse eines Themas abstecken lassen. Was danach den Ausschlag gibt, sind Vollständigkeit, Genauigkeit und Eigenständigkeit des Inhalts — worauf es dabei ankommt, beschreibt der Eintrag zu Unique Content, und wie der Text in das Gesamtbild der Rankingfaktoren passt, der entsprechende Eintrag.