Dieses Buch stellt verschiedene Algorithmen zur Berechnung semantischer Ähnlichkeiten zwischen englischen Texten vor. Ich habe drei verschiedene Algorithmen zur Berechnung der Ähnlichkeit englischer Sätze untersucht. Der erste Algorithmus, der in der Literatur gut erforscht ist [Salton und Buckley, 1988; Wu und Salton, 1981], gewichtet Wörter in jedem Satz entsprechend der Termhäufigkeit und der inversen Dokumenthäufigkeit (tf-idf) und verwendet keine semantischen Informationen. Der zweite Algorithmus nutzt Maße für den semantischen Abstand zwischen Wörtern derselben Wortart. Der dritte Algorithmus kombiniert die tf-idf-Werte mit den Werten für den semantischen Abstand zwischen Wörtern. Ich habe die Leistung des zweiten und dritten Algorithmus anhand von zwei Datensätzen bewertet: O'Sheas Datensatz mit Satzpaaren und von Menschen vorgenommenen Ähnlichkeitsbeurteilungen [Li et al., Aug, Rubenstein und Goodenough, 1965] sowie dem Datensatz von Microsoft Research zu Paraphrasen auf Satzebene [Rus et al., 2012]. Auf O'Sheas Datensatz stimmt der dritte Algorithmus genauer mit den menschlichen Bewertungen überein als der zweite. Auf dem Microsoft-Datensatz gab es keinen signifikanten Unterschied zwischen den beiden Algorithmen.