Journals / Bilgisayar Bilimleri ve Mühendisliği Dergisi / 2021 / Cilt: 14 - Sayı: 2

Data Deduplication with Text Similarity Algorithms: An Application in a Hotels Database

Metin Benzerliği Algoritmaları ile Veri Tekilleştirme: Oteller Veri Tabanında Bir Uygulama

Pages
86–98
DOI
—

Abstract

Deduplication is a great need in the world of data that is growing rapidly and uncontrolled. Data deduplication is a technique used to eliminate duplicate copies of data in the database or to identify and describe them with an Id. Finding a hotel with a different name and ID in the records in the database of hotels with name, address, agency, and price information does not allow comparison. Competitor analysis can be done completely, knowing competitor price situations and market follow-up is possible by singularization of all these hotel names. The purpose of this study is to identify identical hotels with a single identification number by matching hotel names and to obtain singular data. Various text similarity algorithms are used for deduplication. In this study, Text Similarity algorithms; Hotels were compared in the database over hotel names. Distance edit based similarity, token based similarity, sequence based similarity algorithms and fuzzy string matching algorithms were examined. As a result of the study, a hybrid model in which Fuzzy String Matching algorithm and Jaro Winkler distance are used together is proposed. Model; In the comparison made over the test data set, it gave 94% Accuracy results in the easy data set and 83% Accuracy in the difficult data set.

Özet

Hızla ve kontrolsüzce artan veri dünyasında, veri tekilleştirme büyük bir ihtiyaçtır. Veri tekilleştirme, veri tabanında yinelenen verilerin kopyalarını ortadan kaldırmak ya da onları tespit ederek, eşsiz kimlik numarası ile betimlemek için kullanılan bir tekniktir. Oteller veri tabanında; ismi, adresi, acente bilgisi, ve fiyat bilgisi bulunan bir otelin, kayıtlarda farklı isim ve kimlik numaları ile bulunması, karşılaştırma olanağı sunmamaktadır. Rakip analizinin tam anlamıyla yapılabilmesi, rakip fiyat durumlarının bilinmesi ve pazar takibi bütün bu otel isimlerinin tekilleştirilmesi ile mümkündür. Bu çalışmanın amacı,otel isimlerini eşleştirerek, eş olan otelleri tek bir kimlik numarası ile tanımlamak ve tekil veriyi elde etmektir.Veri tekilleştirme için çeşitli metin benzerliği algoritmaları kullanılır. Bu çalışmada, Metin Benzerliği algoritmaları otel isimleri üzerinden karşılaştırılmıştır. Mesafe düzenleme bazlı benzerlik, belirteç bazlı benzerlik, diziliş tabanlı benzerlik algoritmaları ile bulanık dize eşleme algoritmaları incelenmiştir. Çalışmanın sonucunda Bulanık dize eşleme algoritmasının ve Jaro Winkler mesafesinin birlikte kullanıldığı hibrit bir model önerilmiştir.