Login
Login
Analisis perbandingan Cosine dan Jaccard Similarity dengan TF-IDF dan bert sentence transformer untuk deteksi duplikasi dokumen
Deteksi duplikasi dokumen merupakan tantangan penting dalam bidang pengolahan teks, khususnya untuk mengidentifikasi tingkat kemiripan antar dokumen. Permasalahan ini semakin relevan seiring dengan meningkatnya volume dokumen digital yang beredar di berbagai platform. Untuk mengatasi hal tersebut, diperlukan pendekatan yang mampu mengenali kemiripan baik secara leksikal maupun semantik. Penelitian ini membandingkan performa empat kombinasi metode deteksi kemiripan dokumen, yaitu: (1) TF-IDF dengan FastText dan Cosine Similarity, (2) TF-IDF dengan FastText dan Weighted Jaccard Similarity, (3) BERT dengan Cosine Similarity, dan (4) BERT dengan Weighted Jaccard Similarity. Dataset yang digunakan adalah PAN-PC-11, sebuah benchmark standar dalam penelitian deteksi duplikasi dokumen yang berisi pasangan dokumen berbahasa Inggris. Evaluasi dilakukan menggunakan metrik precision, recall, dan F1-score, dengan ambang batas minimum kemiripan sebesar 0,27 untuk Cosine Similarity dan 0,23 untuk Weighted Jaccard Similarity. Hasil dari penelitian ini bertujuan mengidentifikasi kombinasi encoder dan metode pengukuran kemiripan yang paling optimal dalam mendeteksi duplikasi dokumen, ditinjau dari nilai F1-score tertinggi. Proses pengujian masih berlangsung dan hasil akhir akan dilaporkan setelah seluruh kombinasi diuji secara menyeluruh.
Program Studi Informatika
Universitas Kristen Petra
2025
Indonesian
S1
Skripsi No. 010226664/INF/2025; Jane Iolana (C14210122)
Similar collections by theme
Similar collections by subject
Close
Download QR code