Proses mengidentifikasi dan menghilangkan record duplikat dalam dataset untuk memastikan setiap entitas hanya diwakili sekali, meningkatkan akurasi analisis dan laporan.
Deduplication (dedup) adalah proses menemukan dan menghilangkan record yang merepresentasikan entitas yang sama namun muncul lebih dari sekali dalam dataset - baik karena input ganda, integrasi sistem, atau kesalahan proses.
| Strategi | Kapan Digunakan | Teknik |
|---|---|---|
| Keep first | Record terlama lebih dipercaya | ORDER BY created_at ASC |
| Keep last | Record terbaru lebih akurat | ORDER BY updated_at DESC |
| Keep most complete | Maksimalkan kelengkapan data | Hitung non-null columns |
| Merge | Gabungkan atribut terbaik dari tiap duplikat | COALESCE antar record |
Ukuran seberapa baik data memenuhi kebutuhan penggunaannya, mencakup enam dimensi utama: akurasi, kelengkapan, konsistensi, aktualitas, validitas, dan keunikan.
Proses mengidentifikasi dan memperbaiki data yang tidak akurat, tidak lengkap, duplikat, atau tidak konsisten dalam sebuah dataset agar siap digunakan untuk analisis.
Proses memastikan data memenuhi aturan, constraint, dan standar format yang telah ditentukan sebelum digunakan dalam analisis, pelaporan, atau sistem produksi.
Proses analisis statistik dan struktural terhadap dataset untuk memahami karakteristik, distribusi, dan kualitas data sebelum melakukan transformasi atau analisis lebih lanjut.
Udah paham Deduplication? Lanjut latihan SQL dan Excel yuk!
Latihan interaktif, langsung di browser.