TL;DR
Data mining adalah proses nemuin pola yang berguna dari kumpulan data besar pakai teknik statistik dan machine learning. Empat teknik utamanya klasifikasi, clustering, association rules, dan regresi. Bedanya sama analisis biasa: analisis biasa jawab pertanyaan yang udah kamu punya, data mining nemuin pola yang belum kamu tanyain.
Data mining adalah proses nemuin pola yang berguna dari kumpulan data besar, pakai gabungan teknik statistik dan machine learning.
Istilah Indonesianya penambangan data. Analoginya nyambung: kamu ngeruk banyak material buat dapet sedikit yang bernilai.
Yang bikin orang bingung biasanya bedanya sama analisis data biasa. Analisis biasa jawab pertanyaan yang udah kamu punya. Data mining nemuin pola yang belum kamu tanyain.
Data mining adalah kegiatan nyari pola, hubungan, dan kelompok yang belum ketahuan dari data dalam jumlah besar, lalu ngubah temuannya jadi bahan keputusan. Prosesnya gabungan dari statistik, machine learning, dan pengelolaan database. Hasilnya bukan laporan angka, tapi pola yang bisa dipakai buat nebak atau ngelompokin kejadian berikutnya.
Contoh paling gampang dicerna: toko punya 40 ribu baris transaksi. Laporan biasa bilang omzet bulan lalu Rp 312 juta. Data mining bilang ada 4 kelompok pelanggan dengan pola belanja beda, dan satu kelompok punya kemungkinan besar berhenti belanja bulan depan.
Dua-duanya berguna. Tapi cuma satu yang ngasih tau kamu harus ngapain besok.
Ada empat teknik yang nutup mayoritas kasus di dunia kerja: klasifikasi buat nebak label, clustering buat ngelompokin tanpa label, association rules buat nyari barang yang sering muncul bareng, dan regresi buat nebak angka. Sisanya, kayak deteksi anomali dan analisis urutan, biasanya turunan dari keempat ini.
| Teknik | Dipakai buat | Contoh pertanyaan |
|---|---|---|
| Klasifikasi | Nebak label yang udah ditentukan | Nasabah ini bakal telat bayar nggak? |
| Clustering | Ngelompokin tanpa label | Pelanggan aku ada berapa tipe? |
| Association rules | Nyari kombinasi yang sering muncul | Barang apa yang sering dibeli bareng kopi sachet? |
| Regresi | Nebak nilai angka | Berapa penjualan minggu depan? |
Buat klasifikasi dan regresi, daftar algoritma beserta cara pakainya ada lengkap di dokumentasi supervised learning scikit-learn.
Istilah segmentation dan regression juga sering muncul di rapat, jadi enak kalau kamu udah pegang definisinya.
Manfaat utamanya: keputusan yang tadinya ditebak jadi punya dasar angka. Empat bentuk yang paling kelihatan hasilnya adalah nurunin biaya promosi lewat penargetan, naikin nilai belanja lewat rekomendasi, ngurangin kerugian lewat deteksi kecurangan, dan nahan pelanggan sebelum mereka pergi.
Yang sering luput: manfaatnya baru kerasa kalau ada yang nindaklanjutin hasilnya. Daftar 600 pelanggan berisiko churn nilainya nol kalau nggak ada yang ngirim pesan ke mereka.
Makanya di kerangka kerja CRISP-DM, fase terakhirnya deployment, bukan modeling.
Delapan bentuk yang paling umum kamu temui di sini:
Nomor 8 yang paling jarang dibahas padahal paling gampang dimulai. Nggak butuh tim data, nggak butuh server.
Dataset toko_berkah punya ngulikdata isinya 41.892 baris transaksi setahun dari satu toko sembako di Bekasi, dengan 3.104 pelanggan bermember.
Waktu transaksi dikelompokin per tanggal dalam bulan, muncul pola yang lumayan tajam. Rata-rata nilai transaksi tanggal 25 sampai 5 bulan berikutnya ada di Rp 96.300. Di tanggal 6 sampai 24, angkanya turun ke Rp 61.800.
Selisihnya 55,8 persen. Buat toko sembako, itu bukan angka kecil.
Temuan kedua datang dari association rules. Kombinasi minyak goreng 2 liter dan telur 1 kg muncul bareng di 21,4 persen keranjang tanggal muda, tapi cuma 8,1 persen di tanggal tua. Jadi paket bundling buat kombinasi itu masuk akal cuma di jendela 10 hari, bukan sebulan penuh.
Nggak ada laporan penjualan standar yang bakal nunjukin dua hal ini. Keduanya baru kelihatan waktu datanya dipotong ulang dengan pertanyaan yang beda.
Kalau kamu mau nyoba yang serupa, langkah query-nya ada di panduan market basket analysis pakai SQL. Buat versi spreadsheet, COUNTIFS dan SUMIFS udah cukup buat ngitung frekuensi pasangan barang.
Analisis data biasa jawab pertanyaan yang udah kamu punya, misalnya berapa penjualan bulan lalu. Data mining nyari pola yang belum kamu tanyain, misalnya ternyata ada kelompok pelanggan yang cuma belanja tanggal muda dan nilainya dua kali lipat. Yang pertama kamu yang nentuin arahnya, yang kedua datanya yang nunjukin arah.
Nggak selalu. Buat mulai, Orange dan KNIME bisa jalan tanpa nulis satu baris kode. Excel juga cukup buat teknik sederhana kayak segmentasi RFM. Tapi begitu datanya lewat sejuta baris atau kamu mau otomatiskan prosesnya, SQL dan Python bakal jauh lebih hemat waktu daripada klik manual.
Tergantung tekniknya. Association rules bisa ngasih pola berguna dari beberapa ribu transaksi. Klasifikasi butuh contoh yang cukup di tiap kelas, patokan kasarnya minimal beberapa ratus baris per kelas. Yang lebih nentuin sebenernya kualitas, bukan jumlah. Sepuluh ribu baris bersih lebih berguna dari sejuta baris yang kolom kuncinya kosong separuh.
Beda, walau bersinggungan. Machine learning adalah kumpulan algoritma yang belajar dari data. Data mining adalah kegiatan nyari pola berguna, dan machine learning cuma salah satu alat yang dipakai di dalamnya. Data mining juga ngurus hal yang bukan algoritma: nyiapin data, ngartiin hasil, dan mastiin polanya kepakai buat keputusan.
Tiga yang paling sering muncul. Pertama, pola yang ketemu belum tentu sebab akibat, jadi hati-hati narik kesimpulan. Kedua, model yang dilatih dari data lama bisa melenceng waktu perilaku pelanggan berubah. Ketiga, ada urusan privasi. Data pribadi pelanggan di Indonesia diatur UU Perlindungan Data Pribadi, jadi jangan sembarang gabungin data lintas sumber.
Dua hal yang perlu kamu pegang: data mining nyari pola yang belum kamu tanyain, dan empat tekniknya nutup hampir semua kasus kerja nyata.
Buat mulai, ambil file transaksi yang udah ada di laptop kamu. Kelompokin per pelanggan, hitung tiga angka: kapan terakhir belanja, berapa kali setahun, dan total belanjanya. Itu udah segmentasi versi paling sederhana.
Kalau mau tau urutan teknis tiap langkahnya, lanjut ke tahapan data mining dari seleksi data sampai evaluasi pola.
Mau praktek langsung? Mulai latihan SQL gratis
Latihan interaktif, langsung di browser.
Kolom datetime nyimpen tanggal, jam, hari, semuanya nempel jadi satu. Accessor .dt di pandas ngeluarin tiap bagian jadi kolom sendiri buat dianalisa.
Nama toko ketik campur huruf besar-kecil, spasi nyasar di ujung, atau kode produk nempel jadi satu. Accessor .str di pandas ngerapiin semua itu tanpa loop.
Model machine learning cuma ngerti angka, bukan teks kayak merah atau biru. get_dummies ngubah kolom kategori jadi kolom 0/1 dalam satu baris kode.