Skripsi Data Mining: 20 Ide Topik plus Dataset yang Bisa Dipakai
Blog/Tips & Trik/Skripsi Data Mining: 20 Ide Topik plus Dataset yang Bisa Dipakai

Skripsi Data Mining: 20 Ide Topik plus Dataset yang Bisa Dipakai

BimaBima
·15 September 2025·9 menit baca

Penulis

Bima

Bima

Founder & Data Professional

Bagikan

TL;DR

Skripsi data mining adalah penelitian yang pakai algoritma buat nemu pola dari data, lalu polanya dipakai buat jawab satu pertanyaan penelitian. Ide topik yang aman itu yang datasetnya udah bisa kamu unduh sebelum proposal disetujui, misalnya dari BPS, data.go.id, Kaggle, atau UCI Machine Learning Repository. Lima keluarga metode yang paling sering dipakai mahasiswa: klasifikasi, clustering, aturan asosiasi, prediksi deret waktu, dan text mining.

Topik skripsi data mining yang bagus itu topik yang datanya udah kamu pegang sebelum proposal disetujui.

Banyak mahasiswa mandek bukan gara-gara metodenya susah. Mandeknya di bab 3, waktu sadar dataset yang dibayangin ternyata ga ada wujudnya, atau harus nunggu izin dari perusahaan yang ga bakal balas email.

Di bawah ini ada 20 ide topik. Tiap ide udah dipasangin metode dan sumber dataset yang beneran bisa kamu unduh hari ini, plus contoh kasus dengan angka dari dataset latihan Ngulik Data.

Apa itu skripsi data mining?

Skripsi data mining adalah penelitian yang pakai algoritma buat nemu pola dari data dalam jumlah besar, lalu polanya dipakai buat jawab satu pertanyaan penelitian. Bentuknya bisa klasifikasi, clustering, aturan asosiasi, prediksi deret waktu, atau text mining. Yang dinilai penguji bukan cuma akurasi model, tapi juga alasan kamu milih metode itu.

Kerangka kerja yang paling sering dipakai di bab 3 namanya CRISP-DM. Isinya enam tahap: pahami masalah bisnis, pahami data, siapin data, bikin model, evaluasi, lalu pakai hasilnya.

Tahap paling makan waktu bukan bikin model. Nyiapin data biasanya yang paling lama, apalagi kalau datanya berantakan. Kalau kamu belum kenal istilah kualitas data, baca dulu glossary data quality.

Gimana cara milih topik skripsi data mining yang ga bikin mandek?

Pilih dari data ke pertanyaan, bukan sebaliknya. Cari dulu dataset publik yang jumlah barisnya cukup dan kolomnya lengkap, baru rumusin pertanyaan penelitian yang bisa dijawab pakai kolom yang ada. Cara ini motong risiko terbesar skripsi data mining, yaitu judul udah disetujui tapi datanya ga pernah ketemu.

  1. Unduh datasetnya dulu. Buka filenya, hitung jumlah baris dan kolom. Kalau di bawah 500 baris, biasanya penguji bakal nanya kenapa dianggap data mining.
  2. Cek kolom targetnya ada atau nggak. Buat klasifikasi, kamu butuh kolom label. Ga ada label, ga bisa klasifikasi.
  3. Tulis satu pertanyaan penelitian. Contoh: "Seberapa akurat algoritma Naive Bayes mengklasifikasikan ulasan produk berbahasa Indonesia jadi positif dan negatif?"
  4. Tentukan pembandingnya. Skripsi yang cuma pakai satu algoritma sering kena pertanyaan "kenapa ga coba yang lain?". Siapin minimal dua algoritma buat dibandingin.
  5. Tentukan metrik evaluasi di awal. Akurasi, precision, recall, F1, atau RMSE. Tulis di proposal, jangan diputusin belakangan.

Apa saja 20 ide topik skripsi data mining beserta datasetnya?

Dua puluh ide di bawah dikelompokin per keluarga metode. Tiap baris nyantumin sumber dataset yang aksesnya terbuka, jadi kamu bisa cek ketersediaannya sebelum ngajuin judul.

Klasifikasi (memprediksi label)

NoIde topikSumber dataset
1Prediksi kelulusan tepat waktu mahasiswa pakai Decision Tree vs Random ForestData akademik kampus sendiri (minta ke bagian akademik, anonimkan NIM)
2Klasifikasi kelayakan pengajuan kredit UMKM pakai Naive BayesUCI Machine Learning Repository, dataset Statlog German Credit
3Deteksi penyakit diabetes dari data pemeriksaan dasar pakai KNNUCI Pima Indians Diabetes
4Klasifikasi status gizi balita berdasarkan data posyanduData posyandu kelurahan atau publikasi Kemenkes
5Prediksi karyawan resign pakai Logistic Regression dan SVMKaggle, dataset HR Analytics Employee Attrition

Clustering (mengelompokkan tanpa label)

NoIde topikSumber dataset
6Segmentasi pelanggan toko ritel pakai K-Means dan analisis RFMTransaksi POS toko lokal, atau UCI Online Retail
7Pengelompokan kabupaten di Indonesia berdasarkan indikator kemiskinanBPS, tabel dinamis kemiskinan per kabupaten
8Klaster kecamatan rawan banjir dari data curah hujan dan tutupan lahandata.go.id dan BMKG
9Segmentasi mahasiswa berdasarkan pola aktivitas di LMS kampusLog Moodle kampus sendiri

Kalau istilah segmentasi masih abu-abu buat kamu, cek dulu penjelasan segmentation biar bab 2 kamu ga cuma nyalin definisi buku.

Aturan asosiasi (barang apa dibeli bareng apa)

NoIde topikSumber dataset
10Analisis keranjang belanja minimarket pakai algoritma AprioriStruk transaksi minimarket, minimal 3 bulan
11Perbandingan Apriori dan FP-Growth pada data transaksi apotekData penjualan apotek lokal
12Rekomendasi mata kuliah pilihan dari pola pengambilan KRSData KRS kampus sendiri

Prediksi deret waktu (menebak angka ke depan)

NoIde topikSumber dataset
13Peramalan penjualan bulanan UMKM pakai ARIMACatatan penjualan UMKM mitra, 24 bulan ke belakang
14Prediksi harga cabai merah di pasar tradisionalPusat Informasi Harga Pangan Strategis (PIHPS)
15Peramalan jumlah penumpang kereta api pakai Holt-WintersBPS, statistik transportasi
16Prediksi konsumsi listrik rumah tangga pakai LSTMUCI Individual Household Electric Power Consumption

Text mining (mengolah teks jadi angka)

NoIde topikSumber dataset
17Analisis sentimen ulasan aplikasi dompet digital di Google PlayScraping ulasan Google Play pakai library google-play-scraper
18Klasifikasi topik keluhan warga di kanal pengaduan daerahKanal LAPOR daerah masing-masing
19Deteksi berita hoaks berbahasa Indonesia pakai TF-IDF dan SVMDataset hoaks Mafindo dan arsip cek fakta
20Pengelompokan abstrak skripsi pakai LDA buat memetakan tema penelitianRepositori skripsi kampus sendiri

Dataset mana yang aman dipakai buat skripsi di Indonesia?

Dataset aman itu yang lisensinya jelas, sumbernya bisa disitasi, dan datanya ga memuat identitas pribadi. Empat sumber yang paling sering lolos sidang: BPS buat data statistik resmi, data.go.id buat data pemerintah, Kaggle buat dataset latihan, dan UCI Machine Learning Repository buat dataset benchmark yang udah banyak dirujuk jurnal.

Kalau kamu ambil data dari perusahaan atau kampus, hapus dulu kolom identitas. Nama, NIK, nomor HP, alamat lengkap. Ganti NIM jadi kode urut.

Satu hal yang sering kelewat: catat tanggal unduh datasetnya. Data BPS bisa berubah kalau ada revisi, dan penguji suka nanya versi mana yang kamu pakai.

Contoh kasus: segmentasi pelanggan toko_berkah

Aku pakai dataset latihan toko_berkah dari Ngulik Data buat nunjukin alur ide nomor 6. Isinya 4.812 transaksi dari 1.240 pelanggan selama 12 bulan.

Langkahnya: hitung tiga angka per pelanggan (recency, frequency, monetary), lalu kelompokin pakai K-Means.

import pandas as pd
from sklearn.preprocessing import StandardScaler
from sklearn.cluster import KMeans

df = pd.read_csv("toko_berkah_transaksi.csv", parse_dates=["tanggal"])
akhir = df["tanggal"].max()

rfm = df.groupby("id_pelanggan").agg(
    recency=("tanggal", lambda s: (akhir - s.max()).days),
    frequency=("id_transaksi", "nunique"),
    monetary=("total", "sum"),
)

X = StandardScaler().fit_transform(rfm)
rfm["segmen"] = KMeans(n_clusters=4, n_init=10, random_state=42).fit_predict(X)

print(rfm.groupby("segmen").agg(
    jumlah=("recency", "size"),
    rata_belanja=("monetary", "mean"),
).round(0))

Hasilnya empat segmen. Yang menarik ada di segmen paling kecil: 96 pelanggan, atau 7,7 persen dari total, nyumbang Rp 214 juta dari total omzet Rp 683 juta. Artinya kurang dari 8 persen pelanggan bawa 31 persen pendapatan.

Angka kayak gini yang bikin bab 4 kamu ada isinya. Bukan cuma tabel akurasi, tapi temuan yang bisa dipakai pemilik toko.

Buat milih jumlah klaster, jangan asal 4. Pakai metode elbow atau silhouette score. Penjelasan resminya ada di dokumentasi clustering scikit-learn.

Apa kesalahan umum waktu ngerjain skripsi data mining?

  • Ambil judul dulu, cari data belakangan. Ini penyebab mandek nomor satu. Balik urutannya.
  • Nge-drop semua baris yang ada nilai kosong. Kalau 40 persen datamu hilang gara-gara ini, hasilnya bias. Cek dulu polanya, baru putusin mau isi atau buang.
  • Nge-report akurasi 99 persen tanpa curiga. Biasanya ada kebocoran data, misalnya kolom target ikut masuk ke fitur. Atau datanya timpang berat.
  • Ga misahin data latih dan data uji. Model yang diuji pakai data yang sama dengan data latihnya pasti keliatan bagus. Itu bukan hasil.
  • Nganggap nilai ekstrem itu sampah. Di data penjualan, transaksi Rp 40 juta bisa jadi temuan penting, bukan salah input. Baca penjelasan outlier sebelum menghapusnya.
  • Bab 2 cuma nyalin definisi. Penguji nyari perbandingan penelitian sebelumnya, bukan kamus algoritma.

FAQ

Berapa jumlah data minimal buat skripsi data mining?

Ga ada angka baku dari kampus, tapi patokan yang umum dipakai dosen pembimbing itu minimal 500 sampai 1.000 baris buat klasifikasi dan clustering. Buat deret waktu, yang penting panjang periodenya, minimal 24 titik bulanan biar pola musimannya kelihatan. Kalau datamu cuma 100 baris, hasil modelnya bakal goyang tiap kali kamu ganti pembagian data latih dan uji.

Skripsi data mining harus pakai Python atau boleh pakai tool lain?

Boleh pakai apa aja asal bisa kamu pertanggungjawabkan. Python dan R paling fleksibel. RapidMiner dan Orange enak buat yang belum kuat coding, karena alurnya tinggal seret dan lepas. Bahkan Excel masih kepakai buat tahap persiapan data. Yang dinilai penguji itu ketepatan metode dan kejelasan alurnya, bukan merek tool-nya.

Apa bedanya skripsi data mining sama skripsi machine learning?

Bedanya tipis dan sering tumpang tindih. Data mining fokusnya nemu pola yang bisa dijelaskan dari data yang udah ada, misalnya aturan asosiasi atau segmentasi. Machine learning fokusnya bikin model yang akurat buat prediksi data baru. Banyak kampus di Indonesia pakai kedua istilah ini secara bergantian, jadi ikutin aja istilah yang dipakai program studimu.

Boleh nggak pakai dataset Kaggle buat skripsi?

Boleh, dan banyak skripsi lolos pakai itu. Syaratnya dua: sitasi sumbernya lengkap termasuk nama pengunggah dan tanggal akses, dan kamu kasih nilai tambah di analisisnya. Kalau kamu cuma ngulang notebook yang udah ada di Kaggle, penguji bakal nemu. Tambahin perbandingan algoritma atau kaitan sama konteks Indonesia biar ada kontribusinya.

Gimana kalau data dari perusahaan ga boleh dipublikasikan?

Biasa terjadi dan ada solusinya. Anonimkan semua identitas, ganti nama perusahaan jadi "Perusahaan X", dan lampirkan surat izin penelitian di bagian lampiran. Sebagian kampus juga ngizinin kamu cuma nampilin ringkasan statistik tanpa data mentah. Konfirmasi ke pembimbing sejak awal, jangan nunggu bab 4 selesai baru nanya.

Langkah berikutnya

Tiga hal yang paling nentuin lancar atau nggaknya skripsi data mining kamu: dataset udah di tangan sebelum judul disetujui, metrik evaluasi ditulis di proposal, dan minimal ada dua algoritma buat dibandingin.

Kalau Python kamu masih goyang, mulai dari roadmap belajar Python untuk data analyst. Buat olah array dan operasi angka yang jadi dasar semua library data mining, lanjut ke NumPy dasar untuk analis data.

Punya ide topik yang belum ada di daftar ini? Tulis di kolom komentar, siapa tau kepakai sama yang lagi nyari judul juga.

Coba Langsung

Mau praktek langsung? Mulai latihan SQL gratis

Latihan interaktif, langsung di browser.

Buka NgulikSQL →
Bagikan:
Bima
Ditulis oleh

Bima

Founder & Data Professional

Founder Ngulik Data. Passionate about making data analysis accessible for everyone.

Artikel terkait

Pandas groupby: Agregasi Data ala Pivot di Python (2026)
Tips & Trik
20 Juli 2026•9 menit baca

Pandas groupby: Agregasi Data ala Pivot di Python (2026)

groupby ngelompokin baris berdasarkan kolom, lalu ngitung ringkasan per grup kayak total atau rata-rata. Ini pivot-nya pandas.

BimaBima
Pandas to_excel: Ekspor DataFrame ke Excel (2026)
Tips & Trik
18 Juli 2026•8 menit baca

Pandas to_excel: Ekspor DataFrame ke Excel (2026)

to_excel nyimpen DataFrame pandas jadi file Excel .xlsx. Ini cara pakainya, dari satu sheet sampai banyak sheet, plus setelan yang bikin hasilnya rapi.

BimaBima
Pandas read_excel: Baca File Excel di Python
Tips & Trik
16 Juli 2026•8 menit baca

Pandas read_excel: Baca File Excel di Python

pandas read_excel baca file Excel jadi DataFrame, bisa pilih sheet tertentu dan lompatin baris judul yang berantakan. Ini cara pakai plus parameter penting dengan contoh data toko.

BimaBima
Kembali ke Blog
Ngulik Data logoNgulik Data

Platform edukasi data lengkap untuk professionals Indonesia. Belajar SQL, Data Analysis, dan lebih banyak lagi dengan praktek langsung dan feedback real-time.

© 2026 Ngulik Data. Semua hak dilindungi.

TAUTAN
BantuanHargaDatasetBlogAfiliasi
LEGAL
Syarat & KetentuanKebijakan Privasi
Ngulik Data
DatasetLeaderboardBlogStore